
日常最佳 Ollama 模型推薦(2026 完整指南)
發佈於:
閱讀時間: 6 min
主題: 技術
作者: Leandro Valencia
2026 Ollama 模型挑選指南:Qwen 3.5、Gemma 4、gpt-oss、qwen3-coder 等模型比較表,涵蓋量化、所需 RAM 與依硬體挑選建議。
目錄
比較表
| 模型(tag) | 下載大小 | 上下文 | 建議 RAM | 多模態 | 工具 / 推理 | 最適合 |
|---|---|---|---|---|---|---|
qwen3.5:2b |
2.7 GB | 256K | 8 GB | 文字 + 影像 | 是 / 是 | 最低門檻的全能選手。摘要、改寫、分類 |
llama3.2:3b |
2.0 GB | 128K | 8 GB | 純文字 | 是 / 否 | 即時回應、自動補全、CPU 上的簡單任務 |
qwen3.5:4b |
3.4 GB | 256K | 8–12 GB | 文字 + 影像 | 是 / 是 | 多數人的最佳起點 |
gemma4:e2b-it-qat |
4.3 GB | 128K | 8–12 GB | 文字 + 影像 | 是 / 是 | 在入門機器上的自然語氣與撰寫表現 |
qwen3.5:9b |
6.6 GB | 256K | 16 GB | 文字 + 影像 | 是 / 是 | 全表最佳的品質/體積平衡 |
gemma4:12b |
7.6 GB | 256K | 16 GB | 文字 + 影像 | 是 / 是 | 長篇寫作、文件分析、多語言 |
gpt-oss:20b |
14 GB | 128K | 16–24 GB | 純文字 | 是 / 是(可調整) | 顯式推理與 agentic 流程 |
qwen3-coder:30b |
19 GB | 256K | 24 GB | 純文字 | 是 / 否 | 倉庫級別的程式開發(MoE,3.3B 活躍參數) |
qwen3.5:27b |
17 GB | 256K | 24 GB | 文字 + 影像 | 是 / 是 | 不依賴雲端的「認真助理」等級品質 |
qwen3.6:35b |
24 GB | 256K | 32 GB+ | 文字 + 影像 | 是 / 是 | 消費級硬體上能跑的頂級選擇 |
gemma4:31b-it-qat |
19 GB | 256K | 24–32 GB | 文字 + 影像 | 是 / 是 | 授權與語氣皆不同的 Qwen 替代方案 |
glm-ocr |
2.2 GB | 128K | 8 GB | 影像 → 文字 | 是 / 否 | 發票、表格與掃描文件的 OCR |
embeddinggemma:300m |
622 MB | 2K | 8 GB | Embeddings | — | 對你的檔案做語意搜尋與 RAG |
nomic-embed-text |
274 MB | 8K | 8 GB | Embeddings | — | RAG 的經典款,快速且經過驗證 |
「建議 RAM」欄位並非檔案大小,而是涵蓋了活躍上下文所需空間,以及讓作業系統能繼續順暢運作的緩衝。稍後會再詳談。
如何正確讀懂這張表
有三個數字大家常常搞混,而搞混它們正是「下載模型後覺得『本地模型根本是垃圾』」的頭號原因。
下載大小不等於實際佔用的 RAM。 一個 6.6 GB 的模型在記憶體中會佔用這 6.6 GB,加上 注意力快取(KV cache),而 KV cache 會隨對話長度增長。一個務實的經驗法則:在一般使用下,檔案大小再加 20–30%,並且至少預留 2 GB 給系統。若你要使用很長的上下文,緩衝要再更大。
參數數量已經無法預測速度了。 qwen3-coder:30b 總共有 300 億參數,但每個 token 只會啟動 33 億參數,因為它是 mixture of experts(MoE)架構。它以小模型的速度產出文字,卻有大模型的判斷力。你付出的代價是 RAM,而不是等待時間。同樣的情況也適用於 qwen3.5:35b-a3b 與 gemma4:26b-a4b。
標榜的上下文視窗並不是免費的。 一個模型支援 256K token,不代表你能在筆電上實際用到 256K。這些上下文會具體佔用記憶體。實務上,在 16 GB 的機器上你會在 8K 到 32K token 之間工作得很順手,這對幾乎所有日常工作來說都已經綽綽有餘。
是什麼讓 2026 年的模型「有效率」
值得了解一下,為什麼上面這份清單和兩年前的看起來如此不同。
最大的改變是 感知訓練的量化(QAT)。實驗室不再用完整精度訓練模型、之後再壓縮(這會在過程中損失品質),而是讓模型在訓練時就知道未來會以 4 bits 執行。Google 發布了 Gemma 4 的 -it-qat 變體,重量明顯比傳統 Q4 還輕:gemma4:e4b-it-qat 只佔 6.1 GB,相較之下標準版是 9.6 GB,且品質下降幅度遠低於你的預期。如果你要用 Gemma 4,請優先選 QAT tag。
第二個改變是 MXFP4,也就是 OpenAI 在 gpt-oss 採用的格式。MoE 權重在後訓練階段即量化到每個參數 4.25 bits,Ollama 直接原生執行,無需額外轉換。這就是為什麼一個 20B 模型可以塞進 14 GB,並在 16 GB 記憶體的機器上順利運作。
第三個是 中間尺寸的大量出現。Qwen 3.5 提供 0.8B、2B、4B、9B、27B、35B 與 122B 等版本。這樣的顆粒度很重要:你不再只能在「太笨」和「裝不下」之間二選一,而是能找到與你的硬體完全契合的那一階。
第四個,在 Mac 上則是 MLX 與 nvfp4 tag。如果你有 Apple Silicon,-mlx 變體是針對 Apple 引擎編譯的,每瓦效能通常勝過通用的 GGUF。qwen3.5:9b-mlx(8.9 GB)在 16 GB 統一記憶體的 MacBook 上是非常優秀的選擇。
各模型逐一介紹
Qwen 3.5 — 你應該優先安裝的家族
如果你只打算讀這份指南的一段,就讀這一段。Qwen 3.5 家族涵蓋 0.8B 到 122B,全部具備 256K 原生上下文,且都支援文字與影像輸入。它是多模態、支援工具呼叫,還有推理模式。實務上,它能解決大家對本地助理 80% 的需求。
ollama pull qwen3.5:4b # 3.4 GB — 起點
ollama pull qwen3.5:9b # 6.6 GB — 甜蜜點
ollama pull qwen3.5:27b # 17 GB — 你的 GPU 撐得住才考慮
目前整個目錄中,9b 很可能是品質/體積比最好的一個。它塞得進 16 GB 還有工作空間、看得懂影像,而且在日常工作——撰寫、摘要、翻譯、解釋——上與 27b 的差距,遠比重量差距所暗示的小得多。
何時不該用: 如果你的主要任務是在大型倉庫上做 agentic 寫程式,qwen3-coder:30b 才是專門為此訓練的。
Gemma 4 — Google 的替代方案,還多了音訊
Gemma 4 是 Google 的回應,而且帶來了 Qwen 沒有的東西:音訊輸入,此外還有視覺、工具與推理。尺寸從 e2b 一路到 31b,其中「e」版本是有效參數模型——設計目的是讓實際運算成本低於帳面參數量。
ollama pull gemma4:e2b-it-qat # 4.3 GB
ollama pull gemma4:12b # 7.6 GB,256K 上下文
ollama pull gemma4:31b-it-qat # 19 GB
gemma4:12b 值得特別關注:7.6 GB 對應 256K 上下文是極佳的密度,而且 Gemma 的語氣通常比其他家族更自然、較沒有「說明書味」。對於要給真人閱讀的郵件、文章與文字,很多人偏好它。
何時不該用: 在數學推理或程式任務上,Qwen 與 gpt-oss 通常領先。
gpt-oss:20b — 可調整力度的推理
OpenAI 的開放權重模型帶著兩個與眾不同的特色問世:完整且可見的思考鏈,以及可設定的推理力度,分為三級(低、中、高)。需要速度時可以叫它少想一點,問題值得時就叫它多想。
ollama pull gpt-oss:20b # 14 GB,128K 上下文
授權為 Apache 2.0,沒有 copyleft 限制,可用於商業用途。如果你的使用情境涉及 agents、函式呼叫、結構化輸出或推理除錯,這是預設首選——因為你可以逐字看到它是怎麼得出結論的。
何時不該用: 它不處理影像。需要多模態時,請回到 Qwen 或 Gemma。
qwen3-coder:30b — 程式專家
總計 30B,活躍參數 3.3B,256K 原生上下文(可外推到 1M)。以 7.5兆 token 訓練,其中 70% 是程式碼,並採用針對實際程式執行的強化學習。它是為倉庫級別的工程任務設計的,而不是用來自動補全零散的單行。
ollama pull qwen3-coder:30b # 19 GB
ollama launch opencode --model qwen3-coder
在 24 GB 的 GPU 上,這是當今最好的本地程式開發選項。因為是 MoE,儘管體積大,產出速度卻像小模型一樣快。
何時不該用: 對一般問題來說,這是浪費 RAM。請同時載入一個通用模型備用。
Qwen 3.6 — 更上一階
Qwen 最新一代,提供 27b(17 GB)與 35b(24 GB)兩種版本。它的進步集中在 agentic 程式開發——倉庫級別的前端流程與推理——以及 推理保留,這是一個會保留先前訊息思考脈絡的選項,避免在反覆運算的對話中重做工作。
ollama pull qwen3.6:27b
如果你有 32 GB 以上,又想在消費級硬體上跑最頂級的模型,就是它了。如果你只有 16 GB,請留在 qwen3.5:9b,不用糾結。
Llama 3.2(1B 與 3B)— 輕量級
Llama 3.2 已經不是最新款,但因為一個具體理由依然 relevant:1.3 GB 與 2.0 GB,支援工具,且有 128K 上下文。這是你會在入門機器或小型伺服器上長駐的模型,在一秒內回應,就算沒有 GPU 也跑得不錯。
ollama pull llama3.2:3b # 2.0 GB
ollama pull llama3.2:1b # 1.3 GB
要改寫一段文字、分類一篇文字、萃取實體或產生簡短回覆,它完全勝任。要拿來推理解決問題,就不行。
glm-ocr — 幾乎沒人認識的專家
只有 0.9B 參數,下載 2.2 GB,但把一件事做得極好:把文件轉成結構化文字。複雜表格、公式、印章、含大量程式碼的文件、困難的版面。它有專門的模式,直接在 prompt 裡呼叫:
ollama run glm-ocr Text Recognition: ./factura.png
ollama run glm-ocr Table Recognition: ./reporte.png
ollama run glm-ocr Figure Recognition: ./diagrama.png
如果你經常數位化發票、收據或掃描文件,光這一個模型就值得你安裝 Ollama。
Embeddings 模型 — 看不見但不可或缺
如果你想在自家文件裡搜尋——「我三月預算提在哪裡?」——你需要的是 embeddings 模型,而不是聊天機器人。它們體積極小,做的是截然不同的事:把文字轉成向量,以便依意義比較。
ollama pull embeddinggemma:300m # 622 MB,Google 出品
ollama pull nomic-embed-text # 274 MB,事實上的標準
ollama pull qwen3-embedding:0.6b # 如果你已經在用 Qwen 家族
這裡要注意上下文視窗:embeddinggemma 接受 2K token,nomic-embed-text 最多到 8K。這會決定你如何切割文件——500 到 1000 token 的片段跟兩者都很搭。
若是西班牙文或多語言內容,nomic-embed-text-v2-moe 與 snowflake-arctic-embed2 是專為多語言檢索訓練的,效果通常勝過純英文版本。
依你的硬體選擇安裝
8 GB RAM(無獨顯或僅小 GPU)
這是最常見、也最常被誤解的情境。是可以用的,但你必須自律:一次只載一個模型、Q4 量化、適度上下文。
ollama pull qwen3.5:4b # 3.4 GB — 你的主力模型
ollama pull llama3.2:3b # 2.0 GB — 即時回應用
ollama pull glm-ocr # 2.2 GB — 文件與影像
ollama pull nomic-embed-text # 本地搜尋用 embeddings
8 GB 的黃金法則:Q4 的小模型永遠勝過 Q2 的大模型。硬把 14B 壓到極致的誘惑,最後只會換來語無倫次的回答。別這樣做。
16 GB RAM
到了這個等級,體驗才真正稱得上舒適。你可以跑 9–12B 的模型配上寬鬆上下文,或同時載入兩個小模型來比較。
ollama pull qwen3.5:9b # 6.6 GB — 你的主力
ollama pull gemma4:12b # 7.6 GB — 長篇寫作用
ollama pull gpt-oss:20b # 14 GB — 推理用(一次一個)
ollama pull embeddinggemma:300m
在 16 GB 下你也可以把小模型升到 Q5 或 Q8 量化,以些微速度換回一些推理忠實度。
24 GB VRAM(RTX 4090 / 5090 或同等級)
本地模型終於不再像妥協的那一個區間。
ollama pull qwen3.5:27b # 17 GB — 認真的通用助理
ollama pull qwen3-coder:30b # 19 GB — 程式開發
ollama pull gemma4:31b-it-qat # 19 GB — 多模態替代方案
32 GB 以上(含 Mac 的統一記憶體)
ollama pull qwen3.6:35b # 24 GB — 消費級的實用上限
ollama pull qwen3.5:35b-a3b # 24 GB — MoE,比體積所暗示的更快
在 Apple Silicon 上,請優先試 MLX tag:qwen3.6:35b-mlx(22 GB)與 qwen3.5:27b-mlx(20 GB)是針對 Apple 硬體最佳化的。
兩分鐘搞懂量化
量化會降低模型權重的精度,讓它佔用更少記憶體。這是你手中最重要的槓桿,也是大家最容易出錯的地方。
Q4_K_M 是標準選擇。相較於完整精度,大約可減少 70% 消耗,品質損失在日常任務中幾乎察覺不到。猶豫時就選它。在 8 GB 機器上,它不是選項,而是唯一合理的選擇。
Q8_0 大約是 Q4 的兩倍大,但能在推理與數學上換回忠實度。在記憶體充裕的小模型上很合理——qwen3.5:4b-q8_0 重 5.3 GB,在邏輯任務上明顯比 Q4 版本更穩健。
QAT(Gemma 的 -it-qat tag)是訓練階段的量化,不是事後壓縮。有的話,請優先於對應的 Q4。
MXFP4 是 gpt-oss 的原生格式。你不用選什麼:模型就是長這樣。
MLX / nvfp4 是針對 Apple Silicon,以及支援 FP4 的 NVIDIA GPU 的變體。如果你的硬體符合,它們能在相同或更低功耗下提供更好效能。
實用的決策順序很簡單:先挑選能在 Q4 下塞進你記憶體的模型大小,之後只有在還有空間時,才考慮提升量化等級。順序絕對不能顛倒。
毀掉體驗的常見錯誤
「以防萬一」把上下文開到最大。 在 16 GB 機器上設 256K 上下文,只會用空的快吃滿記憶體,留給模型的空間反而沒了。從 8K 開始,真的需要再調高。
用第一個回答評判模型。 第一次產出包含了把模型載入記憶體的時間。第二次才是真正的速度。
用聊天模型做語意搜尋。 它們是不同的工具。想在文件裡搜尋,你需要的是 embeddings 模型加上向量資料庫,而不是把文件貼進 prompt 的聊天機器人。
忽略專用的 tag。 ollama pull gemma4 會拉到 latest,也就是 9.6 GB 的 e4b。gemma4:e4b-it-qat 在 6.1 GB 做幾乎一樣的事。下載前值得看一下 tag 清單。
不清掉舊模型。 每次實驗都會在硬碟上留下好幾 GB。ollama list 可以看你有什麼,ollama rm <modelo> 可以刪除。
今天就能上手的推薦組合
如果你想要一組第一天就順順可用、不必想太多的設定,在 16 GB 機器上:
# 主力模型:對話、摘要、撰寫、影像
ollama pull qwen3.5:9b
# 快速回應與簡單任務
ollama pull llama3.2:3b
# 掃描文件、發票、表格
ollama pull glm-ocr
# 對你的檔案做語意搜尋
ollama pull embeddinggemma:300m
大約 10 GB 硬碟空間,涵蓋了一個人用助理所做的絕大多數事:寫、摘要、翻譯、解釋、讀文件、找東西。當其中某項任務開始不夠用時,你就會精確知道該加哪個模型、為什麼。
常見問題
跑 Ollama 需要多少 RAM?
實務最低要求是 8 GB,搭配 Q4 量化的 4B 模型與適度上下文。想要舒適無妥協的體驗,16 GB 可以讓你跑 9–12B 模型。若是認真的程式開發或高品質通用助理,請瞄準 24 GB VRAM。記得在模型大小之外,再加上 20–30% 給上下文,並預留 2 GB 給系統。
16 GB 筆電最好的 Ollama 模型是哪個?
qwen3.5:9b(6.6 GB)。它是多模態、有 256K 上下文、支援工具與推理,還留下足夠記憶體讓你工作。這是當前目錄中品質/體積比最好的一個。
Ollama 是免費的嗎?
是的。Ollama 是自由軟體,而本指南推薦的模型都採用寬鬆授權(Apache 2.0、Apache 2.0 衍生及類似的商用友善授權)。你唯一要付的,是電費和硬體。
我可以離線使用 Ollama 嗎?
可以。一旦用 ollama pull 下載完模型,所有運算都在本機發生。不會有任何東西被送到雲端,這對敏感資料、合約、發票或離線工作來說非常理想。
聊天模型和 embeddings 模型有什麼差別?
聊天模型(如 qwen3.5:9b)會根據指令產出文字。embeddings 模型(如 nomic-embed-text 或 embeddinggemma:300m)則是把文字轉成數值向量,以便依意義比較文件。如果你想在自家檔案裡搜尋「我三月預算提在哪裡?」,你需要的是 embeddings,不是聊天機器人。
真正改變了什麼
兩年前,在本機跑模型意味著為了隱私接受一個明顯遜色的助理。今天這道算式已經不同:對日常工作——撰寫、摘要、改寫、分類、萃取、翻譯——一個 6.6 GB 的 qwen3.5:9b 做出的成果,多數人根本分不出和雲端服務的差別。
差距依然存在,但它已經上移:現在落在深度推理、極複雜的程式任務,以及對世界最新知識的掌握。其他一切,都已經塞得進你的筆電,可以離線運作,而且不會向任何人告密。
文中所有模型大小、tag 與上下文視窗數字,皆取自 Ollama 官方目錄,查詢時間為2026年8月。模型更新頻繁:下載前請至 ollama.com 確認當前的 tag。
相關文章
繼續探索您可能感興趣的相似內容

你應該正在使用的9款AI工具(以及每款的用途)
9款AI工具實用指南——ChatGPT、Qwen、Codex、Ollama、Google Flow、Vibes、Perchance 和 Treblo——介紹每款的功能、適合對象、價格以及何時該開啟它。

GEO:AI 時代 SEO 的深度研究與個人觀點
一篇有憑有據的 GEO 研究——引用 Ahrefs、Semrush、Pew Research 與普林斯頓原始論文的數據——探討其證據、侷限,以及它與 SEO 的真實關係。
OpenCode Go:價格、使用限額,以及2026年是否值得訂閱
深度評測OpenCode Go:多少錢、包含哪些模型、使用限額的實際運作方式,以及什麼情況下值得付費。文中還介紹了如何取得可用於抵扣使用限額的5美元額度。