文章封面圖: 日常最佳 Ollama 模型推薦(2026 完整指南)

日常最佳 Ollama 模型推薦(2026 完整指南)

發佈於:

閱讀時間: 6 min

主題: 技術

作者: Leandro Valencia

#ollama#AI模型#本地AI#llm#qwen#gemma 4#gpt-oss#qwen coder#glm-ocr#embeddings#量化#隱私#人工智慧#免費AI

2026 Ollama 模型挑選指南:Qwen 3.5、Gemma 4、gpt-oss、qwen3-coder 等模型比較表,涵蓋量化、所需 RAM 與依硬體挑選建議。

目錄

比較表

模型(tag) 下載大小 上下文 建議 RAM 多模態 工具 / 推理 最適合
qwen3.5:2b 2.7 GB 256K 8 GB 文字 + 影像 是 / 是 最低門檻的全能選手。摘要、改寫、分類
llama3.2:3b 2.0 GB 128K 8 GB 純文字 是 / 否 即時回應、自動補全、CPU 上的簡單任務
qwen3.5:4b 3.4 GB 256K 8–12 GB 文字 + 影像 是 / 是 多數人的最佳起點
gemma4:e2b-it-qat 4.3 GB 128K 8–12 GB 文字 + 影像 是 / 是 在入門機器上的自然語氣與撰寫表現
qwen3.5:9b 6.6 GB 256K 16 GB 文字 + 影像 是 / 是 全表最佳的品質/體積平衡
gemma4:12b 7.6 GB 256K 16 GB 文字 + 影像 是 / 是 長篇寫作、文件分析、多語言
gpt-oss:20b 14 GB 128K 16–24 GB 純文字 是 / 是(可調整) 顯式推理與 agentic 流程
qwen3-coder:30b 19 GB 256K 24 GB 純文字 是 / 否 倉庫級別的程式開發(MoE,3.3B 活躍參數)
qwen3.5:27b 17 GB 256K 24 GB 文字 + 影像 是 / 是 不依賴雲端的「認真助理」等級品質
qwen3.6:35b 24 GB 256K 32 GB+ 文字 + 影像 是 / 是 消費級硬體上能跑的頂級選擇
gemma4:31b-it-qat 19 GB 256K 24–32 GB 文字 + 影像 是 / 是 授權與語氣皆不同的 Qwen 替代方案
glm-ocr 2.2 GB 128K 8 GB 影像 → 文字 是 / 否 發票、表格與掃描文件的 OCR
embeddinggemma:300m 622 MB 2K 8 GB Embeddings 對你的檔案做語意搜尋與 RAG
nomic-embed-text 274 MB 8K 8 GB Embeddings RAG 的經典款,快速且經過驗證

「建議 RAM」欄位並非檔案大小,而是涵蓋了活躍上下文所需空間,以及讓作業系統能繼續順暢運作的緩衝。稍後會再詳談。


如何正確讀懂這張表

有三個數字大家常常搞混,而搞混它們正是「下載模型後覺得『本地模型根本是垃圾』」的頭號原因。

下載大小不等於實際佔用的 RAM。 一個 6.6 GB 的模型在記憶體中會佔用這 6.6 GB,加上 注意力快取(KV cache),而 KV cache 會隨對話長度增長。一個務實的經驗法則:在一般使用下,檔案大小再加 20–30%,並且至少預留 2 GB 給系統。若你要使用很長的上下文,緩衝要再更大。

參數數量已經無法預測速度了。 qwen3-coder:30b 總共有 300 億參數,但每個 token 只會啟動 33 億參數,因為它是 mixture of experts(MoE)架構。它以小模型的速度產出文字,卻有大模型的判斷力。你付出的代價是 RAM,而不是等待時間。同樣的情況也適用於 qwen3.5:35b-a3bgemma4:26b-a4b

標榜的上下文視窗並不是免費的。 一個模型支援 256K token,不代表你能在筆電上實際用到 256K。這些上下文會具體佔用記憶體。實務上,在 16 GB 的機器上你會在 8K 到 32K token 之間工作得很順手,這對幾乎所有日常工作來說都已經綽綽有餘。


是什麼讓 2026 年的模型「有效率」

值得了解一下,為什麼上面這份清單和兩年前的看起來如此不同。

最大的改變是 感知訓練的量化(QAT)。實驗室不再用完整精度訓練模型、之後再壓縮(這會在過程中損失品質),而是讓模型在訓練時就知道未來會以 4 bits 執行。Google 發布了 Gemma 4 的 -it-qat 變體,重量明顯比傳統 Q4 還輕:gemma4:e4b-it-qat 只佔 6.1 GB,相較之下標準版是 9.6 GB,且品質下降幅度遠低於你的預期。如果你要用 Gemma 4,請優先選 QAT tag。

第二個改變是 MXFP4,也就是 OpenAI 在 gpt-oss 採用的格式。MoE 權重在後訓練階段即量化到每個參數 4.25 bits,Ollama 直接原生執行,無需額外轉換。這就是為什麼一個 20B 模型可以塞進 14 GB,並在 16 GB 記憶體的機器上順利運作。

第三個是 中間尺寸的大量出現。Qwen 3.5 提供 0.8B、2B、4B、9B、27B、35B 與 122B 等版本。這樣的顆粒度很重要:你不再只能在「太笨」和「裝不下」之間二選一,而是能找到與你的硬體完全契合的那一階。

第四個,在 Mac 上則是 MLX 與 nvfp4 tag。如果你有 Apple Silicon,-mlx 變體是針對 Apple 引擎編譯的,每瓦效能通常勝過通用的 GGUF。qwen3.5:9b-mlx(8.9 GB)在 16 GB 統一記憶體的 MacBook 上是非常優秀的選擇。


各模型逐一介紹

Qwen 3.5 — 你應該優先安裝的家族

如果你只打算讀這份指南的一段,就讀這一段。Qwen 3.5 家族涵蓋 0.8B 到 122B,全部具備 256K 原生上下文,且都支援文字與影像輸入。它是多模態、支援工具呼叫,還有推理模式。實務上,它能解決大家對本地助理 80% 的需求。

ollama pull qwen3.5:4b     # 3.4 GB — 起點
ollama pull qwen3.5:9b     # 6.6 GB — 甜蜜點
ollama pull qwen3.5:27b    # 17 GB  — 你的 GPU 撐得住才考慮

目前整個目錄中,9b 很可能是品質/體積比最好的一個。它塞得進 16 GB 還有工作空間、看得懂影像,而且在日常工作——撰寫、摘要、翻譯、解釋——上與 27b 的差距,遠比重量差距所暗示的小得多。

何時不該用: 如果你的主要任務是在大型倉庫上做 agentic 寫程式,qwen3-coder:30b 才是專門為此訓練的。

Gemma 4 — Google 的替代方案,還多了音訊

Gemma 4 是 Google 的回應,而且帶來了 Qwen 沒有的東西:音訊輸入,此外還有視覺、工具與推理。尺寸從 e2b 一路到 31b,其中「e」版本是有效參數模型——設計目的是讓實際運算成本低於帳面參數量。

ollama pull gemma4:e2b-it-qat   # 4.3 GB
ollama pull gemma4:12b          # 7.6 GB,256K 上下文
ollama pull gemma4:31b-it-qat   # 19 GB

gemma4:12b 值得特別關注:7.6 GB 對應 256K 上下文是極佳的密度,而且 Gemma 的語氣通常比其他家族更自然、較沒有「說明書味」。對於要給真人閱讀的郵件、文章與文字,很多人偏好它。

何時不該用: 在數學推理或程式任務上,Qwen 與 gpt-oss 通常領先。

gpt-oss:20b — 可調整力度的推理

OpenAI 的開放權重模型帶著兩個與眾不同的特色問世:完整且可見的思考鏈,以及可設定的推理力度,分為三級(低、中、高)。需要速度時可以叫它少想一點,問題值得時就叫它多想。

ollama pull gpt-oss:20b   # 14 GB,128K 上下文

授權為 Apache 2.0,沒有 copyleft 限制,可用於商業用途。如果你的使用情境涉及 agents、函式呼叫、結構化輸出或推理除錯,這是預設首選——因為你可以逐字看到它是怎麼得出結論的。

何時不該用: 它不處理影像。需要多模態時,請回到 Qwen 或 Gemma。

qwen3-coder:30b — 程式專家

總計 30B,活躍參數 3.3B,256K 原生上下文(可外推到 1M)。以 7.5兆 token 訓練,其中 70% 是程式碼,並採用針對實際程式執行的強化學習。它是為倉庫級別的工程任務設計的,而不是用來自動補全零散的單行。

ollama pull qwen3-coder:30b   # 19 GB
ollama launch opencode --model qwen3-coder

在 24 GB 的 GPU 上,這是當今最好的本地程式開發選項。因為是 MoE,儘管體積大,產出速度卻像小模型一樣快。

何時不該用: 對一般問題來說,這是浪費 RAM。請同時載入一個通用模型備用。

Qwen 3.6 — 更上一階

Qwen 最新一代,提供 27b(17 GB)與 35b(24 GB)兩種版本。它的進步集中在 agentic 程式開發——倉庫級別的前端流程與推理——以及 推理保留,這是一個會保留先前訊息思考脈絡的選項,避免在反覆運算的對話中重做工作。

ollama pull qwen3.6:27b

如果你有 32 GB 以上,又想在消費級硬體上跑最頂級的模型,就是它了。如果你只有 16 GB,請留在 qwen3.5:9b,不用糾結。

Llama 3.2(1B 與 3B)— 輕量級

Llama 3.2 已經不是最新款,但因為一個具體理由依然 relevant:1.3 GB 與 2.0 GB,支援工具,且有 128K 上下文。這是你會在入門機器或小型伺服器上長駐的模型,在一秒內回應,就算沒有 GPU 也跑得不錯。

ollama pull llama3.2:3b   # 2.0 GB
ollama pull llama3.2:1b   # 1.3 GB

要改寫一段文字、分類一篇文字、萃取實體或產生簡短回覆,它完全勝任。要拿來推理解決問題,就不行。

glm-ocr — 幾乎沒人認識的專家

只有 0.9B 參數,下載 2.2 GB,但把一件事做得極好:把文件轉成結構化文字。複雜表格、公式、印章、含大量程式碼的文件、困難的版面。它有專門的模式,直接在 prompt 裡呼叫:

ollama run glm-ocr Text Recognition: ./factura.png
ollama run glm-ocr Table Recognition: ./reporte.png
ollama run glm-ocr Figure Recognition: ./diagrama.png

如果你經常數位化發票、收據或掃描文件,光這一個模型就值得你安裝 Ollama。

Embeddings 模型 — 看不見但不可或缺

如果你想在自家文件裡搜尋——「我三月預算提在哪裡?」——你需要的是 embeddings 模型,而不是聊天機器人。它們體積極小,做的是截然不同的事:把文字轉成向量,以便依意義比較。

ollama pull embeddinggemma:300m      # 622 MB,Google 出品
ollama pull nomic-embed-text         # 274 MB,事實上的標準
ollama pull qwen3-embedding:0.6b     # 如果你已經在用 Qwen 家族

這裡要注意上下文視窗:embeddinggemma 接受 2K token,nomic-embed-text 最多到 8K。這會決定你如何切割文件——500 到 1000 token 的片段跟兩者都很搭。

若是西班牙文或多語言內容,nomic-embed-text-v2-moesnowflake-arctic-embed2 是專為多語言檢索訓練的,效果通常勝過純英文版本。


依你的硬體選擇安裝

8 GB RAM(無獨顯或僅小 GPU)

這是最常見、也最常被誤解的情境。是可以用的,但你必須自律:一次只載一個模型、Q4 量化、適度上下文。

ollama pull qwen3.5:4b       # 3.4 GB — 你的主力模型
ollama pull llama3.2:3b      # 2.0 GB — 即時回應用
ollama pull glm-ocr          # 2.2 GB — 文件與影像
ollama pull nomic-embed-text # 本地搜尋用 embeddings

8 GB 的黃金法則:Q4 的小模型永遠勝過 Q2 的大模型。硬把 14B 壓到極致的誘惑,最後只會換來語無倫次的回答。別這樣做。

16 GB RAM

到了這個等級,體驗才真正稱得上舒適。你可以跑 9–12B 的模型配上寬鬆上下文,或同時載入兩個小模型來比較。

ollama pull qwen3.5:9b       # 6.6 GB — 你的主力
ollama pull gemma4:12b       # 7.6 GB — 長篇寫作用
ollama pull gpt-oss:20b      # 14 GB — 推理用(一次一個)
ollama pull embeddinggemma:300m

在 16 GB 下你也可以把小模型升到 Q5 或 Q8 量化,以些微速度換回一些推理忠實度。

24 GB VRAM(RTX 4090 / 5090 或同等級)

本地模型終於不再像妥協的那一個區間。

ollama pull qwen3.5:27b      # 17 GB — 認真的通用助理
ollama pull qwen3-coder:30b  # 19 GB — 程式開發
ollama pull gemma4:31b-it-qat # 19 GB — 多模態替代方案

32 GB 以上(含 Mac 的統一記憶體)

ollama pull qwen3.6:35b      # 24 GB — 消費級的實用上限
ollama pull qwen3.5:35b-a3b  # 24 GB — MoE,比體積所暗示的更快

在 Apple Silicon 上,請優先試 MLX tag:qwen3.6:35b-mlx(22 GB)與 qwen3.5:27b-mlx(20 GB)是針對 Apple 硬體最佳化的。


兩分鐘搞懂量化

量化會降低模型權重的精度,讓它佔用更少記憶體。這是你手中最重要的槓桿,也是大家最容易出錯的地方。

Q4_K_M 是標準選擇。相較於完整精度,大約可減少 70% 消耗,品質損失在日常任務中幾乎察覺不到。猶豫時就選它。在 8 GB 機器上,它不是選項,而是唯一合理的選擇。

Q8_0 大約是 Q4 的兩倍大,但能在推理與數學上換回忠實度。在記憶體充裕的小模型上很合理——qwen3.5:4b-q8_0 重 5.3 GB,在邏輯任務上明顯比 Q4 版本更穩健。

QAT(Gemma 的 -it-qat tag)是訓練階段的量化,不是事後壓縮。有的話,請優先於對應的 Q4。

MXFP4 是 gpt-oss 的原生格式。你不用選什麼:模型就是長這樣。

MLX / nvfp4 是針對 Apple Silicon,以及支援 FP4 的 NVIDIA GPU 的變體。如果你的硬體符合,它們能在相同或更低功耗下提供更好效能。

實用的決策順序很簡單:先挑選能在 Q4 下塞進你記憶體的模型大小,之後只有在還有空間時,才考慮提升量化等級。順序絕對不能顛倒。


毀掉體驗的常見錯誤

「以防萬一」把上下文開到最大。 在 16 GB 機器上設 256K 上下文,只會用空的快吃滿記憶體,留給模型的空間反而沒了。從 8K 開始,真的需要再調高。

用第一個回答評判模型。 第一次產出包含了把模型載入記憶體的時間。第二次才是真正的速度。

用聊天模型做語意搜尋。 它們是不同的工具。想在文件裡搜尋,你需要的是 embeddings 模型加上向量資料庫,而不是把文件貼進 prompt 的聊天機器人。

忽略專用的 tag。 ollama pull gemma4 會拉到 latest,也就是 9.6 GB 的 e4bgemma4:e4b-it-qat 在 6.1 GB 做幾乎一樣的事。下載前值得看一下 tag 清單。

不清掉舊模型。 每次實驗都會在硬碟上留下好幾 GB。ollama list 可以看你有什麼,ollama rm <modelo> 可以刪除。


今天就能上手的推薦組合

如果你想要一組第一天就順順可用、不必想太多的設定,在 16 GB 機器上:

# 主力模型:對話、摘要、撰寫、影像
ollama pull qwen3.5:9b

# 快速回應與簡單任務
ollama pull llama3.2:3b

# 掃描文件、發票、表格
ollama pull glm-ocr

# 對你的檔案做語意搜尋
ollama pull embeddinggemma:300m

大約 10 GB 硬碟空間,涵蓋了一個人用助理所做的絕大多數事:寫、摘要、翻譯、解釋、讀文件、找東西。當其中某項任務開始不夠用時,你就會精確知道該加哪個模型、為什麼。


常見問題

跑 Ollama 需要多少 RAM?

實務最低要求是 8 GB,搭配 Q4 量化的 4B 模型與適度上下文。想要舒適無妥協的體驗,16 GB 可以讓你跑 9–12B 模型。若是認真的程式開發或高品質通用助理,請瞄準 24 GB VRAM。記得在模型大小之外,再加上 20–30% 給上下文,並預留 2 GB 給系統。

16 GB 筆電最好的 Ollama 模型是哪個?

qwen3.5:9b(6.6 GB)。它是多模態、有 256K 上下文、支援工具與推理,還留下足夠記憶體讓你工作。這是當前目錄中品質/體積比最好的一個。

Ollama 是免費的嗎?

是的。Ollama 是自由軟體,而本指南推薦的模型都採用寬鬆授權(Apache 2.0、Apache 2.0 衍生及類似的商用友善授權)。你唯一要付的,是電費和硬體。

我可以離線使用 Ollama 嗎?

可以。一旦用 ollama pull 下載完模型,所有運算都在本機發生。不會有任何東西被送到雲端,這對敏感資料、合約、發票或離線工作來說非常理想。

聊天模型和 embeddings 模型有什麼差別?

聊天模型(如 qwen3.5:9b)會根據指令產出文字。embeddings 模型(如 nomic-embed-textembeddinggemma:300m)則是把文字轉成數值向量,以便依意義比較文件。如果你想在自家檔案裡搜尋「我三月預算提在哪裡?」,你需要的是 embeddings,不是聊天機器人。


真正改變了什麼

兩年前,在本機跑模型意味著為了隱私接受一個明顯遜色的助理。今天這道算式已經不同:對日常工作——撰寫、摘要、改寫、分類、萃取、翻譯——一個 6.6 GB 的 qwen3.5:9b 做出的成果,多數人根本分不出和雲端服務的差別。

差距依然存在,但它已經上移:現在落在深度推理、極複雜的程式任務,以及對世界最新知識的掌握。其他一切,都已經塞得進你的筆電,可以離線運作,而且不會向任何人告密。


文中所有模型大小、tag 與上下文視窗數字,皆取自 Ollama 官方目錄,查詢時間為2026年8月。模型更新頻繁:下載前請至 ollama.com 確認當前的 tag。

相關文章

繼續探索您可能感興趣的相似內容

日常最佳 Ollama 模型推薦(2026 完整指南)