文章封面图: 日常使用的最佳 Ollama 模型(2026 指南)

日常使用的最佳 Ollama 模型(2026 指南)

发布于:

阅读时间: 6 min

主题: 技术

作者: Leandro Valencia

#ollama#AI模型#本地AI#llm#qwen#gemma 4#gpt-oss#qwen coder#glm-ocr#embeddings#量化#隐私#人工智能#免费AI

2026 年 Ollama 模型选择指南:Qwen 3.5、Gemma 4、gpt-oss、qwen3-coder 等的对比表,涵盖量化方式、所需内存以及根据你的设备推荐安装方案。

目录

对比表

模型(tag) 下载大小 上下文 推荐内存 多模态 工具/推理 最适合
qwen3.5:2b 2.7 GB 256K 8 GB 文本+图像 是/是 最小全能型。摘要、改写、分类
llama3.2:3b 2.0 GB 128K 8 GB 仅文本 是/否 即时回复、自动补全、CPU 上的简单任务
qwen3.5:4b 3.4 GB 256K 8–12 GB 文本+图像 是/是 最佳起点,适合大多数人
gemma4:e2b-it-qat 4.3 GB 128K 8–12 GB 文本+图像 是/是 在普通设备上自然地撰写和把控语气
qwen3.5:9b 6.6 GB 256K 16 GB 文本+图像 是/是 整张表中质量/体积的最佳平衡点
gemma4:12b 7.6 GB 256K 16 GB 文本+图像 是/是 长文写作、文档分析、多语言
gpt-oss:20b 14 GB 128K 16–24 GB 仅文本 是/是(可调) 显式推理和智能体工作流
qwen3-coder:30b 19 GB 256K 24 GB 仅文本 是/否 仓库级编程(MoE,3.3B 激活参数)
qwen3.5:27b 17 GB 256K 24 GB 文本+图像 是/是 无需依赖云端的“正经助手”级质量
qwen3.6:35b 24 GB 256K 32 GB+ 文本+图像 是/是 消费级硬件上能跑的最强模型
gemma4:31b-it-qat 19 GB 256K 24–32 GB 文本+图像 是/是 Qwen 的替代方案,许可证和语气不同
glm-ocr 2.2 GB 128K 8 GB 图像→文本 是/否 发票、表格和扫描文档的 OCR
embeddinggemma:300m 622 MB 2K 8 GB 嵌入 对你的文件做语义搜索和 RAG
nomic-embed-text 274 MB 8K 8 GB 嵌入 RAG 经典款,快速且久经考验

“推荐内存”这一列并不是文件大小:它包含了活动上下文所需的空间,以及让操作系统保持正常运转的余量。稍后我们会详细说明。


如何正确读懂这张表

有三个数字常常被人搞混,而搞混它们正是头号原因——导致有人下载一个模型后就得出结论:“本地模型都是垃圾”。

下载大小不等于它消耗的内存。 一个 6.6 GB 的模型在内存里占用的不止这 6.6 GB——还要加上注意力缓存(KV cache),它会随对话长度增加而增长。一条实用的经验法则:日常使用时在文件大小基础上加 20–30%,并至少给系统留出 2 GB 空闲。如果要用很长的上下文,余量还要更大。

参数量已经不能预测速度了。 qwen3-coder:30b 共有 300 亿总参数,但每个 token 只激活 33 亿,因为它采用的是 混合专家(MoE)架构。它以小模型的速度生成文本,却以大模型的水平作答。代价体现在内存上,而不是等待时间上。qwen3.5:35b-a3bgemma4:26b-a4b 同理。

标称的上下文窗口不是免费的。 一个模型支持 256K token,并不意味着你能在笔记本上真用满 256K。这些上下文会实打实地占用内存。实际中,在 16 GB 的设备上,你在 8K 到 32K token 之间会很舒服——这足以应对几乎所有日常任务。


2026 年什么让一个模型变得“高效”

值得理解一下,为什么上面这张清单和两年前的看起来如此不同。

最大的变化是训练感知量化(QAT)。实验室不再用全精度训练模型然后再压缩——那样会损失质量——而是在训练时就清楚模型将以 4 bit 运行。Google 发布的 Gemma 4 的 -it-qat 变体比传统 Q4 版本轻得多:gemma4:e4b-it-qat 仅占 6.1 GB,而标准版要 9.6 GB,且质量下降远比你想象的要小。如果你打算用 Gemma 4,永远优先选 QAT 标签。

第二个变化是 MXFP4,也就是 OpenAI 在 gpt-oss 中采用的格式。MoE 的权重在后训练阶段就被量化到每个参数 4.25 bit,Ollama 原生执行它们,无需额外转换。这就是为什么一个 20B 的模型能装进 14 GB,并在 16 GB 内存的设备上跑起来。

第三个变化是中间尺寸的激增。Qwen 3.5 发布了 0.8B、2B、4B、9B、27B、35B 和 122B 等规格。这种颗粒度很重要:你不必在“太蠢”和“装不下”之间二选一,而是能找到与你的硬件完全匹配的那一档。

第四个,在 Mac 上:MLX 和 nvfp4 标签。如果你用的是 Apple Silicon,-mlx 变体是专为 Apple 引擎编译的,每瓦性能通常优于通用的 GGUF。qwen3.5:9b-mlx(8.9 GB)在 16 GB 统一内存的 MacBook 上是个绝佳选择。


逐个介绍这些模型

Qwen 3.5 — 你应该最先安装的模型家族

如果整篇指南你只读一段,就读这一段。Qwen 3.5 家族覆盖从 0.8B 到 122B,全部具备 256K 原生上下文,且全部支持文本和图像输入。它是多模态的,支持工具调用,并带有推理模式。实际上,人们对本地助手提出的需求中,80% 它都能解决。

ollama pull qwen3.5:4b     # 3.4 GB — 入门之选
ollama pull qwen3.5:9b     # 6.6 GB — 甜点位
ollama pull qwen3.5:27b    # 17 GB  — 如果你的 GPU 撑得住

9b 可能是当前整个目录中质量/体积比最优的。它在 16 GB 内放下后还有工作余量,能理解图像,而且在日常任务——撰写、总结、翻译、讲解——上与 27b 的差距远比体积差所暗示的要小。

什么时候不该用它: 如果你的主要任务是在大型仓库上做智能体编程,qwen3-coder:30b 才是专门为此训练的。

Gemma 4 — Google 的替代方案,带音频

Gemma 4 是 Google 的回应,而且带来了 Qwen 没有的东西:音频输入,此外还有视觉、工具和推理。尺寸从 e2b31b,其中带“e”的变体是有效参数模型——设计上让实际计算成本低于标称值。

ollama pull gemma4:e2b-it-qat   # 4.3 GB
ollama pull gemma4:12b          # 7.6 GB,256K 上下文
ollama pull gemma4:31b-it-qat   # 19 GB

gemma4:12b 值得特别关注:7.6 GB 换来 256K 上下文,密度极佳,而且 Gemma 的行文往往比其他家族更自然、更少“教科书腔”。对于将由人来阅读的邮件、文章和文本,很多人更偏爱它。

什么时候不该用它: 在数学推理或代码任务上,Qwen 和 gpt-oss 通常更胜一筹。

gpt-oss:20b — 可调推理强度的模型

OpenAI 的开放权重模型带来了两个与众不同之处:完整且可见的思维链,以及可配置的推理强度,分三档(低、中、高)。想要速度时可以让它少想,问题确实复杂时则可以多想。

ollama pull gpt-oss:20b   # 14 GB,128K 上下文

采用 Apache 2.0 许可证,没有 copyleft 限制,适合商业用途。如果你的用例涉及智能体、函数调用、结构化输出或推理调试,它就是默认之选——因为你可以清楚地看到它是如何得出结论的。

什么时候不该用它: 它不能处理图像。如果需要多模态,请回到 Qwen 或 Gemma。

qwen3-coder:30b — 代码专精模型

总参数 30B、激活参数 3.3B、原生上下文 256K(可外推至 1M)。使用 7.5万亿token 训练,其中代码占比 70%,并辅以针对真实代码执行过程的强化学习。它是为仓库规模的工程任务设计的,而不是用来补全零散的代码行。

ollama pull qwen3-coder:30b   # 19 GB
ollama launch opencode --model qwen3-coder

在 24 GB 的 GPU 上,它是当今最佳的本地编程选择。由于是 MoE 架构,尽管体积大,生成速度却像小模型一样快。

什么时候不该用它: 用来回答通用问题是浪费内存。可以同时加载一个通用模型备用。

Qwen 3.6 — 更高一档

Qwen 最新一代,提供 27b(17 GB)和 35b(24 GB)。它的改进集中在智能体编程——前端工作流和仓库级推理——以及推理保留上,这个选项会保留之前消息的思维上下文,避免在迭代式对话中重复劳动。

ollama pull qwen3.6:27b

如果你有 32 GB 或以上内存,并且想要消费级硬件上能跑的最强模型,就是它了。如果你只有 16 GB,那就用 qwen3.5:9b,别纠结。

Llama 3.2(1B 和 3B)— 轻量级选手

Llama 3.2 已不是最新之作,但它仍然重要,原因很具体:1.3 GB 和 2.0 GB,支持工具调用,128K 上下文。它就是你在一台普通机器或小型服务器上常驻加载的那个模型——响应不到一秒,即使没有 GPU 也能跑得很好。

ollama pull llama3.2:3b   # 2.0 GB
ollama pull llama3.2:1b   # 1.3 GB

用来改写一段话、给文本分类、提取实体或生成简短回复,它完全够用。但要拿它来深入推理问题,就不行了。

glm-ocr — 几乎没人知道的专精模型

只有 0.9B 参数,2.2 GB 下载体积,却把一件事做得极其出色:把文档转换成结构化文本。复杂表格、公式、印章、含大量代码的文档、难处理的版式,都不在话下。它有专门的模式,直接在 prompt 里调用即可:

ollama run glm-ocr Text Recognition: ./factura.png
ollama run glm-ocr Table Recognition: ./reporte.png
ollama run glm-ocr Figure Recognition: ./diagrama.png

如果你经常数字化发票、收据或扫描文档,光这一个模型就值得你装上 Ollama。

嵌入模型 — 隐形但不可或缺

如果你想在自己的文档里搜索——比如“我三月份预算提在哪了?”——你需要的是一个嵌入模型,而不是聊天机器人。它们体积极小,干的活也不同:把文本转换成向量,以便按语义进行比较。

ollama pull embeddinggemma:300m      # 622 MB,Google 出品
ollama pull nomic-embed-text         # 274 MB,事实标准
ollama pull qwen3-embedding:0.6b     # 如果你已经在用 Qwen 家族

这里要注意上下文窗口:embeddinggemma 接受 2K token,nomic-embed-text 最多到 8K。这决定了你如何切分文档——500 到 1000 token 的片段配这两个模型都很合适。

对于中文或多语言内容,nomic-embed-text-v2-moesnowflake-arctic-embed2 专门为多语言检索训练过,效果通常优于纯英文版本。


根据你的设备选择安装方案

8 GB 内存(无独立 GPU 或 GPU 较小)

这是最常见的场景,也最容易被误解。确实能跑,但你必须守规矩:一次只加载一个模型、用 Q4 量化、上下文别开太大。

ollama pull qwen3.5:4b       # 3.4 GB — 你的主力模型
ollama pull llama3.2:3b      # 2.0 GB — 用于即时回复
ollama pull glm-ocr          # 2.2 GB — 文档和图像
ollama pull nomic-embed-text # 用于本地搜索的嵌入模型

8 GB 下的黄金法则:Q4 量化下的小模型永远胜过 Q2 下的大模型。硬把一个 14B 压缩到极限的诱惑,最终只会换来语无伦次的回答。别这么做。

16 GB 内存

到了这里,体验才真正开始变得舒服。你可以跑一个 9–12B 的模型并配上较大的上下文,也可以同时加载两个小模型来对比。

ollama pull qwen3.5:9b       # 6.6 GB — 你的主力
ollama pull gemma4:12b       # 7.6 GB — 用于长文写作
ollama pull gpt-oss:20b      # 14 GB — 用于推理(一次一个)
ollama pull embeddinggemma:300m

在 16 GB 下,你还可以给小模型上 Q5 或 Q8 量化,以此换回一些推理精度,而速度损失很小。

24 GB VRAM(RTX 4090 / 5090 或类似显卡)

在这个范围内,本地模型终于不再像是“将就”了。

ollama pull qwen3.5:27b      # 17 GB — 正经的通用助手
ollama pull qwen3-coder:30b  # 19 GB — 编程
ollama pull gemma4:31b-it-qat # 19 GB — 多模态替代方案

32 GB 或以上(含 Mac 统一内存)

ollama pull qwen3.6:35b      # 24 GB — 消费级硬件的实际上限
ollama pull qwen3.5:35b-a3b  # 24 GB — MoE,比它的体积听起来更快

在 Apple Silicon 上,优先试 MLX 标签:qwen3.6:35b-mlx(22 GB)和 qwen3.5:27b-mlx(20 GB)都是针对 Apple 硬件优化的。


两分钟搞懂量化

量化通过降低模型权重的精度来减少内存占用。这是你能动用的最重要的杠杆,也是最容易出错的地方。

Q4_K_M 是标准选择。相比全精度,它将内存消耗降低约 70%,而质量损失在日常任务中几乎察觉不到。拿不准就选它。在 8 GB 的设备上,它不是“一个选项”——而是唯一合理的选择。

Q8_0 相比 Q4 体积大约翻倍,但能找回推理和数学上的精度。当内存有富余时,用在小模型上很合理——qwen3.5:4b-q8_0 重 5.3 GB,在逻辑任务上明显比 Q4 版本更扎实。

QAT(Gemma 的 -it-qat 标签)是训练阶段的量化,而非事后压缩。只要有的选,就优先于等效的 Q4。

MXFP4 是 gpt-oss 的原生格式。你什么都不用选:模型本来就是这样的。

MLX / nvfp4 是面向 Apple Silicon 以及支持 FP4 的 NVIDIA GPU 的变体。如果你的硬件符合条件,它们能在同等甚至更低功耗下带来更好性能。

实用的决策顺序很简单:先选能在你内存中以 Q4 放下的模型大小,然后只有在空间有富余时才考虑提高量化精度。顺序绝不能反过来。


毁掉体验的常见错误

“以防万一”把上下文拉满。 在 16 GB 的设备上设置 256K 上下文,会用空缓存塞满内存,导致模型本身没了空间。从 8K 起步,需要时再加。

凭第一次回答就评判一个模型。 第一次生成包含了模型加载进内存的时间。第二次才是真正代表速度的。

用聊天模型做语义搜索。 这是两种不同的工具。想搜索文档,你需要的是嵌入模型加一个向量库,而不是把文档贴进 prompt 的聊天机器人。

无视特定标签。 ollama pull gemma4 会拉取 latest,也就是 9.6 GB 的 e4b。而 gemma4:e4b-it-qat 只用 6.1 GB 就能做到几乎一样的事。下载前花点时间看看标签列表是值得的。

不清理旧模型。 每次实验都会在磁盘上留下几个 GB。ollama list 可以查看你装了什么,ollama rm <模型> 则可以删除。


今天就能上手的一套推荐组合

如果你想要一套从第一天起就好用、不用想太多的配置,在 16 GB 的设备上:

# 主力模型:对话、摘要、撰写、图像
ollama pull qwen3.5:9b

# 快速回复和简单任务
ollama pull llama3.2:3b

# 扫描文档、发票、表格
ollama pull glm-ocr

# 对你的文件做语义搜索
ollama pull embeddinggemma:300m

它们总共约占 10 GB 磁盘,能覆盖一个人使用助手的几乎所有场景:写作、总结、翻译、讲解、阅读文档和查找信息。当其中某项任务不够用时,你自然就知道该加哪个模型、为什么加了。


常见问题

运行 Ollama 需要多少内存?

作为实用的下限,8 GB 内存可以跑 Q4 量化的 4B 模型并配上中等上下文。想要舒适且不打折扣的体验,16 GB 能让你跑 9–12B 的模型。要做正经的代码工作或高质量的通用助手,目标定在 24 GB VRAM。记住在模型大小基础上再加 20–30% 给上下文,并给系统留出 2 GB 空闲。

16 GB 笔记本上最好的 Ollama 模型是哪个?

qwen3.5:9b(6.6 GB)。它是多模态的,有 256K 上下文,支持工具调用和推理,还能留出足够的内存供你工作。它是当前目录中质量/体积比最优的选择。

Ollama 是免费的吗?

是的。Ollama 是自由软件,本指南推荐的模型都采用宽松许可证(Apache 2.0 及其衍生等适用于商业用途的许可证)。你唯一要付的只是电费和硬件。

Ollama 可以离线使用吗?

可以。用 ollama pull 下载好模型后,所有处理都在本地进行。不会有任何数据发送到云端,这让它非常适合处理敏感数据、合同、发票或断网环境下工作。

聊天模型和嵌入模型有什么区别?

聊天模型(如 qwen3.5:9b)根据指令生成文本。嵌入模型(如 nomic-embed-textembeddinggemma:300m)把文本转换成数值向量,以便按语义比较文档。如果你想在文件里搜索“我三月份预算提在哪了?”,你需要的是嵌入模型,而不是聊天机器人。


真正改变的是什么

两年前,在本地跑模型意味着为了隐私而接受一个明显更弱的助手。如今等式已经不同了:对于日常任务——撰写、总结、改写、分类、提取、翻译——一个 6.6 GB 的 qwen3.5:9b 做的工作,大多数人根本分不出和云端服务的差别。

差距依然存在,但它已经上移了:现在差距体现在深度推理、极其复杂的代码任务以及对高度实时的世界知识上。除此之外的一切,都已经能装进你的笔记本,离线运行,而且不向任何人透露半个字。


本文引用的所有大小、标签和上下文窗口均来自 Ollama 官方目录,查询于 2026年8月。模型更新频繁:下载前请在 ollama.com 核实当前标签。

相关文章

继续探索您可能感兴趣的相似内容

日常使用的最佳 Ollama 模型(2026 指南)