
Z.ai 与它的 GLM 模型:谁是谁,各自什么时候用
发布于:
阅读时间: 3 min
主题: 技术
作者: Leandro Valencia
Z.ai 模型实用目录 —GLM-5.3、Flash、4.6V、OCR、GLM-Image、CogVideoX 和 Coding Plan—:每个模型做什么、多少钱、如何为每类任务选对模型。
目录
30 秒看懂的地图
| 模型 | 类型 | 用途 | API 价格 |
|---|---|---|---|
| GLM-5.3 | 文本 | 旗舰:难代码、智能体、长任务 | $1.40 / $4.40 |
| GLM-5.3-Flash | 文本 + 图像 | 大批量:对话、抽取、分类 | $0.15 / $0.50 |
| GLM-5.2 | 文本 | MIT 许可的替代,1M 上下文无损 | $1.40 / $4.40 |
| GLM-4.7 / 4.6 | 文本 | 上一代,仍然全面够用 | $0.60 / $2.20 |
| GLM-4.7-Flash | 文本 | API 免费:草图和业余项目 | $0 |
| GLM-4.6V | 视觉 | 截图、文档、UI、原生 tool use | $0.30 / $0.90 |
| GLM-4.6V-Flash | 视觉 | 同样的思路,免费 | $0 |
| GLM-OCR | OCR | 扫描件和 PDF 转干净文本 | $0.03 / $0.03 |
| GLM-Image | 图像 | 生成图中文字可读的图像 | 约 $0.015/张 |
| CogVideoX-3 | 视频 | 短片段 | 约 $0.20/条 |
| GLM-ASR-2512 | 语音 | 音频转写 | 约 $0.0024/分钟 |
这张表只带走一句话就够:“类型”那一列比版本号重要。文本版的 5.3 帮不了你看截图,4.6V 也不该去做 GLM-OCR 十分之一价格就能干完的活。
会思考的:文本模型
GLM-5.3 — 旗舰
家族的最顶端(2026 年 8 月),你说“要最好的”时默认接单的那个。它为代码和智能体优化:在 Z.ai 自家基准上比 GLM-5.2 提升约 50%,在终端任务和长重构上刷新开源最优。100 万 token 上下文、最高 128K 输出,够一个智能体一口气写完整个功能。
一个几乎没人看的价格细节:缓存命中的输入只要 $0.26,而不是 $1.40。如果你的应用每次都发同一段系统提示词,重复部分等于自动打了两折。
用它做: 复杂重构、自主智能体、大型代码库分析、高难度推理。 别用它做: 工单分类、邮件摘要。那是 Flash 的地盘,账单差 10 倍。
GLM-5.3-Flash — 主力劳模
经济版(2026 年 8 月):总参数 320B、激活 18B,混合架构削减缓存和算力成本。除了文本还吃图像,同样 1M 上下文,是 Z.ai 对话的默认模型。
每百万 token $0.15/$0.50,是同类里最便宜的档次。实用口诀:你觉得无聊的任务给 Flash,你觉得费劲的任务给完整版 5.3。
用它做: 聊天机器人、结构化抽取、分类、摘要、一切大批量场景。 别用它做: 软件架构、生产环境依赖的决策。那种地方,旗舰的品质分自己会回本。
GLM-5.2 — MIT 之选
2026 年 6 月发布,API 价格和 5.3 一样。那它存在的意义是什么?许可:GLM-5.3 的权重用的是自有许可(对超大型 AI 服务公司要求安全审查),而 GLM-5.2 是纯 MIT。它发布时被称为可能是最强的开放权重模型,1M 上下文无损(长任务里更少“忘记目标”)。
用它做: 公司自托管但不想跟法务开会,或者内部政策只认 MIT/Apache。
GLM-4.7、4.6 一族 — 留下来的那一代
GLM-4.7(2025 年底)依然是个正经模型——它是最后一个公开 SWE-bench Verified 分数的(73.8%),$0.60/$2.20。GLM-4.6 基本同价。而 GLM-4.7-Flash 在 API 上免费:总参数 30B、激活 3B,非常适合原型、webhook 和几乎不用推理的自动化。
2025 年中的 GLM-4.5 和 4.5-Air 开创了这个时代,但今天已经是历史:128K 上下文,能力低于上面任何一位。老教程让你“用 GLM-4.5”的话,换成 4.6 或更新。
会看的:视觉与文档
GLM-4.6V — 看得懂的模型
视觉模型(106B、128K 上下文):看懂截图、带版式的文档、产品照片、UI。它的绝活是原生 tool use:能看着界面并在其上串联动作,从视觉感知直达在线操作。$0.30/$0.90,比文本旗舰便宜得多。
用它做: 操作界面的智能体、版式重要的文档抽取、详细图像描述。 陷阱: 如果你只要扫描版 PDF 里的文字,GLM-OCR 用 $0.03 就干完。
GLM-OCR — 便宜的专家
一个小模型(0.9B)只干一件事:把扫描件变成干净文本。正确用法是把它放在流水线第一步:先 OCR,再上文本模型。这样处理 500 张发票花的是分级别的小钱;全塞给旗舰按图像输入算,花的就是美元。
会创作的:图像、视频与语音
- GLM-Image(2026 年 1 月):约 $0.015 一张的图像生成,有个少见的强项:图里的文字是能读的(招牌、封面、样机)。MIT 开放权重。
- CogView-4:这家公司的老牌生成器,约 $0.01 一张。更简单,更便宜。
- CogVideoX-3:约 $0.20 一条的短视频。适合广告草稿和社媒素材,不适合成片。
- GLM-ASR-2512:语音转文本约 $0.0024 一分钟。做字幕便宜得离谱。
- GLM-TTS:反方向,文本转语音,开放权重。
- AutoGLM-Phone:操作手机的 9B 实验性智能体。今天是猎奇,明天是方向标。
怎么正确使用:五条规则
1. 按任务选,不按版本号选
最常见的错误是把目录当成“越新越好”的梯子。Flash 不是“差劲的 GLM”:它是为大批量简单任务准备的 GLM,在这些任务上质量打平、成本十分之一。正确的选择是横向的:先选类型(文本、视觉、OCR、图像),再选档位(旗舰还是 Flash),最后才看版本。
2. 每件事走对渠道
Z.ai 有三扇门,混着用是账单惊吓的头号来源:
- chat.z.ai — 试用和闲聊,免费。写一行代码之前先来这里。
- 按量付费 API — 给你的应用用。兼容 OpenAI 的端点:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3-flash",
messages=[{"role": "user", "content": "从这张发票中提取户名和总额"}],
)
- GLM Coding Plan — 面向编程工具(Claude Code、Cline、OpenCode、Roo 等)的订阅。这里有个烧钱的细节:该订阅用自己的 coding 端点和自己的 API key。如果你把按量付费的 key 配到通用端点上,它不扣订阅配额——而是单独计费。完整步骤在开通教程里。
3. 上下文不免费(也不是无害的)
有了 100 万 token 的窗口,诱惑就是把整个仓库“塞得下就全塞”。两个问题:发的每个 token 都要钱;提示词变成大海捞针时模型会变笨、会忘记目标。长上下文替代的是做得烂的 RAG,不是做得好的 RAG。另外打开提示词缓存:5.3 的缓存输入是 $0.26 而不是 $1.40——系统提示词固定的话,这个差价就是纯省。
4. 专用模型优先于全能选手
整个目录反复出现同一个模式:便宜的流水线赢过昂贵的万能模型。扫描 PDF → GLM-OCR($0.03)+ Flash,而不是让旗舰盯着图看。UI 截图 → 4.6V,不是文本版。博客配图 → GLM-Image($0.015),不是高级工具。每个专用模型存在的理由,就是把一件事做得比通才更好、或者便宜一百倍。
5. 别和冷门变体结婚
2026 年 8 月,Z.ai 悄悄下架了 GLM-5-Turbo 和 GLM-5V-Turbo 变体。基础模型和 Flash 产品线多年稳定;实验品会退休。生产代码要写死模型名的话,写主流线的——而且回退方案用环境变量配置,别靠提交代码。
快速决策指南
- 用智能体编程(Claude Code、Cline、OpenCode) → GLM Coding Plan + GLM-5.3。开通步骤在这里。
- 日常对话、学习、草稿 → chat.z.ai 免费(默认 5.3-Flash)。
- 应用里大量简单调用 → API 上的 GLM-5.3-Flash。
- 生产环境的高难度推理 → GLM-5.3。
- 不想谈许可的自托管 → GLM-5.2(MIT),小机器跑 Flash 系(Ollama 指南在这里)。
- 草图和琐碎自动化 → GLM-4.7-Flash,API 免费。
- PDF 和扫描件 → GLM-OCR + Flash;版式重要就用 GLM-4.6V。
- 看懂截图、UI、视觉文档 → GLM-4.6V。
- 图像 → GLM-Image(文字可读)或 CogView-4(更便宜)。
- 短视频 → CogVideoX-3。
- 转写 → GLM-ASR-2512。
- 不能出本机的数据 → 自己硬件上跑 MIT 权重。
Coding Plan 各档位真正差在哪
如果你的场景是编程,订阅有三档:Lite($18/月,每周 10,000 积分)、Pro($80/月,60,000)、Max($168/月,140,000)。三档用同样的模型——包括 5.3;差别只在配额。两个少有人知的乘数:按季付和按年付分别打八折和七折;避开高峰时段(工作日新加坡时间 14:00–18:00 以外)请求只消耗一半积分。在拉美夜里写代码,字面意义上就是半价。
与 OpenCode Go 的深度对比——什么时候买哪家更划算——在这篇文章;三个月的真实使用体验在评测里。
文中价格与功能为 2026 年 9 月数据,变动频繁。做重要决定前请到 docs.z.ai 核实。
想试试?用这个邀请链接开通 Coding Plan 首单 9 折:你省下第一笔付款,我获得平台积分。
— Leandro Valencia
Frequently asked questions
现在 Z.ai 最好的模型是哪个?
难任务(复杂代码、智能体、长分析)用 GLM-5.3。大批量任务(对话、抽取、分类)用 GLM-5.3-Flash,价格约为前者的十分之一,同样支持图片输入。两者都有 100 万 token 上下文。版本号不如字母重要:Flash 是经济型产品线。
GLM 模型免费吗?
取决于渠道。chat.z.ai 的对话免费;GLM-4.7-Flash 和 GLM-4.6V-Flash 在 API 上不收费;开放权重(MIT)可以下载运行,无需授权费。付费的是大模型的 API(按 token 计费)和面向编程工具的订阅 GLM Coding Plan。
能在自己的电脑上跑 GLM 吗?
可以,前提是选对模型。Flash 系列很小(GLM-4.7-Flash 总参数约 30B),用 vLLM、SGLang 或 Ollama 就能在消费级硬件上跑。744B 的旗舰装不进普通机器:那些要走 API 或多 GPU 的正经自托管。
从扫描版 PDF 里提取数据用哪个模型?
便宜的流水线:先用 GLM-OCR(每百万 token 约 $0.03)把页面转成文字,再用 GLM-5.3-Flash 之类的文本模型做结构化。如果文档版式(表格、位置)很重要,就用 GLM-4.6V 代替 OCR。
已经付了别家 AI 订阅,Coding Plan 还值得买吗?
看你烧多少配额。该订阅每月 $18 起,配额每周刷新,能在 Claude Code、Cline 或 OpenCode 里直接用,不用改工作流。与 OpenCode Go 的详细价格和限制对比在本系列的另一篇文章里。
相关文章
继续探索您可能感兴趣的相似内容

Z.ai GLM与OpenCode Go:价格和套餐对比
Z.ai GLM Coding Plan 对比 OpenCode Go:价格、积分、用量上限、包含模型,以及一份诚实建议,说明这两种订阅分别适合什么样的开发者。

Z.ai和GLM模型:3个月日常使用,真实价格,以及适合谁(以及不适合谁)
3个月使用Z.ai/GLM进行实际开发的详细分析。真实价格,实用用例,以及关于谁真正适合的诚实看法。
OpenCode Go:价格、使用限额,以及2026年是否值得订阅
深度评测 OpenCode Go:多少钱、包含哪些模型、使用限额(每 5 小时 / 每周 / 每月)如何运作,以及什么情况下值得付费。文中说明 5 美元首月、额度如何重置,以及与 OpenCode Zen 的差别,写给在终端写代码的开发者。
合作
我每天在用的工具,社区可以拿到更好的条件。