
Z.ai和GLM模型:3个月日常使用,真实价格,以及适合谁(以及不适合谁)
发布于:
阅读时间: 3 min
主题: 技术
作者: Leandro Valencia
3个月使用Z.ai/GLM进行实际开发的详细分析。真实价格,实用用例,以及关于谁真正适合的诚实看法。
目录
- 你来看的表格:GLM编码计划
- 几乎没有人向你解释的事情:积分如何消耗
- 工具:你实际可以在哪里使用这个
- 用例:哪个模型用于哪个任务
- 我的实际经验:三个月,具体流程
- 诚实的真相:不适合谁
- 邀请代码:每个人获得什么,不花哨
你来看的表格:GLM编码计划
这是Z.ai为开发者提供服务的核心。所有计划都提供相同模型的访问权限——没有限制层——唯一变化的是你的配额量。
| 轻量版 | 专业版 | 最大版 | |
|---|---|---|---|
| 基础月费 | ~$18 美元 | ~$72–80 美元 | ~$160–168 美元 |
| 每5小时积分 | 2,000 | 12,000 | 28,000 |
| 周积分 | 10,000 | 60,000 | 140,000 |
| 预计每周令牌(GLM-5.3,缓存~95%) | 48–97百万 | 290–580百万 | 676–1,352百万 |
| 包含模型 | GLM-5.3、GLM-5-Turbo、GLM-4.7 | 相同 | 相同 |
| 包含MCP | Vision、Web Search、Web Reader、Zread | 相同 | 相同 |
| 周期折扣 | 20%季度 / 30%年度 | 相同 | 相同 |
使用年度折扣,轻量版降至~$12.60/月。这个数字使得与任何其他编码订阅的比较对竞争者来说变得不舒服。
两个价格警告:专业版和最大版的金额在不同来源和促销中有所变化($72 vs $80,$160 vs $168),所以在支付前请在页面上确认确切数字。订阅一旦购买不可退款——从轻量版月费开始,而不是最大版年度。
👉 这里订阅10%折扣 —折扣仅适用于你的第一次支付,并且仅当你从未在该平台上支付过订阅时。
模型表格:功能和API定价
如果你更喜欢按令牌支付而不是订阅,这是目录。每百万令牌价格(美元):
文本模型
| 模型 | 输入 | 缓存输入 | 输出 | 用途 |
|---|---|---|---|---|
| GLM-5.3 | $1.40 | $0.26 | $4.40 | 旗舰版。复杂编码、长期代理任务、安全。上下文1M,输出最多128K |
| GLM-5.2 | $1.40 | $0.26 | $4.40 | 前一代,与5.3相同基础 |
| GLM-5-Turbo | $1.20 | $0.24 | $4.00 | 快速。理想用于自动化和低延迟响应 |
| GLM-4.7 | $0.60 | $0.11 | $2.20 | 工作马。中等编码任务 |
| GLM-4.7-FlashX | $0.07 | $0.01 | $0.40 | 高容量:分类、提取、路由 |
| GLM-4.5-Air | $0.20 | $0.03 | $1.10 | 轻量级,非常便宜 |
| GLM-4.7-Flash | 免费 | 免费 | 免费 | 无成本的原型和测试 |
视觉、图像、音频和视频模型
| 模型 | 价格 | 用途 |
|---|---|---|
| GLM-5V-Turbo | $1.20 / $4.00 每MTok | 高级视觉:UI、视频、图形分析 |
| GLM-4.6V | $0.30 / $0.90 每MTok | 标准视觉,良好的成本质量比 |
| GLM-OCR | $0.03 每MTok | 扫描文档中的文本提取 |
| GLM-4.6V-Flash | 免费 | 无成本的基本视觉 |
| GLM-Image | $0.015 每图像 | 图像生成 |
| CogVideoX-3 | $0.20 每视频 | 视频生成 |
| Vidu Q1 / Vidu 2 | $0.20–0.40 每视频 | 从文本、图像或参考的视频 |
| GLM-ASR-2512 | ~$0.0024 每分钟 | 音频转录 |
| 代理幻灯片/海报 | $0.70 每MTok | 自动化演示和海报 |
此表格中最重要的数据:缓存输入的成本是正常输入的五分之一。在代理流程中,你一次又一次地重新发送相同的项目上下文,这个差异决定了这个月对你来说是昂贵还是便宜。
几乎没有人向你解释的事情:积分如何消耗
这是人们感到沮丧并取消的地方。该计划不按"提示数量"工作。它有两个同时限制和每个模型的乘数。
两个限制:
- 5小时限制。 动态刷新:每次消耗在5小时后返回给你。
- 周限制。 从你支付时开始,每7天重置一次。
公式: 积分 = (输入令牌 × 输入乘数 + 缓存令牌 × 缓存乘数 + 输出令牌 × 输出乘数) / 10,000
乘数:
| 模型 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|
| GLM-5.3 | 6.9 | 1.7 | 24 |
| GLM-5-Turbo | 5.7 | 1.5 | 21 |
| GLM-4.7 | 4.6 | 1.2 | 16 |
| GLM-4.6V(视觉MCP) | 1.2 | 0.3 | 2.7 |
| Web Search / Web Reader / Zread | — | — | 1.2 每次调用 |
我通过艰难学习得出的三个实际后果:
- 输出是昂贵的。 GLM-5.3中输出乘数24对输入6.9。"大声思考"4万令牌的模型会消耗你的一天。这就是为什么
reasoning_effort: low存在,为什么我使用它的次数超过预期。 - 缓存是你的预算。 90.9%和98%缓存命中率之间的差异是轻量版中每周43百万令牌和105百万令牌的差异。长时间、一致的会话有效;每10分钟打开新上下文会毁了你。
- 非高峰时段价格为一半。 高峰时段是周一至周五,14:00–18:00新加坡时间(UTC+8)。其他一切——包括整个周末——成本为积分的50%。如果你从美洲工作,你一天的大部分时间处于廉价时段。这可能是该计划最不被宣传的价格优势。
工具:你实际可以在哪里使用这个
该计划严格限制在官方支持的工具。它不是你可以随处插入的开放API;如果你在列表外使用,你会得到余额不足错误。
支持的代码代理: ZCode(Z.ai自己的环境)、Claude Code、Claude for IDE、Codex、Cursor、Cline、OpenCode、Roo Code、Kilo Code、Crush、Goose、Droid、TRAE、Qoder、Pi和Eigent。
通用代理: OpenClaw、Hermes Agent和SillyTavern,以"最佳努力"提供服务——在高负载下他们可能应用临时限制。
配置是更改base URL:
| 协议 | 基础URL |
|---|---|
| Anthropic消息(Claude Code、Goose) | https://api.z.ai/api/anthropic |
| OpenAI聊天完成(其余) | https://api.z.ai/api/coding/paas/v4 |
| OpenAI响应 | https://api.z.ai/api/v1 |
除了积分外无额外成本包含的四个MCP:视觉理解(读取截图、图表、模型)、网络搜索、网络阅读器(提取URL内容)和Zread(读取GitHub存储库)。后者在你集成不知道的库时比听起来更有用。
用例:哪个模型用于哪个任务
这是区分充分利用订阅和浪费订阅的部分。
GLM-5.3 → 重型和长期工作。 涉及十五个文件的重构、迁移、调试你花了几个小时追逐的东西、规格的完整实现。这是这个版本飞跃明显的地方:在其内部基准测试中,与GLM-5.2相比,完成率从23.4%提高到34.5%,并且消耗更少的输出令牌。在终端基准3.0中从4.6跃升到28.3。使用reasoning_effort: max,不要用于任何琐碎的事情。
GLM-5-Turbo → 自动化和延迟。 在cron、webhook或管道中运行的一切。这里你不需要深度推理,你需要一致和快速的响应。这也是我用户等待的聊天机器人的默认选择。
GLM-4.7 → 日常工作。 编写端点、调整测试、向我解释我没有写的文件、生成迁移脚本。输出乘数16对GLM-5.3的24:它产生的收益多得多,对于60%的任务,质量差异不明显。
GLM-4.7-FlashX / GLM-4.5-Air → 容量。 分类工单、提取文本字段、在代理之间路由、总结。每百万输入$0.07,FlashX对于批量处理实际上免费。
GLM-4.6V / GLM-5V-Turbo → 视觉。 传递UI错误截图、照片中的架构图、PDF中的表格。计划中集成的视觉MCP在编码流程中特别舒适。
关于聊天机器人的一个注意点:如果你与真实用户构建交互式对话,GLM-5-Turbo + Web Search MCP组合提供了比价格建议的更自然的体验。这是我最有价值且最不被谈论的用途之一。
我的实际经验:三个月,具体流程
我的工作方式是这样,我认为它解释了为什么它对我如此有效:
我用另一个模型定义规格。 我使用Grok、GPT或Claude进行问题思考部分:架构、权衡、验收标准、触摸哪些文件。这个对话是探索性的、迭代的,在那里我想要最好的推理可用,无论成本如何,因为它是少量令牌。
我用GLM执行规格。 一旦规格被编写且明确,GLM-5.3就实现它。这很重要:执行明确定义的规格与设计它是不同的问题。它需要遵循指令、保持上下文、不创造、正确使用工具。GLM在这方面非常擅长,这就是价格停止对你有意义的地方。
让我们明确地说,积分不足以在轻量版中编码一整天。如果你的工作是八小时的代理吐出代码,你会碰到5小时限制。但对于我的模式——与人类审查交替的执行爆发——它足够了。非高峰时段50%的折扣使我的有效边际翻倍。
应用和聊天也很重要。 在IDE之外,我使用Z.ai的应用程序进行不需要深度思考的任务:审查主题、总结文档、快速验证、重复性过程。与为此打开Sonnet相比,它在成本效率上显著更好且足够好。这不是魔法所在的地方,但这是累积节省所在的地方。
诚实的真相:不适合谁
如果三个月后我明确了一件事,那就是这不是入门工具。
如果你不适合:
- 你正在学习编程,需要模型逐步指导你,纠正你的假设,并向你解释为什么某些东西是错误的。GLM执行得很好;它不会从思考不周的规格中拯救你。如果你给它模糊的指示,它会带着极大的信心返回模糊的工作。
- 你想要无需配置的"一站式"体验。在这里你需要理解基础URL、协议、配额限制、乘数和时间表。这并不困难,但它是真实的摩擦。
- 你需要绝对的能力上限。在Z.ai自己的基准测试中,GLM-5.3达到34.5%,而Claude Fable 5达到39.5%。差距存在,并在前沿任务中感受到。
- 你需要退款保证。没有。要点。
如果你适合: 你已经知道如何定义问题,已经有标准来审查代理产生的内容,你的瓶颈是执行大量工作的成本,而不是前沿的推理质量。
支付前应考虑的其他两件事: Z.ai是中国公司(智谱AI),你的提示通过其基础设施——如果你处理受严格NDA或监管数据下的代码,请与相关负责人确认。而且计划绑定在支持的工具上:如果你的堆栈使用列表中的内容,该订阅对你无效,你将不得不按令牌支付API。
邀请代码:每个人获得什么,不花哨
由于我要分享它,我宁愿准确解释该计划如何工作,而不仅仅是扔给你链接。
你获得(客人):
- 第一次GLM编码计划订阅金额的10%即时折扣。它在结账时自动应用,无需编写任何代码。
- 仅适用于你是新用户或从未在平台上支付过订阅的情况。
- 仅适用于第一次订单。续订、升级和降级不适用。
- 不与其他首次购买折扣活动累积。
- 你必须在注册链接后72小时内完成支付。
我获得(邀请者):
- 相当于你实际支付金额的**10%**的平台积分。这不是现金:它们仅用于在Z.ai内支付订阅、包或API调用。它们不能兑现或转移。
- 并且有阈值:直到我积累3个有效客人,我才收费。在此之前,积分处于待处理状态。
我详细说明这一点,因为激励因素改变了你应该如何阅读评论,我宁愿你知道并自己决定。
👉 10%折扣链接 (代码: V2TH8OSBEF)
使用前:轻量版月度计划是~$18,应用折扣。用你的真实流程测试一个月。30天后如果你没有达到5小时限制,并且模型做了你需要的事情,那么是的,评估30%折扣的年度计划。不是相反。
结论
Z.ai不是"便宜的Claude"。它是一个具有不同配置的工具:在明确定义的工作执行方面出色,以改变你可以自动化的程度的价格。如果你的流程将思考与执行分开——用一个模型定义规格,用另一个执行——它几乎完美契合。如果你期望一个模型做所有事情,你会感到沮丧。
三个月后我的结论很简单:我感觉它给我的比我支付的要多。但这句话仅适用于你已经知道要请求什么的情况。
来源
- Z.AI开发者文档 — GLM编码计划概述
- Z.AI开发者文档 — 定价
- Z.AI开发者文档 — GLM-5.3
- Z.AI开发者文档 — 工具集成
- Z.AI开发者文档 — GLM编码计划常见问题
- Z.AI开发者文档 — 邀请计划规则
- TechNode — Z.ai推出GLM-5.3,声称在编码基准测试中提升50%
- VentureBeat — GLM-5.3具有先进网络功能
- MarkTechPost — Z.ai推出未重新训练基础模型的GLM-5.3
- AI定价专家 — GLM编码计划定价
披露:本文包含邀请链接。如果你通过我订阅,我将获得平台积分。技术和定价数据来自Z.ai的官方文档,并在2026年8月验证;支付前请确认当前金额。
相关文章
继续探索您可能感兴趣的相似内容

我的 Python 学习之旅:建议与资源
关于从零开始学习 Python 过程的个人记录,包括帮助过我的资源以及遇到的困难。

你应该正在使用的9款AI工具(以及每款的用途)
9款AI工具实用指南——ChatGPT、Qwen、Codex、Ollama、Google Flow、Vibes、Perchance 和 Treblo——介绍每款的功能、适合人群、价格以及何时该打开它。

日常使用的最佳 Ollama 模型(2026 指南)
2026 年 Ollama 模型选择指南:Qwen 3.5、Gemma 4、gpt-oss、qwen3-coder 等的对比表,涵盖量化方式、所需内存以及根据你的设备推荐安装方案。