文章封面图: Z.ai 与它的 GLM 模型:谁是谁,各自什么时候用

Z.ai 与它的 GLM 模型:谁是谁,各自什么时候用

发布于:

阅读时间: 3 min

主题: 技术

作者: Leandro Valencia

#z.ai#glm#glm-5.3#glm coding plan#ai模型#ai编程#ai api#人工智能#glm-4.6v#cogvideox

Z.ai 模型实用目录 —GLM-5.3、Flash、4.6V、OCR、GLM-Image、CogVideoX 和 Coding Plan—:每个模型做什么、多少钱、如何为每类任务选对模型。

目录

30 秒看懂的地图

模型 类型 用途 API 价格
GLM-5.3 文本 旗舰:难代码、智能体、长任务 $1.40 / $4.40
GLM-5.3-Flash 文本 + 图像 大批量:对话、抽取、分类 $0.15 / $0.50
GLM-5.2 文本 MIT 许可的替代,1M 上下文无损 $1.40 / $4.40
GLM-4.7 / 4.6 文本 上一代,仍然全面够用 $0.60 / $2.20
GLM-4.7-Flash 文本 API 免费:草图和业余项目 $0
GLM-4.6V 视觉 截图、文档、UI、原生 tool use $0.30 / $0.90
GLM-4.6V-Flash 视觉 同样的思路,免费 $0
GLM-OCR OCR 扫描件和 PDF 转干净文本 $0.03 / $0.03
GLM-Image 图像 生成图中文字可读的图像 约 $0.015/张
CogVideoX-3 视频 短片段 约 $0.20/条
GLM-ASR-2512 语音 音频转写 约 $0.0024/分钟

这张表只带走一句话就够:“类型”那一列比版本号重要。文本版的 5.3 帮不了你看截图,4.6V 也不该去做 GLM-OCR 十分之一价格就能干完的活。


会思考的:文本模型

GLM-5.3 — 旗舰

家族的最顶端(2026 年 8 月),你说“要最好的”时默认接单的那个。它为代码和智能体优化:在 Z.ai 自家基准上比 GLM-5.2 提升约 50%,在终端任务和长重构上刷新开源最优。100 万 token 上下文、最高 128K 输出,够一个智能体一口气写完整个功能。

一个几乎没人看的价格细节:缓存命中的输入只要 $0.26,而不是 $1.40。如果你的应用每次都发同一段系统提示词,重复部分等于自动打了两折。

用它做: 复杂重构、自主智能体、大型代码库分析、高难度推理。 别用它做: 工单分类、邮件摘要。那是 Flash 的地盘,账单差 10 倍。

GLM-5.3-Flash — 主力劳模

经济版(2026 年 8 月):总参数 320B、激活 18B,混合架构削减缓存和算力成本。除了文本还吃图像,同样 1M 上下文,是 Z.ai 对话的默认模型。

每百万 token $0.15/$0.50,是同类里最便宜的档次。实用口诀:你觉得无聊的任务给 Flash,你觉得费劲的任务给完整版 5.3

用它做: 聊天机器人、结构化抽取、分类、摘要、一切大批量场景。 别用它做: 软件架构、生产环境依赖的决策。那种地方,旗舰的品质分自己会回本。

GLM-5.2 — MIT 之选

2026 年 6 月发布,API 价格和 5.3 一样。那它存在的意义是什么?许可:GLM-5.3 的权重用的是自有许可(对超大型 AI 服务公司要求安全审查),而 GLM-5.2 是纯 MIT。它发布时被称为可能是最强的开放权重模型,1M 上下文无损(长任务里更少“忘记目标”)。

用它做: 公司自托管但不想跟法务开会,或者内部政策只认 MIT/Apache。

GLM-4.7、4.6 一族 — 留下来的那一代

GLM-4.7(2025 年底)依然是个正经模型——它是最后一个公开 SWE-bench Verified 分数的(73.8%),$0.60/$2.20。GLM-4.6 基本同价。而 GLM-4.7-Flash 在 API 上免费:总参数 30B、激活 3B,非常适合原型、webhook 和几乎不用推理的自动化。

2025 年中的 GLM-4.5 和 4.5-Air 开创了这个时代,但今天已经是历史:128K 上下文,能力低于上面任何一位。老教程让你“用 GLM-4.5”的话,换成 4.6 或更新。


会看的:视觉与文档

GLM-4.6V — 看得懂的模型

视觉模型(106B、128K 上下文):看懂截图、带版式的文档、产品照片、UI。它的绝活是原生 tool use:能看着界面并在其上串联动作,从视觉感知直达在线操作。$0.30/$0.90,比文本旗舰便宜得多。

用它做: 操作界面的智能体、版式重要的文档抽取、详细图像描述。 陷阱: 如果你只要扫描版 PDF 里的文字,GLM-OCR 用 $0.03 就干完。

GLM-OCR — 便宜的专家

一个小模型(0.9B)只干一件事:把扫描件变成干净文本。正确用法是把它放在流水线第一步:先 OCR,再上文本模型。这样处理 500 张发票花的是分级别的小钱;全塞给旗舰按图像输入算,花的就是美元。


会创作的:图像、视频与语音

  • GLM-Image(2026 年 1 月):约 $0.015 一张的图像生成,有个少见的强项:图里的文字是能读的(招牌、封面、样机)。MIT 开放权重。
  • CogView-4:这家公司的老牌生成器,约 $0.01 一张。更简单,更便宜。
  • CogVideoX-3:约 $0.20 一条的短视频。适合广告草稿和社媒素材,不适合成片。
  • GLM-ASR-2512:语音转文本约 $0.0024 一分钟。做字幕便宜得离谱。
  • GLM-TTS:反方向,文本转语音,开放权重。
  • AutoGLM-Phone:操作手机的 9B 实验性智能体。今天是猎奇,明天是方向标。

怎么正确使用:五条规则

1. 按任务选,不按版本号选

最常见的错误是把目录当成“越新越好”的梯子。Flash 不是“差劲的 GLM”:它是为大批量简单任务准备的 GLM,在这些任务上质量打平、成本十分之一。正确的选择是横向的:先选类型(文本、视觉、OCR、图像),再选档位(旗舰还是 Flash),最后才看版本。

2. 每件事走对渠道

Z.ai 有三扇门,混着用是账单惊吓的头号来源:

  • chat.z.ai — 试用和闲聊,免费。写一行代码之前先来这里。
  • 按量付费 API — 给你的应用用。兼容 OpenAI 的端点:
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "从这张发票中提取户名和总额"}],
)
  • GLM Coding Plan — 面向编程工具(Claude Code、Cline、OpenCode、Roo 等)的订阅。这里有个烧钱的细节:该订阅用自己的 coding 端点自己的 API key。如果你把按量付费的 key 配到通用端点上,它不扣订阅配额——而是单独计费。完整步骤在开通教程里。

3. 上下文不免费(也不是无害的)

有了 100 万 token 的窗口,诱惑就是把整个仓库“塞得下就全塞”。两个问题:发的每个 token 都要钱;提示词变成大海捞针时模型会变笨、会忘记目标。长上下文替代的是做得烂的 RAG,不是做得好的 RAG。另外打开提示词缓存:5.3 的缓存输入是 $0.26 而不是 $1.40——系统提示词固定的话,这个差价就是纯省。

4. 专用模型优先于全能选手

整个目录反复出现同一个模式:便宜的流水线赢过昂贵的万能模型。扫描 PDF → GLM-OCR($0.03)+ Flash,而不是让旗舰盯着图看。UI 截图 → 4.6V,不是文本版。博客配图 → GLM-Image($0.015),不是高级工具。每个专用模型存在的理由,就是把一件事做得比通才更好、或者便宜一百倍。

5. 别和冷门变体结婚

2026 年 8 月,Z.ai 悄悄下架了 GLM-5-Turbo 和 GLM-5V-Turbo 变体。基础模型和 Flash 产品线多年稳定;实验品会退休。生产代码要写死模型名的话,写主流线的——而且回退方案用环境变量配置,别靠提交代码。


快速决策指南

  • 用智能体编程(Claude Code、Cline、OpenCode) → GLM Coding Plan + GLM-5.3。开通步骤在这里
  • 日常对话、学习、草稿 → chat.z.ai 免费(默认 5.3-Flash)。
  • 应用里大量简单调用 → API 上的 GLM-5.3-Flash。
  • 生产环境的高难度推理 → GLM-5.3。
  • 不想谈许可的自托管 → GLM-5.2(MIT),小机器跑 Flash 系(Ollama 指南在这里)。
  • 草图和琐碎自动化 → GLM-4.7-Flash,API 免费。
  • PDF 和扫描件 → GLM-OCR + Flash;版式重要就用 GLM-4.6V。
  • 看懂截图、UI、视觉文档 → GLM-4.6V。
  • 图像 → GLM-Image(文字可读)或 CogView-4(更便宜)。
  • 短视频 → CogVideoX-3。
  • 转写 → GLM-ASR-2512。
  • 不能出本机的数据 → 自己硬件上跑 MIT 权重。

Coding Plan 各档位真正差在哪

如果你的场景是编程,订阅有三档:Lite($18/月,每周 10,000 积分)Pro($80/月,60,000)Max($168/月,140,000)。三档用同样的模型——包括 5.3;差别只在配额。两个少有人知的乘数:按季付和按年付分别打八折和七折;避开高峰时段(工作日新加坡时间 14:00–18:00 以外)请求只消耗一半积分。在拉美夜里写代码,字面意义上就是半价。

与 OpenCode Go 的深度对比——什么时候买哪家更划算——在这篇文章;三个月的真实使用体验在评测里。


文中价格与功能为 2026 年 9 月数据,变动频繁。做重要决定前请到 docs.z.ai 核实。

想试试?用这个邀请链接开通 Coding Plan 首单 9 折:你省下第一笔付款,我获得平台积分。

— Leandro Valencia

Frequently asked questions

现在 Z.ai 最好的模型是哪个?

难任务(复杂代码、智能体、长分析)用 GLM-5.3。大批量任务(对话、抽取、分类)用 GLM-5.3-Flash,价格约为前者的十分之一,同样支持图片输入。两者都有 100 万 token 上下文。版本号不如字母重要:Flash 是经济型产品线。

GLM 模型免费吗?

取决于渠道。chat.z.ai 的对话免费;GLM-4.7-Flash 和 GLM-4.6V-Flash 在 API 上不收费;开放权重(MIT)可以下载运行,无需授权费。付费的是大模型的 API(按 token 计费)和面向编程工具的订阅 GLM Coding Plan。

能在自己的电脑上跑 GLM 吗?

可以,前提是选对模型。Flash 系列很小(GLM-4.7-Flash 总参数约 30B),用 vLLM、SGLang 或 Ollama 就能在消费级硬件上跑。744B 的旗舰装不进普通机器:那些要走 API 或多 GPU 的正经自托管。

从扫描版 PDF 里提取数据用哪个模型?

便宜的流水线:先用 GLM-OCR(每百万 token 约 $0.03)把页面转成文字,再用 GLM-5.3-Flash 之类的文本模型做结构化。如果文档版式(表格、位置)很重要,就用 GLM-4.6V 代替 OCR。

已经付了别家 AI 订阅,Coding Plan 还值得买吗?

看你烧多少配额。该订阅每月 $18 起,配额每周刷新,能在 Claude Code、Cline 或 OpenCode 里直接用,不用改工作流。与 OpenCode Go 的详细价格和限制对比在本系列的另一篇文章里。

相关文章

继续探索您可能感兴趣的相似内容

合作

我每天在用的工具,社区可以拿到更好的条件。

Z.ai首单立减 10%opencode5 美元免费额度先试用Eneba游戏、正版授权与礼品卡立减 5%
Amazon0 美元 · 我为设备和内容制作买的东西,你不会多花一分钱西班牙美国
含推广链接。你支付的价格不变。查看全部合作
培训项目

准备好将您的想法转化为真实项目了吗?

Transforma是一个帮助您以清晰的方法创建、执行和扩展项目的培训项目。

了解Transforma项目