
Z.ai e modelos GLM: 3 meses de uso diário, preços reais e para quem serve (e para quem não serve)
Publicado em:
Tempo de leitura: 13 min
Tema: Tecnologia
Autor: Leandro Valencia
Análise detalhada de 3 meses usando Z.ai/GLM para desenvolvimento real. Preços reais, casos de uso práticos e honestidade sobre quem realmente funciona.
Índice
- A tabela que você veio ver: planos do GLM Coding Plan
- O que quase ninguém explica para você: como os créditos são consumidos
- As ferramentas: onde você pode realmente usar isso
- Casos de uso: qual modelo para qual tarefa
- Minha experiência real: três meses, fluxo concreto
- A verdade honesta: para quem NÃO é isso
- O código de convite: o que cada um ganha, sem firulas
A tabela que você veio ver: planos do GLM Coding Plan
Este é o coração da oferta da Z.ai para desenvolvedores. Todos os planos dão acesso aos mesmos modelos —não há tiers com modelos limitados—, o que muda é quanto cota você tem.
| Lite | Pro | Max | |
|---|---|---|---|
| Preço base mensal | ~$18 USD | ~$72–80 USD | ~$160–168 USD |
| Créditos a cada 5 horas | 2.000 | 12.000 | 28.000 |
| Créditos semanais | 10.000 | 60.000 | 140.000 |
| Tokens estimados/semana (GLM-5.3, cache ~95%) | 48–97 milhões | 290–580 milhões | 676–1.352 milhões |
| Modelos incluídos | GLM-5.3, GLM-5-Turbo, GLM-4.7 | Mesmos | Mesmos |
| MCPs incluídos | Vision, Web Search, Web Reader, Zread | Mesmos | Mesmos |
| Desconto por ciclo | 20% trimestral / 30% anual | Igual | Igual |
Com o desconto anual, Lite cai para ~$12,60/mês. Esse é o número que faz a comparação com qualquer outra assinatura de coding ficar desconfortável para a concorrência.
Duas advertências sobre preços: os valores de Pro e Max variaram entre fontes e promoções ($72 vs $80, $160 vs $168), então verifique o número exato na página antes de pagar. E as assinaturas não são reembolsáveis uma vez compradas — comece com Lite mensal, não Max anual.
👉 Inscreva-se com 10% de desconto aqui — o desconto só se aplica ao seu primeiro pagamento e apenas se você nunca teve uma assinatura paga na plataforma.
Tabela de modelos: capacidades e preços de API
Se você prefere pagar por token em vez de assinar, este é o catálogo. Preços por milhão de tokens (USD):
Modelos de texto
| Modelo | Input | Input cacheado | Output | Para que serve |
|---|---|---|---|---|
| GLM-5.3 | $1,40 | $0,26 | $4,40 | Premium. Coding complexo, tarefas agênticas longas, segurança. Contexto 1M, output até 128K |
| GLM-5.2 | $1,40 | $0,26 | $4,40 | Geração anterior, mesma base que 5.3 |
| GLM-5-Turbo | $1,20 | $0,24 | $4,00 | Rápido. Ideal para automações e respostas de baixa latência |
| GLM-4.7 | $0,60 | $0,11 | $2,20 | Cavalo de batalha barato. Tarefas de código médio |
| GLM-4.7-FlashX | $0,07 | $0,01 | $0,40 | Alto volume: classificação, extração, roteamento |
| GLM-4.5-Air | $0,20 | $0,03 | $1,10 | Leve, muito barato |
| GLM-4.7-Flash | Grátis | Grátis | Grátis | Protótipos e testes sem custo |
Modelos de visão, imagem, áudio e vídeo
| Modelo | Preço | Para que serve |
|---|---|---|
| GLM-5V-Turbo | $1,20 / $4,00 por MTok | Visão de alto nível: análise de UI, vídeo, gráficos |
| GLM-4.6V | $0,30 / $0,90 por MTok | Visão padrão, boa relação custo-benefício |
| GLM-OCR | $0,03 por MTok | Extração de texto de documentos escaneados |
| GLM-4.6V-Flash | Grátis | Visão básica sem custo |
| GLM-Image | $0,015 por imagem | Geração de imagens |
| CogVideoX-3 | $0,20 por vídeo | Geração de vídeo |
| Vidu Q1 / Vidu 2 | $0,20–0,40 por vídeo | Vídeo a partir de texto, imagem ou referência |
| GLM-ASR-2512 | ~$0,0024 por minuto | Transcrição de áudio |
| Agente Slide/Poster | $0,70 por MTok | Apresentações e pôsteres automatizados |
O dado mais importante desta tabela: o input cacheado custa um quinto do input normal. Em um fluxo agêntico onde você reenvia o mesmo contexto de projeto uma e outra vez, essa diferença é que decide se o mês sai caro ou barato para você.
O que quase ninguém explica para você: como os créditos são consumidos
É aqui que as pessoas se frustram e cancelam. O plano não funciona por "número de prompts". Funciona com dois limites simultâneos e multiplicadores por modelo.
Os dois limites:
- Limite de 5 horas. Atualiza dinamicamente: cada consumo é devolvido a você 5 horas depois.
- Limite semanal. Começa quando você paga e reinicia a cada 7 dias.
A fórmula: créditos = (tokens_input × mult_input + tokens_cacheados × mult_cache + tokens_output × mult_output) / 10.000
Os multiplicadores:
| Modelo | Input | Input cacheado | Output |
|---|---|---|---|
| GLM-5.3 | 6,9 | 1,7 | 24 |
| GLM-5-Turbo | 5,7 | 1,5 | 21 |
| GLM-4.7 | 4,6 | 1,2 | 16 |
| GLM-4.6V (Vision MCP) | 1,2 | 0,3 | 2,7 |
| Web Search / Web Reader / Zread | — | — | 1,2 por chamada |
Três consequências práticas que aprendi na marra:
- O output é o que caro. Multiplicador 24 contra 6,9 do input no GLM-5.3. Um modelo que "pensa em voz alta" por 40 mil tokens come o seu dia. Por isso
reasoning_effort: lowexiste e por isso eu uso mais do que esperava. - O cache é o seu orçamento. A diferença entre 90,9% e 98% de acerto de cache é a diferença entre 43 e 105 milhões de tokens por semana no Lite. Sessões longas e coerentes rendem; abrir novo contexto a cada 10 minutos te arruína.
- Fora de horário de pico você paga metade. Horário de pico é segunda a sexta, 14:00–18:00 horário de Singapura (UTC+8). Tudo o mais —incluindo o final de semana completo— custa 50% dos créditos. Se você trabalha das Américas, boa parte do seu dia cai em horário barato. É provavelmente a vantagem de preço menos divulgada do plano.
As ferramentas: onde você pode realmente usar isso
O plano está estritamente limitado a ferramentas suportadas oficialmente. Não é uma API aberta que você conecta onde quiser; se usar fora da lista, dará erro de saldo insuficiente.
Agentes de código suportados: ZCode (ambiente próprio da Z.ai), Claude Code, Claude for IDE, Codex, Cursor, Cline, OpenCode, Roo Code, Kilo Code, Crush, Goose, Droid, TRAE, Qoder, Pi e Eigent.
Agentes de propósito geral: OpenClaw, Hermes Agent e SillyTavern, servidos com "melhor esforço" — sob carga alta podem aplicar limites temporários.
A configuração é mudar o base URL:
| Protocolo | Base URL |
|---|---|
| Anthropic Messages (Claude Code, Goose) | https://api.z.ai/api/anthropic |
| OpenAI Chat Completions (o resto) | https://api.z.ai/api/coding/paas/v4 |
| OpenAI Responses | https://api.z.ai/api/v1 |
E os quatro MCPs incluídos sem custo extra além dos créditos: Vision Understanding (ler capturas, diagramas, mockups), Web Search, Web Reader (extrair conteúdo de URLs) e Zread (ler repositórios do GitHub). Este último é mais útil do que parece quando você está integrando uma biblioteca que não conhece.
Casos de uso: qual modelo para qual tarefa
Esta é a parte que separa quem aproveita a assinatura de quem desperdiça.
GLM-5.3 → trabalho pesado e longo. Refactors que tocam quinze arquivos, migrações, depuração de algo que você está perseguindo há horas, implementação completa de uma spec. É aqui que o salto nesta versão se nota: em seu benchmark interno passou de 23,4% para 34,5% de tarefas completadas contra GLM-5.2, e consumindo menos tokens de output. No Terminal-Bench 3.0 saltou de 4,6 para 28,3. Use com reasoning_effort: max e não use para nada trivial.
GLM-5-Turbo → automações e latência. Tudo que roda em um cron, webhook ou pipeline. Aqui você não precisa de raciocínio profundo, precisa de respostas consistentes e rápidas. É também minha opção padrão para chatbots onde o usuário está esperando.
GLM-4.7 → o dia a dia. Escrever um endpoint, ajustar um teste, explicar um arquivo que eu não escrevi para você, gerar um script de migração. Multiplicador 16 no output contra 24 do GLM-5.3: ele rende muito mais e para 60% das tarefas a diferença de qualidade não é perceptível.
GLM-4.7-FlashX / GLM-4.5-Air → volume. Classificar tickets, extrair campos de texto, fazer roteamento entre agentes, resumir. A $0,07 de input por milhão, FlashX é praticamente grátis para processar lotes.
GLM-4.6V / GLM-5V-Turbo → visão. Passar uma captura de bug de UI, um diagrama de arquitetura em foto, uma tabela em PDF. O Vision MCP integrado no plano torna especialmente confortável dentro do fluxo de coding.
Uma nota sobre chatbots: se você está construindo interação conversacional com usuários reais, a combinação GLM-5-Turbo + Web Search MCP dá uma experiência notavelmente mais natural do que o preço sugeriria. É um dos usos onde mais valor obtive e o menos falado.
Minha experiência real: três meses, fluxo concreto
Minha maneira de trabalhar é esta e acho que explica por que funciona tão bem para mim:
Defino as specs com outro modelo. Uso Grok, GPT ou Claude para a parte de pensar o problema: arquitetura, tradeoffs, critérios de aceitação, quais arquivos tocar. Essa conversação é exploratória, iterativa, e lá eu quero o melhor raciocínio disponível independentemente do custo, porque são poucos tokens.
Executo as specs com GLM. Uma vez a spec escrita e inequívoca, GLM-5.3 implementa. E isso é importante: executar uma spec bem definida é um problema diferente de projetá-la. Requer seguir instruções, manter contexto, não inventar, usar ferramentas corretamente. GLM é muito bom nisso, e é aí que o preço para de fazer sentido a seu favor.
Vamos ser claros, créditos não são suficientes para codar o dia todo no Lite. Se seu trabalho é oito horas de agente cuspir código, você vai bater no limite de 5 horas. Mas para meu padrão —explosões de execução intercaladas com revisão humana— sobra. E o desconto de 50% fora de horário de pico dobra minha margem efetiva.
O app e o chat também contam. Fora do IDE uso o app da Z.ai para tarefas que não exigem raciocínio profundo: revisar um tema, resumir documentação, verificar algo rápido, processos repetitivos. Comparado a abrir um Sonnet para isso, é significativamente mais eficiente em custo e bom o suficiente. Não é onde está a mágica, mas é onde estão os economizados acumulados.
A verdade honesta: para quem NÃO é isso
Se algo tenho claro após três meses é que esta não é uma ferramenta de entrada.
NÃO é para você se:
- Você está aprendendo a programar e precisa que o modelo te guie passo a passo, corrija suas suposições e explique por que algo está errado. GLM executa muito bem; não vai te salvar de uma spec mal pensada. Se der instruções vagas, ele retorna trabalho vago com muita confiança.
- Você quer uma experiência "tudo em um" sem configurar nada. Aqui você precisa entender base URLs, protocolos, limites de cota, multiplicadores e horários. Não é difícil, mas é atrito real.
- Você precisa do teto absoluto de capacidade. No próprio benchmark da Z.ai, GLM-5.3 atinge 34,5% onde Claude Fable 5 chega a 39,5%. A lacuna existe e é sentida em tarefas de fronteira.
- Você precisa de garantia de reembolso. Não tem. Ponto.
É para você se: você já sabe como definir um problema, já tem critério para revisar o que um agente produz, e seu gargalo é o custo de executar muito, não a qualidade do raciocínio na fronteira.
Outras duas coisas que você deve considerar antes de pagar: Z.ai é uma empresa chinesa (Zhipu AI) e seus prompts passam por sua infraestrutura — se você lida com código sob NDA estrito ou dados regulados, revise com quem é responsável. E os planos estão atados a ferramentas suportadas: se seu stack usa algo que não está naquela lista, a assinatura não serve para você e você teria que ir por API paga por token.
O código de convite: o que cada um ganha, sem firulas
Como vou compartilhar, prefiro explicar exatamente como o programa funciona em vez de só jogar o link.
O que você ganha (convidado):
- 10% de desconto instantâneo sobre o valor da sua primeira assinatura do GLM Coding Plan. É aplicado automaticamente no checkout, sem escrever nenhum código.
- Aplica apenas se você for novo usuário ou nunca pagou uma assinatura na plataforma.
- Aplica apenas à primeira ordem. Renovações, upgrades e downgrades não.
- Não se acumula com outras campanhas de desconto de primeira compra.
- Você deve completar o pagamento dentro de 72 horas de se registrar com o link.
O que eu ganho (convidador):
- Créditos de plataforma equivalentes a 10% do valor que você efetivamente pagou. Não é dinheiro: são créditos que só servem para pagar assinaturas, pacotes ou chamadas de API dentro da Z.ai. Não saem nem transferem.
- E há um limiar: eu não cobro nada até acumular 3 convidados válidos. Antes disso, créditos ficam em estado pendente.
Conto isso em detalhe porque o incentivo muda como você deve ler uma resenha, e prefiro que você saiba e decida por si mesmo.
👉 Link com 10% de desconto (código: V2TH8OSBEF)
Antes de usar: o plano Lite mensal é ~$18 com o desconto aplicado. Teste por um mês com seu fluxo real. Se após 30 dias você não bateu no limite de 5 horas e o modelo fez o que você precisava, então sim, avalie o anual com 30% off. Não ao contrário.
Veredito
Z.ai não é "o Claude barato". É uma ferramenta com perfil diferente: excelente executando trabalho bem definido, a um preço que muda a equação de quanto você pode automatizar. Se seu fluxo separa pensar de fazer —definir specs com um modelo, executá-los com outro— encaixa quase perfeitamente. Se você espera que um único modelo faça tudo, vai se frustrar.
Após três meses minha conclusão é simples: sinto que ele me dá mais do que eu pago. Mas essa frase só se aplica se você já sabe o que pedir.
Fontes
- Z.AI Developer Docs — GLM Coding Plan Overview
- Z.AI Developer Docs — Pricing
- Z.AI Developer Docs — GLM-5.3
- Z.AI Developer Docs — Tool Integration
- Z.AI Developer Docs — GLM Coding Plan FAQ
- Z.AI Developer Docs — Regras do programa de convite
- TechNode — Z.ai launches GLM-5.3 with claimed 50% gain on coding benchmark
- VentureBeat — GLM-5.3 is here with advanced cyber capabilities
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model
- AI Pricing Guru — GLM Coding Plan Pricing
Divulgação: este artigo contém um link de convite. Eu recebo créditos de plataforma se você se inscrever através dele. Dados técnicos e de preços vêm da documentação oficial da Z.ai e foram verificados em agosto de 2026; verifique valores atuais antes de pagar.
Posts Relacionados
Continue explorando conteúdo similar que pode te interessar

A Minha Jornada Aprendendo Python: Conselhos e Recursos
Uma crónica pessoal sobre o processo de aprender Python do zero, os recursos que me ajudaram e as dificuldades que encontrei.
OpenCode Go: preço, limites de uso e se vale a pena em 2026
Analisamos a fundo o OpenCode Go: quanto custa, quais modelos inclui, como funcionam realmente seus limites de uso e em quais casos vale a pena pagar por ele. Inclui como conseguir $5 de crédito para seus limites.
Por que em 2026 você não deveria mais depender de um único provedor de IA para programar
Se você fica sem cota de IA no meio do mês, o problema não é disciplina: é que colocou todos os ovos na mesma cesta. Aprenda a diversificar entre DeepSeek, Qwen, GLM, Kimi, Claude e GPT para programar mais barato e sem interrupções.