
Z.ai e modelos GLM: 3 meses de uso diário e preços reais
Publicado em:
Tempo de leitura: 13 min
Tema: Tecnologia
Autor: Leandro Valencia
Análise detalhada de 3 meses usando Z.ai/GLM para desenvolvimento real. Preços reais, casos de uso práticos e honestidade sobre quem realmente funciona.
Índice
- A tabela que você veio ver: planos do GLM Coding Plan
- O que quase ninguém explica para você: como os créditos são consumidos
- As ferramentas: onde você pode realmente usar isso
- Casos de uso: qual modelo para qual tarefa
- Minha experiência real: três meses, fluxo concreto
- A verdade honesta: para quem NÃO é isso
- O código de convite: o que cada um ganha, sem firulas
Última atualização: agosto de 2026
Estou executando trabalho real com há três meses. Não um teste de fim de semana: especificações de produto, refators, automações, chatbots. Nesse tempo, passei por GLM-4.7, GLM-5.2 e agora GLM-5.3, e tenho uma opinião bastante formada: ele me dá mais do que eu pago, mas não é uma ferramenta para qualquer um.
Este post é o que eu gostaria de ter lido antes de me inscrever. Começa com as tabelas —planos, modelos, preços— porque sei que é isso que você quer ver primeiro. Depois vem a parte honesta: o que ele faz bem, o que não faz, e em que ponto da sua curva de experiência faz sentido.
Aviso de transparência: abaixo compartilho meu link de convite. Você recebe 10% de desconto na sua primeira assinatura e eu recebo créditos de plataforma. Dito desde o início para que você leia o resto com essa informação sobre a mesa. Se o post não te convencer, não use.
A tabela que você veio ver: planos do GLM Coding Plan
Este é o coração da oferta da Z.ai para desenvolvedores. Todos os planos dão acesso aos mesmos modelos —não há tiers com modelos limitados—, o que muda é quanto cota você tem.
| Lite | Pro | Max | |
|---|---|---|---|
| Preço base mensal | ~$18 USD | ~$72–80 USD | ~$160–168 USD |
| Créditos a cada 5 horas | 2.000 | 12.000 | 28.000 |
| Créditos semanais | 10.000 | 60.000 | 140.000 |
| Tokens estimados/semana (GLM-5.3, cache ~95%) | 48–97 milhões | 290–580 milhões | 676–1.352 milhões |
| Modelos incluídos | GLM-5.3, GLM-5-Turbo, GLM-4.7 | Mesmos | Mesmos |
| MCPs incluídos | Vision, Web Search, Web Reader, Zread | Mesmos | Mesmos |
| Desconto por ciclo | 20% trimestral / 30% anual | Igual | Igual |
Com o desconto anual, Lite cai para ~$12,60/mês. Esse é o número que faz a comparação com qualquer outra assinatura de coding ficar desconfortável para a concorrência.
Duas advertências sobre preços: os valores de Pro e Max variaram entre fontes e promoções ($72 vs $80, $160 vs $168), então verifique o número exato na página antes de pagar. E as assinaturas não são reembolsáveis uma vez compradas — comece com Lite mensal, não Max anual.
👉 Inscreva-se com 10% de desconto aqui — o desconto só se aplica ao seu primeiro pagamento e apenas se você nunca teve uma assinatura paga na plataforma.
Tabela de modelos: capacidades e preços de API
Se você prefere pagar por token em vez de assinar, este é o catálogo. Preços por milhão de tokens (USD):
Modelos de texto
| Modelo | Input | Input cacheado | Output | Para que serve |
|---|---|---|---|---|
| GLM-5.3 | $1,40 | $0,26 | $4,40 | Premium. Coding complexo, tarefas agênticas longas, segurança. Contexto 1M, output até 128K |
| GLM-5.2 | $1,40 | $0,26 | $4,40 | Geração anterior, mesma base que 5.3 |
| GLM-5-Turbo | $1,20 | $0,24 | $4,00 | Rápido. Ideal para automações e respostas de baixa latência |
| GLM-4.7 | $0,60 | $0,11 | $2,20 | Cavalo de batalha barato. Tarefas de código médio |
| GLM-4.7-FlashX | $0,07 | $0,01 | $0,40 | Alto volume: classificação, extração, roteamento |
| GLM-4.5-Air | $0,20 | $0,03 | $1,10 | Leve, muito barato |
| GLM-4.7-Flash | Grátis | Grátis | Grátis | Protótipos e testes sem custo |
Modelos de visão, imagem, áudio e vídeo
| Modelo | Preço | Para que serve |
|---|---|---|
| GLM-5V-Turbo | $1,20 / $4,00 por MTok | Visão de alto nível: análise de UI, vídeo, gráficos |
| GLM-4.6V | $0,30 / $0,90 por MTok | Visão padrão, boa relação custo-benefício |
| GLM-OCR | $0,03 por MTok | Extração de texto de documentos escaneados |
| GLM-4.6V-Flash | Grátis | Visão básica sem custo |
| GLM-Image | $0,015 por imagem | Geração de imagens |
| CogVideoX-3 | $0,20 por vídeo | Geração de vídeo |
| Vidu Q1 / Vidu 2 | $0,20–0,40 por vídeo | Vídeo a partir de texto, imagem ou referência |
| GLM-ASR-2512 | ~$0,0024 por minuto | Transcrição de áudio |
| Agente Slide/Poster | $0,70 por MTok | Apresentações e pôsteres automatizados |
O dado mais importante desta tabela: o input cacheado custa um quinto do input normal. Em um fluxo agêntico onde você reenvia o mesmo contexto de projeto uma e outra vez, essa diferença é que decide se o mês sai caro ou barato para você.
O que quase ninguém explica para você: como os créditos são consumidos
É aqui que as pessoas se frustram e cancelam. O plano não funciona por "número de prompts". Funciona com dois limites simultâneos e multiplicadores por modelo.
Os dois limites:
- Limite de 5 horas. Atualiza dinamicamente: cada consumo é devolvido a você 5 horas depois.
- Limite semanal. Começa quando você paga e reinicia a cada 7 dias.
A fórmula: créditos = (tokens_input × mult_input + tokens_cacheados × mult_cache + tokens_output × mult_output) / 10.000
Os multiplicadores:
| Modelo | Input | Input cacheado | Output |
|---|---|---|---|
| GLM-5.3 | 6,9 | 1,7 | 24 |
| GLM-5-Turbo | 5,7 | 1,5 | 21 |
| GLM-4.7 | 4,6 | 1,2 | 16 |
| GLM-4.6V (Vision MCP) | 1,2 | 0,3 | 2,7 |
| Web Search / Web Reader / Zread | — | — | 1,2 por chamada |
Três consequências práticas que aprendi na marra:
- O output é o que caro. Multiplicador 24 contra 6,9 do input no GLM-5.3. Um modelo que "pensa em voz alta" por 40 mil tokens come o seu dia. Por isso
reasoning_effort: lowexiste e por isso eu uso mais do que esperava. - O cache é o seu orçamento. A diferença entre 90,9% e 98% de acerto de cache é a diferença entre 43 e 105 milhões de tokens por semana no Lite. Sessões longas e coerentes rendem; abrir novo contexto a cada 10 minutos te arruína.
- Fora de horário de pico você paga metade. Horário de pico é segunda a sexta, 14:00–18:00 horário de Singapura (UTC+8). Tudo o mais —incluindo o final de semana completo— custa 50% dos créditos. Se você trabalha das Américas, boa parte do seu dia cai em horário barato. É provavelmente a vantagem de preço menos divulgada do plano.
As ferramentas: onde você pode realmente usar isso
O plano está estritamente limitado a ferramentas suportadas oficialmente. Não é uma API aberta que você conecta onde quiser; se usar fora da lista, dará erro de saldo insuficiente.
Agentes de código suportados: ZCode (ambiente próprio da Z.ai), Claude Code, Claude for IDE, Codex, Cursor, Cline, OpenCode, Roo Code, Kilo Code, Crush, Goose, Droid, TRAE, Qoder, Pi e Eigent.
Agentes de propósito geral: OpenClaw, Hermes Agent e SillyTavern, servidos com "melhor esforço" — sob carga alta podem aplicar limites temporários.
A configuração é mudar o base URL:
| Protocolo | Base URL |
|---|---|
| Anthropic Messages (Claude Code, Goose) | https://api.z.ai/api/anthropic |
| OpenAI Chat Completions (o resto) | https://api.z.ai/api/coding/paas/v4 |
| OpenAI Responses | https://api.z.ai/api/v1 |
E os quatro MCPs incluídos sem custo extra além dos créditos: Vision Understanding (ler capturas, diagramas, mockups), Web Search, Web Reader (extrair conteúdo de URLs) e Zread (ler repositórios do GitHub). Este último é mais útil do que parece quando você está integrando uma biblioteca que não conhece.
Casos de uso: qual modelo para qual tarefa
Esta é a parte que separa quem aproveita a assinatura de quem desperdiça.
GLM-5.3 → trabalho pesado e longo. Refactors que tocam quinze arquivos, migrações, depuração de algo que você está perseguindo há horas, implementação completa de uma spec. É aqui que o salto nesta versão se nota: em seu benchmark interno passou de 23,4% para 34,5% de tarefas completadas contra GLM-5.2, e consumindo menos tokens de output. No Terminal-Bench 3.0 saltou de 4,6 para 28,3. Use com reasoning_effort: max e não use para nada trivial.
GLM-5-Turbo → automações e latência. Tudo que roda em um cron, webhook ou pipeline. Aqui você não precisa de raciocínio profundo, precisa de respostas consistentes e rápidas. É também minha opção padrão para chatbots onde o usuário está esperando.
GLM-4.7 → o dia a dia. Escrever um endpoint, ajustar um teste, explicar um arquivo que eu não escrevi para você, gerar um script de migração. Multiplicador 16 no output contra 24 do GLM-5.3: ele rende muito mais e para 60% das tarefas a diferença de qualidade não é perceptível.
GLM-4.7-FlashX / GLM-4.5-Air → volume. Classificar tickets, extrair campos de texto, fazer roteamento entre agentes, resumir. A $0,07 de input por milhão, FlashX é praticamente grátis para processar lotes.
GLM-4.6V / GLM-5V-Turbo → visão. Passar uma captura de bug de UI, um diagrama de arquitetura em foto, uma tabela em PDF. O Vision MCP integrado no plano torna especialmente confortável dentro do fluxo de coding.
Uma nota sobre chatbots: se você está construindo interação conversacional com usuários reais, a combinação GLM-5-Turbo + Web Search MCP dá uma experiência notavelmente mais natural do que o preço sugeriria. É um dos usos onde mais valor obtive e o menos falado.
Minha experiência real: três meses, fluxo concreto
Minha maneira de trabalhar é esta e acho que explica por que funciona tão bem para mim:
Defino as specs com outro modelo. Uso Grok, GPT ou Claude para a parte de pensar o problema: arquitetura, tradeoffs, critérios de aceitação, quais arquivos tocar. Essa conversação é exploratória, iterativa, e lá eu quero o melhor raciocínio disponível independentemente do custo, porque são poucos tokens.
Executo as specs com GLM. Uma vez a spec escrita e inequívoca, GLM-5.3 implementa. E isso é importante: executar uma spec bem definida é um problema diferente de projetá-la. Requer seguir instruções, manter contexto, não inventar, usar ferramentas corretamente. GLM é muito bom nisso, e é aí que o preço para de fazer sentido a seu favor.
Vamos ser claros, créditos não são suficientes para codar o dia todo no Lite. Se seu trabalho é oito horas de agente cuspir código, você vai bater no limite de 5 horas. Mas para meu padrão —explosões de execução intercaladas com revisão humana— sobra. E o desconto de 50% fora de horário de pico dobra minha margem efetiva.
O app e o chat também contam. Fora do IDE uso o app da Z.ai para tarefas que não exigem raciocínio profundo: revisar um tema, resumir documentação, verificar algo rápido, processos repetitivos. Comparado a abrir um Sonnet para isso, é significativamente mais eficiente em custo e bom o suficiente. Não é onde está a mágica, mas é onde estão os economizados acumulados.
A verdade honesta: para quem NÃO é isso
Se algo tenho claro após três meses é que esta não é uma ferramenta de entrada.
NÃO é para você se:
- Você está aprendendo a programar e precisa que o modelo te guie passo a passo, corrija suas suposições e explique por que algo está errado. GLM executa muito bem; não vai te salvar de uma spec mal pensada. Se der instruções vagas, ele retorna trabalho vago com muita confiança.
- Você quer uma experiência "tudo em um" sem configurar nada. Aqui você precisa entender base URLs, protocolos, limites de cota, multiplicadores e horários. Não é difícil, mas é atrito real.
- Você precisa do teto absoluto de capacidade. No próprio benchmark da Z.ai, GLM-5.3 atinge 34,5% onde Claude Fable 5 chega a 39,5%. A lacuna existe e é sentida em tarefas de fronteira.
- Você precisa de garantia de reembolso. Não tem. Ponto.
É para você se: você já sabe como definir um problema, já tem critério para revisar o que um agente produz, e seu gargalo é o custo de executar muito, não a qualidade do raciocínio na fronteira.
Outras duas coisas que você deve considerar antes de pagar: Z.ai é uma empresa chinesa (Zhipu AI) e seus prompts passam por sua infraestrutura — se você lida com código sob NDA estrito ou dados regulados, revise com quem é responsável. E os planos estão atados a ferramentas suportadas: se seu stack usa algo que não está naquela lista, a assinatura não serve para você e você teria que ir por API paga por token.
O código de convite: o que cada um ganha, sem firulas
Como vou compartilhar, prefiro explicar exatamente como o programa funciona em vez de só jogar o link.
O que você ganha (convidado):
- 10% de desconto instantâneo sobre o valor da sua primeira assinatura do GLM Coding Plan. É aplicado automaticamente no checkout, sem escrever nenhum código.
- Aplica apenas se você for novo usuário ou nunca pagou uma assinatura na plataforma.
- Aplica apenas à primeira ordem. Renovações, upgrades e downgrades não.
- Não se acumula com outras campanhas de desconto de primeira compra.
- Você deve completar o pagamento dentro de 72 horas de se registrar com o link.
O que eu ganho (convidador):
- Créditos de plataforma equivalentes a 10% do valor que você efetivamente pagou. Não é dinheiro: são créditos que só servem para pagar assinaturas, pacotes ou chamadas de API dentro da Z.ai. Não saem nem transferem.
- E há um limiar: eu não cobro nada até acumular 3 convidados válidos. Antes disso, créditos ficam em estado pendente.
Conto isso em detalhe porque o incentivo muda como você deve ler uma resenha, e prefiro que você saiba e decida por si mesmo.
👉 Link com 10% de desconto (código: V2TH8OSBEF)
Antes de usar: o plano Lite mensal é ~$18 com o desconto aplicado. Teste por um mês com seu fluxo real. Se após 30 dias você não bateu no limite de 5 horas e o modelo fez o que você precisava, então sim, avalie o anual com 30% off. Não ao contrário.
Veredito
Z.ai não é "o Claude barato". É uma ferramenta com perfil diferente: excelente executando trabalho bem definido, a um preço que muda a equação de quanto você pode automatizar. Se seu fluxo separa pensar de fazer —definir specs com um modelo, executá-los com outro— encaixa quase perfeitamente. Se você espera que um único modelo faça tudo, vai se frustrar.
Após três meses minha conclusão é simples: sinto que ele me dá mais do que eu pago. Mas essa frase só se aplica se você já sabe o que pedir.
Fontes
- Z.AI Developer Docs — GLM Coding Plan Overview
- Z.AI Developer Docs — Pricing
- Z.AI Developer Docs — GLM-5.3
- Z.AI Developer Docs — Tool Integration
- Z.AI Developer Docs — GLM Coding Plan FAQ
- Z.AI Developer Docs — Regras do programa de convite
- TechNode — Z.ai launches GLM-5.3 with claimed 50% gain on coding benchmark
- VentureBeat — GLM-5.3 is here with advanced cyber capabilities
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model
- AI Pricing Guru — GLM Coding Plan Pricing
Divulgação: este artigo contém um link de convite. Eu recebo créditos de plataforma se você se inscrever através dele. Dados técnicos e de preços vêm da documentação oficial da Z.ai e foram verificados em agosto de 2026; verifique valores atuais antes de pagar.
Posts Relacionados
Continue explorando conteúdo similar que pode te interessar

Como usar Z.ai (GLM): registro, plano e primeiro prompt
Guia para se registrar na Z.ai, ativar o GLM Coding Plan, criar sua API key e conectar Claude Code, Cline ou OpenCode. Onboarding, não uma análise de preços.

A Minha Jornada Aprendendo Python: Conselhos e Recursos
Uma crónica pessoal sobre o processo de aprender Python do zero, os recursos que me ajudaram e as dificuldades que encontrei.

Z.ai e seus modelos GLM: qual é qual e quando usar cada um
Catálogo prático dos modelos da Z.ai —GLM-5.3, Flash, 4.6V, OCR, GLM-Image, CogVideoX e o Coding Plan—: o que cada um faz, quanto custa e como escolher o certo para cada tarefa.
Alianças
Ferramentas que uso todos os dias, com melhores condições para a comunidade.