Imagem em destaque para Z.ai e modelos GLM: 3 meses de uso diário, preços reais e para quem serve (e para quem não serve)

Z.ai e modelos GLM: 3 meses de uso diário, preços reais e para quem serve (e para quem não serve)

Publicado em:

Tempo de leitura: 13 min

Tema: Tecnologia

Autor: Leandro Valencia

#zai#glm#inteligencia-artificial#desenvolvimento#tecnologia#codigo

Análise detalhada de 3 meses usando Z.ai/GLM para desenvolvimento real. Preços reais, casos de uso práticos e honestidade sobre quem realmente funciona.

Índice

A tabela que você veio ver: planos do GLM Coding Plan

Este é o coração da oferta da Z.ai para desenvolvedores. Todos os planos dão acesso aos mesmos modelos —não há tiers com modelos limitados—, o que muda é quanto cota você tem.

Lite Pro Max
Preço base mensal ~$18 USD ~$72–80 USD ~$160–168 USD
Créditos a cada 5 horas 2.000 12.000 28.000
Créditos semanais 10.000 60.000 140.000
Tokens estimados/semana (GLM-5.3, cache ~95%) 48–97 milhões 290–580 milhões 676–1.352 milhões
Modelos incluídos GLM-5.3, GLM-5-Turbo, GLM-4.7 Mesmos Mesmos
MCPs incluídos Vision, Web Search, Web Reader, Zread Mesmos Mesmos
Desconto por ciclo 20% trimestral / 30% anual Igual Igual

Com o desconto anual, Lite cai para ~$12,60/mês. Esse é o número que faz a comparação com qualquer outra assinatura de coding ficar desconfortável para a concorrência.

Duas advertências sobre preços: os valores de Pro e Max variaram entre fontes e promoções ($72 vs $80, $160 vs $168), então verifique o número exato na página antes de pagar. E as assinaturas não são reembolsáveis uma vez compradas — comece com Lite mensal, não Max anual.

👉 Inscreva-se com 10% de desconto aqui — o desconto só se aplica ao seu primeiro pagamento e apenas se você nunca teve uma assinatura paga na plataforma.


Tabela de modelos: capacidades e preços de API

Se você prefere pagar por token em vez de assinar, este é o catálogo. Preços por milhão de tokens (USD):

Modelos de texto

Modelo Input Input cacheado Output Para que serve
GLM-5.3 $1,40 $0,26 $4,40 Premium. Coding complexo, tarefas agênticas longas, segurança. Contexto 1M, output até 128K
GLM-5.2 $1,40 $0,26 $4,40 Geração anterior, mesma base que 5.3
GLM-5-Turbo $1,20 $0,24 $4,00 Rápido. Ideal para automações e respostas de baixa latência
GLM-4.7 $0,60 $0,11 $2,20 Cavalo de batalha barato. Tarefas de código médio
GLM-4.7-FlashX $0,07 $0,01 $0,40 Alto volume: classificação, extração, roteamento
GLM-4.5-Air $0,20 $0,03 $1,10 Leve, muito barato
GLM-4.7-Flash Grátis Grátis Grátis Protótipos e testes sem custo

Modelos de visão, imagem, áudio e vídeo

Modelo Preço Para que serve
GLM-5V-Turbo $1,20 / $4,00 por MTok Visão de alto nível: análise de UI, vídeo, gráficos
GLM-4.6V $0,30 / $0,90 por MTok Visão padrão, boa relação custo-benefício
GLM-OCR $0,03 por MTok Extração de texto de documentos escaneados
GLM-4.6V-Flash Grátis Visão básica sem custo
GLM-Image $0,015 por imagem Geração de imagens
CogVideoX-3 $0,20 por vídeo Geração de vídeo
Vidu Q1 / Vidu 2 $0,20–0,40 por vídeo Vídeo a partir de texto, imagem ou referência
GLM-ASR-2512 ~$0,0024 por minuto Transcrição de áudio
Agente Slide/Poster $0,70 por MTok Apresentações e pôsteres automatizados

O dado mais importante desta tabela: o input cacheado custa um quinto do input normal. Em um fluxo agêntico onde você reenvia o mesmo contexto de projeto uma e outra vez, essa diferença é que decide se o mês sai caro ou barato para você.


O que quase ninguém explica para você: como os créditos são consumidos

É aqui que as pessoas se frustram e cancelam. O plano não funciona por "número de prompts". Funciona com dois limites simultâneos e multiplicadores por modelo.

Os dois limites:

  • Limite de 5 horas. Atualiza dinamicamente: cada consumo é devolvido a você 5 horas depois.
  • Limite semanal. Começa quando você paga e reinicia a cada 7 dias.

A fórmula: créditos = (tokens_input × mult_input + tokens_cacheados × mult_cache + tokens_output × mult_output) / 10.000

Os multiplicadores:

Modelo Input Input cacheado Output
GLM-5.3 6,9 1,7 24
GLM-5-Turbo 5,7 1,5 21
GLM-4.7 4,6 1,2 16
GLM-4.6V (Vision MCP) 1,2 0,3 2,7
Web Search / Web Reader / Zread 1,2 por chamada

Três consequências práticas que aprendi na marra:

  1. O output é o que caro. Multiplicador 24 contra 6,9 do input no GLM-5.3. Um modelo que "pensa em voz alta" por 40 mil tokens come o seu dia. Por isso reasoning_effort: low existe e por isso eu uso mais do que esperava.
  2. O cache é o seu orçamento. A diferença entre 90,9% e 98% de acerto de cache é a diferença entre 43 e 105 milhões de tokens por semana no Lite. Sessões longas e coerentes rendem; abrir novo contexto a cada 10 minutos te arruína.
  3. Fora de horário de pico você paga metade. Horário de pico é segunda a sexta, 14:00–18:00 horário de Singapura (UTC+8). Tudo o mais —incluindo o final de semana completo— custa 50% dos créditos. Se você trabalha das Américas, boa parte do seu dia cai em horário barato. É provavelmente a vantagem de preço menos divulgada do plano.

As ferramentas: onde você pode realmente usar isso

O plano está estritamente limitado a ferramentas suportadas oficialmente. Não é uma API aberta que você conecta onde quiser; se usar fora da lista, dará erro de saldo insuficiente.

Agentes de código suportados: ZCode (ambiente próprio da Z.ai), Claude Code, Claude for IDE, Codex, Cursor, Cline, OpenCode, Roo Code, Kilo Code, Crush, Goose, Droid, TRAE, Qoder, Pi e Eigent.

Agentes de propósito geral: OpenClaw, Hermes Agent e SillyTavern, servidos com "melhor esforço" — sob carga alta podem aplicar limites temporários.

A configuração é mudar o base URL:

Protocolo Base URL
Anthropic Messages (Claude Code, Goose) https://api.z.ai/api/anthropic
OpenAI Chat Completions (o resto) https://api.z.ai/api/coding/paas/v4
OpenAI Responses https://api.z.ai/api/v1

E os quatro MCPs incluídos sem custo extra além dos créditos: Vision Understanding (ler capturas, diagramas, mockups), Web Search, Web Reader (extrair conteúdo de URLs) e Zread (ler repositórios do GitHub). Este último é mais útil do que parece quando você está integrando uma biblioteca que não conhece.


Casos de uso: qual modelo para qual tarefa

Esta é a parte que separa quem aproveita a assinatura de quem desperdiça.

GLM-5.3 → trabalho pesado e longo. Refactors que tocam quinze arquivos, migrações, depuração de algo que você está perseguindo há horas, implementação completa de uma spec. É aqui que o salto nesta versão se nota: em seu benchmark interno passou de 23,4% para 34,5% de tarefas completadas contra GLM-5.2, e consumindo menos tokens de output. No Terminal-Bench 3.0 saltou de 4,6 para 28,3. Use com reasoning_effort: max e não use para nada trivial.

GLM-5-Turbo → automações e latência. Tudo que roda em um cron, webhook ou pipeline. Aqui você não precisa de raciocínio profundo, precisa de respostas consistentes e rápidas. É também minha opção padrão para chatbots onde o usuário está esperando.

GLM-4.7 → o dia a dia. Escrever um endpoint, ajustar um teste, explicar um arquivo que eu não escrevi para você, gerar um script de migração. Multiplicador 16 no output contra 24 do GLM-5.3: ele rende muito mais e para 60% das tarefas a diferença de qualidade não é perceptível.

GLM-4.7-FlashX / GLM-4.5-Air → volume. Classificar tickets, extrair campos de texto, fazer roteamento entre agentes, resumir. A $0,07 de input por milhão, FlashX é praticamente grátis para processar lotes.

GLM-4.6V / GLM-5V-Turbo → visão. Passar uma captura de bug de UI, um diagrama de arquitetura em foto, uma tabela em PDF. O Vision MCP integrado no plano torna especialmente confortável dentro do fluxo de coding.

Uma nota sobre chatbots: se você está construindo interação conversacional com usuários reais, a combinação GLM-5-Turbo + Web Search MCP dá uma experiência notavelmente mais natural do que o preço sugeriria. É um dos usos onde mais valor obtive e o menos falado.


Minha experiência real: três meses, fluxo concreto

Minha maneira de trabalhar é esta e acho que explica por que funciona tão bem para mim:

Defino as specs com outro modelo. Uso Grok, GPT ou Claude para a parte de pensar o problema: arquitetura, tradeoffs, critérios de aceitação, quais arquivos tocar. Essa conversação é exploratória, iterativa, e lá eu quero o melhor raciocínio disponível independentemente do custo, porque são poucos tokens.

Executo as specs com GLM. Uma vez a spec escrita e inequívoca, GLM-5.3 implementa. E isso é importante: executar uma spec bem definida é um problema diferente de projetá-la. Requer seguir instruções, manter contexto, não inventar, usar ferramentas corretamente. GLM é muito bom nisso, e é aí que o preço para de fazer sentido a seu favor.

Vamos ser claros, créditos não são suficientes para codar o dia todo no Lite. Se seu trabalho é oito horas de agente cuspir código, você vai bater no limite de 5 horas. Mas para meu padrão —explosões de execução intercaladas com revisão humana— sobra. E o desconto de 50% fora de horário de pico dobra minha margem efetiva.

O app e o chat também contam. Fora do IDE uso o app da Z.ai para tarefas que não exigem raciocínio profundo: revisar um tema, resumir documentação, verificar algo rápido, processos repetitivos. Comparado a abrir um Sonnet para isso, é significativamente mais eficiente em custo e bom o suficiente. Não é onde está a mágica, mas é onde estão os economizados acumulados.


A verdade honesta: para quem NÃO é isso

Se algo tenho claro após três meses é que esta não é uma ferramenta de entrada.

NÃO é para você se:

  • Você está aprendendo a programar e precisa que o modelo te guie passo a passo, corrija suas suposições e explique por que algo está errado. GLM executa muito bem; não vai te salvar de uma spec mal pensada. Se der instruções vagas, ele retorna trabalho vago com muita confiança.
  • Você quer uma experiência "tudo em um" sem configurar nada. Aqui você precisa entender base URLs, protocolos, limites de cota, multiplicadores e horários. Não é difícil, mas é atrito real.
  • Você precisa do teto absoluto de capacidade. No próprio benchmark da Z.ai, GLM-5.3 atinge 34,5% onde Claude Fable 5 chega a 39,5%. A lacuna existe e é sentida em tarefas de fronteira.
  • Você precisa de garantia de reembolso. Não tem. Ponto.

É para você se: você já sabe como definir um problema, já tem critério para revisar o que um agente produz, e seu gargalo é o custo de executar muito, não a qualidade do raciocínio na fronteira.

Outras duas coisas que você deve considerar antes de pagar: Z.ai é uma empresa chinesa (Zhipu AI) e seus prompts passam por sua infraestrutura — se você lida com código sob NDA estrito ou dados regulados, revise com quem é responsável. E os planos estão atados a ferramentas suportadas: se seu stack usa algo que não está naquela lista, a assinatura não serve para você e você teria que ir por API paga por token.


O código de convite: o que cada um ganha, sem firulas

Como vou compartilhar, prefiro explicar exatamente como o programa funciona em vez de só jogar o link.

O que você ganha (convidado):

  • 10% de desconto instantâneo sobre o valor da sua primeira assinatura do GLM Coding Plan. É aplicado automaticamente no checkout, sem escrever nenhum código.
  • Aplica apenas se você for novo usuário ou nunca pagou uma assinatura na plataforma.
  • Aplica apenas à primeira ordem. Renovações, upgrades e downgrades não.
  • Não se acumula com outras campanhas de desconto de primeira compra.
  • Você deve completar o pagamento dentro de 72 horas de se registrar com o link.

O que eu ganho (convidador):

  • Créditos de plataforma equivalentes a 10% do valor que você efetivamente pagou. Não é dinheiro: são créditos que só servem para pagar assinaturas, pacotes ou chamadas de API dentro da Z.ai. Não saem nem transferem.
  • E há um limiar: eu não cobro nada até acumular 3 convidados válidos. Antes disso, créditos ficam em estado pendente.

Conto isso em detalhe porque o incentivo muda como você deve ler uma resenha, e prefiro que você saiba e decida por si mesmo.

👉 Link com 10% de desconto (código: V2TH8OSBEF)

Antes de usar: o plano Lite mensal é ~$18 com o desconto aplicado. Teste por um mês com seu fluxo real. Se após 30 dias você não bateu no limite de 5 horas e o modelo fez o que você precisava, então sim, avalie o anual com 30% off. Não ao contrário.


Veredito

Z.ai não é "o Claude barato". É uma ferramenta com perfil diferente: excelente executando trabalho bem definido, a um preço que muda a equação de quanto você pode automatizar. Se seu fluxo separa pensar de fazer —definir specs com um modelo, executá-los com outro— encaixa quase perfeitamente. Se você espera que um único modelo faça tudo, vai se frustrar.

Após três meses minha conclusão é simples: sinto que ele me dá mais do que eu pago. Mas essa frase só se aplica se você já sabe o que pedir.


Fontes

Divulgação: este artigo contém um link de convite. Eu recebo créditos de plataforma se você se inscrever através dele. Dados técnicos e de preços vêm da documentação oficial da Z.ai e foram verificados em agosto de 2026; verifique valores atuais antes de pagar.

Posts Relacionados

Continue explorando conteúdo similar que pode te interessar

Z.ai e modelos GLM: 3 meses de uso diário, preços reais e para quem serve (e para quem não serve)