Imagem em destaque para Z.ai e seus modelos GLM: qual é qual e quando usar cada um

Z.ai e seus modelos GLM: qual é qual e quando usar cada um

Publicado em:

Tempo de leitura: 10 min

Tema: Tecnologia

Autor: Leandro Valencia

#z.ai#glm#glm-5.3#glm coding plan#modelos de ia#ia para programar#api de ia#inteligência artificial#glm-4.6v#cogvideox

Catálogo prático dos modelos da Z.ai —GLM-5.3, Flash, 4.6V, OCR, GLM-Image, CogVideoX e o Coding Plan—: o que cada um faz, quanto custa e como escolher o certo para cada tarefa.

Índice

O mapa em 30 segundos

Modelo Tipo Para que serve Preço na API
GLM-5.3 Texto O flagship: código difícil, agentes, tarefas longas $1.40 / $4.40
GLM-5.3-Flash Texto + imagem Volume: chat, extração, classificação $0.15 / $0.50
GLM-5.2 Texto Alternativa MIT com contexto de 1M sem degradação $1.40 / $4.40
GLM-4.7 / 4.6 Texto A geração anterior, ainda sólida para tudo $0.60 / $2.20
GLM-4.7-Flash Texto Grátis na API: rascunhos e side projects $0
GLM-4.6V Visão Screenshots, documentos, UIs, tool use nativo $0.30 / $0.90
GLM-4.6V-Flash Visão A mesma ideia, grátis $0
GLM-OCR OCR Escaneamentos e PDFs em texto limpo $0.03 / $0.03
GLM-Image Imagem Geração com texto legível dentro da imagem ~$0.015 por imagem
CogVideoX-3 Vídeo Clips curtos ~$0.20 por vídeo
GLM-ASR-2512 Voz Transcrição de áudio ~$0.0024 por minuto

Se você leva só uma ideia desta tabela: a coluna "tipo" importa mais que o número da versão. Um 5.3 de texto não resolve ler um screenshot, e um 4.6V não deveria ser usado para o que o GLM-OCR faz por um décimo do preço.


Os que pensam: modelos de texto

GLM-5.3 — o flagship

É o modelo topo da família (agosto de 2026) e o que responde por padrão quando você pede "o melhor". Está otimizado para código e agentes: nos benchmarks próprios da Z.ai melhorou ~50% sobre o GLM-5.2, e em tarefas de terminal e refactor longo marca o estado da arte aberto. Contexto de 1 milhão de tokens e até 128K de saída, suficiente para um agente escrever uma feature completa numa única execução.

Dado de preço que quase ninguém olha: o input em cache custa $0.26 em vez de $1.40. Se seu app manda o mesmo system prompt em cada chamada, isso é quase 80% de desconto automático na parte repetida.

Use para: refactors complexos, agentes autônomos, análise de bases de código grandes, raciocínio difícil. Não use para: classificar tickets nem resumir e-mails. Para isso existe o Flash, e a diferença na fatura é de 10x.

GLM-5.3-Flash — o cavalo de batalha

A versão econômica (agosto de 2026): 320B de parâmetros totais, 18B ativos, arquitetura híbrida que corta o custo de cache e compute. Aceita imagens além de texto, também com 1M de contexto, e é o modelo padrão do chat da Z.ai.

A $0.15/$0.50 por milhão de tokens, é uma das opções mais baratas da categoria no mercado. Regra prática: se a tarefa te entedia, é para o Flash; se te custa, é para o 5.3 completo.

Use para: chatbots, extração estruturada, classificação, resumos, qualquer coisa em volume. Não use para: arquitetura de software nem decisões das quais a produção depende. Aí, os pontos de qualidade do flagship se pagam sozinhos.

GLM-5.2 — a opção MIT

Junho de 2026, mesmo preço que o 5.3 na API. Por que existe, então? Pela licença: o GLM-5.3 publicou pesos com licença própria (com revisão de segurança exigida de empresas gigantes de serviços de IA), enquanto o GLM-5.2 é MIT puro. Foi apontado como provavelmente o modelo de pesos abertos mais capaz no seu lançamento, com 1M de contexto sem degradação (menos "esquecimento" de objetivos em tarefas longas).

Use para: self-hosting em empresa sem conversar com advogados, ou se sua política interna só aceita licenças MIT/Apache.

GLM-4.7, 4.6 e companhia — a geração que ficou

O GLM-4.7 (fim de 2025) ainda é um modelo sério —foi o último com score público de SWE-bench Verified, 73.8%— a $0.60/$2.20. O GLM-4.6 custa praticamente o mesmo. E o GLM-4.7-Flash é grátis na API: 30B de parâmetros totais, 3B ativos, perfeito para protótipos, webhooks e automações que quase não raciocinam.

Os GLM-4.5 e 4.5-Air de meados de 2025 abriram esta era, mas hoje são história: contexto de 128K e menos capacidade que qualquer um dos de cima. Se um tutorial antigo te disser "use GLM-4.5", troque por 4.6 ou superior.


Os que veem: visão e documentos

GLM-4.6V — o que entende o que vê

O modelo de visão (106B, 128K de contexto): entende screenshots, documentos com layout, fotos de produtos, UIs. Sua graça é o tool use nativo: pode olhar uma interface e encadear ações sobre ela, da percepção visual à ação online. A $0.30/$0.90 é notavelmente mais barato que os flagships de texto.

Use para: agentes que navegam interfaces, extração onde o layout do documento importa, descrição detalhada de imagens. A armadilha: se você só precisa do texto de um PDF escaneado, o GLM-OCR faz esse trabalho a $0.03.

GLM-OCR — o especialista barato

Um modelo pequeno (0.9B) que faz uma coisa só: transformar escaneamentos em texto limpo. O padrão correto é usá-lo como primeiro passo de um pipeline: OCR primeiro, modelo de texto depois. Processar 500 notas fiscais assim custa centavos; entregar todas ao flagship com entrada de imagens custa dólares.


Os que criam: imagem, vídeo e voz

  • GLM-Image (janeiro de 2026): geração de imagens a ~$0.015 por unidade, com um ponto forte incomum: o texto dentro da imagem sai legível (placas, capas, mockups). Pesos abertos MIT.
  • CogView-4: o gerador histórico da casa, a ~$0.01 por imagem. Mais simples, mais barato.
  • CogVideoX-3: vídeo curto por ~$0.20 por clip. Para rascunhos de anúncios e material para redes, não para produção final.
  • GLM-ASR-2512: transcrição de voz para texto a ~$0.0024 por minuto de áudio. Ridiculamente barato para legendagem.
  • GLM-TTS: o inverso, texto para voz, com pesos abertos.
  • AutoGLM-Phone: o agente experimental de 9B que opera um telefone. Curiosidade hoje, sinal de para onde a casa aponta.

Como usá-los corretamente: cinco regras

1. Escolha pela tarefa, não pelo número da versão

O erro mais comum é tratar o catálogo como uma escada onde "o mais novo é o melhor". O Flash não é "o GLM ruim": é o GLM para tarefas simples em volume, e nessas tarefas empata em qualidade custando 10 vezes menos. A seleção correta é horizontal: primeiro o tipo (texto, visão, OCR, imagem), depois a gama (flagship ou Flash), e só no fim a versão.

2. Use o canal correto para cada coisa

A Z.ai tem três portas, e misturá-las é a fonte número um de faturas surpresa:

  • chat.z.ai — para testar e conversar, grátis. Ideal antes de escrever uma linha de código.
  • API pay-as-you-go — para seus apps. Endpoint compatível com OpenAI:
from openai import OpenAI

cliente = OpenAI(
    api_key="SUA_API_KEY",
    base_url="https://api.z.ai/api/paas/v4",
)

resposta = cliente.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Extraia nome e total desta nota fiscal"}],
)
  • GLM Coding Plan — a assinatura para ferramentas de código (Claude Code, Cline, OpenCode, Roo e companhia). Aqui o detalhe que queima: o plano usa seu próprio endpoint de coding e sua própria API key. Se você configurar a key de pagamento por uso no endpoint genérico, ela não desconta a cota do plano — cobra à parte. O passo a passo completo está no post de onboarding.

3. O contexto não é grátis (nem inofensivo)

Com 1M de tokens de janela, a tentação é colar o repositório inteiro "porque cabe". Dois problemas: você paga cada token enviado, e os modelos degradam ou esquecem o objetivo quando o prompt é um palheiro. O contexto longo substitui o RAG mal feito, não o bem feito. E ative o cache de prompt: a entrada em cache do 5.3 custa $0.26 em vez de $1.40 — se seu system prompt é fixo, essa diferença é dinheiro puro.

4. Especialistas antes de generalistas

O padrão se repete em todo o catálogo: o pipeline barato vence o modelo caro universal. PDF escaneado → GLM-OCR ($0.03) + Flash, não o flagship olhando imagens. Screenshot de UI → 4.6V, não o de texto. Imagem para o blog → GLM-Image ($0.015), não uma ferramenta premium. Cada especialista existe porque faz uma coisa melhor ou cem vezes mais barato que o generalista.

5. Não case com as variantes exóticas

Em agosto de 2026, a Z.ai retirou da API as variantes GLM-5-Turbo e GLM-5V-Turbo sem muito barulho. Os modelos base e as linhas Flash estão estáveis há anos; os experimentos se aposentam. Se sua produção tem um nome de modelo fixo no código, que seja um da linha principal —e tenha um fallback configurável por variável de ambiente, não por commit.


Guia de decisão rápida

  • Programar com agentes (Claude Code, Cline, OpenCode) → GLM Coding Plan + GLM-5.3. Como ativar passo a passo.
  • Chat do dia a dia, estudar, rascunhos → chat.z.ai grátis (5.3-Flash por padrão).
  • App com volume de chamadas simples → GLM-5.3-Flash na API.
  • Raciocínio difícil em produção → GLM-5.3.
  • Self-hosting sem discussões de licença → GLM-5.2 (MIT), ou os Flash em hardware pequeno (guia de Ollama aqui).
  • Rascunhos e automações triviais → GLM-4.7-Flash, grátis na API.
  • PDFs e escaneamentos → GLM-OCR + Flash; se o layout importa, GLM-4.6V.
  • Entender screenshots, UIs, documentos visuais → GLM-4.6V.
  • Imagens → GLM-Image (texto legível) ou CogView-4 (mais barato).
  • Vídeo curto → CogVideoX-3.
  • Transcrições → GLM-ASR-2512.
  • Dados que não podem sair da sua máquina → pesos MIT no seu próprio hardware.

O que muda entre os planos do Coding Plan

Se seu caso é programar, a assinatura tem três tiers: Lite ($18/mês, 10.000 créditos semanais), Pro ($80/mês, 60.000) e Max ($168/mês, 140.000). Os três usam os mesmos modelos — incluindo o 5.3 —; o que muda é a cota. Dois multiplicadores pouco conhecidos: pagar trimestral ou anual dá 20% e 30% de desconto, e as requisições fora do horário de pico (fora de 14:00–18:00 de Singapura em dias úteis) consumem metade dos créditos. Programar de noite na América Latina sai, literalmente, pela metade do preço.

A comparativa a fundo contra o OpenCode Go —quando convém cada assinatura— está neste post, e a experiência real de três meses de uso, na resenha.


Preços e funções citados correspondem a setembro de 2026 e mudam com frequência. Verifique em docs.z.ai antes de decidir algo sério.

Quer experimentar? Com este link de convite você tem 10% de desconto no primeiro pedido do Coding Plan: você economiza no primeiro pagamento e eu recebo crédito de plataforma.

— Leandro Valencia

Frequently asked questions

Qual é o melhor modelo da Z.ai hoje?

Para tarefas difíceis (código complexo, agentes, análises longas), GLM-5.3. Para volume (chat, extração, classificação), GLM-5.3-Flash, que custa cerca de 10 vezes menos e também aceita imagens. Os dois compartilham contexto de 1 milhão de tokens. A versão importa menos que as letras: Flash é a linha econômica.

Os modelos GLM são gratuitos?

Depende do canal. O chat do chat.z.ai é gratuito, GLM-4.7-Flash e GLM-4.6V-Flash não cobram na API, e os pesos abertos (MIT) podem ser baixados e executados sem licença. O que se paga é a API dos modelos grandes (por token) e o GLM Coding Plan (assinatura para ferramentas de código).

Posso rodar GLM no meu próprio computador?

Sim, se você escolher bem o modelo. As variantes Flash são pequenas (GLM-4.7-Flash tem uns 30B de parâmetros totais) e rodam com vLLM, SGLang ou Ollama em hardware de consumo. Os flagships de 744B não cabem numa máquina normal: esses você usa via API ou self-hosting sério com várias GPUs.

Qual modelo uso para extrair dados de PDFs escaneados?

O pipeline barato: GLM-OCR primeiro (uns $0.03 por milhão de tokens) para converter as páginas em texto, e depois um modelo de texto como GLM-5.3-Flash para estruturar a informação. Se o layout do documento importa (tabelas, posições), use GLM-4.6V em vez do OCR.

Vale a pena o Coding Plan se já pago outra assinatura de IA?

Depende de quanto você queima de cota. O plano começa em $18 por mês com cota semanal renovável e funciona dentro do Claude Code, Cline ou OpenCode sem mudar seu fluxo. A comparação detalhada de preços e limites contra o OpenCode Go está em outro post desta série.

Posts Relacionados

Continue explorando conteúdo similar que pode te interessar

Alianças

Ferramentas que uso todos os dias, com melhores condições para a comunidade.

Links de afiliado. O preço para si não muda.Ver todas as alianças
Programa de formação

Pronto para transformar sua ideia em um projeto real?

Transforma é o programa onde você aprenderá a criar, executar e escalar seu projeto com clareza e método.

Conhecer o Programa Transforma