Imagen destacada para Z.ai y sus modelos GLM: cuál es cuál y cuándo usar cada uno

Z.ai y sus modelos GLM: cuál es cuál y cuándo usar cada uno

Publicado el:

Tiempo de lectura: 10 min

Tema: Tecnologia

Autor: Leandro Valencia

#z.ai#glm#glm-5.3#glm coding plan#modelos de ia#ia para programar#api de ia#inteligencia artificial#glm-4.6v#cogvideox

Catálogo práctico de los modelos de Z.ai —GLM-5.3, Flash, 4.6V, OCR, GLM-Image, CogVideoX y el Coding Plan—: qué hace cada uno, cuánto cuesta y cómo elegir el correcto para cada tarea.

Tabla de Contenidos

El mapa en 30 segundos

Modelo Tipo Para qué sirve Precio API
GLM-5.3 Texto El flagship: código difícil, agentes, tareas largas $1.40 / $4.40
GLM-5.3-Flash Texto + imagen Volumen: chat, extracción, clasificación $0.15 / $0.50
GLM-5.2 Texto Alternativa MIT con contexto de 1M sin degradación $1.40 / $4.40
GLM-4.7 / 4.6 Texto La generación anterior, aún sólida para todo $0.60 / $2.20
GLM-4.7-Flash Texto Gratis en la API: bocetos y side projects $0
GLM-4.6V Visión Screenshots, documentos, UIs, tool use nativo $0.30 / $0.90
GLM-4.6V-Flash Visión La misma idea, gratis $0
GLM-OCR OCR Escaneos y PDFs a texto limpio $0.03 / $0.03
GLM-Image Imagen Generación con texto legible dentro de la imagen ~$0.015 por imagen
CogVideoX-3 Video Clips cortos ~$0.20 por video
GLM-ASR-2512 Voz Transcripción de audio ~$0.0024 por minuto

Si solo te llevas una idea de esta tabla: la columna "tipo" importa más que el número de versión. Un 5.3 para texto no te sirve para ver una captura de pantalla, y un 4.6V no debería usarse para lo que hace GLM-OCR a un décimo del precio.


Los que piensan: modelos de texto

GLM-5.3 — el flagship

Es el modelo tope de la familia (agosto de 2026) y el que responde por defecto cuando pides "el mejor". Está optimizado para código y agentes: en los benchmarks propios de Z.ai mejoró ~50% sobre GLM-5.2, y en tareas de terminal y refactor largo marca el estado del arte abierto. Contexto de 1 millón de tokens y hasta 128K de salida, suficiente para que un agente escriba un feature completo en una sola corrida.

Dato de precio que casi nadie mira: el input cacheado cuesta $0.26 en vez de $1.40. Si tu app manda el mismo system prompt en cada llamada, eso es casi un 80% de descuento automático en la parte repetida.

Úsalo para: refactors complejos, agentes que trabajan solos, análisis de bases de código grandes, razonamiento difícil. No lo uses para: clasificar tickets ni resumir emails. Para eso está Flash y la diferencia de factura es de 10x.

GLM-5.3-Flash — el caballo de trabajo

La versión económica (agosto de 2026): 320B de parámetros totales, 18B activos, arquitectura híbrida que recorta el costo de caché y cómputo. Acepta imágenes además de texto, también con 1M de contexto, y es el modelo por defecto del chat de Z.ai.

A $0.15/$0.50 por millón de tokens, es de las opciones más baratas de su categoría en el mercado. La regla práctica: si la tarea te aburre, es para Flash; si te cuesta, es para el 5.3 completo.

Úsalo para: chatbots, extracción estructurada, clasificación, resúmenes, cualquier cosa en volumen. No lo uses para: arquitectura de software ni decisiones de las que depende producción. Ahí los puntos de calidad del flagship se pagan solos.

GLM-5.2 — la opción MIT

Junio de 2026, mismo precio que el 5.3 en la API. ¿Por qué existe entonces? Por la licencia: GLM-5.3 publicó pesos con una licencia propia (con revisión de seguridad exigida a empresas gigantes de servicios de IA), mientras que GLM-5.2 es MIT puro. Fue señalado como probablemente el modelo de pesos abiertos más capaz al momento de su lanzamiento, con 1M de contexto sin degradación (menos "olvido" de objetivos en tareas largas).

Úsalo para: self-hosting en empresa sin conversar con abogados, o si tu política interna prohíbe licencias distintas a MIT/Apache.

GLM-4.7, 4.6 y compañía — la generación que no se fue

GLM-4.7 (fines de 2025) sigue siendo un modelo serio —fue el último con score público de SWE-bench Verified, 73.8%— a $0.60/$2.20. GLM-4.6 es prácticamente el mismo precio. Y GLM-4.7-Flash es gratis en la API: 30B de parámetros totales, 3B activos, perfecto para prototipos, webhooks y automatizaciones que casi no razonan.

Los GLM-4.5 y 4.5-Air de mediados de 2025 abrieron esta era, pero hoy son historia: contexto de 128K y menos capacidad que cualquiera de los de arriba. Si un tutorial viejo te dice "usa GLM-4.5", cámbialo por 4.6 o superior.


Los que ven: visión y documentos

GLM-4.6V — el que entiende lo que mira

El modelo de visión (106B, 128K de contexto): entiende screenshots, documentos con layout, fotos de productos, UIs. Su gracia es el tool use nativo: puede ver una interfaz y encadenar acciones sobre ella, de la percepción visual a la acción en línea. A $0.30/$0.90 es notablemente más barato que los flagships de texto.

Úsalo para: agentes que navegan interfaces, extracción donde el diseño del documento importa, describir imágenes con detalle. La trampa: si solo necesitas el texto de un PDF escaneado, GLM-OCR hace ese trabajo a $0.03.

GLM-OCR — el especialista barato

Un modelo chiquito (0.9B) que hace una sola cosa: convertir escaneos en texto limpio. El patrón correcto es usarlo como primer paso de un pipeline: OCR primero, modelo de texto después. Procesar 500 facturas así cuesta centavos; dárselas todas al flagship con entrada de imágenes cuesta dólares.


Los que crean: imagen, video y voz

  • GLM-Image (enero de 2026): generación de imágenes a ~$0.015 por unidad, con un punto fuerte inusual: el texto dentro de la imagen sale legible (carteles, portadas, mockups). Pesos abiertos MIT.
  • CogView-4: el generador histórico de la casa, a ~$0.01 por imagen. Más simple, más barato.
  • CogVideoX-3: video corto por ~$0.20 por clip. Para borradores de anuncios y material de redes, no para producción final.
  • GLM-ASR-2512: transcripción de voz a texto a ~$0.0024 por minuto de audio. Ridículamente barato para subtitular.
  • GLM-TTS: la inversa, texto a voz, con pesos abiertos.
  • AutoGLM-Phone: el agente experimental de 9B que opera un teléfono. Curiosidad hoy, señal de hacia dónde apunta la casa.

Cómo usarlos correctamente: cinco reglas

1. Elige por tarea, no por número de versión

El error más común es tratar el catálogo como una escalera donde "el más nuevo es el mejor". Flash no es "el GLM malo": es el GLM para tareas simples en volumen, y en esas tareas empata en calidad costando 10 veces menos. La selección correcta es horizontal: primero el tipo (texto, visión, OCR, imagen), después la gama (flagship o Flash), y recién al final la versión.

2. Usa el canal correcto para cada cosa

Z.ai tiene tres puertas, y mezclarlas es la fuente número uno de facturas sorpresa:

  • chat.z.ai — para probar y chatear, gratis. Ideal antes de escribir una línea de código.
  • API pay-as-you-go — para tus apps. Endpoint compatible con OpenAI:
from openai import OpenAI

cliente = OpenAI(
    api_key="TU_API_KEY",
    base_url="https://api.z.ai/api/paas/v4",
)

respuesta = cliente.chat.completions.create(
    model="glm-5.3-flash",
    messages=[{"role": "user", "content": "Extrae nombre y total de esta factura"}],
)
  • GLM Coding Plan — la suscripción para herramientas de código (Claude Code, Cline, OpenCode, Roo y compañía). Aquí el detalle que quema: el plan usa su propio endpoint de coding y su propia API key. Si configuras la key de pago por uso sobre el endpoint genérico, no descuenta la cuota del plan — te factura aparte. El paso a paso completo está en el post de onboarding.

3. El contexto no es gratis (ni inofensivo)

Con 1M de tokens de ventana, la tentación es pegar el repositorio entero "porque cabe". Dos problemas: pagas cada token que mandas, y los modelos degradan u olvidan el objetivo cuando el prompt es un pajar. El contexto largo reemplaza al RAG mal hecho, no al bien hecho. Y activa el caché de prompt: la entrada cacheada del 5.3 cuesta $0.26 en vez de $1.40 — si tu system prompt es fijo, esa diferencia es dinero puro.

4. Especialistas antes que todo-terreno

El patrón se repite en todo el catálogo: el pipeline barato le gana al modelo caro universal. PDF escaneado → GLM-OCR ($0.03) + Flash, no el flagship mirando imágenes. Captura de UI → 4.6V, no el de texto. Imagen para el blog → GLM-Image ($0.015), no una herramienta premium. Cada especialista existe porque hace una cosa mejor o cien veces más barato que el generalista.

5. No te cases con las variantes exóticas

En agosto de 2026, Z.ai retiró de la API las variantes GLM-5-Turbo y GLM-5V-Turbo sin mucho ruido. Los modelos base y las líneas Flash llevan años estables; los experimentos se jubilan. Si tu producción hardcodea un nombre de modelo, que sea uno de la línea principal —y ten un fallback configurable por variable de entorno, no por commit.


Guía de decisión rápida

  • Programar con agentes (Claude Code, Cline, OpenCode) → GLM Coding Plan + GLM-5.3. Cómo activarlo paso a paso.
  • Chat del día a día, estudiar, borradores → chat.z.ai gratis (5.3-Flash por defecto).
  • App con volumen de llamadas simples → GLM-5.3-Flash en la API.
  • Razonamiento difícil en producción → GLM-5.3.
  • Self-hosting sin discusiones de licencia → GLM-5.2 (MIT), o los Flash en hardware chico (guía de Ollama aquí).
  • Bocetos y automatizaciones triviales → GLM-4.7-Flash, gratis en la API.
  • PDFs y escaneos → GLM-OCR + Flash; si importa el layout, GLM-4.6V.
  • Entender screenshots, UIs, documentos visuales → GLM-4.6V.
  • Imágenes → GLM-Image (con texto legible) o CogView-4 (más barato).
  • Video corto → CogVideoX-3.
  • Transcripciones → GLM-ASR-2512.
  • Datos que no pueden salir de tu máquina → pesos MIT en tu propio hardware.

Lo que cambia entre planes del Coding Plan

Si tu caso es programar, la suscripción tiene tres tiers: Lite ($18/mes, 10.000 créditos semanales), Pro ($80/mes, 60.000) y Max ($168/mes, 140.000). Los tres usan los mismos modelos — incluido el 5.3 —; lo que cambia es la cuota. Dos multiplicadores poco conocidos: pagar trimestral o anual rebaja 20% y 30%, y las peticiones fuera de hora pico (fuera de 14:00–18:00 de Singapur entre semana) consumen la mitad de créditos. Programar de noche en Latinoamérica sale, literalmente, a mitad de precio.

La comparativa a fondo contra OpenCode Go —cuándo conviene cada suscripción— está en este post, y la experiencia de uso real de tres meses, en la reseña.


Los precios y funciones citados corresponden a septiembre de 2026 y cambian con frecuencia. Verifica en docs.z.ai antes de decidir nada serio.

¿Quieres probarlo? Con este enlace de invitación tienes 10% de descuento en el primer pedido del Coding Plan: tú ahorras el primer pago y yo recibo crédito de plataforma.

— Leandro Valencia

Preguntas frecuentes

¿Cuál es el mejor modelo de Z.ai hoy?

Para tareas difíciles (código complejo, agentes, análisis largos), GLM-5.3. Para volumen (chat, extracción, clasificación), GLM-5.3-Flash, que cuesta cerca de 10 veces menos y también acepta imágenes. Ambos comparten contexto de 1 millón de tokens. La versión apenas importa; la letra sí: Flash es la línea económica.

¿Los modelos GLM son gratis?

Depende del canal. El chat de chat.z.ai es gratuito, GLM-4.7-Flash y GLM-4.6V-Flash no cobran en la API, y los pesos abiertos (MIT) se pueden descargar y correr sin pagar licencias. Lo que se paga es la API de los modelos grandes (por token) y el GLM Coding Plan (suscripción para herramientas de código).

¿Puedo correr GLM en mi propia computadora?

Sí, si eliges bien el modelo. Las variantes Flash son pequeñas (GLM-4.7-Flash tiene unos 30B de parámetros totales) y corren con vLLM, SGLang u Ollama en hardware de consumo. Los flagships de 744B no caben en una máquina normal: esos se usan vía API o self-hosting serio con varias GPUs.

¿Qué modelo uso para extraer datos de PDFs escaneados?

El pipeline barato: GLM-OCR primero (unos $0.03 por millón de tokens) para convertir las páginas a texto, y después un modelo de texto como GLM-5.3-Flash para estructurar la información. Si el diseño del documento importa (tablas, posiciones), usa GLM-4.6V en lugar del OCR.

¿Vale la pena el Coding Plan si ya pago otra suscripción de IA?

Depende de cuánta cuota quemas. El plan arranca en $18 al mes con cuota semanal renovable y funciona dentro de Claude Code, Cline u OpenCode sin cambiar tu flujo. La comparativa detallada de precios y límites contra OpenCode Go está en otro post de esta serie.

Posts Relacionados

Continúa explorando contenido similar que te puede interesar

Alianzas

Herramientas que uso a diario y con las que la comunidad consigue mejores condiciones.

Enlaces de afiliado. El precio para ti no cambia.Ver todas las alianzas
Programa de formación

¿Listo para transformar tu idea en un proyecto real?

Transforma es el programa donde aprenderás a crear, ejecutar y escalar tu proyecto con claridad y método.

Conocer el Programa Transforma