Imagen destacada para Z.ai y los modelos GLM: 3 meses usándolo a diario, precios reales y para quién sí (y para quién no)

Z.ai y los modelos GLM: 3 meses usándolo a diario, precios reales y para quién sí (y para quién no)

Publicado el:

Tiempo de lectura: 13 min

Tema: Tecnologia

Autor: Leandro Valencia

#zai#glm#inteligencia-artificial#desarrollo#tecnologia#codigo

Análisis detallado de 3 meses usando Z.ai/GLM para desarrollo real. Precios reales, casos de uso prácticos y honestidad sobre para quién funciona realmente.

Tabla de Contenidos

La tabla que viniste a ver: planes del GLM Coding Plan

Este es el corazón de la oferta de Z.ai para desarrolladores. Todos los planes dan acceso a los mismos modelos —no hay tiers con modelos capados—, lo único que cambia es cuánta cuota tienes.

Lite Pro Max
Precio base mensual ~$18 USD ~$72–80 USD ~$160–168 USD
Créditos cada 5 horas 2.000 12.000 28.000
Créditos semanales 10.000 60.000 140.000
Tokens estimados/semana (GLM-5.3, caché ~95%) 48–97 millones 290–580 millones 676–1.352 millones
Modelos incluidos GLM-5.3, GLM-5-Turbo, GLM-4.7 Iguales Iguales
MCP incluidos Vision, Web Search, Web Reader, Zread Iguales Iguales
Descuento por ciclo 20% trimestral / 30% anual Igual Igual

Con el descuento anual, Lite baja a ~$12,60/mes. Ese es el número que hace que la comparación con cualquier otra suscripción de coding se vuelva incómoda para la competencia.

Dos advertencias sobre precios: los montos de Pro y Max han variado entre fuentes y promociones ($72 vs $80, $160 vs $168), así que verifica el número exacto en la página antes de pagar. Y las suscripciones no son reembolsables una vez compradas — arranca en Lite mensual, no en Max anual.

👉 Suscríbete con 10% de descuento aquí — el descuento se aplica solo en tu primer pago y solo si nunca has tenido una suscripción pagada en la plataforma.


Tabla de modelos: capacidades y precio de API

Si prefieres pagar por token en vez de suscribirte, este es el catálogo. Precios por millón de tokens (USD):

Modelos de texto

Modelo Input Input cacheado Output Para qué sirve
GLM-5.3 $1,40 $0,26 $4,40 Flagship. Coding complejo, tareas agénticas largas, seguridad. Contexto 1M, output hasta 128K
GLM-5.2 $1,40 $0,26 $4,40 Generación anterior, misma base que 5.3
GLM-5-Turbo $1,20 $0,24 $4,00 Rápido. Ideal para automatizaciones y respuestas de baja latencia
GLM-4.7 $0,60 $0,11 $2,20 Caballo de batalla barato. Tareas de código medias
GLM-4.7-FlashX $0,07 $0,01 $0,40 Volumen alto: clasificación, extracción, routing
GLM-4.5-Air $0,20 $0,03 $1,10 Ligero, muy barato
GLM-4.7-Flash Gratis Gratis Gratis Prototipos y pruebas sin costo

Modelos de visión, imagen, audio y video

Modelo Precio Para qué sirve
GLM-5V-Turbo $1,20 / $4,00 por MTok Visión de alto nivel: análisis de UI, video, gráficos
GLM-4.6V $0,30 / $0,90 por MTok Visión estándar, buena relación costo-calidad
GLM-OCR $0,03 por MTok Extracción de texto de documentos escaneados
GLM-4.6V-Flash Gratis Visión básica sin costo
GLM-Image $0,015 por imagen Generación de imágenes
CogVideoX-3 $0,20 por video Generación de video
Vidu Q1 / Vidu 2 $0,20–0,40 por video Video desde texto, imagen o referencia
GLM-ASR-2512 ~$0,0024 por minuto Transcripción de audio
Agente Slide/Poster $0,70 por MTok Presentaciones y pósters automatizados

El dato que más importa de esta tabla: el input cacheado cuesta la quinta parte del input normal. En un flujo agéntico donde reenvías el mismo contexto de proyecto una y otra vez, esa diferencia es la que decide si el mes te sale caro o barato.


Lo que casi nadie te explica: cómo se consumen los créditos

Aquí es donde la gente se frustra y cancela. El plan no funciona por "número de prompts". Funciona con dos límites simultáneos y multiplicadores por modelo.

Los dos límites:

  • Límite de 5 horas. Se refresca dinámicamente: cada consumo se te devuelve 5 horas después.
  • Límite semanal. Arranca cuando pagas y se reinicia cada 7 días.

La fórmula: créditos = (tokens_input × mult_input + tokens_cacheados × mult_caché + tokens_output × mult_output) / 10.000

Los multiplicadores:

Modelo Input Input cacheado Output
GLM-5.3 6,9 1,7 24
GLM-5-Turbo 5,7 1,5 21
GLM-4.7 4,6 1,2 16
GLM-4.6V (Vision MCP) 1,2 0,3 2,7
Web Search / Web Reader / Zread 1,2 por llamada

Tres consecuencias prácticas que aprendí a golpes:

  1. El output es lo caro. Multiplicador 24 contra 6,9 del input en GLM-5.3. Un modelo que "piensa en voz alta" durante 40 mil tokens te come el día. Por eso reasoning_effort: low existe y por eso lo uso más de lo que esperaba.
  2. La caché es tu presupuesto. La diferencia entre 90,9% y 98% de acierto de caché es la diferencia entre 43 y 105 millones de tokens semanales en Lite. Sesiones largas y coherentes rinden; abrir contexto nuevo cada 10 minutos te arruina.
  3. Fuera de hora pico pagas la mitad. Hora pico es lunes a viernes, 14:00–18:00 hora de Singapur (UTC+8). Todo lo demás —incluido el fin de semana completo— cuesta 50% de los créditos. Si trabajas desde América, buena parte de tu jornada cae en horario barato. Es probablemente la ventaja de precio menos publicitada del plan.

Las herramientas: dónde puedes usar esto realmente

El plan está estrictamente limitado a herramientas soportadas oficialmente. No es una API abierta que enchufas donde quieras; si lo usas fuera de la lista, te va a dar error de balance insuficiente.

Agentes de código soportados: ZCode (el entorno propio de Z.ai), Claude Code, Claude for IDE, Codex, Cursor, Cline, OpenCode, Roo Code, Kilo Code, Crush, Goose, Droid, TRAE, Qoder, Pi y Eigent.

Agentes de propósito general: OpenClaw, Hermes Agent y SillyTavern, servidos con "mejor esfuerzo" — bajo carga alta pueden aplicar límites temporales.

La configuración es cambiar el base URL:

Protocolo Base URL
Anthropic Messages (Claude Code, Goose) https://api.z.ai/api/anthropic
OpenAI Chat Completions (el resto) https://api.z.ai/api/coding/paas/v4
OpenAI Responses https://api.z.ai/api/v1

Y los cuatro MCP incluidos sin costo extra más allá de los créditos: Vision Understanding (leer capturas, diagramas, mockups), Web Search, Web Reader (extraer contenido de URLs) y Zread (leer repositorios de GitHub). Ese último es más útil de lo que suena cuando estás integrando una librería que no conoces.


Casos de uso: qué modelo para qué tarea

Esta es la parte que separa a quien exprime la suscripción de quien la desperdicia.

GLM-5.3 → trabajo pesado y largo. Refactors que tocan quince archivos, migraciones, debugging de algo que llevas horas persiguiendo, implementación completa de una spec. Es donde el salto de esta versión se nota: en su benchmark interno pasó de 23,4% a 34,5% de tareas completadas contra GLM-5.2, y consumiendo menos tokens de output. En Terminal-Bench 3.0 saltó de 4,6 a 28,3. Úsalo con reasoning_effort: max y no lo uses para nada trivial.

GLM-5-Turbo → automatizaciones y latencia. Todo lo que corre en un cron, en un webhook o en un pipeline. Aquí no necesitas razonamiento profundo, necesitas respuestas consistentes y rápidas. Es también mi opción por defecto para chatbots donde el usuario está esperando.

GLM-4.7 → el día a día. Escribir un endpoint, ajustar un test, explicarme un archivo que no escribí yo, generar un script de migración. Multiplicador 16 en output contra 24 de GLM-5.3: te rinde bastante más y para el 60% de las tareas la diferencia de calidad no se percibe.

GLM-4.7-FlashX / GLM-4.5-Air → volumen. Clasificar tickets, extraer campos de texto, hacer routing entre agentes, resumir. A $0,07 de input por millón, FlashX es prácticamente gratis para procesar lotes.

GLM-4.6V / GLM-5V-Turbo → visión. Pasarle una captura de un bug de UI, un diagrama de arquitectura en foto, una tabla en PDF. El Vision MCP integrado en el plan lo hace especialmente cómodo dentro del flujo de coding.

Una nota sobre chatbots: si estás construyendo interacción conversacional con usuarios reales, la combinación GLM-5-Turbo + Web Search MCP da una experiencia notablemente más natural de lo que el precio sugeriría. Es uno de los usos donde más valor he sacado y del que menos se habla.


Mi experiencia real: tres meses, flujo concreto

Mi manera de trabajar es esta y creo que explica por qué me funciona tan bien:

Defino las specs con otro modelo. Uso Grok, GPT o Claude para la parte de pensar el problema: arquitectura, tradeoffs, criterios de aceptación, qué archivos toco. Esa conversación es exploratoria, iterativa, y ahí quiero el mejor razonamiento disponible sin importar el costo, porque son pocos tokens.

Ejecuto las specs con GLM. Una vez la spec está escrita y es inequívoca, GLM-5.3 la implementa. Y esto es lo importante: ejecutar una spec bien definida es un problema distinto a diseñarla. Requiere seguir instrucciones, mantener contexto, no inventar, usar herramientas correctamente. GLM es muy bueno en eso, y ahí es donde el precio deja de tener sentido a favor tuyo.

Los créditos, seamos claros, no alcanzan para codificar todo el día en Lite. Si tu trabajo es ocho horas de agente escupiendo código, vas a chocar contra el límite de 5 horas. Pero para mi patrón —ráfagas de ejecución intercaladas con revisión humana— sobra. Y el 50% de descuento fuera de hora pico me duplica el margen efectivo.

La app y el chat también cuentan. Fuera del IDE uso la aplicación de Z.ai para tareas que no requieren razonamiento profundo: revisar un tema, resumir documentación, verificar algo rápido, procesos repetitivos. Comparado con abrir un Sonnet para eso, es sensiblemente más eficiente en costo y suficientemente bueno. No es donde está la magia, pero es donde está el ahorro acumulado.


Lo honesto: para quién NO es esto

Si algo tengo claro después de tres meses es que esta no es una herramienta de entrada.

No es para ti si:

  • Estás aprendiendo a programar y necesitas que el modelo te guíe paso a paso, corrija tus supuestos y te explique por qué algo está mal. GLM ejecuta muy bien; no te va a rescatar de una spec mal pensada. Si le das instrucciones vagas, te devuelve trabajo vago con mucha confianza.
  • Quieres una experiencia "todo incluido" sin configurar nada. Aquí hay que entender base URLs, protocolos, límites de cuota, multiplicadores y horarios. No es difícil, pero es fricción real.
  • Necesitas el techo absoluto de capacidad. En el propio benchmark de Z.ai, GLM-5.3 alcanza 34,5% donde Claude Fable 5 llega a 39,5%. La brecha existe y en tareas de frontera se siente.
  • Necesitas garantía de reembolso. No hay. Punto.

Sí es para ti si: ya sabes definir un problema, ya tienes criterio para revisar lo que un agente produce, y tu cuello de botella es el costo de ejecutar mucho, no la calidad del razonamiento en la frontera.

Otras dos cosas que debes considerar antes de pagar: Z.ai es una empresa china (Zhipu AI) y tus prompts pasan por su infraestructura — si manejas código bajo NDA estricto o datos regulados, revísalo con quien corresponda. Y los planes están atados a herramientas soportadas: si tu stack usa algo que no está en esa lista, la suscripción no te sirve y tendrías que ir por API pagada por token.


El código de invitado: qué gana cada quien, sin adornos

Ya que voy a compartirlo, prefiero explicarte exactamente cómo funciona el programa en vez de solo tirarte el link.

Lo que ganas tú (invitado):

  • 10% de descuento instantáneo sobre el monto de tu primera suscripción al GLM Coding Plan. Se aplica automáticamente en el checkout, sin escribir ningún código.
  • Aplica solo si eres usuario nuevo o nunca has pagado una suscripción en la plataforma.
  • Aplica solo a la primera orden. Renovaciones, upgrades y downgrades no.
  • No se acumula con otras campañas de descuento de primera compra.
  • Debes completar el pago dentro de las 72 horas de registrarte con el enlace.

Lo que gano yo (invitador):

  • Créditos de plataforma equivalentes al 10% del monto que efectivamente pagaste. No es efectivo: son créditos que solo sirven para pagar suscripciones, packs o llamadas de API dentro de Z.ai. No se retiran ni se transfieren.
  • Y hay un umbral: no cobro nada hasta acumular 3 invitados válidos. Antes de eso los créditos quedan en estado pendiente.

Te lo cuento en detalle porque el incentivo cambia cómo debes leer una reseña, y prefiero que lo sepas y decidas tú.

👉 Enlace con 10% de descuento (código: V2TH8OSBEF)

Antes de usarlo: el plan Lite mensual son ~$18 con el descuento aplicado. Pruébalo un mes con tu flujo real. Si a los 30 días no chocaste contra el límite de 5 horas y el modelo hizo lo que necesitabas, entonces sí evalúa el anual con 30% off. No al revés.


Veredicto

Z.ai no es "el Claude barato". Es una herramienta con un perfil distinto: excelente ejecutando trabajo bien definido, a un precio que cambia la ecuación de cuánto puedes automatizar. Si tu flujo separa el pensar del hacer —definir specs con un modelo, ejecutarlas con otro— encaja casi perfecto. Si esperas que un solo modelo haga todo, te vas a frustrar.

Después de tres meses mi conclusión es simple: siento que me da más de lo que pago. Pero esa frase solo aplica si ya sabes qué pedirle.


Fuentes

Divulgación: este artículo contiene un enlace de invitación. Recibo créditos de plataforma si te suscribes a través de él. Los datos técnicos y de precios provienen de la documentación oficial de Z.ai y fueron verificados en agosto de 2026; verifica los montos actuales antes de pagar.

Posts Relacionados

Continúa explorando contenido similar que te puede interesar

Z.ai y los modelos GLM: 3 meses usándolo a diario, precios reales y para quién sí (y para quién no)