
Z.ai y los modelos GLM: 3 meses usándolo a diario, precios reales y para quién sí (y para quién no)
Publicado el:
Tiempo de lectura: 13 min
Tema: Tecnologia
Autor: Leandro Valencia
Análisis detallado de 3 meses usando Z.ai/GLM para desarrollo real. Precios reales, casos de uso prácticos y honestidad sobre para quién funciona realmente.
Tabla de Contenidos
- La tabla que viniste a ver: planes del GLM Coding Plan
- Lo que casi nadie te explica: cómo se consumen los créditos
- Las herramientas: dónde puedes usar esto realmente
- Casos de uso: qué modelo para qué tarea
- Mi experiencia real: tres meses, flujo concreto
- Lo honesto: para quién NO es esto
- El código de invitado: qué gana cada quien, sin adornos
La tabla que viniste a ver: planes del GLM Coding Plan
Este es el corazón de la oferta de Z.ai para desarrolladores. Todos los planes dan acceso a los mismos modelos —no hay tiers con modelos capados—, lo único que cambia es cuánta cuota tienes.
| Lite | Pro | Max | |
|---|---|---|---|
| Precio base mensual | ~$18 USD | ~$72–80 USD | ~$160–168 USD |
| Créditos cada 5 horas | 2.000 | 12.000 | 28.000 |
| Créditos semanales | 10.000 | 60.000 | 140.000 |
| Tokens estimados/semana (GLM-5.3, caché ~95%) | 48–97 millones | 290–580 millones | 676–1.352 millones |
| Modelos incluidos | GLM-5.3, GLM-5-Turbo, GLM-4.7 | Iguales | Iguales |
| MCP incluidos | Vision, Web Search, Web Reader, Zread | Iguales | Iguales |
| Descuento por ciclo | 20% trimestral / 30% anual | Igual | Igual |
Con el descuento anual, Lite baja a ~$12,60/mes. Ese es el número que hace que la comparación con cualquier otra suscripción de coding se vuelva incómoda para la competencia.
Dos advertencias sobre precios: los montos de Pro y Max han variado entre fuentes y promociones ($72 vs $80, $160 vs $168), así que verifica el número exacto en la página antes de pagar. Y las suscripciones no son reembolsables una vez compradas — arranca en Lite mensual, no en Max anual.
👉 Suscríbete con 10% de descuento aquí — el descuento se aplica solo en tu primer pago y solo si nunca has tenido una suscripción pagada en la plataforma.
Tabla de modelos: capacidades y precio de API
Si prefieres pagar por token en vez de suscribirte, este es el catálogo. Precios por millón de tokens (USD):
Modelos de texto
| Modelo | Input | Input cacheado | Output | Para qué sirve |
|---|---|---|---|---|
| GLM-5.3 | $1,40 | $0,26 | $4,40 | Flagship. Coding complejo, tareas agénticas largas, seguridad. Contexto 1M, output hasta 128K |
| GLM-5.2 | $1,40 | $0,26 | $4,40 | Generación anterior, misma base que 5.3 |
| GLM-5-Turbo | $1,20 | $0,24 | $4,00 | Rápido. Ideal para automatizaciones y respuestas de baja latencia |
| GLM-4.7 | $0,60 | $0,11 | $2,20 | Caballo de batalla barato. Tareas de código medias |
| GLM-4.7-FlashX | $0,07 | $0,01 | $0,40 | Volumen alto: clasificación, extracción, routing |
| GLM-4.5-Air | $0,20 | $0,03 | $1,10 | Ligero, muy barato |
| GLM-4.7-Flash | Gratis | Gratis | Gratis | Prototipos y pruebas sin costo |
Modelos de visión, imagen, audio y video
| Modelo | Precio | Para qué sirve |
|---|---|---|
| GLM-5V-Turbo | $1,20 / $4,00 por MTok | Visión de alto nivel: análisis de UI, video, gráficos |
| GLM-4.6V | $0,30 / $0,90 por MTok | Visión estándar, buena relación costo-calidad |
| GLM-OCR | $0,03 por MTok | Extracción de texto de documentos escaneados |
| GLM-4.6V-Flash | Gratis | Visión básica sin costo |
| GLM-Image | $0,015 por imagen | Generación de imágenes |
| CogVideoX-3 | $0,20 por video | Generación de video |
| Vidu Q1 / Vidu 2 | $0,20–0,40 por video | Video desde texto, imagen o referencia |
| GLM-ASR-2512 | ~$0,0024 por minuto | Transcripción de audio |
| Agente Slide/Poster | $0,70 por MTok | Presentaciones y pósters automatizados |
El dato que más importa de esta tabla: el input cacheado cuesta la quinta parte del input normal. En un flujo agéntico donde reenvías el mismo contexto de proyecto una y otra vez, esa diferencia es la que decide si el mes te sale caro o barato.
Lo que casi nadie te explica: cómo se consumen los créditos
Aquí es donde la gente se frustra y cancela. El plan no funciona por "número de prompts". Funciona con dos límites simultáneos y multiplicadores por modelo.
Los dos límites:
- Límite de 5 horas. Se refresca dinámicamente: cada consumo se te devuelve 5 horas después.
- Límite semanal. Arranca cuando pagas y se reinicia cada 7 días.
La fórmula: créditos = (tokens_input × mult_input + tokens_cacheados × mult_caché + tokens_output × mult_output) / 10.000
Los multiplicadores:
| Modelo | Input | Input cacheado | Output |
|---|---|---|---|
| GLM-5.3 | 6,9 | 1,7 | 24 |
| GLM-5-Turbo | 5,7 | 1,5 | 21 |
| GLM-4.7 | 4,6 | 1,2 | 16 |
| GLM-4.6V (Vision MCP) | 1,2 | 0,3 | 2,7 |
| Web Search / Web Reader / Zread | — | — | 1,2 por llamada |
Tres consecuencias prácticas que aprendí a golpes:
- El output es lo caro. Multiplicador 24 contra 6,9 del input en GLM-5.3. Un modelo que "piensa en voz alta" durante 40 mil tokens te come el día. Por eso
reasoning_effort: lowexiste y por eso lo uso más de lo que esperaba. - La caché es tu presupuesto. La diferencia entre 90,9% y 98% de acierto de caché es la diferencia entre 43 y 105 millones de tokens semanales en Lite. Sesiones largas y coherentes rinden; abrir contexto nuevo cada 10 minutos te arruina.
- Fuera de hora pico pagas la mitad. Hora pico es lunes a viernes, 14:00–18:00 hora de Singapur (UTC+8). Todo lo demás —incluido el fin de semana completo— cuesta 50% de los créditos. Si trabajas desde América, buena parte de tu jornada cae en horario barato. Es probablemente la ventaja de precio menos publicitada del plan.
Las herramientas: dónde puedes usar esto realmente
El plan está estrictamente limitado a herramientas soportadas oficialmente. No es una API abierta que enchufas donde quieras; si lo usas fuera de la lista, te va a dar error de balance insuficiente.
Agentes de código soportados: ZCode (el entorno propio de Z.ai), Claude Code, Claude for IDE, Codex, Cursor, Cline, OpenCode, Roo Code, Kilo Code, Crush, Goose, Droid, TRAE, Qoder, Pi y Eigent.
Agentes de propósito general: OpenClaw, Hermes Agent y SillyTavern, servidos con "mejor esfuerzo" — bajo carga alta pueden aplicar límites temporales.
La configuración es cambiar el base URL:
| Protocolo | Base URL |
|---|---|
| Anthropic Messages (Claude Code, Goose) | https://api.z.ai/api/anthropic |
| OpenAI Chat Completions (el resto) | https://api.z.ai/api/coding/paas/v4 |
| OpenAI Responses | https://api.z.ai/api/v1 |
Y los cuatro MCP incluidos sin costo extra más allá de los créditos: Vision Understanding (leer capturas, diagramas, mockups), Web Search, Web Reader (extraer contenido de URLs) y Zread (leer repositorios de GitHub). Ese último es más útil de lo que suena cuando estás integrando una librería que no conoces.
Casos de uso: qué modelo para qué tarea
Esta es la parte que separa a quien exprime la suscripción de quien la desperdicia.
GLM-5.3 → trabajo pesado y largo. Refactors que tocan quince archivos, migraciones, debugging de algo que llevas horas persiguiendo, implementación completa de una spec. Es donde el salto de esta versión se nota: en su benchmark interno pasó de 23,4% a 34,5% de tareas completadas contra GLM-5.2, y consumiendo menos tokens de output. En Terminal-Bench 3.0 saltó de 4,6 a 28,3. Úsalo con reasoning_effort: max y no lo uses para nada trivial.
GLM-5-Turbo → automatizaciones y latencia. Todo lo que corre en un cron, en un webhook o en un pipeline. Aquí no necesitas razonamiento profundo, necesitas respuestas consistentes y rápidas. Es también mi opción por defecto para chatbots donde el usuario está esperando.
GLM-4.7 → el día a día. Escribir un endpoint, ajustar un test, explicarme un archivo que no escribí yo, generar un script de migración. Multiplicador 16 en output contra 24 de GLM-5.3: te rinde bastante más y para el 60% de las tareas la diferencia de calidad no se percibe.
GLM-4.7-FlashX / GLM-4.5-Air → volumen. Clasificar tickets, extraer campos de texto, hacer routing entre agentes, resumir. A $0,07 de input por millón, FlashX es prácticamente gratis para procesar lotes.
GLM-4.6V / GLM-5V-Turbo → visión. Pasarle una captura de un bug de UI, un diagrama de arquitectura en foto, una tabla en PDF. El Vision MCP integrado en el plan lo hace especialmente cómodo dentro del flujo de coding.
Una nota sobre chatbots: si estás construyendo interacción conversacional con usuarios reales, la combinación GLM-5-Turbo + Web Search MCP da una experiencia notablemente más natural de lo que el precio sugeriría. Es uno de los usos donde más valor he sacado y del que menos se habla.
Mi experiencia real: tres meses, flujo concreto
Mi manera de trabajar es esta y creo que explica por qué me funciona tan bien:
Defino las specs con otro modelo. Uso Grok, GPT o Claude para la parte de pensar el problema: arquitectura, tradeoffs, criterios de aceptación, qué archivos toco. Esa conversación es exploratoria, iterativa, y ahí quiero el mejor razonamiento disponible sin importar el costo, porque son pocos tokens.
Ejecuto las specs con GLM. Una vez la spec está escrita y es inequívoca, GLM-5.3 la implementa. Y esto es lo importante: ejecutar una spec bien definida es un problema distinto a diseñarla. Requiere seguir instrucciones, mantener contexto, no inventar, usar herramientas correctamente. GLM es muy bueno en eso, y ahí es donde el precio deja de tener sentido a favor tuyo.
Los créditos, seamos claros, no alcanzan para codificar todo el día en Lite. Si tu trabajo es ocho horas de agente escupiendo código, vas a chocar contra el límite de 5 horas. Pero para mi patrón —ráfagas de ejecución intercaladas con revisión humana— sobra. Y el 50% de descuento fuera de hora pico me duplica el margen efectivo.
La app y el chat también cuentan. Fuera del IDE uso la aplicación de Z.ai para tareas que no requieren razonamiento profundo: revisar un tema, resumir documentación, verificar algo rápido, procesos repetitivos. Comparado con abrir un Sonnet para eso, es sensiblemente más eficiente en costo y suficientemente bueno. No es donde está la magia, pero es donde está el ahorro acumulado.
Lo honesto: para quién NO es esto
Si algo tengo claro después de tres meses es que esta no es una herramienta de entrada.
No es para ti si:
- Estás aprendiendo a programar y necesitas que el modelo te guíe paso a paso, corrija tus supuestos y te explique por qué algo está mal. GLM ejecuta muy bien; no te va a rescatar de una spec mal pensada. Si le das instrucciones vagas, te devuelve trabajo vago con mucha confianza.
- Quieres una experiencia "todo incluido" sin configurar nada. Aquí hay que entender base URLs, protocolos, límites de cuota, multiplicadores y horarios. No es difícil, pero es fricción real.
- Necesitas el techo absoluto de capacidad. En el propio benchmark de Z.ai, GLM-5.3 alcanza 34,5% donde Claude Fable 5 llega a 39,5%. La brecha existe y en tareas de frontera se siente.
- Necesitas garantía de reembolso. No hay. Punto.
Sí es para ti si: ya sabes definir un problema, ya tienes criterio para revisar lo que un agente produce, y tu cuello de botella es el costo de ejecutar mucho, no la calidad del razonamiento en la frontera.
Otras dos cosas que debes considerar antes de pagar: Z.ai es una empresa china (Zhipu AI) y tus prompts pasan por su infraestructura — si manejas código bajo NDA estricto o datos regulados, revísalo con quien corresponda. Y los planes están atados a herramientas soportadas: si tu stack usa algo que no está en esa lista, la suscripción no te sirve y tendrías que ir por API pagada por token.
El código de invitado: qué gana cada quien, sin adornos
Ya que voy a compartirlo, prefiero explicarte exactamente cómo funciona el programa en vez de solo tirarte el link.
Lo que ganas tú (invitado):
- 10% de descuento instantáneo sobre el monto de tu primera suscripción al GLM Coding Plan. Se aplica automáticamente en el checkout, sin escribir ningún código.
- Aplica solo si eres usuario nuevo o nunca has pagado una suscripción en la plataforma.
- Aplica solo a la primera orden. Renovaciones, upgrades y downgrades no.
- No se acumula con otras campañas de descuento de primera compra.
- Debes completar el pago dentro de las 72 horas de registrarte con el enlace.
Lo que gano yo (invitador):
- Créditos de plataforma equivalentes al 10% del monto que efectivamente pagaste. No es efectivo: son créditos que solo sirven para pagar suscripciones, packs o llamadas de API dentro de Z.ai. No se retiran ni se transfieren.
- Y hay un umbral: no cobro nada hasta acumular 3 invitados válidos. Antes de eso los créditos quedan en estado pendiente.
Te lo cuento en detalle porque el incentivo cambia cómo debes leer una reseña, y prefiero que lo sepas y decidas tú.
👉 Enlace con 10% de descuento (código: V2TH8OSBEF)
Antes de usarlo: el plan Lite mensual son ~$18 con el descuento aplicado. Pruébalo un mes con tu flujo real. Si a los 30 días no chocaste contra el límite de 5 horas y el modelo hizo lo que necesitabas, entonces sí evalúa el anual con 30% off. No al revés.
Veredicto
Z.ai no es "el Claude barato". Es una herramienta con un perfil distinto: excelente ejecutando trabajo bien definido, a un precio que cambia la ecuación de cuánto puedes automatizar. Si tu flujo separa el pensar del hacer —definir specs con un modelo, ejecutarlas con otro— encaja casi perfecto. Si esperas que un solo modelo haga todo, te vas a frustrar.
Después de tres meses mi conclusión es simple: siento que me da más de lo que pago. Pero esa frase solo aplica si ya sabes qué pedirle.
Fuentes
- Z.AI Developer Docs — GLM Coding Plan Overview
- Z.AI Developer Docs — Pricing
- Z.AI Developer Docs — GLM-5.3
- Z.AI Developer Docs — Tool Integration
- Z.AI Developer Docs — FAQ del GLM Coding Plan
- Z.AI Developer Docs — Reglas del programa de invitación
- TechNode — Z.ai launches GLM-5.3 with claimed 50% gain on coding benchmark
- VentureBeat — GLM-5.3 is here with advanced cyber capabilities
- MarkTechPost — Z.ai Ships GLM-5.3 Without Retraining the Base Model
- AI Pricing Guru — GLM Coding Plan Pricing
Divulgación: este artículo contiene un enlace de invitación. Recibo créditos de plataforma si te suscribes a través de él. Los datos técnicos y de precios provienen de la documentación oficial de Z.ai y fueron verificados en agosto de 2026; verifica los montos actuales antes de pagar.
Posts Relacionados
Continúa explorando contenido similar que te puede interesar

Mi Viaje Aprendiendo Python: Consejos y Recursos
Una crónica personal sobre el proceso de aprender Python desde cero, los recursos que me ayudaron y las dificultades que encontré.
OpenCode Go en 2026: $10/mes, límites reales y el veredicto tras usarlo
El veredicto sobre OpenCode Go: sí vale la pena, con matices. $5 el primer mes, $10/mes después — qué modelos incluye, cómo funcionan sus límites de uso reales y cuándo NO deberías pagarlo. Incluye cómo conseguir $5 de crédito extra.
Por qué en 2026 ya no deberías depender de un solo proveedor de IA para programar
Si te quedas sin cuota de IA a mitad de mes, el problema no es tu disciplina: es que pusiste todos los huevos en una canasta. Aprende a diversificar entre DeepSeek, Qwen, GLM, Kimi, Claude y GPT para programar más barato y sin interrupciones.