
Langfuse: cómo ver qué hace tu chatbot en producción
Publicado el:
Tiempo de lectura: 8 min
Tema: Tecnologia
Autor: Leandro Valencia
Tu bot con IA responde, pero no sabes si bien. Qué es la observabilidad de LLMs y cómo usar Langfuse, open source, para ver costos, errores y calidad.
Tabla de Contenidos
- Las tres fallas silenciosas de un bot con IA
- Qué es la observabilidad de LLMs
- Cuándo vale la pena
- Construir es la mitad del trabajo
Un lunes llega el mensaje del cliente: "El bot le dijo a una usuaria que el envío era gratis. No lo es". Abres el panel y ves la conversación. Lo que no ves es por qué respondió eso.
¿Qué prompt estaba activo? ¿Qué documentos le pasó la búsqueda? ¿Fue el modelo, el contexto o un cambio del viernes? Sin esos datos, arreglarlo es adivinar.
En el trabajo de implementar chatbots y flujos de WhatsApp para empresas, esta escena se repite. Casi todo el contenido sobre IA enseña a construir el bot. Muy poco enseña a saber qué está haciendo una vez que habla con clientes reales. Si todavía estás armando ese flujo, la pieza anterior está en cómo llevar un proceso a un chatbot. Esto es lo que viene después de lanzarlo.
Las tres fallas silenciosas de un bot con IA
Un bot tradicional falla con ruido: se cae, devuelve un error y alguien se entera. Un bot con IA falla en silencio, porque siempre responde algo. Estas son las tres fallas que más se ven en producción:
- Respuestas que suenan bien y están mal. El modelo inventa un precio, una política o un horario con total seguridad. Nadie lo nota hasta que un cliente se queja.
- Costos que se disparan sin una causa visible. Un historial que crece sin límite, o un bucle en un agente, duplica la factura de la API. La factura llega a fin de mes, cuando ya no hay nada que recortar.
- Prompts que empeoran sin que nadie lo sepa. Cambias el prompt para arreglar un caso y rompes otros tres. Sin versiones comparables, te enteras por los usuarios.
Las tres tienen la misma causa: el problema no es solo el modelo. Es que no puedes ver qué pasó por dentro.
Qué es la observabilidad de LLMs
Piensa en la caja negra de un avión. No evita el accidente. Permite reconstruir, paso a paso, qué pasó. La observabilidad de LLMs hace eso con tu bot: guarda cada paso de cada conversación para revisarlo después.
Cada interacción queda registrada como una traza. La pregunta "¿El envío es gratis?" se vería así:
- Traza: mensaje de la usuaria en WhatsApp (1,8 s · USD 0,004)
- Búsqueda en la base de conocimiento: los documentos que encontró
- Llamada al modelo: el prompt exacto y su versión, la respuesta y los tokens
- Respuesta enviada al usuario
Con eso, el caso del envío gratis se resuelve en minutos. Ves que la búsqueda trajo una promoción vencida y que el modelo la tomó como vigente. Ya no adivinas: sabes qué corregir.
Si vienes del marketing, es el equivalente a tener analítica de las conversaciones: quién preguntó qué, cuánto costó y qué tan bien salió.
Qué resuelve Langfuse
Langfuse es una plataforma open source, con licencia MIT, para rastrear, evaluar y mejorar aplicaciones con modelos de lenguaje. Cada función responde a una de las fallas de arriba.
| Función | Qué hace | Qué falla resuelve |
|---|---|---|
| Trazas | Registra cada paso de cada conversación, con costo y latencia | "No sé por qué respondió eso" |
| Gestión de prompts | Versiona los prompts y permite volver a una versión anterior | "El prompt empeoró y no sé cuándo" |
| Evaluaciones | Califica respuestas con otro modelo, con reglas o con revisión humana | "Suena bien pero está mal" |
| Experimentos | Prueba un prompt o un modelo nuevo contra casos reales antes de publicarlo | "Arreglé uno y rompí tres" |
| Paneles | Costo, latencia y calidad en el tiempo, con alertas | "La factura se duplicó" |
Se conecta con OpenAI, Anthropic, Google, LangChain, el Vercel AI SDK, CrewAI, n8n y cualquier stack que hable OpenTelemetry. En la página de precios aparecen equipos como Canva, Khan Academy y Hugging Face.
El 16 de enero de 2026, ClickHouse compró Langfuse. El proyecto sigue siendo open source y autoalojable, con la misma licencia MIT. En el anuncio, ClickHouse situó el proyecto por encima de las 20.000 estrellas en GitHub al cierre de 2025. La compra no cambia el uso de esta guía: la nube sigue en los mismos endpoints y el código de instrumentación es el mismo contra la nube o contra un servidor propio.
Cuánto cuesta
| Plan | Precio | Uso incluido | Retención |
|---|---|---|---|
| Hobby | Gratis | 50.000 unidades/mes, 2 usuarios | 30 días |
| Core | USD 29/mes | 100.000 unidades/mes, usuarios ilimitados | 90 días |
| Pro | USD 199/mes | 100.000 unidades/mes, usuarios ilimitados | 3 años |
| Autoalojado | Gratis (pagas tu servidor) | Sin tope de la plataforma | La que definas |
Precios de la página oficial, revisados en octubre de 2026. En Hobby no hay unidades extra: al llegar al cupo, el plan se queda corto. En Core y Pro las primeras 100.000 unidades van incluidas y el consumo adicional se cobra por tramos, empezando en USD 8 por cada 100.000. Una unidad es un punto de trazado: la traza, cada paso y cada evaluación.
Para probar, Hobby alcanza. Elige la región al crear el proyecto. La nube guarda los datos en Estados Unidos, la Unión Europea o Japón, y la URL base cambia según esa elección.
Tu primera traza en diez minutos
El camino más corto es un bot en Python que ya usa OpenAI. Si usas n8n, LangChain u otra herramienta, la idea es la misma y el detalle está en la guía de integraciones.
- Crea la cuenta en cloud.langfuse.com, crea un proyecto y copia las dos llaves, la pública y la secreta.
- Instala el paquete:
pip install langfuse openai
- Configura las variables de entorno. La URL de la Unión Europea es la de abajo. Si elegiste otra región, usa
https://us.cloud.langfuse.comohttps://jp.cloud.langfuse.com.
LANGFUSE_PUBLIC_KEY="pk-lf-..."
LANGFUSE_SECRET_KEY="sk-lf-..."
LANGFUSE_BASE_URL="https://cloud.langfuse.com"
OPENAI_API_KEY="sk-..."
- Cambia el import y agrupa la conversación. Langfuse trae un reemplazo del cliente de OpenAI que registra la llamada.
propagate_attributesmarca el usuario y la sesión para que el panel pueda juntar los turnos de un mismo chat. En un script que termina enseguida,flush()empuja los datos antes de que el proceso se cierre.
from langfuse import observe, propagate_attributes, get_client
from langfuse.openai import openai # antes: import openai
@observe()
def responder(mensaje: str, usuario_id: str, conversacion_id: str):
with propagate_attributes(user_id=usuario_id, session_id=conversacion_id):
respuesta = openai.chat.completions.create(
name="respuesta-bot",
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "Eres el asistente de una tienda online."},
{"role": "user", "content": mensaje},
],
)
return respuesta.choices[0].message.content
print(responder("¿El envío es gratis?", "cliente-123", "chat-456"))
get_client().flush()
- Abre el panel. En Tracing verás la traza con el prompt, la respuesta, los tokens, el costo y el tiempo. Con el
session_idpuedes seguir la conversación completa de ese usuario.
Si quieres los datos en tu servidor
Puedes autoalojarlo con Docker. En local, clona el repo, revisa los secretos marcados como CHANGEME en el docker-compose.yml y levanta los contenedores:
git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up
La documentación dice que en unos 2 o 3 minutos el contenedor web queda listo en http://localhost:3000. No hay usuario administrador de fábrica: el primer acceso es un registro. Para una máquina de producción, la misma guía recomienda al menos 4 núcleos y 16 GB de RAM, y recuerda que Compose no da alta disponibilidad. Para una pyme que empieza, el plan gratuito en la nube suele salir más barato que ese servidor.
Cuándo vale la pena
Langfuse vale la pena desde el momento en que el bot habla con clientes reales. Antes de eso, casi siempre sobra.
Úsalo si:
- El bot atiende clientes o maneja precios, pedidos o soporte.
- Implementas bots para terceros y tienes que explicar qué pasó cuando algo falla.
- Gastas más que unos pocos dólares al mes en APIs de IA y quieres saber en qué.
- Cambias prompts con frecuencia o más de una persona los edita.
Todavía no lo necesitas si:
- Estás en un prototipo para ti o en una prueba de fin de semana.
- La plataforma del bot es cerrada y no deja conectar herramientas externas. En ese caso, mira qué registros ofrece la propia plataforma.
Alternativas. LangSmith y Braintrust cubren un terreno parecido. La diferencia práctica de Langfuse es que es open source y puedes llevarte los datos a un servidor propio.
Construir es la mitad del trabajo
Lanzar un bot con IA toma una tarde. Saber si está funcionando bien es lo que separa un experimento de un producto en el que un cliente puede confiar.
Langfuse no hace que el modelo sea más inteligente. Hace algo más útil: deja ver qué está pasando, para corregir con el prompt, los documentos y el costo a la vista. El plan de entrada es gratis. Seguir a ciegas, después de la primera queja de un cliente, ya no tiene disculpa.
Guía paso a paso
Crea el proyecto en Langfuse
Entra en cloud.langfuse.com, crea un proyecto y copia la llave pública y la secreta. Elige la región donde se van a guardar los datos.
Instala el paquete
En el entorno del bot ejecuta pip install langfuse openai. Langfuse reemplaza el cliente de OpenAI y registra cada llamada.
Configura las variables
Define LANGFUSE_PUBLIC_KEY, LANGFUSE_SECRET_KEY, LANGFUSE_BASE_URL y OPENAI_API_KEY antes de arrancar el proceso.
Envuelve la llamada al modelo
Importa openai desde langfuse.openai y propaga user_id y session_id. Así cada conversación queda agrupada.
Revisa la traza en el panel
Abre Tracing, localiza la llamada y lee el prompt, la respuesta, los tokens, el costo y el tiempo. En un script corto llama a flush antes de salir.
Preguntas frecuentes
¿Qué es Langfuse?
Langfuse es una plataforma open source, con licencia MIT, para rastrear, evaluar y mejorar aplicaciones que usan modelos de lenguaje. Registra cada paso de una conversación, versiona prompts y muestra costo, latencia y calidad.
¿Langfuse es gratis?
El plan Hobby no cuesta y no pide tarjeta. Incluye 50.000 unidades al mes, 2 usuarios y 30 días de retención. También puedes autoalojarlo: el software es gratis y pagas el servidor.
¿Sirve si mi bot no está en Python?
Sí. El ejemplo de esta guía usa el SDK de Python porque es el camino más corto, pero Langfuse también tiene SDK de JavaScript, integración con LangChain, Vercel AI SDK, CrewAI, n8n y OpenTelemetry.
¿En qué se diferencia del historial del chatbot?
El historial muestra el mensaje del usuario y la respuesta. Una traza muestra además qué prompt estaba activo, qué documentos recuperó la búsqueda, qué modelo respondió, cuántos tokens gastó y cuánto tardó.
¿Tengo que autoalojarlo?
No. Para probar y para la mayoría de pymes, el plan gratuito en la nube alcanza. El autoalojamiento conviene cuando el volumen, la residencia de los datos o el costo del plan cloud lo justifican.
Posts Relacionados
Continúa explorando contenido similar que te puede interesar

Opus 5.5 vs Sonnet 5.5: qué modelo de Claude usar en 2026
Comparamos los modelos de Anthropic: Opus 5.5, Sonnet 5.5, Fable 5.1 y Haiku 4.5. Precios, fortalezas de cada uno y cuál conviene usar según la tarea.

The Witcher 3 Remastered: la lección del remaster para tu software
The Witcher 3 Remastered llega gratis con path tracing y combate nuevo. Te explico cómo el modelo remaster le da nueva vida a cualquier producto de software.

Spec-Driven Development: guía de BDD, DDD, MDE y API-First
Qué es el Spec-Driven Development, por qué volvió con la IA y cómo aplicarlo con BDD, DDD, MDE y API-First. Con ejemplos, tabla comparativa y flujo con agentes.
Alianzas
Herramientas que uso a diario y con las que la comunidad consigue mejores condiciones.