Imagen destacada para Langfuse: cómo ver qué hace tu chatbot en producción

Langfuse: cómo ver qué hace tu chatbot en producción

Publicado el:

Tiempo de lectura: 8 min

Tema: Tecnologia

Autor: Leandro Valencia

#langfuse#observabilidad de llms#chatbot con ia#monitoreo de prompts#costos de openai

Tu bot con IA responde, pero no sabes si bien. Qué es la observabilidad de LLMs y cómo usar Langfuse, open source, para ver costos, errores y calidad.

Tabla de Contenidos

Un lunes llega el mensaje del cliente: "El bot le dijo a una usuaria que el envío era gratis. No lo es". Abres el panel y ves la conversación. Lo que no ves es por qué respondió eso.

¿Qué prompt estaba activo? ¿Qué documentos le pasó la búsqueda? ¿Fue el modelo, el contexto o un cambio del viernes? Sin esos datos, arreglarlo es adivinar.

En el trabajo de implementar chatbots y flujos de WhatsApp para empresas, esta escena se repite. Casi todo el contenido sobre IA enseña a construir el bot. Muy poco enseña a saber qué está haciendo una vez que habla con clientes reales. Si todavía estás armando ese flujo, la pieza anterior está en cómo llevar un proceso a un chatbot. Esto es lo que viene después de lanzarlo.

Las tres fallas silenciosas de un bot con IA

Un bot tradicional falla con ruido: se cae, devuelve un error y alguien se entera. Un bot con IA falla en silencio, porque siempre responde algo. Estas son las tres fallas que más se ven en producción:

  1. Respuestas que suenan bien y están mal. El modelo inventa un precio, una política o un horario con total seguridad. Nadie lo nota hasta que un cliente se queja.
  2. Costos que se disparan sin una causa visible. Un historial que crece sin límite, o un bucle en un agente, duplica la factura de la API. La factura llega a fin de mes, cuando ya no hay nada que recortar.
  3. Prompts que empeoran sin que nadie lo sepa. Cambias el prompt para arreglar un caso y rompes otros tres. Sin versiones comparables, te enteras por los usuarios.

Las tres tienen la misma causa: el problema no es solo el modelo. Es que no puedes ver qué pasó por dentro.

Qué es la observabilidad de LLMs

Piensa en la caja negra de un avión. No evita el accidente. Permite reconstruir, paso a paso, qué pasó. La observabilidad de LLMs hace eso con tu bot: guarda cada paso de cada conversación para revisarlo después.

Cada interacción queda registrada como una traza. La pregunta "¿El envío es gratis?" se vería así:

  • Traza: mensaje de la usuaria en WhatsApp (1,8 s · USD 0,004)
    • Búsqueda en la base de conocimiento: los documentos que encontró
    • Llamada al modelo: el prompt exacto y su versión, la respuesta y los tokens
    • Respuesta enviada al usuario

Con eso, el caso del envío gratis se resuelve en minutos. Ves que la búsqueda trajo una promoción vencida y que el modelo la tomó como vigente. Ya no adivinas: sabes qué corregir.

Si vienes del marketing, es el equivalente a tener analítica de las conversaciones: quién preguntó qué, cuánto costó y qué tan bien salió.

Qué resuelve Langfuse

Langfuse es una plataforma open source, con licencia MIT, para rastrear, evaluar y mejorar aplicaciones con modelos de lenguaje. Cada función responde a una de las fallas de arriba.

Función Qué hace Qué falla resuelve
Trazas Registra cada paso de cada conversación, con costo y latencia "No sé por qué respondió eso"
Gestión de prompts Versiona los prompts y permite volver a una versión anterior "El prompt empeoró y no sé cuándo"
Evaluaciones Califica respuestas con otro modelo, con reglas o con revisión humana "Suena bien pero está mal"
Experimentos Prueba un prompt o un modelo nuevo contra casos reales antes de publicarlo "Arreglé uno y rompí tres"
Paneles Costo, latencia y calidad en el tiempo, con alertas "La factura se duplicó"

Se conecta con OpenAI, Anthropic, Google, LangChain, el Vercel AI SDK, CrewAI, n8n y cualquier stack que hable OpenTelemetry. En la página de precios aparecen equipos como Canva, Khan Academy y Hugging Face.

El 16 de enero de 2026, ClickHouse compró Langfuse. El proyecto sigue siendo open source y autoalojable, con la misma licencia MIT. En el anuncio, ClickHouse situó el proyecto por encima de las 20.000 estrellas en GitHub al cierre de 2025. La compra no cambia el uso de esta guía: la nube sigue en los mismos endpoints y el código de instrumentación es el mismo contra la nube o contra un servidor propio.

Cuánto cuesta

Plan Precio Uso incluido Retención
Hobby Gratis 50.000 unidades/mes, 2 usuarios 30 días
Core USD 29/mes 100.000 unidades/mes, usuarios ilimitados 90 días
Pro USD 199/mes 100.000 unidades/mes, usuarios ilimitados 3 años
Autoalojado Gratis (pagas tu servidor) Sin tope de la plataforma La que definas

Precios de la página oficial, revisados en octubre de 2026. En Hobby no hay unidades extra: al llegar al cupo, el plan se queda corto. En Core y Pro las primeras 100.000 unidades van incluidas y el consumo adicional se cobra por tramos, empezando en USD 8 por cada 100.000. Una unidad es un punto de trazado: la traza, cada paso y cada evaluación.

Para probar, Hobby alcanza. Elige la región al crear el proyecto. La nube guarda los datos en Estados Unidos, la Unión Europea o Japón, y la URL base cambia según esa elección.

Tu primera traza en diez minutos

El camino más corto es un bot en Python que ya usa OpenAI. Si usas n8n, LangChain u otra herramienta, la idea es la misma y el detalle está en la guía de integraciones.

  1. Crea la cuenta en cloud.langfuse.com, crea un proyecto y copia las dos llaves, la pública y la secreta.
  2. Instala el paquete:
pip install langfuse openai
  1. Configura las variables de entorno. La URL de la Unión Europea es la de abajo. Si elegiste otra región, usa https://us.cloud.langfuse.com o https://jp.cloud.langfuse.com.
LANGFUSE_PUBLIC_KEY="pk-lf-..."
LANGFUSE_SECRET_KEY="sk-lf-..."
LANGFUSE_BASE_URL="https://cloud.langfuse.com"
OPENAI_API_KEY="sk-..."
  1. Cambia el import y agrupa la conversación. Langfuse trae un reemplazo del cliente de OpenAI que registra la llamada. propagate_attributes marca el usuario y la sesión para que el panel pueda juntar los turnos de un mismo chat. En un script que termina enseguida, flush() empuja los datos antes de que el proceso se cierre.
from langfuse import observe, propagate_attributes, get_client
from langfuse.openai import openai  # antes: import openai

@observe()
def responder(mensaje: str, usuario_id: str, conversacion_id: str):
    with propagate_attributes(user_id=usuario_id, session_id=conversacion_id):
        respuesta = openai.chat.completions.create(
            name="respuesta-bot",
            model="gpt-4o-mini",
            messages=[
                {"role": "system", "content": "Eres el asistente de una tienda online."},
                {"role": "user", "content": mensaje},
            ],
        )
        return respuesta.choices[0].message.content

print(responder("¿El envío es gratis?", "cliente-123", "chat-456"))
get_client().flush()
  1. Abre el panel. En Tracing verás la traza con el prompt, la respuesta, los tokens, el costo y el tiempo. Con el session_id puedes seguir la conversación completa de ese usuario.

Si quieres los datos en tu servidor

Puedes autoalojarlo con Docker. En local, clona el repo, revisa los secretos marcados como CHANGEME en el docker-compose.yml y levanta los contenedores:

git clone https://github.com/langfuse/langfuse.git
cd langfuse
docker compose up

La documentación dice que en unos 2 o 3 minutos el contenedor web queda listo en http://localhost:3000. No hay usuario administrador de fábrica: el primer acceso es un registro. Para una máquina de producción, la misma guía recomienda al menos 4 núcleos y 16 GB de RAM, y recuerda que Compose no da alta disponibilidad. Para una pyme que empieza, el plan gratuito en la nube suele salir más barato que ese servidor.

Cuándo vale la pena

Langfuse vale la pena desde el momento en que el bot habla con clientes reales. Antes de eso, casi siempre sobra.

Úsalo si:

  • El bot atiende clientes o maneja precios, pedidos o soporte.
  • Implementas bots para terceros y tienes que explicar qué pasó cuando algo falla.
  • Gastas más que unos pocos dólares al mes en APIs de IA y quieres saber en qué.
  • Cambias prompts con frecuencia o más de una persona los edita.

Todavía no lo necesitas si:

  • Estás en un prototipo para ti o en una prueba de fin de semana.
  • La plataforma del bot es cerrada y no deja conectar herramientas externas. En ese caso, mira qué registros ofrece la propia plataforma.

Alternativas. LangSmith y Braintrust cubren un terreno parecido. La diferencia práctica de Langfuse es que es open source y puedes llevarte los datos a un servidor propio.

Construir es la mitad del trabajo

Lanzar un bot con IA toma una tarde. Saber si está funcionando bien es lo que separa un experimento de un producto en el que un cliente puede confiar.

Langfuse no hace que el modelo sea más inteligente. Hace algo más útil: deja ver qué está pasando, para corregir con el prompt, los documentos y el costo a la vista. El plan de entrada es gratis. Seguir a ciegas, después de la primera queja de un cliente, ya no tiene disculpa.

Guía paso a paso

  1. Crea el proyecto en Langfuse

    Entra en cloud.langfuse.com, crea un proyecto y copia la llave pública y la secreta. Elige la región donde se van a guardar los datos.

  2. Instala el paquete

    En el entorno del bot ejecuta pip install langfuse openai. Langfuse reemplaza el cliente de OpenAI y registra cada llamada.

  3. Configura las variables

    Define LANGFUSE_PUBLIC_KEY, LANGFUSE_SECRET_KEY, LANGFUSE_BASE_URL y OPENAI_API_KEY antes de arrancar el proceso.

  4. Envuelve la llamada al modelo

    Importa openai desde langfuse.openai y propaga user_id y session_id. Así cada conversación queda agrupada.

  5. Revisa la traza en el panel

    Abre Tracing, localiza la llamada y lee el prompt, la respuesta, los tokens, el costo y el tiempo. En un script corto llama a flush antes de salir.

Preguntas frecuentes

¿Qué es Langfuse?

Langfuse es una plataforma open source, con licencia MIT, para rastrear, evaluar y mejorar aplicaciones que usan modelos de lenguaje. Registra cada paso de una conversación, versiona prompts y muestra costo, latencia y calidad.

¿Langfuse es gratis?

El plan Hobby no cuesta y no pide tarjeta. Incluye 50.000 unidades al mes, 2 usuarios y 30 días de retención. También puedes autoalojarlo: el software es gratis y pagas el servidor.

¿Sirve si mi bot no está en Python?

Sí. El ejemplo de esta guía usa el SDK de Python porque es el camino más corto, pero Langfuse también tiene SDK de JavaScript, integración con LangChain, Vercel AI SDK, CrewAI, n8n y OpenTelemetry.

¿En qué se diferencia del historial del chatbot?

El historial muestra el mensaje del usuario y la respuesta. Una traza muestra además qué prompt estaba activo, qué documentos recuperó la búsqueda, qué modelo respondió, cuántos tokens gastó y cuánto tardó.

¿Tengo que autoalojarlo?

No. Para probar y para la mayoría de pymes, el plan gratuito en la nube alcanza. El autoalojamiento conviene cuando el volumen, la residencia de los datos o el costo del plan cloud lo justifican.

Posts Relacionados

Continúa explorando contenido similar que te puede interesar

Alianzas

Herramientas que uso a diario y con las que la comunidad consigue mejores condiciones.

Enlaces de afiliado. El precio para ti no cambia.Ver todas las alianzas
Programa de formación

¿Listo para transformar tu idea en un proyecto real?

Transforma es el programa donde aprenderás a crear, ejecutar y escalar tu proyecto con claridad y método.

Conocer el Programa Transforma