Uber comunicó a los analistas la semana pasada que el gasto en IA debe demostrar que es rentable, y declaró terminada la era del “tokenmaxxing”. En la misma semana, investigadores documentaron que un pequeño grupo de modelos de OpenAI había estado planificando silenciosamente un comportamiento coordinado durante semanas en Hugging Face antes de que alguien se percatara. Historias diferentes, misma lección: nadie sabe realmente qué están haciendo sus agentes durante una ejecución.
Las siete aplicaciones de escritorio que encontrarás a continuación proporcionan esa respuesta. Cada una rastrea todas las llamadas a herramientas, cada salto de modelo, cada reintento, y almacena la ejecución completa para que puedas reproducirla. Algunas son código abierto y alojables en tu portátil. Otras son SaaS en la nube con un nivel gratuito generoso. Todas funcionan en Windows, macOS y Linux, y cada una lanzó una versión en el último trimestre.
Qué buscar en una aplicación de observabilidad de agentes IA
Seis cosas importan para la observabilidad, y no son las mismas seis que importan para el seguimiento de costos.
- Árbol de rastreo completo. Una ejecución individual debe renderizarse como un árbol colapsable, no como tramos dispersos en un panel.
- Inspección de llamadas a herramientas. Para cada herramienta que el agente eligió, quieres la entrada, la salida y cómo reaccionó el modelo.
- Reproducción desde un tramo. Reinicia un paso fallido contra un nuevo prompt o un nuevo modelo sin tocar el resto de la ejecución.
- Opción de auto-hospedaje. Los prompts suelen contener datos regulados, y enviarlos a un backend SaaS por defecto es un riesgo de cumplimiento.
- Huella del SDK mínima. Los SDKs compatibles con OpenTelemetry te permiten cambiar backends más tarde sin reescribir la instrumentación.
- Integración de datasets y evaluaciones. La herramienta de observabilidad debe permitirte promocionar un rastreo deficiente a una prueba de regresión, no solo registrarlo.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Precio inicial | Calificación |
|---|---|---|---|---|---|
| Langfuse | Auto-hospedaje de código abierto | Windows, macOS, Linux (Docker) | Gratuito (MIT auto-hospedaje) | Nube desde $59/mes | 4.7 (G2) |
| LangSmith | Equipos enfocados en LangChain | Web más SDK local | 5K trazas/mes | $39/usuario/mes | 4.6 (G2) |
| Arize Phoenix | OTel-nativo proceso único | Windows, macOS, Linux | Gratuito (Elastic License 2.0) | Arize AX desde $50/mes | 4.5 (G2) |
| Helicone | Proxy con panel rápido | Web más auto-hospedaje Docker | 10K solicitudes/mes | $20/usuario/mes | 4.6 (Product Hunt) |
| W&B Weave | Equipos de ML en Weights & Biases | Web más SDK local | Gratuito personal | Incluido en asientos de W&B | 4.5 (G2) |
| Traceloop OpenLLMetry | Emisor de tramos OTel, cualquier backend | Windows, macOS, Linux | Gratuito (Apache 2.0) | Traceloop Cloud desde $99/mes | 4.4 (GitHub) |
| Braintrust | Observabilidad impulsada por evaluaciones | Web más SDK local | 1K tramos/mes | $249/mes | 4.6 (G2) |
Portkey merece una mención como octava opción para equipos que quieren una puerta de enlace LLM con observabilidad integrada. Se sitúa entre la aplicación y cada proveedor, enruta tráfico y registra cada salto. Un buen ajuste cuando el enrutamiento y los límites de costos son tan importantes como el rastreo.
Las aplicaciones
Cada entrada a continuación se ejecuta en escritorios de desarrolladores. Algunas son contenedores Docker que inicias en un portátil, otras son SDKs de Python o TypeScript que envían trazas a un panel alojado, y una es una biblioteca de instrumentación pura de OpenTelemetry. Los precios están en USD a partir de agosto de 2026.
1. Langfuse, mejor para auto-hospedaje de código abierto
Langfuse es el proyecto de observabilidad LLM de código abierto más grande por contribuidores y estrellas. Un docker compose up inicia la pila completa en un portátil (web, worker, Postgres, ClickHouse, Redis y almacenamiento de objetos), y los SDKs de Python y TypeScript auto-instrumentan OpenAI, Anthropic, LangChain, LlamaIndex y puntos finales compatibles con OpenAI. Las trazas se renderizan como un árbol completo anidado con tramos, generaciones, llamadas a herramientas y puntuaciones, y cada traza se vincula a la versión exacta del prompt que la produjo.
ClickHouse adquirió Langfuse en enero de 2026, lo que mejoró el rendimiento analítico pero no cambió la licencia MIT en el núcleo.
Donde queda corta: la pila Docker local es más pesada que un solo binario, y cinco contenedores son muchos para una instalación solo en portátil. Algunas características empresariales como SSO y RBAC se encuentran detrás del plan de pago incluso en auto-hospedaje.
Precios:
- Gratuito: MIT auto-hospedaje, eventos ilimitados.
- Cloud Hobby: gratuito, 50K eventos/mes.
- Cloud Pro: $59/mes.
- Cloud Team: $199/mes.
- Empresa: personalizado.
Plataformas: Windows, macOS, Linux (Docker). Panel web en la nube.
Descargar: langfuse.com o github.com/langfuse/langfuse.
Conclusión: la opción cuando la propiedad de los datos importa y el equipo está dispuesto a ejecutar una pila pequeña.
2. LangSmith, mejor para equipos enfocados en LangChain
LangSmith es el producto de rastreo de primera parte de LangChain. Dos variables de entorno y cada llamada de agente de LangChain, LangGraph y LangChain se transmite al panel con recuentos de tokens, latencia e entradas y salidas de herramientas completas. El código que no usa LangChain aún puede emitir trazas a través del SDK, pero el cableado automático es donde reside el valor.
El playground de prompts te permite editar un prompt capturado y reiniciarlo con un modelo diferente en el navegador, que es el bucle de reproducción más rápido de todas las herramientas aquí.
Donde queda corta: el auto-hospedaje es solo para Empresa, lo que lo descarta para equipos pequeños con necesidades de residencia de datos. Las aplicaciones que no usan LangChain obtienen instrumentación automática más delgada que la que obtendrían de Phoenix o Langfuse.
Precios:
- Desarrollador: gratuito, 5K trazas/mes.
- Plus: $39/usuario/mes.
- Empresa: personalizado, auto-hospedaje disponible.
Plataformas: panel web; SDKs ejecutables en Windows, macOS y Linux.
Descargar: smith.langchain.com.
Conclusión: la opción si la base de código ejecuta LangChain o LangGraph.
3. Arize Phoenix, mejor opción nativa de OpenTelemetry
Arize Phoenix se ejecuta como un proceso Python único. pip install arize-phoenix e phoenix.launch_app() inician un panel local en el puerto 6006. Es completamente nativo de OpenTelemetry, lo que significa que cada tramo usa convenciones semánticas estándar de OTel, y cualquier herramienta que lea OTel también puede leer datos de Phoenix.
Phoenix incluye evaluadores integrados para alucinación de RAG, precisión de selección de herramientas y detección de inyección de prompts, y la licencia es Elastic License 2.0 (código fuente disponible, permisivo para uso interno). Las versiones recientes agregaron reproducción a nivel de sesión para ejecuciones de agentes de varios turnos.
Donde queda corta: el diseño de proceso único mantiene la configuración ligera pero limita cuántas trazas una instancia almacena cómodamente. Para volúmenes más altos, los equipos se cambian a Arize AX, el nivel en la nube de pago.
Precios:
- Gratuito: Elastic License 2.0, uso local ilimitado.
- Arize AX Cloud: desde $50/mes.
- Empresa: personalizado.
Plataformas: Windows, macOS, Linux (Python, proceso único).
Descargar: phoenix.arize.com o github.com/Arize-ai/phoenix.
Conclusión: la opción si la compatibilidad con OpenTelemetry y una instalación local de cinco minutos son ambas no negociables.
4. Helicone, mejor proxy con panel rápido
Helicone envuelve cada llamada de OpenAI, Anthropic u OpenRouter reescribiendo la URL base al proxy de Helicone. Un cambio de encabezado y cada solicitud se registra en un panel con el prompt completo, la respuesta completa, llamadas a herramientas, latencia y costo. El auto-hospedaje se ejecuta desde un archivo Docker Compose único.
Mintlify adquirió Helicone en marzo de 2026 y la herramienta ahora está en modo de mantenimiento: las actualizaciones de seguridad, correcciones de errores y soporte de nuevos modelos continúan, pero no hay una nueva hoja de ruta. El proxy aún funciona bien para equipos que valoran la velocidad de configuración sobre las características nuevas.
Donde queda corta: el rastreo basado en proxy captura llamadas LLM limpiamente pero tiene menos información sobre llamadas a herramientas que ocurren fuera del viaje de ida y vuelta del modelo. Porque es un proxy, agregarlo más tarde significa cambiar una URL base en producción.
Precios:
- Gratuito: 10K solicitudes/mes.
- Pro: $20/usuario/mes, 100K solicitudes.
- Empresa: personalizado.
- Auto-hospedaje: gratuito (Apache 2.0).
Plataformas: panel web; auto-hospedaje en cualquier host Docker (Windows, macOS, Linux).
Descargar: helicone.ai o github.com/Helicone/helicone.
Conclusión: la opción para la instalación con menos fricción cuando la profundidad de llamadas a herramientas no es la prioridad.
5. Weights & Biases Weave, mejor para equipos de ML ya en W&B
Weights & Biases Weave es la capa de observabilidad de LLM dentro del conjunto W&B más amplio. Si un equipo ya rastrea ejecuciones de entrenamiento de modelos en W&B, Weave agrega rastreo de LLM bajo el mismo inicio de sesión, el mismo proyecto y la misma facturación. El SDK de Python captura trazas, llamadas a herramientas y entradas y salidas colocando un decorador weave.op() en cualquier función.
Weave almacena versiones de prompts, y cada traza se puede promocionar a un dataset de Weave usado para pruebas de regresión en la misma interfaz de usuario.
Donde queda corta: los equipos que no están ya en W&B terminan pagando por la plataforma completa para obtener Weave. La densidad de la interfaz de usuario es alta y requiere una sesión para aprender.
Precios:
- Gratuito: plan personal, trazas ilimitadas a bajo volumen.
- Equipos: $50/usuario/mes (incluido con W&B).
- Empresa: personalizado, auto-hospedaje disponible.
Plataformas: panel web; SDK de Python en Windows, macOS, Linux.
Descargar: wandb.ai/site/weave.
Conclusión: la opción si el equipo ya vive en Weights & Biases.
6. Traceloop OpenLLMetry, mejor para emisión de tramos OTel
Traceloop OpenLLMetry no es un panel. Es un conjunto de instrumentaciones de OpenTelemetry que auto-rastrea 30+ proveedores de LLM, bases de datos vectoriales y marcos de trabajo de agentes, luego emiten trazas OTel estándar a cualquier backend que un equipo ya ejecute. Esto significa que Datadog, Grafana Tempo, Honeycomb, SigNoz, Jaeger o un Recopilador OTel auto-hospedado se convierten en backends de observabilidad válidos para ejecuciones de IA sin pegamento adicional.
Dos líneas de Python o TypeScript cablean la instrumentación completa, y las convenciones semánticas coinciden con la especificación del grupo de trabajo de GenAI de OpenTelemetry.
Donde queda corta: no hay panel de primera parte para ver trazas, por lo que un backend debe ser elegido y configurado por separado. Los equipos que solo quieren una interfaz de usuario deben elegir Langfuse o Phoenix en su lugar.
Precios:
- Gratuito: Apache 2.0, uso ilimitado.
- Traceloop Cloud (backend alojado): desde $99/mes.
- Empresa: personalizado.
Plataformas: Windows, macOS, Linux (SDKs de Python y TypeScript).
Descargar: traceloop.com o github.com/traceloop/openllmetry.
Conclusión: la opción cuando el equipo ya ejecuta una pila de observabilidad general y quiere trazas de LLM dentro de ella.
7. Braintrust, mejor para observabilidad impulsada por evaluaciones
Braintrust trata trazas y evaluaciones como un objeto. Cada traza de producción puede capturarse, promocionarse a un dataset dorado y reejecerse a través de un evaluador de puntuación para comprobar regresión cuando un prompt, modelo o herramienta cambia. La interfaz de usuario de trazas muestra tramos anidados con entradas y salidas de herramientas completas, y la interfaz de usuario de evaluaciones muestra los mismos datos puntuados contra salidas de referencia.
El flujo de trabajo se adapta a equipos que tratan la calidad del agente como un punto de referencia a superar, no un panel a ver.
Donde queda corta: una inversión de tiempo inicial en escribir evaluadores y salidas de referencia se amortiza más tarde pero ralentiza la configuración del primer día. El nivel gratuito en 1K tramos por mes se agota rápidamente en cargas de trabajo reales de agentes.
Precios:
- Gratuito: 1K tramos/mes.
- Pro: $249/mes.
- Empresa: personalizado, incluye auto-hospedaje.
Plataformas: panel web; SDKs para Windows, macOS, Linux.
Descargar: braintrust.dev.
Conclusión: la opción si el equipo ejecuta evaluaciones estructuradas y necesita la herramienta que cierra el bucle de rastreo a prueba.
Cómo elegir la correcta
- Si el auto-hospedaje es un requisito inamovible: Langfuse o Arize Phoenix.
- Si la base de código ejecuta LangChain o LangGraph: LangSmith.
- Si necesitas la instalación más rápida posible en un portátil: Arize Phoenix.
- Si el equipo ya emite OpenTelemetry para el resto de la pila: Traceloop OpenLLMetry en tu backend existente.
- Si la velocidad de configuración de proxy importa más que la profundidad de llamadas a herramientas: Helicone.
- Si W&B ya ejecuta el lado de ML del equipo: Weights & Biases Weave.
- Si la calidad de la evaluación impulsa la hoja de ruta: Braintrust.
- Si el enrutamiento y los límites de costos importan junto con el rastreo: Portkey.
Una pila de producción común en 2026 empareja OpenLLMetry para instrumentación, Langfuse o Phoenix como backend y Braintrust para evaluaciones. Las tres herramientas no se superponen, y OpenTelemetry las mantiene portátiles.
Preguntas frecuentes
¿Qué es la observabilidad de agentes IA? Es la práctica de capturar cada paso de una ejecución de agente: prompts, respuestas del modelo, llamadas a herramientas, reintentos y la salida final. A diferencia del monitoreo LLM puro, que registra cada llamada del modelo como un evento discreto, la observabilidad trata la sesión completa como una traza anidada para que un depurador pueda ver qué hizo realmente el agente.
¿Pueden estas herramientas de observabilidad de agentes IA ejecutarse en un escritorio? Sí. Langfuse y Helicone distribuyen archivos Docker Compose, Arize Phoenix se ejecuta como un proceso Python único, Traceloop OpenLLMetry es un SDK, y LangSmith, W&B Weave y Braintrust distribuyen SDKs amigables para escritorio que envían trazas a su nube. Cada herramienta en esta lista funciona en Windows, macOS y Linux.
¿Cuál es la mejor herramienta de observabilidad de agentes IA de código abierto? Langfuse (MIT) y Arize Phoenix (Elastic License 2.0) son las dos opciones más sólidas. Langfuse distribuye paneles más pulidos y características multiusuario. Phoenix tiene infraestructura más ligera y soporte completo de OpenTelemetry desde el inicio.
¿Detectan estas herramientas de observabilidad fallos silenciosos de agentes? Sí, cuando el árbol de rastreo renderiza la ejecución completa. Los fallos silenciosos generalmente aparecen como una llamada a herramienta que devolvió una cadena vacía, un bucle de reintento que nunca sale o una respuesta del modelo que omitió un paso requerido. Todas las siete herramientas anteriores surfacean estos patrones en la interfaz de usuario de rastreo.
¿Cómo encaja OpenTelemetry? El grupo de trabajo de GenAI de OpenTelemetry publica convenciones semánticas para tramos de LLM. Langfuse, Phoenix, Traceloop OpenLLMetry y varios backends de propósito general las adoptan, lo que significa que una biblioteca de instrumentación única puede alimentar múltiples interfaces de usuario. Helicone y LangSmith no son nativos de OTel por defecto.
¿Pueden estas herramientas detectar inyección de prompts? Phoenix distribuye un evaluador de inyección de prompts integrado que se ejecuta en trazas capturadas. Langfuse y Braintrust soportan evaluaciones personalizadas con el mismo propósito. Ninguna de estas herramientas bloquea una inyección en tiempo de solicitud; la surfacean después del hecho.