OpenAI redujo los precios de la API GPT-5.6 hasta un 80% la semana pasada, Anthropic y Google revisaron sus listas de precios en julio, y Groq y Cerebras lanzan nuevos tiers cada mes. Si tu producto cobra gastos en cuatro o cinco proveedores de modelos, una solicitud descontrolada puede costar silenciosamente más que un servidor pequeño antes de que llegue la factura. Estas son las siete mejores aplicaciones para rastrear costos de API de IA en escritorio en 2026, probadas en una canalización de producción real que se distribuye entre Claude, GPT-5, Gemini y un endpoint Llama autohospedado.
Cada herramienta a continuación proxifica tus llamadas (por lo que ve cada solicitud y respuesta), o envuelve los SDK del modelo para registrar el uso, y cada una tiene un panel de control de escritorio o web que puedes fijar. Los precios están en USD a partir de agosto de 2026.
Qué buscar en un rastreador de costos de API
Seis criterios que separan las herramientas útiles de los paneles de control que nadie lee.
- Costo por llamada, no por token. Quieres dólares por flujo de trabajo, no tokens por modelo.
- Multiprovedor. OpenAI, Anthropic, Google, Groq, Together, más endpoints compatibles con OpenAI autohospedados.
- Etiquetar por usuario, característica, entorno. Para que un pico se pueda rastrear hasta un cliente o una ruta de código.
- Alertas de presupuesto. Un ping de Slack al 80% del límite mensual, no una sorpresa en la factura.
- Propiedad de datos. Autohospedable o política de retención documentada.
- Proxy de baja latencia. Si una herramienta se sitúa entre tu aplicación y el modelo, la latencia agregada debe ser inferior a 100ms.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Característica destacada |
|---|---|---|---|---|
| OpenRouter | Enrutamiento multimodelo más facturación | Web | Gratis (cuotas por llamada) | Una clave API en 250+ modelos |
| Helicone | Proxy con panel rápido | Web, autohospedado | 10K solicitudes/mes | Latencia de proxy sub-25ms |
| Langfuse | Observabilidad de código abierto | Autohospedado o nube | Gratis autohospedado | Árbol de rastreo completo por solicitud |
| LangSmith | Nativo de LangChain | Web | Nivel dev gratis | Mejor para aplicaciones LangChain |
| Portkey | Puerta de enlace empresarial | Web, autohospedado | 10K solicitudes/mes | Equilibrio de carga y conmutación por error |
| PromptLayer | Analítica a nivel de prompt | Web | Nivel gratis | Prueba A/B de versiones de prompt |
| Braintrust | Evaluación más costo | Web | Nivel gratis | Vincula el gasto con puntuaciones de evaluación |
| W&B Weave | Nativo del equipo ML | Web | Nivel gratis | Cabe dentro de los asientos existentes de W&B |
1. OpenRouter, mejor para enrutamiento multimodelo más facturación
OpenRouter es una puerta de enlace de punto final único que se encuentra frente a 250+ modelos en todos los proveedores. Abonas un saldo, utilizas una clave API y OpenRouter cobra la tarifa por token del modelo más un pequeño margen. El panel muestra el gasto exacto por clave, por modelo, por día, y puedes limitar la velocidad de cada clave.
Dónde falla: para registro puro (no enrutamiento) no es la herramienta; quieres Helicone o Langfuse. Además, la latencia de la solicitud depende de a qué proveedor enrutaste.
Precios:
- Gratis para registrarse.
- Cuotas de pago por uso por llamada, aproximadamente precio de lista del modelo + 5%.
- Empresarial: personalizado.
Plataformas: panel web; la API es agnóstica del lenguaje (Windows, macOS, Linux).
Descargar: openrouter.ai.
Conclusión: la opción si quieres una factura en todos los proveedores de modelos con un panel de gastos activo.
2. Helicone, mejor proxy con panel rápido
Helicone envuelve tus llamadas OpenAI/Anthropic/etc existentes con un encabezado proxy (una línea de código) y cada solicitud se registra en un panel activo con costo, latencia y carga útil. Autohospedable vía Docker.
Dónde falla: el nivel gratuito está limitado a 10.000 solicitudes por mes, que una herramienta interna ocupada agota en días.
Precios:
- Gratis: 10K solicitudes/mes.
- Pro: $20/usuario/mes, 100K solicitudes.
- Empresarial: personalizado.
- Autohospedado: gratis (código abierto, Apache 2.0).
Plataformas: panel web; autohospedado en cualquier host Docker.
Descargar: helicone.ai o github.com/Helicone/helicone.
Conclusión: la opción si quieres el proxy con menor fricción que proporciona un panel rápido y puede autohospedarse más tarde.
3. Langfuse, mejor observabilidad de código abierto
Langfuse es la plataforma de observabilidad LLM de código abierto. Captura trazas completas (una cadena de llamadas de modelo más llamadas de herramientas por sesión), más costo, más puntuaciones de ejecuciones de evaluación. Autohospedado en Docker, o Langfuse Cloud para una instancia administrada.
Dónde falla: escribes más instrumentación que con Helicone. El SDK de rastreo es pequeño pero no es “agregar un encabezado”.
Precios:
- Gratis: completamente de código abierto (MIT), autohospedado.
- Cloud Hobby: nivel gratuito.
- Cloud Pro: $59/mes.
- Empresarial: personalizado.
Plataformas: autohospedado en Docker; panel web cloud.
Descargar: langfuse.com o github.com/langfuse/langfuse.
Conclusión: la opción si la propiedad de datos es importante y quieres un árbol de rastreo real por sesión de usuario.
4. LangSmith, mejor para aplicaciones LangChain
LangSmith es la observabilidad de primera parte de LangChain. Si tu aplicación ya está construida en LangChain (Python o JS), LangSmith se incorpora con dos variables de entorno y rastrea cada cadena, agente y llamada de herramienta con costo.
Dónde falla: es mejor cuando la aplicación subyacente ejecuta LangChain. Los proyectos que no son LangChain aún pueden usar el SDK pero pierdes el cableado automático.
Precios:
- Desarrollador: gratis, 5K trazas/mes.
- Plus: $39/usuario/mes.
- Empresarial: personalizado.
Plataformas: panel web.
Descargar: smith.langchain.com.
Conclusión: la opción si la base de código es nativa de LangChain.
5. Portkey, mejor puerta de enlace empresarial
Portkey se sitúa entre tu aplicación y cada proveedor de LLM, equilibra la carga en modelos, conmuta por error en límites de velocidad y registra el costo por usuario. Es lo más cercano a una puerta de enlace API empresarial para LLM, con reintentos, almacenamiento semántico en caché y redacción de PII integrados.
Dónde falla: cuanto más utilizas sus características, más dependes del proxy. El autohospedado está disponible pero la carga de operaciones no es cero.
Precios:
- Gratis: 10K solicitudes/mes.
- Producción: $49/mes.
- Empresarial: personalizado.
- Autohospedado: disponible bajo solicitud.
Plataformas: panel web, autohospedado en Docker.
Descargar: portkey.ai.
Conclusión: la opción si quieres almacenamiento en caché, conmutación por error y resiliencia de límite de velocidad además del rastreo de costos.
6. PromptLayer, mejor para analítica a nivel de prompt
PromptLayer organiza llamadas por versión de prompt. Si pruebas A/B dos versiones del mismo prompt, PromptLayer muestra el costo por versión, la latencia por versión y la tasa de éxito por versión.
Dónde falla: conjunto de características más reducido que Helicone o Langfuse; la fortaleza es la analítica de prompts, no el rastreo completo de solicitudes.
Precios:
- Gratis: 5K solicitudes/mes.
- Pro: $20/usuario/mes.
- Empresarial: personalizado.
Plataformas: panel web.
Descargar: promptlayer.com.
Conclusión: la opción si el flujo de trabajo es “iterar en prompts y elegir el ganador por costo y latencia”.
7. Braintrust, mejor para vincular gasto con puntuaciones de evaluación
Braintrust combina un marco de evaluación (define una suite de pruebas, puntúa salidas de modelo) con rastreo de costos. Cada ejecución de evaluación te dice no solo la precisión sino los dólares gastados para lograrla, para que puedas intercambiar un modelo más pequeño por uno más grande en números reales.
Dónde falla: inviertes tiempo escribiendo evaluaciones para obtener el valor completo. No es un registrador plug-and-play.
Precios:
- Gratis: 1K spans/mes.
- Pro: $249/mes.
- Empresarial: personalizado.
Plataformas: panel web.
Descargar: braintrust.dev.
Conclusión: la opción si ya ejecutas evaluaciones estructuradas y quieres costo por punto de referencia.
Cómo elegir el correcto
- Si quieres la cobertura de modelo más amplia en una factura: OpenRouter.
- Si quieres un proxy de dos líneas con un panel activo: Helicone.
- Si la propiedad de datos y el autohospedado importan: Langfuse.
- Si la base de código es nativa de LangChain: LangSmith.
- Si necesitas reintentos, conmutación por error y almacenamiento en caché en una puerta de enlace: Portkey.
- Si la iteración de prompts es el flujo de trabajo: PromptLayer.
- Si el costo por punto de referencia es la métrica: Braintrust.
FAQ
¿Cuál es el margen de costo de OpenRouter? Aproximadamente 5% por encima del precio de lista del proveedor, más una tarifa de stripe en recargas. En cargas de trabajo de bajo volumen vale la pena por la facturación unificada.
¿Puedo autohospedarse un rastreador de costos de IA? Sí. Langfuse, Helicone y Portkey publican imágenes Docker autohospedables. Langfuse es el más permisivo (MIT); Helicone es Apache 2.0.
¿Qué rastreador agrega menos latencia? El proxy de Helicone mide menos de 25ms en la mayoría de regiones. El registrador asincrónico de Langfuse agrega cero latencia de bloqueo porque las escrituras son fire-and-forget.
¿Cómo presupuesto para una factura de LLM impredecible? Establece un límite mensual en el panel de tu proveedor (OpenAI y Anthropic lo soportan), más una alerta suave al 80% en tu rastreador de costos. Combina con Portkey u OpenRouter para cambiar a un modelo más barato cuando el límite está cerca.
¿Cuál es el rastreador de costos de IA más barato? Langfuse autohospedado es gratis. El nivel gratuito de Helicone en 10K solicitudes funciona para pequeños proyectos. OpenRouter no tiene tarifa mensual, solo por llamada.