LiteLLM

El artículo de XDA sobre Nvidia Personal AI Router tocó un tema: dos PC detrás de un punto final, solicitudes de modelo enrutadas por peso y salud, sin editar archivos de configuración en cinco aplicaciones. El quid es que la versión de Nvidia es un sabor de una categoría que la pila de código abierto ya cubre, y cubre con soporte de modelo más amplio. Si tienes una estación de trabajo con una 4090 y una mini PC ejecutando Ollama en el armario, un proxy que los unifique es la pieza que falta.

Probamos siete equilibradores de carga y pasarelas para inferencia local de LLM en 2026. Cada opción se coloca frente a Ollama, vLLM, LM Studio, llama.cpp o una combinación, expone un punto final compatible con OpenAI y maneja el enrutamiento cuando un backend está ocupado, desconectado o no es la herramienta adecuada para el trabajo.

Qué buscar en un equilibrador de carga de IA local

Comparación rápida

Aplicación Mejor para Backends Licencia Código abierto
LiteLLM Proxy universal con 100+ proveedores Cualquier compatible con OpenAI MIT
Olla Puramente local, huella pequeña Ollama, vLLM, LM Studio, SGLang, llama.cpp Apache 2.0
Nvidia Personal AI Router Configuraciones de hardware Nvidia en Windows Backends optimizados por Nvidia Gratis (registro) No
vLLM Servicio de alto rendimiento de modelo único Motor vLLM Apache 2.0
Ollama Host multimodelo más simple Nativo MIT
LocalAI Clon OpenAI drop-in con más modelos multimedia GGUF, ONNX, diffusers MIT
Portkey Pasarela empresarial con controles de política 200+ proveedores AGPL / nivel de pago Source-available

Las 7 mejores aplicaciones para equilibrio de carga de inferencia local de IA

1. LiteLLM — mejor en general

LiteLLM se ejecuta como un proxy Python o Rust frente a tus modelos y entrega un punto final /v1 que habla OpenAI. Apúntalo a cualquier combinación de Ollama, vLLM, Anthropic alojado y OpenAI, y equilibrará la carga entre ellos, retrocederá en 429, cacheará prompts repetidos y aplicará presupuestos por clave. La reescritura en Rust de 2026 impulsa el rendimiento por encima de 1500 solicitudes por segundo en un solo nodo, que es mucho más de lo que un laboratorio doméstico jamás necesitará, pero agradable en una pasarela de equipo compartida.

Donde se queda corto: El archivo de configuración crece rápidamente una vez que añades árboles de fallback y niveles de costo. El panel es funcional pero nada que mostrarías.

Precios: Gratuito y código abierto (MIT). Un nivel empresarial de pago añade SSO y registros de auditoría.

Plataformas: Windows, macOS, Linux, Docker.

Descargar: litellm.ai · GitHub

Conclusión: Si quieres un router que crezca desde el laboratorio doméstico a APIs alojadas, empieza aquí.

2. Olla — mejor opción puramente local

Olla es un proxy LLM diseñado específicamente para inferencia autohospedada. Habla con Ollama, LM Studio, vLLM, llama.cpp, SGLang y LiteLLM mismo, descubre modelos en cada backend automáticamente y se mantiene por debajo de 50 MB de memoria. La conmutación por error entre dos Ollama es un archivo YAML de cinco líneas, y las métricas expuestas alimentan a Prometheus sin un complemento.

Donde se queda corto: Sin seguimiento de costos incorporado o aplicación de presupuesto, porque no toca APIs alojadas. La comunidad es más pequeña que la de LiteLLM.

Precios: Gratuito y código abierto (Apache 2.0).

Plataformas: Windows, macOS, Linux, Docker. Un único binario estático.

Descargar: thushan.github.io/olla · GitHub

Conclusión: Elige esto si tu stack completo está en hardware que posees y quieres un router que arranque en un segundo.

3. Nvidia Personal AI Router — mejor opción llave en mano en hardware Nvidia

Nvidia Personal AI Router es el tema del artículo de XDA. Se envía como una aplicación Windows que escanea tu LAN, encuentra nodos de inferencia basados en Nvidia y los agrupa detrás de un punto final local. El enrutamiento de modelos, streaming y transferencia de cuantización se manejan dentro del router, y las aplicaciones cliente del mismo conjunto (Nvidia ChatRTX y Nvidia AI Workbench) se conectan directamente.

Donde se queda corto: Enfocado en Nvidia: las tarjetas Radeon e Intel Arc son ciudadanos de segunda clase. El router no expone un punto final compatible con OpenAI de forma nativa, así que los clientes de terceros necesitan un shim.

Precios: Gratuito con una cuenta de desarrollador de Nvidia.

Plataformas: Windows.

Descargar: nvidia.com/ai-router

Conclusión: La forma más fácil de agrupar dos equipos Nvidia en un punto final de IA si nunca abandonas el ecosistema Nvidia.

4. vLLM — mejor para maximizar una sola GPU potente

vLLM no es un router por sí solo, pero su servidor compatible con OpenAI con batching continuo y PagedAttention impulsa el rendimiento en una sola GPU mucho más allá de lo que puede alcanzar Ollama por un margen amplio. En una configuración de dos nodos, ejecutar vLLM detrás de LiteLLM u Olla es el patrón estándar para servir un modelo grande a un equipo, mientras que backends más baratos manejan la cola larga.

Donde se queda corto: La carga de modelos es más lenta que Ollama; sin fallback solo de CPU. El soporte de cuantización se queda rezagado respecto a llama.cpp.

Precios: Gratuito y código abierto (Apache 2.0).

Plataformas: Linux con CUDA, ROCm o Intel XPU. Windows vía WSL2. El soporte Metal de macOS es impulsado por la comunidad.

Descargar: vllm.ai · GitHub

Conclusión: Usa esto como uno de los backends al que tu router envía trabajo, no como el router en sí.

5. Ollama — mejor para alojamiento multimodelo simple

Ollama permanece en la lista porque la mayoría de configuraciones domésticas ya la ejecutan, y su cola incorporada maneja múltiples solicitudes simultáneas razonablemente bien. Empareja con un router al frente para alta disponibilidad, o ejecuta dos cajas Ollama con Olla para conmutación por error de respaldo activo.

Donde se queda corto: El rendimiento por GPU se queda rezagado respecto a vLLM en 4-8x en cargas de lote. Sin seguimiento de costos, sin inteligencia de enrutamiento.

Precios: Gratuito y código abierto (MIT).

Plataformas: Windows, macOS, Linux, Docker.

Descargar: ollama.com · GitHub

Conclusión: El backend confiable, no el router. Mantenlo y pon algo más inteligente al frente.

6. LocalAI — mejor si el router también actúa como host de inferencia

LocalAI es un único binario que habla la API de OpenAI y aloja LLM, modelos de inserción, TTS, generación de imágenes y conversión de voz a texto. Puede llamar a otros backends de Ollama o vLLM detrás de escenas, lo que lo hace decente como todo en uno para un laboratorio doméstico de nodo único donde preferirías ejecutar un proceso en lugar de tres.

Donde se queda corto: Menos flexible que LiteLLM para configuraciones híbridas locales más alojadas. El soporte de modelos multimedia significa que el binario es pesado.

Precios: Gratuito y código abierto (MIT).

Plataformas: Windows, macOS, Linux, Docker.

Descargar: localai.io · GitHub

Conclusión: Buena opción si quieres un router y un host de modelos multimedia completo en la misma caja.

7. Portkey — mejor si necesitas controles de política

Portkey es la opción de nivel empresarial. Enfrenta modelos locales y alojados como lo hace LiteLLM pero añade protecciones, redacción de PII y políticas de enrutamiento por equipo de serie. La versión OSS autohospedada cubre los conceptos básicos del enrutamiento; SSO, auditoría y el panel gestionado se encuentran detrás del nivel de pago.

Donde se queda corto: AGPL asusta a algunos homelabbers. El motor de política completo solo es útil si un equipo se apoya en él.

Precios: Autohospedado gratuito (AGPL); los niveles gestionados de pago comienzan con una tarifa mensual modesta por puesto.

Plataformas: Docker en cualquier SO anfitrión.

Descargar: portkey.ai · GitHub

Conclusión: Excesivo para un laboratorio doméstico individual, de tamaño correcto para una pasarela de equipo pequeño.

Cómo elegir la correcta

Preguntas frecuentes

¿Cuál es la diferencia entre un equilibrador de carga y un motor de inferencia?

Un motor de inferencia (vLLM, Ollama, llama.cpp) ejecuta el modelo real. Un equilibrador de carga o pasarela (LiteLLM, Olla) se sienta al frente y decide qué motor obtiene cada solicitud. Necesitas ambos: uno para servir, uno para enrutar.

¿Puedo equilibrar la carga de modelos locales con una API alojada como fallback?

Sí. LiteLLM y Portkey están construidos exactamente para esto. Configura primero el modelo local con un peso de costo más bajo, luego un proveedor alojado como fallback; el router usa la API alojada solo cuando tu GPU está caída o sobrecargada.

¿Necesito un router si solo tengo una GPU?

No estrictamente, pero aún ayuda. Un router te da un punto final estable, lógica de reintento y observabilidad, así que si cambias Ollama por vLLM más tarde no necesitas tocar ninguna aplicación cliente.

¿Funciona Nvidia Personal AI Router con GPU AMD o Intel?

No oficialmente. Apunta al hardware Nvidia y CUDA. Para configuraciones mixtas, LiteLLM u Olla tratarán cualquier backend compatible con OpenAI igual independientemente del fabricante.

¿Cuál tiene la latencia más baja?

Olla añade menos de 5 ms en una red local en pruebas, gracias a su núcleo Go. LiteLLM se sitúa alrededor de 10-15 ms con el motor Rust en un caché cálido. Para la mayoría de cargas de trabajo de chat y codificación, ambas son invisibles junto al tiempo de decodificación del modelo mismo.