El artículo de XDA sobre Nvidia Personal AI Router tocó un tema: dos PC detrás de un punto final, solicitudes de modelo enrutadas por peso y salud, sin editar archivos de configuración en cinco aplicaciones. El quid es que la versión de Nvidia es un sabor de una categoría que la pila de código abierto ya cubre, y cubre con soporte de modelo más amplio. Si tienes una estación de trabajo con una 4090 y una mini PC ejecutando Ollama en el armario, un proxy que los unifique es la pieza que falta.
Probamos siete equilibradores de carga y pasarelas para inferencia local de LLM en 2026. Cada opción se coloca frente a Ollama, vLLM, LM Studio, llama.cpp o una combinación, expone un punto final compatible con OpenAI y maneja el enrutamiento cuando un backend está ocupado, desconectado o no es la herramienta adecuada para el trabajo.
Qué buscar en un equilibrador de carga de IA local
- Superficie compatible con OpenAI. Cada cliente serio (Open WebUI, Cline, Continue, Aider, Zed) espera
/v1/chat/completions. Si tu router habla una API personalizada, pasarás el próximo fin de semana parchando clientes. - Cobertura de backend. Ollama, vLLM, LM Studio, llama.cpp y SGLang son los motores locales comunes. Cúbrelos todos o desecharás el router en tres meses.
- Comprobaciones de salud y conmutación por error. Los equipos locales se desconectan. Un router que sigue enviando solicitudes a una GPU desconectada es peor que round-robin.
- Enrutamiento basado en costo y capacidad. No todos los prompts necesitan un modelo de 70B. Enruta prompts ligeros a un modelo local pequeño y reserva el grande para casos difíciles.
- Observabilidad. Registros, latencia por modelo y trazas de solicitud son la diferencia entre “es lento” y “el 8B está comiendo todo el tráfico porque siempre responde primero.”
Comparación rápida
| Aplicación | Mejor para | Backends | Licencia | Código abierto |
|---|---|---|---|---|
| LiteLLM | Proxy universal con 100+ proveedores | Cualquier compatible con OpenAI | MIT | Sí |
| Olla | Puramente local, huella pequeña | Ollama, vLLM, LM Studio, SGLang, llama.cpp | Apache 2.0 | Sí |
| Nvidia Personal AI Router | Configuraciones de hardware Nvidia en Windows | Backends optimizados por Nvidia | Gratis (registro) | No |
| vLLM | Servicio de alto rendimiento de modelo único | Motor vLLM | Apache 2.0 | Sí |
| Ollama | Host multimodelo más simple | Nativo | MIT | Sí |
| LocalAI | Clon OpenAI drop-in con más modelos multimedia | GGUF, ONNX, diffusers | MIT | Sí |
| Portkey | Pasarela empresarial con controles de política | 200+ proveedores | AGPL / nivel de pago | Source-available |
Las 7 mejores aplicaciones para equilibrio de carga de inferencia local de IA
1. LiteLLM — mejor en general
LiteLLM se ejecuta como un proxy Python o Rust frente a tus modelos y entrega un punto final /v1 que habla OpenAI. Apúntalo a cualquier combinación de Ollama, vLLM, Anthropic alojado y OpenAI, y equilibrará la carga entre ellos, retrocederá en 429, cacheará prompts repetidos y aplicará presupuestos por clave. La reescritura en Rust de 2026 impulsa el rendimiento por encima de 1500 solicitudes por segundo en un solo nodo, que es mucho más de lo que un laboratorio doméstico jamás necesitará, pero agradable en una pasarela de equipo compartida.
Donde se queda corto: El archivo de configuración crece rápidamente una vez que añades árboles de fallback y niveles de costo. El panel es funcional pero nada que mostrarías.
Precios: Gratuito y código abierto (MIT). Un nivel empresarial de pago añade SSO y registros de auditoría.
Plataformas: Windows, macOS, Linux, Docker.
Descargar: litellm.ai · GitHub
Conclusión: Si quieres un router que crezca desde el laboratorio doméstico a APIs alojadas, empieza aquí.
2. Olla — mejor opción puramente local
Olla es un proxy LLM diseñado específicamente para inferencia autohospedada. Habla con Ollama, LM Studio, vLLM, llama.cpp, SGLang y LiteLLM mismo, descubre modelos en cada backend automáticamente y se mantiene por debajo de 50 MB de memoria. La conmutación por error entre dos Ollama es un archivo YAML de cinco líneas, y las métricas expuestas alimentan a Prometheus sin un complemento.
Donde se queda corto: Sin seguimiento de costos incorporado o aplicación de presupuesto, porque no toca APIs alojadas. La comunidad es más pequeña que la de LiteLLM.
Precios: Gratuito y código abierto (Apache 2.0).
Plataformas: Windows, macOS, Linux, Docker. Un único binario estático.
Descargar: thushan.github.io/olla · GitHub
Conclusión: Elige esto si tu stack completo está en hardware que posees y quieres un router que arranque en un segundo.
3. Nvidia Personal AI Router — mejor opción llave en mano en hardware Nvidia
Nvidia Personal AI Router es el tema del artículo de XDA. Se envía como una aplicación Windows que escanea tu LAN, encuentra nodos de inferencia basados en Nvidia y los agrupa detrás de un punto final local. El enrutamiento de modelos, streaming y transferencia de cuantización se manejan dentro del router, y las aplicaciones cliente del mismo conjunto (Nvidia ChatRTX y Nvidia AI Workbench) se conectan directamente.
Donde se queda corto: Enfocado en Nvidia: las tarjetas Radeon e Intel Arc son ciudadanos de segunda clase. El router no expone un punto final compatible con OpenAI de forma nativa, así que los clientes de terceros necesitan un shim.
Precios: Gratuito con una cuenta de desarrollador de Nvidia.
Plataformas: Windows.
Descargar: nvidia.com/ai-router
Conclusión: La forma más fácil de agrupar dos equipos Nvidia en un punto final de IA si nunca abandonas el ecosistema Nvidia.
4. vLLM — mejor para maximizar una sola GPU potente
vLLM no es un router por sí solo, pero su servidor compatible con OpenAI con batching continuo y PagedAttention impulsa el rendimiento en una sola GPU mucho más allá de lo que puede alcanzar Ollama por un margen amplio. En una configuración de dos nodos, ejecutar vLLM detrás de LiteLLM u Olla es el patrón estándar para servir un modelo grande a un equipo, mientras que backends más baratos manejan la cola larga.
Donde se queda corto: La carga de modelos es más lenta que Ollama; sin fallback solo de CPU. El soporte de cuantización se queda rezagado respecto a llama.cpp.
Precios: Gratuito y código abierto (Apache 2.0).
Plataformas: Linux con CUDA, ROCm o Intel XPU. Windows vía WSL2. El soporte Metal de macOS es impulsado por la comunidad.
Conclusión: Usa esto como uno de los backends al que tu router envía trabajo, no como el router en sí.
5. Ollama — mejor para alojamiento multimodelo simple
Ollama permanece en la lista porque la mayoría de configuraciones domésticas ya la ejecutan, y su cola incorporada maneja múltiples solicitudes simultáneas razonablemente bien. Empareja con un router al frente para alta disponibilidad, o ejecuta dos cajas Ollama con Olla para conmutación por error de respaldo activo.
Donde se queda corto: El rendimiento por GPU se queda rezagado respecto a vLLM en 4-8x en cargas de lote. Sin seguimiento de costos, sin inteligencia de enrutamiento.
Precios: Gratuito y código abierto (MIT).
Plataformas: Windows, macOS, Linux, Docker.
Descargar: ollama.com · GitHub
Conclusión: El backend confiable, no el router. Mantenlo y pon algo más inteligente al frente.
6. LocalAI — mejor si el router también actúa como host de inferencia
LocalAI es un único binario que habla la API de OpenAI y aloja LLM, modelos de inserción, TTS, generación de imágenes y conversión de voz a texto. Puede llamar a otros backends de Ollama o vLLM detrás de escenas, lo que lo hace decente como todo en uno para un laboratorio doméstico de nodo único donde preferirías ejecutar un proceso en lugar de tres.
Donde se queda corto: Menos flexible que LiteLLM para configuraciones híbridas locales más alojadas. El soporte de modelos multimedia significa que el binario es pesado.
Precios: Gratuito y código abierto (MIT).
Plataformas: Windows, macOS, Linux, Docker.
Descargar: localai.io · GitHub
Conclusión: Buena opción si quieres un router y un host de modelos multimedia completo en la misma caja.
7. Portkey — mejor si necesitas controles de política
Portkey es la opción de nivel empresarial. Enfrenta modelos locales y alojados como lo hace LiteLLM pero añade protecciones, redacción de PII y políticas de enrutamiento por equipo de serie. La versión OSS autohospedada cubre los conceptos básicos del enrutamiento; SSO, auditoría y el panel gestionado se encuentran detrás del nivel de pago.
Donde se queda corto: AGPL asusta a algunos homelabbers. El motor de política completo solo es útil si un equipo se apoya en él.
Precios: Autohospedado gratuito (AGPL); los niveles gestionados de pago comienzan con una tarifa mensual modesta por puesto.
Plataformas: Docker en cualquier SO anfitrión.
Descargar: portkey.ai · GitHub
Conclusión: Excesivo para un laboratorio doméstico individual, de tamaño correcto para una pasarela de equipo pequeño.
Cómo elegir la correcta
- Si quieres un router que crezca desde el laboratorio doméstico a APIs alojadas: LiteLLM.
- Si todo tu stack es local y quieres la huella más pequeña: Olla.
- Si ambos PC son Nvidia y nunca abandonas Windows: Nvidia Personal AI Router.
- Si un pequeño equipo necesita protecciones y política: Portkey.
- Si quieres un router que también aloje diffusers y TTS: LocalAI.
- Mantén Ollama como tu backend confiable y vLLM para la única GPU potente.
Preguntas frecuentes
¿Cuál es la diferencia entre un equilibrador de carga y un motor de inferencia?
Un motor de inferencia (vLLM, Ollama, llama.cpp) ejecuta el modelo real. Un equilibrador de carga o pasarela (LiteLLM, Olla) se sienta al frente y decide qué motor obtiene cada solicitud. Necesitas ambos: uno para servir, uno para enrutar.
¿Puedo equilibrar la carga de modelos locales con una API alojada como fallback?
Sí. LiteLLM y Portkey están construidos exactamente para esto. Configura primero el modelo local con un peso de costo más bajo, luego un proveedor alojado como fallback; el router usa la API alojada solo cuando tu GPU está caída o sobrecargada.
¿Necesito un router si solo tengo una GPU?
No estrictamente, pero aún ayuda. Un router te da un punto final estable, lógica de reintento y observabilidad, así que si cambias Ollama por vLLM más tarde no necesitas tocar ninguna aplicación cliente.
¿Funciona Nvidia Personal AI Router con GPU AMD o Intel?
No oficialmente. Apunta al hardware Nvidia y CUDA. Para configuraciones mixtas, LiteLLM u Olla tratarán cualquier backend compatible con OpenAI igual independientemente del fabricante.
¿Cuál tiene la latencia más baja?
Olla añade menos de 5 ms en una red local en pruebas, gracias a su núcleo Go. LiteLLM se sitúa alrededor de 10-15 ms con el motor Rust en un caché cálido. Para la mayoría de cargas de trabajo de chat y codificación, ambas son invisibles junto al tiempo de decodificación del modelo mismo.