Ejecutar múltiples LLM locales pequeños en desktop

XDA publicó un artículo este mes argumentando que dos modelos locales de 2 GB ejecutándose en paralelo superan a un modelo de 8 GB en casi todas las tareas reales, y el autor tenía razón. Un modelo pequeño ajustado para código más un modelo pequeño ajustado para chat, ejecutándose lado a lado, usa menos VRAM, responde más rápido y le permite dirigir la pregunta correcta a la herramienta correcta. La fricción está en el tooling: la mayoría de aplicaciones LLM locales asumen un modelo a la vez y una ventana de chat. Las ocho aplicaciones para ejecutar múltiples LLM locales simultáneamente en desktop a continuación todas manejan modelos concurrentes, ya sea de forma nativa o exponiendo un endpoint compatible con OpenAI que la segunda aplicación puede señalar.

Qué buscar en un ejecutor de LLM multimodelo

Criterios reales para ejecutar más de un modelo:

Comparación rápida

Aplicación Mejor para Multimodelo Plan gratis Precio inicial GUI
Ollama CLI-first, OpenAI endpoint Sí (carga paralela) Gratis Gratis No (CLI)
LM Studio Gestor de modelos punto y clic Gratis Gratis
Jan Chat completamente offline + backend Gratis Gratis
llama.cpp server Control más crudo, huella más pequeña Sí (por proceso) Gratis Gratis No
LiteLLM Enrutar a 100+ backends Enrutador Gratis Gratis (opt-in en la nube) UI Web
Open WebUI Frontend de chat multimodelo Gratis Gratis Sí (web)
vLLM Rendimiento de nivel de producción Sí (paralelismo tensorial) Gratis Gratis No
Msty Local + nube en una aplicación desktop Sí (Split Chat) Gratis 8,99 USD/mes

Las aplicaciones

1. Ollama, el runtime predeterminado

Ollama carga y descarga modelos bajo demanda y expone un API compatible con OpenAI en el puerto 11434. Configure OLLAMA_NUM_PARALLEL=2 y OLLAMA_MAX_LOADED_MODELS=3 en su env, reinicie el servicio, y podrá acceder a dos modelos en paralelo desde cualquier cliente. En un M2 Pro con 32 GB de memoria unificada ejecutamos Qwen2.5-Coder 3B y Llama 3.2 3B uno al lado del otro con espacio para un pequeño modelo de visión.

Donde cae corto: Sin GUI nativa. La longitud de contexto predeterminada (2048) es pequeña para trabajo real, así que ajústela. El proceso ollama serve no fija automáticamente modelos a GPU específicas en rigs multi-GPU.

Precios:

Plataformas: macOS, Windows, Linux.

Descargar: Ollama | GitHub

Conclusión: La capa base. Casi todas las otras herramientas en esta lista envuelven Ollama o comparten su arquitectura. Instálelo primero.

2. LM Studio, la GUI pulida

LM Studio es la aplicación que la mayoría de la gente instala primero. Incluye un navegador de modelos completo, una UI de chat y, desde la versión 0.3, un servidor local integrado que ejecuta múltiples modelos de forma concurrente. El catálogo de modelos se extrae directamente de Hugging Face y se filtra por lo que cabrá en su máquina. El modo Split Chat le permite comparar dos modelos en el mismo prompt en vivo.

Donde cae corto: No es de código abierto (gratis para uso personal, contáctelos para uso comercial). La versión llama.cpp incluida puede quedarse atrás del upstream.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: LM Studio

Conclusión: El mejor punto de entrada si desea una GUI. Empareje con Ollama para scripting.

3. Jan, el LM Studio de código abierto

Jan es la alternativa de código abierto a LM Studio: la misma idea, licencia MIT, y un objetivo declarado de ejecutar completamente sin conexión. Los hilos de chat multimodelo permiten que cada hilo se fije a un modelo diferente. Ejecuta su propio backend llama.cpp y puede hacer proxy a un Ollama remoto o API compatible con OpenAI cuando desea un modelo más grande.

Donde cae corto: Proyecto más joven que LM Studio. Menos extensiones empaquetadas.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: Jan | GitHub

Conclusión: Elija esto si el código abierto es importante. Funcionalmente muy similar a LM Studio.

4. llama.cpp server, la primitiva base

llama.cpp incluye un servidor HTTP sin estado que lanza por modelo. Dos comandos de shell, dos puertos, dos modelos. Esta es la forma más ajustada de mantener dos cuantificaciones GGUF en RAM: sin envoltorio, sin programador, sin telemetría, y la sobrecarga de memoria más pequeña de cualquier cosa aquí.

Donde cae corto: Usted conecta su propio enrutamiento. Sin GUI. Sin gestor de modelos. Solo línea de comandos para configurar.

Precios:

Plataformas: Windows, macOS, Linux (también Docker).

Descargar: GitHub

Conclusión: Para personas que quieren entender qué están ocultando las capas de abstracción. Perfecto para rigs de scripting.

5. LiteLLM, el enrutador

LiteLLM no aloja modelos; los enruta. Apunte a su instancia Ollama, servidor LM Studio, clave API de Anthropic y endpoint de Azure, luego envíe cada solicitud a través de una URL compatible con OpenAI y deje que el enrutador decida. Un archivo de configuración YAML con conmutaciones por error por modelo y límites de velocidad permite que un asistente de codificación vuelva a un modelo local más pequeño cuando el grande está ocupado.

Donde cae corto: Añade un proceso extra para gestionar. Las decisiones de enrutamiento de depuración requieren algo de lectura de registros.

Precios:

Plataformas: Windows, macOS, Linux (Python, Docker).

Descargar: GitHub

Conclusión: El pegamento entre múltiples runners. Omita si solo ejecuta un backend, obligatorio si ejecuta tres.

6. Open WebUI, el frontend tipo ChatGPT

Open WebUI es la interfaz de chat pulida para modelos locales. Conéctelo a Ollama (o cualquier endpoint compatible con OpenAI), y le proporciona autenticación multiusuario, historial de chat, cambio de modelo a mitad de conversación y comparación de modelos uno al lado del otro en una sola pestaña del navegador. Útil para un hogar donde cuatro personas comparten una máquina.

Donde cae corto: Se ejecuta en Docker para la experiencia fluida; la instalación nativa es posible pero más complicada. Usa alrededor de 500 MB de RAM antes de que se cargue ningún modelo.

Precios:

Plataformas: Windows, macOS, Linux (Docker).

Descargar: GitHub

Conclusión: El mejor frontend si ya tiene Ollama ejecutándose. El modo Split Chat es la característica asesina.

7. vLLM, el motor de rendimiento

vLLM es lo que instala cuando las herramientas de desktop dejan de escalar. La gestión de memoria PagedAttention mantiene múltiples modelos con mejor utilización de VRAM que cualquier runner de modelo único. El paralelismo tensorial divide un modelo entre GPU; múltiples implementaciones en el mismo servidor alojan diferentes modelos simultáneamente. Excesivo para un portátil, esencial para una estación de trabajo con dos GPU.

Donde cae corto: Linux-first (Windows vía WSL2). Requiere Python y configuración CUDA. No orientado a usuarios ocasionales.

Precios:

Plataformas: Linux, Windows (WSL2), macOS (Apple Silicon parcial).

Descargar: GitHub

Conclusión: Solo alcance esto si tiene una GPU seria. En un 4090 único, Ollama es más fácil y casi tan rápido.

8. Msty, la aplicación desktop local+cloud

Msty se envía como un único binario de desktop que ejecuta modelos locales a través de un runtime incluido y modelos en la nube a través de sus propias claves API, uno al lado del otro en la misma ventana. Split Chat compara hasta cuatro modelos por prompt. La característica Knowledge Stacks indexa documentos locales y comparte el índice entre modelos.

Donde cae corto: El nivel gratuito es generoso pero limita el split chat a dos modelos. El nivel pagado para split de cuatro vías está en el lado caro.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: Msty

Conclusión: La forma más fácil de comparar modelos locales vs. en la nube uno al lado del otro. Paguela solo si necesita split de cuatro vías.

Cómo elegir la correcta

FAQ

¿Puedo ejecutar dos LLM en una sola GPU?

Sí, si ambas versiones cuantificadas caben en VRAM. Un modelo 3B en Q4_K_M usa alrededor de 2 GB; dos de los cuales caben cómodamente en una tarjeta de 8 GB. Establezca OLLAMA_MAX_LOADED_MODELS por encima de 1 para mantenerlos calientes.

¿Son realmente buenos los LLM locales pequeños?

Desde Qwen 2.5 y Llama 3.2 en el rango 3B-7B, los modelos pequeños manejan resumen, finalización de código, extracción y chat de forma corta con calidad cercana a GPT-3.5. Fallan en el razonamiento de contexto largo y tareas complejas de varios pasos. Enrute alrededor de esto con un modelo más grande para prompts difíciles.

¿Cuál es la diferencia entre Ollama y LM Studio?

Ollama es un runtime CLI-first con una API HTTP. LM Studio es una aplicación de desktop GUI-first que ejecuta un servidor llama.cpp incluido. Pueden ejecutarse en paralelo en la misma máquina.

¿Necesito una GPU para ejecutar LLM locales?

No, pero ayuda. Un modelo 3B se ejecuta a velocidad legible (10 a 20 tokens/segundo) en un CPU Apple Silicon moderno o un chip Intel/AMD con 16 GB de RAM. Las GPU lo impulsan a 60 a 200 tokens/segundo.

¿Qué aplicación se ejecuta más rápido?

Por token, vLLM en una GPU NVIDIA moderna. Por instalación, llama.cpp con una buena cuantificación. Por conveniencia, Ollama.