Ejecutar varios modelos de IA local en escritorio con Ollama

Las mejores aplicaciones para ejecutar varios modelos de IA local en escritorio son las que dejan de tratar tu GPU como una consola de cartucho de ranura única. Un artículo reciente de XDA de un escritor que dejó de perseguir modelos locales más grandes lo expresa claramente: dos modelos de 2GB ejecutándose uno al lado del otro superaron a un modelo de 8GB, porque cada modelo pequeño fue elegido para una tarea específica. Un modelo de código de 3B manejó el autocompletado. Un modelo de chat de 3B manejó la conversación. Ninguno de ellos necesitaba ser universal.

Ese es el patrón que nos importa aquí. No perseguir benchmarks. Enrutamiento. Probamos siete corredores y orquestadores de escritorio durante las últimas semanas, cronometramos lo rápido que intercambian modelos, comprobamos si pueden mantener dos cargados a la vez, y clasificamos lo útil que es el enrutamiento en la práctica. Esta lista es para cualquiera con una tarjeta de 12GB a 24GB que quiera un asistente real más un modelo de código más quizás un modelo de visión, todo en una máquina.

Qué buscar en un corredor local multimodelo

Seis cosas separan las herramientas que hacen que los flujos de trabajo multimodelo sean agradables de las que te fuerzan a un surco de modelo único.

Comparación rápida

Aplicación Mejor para Plataformas Plan gratuito Nivel de pago Historia multimodelo
Ollama Corredor fundamental y capa API Windows, macOS, Linux Totalmente gratuito, código abierto Ninguno Intercambio en caliente bajo demanda, mantiene modelos recientes calientes
LM Studio GUI de pestañas multimodelo Windows, macOS, Linux Gratuito para uso personal Licencia de equipo para trabajo Carga varios modelos a la vez, cambia pestañas
Msty Chat paralelo entre modelos Windows, macOS, Linux Nivel gratuito Licencia de por vida Aurum Respuestas lado a lado de hasta ocho modelos
Jan Cliente de chat multimodelo de código abierto Windows, macOS, Linux Totalmente gratuito, código abierto Ninguno Intercambio por conversación, servidor compatible con OpenAI
Open WebUI Capa de enrutamiento de canalización sobre Ollama Interfaz web, auto-hospedado Totalmente gratuito, código abierto Ninguno Selección de modelo por solicitud, scripts de canalización
LocalAI Enrutador API directo Windows, macOS, Linux, Docker Totalmente gratuito, código abierto Ninguno Un endpoint enruta a muchos backends y formatos
LiteLLM Proxy entre backends Windows, macOS, Linux Totalmente gratuito, código abierto Nivel de nube administrado Enruta por nombre de modelo a cualquier proveedor local o remoto

Las aplicaciones

1. Ollama, mejor para intercambio en caliente de modelos locales

Ollama es la aplicación de la que depende la mayoría del resto de esta lista, y por una buena razón. Su CLI y API alrededor de llama.cpp hacen que la gestión de modelos se sienta como docker pull, y su comportamiento con múltiples modelos es la razón por la que los flujos de trabajo de dos modelos pequeños funcionan en primer lugar. Ejecuta ollama run llama3.2:3b para chat y ollama run qwen2.5-coder:3b para autocompletado, y el demonio mantiene el usado recientemente caliente mientras carga el otro. El keep-alive predeterminado es de cinco minutos, por lo que un cambio rápido hacia atrás no repaga el costo de carga. Establece OLLAMA_KEEP_ALIVE más alto y el modelo permanece residente hasta que la presión de VRAM lo obligue a desalojarlo.

El endpoint compatible con OpenAI en http://localhost:11434/v1 significa que cada complemento IDE, frontend de chat y marco de agente que probamos se conectó sin adaptadores. En una tarjeta de 24GB mantuvimos un modelo de chat de 7B y un modelo de código de 3B residentes juntos con espacio de sobra.

Donde se queda corto: Sin interfaz gráfica. El descubrimiento de modelos es un archivo de texto llamado Modelfile. La compatibilidad con GPU de Windows ha sido estable desde el lanzamiento nativo, pero aún se queda atrás de macOS en pulido.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: Sitio del editor - GitHub

Resumen: Instala esto primero. Incluso si tu aplicación diaria es una aplicación GUI, probablemente quieras Ollama como backend.

2. LM Studio, mejor interfaz gráfica para mantener varios modelos a la vez

LM Studio es la aplicación para darle a un usuario sin CLI que aún quiera el truco de modelos pequeños. La serie 0.3 añadió soporte multimodelo en la misma ventana, así que puedes cargar un modelo de chat en una pestaña, un modelo de código en otra, y cambiar entre ellos sin esperar a que se cargue cada vez. El servidor incorporado expone un endpoint compatible con OpenAI por cada modelo cargado, lo que significa que una extensión de editor puede golpear el modelo de código mientras tu ventana de chat sigue hablando con el modelo de chat.

El descubrimiento de modelos es una caja de búsqueda contra Hugging Face con selector de cuantización y estimador de VRAM incorporados. La interfaz gráfica muestra controles deslizantes de descarga de GPU por modelo, lo que importa cuando intentas que dos modelos de tamaño medio quepan en una tarjeta.

Donde se queda corto: No es código abierto. La licencia gratuita cubre uso personal, y hay una licencia separada para uso laboral que el flujo de descarga te pide que reconozcas. Algunos formatos de cuantización se cargan más lentamente que en raw llama.cpp.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: Sitio del editor - GitHub

Resumen: La mejor opción si quieres una interfaz gráfica real, varios modelos cargados y un servidor API que funcione sin tocar una terminal.

3. Msty, mejor para chat paralelo y comparación

Msty es la aplicación que nos hizo dejar de probar modelos A/B copiando y pegando. Su vista dividida te permite enviar un mensaje a dos, cuatro, u ocho modelos a la vez y leer las respuestas lado a lado. Ese es exactamente el flujo de trabajo que deseas cuando intentas descubrir qué modelo pequeño merece la pena mantener cargado. Apúntalo a Ollama y hereda tus modelos locales automáticamente. Apúntalo a claves de OpenAI o Anthropic y compara local versus alojado en la misma vista.

La función Knowledge Stack te permite adjuntar carpetas de documentos y PDF e interrogarlos entre modelos, lo que se empareja bien con un modelo de chat pequeño más un modelo de incrustación pequeño mantenidos residentes juntos.

Donde se queda corto: No es código abierto. El nivel gratuito cubre uso personal, y la actualización Aurum desbloquea chat dividido por encima de dos modelos, sincronización de espacio de trabajo y algunos otros extras. La interfaz gráfica está llena de características y requiere una sesión para aprender.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: Sitio del editor

Resumen: Elige esto cuando realmente necesites ver dos modelos respondiendo a la misma pregunta al mismo tiempo.

4. Jan, mejor cliente de chat multimodelo de código abierto

Jan es la alternativa de código abierto si quieres una interfaz gráfica de estilo LM Studio sin la cuestión de licencia. Viene con su propio motor de inferencia, puede ejecutarse contra servidores de Ollama o llama.cpp, y te permite cambiar el modelo por conversación. Cada hilo recuerda qué modelo, qué indicación del sistema y qué parámetros estaba usando, por lo que un hilo de código y un hilo de escritura pueden apuntar a especialistas diferentes sin contaminarse mutuamente.

El servidor local incorporado expone un endpoint compatible con OpenAI, y la aplicación en sí es extensible a través de una pequeña API de extensión. En nuestras pruebas, el cambio de modelo entre dos hilos fue casi instantáneo cuando el objetivo ya estaba cargado y alrededor de tres a ocho segundos cuando tenía que cargarse desde el disco en un NVMe.

Donde se queda corto: No puede mantener varios modelos residentes en su propio motor aún. Si quieres dos cargados a la vez, apúntalo a Ollama y deja que Ollama haga la gestión de residencia. La aceleración de GPU en Windows aún se queda atrás de la compilación de macOS para algunos formatos de cuantización.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: Sitio del editor - GitHub

Resumen: La opción correcta si el código abierto importa y quieres enrutamiento de modelo por hilo sin trabajo de CLI.

5. Open WebUI, mejor capa de enrutamiento sobre Ollama

Open WebUI solía ser marcado como Ollama WebUI, y sigue siendo el frontend web más completo para una pila local auto-hospedada. Lo que le gana un lugar aquí es su sistema de canalizaciones: puedes definir scripts que elijan el modelo por solicitud basado en el contenido del mensaje, el historial de mensajes o los archivos adjuntos. El ejemplo clásico es una canalización de enrutamiento que envía cualquier cosa que comience con un bloque de código a tu modelo codificador y todo lo demás a tu modelo de chat, todo dentro de una conversación.

También admite respuestas de modelo paralelo en un solo mensaje, más RAG con tu propio almacén de documentos, más llamadas de función. Debido a que expone todo esto a través de tu LAN, una caja de Ollama en el sótano puede servir chat multimodelo enrutado a cada máquina en la casa.

Donde se queda corto: Primero web. No hay cliente de escritorio nativo, así que ejecutas localmente en un navegador o auto-hospedas en un servidor. La configuración pide Docker o Python, no un instalador de doble clic.

Precios:

Plataformas: Se ejecuta en cualquier lugar donde Docker o Python se ejecutan. Acceso vía navegador en Windows, macOS, Linux.

Descargar: Sitio del editor - GitHub

Resumen: Usa esto cuando quieras enrutamiento programable y te sientas cómodo con una instalación de Docker de cinco minutos.

6. LocalAI, mejor enrutador API directo entre familias de modelos

LocalAI es la respuesta a un problema específico. Tienes un modelo de chat en GGUF, un modelo de whisper para transcripción, un modelo de imagen para difusión, y un modelo de incrustación pequeño, y quieres un endpoint que hable compatible con OpenAI para todos ellos. Ejecuta cada backend en su propio worker, enruta solicitudes por nombre de modelo, y devuelve respuestas en la misma forma que lo haría una API alojada. Tu complemento Continue, tu herramienta de notas y tu script personalizado todos apuntan a la misma URL y seleccionan su modelo por nombre.

Para el patrón de dos modelos pequeños, significa un flujo de trabajo como Continue preguntando qwen-coder-3b mientras tu aplicación de notas pregunta llama-3.2-3b, ambos servidos desde el mismo proxy, ambos cargables en caliente, ambos aislados para que un trabajo de incrustación pesado no detenga el chat.

Donde se queda corto: La configuración es más pesada que Ollama. La configuración del modelo es YAML por backend. La aceleración de GPU funciona pero requiere algo de conocimiento de lo que has instalado. La documentación es exhaustiva pero asume que ya sabes cómo se ve un payload compatible con OpenAI.

Precios:

Plataformas: Windows, macOS, Linux, Docker.

Descargar: Sitio del editor - GitHub

Resumen: La opción correcta cuando quieres una API local que hable a texto, visión, audio e incrustaciones sin pegar servidores separados juntos.

7. LiteLLM, mejor proxy entre backends para enrutamiento de tareas

LiteLLM comenzó como un SDK de Python para llamar a cien proveedores de modelos con una interfaz, y su servidor proxy es lo que le gana un lugar en una lista orientada localmente. Ejecuta en frente de Ollama, LM Studio, LocalAI o cualquier mezcla, y los clientes hablan con él con un payload compatible con OpenAI. Reescribe la solicitud para el backend que sea detrás del nombre de modelo solicitado. Eso significa un endpoint enruta chat a tu Llama local y code a tu Qwen Coder local, con la misma herramienta obteniendo ambos sin saber dónde viven.

También maneja fallbacks, reintentos, límites de velocidad y presupuestos por clave, lo que importa en el momento en que comienzas a permitir que más de una aplicación comparta tu GPU.

Donde se queda corto: Es un proxy, no un corredor. Aún necesitas Ollama o LocalAI detrás de él para servir realmente los modelos. La configuración es un archivo YAML. El panel pulido se sienta en el nivel de nube administrado, así que los auto-hospedadores se basan en la interfaz gráfica gratuita más archivos de configuración.

Precios:

Plataformas: Windows, macOS, Linux, Docker.

Descargar: Sitio del editor - GitHub

Resumen: Añade esto el día que tengas más de una aplicación presionando más de un modelo local y quieras una única fuente de verdad para nombres, enrutamiento y límites.

Cómo elegir el correcto

Si quieres la configuración mínima para el truco de modelos pequeños, ejecuta Ollama y ya está. Extrae un modelo de chat de 3B y un modelo de código de 3B, deja que el demonio mantenga uno caliente mientras usas el otro, y apunta tu editor al endpoint local.

Si quieres una interfaz gráfica y sin terminal, instala LM Studio. Carga dos modelos en dos pestañas y usa su servidor incorporado para cualquier cosa que necesite una API.

Si realmente quieres comparar modelos antes de comprometer VRAM a ellos, usa Msty y divide el mismo mensaje entre candidatos hasta que uno gane.

Si quieres una interfaz gráfica y código abierto, ejecuta Jan encima de Ollama.

Si quieres enrutar por contenido de mensaje en lugar de por aplicación, auto-hospeda Open WebUI frente a Ollama y escribe una canalización.

Si tu carga de trabajo incluye visión, transcripción o incrustaciones junto con chat, coloca LocalAI en el medio y deja que una API sirva todo.

Si ya tienes tres herramientas presionando dos modelos y se está volviendo desordenado, suelta LiteLLM frente y renombra todo por rol.

Preguntas frecuentes

¿Realmente puedo ejecutar dos modelos de IA locales a la vez?

Sí, en cualquier GPU con suficiente VRAM para sostener ambos. Dos modelos cuantificados de 3B o 4B caben cómodamente en una tarjeta de 12GB. Ollama y LM Studio pueden sostener ambos residentes, y las solicitudes a cualquiera que esté inactivo vuelven instantáneamente sin carga fría. El artículo de XDA que inspiró este es un ejemplo de trabajo, no uno teórico.

¿Es un modelo de IA local grande siempre mejor que dos pequeños?

No para flujos de trabajo reales. Un modelo de 8GB sencillo tiene que ser un generalista, lo que significa que es un codificador mediocre y un escritor mediocre. Dos modelos de 3B elegidos por su especialización (un modelo codificador más un modelo de chat, digamos) a menudo superan al modelo sencillo más grande en cada tarea especialista, especialmente con enrutamiento correcto. El único lugar donde un modelo sencillo más grande aún gana es el razonamiento profundo en una sola pregunta difícil que necesita contexto largo.

¿Cuál es la mejor aplicación gratuita para ejecutar varios modelos locales en escritorio?

Ollama, para el demonio y la API. Añade Jan u Open WebUI encima cuando quieras una interfaz gráfica o enrutamiento programable. Los tres son código abierto y gratis sin límite de asientos.

¿Permite LM Studio ejecutar dos modelos a la vez?

Sí, desde la serie 0.3 soporta carga de múltiples modelos en la misma sesión con pestañas, y el servidor compatible con OpenAI incorporado expone cada modelo cargado como un endpoint separado. La limitación principal es VRAM.

¿Cuánta VRAM necesito para ejecutar dos modelos de IA local?

Un mínimo cómodo para dos modelos cuantificados de 3B o 4B es 12GB. En tarjetas de 8GB puedes ejecutar apenas dos modelos muy pequeños en Q4, pero perderás algo de espacio de concurrencia. Para un 7B más un 3B mantenido residente juntos, planifica 16GB y arriba.

¿Cuál es la diferencia entre Ollama y LocalAI?

Ollama es un corredor enfocado alrededor de llama.cpp con una CLI limpia, un catálogo de modelo de texto y un endpoint compatible con OpenAI. LocalAI es una capa de API más amplia que puede frente a muchos backends a la vez, incluyendo texto, imagen, audio e incrustaciones, con config YAML por backend. Ollama es más fácil de comenzar. LocalAI es lo que alcanzas cuando tu flujo de trabajo es más que chat.