XDA publicó un artículo este mes argumentando que un stack de IA local más pequeño es un stack de IA local más productivo. El autor había acumulado el desorden habitual: dos ejecutores de modelos, tres interfaces de usuario, una base de datos vectorial que nadie usaba y una carpeta de adaptadores que había olvidado. Reducir a un conjunto mínimo facilitó el mantenimiento de la configuración y más fácil de usar. Probamos ocho de las mejores aplicaciones para un stack de IA local minimalista en escritorio, en un MacBook Pro M3, una estación de trabajo Windows con una RTX 4070 y una caja Debian con una AMD 7800 XT, enfocándonos en cómo se comporta cada una como la única herramienta en el stack en lugar de una de muchas.
Qué buscar en una aplicación de IA local minimalista
- Instalación de binario único o cercana. Una herramienta que sea un
brew installo un.msisupera a una herramienta que necesita Docker más Python más un archivo de configuración. - Gestión de modelos que no se interpone. Descargar un GGUF debe ser un comando. Eliminar uno no debe requerir buscar una carpeta oculta.
- Compatibilidad de API. Un endpoint compatible con OpenAI es lo que te permite apuntar cualquier herramienta existente a tu modelo local sin reescribir ambos lados.
- Detección automática de GPU y CPU. El stack debe determinar si tienes Metal, CUDA, ROCm o solo CPU y usar el correcto. La selección manual del backend es el desorden que estas herramientas debían eliminar.
- Disciplina de RAM. Una herramienta que está inactiva con 2 GB de RAM para servir un modelo que cabe en 8 GB está haciendo algo mal.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Precio inicial | Característica destacada |
|---|---|---|---|---|---|
| llama.cpp | El runtime de referencia | Windows, macOS, Linux | Gratuito, código abierto | Gratuito | Inferencia binaria única portátil |
| llamafile | Un archivo, sin instalación | Windows, macOS, Linux | Gratuito, código abierto | Gratuito | Modelo más runtime en un ejecutable |
| Ollama | CLI más simple más API | Windows, macOS, Linux | Gratuito, código abierto | Gratuito | ollama run y tienes un endpoint OpenAI |
| Jan | Interfaz de usuario de escritorio nativa con API | Windows, macOS, Linux | Gratuito, código abierto | Gratuito | Chat de escritorio multiplataforma |
| KoboldCpp | Interfaz de usuario binaria única más API | Windows, macOS, Linux | Gratuito, código abierto | Gratuito | Ejecutor de GGUF con interfaz web integrada |
| Msty | Interfaz de usuario comercial pulida en modelos locales | Windows, macOS, Linux | Nivel gratuito | Suscripción a Msty para funciones avanzadas | Interfaz de chat multimodelo |
| GPT4All | Chat de escritorio más simple | Windows, macOS, Linux | Gratuito, código abierto | Gratuito | Amigable para principiantes, sin CLI |
| LM Studio | Ejecutor local completo | Windows, macOS, Linux | Gratuito para uso personal | Licencia comercial | Interfaz de descubrimiento de modelo, amplio soporte de backend |
Las aplicaciones
1. llama.cpp — Mejor para el runtime de referencia en el que todos construyen
llama.cpp es el runtime que la mayoría de esta lista envuelve de una forma u otra. Es un servidor de inferencia C++ portátil e independiente de dependencias que ejecuta modelos GGUF en CPU, Metal, CUDA y ROCm. Como un stack minimalista en sí mismo, llama-server te da un endpoint compatible con OpenAI, y llama-cli te da un REPL. Eso es suficiente para la mayoría del trabajo de IA local.
Dónde falla: Sin interfaz de usuario pulida. Estás compilando o descargando un binario de lanzamiento. La gestión de modelos es manual.
Precio:
- Gratuito: Totalmente de código abierto
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/ggerganov/llama.cpp
Conclusión: llama.cpp es la opción cuando quieres las menos partes móviles y te sientes cómodo en una terminal.
2. llamafile — Mejor para un runtime y un modelo en un ejecutable
llamafile del proyecto Mozilla Ocho agrupa un modelo y el runtime de llama.cpp en un único binario Cosmopolitan-libc que se ejecuta en Windows, macOS y Linux sin instalación. Descarga el archivo, cámbialo, ejecútalo. Abre una interfaz de usuario del navegador y expone una API compatible con OpenAI en localhost. Es la interpretación más literal de “IA local minimalista” en la lista.
Dónde falla: Los archivos binarios portátiles únicos pueden activar herramientas de seguridad del host. Descargar un nuevo modelo significa descargar un nuevo llamafile.
Precio:
- Gratuito: Totalmente de código abierto
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/Mozilla-Ocho/llamafile
Conclusión: llamafile es la opción cuando la instalación debe ser un archivo y solo uno.
3. Ollama — Mejor para el flujo de trabajo CLI más simple más API
Ollama envuelve llama.cpp con la experiencia de instalación y comando más limpia de cualquier cosa en esta lista. ollama pull llama3.2:8b descarga un modelo. ollama run llama3.2:8b abre un chat. ollama serve expone un endpoint compatible con OpenAI en el puerto 11434 por defecto. El formato Modelfile te permite fijar prompts de sistema y parámetros con un único archivo de texto.
Dónde falla: La instalación predeterminada ejecuta el servidor como un servicio de fondo que quizás no quieras. La cuantización manual de modelos es limitada en comparación con llama.cpp sin procesar.
Precio:
- Gratuito: Totalmente de código abierto
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: ollama.com
Conclusión: Ollama es la opción cuando la instalación de un comando y la ejecución de un comando son la barra mínima.
4. Jan — Mejor para una interfaz de usuario de escritorio nativa que posees
Jan es una aplicación de escritorio creada desde cero para modelos locales, de código abierto, con un servidor API compatible con OpenAI integrado. Es lo que instalas cuando quieres una interfaz de usuario de chat de escritorio real sin la superficie de LM Studio. El equipo envía compilaciones para los tres sistemas operativos y mantiene el flujo de descubrimiento de modelos simple.
Dónde falla: Proyecto más joven que LM Studio u Ollama. Algunas características avanzadas (backends especializados, personalización profunda de modelos) están rezagadas.
Precio:
- Gratuito: Totalmente de código abierto
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: jan.ai
Conclusión: Jan es la opción cuando una interfaz de usuario de escritorio adecuada es el factor decisivo.
5. KoboldCpp — Mejor para interfaz de usuario binaria única más API en un destino portátil
KoboldCpp comenzó como un fork de llama.cpp dirigido a la comunidad de KoboldAI, y ha crecido hasta convertirse en un ejecutor GGUF de binario único con interfaz de usuario de navegador, endpoint de API, soporte de entrada de imágenes y audio, y sin paso de instalación. Coloca el binario y un GGUF junto a él, ejecuta un comando y todo está listo.
Dónde falla: Algunas características especializadas (integración de Horde, prompts específicos de KoboldAI) no importan para un caso de uso de chat general.
Precio:
- Gratuito: Totalmente de código abierto
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/LostRuins/koboldcpp
Conclusión: KoboldCpp es la opción cuando quieres un único binario que te dé una interfaz de usuario y una API sin una aplicación más pesada.
6. Msty — Mejor para una interfaz de usuario comercial pulida en modelos locales
Msty utiliza el enfoque de LM Studio y produce una interfaz de usuario más limpia. Chatea lado a lado con múltiples modelos, conéctate a endpoints locales de Ollama o Jan, y organiza conversaciones en carpetas. El nivel gratuito es generoso; el nivel pagado es lo que desbloquea características de multiusuario y espacio de trabajo.
Dónde falla: Código cerrado. No en el extremo minimalista de “instalar un binario de código abierto.” Para un usuario solitario que valora el pulido sobre los principios, eso está bien.
Precio:
- Gratuito: Interfaz de usuario central completa
- Pagado: Suscripción a Msty para características avanzadas de espacio de trabajo
Plataformas: Windows, macOS, Linux
Descargar: msty.app
Conclusión: Msty es la opción cuando el pulido de la interfaz de usuario vale la pena cambiar la restricción de código abierto.
7. GPT4All — Mejor para chat de escritorio amigable para principiantes
GPT4All de Nomic es la forma más amigable de ejecutar una LLM local para alguien que no quiere tocar una terminal. Instala la aplicación, explora una lista de modelos curada, elige uno, chatea. También expone una API local e integra con Nomic Atlas para RAG basado en documentos si decides ir más allá del chat.
Dónde falla: La lista de modelos curada es un pequeño subconjunto de lo que está disponible en Hugging Face. Los usuarios avanzados crecen más allá de él.
Precio:
- Gratuito: Totalmente de código abierto
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: gpt4all.io
Conclusión: GPT4All es la opción para un usuario de IA local por primera vez que quiere una aplicación de escritorio que simplemente funcione.
8. LM Studio — Mejor para un ejecutor local completo
LM Studio es el extremo maximalista de “todavía una única aplicación de escritorio.” Descubrimiento de modelos de Hugging Face, soporte de backend múltiple (llama.cpp, MLX en Apple Silicon), interfaz de usuario de chat completa, servidor de API y superficie de configuración de modelos que expone todo. Es lo que las personas usan por defecto cuando la simplicidad de Ollama es demasiado limitada.
Dónde falla: No de código abierto. Huella de instalación más grande que las opciones anteriores. La superficie de características maximalista es lo opuesto al stack minimalista que argumentaba el artículo de XDA, pero se incluye aquí como punto de referencia para lo que sucede cuando te niegas a recortar.
Precio:
- Gratuito: Uso personal
- Pagado: Licencia comercial para despliegues comerciales
Plataformas: Windows, macOS, Linux
Descargar: lmstudio.ai
Conclusión: LM Studio es la opción cuando un ejecutor local completo vale la pena la instalación más grande que cualquiera de los anteriores.
Cómo elegir el correcto
- El stack mínimo viable: Ollama. Instálalo, extrae un modelo, listo. Todo lo demás es opcional.
- Si prefieres un archivo y sin instalación: llamafile.
- Si quieres el runtime de referencia sin envoltura: llama.cpp directamente.
- Si quieres una interfaz de usuario de chat de escritorio y código abierto: Jan.
- Si quieres un único binario que también es una interfaz de usuario: KoboldCpp.
- Si el pulido importa más que el código abierto: Msty encima de un endpoint de Ollama.
- Si nunca has instalado un modelo local antes: GPT4All.
- Si has superado Ollama y quieres más controles: LM Studio.
Preguntas frecuentes
¿Qué modelo debo ejecutar en 16 GB de RAM? Una cuantización Q4 de un modelo 7B u 8B funciona bien en ese rango y cubre la mayoría de los casos de uso de chat y codificación. La cuantización Q4 de 13B es posible pero ajustada.
¿Funcionan estas aplicaciones en Apple Silicon? Sí. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio y Msty todos usan Metal en Apple Silicon y alcanzan velocidad cercana a la nativa. llamafile se envía con binarios de Apple Silicon.
¿Puedo apuntar herramientas de estilo ChatGPT a un modelo local? Sí. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio y llamafile todos exponen un endpoint compatible con OpenAI en localhost. Apunta cualquier herramienta que acepte una URL base personalizada a http://localhost:<port>/v1.
¿En qué se diferencia un stack minimalista de uno maximalista? Menos partes móviles. Un runtime, un administrador de modelos, una interfaz de usuario. Los stacks maximalistas añaden bases de datos vectoriales, capas de orquestación y frameworks de agentes. La mayoría de usuarios solitarios no necesitan nada de eso hasta que un problema específico lo exija.
¿Alguno de estos es capaz de agente de inmediato? No. Estos son runtimes de inferencia e interfaces de usuario de chat. Para un bucle de agente añades una herramienta separada que hable el protocolo OpenAI Chat Completions contra uno de estos endpoints.
¿Cuál es el stack más pequeño en disco? llamafile más un modelo cuantizado único es la instalación más ligera posible. Ollama más su almacén de modelos es un segundo cercano y más fácil de crecer.