XDA pasó una semana probando todos los modelos de lenguaje pequeños que vale la pena ejecutar en un portátil normal y se quedó con tres ganadores. La historia salió la misma semana en que Qwen 3, Llama 3.2 y Gemma 3 lanzaron simultáneamente cuantos de 1B–8B que funcionan muy por encima de su peso. Los mejores programas para LLM locales pequeños en escritorio ya no son juguetes de investigación. Caben en 4 GB de RAM, funcionan sin tarjeta gráfica discreta y responden preguntas cotidianas lo suficientemente rápido como para reemplazar la pestaña de ChatGPT que mantienes abierta.
Probamos ocho aplicaciones en un MacBook Air M2 (16 GB), un portátil Ryzen de gama media con iGPU únicamente y una estación de trabajo Fedora con tarjeta NVIDIA de 6 GB. Cada una se evaluó según la rapidez con que una instalación nueva podía descargar un cuanto de 3B, qué tal manejaba una carga de trabajo mixta de chat, código y resúmenes breves de documentos, y si seguía siendo usable mientras se realizaba una videollamada en segundo plano.
Qué buscar en una aplicación de LLM local pequeño
- Catálogo de modelos pequeños. Descargas directas de Llama 3.2 (1B/3B), Qwen 3 (0.5B–8B), Gemma 3 (2B/4B), Phi-4-mini y SmolLM sin buscar en Hugging Face.
- Presets de cuantización. Los cuantos GGUF de 4 y 5 bits son el punto dulce en máquinas de 8–16 GB. La aplicación debe tener un valor por defecto sensato.
- Fallback solo CPU. No todos tienen tarjeta gráfica. La aplicación debe seguir siendo usable en gráficos integrados o CPU puro.
- Huella de memoria. Cuánta RAM utiliza la aplicación en sí antes de cargar un modelo. Algunos shells de Electron ocupan 800 MB en idle.
- API compatible con OpenAI. Para que un editor de código, una aplicación de notas o un script de shell puedan enviar indicaciones al mismo proceso.
- Inicio en frío. El tiempo desde hacer doble clic hasta un chat en ejecución importa cuando la razón por la que lo quieres local es evitar la pestaña del navegador.
Comparación rápida
| Programa | Mejor para | Plataformas | Plan gratuito | De pago | Calificación |
|---|---|---|---|---|---|
| Jan | Cliente de código abierto tipo ChatGPT | Windows, macOS, Linux | Totalmente gratuito | Ninguno | 4.7 |
| Ollama | Runtime CLI + API más simple | Windows, macOS, Linux | Totalmente gratuito | Ninguno | 4.9 |
| LM Studio | Descubrimiento de modelos con interfaz gráfica real | Windows, macOS, Linux | Totalmente gratuito personal | Contactar ventas para trabajo | 4.8 |
| GPT4All | Local + fallback en la nube opcional | Windows, macOS, Linux | Totalmente gratuito | Ninguno | 4.5 |
| Msty | Comparación de chat dividido entre modelos | Windows, macOS, Linux | Totalmente gratuito | Aurum $99 de por vida | 4.7 |
| llamafile | Modelo portátil de archivo único | Windows, macOS, Linux | Totalmente gratuito | Ninguno | 4.6 |
| Cortex | Runtime tipo Ollama, huella menor | Windows, macOS, Linux | Totalmente gratuito | Ninguno | 4.4 |
| KoboldCpp | Escritura creativa de contexto largo | Windows, macOS, Linux | Totalmente gratuito | Ninguno | 4.5 |
Los programas
1. Jan para LLM local pequeño — Mejor cliente de código abierto tipo ChatGPT
Jan ofrece una aplicación de escritorio tipo ChatGPT que se ve familiar en el momento en que la abres, y luego descarga silenciosamente Llama 3.2 3B o Qwen 3 4B en segundo plano. Incluye asistentes, hilos, carga de archivos y un servidor compatible con OpenAI. En el MacBook Air M2, el primer chat con Llama 3.2 3B comenzó a responder preguntas en tres minutos después de la instalación.
Donde falla: El inicio en frío en Windows sigue siendo más lento que en macOS por unos segundos. Algunas importaciones de Hugging Face requieren una caída GGUF manual.
Precios:
- Gratuito: Totalmente gratuito, código abierto bajo AGPL.
- De pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: jan.ai · github.com/janhq/jan
En conclusión: La opción si quieres la experiencia de ChatGPT sin suscripción ni conexión a internet.
2. Ollama para LLM local pequeño — Mejor runtime CLI + API más simple
Ollama es el runtime en el que se construye todo lo demás. ollama run llama3.2:3b descarga el cuanto, lo carga e inicia el chat. La API compatible con OpenAI en el puerto 11434 significa que cualquier editor, aplicación de notas o script que hable OpenAI puede comunicarse con él sin cambios.
Donde falla: Sin interfaz gráfica nativa. Lo emparejarás con Open WebUI o Msty para una ventana de chat.
Precios:
- Gratuito: Totalmente gratuito, licencia MIT.
- De pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: ollama.com · github.com/ollama/ollama
En conclusión: Empieza aquí incluso si también instalas un cliente de chat. La mayoría de otras aplicaciones en esta lista pueden apuntar a Ollama.
3. LM Studio para LLM local pequeño — Mejor descubrimiento de modelos con interfaz gráfica real
LM Studio es la aplicación todo en uno para explorar Hugging Face, elegir un cuanto y chatear sin tocar una terminal. El navegador de modelos filtra por tamaño y licencia, lo que importa cuando intentas meter un modelo en 6 GB de RAM. El servidor API local es un solo interruptor.
Donde falla: No es código abierto. El soporte de Linux se queda atrás de Windows y macOS en nuevas funciones.
Precios:
- Gratuito: Totalmente gratuito para uso personal.
- De pago: Contactar ventas para implementaciones comerciales.
Plataformas: Windows, macOS, Linux.
Descargar: lmstudio.ai
En conclusión: La interfaz gráfica más suave para explorar y probar cuantos pequeños lado a lado.
4. GPT4All para LLM local pequeño — Mejor local más fallback en la nube opcional
GPT4All ofrece una aplicación de chat nativa que ejecuta cuantos GGUF localmente y también puede enrutar a OpenAI o Groq cuando se necesita un modelo más pesado. LocalDocs te permite apuntar a una carpeta y obtener respuestas fundamentadas sin enviar archivos a ningún lado.
Donde falla: El catálogo de modelos está un paso atrás de LM Studio. La descarga de GPU en Windows requiere algunos ajustes.
Precios:
- Gratuito: Totalmente gratuito, código abierto.
- De pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: gpt4all.io
En conclusión: Elige esto cuando quieras una aplicación que comience localmente y pueda usar la nube bajo demanda.
5. Msty para LLM local pequeño — Mejor comparación de chat dividido entre modelos
Msty muestra dos o tres respuestas de modelos lado a lado. Esa es la forma más rápida de decidir si Qwen 3 4B o Gemma 3 4B se ajusta a tu estilo de indicación. Habla con Ollama, LM Studio y API en la nube, por lo que la comparación no se limita a lo que aloja.
Donde falla: Algunas funciones avanzadas están detrás del nivel Aurum. No es código abierto.
Precios:
- Gratuito: Chat completamente gratuito y vista dividida.
- De pago: Aurum $99 de por vida para pilas de conocimiento y extras premium.
Plataformas: Windows, macOS, Linux.
Descargar: msty.app
En conclusión: La opción si audicionas modelos a menudo y quieres verlos en debate.
6. llamafile para LLM local pequeño — Mejor modelo portátil de archivo único
llamafile envuelve un modelo y su runtime en un ejecutable. Colócalo en una unidad USB, haz doble clic en cualquier máquina Windows, macOS o Linux, y una pestaña del navegador se abre con un chat. Es la contribución de Mozilla a Cosmopolitan libc, y elimina completamente el paso de instalación.
Donde falla: Los archivos pueden ser de 3–5 GB. El primer lanzamiento en máquinas corporativas bloqueadas puede requerir un clic derecho.
Precios:
- Gratuito: Totalmente gratuito, Apache 2.0.
- De pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: github.com/Mozilla-Ocho/llamafile
En conclusión: La opción correcta para portabilidad, para demostraciones o para una máquina en la que no puedes instalar software.
7. Cortex para LLM local pequeño — Mejor runtime tipo Ollama con huella menor
Cortex es el runtime que potencia Jan bajo el capó, expuesto como un daemon independiente. Tiene una huella menor que Ollama en idle y por defecto a llama.cpp con una API compatible con OpenAI. Las descargas de modelos usan el mismo ecosistema GGUF.
Donde falla: Comunidad más pequeña, por lo que hay menos integraciones de terceros. La documentación sigue poniéndose al día.
Precios:
- Gratuito: Totalmente gratuito, código abierto.
- De pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: cortex.so · github.com/janhq/cortex.cpp
En conclusión: Elige esto si Ollama te parece pesado y quieres un daemon más ligero que aún hable la API de OpenAI.
8. KoboldCpp para LLM local pequeño — Mejor para escritura creativa de contexto largo
KoboldCpp es el fork de llama.cpp construido alrededor de ficción, juego de rol y escritura de contexto largo. La memoria de personaje persistente, la información del mundo y una interfaz de navegador enfocada en borrador en lugar de preguntas y respuestas la hacen diferente a las otras aplicaciones en esta lista, de una manera útil. Maneja contextos de 32K–128K en modelos pequeños mejor que la mayoría de las interfaces gráficas.
Donde falla: La interfaz gráfica es densa y descaradamente para usuarios avanzados. No es la aplicación para entregar a un amigo no técnico.
Precios:
- Gratuito: Totalmente gratuito, AGPL.
- De pago: Ninguno.
Plataformas: Windows, macOS, Linux.
Descargar: github.com/LostRuins/koboldcpp
En conclusión: La opción si la razón por la que quieres un modelo local son sesiones de escritura que ChatGPT limitaría por velocidad.
Cómo elegir el correcto
Si quieres la configuración más simple que funcione: Ollama más un cliente de chat. Instala Ollama, luego elige Jan u Open WebUI encima.
Si quieres una aplicación de escritorio pulida: LM Studio para la interfaz gráfica, o Jan si el código abierto importa.
Si audicionas modelos a menudo: Msty para la vista dividida.
Si estás haciendo una demostración a alguien o trabajando en una máquina bloqueada: llamafile.
Si quieres el daemon más ligero: Cortex.
Si escribes ficción larga o ejecutas campañas de juego de rol: KoboldCpp.
Si un modelo pequeño no es suficiente para una tarea específica, la mayoría de estas aplicaciones también enrutan a puntos finales en la nube. Comienza localmente, escala solo cuando la respuesta local no es lo suficientemente buena.
Preguntas frecuentes
¿Cuál es la mejor aplicación de LLM local pequeño para un portátil sin tarjeta gráfica? Ollama con un modelo de 3B o 4B se ejecuta en CPU y gráficos integrados con velocidad aceptable. LM Studio ofrece presets solo para CPU en su selector de modelos.
¿Puede un LLM local pequeño reemplazar a ChatGPT? Para chat diario, resúmenes y asistencia con código corto, sí. Para razonamiento pesado, flujos de trabajo de agentes y tareas de investigación largas, no. La mayoría de las personas que prueban ambos terminan usando local para indicaciones diarias y nube para las difíciles.
¿Qué tamaño de modelo se ejecuta en 8 GB de RAM? Un modelo 3B en cuantización Q4 cabe cómodamente con margen para la aplicación en sí. Un cuanto 4B funciona si cierras otras aplicaciones de memoria pesada.
¿Son los LLM locales realmente privados? Las aplicaciones en esta lista no cargan indicaciones por defecto. GPT4All y Msty ofrecen enrutamiento en la nube opcional, y es opt-in. Si el aislamiento total importa, desactiva el acceso a la red para la aplicación.
¿Cuál es la mejor aplicación de LLM local pequeño gratuita? Ollama para el runtime y Jan para la interfaz gráfica. Ambos son gratuitos, ambos son código abierto, ambos se mantienen activamente.