Los mejores programas para LLM locales pequeños en escritorio en 2026

XDA pasó una semana probando todos los modelos de lenguaje pequeños que vale la pena ejecutar en un portátil normal y se quedó con tres ganadores. La historia salió la misma semana en que Qwen 3, Llama 3.2 y Gemma 3 lanzaron simultáneamente cuantos de 1B–8B que funcionan muy por encima de su peso. Los mejores programas para LLM locales pequeños en escritorio ya no son juguetes de investigación. Caben en 4 GB de RAM, funcionan sin tarjeta gráfica discreta y responden preguntas cotidianas lo suficientemente rápido como para reemplazar la pestaña de ChatGPT que mantienes abierta.

Probamos ocho aplicaciones en un MacBook Air M2 (16 GB), un portátil Ryzen de gama media con iGPU únicamente y una estación de trabajo Fedora con tarjeta NVIDIA de 6 GB. Cada una se evaluó según la rapidez con que una instalación nueva podía descargar un cuanto de 3B, qué tal manejaba una carga de trabajo mixta de chat, código y resúmenes breves de documentos, y si seguía siendo usable mientras se realizaba una videollamada en segundo plano.

Qué buscar en una aplicación de LLM local pequeño

Comparación rápida

Programa Mejor para Plataformas Plan gratuito De pago Calificación
Jan Cliente de código abierto tipo ChatGPT Windows, macOS, Linux Totalmente gratuito Ninguno 4.7
Ollama Runtime CLI + API más simple Windows, macOS, Linux Totalmente gratuito Ninguno 4.9
LM Studio Descubrimiento de modelos con interfaz gráfica real Windows, macOS, Linux Totalmente gratuito personal Contactar ventas para trabajo 4.8
GPT4All Local + fallback en la nube opcional Windows, macOS, Linux Totalmente gratuito Ninguno 4.5
Msty Comparación de chat dividido entre modelos Windows, macOS, Linux Totalmente gratuito Aurum $99 de por vida 4.7
llamafile Modelo portátil de archivo único Windows, macOS, Linux Totalmente gratuito Ninguno 4.6
Cortex Runtime tipo Ollama, huella menor Windows, macOS, Linux Totalmente gratuito Ninguno 4.4
KoboldCpp Escritura creativa de contexto largo Windows, macOS, Linux Totalmente gratuito Ninguno 4.5

Los programas

1. Jan para LLM local pequeño — Mejor cliente de código abierto tipo ChatGPT

Jan ofrece una aplicación de escritorio tipo ChatGPT que se ve familiar en el momento en que la abres, y luego descarga silenciosamente Llama 3.2 3B o Qwen 3 4B en segundo plano. Incluye asistentes, hilos, carga de archivos y un servidor compatible con OpenAI. En el MacBook Air M2, el primer chat con Llama 3.2 3B comenzó a responder preguntas en tres minutos después de la instalación.

Donde falla: El inicio en frío en Windows sigue siendo más lento que en macOS por unos segundos. Algunas importaciones de Hugging Face requieren una caída GGUF manual.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: jan.ai · github.com/janhq/jan

En conclusión: La opción si quieres la experiencia de ChatGPT sin suscripción ni conexión a internet.

2. Ollama para LLM local pequeño — Mejor runtime CLI + API más simple

Ollama es el runtime en el que se construye todo lo demás. ollama run llama3.2:3b descarga el cuanto, lo carga e inicia el chat. La API compatible con OpenAI en el puerto 11434 significa que cualquier editor, aplicación de notas o script que hable OpenAI puede comunicarse con él sin cambios.

Donde falla: Sin interfaz gráfica nativa. Lo emparejarás con Open WebUI o Msty para una ventana de chat.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: ollama.com · github.com/ollama/ollama

En conclusión: Empieza aquí incluso si también instalas un cliente de chat. La mayoría de otras aplicaciones en esta lista pueden apuntar a Ollama.

3. LM Studio para LLM local pequeño — Mejor descubrimiento de modelos con interfaz gráfica real

LM Studio es la aplicación todo en uno para explorar Hugging Face, elegir un cuanto y chatear sin tocar una terminal. El navegador de modelos filtra por tamaño y licencia, lo que importa cuando intentas meter un modelo en 6 GB de RAM. El servidor API local es un solo interruptor.

Donde falla: No es código abierto. El soporte de Linux se queda atrás de Windows y macOS en nuevas funciones.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: lmstudio.ai

En conclusión: La interfaz gráfica más suave para explorar y probar cuantos pequeños lado a lado.

4. GPT4All para LLM local pequeño — Mejor local más fallback en la nube opcional

GPT4All ofrece una aplicación de chat nativa que ejecuta cuantos GGUF localmente y también puede enrutar a OpenAI o Groq cuando se necesita un modelo más pesado. LocalDocs te permite apuntar a una carpeta y obtener respuestas fundamentadas sin enviar archivos a ningún lado.

Donde falla: El catálogo de modelos está un paso atrás de LM Studio. La descarga de GPU en Windows requiere algunos ajustes.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: gpt4all.io

En conclusión: Elige esto cuando quieras una aplicación que comience localmente y pueda usar la nube bajo demanda.

5. Msty para LLM local pequeño — Mejor comparación de chat dividido entre modelos

Msty muestra dos o tres respuestas de modelos lado a lado. Esa es la forma más rápida de decidir si Qwen 3 4B o Gemma 3 4B se ajusta a tu estilo de indicación. Habla con Ollama, LM Studio y API en la nube, por lo que la comparación no se limita a lo que aloja.

Donde falla: Algunas funciones avanzadas están detrás del nivel Aurum. No es código abierto.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: msty.app

En conclusión: La opción si audicionas modelos a menudo y quieres verlos en debate.

6. llamafile para LLM local pequeño — Mejor modelo portátil de archivo único

llamafile envuelve un modelo y su runtime en un ejecutable. Colócalo en una unidad USB, haz doble clic en cualquier máquina Windows, macOS o Linux, y una pestaña del navegador se abre con un chat. Es la contribución de Mozilla a Cosmopolitan libc, y elimina completamente el paso de instalación.

Donde falla: Los archivos pueden ser de 3–5 GB. El primer lanzamiento en máquinas corporativas bloqueadas puede requerir un clic derecho.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: github.com/Mozilla-Ocho/llamafile

En conclusión: La opción correcta para portabilidad, para demostraciones o para una máquina en la que no puedes instalar software.

7. Cortex para LLM local pequeño — Mejor runtime tipo Ollama con huella menor

Cortex es el runtime que potencia Jan bajo el capó, expuesto como un daemon independiente. Tiene una huella menor que Ollama en idle y por defecto a llama.cpp con una API compatible con OpenAI. Las descargas de modelos usan el mismo ecosistema GGUF.

Donde falla: Comunidad más pequeña, por lo que hay menos integraciones de terceros. La documentación sigue poniéndose al día.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: cortex.so · github.com/janhq/cortex.cpp

En conclusión: Elige esto si Ollama te parece pesado y quieres un daemon más ligero que aún hable la API de OpenAI.

8. KoboldCpp para LLM local pequeño — Mejor para escritura creativa de contexto largo

KoboldCpp es el fork de llama.cpp construido alrededor de ficción, juego de rol y escritura de contexto largo. La memoria de personaje persistente, la información del mundo y una interfaz de navegador enfocada en borrador en lugar de preguntas y respuestas la hacen diferente a las otras aplicaciones en esta lista, de una manera útil. Maneja contextos de 32K–128K en modelos pequeños mejor que la mayoría de las interfaces gráficas.

Donde falla: La interfaz gráfica es densa y descaradamente para usuarios avanzados. No es la aplicación para entregar a un amigo no técnico.

Precios:

Plataformas: Windows, macOS, Linux.

Descargar: github.com/LostRuins/koboldcpp

En conclusión: La opción si la razón por la que quieres un modelo local son sesiones de escritura que ChatGPT limitaría por velocidad.

Cómo elegir el correcto

Si quieres la configuración más simple que funcione: Ollama más un cliente de chat. Instala Ollama, luego elige Jan u Open WebUI encima.

Si quieres una aplicación de escritorio pulida: LM Studio para la interfaz gráfica, o Jan si el código abierto importa.

Si audicionas modelos a menudo: Msty para la vista dividida.

Si estás haciendo una demostración a alguien o trabajando en una máquina bloqueada: llamafile.

Si quieres el daemon más ligero: Cortex.

Si escribes ficción larga o ejecutas campañas de juego de rol: KoboldCpp.

Si un modelo pequeño no es suficiente para una tarea específica, la mayoría de estas aplicaciones también enrutan a puntos finales en la nube. Comienza localmente, escala solo cuando la respuesta local no es lo suficientemente buena.

Preguntas frecuentes

¿Cuál es la mejor aplicación de LLM local pequeño para un portátil sin tarjeta gráfica? Ollama con un modelo de 3B o 4B se ejecuta en CPU y gráficos integrados con velocidad aceptable. LM Studio ofrece presets solo para CPU en su selector de modelos.

¿Puede un LLM local pequeño reemplazar a ChatGPT? Para chat diario, resúmenes y asistencia con código corto, sí. Para razonamiento pesado, flujos de trabajo de agentes y tareas de investigación largas, no. La mayoría de las personas que prueban ambos terminan usando local para indicaciones diarias y nube para las difíciles.

¿Qué tamaño de modelo se ejecuta en 8 GB de RAM? Un modelo 3B en cuantización Q4 cabe cómodamente con margen para la aplicación en sí. Un cuanto 4B funciona si cierras otras aplicaciones de memoria pesada.

¿Son los LLM locales realmente privados? Las aplicaciones en esta lista no cargan indicaciones por defecto. GPT4All y Msty ofrecen enrutamiento en la nube opcional, y es opt-in. Si el aislamiento total importa, desactiva el acceso a la red para la aplicación.

¿Cuál es la mejor aplicación de LLM local pequeño gratuita? Ollama para el runtime y Jan para la interfaz gráfica. Ambos son gratuitos, ambos son código abierto, ambos se mantienen activamente.