Los LLM locales solían sentirse como un compromiso. Sacrificabas calidad del modelo a cambio de privacidad y sin factura por token. Los modelos de razonamiento han invertido eso. DeepSeek R1 destila, Qwen 3 con modo pensamiento y GPT-OSS todos producen trazas visibles de cadena de pensamiento antes de su respuesta final, y los más pequeños funcionan en un portátil de 16GB. El cuello de botella ya no es el modelo. Es la aplicación de escritorio que usas para cargarlo, ejecutarlo y chatear con él. Probamos ocho de ellas en el mismo hardware, y estas son las siete que vale la pena instalar.
Qué buscar en una aplicación para LLM de razonamiento
- Visualización del modo pensamiento de primera categoría. Los modelos de razonamiento emiten bloques
<think>. Las buenas aplicaciones te permiten mostrar u ocultar esos bloques por conversación. - Catálogo de modelos y gestión de cuantización. Quieres buscar, descargar y eliminar pesos cuantizados sin editar archivos de configuración manualmente.
- Funciona sin conexión. El punto es tener una pila de inferencia local. No debería requerirse inicio de sesión en la nube.
- API compatible con OpenAI. Para que el mismo modelo alimente tu ventana de chat y cualquier editor, agente o script.
- Respaldo de GPU y CPU. Maneja NVIDIA CUDA, Apple Metal, AMD ROCm en Linux y una ruta solo CPU para máquinas sin GPU.
- Valores predeterminados sensatos. Los modelos de razonamiento consumen contexto. La aplicación debería establecer una ventana de contexto grande sin que tengas que saberlo.
Comparación rápida
| Aplicación | Mejor para | Plataformas | Plan gratuito | Precio inicial/mes | Nota |
|---|---|---|---|---|---|
| Ollama | Desarrolladores que viven en la terminal | Windows, macOS, Linux | Sí | Gratuito | Sirve cualquier modelo a través de un endpoint compatible con OpenAI |
| LM Studio | Navegación GUI de modelos | Windows, macOS, Linux | Sí | Gratuito | Mejor catálogo interactivo de modelos |
| Jan | Reemplazo privado de ChatGPT | Windows, macOS, Linux | Sí | Gratuito | Completamente local por defecto, sin telemetría |
| Msty | Chat de múltiples modelos lado a lado | Windows, macOS, Linux | Sí | $9 de por vida para Pro | Chatea con varios modelos en paralelo |
| Open WebUI | IU autohospedada para equipo | Docker en cualquier lugar | Sí | Gratuito | Convierte Ollama en un espacio de trabajo compartido |
| GPT4All | Principiantes absolutos | Windows, macOS, Linux | Sí | Gratuito | Instalación con un clic, lista de modelos curada |
| Text Generation WebUI | Usuarios avanzados y fine-tuners | Windows, macOS, Linux | Sí | Gratuito | Controles de muestreo y LoRA más profundos |
Las aplicaciones
1. Ollama - Mejor para desarrolladores que viven en la terminal
Ollama es la capa base a la que se conectan la mayoría de las otras aplicaciones en esta lista. Se ejecuta como servicio de fondo, expone una API compatible con OpenAI en localhost:11434 y descarga modelos con un comando único como ollama pull deepseek-r1:14b. Los modelos de razonamiento son ciudadanos de primera clase: el CLI muestra salida <think> en vivo, y hay un interruptor /set think para activar el modo de pensamiento en Qwen 3 y GPT-OSS.
Donde falla: la interfaz de chat es una terminal, que está bien para desarrolladores e inútil para cualquier otro. No gestiona documentación de tarjeta de modelo ni comparaciones.
Precios:
- Gratuito: todo
- Pago: ninguno
Plataformas: Windows, macOS, Linux, Docker
Descargar: ollama.com
Conclusión: instala esto primero, luego agrega una GUI encima. Olvídalo si nunca quieres ver una línea de comandos.
2. LM Studio - Mejor GUI para explorar y probar modelos
LM Studio es la aplicación para abrir cuando quieres ver qué hay disponible. Su catálogo integrado envuelve la lista de modelos de Hugging Face con filtros sensatos, vistas previas y recomendaciones de cuantización. La ventana de chat muestra bloques de pensamiento en una sección que se puede contraer, y el modo servidor local expone el mismo endpoint compatible con OpenAI que Ollama, para que herramientas como Cursor o Continue lo utilicen sin diferencia.
Donde falla: la aplicación es de código cerrado. Si eso te importa, usa Jan en su lugar.
Precios:
- Gratuito: aplicación completa para uso personal
- Pago: LM Studio for Work, cotización, para implementaciones de equipo
Plataformas: Windows, macOS, Linux
Descargar: lmstudio.ai
Conclusión: la forma más rápida de probar cinco modelos de razonamiento antes de la cena.
3. Jan - Mejor para quienes quieren un clon privado de ChatGPT
Jan se ve y se siente como ChatGPT, excepto que cada mensaje permanece en tu disco. La aplicación es de código abierto bajo Apache 2.0, envía un servidor compatible con OpenAI y extrae de un centro de modelos integrado con etiquetas de modelo de razonamiento en las entradas principales de DeepSeek y Qwen. Las extensiones agregan comportamiento de búsqueda web o intérprete de código sin que nada de eso toque un endpoint en la nube de forma predeterminada.
Donde falla: el catálogo de modelos es más pequeño que el de LM Studio. Los parámetros de muestreo avanzados están ocultos detrás de interruptores.
Precios:
- Gratuito: aplicación completa
- Pago: ninguno
Plataformas: Windows, macOS, Linux
Descargar: jan.ai
Conclusión: la opción correcta cuando la privacidad es la razón por la que dejaste ChatGPT.
4. Msty - Mejor para comparar modelos de razonamiento lado a lado
Msty envía un chat de vista dividida que ejecuta el mismo mensaje a través de dos o tres modelos a la vez. Cuando estás intentando decidir si DeepSeek R1 14B vale la pena de VRAM sobre Qwen 3 8B, ver ambas respuestas, ambos trazos <think> y ambos tiempos en la misma pantalla comprime horas de pruebas en minutos. También admite API remotas, por lo que un modelo de razonamiento local puede compararse con un modelo de frontera en la nube en la misma conversación.
Donde falla: la vista dividida usa más RAM. Las funciones Pro están bloqueadas detrás de una licencia única.
Precios:
- Gratuito: chat de modelo único, modelos locales ilimitados
- Pago: $9 de una sola vez para Msty Pro, agrega divisiones de múltiples modelos y pilas de conocimiento
Plataformas: Windows, macOS, Linux
Descargar: msty.app
Conclusión: compra el desbloqueo de $9 la primera vez que desees haberlo hecho.
5. Open WebUI - Mejor para compartir un LLM local con un equipo
Open WebUI convierte Ollama en un espacio de trabajo compartido con cuentas de usuario, historial de chat y RAG. Los modelos de razonamiento se representan limpiamente, <think> se contrae de forma predeterminada, y los administradores pueden restringir qué modelos puede utilizar cada usuario. Se ejecuta en Docker en una línea, expone la misma interfaz de usuario en la LAN y funciona bien con una estación de trabajo que aloja el modelo mientras las computadoras portátiles se conectan a través del navegador.
Donde falla: la configuración es más pesada que las aplicaciones de escritorio. Necesitas Docker y un proxy inverso o un puerto dedicado.
Precios:
- Gratuito: con licencia MIT, autohospedado
- Pago: ninguno
Plataformas: Docker en Windows, macOS, Linux
Descargar: openwebui.com
Conclusión: la opción cuando más de una persona necesita el mismo modelo local.
6. GPT4All - Mejor para una primera instalación sin curva de aprendizaje
GPT4All de Nomic AI es la forma menos friccionada de ejecutar un modelo de razonamiento. Instala la aplicación, haz clic en un modelo, haz clic en chat. El catálogo está curado (aproximadamente una docena de modelos en lugar de cientos), lo cual es una característica para personas que no quieren pensar en cuantificación. LocalDocs agrega RAG sobre una carpeta de archivos en tres clics.
Donde falla: el catálogo curado deja fuera modelos que quieren los usuarios avanzados. El rendimiento se queda atrás respecto a Ollama en GPU.
Precios:
- Gratuito: aplicación completa
- Pago: ninguno
Plataformas: Windows, macOS, Linux
Descargar: gpt4all.io
Conclusión: la aplicación para instalar en la máquina de un padre o colega.
7. Text Generation WebUI - Mejor para usuarios avanzados y fine-tuning
Text Generation WebUI (oobabooga) es la aplicación de los aficionados. Expone cada parámetro de muestreo, admite carga de LoRA e intercambia backends entre llama.cpp, ExLlamaV2, Transformers y vLLM. Si quieres comparar formatos de cuantización o ejecutar un modelo de razonamiento con tokens de parada personalizados, esta es la aplicación que te permite hacerlo sin parchear fuente.
Donde falla: la interfaz de usuario es mucho. Cada solicitud de modelo de razonamiento necesita una plantilla de instrucción compatible seleccionada manualmente.
Precios:
- Gratuito: AGPL v3
- Pago: ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/oobabooga/text-generation-webui
Conclusión: la aplicación para personas que leen tarjetas de modelo de Hugging Face por diversión.
Cómo elegir la correcta
- Si solo quieres el chat de modelo de razonamiento más rápido en tu portátil: LM Studio.
- Si quieres un clon de ChatGPT que no almacena nada en la nube: Jan.
- Si estás construyendo herramientas alrededor de un modelo local y necesitas un servidor compatible con OpenAI: Ollama.
- Si compartes el modelo con un equipo: Open WebUI encima de Ollama.
- Si quieres comparar dos modelos de razonamiento en el mismo mensaje: Msty.
- Si estás instalando esto en la máquina de alguien que nunca ha usado un modelo local: GPT4All.
- Si quieres jugar con cuantización y LoRA: Text Generation WebUI.
Preguntas frecuentes
¿Cuál es la mejor aplicación gratuita para ejecutar DeepSeek R1 localmente?
Ollama con LM Studio o Jan como cliente de chat. Ollama extrae las destilaciones de R1 y las sirve, y tanto LM Studio como Jan representan los bloques <think> de forma limpia.
¿Puedo ejecutar un LLM de razonamiento en una computadora portátil sin GPU? Sí, en modelos más pequeños. Tanto GPT4All como Ollama se replantean a CPU. Espera 3 a 8 tokens por segundo en una computadora portátil moderna para una destilación de razonamiento de 7B u 8B.
¿Qué aplicación LLM local muestra la cadena de pensamiento?
LM Studio, Msty, Jan y Open WebUI todos representan bloques <think> en una sección que se puede contraer. Ollama los muestra en la terminal de forma predeterminada.
¿Funcionan estas aplicaciones sin conexión? Las siete sí. Ollama, Jan, GPT4All y Text Generation WebUI no necesitan red en absoluto después de descargar el modelo. LM Studio y Msty solo llaman a casa para actualizaciones de catálogo opcionales.
¿Vale la pena Msty $9 por el nivel Pro? Si comparas modelos más de una vez por semana, sí. La vista dividida de múltiples modelos por sí sola justifica el precio la primera vez que la usas para omitir una hoja de cálculo de evaluación comparativa.