Ollama y otras aplicaciones para ejecutar LLM locales con razonamiento

Los LLM locales solían sentirse como un compromiso. Sacrificabas calidad del modelo a cambio de privacidad y sin factura por token. Los modelos de razonamiento han invertido eso. DeepSeek R1 destila, Qwen 3 con modo pensamiento y GPT-OSS todos producen trazas visibles de cadena de pensamiento antes de su respuesta final, y los más pequeños funcionan en un portátil de 16GB. El cuello de botella ya no es el modelo. Es la aplicación de escritorio que usas para cargarlo, ejecutarlo y chatear con él. Probamos ocho de ellas en el mismo hardware, y estas son las siete que vale la pena instalar.

Qué buscar en una aplicación para LLM de razonamiento

Comparación rápida

Aplicación Mejor para Plataformas Plan gratuito Precio inicial/mes Nota
Ollama Desarrolladores que viven en la terminal Windows, macOS, Linux Gratuito Sirve cualquier modelo a través de un endpoint compatible con OpenAI
LM Studio Navegación GUI de modelos Windows, macOS, Linux Gratuito Mejor catálogo interactivo de modelos
Jan Reemplazo privado de ChatGPT Windows, macOS, Linux Gratuito Completamente local por defecto, sin telemetría
Msty Chat de múltiples modelos lado a lado Windows, macOS, Linux $9 de por vida para Pro Chatea con varios modelos en paralelo
Open WebUI IU autohospedada para equipo Docker en cualquier lugar Gratuito Convierte Ollama en un espacio de trabajo compartido
GPT4All Principiantes absolutos Windows, macOS, Linux Gratuito Instalación con un clic, lista de modelos curada
Text Generation WebUI Usuarios avanzados y fine-tuners Windows, macOS, Linux Gratuito Controles de muestreo y LoRA más profundos

Las aplicaciones

1. Ollama - Mejor para desarrolladores que viven en la terminal

Ollama es la capa base a la que se conectan la mayoría de las otras aplicaciones en esta lista. Se ejecuta como servicio de fondo, expone una API compatible con OpenAI en localhost:11434 y descarga modelos con un comando único como ollama pull deepseek-r1:14b. Los modelos de razonamiento son ciudadanos de primera clase: el CLI muestra salida <think> en vivo, y hay un interruptor /set think para activar el modo de pensamiento en Qwen 3 y GPT-OSS.

Donde falla: la interfaz de chat es una terminal, que está bien para desarrolladores e inútil para cualquier otro. No gestiona documentación de tarjeta de modelo ni comparaciones.

Precios:

Plataformas: Windows, macOS, Linux, Docker

Descargar: ollama.com

Conclusión: instala esto primero, luego agrega una GUI encima. Olvídalo si nunca quieres ver una línea de comandos.

2. LM Studio - Mejor GUI para explorar y probar modelos

LM Studio es la aplicación para abrir cuando quieres ver qué hay disponible. Su catálogo integrado envuelve la lista de modelos de Hugging Face con filtros sensatos, vistas previas y recomendaciones de cuantización. La ventana de chat muestra bloques de pensamiento en una sección que se puede contraer, y el modo servidor local expone el mismo endpoint compatible con OpenAI que Ollama, para que herramientas como Cursor o Continue lo utilicen sin diferencia.

Donde falla: la aplicación es de código cerrado. Si eso te importa, usa Jan en su lugar.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: lmstudio.ai

Conclusión: la forma más rápida de probar cinco modelos de razonamiento antes de la cena.

3. Jan - Mejor para quienes quieren un clon privado de ChatGPT

Jan se ve y se siente como ChatGPT, excepto que cada mensaje permanece en tu disco. La aplicación es de código abierto bajo Apache 2.0, envía un servidor compatible con OpenAI y extrae de un centro de modelos integrado con etiquetas de modelo de razonamiento en las entradas principales de DeepSeek y Qwen. Las extensiones agregan comportamiento de búsqueda web o intérprete de código sin que nada de eso toque un endpoint en la nube de forma predeterminada.

Donde falla: el catálogo de modelos es más pequeño que el de LM Studio. Los parámetros de muestreo avanzados están ocultos detrás de interruptores.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: jan.ai

Conclusión: la opción correcta cuando la privacidad es la razón por la que dejaste ChatGPT.

4. Msty - Mejor para comparar modelos de razonamiento lado a lado

Msty envía un chat de vista dividida que ejecuta el mismo mensaje a través de dos o tres modelos a la vez. Cuando estás intentando decidir si DeepSeek R1 14B vale la pena de VRAM sobre Qwen 3 8B, ver ambas respuestas, ambos trazos <think> y ambos tiempos en la misma pantalla comprime horas de pruebas en minutos. También admite API remotas, por lo que un modelo de razonamiento local puede compararse con un modelo de frontera en la nube en la misma conversación.

Donde falla: la vista dividida usa más RAM. Las funciones Pro están bloqueadas detrás de una licencia única.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: msty.app

Conclusión: compra el desbloqueo de $9 la primera vez que desees haberlo hecho.

5. Open WebUI - Mejor para compartir un LLM local con un equipo

Open WebUI convierte Ollama en un espacio de trabajo compartido con cuentas de usuario, historial de chat y RAG. Los modelos de razonamiento se representan limpiamente, <think> se contrae de forma predeterminada, y los administradores pueden restringir qué modelos puede utilizar cada usuario. Se ejecuta en Docker en una línea, expone la misma interfaz de usuario en la LAN y funciona bien con una estación de trabajo que aloja el modelo mientras las computadoras portátiles se conectan a través del navegador.

Donde falla: la configuración es más pesada que las aplicaciones de escritorio. Necesitas Docker y un proxy inverso o un puerto dedicado.

Precios:

Plataformas: Docker en Windows, macOS, Linux

Descargar: openwebui.com

Conclusión: la opción cuando más de una persona necesita el mismo modelo local.

6. GPT4All - Mejor para una primera instalación sin curva de aprendizaje

GPT4All de Nomic AI es la forma menos friccionada de ejecutar un modelo de razonamiento. Instala la aplicación, haz clic en un modelo, haz clic en chat. El catálogo está curado (aproximadamente una docena de modelos en lugar de cientos), lo cual es una característica para personas que no quieren pensar en cuantificación. LocalDocs agrega RAG sobre una carpeta de archivos en tres clics.

Donde falla: el catálogo curado deja fuera modelos que quieren los usuarios avanzados. El rendimiento se queda atrás respecto a Ollama en GPU.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: gpt4all.io

Conclusión: la aplicación para instalar en la máquina de un padre o colega.

7. Text Generation WebUI - Mejor para usuarios avanzados y fine-tuning

Text Generation WebUI (oobabooga) es la aplicación de los aficionados. Expone cada parámetro de muestreo, admite carga de LoRA e intercambia backends entre llama.cpp, ExLlamaV2, Transformers y vLLM. Si quieres comparar formatos de cuantización o ejecutar un modelo de razonamiento con tokens de parada personalizados, esta es la aplicación que te permite hacerlo sin parchear fuente.

Donde falla: la interfaz de usuario es mucho. Cada solicitud de modelo de razonamiento necesita una plantilla de instrucción compatible seleccionada manualmente.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: github.com/oobabooga/text-generation-webui

Conclusión: la aplicación para personas que leen tarjetas de modelo de Hugging Face por diversión.

Cómo elegir la correcta

Preguntas frecuentes

¿Cuál es la mejor aplicación gratuita para ejecutar DeepSeek R1 localmente? Ollama con LM Studio o Jan como cliente de chat. Ollama extrae las destilaciones de R1 y las sirve, y tanto LM Studio como Jan representan los bloques <think> de forma limpia.

¿Puedo ejecutar un LLM de razonamiento en una computadora portátil sin GPU? Sí, en modelos más pequeños. Tanto GPT4All como Ollama se replantean a CPU. Espera 3 a 8 tokens por segundo en una computadora portátil moderna para una destilación de razonamiento de 7B u 8B.

¿Qué aplicación LLM local muestra la cadena de pensamiento? LM Studio, Msty, Jan y Open WebUI todos representan bloques <think> en una sección que se puede contraer. Ollama los muestra en la terminal de forma predeterminada.

¿Funcionan estas aplicaciones sin conexión? Las siete sí. Ollama, Jan, GPT4All y Text Generation WebUI no necesitan red en absoluto después de descargar el modelo. LM Studio y Msty solo llaman a casa para actualizaciones de catálogo opcionales.

¿Vale la pena Msty $9 por el nivel Pro? Si comparas modelos más de una vez por semana, sí. La vista dividida de múltiples modelos por sí sola justifica el precio la primera vez que la usas para omitir una hoja de cálculo de evaluación comparativa.