llama.cpp

XDA publicó un artículo este mes argumentando que un stack de IA local más pequeño es un stack de IA local más productivo. El autor había acumulado el desorden habitual: dos ejecutores de modelos, tres interfaces de usuario, una base de datos vectorial que nadie usaba y una carpeta de adaptadores que había olvidado. Reducir a un conjunto mínimo facilitó el mantenimiento de la configuración y más fácil de usar. Probamos ocho de las mejores aplicaciones para un stack de IA local minimalista en escritorio, en un MacBook Pro M3, una estación de trabajo Windows con una RTX 4070 y una caja Debian con una AMD 7800 XT, enfocándonos en cómo se comporta cada una como la única herramienta en el stack en lugar de una de muchas.

Qué buscar en una aplicación de IA local minimalista

Comparación rápida

Aplicación Mejor para Plataformas Plan gratuito Precio inicial Característica destacada
llama.cpp El runtime de referencia Windows, macOS, Linux Gratuito, código abierto Gratuito Inferencia binaria única portátil
llamafile Un archivo, sin instalación Windows, macOS, Linux Gratuito, código abierto Gratuito Modelo más runtime en un ejecutable
Ollama CLI más simple más API Windows, macOS, Linux Gratuito, código abierto Gratuito ollama run y tienes un endpoint OpenAI
Jan Interfaz de usuario de escritorio nativa con API Windows, macOS, Linux Gratuito, código abierto Gratuito Chat de escritorio multiplataforma
KoboldCpp Interfaz de usuario binaria única más API Windows, macOS, Linux Gratuito, código abierto Gratuito Ejecutor de GGUF con interfaz web integrada
Msty Interfaz de usuario comercial pulida en modelos locales Windows, macOS, Linux Nivel gratuito Suscripción a Msty para funciones avanzadas Interfaz de chat multimodelo
GPT4All Chat de escritorio más simple Windows, macOS, Linux Gratuito, código abierto Gratuito Amigable para principiantes, sin CLI
LM Studio Ejecutor local completo Windows, macOS, Linux Gratuito para uso personal Licencia comercial Interfaz de descubrimiento de modelo, amplio soporte de backend

Las aplicaciones

1. llama.cpp — Mejor para el runtime de referencia en el que todos construyen

llama.cpp es el runtime que la mayoría de esta lista envuelve de una forma u otra. Es un servidor de inferencia C++ portátil e independiente de dependencias que ejecuta modelos GGUF en CPU, Metal, CUDA y ROCm. Como un stack minimalista en sí mismo, llama-server te da un endpoint compatible con OpenAI, y llama-cli te da un REPL. Eso es suficiente para la mayoría del trabajo de IA local.

Dónde falla: Sin interfaz de usuario pulida. Estás compilando o descargando un binario de lanzamiento. La gestión de modelos es manual.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: github.com/ggerganov/llama.cpp

Conclusión: llama.cpp es la opción cuando quieres las menos partes móviles y te sientes cómodo en una terminal.

2. llamafile — Mejor para un runtime y un modelo en un ejecutable

llamafile del proyecto Mozilla Ocho agrupa un modelo y el runtime de llama.cpp en un único binario Cosmopolitan-libc que se ejecuta en Windows, macOS y Linux sin instalación. Descarga el archivo, cámbialo, ejecútalo. Abre una interfaz de usuario del navegador y expone una API compatible con OpenAI en localhost. Es la interpretación más literal de “IA local minimalista” en la lista.

Dónde falla: Los archivos binarios portátiles únicos pueden activar herramientas de seguridad del host. Descargar un nuevo modelo significa descargar un nuevo llamafile.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: github.com/Mozilla-Ocho/llamafile

Conclusión: llamafile es la opción cuando la instalación debe ser un archivo y solo uno.

3. Ollama — Mejor para el flujo de trabajo CLI más simple más API

Ollama envuelve llama.cpp con la experiencia de instalación y comando más limpia de cualquier cosa en esta lista. ollama pull llama3.2:8b descarga un modelo. ollama run llama3.2:8b abre un chat. ollama serve expone un endpoint compatible con OpenAI en el puerto 11434 por defecto. El formato Modelfile te permite fijar prompts de sistema y parámetros con un único archivo de texto.

Dónde falla: La instalación predeterminada ejecuta el servidor como un servicio de fondo que quizás no quieras. La cuantización manual de modelos es limitada en comparación con llama.cpp sin procesar.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: ollama.com

Conclusión: Ollama es la opción cuando la instalación de un comando y la ejecución de un comando son la barra mínima.

4. Jan — Mejor para una interfaz de usuario de escritorio nativa que posees

Jan es una aplicación de escritorio creada desde cero para modelos locales, de código abierto, con un servidor API compatible con OpenAI integrado. Es lo que instalas cuando quieres una interfaz de usuario de chat de escritorio real sin la superficie de LM Studio. El equipo envía compilaciones para los tres sistemas operativos y mantiene el flujo de descubrimiento de modelos simple.

Dónde falla: Proyecto más joven que LM Studio u Ollama. Algunas características avanzadas (backends especializados, personalización profunda de modelos) están rezagadas.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: jan.ai

Conclusión: Jan es la opción cuando una interfaz de usuario de escritorio adecuada es el factor decisivo.

5. KoboldCpp — Mejor para interfaz de usuario binaria única más API en un destino portátil

KoboldCpp comenzó como un fork de llama.cpp dirigido a la comunidad de KoboldAI, y ha crecido hasta convertirse en un ejecutor GGUF de binario único con interfaz de usuario de navegador, endpoint de API, soporte de entrada de imágenes y audio, y sin paso de instalación. Coloca el binario y un GGUF junto a él, ejecuta un comando y todo está listo.

Dónde falla: Algunas características especializadas (integración de Horde, prompts específicos de KoboldAI) no importan para un caso de uso de chat general.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: github.com/LostRuins/koboldcpp

Conclusión: KoboldCpp es la opción cuando quieres un único binario que te dé una interfaz de usuario y una API sin una aplicación más pesada.

6. Msty — Mejor para una interfaz de usuario comercial pulida en modelos locales

Msty utiliza el enfoque de LM Studio y produce una interfaz de usuario más limpia. Chatea lado a lado con múltiples modelos, conéctate a endpoints locales de Ollama o Jan, y organiza conversaciones en carpetas. El nivel gratuito es generoso; el nivel pagado es lo que desbloquea características de multiusuario y espacio de trabajo.

Dónde falla: Código cerrado. No en el extremo minimalista de “instalar un binario de código abierto.” Para un usuario solitario que valora el pulido sobre los principios, eso está bien.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: msty.app

Conclusión: Msty es la opción cuando el pulido de la interfaz de usuario vale la pena cambiar la restricción de código abierto.

7. GPT4All — Mejor para chat de escritorio amigable para principiantes

GPT4All de Nomic es la forma más amigable de ejecutar una LLM local para alguien que no quiere tocar una terminal. Instala la aplicación, explora una lista de modelos curada, elige uno, chatea. También expone una API local e integra con Nomic Atlas para RAG basado en documentos si decides ir más allá del chat.

Dónde falla: La lista de modelos curada es un pequeño subconjunto de lo que está disponible en Hugging Face. Los usuarios avanzados crecen más allá de él.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: gpt4all.io

Conclusión: GPT4All es la opción para un usuario de IA local por primera vez que quiere una aplicación de escritorio que simplemente funcione.

8. LM Studio — Mejor para un ejecutor local completo

LM Studio es el extremo maximalista de “todavía una única aplicación de escritorio.” Descubrimiento de modelos de Hugging Face, soporte de backend múltiple (llama.cpp, MLX en Apple Silicon), interfaz de usuario de chat completa, servidor de API y superficie de configuración de modelos que expone todo. Es lo que las personas usan por defecto cuando la simplicidad de Ollama es demasiado limitada.

Dónde falla: No de código abierto. Huella de instalación más grande que las opciones anteriores. La superficie de características maximalista es lo opuesto al stack minimalista que argumentaba el artículo de XDA, pero se incluye aquí como punto de referencia para lo que sucede cuando te niegas a recortar.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: lmstudio.ai

Conclusión: LM Studio es la opción cuando un ejecutor local completo vale la pena la instalación más grande que cualquiera de los anteriores.

Cómo elegir el correcto

Preguntas frecuentes

¿Qué modelo debo ejecutar en 16 GB de RAM? Una cuantización Q4 de un modelo 7B u 8B funciona bien en ese rango y cubre la mayoría de los casos de uso de chat y codificación. La cuantización Q4 de 13B es posible pero ajustada.

¿Funcionan estas aplicaciones en Apple Silicon? Sí. llama.cpp, Ollama, Jan, KoboldCpp, LM Studio y Msty todos usan Metal en Apple Silicon y alcanzan velocidad cercana a la nativa. llamafile se envía con binarios de Apple Silicon.

¿Puedo apuntar herramientas de estilo ChatGPT a un modelo local? Sí. Ollama, llama.cpp, Jan, KoboldCpp, LM Studio y llamafile todos exponen un endpoint compatible con OpenAI en localhost. Apunta cualquier herramienta que acepte una URL base personalizada a http://localhost:<port>/v1.

¿En qué se diferencia un stack minimalista de uno maximalista? Menos partes móviles. Un runtime, un administrador de modelos, una interfaz de usuario. Los stacks maximalistas añaden bases de datos vectoriales, capas de orquestación y frameworks de agentes. La mayoría de usuarios solitarios no necesitan nada de eso hasta que un problema específico lo exija.

¿Alguno de estos es capaz de agente de inmediato? No. Estos son runtimes de inferencia e interfaces de usuario de chat. Para un bucle de agente añades una herramienta separada que hable el protocolo OpenAI Chat Completions contra uno de estos endpoints.

¿Cuál es el stack más pequeño en disco? llamafile más un modelo cuantizado único es la instalación más ligera posible. Ollama más su almacén de modelos es un segundo cercano y más fácil de crecer.