Ollama

XDA ejecutó el mismo modelo 8B en un portátil RTX 5070 y en una máquina con gráficos integrados e informó que la brecha de tokens por segundo es más pequeña de lo que la mayoría de la gente imagina. Esa es la historia de los LLM locales en 2026: cuantización, backends Vulkan y Metal de Apple han llevado muchas cargas de trabajo a un rango en el que una iGPU o una pequeña dGPU es suficiente. No necesitas un rig de $2.000 para ejecutar modelos útiles localmente.

Esta guía cubre ocho aplicaciones para ejecutar LLM locales en gráficos integrados, probadas en un Intel Core Ultra 5 con Arc iGPU, un AMD Ryzen 7 con Radeon 780M y un Apple M2. Las ocho ejecutan modelos en el rango de 7B a 14B a velocidades utilizables (10 tokens por segundo o mejor) con la cuantización correcta. Priorizamos la facilidad de configuración, la compatibilidad de modelos y el rendimiento honesto en hardware clase iGPU.

Qué buscar en un corredor LLM local para iGPU

Comparación rápida

Aplicación Mejor para Plan gratuito Precio inicial Estilo UI
Ollama CLI + API para modelos locales Gratis (open source) Terminal o clientes de terceros
LM Studio UI de escritorio pulida Gratis Escritorio nativo
GPT4All Escritorio amigable para principiantes Gratis Escritorio nativo
Jan Clon ChatGPT completamente open source Gratis Escritorio nativo (Electron)
Msty Todo en uno con RAG Base gratuita Escritorio nativo
KoboldCpp Juego de rol y escritura creativa Gratis (open source) Web UI
Text Generation WebUI Experimentación de usuario avanzado Gratis (open source) Web UI
AnythingLLM RAG local sobre documentos Gratis (open source) Escritorio nativo

Las aplicaciones

1. Ollama, mejor corredor CLI y API

Ollama es lo más cercano a un estándar para LLM locales. Instálalo, ejecuta ollama run llama3.2:3b, y tendrás un modelo en funcionamiento en menos de un minuto. Bajo el capó utiliza llama.cpp con una biblioteca de modelos curada, una API compatible con OpenAI en localhost:11434 y gestión de memoria por modelo.

Dónde queda corto: Sin UI de chat incorporada; usas ollama run en una terminal o lo empareja con un cliente (Open WebUI, Msty o Enchanted en Mac). La biblioteca de modelos en ollama.com está curada pero es limitada en comparación con el acceso crudo a Hugging Face.

Precios:

Plataformas: Windows, macOS (Apple silicon e Intel), Linux.

Descarga: ollama.com/download o a través de Homebrew / apt.

Conclusión: El mejor backend, punto. Instálalo incluso si planeas usar una interfaz diferente encima.

2. LM Studio, mejor UI de escritorio pulida

LM Studio envuelve llama.cpp en una aplicación de escritorio nativa con un navegador de modelos Hugging Face incorporado, descargas de un clic, puntos de referencia de rendimiento por modelo y un servidor API compatible con OpenAI. La configuración de descarga de GPU se expone con valores predeterminados sensatos para Intel Arc, AMD y Apple silicon.

Dónde queda corto: Código fuente cerrado (aunque es gratis). Algunos usuarios informan que la interfaz gráfica consume más RAM que el modelo en sí en iGPU de gama baja.

Precios:

Plataformas: Windows, macOS, Linux (beta).

Descarga: lmstudio.ai

Conclusión: El mejor punto de partida para usuarios de iGPU que prefieren una interfaz gráfica. Viene con los valores predeterminados correctos para hardware de consumidor.

3. GPT4All, mejor escritorio amigable para principiantes

GPT4All de Nomic es el más accesible del lote. Instala, elige un modelo de la barra lateral, y se descarga y ejecuta. El panel LocalDocs añade RAG simple sobre una carpeta de archivos sin configuración.

Dónde queda corto: Catálogo de modelos más pequeño que LM Studio. Más lento en Windows que Ollama o LM Studio en nuestras pruebas.

Precios:

Plataformas: Windows, macOS, Linux.

Descarga: nomic.ai/gpt4all

Conclusión: La opción para el miembro de la familia menos técnico. Los consigue ejecutando un modelo local sin tocar una terminal.

4. Jan, mejor clon ChatGPT completamente open source

Jan es una aplicación de escritorio completamente open source que imita la interfaz de ChatGPT. Ejecuta modelos locales a través de llama.cpp incluido, se conecta a API remotas (OpenAI, Anthropic, Groq, Mistral) como opción y almacena cada conversación localmente.

Dónde queda corto: Basado en Electron, así que la huella de RAM es más pesada que las aplicaciones nativas. Las conversaciones de múltiples turnos ocasionalmente pierden contexto en iGPU debido al truncamiento agresivo del contexto.

Precios:

Plataformas: Windows, macOS, Linux.

Descarga: jan.ai

Conclusión: El más parecido a ChatGPT abierto. Mejor si quieres una sola aplicación para local más remoto opcional.

5. Msty, mejor todo en uno con RAG

Msty combina modelos locales, API remotas, RAG sobre documentos y conversaciones de vista dividida en una aplicación. Su función “Knowledge Stacks” indexa carpetas de PDF, documentos de Word y archivos de texto para que puedas chatear con ellos sin configurar una base de datos vectorial.

Dónde queda corto: Código fuente cerrado. El plan gratuito limita algunas características RAG avanzadas.

Precios:

Plataformas: Windows, macOS, Linux.

Descarga: msty.app

Conclusión: La opción si quieres chat de documentos sin configurar un almacén vectorial separado.

6. KoboldCpp, mejor para juego de rol y escritura creativa

KoboldCpp comenzó como un fork de llama.cpp dirigido a escritura de forma larga y juego de rol. Tiene una interfaz web con información mundial, memoria de personaje y libros de tradición que otros corredores no exponen. El backend admite Vulkan para iGPU.

Dónde queda corto: La interfaz es densa con controles deslizantes que solo significan algo para usuarios avanzados. No está realmente diseñado para flujos de trabajo de asistente de chat.

Precios:

Plataformas: Windows, macOS, Linux.

Descarga: KoboldCpp GitHub releases.

Conclusión: Opción de nicho para escritores y jugadores de rol que quieren personajes persistentes.

7. Text Generation WebUI, mejor experimentación de usuario avanzado

Text Generation WebUI (oobabooga) es el patio de juegos del experimentador. Admite llama.cpp, ExLlama, Transformers y más backends, expone cada parámetro de generación e integra LoRA y ajuste fino.

Dónde queda corto: La configuración no es para principiantes; espera una instalación de 30 minutos con Python venv desordenado. La interfaz web es funcional pero no está diseñada.

Precios:

Plataformas: Windows, macOS, Linux vía Python.

Descarga: oobabooga/text-generation-webui GitHub.

Conclusión: La opción correcta cuando sabes qué quieres ajustar y no puedes hacerlo en una aplicación mejor.

8. AnythingLLM, mejor RAG local sobre documentos

AnythingLLM es una aplicación RAG construida a propósito que empareja un LLM local (o remoto) con un almacén de documentos. Apunta a una carpeta o suelta archivos, e indexa en una base de datos vectorial local. Los espacios de trabajo multiusuario separan contextos para diferentes proyectos.

Dónde queda corto: Enfocado en RAG; el chat puro es posible pero no el punto. La configuración implica elegir un modelo de incrustación separadamente del modelo de chat, lo que confunde a los principiantes.

Precios:

Plataformas: Windows, macOS, Linux, más implementación Docker para auto-hosting.

Descarga: anythingllm.com o Mintplex-Labs/anything-llm GitHub.

Conclusión: La opción si la razón por la que quieres IA local es consultar tu propia colección de documentos en privado.

Cómo elegir el correcto

La mejor configuración emparejada para la mayoría de usuarios de iGPU: Ollama como backend + LM Studio u Open WebUI como cliente. Eso te da el backend más rápido con la interfaz más amigable.

FAQ

¿Cuál es la mejor aplicación LLM local para Intel Arc iGPU?

LM Studio y Ollama ambos usan Vulkan y funcionan bien en Intel Arc iGPU (Xe, Xe2, Xe-LPG). La elección del modelo es más importante que la elección de la aplicación; las cuantizaciones Q4_K_M de modelos 7B a 8B son el punto óptimo.

¿Puedo ejecutar LLM locales en un APU Ryzen sin una GPU discreta?

Sí. Las iGPU Radeon 780M / 890M de las series Ryzen 7000 y 8000 ejecutan modelos 7B a 10-20 tokens por segundo en cuantización Q4 a través de Vulkan. Aumenta la asignación de RAM del sistema a gráficos en BIOS si quieres cargar contextos más grandes.

¿Cuál es el mejor LLM local para un MacBook con M2 o M3?

Apple silicon ejecuta Llama 3.1 8B, Qwen 3 8B y Mistral 7B a 20-40 tokens por segundo en M2. LM Studio y Ollama ambos usan Metal automáticamente. En 16GB de memoria unificada, mantente con Q4_K_M o Q5_K_M.

¿Necesito saber Python para ejecutar modelos locales?

No. Ollama, LM Studio, GPT4All, Jan y Msty son todas instalaciones de un clic sin Python. Text Generation WebUI es la excepción.

¿Cuál es la aplicación LLM local completamente open source?

Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI y AnythingLLM son todas open source. LM Studio y Msty son gratis pero código fuente cerrado.

¿Cuánta RAM necesito para LLM locales?

Para modelos 7B a 8B en cuantización Q4, 16GB de RAM total del sistema es viable y 32GB es cómodo. iGPU comparte RAM del sistema, así que presupuesta en consecuencia. Para modelos 13B a 14B, planifica un mínimo de 32GB.