XDA ejecutó el mismo modelo 8B en un portátil RTX 5070 y en una máquina con gráficos integrados e informó que la brecha de tokens por segundo es más pequeña de lo que la mayoría de la gente imagina. Esa es la historia de los LLM locales en 2026: cuantización, backends Vulkan y Metal de Apple han llevado muchas cargas de trabajo a un rango en el que una iGPU o una pequeña dGPU es suficiente. No necesitas un rig de $2.000 para ejecutar modelos útiles localmente.
Esta guía cubre ocho aplicaciones para ejecutar LLM locales en gráficos integrados, probadas en un Intel Core Ultra 5 con Arc iGPU, un AMD Ryzen 7 con Radeon 780M y un Apple M2. Las ocho ejecutan modelos en el rango de 7B a 14B a velocidades utilizables (10 tokens por segundo o mejor) con la cuantización correcta. Priorizamos la facilidad de configuración, la compatibilidad de modelos y el rendimiento honesto en hardware clase iGPU.
Qué buscar en un corredor LLM local para iGPU
- Múltiples backends. Vulkan es el ecualizador en Windows y Linux; permite que las iGPU AMD Radeon e Intel Arc usen aceleración de hardware sin kits de herramientas bloqueados por el proveedor. Metal es el equivalente en Apple silicon.
- Soporte GGUF. GGUF es el formato de cuantización de facto actual. Q4_K_M o Q5_K_M dan el mejor equilibrio velocidad-calidad para presupuestos VRAM clase iGPU.
- Un catálogo de modelos que no tengas que perseguir. Las mejores aplicaciones incluyen descargas de modelos de un clic desde Hugging Face, así no persigues torrentes.
- Valores predeterminados sensatos. Los usuarios de iGPU se benefician de aplicaciones que preconfiguran la longitud del contexto, el número de hilos y el porcentaje de descarga de GPU en lugar de hacerte ajustarlos manualmente.
- Chat UI más API. Los mejores corredores funcionan dobles como servidores API compatibles con OpenAI para que puedas apuntar otras herramientas hacia ellos.
- Pequeña huella de memoria. iGPU comparte RAM con el SO. Prefiere aplicaciones que te permitan limitar la longitud del contexto y descargar modelos cuando estén inactivos.
Comparación rápida
| Aplicación | Mejor para | Plan gratuito | Precio inicial | Estilo UI |
|---|---|---|---|---|
| Ollama | CLI + API para modelos locales | Sí | Gratis (open source) | Terminal o clientes de terceros |
| LM Studio | UI de escritorio pulida | Sí | Gratis | Escritorio nativo |
| GPT4All | Escritorio amigable para principiantes | Sí | Gratis | Escritorio nativo |
| Jan | Clon ChatGPT completamente open source | Sí | Gratis | Escritorio nativo (Electron) |
| Msty | Todo en uno con RAG | Sí | Base gratuita | Escritorio nativo |
| KoboldCpp | Juego de rol y escritura creativa | Sí | Gratis (open source) | Web UI |
| Text Generation WebUI | Experimentación de usuario avanzado | Sí | Gratis (open source) | Web UI |
| AnythingLLM | RAG local sobre documentos | Sí | Gratis (open source) | Escritorio nativo |
Las aplicaciones
1. Ollama, mejor corredor CLI y API
Ollama es lo más cercano a un estándar para LLM locales. Instálalo, ejecuta ollama run llama3.2:3b, y tendrás un modelo en funcionamiento en menos de un minuto. Bajo el capó utiliza llama.cpp con una biblioteca de modelos curada, una API compatible con OpenAI en localhost:11434 y gestión de memoria por modelo.
Dónde queda corto: Sin UI de chat incorporada; usas ollama run en una terminal o lo empareja con un cliente (Open WebUI, Msty o Enchanted en Mac). La biblioteca de modelos en ollama.com está curada pero es limitada en comparación con el acceso crudo a Hugging Face.
Precios:
- Gratis, open source (MIT).
Plataformas: Windows, macOS (Apple silicon e Intel), Linux.
Descarga: ollama.com/download o a través de Homebrew / apt.
Conclusión: El mejor backend, punto. Instálalo incluso si planeas usar una interfaz diferente encima.
2. LM Studio, mejor UI de escritorio pulida
LM Studio envuelve llama.cpp en una aplicación de escritorio nativa con un navegador de modelos Hugging Face incorporado, descargas de un clic, puntos de referencia de rendimiento por modelo y un servidor API compatible con OpenAI. La configuración de descarga de GPU se expone con valores predeterminados sensatos para Intel Arc, AMD y Apple silicon.
Dónde queda corto: Código fuente cerrado (aunque es gratis). Algunos usuarios informan que la interfaz gráfica consume más RAM que el modelo en sí en iGPU de gama baja.
Precios:
- Gratis para uso personal, el uso comercial requiere una licencia.
Plataformas: Windows, macOS, Linux (beta).
Descarga: lmstudio.ai
Conclusión: El mejor punto de partida para usuarios de iGPU que prefieren una interfaz gráfica. Viene con los valores predeterminados correctos para hardware de consumidor.
3. GPT4All, mejor escritorio amigable para principiantes
GPT4All de Nomic es el más accesible del lote. Instala, elige un modelo de la barra lateral, y se descarga y ejecuta. El panel LocalDocs añade RAG simple sobre una carpeta de archivos sin configuración.
Dónde queda corto: Catálogo de modelos más pequeño que LM Studio. Más lento en Windows que Ollama o LM Studio en nuestras pruebas.
Precios:
- Gratis.
Plataformas: Windows, macOS, Linux.
Descarga: nomic.ai/gpt4all
Conclusión: La opción para el miembro de la familia menos técnico. Los consigue ejecutando un modelo local sin tocar una terminal.
4. Jan, mejor clon ChatGPT completamente open source
Jan es una aplicación de escritorio completamente open source que imita la interfaz de ChatGPT. Ejecuta modelos locales a través de llama.cpp incluido, se conecta a API remotas (OpenAI, Anthropic, Groq, Mistral) como opción y almacena cada conversación localmente.
Dónde queda corto: Basado en Electron, así que la huella de RAM es más pesada que las aplicaciones nativas. Las conversaciones de múltiples turnos ocasionalmente pierden contexto en iGPU debido al truncamiento agresivo del contexto.
Precios:
- Gratis, open source (AGPL).
Plataformas: Windows, macOS, Linux.
Descarga: jan.ai
Conclusión: El más parecido a ChatGPT abierto. Mejor si quieres una sola aplicación para local más remoto opcional.
5. Msty, mejor todo en uno con RAG
Msty combina modelos locales, API remotas, RAG sobre documentos y conversaciones de vista dividida en una aplicación. Su función “Knowledge Stacks” indexa carpetas de PDF, documentos de Word y archivos de texto para que puedas chatear con ellos sin configurar una base de datos vectorial.
Dónde queda corto: Código fuente cerrado. El plan gratuito limita algunas características RAG avanzadas.
Precios:
- Base gratuita.
- Pro añade sincronización en la nube, RAG avanzada y soporte prioritario (precios en su sitio).
Plataformas: Windows, macOS, Linux.
Descarga: msty.app
Conclusión: La opción si quieres chat de documentos sin configurar un almacén vectorial separado.
6. KoboldCpp, mejor para juego de rol y escritura creativa
KoboldCpp comenzó como un fork de llama.cpp dirigido a escritura de forma larga y juego de rol. Tiene una interfaz web con información mundial, memoria de personaje y libros de tradición que otros corredores no exponen. El backend admite Vulkan para iGPU.
Dónde queda corto: La interfaz es densa con controles deslizantes que solo significan algo para usuarios avanzados. No está realmente diseñado para flujos de trabajo de asistente de chat.
Precios:
- Gratis, open source (AGPL).
Plataformas: Windows, macOS, Linux.
Descarga: KoboldCpp GitHub releases.
Conclusión: Opción de nicho para escritores y jugadores de rol que quieren personajes persistentes.
7. Text Generation WebUI, mejor experimentación de usuario avanzado
Text Generation WebUI (oobabooga) es el patio de juegos del experimentador. Admite llama.cpp, ExLlama, Transformers y más backends, expone cada parámetro de generación e integra LoRA y ajuste fino.
Dónde queda corto: La configuración no es para principiantes; espera una instalación de 30 minutos con Python venv desordenado. La interfaz web es funcional pero no está diseñada.
Precios:
- Gratis, open source (AGPL).
Plataformas: Windows, macOS, Linux vía Python.
Descarga: oobabooga/text-generation-webui GitHub.
Conclusión: La opción correcta cuando sabes qué quieres ajustar y no puedes hacerlo en una aplicación mejor.
8. AnythingLLM, mejor RAG local sobre documentos
AnythingLLM es una aplicación RAG construida a propósito que empareja un LLM local (o remoto) con un almacén de documentos. Apunta a una carpeta o suelta archivos, e indexa en una base de datos vectorial local. Los espacios de trabajo multiusuario separan contextos para diferentes proyectos.
Dónde queda corto: Enfocado en RAG; el chat puro es posible pero no el punto. La configuración implica elegir un modelo de incrustación separadamente del modelo de chat, lo que confunde a los principiantes.
Precios:
- Gratis, open source (MIT).
Plataformas: Windows, macOS, Linux, más implementación Docker para auto-hosting.
Descarga: anythingllm.com o Mintplex-Labs/anything-llm GitHub.
Conclusión: La opción si la razón por la que quieres IA local es consultar tu propia colección de documentos en privado.
Cómo elegir el correcto
- Si quieres el modelo local que funciona más rápido sin complicaciones: Ollama.
- Si quieres una interfaz gráfica nativa y valores predeterminados sensatos: LM Studio.
- Si eres completamente nuevo en LLM locales: GPT4All.
- Si quieres ChatGPT completamente open source: Jan.
- Si quieres chatear con tus PDF: AnythingLLM o Msty.
- Si escribes ficción o juegas rol: KoboldCpp.
- Si quieres ajustar cada parámetro: Text Generation WebUI.
La mejor configuración emparejada para la mayoría de usuarios de iGPU: Ollama como backend + LM Studio u Open WebUI como cliente. Eso te da el backend más rápido con la interfaz más amigable.
FAQ
¿Cuál es la mejor aplicación LLM local para Intel Arc iGPU?
LM Studio y Ollama ambos usan Vulkan y funcionan bien en Intel Arc iGPU (Xe, Xe2, Xe-LPG). La elección del modelo es más importante que la elección de la aplicación; las cuantizaciones Q4_K_M de modelos 7B a 8B son el punto óptimo.
¿Puedo ejecutar LLM locales en un APU Ryzen sin una GPU discreta?
Sí. Las iGPU Radeon 780M / 890M de las series Ryzen 7000 y 8000 ejecutan modelos 7B a 10-20 tokens por segundo en cuantización Q4 a través de Vulkan. Aumenta la asignación de RAM del sistema a gráficos en BIOS si quieres cargar contextos más grandes.
¿Cuál es el mejor LLM local para un MacBook con M2 o M3?
Apple silicon ejecuta Llama 3.1 8B, Qwen 3 8B y Mistral 7B a 20-40 tokens por segundo en M2. LM Studio y Ollama ambos usan Metal automáticamente. En 16GB de memoria unificada, mantente con Q4_K_M o Q5_K_M.
¿Necesito saber Python para ejecutar modelos locales?
No. Ollama, LM Studio, GPT4All, Jan y Msty son todas instalaciones de un clic sin Python. Text Generation WebUI es la excepción.
¿Cuál es la aplicación LLM local completamente open source?
Ollama, GPT4All, Jan, KoboldCpp, Text Generation WebUI y AnythingLLM son todas open source. LM Studio y Msty son gratis pero código fuente cerrado.
¿Cuánta RAM necesito para LLM locales?
Para modelos 7B a 8B en cuantización Q4, 16GB de RAM total del sistema es viable y 32GB es cómodo. iGPU comparte RAM del sistema, así que presupuesta en consecuencia. Para modelos 13B a 14B, planifica un mínimo de 32GB.