Nadie necesita una tarjeta de 24 GB para ejecutar un modelo local útil en 2026. Los modelos cuantificados de 7 a 14 mil millones de parámetros caben en 8 a 12 GB de VRAM a velocidades que una GTX 1080 o RTX 2080 usada produce cómodamente, y la diferencia entre “solo en la nube” y “local la mayoría del tiempo” ahora es una instalación de controlador y una descarga de 4 GB. El truco es el tiempo de ejecución. Algunas aplicaciones asumen una tarjeta RTX 50-series nueva; otras fueron construidas específicamente para el hardware antiguo que se encuentra en un chasis de servidor doméstico.
Probamos 8 aplicaciones de escritorio para ejecutar IA local en GPU NVIDIA antiguas, enfocándose en Pascal (serie GTX 10 y Quadro P), Turing (serie RTX 20 y Quadro T) y Ampere inicial (serie RTX 30 y estaciones de trabajo serie A). Cada aplicación en la lista ejecuta Llama 3.1, Qwen 2.5, Mistral 7B o Gemma 2 en 8 GB de VRAM con una velocidad de token por segundo utilizable. Cuál se ajusta a nuestra configuración depende de si queremos una ventana de chat, un servicio o un tiempo de ejecución de bajo nivel.
Qué buscar en una aplicación de IA local para GPU antiguas
Las limitaciones de hardware importan más que el texto de marketing.
- Soporte CUDA 11, no solo CUDA 12 (Pascal se limita a CUDA 12.6 en Linux, más adelante en Windows).
- Formatos de cuantificación que ajusten 7B en 8 GB (GGUF Q4_K_M, Q5_K_M o AWQ de 4 bits).
- Descarga de capas para que un modelo de 13B pueda descargar capas en exceso a la CPU sin volverse inútil.
- Una instalación de un clic que no requiera compilar PyTorch desde la fuente.
- Una API compatible con OpenAI para que cualquier cliente pueda apuntar a localhost sin un shim personalizado.
- Descarga de modelo que se reanuda y verifica sumas de verificación (la paranoia de la era de acceso telefónico aún ayuda).
Comparación rápida
| Aplicación | Mejor para | Windows / Linux | Plan gratuito | Característica destacada | Licencia |
|---|---|---|---|---|---|
| Ollama | Demonio headless y scripts | Ambos | Gratis | Extracción de modelo de una línea, enfocado en CLI | MIT |
| LM Studio | Chat todo en uno | Ambos | Gratis | Navegador de modelos + chat + servidor | Propietaria |
| KoboldCPP | Ejecutable de tiempo de ejecución único | Ambos | Gratis | Sin instalación, GGUF, TTS, imágenes | AGPL 3.0 |
| text-generation-webui | Manipulación de usuario avanzado | Ambos | Gratis | Se admiten todos los formatos de cuantificación | AGPL 3.0 |
| GPT4All | Primer modelo en una laptop modesta | Ambos | Gratis | Barra lateral LocalDocs, presets de VRAM bajo | Tipo MIT |
| Jan | Equivalente LM Studio totalmente de código abierto | Ambos | Gratis | Soporte MCP, compatible con OpenAI | Apache 2.0 |
| llama.cpp | Velocidad de metal desnudo | Ambos | Gratis | CPU más rápido + descarga GPU parcial | MIT |
| vLLM | Servidor API multiusuario | Linux (WSL en Windows) | Gratis | Atención paginada, mejor rendimiento | Apache 2.0 |
Las aplicaciones
1. Ollama – mejor demonio headless en tarjetas NVIDIA antiguas
Ollama es el tiempo de ejecución que la mayoría de la gente instala primero porque todo el flujo de trabajo es ollama pull llama3.1:8b y luego ollama run llama3.1. En una GTX 1080 Ti (11 GB), Llama 3.1 8B Q4_K_M funciona entre 25 y 30 tokens por segundo; en una RTX 2080 Super (8 GB), el mismo modelo funciona alrededor de 40. Ollama vincula un punto final compatible con OpenAI en localhost:11434, y cualquier interfaz que hable con OpenAI (Open WebUI, Msty, LibreChat) se conecta con un cambio de URL base.
Donde se queda corta: El cliente de chat es una terminal. Ollama no viene con una GUI; el uso gráfico significa agregar Open WebUI u otra interfaz.
Precios:
- Gratis: Todo, licenciado bajo MIT
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: ollama.com
Conclusión: La opción correcta cuando el objetivo es servir un modelo a otras herramientas y scripts, no chatear en una aplicación.
2. LM Studio – lo mejor todo en uno para una instalación inicial
LM Studio es la opción “descargar un EXE y hablar con un modelo en cinco minutos”. La aplicación incluye un navegador de Hugging Face, un panel de chat y un botón para exponer un servidor compatible con OpenAI en localhost:1234. La detección de VRAM es precisa en tarjetas antiguas, y la lista de modelos marca qué compilaciones caben completamente en nuestra GPU frente a las que necesitan descarga de CPU.
Donde se queda corta: El cliente es de código cerrado. El uso comercial requiere completar el formulario de licencia del equipo LM Studio y esperar una cotización.
Precios:
- Gratis: Uso personal
- Pagado: Licencia de equipo bajo demanda
Plataformas: Windows, macOS, Linux
Descargar: lmstudio.ai
Conclusión: La instalación inicial más amigable en hardware NVIDIA antiguo, con el camino más rápido hacia una ventana de chat funcional.
3. KoboldCPP – mejor tiempo de ejecución sin instalación
KoboldCPP es un ejecutable único (koboldcpp.exe en Windows, un binario estático en Linux) que ejecuta modelos GGUF, generación de imágenes Stable Diffusion y transcripción Whisper sin ningún entorno de Python. En una GTX 1660 Super (6 GB), un modelo 7B Q4 aún cabe con algunas capas descargadas a la CPU, y el mismo ejecutable maneja la generación rápida de imágenes sin cambiar de aplicación.
Donde se queda corta: La interfaz es basada en web (se abre en una pestaña del navegador) y se siente funcional en lugar de pulida. La profundidad de funciones es alta, la detectabilidad es baja.
Precios:
- Gratis: Todo, AGPL 3.0
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/LostRuins/koboldcpp
Conclusión: La opción cuando la máquina objetivo es una laptop, un homelab o la PC de un amigo donde no queremos instalar Python en todo el sistema.
4. text-generation-webui – lo mejor para usuarios avanzados
text-generation-webui (oobabooga) admite todos los formatos de cuantificación que importan (GGUF, GPTQ, AWQ, exllamav2), nos permite cambiar cargadores sobre la marcha y expone perillas de generación de bajo nivel (escalado de rope, mirostat, temperatura dinámica) que otras aplicaciones ocultan. En una RTX 3060 (12 GB), ejecuta felizmente un modelo de 14B en Q4 con 20 a 30 tokens por segundo.
Donde se queda corta: El instalador descarga varios gigabytes de dependencias de Python. El primer lanzamiento toma 5 a 10 minutos. No es la herramienta para alguien que quiere hacer clic en una cosa y chatear.
Precios:
- Gratis: Todo, AGPL 3.0
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/oobabooga/text-generation-webui
Conclusión: Ideal para el usuario que quiere comparar cuantificaciones de modelos y estrategias de generación en el mismo hardware.
5. GPT4All – mejor punto de partida de VRAM bajo
GPT4All tiene el piso más bajo: el catálogo de modelos integrado marca modelos de 3B y 4B que funcionan en tarjetas de 4 GB, y la barra lateral LocalDocs maneja trabajos pequeños de RAG sin una base de datos de vectores separada. En una GTX 1060 (6 GB), Mistral 7B Instruct funciona a un ritmo útil de 15 a 20 tokens por segundo.
Donde se queda corta: La GUI está diseñada para uso individual; no hay API multiusuario integrada. El catálogo de modelos es más pequeño que el de LM Studio u Ollama.
Precios:
- Gratis: Todo
- Pagado: Ninguno; el soporte empresarial es un complemento pagado
Plataformas: Windows, macOS, Linux
Descargar: gpt4all.io
Conclusión: La instalación inicial correcta en una laptop con 4 a 6 GB de VRAM.
6. Jan – mejor equivalente LM Studio completamente de código abierto
Jan es lo que LM Studio se vería si el cliente en sí fuera Apache 2.0. Catálogo de modelos de primera parte, servidor compatible con OpenAI en localhost:1337, soporte del Model Context Protocol para que Claude Desktop y Continue puedan acceder a un modelo alojado en Jan, y sin telemetría.
Donde se queda corta: Proyecto más joven que LM Studio; el catálogo es más pequeño y algunas cuantificaciones de Hugging Face llegan más tarde. La aceleración de GPU de Windows en hardware no CUDA aún se está poniendo al día.
Precios:
- Gratis: Todo, Apache 2.0
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: jan.ai
Conclusión: La opción de código abierto cuando deseamos una aplicación estilo LM Studio cuya licencia podamos leer en una tarde.
7. llama.cpp – mejor tiempo de ejecución de metal desnudo
llama.cpp es el proyecto de C++ en el que se basa todo el ecosistema. Funciona en todas partes, se compila en cinco minutos en Linux y produce el mejor rendimiento de usuario único en GPU antiguas porque no hay abstracción de Python entre el controlador y el modelo. En una GTX 1080 Ti con -ngl 33, alcanza velocidades de token sin procesar que las aplicaciones de nivel superior se quedan atrás por unos pocos puntos porcentuales.
Donde se queda corta: Sin instalador, sin GUI. Estamos compilando y ejecutando herramientas de línea de comandos. La configuración inicial para un usuario de Windows requiere más trabajo que cualquier otra aplicación en esta lista.
Precios:
- Gratis: Todo, MIT
- Pagado: Ninguno
Plataformas: Windows, macOS, Linux
Descargar: github.com/ggml-org/llama.cpp
Conclusión: Para desarrolladores que quieren saber exactamente qué sucede entre el archivo de modelo y el primer token.
8. vLLM – mejor servidor API multiusuario en Linux
vLLM es el tiempo de ejecución para convertir una estación de trabajo antigua en un servidor de inferencia de un pequeño equipo. La atención paginada escala el rendimiento casi linealmente con solicitudes concurrentes, y los modelos cuantificados AWQ de 4 bits permiten que una tarjeta de 24 GB sirva a dos o tres personas escribiendo simultáneamente sin atascarse. Se ejecuta de forma nativa en Linux; los usuarios de Windows necesitan WSL 2 con paso de CUDA.
Donde se queda corta: No es una aplicación de chat. vLLM es un servidor compatible con OpenAI y espera que los clientes lo accedan. La compatibilidad de modelos pequeños es buena, pero el enfoque de optimización del proyecto es en implementaciones más grandes.
Precios:
- Gratis: Todo, Apache 2.0
- Pagado: Ninguno
Plataformas: Linux (WSL en Windows)
Descargar: github.com/vllm-project/vllm
Conclusión: La opción cuando el objetivo es un clon privado de OpenAI que un pequeño grupo de personas comparte.
Cómo elegir la correcta
- Si queremos una ventana de chat en los próximos 10 minutos: LM Studio o GPT4All.
- Si servimos modelos a otras herramientas: Ollama.
- Si queremos la misma experiencia de código abierto: Jan.
- Si nuestra máquina no puede instalar nada en todo el sistema: KoboldCPP.
- Si queremos exprimir el último porcentaje de rendimiento: llama.cpp.
- Si queremos comparar compilaciones y cuantificaciones de modelos: text-generation-webui.
- Si un pequeño equipo va a compartir la máquina: vLLM en Linux.
Preguntas frecuentes
¿Qué tan antiguo es demasiado antiguo para que una GPU ejecute IA local?
Las tarjetas con 4 GB de VRAM y Compute Capability 6.0 o superior (Pascal en adelante) pueden ejecutar modelos de 3B y 4B cómodamente. Por debajo de 4 GB, la respuesta práctica es inferencia solo de CPU con un modelo pequeño.
¿Tiene sentido una GTX 1080 Ti en 2026?
Sí para IA local. Tiene 11 GB de VRAM, amplio soporte CUDA 12 y suficiente cómputo para modelos de 7B y 8B a 25 a 30 tokens por segundo. No es suficiente para generación de imágenes de alta resolución.
¿Qué formato de cuantificación es mejor para tarjetas antiguas?
GGUF Q4_K_M o Q5_K_M para calidad de chat, AWQ de 4 bits para rendimiento máximo cuando se usa vLLM. GPTQ aún funciona pero el formato se está retirando silenciosamente.
¿Puedo ejecutar estas aplicaciones en GPU AMD o Intel?
Ollama, LM Studio, KoboldCPP y llama.cpp admiten Vulkan o ROCm en muchas tarjetas AMD. Intel Arc es compatible a través de SYCL en llama.cpp y OpenVINO en algunos forks. Este artículo se enfoca en NVIDIA porque ahí es donde vive la conversación sobre tarjetas antiguas.
¿Debo preocuparme por la telemetría?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All y vLLM se envían sin telemetría. LM Studio tiene controles de telemetría en configuración; optar por no participar en la primera ejecución.