Las mejores aplicaciones para ejecutar IA local en GPU NVIDIA antiguas

Nadie necesita una tarjeta de 24 GB para ejecutar un modelo local útil en 2026. Los modelos cuantificados de 7 a 14 mil millones de parámetros caben en 8 a 12 GB de VRAM a velocidades que una GTX 1080 o RTX 2080 usada produce cómodamente, y la diferencia entre “solo en la nube” y “local la mayoría del tiempo” ahora es una instalación de controlador y una descarga de 4 GB. El truco es el tiempo de ejecución. Algunas aplicaciones asumen una tarjeta RTX 50-series nueva; otras fueron construidas específicamente para el hardware antiguo que se encuentra en un chasis de servidor doméstico.

Probamos 8 aplicaciones de escritorio para ejecutar IA local en GPU NVIDIA antiguas, enfocándose en Pascal (serie GTX 10 y Quadro P), Turing (serie RTX 20 y Quadro T) y Ampere inicial (serie RTX 30 y estaciones de trabajo serie A). Cada aplicación en la lista ejecuta Llama 3.1, Qwen 2.5, Mistral 7B o Gemma 2 en 8 GB de VRAM con una velocidad de token por segundo utilizable. Cuál se ajusta a nuestra configuración depende de si queremos una ventana de chat, un servicio o un tiempo de ejecución de bajo nivel.

Qué buscar en una aplicación de IA local para GPU antiguas

Las limitaciones de hardware importan más que el texto de marketing.

Comparación rápida

Aplicación Mejor para Windows / Linux Plan gratuito Característica destacada Licencia
Ollama Demonio headless y scripts Ambos Gratis Extracción de modelo de una línea, enfocado en CLI MIT
LM Studio Chat todo en uno Ambos Gratis Navegador de modelos + chat + servidor Propietaria
KoboldCPP Ejecutable de tiempo de ejecución único Ambos Gratis Sin instalación, GGUF, TTS, imágenes AGPL 3.0
text-generation-webui Manipulación de usuario avanzado Ambos Gratis Se admiten todos los formatos de cuantificación AGPL 3.0
GPT4All Primer modelo en una laptop modesta Ambos Gratis Barra lateral LocalDocs, presets de VRAM bajo Tipo MIT
Jan Equivalente LM Studio totalmente de código abierto Ambos Gratis Soporte MCP, compatible con OpenAI Apache 2.0
llama.cpp Velocidad de metal desnudo Ambos Gratis CPU más rápido + descarga GPU parcial MIT
vLLM Servidor API multiusuario Linux (WSL en Windows) Gratis Atención paginada, mejor rendimiento Apache 2.0

Las aplicaciones

1. Ollama – mejor demonio headless en tarjetas NVIDIA antiguas

Ollama es el tiempo de ejecución que la mayoría de la gente instala primero porque todo el flujo de trabajo es ollama pull llama3.1:8b y luego ollama run llama3.1. En una GTX 1080 Ti (11 GB), Llama 3.1 8B Q4_K_M funciona entre 25 y 30 tokens por segundo; en una RTX 2080 Super (8 GB), el mismo modelo funciona alrededor de 40. Ollama vincula un punto final compatible con OpenAI en localhost:11434, y cualquier interfaz que hable con OpenAI (Open WebUI, Msty, LibreChat) se conecta con un cambio de URL base.

Donde se queda corta: El cliente de chat es una terminal. Ollama no viene con una GUI; el uso gráfico significa agregar Open WebUI u otra interfaz.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: ollama.com

Conclusión: La opción correcta cuando el objetivo es servir un modelo a otras herramientas y scripts, no chatear en una aplicación.

2. LM Studio – lo mejor todo en uno para una instalación inicial

LM Studio es la opción “descargar un EXE y hablar con un modelo en cinco minutos”. La aplicación incluye un navegador de Hugging Face, un panel de chat y un botón para exponer un servidor compatible con OpenAI en localhost:1234. La detección de VRAM es precisa en tarjetas antiguas, y la lista de modelos marca qué compilaciones caben completamente en nuestra GPU frente a las que necesitan descarga de CPU.

Donde se queda corta: El cliente es de código cerrado. El uso comercial requiere completar el formulario de licencia del equipo LM Studio y esperar una cotización.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: lmstudio.ai

Conclusión: La instalación inicial más amigable en hardware NVIDIA antiguo, con el camino más rápido hacia una ventana de chat funcional.

3. KoboldCPP – mejor tiempo de ejecución sin instalación

KoboldCPP es un ejecutable único (koboldcpp.exe en Windows, un binario estático en Linux) que ejecuta modelos GGUF, generación de imágenes Stable Diffusion y transcripción Whisper sin ningún entorno de Python. En una GTX 1660 Super (6 GB), un modelo 7B Q4 aún cabe con algunas capas descargadas a la CPU, y el mismo ejecutable maneja la generación rápida de imágenes sin cambiar de aplicación.

Donde se queda corta: La interfaz es basada en web (se abre en una pestaña del navegador) y se siente funcional en lugar de pulida. La profundidad de funciones es alta, la detectabilidad es baja.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: github.com/LostRuins/koboldcpp

Conclusión: La opción cuando la máquina objetivo es una laptop, un homelab o la PC de un amigo donde no queremos instalar Python en todo el sistema.

4. text-generation-webui – lo mejor para usuarios avanzados

text-generation-webui (oobabooga) admite todos los formatos de cuantificación que importan (GGUF, GPTQ, AWQ, exllamav2), nos permite cambiar cargadores sobre la marcha y expone perillas de generación de bajo nivel (escalado de rope, mirostat, temperatura dinámica) que otras aplicaciones ocultan. En una RTX 3060 (12 GB), ejecuta felizmente un modelo de 14B en Q4 con 20 a 30 tokens por segundo.

Donde se queda corta: El instalador descarga varios gigabytes de dependencias de Python. El primer lanzamiento toma 5 a 10 minutos. No es la herramienta para alguien que quiere hacer clic en una cosa y chatear.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: github.com/oobabooga/text-generation-webui

Conclusión: Ideal para el usuario que quiere comparar cuantificaciones de modelos y estrategias de generación en el mismo hardware.

5. GPT4All – mejor punto de partida de VRAM bajo

GPT4All tiene el piso más bajo: el catálogo de modelos integrado marca modelos de 3B y 4B que funcionan en tarjetas de 4 GB, y la barra lateral LocalDocs maneja trabajos pequeños de RAG sin una base de datos de vectores separada. En una GTX 1060 (6 GB), Mistral 7B Instruct funciona a un ritmo útil de 15 a 20 tokens por segundo.

Donde se queda corta: La GUI está diseñada para uso individual; no hay API multiusuario integrada. El catálogo de modelos es más pequeño que el de LM Studio u Ollama.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: gpt4all.io

Conclusión: La instalación inicial correcta en una laptop con 4 a 6 GB de VRAM.

6. Jan – mejor equivalente LM Studio completamente de código abierto

Jan es lo que LM Studio se vería si el cliente en sí fuera Apache 2.0. Catálogo de modelos de primera parte, servidor compatible con OpenAI en localhost:1337, soporte del Model Context Protocol para que Claude Desktop y Continue puedan acceder a un modelo alojado en Jan, y sin telemetría.

Donde se queda corta: Proyecto más joven que LM Studio; el catálogo es más pequeño y algunas cuantificaciones de Hugging Face llegan más tarde. La aceleración de GPU de Windows en hardware no CUDA aún se está poniendo al día.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: jan.ai

Conclusión: La opción de código abierto cuando deseamos una aplicación estilo LM Studio cuya licencia podamos leer en una tarde.

7. llama.cpp – mejor tiempo de ejecución de metal desnudo

llama.cpp es el proyecto de C++ en el que se basa todo el ecosistema. Funciona en todas partes, se compila en cinco minutos en Linux y produce el mejor rendimiento de usuario único en GPU antiguas porque no hay abstracción de Python entre el controlador y el modelo. En una GTX 1080 Ti con -ngl 33, alcanza velocidades de token sin procesar que las aplicaciones de nivel superior se quedan atrás por unos pocos puntos porcentuales.

Donde se queda corta: Sin instalador, sin GUI. Estamos compilando y ejecutando herramientas de línea de comandos. La configuración inicial para un usuario de Windows requiere más trabajo que cualquier otra aplicación en esta lista.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: github.com/ggml-org/llama.cpp

Conclusión: Para desarrolladores que quieren saber exactamente qué sucede entre el archivo de modelo y el primer token.

8. vLLM – mejor servidor API multiusuario en Linux

vLLM es el tiempo de ejecución para convertir una estación de trabajo antigua en un servidor de inferencia de un pequeño equipo. La atención paginada escala el rendimiento casi linealmente con solicitudes concurrentes, y los modelos cuantificados AWQ de 4 bits permiten que una tarjeta de 24 GB sirva a dos o tres personas escribiendo simultáneamente sin atascarse. Se ejecuta de forma nativa en Linux; los usuarios de Windows necesitan WSL 2 con paso de CUDA.

Donde se queda corta: No es una aplicación de chat. vLLM es un servidor compatible con OpenAI y espera que los clientes lo accedan. La compatibilidad de modelos pequeños es buena, pero el enfoque de optimización del proyecto es en implementaciones más grandes.

Precios:

Plataformas: Linux (WSL en Windows)

Descargar: github.com/vllm-project/vllm

Conclusión: La opción cuando el objetivo es un clon privado de OpenAI que un pequeño grupo de personas comparte.

Cómo elegir la correcta

Preguntas frecuentes

¿Qué tan antiguo es demasiado antiguo para que una GPU ejecute IA local?
Las tarjetas con 4 GB de VRAM y Compute Capability 6.0 o superior (Pascal en adelante) pueden ejecutar modelos de 3B y 4B cómodamente. Por debajo de 4 GB, la respuesta práctica es inferencia solo de CPU con un modelo pequeño.

¿Tiene sentido una GTX 1080 Ti en 2026?
Sí para IA local. Tiene 11 GB de VRAM, amplio soporte CUDA 12 y suficiente cómputo para modelos de 7B y 8B a 25 a 30 tokens por segundo. No es suficiente para generación de imágenes de alta resolución.

¿Qué formato de cuantificación es mejor para tarjetas antiguas?
GGUF Q4_K_M o Q5_K_M para calidad de chat, AWQ de 4 bits para rendimiento máximo cuando se usa vLLM. GPTQ aún funciona pero el formato se está retirando silenciosamente.

¿Puedo ejecutar estas aplicaciones en GPU AMD o Intel?
Ollama, LM Studio, KoboldCPP y llama.cpp admiten Vulkan o ROCm en muchas tarjetas AMD. Intel Arc es compatible a través de SYCL en llama.cpp y OpenVINO en algunos forks. Este artículo se enfoca en NVIDIA porque ahí es donde vive la conversación sobre tarjetas antiguas.

¿Debo preocuparme por la telemetría?
Ollama, KoboldCPP, Jan, llama.cpp, GPT4All y vLLM se envían sin telemetría. LM Studio tiene controles de telemetría en configuración; optar por no participar en la primera ejecución.