Las mejores aplicaciones para convertir un PC antiguo en servidor de IA local

Ese viejo PC gaming que se sienta en el armario aún tiene mucha vida. Una máquina de la era 2018 con Ryzen o Intel, 32 GB de RAM y una GPU usada ejecutará un modelo 7B a velocidad de conversación y alojará cómodamente un modelo 13B. Apunta las laptops familiares a ella y tienes una IA privada, siempre encendida que responde en la LAN en un par de segundos. Las mejores aplicaciones para convertir un PC antiguo en servidor de IA local eligen bien sus modelos, envían una API HTTP para otras herramientas y permiten que la máquina duerma entre consultas. Elegimos siete que convierten el hardware de diez años en un servicio de IA utilizable.

Qué buscar en una aplicación de servidor de IA local

Seis cosas importan para la IA en hardware antiguo:

Comparación rápida

Aplicación Mejor para Soporte GPU API Destacado
Ollama Servidor más simple Nvidia, AMD, Apple Compatible con OpenAI Un comando ejecuta un modelo
LM Studio UI amigable Nvidia, AMD, Apple Compatible con OpenAI Mejor descubrimiento de modelos
Jan ChatGPT completamente local Nvidia, AMD, Apple Compatible con OpenAI Chat más servidor en una aplicación
GPT4All Línea base solo CPU Nvidia, AMD, CPU API local Se ejecuta en hardware antiguo
llama.cpp Control bare-metal Nvidia, AMD, Apple, CPU HTTP puro El motor bajo la mayoría de la lista
Open WebUI Frontend web para Ollama Cualquiera (cliente) Se comunica con Ollama Interfaz similar a ChatGPT para la LAN
LocalAI Reemplazo directo de OpenAI Nvidia, AMD, CPU Compatible con OpenAI Sirve imágenes, audio, embeddings también

Las aplicaciones

1. Ollama, mejor para “ejecutar un modelo en un comando”

Ollama envía un servicio de fondo que extrae, cuantiza y sirve modelos desde una biblioteca seleccionada. Un comando (ollama run llama3.2) descarga los pesos, carga el modelo y coloca al usuario en un chat. El servicio expone un endpoint compatible con OpenAI en localhost:11434, por lo que cualquier herramienta que hable con OpenAI puede apuntar a la PC antigua y obtener el mismo comportamiento.

Dónde falla: La biblioteca propia de Ollama utiliza un formato de manifiesto personalizado. Traer un GGUF aleatorio de Hugging Face requiere un pequeño Modelfile y un paso de importación.

Precio: Gratis, con licencia MIT.

Plataformas: Windows, macOS, Linux.

Descargar: Ollama

Conclusión: Comienza aquí. Instálalo, ejecuta un comando, y la LAN tiene un servidor de IA.

2. LM Studio, mejor para UI amigable

LM Studio es una aplicación de escritorio que explora Hugging Face, descarga modelos GGUF y los ejecuta localmente. Tiene una interfaz de chat y un toggle “servidor local” que expone un endpoint compatible con OpenAI. La interfaz muestra el uso de RAM y VRAM predicho antes de descargar, lo cual es genuinamente útil al elegir una cuantización.

Dónde falla: Código cerrado. Algunas partes de la aplicación dependen de la conectividad a Internet incluso para el uso local, aunque el modelo se ejecuta sin conexión.

Precio: Gratis para uso personal.

Plataformas: Windows, macOS, Linux.

Descargar: LM Studio

Conclusión: Elige esto cuando el amigo que ejecuta la PC antigua no quiere tocar una terminal.

3. Jan, mejor para clon ChatGPT completamente local

Jan es una aplicación de escritorio que se envía como cliente en forma de ChatGPT, gestor de modelos y servidor API local en un paquete. Las descargas de modelos son visibles, y el “modo servidor” hace que los mismos modelos estén disponibles para otras aplicaciones en la LAN. Todo el diseño es de código abierto y orientado a la privacidad.

Dónde falla: Más nuevo que Ollama y LM Studio; ocasionalmente bordes ásperos en soporte de modelos.

Precio: Gratis, con licencia AGPL.

Plataformas: Windows, macOS, Linux.

Descargar: Jan

Conclusión: La opción si el objetivo es una sola aplicación que actúe como cliente de chat y servidor en la LAN.

4. GPT4All, mejor para línea base solo CPU

GPT4All fue construido para el caso donde no hay GPU en absoluto. Ejecuta modelos GGUF en la CPU con desempeño utilizable en cualquier máquina desde 2018 en adelante. La aplicación de escritorio gestiona modelos, y un servidor API local se puede encender desde la configuración.

Dónde falla: La velocidad en CPU está limitada por el ancho de banda de memoria. Espera 4 a 8 tok/s en un modelo 7B en una CPU moderna sin GPU.

Precio: Gratis, con licencia MIT.

Plataformas: Windows, macOS, Linux.

Descargar: GPT4All

Conclusión: Para la PC de oficina sin GPU. Todavía ejecuta un asistente.

5. llama.cpp, mejor para control bare-metal

llama.cpp es el motor que envuelven la mayoría de las aplicaciones anteriores. Ejecutarlo directamente es el camino más rápido en hardware antiguo porque no hay sobrecarga. El binario llama-server expone un endpoint HTTP; el binario llama-cli ejecuta chat interactivo. Todo es un proyecto de C++ sin runtime.

Dónde falla: Solo línea de comandos. La configuración vive en banderas, no en una interfaz.

Precio: Gratis, con licencia MIT.

Plataformas: Windows, macOS, Linux (se construye desde la fuente en todos lados).

Descargar: GitHub

Conclusión: La opción cuando el objetivo es exprimir cada último token por segundo de la máquina antigua.

6. Open WebUI, mejor para frontend web

Open WebUI es una interfaz web auto-hospedada que se comunica con Ollama (o cualquier endpoint compatible con OpenAI). Instálalo en la PC antigua, y cada dispositivo en la LAN obtiene una página similar a ChatGPT en http://server-ip:3000. Usuarios, permisos, documentos RAG y enrutamiento de múltiples modelos están todos incorporados.

Dónde falla: Se ejecuta encima de un backend modelo, por lo que necesita Ollama o un servidor compatible con OpenAI detrás.

Precio: Gratis, auto-hospedado; BSD-3-Clause.

Plataformas: Docker en cualquier host.

Descargar: GitHub

Conclusión: La interfaz de usuario que la mayoría de las familias quieren. Instálalo justo después de Ollama.

7. LocalAI, mejor para reemplazo directo de OpenAI

LocalAI reemplaza la API de OpenAI en la LAN. Terminaciones de chat, embeddings, generación de imágenes (Stable Diffusion), texto a voz y voz a texto todos viven detrás de los mismos endpoints HTTP que usa OpenAI. Cualquier herramienta con un SDK de OpenAI funciona contra LocalAI cambiando una variable env.

Dónde falla: El alcance amplio significa inicio más lento. Cada modalidad tiene sus propias opciones de modelo.

Precio: Gratis, con licencia MIT.

Plataformas: Docker en Linux, Windows (WSL2), macOS.

Descargar: LocalAI · GitHub

Conclusión: Elige esto cuando el objetivo es intercambiar OpenAI por un servidor local en muchas aplicaciones a la vez.

Cómo elegir la combinación correcta

Para una configuración de home-lab que solo necesita funcionar: Ollama más Open WebUI. Uno sirve modelos en la LAN; el otro le da a la familia una página para visitar.

Para un amigo que no tocará una terminal: LM Studio en el escritorio y déjalo chatear localmente.

Para una vieja caja de oficina solo CPU: GPT4All con un modelo 3B. O llama.cpp con el mismo modelo si una terminal está bien.

Para un todo en uno que da chat y servidor sin dividirse en dos aplicaciones: Jan.

Para un hogar que ejecuta muchas herramientas de IA (asistentes personales, IDE de codificación, aplicaciones de notas): LocalAI para que cada herramienta vea un endpoint similar a OpenAI.

FAQ

¿Qué modelo debo ejecutar primero? Llama 3.2 3B o Qwen 2.5 3B en Q4_K_M. Ambos caben en 4 GB de RAM, se ejecutan a 15 a 30 tok/s en una CPU moderna por sí sola y dan respuestas casi insignia para preguntas comunes.

¿Necesito una GPU? No, pero cambia lo que puedes ejecutar. Sin GPU, espera modelos 7B a 5 a 10 tok/s. Incluso con una Nvidia RTX 3060 usada (12 GB), un modelo 13B a 30 a 50 tok/s se vuelve práctico.

¿Cuánta RAM necesito? 16 GB es el mínimo para modelos 7B. 32 GB abre el territorio 13B. 64 GB o más comienza a mantener 34B y 70B (con cuantización).

¿Puedo acceder a esto desde fuera de casa? Sí, sobre una VPN mesh como Tailscale. No expongas un endpoint Ollama o LocalAI en Internet público. No hay auth incorporada por defecto.

¿Cuánta energía consume una PC antigua en idle? Un escritorio antiguo con GPU se queda en 40 a 80 W. Eso es $50 a $100 al año de electricidad en la mayoría de los mercados. Si la máquina solo se consulta unas pocas veces al día, configura wake-on-LAN en BIOS y duérmela entre sesiones.

¿Cómo se compara esto con ejecutar Ollama en una Mac mini? Una Mac mini Apple Silicon con 16 o 24 GB de memoria unificada es el camino más eficiente en energía. Si la PC antigua aún tiene valor en otro lugar, mantenla. Si empiezas de nuevo, una M1 mini usada a menudo vence a una torre 2018 en vatios por token.