
Ese viejo PC gaming que se sienta en el armario aún tiene mucha vida. Una máquina de la era 2018 con Ryzen o Intel, 32 GB de RAM y una GPU usada ejecutará un modelo 7B a velocidad de conversación y alojará cómodamente un modelo 13B. Apunta las laptops familiares a ella y tienes una IA privada, siempre encendida que responde en la LAN en un par de segundos. Las mejores aplicaciones para convertir un PC antiguo en servidor de IA local eligen bien sus modelos, envían una API HTTP para otras herramientas y permiten que la máquina duerma entre consultas. Elegimos siete que convierten el hardware de diez años en un servicio de IA utilizable.
Qué buscar en una aplicación de servidor de IA local
Seis cosas importan para la IA en hardware antiguo:
- Backend y formato.
llama.cpp(GGUF) tiene el soporte más amplio; MLC y ONNX son las alternativas. - Ruta solo CPU. Si la aplicación se ejecuta a una velocidad utilizable en una máquina sin GPU.
- Amplitud de soporte de GPU. Nvidia (CUDA), AMD (ROCm), Intel (SYCL) y Apple Silicon (Metal).
- Manejo de solicitudes concurrentes. Si la familia puede consultar al mismo tiempo sin que uno agote al otro.
- API compatible con OpenAI. Si otras herramientas pueden apuntar al servidor y pensar que están hablando con la API de OpenAI.
- Techo de memoria. RAM más VRAM decide qué modelo cabe. La cuantización Q4 reduce aproximadamente a la mitad la necesidad de memoria.
Comparación rápida
| Aplicación | Mejor para | Soporte GPU | API | Destacado |
|---|---|---|---|---|
| Ollama | Servidor más simple | Nvidia, AMD, Apple | Compatible con OpenAI | Un comando ejecuta un modelo |
| LM Studio | UI amigable | Nvidia, AMD, Apple | Compatible con OpenAI | Mejor descubrimiento de modelos |
| Jan | ChatGPT completamente local | Nvidia, AMD, Apple | Compatible con OpenAI | Chat más servidor en una aplicación |
| GPT4All | Línea base solo CPU | Nvidia, AMD, CPU | API local | Se ejecuta en hardware antiguo |
| llama.cpp | Control bare-metal | Nvidia, AMD, Apple, CPU | HTTP puro | El motor bajo la mayoría de la lista |
| Open WebUI | Frontend web para Ollama | Cualquiera (cliente) | Se comunica con Ollama | Interfaz similar a ChatGPT para la LAN |
| LocalAI | Reemplazo directo de OpenAI | Nvidia, AMD, CPU | Compatible con OpenAI | Sirve imágenes, audio, embeddings también |
Las aplicaciones
1. Ollama, mejor para “ejecutar un modelo en un comando”
Ollama envía un servicio de fondo que extrae, cuantiza y sirve modelos desde una biblioteca seleccionada. Un comando (ollama run llama3.2) descarga los pesos, carga el modelo y coloca al usuario en un chat. El servicio expone un endpoint compatible con OpenAI en localhost:11434, por lo que cualquier herramienta que hable con OpenAI puede apuntar a la PC antigua y obtener el mismo comportamiento.
Dónde falla: La biblioteca propia de Ollama utiliza un formato de manifiesto personalizado. Traer un GGUF aleatorio de Hugging Face requiere un pequeño Modelfile y un paso de importación.
Precio: Gratis, con licencia MIT.
Plataformas: Windows, macOS, Linux.
Descargar: Ollama
Conclusión: Comienza aquí. Instálalo, ejecuta un comando, y la LAN tiene un servidor de IA.
2. LM Studio, mejor para UI amigable
LM Studio es una aplicación de escritorio que explora Hugging Face, descarga modelos GGUF y los ejecuta localmente. Tiene una interfaz de chat y un toggle “servidor local” que expone un endpoint compatible con OpenAI. La interfaz muestra el uso de RAM y VRAM predicho antes de descargar, lo cual es genuinamente útil al elegir una cuantización.
Dónde falla: Código cerrado. Algunas partes de la aplicación dependen de la conectividad a Internet incluso para el uso local, aunque el modelo se ejecuta sin conexión.
Precio: Gratis para uso personal.
Plataformas: Windows, macOS, Linux.
Descargar: LM Studio
Conclusión: Elige esto cuando el amigo que ejecuta la PC antigua no quiere tocar una terminal.
3. Jan, mejor para clon ChatGPT completamente local
Jan es una aplicación de escritorio que se envía como cliente en forma de ChatGPT, gestor de modelos y servidor API local en un paquete. Las descargas de modelos son visibles, y el “modo servidor” hace que los mismos modelos estén disponibles para otras aplicaciones en la LAN. Todo el diseño es de código abierto y orientado a la privacidad.
Dónde falla: Más nuevo que Ollama y LM Studio; ocasionalmente bordes ásperos en soporte de modelos.
Precio: Gratis, con licencia AGPL.
Plataformas: Windows, macOS, Linux.
Descargar: Jan
Conclusión: La opción si el objetivo es una sola aplicación que actúe como cliente de chat y servidor en la LAN.
4. GPT4All, mejor para línea base solo CPU
GPT4All fue construido para el caso donde no hay GPU en absoluto. Ejecuta modelos GGUF en la CPU con desempeño utilizable en cualquier máquina desde 2018 en adelante. La aplicación de escritorio gestiona modelos, y un servidor API local se puede encender desde la configuración.
Dónde falla: La velocidad en CPU está limitada por el ancho de banda de memoria. Espera 4 a 8 tok/s en un modelo 7B en una CPU moderna sin GPU.
Precio: Gratis, con licencia MIT.
Plataformas: Windows, macOS, Linux.
Descargar: GPT4All
Conclusión: Para la PC de oficina sin GPU. Todavía ejecuta un asistente.
5. llama.cpp, mejor para control bare-metal
llama.cpp es el motor que envuelven la mayoría de las aplicaciones anteriores. Ejecutarlo directamente es el camino más rápido en hardware antiguo porque no hay sobrecarga. El binario llama-server expone un endpoint HTTP; el binario llama-cli ejecuta chat interactivo. Todo es un proyecto de C++ sin runtime.
Dónde falla: Solo línea de comandos. La configuración vive en banderas, no en una interfaz.
Precio: Gratis, con licencia MIT.
Plataformas: Windows, macOS, Linux (se construye desde la fuente en todos lados).
Descargar: GitHub
Conclusión: La opción cuando el objetivo es exprimir cada último token por segundo de la máquina antigua.
6. Open WebUI, mejor para frontend web
Open WebUI es una interfaz web auto-hospedada que se comunica con Ollama (o cualquier endpoint compatible con OpenAI). Instálalo en la PC antigua, y cada dispositivo en la LAN obtiene una página similar a ChatGPT en http://server-ip:3000. Usuarios, permisos, documentos RAG y enrutamiento de múltiples modelos están todos incorporados.
Dónde falla: Se ejecuta encima de un backend modelo, por lo que necesita Ollama o un servidor compatible con OpenAI detrás.
Precio: Gratis, auto-hospedado; BSD-3-Clause.
Plataformas: Docker en cualquier host.
Descargar: GitHub
Conclusión: La interfaz de usuario que la mayoría de las familias quieren. Instálalo justo después de Ollama.
7. LocalAI, mejor para reemplazo directo de OpenAI
LocalAI reemplaza la API de OpenAI en la LAN. Terminaciones de chat, embeddings, generación de imágenes (Stable Diffusion), texto a voz y voz a texto todos viven detrás de los mismos endpoints HTTP que usa OpenAI. Cualquier herramienta con un SDK de OpenAI funciona contra LocalAI cambiando una variable env.
Dónde falla: El alcance amplio significa inicio más lento. Cada modalidad tiene sus propias opciones de modelo.
Precio: Gratis, con licencia MIT.
Plataformas: Docker en Linux, Windows (WSL2), macOS.
Conclusión: Elige esto cuando el objetivo es intercambiar OpenAI por un servidor local en muchas aplicaciones a la vez.
Cómo elegir la combinación correcta
Para una configuración de home-lab que solo necesita funcionar: Ollama más Open WebUI. Uno sirve modelos en la LAN; el otro le da a la familia una página para visitar.
Para un amigo que no tocará una terminal: LM Studio en el escritorio y déjalo chatear localmente.
Para una vieja caja de oficina solo CPU: GPT4All con un modelo 3B. O llama.cpp con el mismo modelo si una terminal está bien.
Para un todo en uno que da chat y servidor sin dividirse en dos aplicaciones: Jan.
Para un hogar que ejecuta muchas herramientas de IA (asistentes personales, IDE de codificación, aplicaciones de notas): LocalAI para que cada herramienta vea un endpoint similar a OpenAI.
FAQ
¿Qué modelo debo ejecutar primero? Llama 3.2 3B o Qwen 2.5 3B en Q4_K_M. Ambos caben en 4 GB de RAM, se ejecutan a 15 a 30 tok/s en una CPU moderna por sí sola y dan respuestas casi insignia para preguntas comunes.
¿Necesito una GPU? No, pero cambia lo que puedes ejecutar. Sin GPU, espera modelos 7B a 5 a 10 tok/s. Incluso con una Nvidia RTX 3060 usada (12 GB), un modelo 13B a 30 a 50 tok/s se vuelve práctico.
¿Cuánta RAM necesito? 16 GB es el mínimo para modelos 7B. 32 GB abre el territorio 13B. 64 GB o más comienza a mantener 34B y 70B (con cuantización).
¿Puedo acceder a esto desde fuera de casa? Sí, sobre una VPN mesh como Tailscale. No expongas un endpoint Ollama o LocalAI en Internet público. No hay auth incorporada por defecto.
¿Cuánta energía consume una PC antigua en idle? Un escritorio antiguo con GPU se queda en 40 a 80 W. Eso es $50 a $100 al año de electricidad en la mayoría de los mercados. Si la máquina solo se consulta unas pocas veces al día, configura wake-on-LAN en BIOS y duérmela entre sesiones.
¿Cómo se compara esto con ejecutar Ollama en una Mac mini? Una Mac mini Apple Silicon con 16 o 24 GB de memoria unificada es el camino más eficiente en energía. Si la PC antigua aún tiene valor en otro lugar, mantenla. Si empiezas de nuevo, una M1 mini usada a menudo vence a una torre 2018 en vatios por token.