Ollama — el servidor LLM local más popular para laboratorios domésticos Proxmox

Cada mensaje enviado a ChatGPT o Claude sale del edificio. Para la mayoría de las personas, ese intercambio está bien. Para un número creciente de propietarios de laboratorios domésticos no lo es, y un servidor Proxmox que ya ejecuta Plex, Home Assistant y Pi-hole tiene exactamente el CPU, RAM e (a menudo) GPU que necesita un modelo de lenguaje local. Un informe reciente de un alojador propio que abandonó la IA en la nube por un LLM local en Proxmox resumió bien el atractivo: el hardware ya estaba pagado, así que el modelo se convirtió en lo que finalmente hizo que todo el laboratorio doméstico valiera la pena. Recopilamos las siete aplicaciones que vale la pena ejecutar en una VM o un contenedor LXC para lograr esto, clasificadas por esfuerzo de configuración, eficiencia del hardware y qué tan cerca está la experiencia diaria a ChatGPT. Estas son las mejores aplicaciones para alojar un LLM local en Proxmox este año.

Qué buscar en un anfitrión LLM de Proxmox

No todos los proyectos locales de LLM están diseñados para ejecutarse sin interfaz en un hipervisor. Algunas cosas separan las que vale la pena instalar de las que te van a ralentizar.

Comparación rápida

Aplicación Mejor para Implementación Nivel gratuito Soporte de GPU
Ollama Host Proxmox general Linux VM, LXC, Docker Gratuito, código abierto NVIDIA, AMD (ROCm), CPU
Open WebUI Mejor interfaz sobre Ollama Docker en la misma VM/LXC Gratuito, código abierto Hereda GPU de backend
LM Studio Descubrimiento de modelos en escritorio Aplicación de escritorio (no sin interfaz) Gratuito NVIDIA, Apple Silicon
text-generation-webui Formatos de modelo avanzados y antiguos Linux VM, Docker Gratuito, código abierto NVIDIA, AMD, CPU
vLLM Servicio de alto rendimiento, producción Linux VM, Docker Gratuito, código abierto NVIDIA (mejor), AMD (parcial)
llama.cpp server Lo más ligero, nativo de GGUF Linux VM, LXC, Docker Gratuito, código abierto NVIDIA, AMD, Apple Silicon, CPU
LocalAI Reemplazo drop-in de OpenAI-API Linux VM, LXC, Docker Gratuito, código abierto NVIDIA, CPU

Las 7 aplicaciones clasificadas

1. Ollama — Mejor en general

Ollama es la aplicación en la que primero aterrizan la mayoría de los propietarios de laboratorios domésticos Proxmox, y generalmente en la que se quedan. La instalación es un único comando de shell dentro de una VM Debian o Ubuntu (o un contenedor LXC privilegiado con los módulos del kernel correctos), y extraer un modelo es tan simple como ollama run llama3. Expone una API compatible con OpenAI en el puerto 11434 por defecto, lo que significa que Home Assistant, Continue.dev y docenas de otras herramientas se conectan a ella sin configuración adicional.

Dónde se queda corto: La interfaz incluida es un chat de línea de comandos, no una interfaz web, por lo que la mayoría de las personas la combinan con Open WebUI o un frontend similar. El paso de GPU a un contenedor LXC requiere que el controlador NVIDIA coincida exactamente entre el host y el contenedor, lo que afecta a los principiantes más que la ruta de VM.

Precio: Gratuito, código abierto.

Plataformas: Linux VM, LXC, Docker, también nativo en Windows y macOS para pruebas locales fuera del laboratorio.

Descargar: ollama.com

Línea inferior: La opción por defecto para un host LLM de Proxmox, y el backend en el que se construyen la mayoría de las otras aplicaciones en esta lista.

2. Open WebUI — Mejor interfaz sobre Ollama

Open WebUI convierte Ollama en algo que realmente parece y se siente como ChatGPT: historial de chat, múltiples conversaciones, cambio de modelo desde un menú desplegable, carga de documentos con respuestas mejoradas por búsqueda, e inicios de sesión multiusuario con permisos por usuario. Se ejecuta en su propio contenedor Docker justo al lado de Ollama, por lo que los dos juntos caben cómodamente en un contenedor LXC o una VM pequeña.

Las implementaciones familiares o de hogar se benefician más aquí. Cada persona obtiene su propio inicio de sesión, su propio historial de chat, y un administrador puede establecer qué modelos están disponibles para quién.

Dónde se queda corto: Es una interfaz, no un servidor de modelos, por lo que depende completamente de Ollama (u otro backend compatible con OpenAI) ya ejecutándose debajo. Las pantallas de administración de permisos y usuarios toman unos minutos para acostumbrarse la primera vez.

Precio: Gratuito, código abierto.

Plataformas: Docker en una VM Linux o contenedor LXC, junto con Ollama.

Descargar: github.com/open-webui/open-webui

Línea inferior: La opción para quien quiere que la familia realmente use el LLM local en lugar de solo la persona que lo configuró.

3. LM Studio — Mejor para el descubrimiento de modelos

LM Studio es una aplicación de escritorio pulida para Windows, macOS y Linux que hace que navegar, descargar y probar modelos de Hugging Face sea indoloro, con un catálogo integrado, estimaciones de RAM y VRAM antes de descargar, y un modo de servidor local que expone la misma API compatible con OpenAI que las otras aplicaciones en esta lista. Es menos nativo de Proxmox que Ollama, ya que está diseñado para ejecutarse con GUI en una estación de trabajo en lugar de sin interfaz en un contenedor, pero merece un lugar aquí porque es la forma más rápida de averiguar qué modelo realmente se ajusta a tu hardware antes de comprometerse con una implementación de Proxmox.

Algunos propietarios de laboratorios domésticos ejecutan LM Studio en una máquina de escritorio puramente para investigación de modelos, luego extraen el modelo ganador en Ollama en el cuadro Proxmox para el servidor siempre encendido.

Dónde se queda corto: Ejecutarlo sin interfaz dentro de una VM funciona pero pierde el punto de la aplicación, ya que la GUI es el principal atractivo. No está diseñado para el tipo de operación desatendida y “arrancar y olvidarse” que un servidor de laboratorio doméstico quiere.

Precio: Gratuito.

Plataformas: Escritorio Windows, macOS, Linux (no nativo de contenedor).

Descargar: lmstudio.ai

Línea inferior: Útil como herramienta de reconocimiento antes de la implementación, no como el host Proxmox en sí.

4. text-generation-webui — Mejor para formatos de modelo avanzados y antiguos

text-generation-webui, a menudo llamado “oobabooga” por su creador, es el veterano de esta lista y sigue siendo la aplicación con el soporte de formato más amplio: GGUF, GPTQ, AWQ y EXL2 se cargan todos a través de la misma interfaz, junto con soporte de ajuste fino de LoRA y un modo de finalización estilo cuaderno. Para quién está ejecutando un modelo más antiguo u oscuro para el que las herramientas más nuevas han dejado de soportar, este es generalmente el lugar donde todavía funciona.

La interfaz web incluye tarjetas de personaje, presets de chat y extensiones para cosas como memoria a largo plazo y voz, características dirigidas más a la experimentación de afición que a una experiencia de chat limpia y diaria.

Dónde se queda corto: La interfaz muestra su edad junto a Open WebUI, y la gran cantidad de configuraciones y extensiones puede abrumar a alguien que solo quiere un cuadro de chat que funcione. Las actualizaciones ocasionalmente rompen la compatibilidad con formatos de cuantización específicos.

Precio: Gratuito, código abierto.

Plataformas: Linux VM, Docker, también se ejecuta en Windows y macOS.

Descargar: github.com/oobabooga/text-generation-webui

Línea inferior: La opción correcta para los aficionados que ejecutan formatos de modelo inusuales o ajustes finos que otros servidores no soportan.

5. vLLM — Mejor para alto rendimiento y servicio de producción

vLLM se construye para un problema diferente que la mayoría de esta lista: servir muchas solicitudes concurrentes rápidamente, usando PagedAttention para mantener la memoria GPU eficiente bajo carga. En un cuadro Proxmox con una GPU adecuada, vLLM superará a Ollama por un gran margen cuando varias personas o varias aplicaciones afecten al modelo al mismo tiempo, lo que importa para un laboratorio doméstico que ejecuta un LLM detrás de múltiples servicios (asistente de codificación, interfaz de chat y conducto de automatización, todo al mismo tiempo).

Habla de forma nativa la API de OpenAI, por lo que se integra con las mismas herramientas que hablan con Ollama.

Dónde se queda corto: La configuración es más pesada, los requisitos de GPU son más estrictos, y el rendimiento del chat de usuario único no es significativamente mejor que las opciones más simples aquí. Los laboratorios domésticos solo para CPU o con bajo VRAM obtienen poco beneficio de él.

Precio: Gratuito, código abierto.

Plataformas: Linux VM con paso de GPU, Docker.

Descargar: github.com/vllm-project/vllm

Línea inferior: Overkill para un reemplazo de ChatGPT de usuario único, pero la herramienta correcta una vez que un laboratorio doméstico comienza a servir un modelo local a múltiples aplicaciones o personas al mismo tiempo.

6. llama.cpp server — Lo más ligero, nativo de GGUF

llama.cpp es el motor de inferencia de C++ que la mayoría de las aplicaciones en esta lista ejecutan bajo el capó, y su propio servidor incluido (llama-server) es la forma más ligera de exponer un modelo GGUF sobre una API compatible con OpenAI sin capas adicionales. El uso de recursos es el más bajo en esta lista, lo que lo hace una opción fuerte para un pequeño contenedor LXC o un host Proxmox que también necesita ejecutar otros servicios en el mismo hardware.

Incluye una interfaz de chat web mínima integrada, funcional pero sencilla, que es suficiente para uso básico sin agregar Open WebUI encima.

Dónde se queda corto: Sin administrador de modelos, sin cuentas multiusuario, y la configuración ocurre a través de banderas de línea de comandos en lugar de una pantalla de configuración. Premia a alguien cómodo con una terminal más que a alguien que quiere una configuración de apuntar y hacer clic.

Precio: Gratuito, código abierto.

Plataformas: Linux VM, LXC, Docker, también compila en Windows, macOS y Apple Silicon.

Descargar: github.com/ggerganov/llama.cpp

Línea inferior: La opción para ajustar un modelo al hardware mínimo o a un contenedor LXC con recursos limitados.

7. LocalAI — Mejor reemplazo drop-in de OpenAI-API

LocalAI apunta a ser un reemplazo casi total de drop-in para la API de OpenAI, cubriendo no solo finalizaciones de chat sino generación de imágenes, texto a voz e incrustaciones detrás de la misma interfaz. Para un laboratorio doméstico que ya tiene aplicaciones o automatización conectadas para llamar a la API de OpenAI, LocalAI permite que ese punto de integración permanezca sin cambios mientras la inferencia real ocurre localmente en el cuadro Proxmox.

Soporta una amplia gama de backends, incluyendo llama.cpp, por lo que el mismo servidor puede ejecutar varios formatos de modelo diferentes dependiendo de lo que requiera una solicitud determinada.

Dónde se queda corto: La amplitud de los tipos de modelo soportados añade complejidad de configuración en comparación con un servidor de propósito único como Ollama, y el proyecto se mueve lo suficientemente rápido como para que la documentación ocasionalmente se quede atrás de la versión más reciente.

Precio: Gratuito, código abierto.

Plataformas: Linux VM, LXC, Docker.

Descargar: localai.io

Línea inferior: La opción correcta cuando la herramienta existente ya está construida contra la API de OpenAI y cambiar el punto final, no reescribir la integración, es el objetivo.

Cómo elegir el correcto

Para una sola persona reemplazando ChatGPT para uso diario, Ollama emparejado con Open WebUI cubre casi todo: una interfaz de chat, cambio de modelo y un punto final API para cualquier otra cosa en la red. Un hogar que comparte un cuadro Proxmox se beneficia del mismo emparejamiento, ya que los inicios de sesión por usuario de Open WebUI mantienen los historiales de chat separados sin necesidad de múltiples VM.

Un aficionado que quiere jugar con ajustes finos, presets de personaje o formatos de cuantización más antiguos obtiene más rendimiento de text-generation-webui, incluso con su curva de aprendizaje más pronunciada. Alguien que aún está decidiendo qué modelo se ajusta a su hardware debería comenzar con LM Studio en un escritorio antes de comprometerse con una VM de Proxmox en una configuración específica.

Un rig rico en GPU que sirve múltiples aplicaciones o usuarios al mismo tiempo es el único caso en el que vLLM obtiene su costo de configuración adicional, ya que su ventaja de rendimiento solo se muestra bajo carga concurrente. Un cuadro solo para CPU, o un host Proxmox con RAM limitado para ahorrar, se sirve mejor directamente con el servidor llama.cpp, que tiene la menor sobrecarga de cualquier cosa en esta lista. Y un laboratorio con automatización existente que ya llama a la API de OpenAI es el caso claro para LocalAI, ya que permite que ese punto de integración permanezca exactamente como era.

Preguntas frecuentes

¿Puede Proxmox ejecutar LLMs sin una GPU? Sí. Ollama, servidor llama.cpp y LocalAI se ejecutan todos en solo CPU, y un modelo 7B o 8B cuantizado es utilizable para chat en una CPU multicore moderna, aunque las respuestas llegan notablemente más lentamente que en una GPU. Los modelos cuantizados más pequeños (3B e inferiores) permanecen receptivos incluso en hardware modesto.

¿Cuál es el LLM local más cercano a la calidad de ChatGPT? La calidad del modelo depende de qué pesos se cargan, no de qué servidor los ejecuta, por lo que cualquiera de estas aplicaciones puede ejecutar los mismos modelos. Los modelos abiertos más grandes en el rango de 70B-plus, ejecutados en una buena cuantización, se acercan más a las respuestas a nivel de ChatGPT, aunque necesitan VRAM sustancial o un fallback de CPU lento para funcionar bien.

¿Es Ollama gratuito? Sí. Ollama es gratuito y de código abierto, sin nivel de pago, suscripción o límites de uso, ya que la inferencia ocurre completamente en el hardware en el que se ejecuta.

¿Debería usar una VM o un contenedor LXC para Ollama? Un contenedor LXC es más ligero e inicia más rápido, lo que conviene a una configuración solo para CPU o un laboratorio apretado en RAM. Una VM es la opción más segura para el paso de GPU, ya que aísla la pila de controladores NVIDIA del host Proxmox y evita los problemas de coincidencia de versiones que surgen cuando un contenedor comparte el kernel y los controladores del host.

¿Qué modelo se ejecuta en 16 GB de VRAM? Un modelo 13B en cuantización GGUF de 4 bits o 5 bits cabe cómodamente en 16 GB de VRAM con espacio para una ventana de contexto razonable. Algunas cuantizaciones 34B bien optimizadas también caben con una longitud de contexto reducida, aunque 13B e inferior da el mayor margen para conversaciones más largas.