Ollama, una de las aplicaciones utilizadas para ejecutar LLM locales en un NAS

Gemma 4 en un portátil es ágil. La GPU hace su trabajo, las respuestas llegan en segundos, y el modelo se siente como un asistente real. Muévelo a un NAS y se ralentizará lo suficiente como para que una pregunta sea un pequeño compromiso. Esa brecha es el punto. Cuando el modelo vive en almacenamiento compartido, toda la familia o equipo puede llamarlo, y el segundo extra de latencia lo convierte nuevamente en una herramienta en lugar de un reflejo.

Elegimos ocho aplicaciones que ejecutamos en un NAS para alojar LLM locales hoy. Algunas son el servidor, algunas son el front-end, algunas son la capa de despliegue. Juntas, cubren el flujo de trabajo desde descargar un modelo hasta una familia de clientes que llaman a un punto final compartido.

Qué buscar en una aplicación LLM alojada en NAS

Los ocho a continuación cumplen al menos cuatro de los cinco. El rango los ordena por facilidad de ejecución en Synology, QNAP o un NAS construido por uno mismo.

Comparación rápida

Aplicación Mejor para Se ejecuta en Soporte de GPU Licencia
Ollama El servidor NAS más fácil Linux, macOS, Windows CUDA, Metal, ROCm MIT
LM Studio Host de modelo punto y clic Linux, macOS, Windows CUDA, Metal, ROCm Proprietary (free)
Open WebUI Front-end web compartido Docker A través del backend MIT
LocalAI Drop-in compatible con OpenAI Docker CUDA, ROCm, CPU MIT
Text Generation WebUI Sintonización de usuario avanzado Linux, macOS, Windows CUDA, ROCm, CPU AGPL
Jan Cliente de escritorio local Windows, macOS, Linux CUDA, Metal, CPU AGPL
vLLM Inferencia de alto rendimiento Linux CUDA (GPU de servidor) Apache 2
llama.cpp Inferencia de CPU bare-metal Cualquiera Cualquiera MIT

1. Ollama, mejor para el servidor NAS más fácil

Ollama es lo más cercano a una instalación de un comando para un NAS. Imagen de Docker, puerto 11434, y cada cliente que hable con Ollama o la API de OpenAI puede comunicarse con él. La biblioteca de modelos incluye Llama, Gemma, Mistral, Qwen y una lista creciente de variantes instruct.

Dónde falla: los controles de muestreo de grano fino se ocultan detrás de banderas. Cualquiera que quiera intercambiar plantillas de indicaciones manualmente termina en la sintaxis de modelfile.

Precio:

Plataformas: Linux, macOS, Windows (todos como Docker o nativos).

Descargar: ollama.com

Conclusión: La recomendación predeterminada para cualquiera que configure un LLM NAS por primera vez.

2. LM Studio, mejor para un host de modelo punto y clic

LM Studio es la aplicación de escritorio que también ejecuta un servidor compatible con OpenAI. Apúntalo a una carpeta de modelo montada en NAS, activa el servidor, y los clientes en la LAN pueden llamarlo. La GUI oculta las partes de llama.cpp que asustan a la gente.

Dónde falla: es una aplicación de escritorio en primer lugar, por lo que la instalación sin interfaz en un NAS significa ejecutarla dentro de un servidor X ligero o elegir un NAS con pantalla para la configuración.

Precio:

Plataformas: Windows, macOS, Linux.

Descargar: lmstudio.ai

Conclusión: La opción correcta cuando un miembro de la familia quiere cambiar modelos y no quiere tocar la terminal.

3. Open WebUI, mejor para un front-end web compartido

Open WebUI es la interfaz web estilo ChatGPT para un backend alojado en NAS. Apúntalo a Ollama, LM Studio o LocalAI, agrega usuarios, y cada miembro del hogar obtiene sus propios chats y una biblioteca compartida de indicaciones. RAG sobre archivos locales se envía en la caja.

Dónde falla: es un front-end, no un runtime. Ollama o LocalAI sigue haciendo el trabajo del modelo.

Precio:

Plataformas: Docker en Linux, más una instalación nativa de NAS a través de Portainer.

Descargar: openwebui.com

Conclusión: El emparejamiento correcto con Ollama cuando el objetivo es un chat familiar compartido y orientado al navegador.

4. LocalAI, mejor para drop-in compatible con OpenAI

LocalAI expone un punto final compatible con OpenAI (chat, incrustaciones, imágenes, TTS) contra modelos locales. Cualquier aplicación que hable con la API de OpenAI puede comunicarse con él sin cambios. Los backends abarcan llama.cpp, whisper.cpp y stable-diffusion.cpp.

Dónde falla: el archivo de configuración es denso y cada modelo necesita su propia entrada. Ollama maneja la asignación por ti.

Precio:

Plataformas: Docker en Linux, más compilaciones nativas para Windows y macOS.

Descargar: localai.io

Conclusión: El servidor correcto cuando el cliente es un SDK de OpenAI y cambiar la URL base es toda la migración.

5. Text Generation WebUI, mejor para sintonización de usuario avanzado

Text Generation WebUI (oobabooga) es el front-end más antiguo y rico que también ejecuta un servidor. Los parámetros de muestreo, la carga de LoRA y las plantillas de indicaciones estilo tarjeta de personaje están todas expuestas. Cualquiera que quiera ajustar un modelo más allá del predeterminado se sienta aquí.

Dónde falla: la interfaz ha sido reconstruida dos veces y aún muestra sus raíces de usuario avanzado. No es la herramienta que entregas a un miembro de la familia.

Precio:

Plataformas: Windows, macOS, Linux.

Descargar: github.com/oobabooga/text-generation-webui

Conclusión: La opción para cualquiera que quiera botones de muestreo que Ollama y LM Studio ocultan.

6. Jan, mejor para cliente de escritorio local

Jan es el cliente ChatGPT local. Se envía con su propio runtime para NAS solo CPU, pero también habla con un servidor Ollama o LocalAI remoto. Los chats y las indicaciones permanecen en el disco, por lo que todo el historial es un archivo local.

Dónde falla: como servidor NAS, no es el mejor ajuste. Úsalo como cliente y deja que Ollama o LocalAI hagan el servicio.

Precio:

Plataformas: Windows, macOS, Linux.

Descargar: jan.ai

Conclusión: El compañero de escritorio correcto para un servidor NAS para cualquiera que no quiera una pestaña web.

7. vLLM, mejor para inferencia de alto rendimiento

vLLM es el servidor de nivel de producción. La atención paginada, el paralelismo de tensores y el agrupamiento continuo lo hacen la forma más rápida de servir un modelo grande a muchos clientes. El truco es que necesita una GPU real (Ampere o posterior).

Dónde falla: no es una instalación amigable con NAS. Un chasis NAS sin una GPU de centro de datos no puede ejecutarlo de la forma que asumen los documentos.

Precio:

Plataformas: Linux (típicamente Docker con kit de herramientas de contenedor NVIDIA).

Descargar: github.com/vllm-project/vllm

Conclusión: La opción cuando el “NAS” es una caja Linux con una GPU real que sirve a un laboratorio doméstico de clientes.

8. llama.cpp, mejor para inferencia de CPU bare-metal

llama.cpp es el runtime de bajo nivel que todo en esta lista envuelve. Se ejecuta en compilaciones de NAS solo CPU donde falta una GPU real, con modelos cuantificados que reducen un modelo de parámetro 8B a unos pocos gigabytes.

Dónde falla: no hay interfaz. Es un binario de servidor y CLI. Emparejalo con Open WebUI u Ollama.

Precio:

Plataformas: Cualquiera (Linux, macOS, Windows, ARM incluyendo Raspberry Pi y Apple Silicon).

Descargar: github.com/ggerganov/llama.cpp

Conclusión: La opción correcta cuando el NAS es solo CPU y cada gigabyte de RAM importa.

Cómo elegir el correcto

Preguntas frecuentes

¿Qué modelo se ejecuta en un NAS sin GPU?

Las versiones cuantificadas de Gemma, Llama o Mistral en el rango 3B-8B se ejecutan en una CPU NAS moderna con algunos tokens por segundo. Eso es lento para chat interactivo, bien para un resumen de una sola vez o un trabajo nocturno.

¿Necesito una GPU en mi NAS?

Solo para velocidad interactiva. Un NAS solo CPU aún ejecuta un modelo pequeño; los tiempos de respuesta se encuentran en segundos por oración en lugar de tokens por segundo.

¿Puedo mantener el modelo alojado en NAS privado en mi LAN?

Sí. Ollama, LM Studio y LocalAI se vinculan a la interfaz LAN por defecto. Agrega autenticación básica o un proxy inverso para cualquier cosa más que una LAN doméstica.

¿Cuánto espacio en disco necesitan los modelos locales?

Un modelo 8B cuantificado se encuentra alrededor de 5 GB. Un modelo 70B cuantificado se encuentra más cerca de 40 GB. Un NAS con un volumen de repuesto de 500 GB contiene una biblioteca completa.

¿Pueden varias personas usar el modelo al mismo tiempo?

Ollama, LocalAI y Text Generation WebUI se serializan por defecto. vLLM maneja solicitudes concurrentes de forma nativa. Para una familia pequeña, la serialización está bien.

¿Qué hay de la privacidad?

Cada aplicación en esta lista ejecuta el modelo localmente. Ninguna indicación o respuesta se envía a un tercero a menos que la aplicación esté configurada para hacerlo.