El artículo de XDA de la semana pasada terminó donde termina cada hilo de home-lab: solo uno de los siete LLM locales funcionó como el cerebro de un hogar inteligente cuando las automatizaciones se volvieron interesantes. El resto alucinaba en llamadas de función, perdía la intención de “apagar la luz del porche” o se calentaba tanto que los ventiladores del NAS giraban durante horas. Un modelo local en un NAS es una respuesta legítima al control por voz, pero la elección del runtime importa más que la elección del modelo.
Probamos 7 aplicaciones de escritorio que se ejecutan en un NAS doméstico o una mini PC en la misma LAN, exponen un punto de acceso compatible con OpenAI e integran limpiamente con la tubería de voz basada en LLM de Home Assistant. Todo lo siguiente se ejecuta sin conexión una vez que se descargan los pesos, y todo tiene una imagen Docker documentada.
Qué buscar
- API compatible con OpenAI. Home Assistant’s Assist lo espera, y todas las otras herramientas de abajo se conectan de la misma manera.
- Soporte de llamadas de función. Un modelo que no puede emitir una llamada de función estructurada no puede apagar una luz.
- Soporte de modelos GGUF o GPTQ. Si el NAS no tiene GPU, un Q4 GGUF en CPU es el punto de partida honesto.
- Un consumo de memoria sensato. Un modelo 7B Q4 debe ocupar menos de 6 GB de RAM en reposo.
- Arranque en caliente. Cargar en frío un modelo 7B en cada comando de voz es un retraso de cinco segundos que notarás.
- Un gestor de procesos estable. El NAS se reinicia semanalmente para actualizaciones; el modelo debe volver automáticamente.
Comparativa rápida
| App | Mejor para | Plataformas | Plan gratuito | Característica destacada |
|---|---|---|---|---|
| Ollama | El ejecutor por defecto que la mayoría de guías de Home Assistant buscan | Linux, macOS, Windows | Sí (open source) | Catálogo de modelos y un punto de acceso estable compatible con OpenAI |
| LocalAI | Solución todo en uno como reemplazo para APIs de OpenAI, incluyendo audio | Linux, macOS, Windows (Docker) | Sí (open source) | Maneja chat, embeddings, TTS y STT desde un contenedor |
| LM Studio | GUI en el host del NAS y servidor para la LAN | Windows, macOS, Linux | Sí | Descubrimiento de modelos y toggle de servidor de un clic |
| Open WebUI | Frontend de chat web que también se conecta con Home Assistant | Linux, macOS, Windows (Docker) | Sí (open source) | Chat multiusuario con Ollama, LocalAI o cualquier backend compatible con OpenAI |
| Home Assistant | El consumidor del punto de acceso | Windows, macOS, Linux (HAOS, Docker) | Sí | Integración nativa de Assist LLM con enrutamiento de llamadas de función |
| vLLM | Mejor rendimiento en un NAS con GPU | Linux (Docker) | Sí (open source) | Batching continuo y atención paginada para uso multiusuario |
| llama.cpp | El ejecutor bare-metal en C++ detrás de la mayoría de los anteriores | Linux, macOS, Windows | Sí (open source) | Ejecuta GGUF en CPU en casi cualquier hardware |
Las 7 mejores apps para un LLM de hogar inteligente local en NAS
1. Ollama — el mejor ejecutor por defecto al que apuntan la mayoría de guías
Ollama envuelve llama.cpp con una CLI limpia, una biblioteca de modelos y un servidor HTTP compatible con OpenAI que la integración Assist LLM de Home Assistant reconoce directamente. Instala en el NAS, ejecuta ollama pull qwen2.5:7b-instruct y apunta Home Assistant a http://<nas-ip>:11434. El gestor de servicios lo mantiene en funcionamiento a través de reinicios.
Donde falla: La concurrencia multiusuario es de carril único; las solicitudes paralelas se colan en lugar de agruparse. El soporte de Windows llegó recientemente y se queda atrás de Linux en estabilidad.
Precio:
- Gratis: open source bajo MIT
- De pago: ninguno para self-hosting
Plataformas: Linux, macOS, Windows (nativo y Docker)
Descargar: ollama.com
Conclusión: Elige Ollama primero, y solo vete cuando una limitación específica te empuje a hacerlo.
2. LocalAI — mejor si quieres chat, voz y embeddings desde un contenedor
LocalAI es la solución que cubre toda la superficie de OpenAI: completaciones de chat, embeddings, TTS, STT y generación de imágenes, todo localmente. El protocolo Wyoming de Home Assistant puede apuntar al punto de acceso Whisper de LocalAI para STT y Piper para TTS, lo que significa que todo el bucle de voz vive en el NAS.
Donde falla: El archivo de configuración es denso y requiere una primera lectura. Las rutas de aceleración GPU (CUDA, ROCm, Vulkan) son por compilación y elegir la imagen incorrecta da un fallback silencioso a CPU.
Precio:
- Gratis: open source bajo MIT
- De pago: ninguno
Plataformas: Linux, macOS, Windows (Docker)
Descargar: localai.io
Conclusión: Elige LocalAI si el objetivo es un stack de voz autónomo con STT, TTS y chat todo en uno.
3. LM Studio — mejor cuando una interfaz más amigable importa
LM Studio comenzó como una aplicación de chat de escritorio y creció en modo servidor headless. En un NAS con pantalla o sesión KVM remota, el selector de modelos y el selector de cuantización son más tolerantes que una CLI pura. El servidor integrado expone el punto de acceso compatible con OpenAI que Home Assistant espera.
Donde falla: La aplicación principal es de código cerrado, que es un no rotundo para algunos setups de home-lab. El modo headless está disponible pero sigue siendo un ciudadano de segunda clase.
Precio:
- Gratis: aplicación completa
- De pago: ninguno
Plataformas: Windows, macOS, Linux
Descargar: lmstudio.ai
Conclusión: Elige LM Studio si quieres una interfaz para probar modelos antes de asignar uno al rol de hogar inteligente.
4. Open WebUI — el mejor frontend de chat que mantiene a los humanos en el bucle
Open WebUI es el frontend basado en navegador estilo ChatGPT que se ejecuta contra Ollama, LocalAI o cualquier punto de acceso compatible con OpenAI. En un NAS, funciona como una superficie de prueba: ejecuta un prompt contra el mismo modelo que utiliza la tubería Assist, ajusta el prompt del sistema y luego actualiza Home Assistant. El soporte multiusuario con roles mantiene a la familia fuera de la consola de administrador.
Donde falla: Es una UI de chat, no parte de la ruta de automatización en sí. La configuración requiere un volumen persistente y un proxy inverso para acceso LAN o Tailscale.
Precio:
- Gratis: open source bajo MIT
- De pago: ninguno
Plataformas: Linux, macOS, Windows (Docker)
Descargar: openwebui.com
Conclusión: Elige Open WebUI como el chat orientado al usuario sobre cualquier runtime en el que te instales.
5. Home Assistant — el mejor consumidor del punto de acceso
Home Assistant’s integración Assist LLM es lo que convierte “encender la luz de la cocina” en una llamada de función. Apunta a Ollama, LocalAI, LM Studio o cualquier punto de acceso compatible con OpenAI, marca “expose to Assist” en las entidades que deseas que controle el modelo y la voz se ejecuta completamente en la LAN. El template del prompt es editable, que es cómo impides que el modelo alucine cuartos.
Donde falla: La calidad de las llamadas de función depende del modelo, y Home Assistant no te dirá cuándo el modelo devuelve un ID de entidad plausible pero incorrecto. La depuración vive en el panel de depuración de Assist y lleva tiempo dominar.
Precio:
- Gratis: open source
- De pago: Cloud Nabu Casa opcional, no requerido para voz local
Plataformas: Windows, macOS, Linux (HAOS, Docker, VM)
Descargar: home-assistant.io
Conclusión: Elige Home Assistant porque el LLM solo es interesante si algo actúa sobre su salida, y esto es lo que actúa.
6. vLLM — mejor si el NAS tiene una GPU real
vLLM es el runtime enfocado en rendimiento. El batching continuo, la atención paginada y una cola de solicitudes múltiples adecuada convierten una pequeña tarjeta NVIDIA en un punto de acceso a escala familiar que puede servir solicitudes de voz, una pestaña Open WebUI y un plugin Obsidian al mismo tiempo sin que uno bloquee el otro.
Donde falla: Solo GPU, así que un NAS solo CPU queda fuera. La compatibilidad del modelo es más estrecha que la de Ollama y agregar una nueva arquitectura es un paso de compilación.
Precio:
- Gratis: open source bajo Apache 2.0
- De pago: ninguno
Plataformas: Linux (Docker)
Descargar: github.com/vllm-project/vllm
Conclusión: Elige vLLM si el NAS tiene una tarjeta NVIDIA compatible y varios miembros de la familia presionarán el modelo simultáneamente.
7. llama.cpp — el mejor ejecutor bare-metal para hardware limitado
llama.cpp es el proyecto C++ que potencia la mayoría de los runtimes anteriores. Ejecutarlo directamente, con el servidor HTTP integrado, es la forma más eficiente de exprimir un modelo 7B a un Synology o a una vieja caja ARM. El soporte para Metal en Apple Silicon y CUDA en NVIDIA permite a un binario cubrir la mayoría de los setups domésticos.
Donde falla: Sin gestión de modelos, sin actualizaciones automáticas, sin scripts de servicio fuera de la caja. Es un conjunto de herramientas, no un producto.
Precio:
- Gratis: open source bajo MIT
- De pago: ninguno
Plataformas: Linux, macOS, Windows (source, binario o Docker)
Descargar: github.com/ggerganov/llama.cpp
Conclusión: Elige llama.cpp si el NAS es pequeño, el SO es inusual y deseas la menor abstracción posible sobre el archivo del modelo.
Cómo elegir
Si estás empezando desde cero, instala Ollama en el NAS y apunta Home Assistant a él.
Si el stack de voz necesita STT y TTS en la misma caja, reemplaza Ollama con LocalAI y descarga las imágenes de Whisper y Piper.
Si quieres una interfaz para comparar modelos antes de comprometerte, instala LM Studio y usa su modo servidor.
Si la familia quiere chatear con el mismo modelo que ejecuta las automatizaciones, agrega Open WebUI encima.
Si el NAS tiene una GPU NVIDIA y más de un usuario pesado, cambia a vLLM para concurrencia.
Si el hardware es inusualmente pequeño y cada megabyte importa, ejecuta llama.cpp directamente.
Preguntas frecuentes
¿Puedo realmente ejecutar un modelo útil en un NAS?
Sí. Un modelo 7B Q4 en llama.cpp en una CPU de ocho núcleos moderna genera a velocidad legible para respuestas de comandos de voz cortos. Si el NAS tiene 16 GB de RAM y caché NVMe, el modelo se carga en segundos después de un arranque en caliente. Para chats largos o razonamiento, agrega una GPU.
¿Qué modelo maneja mejor las llamadas de función de Home Assistant?
Qwen 2.5 Instruct, Llama 3.1 8B Instruct y Hermes-3-Llama son las opciones locales confiables en el tamaño 7B-8B. Por debajo de 7B, el formato de llamadas de función comienza a fallar. Prueba con el panel de depuración de Assist en un puñado de comandos realistas antes de comprometerte.
¿Ve el modelo todo el estado de mi casa?
Solo las entidades que expones explícitamente a Assist. El toggle de exposición es por entidad, así que una luz en la oficina no tiene que filtrarse en el contexto del modelo. Mantén el conjunto expuesto pequeño; el prompt es más económico y el modelo comete menos errores.
¿Qué sucede cuando se cae internet?
Nada cambia. STT, LLM y TTS todos se ejecutan en el NAS, así que el control por voz sigue funcionando. La única ruta que necesita WAN es el acceso remoto, y tanto Cloud Nabu Casa como una VPN autohospedada lo arreglan por separado.