Las mejores apps para un LLM de hogar inteligente local en NAS en 2026

El artículo de XDA de la semana pasada terminó donde termina cada hilo de home-lab: solo uno de los siete LLM locales funcionó como el cerebro de un hogar inteligente cuando las automatizaciones se volvieron interesantes. El resto alucinaba en llamadas de función, perdía la intención de “apagar la luz del porche” o se calentaba tanto que los ventiladores del NAS giraban durante horas. Un modelo local en un NAS es una respuesta legítima al control por voz, pero la elección del runtime importa más que la elección del modelo.

Probamos 7 aplicaciones de escritorio que se ejecutan en un NAS doméstico o una mini PC en la misma LAN, exponen un punto de acceso compatible con OpenAI e integran limpiamente con la tubería de voz basada en LLM de Home Assistant. Todo lo siguiente se ejecuta sin conexión una vez que se descargan los pesos, y todo tiene una imagen Docker documentada.

Qué buscar

Comparativa rápida

App Mejor para Plataformas Plan gratuito Característica destacada
Ollama El ejecutor por defecto que la mayoría de guías de Home Assistant buscan Linux, macOS, Windows Sí (open source) Catálogo de modelos y un punto de acceso estable compatible con OpenAI
LocalAI Solución todo en uno como reemplazo para APIs de OpenAI, incluyendo audio Linux, macOS, Windows (Docker) Sí (open source) Maneja chat, embeddings, TTS y STT desde un contenedor
LM Studio GUI en el host del NAS y servidor para la LAN Windows, macOS, Linux Descubrimiento de modelos y toggle de servidor de un clic
Open WebUI Frontend de chat web que también se conecta con Home Assistant Linux, macOS, Windows (Docker) Sí (open source) Chat multiusuario con Ollama, LocalAI o cualquier backend compatible con OpenAI
Home Assistant El consumidor del punto de acceso Windows, macOS, Linux (HAOS, Docker) Integración nativa de Assist LLM con enrutamiento de llamadas de función
vLLM Mejor rendimiento en un NAS con GPU Linux (Docker) Sí (open source) Batching continuo y atención paginada para uso multiusuario
llama.cpp El ejecutor bare-metal en C++ detrás de la mayoría de los anteriores Linux, macOS, Windows Sí (open source) Ejecuta GGUF en CPU en casi cualquier hardware

Las 7 mejores apps para un LLM de hogar inteligente local en NAS

1. Ollama — el mejor ejecutor por defecto al que apuntan la mayoría de guías

Ollama envuelve llama.cpp con una CLI limpia, una biblioteca de modelos y un servidor HTTP compatible con OpenAI que la integración Assist LLM de Home Assistant reconoce directamente. Instala en el NAS, ejecuta ollama pull qwen2.5:7b-instruct y apunta Home Assistant a http://<nas-ip>:11434. El gestor de servicios lo mantiene en funcionamiento a través de reinicios.

Donde falla: La concurrencia multiusuario es de carril único; las solicitudes paralelas se colan en lugar de agruparse. El soporte de Windows llegó recientemente y se queda atrás de Linux en estabilidad.

Precio:

Plataformas: Linux, macOS, Windows (nativo y Docker)

Descargar: ollama.com

Conclusión: Elige Ollama primero, y solo vete cuando una limitación específica te empuje a hacerlo.


2. LocalAI — mejor si quieres chat, voz y embeddings desde un contenedor

LocalAI es la solución que cubre toda la superficie de OpenAI: completaciones de chat, embeddings, TTS, STT y generación de imágenes, todo localmente. El protocolo Wyoming de Home Assistant puede apuntar al punto de acceso Whisper de LocalAI para STT y Piper para TTS, lo que significa que todo el bucle de voz vive en el NAS.

Donde falla: El archivo de configuración es denso y requiere una primera lectura. Las rutas de aceleración GPU (CUDA, ROCm, Vulkan) son por compilación y elegir la imagen incorrecta da un fallback silencioso a CPU.

Precio:

Plataformas: Linux, macOS, Windows (Docker)

Descargar: localai.io

Conclusión: Elige LocalAI si el objetivo es un stack de voz autónomo con STT, TTS y chat todo en uno.


3. LM Studio — mejor cuando una interfaz más amigable importa

LM Studio comenzó como una aplicación de chat de escritorio y creció en modo servidor headless. En un NAS con pantalla o sesión KVM remota, el selector de modelos y el selector de cuantización son más tolerantes que una CLI pura. El servidor integrado expone el punto de acceso compatible con OpenAI que Home Assistant espera.

Donde falla: La aplicación principal es de código cerrado, que es un no rotundo para algunos setups de home-lab. El modo headless está disponible pero sigue siendo un ciudadano de segunda clase.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: lmstudio.ai

Conclusión: Elige LM Studio si quieres una interfaz para probar modelos antes de asignar uno al rol de hogar inteligente.


4. Open WebUI — el mejor frontend de chat que mantiene a los humanos en el bucle

Open WebUI es el frontend basado en navegador estilo ChatGPT que se ejecuta contra Ollama, LocalAI o cualquier punto de acceso compatible con OpenAI. En un NAS, funciona como una superficie de prueba: ejecuta un prompt contra el mismo modelo que utiliza la tubería Assist, ajusta el prompt del sistema y luego actualiza Home Assistant. El soporte multiusuario con roles mantiene a la familia fuera de la consola de administrador.

Donde falla: Es una UI de chat, no parte de la ruta de automatización en sí. La configuración requiere un volumen persistente y un proxy inverso para acceso LAN o Tailscale.

Precio:

Plataformas: Linux, macOS, Windows (Docker)

Descargar: openwebui.com

Conclusión: Elige Open WebUI como el chat orientado al usuario sobre cualquier runtime en el que te instales.


5. Home Assistant — el mejor consumidor del punto de acceso

Home Assistant’s integración Assist LLM es lo que convierte “encender la luz de la cocina” en una llamada de función. Apunta a Ollama, LocalAI, LM Studio o cualquier punto de acceso compatible con OpenAI, marca “expose to Assist” en las entidades que deseas que controle el modelo y la voz se ejecuta completamente en la LAN. El template del prompt es editable, que es cómo impides que el modelo alucine cuartos.

Donde falla: La calidad de las llamadas de función depende del modelo, y Home Assistant no te dirá cuándo el modelo devuelve un ID de entidad plausible pero incorrecto. La depuración vive en el panel de depuración de Assist y lleva tiempo dominar.

Precio:

Plataformas: Windows, macOS, Linux (HAOS, Docker, VM)

Descargar: home-assistant.io

Conclusión: Elige Home Assistant porque el LLM solo es interesante si algo actúa sobre su salida, y esto es lo que actúa.


6. vLLM — mejor si el NAS tiene una GPU real

vLLM es el runtime enfocado en rendimiento. El batching continuo, la atención paginada y una cola de solicitudes múltiples adecuada convierten una pequeña tarjeta NVIDIA en un punto de acceso a escala familiar que puede servir solicitudes de voz, una pestaña Open WebUI y un plugin Obsidian al mismo tiempo sin que uno bloquee el otro.

Donde falla: Solo GPU, así que un NAS solo CPU queda fuera. La compatibilidad del modelo es más estrecha que la de Ollama y agregar una nueva arquitectura es un paso de compilación.

Precio:

Plataformas: Linux (Docker)

Descargar: github.com/vllm-project/vllm

Conclusión: Elige vLLM si el NAS tiene una tarjeta NVIDIA compatible y varios miembros de la familia presionarán el modelo simultáneamente.


7. llama.cpp — el mejor ejecutor bare-metal para hardware limitado

llama.cpp es el proyecto C++ que potencia la mayoría de los runtimes anteriores. Ejecutarlo directamente, con el servidor HTTP integrado, es la forma más eficiente de exprimir un modelo 7B a un Synology o a una vieja caja ARM. El soporte para Metal en Apple Silicon y CUDA en NVIDIA permite a un binario cubrir la mayoría de los setups domésticos.

Donde falla: Sin gestión de modelos, sin actualizaciones automáticas, sin scripts de servicio fuera de la caja. Es un conjunto de herramientas, no un producto.

Precio:

Plataformas: Linux, macOS, Windows (source, binario o Docker)

Descargar: github.com/ggerganov/llama.cpp

Conclusión: Elige llama.cpp si el NAS es pequeño, el SO es inusual y deseas la menor abstracción posible sobre el archivo del modelo.

Cómo elegir

Si estás empezando desde cero, instala Ollama en el NAS y apunta Home Assistant a él.

Si el stack de voz necesita STT y TTS en la misma caja, reemplaza Ollama con LocalAI y descarga las imágenes de Whisper y Piper.

Si quieres una interfaz para comparar modelos antes de comprometerte, instala LM Studio y usa su modo servidor.

Si la familia quiere chatear con el mismo modelo que ejecuta las automatizaciones, agrega Open WebUI encima.

Si el NAS tiene una GPU NVIDIA y más de un usuario pesado, cambia a vLLM para concurrencia.

Si el hardware es inusualmente pequeño y cada megabyte importa, ejecuta llama.cpp directamente.

Preguntas frecuentes

¿Puedo realmente ejecutar un modelo útil en un NAS?

Sí. Un modelo 7B Q4 en llama.cpp en una CPU de ocho núcleos moderna genera a velocidad legible para respuestas de comandos de voz cortos. Si el NAS tiene 16 GB de RAM y caché NVMe, el modelo se carga en segundos después de un arranque en caliente. Para chats largos o razonamiento, agrega una GPU.

¿Qué modelo maneja mejor las llamadas de función de Home Assistant?

Qwen 2.5 Instruct, Llama 3.1 8B Instruct y Hermes-3-Llama son las opciones locales confiables en el tamaño 7B-8B. Por debajo de 7B, el formato de llamadas de función comienza a fallar. Prueba con el panel de depuración de Assist en un puñado de comandos realistas antes de comprometerte.

¿Ve el modelo todo el estado de mi casa?

Solo las entidades que expones explícitamente a Assist. El toggle de exposición es por entidad, así que una luz en la oficina no tiene que filtrarse en el contexto del modelo. Mantén el conjunto expuesto pequeño; el prompt es más económico y el modelo comete menos errores.

¿Qué sucede cuando se cae internet?

Nada cambia. STT, LLM y TTS todos se ejecutan en el NAS, así que el control por voz sigue funcionando. La única ruta que necesita WAN es el acceso remoto, y tanto Cloud Nabu Casa como una VPN autohospedada lo arreglan por separado.