Mejores aplicaciones para control de voz híbrido con Home Assistant en 2026

Un escritor de XDA conectó un LLM local a Home Assistant para control de voz, luego lo apagó para la mayoría de lo que dijeron. Los comandos de palabras clave manejan “enciende las luces de la cocina” más rápido y nunca fallan, por lo que el LLM solo se ejecuta cuando una solicitud es genuinamente abierta. Esa división es la configuración sensata para una casa llena de comandos de voz, y se alinea con cómo funciona Assist en sí: intenciones primero, LLM como alternativa. Estas son las mejores aplicaciones para control de voz híbrido con Home Assistant en escritorio, las piezas que hacen que el camino rápido sea rápido y mantienen el LLM listo cuando una palabra clave no puede cubrir la solicitud.

Probamos ocho herramientas en instalaciones de Home Assistant OS, Home Assistant Container y Supervised en Linux, Windows y macOS. Cada opción funciona con el Protocolo Wyoming para que las piezas se intercambien limpiamente. Los criterios de evaluación: qué tan rápido se resuelve la ruta de palabras clave, si el LLM puede invocarse por nombre o en caso de fallo, y si toda la pila se mantiene local cuando internet cae.

Qué buscar en una configuración de voz híbrida

Comparación rápida

Aplicación Mejor para Plataformas Plan gratuito Nivel de pago Calificación
Home Assistant Assist Tubería de voz híbrida predeterminada Linux, Windows, macOS Completamente gratis Ninguno 4.7
Rhasspy Voz offline completamente enfocada en palabras clave Linux, Windows, macOS, Docker Completamente gratis Ninguno 4.6
Wyoming Satellite Convertir una Pi o portátil viejo en micrófono de sala Linux Completamente gratis Ninguno 4.7
Ollama Conversation El respaldo de LLM que funciona en tu caja Linux, Windows, macOS Completamente gratis Ninguno 4.8
Whisper (Wyoming) Voz a texto local que puede seguir el ritmo Linux, Windows, macOS Completamente gratis Ninguno 4.7
Piper (Wyoming) Síntesis de texto a voz local natural Linux, Windows, macOS Completamente gratis Ninguno 4.7
OpenWakeWord Palabras de activación personalizadas sin entrenamiento en la nube Linux, Windows, macOS Completamente gratis Ninguno 4.5
Willow Firmware de satélite de voz construido a propósito Linux, ESP32-S3 Completamente gratis Ninguno 4.6

Las aplicaciones

1. Home Assistant Assist para voz híbrida — Mejor tubería predeterminada

Home Assistant Assist es el motor de voz incorporado, y desde la remodelación de 2024 ya ejecuta el patrón híbrido desde la caja. Una solicitud golpea primero un coincidor de intenciones rápido, por lo que “apaga el ventilador” se resuelve en milisegundos sin un LLM. Cualquier cosa que el coincidor no pueda analizar cae en el agente de conversación configurado, donde se conectan Ollama u OpenAI. Assist también posee el enrutamiento de STT y TTS, por lo que la tubería es una pantalla en lugar de cinco.

Dónde falla: La sintaxis de intención todavía confunde a la gente. Las frases complejas necesitan un disparador de oración o una intención personalizada, que es más trabajo que editar una automatización.

Precios:

Plataformas: Cualquier instalación de Home Assistant (Linux, Windows a través de Docker, macOS a través de Docker).

Descargar: home-assistant.io/voice-pe · github.com/home-assistant/core

Conclusión: Comienza aquí. Todas las demás opciones a continuación extienden o reemplazan una pieza de Assist, no todo.

2. Rhasspy para voz híbrida — Mejor pila offline enfocada en palabras clave

Rhasspy es anterior a Assist y sigue siendo válido cuando la prioridad es cero llamadas a la nube. Resuelve comandos de un archivo de plantilla de oración fija, lo que hace que la capa de palabras clave sea tanto rápida como predecible. Rhasspy 3 habla Protocolo Wyoming, por lo que su STT y motor de intención se ajustan a Home Assistant como el camino rápido, con un agente de conversación Ollama como respaldo de LLM en Assist.

Dónde falla: La sintaxis de plantilla se siente anticuada junto a las intenciones de Assist. Y la UI es funcional, no amigable.

Precios:

Plataformas: Linux, Windows, macOS. Funciona bien en Docker en una Pi 4 o mejor.

Descargar: rhasspy.readthedocs.io · github.com/rhasspy/rhasspy3

Conclusión: Elige Rhasspy si el objetivo es una sala que responda incluso cuando la WAN se cae durante una semana.

3. Wyoming Satellite para voz híbrida — Mejor micrófono de sala DIY

Wyoming Satellite convierte un portátil antiguo, una Raspberry Pi o una mini PC en un punto final de voz que Home Assistant trata como un satélite de primera clase. La detección de activación se ejecuta en el satélite, el audio se envía al servidor para STT y TTS regresa. Esa división permite que una Pi de $35 sea el micrófono mientras que una máquina más grande ejecuta Whisper y el LLM, que es la configuración que mantiene el patrón híbrido rápido.

Dónde falla: La configuración es un servicio systemd y un archivo de configuración, no un asistente. Los satélites alimentados por batería necesitan trabajo adicional.

Precios:

Plataformas: Linux (Debian, Ubuntu, Raspberry Pi OS).

Descargar: github.com/rhasspy/wyoming-satellite

Conclusión: Úsalo para dispersar micrófonos por la casa sin comprar ocho de lo mismo.

4. Ollama Conversation para voz híbrida — Mejor respaldo de LLM local

Ollama Conversation es la integración que permite a Assist pasar una solicitud a un modelo Ollama local cuando el coincidor de intención se rinde. Llama 3 8B, Qwen 2.5 7B o un Phi-3 más pequeño sirven bien como el cerebro de respaldo. El LLM ve las entidades expuestas como herramientas, por lo que puede llamar a métodos de servicio cuando la solicitud tiene estructura y responder conversacionalmente cuando no la tiene.

Dónde falla: La primera ejecución de un modelo frío puede tomar un segundo en una GPU modesta. El almacenamiento en caché de indicaciones ayuda, pero un modo de espera en caliente es una decisión de GPU real.

Precios:

Plataformas: Linux, Windows, macOS.

Descargar: ollama.com · github.com/home-assistant/core/tree/dev/homeassistant/components/ollama

Conclusión: El único backend de LLM a elegir cuando el punto es mantener todo el bucle de voz fuera de internet.

5. Whisper (Wyoming) para voz híbrida — Mejor voz a texto local

Whisper con el envoltorio Wyoming es el motor STT en el que terminan la mayoría de las configuraciones híbridas. Los modelos small.en y base.en son lo suficientemente rápidos en CPU para una casa con unos pocos satélites, y medium.en en una GPU modesta mantiene el ritmo con una familia hablándose entre sí. Whisper lee bien la intención, por lo que el camino rápido de palabras clave aterriza más a menudo que con motores más antiguos.

Dónde falla: La elección del modelo importa. El modelo diminuto falla en nombres y comandos cortos. Base o small es el piso para una configuración real.

Precios:

Plataformas: Linux, Windows, macOS. La imagen de Docker se ejecuta en ARM y x86.

Descargar: github.com/rhasspy/wyoming-faster-whisper

Conclusión: El STT predeterminado para cualquiera que quiera escuchar “luces apagadas” la primera vez.

6. Piper (Wyoming) para voz híbrida — Mejor síntesis de voz local

Piper es el motor TTS neural que hizo que la voz local sonara como un asistente real en lugar de una unidad GPS de una década de antigüedad. Las voces son pequeñas (unos pocos decenas de megabytes cada una), la inferencia solo en CPU es rápida, y el catálogo cubre docenas de idiomas. Piper maneja tanto confirmaciones cortas (“está bien”) como respuestas de LLM más largas sin un retraso entre ellas.

Dónde falla: Algunas voces suenan delgadas al lado de TTS en la nube. La clonación de voz se mantiene fuera del alcance, lo que conviene a la mayoría de los hogares.

Precios:

Plataformas: Linux, Windows, macOS.

Descargar: github.com/rhasspy/piper

Conclusión: El TTS correcto para una pila híbrida donde el hogar escucha la salida todo el día.

7. OpenWakeWord para voz híbrida — Mejor palabra de activación personalizada

OpenWakeWord entrena una palabra de activación sin enviar audio a ningún lado. Eso importa para las configuraciones híbridas porque una mala palabra de activación es lo que rompe la ilusión enfocada en palabras clave: una activación falsa envía el habla real a STT, luego a LLM, y el hogar escucha el ventilador girar. OpenWakeWord viene con varios modelos listos y un notebook de Colab para uno nuevo.

Dónde falla: Una palabra personalizada de calidad necesita algunos miles de muestras generadas. “Alexa”, “Hey Jarvis” y “Hey Rhasspy” preentrenados son las opciones de bajo esfuerzo.

Precios:

Plataformas: Linux, Windows, macOS.

Descargar: github.com/dscripka/openWakeWord

Conclusión: La opción correcta cuando el nombre del hogar no es una de las palabras de activación preentrenadas.

8. Willow para voz híbrida — Mejor firmware de satélite construido a propósito

Willow es un firmware de satélite de voz para ESP32-S3-BOX y placas de desarrollo similares, y trata Home Assistant Assist como un backend de primera clase. La detección de activación en dispositivo significa que ningún tráfico sale del dispositivo hasta que te escucha, y todo el viaje es lo suficientemente rápido como para que los comandos de palabras clave se sientan instantáneos. El Servidor de Inferencia de Willow también puede alojar Whisper y LLM si la carga de trabajo debe residir en una caja.

Dónde falla: El hardware es un grupo pequeño. El suministro de ESP32-S3-BOX viene y va.

Precios:

Plataformas: Linux (para el Servidor de Inferencia), ESP32-S3-BOX y hardware compatible.

Descargar: heywillow.io · github.com/toverainc/willow

Conclusión: Usa Willow cuando los satélites necesiten ser pequeños, silenciosos y siempre escuchando sin una PC en la sala.

Cómo elegir el correcto

FAQ

¿Cuál es el mejor LLM local para el control de voz de Home Assistant?
Tanto Llama 3 8B como Qwen 2.5 7B funcionan bien cuando se combinan con el envoltorio de llamada de herramientas que expone Assist. Los modelos Phi-3 más pequeños funcionan en cajas solo en CPU pero pierden más llamadas de servicio. El modelo correcto es el más grande que mantiene una solicitud por debajo de dos segundos en tu GPU.

¿Puedo usar control de voz de Home Assistant sin conexión a internet?
Sí. Whisper, Piper, Ollama y Assist todos se ejecutan localmente, y Wyoming Satellite lleva audio por la LAN. La pila sobrevive a una interrupción de internet siempre que el servidor y los satélites estén en la misma red.

¿Necesito una GPU para ejecutar un LLM local para el control de voz de Home Assistant?
No para modelos más pequeños. Un modelo 7B cuantizado a Q4 se ejecuta en CPU moderno o GPU de rango medio. Una GPU es lo que mantiene el tiempo de respuesta por debajo de un segundo, lo que hace que la voz se sienta en tiempo real.

¿Cómo hago que Home Assistant Assist use palabras clave primero y el LLM solo como respaldo?
Assist ya lo hace. En Configuración, establece el agente de Conversación de la tubería en un LLM. Las intenciones se ejecutan primero, y solo las solicitudes no coincidentes llegan al LLM. Las oraciones personalizadas en intents.yaml agregan más cobertura de palabras clave.

¿Cuál es la diferencia entre Rhasspy y Home Assistant Assist?
Rhasspy es el motor más antiguo, basado en plantillas, enfocado en palabras clave que se ejecuta de forma independiente o como proveedor de STT/intención de Assist. Assist es la integración más nueva y más cerrada construida en Home Assistant con respaldo de LLM incorporado. La mayoría de las configuraciones de 2026 usan Assist y toman ideas prestadas de Rhasspy.