
Un artículo reciente de XDA señaló algo pequeño pero cierto sobre los hogares inteligentes autohospedados: todo lo demás tiene buenas opciones locales, excepto el altavoz. Nest de Google y Echo de Amazon se han convertido en el camino de menor resistencia para el control por voz, y todas las demás capas de la casa —luces, sensores, cámaras— tienen alternativas abiertas que claramente las superan. Las mejores aplicaciones para altavoces inteligentes autohospedados en escritorio cierran esa última brecha.
Probamos siete aplicaciones y stacks en Windows, macOS y Linux que añaden control por voz local, detección de palabra de activación y audio multisala a un hogar inteligente autohospedado. Cada una cubre una pieza diferente del pipeline “hey altavoz, haz algo”: palabra de activación, conversión de voz a texto, manejo de intenciones, conversión de texto a voz y reproducción multisala. Elige según la pieza que más necesitemos resolver.
Qué buscar en un stack de altavoz inteligente autohospedado
Un altavoz que reemplaza un Nest o un Echo tiene más piezas movibles que “instalar una aplicación”. Las aplicaciones que lo hacen bien comparten algunas propiedades:
- Privacidad de extremo a extremo: el procesamiento de audio ocurre en la LAN, sin llamadas a la nube inevitables, y todo es inspectable.
- Un pipeline separable. La palabra de activación, conversión de voz a texto, intención y conversión de texto a voz deben ser intercambiables para que podamos actualizar una sin rehacer el resto.
- Una buena detección de palabra de activación que resista falsos positivos en televisión y reproducción de música. Esta es la pieza en la que Google y Amazon gastaron más y donde los stacks de aficionados solían quedarse cortos.
- Integración con Home Assistant, la plataforma de hogar inteligente de código abierto de referencia en 2026, ya sea directamente o a través de un puente documentado.
- Audio multisala que esté sincronizado, no “lo suficientemente cerca”.
- Requisitos de hardware razonables. Cualquier cosa que necesite una GPU para la palabra de activación es un mal ajuste para un despliegue de altavoz distribuido.
Comparación rápida
| Aplicación | Lo mejor para | Plataformas | Plan gratuito | Precio inicial/mes | Calificación |
|---|---|---|---|---|---|
| Home Assistant Assist | Pipeline de voz de extremo a extremo vinculado a Home Assistant | Windows, macOS, Linux, Docker | Completamente gratis, código abierto | Gratis (la nube de Nabu Casa es opcional) | 4.8 / 5 |
| Rhasspy 3 | Kit de herramientas de asistente de voz modular | Linux, Docker | Completamente gratis, código abierto | Gratis | Referencia de comunidad |
| Willow | Hardware basado en ESP32 más servidor para voz local barata | Servidor Linux + dispositivo ESP32 | Completamente gratis, código abierto | Gratis | GitHub |
| openWakeWord | Motor de palabra de activación personalizada que supera a los comerciales | Windows, macOS, Linux | Completamente gratis, código abierto | Gratis | GitHub |
| Snapcast | Servidor de audio multisala sincronizado | Windows, macOS, Linux, Android | Completamente gratis, código abierto | Gratis | 4.7 / 5 |
| Music Assistant | Servidor de biblioteca de música para Home Assistant | Linux, Docker | Completamente gratis, código abierto | Gratis | 4.6 / 5 |
| Mycroft OVOS | Bifurcación comunitaria de Mycroft con stack completo de asistente | Linux, Docker | Completamente gratis, código abierto | Gratis | Referencia de comunidad |
Piper TTS se incluye en la sección de cómo elegir como la mejor opción actual de voz para conversión de texto a voz.
Las aplicaciones
1. Home Assistant Assist
Home Assistant Assist es la capa de asistente que viene con Home Assistant, y en 2026 es el stack de altavoz inteligente de código abierto más completo. Assist agrupa la detección de palabra de activación (vía openWakeWord), conversión de voz a texto (vía Whisper), manejo de intenciones (nativo, extendido por cualquier complemento de HA) y conversión de texto a voz (vía Piper). Voice PE, el hardware Voice Preview Edition de Home Assistant, es el altavoz listo si no queremos conseguir hardware. Cualquier asistente de voz basado en ESP32 o un satélite con protocolo Wyoming también funciona.
Dónde se queda corto: la integración LLM de Assist para preguntas abiertas aún necesita configuración y un modelo en la nube o uno local. El motor de intención estándar es muy bueno en comandos de hogar inteligente y menos útil para consultas de conocimiento general.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: Nabu Casa Cloud es opcional y añade acceso remoto más STT/TTS en la nube
Plataformas: Windows, macOS, Linux, Docker (como host de HA)
Descargar: Home Assistant
Conclusión: la opción sensata por defecto para un altavoz inteligente autohospedado en 2026.
2. Rhasspy 3
Rhasspy 3 es un kit de herramientas de asistente de voz modular construido por el mantenedor que ahora trabaja en Home Assistant Assist. El diseño es un conjunto de etapas (entrada de audio, palabra de activación, STT, intención, TTS, salida de audio) que se conectan entre sí sobre un bus de eventos. Rhasspy se sitúa en el extremo “haz el nuestro” del espectro y recompensa a quien quiera control total sobre qué modelo ejecuta cada etapa.
Dónde se queda corto: el trabajo de configuración es real. Es más un kit de herramientas que un producto. La documentación ha mejorado en 2026 pero aún asume cierta comodidad en una terminal.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: sin nivel de pago
Plataformas: Linux, Docker
Descargar: Rhasspy 3
Conclusión: la opción para quien quiera componer el asistente por sí mismo.
3. Willow
Willow es un stack de hardware más servidor para control de voz local barato. El cliente se ejecuta en una placa de desarrollo ESP32-S3 con una pequeña matriz de micrófono, transmite audio a un servidor de inferencia Willow local (que se ejecuta en una caja x86 modesta con o sin GPU) e integra con Home Assistant, openHAB y MQTT de fábrica. Para un despliegue multisala distribuido, el costo por satélite de Willow es una fracción de un Nest Mini.
Dónde se queda corto: depende del hardware ESP32 que conseguimos nosotros mismos. El servidor de inferencia puede beneficiarse de una GPU, aunque los setupss solo con CPU funcionan.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: sin nivel de pago (Willow One es una oferta gestionada pagada, opcional)
Plataformas: Servidor Linux, cliente ESP32-S3
Descargar: Willow
Conclusión: la opción para un despliegue multisala de voz con presupuesto limitado que vive en la LAN.
4. openWakeWord
openWakeWord es el motor de palabra de activación que Home Assistant Assist, Rhasspy 3 y Mycroft OVOS usan en varias formas. Quien quiera una palabra de activación personalizada (“hey Jarvis”, “computer”, un nombre de familia) entrena un pequeño modelo con algunas docenas de muestras y lo deja caer en el pipeline. Los falsos positivos son menores que en los motores comerciales porque el modelo se entrena en nuestra palabra de activación específica en lugar de un clasificador general.
Dónde se queda corto: es una biblioteca en lugar de una aplicación, así que necesita ser conectada a un pipeline. Entrenar una buena palabra de activación personalizada toma una hora de recopilación de muestras.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: sin nivel de pago
Plataformas: Windows, macOS, Linux, embebido
Descargar: openWakeWord
Conclusión: la opción cuando queremos una palabra de activación personalizada que Google y Amazon no pueden ofrecer.
5. Snapcast
Snapcast es un servidor de audio multisala que mantiene cada altavoz en la LAN sincronizado dentro de unos pocos milisegundos. Apunta una fuente de música a Snapcast (Music Player Daemon, Spotifyd, un puente AirPlay, un cliente Squeezelite) y el audio se transmite a cada cliente Snapcast —una Raspberry Pi con un DAC, un teléfono, un PC Windows, una vieja tableta Android que ejecuta el cliente Snapcast. Para un hogar inteligente autohospedado, Snapcast es la pieza que permite que un comando de voz reproduzca música en cada sala.
Dónde se queda corto: el setup es un ejercicio de archivo de configuración. Los reemplazos modernos (Music Assistant, ecosistemas al estilo de HomePod) ocultan más de la plomería.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: sin nivel de pago
Plataformas: Windows, macOS, Linux, clientes Android, iOS
Descargar: Snapcast
Conclusión: la opción para audio multisala sincronizado sin suscripción.
6. Music Assistant
Music Assistant es un complemento de Home Assistant que unifica fuentes de música (Spotify Connect, Tidal, Qobuz, YouTube Music, Plex, archivos locales, SomaFM) en una sola cola y enruta la reproducción a cualquier reproductor multimedia de Home Assistant —satélites Snapcast, Google Cast, Sonos, AirPlay, un altavoz ESPHome. Es la capa que vincula “hey Assist, reproduce Radiohead en la cocina” a un motor de música real.
Dónde se queda corto: depende de Home Assistant. El uso independiente es posible pero el valor principal está dentro de HA. Algunas integraciones de fuente de streaming necesitan credenciales por usuario.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: sin nivel de pago
Plataformas: Linux (como complemento de HA), Docker
Descargar: Music Assistant
Conclusión: la opción para responder comandos de música activados por voz con fuentes de streaming reales.
7. Mycroft OVOS
Mycroft OVOS (OpenVoiceOS) es la bifurcación comunitaria de Mycroft que sobrevivió al cierre del proyecto original y ahora mantiene un stack completo de asistente: palabra de activación, STT, intención, TTS y un mercado de habilidades. OVOS se ejecuta en una Raspberry Pi, un Mycroft Mark II si tenemos uno, o una caja Linux estándar, y se fediera con Home Assistant a través de un puente documentado.
Dónde se queda corto: la comunidad es más pequeña que la de Home Assistant. Algunas habilidades son más antiguas y dependen de APIs que han cambiado.
Precios:
- Gratis: completamente gratis, código abierto
- Pagado: sin nivel de pago
Plataformas: Linux, Docker, Raspberry Pi
Descargar: OpenVoiceOS
Conclusión: la opción para un stack de asistente completo autónomo cuando Home Assistant Assist no tiene la forma correcta.
Cómo elegir el stack correcto de altavoz inteligente autohospedado
- Si ya ejecutamos Home Assistant: Home Assistant Assist con Voice PE o un satélite ESP32 es la opción sensata por defecto.
- Si queremos componer el asistente desde cero: Rhasspy 3.
- Si queremos el despliegue multisala más barato: Willow con clientes ESP32-S3 y un servidor de inferencia local.
- Si queremos una palabra de activación personalizada: openWakeWord, conectado a cualquiera que sea el pipeline que usemos.
- Si queremos reproducción de música sincronizada en cada sala: Snapcast.
- Si queremos un motor de música para reproducción activada por voz: Music Assistant.
- Si queremos un SO de asistente autónomo separado de Home Assistant: Mycroft OVOS.
Para la voz de conversión de texto a voz en sí, Piper TTS es la opción de código abierto mejor actual y la predeterminada en Home Assistant Assist. Ofrece voces neurales de alta calidad en muchos idiomas y se ejecuta en cualquier CPU modesto.
El setup inicial más fuerte de 2026 para la mayoría de las personas es Home Assistant Assist con openWakeWord, Whisper para STT, Piper para TTS, Music Assistant para reproducción y Snapcast para multisala. Esa combinación reemplaza una casa llena de altavoces Nest o Echo con un stack que vive completamente en la LAN.
Preguntas frecuentes
¿Puede un altavoz inteligente autohospedado reemplazar un Google Nest o Amazon Echo? Para comandos de hogar inteligente, sí. Para consultas abiertas ("¿quién fue Marie Curie?"), depende de si conectamos un LLM local (Ollama, LM Studio) o un modelo en la nube. La brecha en el control de hogar inteligente se ha cerrado; la brecha en el conocimiento general es una opción de configuración.
¿Funciona un altavoz inteligente autohospedado sin conexión? Sí. Home Assistant Assist con Whisper local, Piper y openWakeWord se ejecuta completamente sin conexión a Internet para comandos de hogar inteligente. Algunas habilidades (clima, noticias) aún necesitan acceso a Internet para alcanzar su fuente de datos.
¿Qué hardware necesito para un altavoz inteligente autohospedado? Lo mínimo es una Raspberry Pi 4 o 5 como servidor, un micrófono USB y cualquier altavoz alimentado. Para multisala, los satélites ESP32-S3 de Willow más un servidor de inferencia x86 modesto o dispositivos Voice PE de Home Assistant son las opciones actuales.
¿Es Home Assistant Assist gratis? Sí. Home Assistant Assist es completamente gratis y de código abierto. Nabu Casa Cloud es una suscripción pagada opcional que añade acceso remoto y STT/TTS en la nube como conveniencia; no es obligatorio.
¿Puedo usar mis altavoces de Google o Amazon con Home Assistant? Sí, como reproductores de multimedia. Home Assistant se integra con Google Cast y Alexa para reproducción y algunos controles, pero el asistente de voz en el dispositivo en sí aún se enruta a Google o Amazon. Para mover el asistente de Google o Amazon, necesitamos un altavoz autohospedado.
¿Qué motor de conversión de texto a voz suena mejor? Piper es la opción actual para TTS de código abierto en 2026. Ofrece una gama de voces neurales por idioma, se ejecuta rápido en CPU e integra directamente con Home Assistant Assist y Rhasspy 3.