Home Assistant

XDA-Developers analizó esta semana un imán de frigorífico con ESP32 de $50 que graba notas de voz sin enviarlas a un servicio en la nube. Es la misma historia que seguimos escuchando de aficionados a la tecnología y hogares que valoran la privacidad: los asistentes de voz modernos son útiles, pero enviar cada comando a la nube de grandes tecnológicas es un mal acuerdo. Lo bueno es que un asistente de voz privado completo con IA ahora funciona en hardware de clase escritorio. A continuación hay siete aplicaciones que lo hacen realidad.

Elegimos aplicaciones que se instalan en tu máquina, mantienen transcripciones locales y cubren el flujo completo: detección de palabra de activación, conversión de voz a texto, procesamiento de intenciones, respuesta y síntesis de voz.

Qué buscar en una pila de asistente de voz privada

Un asistente privado que funcione necesita resolver cinco problemas a la vez:

Las aplicaciones a continuación cubren las cinco, a veces en combinación.

Las aplicaciones

1. Home Assistant, lo mejor para una pila completa de asistente privado

Home Assistant comenzó como un centro de automatización del hogar y creció para obtener un asistente de voz de primera clase este año. Su función Assist une Whisper para conversión de voz a texto, Piper para síntesis de voz y un motor de procesamiento de intenciones. Añade un LLM local (vía Ollama) y tienes un asistente de voz completamente offline con capacidad de diálogo.

Dónde falla: La configuración requiere paciencia. La instalación de Home Assistant OS es sencilla, pero los complementos de voz necesitan configuración para micrófonos, palabras de activación y voces de respuesta.

Precio:

Plataformas: Windows, macOS, Linux (Home Assistant OS se envía en Raspberry Pi y mini PCs x86)

Descargar: Home Assistant | GitHub

Conclusión: El mejor pegamento que mantiene unido un asistente de voz privado. Todo lo siguiente se conecta con él.

2. Willow, lo mejor para interfaces de voz basadas en hardware

Willow es un asistente de voz de código abierto propósito-específico que funciona en placas ESP32-S3 (como ESP32-BOX-3) y transmite audio a un servidor de inferencia local en tu PC o NAS. Maneja detección de palabra de activación, conversión de voz a texto y reenvío de intenciones a Home Assistant, MQTT o un punto de acceso REST.

Dónde falla: Requiere hardware dedicado. No es una solución “instala esto en mi portátil”, más bien un proyecto “construye el puck”.

Precio:

Plataformas: El servidor funciona en Linux; los clientes son placas ESP32

Descargar: Willow GitHub | Willow Application Server

Conclusión: La respuesta correcta si quieres pucks de voz físicos alrededor de la casa, no solo un micrófono de portátil.

3. Rhasspy, lo mejor para experimentos offline-primero

Rhasspy es el veterano de los asistentes de voz locales. Diseñado de forma modular, te permite intercambiar cualquier motor de palabra de activación, cualquier modelo de conversión de voz a texto, cualquier procesador de intenciones y cualquier voz de síntesis. Su reconocimiento de intenciones soporta plantillas de oraciones offline, así que los comandos simples funcionan sin un LLM.

Dónde falla: El ritmo de desarrollo se ha ralentizado desde que Home Assistant absorbió al mantenedor. Aún funciona, pero la ayuda de la comunidad es más escasa que antes.

Precio:

Plataformas: Windows, macOS, Linux (Docker recomendado)

Descargar: Rhasspy Docs | GitHub

Conclusión: Usa si quieres el máximo control en cada etapa. Los nuevos usuarios deberían empezar con Home Assistant Assist.

4. Whisper.cpp, lo mejor para conversión de voz a texto local

Whisper.cpp es un puerto en C++ del modelo Whisper de OpenAI optimizado para inferencia en CPU. Es el motor de transcripción en el que se basan la mayoría de pilas de voz privada. Los tamaños de modelo van desde tiny (~40 MB) hasta large-v3 (~3 GB) te permiten intercambiar precisión por latencia.

Dónde falla: No es un asistente completo, solo la pieza de transcripción. Necesita envoltorios de palabra de activación, intención y respuesta alrededor.

Precio:

Plataformas: Windows, macOS, Linux (funciona en Raspberry Pi 4 con modelos pequeños)

Descargar: Whisper.cpp GitHub | OpenAI Whisper model card

Conclusión: El estándar de conversión de voz a texto. Cada pila a continuación lo usa o algo similar bajo el capó.

5. Piper, lo mejor para síntesis de voz local

Piper es el motor de síntesis de voz neural de Home Assistant, lo suficientemente pequeño para funcionar en una Raspberry Pi y lo suficientemente bueno para sonar natural. Los paquetes de voz cubren 40+ idiomas y decenas de acentos.

Dónde falla: No alcanza el nivel de expresividad de Eleven Labs. Bien para respuestas del asistente, no para narración de audiolibros.

Precio:

Plataformas: Windows, macOS, Linux, Raspberry Pi

Descargar: Piper GitHub | Voice samples

Conclusión: El motor TTS local predeterminado. Se envía como complemento de Home Assistant.

6. Ollama, lo mejor para el cerebro del LLM

Ollama ejecuta modelos de lenguaje de peso abierto localmente con una instalación de una línea. Apunta Home Assistant Assist o cualquier pila de voz al punto de acceso de API de Ollama y tu asistente puede responder preguntas abiertas, resumir tu bandeja de entrada o razonar sobre el estado de tu hogar inteligente.

Dónde falla: La latencia de respuesta depende del tamaño del modelo y del hardware. Una respuesta Llama 3.1 8B toma segundos en CPU, sub-segundo en una GPU moderna.

Precio:

Plataformas: Windows, macOS, Linux

Descargar: Ollama Site | Ollama Library

Conclusión: Instala Ollama cuando quieras que tu asistente piense, no solo ejecute comandos.

7. OpenWakeWord, lo mejor para palabras de activación personalizadas

OpenWakeWord entrena un modelo de palabra de activación en el navegador a partir de algunos ejemplos de audio. Di “computadora” en serio, o inventa un nombre que no haya sido ya tomado por cada asistente big-tech en el mercado.

Dónde falla: Los modelos personalizados necesitan suficientes muestras de entrenamiento para evitar falsos positivos. Espera una noche de afinación.

Precio:

Plataformas: Se ejecuta en cualquier lugar donde Python y TensorFlow se ejecuten

Descargar: OpenWakeWord GitHub | Community wake words

Conclusión: La manera de escapar de “Alexa” y “Hey Google” para siempre.

Cómo elegir el correcto

Comienza con Home Assistant más Whisper.cpp y Piper. Esa es la pila de asistente privado de referencia en 2026.

Añade Ollama cuando quieras respuestas conversacionales en lugar de intenciones programadas.

Usa Willow si quieres pucks de voz físicos (imán de frigorífico, puck de cocina, mesita de noche) en lugar de solo hablar a tu portátil.

Usa Rhasspy si ya conoces los componentes y quieres control máximo. Sáltalo si eres nuevo; Home Assistant Assist es ahora más amigable para principiantes.

Toma OpenWakeWord en el momento en que “Nabu” o “Jarvis” te moleste.

Preguntas Frecuentes

¿Puede un asistente de voz privado con IA igualar la velocidad de Alexa? En un PC de escritorio moderno o Mac mini, Whisper.cpp con el modelo pequeño transcribe en tiempo real y Piper responde en menos de un segundo. Es competitivo.

¿Cuánta energía usa una pila de voz local? Una Raspberry Pi 4 maneja la escucha de palabra de activación e intenciones básicas en un par de vatios. Añadir un LLM local vía Ollama la requiere un NUC pequeño o una estación de trabajo.

¿Necesito internet en absoluto? No. Whisper, Piper, Ollama, Home Assistant y Rhasspy se ejecutan completamente offline. Solo los complementos en la nube opcionales necesitan conectividad.

¿Cuál es el mejor hardware para un asistente de voz privado en 2026? Un mini PC Ryzen (clase AMD Strix Halo) o Mac mini con silicio Apple para asistentes respaldados por LLM. Raspberry Pi 5 funciona bien para configuraciones solo de intenciones.

¿Puedo ejecutar esto en mi instalación existente de Home Assistant? Sí. Home Assistant Assist es una característica de primera parte. Añade los complementos Whisper, Piper y (opcionalmente) Ollama de la tienda, conéctalos en la configuración Voice Assistants, y listo.