XDA-Developers analizó esta semana un imán de frigorífico con ESP32 de $50 que graba notas de voz sin enviarlas a un servicio en la nube. Es la misma historia que seguimos escuchando de aficionados a la tecnología y hogares que valoran la privacidad: los asistentes de voz modernos son útiles, pero enviar cada comando a la nube de grandes tecnológicas es un mal acuerdo. Lo bueno es que un asistente de voz privado completo con IA ahora funciona en hardware de clase escritorio. A continuación hay siete aplicaciones que lo hacen realidad.
Elegimos aplicaciones que se instalan en tu máquina, mantienen transcripciones locales y cubren el flujo completo: detección de palabra de activación, conversión de voz a texto, procesamiento de intenciones, respuesta y síntesis de voz.
Qué buscar en una pila de asistente de voz privada
Un asistente privado que funcione necesita resolver cinco problemas a la vez:
- Detección de palabra de activación. Algo tiene que estar escuchando constantemente sin consumir mucha CPU.
- Conversión de voz a texto. Whisper es el estándar actual para transcripción local.
- Procesamiento de intenciones. Una vez que las palabras se transcriben, algo tiene que distinguir “enciende la luz de la cocina” de “activa un temporizador”.
- Modelo de lenguaje o respuesta programada. Para conversación abierta, un LLM local. Para automatización del hogar, un motor de reglas.
- Síntesis de voz. Una voz que responde.
Las aplicaciones a continuación cubren las cinco, a veces en combinación.
Las aplicaciones
1. Home Assistant, lo mejor para una pila completa de asistente privado
Home Assistant comenzó como un centro de automatización del hogar y creció para obtener un asistente de voz de primera clase este año. Su función Assist une Whisper para conversión de voz a texto, Piper para síntesis de voz y un motor de procesamiento de intenciones. Añade un LLM local (vía Ollama) y tienes un asistente de voz completamente offline con capacidad de diálogo.
Dónde falla: La configuración requiere paciencia. La instalación de Home Assistant OS es sencilla, pero los complementos de voz necesitan configuración para micrófonos, palabras de activación y voces de respuesta.
Precio:
- Gratis, Apache 2.0
- Suscripción opcional de Nabu Casa para acceso remoto ($6.50/mes) no es requerida para voz
Plataformas: Windows, macOS, Linux (Home Assistant OS se envía en Raspberry Pi y mini PCs x86)
Descargar: Home Assistant | GitHub
Conclusión: El mejor pegamento que mantiene unido un asistente de voz privado. Todo lo siguiente se conecta con él.
2. Willow, lo mejor para interfaces de voz basadas en hardware
Willow es un asistente de voz de código abierto propósito-específico que funciona en placas ESP32-S3 (como ESP32-BOX-3) y transmite audio a un servidor de inferencia local en tu PC o NAS. Maneja detección de palabra de activación, conversión de voz a texto y reenvío de intenciones a Home Assistant, MQTT o un punto de acceso REST.
Dónde falla: Requiere hardware dedicado. No es una solución “instala esto en mi portátil”, más bien un proyecto “construye el puck”.
Precio:
- Gratis, Apache 2.0
- El hardware ESP32-BOX-3 cuesta alrededor de $40
Plataformas: El servidor funciona en Linux; los clientes son placas ESP32
Descargar: Willow GitHub | Willow Application Server
Conclusión: La respuesta correcta si quieres pucks de voz físicos alrededor de la casa, no solo un micrófono de portátil.
3. Rhasspy, lo mejor para experimentos offline-primero
Rhasspy es el veterano de los asistentes de voz locales. Diseñado de forma modular, te permite intercambiar cualquier motor de palabra de activación, cualquier modelo de conversión de voz a texto, cualquier procesador de intenciones y cualquier voz de síntesis. Su reconocimiento de intenciones soporta plantillas de oraciones offline, así que los comandos simples funcionan sin un LLM.
Dónde falla: El ritmo de desarrollo se ha ralentizado desde que Home Assistant absorbió al mantenedor. Aún funciona, pero la ayuda de la comunidad es más escasa que antes.
Precio:
- Gratis, MIT
Plataformas: Windows, macOS, Linux (Docker recomendado)
Descargar: Rhasspy Docs | GitHub
Conclusión: Usa si quieres el máximo control en cada etapa. Los nuevos usuarios deberían empezar con Home Assistant Assist.
4. Whisper.cpp, lo mejor para conversión de voz a texto local
Whisper.cpp es un puerto en C++ del modelo Whisper de OpenAI optimizado para inferencia en CPU. Es el motor de transcripción en el que se basan la mayoría de pilas de voz privada. Los tamaños de modelo van desde tiny (~40 MB) hasta large-v3 (~3 GB) te permiten intercambiar precisión por latencia.
Dónde falla: No es un asistente completo, solo la pieza de transcripción. Necesita envoltorios de palabra de activación, intención y respuesta alrededor.
Precio:
- Gratis, MIT
Plataformas: Windows, macOS, Linux (funciona en Raspberry Pi 4 con modelos pequeños)
Descargar: Whisper.cpp GitHub | OpenAI Whisper model card
Conclusión: El estándar de conversión de voz a texto. Cada pila a continuación lo usa o algo similar bajo el capó.
5. Piper, lo mejor para síntesis de voz local
Piper es el motor de síntesis de voz neural de Home Assistant, lo suficientemente pequeño para funcionar en una Raspberry Pi y lo suficientemente bueno para sonar natural. Los paquetes de voz cubren 40+ idiomas y decenas de acentos.
Dónde falla: No alcanza el nivel de expresividad de Eleven Labs. Bien para respuestas del asistente, no para narración de audiolibros.
Precio:
- Gratis, MIT
Plataformas: Windows, macOS, Linux, Raspberry Pi
Descargar: Piper GitHub | Voice samples
Conclusión: El motor TTS local predeterminado. Se envía como complemento de Home Assistant.
6. Ollama, lo mejor para el cerebro del LLM
Ollama ejecuta modelos de lenguaje de peso abierto localmente con una instalación de una línea. Apunta Home Assistant Assist o cualquier pila de voz al punto de acceso de API de Ollama y tu asistente puede responder preguntas abiertas, resumir tu bandeja de entrada o razonar sobre el estado de tu hogar inteligente.
Dónde falla: La latencia de respuesta depende del tamaño del modelo y del hardware. Una respuesta Llama 3.1 8B toma segundos en CPU, sub-segundo en una GPU moderna.
Precio:
- Gratis, MIT
Plataformas: Windows, macOS, Linux
Descargar: Ollama Site | Ollama Library
Conclusión: Instala Ollama cuando quieras que tu asistente piense, no solo ejecute comandos.
7. OpenWakeWord, lo mejor para palabras de activación personalizadas
OpenWakeWord entrena un modelo de palabra de activación en el navegador a partir de algunos ejemplos de audio. Di “computadora” en serio, o inventa un nombre que no haya sido ya tomado por cada asistente big-tech en el mercado.
Dónde falla: Los modelos personalizados necesitan suficientes muestras de entrenamiento para evitar falsos positivos. Espera una noche de afinación.
Precio:
- Gratis, Apache 2.0
Plataformas: Se ejecuta en cualquier lugar donde Python y TensorFlow se ejecuten
Descargar: OpenWakeWord GitHub | Community wake words
Conclusión: La manera de escapar de “Alexa” y “Hey Google” para siempre.
Cómo elegir el correcto
Comienza con Home Assistant más Whisper.cpp y Piper. Esa es la pila de asistente privado de referencia en 2026.
Añade Ollama cuando quieras respuestas conversacionales en lugar de intenciones programadas.
Usa Willow si quieres pucks de voz físicos (imán de frigorífico, puck de cocina, mesita de noche) en lugar de solo hablar a tu portátil.
Usa Rhasspy si ya conoces los componentes y quieres control máximo. Sáltalo si eres nuevo; Home Assistant Assist es ahora más amigable para principiantes.
Toma OpenWakeWord en el momento en que “Nabu” o “Jarvis” te moleste.
Preguntas Frecuentes
¿Puede un asistente de voz privado con IA igualar la velocidad de Alexa? En un PC de escritorio moderno o Mac mini, Whisper.cpp con el modelo pequeño transcribe en tiempo real y Piper responde en menos de un segundo. Es competitivo.
¿Cuánta energía usa una pila de voz local? Una Raspberry Pi 4 maneja la escucha de palabra de activación e intenciones básicas en un par de vatios. Añadir un LLM local vía Ollama la requiere un NUC pequeño o una estación de trabajo.
¿Necesito internet en absoluto? No. Whisper, Piper, Ollama, Home Assistant y Rhasspy se ejecutan completamente offline. Solo los complementos en la nube opcionales necesitan conectividad.
¿Cuál es el mejor hardware para un asistente de voz privado en 2026? Un mini PC Ryzen (clase AMD Strix Halo) o Mac mini con silicio Apple para asistentes respaldados por LLM. Raspberry Pi 5 funciona bien para configuraciones solo de intenciones.
¿Puedo ejecutar esto en mi instalación existente de Home Assistant? Sí. Home Assistant Assist es una característica de primera parte. Añade los complementos Whisper, Piper y (opcionalmente) Ollama de la tienda, conéctalos en la configuración Voice Assistants, y listo.