Un desarrollador dictando código en una laptop con un modelo de voz offline que transcribe localmente

Esta semana un escritor de XDA notó que las compilaciones recientes de VS Code incluyen silenciosamente un modelo de reconocimiento de voz local. Sin viajes a la nube, sin clave API de OpenAI, sin datos saliendo de la máquina. La transcripción fue, en sus palabras, “sorprendentemente buena”. Esa historia se alinea con lo que sucedió en el mundo más amplio del habla de código abierto durante los últimos dos años: los modelos de clase Whisper ahora se ejecutan en una laptop, en tiempo real, sin enviar audio a ninguna parte.

Probamos siete aplicaciones de escritorio para voz a código sin conexión y dictado en 2026. Cada una de ellas mantiene el audio en el dispositivo. Un par fue construida específicamente para programadores. El resto son herramientas de dictado general que se conectan a un editor.

Qué importa en una aplicación de voz a código sin conexión

Comparación rápida

Aplicación Mejor para Plan gratuito Precio inicial Plataformas
whisper.cpp Transcripción Whisper bare-metal en cualquier lugar Aplicación completa Gratis, código abierto Windows, macOS, Linux
Talon Voice Codificación sin manos con gramática real Nivel gratuito Alrededor de $15/mes Pro (opcional) Windows, macOS, Linux
Serenade Comandos de voz dentro de VS Code Nivel gratuito Alrededor de $10/mes Pro Windows, macOS, Linux
Vosk Modelos pequeños y embebibles Kit de herramientas completo Gratis, código abierto Windows, macOS, Linux
WhisperKit Whisper nativo de Apple Silicon Framework completo Gratis, código abierto macOS
Wispr Flow Dictado de todo el sistema con pulido Prueba de 7 días Alrededor de $12/mes macOS, Windows
SuperWhisper Whisper de barra de menú sin conexión en macOS Nivel gratuito Alrededor de $9 de una sola vez o tier de por vida macOS

Las aplicaciones

1. whisper.cpp — Mejor transcripción bare-metal sin conexión

whisper.cpp es el puerto C++ de Whisper de OpenAI hecho por Georgi Gerganov. Se ejecuta en CPU, en Apple Silicon a través de Metal, y en GPU Nvidia a través de CUDA. La transcripción de streaming en tiempo real funciona con el modelo small.en o medium.en en cualquier laptop de los últimos cinco años. Todo el runtime es un único binario; Python no es necesario.

Donde falla: es una biblioteca, no una GUI. Obtener texto en una aplicación de destino significa enviar a través de un script que canaliza a wl-copy, xdotool o AppleScript.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: whisper.cpp en GitHub

Conclusión: Cada herramienta de dictado sin conexión en esta lista usa whisper.cpp bajo el capó o compite contra ella. Comienza aquí.

2. Talon Voice — Mejor codificación sin manos

Talon Voice es lo que usan los desarrolladores afectados por RSI a largo plazo para escribir código completamente por voz. El sistema de gramática entiende camelCase, snake_case, SCREAMING_SNAKE y todos los movimientos de editor que podamos pedir. Talon se ejecuta sin conexión por defecto con su propio motor de reconocimiento de voz (modelos Conformer, no Whisper).

Donde falla: la curva de aprendizaje es real. Escribir gramáticas personalizadas requiere una tarde antes de que la aplicación se amortice. Los paquetes de idioma mantenidos por la comunidad (talon-community) son esenciales.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: Descargas de Talon Voice

Conclusión: El estándar de oro para codificación sin manos. Si escribimos para ganarnos la vida, Talon vale la semana de configuración.

3. Serenade — Mejor edición controlada por voz en VS Code

Serenade se encuentra dentro de VS Code, IDE de JetBrains y terminales, escucha comandos estructurados (“add function foo taking user”), y produce el código correspondiente. Ejecuta un modelo de voz local en hardware moderno.

Donde falla: el nivel gratuito limita los minutos de voz diarios. La gramática de comandos es más estricta que la de Talon; el dictado de forma libre no es su fortaleza.

Precios:

Plataformas: Windows, macOS, Linux

Descargar: Descargas de Serenade

Conclusión: Para edición de voz ligera en un IDE convencional, Serenade requiere menos configuración que Talon.

4. Vosk — Mejor kit de herramientas pequeño de reconocimiento de voz sin conexión

Vosk es el kit de herramientas de reconocimiento de voz de Alpha Cephei. Los modelos comienzan en 50MB (más pequeño que el modelo pequeño de whisper.cpp) y se ejecutan en hardware Raspberry Pi. Bindings nativos de Python, Node, C#, Java y Go.

Donde falla: la precisión está por debajo de los modelos de clase Whisper en inglés general. Mejor adaptado para gramáticas de comandos, palabras de activación y vocabularios limitados.

Precios:

Plataformas: Windows, macOS, Linux, Android, iOS

Descargar: Descargas de Vosk

Conclusión: No es la opción para dictado gratuito. Excelente para escribir una palabra de activación o gramática de comando ajustada en una aplicación existente.

5. WhisperKit — Mejor stack de Whisper de Apple Silicon

WhisperKit es el paquete Swift de Argmax que ejecuta Whisper en Apple Neural Engine. En una Mac de la serie M, medium.en se transcribe a 30 a 60 veces la velocidad real usando watts de un dígito.

Donde falla: solo macOS. Construir sobre ella significa escribir Swift.

Precios:

Plataformas: macOS, iOS

Descargar: WhisperKit en GitHub

Conclusión: La biblioteca que cada aplicación de dictado Mac seria usa ahora. No algo que instalemos directamente, sino la razón por la que SuperWhisper y Wispr Flow se sienten instantáneos en Apple Silicon.

6. Wispr Flow — Mejor dictado de todo el sistema pulido

Wispr Flow es lo más parecido a una experiencia de “simplemente hable en cualquier campo de texto”. Actívelo con una tecla de acceso rápido, hable, suelte, y el texto transcrito se inserta donde está el cursor. Puntuación, capitalización y formato amigable con el código, todo sucede en el dispositivo.

Donde falla: pagado después de la prueba. macOS es la compilación madura; Windows sigue adelantándose en opciones de modelo y controles de barra de menú.

Precios:

Plataformas: macOS, Windows

Descargar: Sitio oficial de Wispr Flow

Conclusión: Si el dictado debe sentirse como parte del SO, esta es la opción pagada con menos fricción.

7. SuperWhisper — Mejor Whisper de barra de menú sin conexión en macOS

SuperWhisper es una aplicación de barra de menú autónoma que ejecuta Whisper localmente, transcribe en cualquier campo de texto activo, y puede postprocesar la salida con un LLM en dispositivo (Ollama, LM Studio o modelos en dispositivo de Apple).

Donde falla: solo macOS. El precio de una sola vez sería modesto para una aplicación solo para Mac, pero el nivel de actualización “lifetime” aún existe y vale la pena el costo para usuarios diarios.

Precios:

Plataformas: macOS

Descargar: Sitio oficial de SuperWhisper

Conclusión: Usuarios de Mac que desean dictado sin conexión sin plomería de canalización: instale esto en cinco minutos y salte el resto de la lista.

Cómo elegir el correcto

FAQ

¿Es el reconocimiento de voz sin conexión realmente tan bueno como el dictado en la nube? Para inglés, whisper-large-v3 ejecutándose localmente está dentro de un pelo de lo que devuelven los servicios de dictado en la nube. Los idiomas no ingleses aún se quedan atrás de las ofertas en la nube, pero la brecha sigue cerrándose cada lanzamiento de modelo.

¿Puedo ejecutar esto en una CPU sin una GPU? Sí. whisper.cpp, Vosk, Talon y Serenade todos se ejecutan en CPU. Whisper-medium se ejecuta a velocidad de tiempo real en cualquier CPU de laptop moderna.

¿Cuál es la diferencia entre Whisper y Vosk? Whisper es un modelo grande basado en transformer entrenado en audio multilingüe; la precisión es alta, los modelos son más pesados. Vosk utiliza modelos más pequeños optimizados para streaming; la precisión es menor para dictado general pero la latencia y la huella son mejores para uso incorporado.

¿Alguno de estos mantiene el audio en el dispositivo para siempre? Sí. whisper.cpp, Vosk, WhisperKit, Talon (en su configuración predeterminada) y SuperWhisper están todos sin conexión. Serenade y Wispr Flow utilizan por defecto modelos en dispositivo pero verifica la configuración si manejamos audio sensible.

¿Es el dictado más rápido que escribir? Para prosa, sí, una vez que nos adaptamos. Para código, coincide con la escritura táctil después de algunas horas de práctica con Talon o Serenade. La ganancia más grande es poder trabajar a través de una lesión de muñeca sin perder el día.