Speakr, una aplicación de transcripción autohospedada en GitHub

Speakr ha recibido mucha atención esta semana por una razón simple: traslada la transcripción personal de los servidores de la empresa al hardware que el usuario realmente controla. Suelta un archivo de audio (o graba desde el navegador), obtén una transcripción que se puede buscar, un resumen y una interfaz de chat sobre toda la biblioteca. No todos quieren tener Docker en sus vidas, y diferentes configuraciones favorecen diferentes opciones. Estas siete alternativas a Speakr en escritorio cubren el espectro desde motores de autohospedaje puro hasta aplicaciones locales pulidas que se ejecutan sin tocar una terminal.

Comparación rápida

Aplicación Mejor para Plataformas Precio Destacado
OpenTranscribe Transcripción autohospedada compartida en equipo Windows / macOS / Linux (Docker) Gratis Diarización, búsqueda, colaboración en una pila
Whishper Implementación simple de Docker para usuarios individuales Windows / macOS / Linux (Docker) Gratis Interfaz web, exportación de subtítulos, traducción
WhisperX Mejor precisión de diarización Windows / macOS / Linux (CLI) Gratis Marcas de tiempo a nivel de palabra, VAD, diarización
faster-whisper Motor Whisper con prioridad de velocidad Windows / macOS / Linux (CLI) Gratis Backend CTranslate2, ganancias de velocidad enormes
MacWhisper La aplicación Mac nativa más pulida macOS Freemium Interfaz de una ventana, lotes, importación de podcast
Buzz GUI multiplataforma de código abierto Windows / macOS / Linux Gratis Whisper.cpp bajo una interfaz amigable
SuperWhisper Voz a texto en todas partes en macOS macOS Freemium Atajo de teclado en todo el sistema, modos de indicación

Lo que Speakr hace bien y lo que deja fuera

Speakr ofrece un servidor de transcripción personal con una capa de chat y opción de motor basada en conectores: WhisperX local, gpt-4o-transcribe-diarize de OpenAI, Mistral Voxtral y otros. Lo que algunos usuarios echan de menos es un camino de entrada menos friccional (Docker Compose no es un costo cero para explicarle a un miembro de la familia sin conocimientos técnicos), configuraciones verdaderamente multiusuario o compartidas en equipo, y pulimiento de aplicaciones nativas para el caso de “solo transcribe este archivo”. Las opciones a continuación solucionan al menos una de estas.

OpenTranscribe — Mejor para transcripción autohospedada compartida en equipo

OpenTranscribe de Attevon LLC es más una plataforma de transcripción completa que una herramienta única. Frontend Svelte, backend FastAPI, implementación Docker, y viene con diarización de hablantes, búsqueda basada en etiquetas, edición colaborativa y detección de temas listos para usar. Si Speakr es tu grabadora personal, OpenTranscribe es lo que ejecutarías para un equipo de podcast de cinco personas.

Dónde falla: huella de recursos más pesada. No es la opción para una Raspberry Pi.

Precio: gratuito y de código abierto (AGPL). Aporta tu propia potencia de GPU o CPU.

vs Speakr: OpenTranscribe está más orientado al equipo; Speakr es más personal.

Descargar: OpenTranscribe en GitHub

Conclusión: la opción cuando más de una persona necesita tocar las transcripciones.

Whishper — Implementación más simple de Docker para usuarios individuales

Whishper es una aplicación web de transcripción y traducción autohospedada de un solo contenedor. Configura en un archivo docker-compose, abre un navegador, carga audio, descarga SRT o texto plano. No es tan completa como Speakr, pero para el trabajo de “solo quiero un servidor Whisper privado” es la forma más rápida de llegar allí.

Dónde falla: sin interfaz de chat sobre transcripciones, sin resúmenes LLM.

Precio: gratuito y de código abierto.

vs Speakr: Whishper es más simple y ligero; Speakr hace más por sesión.

Descargar: Whishper en GitHub

Conclusión: la opción para la configuración autohospedada más pequeña que aún funciona.

WhisperX — Mejor para precisión bruta

WhisperX de Max Bain es la opción cuando la calidad de transcripción es todo lo que importa. Agrega fragmentación basada en VAD, marcas de tiempo a nivel de palabra y diarización de hablantes con pyannote sobre faster-whisper, y la precisión en entrevistas con dos o más voces está genuinamente un paso por encima de Whisper estándar.

Dónde falla: es una herramienta de línea de comandos, no una aplicación. GPU altamente recomendado.

Precio: gratuito y de código abierto.

vs Speakr: WhisperX es un motor que incrustarías en Speakr; Speakr ya lo admite como backend.

Descargar: WhisperX en GitHub

Conclusión: la opción cuando la propia transcripción tiene que ser lo mejor posible.

faster-whisper — Mejor para velocidad

faster-whisper de Guillaume Klein es una reimplementación de Whisper usando CTranslate2. En el mismo hardware, alcanzará múltiples tiempos reales y usará menos memoria que el paquete Python Whisper de referencia. La mayoría de las otras herramientas en esta lista son wrappers alrededor de ella.

Dónde falla: solo CLI; construyes el flujo de trabajo.

Precio: gratuito y de código abierto.

vs Speakr: faster-whisper es la capa del motor; Speakr es un producto construido sobre motores como este.

Descargar: faster-whisper en GitHub

Conclusión: la opción para scripts, canalizaciones y exprimir cada segundo de tu GPU.

MacWhisper — Aplicación Mac nativa más pulida

MacWhisper de Jordi Bruin es la forma de menor fricción de obtener transcripción precisa en una Mac. Arrastra audio a la ventana, elige un modelo, obtén una transcripción con etiquetas de hablante y marcas de tiempo. Importación de podcasts, modo lote y exportación a todos los formatos de subtítulos y documentos comunes.

Dónde falla: solo macOS. El nivel gratuito se limita a modelos más pequeños; la versión de pago desbloquea grande y turbo.

Precio: nivel gratuito para uso básico; actualización única pagada para acceso completo a modelos.

vs Speakr: MacWhisper se ejecuta localmente sin servidor; Speakr es una aplicación de navegador compartida en tu red.

Descargar: MacWhisper

Conclusión: la opción para usuarios de Mac que solo quieren la transcripción ahora.

Buzz — GUI de código abierto multiplataforma mejor

Buzz de Chidi Williams envuelve whisper.cpp en una ventana amigable que se ejecuta en Windows, macOS y Linux. Transcripción por lotes, grabación en directo, traducción y soporte para descargar modelos desde Hugging Face. Es lo más cercano a MacWhisper en la columna de código abierto.

Dónde falla: la interfaz ha sido pulida por la comunidad pero aún muestra sus raíces Qt.

Precio: gratuito y de código abierto.

vs Speakr: Buzz es una aplicación de escritorio local; Speakr es un servidor al que te conectas.

Descargar: Buzz en GitHub

Conclusión: la opción cuando el requisito de Docker de Speakr es un factor decisivo pero Whisper sigue siendo el objetivo.

SuperWhisper — Mejor voz a texto en todas partes en macOS

SuperWhisper de Ivan Vialov pone Whisper detrás de un atajo de teclado en todo el sistema en macOS. Mantén una tecla, habla, y el texto transcrito se coloca en cualquier aplicación enfocada. Los “modos” personalizados te permiten procesar la salida a través de un LLM para convertir una nota de voz divagadora en una lista de puntos, correo electrónico o mensaje de confirmación.

Dónde falla: solo macOS. Los modos completamente offline necesitan una Mac decente para ejecutar el modelo grande en tiempo real.

Precio: gratuito para uso básico; suscripción para el nivel profesional con modelos en la nube e indicaciones personalizadas.

vs Speakr: SuperWhisper es dictado primero; Speakr es transcripción primero.

Descargar: SuperWhisper

Conclusión: la opción cuando el audio que te importa es tu propia voz, ahora mismo.

Cómo elegir

Elige OpenTranscribe si más de una persona necesita acceso. Elige Whishper para la configuración autohospedada más simple. Elige WhisperX cuando la precisión en audio multialtavoz es la prioridad, y faster-whisper cuando estés escribiendo un script de canalización. Elige MacWhisper para la experiencia Mac más fluida, Buzz para la misma idea en Windows o Linux, y SuperWhisper cuando lo que realmente quieres es dictado en todo el sistema. Sigue con Speakr si te gusta el equilibrio que logra entre transcripción, resúmenes LLM e interfaz de chat personal sobre tus notas de voz; nada más combina esos tres tan ordenadamente.

FAQ

¿Es Speakr gratis? Sí. Speakr es de código abierto bajo AGPLv3 y se ejecuta en tu propio hardware. Aportas la potencia de cálculo.

¿Cuál de estos transcribe en tiempo real? SuperWhisper y MacWhisper (nivel de pago) manejan tiempo real en una Mac moderna. Buzz puede grabar y transcribir en directo. Las opciones basadas en servidor son lote primero.

¿Cuál es mejor para la precisión? WhisperX con un modelo grande gana en pruebas independientes, especialmente en audio multialtavoz. Speakr, OpenTranscribe y Whishper todos lo usan o tienen faster-whisper bajo el capó.

¿Hay alguno que funcione sin GPU? Todos pueden, pero la velocidad de transcripción disminuye significativamente en CPU. faster-whisper es el más amigable con CPU.

¿Cuál alternativa funciona mejor para podcasts? MacWhisper para un flujo de trabajo Mac de usuario individual; OpenTranscribe si un equipo necesita colaborar en ediciones y etiquetas de hablante.