Convierte una grabación hablada en texto escrito: localmente en el navegador mediante reconocimiento de voz por IA (Whisper), totalmente sin subir nada.
Procesando localmente en tu dispositivo ...
!
i
¿No es la herramienta adecuada? Ver 3 herramientas relacionadas
No se produce ningún tratamiento del contenido de tus archivos en servidores, así que no necesitas firmar un contrato de encargo con gottrix para trabajar con documentos confidenciales o de empresa.
Hosted in GermanyGlobal Content Delivery
Servidores de origen en Hetzner (Alemania), con entrega mundial a través de una red de distribución de contenidos (CDN). El contenido de tus archivos nunca se transmite en el proceso: no sale de tu dispositivo.
Una entrevista, la grabación de una clase, una nota de voz con una idea sobre la marcha: esta herramienta escucha la grabación y la transcribe como texto buscable y copiable. El modelo de reconocimiento es Whisper de OpenAI, aquí como una compilación de WebAssembly propia de un solo hilo: la misma tecnología de base que usan los servicios de transcripción conocidos, solo que aquí se ejecuta enteramente en tu dispositivo en lugar de en un servidor externo.
Por defecto, Whisper detecta él mismo el idioma hablado ("Detectar automáticamente"); en grabaciones cortas o multilingües también se puede fijar el idioma, lo que puede mejorar algo la precisión y la velocidad. El resultado aparece como texto corrido con un párrafo por segmento de habla; para vídeos que necesitan marcas de tiempo integradas está la herramienta hermana "Vídeo a subtítulos", que usa el mismo reconocimiento pero genera un archivo SRT/VTT con marcas de tiempo exactas.
Como se trabaja sin memoria compartida (sin aislamiento de origen cruzado), el reconocimiento se ejecuta en un solo hilo en vez de varios: correcto, pero notablemente más lento que un servicio en el servidor. Por eso aquí rige un límite de duración bastante más estricto que en las demás herramientas de audio de esta página; mejor ser honestamente lento que prometer una velocidad falsa.
Ficha técnica
Ficha técnica
Formatos de entrada
MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Conversión automática
MP4
Formato de salida
TXT
Procesamiento por lotes
No
Procesamiento
Local en el navegador (WebAssembly)
Subida de archivos
Ninguna
En 3 pasos
Suelta tu archivo de audio.
Elige un idioma o deja "Detectar automáticamente".
Copia el texto reconocido o descárgalo como TXT.
Límites: Se ejecuta en un solo hilo (sin modo de aislamiento de origen cruzado en esta página) y por eso es notablemente más lento que los servicios en el servidor: aquí rige un límite de duración por dispositivo bastante más estricto (más corto que en las demás herramientas de audio). Se usa el modelo compacto de nivel "tiny": bueno para habla clara, más débil con mucho ruido de fondo, dialectos o jerga técnica que un modelo mayor. El reconocimiento no está libre de errores: revisa el resultado, sobre todo nombres propios y números.
Preguntas frecuentes
¿Se sube mi grabación?
No, el reconocimiento se ejecuta totalmente en local, en el navegador, mediante WebAssembly.
¿Qué idiomas se reconocen?
Casi 100 idiomas; se detectan automáticamente o se eligen de forma fija.
¿Por qué tarda más que otras herramientas de audio?
El reconocimiento de voz exige mucho cálculo y aquí se ejecuta sin múltiples hilos: correcto, pero deliberadamente más lento en vez de prometer una rapidez falsa.
¿Existe también con marcas de tiempo para subtítulos?
Sí, la herramienta hermana "Vídeo a subtítulos" genera SRT/VTT con marcas de tiempo exactas.
Solo con tu consentimiento medimos el uso de forma anonimizada mediante cookies para mejorar gottrix. Tus archivos siempre permanecen en local, en tu dispositivo. Privacidad