es

Audio a texto

Convierte una grabación hablada en texto escrito: localmente en el navegador mediante reconocimiento de voz por IA (Whisper), totalmente sin subir nada.

Procesando localmente en tu dispositivo ...

Idioma de la grabación
  • Detectar automáticamente
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Procesando localmente en tu dispositivo ...

0%

¿Se sube mi archivo?

No. Todo se ejecuta en tu navegador: tu archivo nunca sale de tu dispositivo. Cómo se puede comprobar

Sin subidas100% local
Tus datos son tuyossin acceso de terceros
Hosted in GermanyGlobal Content Delivery
Auditoría externaTLS A+ · Cabeceras A+

Una entrevista, la grabación de una clase, una nota de voz con una idea sobre la marcha: esta herramienta escucha la grabación y la transcribe como texto buscable y copiable. El modelo de reconocimiento es Whisper de OpenAI, aquí como una compilación de WebAssembly propia de un solo hilo: la misma tecnología de base que usan los servicios de transcripción conocidos, solo que aquí se ejecuta enteramente en tu dispositivo en lugar de en un servidor externo.

Por defecto, Whisper detecta él mismo el idioma hablado ("Detectar automáticamente"); en grabaciones cortas o multilingües también se puede fijar el idioma, lo que puede mejorar algo la precisión y la velocidad. El resultado aparece como texto corrido con un párrafo por segmento de habla; para vídeos que necesitan marcas de tiempo integradas está la herramienta hermana "Vídeo a subtítulos", que usa el mismo reconocimiento pero genera un archivo SRT/VTT con marcas de tiempo exactas.

Como se trabaja sin memoria compartida (sin aislamiento de origen cruzado), el reconocimiento se ejecuta en un solo hilo en vez de varios: correcto, pero notablemente más lento que un servicio en el servidor. Por eso aquí rige un límite de duración bastante más estricto que en las demás herramientas de audio de esta página; mejor ser honestamente lento que prometer una velocidad falsa.

Ficha técnica

Ficha técnica
Formatos de entradaMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Conversión automáticaMP4
Formato de salidaTXT
Procesamiento por lotesNo
ProcesamientoLocal en el navegador (WebAssembly)
Subida de archivosNinguna

En 3 pasos

  1. Suelta tu archivo de audio.
  2. Elige un idioma o deja "Detectar automáticamente".
  3. Copia el texto reconocido o descárgalo como TXT.

Límites: Se ejecuta en un solo hilo (sin modo de aislamiento de origen cruzado en esta página) y por eso es notablemente más lento que los servicios en el servidor: aquí rige un límite de duración por dispositivo bastante más estricto (más corto que en las demás herramientas de audio). Se usa el modelo compacto de nivel "tiny": bueno para habla clara, más débil con mucho ruido de fondo, dialectos o jerga técnica que un modelo mayor. El reconocimiento no está libre de errores: revisa el resultado, sobre todo nombres propios y números.

Preguntas frecuentes

¿Se sube mi grabación?

No, el reconocimiento se ejecuta totalmente en local, en el navegador, mediante WebAssembly.

¿Qué idiomas se reconocen?

Casi 100 idiomas; se detectan automáticamente o se eligen de forma fija.

¿Por qué tarda más que otras herramientas de audio?

El reconocimiento de voz exige mucho cálculo y aquí se ejecuta sin múltiples hilos: correcto, pero deliberadamente más lento en vez de prometer una rapidez falsa.

¿Existe también con marcas de tiempo para subtítulos?

Sí, la herramienta hermana "Vídeo a subtítulos" genera SRT/VTT con marcas de tiempo exactas.

Herramientas relacionadas

Vídeo a subtítulos · Eliminar ruido · Imagen a texto (OCR) · Forma de onda en PNG · Grabar audio · Intercambiar canales