pt

Áudio em texto

Transforma uma gravação falada em texto escrito, no navegador por reconhecimento de voz com IA (Whisper), sem qualquer envio.

Processando localmente no seu dispositivo ...

Idioma da gravação
  • Deteção automática
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Processando localmente no seu dispositivo ...

0%

Meu arquivo é enviado?

Não. Tudo roda no seu navegador - o seu arquivo nunca sai do seu dispositivo. Como isso é verificável

Sem envio100% local
O conteúdo fica consigosem acesso de terceiros
Hosted in GermanyGlobal Content Delivery
Auditado externamenteTLS A+ · Cabeçalhos A+

Uma entrevista, a gravação de uma aula, uma nota de voz com uma ideia em movimento: esta ferramenta ouve a gravação e transcreve-a como texto pesquisável e copiável. O modelo de reconhecimento é o Whisper da OpenAI, aqui como uma compilação WebAssembly própria, de thread única - a mesma tecnologia de base usada pelos serviços de transcrição conhecidos, só que aqui corre inteiramente no teu dispositivo em vez de num servidor externo.

Por predefinição, o Whisper deteta sozinho o idioma falado ("Deteção automática") - em gravações curtas ou multilingues, o idioma também pode ser fixado, o que pode melhorar ligeiramente a precisão e a velocidade. O resultado aparece como texto corrido com um parágrafo por segmento de fala; para vídeos que precisam de marcas de tempo incorporadas existe a ferramenta irmã "Vídeo em legendas", que usa o mesmo reconhecimento mas gera um ficheiro SRT/VTT com marcas de tempo exatas.

Como se trabalha sem memória partilhada (sem isolamento cross-origin), o reconhecimento corre numa única thread em vez de várias - correto, mas visivelmente mais lento do que um serviço no lado do servidor. Por isso aplica-se aqui um limite de duração bem mais rigoroso do que nas restantes ferramentas de áudio desta página; mais vale ser honestamente lento do que prometer uma velocidade falsa.

Ficha técnica

Ficha técnica
Formatos de entradaMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Conversão automáticaMP4
Formato de saídaTXT
Processamento em loteNão
ProcessamentoLocalmente no navegador (WebAssembly)
Upload de arquivosNenhum

Em 3 passos

  1. Larga o teu ficheiro de áudio.
  2. Escolhe um idioma ou deixa em "Deteção automática".
  3. Copia o texto reconhecido ou descarrega-o como TXT.

Limites: Corre numa única thread (sem modo de isolamento cross-origin nesta página) e por isso é visivelmente mais lento do que os serviços no lado do servidor - aplica-se aqui um limite de duração por dispositivo bem mais rigoroso (mais curto do que nas restantes ferramentas de áudio). É usado o modelo compacto de nível "tiny": bom para fala clara, mais fraco com muito ruído de fundo, dialetos ou jargão do que um modelo maior. O reconhecimento não é isento de erros: verifica o resultado, sobretudo nomes próprios e números.

Perguntas frequentes

A minha gravação é enviada?

Não, o reconhecimento corre totalmente em local, no navegador, através de WebAssembly.

Que idiomas são reconhecidos?

Quase 100 idiomas; detetados automaticamente ou escolhidos de forma fixa.

Porque demora mais do que outras ferramentas de áudio?

O reconhecimento de voz exige muito cálculo e aqui corre sem várias threads - correto, mas deliberadamente mais lento em vez de prometer uma rapidez falsa.

Também existe com marcas de tempo para legendas?

Sim, a ferramenta irmã "Vídeo em legendas" gera SRT/VTT com marcas de tempo exatas.

Ferramentas relacionadas

Vídeo em legendas · Remover ruído · Imagem para texto (OCR) · Forma de onda em PNG · Gravar áudio · Trocar canais