it

Audio in testo

Trasforma una registrazione parlata in testo scritto, nel browser tramite riconoscimento vocale IA (Whisper), senza alcun caricamento.

Elaborazione in locale sul tuo dispositivo ...

Lingua della registrazione
  • Rilevamento automatico
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Elaborazione in locale sul tuo dispositivo ...

0%

Il mio file viene caricato?

No. Tutto avviene nel tuo browser - il tuo file non lascia mai il dispositivo. Perché è verificabile

Nessun caricamento100% in locale
I contenuti restano tuoinessun accesso di terzi
Hosted in GermanyGlobal Content Delivery
Verificato esternamenteTLS A+ · Intestazioni A+

Un'intervista, la registrazione di una lezione, un memo vocale con un'idea al volo: questo strumento ascolta la registrazione e la trascrive in un testo ricercabile e copiabile. Il modello di riconoscimento è Whisper di OpenAI, qui come build WebAssembly compilata appositamente, a thread singolo - la stessa tecnologia di base usata dai noti servizi di trascrizione, solo che qui viene eseguita interamente sul tuo dispositivo invece che su un server esterno.

Per impostazione predefinita, Whisper riconosce da solo la lingua parlata ("Rilevamento automatico") - per registrazioni brevi o multilingue si può però anche impostare la lingua in modo fisso, il che può migliorare leggermente precisione e velocità. Il risultato appare come testo continuo con un paragrafo per ogni segmento vocale; per i video che necessitano di marcatori temporali incorporati esiste lo strumento gemello "Video in sottotitoli", che usa lo stesso riconoscimento ma genera un file SRT/VTT con marcatori temporali esatti.

Poiché si lavora senza memoria condivisa (nessun isolamento cross-origin), il riconoscimento viene eseguito a thread singolo anziché multithread - corretto, ma sensibilmente più lento di un servizio lato server. Per questo qui vale un limite di durata decisamente più severo rispetto agli altri strumenti audio di questa pagina; meglio essere onestamente lenti che promettere una velocità falsa.

Scheda tecnica

Scheda tecnica
Formati di inputMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Conversione automaticaMP4
Formato di outputTXT
Elaborazione in batchNo
ElaborazioneIn locale nel browser (WebAssembly)
Caricamento fileNessuno

In 3 passaggi

  1. Rilascia il tuo file audio.
  2. Scegli una lingua oppure lascia "Rilevamento automatico".
  3. Copia il testo riconosciuto o scaricalo come TXT.

Limiti: Viene eseguito a thread singolo (nessuna modalità di isolamento cross-origin su questa pagina) ed è quindi sensibilmente più lento dei servizi lato server - qui vale un limite di durata per dispositivo decisamente più severo (più corto rispetto agli altri strumenti audio). Viene usato il modello compatto di livello "tiny": buono per un parlato chiaro, più debole con forte rumore di fondo, dialetti o gergo tecnico rispetto a un modello più grande. Il riconoscimento non è privo di errori: controlla il risultato, specialmente nomi propri e numeri.

Domande frequenti

La mia registrazione viene caricata online?

No, il riconoscimento viene eseguito interamente in locale, nel browser, tramite WebAssembly.

Quali lingue vengono riconosciute?

Quasi 100 lingue; rilevate automaticamente oppure scelte in modo fisso.

Perché richiede più tempo rispetto ad altri strumenti audio?

Il riconoscimento vocale richiede molto calcolo e qui viene eseguito senza multithreading - corretto, ma volutamente più lento invece di promettere una rapidità falsa.

Esiste anche con marcatori temporali per i sottotitoli?

Sì, lo strumento gemello "Video in sottotitoli" genera SRT/VTT con marcatori temporali esatti.

Strumenti correlati

Video in sottotitoli · Rimuovi il rumore · Immagine in testo (OCR) · Immagine forma d'onda · Registra audio · Scambia i canali