ca

Àudio a text

Converteix una gravació parlada en text escrit, al navegador mitjançant reconeixement de veu amb IA (Whisper), sense cap pujada.

Processant en local al teu dispositiu ...

Idioma de la gravació
  • Detecció automàtica
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Processant en local al teu dispositiu ...

0%

Es puja el meu fitxer?

No. Tot s'executa al teu navegador - el teu fitxer no surt mai del dispositiu. Per què és verificable

Sense pujar res100% local
El contingut es queda amb tusense accés de tercers
Hosted in GermanyGlobal Content Delivery
Auditat de manera independentTLS A+ · Capçaleres A+

Una entrevista, la gravació d'una classe, una nota de veu amb una idea pel camí: aquesta eina escolta la gravació i la transcriu com a text cercable i copiable. El model de reconeixement és Whisper d'OpenAI, aquí com una compilació WebAssembly pròpia i d'un sol fil: la mateixa tecnologia de base que fan servir els serveis de transcripció coneguts, només que aquí s'executa íntegrament al teu dispositiu en lloc d'un servidor extern.

Per defecte, Whisper detecta ell mateix l'idioma parlat ("Detecció automàtica"): en gravacions curtes o multilingües l'idioma també es pot fixar, cosa que pot millorar lleugerament la precisió i la velocitat. El resultat apareix com a text continu amb un paràgraf per segment de parla; per a vídeos que necessiten marques de temps incrustades hi ha l'eina germana "Vídeo a subtítols", que fa servir el mateix reconeixement però genera un fitxer SRT/VTT amb marques de temps exactes.

Com que es treballa sense memòria compartida (sense aïllament d'origen creuat), el reconeixement s'executa en un sol fil en lloc de diversos: correcte, però notablement més lent que un servei del costat del servidor. Per això aquí s'aplica un límit de durada molt més estricte que a la resta d'eines d'àudio d'aquesta pàgina; més val ser honestament lent que prometre una velocitat falsa.

Fitxa tècnica

Fitxa tècnica
Formats d'entradaMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Conversió automàticaMP4
Format de sortidaTXT
Processament per lotsNo
ProcessamentEn local al navegador (WebAssembly)
Càrrega de fitxersCap

En 3 passos

  1. Deixa anar el teu fitxer d'àudio.
  2. Tria un idioma o deixa-ho en "Detecció automàtica".
  3. Copia el text reconegut o descarrega'l com a TXT.

Límits: S'executa en un sol fil (sense mode d'aïllament d'origen creuat en aquesta pàgina) i per això és notablement més lent que els serveis del costat del servidor: aquí s'aplica un límit de durada per dispositiu molt més estricte (més curt que a la resta d'eines d'àudio). S'utilitza el model compacte de nivell "tiny": bo per a parla clara, més feble amb molt soroll de fons, dialectes o argot tècnic que un model més gran. El reconeixement no és lliure d'errors: revisa el resultat, sobretot els noms propis i els números.

Preguntes freqüents

Es puja la meva gravació?

No, el reconeixement s'executa totalment en local, al navegador, mitjançant WebAssembly.

Quins idiomes es reconeixen?

Gairebé 100 idiomes; detectats automàticament o triats de manera fixa.

Per què triga més que altres eines d'àudio?

El reconeixement de veu exigeix molt de càlcul i aquí s'executa sense múltiples fils: correcte, però deliberadament més lent en lloc de prometre una rapidesa falsa.

També existeix amb marques de temps per a subtítols?

Sí, l'eina germana "Vídeo a subtítols" genera SRT/VTT amb marques de temps exactes.

Eines relacionades

Vídeo a subtítols · Eliminar soroll · Imatge a text (OCR) · Imatge de forma d'ona · Grava l'àudio · Intercanvia els canals