sv

Ljud till text

Gör om en talad inspelning till skriven text - lokalt i webbläsaren med AI-taligenkänning (Whisper), helt utan uppladdning.

Körs lokalt på din enhet ...

Inspelningens språk
  • Detektera automatiskt
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Körs lokalt på din enhet ...

0%

Laddas min fil upp?

Nej. Allt körs i din webbläsare - din fil lämnar aldrig din enhet. Så går det att verifiera

Ingen uppladdning100% lokalt
Innehållet stannar hos digingen åtkomst för tredje part
Hosted in GermanyGlobal Content Delivery
Granskat externtTLS A+ · HTTP-rubriker A+

En intervju, en föreläsningsinspelning, ett röstmemo med en idé på språng: det här verktyget lyssnar på inspelningen och skriver ner den som sökbar, kopierbar text. Igenkänningsmodellen är Whisper från OpenAI, här som en särskilt kompilerad, enkeltrådig WebAssembly-build - samma underliggande teknik som de kända transkriberingstjänsterna använder, förutom att den här körs helt på din egen enhet i stället för på en främmande server.

Som standard känner Whisper själv igen det talade språket ("Detektera automatiskt") - för korta eller flerspråkiga inspelningar kan språket också anges fast, vilket kan förbättra träffsäkerheten och tempot något. Resultatet visas som löpande text med ett stycke per talavsnitt; för videor som behöver inbäddade tidsstämplar finns systerverktyget "Video till undertexter", som använder samma igenkänning men levererar en SRT/VTT-fil med exakta tidsmarkeringar i stället.

Eftersom arbetet sker utan delat minne (ingen cross-origin-isolering) körs igenkänningen enkeltrådigt i stället för flertrådigt - korrekt, men märkbart långsammare än en servertjänst. Därför gäller en betydligt strängare längdgräns här än för sidans övriga ljudverktyg; hellre ärligt långsam än ett falskt löfte om hastighet.

Tekniska data

Tekniska data
IndataformatMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Automatisk konverteringMP4
UtdataformatTXT
BatchbearbetningNej
BearbetningLokalt i webbläsaren (WebAssembly)
FiluppladdningIngen

I 3 steg

  1. Släpp din ljudfil.
  2. Välj ett språk eller låt det stå kvar på "Detektera automatiskt".
  3. Kopiera den igenkända texten eller ladda ner den som TXT.

Begränsningar: Körs enkeltrådigt (inget cross-origin-isoleringsläge på den här sidan) och är därför märkbart långsammare än servertjänster - en betydligt strängare längdgräns per enhet gäller här (kortare än för de övriga ljudverktygen). Den kompakta modellnivån "tiny" används: bra för tydligt tal, svagare vid kraftigt bakgrundsljud, dialekter eller fackjargong än en större modell skulle vara. Igenkänningen är inte felfri - kontrollera resultatet, särskilt egennamn och siffror.

Vanliga frågor

Laddas min inspelning upp?

Nej, igenkänningen körs helt lokalt i webbläsaren via WebAssembly.

Vilka språk känns igen?

Nästan 100 språk; antingen automatiskt detekterade eller fast valda.

Varför tar det här längre tid än andra ljudverktyg?

Taligenkänning är beräkningstungt och körs här utan flertrådighet - korrekt, men medvetet långsammare i stället för att lova en falsk snabbhet.

Finns det en version med tidsstämplar för undertexter?

Ja, systerverktyget "Video till undertexter" levererar SRT/VTT med exakta tidsmarkeringar.

Relaterade verktyg

Video till undertexter · Ta bort brus · Bild till text (OCR) · Vågformsbild · Spela in ljud · Byt kanaler