Innehållet stannar hos digingen åtkomst för tredje part
Ditt filinnehåll behandlas inte på någon server. Du behöver inget personuppgiftsbiträdesavtal med gottrix för att hantera konfidentiella eller affärsdokument.
Hosted in GermanyGlobal Content Delivery
Origin-servrar hos Hetzner i Tyskland, global leverans via ett content delivery network (CDN). Ditt filinnehåll överförs aldrig i processen - det lämnar aldrig din enhet.
En intervju, en föreläsningsinspelning, ett röstmemo med en idé på språng: det här verktyget lyssnar på inspelningen och skriver ner den som sökbar, kopierbar text. Igenkänningsmodellen är Whisper från OpenAI, här som en särskilt kompilerad, enkeltrådig WebAssembly-build - samma underliggande teknik som de kända transkriberingstjänsterna använder, förutom att den här körs helt på din egen enhet i stället för på en främmande server.
Som standard känner Whisper själv igen det talade språket ("Detektera automatiskt") - för korta eller flerspråkiga inspelningar kan språket också anges fast, vilket kan förbättra träffsäkerheten och tempot något. Resultatet visas som löpande text med ett stycke per talavsnitt; för videor som behöver inbäddade tidsstämplar finns systerverktyget "Video till undertexter", som använder samma igenkänning men levererar en SRT/VTT-fil med exakta tidsmarkeringar i stället.
Eftersom arbetet sker utan delat minne (ingen cross-origin-isolering) körs igenkänningen enkeltrådigt i stället för flertrådigt - korrekt, men märkbart långsammare än en servertjänst. Därför gäller en betydligt strängare längdgräns här än för sidans övriga ljudverktyg; hellre ärligt långsam än ett falskt löfte om hastighet.
Tekniska data
Tekniska data
Indataformat
MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Automatisk konvertering
MP4
Utdataformat
TXT
Batchbearbetning
Nej
Bearbetning
Lokalt i webbläsaren (WebAssembly)
Filuppladdning
Ingen
I 3 steg
Släpp din ljudfil.
Välj ett språk eller låt det stå kvar på "Detektera automatiskt".
Kopiera den igenkända texten eller ladda ner den som TXT.
Begränsningar: Körs enkeltrådigt (inget cross-origin-isoleringsläge på den här sidan) och är därför märkbart långsammare än servertjänster - en betydligt strängare längdgräns per enhet gäller här (kortare än för de övriga ljudverktygen). Den kompakta modellnivån "tiny" används: bra för tydligt tal, svagare vid kraftigt bakgrundsljud, dialekter eller fackjargong än en större modell skulle vara. Igenkänningen är inte felfri - kontrollera resultatet, särskilt egennamn och siffror.
Vanliga frågor
Laddas min inspelning upp?
Nej, igenkänningen körs helt lokalt i webbläsaren via WebAssembly.
Vilka språk känns igen?
Nästan 100 språk; antingen automatiskt detekterade eller fast valda.
Varför tar det här längre tid än andra ljudverktyg?
Taligenkänning är beräkningstungt och körs här utan flertrådighet - korrekt, men medvetet långsammare i stället för att lova en falsk snabbhet.
Finns det en version med tidsstämplar för undertexter?
Ja, systerverktyget "Video till undertexter" levererar SRT/VTT med exakta tidsmarkeringar.
Endast med ditt samtycke mäter vi användningen anonymiserat via cookies för att förbättra gottrix. Dina filer stannar alltid lokalt, på din enhet. Integritet