Es entsteht keine Auftragsverarbeitung deiner Datei-Inhalte. Du brauchst keinen AVV mit gottrix, um vertrauliche oder geschäftliche Dokumente zu verarbeiten.
Hosted in GermanyGlobal Content Delivery
Origin-Server bei Hetzner in Deutschland, weltweite Auslieferung über ein Content-Delivery-Netz. Deine Dateiinhalte werden dabei nie übertragen - sie verlassen dein Gerät nicht.
Ein Interview, eine Vorlesungsaufzeichnung, eine Sprachmemo mit einer Idee unterwegs: Dieses Tool hört die Aufnahme und schreibt sie als durchsuch- und kopierbaren Text nieder. Erkennungsmodell ist Whisper von OpenAI, hier als eigens kompiliertes, einzelsträngiges WebAssembly - dieselbe Grundtechnik, die auch die bekannten Transkriptionsdienste nutzen, nur läuft sie hier komplett auf deinem Gerät statt auf einem fremden Server.
Standardmäßig erkennt Whisper die gesprochene Sprache selbst ("Automatisch erkennen") - bei kurzen oder mehrsprachigen Aufnahmen lässt sich die Sprache aber auch fest vorgeben, was Erkennungsrate und Tempo leicht verbessern kann. Das Ergebnis erscheint als fortlaufender Text mit Absätzen je Sprechabschnitt; für Videos mit eingebettetem Zeitstempel-Bedarf gibt es das Schwester-Tool "Video zu Untertiteln", das dieselbe Erkennung nutzt, aber als SRT/VTT-Datei mit exakten Zeitmarken ausgibt.
Weil ohne geteilten Speicher (keine Cross-Origin-Isolation) gearbeitet wird, läuft die Erkennung einzelsträngig statt mehrfädig - korrekt, aber spürbar langsamer als ein serverseitiger Dienst. Deshalb gilt hier eine deutlich strengere Längen-Obergrenze als bei den übrigen Audio-Werkzeugen dieser Seite; lieber ehrlich langsam als eine falsche Geschwindigkeit versprechen.
Technische Daten
Technische Daten
Eingabeformate
MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Auto-Konvertierung
MP4
Ausgabeformat
TXT
Stapelverarbeitung
Nein
Verarbeitung
Lokal im Browser (WebAssembly)
Datei-Upload
Keiner
In 3 Schritten
Audiodatei ablegen.
Sprache wählen oder bei "Automatisch erkennen" belassen.
Erkannten Text kopieren oder als TXT herunterladen.
Grenzen: Läuft einzelsträngig (kein Cross-Origin-Isolation-Modus auf dieser Seite) und ist deshalb spürbar langsamer als serverseitige Dienste - eine deutlich strengere Längen-Obergrenze pro Gerät gilt hier (kürzer als bei den übrigen Audio-Tools). Genutzt wird die kompakte "tiny"-Modellstufe: gut für klare Sprache, schwächer bei starkem Hintergrundlärm, Dialekten oder Fachjargon als ein größeres Modell. Die Erkennung ist nicht fehlerfrei - prüfe das Ergebnis, besonders Eigennamen und Zahlen.
Häufige Fragen
Wird meine Aufnahme hochgeladen?
Nein, die Erkennung läuft vollständig lokal im Browser über WebAssembly.
Welche Sprachen werden erkannt?
Fast 100 Sprachen; entweder automatisch erkannt oder fest gewählt.
Warum dauert das länger als bei anderen Audio-Tools?
Spracherkennung ist rechenintensiv und läuft hier ohne Mehrfädigkeit - korrekt, aber bewusst langsamer statt falsch schnell versprochen.
Gibt es das auch mit Zeitstempeln für Untertitel?
Ja, das Schwester-Tool "Video zu Untertiteln" gibt SRT/VTT mit exakten Zeitmarken aus.
Nur mit deiner Zustimmung messen wir mit Cookies anonymisiert die Nutzung, um gottrix zu verbessern. Deine Dateien bleiben immer lokal auf deinem Gerät. Datenschutz