de

Audio zu Text

Verwandle eine gesprochene Aufnahme in geschriebenen Text - lokal im Browser per KI-Spracherkennung (Whisper), komplett ohne Upload.

Läuft lokal auf deinem Gerät ...

Sprache der Aufnahme
  • Automatisch erkennen
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Läuft lokal auf deinem Gerät ...

0%

Wird meine Datei hochgeladen?

Nein. Die Umwandlung läuft komplett in Deinem Browser - Deine Datei verlässt Dein Gerät nie. So ist das nachprüfbar

Kein Upload100% lokal
Inhalte bleiben bei dirkein Zugriff durch Dritte
Hosted in GermanyGlobal Content Delivery
Extern geprüftTLS A+ · Header A+

Ein Interview, eine Vorlesungsaufzeichnung, eine Sprachmemo mit einer Idee unterwegs: Dieses Tool hört die Aufnahme und schreibt sie als durchsuch- und kopierbaren Text nieder. Erkennungsmodell ist Whisper von OpenAI, hier als eigens kompiliertes, einzelsträngiges WebAssembly - dieselbe Grundtechnik, die auch die bekannten Transkriptionsdienste nutzen, nur läuft sie hier komplett auf deinem Gerät statt auf einem fremden Server.

Standardmäßig erkennt Whisper die gesprochene Sprache selbst ("Automatisch erkennen") - bei kurzen oder mehrsprachigen Aufnahmen lässt sich die Sprache aber auch fest vorgeben, was Erkennungsrate und Tempo leicht verbessern kann. Das Ergebnis erscheint als fortlaufender Text mit Absätzen je Sprechabschnitt; für Videos mit eingebettetem Zeitstempel-Bedarf gibt es das Schwester-Tool "Video zu Untertiteln", das dieselbe Erkennung nutzt, aber als SRT/VTT-Datei mit exakten Zeitmarken ausgibt.

Weil ohne geteilten Speicher (keine Cross-Origin-Isolation) gearbeitet wird, läuft die Erkennung einzelsträngig statt mehrfädig - korrekt, aber spürbar langsamer als ein serverseitiger Dienst. Deshalb gilt hier eine deutlich strengere Längen-Obergrenze als bei den übrigen Audio-Werkzeugen dieser Seite; lieber ehrlich langsam als eine falsche Geschwindigkeit versprechen.

Technische Daten

Technische Daten
EingabeformateMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Auto-KonvertierungMP4
AusgabeformatTXT
StapelverarbeitungNein
VerarbeitungLokal im Browser (WebAssembly)
Datei-UploadKeiner

In 3 Schritten

  1. Audiodatei ablegen.
  2. Sprache wählen oder bei "Automatisch erkennen" belassen.
  3. Erkannten Text kopieren oder als TXT herunterladen.

Grenzen: Läuft einzelsträngig (kein Cross-Origin-Isolation-Modus auf dieser Seite) und ist deshalb spürbar langsamer als serverseitige Dienste - eine deutlich strengere Längen-Obergrenze pro Gerät gilt hier (kürzer als bei den übrigen Audio-Tools). Genutzt wird die kompakte "tiny"-Modellstufe: gut für klare Sprache, schwächer bei starkem Hintergrundlärm, Dialekten oder Fachjargon als ein größeres Modell. Die Erkennung ist nicht fehlerfrei - prüfe das Ergebnis, besonders Eigennamen und Zahlen.

Häufige Fragen

Wird meine Aufnahme hochgeladen?

Nein, die Erkennung läuft vollständig lokal im Browser über WebAssembly.

Welche Sprachen werden erkannt?

Fast 100 Sprachen; entweder automatisch erkannt oder fest gewählt.

Warum dauert das länger als bei anderen Audio-Tools?

Spracherkennung ist rechenintensiv und läuft hier ohne Mehrfädigkeit - korrekt, aber bewusst langsamer statt falsch schnell versprochen.

Gibt es das auch mit Zeitstempeln für Untertitel?

Ja, das Schwester-Tool "Video zu Untertiteln" gibt SRT/VTT mit exakten Zeitmarken aus.

Passende Tools

Video zu Untertiteln · Rauschen entfernen · Bild zu Text (OCR) · Wellenform-Bild erstellen · Audio aufnehmen · Links/Rechts tauschen