de

Text in Sprache umwandeln

Wandle getippten Text lokal im Browser per KI-Sprachsynthese in eine echte Audiodatei um - ganz ohne Server, Konto oder Upload.

Läuft lokal auf deinem Gerät ...

Format
  • WAV
  • M4A (AAC)

Läuft lokal auf deinem Gerät ...

0%

Wird meine Datei hochgeladen?

Nein. Die Umwandlung läuft komplett in Deinem Browser - Deine Datei verlässt Dein Gerät nie. So ist das nachprüfbar

Kein Upload100% lokal
Inhalte bleiben bei dirkein Zugriff durch Dritte
Hosted in GermanyGlobal Content Delivery
Extern geprüftTLS A+ · Header A+

Ein Klingelton-Ansagetext, ein Sprachschnipsel für ein Video, eine Vorlese-Probe: Dieses Tool spricht getippten Text mit einer echten, im Browser laufenden Sprachsynthese (SpeechT5, ein neuronales Text-zu-Sprache-Modell) und schreibt das Ergebnis als herunterladbare Audiodatei heraus - anders als die eingebaute Bildschirmvorlese-Funktion des Browsers lässt sich diese Ausgabe tatsächlich speichern und weiterverwenden.

Die Sprachsynthese läuft komplett lokal als WebAssembly, in derselben Technik-Familie wie die anderen KI-Werkzeuge dieser Seite (Spracherkennung, Rauschunterdrückung): Text und erzeugte Audiodatei verlassen das Gerät nie. Aktuell steht eine Stimme zur Verfügung (US-amerikanisches Englisch, weiblich); Ausgabeformat ist WAV oder M4A (AAC).

Weil ohne geteilten Speicher (keine Cross-Origin-Isolation) gearbeitet wird, läuft die Synthese einzelsträngig statt mehrfädig - korrekt, aber merklich langsamer als ein serverseitiger Dienst, mit einem Fortschrittsbalken während der Erzeugung. Längerer Text wird automatisch in kurze, meist satzlange Abschnitte zerlegt und nacheinander vertont, weil die Sprachqualität bei sehr langen Abschnitten in einem Zug spürbar nachlässt.

Technische Daten

Technische Daten
EingabeformateTexteingabe
AusgabeformateWAV, M4A
StapelverarbeitungNein
VerarbeitungLokal im Browser (WebAssembly)
Datei-UploadKeiner

In 3 Schritten

  1. Text eingeben (bis zu 1000 Zeichen).
  2. Format wählen (WAV oder M4A) und "Erzeugen" antippen.
  3. Fertige Audiodatei anhören und herunterladen.

Grenzen: Aktuell nur EINE Stimme (US-amerikanisches Englisch, weiblich) - weitere Sprachen/Stimmen sind eine dokumentierte Folgearbeit, keine Zusage. Am klarsten klingen kurze, einfache Sätze; bei langem oder ungewöhnlichem Wortschatz kann die Aussprache hörbar nachlassen. Eingabe ist auf 1000 Zeichen begrenzt, längerer Text wird satzweise zerlegt. Verarbeitung läuft einzelsträngig (kein Cross-Origin-Isolation-Modus auf dieser Seite) und ist deshalb spürbar langsamer als ein serverseitiger Dienst - für einen ganzen Absatz realistisch mehrere zehn Sekunden, nicht Millisekunden.

Häufige Fragen

Wird mein Text irgendwohin gesendet?

Nein, die Sprachsynthese läuft vollständig lokal im Browser über WebAssembly - weder Text noch Audiodatei verlassen das Gerät.

Warum klingt das nicht wie die eingebaute Vorlesefunktion meines Systems?

Weil es eine andere, eigenständige Technik ist: ein neuronales Sprachmodell statt der systemeigenen Sprachausgabe - und anders als bei dieser lässt sich das Ergebnis hier als echte Datei speichern.

Warum dauert die Erzeugung mehrere Sekunden?

Sprachsynthese ist rechenintensiv und läuft hier ohne Mehrfädigkeit - korrekt, aber bewusst langsamer statt falsch schnell versprochen. Ein Fortschrittsbalken zeigt den Stand an.

Gibt es weitere Stimmen oder Sprachen?

Aktuell steht eine Stimme bereit (US-amerikanisches Englisch, weiblich). Weitere Stimmen/Sprachen sind eine mögliche Folgearbeit, aber keine feste Zusage.

Warum wird langer Text in Stücke zerlegt?

Das zugrunde liegende Sprachmodell klingt bei sehr langen, am Stück gesprochenen Abschnitten hörbar schlechter - kurze Abschnitte einzeln zu vertonen und aneinanderzuhängen liefert insgesamt die klarere Aussprache.

Passende Tools

Audio zu Text · Rauschen entfernen · Audio aufnehmen · Audio-Konverter