Es entsteht keine Auftragsverarbeitung deiner Datei-Inhalte. Du brauchst keinen AVV mit gottrix, um vertrauliche oder geschäftliche Dokumente zu verarbeiten.
Hosted in GermanyGlobal Content Delivery
Origin-Server bei Hetzner in Deutschland, weltweite Auslieferung über ein Content-Delivery-Netz. Deine Dateiinhalte werden dabei nie übertragen - sie verlassen dein Gerät nicht.
Ein Klingelton-Ansagetext, ein Sprachschnipsel für ein Video, eine Vorlese-Probe: Dieses Tool spricht getippten Text mit einer echten, im Browser laufenden Sprachsynthese (SpeechT5, ein neuronales Text-zu-Sprache-Modell) und schreibt das Ergebnis als herunterladbare Audiodatei heraus - anders als die eingebaute Bildschirmvorlese-Funktion des Browsers lässt sich diese Ausgabe tatsächlich speichern und weiterverwenden.
Die Sprachsynthese läuft komplett lokal als WebAssembly, in derselben Technik-Familie wie die anderen KI-Werkzeuge dieser Seite (Spracherkennung, Rauschunterdrückung): Text und erzeugte Audiodatei verlassen das Gerät nie. Aktuell steht eine Stimme zur Verfügung (US-amerikanisches Englisch, weiblich); Ausgabeformat ist WAV oder M4A (AAC).
Weil ohne geteilten Speicher (keine Cross-Origin-Isolation) gearbeitet wird, läuft die Synthese einzelsträngig statt mehrfädig - korrekt, aber merklich langsamer als ein serverseitiger Dienst, mit einem Fortschrittsbalken während der Erzeugung. Längerer Text wird automatisch in kurze, meist satzlange Abschnitte zerlegt und nacheinander vertont, weil die Sprachqualität bei sehr langen Abschnitten in einem Zug spürbar nachlässt.
Technische Daten
Technische Daten
Eingabeformate
Texteingabe
Ausgabeformate
WAV, M4A
Stapelverarbeitung
Nein
Verarbeitung
Lokal im Browser (WebAssembly)
Datei-Upload
Keiner
In 3 Schritten
Text eingeben (bis zu 1000 Zeichen).
Format wählen (WAV oder M4A) und "Erzeugen" antippen.
Fertige Audiodatei anhören und herunterladen.
Grenzen: Aktuell nur EINE Stimme (US-amerikanisches Englisch, weiblich) - weitere Sprachen/Stimmen sind eine dokumentierte Folgearbeit, keine Zusage. Am klarsten klingen kurze, einfache Sätze; bei langem oder ungewöhnlichem Wortschatz kann die Aussprache hörbar nachlassen. Eingabe ist auf 1000 Zeichen begrenzt, längerer Text wird satzweise zerlegt. Verarbeitung läuft einzelsträngig (kein Cross-Origin-Isolation-Modus auf dieser Seite) und ist deshalb spürbar langsamer als ein serverseitiger Dienst - für einen ganzen Absatz realistisch mehrere zehn Sekunden, nicht Millisekunden.
Häufige Fragen
Wird mein Text irgendwohin gesendet?
Nein, die Sprachsynthese läuft vollständig lokal im Browser über WebAssembly - weder Text noch Audiodatei verlassen das Gerät.
Warum klingt das nicht wie die eingebaute Vorlesefunktion meines Systems?
Weil es eine andere, eigenständige Technik ist: ein neuronales Sprachmodell statt der systemeigenen Sprachausgabe - und anders als bei dieser lässt sich das Ergebnis hier als echte Datei speichern.
Warum dauert die Erzeugung mehrere Sekunden?
Sprachsynthese ist rechenintensiv und läuft hier ohne Mehrfädigkeit - korrekt, aber bewusst langsamer statt falsch schnell versprochen. Ein Fortschrittsbalken zeigt den Stand an.
Gibt es weitere Stimmen oder Sprachen?
Aktuell steht eine Stimme bereit (US-amerikanisches Englisch, weiblich). Weitere Stimmen/Sprachen sind eine mögliche Folgearbeit, aber keine feste Zusage.
Warum wird langer Text in Stücke zerlegt?
Das zugrunde liegende Sprachmodell klingt bei sehr langen, am Stück gesprochenen Abschnitten hörbar schlechter - kurze Abschnitte einzeln zu vertonen und aneinanderzuhängen liefert insgesamt die klarere Aussprache.
Nur mit deiner Zustimmung messen wir mit Cookies anonymisiert die Nutzung, um gottrix zu verbessern. Deine Dateien bleiben immer lokal auf deinem Gerät. Datenschutz