Es entsteht keine Auftragsverarbeitung deiner Datei-Inhalte. Du brauchst keinen AVV mit gottrix, um vertrauliche oder geschäftliche Dokumente zu verarbeiten.
Hosted in GermanyGlobal Content Delivery
Origin-Server bei Hetzner in Deutschland, weltweite Auslieferung über ein Content-Delivery-Netz. Deine Dateiinhalte werden dabei nie übertragen - sie verlassen dein Gerät nicht.
Manchmal braucht man nur den reinen Text aus einem PDF: ein Zitat in ein Dokument übernehmen, einen Vertrag in den Editor kopieren, Inhalte für eine Suche oder ein Archiv indexieren oder Text einer Vorlese-/Screenreader-Software übergeben. Dieses Werkzeug liest die im PDF eingebettete Textebene aus und gibt sie als schlichte .txt-Datei zurück - ohne Schriften, Bilder, Farben oder Layout, nur die Zeichen.
Die Reihenfolge wird Seite für Seite rekonstruiert: Textstücke auf gleicher Höhe bilden eine Zeile, von oben nach unten und links nach rechts gelesen. Seiten werden durch eine Leerzeile getrennt, sodass die Ausgabe sich gut weiterverarbeiten, importieren oder durchsuchen lässt.
Wichtig und ehrlich: Dieses Tool extrahiert nur Text, der bereits als Textebene in der PDF steckt. Ein eingescanntes oder rein aus Fotos bestehendes PDF enthält keine solche Ebene - dort bleibt die Ausgabe leer, und du brauchst stattdessen die Texterkennung „PDF OCR", die aus den Pixeln Buchstaben erkennt. Auch komplexe Layouts mit mehreren Spalten, Tabellen oder Fußnoten lassen sich nicht immer perfekt in eine lineare Textreihenfolge bringen. Für normale, „echte" PDFs (aus Office-Programmen, Browsern oder Satzsystemen erzeugt) liefert die Extraktion aber sauberen, weiterverwendbaren Text. Alles läuft lokal im Browser via pdf.js; deine Datei verlässt dein Gerät nicht.
Grenzen: Extrahiert die vorhandene Textebene eines PDF und gibt sie als UTF-8-.txt-Datei zurück; Zeilen werden aus den Textpositionen rekonstruiert. Eingescannte oder reine Bild-PDFs haben keine Textebene - dort bleibt die Ausgabe leer, nutze dann "PDF OCR". Schriften, Bilder, Farben und exaktes Layout (mehrspaltige Seiten, Tabellen) gehen verloren bzw. werden nur linear angenähert. Passwortgeschützte PDFs zuerst mit "PDF entsperren" öffnen.
Häufige Fragen
Warum ist meine Textdatei leer?
Wahrscheinlich ist dein PDF ein Scan oder besteht aus Bildern und hat keine Textebene. Nutze dann "PDF OCR", das Text aus den Pixeln erkennt.
Bleibt das Layout erhalten?
Nein. Du erhältst reinen Text in Lesereihenfolge. Schriften, Bilder, Spalten und Tabellen werden nicht originalgetreu abgebildet.
In welcher Kodierung ist die Datei?
UTF-8, sodass auch Umlaute und Sonderzeichen korrekt erhalten bleiben.
Wie werden mehrere Seiten getrennt?
Durch eine Leerzeile zwischen den Seiten.
Wird die PDF hochgeladen?
Nein, die Textextraktion passiert vollständig lokal im Browser.
Nur mit deiner Zustimmung messen wir mit Cookies anonymisiert die Nutzung, um gottrix zu verbessern. Deine Dateien bleiben immer lokal auf deinem Gerät. Datenschutz