Vos contenus restent chez vousaucun accès par des tiers
Aucun traitement du contenu de vos fichiers n'a lieu sur un serveur. Vous n'avez besoin d'aucun contrat de sous-traitance avec gottrix pour vos documents confidentiels ou professionnels.
Hosted in GermanyGlobal Content Delivery
Serveurs d'origine chez Hetzner en Allemagne, diffusion mondiale via un réseau de diffusion de contenu (CDN). Le contenu de vos fichiers n'est jamais transmis dans ce cadre - il ne quitte jamais votre appareil.
Il arrive qu'on ait juste besoin du texte brut d'un PDF : reprendre une citation dans un document, copier un contrat dans votre éditeur, indexer un contenu pour une recherche ou une archive, ou transmettre le texte à un lecteur d'écran. Cet outil lit la couche de texte intégrée au PDF et la restitue sous forme de fichier .txt tout simple - sans polices, images, couleurs ni mise en page, seulement les caractères.
L'ordre est reconstitué page par page : les fragments de texte à la même hauteur forment une ligne, lue de haut en bas et de gauche à droite. Les pages sont séparées par une ligne vide, ce qui rend le résultat facile à réutiliser, importer ou rechercher.
Important, en toute honnêteté : cet outil n'extrait que le texte déjà présent comme couche de texte dans le PDF. Un PDF scanné ou composé uniquement de photos n'a pas une telle couche - le résultat y reste vide, et vous avez alors besoin de la reconnaissance de texte « PDF OCR », qui détecte les lettres à partir des pixels. Les mises en page complexes à plusieurs colonnes, avec tableaux ou notes de bas de page, ne se laissent pas non plus toujours ramener parfaitement à un ordre de texte linéaire. Mais pour des PDF normaux et « réels » (créés par des logiciels bureautiques, des navigateurs ou des systèmes de composition), l'extraction fournit un texte propre et réutilisable. Tout se passe en local dans le navigateur via pdf.js ; votre fichier ne quitte jamais votre appareil.
Limites: Extrait la couche de texte existante d'un PDF et la restitue en fichier .txt UTF-8 ; les lignes sont reconstruites à partir des positions du texte. Les PDF scannés ou en image seule n'ont pas de couche de texte, la sortie y reste vide : utilisez alors PDF OCR. Les polices, images, couleurs et la mise en page exacte (pages à plusieurs colonnes, tableaux) sont perdues ou seulement approchées de façon linéaire. Déverrouillez d'abord les PDF protégés par mot de passe avec Déverrouiller un PDF.
Questions fréquentes
Pourquoi mon fichier texte est-il vide ?
Votre PDF est probablement un scan ou composé d'images et n'a pas de couche de texte. Utilisez alors PDF OCR, qui reconnaît le texte à partir des pixels.
La mise en page est-elle conservée ?
Non. Vous obtenez du texte brut dans l'ordre de lecture. Les polices, images, colonnes et tableaux ne sont pas reproduits à l'identique.
Dans quel encodage est le fichier ?
En UTF-8, si bien que les accents et les caractères spéciaux sont conservés correctement.
Comment les pages multiples sont-elles séparées ?
Par une ligne vide entre les pages.
Le PDF est-il envoyé ?
Non, l'extraction de texte se fait entièrement en local dans le navigateur.
Uniquement avec votre accord, nous mesurons l'utilisation de manière anonymisée via des cookies afin d'améliorer gottrix. Vos fichiers restent toujours en local, sur votre appareil. Confidentialité