Vos contenus restent chez vousaucun accès par des tiers
Aucun traitement du contenu de vos fichiers n'a lieu sur un serveur. Vous n'avez besoin d'aucun contrat de sous-traitance avec gottrix pour vos documents confidentiels ou professionnels.
Hosted in GermanyGlobal Content Delivery
Serveurs d'origine chez Hetzner en Allemagne, diffusion mondiale via un réseau de diffusion de contenu (CDN). Le contenu de vos fichiers n'est jamais transmis dans ce cadre - il ne quitte jamais votre appareil.
Un PDF scanné n'est en substance qu'une pile d'images: vous voyez le texte, mais vous ne pouvez ni le sélectionner, ni le rechercher, ni le copier. L'OCR (reconnaissance optique de caractères) lit les lettres dans l'image et les place sous forme de couche de texte invisible exactement sur les pages. L'apparence reste identique, mais le PDF devient consultable et le texte sélectionnable, ce qu'attendent les administrations, les archives et les moteurs de recherche en texte intégral.
Choisissez comme sortie un PDF consultable (pages originales plus couche de texte) ou du texte brut au format TXT. Sélectionnez la langue du document dans la liste, 113 langues du français, de l'anglais et de l'allemand au russe, à l'arabe et au hindi, en passant par le japonais, le coréen et le chinois, chacune dans son propre nom, afin que les caractères soient correctement reconnus. Tout s'exécute dans le navigateur via WebAssembly: le même moteur Tesseract libre que l'outil "Image en texte", appliqué page par page à tout le PDF. Lors de la première utilisation, le navigateur télécharge le moteur et le modèle de langue choisi une seule fois (quelques Mo, même origine); l'outil fonctionne ensuite hors ligne.
L'outil est destiné aux PDF scannés ou constitués uniquement d'images. La reconnaissance dépend fortement de la qualité du scan: des pages nettes, droites et très contrastées donnent d'excellents résultats; les pages penchées ou floues donnent de bien moins bons résultats; l'écriture manuscrite n'est pas reconnue de manière fiable. Dans le PDF consultable, chaque page est réintégrée sous forme d'image, ce qui préserve la mise en page mais peut augmenter la taille du fichier. Un PDF contenant déjà du texte réel n'a pas besoin d'OCR. Vérifiez le résultat pour les chiffres et les noms propres.
La reconnaissance de texte est d'ordinaire l'affaire du cloud : les services OCR connus envoient chaque scan sur leurs serveurs pour le traiter - justement des documents comme des contrats, des courriers médicaux ou des pièces d'identité. Ici, toute la reconnaissance s'exécute avec Tesseract en WebAssembly dans votre navigateur, et les 113 packs de langues sont hébergés sur gottrix même - rien n'est chargé chez des tiers pendant la reconnaissance. La liste des langues démarre en outre présélectionnée selon la langue de votre interface. Gratuit, sans compte et sans limite de pages.
Choisissez la sortie (PDF consultable ou texte) et la langue dans la liste.
Téléchargez le PDF consultable ou le fichier TXT.
Limites: Pour les PDF SCANNÉS ou PDF images: les rend consultables par OCR (couche de texte invisible) ou retourne le texte brut. Reconnaît le texte IMPRIMÉ dans 113 langues et de nombreuses écritures; écriture manuscrite non fiable. Remarque: la couche de texte invisible du PDF consultable couvre l'alphabet latin avec toutes ses lettres accentuées (23 des 113 langues, p. ex. polonais, tchèque, vietnamien, turc), le grec et le cyrillique. Les caractères d'autres écritures (p. ex. CJK, arabe, hébreu, devanagari, thaï) y sont volontairement omis plutôt que déformés; pour ces écritures, utilisez la sortie "Texte seul (TXT)", qui restitue le texte intégralement reconnu. Dans le PDF consultable, chaque page est réintégrée comme image, la mise en page est préservée mais le fichier peut grossir; un PDF avec du vrai texte n'a pas besoin d'OCR. La reconnaissance n'est pas parfaite: vérifiez en particulier les chiffres et les noms propres. Le moteur et le modèle de langue sont téléchargés une seule fois (quelques Mo, même origine), puis l'outil est utilisable hors ligne. Les PDF volumineux peuvent demander du temps et de la mémoire selon le nombre de pages et l'appareil.
Questions fréquentes
Mon PDF est-il envoyé à un serveur?
Non. Le rendu et la reconnaissance s'effectuent entièrement en local dans le navigateur (WebAssembly); le PDF ne quitte jamais votre appareil, ce qui est l'avantage décisif pour les contrats et le courrier officiel.
Qu'est-ce qu'un PDF consultable?
La page ressemble au scan, mais une couche de texte invisible est placée dessous. Cela vous permet de faire des recherches dans le PDF, de sélectionner et de copier du texte, sans que l'apparence visuelle change.
La mise en page est-elle préservée?
Oui. Chaque page est intégrée sous forme d'image de la page originale, avec la couche de texte invisible alignée dessus avec précision. L'apparence ne change pas, bien que le fichier puisse légèrement grossir.
Reconnaît-il l'écriture manuscrite ou d'autres langues?
D'autres langues oui: plus de 100 disponibles, dont l'arabe, le russe, le hindi, le japonais, le coréen et le chinois. L'écriture manuscrite n'est pas reconnue de façon fiable, uniquement le texte imprimé. La couche de texte du PDF consultable couvre le latin avec toutes ses lettres accentuées, le grec et le cyrillique; pour le CJK, l'arabe, l'hébreu, le devanagari ou le thaï, utilisez la sortie "Texte seul (TXT)", qui contient le texte intégralement reconnu.
Combien de langues la reconnaissance de texte prend-elle en charge ?
113 - du français, de l'anglais et de l'allemand à l'arabe, au hindi et au thaï, jusqu'au japonais, au coréen et au chinois. Chaque langue figure sous son propre nom dans la liste, et tous les packs de langues sont hébergés sur gottrix même, pas chez un tiers.
L'OCR de PDF est-il gratuit, et y a-t-il une limite de pages ?
Oui, entièrement gratuit - sans compte, sans filigrane et sans limite de pages ni de quota journalier. Beaucoup de pages prennent simplement plus de temps, car c'est votre propre appareil qui calcule la reconnaissance.
Pourquoi la reconnaissance locale est-elle meilleure pour les scans confidentiels ?
Parce que le scan ne quitte jamais votre appareil : pas d'envoi, pas de traitement serveur, pas de copie dans un cloud tiers. Après le premier chargement, la reconnaissance fonctionne même hors ligne - la preuve la plus forte que rien n'est transmis.
Uniquement avec votre accord, nous mesurons l'utilisation de manière anonymisée via des cookies afin d'améliorer gottrix. Vos fichiers restent toujours en local, sur votre appareil. Confidentialité