El contingut es queda amb tusense accés de tercers
No hi ha cap tractament del contingut dels teus fitxers en cap servidor. No et cal cap contracte d'encàrrec de tractament amb gottrix per treballar amb documents confidencials o de feina.
Hosted in GermanyGlobal Content Delivery
Servidors d'origen a Hetzner, a Alemanya, amb lliurament mundial mitjançant una xarxa de distribució de continguts (CDN). El contingut dels teus fitxers no es transmet mai en aquest procés - no surt mai del teu dispositiu.
Un PDF escanejat és, en essència, una pila d'imatges: veus el text però no el pots seleccionar, cercar ni copiar. L'OCR (reconeixement òptic de caràcters) llegeix les lletres de la imatge i les col·loca com una capa de text invisible exactament sobre les pàgines. L'aparença es manté idèntica, però el PDF es torna cercable i el text, seleccionable, just el que necessiten organismes, arxius i motors de cerca de text complet.
Tria com a sortida un PDF cercable (pàgines originals més capa de text) o text pla com a TXT. Estableix l'idioma del document de la llista, 113 idiomes des de l'anglès, el català i el castellà fins al rus, l'àrab i l'hindi, passant pel japonès, el coreà i el xinès, cadascun amb el seu propi nom, perquè els caràcters es reconeguin correctament. Tot s'executa al navegador via WebAssembly: el mateix motor Tesseract de codi obert que l'eina "Imatge a text", aplicat pàgina a pàgina a tot el PDF. En el primer ús, el navegador descarrega el motor i el model d'idioma triat una sola vegada (pocs MB, mateixa origen); després funciona sense connexió.
L'eina està pensada per a PDFs escanejats o compostos només d'imatges. El reconeixement depèn molt de la qualitat de l'escaneig: pàgines nítides, dretes i amb bon contrast es reconeixen molt bé; les tortes o borroses, molt pitjor; l'escriptura manual no es reconeix de manera fiable. En el PDF cercable cada pàgina es reincrusta com a imatge, de manera que el disseny es preserva però el fitxer pot créixer. Un PDF que ja conté text real no necessita OCR. Comprova el resultat en els nombres i els noms propis.
El reconeixement de text sol ser terreny del núvol: els serveis d'OCR coneguts pugen cada escaneig als seus servidors per processar-lo - precisament documents com contractes, informes mèdics o documents d'identitat. Aquí tot el reconeixement s'executa amb Tesseract com a WebAssembly al teu navegador, i els 113 paquets d'idioma són allotjats al mateix gottrix - durant el reconeixement no es baixa res de tercers. A més, la llista d'idiomes comença preseleccionada segons l'idioma de la teva interfície. Gratis, sense compte i sense límit de pàgines.
Tria la sortida (PDF cercable o text) i l'idioma de la llista.
Descarrega el PDF cercable o el fitxer TXT.
Límits: Per a PDFs ESCANEJATS o d'imatges: els fa cercables via OCR (capa de text invisible) o retorna text pla. Reconeix text IMPRÈS en 113 idiomes i molts alfabets; escriptura manual no de manera fiable. Nota: la capa de text invisible del PDF cercable cobreix l'alfabet llatí amb totes les lletres accentuades (23 dels 113 idiomes, p. ex. polonès, txec, vietnamita, turc), el grec i el ciríl·lic. Els caràcters d'altres escriptures (p. ex. CJK, àrab, hebreu, devanagari, tai) s'hi ometen deliberadament en lloc de sortir deformats; per a aquestes escriptures, usa la sortida "Només text (TXT)", que retorna el text reconegut complet. En el PDF cercable cada pàgina es reincrusta com a imatge, el disseny es preserva però el fitxer pot créixer; un PDF amb text real no necessita OCR. El reconeixement no és perfecte: comprova especialment els nombres i els noms propis. El motor i el model d'idioma es descarreguen una sola vegada (pocs MB, mateixa origen), després l'eina funciona sense connexió. Els PDFs grans poden requerir més temps i memòria segons el nombre de pàgines i el dispositiu.
Preguntes freqüents
El meu PDF s'envia a algun servidor?
No. La renderització i el reconeixement s'executen completament de manera local al navegador (WebAssembly); el PDF mai no surt del teu dispositiu, la qual cosa és l'avantatge decisiu sobretot per a contractes i correspondència oficial.
Què és un PDF cercable?
La pàgina té l'aparença de l'escaneig, però a sota hi ha una capa de text invisible. Això et permet cercar al PDF, seleccionar i copiar text sense que l'aspecte visual canviï.
Es preserva el disseny?
Sí. Cada pàgina s'incorpora com a imatge de la pàgina original amb la capa de text invisible alineada a sobre amb precisió. L'aparença no canvia, tot i que el fitxer pot créixer lleugerament.
Reconeix l'escriptura manual o altres idiomes?
Altres idiomes sí: més de 100 disponibles, incloent-hi l'àrab, el rus, l'hindi, el japonès, el coreà i el xinès. L'escriptura manual no es reconeix de manera fiable, només el text imprès. La capa de text del PDF cercable cobreix el llatí amb totes les lletres accentuades, el grec i el ciríl·lic; per a CJK, àrab, hebreu, devanagari o tai, usa la sortida "Només text (TXT)", que conté el text reconegut complet.
Quants idiomes reconeix l'OCR?
113 - del català, l'anglès i l'alemany a l'àrab, l'hindi i el tailandès, fins al japonès, el coreà i el xinès. Cada idioma apareix amb el seu propi nom a la llista, i tots els paquets d'idioma són allotjats al mateix gottrix, no a cap tercer.
L'OCR de PDF és gratis, i hi ha límit de pàgines?
Sí, totalment gratis - sense compte, sense marca d'aigua i sense límit de pàgines ni diari. Moltes pàgines simplement triguen proporcionalment més, perquè el reconeixement el calcula el teu propi dispositiu.
Per què el reconeixement local és millor per a escanejos confidencials?
Perquè l'escaneig no surt mai del teu dispositiu: sense pujada, sense processament en servidor, sense còpia en un núvol aliè. Després de la primera càrrega el reconeixement funciona fins i tot sense connexió - la prova més contundent que no es transmet res.
Només amb el teu consentiment mesurem l'ús de manera anonimitzada mitjançant galetes per millorar gottrix. Els teus fitxers sempre romanen en local, al teu dispositiu. Privadesa