ca

PDF OCR cercable

Fes cercable un PDF escanejat amb OCR al navegador, amb una capa de text invisible sota les pàgines originals, sense enviar res.

Processant en local al teu dispositiu ...

Sortida
  • PDF cercable
  • Només text (TXT)
Idioma del document
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Els teus fitxers

    Processant en local al teu dispositiu ...

    0%

    Es puja el meu fitxer?

    No. Tot s'executa al teu navegador - el teu fitxer no surt mai del dispositiu. Per què és verificable

    Sense pujar res100% local
    El contingut es queda amb tusense accés de tercers
    Hosted in GermanyGlobal Content Delivery
    Auditat de manera independentTLS A+ · Capçaleres A+

    Un PDF escanejat és, en essència, una pila d'imatges: veus el text però no el pots seleccionar, cercar ni copiar. L'OCR (reconeixement òptic de caràcters) llegeix les lletres de la imatge i les col·loca com una capa de text invisible exactament sobre les pàgines. L'aparença es manté idèntica, però el PDF es torna cercable i el text, seleccionable, just el que necessiten organismes, arxius i motors de cerca de text complet.

    Tria com a sortida un PDF cercable (pàgines originals més capa de text) o text pla com a TXT. Estableix l'idioma del document de la llista, 113 idiomes des de l'anglès, el català i el castellà fins al rus, l'àrab i l'hindi, passant pel japonès, el coreà i el xinès, cadascun amb el seu propi nom, perquè els caràcters es reconeguin correctament. Tot s'executa al navegador via WebAssembly: el mateix motor Tesseract de codi obert que l'eina "Imatge a text", aplicat pàgina a pàgina a tot el PDF. En el primer ús, el navegador descarrega el motor i el model d'idioma triat una sola vegada (pocs MB, mateixa origen); després funciona sense connexió.

    L'eina està pensada per a PDFs escanejats o compostos només d'imatges. El reconeixement depèn molt de la qualitat de l'escaneig: pàgines nítides, dretes i amb bon contrast es reconeixen molt bé; les tortes o borroses, molt pitjor; l'escriptura manual no es reconeix de manera fiable. En el PDF cercable cada pàgina es reincrusta com a imatge, de manera que el disseny es preserva però el fitxer pot créixer. Un PDF que ja conté text real no necessita OCR. Comprova el resultat en els nombres i els noms propis.

    El reconeixement de text sol ser terreny del núvol: els serveis d'OCR coneguts pugen cada escaneig als seus servidors per processar-lo - precisament documents com contractes, informes mèdics o documents d'identitat. Aquí tot el reconeixement s'executa amb Tesseract com a WebAssembly al teu navegador, i els 113 paquets d'idioma són allotjats al mateix gottrix - durant el reconeixement no es baixa res de tercers. A més, la llista d'idiomes comença preseleccionada segons l'idioma de la teva interfície. Gratis, sense compte i sense límit de pàgines.

    Fitxa tècnica

    Fitxa tècnica
    Formats d'entradaPDF
    Conversió automàticaPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Formats de sortidaPDF, TXT
    Processament per lots
    ProcessamentEn local al navegador (WebAssembly)
    Càrrega de fitxersCap

    En 3 passos

    1. Arrossega el PDF escanejat.
    2. Tria la sortida (PDF cercable o text) i l'idioma de la llista.
    3. Descarrega el PDF cercable o el fitxer TXT.

    Límits: Per a PDFs ESCANEJATS o d'imatges: els fa cercables via OCR (capa de text invisible) o retorna text pla. Reconeix text IMPRÈS en 113 idiomes i molts alfabets; escriptura manual no de manera fiable. Nota: la capa de text invisible del PDF cercable cobreix l'alfabet llatí amb totes les lletres accentuades (23 dels 113 idiomes, p. ex. polonès, txec, vietnamita, turc), el grec i el ciríl·lic. Els caràcters d'altres escriptures (p. ex. CJK, àrab, hebreu, devanagari, tai) s'hi ometen deliberadament en lloc de sortir deformats; per a aquestes escriptures, usa la sortida "Només text (TXT)", que retorna el text reconegut complet. En el PDF cercable cada pàgina es reincrusta com a imatge, el disseny es preserva però el fitxer pot créixer; un PDF amb text real no necessita OCR. El reconeixement no és perfecte: comprova especialment els nombres i els noms propis. El motor i el model d'idioma es descarreguen una sola vegada (pocs MB, mateixa origen), després l'eina funciona sense connexió. Els PDFs grans poden requerir més temps i memòria segons el nombre de pàgines i el dispositiu.

    Preguntes freqüents

    El meu PDF s'envia a algun servidor?

    No. La renderització i el reconeixement s'executen completament de manera local al navegador (WebAssembly); el PDF mai no surt del teu dispositiu, la qual cosa és l'avantatge decisiu sobretot per a contractes i correspondència oficial.

    Què és un PDF cercable?

    La pàgina té l'aparença de l'escaneig, però a sota hi ha una capa de text invisible. Això et permet cercar al PDF, seleccionar i copiar text sense que l'aspecte visual canviï.

    Es preserva el disseny?

    Sí. Cada pàgina s'incorpora com a imatge de la pàgina original amb la capa de text invisible alineada a sobre amb precisió. L'aparença no canvia, tot i que el fitxer pot créixer lleugerament.

    Reconeix l'escriptura manual o altres idiomes?

    Altres idiomes sí: més de 100 disponibles, incloent-hi l'àrab, el rus, l'hindi, el japonès, el coreà i el xinès. L'escriptura manual no es reconeix de manera fiable, només el text imprès. La capa de text del PDF cercable cobreix el llatí amb totes les lletres accentuades, el grec i el ciríl·lic; per a CJK, àrab, hebreu, devanagari o tai, usa la sortida "Només text (TXT)", que conté el text reconegut complet.

    Quants idiomes reconeix l'OCR?

    113 - del català, l'anglès i l'alemany a l'àrab, l'hindi i el tailandès, fins al japonès, el coreà i el xinès. Cada idioma apareix amb el seu propi nom a la llista, i tots els paquets d'idioma són allotjats al mateix gottrix, no a cap tercer.

    L'OCR de PDF és gratis, i hi ha límit de pàgines?

    Sí, totalment gratis - sense compte, sense marca d'aigua i sense límit de pàgines ni diari. Moltes pàgines simplement triguen proporcionalment més, perquè el reconeixement el calcula el teu propi dispositiu.

    Per què el reconeixement local és millor per a escanejos confidencials?

    Perquè l'escaneig no surt mai del teu dispositiu: sense pujada, sense processament en servidor, sense còpia en un núvol aliè. Després de la primera càrrega el reconeixement funciona fins i tot sense connexió - la prova més contundent que no es transmet res.

    Eines relacionades

    Imatge a text (OCR) · De PDF a Word · Comprimeix PDF · Convertir PDF a Markdown · PDF a text · De PDF a EPUB