it

PDF OCR ricercabile

Rendi ricercabile un PDF scansionato con OCR nel browser, con uno strato di testo invisibile sotto le pagine originali, senza caricare nulla.

Elaborazione in locale sul tuo dispositivo ...

Output
  • PDF ricercabile
  • Solo testo (TXT)
Lingua del documento
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

I tuoi file

    Elaborazione in locale sul tuo dispositivo ...

    0%

    Il mio file viene caricato?

    No. Tutto avviene nel tuo browser - il tuo file non lascia mai il dispositivo. Perché è verificabile

    Nessun caricamento100% in locale
    I contenuti restano tuoinessun accesso di terzi
    Hosted in GermanyGlobal Content Delivery
    Verificato esternamenteTLS A+ · Intestazioni A+

    Un PDF scansionato è in sostanza una serie di immagini: vedi il testo, ma non puoi selezionarlo, cercarlo o copiarlo. L'OCR (riconoscimento ottico dei caratteri) legge le lettere dall'immagine e le posiziona come strato di testo invisibile esattamente sopra le pagine. L'aspetto rimane identico, ma il PDF diventa ricercabile e il testo selezionabile, esattamente ciò che si aspettano uffici, archivi e motori di ricerca full-text.

    Scegli come output un PDF ricercabile (pagine originali con strato di testo) o testo semplice come TXT. Imposta la lingua del documento dall'elenco, 113 lingue dall'italiano, dal tedesco e dall'inglese fino al russo, all'arabo e all'hindi, passando per il giapponese, il coreano e il cinese, ognuna con il proprio nome, in modo che i caratteri vengano riconosciuti correttamente. Tutto avviene nel browser tramite WebAssembly: lo stesso motore Tesseract open source dello strumento "Immagine in testo", applicato pagina per pagina all'intero PDF. Al primo utilizzo il browser scarica una sola volta il motore e il modello di lingua scelto (pochi MB, stessa origine); dopodiché funziona offline.

    Lo strumento è pensato per PDF scansionati o composti solo da immagini. Il riconoscimento dipende molto dalla qualità della scansione: pagine nitide, dritte e ad alto contrasto vengono riconosciute molto bene; quelle storte o sfocate molto peggio; la scrittura a mano non viene riconosciuta in modo affidabile. Nel PDF ricercabile ogni pagina viene reinserita come immagine, quindi il layout viene preservato ma il file può aumentare di dimensione. Un PDF che contiene già del testo reale non ha bisogno di OCR. Controlla il risultato per i numeri e i nomi propri.

    Il riconoscimento del testo di solito è affare del cloud: i noti servizi OCR caricano ogni scansione sui loro server per elaborarla - proprio documenti come contratti, referti medici o documenti d'identità. Qui l'intero riconoscimento gira con Tesseract in WebAssembly nel tuo browser, e tutti i 113 pacchetti lingua sono ospitati su gottrix stesso - durante il riconoscimento non viene scaricato nulla da terzi. In più, l'elenco delle lingue parte già preselezionato in base alla lingua della tua interfaccia. Gratis, senza account e senza limite di pagine.

    Scheda tecnica

    Scheda tecnica
    Formati di inputPDF
    Conversione automaticaPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Formati di outputPDF, TXT
    Elaborazione in batch
    ElaborazioneIn locale nel browser (WebAssembly)
    Caricamento fileNessuno

    In 3 passaggi

    1. Trascina il PDF scansionato.
    2. Scegli l'output (PDF ricercabile o testo) e la lingua dall'elenco.
    3. Scarica il PDF ricercabile o il file TXT.

    Limiti: Per PDF SCANSIONATI o immagine: li rende ricercabili tramite OCR (strato di testo invisibile) o restituisce testo semplice. Riconosce testo STAMPATO in 113 lingue e molti alfabeti; scrittura a mano non affidabile. Nota: lo strato di testo invisibile del PDF ricercabile copre l'alfabeto latino con tutte le lettere accentate (23 delle 113 lingue, ad es. polacco, ceco, vietnamita, turco), il greco e il cirillico. I caratteri di altre scritture (ad es. CJK, arabo, ebraico, devanagari, thai) vengono volutamente omessi invece che alterati; per queste scritture usa l'output "Solo testo (TXT)", che restituisce il testo riconosciuto completo. Nel PDF ricercabile ogni pagina viene reinserita come immagine, il layout viene preservato ma il file può crescere; un PDF con testo reale non ha bisogno di OCR. Il riconoscimento non è privo di errori: controlla in particolare i numeri e i nomi propri. Il motore e il modello di lingua vengono scaricati una sola volta (pochi MB, stessa origine), poi lo strumento funziona offline. I PDF di grandi dimensioni possono richiedere tempo e memoria in base al numero di pagine e al dispositivo.

    Domande frequenti

    Il mio PDF viene caricato su un server?

    No. Il rendering e il riconoscimento avvengono interamente in locale nel browser (WebAssembly); il PDF non lascia mai il tuo dispositivo, il che è il vantaggio decisivo soprattutto per contratti e corrispondenza ufficiale.

    Che cos'è un PDF ricercabile?

    La pagina ha l'aspetto della scansione, ma sotto c'è uno strato di testo invisibile. Questo ti permette di cercare nel PDF, selezionare e copiare il testo senza che l'aspetto visivo cambi.

    Il layout viene preservato?

    Sì. Ogni pagina viene incorporata come immagine della pagina originale con lo strato di testo invisibile allineato sopra con precisione. L'aspetto non cambia, anche se il file può crescere leggermente.

    Riconosce la scrittura a mano o altre lingue?

    Altre lingue sì: oltre 100 disponibili, tra cui arabo, russo, hindi, giapponese, coreano e cinese. La scrittura a mano non viene riconosciuta in modo affidabile, solo il testo stampato. Lo strato di testo del PDF ricercabile copre il latino con tutte le lettere accentate, il greco e il cirillico; per CJK, arabo, ebraico, devanagari o thai usa l'output "Solo testo (TXT)", che contiene il testo riconosciuto completo.

    Quante lingue riconosce l'OCR?

    113 - dall'italiano, inglese e tedesco all'arabo, hindi e thai, fino a giapponese, coreano e cinese. Ogni lingua compare con il proprio nome nell'elenco, e tutti i pacchetti lingua sono ospitati su gottrix stesso, non presso terzi.

    L'OCR dei PDF è gratis, e c'è un limite di pagine?

    Sì, completamente gratis - senza account, senza filigrana e senza limiti di pagine o giornalieri. Tante pagine richiedono solo proporzionalmente più tempo, perché il riconoscimento lo calcola il tuo stesso dispositivo.

    Perché il riconoscimento locale è meglio per scansioni riservate?

    Perché la scansione non lascia mai il tuo dispositivo: nessun upload, nessuna elaborazione su server, nessuna copia in un cloud altrui. Dopo il primo caricamento il riconoscimento funziona persino offline - la prova più forte che nulla viene trasmesso.

    Strumenti correlati

    Immagine in testo (OCR) · PDF in Word · Comprimi PDF · Da PDF a Markdown · PDF in testo · PDF in EPUB