Non avviene alcun trattamento dei contenuti dei tuoi file. Non ti serve un accordo sul trattamento dei dati con gottrix per gestire documenti riservati o aziendali.
Hosted in GermanyGlobal Content Delivery
Server di origine presso Hetzner in Germania, distribuzione mondiale tramite una rete di distribuzione dei contenuti (CDN). Il contenuto dei tuoi file non viene mai trasmesso in questo processo - non lascia il tuo dispositivo.
Un PDF scansionato è in sostanza una serie di immagini: vedi il testo, ma non puoi selezionarlo, cercarlo o copiarlo. L'OCR (riconoscimento ottico dei caratteri) legge le lettere dall'immagine e le posiziona come strato di testo invisibile esattamente sopra le pagine. L'aspetto rimane identico, ma il PDF diventa ricercabile e il testo selezionabile, esattamente ciò che si aspettano uffici, archivi e motori di ricerca full-text.
Scegli come output un PDF ricercabile (pagine originali con strato di testo) o testo semplice come TXT. Imposta la lingua del documento dall'elenco, 113 lingue dall'italiano, dal tedesco e dall'inglese fino al russo, all'arabo e all'hindi, passando per il giapponese, il coreano e il cinese, ognuna con il proprio nome, in modo che i caratteri vengano riconosciuti correttamente. Tutto avviene nel browser tramite WebAssembly: lo stesso motore Tesseract open source dello strumento "Immagine in testo", applicato pagina per pagina all'intero PDF. Al primo utilizzo il browser scarica una sola volta il motore e il modello di lingua scelto (pochi MB, stessa origine); dopodiché funziona offline.
Lo strumento è pensato per PDF scansionati o composti solo da immagini. Il riconoscimento dipende molto dalla qualità della scansione: pagine nitide, dritte e ad alto contrasto vengono riconosciute molto bene; quelle storte o sfocate molto peggio; la scrittura a mano non viene riconosciuta in modo affidabile. Nel PDF ricercabile ogni pagina viene reinserita come immagine, quindi il layout viene preservato ma il file può aumentare di dimensione. Un PDF che contiene già del testo reale non ha bisogno di OCR. Controlla il risultato per i numeri e i nomi propri.
Il riconoscimento del testo di solito è affare del cloud: i noti servizi OCR caricano ogni scansione sui loro server per elaborarla - proprio documenti come contratti, referti medici o documenti d'identità. Qui l'intero riconoscimento gira con Tesseract in WebAssembly nel tuo browser, e tutti i 113 pacchetti lingua sono ospitati su gottrix stesso - durante il riconoscimento non viene scaricato nulla da terzi. In più, l'elenco delle lingue parte già preselezionato in base alla lingua della tua interfaccia. Gratis, senza account e senza limite di pagine.
Scegli l'output (PDF ricercabile o testo) e la lingua dall'elenco.
Scarica il PDF ricercabile o il file TXT.
Limiti: Per PDF SCANSIONATI o immagine: li rende ricercabili tramite OCR (strato di testo invisibile) o restituisce testo semplice. Riconosce testo STAMPATO in 113 lingue e molti alfabeti; scrittura a mano non affidabile. Nota: lo strato di testo invisibile del PDF ricercabile copre l'alfabeto latino con tutte le lettere accentate (23 delle 113 lingue, ad es. polacco, ceco, vietnamita, turco), il greco e il cirillico. I caratteri di altre scritture (ad es. CJK, arabo, ebraico, devanagari, thai) vengono volutamente omessi invece che alterati; per queste scritture usa l'output "Solo testo (TXT)", che restituisce il testo riconosciuto completo. Nel PDF ricercabile ogni pagina viene reinserita come immagine, il layout viene preservato ma il file può crescere; un PDF con testo reale non ha bisogno di OCR. Il riconoscimento non è privo di errori: controlla in particolare i numeri e i nomi propri. Il motore e il modello di lingua vengono scaricati una sola volta (pochi MB, stessa origine), poi lo strumento funziona offline. I PDF di grandi dimensioni possono richiedere tempo e memoria in base al numero di pagine e al dispositivo.
Domande frequenti
Il mio PDF viene caricato su un server?
No. Il rendering e il riconoscimento avvengono interamente in locale nel browser (WebAssembly); il PDF non lascia mai il tuo dispositivo, il che è il vantaggio decisivo soprattutto per contratti e corrispondenza ufficiale.
Che cos'è un PDF ricercabile?
La pagina ha l'aspetto della scansione, ma sotto c'è uno strato di testo invisibile. Questo ti permette di cercare nel PDF, selezionare e copiare il testo senza che l'aspetto visivo cambi.
Il layout viene preservato?
Sì. Ogni pagina viene incorporata come immagine della pagina originale con lo strato di testo invisibile allineato sopra con precisione. L'aspetto non cambia, anche se il file può crescere leggermente.
Riconosce la scrittura a mano o altre lingue?
Altre lingue sì: oltre 100 disponibili, tra cui arabo, russo, hindi, giapponese, coreano e cinese. La scrittura a mano non viene riconosciuta in modo affidabile, solo il testo stampato. Lo strato di testo del PDF ricercabile copre il latino con tutte le lettere accentate, il greco e il cirillico; per CJK, arabo, ebraico, devanagari o thai usa l'output "Solo testo (TXT)", che contiene il testo riconosciuto completo.
Quante lingue riconosce l'OCR?
113 - dall'italiano, inglese e tedesco all'arabo, hindi e thai, fino a giapponese, coreano e cinese. Ogni lingua compare con il proprio nome nell'elenco, e tutti i pacchetti lingua sono ospitati su gottrix stesso, non presso terzi.
L'OCR dei PDF è gratis, e c'è un limite di pagine?
Sì, completamente gratis - senza account, senza filigrana e senza limiti di pagine o giornalieri. Tante pagine richiedono solo proporzionalmente più tempo, perché il riconoscimento lo calcola il tuo stesso dispositivo.
Perché il riconoscimento locale è meglio per scansioni riservate?
Perché la scansione non lascia mai il tuo dispositivo: nessun upload, nessuna elaborazione su server, nessuna copia in un cloud altrui. Dopo il primo caricamento il riconoscimento funziona persino offline - la prova più forte che nulla viene trasmesso.
Solo con il tuo consenso misuriamo l'utilizzo in forma anonimizzata tramite cookie per migliorare gottrix. I tuoi file restano sempre in locale, sul tuo dispositivo. Privacy