Non avviene alcun trattamento dei contenuti dei tuoi file. Non ti serve un accordo sul trattamento dei dati con gottrix per gestire documenti riservati o aziendali.
Hosted in GermanyGlobal Content Delivery
Server di origine presso Hetzner in Germania, distribuzione mondiale tramite una rete di distribuzione dei contenuti (CDN). Il contenuto dei tuoi file non viene mai trasmesso in questo processo - non lascia il tuo dispositivo.
Markdown è il formato ideale per appunti, wiki, siti statici e strumenti di intelligenza artificiale: semplice, versionabile e leggibile ovunque. Chi vuole riutilizzare il contenuto di un PDF in questi contesti deve finora copiarlo faticosamente. Questo strumento legge il livello testo del PDF e lo restituisce come Markdown con la struttura generale già impostata - titoli, elenchi puntati e paragrafi al posto di un unico blocco di testo.
La struttura viene rilevata tramite euristica: le righe con un corpo notevolmente più grande del testo normale diventano titoli (#, ## o ###), le righe che iniziano con un punto elenco o un numero vengono trasformate in elenchi Markdown, e una spaziatura verticale maggiore tra le righe indica un nuovo paragrafo. Dalle sole posizioni del testo grezzo si ottiene un documento Markdown leggibile e riutilizzabile - un punto di partenza ideale da perfezionare nel proprio editor.
Onesto e importante: si tratta di un'approssimazione strutturale, non di una ricostruzione fedele del layout. Tabelle, pagine multicolonna e formattazioni dettagliate non possono essere derivate senza perdita dal livello testo. Come per l'estrazione di testo semplice: un PDF scansionato o composto solo da immagini non ha un livello testo - il risultato resterà vuoto e sarà necessario usare il riconoscimento testo PDF OCR. Tutto viene eseguito localmente nel browser tramite pdf.js; il file non lascia il tuo dispositivo.
Limiti: Converte il livello testo esistente di un PDF in Markdown (UTF-8 .md). Titoli, elenchi e paragrafi vengono rilevati in modo euristico dalla dimensione del carattere e dalla spaziatura - un'approssimazione strutturale, non una ricostruzione esatta del layout. Tabelle e pagine multicolonna vengono solo approssimate linearmente. I PDF scansionati o composti solo da immagini non hanno un livello testo; il risultato resta vuoto, usa PDF OCR in alternativa. Sblocca prima i PDF protetti da password. Viene letto solo il testo (getTextContent di pdf.js); le immagini incorporate non vengono riportate nel Markdown.
Domande frequenti
Come vengono rilevati i titoli?
In base alla dimensione del carattere: le righe notevolmente più grandi del testo normale diventano #, ## o ### a seconda del rapporto.
Tabelle e colonne vengono conservate?
No. La conversione è un'approssimazione strutturale; tabelle e layout multicolonna vengono solo approssimati linearmente, senza ricostruzione fedele.
Perché il mio Markdown è vuoto?
Il tuo PDF è probabilmente una scansione o è composto da immagini e non ha un livello testo. Usa PDF OCR, che riconosce il testo dai pixel.
Il PDF viene caricato su un server?
No. La conversione avviene interamente in locale nel browser tramite pdf.js; il file non lascia il tuo dispositivo.
Solo con il tuo consenso misuriamo l'utilizzo in forma anonimizzata tramite cookie per migliorare gottrix. I tuoi file restano sempre in locale, sul tuo dispositivo. Privacy