Преобразувайте текстовия слой на PDF файл в Markdown локално - заглавия, списъци и абзаци се разпознават автоматично по структурата. Без качване на сървър.
Обработва се локално на устройството ви ...
!
i
Не е правилният инструмент? Вижте 3 сходни инструмента
Съдържанието остава у теббез достъп на трети страни
Не възниква обработка на съдържанието на файловете ти. Не ти трябва договор за обработка на данни с gottrix, за да работиш с поверителни или служебни документи.
Hosted in GermanyGlobal Content Delivery
Основни сървъри в Hetzner в Германия, глобално доставяне чрез мрежа за доставяне на съдържание (CDN). Съдържанието на файловете ти никога не се предава в този процес - то не напуска устройството ти.
Markdown е форматът за бележки, уикита, статични сайтове и инструменти за изкуствен интелект: прост, подходящ за версионен контрол и четим навсякъде. До момента, за да се преизползва съдържанието на PDF файл, се налагаше трудоемко ръчно копиране на текст. Този инструмент прочита текстовия слой на PDF и го връща като Markdown с вече очертана обща структура - заглавия, списъци с водещи символи и абзаци вместо монолитна стена от текст.
Структурата се разпознава по евристичен начин: редове, забележително по-едри от основния текст, се превръщат в заглавия (#, ## или ###) в зависимост от съотношението на размерите; редове, започващи с водещ символ или цифра, стават Markdown списъци; по-голям вертикален интервал между редовете отбелязва началото на нов абзац. По този начин от чистите координати на текста се получава четим и пригоден за по-нататъшна употреба Markdown документ - идеална отправна точка за финално редактиране.
Честно и важно: това е приближение на структурата, а не точно възпроизвеждане на оформлението. Таблици, многоколонни страници и фино форматиране не могат да бъдат извлечени без загуби от текстовия слой. Както при обикновено извличане на текст: сканиран или съставен само от изображения PDF няма текстов слой - в такъв случай резултатът ще е празен и вместо това трябва да използвате PDF OCR. Всичко работи локално в браузъра чрез pdf.js; файлът ви не напуска устройството.
Ограничения: Преобразува съществуващия текстов слой на PDF в Markdown (UTF-8 .md). Заглавия, списъци и абзаци се разпознават евристично по размер на шрифта и интервали - приближение на структурата, а не точно възпроизвеждане на оформлението. Таблиците и многоколонните страници се възпроизвеждат само линейно. Сканирани и съставени само от изображения PDF файлове нямат текстов слой; резултатът ще е празен - използвайте PDF OCR. Първо премахнете защитата с парола при нужда. Чете се само текстът (getTextContent на pdf.js); вградените изображения не се пренасят в Markdown.
Чести въпроси
Как се разпознават заглавията?
По размер на шрифта: редове, забележително по-едри от основния текст, се превръщат в #, ## или ### в зависимост от съотношението на размерите.
Запазват ли се таблиците и колоните?
Не. Преобразуването е приближение на структурата; таблиците и многоколонните оформления се възпроизвеждат само линейно, без точно пресъздаване.
Защо Markdown е празен?
Вероятно вашият PDF е скан или е съставен от изображения и няма текстов слой. Използвайте PDF OCR, който разпознава текст от пиксели.
PDF файлът качва ли се на сървър?
Не. Преобразуването протича изцяло локално в браузъра чрез pdf.js; файлът не напуска устройството ви.
Поддържат ли се PDF файлове с парола?
Първо премахнете защитата с парола с друг инструмент, след което обработете файла тук.
Само с вашето съгласие измерваме употребата анонимно чрез бисквитки, за да подобряваме gottrix. Вашите файлове винаги остават локално, на вашето устройство. Поверителност