Жодної обробки вмісту ваших файлів на сервері не відбувається. Вам не потрібен договір про обробку даних із gottrix, щоб працювати з конфіденційними чи службовими документами.
Hosted in GermanyGlobal Content Delivery
Основні сервери розміщено в Hetzner у Німеччині, доставлення по всьому світу відбувається через мережу доставлення контенту (CDN). Вміст ваших файлів при цьому ніколи не передається - він не залишає ваш пристрій.
Markdown - це формат для нотаток, вікі, статичних сайтів та інструментів ШІ: простий, придатний для контролю версій і читабельний будь-де. Досі, щоб повторно використати вміст PDF, доводилося кропітко копіювати текст вручну. Цей інструмент зчитує текстовий шар PDF і повертає його у вигляді Markdown із вже накресленою загальною структурою - заголовки, марковані списки та абзаци замість суцільної стіни тексту.
Структура визначається за евристикою: рядки, що помітно крупніші за основний текст, перетворюються на заголовки (#, ## або ###) залежно від співвідношення розмірів; рядки, що починаються з маркера або цифри, стають списками Markdown; великий вертикальний проміжок між рядками позначає початок нового абзацу. Так із голих координат тексту формується читабельний і придатний для подальшого використання Markdown-документ - чудова відправна точка для доопрацювання у вашому редакторі.
Чесно і важливо: це наближення структури, а не точне відтворення макета. Таблиці, багатоколонкові сторінки та тонке форматування неможливо без втрат витягти з текстового шару. Як і при звичайному витяганні тексту: відсканований або складений лише із зображень PDF не має текстового шару - у цьому випадку результат буде порожнім, і замість цього слід скористатися PDF OCR. Усе працює локально у браузері через pdf.js; ваш файл не залишає пристрій.
Обмеження: Перетворює наявний текстовий шар PDF на Markdown (UTF-8 .md). Заголовки, списки та абзаци визначаються евристично за розміром шрифту й міжрядковими інтервалами - це наближення структури, а не точне відтворення макета. Таблиці та багатоколонкові сторінки відтворюються лише лінійно. Відскановані та складені лише із зображень PDF не мають текстового шару; результат буде порожнім - скористайтеся PDF OCR. Знімайте захист паролем перед обробкою. Зчитується лише текст (getTextContent з pdf.js); вбудовані зображення не переносяться до Markdown.
Часті запитання
Як визначаються заголовки?
За розміром шрифту: рядки, що помітно крупніші за основний текст, перетворюються на #, ## або ### залежно від співвідношення розмірів.
Чи зберігаються таблиці та колонки?
Ні. Перетворення є наближенням структури; таблиці та багатоколонкові макети відтворюються лише лінійно, без точного відновлення.
Чому мій Markdown порожній?
Ймовірно, ваш PDF є скан-копією або складається із зображень і не містить текстового шару. Скористайтеся PDF OCR, який розпізнає текст із пікселів.
PDF завантажується на сервер?
Ні. Перетворення виконується повністю локально у браузері через pdf.js; файл не залишає ваш пристрій.
Що робити з PDF, захищеним паролем?
Спочатку зніміть захист за допомогою іншого інструменту, а потім обробіть файл тут.
Лише за вашою згодою ми анонімно вимірюємо використання за допомогою файлів cookie, щоб покращувати gottrix. Ваші файли завжди залишаються локально, на вашому пристрої. Конфіденційність