Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
Markdown - это формат для заметок, вики, статических сайтов и инструментов ИИ: простой, пригодный для контроля версий и читаемый повсюду. До сих пор, чтобы повторно использовать содержимое PDF, приходилось кропотливо копировать текст вручную. Этот инструмент считывает текстовый слой PDF и возвращает его в виде Markdown с уже намеченной общей структурой - заголовки, маркированные списки и абзацы вместо сплошной стены текста.
Структура определяется по эвристике: строки, заметно крупнее основного текста, превращаются в заголовки (#, ## или ###) в зависимости от соотношения размеров; строки, начинающиеся с маркера или цифры, становятся списками Markdown; большой вертикальный промежуток между строками обозначает начало нового абзаца. Так из голых координат текста формируется читаемый и пригодный для дальнейшего использования Markdown-документ - отличная отправная точка для доработки в вашем редакторе.
Честно и важно: это приближение структуры, а не точное воспроизведение макета. Таблицы, многоколоночные страницы и тонкое форматирование невозможно без потерь извлечь из текстового слоя. Как и при простом извлечении текста: отсканированный или состоящий только из изображений PDF не имеет текстового слоя - в этом случае результат будет пустым, и вместо него следует использовать PDF OCR. Всё работает локально в браузере через pdf.js; ваш файл не покидает устройство.
Ограничения: Преобразует существующий текстовый слой PDF в Markdown (UTF-8 .md). Заголовки, списки и абзацы определяются эвристически по размеру шрифта и межстрочным интервалам - это приближение структуры, а не точное воспроизведение макета. Таблицы и многоколоночные страницы воспроизводятся только линейно. Отсканированные и состоящие только из изображений PDF не имеют текстового слоя; результат будет пустым - используйте PDF OCR. Снимите защиту паролем перед обработкой. Считывается только текст (getTextContent из pdf.js); встроенные изображения не переносятся в Markdown.
Частые вопросы
Как определяются заголовки?
По размеру шрифта: строки, заметно крупнее основного текста, преобразуются в #, ## или ### в зависимости от соотношения размеров.
Сохраняются ли таблицы и колонки?
Нет. Преобразование является приближением структуры; таблицы и многоколоночные макеты воспроизводятся только линейно, без точного восстановления.
Почему мой Markdown пустой?
Скорее всего, ваш PDF является сканом или состоит из изображений и не содержит текстового слоя. Воспользуйтесь PDF OCR, который распознаёт текст из пикселей.
PDF загружается на сервер?
Нет. Преобразование выполняется полностью локально в браузере через pdf.js; файл не покидает ваше устройство.
Что делать с защищённым паролем PDF?
Сначала снимите защиту с помощью другого инструмента, а затем обработайте файл здесь.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность