Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
Иногда нужен просто чистый текст из PDF: перенести цитату в документ, скопировать договор в редактор, проиндексировать содержимое для поиска или архива либо передать текст программе чтения с экрана. Этот инструмент считывает встроенный в PDF текстовый слой и возвращает его как простой файл .txt - без шрифтов, изображений, цветов или вёрстки, только символы.
Порядок восстанавливается постранично: фрагменты текста на одной высоте образуют строку, читаемую сверху вниз и слева направо. Страницы разделяются пустой строкой, поэтому результат легко использовать дальше, импортировать или искать по нему.
Важно и честно: этот инструмент извлекает только текст, уже присутствующий в PDF как текстовый слой. Отсканированный или составленный целиком из фотографий PDF не содержит такого слоя - там результат останется пустым, и вместо этого вам нужно распознавание текста «PDF OCR», которое находит буквы по пикселям. Сложные многоколоночные макеты с таблицами или сносками тоже не всегда идеально сводятся к линейному порядку текста. Но для обычных, «настоящих» PDF (созданных офисными программами, браузерами или системами вёрстки) извлечение даёт чистый, пригодный для дальнейшего использования текст. Всё выполняется локально в браузере через pdf.js; ваш файл не покидает устройство.
Ограничения: Извлекает существующий текстовый слой PDF и возвращает его как файл .txt в UTF-8; строки восстанавливаются из позиций текста. У отсканированных или чисто графических PDF текстового слоя нет, там результат остаётся пустым: используйте тогда PDF OCR. Шрифты, изображения, цвета и точный макет (многоколоночные страницы, таблицы) теряются или лишь линейно приближаются. Защищённые паролем PDF сначала откройте с помощью Разблокировать PDF.
Частые вопросы
Почему мой текстовый файл пустой?
Скорее всего, ваш PDF - это скан или состоит из изображений и не имеет текстового слоя. Используйте тогда PDF OCR, который распознаёт текст из пикселей.
Сохраняется ли макет?
Нет. Вы получаете чистый текст в порядке чтения. Шрифты, изображения, колонки и таблицы не воспроизводятся в точности.
В какой кодировке файл?
В UTF-8, так что кириллица и специальные символы сохраняются корректно.
Как разделяются несколько страниц?
Пустой строкой между страницами.
Загружается ли PDF?
Нет, извлечение текста происходит полностью локально в браузере.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность