ru

PDF в текст

Извлеките текстовый слой PDF в простой файл .txt, чтобы копировать, использовать дальше или искать. Локально, без загрузки.

Обработка локально на вашем устройстве ...

Ваши файлы

    Обработка локально на вашем устройстве ...

    0%

    Загружается ли мой файл?

    Нет. Всё выполняется в вашем браузере - ваш файл никогда не покидает устройство. Как это можно проверить

    Без загрузки100% локально
    Содержимое остаётся у васнет доступа у третьих лиц
    Hosted in GermanyGlobal Content Delivery
    Независимый аудитTLS A+ · Заголовки A+

    Иногда нужен просто чистый текст из PDF: перенести цитату в документ, скопировать договор в редактор, проиндексировать содержимое для поиска или архива либо передать текст программе чтения с экрана. Этот инструмент считывает встроенный в PDF текстовый слой и возвращает его как простой файл .txt - без шрифтов, изображений, цветов или вёрстки, только символы.

    Порядок восстанавливается постранично: фрагменты текста на одной высоте образуют строку, читаемую сверху вниз и слева направо. Страницы разделяются пустой строкой, поэтому результат легко использовать дальше, импортировать или искать по нему.

    Важно и честно: этот инструмент извлекает только текст, уже присутствующий в PDF как текстовый слой. Отсканированный или составленный целиком из фотографий PDF не содержит такого слоя - там результат останется пустым, и вместо этого вам нужно распознавание текста «PDF OCR», которое находит буквы по пикселям. Сложные многоколоночные макеты с таблицами или сносками тоже не всегда идеально сводятся к линейному порядку текста. Но для обычных, «настоящих» PDF (созданных офисными программами, браузерами или системами вёрстки) извлечение даёт чистый, пригодный для дальнейшего использования текст. Всё выполняется локально в браузере через pdf.js; ваш файл не покидает устройство.

    Технические данные

    Технические данные
    Входные форматыPDF
    Автоматическое преобразованиеPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Выходной форматTXT
    Пакетная обработкаНет
    ОбработкаЛокально в браузере (JavaScript)
    Загрузка файловОтсутствует

    В 3 шага

    1. Перетащите ваш PDF.
    2. Текст извлекается автоматически.
    3. Скачайте текст как .txt.

    Ограничения: Извлекает существующий текстовый слой PDF и возвращает его как файл .txt в UTF-8; строки восстанавливаются из позиций текста. У отсканированных или чисто графических PDF текстового слоя нет, там результат остаётся пустым: используйте тогда PDF OCR. Шрифты, изображения, цвета и точный макет (многоколоночные страницы, таблицы) теряются или лишь линейно приближаются. Защищённые паролем PDF сначала откройте с помощью Разблокировать PDF.

    Частые вопросы

    Почему мой текстовый файл пустой?

    Скорее всего, ваш PDF - это скан или состоит из изображений и не имеет текстового слоя. Используйте тогда PDF OCR, который распознаёт текст из пикселей.

    Сохраняется ли макет?

    Нет. Вы получаете чистый текст в порядке чтения. Шрифты, изображения, колонки и таблицы не воспроизводятся в точности.

    В какой кодировке файл?

    В UTF-8, так что кириллица и специальные символы сохраняются корректно.

    Как разделяются несколько страниц?

    Пустой строкой между страницами.

    Загружается ли PDF?

    Нет, извлечение текста происходит полностью локально в браузере.

    Похожие инструменты

    PDF OCR - поиск по PDF · PDF в Word · Извлечь страницы PDF · PDF в Markdown · DOCX в HTML · DOCX в Markdown