ru

Таблицы из PDF

Распознайте таблицы в PDF и экспортируйте их в CSV, Excel (XLSX) или JSON, с линиями или без. Локально в браузере, без загрузки на сервер.

Обработка локально на вашем устройстве ...

Формат вывода Целевой формат итогового файла.
  • CSV
  • Excel (XLSX)
  • JSON
Распознавание таблиц
  • Автоматически
  • С линиями (сетка)
  • Без линий (отступы)
Разделитель
  • Запятая
  • Точка с запятой
  • Табуляция

Ваши файлы

    Обработка локально на вашем устройстве ...

    0%

    Загружается ли мой файл?

    Нет. Всё выполняется в вашем браузере - ваш файл никогда не покидает устройство. Как это можно проверить

    Без загрузки100% локально
    Содержимое остаётся у васнет доступа у третьих лиц
    Hosted in GermanyGlobal Content Delivery
    Независимый аудитTLS A+ · Заголовки A+

    Цифры часто застревают именно там, где ими нельзя воспользоваться: в таблицах внутри PDF. Счета, отчёты, банковские выписки, исследования: тому, кому нужны эти значения в Excel, базе данных или скрипте, до сих пор приходилось перепечатывать их вручную или сражаться с колонками, рассыпающимися при вставке. Этот инструмент автоматически распознаёт таблицы в PDF и экспортирует их с сохранением структуры: в CSV для электронных таблиц и импорта, в книгу Excel (XLSX) с отдельным листом для каждой таблицы или в JSON с координатами для обработки в коде.

    Распознавание использует те же две техники, на которые опираются известные специализированные инструменты: таблицы с границами распознаются по реально нарисованным на странице линиям (режим сетки); линии образуют сетку ячеек, и каждый текст попадает в свою ячейку. Таблицы без границ распознаются по выравниванию (режим отступов): блоки текста, стоящие на одних и тех же позициях колонок в нескольких строках, образуют колонки, а сплошные промежутки задают их границы. Автоматический режим сначала ищет линии, а при их отсутствии переходит к анализу отступов; оба режима можно выбрать и принудительно. Поддерживаются несколько таблиц и многостраничные PDF: каждая найденная таблица экспортируется отдельно.

    Честно и важно: распознавание читает текстовый слой PDF. У отсканированного или состоящего только из изображений PDF такого слоя нет; в этом случае инструмент прямо сообщает об этом, а не выдаёт пустые или выдуманные таблицы. Сначала преобразуйте сканы с помощью «PDF OCR», затем извлекайте таблицы. У сложных макетов есть пределы: объединённые ячейки и вложенные таблицы передаются приближённо, а не восстанавливаются пиксель в пиксель. Всё выполняется локально в браузере через pdf.js; ваш файл никогда не покидает устройство.

    Технические данные

    Технические данные
    Входные форматыPDF
    Автоматическое преобразованиеPNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
    Выходные форматыCSV, XLSX, JSON
    Пакетная обработкаНет
    ОбработкаЛокально в браузере (JavaScript)
    Загрузка файловОтсутствует

    В 3 шага

    1. Перетащите ваш PDF.
    2. Выберите формат вывода и способ распознавания.
    3. Скачайте таблицы в CSV, XLSX или JSON.

    Ограничения: Распознаёт таблицы по линиям границ (сетка) или по выравниванию текста (отступы) и экспортирует их в CSV (один файл на таблицу, несколько в ZIP), XLSX (один лист на таблицу) или JSON (со страницей, ячейками и координатами в пунктах PDF). Нужен настоящий текстовый слой: отсканированные PDF сначала преобразуйте с помощью «PDF OCR». Объединённые ячейки и сложные макеты передаются приближённо; в Excel числами становятся только однозначные значения (десятичная точка). Защищённые паролем PDF сначала откройте инструментом «Разблокировать PDF».

    Частые вопросы

    Как инструмент распознаёт таблицы?

    Двумя техниками: в таблицах с границами нарисованные линии образуют сетку ячеек (режим сетки). В таблицах без границ колонки распознаются по выравниванию текста и сплошным промежуткам (режим отступов). Автоматический режим сам выбирает подходящую технику.

    Почему в моём скане не находятся таблицы?

    Скан состоит только из пикселей изображения, без читаемого текстового слоя. Сначала преобразуйте PDF в распознаваемый текст с помощью «PDF OCR», затем извлеките таблицы.

    Можно ли экспортировать несколько таблиц и страниц сразу?

    Да. Просматриваются все страницы, и каждая найденная таблица экспортируется отдельно: как собственный CSV-файл (несколько собираются в ZIP), как отдельный лист файла Excel или как запись в JSON.

    Что содержит экспорт в JSON?

    Полную структуру: для каждой таблицы её страницу, режим распознавания и позицию; для каждой ячейки её текст и ограничивающий прямоугольник в пунктах PDF (начало координат внизу слева). Идеально для скриптов и конвейеров данных.

    Почему объединённые ячейки получаются неточными?

    У ячейки, объединённой на несколько колонок, нет однозначной позиции в сетке; её содержимое попадает в одну из ячеек, остальные остаются пустыми. Это честное приближение: даже специализированные настольные программы не решают это безошибочно.

    Загружается ли мой PDF на сервер?

    Нет. Распознавание и экспорт полностью выполняются локально в браузере через pdf.js; файл никогда не покидает ваше устройство.

    Работает ли извлечение таблиц на смартфоне или Chromebook?

    Да, на любом устройстве с современным браузером - Windows, Mac, Linux, Chromebook или смартфон. Очень большие PDF просто требуют на мобильных устройствах больше времени и памяти.

    Похожие инструменты

    PDF в текст · PDF OCR - поиск по PDF · XLSX в CSV · CSV в XLSX · CSV в JSON · PDF в Markdown