ru

Таблицы из PDF

Распознайте таблицы в PDF и экспортируйте их в CSV, Excel (XLSX) или JSON, с линиями или без. Локально в браузере, без загрузки на сервер.

Обработка локально на вашем устройстве ...

Формат вывода Целевой формат итогового файла.
  • CSV
  • Excel (XLSX)
  • JSON
Распознавание таблиц
  • Автоматически
  • С линиями (сетка)
  • Без линий (отступы)
Разделитель
  • Запятая
  • Точка с запятой
  • Табуляция

Ваши файлы

    Обработка локально на вашем устройстве ...

    0%

    Ваши файлы так и не покинули устройство

      Продолжить с этим файлом

      Без повторной загрузки

      Эти инструменты принимают .CSV - ваш файл передаётся напрямую.

      Загружается ли мой файл?

      Нет. Всё выполняется в вашем браузере - ваш файл никогда не покидает устройство. Как это можно проверить

      Без загрузки100% локально
      Содержимое остаётся у васнет доступа у третьих лиц
      Hosted in GermanyGlobal Content Delivery
      Независимый аудитTLS A+ · Заголовки A+

      Цифры часто застревают именно там, где ими нельзя воспользоваться: в таблицах внутри PDF. Счета, отчёты, банковские выписки, исследования: тому, кому нужны эти значения в Excel, базе данных или скрипте, до сих пор приходилось перепечатывать их вручную или сражаться с колонками, рассыпающимися при вставке. Этот инструмент автоматически распознаёт таблицы в PDF и экспортирует их с сохранением структуры: в CSV для электронных таблиц и импорта, в книгу Excel (XLSX) с отдельным листом для каждой таблицы или в JSON с координатами для обработки в коде.

      Распознавание использует те же две техники, на которые опираются известные специализированные инструменты: таблицы с границами распознаются по реально нарисованным на странице линиям (режим сетки); линии образуют сетку ячеек, и каждый текст попадает в свою ячейку. Таблицы без границ распознаются по выравниванию (режим отступов): блоки текста, стоящие на одних и тех же позициях колонок в нескольких строках, образуют колонки, а сплошные промежутки задают их границы. Автоматический режим сначала ищет линии, а при их отсутствии переходит к анализу отступов; оба режима можно выбрать и принудительно. Поддерживаются несколько таблиц и многостраничные PDF: каждая найденная таблица экспортируется отдельно.

      Честно и важно: распознавание читает текстовый слой PDF. У отсканированного или состоящего только из изображений PDF такого слоя нет; в этом случае инструмент прямо сообщает об этом, а не выдаёт пустые или выдуманные таблицы. Сначала преобразуйте сканы с помощью «PDF OCR», затем извлекайте таблицы. У сложных макетов есть пределы: объединённые ячейки и вложенные таблицы передаются приближённо, а не восстанавливаются пиксель в пиксель. Всё выполняется локально в браузере через pdf.js; ваш файл никогда не покидает устройство.

      Технические данные

      Технические данные
      Входные форматыPDF
      Автоматическое преобразованиеPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      Выходные форматыCSV, XLSX, JSON
      Пакетная обработкаНет
      ОбработкаЛокально в браузере (JavaScript)
      Загрузка файловОтсутствует

      В 3 шага

      1. Перетащите ваш PDF.
      2. Выберите формат вывода и способ распознавания.
      3. Скачайте таблицы в CSV, XLSX или JSON.

      Ограничения: Распознаёт таблицы по линиям границ (сетка) или по выравниванию текста (отступы) и экспортирует их в CSV (один файл на таблицу, несколько в ZIP), XLSX (один лист на таблицу) или JSON (со страницей, ячейками и координатами в пунктах PDF). Нужен настоящий текстовый слой: отсканированные PDF сначала преобразуйте с помощью «PDF OCR». Объединённые ячейки и сложные макеты передаются приближённо; в Excel числами становятся только однозначные значения (десятичная точка). Защищённые паролем PDF сначала откройте инструментом «Разблокировать PDF».

      Частые вопросы

      Как инструмент распознаёт таблицы?

      Двумя техниками: в таблицах с границами нарисованные линии образуют сетку ячеек (режим сетки). В таблицах без границ колонки распознаются по выравниванию текста и сплошным промежуткам (режим отступов). Автоматический режим сам выбирает подходящую технику.

      Почему в моём скане не находятся таблицы?

      Скан состоит только из пикселей изображения, без читаемого текстового слоя. Сначала преобразуйте PDF в распознаваемый текст с помощью «PDF OCR», затем извлеките таблицы.

      Можно ли экспортировать несколько таблиц и страниц сразу?

      Да. Просматриваются все страницы, и каждая найденная таблица экспортируется отдельно: как собственный CSV-файл (несколько собираются в ZIP), как отдельный лист файла Excel или как запись в JSON.

      Что содержит экспорт в JSON?

      Полную структуру: для каждой таблицы её страницу, режим распознавания и позицию; для каждой ячейки её текст и ограничивающий прямоугольник в пунктах PDF (начало координат внизу слева). Идеально для скриптов и конвейеров данных.

      Почему объединённые ячейки получаются неточными?

      У ячейки, объединённой на несколько колонок, нет однозначной позиции в сетке; её содержимое попадает в одну из ячеек, остальные остаются пустыми. Это честное приближение: даже специализированные настольные программы не решают это безошибочно.

      Загружается ли мой PDF на сервер?

      Нет. Распознавание и экспорт полностью выполняются локально в браузере через pdf.js; файл никогда не покидает ваше устройство.

      Работает ли извлечение таблиц на смартфоне или Chromebook?

      Да, на любом устройстве с современным браузером - Windows, Mac, Linux, Chromebook или смартфон. Очень большие PDF просто требуют на мобильных устройствах больше времени и памяти.

      Похожие инструменты

      PDF в текст · PDF OCR - поиск по PDF · XLSX в CSV · CSV в XLSX · CSV в JSON · PDF в Markdown