Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
Цифры часто застревают именно там, где ими нельзя воспользоваться: в таблицах внутри PDF. Счета, отчёты, банковские выписки, исследования: тому, кому нужны эти значения в Excel, базе данных или скрипте, до сих пор приходилось перепечатывать их вручную или сражаться с колонками, рассыпающимися при вставке. Этот инструмент автоматически распознаёт таблицы в PDF и экспортирует их с сохранением структуры: в CSV для электронных таблиц и импорта, в книгу Excel (XLSX) с отдельным листом для каждой таблицы или в JSON с координатами для обработки в коде.
Распознавание использует те же две техники, на которые опираются известные специализированные инструменты: таблицы с границами распознаются по реально нарисованным на странице линиям (режим сетки); линии образуют сетку ячеек, и каждый текст попадает в свою ячейку. Таблицы без границ распознаются по выравниванию (режим отступов): блоки текста, стоящие на одних и тех же позициях колонок в нескольких строках, образуют колонки, а сплошные промежутки задают их границы. Автоматический режим сначала ищет линии, а при их отсутствии переходит к анализу отступов; оба режима можно выбрать и принудительно. Поддерживаются несколько таблиц и многостраничные PDF: каждая найденная таблица экспортируется отдельно.
Честно и важно: распознавание читает текстовый слой PDF. У отсканированного или состоящего только из изображений PDF такого слоя нет; в этом случае инструмент прямо сообщает об этом, а не выдаёт пустые или выдуманные таблицы. Сначала преобразуйте сканы с помощью «PDF OCR», затем извлекайте таблицы. У сложных макетов есть пределы: объединённые ячейки и вложенные таблицы передаются приближённо, а не восстанавливаются пиксель в пиксель. Всё выполняется локально в браузере через pdf.js; ваш файл никогда не покидает устройство.
Технические данные
Технические данные
Входные форматы
PDF
Автоматическое преобразование
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Выходные форматы
CSV, XLSX, JSON
Пакетная обработка
Нет
Обработка
Локально в браузере (JavaScript)
Загрузка файлов
Отсутствует
В 3 шага
Перетащите ваш PDF.
Выберите формат вывода и способ распознавания.
Скачайте таблицы в CSV, XLSX или JSON.
Ограничения: Распознаёт таблицы по линиям границ (сетка) или по выравниванию текста (отступы) и экспортирует их в CSV (один файл на таблицу, несколько в ZIP), XLSX (один лист на таблицу) или JSON (со страницей, ячейками и координатами в пунктах PDF). Нужен настоящий текстовый слой: отсканированные PDF сначала преобразуйте с помощью «PDF OCR». Объединённые ячейки и сложные макеты передаются приближённо; в Excel числами становятся только однозначные значения (десятичная точка). Защищённые паролем PDF сначала откройте инструментом «Разблокировать PDF».
Частые вопросы
Как инструмент распознаёт таблицы?
Двумя техниками: в таблицах с границами нарисованные линии образуют сетку ячеек (режим сетки). В таблицах без границ колонки распознаются по выравниванию текста и сплошным промежуткам (режим отступов). Автоматический режим сам выбирает подходящую технику.
Почему в моём скане не находятся таблицы?
Скан состоит только из пикселей изображения, без читаемого текстового слоя. Сначала преобразуйте PDF в распознаваемый текст с помощью «PDF OCR», затем извлеките таблицы.
Можно ли экспортировать несколько таблиц и страниц сразу?
Да. Просматриваются все страницы, и каждая найденная таблица экспортируется отдельно: как собственный CSV-файл (несколько собираются в ZIP), как отдельный лист файла Excel или как запись в JSON.
Что содержит экспорт в JSON?
Полную структуру: для каждой таблицы её страницу, режим распознавания и позицию; для каждой ячейки её текст и ограничивающий прямоугольник в пунктах PDF (начало координат внизу слева). Идеально для скриптов и конвейеров данных.
Почему объединённые ячейки получаются неточными?
У ячейки, объединённой на несколько колонок, нет однозначной позиции в сетке; её содержимое попадает в одну из ячеек, остальные остаются пустыми. Это честное приближение: даже специализированные настольные программы не решают это безошибочно.
Загружается ли мой PDF на сервер?
Нет. Распознавание и экспорт полностью выполняются локально в браузере через pdf.js; файл никогда не покидает ваше устройство.
Работает ли извлечение таблиц на смартфоне или Chromebook?
Да, на любом устройстве с современным браузером - Windows, Mac, Linux, Chromebook или смартфон. Очень большие PDF просто требуют на мобильных устройствах больше времени и памяти.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность