Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
Цифры часто застревают именно там, где ими нельзя воспользоваться: в таблицах внутри PDF. Счета, отчёты, банковские выписки, исследования: тому, кому нужны эти значения в Excel, базе данных или скрипте, до сих пор приходилось перепечатывать их вручную или сражаться с колонками, рассыпающимися при вставке. Этот инструмент автоматически распознаёт таблицы в PDF и экспортирует их с сохранением структуры: в CSV для электронных таблиц и импорта, в книгу Excel (XLSX) с отдельным листом для каждой таблицы или в JSON с координатами для обработки в коде.
Распознавание использует те же две техники, на которые опираются известные специализированные инструменты: таблицы с границами распознаются по реально нарисованным на странице линиям (режим сетки); линии образуют сетку ячеек, и каждый текст попадает в свою ячейку. Таблицы без границ распознаются по выравниванию (режим отступов): блоки текста, стоящие на одних и тех же позициях колонок в нескольких строках, образуют колонки, а сплошные промежутки задают их границы. Автоматический режим сначала ищет линии, а при их отсутствии переходит к анализу отступов; оба режима можно выбрать и принудительно. Поддерживаются несколько таблиц и многостраничные PDF: каждая найденная таблица экспортируется отдельно.
Честно и важно: распознавание читает текстовый слой PDF. У отсканированного или состоящего только из изображений PDF такого слоя нет; в этом случае инструмент прямо сообщает об этом, а не выдаёт пустые или выдуманные таблицы. Сначала преобразуйте сканы с помощью «PDF OCR», затем извлекайте таблицы. У сложных макетов есть пределы: объединённые ячейки и вложенные таблицы передаются приближённо, а не восстанавливаются пиксель в пиксель. Всё выполняется локально в браузере через pdf.js; ваш файл никогда не покидает устройство.
Ограничения: Распознаёт таблицы по линиям границ (сетка) или по выравниванию текста (отступы) и экспортирует их в CSV (один файл на таблицу, несколько в ZIP), XLSX (один лист на таблицу) или JSON (со страницей, ячейками и координатами в пунктах PDF). Нужен настоящий текстовый слой: отсканированные PDF сначала преобразуйте с помощью «PDF OCR». Объединённые ячейки и сложные макеты передаются приближённо; в Excel числами становятся только однозначные значения (десятичная точка). Защищённые паролем PDF сначала откройте инструментом «Разблокировать PDF».
Частые вопросы
Как инструмент распознаёт таблицы?
Двумя техниками: в таблицах с границами нарисованные линии образуют сетку ячеек (режим сетки). В таблицах без границ колонки распознаются по выравниванию текста и сплошным промежуткам (режим отступов). Автоматический режим сам выбирает подходящую технику.
Почему в моём скане не находятся таблицы?
Скан состоит только из пикселей изображения, без читаемого текстового слоя. Сначала преобразуйте PDF в распознаваемый текст с помощью «PDF OCR», затем извлеките таблицы.
Можно ли экспортировать несколько таблиц и страниц сразу?
Да. Просматриваются все страницы, и каждая найденная таблица экспортируется отдельно: как собственный CSV-файл (несколько собираются в ZIP), как отдельный лист файла Excel или как запись в JSON.
Что содержит экспорт в JSON?
Полную структуру: для каждой таблицы её страницу, режим распознавания и позицию; для каждой ячейки её текст и ограничивающий прямоугольник в пунктах PDF (начало координат внизу слева). Идеально для скриптов и конвейеров данных.
Почему объединённые ячейки получаются неточными?
У ячейки, объединённой на несколько колонок, нет однозначной позиции в сетке; её содержимое попадает в одну из ячеек, остальные остаются пустыми. Это честное приближение: даже специализированные настольные программы не решают это безошибочно.
Загружается ли мой PDF на сервер?
Нет. Распознавание и экспорт полностью выполняются локально в браузере через pdf.js; файл никогда не покидает ваше устройство.
Работает ли извлечение таблиц на смартфоне или Chromebook?
Да, на любом устройстве с современным браузером - Windows, Mac, Linux, Chromebook или смартфон. Очень большие PDF просто требуют на мобильных устройствах больше времени и памяти.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность