Жодної обробки вмісту ваших файлів на сервері не відбувається. Вам не потрібен договір про обробку даних із gottrix, щоб працювати з конфіденційними чи службовими документами.
Hosted in GermanyGlobal Content Delivery
Основні сервери розміщено в Hetzner у Німеччині, доставлення по всьому світу відбувається через мережу доставлення контенту (CDN). Вміст ваших файлів при цьому ніколи не передається - він не залишає ваш пристрій.
Цифри часто застрягають саме там, де ними не можна скористатися: у таблицях усередині PDF. Рахунки, звіти, банківські виписки, дослідження: кому потрібні ці значення в Excel, базі даних чи скрипті, той досі передруковував їх вручну або боровся з колонками, що розсипаються під час вставлення. Цей інструмент автоматично розпізнає таблиці в PDF і експортує їх зі збереженням структури: у CSV для електронних таблиць та імпорту, у книгу Excel (XLSX) з окремим аркушем для кожної таблиці або в JSON з координатами для обробки в коді.
Розпізнавання використовує ті самі дві техніки, на які спираються відомі спеціалізовані інструменти: таблиці з межами розпізнаються за реально намальованими на сторінці лініями (режим сітки); лінії утворюють сітку клітинок, і кожен текст потрапляє у свою клітинку. Таблиці без меж розпізнаються за вирівнюванням (режим відступів): блоки тексту, розташовані на тих самих позиціях колонок у кількох рядках, утворюють колонки, а суцільні проміжки визначають їхні межі. Автоматичний режим спершу шукає лінії, а за їх відсутності переходить до аналізу відступів; обидва режими можна обрати й примусово. Підтримуються кілька таблиць і багатосторінкові PDF: кожна знайдена таблиця експортується окремо.
Чесно і важливо: розпізнавання читає текстовий шар PDF. Сканований PDF, або той, що складається лише із зображень, такого шару не має; тоді інструмент прямо про це повідомляє, а не видає порожні чи вигадані таблиці. Спершу перетворіть скани за допомогою «PDF OCR», а потім витягайте таблиці. Складні макети мають межі: об'єднані клітинки чи вкладені таблиці передаються наближено, а не відтворюються піксель у піксель. Усе виконується локально у браузері через pdf.js; ваш файл ніколи не залишає пристрій.
Обмеження: Розпізнає таблиці за лініями меж (сітка) або за вирівнюванням тексту (відступи) та експортує їх у CSV (один файл на таблицю, кілька в ZIP), XLSX (один аркуш на таблицю) або JSON (зі сторінкою, клітинками та координатами в пунктах PDF). Потрібен справжній текстовий шар: скановані PDF спершу перетворіть за допомогою «PDF OCR». Об'єднані клітинки та складні макети передаються наближено; в Excel числами стають лише однозначні значення (десяткова крапка). Захищені паролем PDF спершу відкрийте інструментом «Розблокувати PDF».
Часті запитання
Як інструмент розпізнає таблиці?
Двома техніками: у таблицях з межами намальовані лінії утворюють сітку клітинок (режим сітки). У таблицях без меж колонки розпізнаються за вирівнюванням тексту та суцільними проміжками (режим відступів). Автоматичний режим сам обирає відповідну техніку.
Чому у моєму скані не знаходяться таблиці?
Скан складається лише з пікселів зображення, без читабельного текстового шару. Спершу перетворіть PDF на розпізнаваний текст за допомогою «PDF OCR», а потім витягніть таблиці.
Чи можна експортувати кілька таблиць і сторінок одразу?
Так. Переглядаються всі сторінки, і кожна знайдена таблиця експортується окремо: як власний CSV-файл (кілька збираються в ZIP), як окремий аркуш файлу Excel або як запис у JSON.
Що містить експорт у JSON?
Повну структуру: для кожної таблиці її сторінку, режим розпізнавання та позицію; для кожної клітинки її текст і обмежувальну рамку в пунктах PDF (початок координат унизу ліворуч). Ідеально для скриптів і конвеєрів даних.
Чому об'єднані клітинки виходять неточними?
Клітинка, об'єднана на кілька колонок, не має однозначної позиції в сітці; її вміст потрапляє в одну з клітинок, решта лишаються порожніми. Це чесне наближення: навіть спеціалізовані настільні програми не розв'язують це бездоганно.
Чи завантажується мій PDF на сервер?
Ні. Розпізнавання та експорт повністю виконуються локально у браузері через pdf.js; файл ніколи не залишає ваш пристрій.
Чи працює видобування таблиць на смартфоні або Chromebook?
Так, на будь-якому пристрої із сучасним браузером - Windows, Mac, Linux, Chromebook чи смартфон. Дуже великі PDF просто потребують на мобільних пристроях більше часу й пам'яті.
Лише за вашою згодою ми анонімно вимірюємо використання за допомогою файлів cookie, щоб покращувати gottrix. Ваші файли завжди залишаються локально, на вашому пристрої. Конфіденційність