Жодної обробки вмісту ваших файлів на сервері не відбувається. Вам не потрібен договір про обробку даних із gottrix, щоб працювати з конфіденційними чи службовими документами.
Hosted in GermanyGlobal Content Delivery
Основні сервери розміщено в Hetzner у Німеччині, доставлення по всьому світу відбувається через мережу доставлення контенту (CDN). Вміст ваших файлів при цьому ніколи не передається - він не залишає ваш пристрій.
Цифри часто застрягають саме там, де ними не можна скористатися: у таблицях усередині PDF. Рахунки, звіти, банківські виписки, дослідження: кому потрібні ці значення в Excel, базі даних чи скрипті, той досі передруковував їх вручну або боровся з колонками, що розсипаються під час вставлення. Цей інструмент автоматично розпізнає таблиці в PDF і експортує їх зі збереженням структури: у CSV для електронних таблиць та імпорту, у книгу Excel (XLSX) з окремим аркушем для кожної таблиці або в JSON з координатами для обробки в коді.
Розпізнавання використовує ті самі дві техніки, на які спираються відомі спеціалізовані інструменти: таблиці з межами розпізнаються за реально намальованими на сторінці лініями (режим сітки); лінії утворюють сітку клітинок, і кожен текст потрапляє у свою клітинку. Таблиці без меж розпізнаються за вирівнюванням (режим відступів): блоки тексту, розташовані на тих самих позиціях колонок у кількох рядках, утворюють колонки, а суцільні проміжки визначають їхні межі. Автоматичний режим спершу шукає лінії, а за їх відсутності переходить до аналізу відступів; обидва режими можна обрати й примусово. Підтримуються кілька таблиць і багатосторінкові PDF: кожна знайдена таблиця експортується окремо.
Чесно і важливо: розпізнавання читає текстовий шар PDF. Сканований PDF, або той, що складається лише із зображень, такого шару не має; тоді інструмент прямо про це повідомляє, а не видає порожні чи вигадані таблиці. Спершу перетворіть скани за допомогою «PDF OCR», а потім витягайте таблиці. Складні макети мають межі: об'єднані клітинки чи вкладені таблиці передаються наближено, а не відтворюються піксель у піксель. Усе виконується локально у браузері через pdf.js; ваш файл ніколи не залишає пристрій.
Технічні дані
Технічні дані
Вхідні формати
PDF
Автоматичне перетворення
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Вихідні формати
CSV, XLSX, JSON
Пакетна обробка
Ні
Обробка
Локально в браузері (JavaScript)
Завантаження файлів
Немає
У 3 кроки
Перетягніть ваш PDF.
Оберіть формат виводу та спосіб розпізнавання.
Завантажте таблиці у CSV, XLSX або JSON.
Обмеження: Розпізнає таблиці за лініями меж (сітка) або за вирівнюванням тексту (відступи) та експортує їх у CSV (один файл на таблицю, кілька в ZIP), XLSX (один аркуш на таблицю) або JSON (зі сторінкою, клітинками та координатами в пунктах PDF). Потрібен справжній текстовий шар: скановані PDF спершу перетворіть за допомогою «PDF OCR». Об'єднані клітинки та складні макети передаються наближено; в Excel числами стають лише однозначні значення (десяткова крапка). Захищені паролем PDF спершу відкрийте інструментом «Розблокувати PDF».
Часті запитання
Як інструмент розпізнає таблиці?
Двома техніками: у таблицях з межами намальовані лінії утворюють сітку клітинок (режим сітки). У таблицях без меж колонки розпізнаються за вирівнюванням тексту та суцільними проміжками (режим відступів). Автоматичний режим сам обирає відповідну техніку.
Чому у моєму скані не знаходяться таблиці?
Скан складається лише з пікселів зображення, без читабельного текстового шару. Спершу перетворіть PDF на розпізнаваний текст за допомогою «PDF OCR», а потім витягніть таблиці.
Чи можна експортувати кілька таблиць і сторінок одразу?
Так. Переглядаються всі сторінки, і кожна знайдена таблиця експортується окремо: як власний CSV-файл (кілька збираються в ZIP), як окремий аркуш файлу Excel або як запис у JSON.
Що містить експорт у JSON?
Повну структуру: для кожної таблиці її сторінку, режим розпізнавання та позицію; для кожної клітинки її текст і обмежувальну рамку в пунктах PDF (початок координат унизу ліворуч). Ідеально для скриптів і конвеєрів даних.
Чому об'єднані клітинки виходять неточними?
Клітинка, об'єднана на кілька колонок, не має однозначної позиції в сітці; її вміст потрапляє в одну з клітинок, решта лишаються порожніми. Це чесне наближення: навіть спеціалізовані настільні програми не розв'язують це бездоганно.
Чи завантажується мій PDF на сервер?
Ні. Розпізнавання та експорт повністю виконуються локально у браузері через pdf.js; файл ніколи не залишає ваш пристрій.
Чи працює видобування таблиць на смартфоні або Chromebook?
Так, на будь-якому пристрої із сучасним браузером - Windows, Mac, Linux, Chromebook чи смартфон. Дуже великі PDF просто потребують на мобільних пристроях більше часу й пам'яті.
Лише за вашою згодою ми анонімно вимірюємо використання за допомогою файлів cookie, щоб покращувати gottrix. Ваші файли завжди залишаються локально, на вашому пристрої. Конфіденційність