uk

Таблиці з PDF

Розпізнайте таблиці у PDF та експортуйте їх у CSV, Excel (XLSX) або JSON, з лініями чи без. Локально у браузері, без завантаження.

Обробка локально на вашому пристрої ...

Формат виводу Цільовий формат підсумкового файлу.
  • CSV
  • Excel (XLSX)
  • JSON
Розпізнавання таблиць
  • Автоматично
  • З лініями (сітка)
  • Без ліній (відступи)
Роздільник
  • Кома
  • Крапка з комою
  • Табуляція

Ваші файли

    Обробка локально на вашому пристрої ...

    0%

    Чи завантажується мій файл?

    Ні. Усе працює у вашому браузері - ваш файл ніколи не залишає пристрій. Як це перевірити

    Без завантаження100% локально
    Вміст лишається у васбез доступу третіх осіб
    Hosted in GermanyGlobal Content Delivery
    Незалежний аудитTLS A+ · Заголовки A+

    Цифри часто застрягають саме там, де ними не можна скористатися: у таблицях усередині PDF. Рахунки, звіти, банківські виписки, дослідження: кому потрібні ці значення в Excel, базі даних чи скрипті, той досі передруковував їх вручну або боровся з колонками, що розсипаються під час вставлення. Цей інструмент автоматично розпізнає таблиці в PDF і експортує їх зі збереженням структури: у CSV для електронних таблиць та імпорту, у книгу Excel (XLSX) з окремим аркушем для кожної таблиці або в JSON з координатами для обробки в коді.

    Розпізнавання використовує ті самі дві техніки, на які спираються відомі спеціалізовані інструменти: таблиці з межами розпізнаються за реально намальованими на сторінці лініями (режим сітки); лінії утворюють сітку клітинок, і кожен текст потрапляє у свою клітинку. Таблиці без меж розпізнаються за вирівнюванням (режим відступів): блоки тексту, розташовані на тих самих позиціях колонок у кількох рядках, утворюють колонки, а суцільні проміжки визначають їхні межі. Автоматичний режим спершу шукає лінії, а за їх відсутності переходить до аналізу відступів; обидва режими можна обрати й примусово. Підтримуються кілька таблиць і багатосторінкові PDF: кожна знайдена таблиця експортується окремо.

    Чесно і важливо: розпізнавання читає текстовий шар PDF. Сканований PDF, або той, що складається лише із зображень, такого шару не має; тоді інструмент прямо про це повідомляє, а не видає порожні чи вигадані таблиці. Спершу перетворіть скани за допомогою «PDF OCR», а потім витягайте таблиці. Складні макети мають межі: об'єднані клітинки чи вкладені таблиці передаються наближено, а не відтворюються піксель у піксель. Усе виконується локально у браузері через pdf.js; ваш файл ніколи не залишає пристрій.

    Технічні дані

    Технічні дані
    Вхідні форматиPDF
    Автоматичне перетворенняPNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
    Вихідні форматиCSV, XLSX, JSON
    Пакетна обробкаНі
    ОбробкаЛокально в браузері (JavaScript)
    Завантаження файлівНемає

    У 3 кроки

    1. Перетягніть ваш PDF.
    2. Оберіть формат виводу та спосіб розпізнавання.
    3. Завантажте таблиці у CSV, XLSX або JSON.

    Обмеження: Розпізнає таблиці за лініями меж (сітка) або за вирівнюванням тексту (відступи) та експортує їх у CSV (один файл на таблицю, кілька в ZIP), XLSX (один аркуш на таблицю) або JSON (зі сторінкою, клітинками та координатами в пунктах PDF). Потрібен справжній текстовий шар: скановані PDF спершу перетворіть за допомогою «PDF OCR». Об'єднані клітинки та складні макети передаються наближено; в Excel числами стають лише однозначні значення (десяткова крапка). Захищені паролем PDF спершу відкрийте інструментом «Розблокувати PDF».

    Часті запитання

    Як інструмент розпізнає таблиці?

    Двома техніками: у таблицях з межами намальовані лінії утворюють сітку клітинок (режим сітки). У таблицях без меж колонки розпізнаються за вирівнюванням тексту та суцільними проміжками (режим відступів). Автоматичний режим сам обирає відповідну техніку.

    Чому у моєму скані не знаходяться таблиці?

    Скан складається лише з пікселів зображення, без читабельного текстового шару. Спершу перетворіть PDF на розпізнаваний текст за допомогою «PDF OCR», а потім витягніть таблиці.

    Чи можна експортувати кілька таблиць і сторінок одразу?

    Так. Переглядаються всі сторінки, і кожна знайдена таблиця експортується окремо: як власний CSV-файл (кілька збираються в ZIP), як окремий аркуш файлу Excel або як запис у JSON.

    Що містить експорт у JSON?

    Повну структуру: для кожної таблиці її сторінку, режим розпізнавання та позицію; для кожної клітинки її текст і обмежувальну рамку в пунктах PDF (початок координат унизу ліворуч). Ідеально для скриптів і конвеєрів даних.

    Чому об'єднані клітинки виходять неточними?

    Клітинка, об'єднана на кілька колонок, не має однозначної позиції в сітці; її вміст потрапляє в одну з клітинок, решта лишаються порожніми. Це чесне наближення: навіть спеціалізовані настільні програми не розв'язують це бездоганно.

    Чи завантажується мій PDF на сервер?

    Ні. Розпізнавання та експорт повністю виконуються локально у браузері через pdf.js; файл ніколи не залишає ваш пристрій.

    Чи працює видобування таблиць на смартфоні або Chromebook?

    Так, на будь-якому пристрої із сучасним браузером - Windows, Mac, Linux, Chromebook чи смартфон. Дуже великі PDF просто потребують на мобільних пристроях більше часу й пам'яті.

    Схожі інструменти

    PDF у текст · PDF OCR пошук · XLSX у CSV · CSV у XLSX · CSV у JSON · PDF у Markdown