bg

Таблици от PDF

Разпознайте таблиците в PDF и ги експортирайте като CSV, Excel (XLSX) или JSON, с линии или без. Локално в браузъра, без качване.

Обработва се локално на устройството ви ...

Изходен формат Целевият формат на изходния файл.
  • CSV
  • Excel (XLSX)
  • JSON
Разпознаване на таблици
  • Автоматично
  • С линии (мрежа)
  • Без линии (интервали)
Разделител
  • Запетая
  • Точка и запетая
  • Табулация

Вашите файлове

    Обработва се локално на устройството ви ...

    0%

    Качва ли се файлът ми?

    Не. Всичко работи в браузъра ви - файлът ви никога не напуска устройството. Как се проверява това

    Без качване100% локално
    Съдържанието остава у теббез достъп на трети страни
    Hosted in GermanyGlobal Content Delivery
    Независимо провереноTLS A+ · Заглавки A+

    Числата често остават заклещени точно там, където не могат да се използват: в таблици в PDF. Фактури, отчети, банкови извлечения, проучвания: който има нужда от тези стойности в Excel, база данни или скрипт, досега ги преписваше ръчно или се бореше с колони, които се разпадат при поставяне. Този инструмент разпознава таблиците в PDF автоматично и ги експортира със запазена структура: като CSV за електронни таблици и импорт, като работна книга на Excel (XLSX) с отделен лист за всяка таблица или като JSON с координати за обработка в код.

    Разпознаването използва същите две техники, на които разчитат познатите специализирани инструменти: таблиците с рамки се разпознават по реално начертаните на страницата линии (режим мрежа); линиите образуват мрежата от клетки и всеки текст се насочва към своята клетка. Таблиците без рамки се разпознават по подравняването (режим интервали): текстовите блокове, разположени на едни и същи позиции на колони в няколко реда, образуват колоните, а непрекъснатите празнини очертават границите им. Автоматичният режим първо търси линии и при липса преминава към анализ на интервалите; и двата режима могат да се изберат и принудително. Поддържат се няколко таблици и многостранични PDF файлове: всяка открита таблица се експортира отделно.

    Честно и важно: разпознаването чете текстовия слой на PDF. Сканиран PDF или такъв само от изображения няма такъв слой; тогава инструментът го казва открито, вместо да произвежда празни или измислени таблици. Първо преобразувайте сканираните файлове с "PDF OCR", после извличайте таблиците. Сложните оформления имат граници: обединените клетки и вложените таблици се предават приблизително, а не се възстановяват пиксел по пиксел. Всичко се изпълнява локално в браузъра чрез pdf.js; вашият файл никога не напуска устройството ви.

    Технически данни

    Технически данни
    Входни форматиPDF
    Автоматично конвертиранеPNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
    Изходни форматиCSV, XLSX, JSON
    Пакетна обработкаНе
    ОбработкаЛокално в браузъра (JavaScript)
    Качване на файловеНяма

    В 3 стъпки

    1. Пуснете вашия PDF.
    2. Изберете изходен формат и разпознаване.
    3. Изтеглете таблиците като CSV, XLSX или JSON.

    Ограничения: Разпознава таблици по линиите на рамката (мрежа) или по подравняването на текста (интервали) и ги експортира като CSV (по един файл на таблица, няколко в ZIP), XLSX (по един лист на таблица) или JSON (със страница, клетки и позиции в PDF пунктове). Изисква истински текстов слой: първо преобразувайте сканираните PDF файлове с "PDF OCR". Обединените клетки и сложните оформления се предават приблизително; в Excel само еднозначните числа (десетична точка) стават числови клетки. Защитените с парола PDF файлове първо отворете с "Отключване на PDF".

    Чести въпроси

    Как инструментът разпознава таблиците?

    С две техники: при таблиците с рамки начертаните линии образуват мрежата от клетки (режим мрежа). При таблиците без рамки колоните се разпознават по подравняването на текста и непрекъснатите празнини (режим интервали). Автоматичният режим сам избира подходящата техника.

    Защо не намира таблици в моя сканиран документ?

    Сканът е само пиксели от изображение, без четим текстов слой. Първо преобразувайте PDF в търсим текст с "PDF OCR", после извлечете таблиците.

    Мога ли да експортирам няколко таблици и страници наведнъж?

    Да. Преглеждат се всички страници и всяка открита таблица се експортира отделно: като собствен CSV файл (няколко се събират в ZIP), като отделен лист във файл на Excel или като запис в JSON.

    Какво съдържа JSON експортът?

    Пълната структура: за всяка таблица нейната страница, режим на разпознаване и позиция; за всяка клетка нейният текст и ограждащата ѝ рамка в PDF пунктове (начало долу вляво). Идеално за скриптове и конвейери за данни.

    Защо обединените клетки не излизат точни?

    Клетка, обединена върху няколко колони, няма еднозначна позиция в мрежата; съдържанието ѝ попада в една от клетките, а останалите остават празни. Това е честно приближение: дори специализираните настолни програми не решават това безгрешно.

    Качва ли се моят PDF някъде?

    Не. Разпознаването и експортът се изпълняват изцяло локално в браузъра чрез pdf.js; файлът никога не напуска устройството ви.

    Работи ли извличането на таблици и на смартфон или Chromebook?

    Да, на всяко устройство с актуален браузър - Windows, Mac, Linux, Chromebook или смартфон. Много големите PDF файлове просто изискват повече време и памет на мобилни устройства.

    Сходни инструменти

    PDF в текстов файл · PDF OCR - търсене · XLSX към CSV · CSV към XLSX · CSV към JSON · PDF към Markdown