bg

Таблици от PDF

Разпознайте таблиците в PDF и ги експортирайте като CSV, Excel (XLSX) или JSON, с линии или без. Локално в браузъра, без качване.

Обработва се локално на устройството ви ...

Изходен формат Целевият формат на изходния файл.
  • CSV
  • Excel (XLSX)
  • JSON
Разпознаване на таблици
  • Автоматично
  • С линии (мрежа)
  • Без линии (интервали)
Разделител
  • Запетая
  • Точка и запетая
  • Табулация

Вашите файлове

    Обработва се локално на устройството ви ...

    0%

    Вашите файлове така и не напуснаха устройството ви

      Продължи с този файл

      Без ново качване

      Тези инструменти приемат .CSV - файлът ти се предава директно.

      Качва ли се файлът ми?

      Не. Всичко работи в браузъра ви - файлът ви никога не напуска устройството. Как се проверява това

      Без качване100% локално
      Съдържанието остава у теббез достъп на трети страни
      Hosted in GermanyGlobal Content Delivery
      Независимо провереноTLS A+ · Заглавки A+

      Числата често остават заклещени точно там, където не могат да се използват: в таблици в PDF. Фактури, отчети, банкови извлечения, проучвания: който има нужда от тези стойности в Excel, база данни или скрипт, досега ги преписваше ръчно или се бореше с колони, които се разпадат при поставяне. Този инструмент разпознава таблиците в PDF автоматично и ги експортира със запазена структура: като CSV за електронни таблици и импорт, като работна книга на Excel (XLSX) с отделен лист за всяка таблица или като JSON с координати за обработка в код.

      Разпознаването използва същите две техники, на които разчитат познатите специализирани инструменти: таблиците с рамки се разпознават по реално начертаните на страницата линии (режим мрежа); линиите образуват мрежата от клетки и всеки текст се насочва към своята клетка. Таблиците без рамки се разпознават по подравняването (режим интервали): текстовите блокове, разположени на едни и същи позиции на колони в няколко реда, образуват колоните, а непрекъснатите празнини очертават границите им. Автоматичният режим първо търси линии и при липса преминава към анализ на интервалите; и двата режима могат да се изберат и принудително. Поддържат се няколко таблици и многостранични PDF файлове: всяка открита таблица се експортира отделно.

      Честно и важно: разпознаването чете текстовия слой на PDF. Сканиран PDF или такъв само от изображения няма такъв слой; тогава инструментът го казва открито, вместо да произвежда празни или измислени таблици. Първо преобразувайте сканираните файлове с "PDF OCR", после извличайте таблиците. Сложните оформления имат граници: обединените клетки и вложените таблици се предават приблизително, а не се възстановяват пиксел по пиксел. Всичко се изпълнява локално в браузъра чрез pdf.js; вашият файл никога не напуска устройството ви.

      Технически данни

      Технически данни
      Входни форматиPDF
      Автоматично конвертиранеPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      Изходни форматиCSV, XLSX, JSON
      Пакетна обработкаНе
      ОбработкаЛокално в браузъра (JavaScript)
      Качване на файловеНяма

      В 3 стъпки

      1. Пуснете вашия PDF.
      2. Изберете изходен формат и разпознаване.
      3. Изтеглете таблиците като CSV, XLSX или JSON.

      Ограничения: Разпознава таблици по линиите на рамката (мрежа) или по подравняването на текста (интервали) и ги експортира като CSV (по един файл на таблица, няколко в ZIP), XLSX (по един лист на таблица) или JSON (със страница, клетки и позиции в PDF пунктове). Изисква истински текстов слой: първо преобразувайте сканираните PDF файлове с "PDF OCR". Обединените клетки и сложните оформления се предават приблизително; в Excel само еднозначните числа (десетична точка) стават числови клетки. Защитените с парола PDF файлове първо отворете с "Отключване на PDF".

      Чести въпроси

      Как инструментът разпознава таблиците?

      С две техники: при таблиците с рамки начертаните линии образуват мрежата от клетки (режим мрежа). При таблиците без рамки колоните се разпознават по подравняването на текста и непрекъснатите празнини (режим интервали). Автоматичният режим сам избира подходящата техника.

      Защо не намира таблици в моя сканиран документ?

      Сканът е само пиксели от изображение, без четим текстов слой. Първо преобразувайте PDF в търсим текст с "PDF OCR", после извлечете таблиците.

      Мога ли да експортирам няколко таблици и страници наведнъж?

      Да. Преглеждат се всички страници и всяка открита таблица се експортира отделно: като собствен CSV файл (няколко се събират в ZIP), като отделен лист във файл на Excel или като запис в JSON.

      Какво съдържа JSON експортът?

      Пълната структура: за всяка таблица нейната страница, режим на разпознаване и позиция; за всяка клетка нейният текст и ограждащата ѝ рамка в PDF пунктове (начало долу вляво). Идеално за скриптове и конвейери за данни.

      Защо обединените клетки не излизат точни?

      Клетка, обединена върху няколко колони, няма еднозначна позиция в мрежата; съдържанието ѝ попада в една от клетките, а останалите остават празни. Това е честно приближение: дори специализираните настолни програми не решават това безгрешно.

      Качва ли се моят PDF някъде?

      Не. Разпознаването и експортът се изпълняват изцяло локално в браузъра чрез pdf.js; файлът никога не напуска устройството ви.

      Работи ли извличането на таблици и на смартфон или Chromebook?

      Да, на всяко устройство с актуален браузър - Windows, Mac, Linux, Chromebook или смартфон. Много големите PDF файлове просто изискват повече време и памет на мобилни устройства.

      Сходни инструменти

      PDF в текстов файл · PDF OCR - търсене · XLSX към CSV · CSV към XLSX · CSV към JSON · PDF към Markdown