Съдържанието остава у теббез достъп на трети страни
Не възниква обработка на съдържанието на файловете ти. Не ти трябва договор за обработка на данни с gottrix, за да работиш с поверителни или служебни документи.
Hosted in GermanyGlobal Content Delivery
Основни сървъри в Hetzner в Германия, глобално доставяне чрез мрежа за доставяне на съдържание (CDN). Съдържанието на файловете ти никога не се предава в този процес - то не напуска устройството ти.
Числата често остават заклещени точно там, където не могат да се използват: в таблици в PDF. Фактури, отчети, банкови извлечения, проучвания: който има нужда от тези стойности в Excel, база данни или скрипт, досега ги преписваше ръчно или се бореше с колони, които се разпадат при поставяне. Този инструмент разпознава таблиците в PDF автоматично и ги експортира със запазена структура: като CSV за електронни таблици и импорт, като работна книга на Excel (XLSX) с отделен лист за всяка таблица или като JSON с координати за обработка в код.
Разпознаването използва същите две техники, на които разчитат познатите специализирани инструменти: таблиците с рамки се разпознават по реално начертаните на страницата линии (режим мрежа); линиите образуват мрежата от клетки и всеки текст се насочва към своята клетка. Таблиците без рамки се разпознават по подравняването (режим интервали): текстовите блокове, разположени на едни и същи позиции на колони в няколко реда, образуват колоните, а непрекъснатите празнини очертават границите им. Автоматичният режим първо търси линии и при липса преминава към анализ на интервалите; и двата режима могат да се изберат и принудително. Поддържат се няколко таблици и многостранични PDF файлове: всяка открита таблица се експортира отделно.
Честно и важно: разпознаването чете текстовия слой на PDF. Сканиран PDF или такъв само от изображения няма такъв слой; тогава инструментът го казва открито, вместо да произвежда празни или измислени таблици. Първо преобразувайте сканираните файлове с "PDF OCR", после извличайте таблиците. Сложните оформления имат граници: обединените клетки и вложените таблици се предават приблизително, а не се възстановяват пиксел по пиксел. Всичко се изпълнява локално в браузъра чрез pdf.js; вашият файл никога не напуска устройството ви.
Технически данни
Технически данни
Входни формати
PDF
Автоматично конвертиране
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Изходни формати
CSV, XLSX, JSON
Пакетна обработка
Не
Обработка
Локално в браузъра (JavaScript)
Качване на файлове
Няма
В 3 стъпки
Пуснете вашия PDF.
Изберете изходен формат и разпознаване.
Изтеглете таблиците като CSV, XLSX или JSON.
Ограничения: Разпознава таблици по линиите на рамката (мрежа) или по подравняването на текста (интервали) и ги експортира като CSV (по един файл на таблица, няколко в ZIP), XLSX (по един лист на таблица) или JSON (със страница, клетки и позиции в PDF пунктове). Изисква истински текстов слой: първо преобразувайте сканираните PDF файлове с "PDF OCR". Обединените клетки и сложните оформления се предават приблизително; в Excel само еднозначните числа (десетична точка) стават числови клетки. Защитените с парола PDF файлове първо отворете с "Отключване на PDF".
Чести въпроси
Как инструментът разпознава таблиците?
С две техники: при таблиците с рамки начертаните линии образуват мрежата от клетки (режим мрежа). При таблиците без рамки колоните се разпознават по подравняването на текста и непрекъснатите празнини (режим интервали). Автоматичният режим сам избира подходящата техника.
Защо не намира таблици в моя сканиран документ?
Сканът е само пиксели от изображение, без четим текстов слой. Първо преобразувайте PDF в търсим текст с "PDF OCR", после извлечете таблиците.
Мога ли да експортирам няколко таблици и страници наведнъж?
Да. Преглеждат се всички страници и всяка открита таблица се експортира отделно: като собствен CSV файл (няколко се събират в ZIP), като отделен лист във файл на Excel или като запис в JSON.
Какво съдържа JSON експортът?
Пълната структура: за всяка таблица нейната страница, режим на разпознаване и позиция; за всяка клетка нейният текст и ограждащата ѝ рамка в PDF пунктове (начало долу вляво). Идеално за скриптове и конвейери за данни.
Защо обединените клетки не излизат точни?
Клетка, обединена върху няколко колони, няма еднозначна позиция в мрежата; съдържанието ѝ попада в една от клетките, а останалите остават празни. Това е честно приближение: дори специализираните настолни програми не решават това безгрешно.
Качва ли се моят PDF някъде?
Не. Разпознаването и експортът се изпълняват изцяло локално в браузъра чрез pdf.js; файлът никога не напуска устройството ви.
Работи ли извличането на таблици и на смартфон или Chromebook?
Да, на всяко устройство с актуален браузър - Windows, Mac, Linux, Chromebook или смартфон. Много големите PDF файлове просто изискват повече време и памет на мобилни устройства.
Само с вашето съгласие измерваме употребата анонимно чрез бисквитки, за да подобряваме gottrix. Вашите файлове винаги остават локално, на вашето устройство. Поверителност