Съдържанието остава у теббез достъп на трети страни
Не възниква обработка на съдържанието на файловете ти. Не ти трябва договор за обработка на данни с gottrix, за да работиш с поверителни или служебни документи.
Hosted in GermanyGlobal Content Delivery
Основни сървъри в Hetzner в Германия, глобално доставяне чрез мрежа за доставяне на съдържание (CDN). Съдържанието на файловете ти никога не се предава в този процес - то не напуска устройството ти.
Числата често остават заклещени точно там, където не могат да се използват: в таблици в PDF. Фактури, отчети, банкови извлечения, проучвания: който има нужда от тези стойности в Excel, база данни или скрипт, досега ги преписваше ръчно или се бореше с колони, които се разпадат при поставяне. Този инструмент разпознава таблиците в PDF автоматично и ги експортира със запазена структура: като CSV за електронни таблици и импорт, като работна книга на Excel (XLSX) с отделен лист за всяка таблица или като JSON с координати за обработка в код.
Разпознаването използва същите две техники, на които разчитат познатите специализирани инструменти: таблиците с рамки се разпознават по реално начертаните на страницата линии (режим мрежа); линиите образуват мрежата от клетки и всеки текст се насочва към своята клетка. Таблиците без рамки се разпознават по подравняването (режим интервали): текстовите блокове, разположени на едни и същи позиции на колони в няколко реда, образуват колоните, а непрекъснатите празнини очертават границите им. Автоматичният режим първо търси линии и при липса преминава към анализ на интервалите; и двата режима могат да се изберат и принудително. Поддържат се няколко таблици и многостранични PDF файлове: всяка открита таблица се експортира отделно.
Честно и важно: разпознаването чете текстовия слой на PDF. Сканиран PDF или такъв само от изображения няма такъв слой; тогава инструментът го казва открито, вместо да произвежда празни или измислени таблици. Първо преобразувайте сканираните файлове с "PDF OCR", после извличайте таблиците. Сложните оформления имат граници: обединените клетки и вложените таблици се предават приблизително, а не се възстановяват пиксел по пиксел. Всичко се изпълнява локално в браузъра чрез pdf.js; вашият файл никога не напуска устройството ви.
Ограничения: Разпознава таблици по линиите на рамката (мрежа) или по подравняването на текста (интервали) и ги експортира като CSV (по един файл на таблица, няколко в ZIP), XLSX (по един лист на таблица) или JSON (със страница, клетки и позиции в PDF пунктове). Изисква истински текстов слой: първо преобразувайте сканираните PDF файлове с "PDF OCR". Обединените клетки и сложните оформления се предават приблизително; в Excel само еднозначните числа (десетична точка) стават числови клетки. Защитените с парола PDF файлове първо отворете с "Отключване на PDF".
Чести въпроси
Как инструментът разпознава таблиците?
С две техники: при таблиците с рамки начертаните линии образуват мрежата от клетки (режим мрежа). При таблиците без рамки колоните се разпознават по подравняването на текста и непрекъснатите празнини (режим интервали). Автоматичният режим сам избира подходящата техника.
Защо не намира таблици в моя сканиран документ?
Сканът е само пиксели от изображение, без четим текстов слой. Първо преобразувайте PDF в търсим текст с "PDF OCR", после извлечете таблиците.
Мога ли да експортирам няколко таблици и страници наведнъж?
Да. Преглеждат се всички страници и всяка открита таблица се експортира отделно: като собствен CSV файл (няколко се събират в ZIP), като отделен лист във файл на Excel или като запис в JSON.
Какво съдържа JSON експортът?
Пълната структура: за всяка таблица нейната страница, режим на разпознаване и позиция; за всяка клетка нейният текст и ограждащата ѝ рамка в PDF пунктове (начало долу вляво). Идеално за скриптове и конвейери за данни.
Защо обединените клетки не излизат точни?
Клетка, обединена върху няколко колони, няма еднозначна позиция в мрежата; съдържанието ѝ попада в една от клетките, а останалите остават празни. Това е честно приближение: дори специализираните настолни програми не решават това безгрешно.
Качва ли се моят PDF някъде?
Не. Разпознаването и експортът се изпълняват изцяло локално в браузъра чрез pdf.js; файлът никога не напуска устройството ви.
Работи ли извличането на таблици и на смартфон или Chromebook?
Да, на всяко устройство с актуален браузър - Windows, Mac, Linux, Chromebook или смартфон. Много големите PDF файлове просто изискват повече време и памет на мобилни устройства.
Само с вашето съгласие измерваме употребата анонимно чрез бисквитки, за да подобряваме gottrix. Вашите файлове винаги остават локално, на вашето устройство. Поверителност