Zawartość Twoich plików nie jest nigdzie przetwarzana w ramach powierzenia. Nie potrzebujesz umowy powierzenia z gottrix, aby obrabiać dokumenty poufne lub firmowe.
Hosted in GermanyGlobal Content Delivery
Serwery źródłowe u Hetznera w Niemczech, globalne dostarczanie przez sieć dostarczania treści (CDN). Zawartość Twoich plików nigdy nie jest przy tym przesyłana - nie opuszcza Twojego urządzenia.
Liczby często tkwią dokładnie tam, gdzie nie da się z nich skorzystać: w tabelach w pliku PDF. Faktury, raporty, wyciągi bankowe, opracowania: kto potrzebuje tych wartości w Excelu, bazie danych lub skrypcie, dotąd przepisywał je ręcznie albo walczył z kolumnami rozpadającymi się przy wklejaniu. To narzędzie automatycznie rozpoznaje tabele w PDF i eksportuje je z zachowaniem struktury: jako CSV do arkuszy kalkulacyjnych i importów, jako skoroszyt Excela (XLSX) z osobnym arkuszem dla każdej tabeli lub jako JSON ze współrzędnymi do dalszego przetwarzania w kodzie.
Wykrywanie opiera się na tych samych dwóch technikach, których używają znane narzędzia specjalistyczne: tabele z obramowaniem rozpoznawane są po liniach faktycznie narysowanych na stronie (tryb siatki); linie tworzą siatkę komórek, a każdy tekst trafia do swojej komórki. Tabele bez obramowania rozpoznawane są po wyrównaniu (tryb odstępów): bloki tekstu stojące w tych samych pozycjach kolumn w kolejnych wierszach tworzą kolumny, a ciągłe przerwy wyznaczają ich granice. Tryb automatyczny najpierw szuka linii, a w razie ich braku analizuje odstępy; oba tryby można też wymusić. Obsługiwane są liczne tabele i wielostronicowe pliki PDF: każda wykryta tabela jest eksportowana osobno.
Uczciwie i ważne: wykrywanie odczytuje warstwę tekstową pliku PDF. Zeskanowany PDF lub złożony wyłącznie z obrazów takiej warstwy nie ma; wtedy narzędzie mówi to wprost, zamiast tworzyć puste lub zmyślone tabele. Skany przekształć najpierw narzędziem "PDF OCR", a tabele wyodrębnij potem. Złożone układy mają swoje granice: scalone komórki czy zagnieżdżone tabele są przybliżane, a nie odtwarzane co do piksela. Wszystko działa lokalnie w przeglądarce przez pdf.js; Twój plik nigdy nie opuszcza urządzenia.
Ograniczenia: Wykrywa tabele na podstawie linii obramowania (siatka) lub wyrównania tekstu (odstępy) i eksportuje je jako CSV (jeden plik na tabelę, kilka w ZIP), XLSX (jeden arkusz na tabelę) lub JSON (ze stroną, komórkami i pozycjami w punktach PDF). Wymaga prawdziwej warstwy tekstowej: zeskanowane pliki PDF przekształć najpierw narzędziem "PDF OCR". Scalone komórki i złożone układy są przybliżane; w Excelu tylko jednoznaczne liczby (kropka dziesiętna) stają się komórkami liczbowymi. Pliki PDF chronione hasłem otwórz najpierw narzędziem "Odblokuj PDF".
Częste pytania
Jak narzędzie wykrywa tabele?
Dwiema technikami: w tabelach z obramowaniem narysowane linie tworzą siatkę komórek (tryb siatki). W tabelach bez obramowania kolumny rozpoznawane są po wyrównaniu tekstu i ciągłych przerwach (tryb odstępów). Tryb automatyczny sam wybiera właściwą technikę.
Dlaczego w moim skanie nie znajduje tabel?
Skan to wyłącznie piksele obrazu, bez warstwy tekstowej do odczytania. Najpierw przekształć PDF w przeszukiwalny tekst narzędziem "PDF OCR", a potem wyodrębnij tabele.
Czy mogę wyeksportować kilka tabel i stron naraz?
Tak. Przeszukiwane są wszystkie strony, a każda wykryta tabela jest eksportowana osobno: jako własny plik CSV (kilka spakowanych w ZIP), jako osobny arkusz w pliku Excela lub jako wpis w JSON-ie.
Co zawiera eksport JSON?
Pełną strukturę: dla każdej tabeli stronę, tryb wykrywania i pozycję; dla każdej komórki tekst i ramkę w punktach PDF (początek układu w lewym dolnym rogu). Idealne do skryptów i potoków danych.
Dlaczego scalone komórki nie są dokładne?
Komórka scalona na kilka kolumn nie ma jednoznacznej pozycji w siatce; jej zawartość trafia do jednej z komórek, a pozostałe zostają puste. To uczciwe przybliżenie: nawet wyspecjalizowane narzędzia desktopowe nie rozwiązują tego bezbłędnie.
Czy mój PDF jest gdzieś wysyłany?
Nie. Wykrywanie i eksport działają w całości lokalnie w przeglądarce przez pdf.js; plik nigdy nie opuszcza Twojego urządzenia.
Czy wyodrębnianie tabel działa też na smartfonie lub Chromebooku?
Tak, na każdym urządzeniu z aktualną przeglądarką - Windows, Mac, Linux, Chromebook lub smartfon. Bardzo duże PDF-y potrzebują na urządzeniach mobilnych jedynie więcej czasu i pamięci.
Tylko za Twoją zgodą mierzymy korzystanie w sposób zanonimizowany za pomocą plików cookie, aby ulepszać gottrix. Twoje pliki zawsze pozostają lokalnie, na Twoim urządzeniu. Prywatność