Zawartość Twoich plików nie jest nigdzie przetwarzana w ramach powierzenia. Nie potrzebujesz umowy powierzenia z gottrix, aby obrabiać dokumenty poufne lub firmowe.
Hosted in GermanyGlobal Content Delivery
Serwery źródłowe u Hetznera w Niemczech, globalne dostarczanie przez sieć dostarczania treści (CDN). Zawartość Twoich plików nigdy nie jest przy tym przesyłana - nie opuszcza Twojego urządzenia.
Liczby często tkwią dokładnie tam, gdzie nie da się z nich skorzystać: w tabelach w pliku PDF. Faktury, raporty, wyciągi bankowe, opracowania: kto potrzebuje tych wartości w Excelu, bazie danych lub skrypcie, dotąd przepisywał je ręcznie albo walczył z kolumnami rozpadającymi się przy wklejaniu. To narzędzie automatycznie rozpoznaje tabele w PDF i eksportuje je z zachowaniem struktury: jako CSV do arkuszy kalkulacyjnych i importów, jako skoroszyt Excela (XLSX) z osobnym arkuszem dla każdej tabeli lub jako JSON ze współrzędnymi do dalszego przetwarzania w kodzie.
Wykrywanie opiera się na tych samych dwóch technikach, których używają znane narzędzia specjalistyczne: tabele z obramowaniem rozpoznawane są po liniach faktycznie narysowanych na stronie (tryb siatki); linie tworzą siatkę komórek, a każdy tekst trafia do swojej komórki. Tabele bez obramowania rozpoznawane są po wyrównaniu (tryb odstępów): bloki tekstu stojące w tych samych pozycjach kolumn w kolejnych wierszach tworzą kolumny, a ciągłe przerwy wyznaczają ich granice. Tryb automatyczny najpierw szuka linii, a w razie ich braku analizuje odstępy; oba tryby można też wymusić. Obsługiwane są liczne tabele i wielostronicowe pliki PDF: każda wykryta tabela jest eksportowana osobno.
Uczciwie i ważne: wykrywanie odczytuje warstwę tekstową pliku PDF. Zeskanowany PDF lub złożony wyłącznie z obrazów takiej warstwy nie ma; wtedy narzędzie mówi to wprost, zamiast tworzyć puste lub zmyślone tabele. Skany przekształć najpierw narzędziem "PDF OCR", a tabele wyodrębnij potem. Złożone układy mają swoje granice: scalone komórki czy zagnieżdżone tabele są przybliżane, a nie odtwarzane co do piksela. Wszystko działa lokalnie w przeglądarce przez pdf.js; Twój plik nigdy nie opuszcza urządzenia.
Dane techniczne
Dane techniczne
Formaty wejściowe
PDF
Automatyczna konwersja
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
Formaty wyjściowe
CSV, XLSX, JSON
Przetwarzanie wsadowe
Nie
Przetwarzanie
Lokalnie w przeglądarce (JavaScript)
Przesyłanie plików
Brak
W 3 krokach
Upuść swój plik PDF.
Wybierz format wyjściowy i sposób wykrywania.
Pobierz tabele jako CSV, XLSX lub JSON.
Ograniczenia: Wykrywa tabele na podstawie linii obramowania (siatka) lub wyrównania tekstu (odstępy) i eksportuje je jako CSV (jeden plik na tabelę, kilka w ZIP), XLSX (jeden arkusz na tabelę) lub JSON (ze stroną, komórkami i pozycjami w punktach PDF). Wymaga prawdziwej warstwy tekstowej: zeskanowane pliki PDF przekształć najpierw narzędziem "PDF OCR". Scalone komórki i złożone układy są przybliżane; w Excelu tylko jednoznaczne liczby (kropka dziesiętna) stają się komórkami liczbowymi. Pliki PDF chronione hasłem otwórz najpierw narzędziem "Odblokuj PDF".
Częste pytania
Jak narzędzie wykrywa tabele?
Dwiema technikami: w tabelach z obramowaniem narysowane linie tworzą siatkę komórek (tryb siatki). W tabelach bez obramowania kolumny rozpoznawane są po wyrównaniu tekstu i ciągłych przerwach (tryb odstępów). Tryb automatyczny sam wybiera właściwą technikę.
Dlaczego w moim skanie nie znajduje tabel?
Skan to wyłącznie piksele obrazu, bez warstwy tekstowej do odczytania. Najpierw przekształć PDF w przeszukiwalny tekst narzędziem "PDF OCR", a potem wyodrębnij tabele.
Czy mogę wyeksportować kilka tabel i stron naraz?
Tak. Przeszukiwane są wszystkie strony, a każda wykryta tabela jest eksportowana osobno: jako własny plik CSV (kilka spakowanych w ZIP), jako osobny arkusz w pliku Excela lub jako wpis w JSON-ie.
Co zawiera eksport JSON?
Pełną strukturę: dla każdej tabeli stronę, tryb wykrywania i pozycję; dla każdej komórki tekst i ramkę w punktach PDF (początek układu w lewym dolnym rogu). Idealne do skryptów i potoków danych.
Dlaczego scalone komórki nie są dokładne?
Komórka scalona na kilka kolumn nie ma jednoznacznej pozycji w siatce; jej zawartość trafia do jednej z komórek, a pozostałe zostają puste. To uczciwe przybliżenie: nawet wyspecjalizowane narzędzia desktopowe nie rozwiązują tego bezbłędnie.
Czy mój PDF jest gdzieś wysyłany?
Nie. Wykrywanie i eksport działają w całości lokalnie w przeglądarce przez pdf.js; plik nigdy nie opuszcza Twojego urządzenia.
Czy wyodrębnianie tabel działa też na smartfonie lub Chromebooku?
Tak, na każdym urządzeniu z aktualną przeglądarką - Windows, Mac, Linux, Chromebook lub smartfon. Bardzo duże PDF-y potrzebują na urządzeniach mobilnych jedynie więcej czasu i pamięci.
Tylko za Twoją zgodą mierzymy korzystanie w sposób zanonimizowany za pomocą plików cookie, aby ulepszać gottrix. Twoje pliki zawsze pozostają lokalnie, na Twoim urządzeniu. Prywatność