Zawartość Twoich plików nie jest nigdzie przetwarzana w ramach powierzenia. Nie potrzebujesz umowy powierzenia z gottrix, aby obrabiać dokumenty poufne lub firmowe.
Hosted in GermanyGlobal Content Delivery
Serwery źródłowe u Hetznera w Niemczech, globalne dostarczanie przez sieć dostarczania treści (CDN). Zawartość Twoich plików nigdy nie jest przy tym przesyłana - nie opuszcza Twojego urządzenia.
Markdown to format do notatek, wiki, stron statycznych i narzędzi AI: prosty, obsługujący wersjonowanie i czytelny wszędzie. Kto chciał dotąd ponownie wykorzystać treść pliku PDF w tym formacie, musiał żmudnie ją kopiować fragment po fragmencie. To narzędzie odczytuje warstwę tekstową pliku PDF i zwraca ją jako Markdown z już zarysowaną strukturą - nagłówki, listy i akapity zamiast jednej ściany tekstu.
Struktura jest wykrywana za pomocą algorytmu heurystycznego: linie z wyraźnie większą czcionką niż tekst główny stają się nagłówkami (#, ## lub ###), linie zaczynające się od punktu lub cyfry stają się listami Markdown, a większa pionowa przerwa między wierszami oznacza nowy akapit. W ten sposób z surowych pozycji tekstowych powstaje czytelny, gotowy do dalszego użycia dokument Markdown - idealny punkt wyjścia do dopracowania w edytorze.
Uczciwie i ważnie: to jest przybliżenie struktury, nie wierne odtworzenie układu graficznego. Tabel, stron wielokolumnowych i subtelnego formatowania nie da się bez strat wyprowadzić z warstwy tekstowej. Podobnie jak przy zwykłej ekstrakcji tekstu: zeskanowany lub czysto obrazkowy plik PDF nie ma warstwy tekstowej - tam wynik pozostaje pusty i potrzebne jest zamiast tego PDF OCR. Wszystko działa lokalnie w przeglądarce za pomocą pdf.js; twój plik nie opuszcza twojego urządzenia.
Ograniczenia: Przekształca istniejącą warstwę tekstową pliku PDF na Markdown (UTF-8 .md). Nagłówki, listy i akapity są wykrywane heurystycznie na podstawie rozmiaru czcionki i odstępów - przybliżenie struktury, nie dokładne odtworzenie układu. Tabele i strony wielokolumnowe są odwzorowywane jedynie liniowo. Zeskanowane lub czysto obrazkowe pliki PDF nie mają warstwy tekstowej; wynik pozostaje wówczas pusty - użyj PDF OCR. Pliki PDF chronione hasłem należy najpierw odblokować. Odczytywany jest tylko tekst (getTextContent z pdf.js); osadzone obrazy nie trafiają do Markdown.
Częste pytania
Jak są wykrywane nagłówki?
Na podstawie rozmiaru czcionki: linie wyraźnie większe niż tekst główny stają się - w zależności od proporcji - nagłówkami #, ## lub ###.
Czy tabele i kolumny są zachowywane?
Nie. Konwersja to przybliżenie struktury; tabele i układy wielokolumnowe są jedynie liniowo aproksymowane, a nie wiernie odtwarzane.
Dlaczego mój Markdown jest pusty?
Twój plik PDF to prawdopodobnie skan lub składa się z obrazów i nie ma warstwy tekstowej. Użyj PDF OCR, które rozpoznaje tekst z pikseli.
Czy plik PDF jest przesyłany?
Nie. Konwersja odbywa się w całości lokalnie w przeglądarce za pomocą pdf.js; plik nie opuszcza twojego urządzenia.
Tylko za Twoją zgodą mierzymy korzystanie w sposób zanonimizowany za pomocą plików cookie, aby ulepszać gottrix. Twoje pliki zawsze pozostają lokalnie, na Twoim urządzeniu. Prywatność