Zamień zeskanowany PDF w wyszukiwalny dokument - lokalnie w przeglądarce, z niewidoczną warstwą tekstową pod oryginalnymi stronami, bez przesyłania pliku.
Przetwarzanie lokalnie na Twoim urządzeniu ...
!
i
To nie to narzędzie? Zobacz 3 powiązanych narzędzi
Zawartość Twoich plików nie jest nigdzie przetwarzana w ramach powierzenia. Nie potrzebujesz umowy powierzenia z gottrix, aby obrabiać dokumenty poufne lub firmowe.
Hosted in GermanyGlobal Content Delivery
Serwery źródłowe u Hetznera w Niemczech, globalne dostarczanie przez sieć dostarczania treści (CDN). Zawartość Twoich plików nigdy nie jest przy tym przesyłana - nie opuszcza Twojego urządzenia.
Zeskanowany PDF to w istocie stos obrazów: widzisz tekst, ale nie możesz go zaznaczać, przeszukiwać ani kopiować. OCR (optyczne rozpoznawanie znaków) odczytuje litery z obrazu i umieszcza je jako niewidoczną warstwę tekstową dokładnie nad stronami. Wygląd pozostaje identyczny, lecz PDF staje się wyszukiwalny, a tekst - zaznaczalny. Tego właśnie oczekują urzędy, archiwa i wyszukiwarki pełnotekstowe.
Wybierz jako wynik wyszukiwalny PDF (oryginalne strony plus warstwa tekstowa) albo czysty tekst jako TXT. Ustaw język dokumentu z listy - 113 języków od polskiego i angielskiego, przez rosyjski, arabski i hindi, aż po japoński, koreański i chiński, każdy we własnej nazwie - aby znaki były rozpoznawane poprawnie. Wszystko działa w przeglądarce przez WebAssembly: ten sam otwartoźródłowy silnik Tesseract co w narzędziu "Obraz do tekstu", stosowany strona po stronie na całym pliku PDF. Przy pierwszym użyciu przeglądarka pobiera jednorazowo silnik i model językowy (kilka MB, same-origin); potem działa offline.
Narzędzie jest przeznaczone dla zeskanowanych lub obrazkowych plików PDF. Jakość rozpoznawania w dużej mierze zależy od jakości skanu: ostre, proste i kontrastowe strony z drukowanym tekstem są rozpoznawane bardzo dobrze, krzywe lub nieostre - znacznie gorzej; pismo odręczne nie jest rozpoznawane niezawodnie. W wyszukiwalnym PDF każda strona jest osadzana ponownie jako obraz, przez co układ zostaje zachowany, lecz plik może urosnąć. PDF zawierający już prawdziwy tekst nie wymaga OCR. Sprawdź wynik pod kątem liczb i nazw własnych.
Rozpoznawanie tekstu to zwykle domena chmury: znane serwisy OCR wysyłają każdy skan na swoje serwery do przetworzenia - akurat dokumenty takie jak umowy, wypisy lekarskie czy dowody tożsamości. Tutaj całe rozpoznawanie działa z Tesseractem jako WebAssembly w Twojej przeglądarce, a wszystkie 113 pakietów językowych jest hostowane na samym gottrix - podczas rozpoznawania nic nie jest pobierane od podmiotów trzecich. Lista języków startuje ponadto wstępnie ustawiona według języka Twojego interfejsu. Za darmo, bez konta i bez limitu stron.
Wybierz wynik (wyszukiwalny PDF lub tekst) i język z listy.
Pobierz wyszukiwalny PDF lub TXT.
Ograniczenia: Dla ZESKANOWANYCH / obrazkowych plików PDF: sprawia, że są wyszukiwalne przez OCR (niewidoczna warstwa tekstowa) lub zwraca czysty tekst. Rozpoznaje DRUKOWANY tekst w 113 językach i wielu pismach; pismo odręczne nie jest rozpoznawane niezawodnie. Uwaga: niewidoczna warstwa tekstowa w wyszukiwalnym PDF obejmuje alfabet łaciński ze wszystkimi znakami diakrytycznymi (23 ze 113 języków, np. polski, czeski, wietnamski i turecki), grekę i cyrylicę. Znaki innych pism (np. CJK, arabskie, hebrajskie, dewanagari, tajskie) są tam celowo pomijane, zamiast trafiać tam zniekształcone; dla tych pism wynik "Tylko tekst (TXT)" zawiera w pełni rozpoznany tekst. W wyszukiwalnym PDF każda strona jest osadzana ponownie jako obraz, układ zostaje więc zachowany, lecz plik może urosnąć. PDF z już istniejącym prawdziwym tekstem nie wymaga OCR. Rozpoznawanie nie jest bezbłędne - sprawdzaj szczególnie liczby i nazwy własne. Silnik i wybrany model językowy są pobierane jednorazowo (kilka MB, same-origin), potem działają offline. Duże pliki PDF wymagają czasu i pamięci w zależności od liczby stron i urządzenia.
Częste pytania
Czy mój PDF jest przesyłany na serwer?
Nie. Renderowanie i rozpoznawanie tekstu odbywają się w całości lokalnie w przeglądarce (WebAssembly); PDF nie opuszcza twojego urządzenia - to kluczowa zaleta, zwłaszcza w przypadku umów i korespondencji urzędowej.
Czym jest wyszukiwalny PDF?
Strona wygląda jak skan, ale pod spodem znajduje się niewidoczna warstwa tekstowa. Dzięki temu możesz przeszukiwać PDF, zaznaczać i kopiować tekst - przy zachowaniu identycznego wyglądu.
Czy układ dokumentu zostaje zachowany?
Tak. Każda strona jest osadzana jako obraz oryginału, a niewidoczna warstwa tekstowa leży dokładnie nad nim. Wygląd się nie zmienia, choć plik może nieco urosnąć.
Czy rozpoznaje pismo odręczne i inne języki?
Inne języki - tak: dostępnych jest ponad 100 (w tym arabski, rosyjski, hindi, japoński, koreański, chiński). Pismo odręczne nie jest rozpoznawane niezawodnie, tylko druk. Warstwa tekstowa wyszukiwalnego PDF obejmuje alfabet łaciński ze wszystkimi znakami diakrytycznymi, grekę i cyrylicę; przy CJK, arabskim, hebrajskim, dewanagari lub tajskim użyj wyniku "Tylko tekst (TXT)", który zawiera w pełni rozpoznany tekst.
Ile języków rozpoznaje OCR?
113 - od polskiego, angielskiego i niemieckiego przez arabski, hindi i tajski aż po japoński, koreański i chiński. Każdy język widnieje na liście pod własną nazwą, a wszystkie pakiety językowe są hostowane na samym gottrix, nie u podmiotu trzeciego.
Czy OCR PDF jest darmowy i czy jest limit stron?
Tak, całkowicie darmowy - bez konta, bez znaku wodnego i bez limitu stron ani dziennego. Wiele stron zajmuje po prostu odpowiednio więcej czasu, bo rozpoznawanie liczy Twoje własne urządzenie.
Dlaczego lokalne rozpoznawanie jest lepsze dla poufnych skanów?
Bo skan nigdy nie opuszcza Twojego urządzenia: bez wysyłania, bez przetwarzania na serwerze, bez kopii w cudzej chmurze. Po pierwszym załadowaniu rozpoznawanie działa nawet offline - najmocniejszy dowód, że nic nie jest przesyłane.
Tylko za Twoją zgodą mierzymy korzystanie w sposób zanonimizowany za pomocą plików cookie, aby ulepszać gottrix. Twoje pliki zawsze pozostają lokalnie, na Twoim urządzeniu. Prywatność