pl

PDF OCR wyszukiwalny

Zamień zeskanowany PDF w wyszukiwalny dokument - lokalnie w przeglądarce, z niewidoczną warstwą tekstową pod oryginalnymi stronami, bez przesyłania pliku.

Przetwarzanie lokalnie na Twoim urządzeniu ...

Wynik
  • Wyszukiwalny PDF
  • Tylko tekst (TXT)
Język dokumentu
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Twoje pliki

    Przetwarzanie lokalnie na Twoim urządzeniu ...

    0%

    Czy mój plik jest przesyłany?

    Nie. Wszystko działa w Twojej przeglądarce - Twój plik nigdy nie opuszcza urządzenia. Jak to sprawdzić

    Bez wysyłania100% lokalnie
    Treści zostają u Ciebiebrak dostępu osób trzecich
    Hosted in GermanyGlobal Content Delivery
    Zbadane niezależnieTLS A+ · Nagłówki A+

    Zeskanowany PDF to w istocie stos obrazów: widzisz tekst, ale nie możesz go zaznaczać, przeszukiwać ani kopiować. OCR (optyczne rozpoznawanie znaków) odczytuje litery z obrazu i umieszcza je jako niewidoczną warstwę tekstową dokładnie nad stronami. Wygląd pozostaje identyczny, lecz PDF staje się wyszukiwalny, a tekst - zaznaczalny. Tego właśnie oczekują urzędy, archiwa i wyszukiwarki pełnotekstowe.

    Wybierz jako wynik wyszukiwalny PDF (oryginalne strony plus warstwa tekstowa) albo czysty tekst jako TXT. Ustaw język dokumentu z listy - 113 języków od polskiego i angielskiego, przez rosyjski, arabski i hindi, aż po japoński, koreański i chiński, każdy we własnej nazwie - aby znaki były rozpoznawane poprawnie. Wszystko działa w przeglądarce przez WebAssembly: ten sam otwartoźródłowy silnik Tesseract co w narzędziu "Obraz do tekstu", stosowany strona po stronie na całym pliku PDF. Przy pierwszym użyciu przeglądarka pobiera jednorazowo silnik i model językowy (kilka MB, same-origin); potem działa offline.

    Narzędzie jest przeznaczone dla zeskanowanych lub obrazkowych plików PDF. Jakość rozpoznawania w dużej mierze zależy od jakości skanu: ostre, proste i kontrastowe strony z drukowanym tekstem są rozpoznawane bardzo dobrze, krzywe lub nieostre - znacznie gorzej; pismo odręczne nie jest rozpoznawane niezawodnie. W wyszukiwalnym PDF każda strona jest osadzana ponownie jako obraz, przez co układ zostaje zachowany, lecz plik może urosnąć. PDF zawierający już prawdziwy tekst nie wymaga OCR. Sprawdź wynik pod kątem liczb i nazw własnych.

    Rozpoznawanie tekstu to zwykle domena chmury: znane serwisy OCR wysyłają każdy skan na swoje serwery do przetworzenia - akurat dokumenty takie jak umowy, wypisy lekarskie czy dowody tożsamości. Tutaj całe rozpoznawanie działa z Tesseractem jako WebAssembly w Twojej przeglądarce, a wszystkie 113 pakietów językowych jest hostowane na samym gottrix - podczas rozpoznawania nic nie jest pobierane od podmiotów trzecich. Lista języków startuje ponadto wstępnie ustawiona według języka Twojego interfejsu. Za darmo, bez konta i bez limitu stron.

    Dane techniczne

    Dane techniczne
    Formaty wejściowePDF
    Automatyczna konwersjaPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Formaty wyjściowePDF, TXT
    Przetwarzanie wsadoweTak
    PrzetwarzanieLokalnie w przeglądarce (WebAssembly)
    Przesyłanie plikówBrak

    W 3 krokach

    1. Upuść zeskanowany PDF w wyznaczonym miejscu.
    2. Wybierz wynik (wyszukiwalny PDF lub tekst) i język z listy.
    3. Pobierz wyszukiwalny PDF lub TXT.

    Ograniczenia: Dla ZESKANOWANYCH / obrazkowych plików PDF: sprawia, że są wyszukiwalne przez OCR (niewidoczna warstwa tekstowa) lub zwraca czysty tekst. Rozpoznaje DRUKOWANY tekst w 113 językach i wielu pismach; pismo odręczne nie jest rozpoznawane niezawodnie. Uwaga: niewidoczna warstwa tekstowa w wyszukiwalnym PDF obejmuje alfabet łaciński ze wszystkimi znakami diakrytycznymi (23 ze 113 języków, np. polski, czeski, wietnamski i turecki), grekę i cyrylicę. Znaki innych pism (np. CJK, arabskie, hebrajskie, dewanagari, tajskie) są tam celowo pomijane, zamiast trafiać tam zniekształcone; dla tych pism wynik "Tylko tekst (TXT)" zawiera w pełni rozpoznany tekst. W wyszukiwalnym PDF każda strona jest osadzana ponownie jako obraz, układ zostaje więc zachowany, lecz plik może urosnąć. PDF z już istniejącym prawdziwym tekstem nie wymaga OCR. Rozpoznawanie nie jest bezbłędne - sprawdzaj szczególnie liczby i nazwy własne. Silnik i wybrany model językowy są pobierane jednorazowo (kilka MB, same-origin), potem działają offline. Duże pliki PDF wymagają czasu i pamięci w zależności od liczby stron i urządzenia.

    Częste pytania

    Czy mój PDF jest przesyłany na serwer?

    Nie. Renderowanie i rozpoznawanie tekstu odbywają się w całości lokalnie w przeglądarce (WebAssembly); PDF nie opuszcza twojego urządzenia - to kluczowa zaleta, zwłaszcza w przypadku umów i korespondencji urzędowej.

    Czym jest wyszukiwalny PDF?

    Strona wygląda jak skan, ale pod spodem znajduje się niewidoczna warstwa tekstowa. Dzięki temu możesz przeszukiwać PDF, zaznaczać i kopiować tekst - przy zachowaniu identycznego wyglądu.

    Czy układ dokumentu zostaje zachowany?

    Tak. Każda strona jest osadzana jako obraz oryginału, a niewidoczna warstwa tekstowa leży dokładnie nad nim. Wygląd się nie zmienia, choć plik może nieco urosnąć.

    Czy rozpoznaje pismo odręczne i inne języki?

    Inne języki - tak: dostępnych jest ponad 100 (w tym arabski, rosyjski, hindi, japoński, koreański, chiński). Pismo odręczne nie jest rozpoznawane niezawodnie, tylko druk. Warstwa tekstowa wyszukiwalnego PDF obejmuje alfabet łaciński ze wszystkimi znakami diakrytycznymi, grekę i cyrylicę; przy CJK, arabskim, hebrajskim, dewanagari lub tajskim użyj wyniku "Tylko tekst (TXT)", który zawiera w pełni rozpoznany tekst.

    Ile języków rozpoznaje OCR?

    113 - od polskiego, angielskiego i niemieckiego przez arabski, hindi i tajski aż po japoński, koreański i chiński. Każdy język widnieje na liście pod własną nazwą, a wszystkie pakiety językowe są hostowane na samym gottrix, nie u podmiotu trzeciego.

    Czy OCR PDF jest darmowy i czy jest limit stron?

    Tak, całkowicie darmowy - bez konta, bez znaku wodnego i bez limitu stron ani dziennego. Wiele stron zajmuje po prostu odpowiednio więcej czasu, bo rozpoznawanie liczy Twoje własne urządzenie.

    Dlaczego lokalne rozpoznawanie jest lepsze dla poufnych skanów?

    Bo skan nigdy nie opuszcza Twojego urządzenia: bez wysyłania, bez przetwarzania na serwerze, bez kopii w cudzej chmurze. Po pierwszym załadowaniu rozpoznawanie działa nawet offline - najmocniejszy dowód, że nic nie jest przesyłane.

    Powiązane narzędzia

    Obraz do tekstu (OCR) · PDF na Word · Kompresja PDF · PDF na Markdown · PDF na tekst · PDF na EPUB