bg

PDF OCR - търсене

Направете сканиран PDF търсим чрез OCR директно в браузъра - невидим текстов слой под оригиналните страници, без качване на файлове.

Обработва се локално на устройството ви ...

Изходен формат
  • Търсим PDF
  • Само текст (TXT)
Език на документа
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Вашите файлове

    Обработва се локално на устройството ви ...

    0%

    Вашите файлове така и не напуснаха устройството ви

      Продължи с този файл

      Без ново качване

      Тези инструменти приемат .PDF - файлът ти се предава директно.

      Качва ли се файлът ми?

      Не. Всичко работи в браузъра ви - файлът ви никога не напуска устройството. Как се проверява това

      Без качване100% локално
      Съдържанието остава у теббез достъп на трети страни
      Hosted in GermanyGlobal Content Delivery
      Независимо провереноTLS A+ · Заглавки A+

      Сканираният PDF е по същество купчина от изображения: виждате текста, но не можете да го маркирате, търсите или копирате. OCR (оптично разпознаване на символи) прочита буквите от изображението и ги поставя като невидим текстов слой точно върху страниците. Изгледът остава идентичен, но PDF-ът става търсим и текстът може да се маркира - точно това очакват институциите, архивите и пълнотекстовото търсене.

      Изберете изходния формат: търсим PDF (оригинални страници плюс текстов слой) или обикновен текст TXT. Задайте езика на документа от списъка - 113 езика от немски и английски през руски, арабски и хинди до японски, корейски и китайски, всеки с собственото си название - за да се разпознаят символите правилно. Всичко работи в браузъра чрез WebAssembly: същият Tesseract с отворен код като в инструмента „Изображение в текст“, само приложен страница по страница към целия PDF. При първо използване двигателят и езиковият модел се зареждат еднократно (няколко МБ, същият произход); след това работи офлайн.

      Инструментът е предназначен за сканирани или графични PDF файлове. Качеството на разпознаването зависи силно от качеството на скана: ясни, прави, контрастни страници с печатен текст се разпознават много добре; наклонени или замъглени - значително по-зле; ръкопис ненадеждно. В търсимия PDF всяка страница се вгражда отново като изображение - PDF, съдържащ вече истински текст, не се нуждае от OCR. Проверявайте резултата за цифри и собствени имена.

      Разпознаването на текст обикновено е владение на облака: известните OCR услуги качват всеки скан на своите сървъри за обработка - и то точно документи като договори, медицински писма или лични документи. Тук цялото разпознаване работи с Tesseract като WebAssembly във вашия браузър, а всичките 113 езикови пакета са хоствани на самия gottrix - по време на разпознаването нищо не се тегли от трети страни. Освен това списъкът с езици стартира предварително избран според езика на вашия интерфейс. Безплатно, без акаунт и без лимит на страниците.

      Технически данни

      Технически данни
      Входни форматиPDF
      Автоматично конвертиранеPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      Изходни форматиPDF, TXT
      Пакетна обработкаДа
      ОбработкаЛокално в браузъра (WebAssembly)
      Качване на файловеНяма

      В 3 стъпки

      1. Пуснете сканирания PDF.
      2. Изберете изходния формат (търсим PDF или текст) и езика от списъка.
      3. Изтеглете търсимия PDF или TXT.

      Ограничения: За СКАНИРАНИ / графични PDF файлове: прави ги търсими чрез OCR (невидим текстов слой) или връща обикновен текст. Разпознава ПЕЧАТЕН текст на 113 езика и много азбуки; ръкопис ненадеждно. Забележка: невидимият текстов слой в търсимия PDF покрива латиница с всички ударени букви (23 от 113-те езика, напр. полски, чешки, виетнамски, турски), гръцки и кирилица. Знаци от други писмености (напр. CJK, арабски, иврит, деванагари, тайски) съзнателно се пропускат там, вместо да бъдат изкривени; за тези писмености изберете изход „Само текст (TXT)“, който връща напълно разпознатия текст. В търсимия PDF всяка страница се вгражда отново като изображение, оформлението се запазва, но файлът може да нарасне; PDF с вече истински текст не се нуждае от OCR. Разпознаването не е безпогрешно - проверявайте цифри и собствени имена. Двигателят и езиковият модел се зареждат еднократно (няколко МБ, същият произход), след това е достъпно офлайн. Големи PDF файлове изискват известно време и памет в зависимост от броя на страниците и устройството.

      Чести въпроси

      PDF файлът ми се качва на сървър?

      Не. Рендирането и разпознаването се изпълняват изцяло локално в браузъра (WebAssembly); PDF-ът никога не напуска устройството ви - особено важно за договори и официална кореспонденция.

      Какво е търсим PDF?

      Страницата изглежда като скана, но под нея се намират невидим текстов слой. Това позволява да търсите в PDF-а, да маркирате и копирате текст - визуалното оформление остава непроменено.

      Запазва ли се оформлението?

      Да. Всяка страница се вгражда като изображение на оригинала, невидимият текстов слой е наредено точно отгоре. Изгледът не се променя, но файлът може малко да нарасне.

      Разпознава ли ръкопис и други езици?

      Други езици - да: налични са над 100 (включително арабски, руски, хинди, японски, корейски, китайски). Ръкописът се разпознава ненадеждно, само печатен текст. Текстовият слой на търсимия PDF покрива латиница с всички ударени букви, гръцки и кирилица; при CJK, арабски, иврит, деванагари или тайски използвайте изхода „Само текст (TXT)“, който съдържа напълно разпознатия текст.

      Колко езика разпознава OCR?

      113 - от български, английски и немски през арабски, хинди и тайски до японски, корейски и китайски. Всеки език фигурира в списъка под собственото си име, а всички езикови пакети са хоствани на самия gottrix, не при трета страна.

      Безплатен ли е OCR за PDF и има ли лимит на страници?

      Да, напълно безплатен - без акаунт, без воден знак и без лимит на страници или дневен лимит. Многото страници просто отнемат съответно повече време, защото разпознаването се изчислява от вашето собствено устройство.

      Защо локалното разпознаване е по-добро за поверителни сканове?

      Защото сканът никога не напуска вашето устройство: без качване, без обработка на сървър, без копие в чужд облак. След първото зареждане разпознаването работи дори офлайн - най-силното доказателство, че нищо не се предава.

      Сходни инструменти

      Снимка в текст · PDF към Word · Компресиране на PDF · PDF към Markdown · PDF в текстов файл · PDF към EPUB