uk

PDF OCR пошук

Зробіть відсканований PDF доступним для пошуку через OCR прямо в браузері - невидимий текстовий шар під оригінальними сторінками, без завантаження файлів.

Обробка локально на вашому пристрої ...

Формат виведення
  • Пошуковий PDF
  • Лише текст (TXT)
Мова документа
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Ваші файли

    Обробка локально на вашому пристрої ...

    0%

    Ваші файли так і не залишили ваш пристрій

      Продовжити з цим файлом

      Без повторного завантаження

      Ці інструменти приймають .PDF - ваш файл передається напряму.

      Чи завантажується мій файл?

      Ні. Усе працює у вашому браузері - ваш файл ніколи не залишає пристрій. Як це перевірити

      Без завантаження100% локально
      Вміст лишається у васбез доступу третіх осіб
      Hosted in GermanyGlobal Content Delivery
      Незалежний аудитTLS A+ · Заголовки A+

      Відсканований PDF - це по суті стос картинок: текст видно, але його не можна виділити, знайти чи скопіювати. OCR (оптичне розпізнавання символів) зчитує літери із зображення і розміщує їх як невидимий текстовий шар точно поверх сторінок. Зовнішній вигляд не змінюється, але PDF стає доступним для пошуку і текст можна виділяти - саме це потрібно відомствам, архівам і повнотекстовому пошуку.

      Виберіть формат виведення: пошуковий PDF (оригінальні сторінки плюс текстовий шар) або простий текст TXT. Вкажіть мову документа зі списку - 113 мов від німецької та англійської через російську, арабську та гінді до японської, корейської та китайської, кожна під своєю назвою - щоб символи розпізнавалися правильно. Все працює у браузері через WebAssembly: той самий Tesseract із відкритим кодом, що й в інструменті "Зображення в текст", лише застосовується посторінково до всього PDF. При першому використанні рушій і мовна модель завантажуються один раз (кілька МБ, те саме джерело); після цього працює офлайн.

      Інструмент призначений для відсканованих або графічних PDF. Якість розпізнавання сильно залежить від якості скану: чіткі, прямі, контрастні сторінки з друкованим текстом розпізнаються дуже добре; перекошені або розмиті - значно гірше; рукопис ненадійно. У пошуковому PDF кожна сторінка знову вбудовується як зображення - PDF, що вже містить справжній текст, у OCR не потребує. Перевіряйте результат для цифр і власних назв.

      Розпізнавання тексту зазвичай царина хмари: відомі OCR-сервіси завантажують кожен скан на свої сервери для обробки - і це саме такі документи, як договори, медичні виписки чи посвідчення особи. Тут усе розпізнавання виконує Tesseract у вигляді WebAssembly у вашому браузері, а всі 113 мовних пакетів розміщені на самому gottrix - під час розпізнавання нічого не довантажується від третіх сторін. До того ж список мов відкривається з попереднім вибором під мову вашого інтерфейсу. Безплатно, без облікового запису й без обмеження сторінок.

      Технічні дані

      Технічні дані
      Вхідні форматиPDF
      Автоматичне перетворенняPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      Вихідні форматиPDF, TXT
      Пакетна обробкаТак
      ОбробкаЛокально в браузері (WebAssembly)
      Завантаження файлівНемає

      У 3 кроки

      1. Перетягніть відсканований PDF.
      2. Виберіть формат виведення (пошуковий PDF або текст) і мову зі списку.
      3. Завантажте пошуковий PDF або TXT.

      Обмеження: Для ВІДСКАНОВАНИХ / графічних PDF: робить їх доступними для пошуку через OCR (невидимий текстовий шар) або повертає простий текст. Розпізнає ДРУКОВАНИЙ текст 113 мовами та у багатьох алфавітах; рукопис ненадійно. Примітка: невидимий текстовий шар у пошуковому PDF охоплює латиницю з усіма діакритичними знаками (23 із 113 мов, наприклад польську, чеську, в'єтнамську, турецьку), грецький алфавіт і кирилицю. Символи інших писемностей (наприклад CJK, арабська, іврит, деванагарі, тайська) там свідомо пропускаються, а не спотворюються; для таких писемностей виберіть виведення "Лише текст (TXT)", яке містить повністю розпізнаний текст. У пошуковому PDF кожна сторінка знову вбудовується як зображення, макет зберігається, але файл може збільшитися; PDF із наявним справжнім текстом у OCR не потребує. Розпізнавання не ідеальне - перевіряйте цифри та власні назви. Рушій і мовна модель завантажуються один раз (кілька МБ, те саме джерело), потім доступно офлайн. Великі PDF потребують часу і пам'яті залежно від кількості сторінок і пристрою.

      Часті запитання

      Мій PDF завантажується на сервер?

      Ні. Рендеринг і розпізнавання виконуються повністю локально в браузері (WebAssembly); PDF ніколи не покидає ваш пристрій - особливо важливо для договорів і офіційного листування.

      Що таке пошуковий PDF?

      Сторінка виглядає як скан, але під нею знаходиться невидимий текстовий шар. Це дозволяє шукати по PDF, виділяти та копіювати текст - візуальне оформлення при цьому не змінюється.

      Чи зберігається макет?

      Так. Кожна сторінка вбудовується як зображення оригіналу, невидимий текстовий шар вирівняний точно поверх. Зовнішній вигляд не змінюється, але файл може трохи збільшитися.

      Чи розпізнає рукопис і інші мови?

      Інші мови - так: доступно понад 100 (включаючи арабську, російську, гінді, японську, корейську, китайську). Рукопис розпізнається ненадійно, лише друкований текст. Текстовий шар пошукового PDF охоплює латиницю з усіма діакритичними знаками, грецький алфавіт і кирилицю; для CJK, арабської, івриту, деванагарі чи тайської використовуйте виведення "Лише текст (TXT)", яке містить повністю розпізнаний текст.

      Скільки мов розпізнає OCR?

      113 - від української, англійської та німецької через арабську, гінді й тайську до японської, корейської та китайської. Кожна мова вказана в списку під власною назвою, а всі мовні пакети розміщені на самому gottrix, не в третьої сторони.

      OCR для PDF безплатний, чи є ліміт сторінок?

      Так, повністю безплатний - без облікового запису, без водяного знака й без посторінкового чи денного ліміту. Багато сторінок просто займають відповідно більше часу, бо розпізнавання рахує ваш власний пристрій.

      Чому локальне розпізнавання краще для конфіденційних сканів?

      Бо скан ніколи не покидає ваш пристрій: ні завантаження, ні обробки на сервері, ні копії в чужій хмарі. Після першого завантаження розпізнавання працює навіть офлайн - найсильніший доказ того, що нічого не передається.

      Схожі інструменти

      Зображення в текст · PDF у Word · Стиснення PDF · PDF у Markdown · PDF у текст · PDF у EPUB