ru

PDF OCR - поиск по PDF

Сделайте отсканированный PDF доступным для поиска через OCR прямо в браузере - невидимый текстовый слой под оригинальными страницами, без загрузки файлов.

Обработка локально на вашем устройстве ...

Формат вывода
  • Поисковый PDF
  • Только текст (TXT)
Язык документа
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Ваши файлы

    Обработка локально на вашем устройстве ...

    0%

    Ваши файлы так и не покинули устройство

      Продолжить с этим файлом

      Без повторной загрузки

      Эти инструменты принимают .PDF - ваш файл передаётся напрямую.

      Загружается ли мой файл?

      Нет. Всё выполняется в вашем браузере - ваш файл никогда не покидает устройство. Как это можно проверить

      Без загрузки100% локально
      Содержимое остаётся у васнет доступа у третьих лиц
      Hosted in GermanyGlobal Content Delivery
      Независимый аудитTLS A+ · Заголовки A+

      Отсканированный PDF - это по сути стопка картинок: текст виден, но его нельзя выделить, найти или скопировать. OCR (оптическое распознавание символов) считывает буквы с изображения и размещает их как невидимый текстовый слой точно поверх страниц. Внешний вид не меняется, но PDF становится доступным для поиска и текст можно выделять - именно это нужно ведомствам, архивам и полнотекстовому поиску.

      Выберите формат вывода: поисковый PDF (оригинальные страницы плюс текстовый слой) или простой текст TXT. Укажите язык документа из списка - 113 языков от немецкого и английского через русский, арабский и хинди до японского, корейского и китайского, каждый под своим названием - чтобы символы распознавались правильно. Всё работает в браузере через WebAssembly: тот же Tesseract с открытым кодом, что и в инструменте «Изображение в текст», только применяется постранично ко всему PDF. При первом использовании движок и языковая модель загружаются один раз (несколько МБ, тот же источник); после этого работает офлайн.

      Инструмент предназначен для отсканированных или графических PDF. Качество распознавания сильно зависит от качества скана: чёткие, прямые, контрастные страницы с печатным текстом распознаются очень хорошо; перекошенные или размытые - значительно хуже; рукопись ненадёжно. В поисковом PDF каждая страница заново встраивается как изображение - PDF, уже содержащий настоящий текст, в OCR не нуждается. Проверяйте результат для цифр и имён собственных.

      Распознавание текста обычно вотчина облака: известные OCR-сервисы загружают каждый скан на свои серверы для обработки - и это именно такие документы, как договоры, медицинские выписки или удостоверения личности. Здесь всё распознавание выполняется Tesseract в виде WebAssembly в вашем браузере, а все 113 языковых пакетов размещены на самом gottrix - во время распознавания ничего не подгружается у третьих сторон. К тому же список языков открывается с предвыбором под язык вашего интерфейса. Бесплатно, без аккаунта и без ограничения страниц.

      Технические данные

      Технические данные
      Входные форматыPDF
      Автоматическое преобразованиеPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      Выходные форматыPDF, TXT
      Пакетная обработкаДа
      ОбработкаЛокально в браузере (WebAssembly)
      Загрузка файловОтсутствует

      В 3 шага

      1. Перетащите отсканированный PDF.
      2. Выберите формат вывода (поисковый PDF или текст) и язык из списка.
      3. Скачайте поисковый PDF или TXT.

      Ограничения: Для ОТСКАНИРОВАННЫХ / графических PDF: делает их доступными для поиска через OCR (невидимый текстовый слой) или возвращает простой текст. Распознаёт ПЕЧАТНЫЙ текст на 113 языках и во многих алфавитах; рукопись ненадёжно. Примечание: невидимый текстовый слой в поисковом PDF охватывает латиницу со всеми диакритическими знаками (23 из 113 языков, например польский, чешский, вьетнамский, турецкий), греческий алфавит и кириллицу. Символы других письменностей (например CJK, арабский, иврит, деванагари, тайский) там намеренно опускаются, а не искажаются; для таких письменностей выберите вывод «Только текст (TXT)», он содержит полностью распознанный текст. В поисковом PDF каждая страница заново встраивается как изображение, макет сохраняется, но файл может вырасти; PDF с настоящим текстом в OCR не нуждается. Распознавание не идеально - проверяйте цифры и имена собственные. Движок и языковая модель загружаются один раз (несколько МБ, тот же источник), затем доступно офлайн. Большие PDF требуют времени и памяти в зависимости от числа страниц и устройства.

      Частые вопросы

      Мой PDF загружается на сервер?

      Нет. Рендеринг и распознавание выполняются полностью локально в браузере (WebAssembly); PDF никогда не покидает ваше устройство - особенно важно для договоров и официальной переписки.

      Что такое поисковый PDF?

      Страница выглядит как скан, но под ней находится невидимый текстовый слой. Это позволяет искать по PDF, выделять и копировать текст - визуальное оформление при этом не меняется.

      Сохраняется ли макет?

      Да. Каждая страница встраивается как изображение оригинала, невидимый текстовый слой выровнен точно поверх. Внешний вид не меняется, но файл может немного вырасти.

      Распознаёт ли рукопись и другие языки?

      Другие языки - да: доступно более 100 (включая арабский, русский, хинди, японский, корейский, китайский). Рукопись распознаётся ненадёжно, только печатный текст. Текстовый слой поискового PDF охватывает латиницу со всеми диакритическими знаками, греческий алфавит и кириллицу; для CJK, арабского, иврита, деванагари или тайского используйте вывод «Только текст (TXT)», он содержит полностью распознанный текст.

      Сколько языков распознаёт OCR?

      113 - от русского, английского и немецкого через арабский, хинди и тайский до японского, корейского и китайского. Каждый язык указан в списке под собственным названием, а все языковые пакеты размещены на самом gottrix, не у третьей стороны.

      OCR для PDF бесплатен, есть ли лимит страниц?

      Да, полностью бесплатен - без аккаунта, без водяного знака и без постраничного или дневного лимита. Большое число страниц просто занимает соответственно больше времени, потому что распознавание считает ваше собственное устройство.

      Почему локальное распознавание лучше для конфиденциальных сканов?

      Потому что скан никогда не покидает ваше устройство: ни загрузки, ни обработки на сервере, ни копии в чужом облаке. После первой загрузки распознавание работает даже офлайн - сильнейшее доказательство того, что ничего не передаётся.

      Похожие инструменты

      Изображение в текст · PDF в Word · Сжатие PDF · PDF в Markdown · PDF в текст · PDF в EPUB