Сделайте отсканированный PDF доступным для поиска через OCR прямо в браузере - невидимый текстовый слой под оригинальными страницами, без загрузки файлов.
Обработка локально на вашем устройстве ...
!
i
Не тот инструмент? Посмотрите 3 похожих инструментов
Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
Отсканированный PDF - это по сути стопка картинок: текст виден, но его нельзя выделить, найти или скопировать. OCR (оптическое распознавание символов) считывает буквы с изображения и размещает их как невидимый текстовый слой точно поверх страниц. Внешний вид не меняется, но PDF становится доступным для поиска и текст можно выделять - именно это нужно ведомствам, архивам и полнотекстовому поиску.
Выберите формат вывода: поисковый PDF (оригинальные страницы плюс текстовый слой) или простой текст TXT. Укажите язык документа из списка - 113 языков от немецкого и английского через русский, арабский и хинди до японского, корейского и китайского, каждый под своим названием - чтобы символы распознавались правильно. Всё работает в браузере через WebAssembly: тот же Tesseract с открытым кодом, что и в инструменте «Изображение в текст», только применяется постранично ко всему PDF. При первом использовании движок и языковая модель загружаются один раз (несколько МБ, тот же источник); после этого работает офлайн.
Инструмент предназначен для отсканированных или графических PDF. Качество распознавания сильно зависит от качества скана: чёткие, прямые, контрастные страницы с печатным текстом распознаются очень хорошо; перекошенные или размытые - значительно хуже; рукопись ненадёжно. В поисковом PDF каждая страница заново встраивается как изображение - PDF, уже содержащий настоящий текст, в OCR не нуждается. Проверяйте результат для цифр и имён собственных.
Распознавание текста обычно вотчина облака: известные OCR-сервисы загружают каждый скан на свои серверы для обработки - и это именно такие документы, как договоры, медицинские выписки или удостоверения личности. Здесь всё распознавание выполняется Tesseract в виде WebAssembly в вашем браузере, а все 113 языковых пакетов размещены на самом gottrix - во время распознавания ничего не подгружается у третьих сторон. К тому же список языков открывается с предвыбором под язык вашего интерфейса. Бесплатно, без аккаунта и без ограничения страниц.
Выберите формат вывода (поисковый PDF или текст) и язык из списка.
Скачайте поисковый PDF или TXT.
Ограничения: Для ОТСКАНИРОВАННЫХ / графических PDF: делает их доступными для поиска через OCR (невидимый текстовый слой) или возвращает простой текст. Распознаёт ПЕЧАТНЫЙ текст на 113 языках и во многих алфавитах; рукопись ненадёжно. Примечание: невидимый текстовый слой в поисковом PDF охватывает латиницу со всеми диакритическими знаками (23 из 113 языков, например польский, чешский, вьетнамский, турецкий), греческий алфавит и кириллицу. Символы других письменностей (например CJK, арабский, иврит, деванагари, тайский) там намеренно опускаются, а не искажаются; для таких письменностей выберите вывод «Только текст (TXT)», он содержит полностью распознанный текст. В поисковом PDF каждая страница заново встраивается как изображение, макет сохраняется, но файл может вырасти; PDF с настоящим текстом в OCR не нуждается. Распознавание не идеально - проверяйте цифры и имена собственные. Движок и языковая модель загружаются один раз (несколько МБ, тот же источник), затем доступно офлайн. Большие PDF требуют времени и памяти в зависимости от числа страниц и устройства.
Частые вопросы
Мой PDF загружается на сервер?
Нет. Рендеринг и распознавание выполняются полностью локально в браузере (WebAssembly); PDF никогда не покидает ваше устройство - особенно важно для договоров и официальной переписки.
Что такое поисковый PDF?
Страница выглядит как скан, но под ней находится невидимый текстовый слой. Это позволяет искать по PDF, выделять и копировать текст - визуальное оформление при этом не меняется.
Сохраняется ли макет?
Да. Каждая страница встраивается как изображение оригинала, невидимый текстовый слой выровнен точно поверх. Внешний вид не меняется, но файл может немного вырасти.
Распознаёт ли рукопись и другие языки?
Другие языки - да: доступно более 100 (включая арабский, русский, хинди, японский, корейский, китайский). Рукопись распознаётся ненадёжно, только печатный текст. Текстовый слой поискового PDF охватывает латиницу со всеми диакритическими знаками, греческий алфавит и кириллицу; для CJK, арабского, иврита, деванагари или тайского используйте вывод «Только текст (TXT)», он содержит полностью распознанный текст.
Сколько языков распознаёт OCR?
113 - от русского, английского и немецкого через арабский, хинди и тайский до японского, корейского и китайского. Каждый язык указан в списке под собственным названием, а все языковые пакеты размещены на самом gottrix, не у третьей стороны.
OCR для PDF бесплатен, есть ли лимит страниц?
Да, полностью бесплатен - без аккаунта, без водяного знака и без постраничного или дневного лимита. Большое число страниц просто занимает соответственно больше времени, потому что распознавание считает ваше собственное устройство.
Почему локальное распознавание лучше для конфиденциальных сканов?
Потому что скан никогда не покидает ваше устройство: ни загрузки, ни обработки на сервере, ни копии в чужом облаке. После первой загрузки распознавание работает даже офлайн - сильнейшее доказательство того, что ничего не передаётся.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность