Содержимое остаётся у васнет доступа у третьих лиц
Содержимое ваших файлов нигде не обрабатывается на стороне сервера. Вам не нужен договор об обработке данных с gottrix, чтобы работать с конфиденциальными или деловыми документами.
Hosted in GermanyGlobal Content Delivery
Исходный сервер у Hetzner в Германии, доставка по всему миру через сеть доставки контента (CDN). Содержимое ваших файлов при этом никогда не передаётся - оно не покидает ваше устройство.
OCR (оптическое распознавание символов) превращает изображение текста обратно в настоящий, выделяемый текст. Сфотографируйте или отсканируйте счёт, письмо или страницу книги - и получите содержимое как TXT-файл, который можно искать, копировать и обрабатывать дальше. Используется движок Tesseract с открытым исходным кодом, работающий здесь полностью как WebAssembly в браузере.
Выберите язык документа из списка - доступно более 100 языков: немецкий, английский и европейские языки, русский, арабский, иврит, хинди, японский, корейский и китайский. Каждый язык указан своим собственным названием, так что вы быстро его найдёте. Правильный выбор обеспечивает корректное распознавание букв, диакритических знаков и специальных символов данного алфавита. При первом использовании браузер один раз загружает движок и выбранную языковую модель с этого сайта (несколько мегабайт, тот же источник, никаких сторонних серверов); после этого инструмент работает и офлайн. Можно подать несколько изображений сразу - каждое становится отдельным TXT.
Качество распознавания почти полностью определяется исходным материалом: чёткая, прямая, контрастная фотография печатного текста распознаётся очень хорошо; перекошенная, размытая или тёмная - значительно хуже. Печатный текст работает надёжно, рукописный - нет. Колонки, таблицы и нестандартные макеты выводятся как сплошной текст - порядок обычно верный, но визуальная структура теряется. Обязательно проверяйте результат, особенно цифры.
Выберите язык документа из списка (более 100 языков).
Скачайте распознанный текст в формате TXT.
Ограничения: Распознаёт ПЕЧАТНЫЙ текст из чётких изображений (JPG, PNG, WebP, BMP) в TXT; рукопись распознаётся ненадёжно. Более 100 языков и множество алфавитов (латиница, кириллица, греческий, арабский, иврит, индийские письмена, CJK и другие) - выберите подходящий для вашего документа. Колонки/таблицы/макет не сохраняются как структура, только как сплошной текст. Распознавание не идеально - проверяйте результат, особенно цифры и имена собственные. При первом использовании движок и выбранная языковая модель загружаются один раз (несколько МБ, тот же источник); затем доступно офлайн. Для отсканированных PDF есть отдельный инструмент «PDF OCR» (поиск или простой текст).
Частые вопросы
Моё изображение загружается на сервер?
Нет. Распознавание текста выполняется полностью локально в браузере (WebAssembly); изображение никогда не покидает ваше устройство - это особенно важно для конфиденциальных документов.
Какие языки распознаются?
Более 100 языков и множество алфавитов - помимо немецкого и английского также французский, испанский, русский, арабский, иврит, хинди, японский, корейский, китайский и другие. Выберите нужный язык из списка, чтобы специальные символы распознавались корректно.
Работает ли с рукописным текстом?
Нет, надёжно только с печатным текстом. Рукопись движок не распознаёт стабильно.
Почему распознавание иногда ошибается?
OCR зависит от качества изображения: чёткий, прямой, контрастный текст распознаётся очень хорошо; перекошенный, размытый или тёмный - значительно хуже. Всегда проверяйте цифры и имена собственные.
Можно ли распознать отсканированный PDF?
Да, для этого есть отдельный инструмент «PDF OCR»: он делает отсканированный PDF доступным для поиска или выдаёт простой текст - без лишних шагов через отдельные изображения.
Только с вашего согласия мы анонимно измеряем использование с помощью файлов cookie, чтобы улучшать gottrix. Ваши файлы всегда остаются локально, на вашем устройстве. Конфиденциальность