Съдържанието остава у теббез достъп на трети страни
Не възниква обработка на съдържанието на файловете ти. Не ти трябва договор за обработка на данни с gottrix, за да работиш с поверителни или служебни документи.
Hosted in GermanyGlobal Content Delivery
Основни сървъри в Hetzner в Германия, глобално доставяне чрез мрежа за доставяне на съдържание (CDN). Съдържанието на файловете ти никога не се предава в този процес - то не напуска устройството ти.
Сканираният PDF е по същество купчина от изображения: виждате текста, но не можете да го маркирате, търсите или копирате. OCR (оптично разпознаване на символи) прочита буквите от изображението и ги поставя като невидим текстов слой точно върху страниците. Изгледът остава идентичен, но PDF-ът става търсим и текстът може да се маркира - точно това очакват институциите, архивите и пълнотекстовото търсене.
Изберете изходния формат: търсим PDF (оригинални страници плюс текстов слой) или обикновен текст TXT. Задайте езика на документа от списъка - 113 езика от немски и английски през руски, арабски и хинди до японски, корейски и китайски, всеки с собственото си название - за да се разпознаят символите правилно. Всичко работи в браузъра чрез WebAssembly: същият Tesseract с отворен код като в инструмента „Изображение в текст“, само приложен страница по страница към целия PDF. При първо използване двигателят и езиковият модел се зареждат еднократно (няколко МБ, същият произход); след това работи офлайн.
Инструментът е предназначен за сканирани или графични PDF файлове. Качеството на разпознаването зависи силно от качеството на скана: ясни, прави, контрастни страници с печатен текст се разпознават много добре; наклонени или замъглени - значително по-зле; ръкопис ненадеждно. В търсимия PDF всяка страница се вгражда отново като изображение - PDF, съдържащ вече истински текст, не се нуждае от OCR. Проверявайте резултата за цифри и собствени имена.
Разпознаването на текст обикновено е владение на облака: известните OCR услуги качват всеки скан на своите сървъри за обработка - и то точно документи като договори, медицински писма или лични документи. Тук цялото разпознаване работи с Tesseract като WebAssembly във вашия браузър, а всичките 113 езикови пакета са хоствани на самия gottrix - по време на разпознаването нищо не се тегли от трети страни. Освен това списъкът с езици стартира предварително избран според езика на вашия интерфейс. Безплатно, без акаунт и без лимит на страниците.
Изберете изходния формат (търсим PDF или текст) и езика от списъка.
Изтеглете търсимия PDF или TXT.
Ограничения: За СКАНИРАНИ / графични PDF файлове: прави ги търсими чрез OCR (невидим текстов слой) или връща обикновен текст. Разпознава ПЕЧАТЕН текст на 113 езика и много азбуки; ръкопис ненадеждно. Забележка: невидимият текстов слой в търсимия PDF покрива латиница с всички ударени букви (23 от 113-те езика, напр. полски, чешки, виетнамски, турски), гръцки и кирилица. Знаци от други писмености (напр. CJK, арабски, иврит, деванагари, тайски) съзнателно се пропускат там, вместо да бъдат изкривени; за тези писмености изберете изход „Само текст (TXT)“, който връща напълно разпознатия текст. В търсимия PDF всяка страница се вгражда отново като изображение, оформлението се запазва, но файлът може да нарасне; PDF с вече истински текст не се нуждае от OCR. Разпознаването не е безпогрешно - проверявайте цифри и собствени имена. Двигателят и езиковият модел се зареждат еднократно (няколко МБ, същият произход), след това е достъпно офлайн. Големи PDF файлове изискват известно време и памет в зависимост от броя на страниците и устройството.
Чести въпроси
PDF файлът ми се качва на сървър?
Не. Рендирането и разпознаването се изпълняват изцяло локално в браузъра (WebAssembly); PDF-ът никога не напуска устройството ви - особено важно за договори и официална кореспонденция.
Какво е търсим PDF?
Страницата изглежда като скана, но под нея се намират невидим текстов слой. Това позволява да търсите в PDF-а, да маркирате и копирате текст - визуалното оформление остава непроменено.
Запазва ли се оформлението?
Да. Всяка страница се вгражда като изображение на оригинала, невидимият текстов слой е наредено точно отгоре. Изгледът не се променя, но файлът може малко да нарасне.
Разпознава ли ръкопис и други езици?
Други езици - да: налични са над 100 (включително арабски, руски, хинди, японски, корейски, китайски). Ръкописът се разпознава ненадеждно, само печатен текст. Текстовият слой на търсимия PDF покрива латиница с всички ударени букви, гръцки и кирилица; при CJK, арабски, иврит, деванагари или тайски използвайте изхода „Само текст (TXT)“, който съдържа напълно разпознатия текст.
Колко езика разпознава OCR?
113 - от български, английски и немски през арабски, хинди и тайски до японски, корейски и китайски. Всеки език фигурира в списъка под собственото си име, а всички езикови пакети са хоствани на самия gottrix, не при трета страна.
Безплатен ли е OCR за PDF и има ли лимит на страници?
Да, напълно безплатен - без акаунт, без воден знак и без лимит на страници или дневен лимит. Многото страници просто отнемат съответно повече време, защото разпознаването се изчислява от вашето собствено устройство.
Защо локалното разпознаване е по-добро за поверителни сканове?
Защото сканът никога не напуска вашето устройство: без качване, без обработка на сървър, без копие в чужд облак. След първото зареждане разпознаването работи дори офлайн - най-силното доказателство, че нищо не се предава.
Само с вашето съгласие измерваме употребата анонимно чрез бисквитки, за да подобряваме gottrix. Вашите файлове винаги остават локално, на вашето устройство. Поверителност