sw

PDF OCR inayotafutwa

Fanya PDF iliyoscanwa iweze kutafutwa kwa OCR - hapa kwenye kivinjari, na safu isiyoonekana ya maandishi chini ya kurasa za asili, bila kupakia faili.

Inachakata humu kwenye kifaa chako ...

Matokeo
  • PDF inayotafutwa
  • Maandishi tu (TXT)
Lugha ya hati
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

Faili zako

    Inachakata humu kwenye kifaa chako ...

    0%

    Je, faili yangu hupakiwa?

    Hapana. Kila kitu hufanyika kwenye kivinjari chako - faili yako haitoki kamwe kwenye kifaa chako. Jinsi hili linavyoweza kuthibitishwa

    Hakuna kupakia100% kwa kifaa chako
    Maudhui hubaki kwakohakuna ufikiaji wa wengine
    Hosted in GermanyGlobal Content Delivery
    Imekaguliwa kwa njeTLS A+ · Vichwa vya HTTP A+

    PDF iliyoscanwa ni kwa asili mlundiko wa picha: unaona maandishi lakini huwezi kuichagua, kuitafuta au kuinakili. OCR (utambuzi wa maandishi kwa macho) husoma herufi kutoka picha na kuziweka kama safu isiyoonekana ya maandishi juu ya kurasa. Mwonekano unabaki sawa, lakini PDF inakuwa inayoweza kutafutwa na maandishi yanaweza kuchaguliwa - hasa ndiyo kinachohitajika na ofisi, kumbukumbu na utafutaji wa maandishi kamili.

    Chagua matokeo: PDF inayoweza kutafutwa (kurasa za asili pamoja na safu ya maandishi) au maandishi safi kama TXT. Weka lugha ya hati kutoka orodha - lugha 113 kuanzia Kiswahili na Kiingereza, hadi Kirusi, Kiarabu na Kihindi, na zaidi hadi Kijapani, Kikorea na Kichina, kila moja kwa jina lake - ili herufi zitambuliwe vizuri. Kila kitu kinafanyika ndani ya kivinjari kupitia WebAssembly: injini ile ile ya chanzo wazi ya Tesseract kama zana ya "Picha hadi Maandishi", inayotumika ukurasa kwa ukurasa kwenye PDF nzima. Wakati wa matumizi ya kwanza kivinjari kinapakua injini na mfano wa lugha mara moja (MB chache, same-origin); baada ya hapo inafanya kazi bila mtandao.

    Zana hii imeundwa kwa PDF zilizoscanwa au zinazotegemea picha. Ubora wa utambuzi unategemea sana ubora wa skani: kurasa wazi, zilizonyooka na zenye tofauti kubwa ya maandishi yaliyochapishwa zinatambuliwa vizuri sana, zilizopotoka au zisizo wazi - vibaya zaidi; mwandiko wa mkono hautambuliwi kwa uhakika. Katika PDF inayoweza kutafutwa, kila ukurasa huwekwa tena kama picha, hivyo mpango unabaki lakini faili inaweza kukua. PDF yenye maandishi halisi tayari haihitaji OCR. Angalia matokeo kwa nambari na majina maalum.

    Utambuzi wa maandishi kwa kawaida ni eneo la wingu: huduma maarufu za OCR hupakia kila skani kwenye seva zao kwa ajili ya kuchakatwa - na hasa nyaraka kama mikataba, barua za matibabu au vitambulisho. Hapa utambuzi wote unafanya kazi kwa Tesseract kama WebAssembly kwenye kivinjari chako, na vifurushi vyote 113 vya lugha vinapangishwa kwenye gottrix yenyewe - wakati wa utambuzi hakuna kinachopakuliwa kutoka kwa wahusika wengine. Zaidi ya hayo, orodha ya lugha huanza ikiwa imechaguliwa awali kulingana na lugha ya kiolesura chako. Bure, bila akaunti na bila kikomo cha kurasa.

    Maelezo ya kiufundi

    Maelezo ya kiufundi
    Miundo ya ingizoPDF
    Ubadilishaji otomatikiPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
    Miundo ya matokeoPDF, TXT
    Uchakataji wa kundiNdiyo
    UchakatajiNdani ya kivinjari (WebAssembly)
    Upakiaji wa failiHakuna

    Katika hatua 3

    1. Weka PDF iliyoscanwa.
    2. Chagua matokeo (PDF inayotafutwa au maandishi) na lugha kutoka orodha.
    3. Pakua PDF inayotafutwa au TXT.

    Mipaka: Kwa PDF ZILIZOSCANWA / za picha: inazifanya ziweze kutafutwa kwa OCR (safu isiyoonekana ya maandishi) au kurudisha maandishi safi. Inatambua maandishi YALIYOCHAPISHWA katika lugha 113 na mifumo mingi ya maandishi; mwandiko wa mkono hautambuliwi kwa uhakika. Kumbuka: safu isiyoonekana ya maandishi katika PDF inayoweza kutafutwa inajumuisha herufi za Kilatini pamoja na alama zake zote za sauti (lugha 23 kati ya 113, k.m. Kipolandi, Kicheki, Kivietinamu, Kituruki), Kigiriki na Kisirili. Herufi za mifumo mingine ya maandishi (k.m. CJK, Kiarabu, Kiebrania, Kidevanagari, Kithai) huachwa hapo kwa makusudi badala ya kuonekana zikiwa zimeharibika; kwa mifumo hiyo ya maandishi, matokeo ya "Maandishi tu (TXT)" hutoa maandishi yaliyotambuliwa kikamilifu. Katika PDF inayoweza kutafutwa kila ukurasa huwekwa tena kama picha, hivyo mpango unabaki lakini faili inaweza kukua. PDF yenye maandishi halisi haihitaji OCR. Utambuzi si bila makosa - angalia hasa nambari na majina maalum. Injini na mfano wa lugha uliochaguliwa zinapakuliwa mara moja (MB chache, same-origin), kisha zinafanya kazi bila mtandao. PDF kubwa zinahitaji muda na kumbukumbu kulingana na idadi ya kurasa na kifaa.

    Maswali yanayoulizwa mara kwa mara

    Je, PDF yangu inapakiwa kwenye seva?

    Hapana. Kutoa na kutambua maandishi kunafanyika kikamilifu hapa ndani ya kivinjari (WebAssembly); PDF haiachi kifaa chako - hii ndiyo faida muhimu, hasa kwa mikataba na barua rasmi.

    PDF inayotafutwa ni nini?

    Ukurasa unaonekana kama skani, lakini chini yake kuna safu isiyoonekana ya maandishi. Hii inakuruhusu kutafuta kwenye PDF, kuchagua na kunakili maandishi - huku mwonekano ukibaki ule ule.

    Je, mpango wa hati unabaki?

    Ndiyo. Kila ukurasa huwekwa kama picha ya ukurasa wa asili, na safu isiyoonekana ya maandishi imewekwa juu yake sawasawa. Mwonekano hauna mabadiliko, ingawa faili inaweza kukua kidogo.

    Je, inatambua mwandiko wa mkono au lugha nyingine?

    Lugha nyingine - ndiyo: zaidi ya 100 zinapatikana (ikiwemo Kiarabu, Kirusi, Kihindi, Kijapani, Kikorea, Kichina). Mwandiko wa mkono hautambuliwi kwa uhakika, tu maandishi yaliyochapishwa. Safu ya maandishi katika PDF inayotafutwa inajumuisha herufi za Kilatini pamoja na alama zake zote za sauti, Kigiriki na Kisirili; kwa CJK, Kiarabu, Kiebrania, Kidevanagari au Kithai tumia matokeo ya "Maandishi tu (TXT)", yenye maandishi yaliyotambuliwa kikamilifu.

    Utambuzi wa maandishi unatambua lugha ngapi?

    113 - kuanzia Kiswahili, Kiingereza na Kijerumani kupitia Kiarabu, Kihindi na Kithai hadi Kijapani, Kikorea na Kichina. Kila lugha inaonekana kwenye orodha kwa jina lake yenyewe, na vifurushi vyote vya lugha vinapangishwa kwenye gottrix yenyewe, si kwa mhusika mwingine.

    Je, OCR ya PDF ni bure, na kuna kikomo cha kurasa?

    Ndiyo, bure kabisa - bila akaunti, bila alama ya maji na bila kikomo cha kurasa wala cha kila siku. Kurasa nyingi zinachukua tu muda zaidi kulingana na wingi wake, kwa sababu kifaa chako ndicho kinachokokotoa utambuzi.

    Kwa nini utambuzi wa ndani ya kifaa ni bora kwa skani za siri?

    Kwa sababu skani haiondoki kamwe kwenye kifaa chako: hakuna kupakia, hakuna uchakataji wa seva, hakuna nakala kwenye wingu la mtu mwingine. Baada ya upakiaji wa kwanza utambuzi unafanya kazi hata bila mtandao - uthibitisho imara zaidi kwamba hakuna kinachotumwa.

    Zana zinazohusiana

    Picha hadi Maandishi · PDF kwenda Word · Finyaza PDF · PDF hadi Markdown · PDF kwa maandishi · PDF kwenda EPUB