Hakuna uchakataji wa maudhui ya faili yako unaofanyika kwenye seva yoyote. Huhitaji mkataba wa uchakataji wa data na gottrix ili kushughulikia nyaraka za siri au za kibiashara.
Hosted in GermanyGlobal Content Delivery
Seva za asili ziko Hetzner nchini Ujerumani, zikiwasilishwa duniani kote kupitia mtandao wa usambazaji maudhui (CDN). Maudhui ya faili yako hayatumwi kamwe katika mchakato huu - hayaachi kifaa chako.
PDF iliyoscanwa ni kwa asili mlundiko wa picha: unaona maandishi lakini huwezi kuichagua, kuitafuta au kuinakili. OCR (utambuzi wa maandishi kwa macho) husoma herufi kutoka picha na kuziweka kama safu isiyoonekana ya maandishi juu ya kurasa. Mwonekano unabaki sawa, lakini PDF inakuwa inayoweza kutafutwa na maandishi yanaweza kuchaguliwa - hasa ndiyo kinachohitajika na ofisi, kumbukumbu na utafutaji wa maandishi kamili.
Chagua matokeo: PDF inayoweza kutafutwa (kurasa za asili pamoja na safu ya maandishi) au maandishi safi kama TXT. Weka lugha ya hati kutoka orodha - lugha 113 kuanzia Kiswahili na Kiingereza, hadi Kirusi, Kiarabu na Kihindi, na zaidi hadi Kijapani, Kikorea na Kichina, kila moja kwa jina lake - ili herufi zitambuliwe vizuri. Kila kitu kinafanyika ndani ya kivinjari kupitia WebAssembly: injini ile ile ya chanzo wazi ya Tesseract kama zana ya "Picha hadi Maandishi", inayotumika ukurasa kwa ukurasa kwenye PDF nzima. Wakati wa matumizi ya kwanza kivinjari kinapakua injini na mfano wa lugha mara moja (MB chache, same-origin); baada ya hapo inafanya kazi bila mtandao.
Zana hii imeundwa kwa PDF zilizoscanwa au zinazotegemea picha. Ubora wa utambuzi unategemea sana ubora wa skani: kurasa wazi, zilizonyooka na zenye tofauti kubwa ya maandishi yaliyochapishwa zinatambuliwa vizuri sana, zilizopotoka au zisizo wazi - vibaya zaidi; mwandiko wa mkono hautambuliwi kwa uhakika. Katika PDF inayoweza kutafutwa, kila ukurasa huwekwa tena kama picha, hivyo mpango unabaki lakini faili inaweza kukua. PDF yenye maandishi halisi tayari haihitaji OCR. Angalia matokeo kwa nambari na majina maalum.
Utambuzi wa maandishi kwa kawaida ni eneo la wingu: huduma maarufu za OCR hupakia kila skani kwenye seva zao kwa ajili ya kuchakatwa - na hasa nyaraka kama mikataba, barua za matibabu au vitambulisho. Hapa utambuzi wote unafanya kazi kwa Tesseract kama WebAssembly kwenye kivinjari chako, na vifurushi vyote 113 vya lugha vinapangishwa kwenye gottrix yenyewe - wakati wa utambuzi hakuna kinachopakuliwa kutoka kwa wahusika wengine. Zaidi ya hayo, orodha ya lugha huanza ikiwa imechaguliwa awali kulingana na lugha ya kiolesura chako. Bure, bila akaunti na bila kikomo cha kurasa.
Chagua matokeo (PDF inayotafutwa au maandishi) na lugha kutoka orodha.
Pakua PDF inayotafutwa au TXT.
Mipaka: Kwa PDF ZILIZOSCANWA / za picha: inazifanya ziweze kutafutwa kwa OCR (safu isiyoonekana ya maandishi) au kurudisha maandishi safi. Inatambua maandishi YALIYOCHAPISHWA katika lugha 113 na mifumo mingi ya maandishi; mwandiko wa mkono hautambuliwi kwa uhakika. Kumbuka: safu isiyoonekana ya maandishi katika PDF inayoweza kutafutwa inajumuisha herufi za Kilatini pamoja na alama zake zote za sauti (lugha 23 kati ya 113, k.m. Kipolandi, Kicheki, Kivietinamu, Kituruki), Kigiriki na Kisirili. Herufi za mifumo mingine ya maandishi (k.m. CJK, Kiarabu, Kiebrania, Kidevanagari, Kithai) huachwa hapo kwa makusudi badala ya kuonekana zikiwa zimeharibika; kwa mifumo hiyo ya maandishi, matokeo ya "Maandishi tu (TXT)" hutoa maandishi yaliyotambuliwa kikamilifu. Katika PDF inayoweza kutafutwa kila ukurasa huwekwa tena kama picha, hivyo mpango unabaki lakini faili inaweza kukua. PDF yenye maandishi halisi haihitaji OCR. Utambuzi si bila makosa - angalia hasa nambari na majina maalum. Injini na mfano wa lugha uliochaguliwa zinapakuliwa mara moja (MB chache, same-origin), kisha zinafanya kazi bila mtandao. PDF kubwa zinahitaji muda na kumbukumbu kulingana na idadi ya kurasa na kifaa.
Maswali yanayoulizwa mara kwa mara
Je, PDF yangu inapakiwa kwenye seva?
Hapana. Kutoa na kutambua maandishi kunafanyika kikamilifu hapa ndani ya kivinjari (WebAssembly); PDF haiachi kifaa chako - hii ndiyo faida muhimu, hasa kwa mikataba na barua rasmi.
PDF inayotafutwa ni nini?
Ukurasa unaonekana kama skani, lakini chini yake kuna safu isiyoonekana ya maandishi. Hii inakuruhusu kutafuta kwenye PDF, kuchagua na kunakili maandishi - huku mwonekano ukibaki ule ule.
Je, mpango wa hati unabaki?
Ndiyo. Kila ukurasa huwekwa kama picha ya ukurasa wa asili, na safu isiyoonekana ya maandishi imewekwa juu yake sawasawa. Mwonekano hauna mabadiliko, ingawa faili inaweza kukua kidogo.
Je, inatambua mwandiko wa mkono au lugha nyingine?
Lugha nyingine - ndiyo: zaidi ya 100 zinapatikana (ikiwemo Kiarabu, Kirusi, Kihindi, Kijapani, Kikorea, Kichina). Mwandiko wa mkono hautambuliwi kwa uhakika, tu maandishi yaliyochapishwa. Safu ya maandishi katika PDF inayotafutwa inajumuisha herufi za Kilatini pamoja na alama zake zote za sauti, Kigiriki na Kisirili; kwa CJK, Kiarabu, Kiebrania, Kidevanagari au Kithai tumia matokeo ya "Maandishi tu (TXT)", yenye maandishi yaliyotambuliwa kikamilifu.
Utambuzi wa maandishi unatambua lugha ngapi?
113 - kuanzia Kiswahili, Kiingereza na Kijerumani kupitia Kiarabu, Kihindi na Kithai hadi Kijapani, Kikorea na Kichina. Kila lugha inaonekana kwenye orodha kwa jina lake yenyewe, na vifurushi vyote vya lugha vinapangishwa kwenye gottrix yenyewe, si kwa mhusika mwingine.
Je, OCR ya PDF ni bure, na kuna kikomo cha kurasa?
Ndiyo, bure kabisa - bila akaunti, bila alama ya maji na bila kikomo cha kurasa wala cha kila siku. Kurasa nyingi zinachukua tu muda zaidi kulingana na wingi wake, kwa sababu kifaa chako ndicho kinachokokotoa utambuzi.
Kwa nini utambuzi wa ndani ya kifaa ni bora kwa skani za siri?
Kwa sababu skani haiondoki kamwe kwenye kifaa chako: hakuna kupakia, hakuna uchakataji wa seva, hakuna nakala kwenye wingu la mtu mwingine. Baada ya upakiaji wa kwanza utambuzi unafanya kazi hata bila mtandao - uthibitisho imara zaidi kwamba hakuna kinachotumwa.
Tunapima matumizi bila kukutambua kupitia vidakuzi ili kuboresha gottrix kwa idhini yako pekee. Faili zako hubaki kila wakati ndani ya kifaa chako. Faragha