hi

PDF OCR (खोजने योग्य)

स्कैन किए गए PDF को OCR से खोजने योग्य बनाएं - ब्राउज़र में, मूल पृष्ठों के नीचे छिपी टेक्स्ट परत के साथ, बिना अपलोड।

आपके डिवाइस पर ही स्थानीय प्रोसेसिंग चल रही है ...

आउटपुट
  • खोजने योग्य PDF
  • केवल टेक्स्ट (TXT)
दस्तावेज़ की भाषा
  • Deutsch
  • English
  • Français
  • Español
  • Italiano
  • Português
  • Nederlands
  • Polski
  • Русский
  • Українська
  • Čeština
  • Slovenčina
  • Română
  • Magyar
  • Ελληνικά
  • Türkçe
  • Svenska
  • Dansk
  • Norsk
  • Suomi
  • Català
  • Hrvatski
  • Српски
  • Български
  • العربية
  • עברית
  • فارسی
  • اردو
  • हिन्दी
  • বাংলা
  • 日本語
  • 한국어
  • 简体中文
  • 繁體中文
  • ไทย
  • Tiếng Việt
  • Bahasa Indonesia
  • Bahasa Melayu
  • Afrikaans
  • አማርኛ
  • অসমীয়া
  • Azərbaycanca
  • Азәрбајҹанҹа (Кирил)
  • Беларуская
  • བོད་སྐད་
  • Bosanski
  • Brezhoneg
  • Cebuano
  • ᏣᎳᎩ
  • Corsu
  • Cymraeg
  • ދިވެހި
  • རྫོང་ཁ
  • Esperanto
  • Eesti
  • Euskara
  • Føroyskt
  • Filipino
  • Frysk
  • Gàidhlig
  • Gaeilge
  • Galego
  • Ἀρχαία Ἑλληνικά
  • ગુજરાતી
  • Kreyòl ayisyen
  • Հայերեն
  • ᐃᓄᒃᑎᑐᑦ
  • Íslenska
  • Basa Jawa
  • ಕನ್ನಡ
  • ქართული
  • Қазақша
  • ខ្មែរ
  • Кыргызча
  • Kurmancî
  • ລາວ
  • Latina
  • Latviešu
  • Lietuvių
  • Lëtzebuergesch
  • മലയാളം
  • मराठी
  • Македонски
  • Malti
  • Монгол
  • Māori
  • မြန်မာ
  • नेपाली
  • Occitan
  • ଓଡ଼ିଆ
  • ਪੰਜਾਬੀ
  • پښتو
  • Runa Simi
  • संस्कृतम्
  • සිංහල
  • Slovenščina
  • سنڌي
  • Shqip
  • Srpski (latinica)
  • Basa Sunda
  • Kiswahili
  • ܠܫܢܐ ܣܘܪܝܝܐ
  • தமிழ்
  • Татарча
  • తెలుగు
  • Тоҷикӣ
  • ትግርኛ
  • Lea faka-Tonga
  • ئۇيغۇرچە
  • Oʻzbekcha
  • Ўзбекча (Кирил)
  • ייִדיש
  • Yorùbá

आपकी फ़ाइलें

    आपके डिवाइस पर ही स्थानीय प्रोसेसिंग चल रही है ...

    0%

    आपकी फ़ाइलें आपके डिवाइस से कभी बाहर नहीं गईं

      इस फ़ाइल के साथ जारी रखें

      दोबारा अपलोड नहीं

      ये टूल .PDF स्वीकार करते हैं - आपकी फ़ाइल सीधे भेज दी जाती है।

      क्या मेरी फ़ाइल अपलोड होती है?

      नहीं। सब कुछ आपके ब्राउज़र में चलता है - आपकी फ़ाइल कभी आपके डिवाइस से बाहर नहीं जाती। यह कैसे सत्यापित किया जा सकता है

      कोई अपलोड नहीं100% स्थानीय
      सामग्री आपके पास रहती हैकिसी तीसरे की पहुँच नहीं
      Hosted in GermanyGlobal Content Delivery
      स्वतंत्र रूप से जाँचा गयाTLS A+ · हेडर A+

      स्कैन किया गया PDF मूलतः छवियों का ढेर है: आप टेक्स्ट देख सकते हैं लेकिन चुन, खोज या कॉपी नहीं कर सकते। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) छवि से अक्षर पढ़कर उन्हें पृष्ठों के ऊपर एक अदृश्य टेक्स्ट परत के रूप में रखता है। दिखावट वैसी ही रहती है, लेकिन PDF खोजने योग्य हो जाता है और टेक्स्ट चुना जा सकता है - ठीक वैसा जैसा कार्यालय, अभिलेखागार और पूर्ण-पाठ खोज चाहते हैं।

      आउटपुट चुनें: खोजने योग्य PDF (मूल पृष्ठ और टेक्स्ट परत) या TXT के रूप में सादा टेक्स्ट। सूची से दस्तावेज़ की भाषा सेट करें - हिंदी और अंग्रेज़ी से लेकर रूसी, अरबी और जापानी, कोरियाई और चीनी तक 113 भाषाएं, हर एक अपने नाम में - ताकि अक्षर सही ढंग से पहचाने जाएं। सब कुछ ब्राउज़र में WebAssembly के जरिए चलता है: वही ओपन-सोर्स Tesseract इंजन जैसा "चित्र से टेक्स्ट" टूल, पूरे PDF पर पृष्ठ-दर-पृष्ठ। पहली बार उपयोग पर ब्राउज़र इंजन और चुना गया भाषा मॉडल एक बार डाउनलोड करता है (कुछ MB, same-origin); उसके बाद ऑफलाइन काम करता है।

      यह टूल स्कैन किए गए या छवि-आधारित PDF के लिए है। पहचान स्कैन गुणवत्ता पर बहुत निर्भर करती है: मुद्रित टेक्स्ट के साथ तीखे, सीधे, उच्च-कंट्रास्ट पृष्ठ बहुत अच्छी तरह पहचाने जाते हैं; तिरछे या धुंधले काफी खराब; हस्तलिपि विश्वसनीय नहीं। खोजने योग्य PDF में हर पृष्ठ छवि के रूप में फिर से एम्बेड होता है - जिस PDF में पहले से वास्तविक टेक्स्ट है उसे OCR की जरूरत नहीं। संख्याओं और उचित नामों के लिए परिणाम जांचें।

      टेक्स्ट पहचान आमतौर पर क्लाउड का इलाका है: जाने-माने OCR सेवाएं हर स्कैन को प्रोसेसिंग के लिए अपने सर्वर पर अपलोड करती हैं - और वह भी अनुबंध, मेडिकल रिपोर्ट या पहचान पत्र जैसे दस्तावेज़। यहां पूरी पहचान आपके ब्राउज़र में WebAssembly के रूप में Tesseract से चलती है, और सभी 113 भाषा पैक gottrix पर ही होस्ट किए गए हैं - पहचान के दौरान किसी तीसरे पक्ष से कुछ भी लोड नहीं होता। भाषा सूची आपकी इंटरफ़ेस भाषा के अनुसार पहले से चुनी हुई शुरू होती है। मुफ़्त, बिना खाते के और बिना पृष्ठ सीमा के।

      तकनीकी विवरण

      तकनीकी विवरण
      इनपुट फ़ॉर्मैटPDF
      स्वचालित रूपांतरणPNG, JPG, WebP, GIF, BMP, TIFF, ICO, SVG, HEIC, ZIP, DOCX, DDS, HDR, PCX, WBMP
      आउटपुट फ़ॉर्मैटPDF, TXT
      बैच प्रोसेसिंगहाँ
      प्रोसेसिंगब्राउज़र में स्थानीय रूप से (WebAssembly)
      फ़ाइल अपलोडकोई नहीं

      3 चरणों में

      1. स्कैन किया गया PDF डालें।
      2. आउटपुट (खोजने योग्य PDF या टेक्स्ट) और सूची से भाषा चुनें।
      3. खोजने योग्य PDF या TXT डाउनलोड करें।

      सीमाएँ: स्कैन/छवि-आधारित PDF के लिए: OCR से खोजने योग्य बनाता है (अदृश्य टेक्स्ट परत) या सादा टेक्स्ट देता है। 113 भाषाओं और कई लिपियों में मुद्रित टेक्स्ट पहचानता है; हस्तलिपि विश्वसनीय नहीं। नोट: खोजने योग्य PDF की अदृश्य टेक्स्ट परत में सभी उच्चारण-चिह्नों सहित लैटिन लिपि (113 में से 23 भाषाओं में, जैसे पोलिश, चेक, वियतनामी, तुर्की), ग्रीक और सिरिलिक शामिल हैं। अन्य लिपियों के अक्षर (जैसे CJK, अरबी, हिब्रू, देवनागरी, थाई) वहां विकृत रूप में डालने के बजाय जानबूझकर छोड़ दिए जाते हैं; उन लिपियों के लिए "केवल टेक्स्ट (TXT)" आउटपुट पूरी तरह पहचाना गया टेक्स्ट देता है। खोजने योग्य PDF में हर पृष्ठ छवि के रूप में फिर एम्बेड होता है इसलिए लेआउट बना रहता है लेकिन फ़ाइल बड़ी हो सकती है; जिस PDF में पहले से वास्तविक टेक्स्ट है उसे OCR नहीं चाहिए। पहचान त्रुटि-मुक्त नहीं - खासकर संख्याएं और उचित नाम जांचें। इंजन और चुना गया भाषा मॉडल एक बार डाउनलोड होता है (कुछ MB, same-origin), फिर ऑफलाइन उपयोग संभव। बड़े PDF में पृष्ठ संख्या और डिवाइस के अनुसार समय और मेमोरी लगती है।

      अक्सर पूछे जाने वाले प्रश्न

      क्या मेरा PDF अपलोड होता है?

      नहीं। रेंडरिंग और पहचान पूरी तरह ब्राउज़र में स्थानीय रूप से चलती है (WebAssembly); PDF कभी आपके डिवाइस से नहीं जाता - अनुबंध और सरकारी पत्राचार के लिए निर्णायक फायदा।

      खोजने योग्य PDF क्या होता है?

      पृष्ठ स्कैन जैसा दिखता है, लेकिन नीचे एक अदृश्य टेक्स्ट परत होती है। इससे PDF में खोज, टेक्स्ट चुनना और कॉपी करना संभव होता है - जबकि दृश्य रूप वैसा ही रहता है।

      क्या लेआउट बना रहता है?

      हां। हर पृष्ठ मूल पृष्ठ की छवि के रूप में एम्बेड होता है, जिसके ऊपर अदृश्य टेक्स्ट परत संरेखित होती है। दिखावट नहीं बदलती, हालांकि फ़ाइल थोड़ी बड़ी हो सकती है।

      क्या यह हस्तलिपि या अन्य भाषाएं पहचानता है?

      अन्य भाषाएं हां: 100 से अधिक उपलब्ध (अरबी, रूसी, हिंदी, जापानी, कोरियाई, चीनी सहित)। हस्तलिपि विश्वसनीय नहीं, केवल मुद्रित टेक्स्ट। खोजने योग्य PDF की टेक्स्ट परत सभी उच्चारण-चिह्नों सहित लैटिन, ग्रीक और सिरिलिक को कवर करती है; CJK, अरबी, हिब्रू, देवनागरी या थाई के लिए "केवल टेक्स्ट (TXT)" आउटपुट उपयोग करें, जिसमें पूरा पहचाना गया टेक्स्ट होता है।

      टेक्स्ट पहचान कितनी भाषाएं जानती है?

      113 - हिन्दी, अंग्रेज़ी और जर्मन से लेकर अरबी, थाई होते हुए जापानी, कोरियाई और चीनी तक। हर भाषा सूची में अपने ही नाम से दिखती है, और सारे भाषा पैक किसी तीसरे पक्ष के बजाय खुद gottrix पर होस्ट किए गए हैं।

      क्या PDF OCR मुफ़्त है, और क्या पृष्ठ सीमा है?

      हां, पूरी तरह मुफ़्त - बिना खाते के, बिना वॉटरमार्क के और बिना पृष्ठ या दैनिक सीमा के। ज़्यादा पृष्ठों में बस उतना ही ज़्यादा समय लगता है, क्योंकि पहचान की गणना आपका अपना डिवाइस करता है।

      गोपनीय स्कैन के लिए लोकल पहचान बेहतर क्यों है?

      क्योंकि स्कैन कभी आपके डिवाइस से बाहर नहीं जाता: न अपलोड, न सर्वर प्रोसेसिंग, न किसी पराए क्लाउड में कॉपी। पहली लोडिंग के बाद पहचान ऑफ़लाइन भी चलती है - इस बात का सबसे मज़बूत सबूत कि कुछ भी भेजा नहीं जाता।

      संबंधित टूल

      चित्र से टेक्स्ट (OCR) · PDF से Word · PDF संपीड़ित करें · PDF से Markdown · PDF से टेक्स्ट · PDF से EPUB