किसी सर्वर पर आपकी फ़ाइल की सामग्री की कोई प्रोसेसिंग नहीं होती। गोपनीय या व्यावसायिक दस्तावेज़ संभालने के लिए आपको gottrix के साथ किसी डेटा-प्रोसेसिंग समझौते की ज़रूरत नहीं।
Hosted in GermanyGlobal Content Delivery
ओरिजिन सर्वर जर्मनी में Hetzner पर हैं, और कंटेंट डिलीवरी नेटवर्क (CDN) के ज़रिए दुनिया भर में डिलीवरी होती है। इस दौरान आपकी फ़ाइल की सामग्री कभी ट्रांसमिट नहीं होती - वह आपके डिवाइस से बाहर नहीं जाती।
स्कैन किया गया PDF मूलतः छवियों का ढेर है: आप टेक्स्ट देख सकते हैं लेकिन चुन, खोज या कॉपी नहीं कर सकते। OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) छवि से अक्षर पढ़कर उन्हें पृष्ठों के ऊपर एक अदृश्य टेक्स्ट परत के रूप में रखता है। दिखावट वैसी ही रहती है, लेकिन PDF खोजने योग्य हो जाता है और टेक्स्ट चुना जा सकता है - ठीक वैसा जैसा कार्यालय, अभिलेखागार और पूर्ण-पाठ खोज चाहते हैं।
आउटपुट चुनें: खोजने योग्य PDF (मूल पृष्ठ और टेक्स्ट परत) या TXT के रूप में सादा टेक्स्ट। सूची से दस्तावेज़ की भाषा सेट करें - हिंदी और अंग्रेज़ी से लेकर रूसी, अरबी और जापानी, कोरियाई और चीनी तक 113 भाषाएं, हर एक अपने नाम में - ताकि अक्षर सही ढंग से पहचाने जाएं। सब कुछ ब्राउज़र में WebAssembly के जरिए चलता है: वही ओपन-सोर्स Tesseract इंजन जैसा "चित्र से टेक्स्ट" टूल, पूरे PDF पर पृष्ठ-दर-पृष्ठ। पहली बार उपयोग पर ब्राउज़र इंजन और चुना गया भाषा मॉडल एक बार डाउनलोड करता है (कुछ MB, same-origin); उसके बाद ऑफलाइन काम करता है।
यह टूल स्कैन किए गए या छवि-आधारित PDF के लिए है। पहचान स्कैन गुणवत्ता पर बहुत निर्भर करती है: मुद्रित टेक्स्ट के साथ तीखे, सीधे, उच्च-कंट्रास्ट पृष्ठ बहुत अच्छी तरह पहचाने जाते हैं; तिरछे या धुंधले काफी खराब; हस्तलिपि विश्वसनीय नहीं। खोजने योग्य PDF में हर पृष्ठ छवि के रूप में फिर से एम्बेड होता है - जिस PDF में पहले से वास्तविक टेक्स्ट है उसे OCR की जरूरत नहीं। संख्याओं और उचित नामों के लिए परिणाम जांचें।
टेक्स्ट पहचान आमतौर पर क्लाउड का इलाका है: जाने-माने OCR सेवाएं हर स्कैन को प्रोसेसिंग के लिए अपने सर्वर पर अपलोड करती हैं - और वह भी अनुबंध, मेडिकल रिपोर्ट या पहचान पत्र जैसे दस्तावेज़। यहां पूरी पहचान आपके ब्राउज़र में WebAssembly के रूप में Tesseract से चलती है, और सभी 113 भाषा पैक gottrix पर ही होस्ट किए गए हैं - पहचान के दौरान किसी तीसरे पक्ष से कुछ भी लोड नहीं होता। भाषा सूची आपकी इंटरफ़ेस भाषा के अनुसार पहले से चुनी हुई शुरू होती है। मुफ़्त, बिना खाते के और बिना पृष्ठ सीमा के।
आउटपुट (खोजने योग्य PDF या टेक्स्ट) और सूची से भाषा चुनें।
खोजने योग्य PDF या TXT डाउनलोड करें।
सीमाएँ: स्कैन/छवि-आधारित PDF के लिए: OCR से खोजने योग्य बनाता है (अदृश्य टेक्स्ट परत) या सादा टेक्स्ट देता है। 113 भाषाओं और कई लिपियों में मुद्रित टेक्स्ट पहचानता है; हस्तलिपि विश्वसनीय नहीं। नोट: खोजने योग्य PDF की अदृश्य टेक्स्ट परत में सभी उच्चारण-चिह्नों सहित लैटिन लिपि (113 में से 23 भाषाओं में, जैसे पोलिश, चेक, वियतनामी, तुर्की), ग्रीक और सिरिलिक शामिल हैं। अन्य लिपियों के अक्षर (जैसे CJK, अरबी, हिब्रू, देवनागरी, थाई) वहां विकृत रूप में डालने के बजाय जानबूझकर छोड़ दिए जाते हैं; उन लिपियों के लिए "केवल टेक्स्ट (TXT)" आउटपुट पूरी तरह पहचाना गया टेक्स्ट देता है। खोजने योग्य PDF में हर पृष्ठ छवि के रूप में फिर एम्बेड होता है इसलिए लेआउट बना रहता है लेकिन फ़ाइल बड़ी हो सकती है; जिस PDF में पहले से वास्तविक टेक्स्ट है उसे OCR नहीं चाहिए। पहचान त्रुटि-मुक्त नहीं - खासकर संख्याएं और उचित नाम जांचें। इंजन और चुना गया भाषा मॉडल एक बार डाउनलोड होता है (कुछ MB, same-origin), फिर ऑफलाइन उपयोग संभव। बड़े PDF में पृष्ठ संख्या और डिवाइस के अनुसार समय और मेमोरी लगती है।
अक्सर पूछे जाने वाले प्रश्न
क्या मेरा PDF अपलोड होता है?
नहीं। रेंडरिंग और पहचान पूरी तरह ब्राउज़र में स्थानीय रूप से चलती है (WebAssembly); PDF कभी आपके डिवाइस से नहीं जाता - अनुबंध और सरकारी पत्राचार के लिए निर्णायक फायदा।
खोजने योग्य PDF क्या होता है?
पृष्ठ स्कैन जैसा दिखता है, लेकिन नीचे एक अदृश्य टेक्स्ट परत होती है। इससे PDF में खोज, टेक्स्ट चुनना और कॉपी करना संभव होता है - जबकि दृश्य रूप वैसा ही रहता है।
क्या लेआउट बना रहता है?
हां। हर पृष्ठ मूल पृष्ठ की छवि के रूप में एम्बेड होता है, जिसके ऊपर अदृश्य टेक्स्ट परत संरेखित होती है। दिखावट नहीं बदलती, हालांकि फ़ाइल थोड़ी बड़ी हो सकती है।
क्या यह हस्तलिपि या अन्य भाषाएं पहचानता है?
अन्य भाषाएं हां: 100 से अधिक उपलब्ध (अरबी, रूसी, हिंदी, जापानी, कोरियाई, चीनी सहित)। हस्तलिपि विश्वसनीय नहीं, केवल मुद्रित टेक्स्ट। खोजने योग्य PDF की टेक्स्ट परत सभी उच्चारण-चिह्नों सहित लैटिन, ग्रीक और सिरिलिक को कवर करती है; CJK, अरबी, हिब्रू, देवनागरी या थाई के लिए "केवल टेक्स्ट (TXT)" आउटपुट उपयोग करें, जिसमें पूरा पहचाना गया टेक्स्ट होता है।
टेक्स्ट पहचान कितनी भाषाएं जानती है?
113 - हिन्दी, अंग्रेज़ी और जर्मन से लेकर अरबी, थाई होते हुए जापानी, कोरियाई और चीनी तक। हर भाषा सूची में अपने ही नाम से दिखती है, और सारे भाषा पैक किसी तीसरे पक्ष के बजाय खुद gottrix पर होस्ट किए गए हैं।
क्या PDF OCR मुफ़्त है, और क्या पृष्ठ सीमा है?
हां, पूरी तरह मुफ़्त - बिना खाते के, बिना वॉटरमार्क के और बिना पृष्ठ या दैनिक सीमा के। ज़्यादा पृष्ठों में बस उतना ही ज़्यादा समय लगता है, क्योंकि पहचान की गणना आपका अपना डिवाइस करता है।
गोपनीय स्कैन के लिए लोकल पहचान बेहतर क्यों है?
क्योंकि स्कैन कभी आपके डिवाइस से बाहर नहीं जाता: न अपलोड, न सर्वर प्रोसेसिंग, न किसी पराए क्लाउड में कॉपी। पहली लोडिंग के बाद पहचान ऑफ़लाइन भी चलती है - इस बात का सबसे मज़बूत सबूत कि कुछ भी भेजा नहीं जाता।
केवल आपकी सहमति से ही हम gottrix को बेहतर बनाने के लिए कुकीज़ के ज़रिए उपयोग को गुमनाम रूप से मापते हैं। आपकी फ़ाइलें हमेशा आपके डिवाइस पर ही स्थानीय रहती हैं। गोपनीयता