किसी सर्वर पर आपकी फ़ाइल की सामग्री की कोई प्रोसेसिंग नहीं होती। गोपनीय या व्यावसायिक दस्तावेज़ संभालने के लिए आपको gottrix के साथ किसी डेटा-प्रोसेसिंग समझौते की ज़रूरत नहीं।
Hosted in GermanyGlobal Content Delivery
ओरिजिन सर्वर जर्मनी में Hetzner पर हैं, और कंटेंट डिलीवरी नेटवर्क (CDN) के ज़रिए दुनिया भर में डिलीवरी होती है। इस दौरान आपकी फ़ाइल की सामग्री कभी ट्रांसमिट नहीं होती - वह आपके डिवाइस से बाहर नहीं जाती।
आँकड़े अक्सर वहीं फँसे रहते हैं जहाँ उनका उपयोग नहीं हो सकता: PDF की तालिकाओं में। चालान, रिपोर्ट, बैंक स्टेटमेंट, अध्ययन: जिसे ये मान Excel, डेटाबेस या स्क्रिप्ट में चाहिए, वह अब तक उन्हें हाथ से दोबारा टाइप करता था या चिपकाते ही बिखर जाने वाले कॉलमों से जूझता था। यह टूल PDF की तालिकाओं को अपने आप पहचानता है और संरचना बनाए रखते हुए निर्यात करता है: स्प्रेडशीट और आयात के लिए CSV, हर तालिका की अलग शीट वाली Excel वर्कबुक (XLSX), या कोड में आगे की प्रोसेसिंग के लिए निर्देशांक सहित JSON।
पहचान उन्हीं दो तकनीकों पर आधारित है जिन पर इस श्रेणी के जाने-माने विशेष टूल निर्भर करते हैं: बॉर्डर वाली तालिकाएँ पृष्ठ पर वास्तव में खींची गई रेखाओं से पहचानी जाती हैं (ग्रिड मोड); रेखाएँ सेलों का ग्रिड बनाती हैं और हर टेक्स्ट अपनी सेल में जाता है। बिना बॉर्डर वाली तालिकाएँ संरेखण से पहचानी जाती हैं (अंतराल मोड): कई पंक्तियों में एक जैसी कॉलम-स्थिति पर बैठे टेक्स्ट खंड कॉलम बनाते हैं, और लगातार खाली रहने वाली जगहें कॉलम की सीमाएँ तय करती हैं। स्वचालित मोड पहले रेखाएँ खोजता है, न मिलने पर अंतराल-विश्लेषण करता है; दोनों मोड सीधे भी चुने जा सकते हैं। कई तालिकाएँ और बहु-पृष्ठ PDF समर्थित हैं: हर पहचानी गई तालिका अलग से निर्यात होती है।
ईमानदार और महत्वपूर्ण: पहचान PDF की टेक्स्ट परत पढ़ती है। स्कैन किया हुआ या केवल छवियों से बना PDF ऐसी परत नहीं रखता; तब टूल खाली या मनगढ़ंत तालिकाएँ देने के बजाय यह बात साफ़ बताता है। स्कैन पहले "PDF OCR" से खोजने योग्य टेक्स्ट में बदलें, फिर तालिकाएँ निकालें। जटिल लेआउट की भी सीमाएँ हैं: मर्ज की गई सेलें या नेस्टेड तालिकाएँ अनुमानित रहती हैं, पिक्सेल-दर-पिक्सेल नहीं बनतीं। सब कुछ ब्राउज़र में pdf.js के ज़रिए लोकल चलता है; आपकी फ़ाइल कभी आपका डिवाइस नहीं छोड़ती।
तकनीकी विवरण
तकनीकी विवरण
इनपुट फ़ॉर्मैट
PDF
स्वचालित रूपांतरण
PNG, JPG, GIF, BMP, TIFF, ZIP, DOCX
आउटपुट फ़ॉर्मैट
CSV, XLSX, JSON
बैच प्रोसेसिंग
नहीं
प्रोसेसिंग
ब्राउज़र में स्थानीय रूप से (JavaScript)
फ़ाइल अपलोड
कोई नहीं
3 चरणों में
अपना PDF यहाँ छोड़ें।
आउटपुट प्रारूप और पहचान चुनें।
तालिकाएँ CSV, XLSX या JSON के रूप में डाउनलोड करें।
सीमाएँ: बॉर्डर रेखाओं (ग्रिड) या टेक्स्ट संरेखण (अंतराल) से तालिकाएँ पहचानता है और उन्हें CSV (हर तालिका की अलग फ़ाइल, कई हों तो ZIP), XLSX (हर तालिका की अलग शीट) या JSON (पृष्ठ, सेल और PDF पॉइंट में स्थिति सहित) के रूप में निर्यात करता है। असली टेक्स्ट परत ज़रूरी है: स्कैन किए गए PDF पहले "PDF OCR" से बदलें। मर्ज की गई सेलें और जटिल लेआउट अनुमानित रहते हैं; Excel में केवल स्पष्ट संख्याएँ (दशमलव बिंदु) ही संख्या-सेल बनती हैं। पासवर्ड-सुरक्षित PDF पहले "PDF अनलॉक करें" से खोलें।
अक्सर पूछे जाने वाले प्रश्न
टूल तालिकाएँ कैसे पहचानता है?
दो तकनीकों से: बॉर्डर वाली तालिकाओं में खींची गई रेखाएँ सेलों का ग्रिड बनाती हैं (ग्रिड मोड)। बिना बॉर्डर वाली तालिकाओं में कॉलम टेक्स्ट संरेखण और लगातार खाली जगहों से पहचाने जाते हैं (अंतराल मोड)। स्वचालित मोड सही तकनीक खुद चुनता है।
मेरे स्कैन किए दस्तावेज़ में तालिकाएँ क्यों नहीं मिलतीं?
स्कैन में केवल छवि के पिक्सेल होते हैं, पढ़ने लायक टेक्स्ट परत नहीं। पहले "PDF OCR" से PDF को खोजने योग्य टेक्स्ट में बदलें, फिर तालिकाएँ निकालें।
क्या मैं कई तालिकाएँ और पृष्ठ एक साथ निर्यात कर सकता हूँ?
हाँ। सभी पृष्ठ खंगाले जाते हैं और हर पहचानी गई तालिका अलग निर्यात होती है: अपनी CSV फ़ाइल के रूप में (कई हों तो एक ZIP में), Excel फ़ाइल की अलग शीट के रूप में, या JSON में एक प्रविष्टि के रूप में।
JSON निर्यात में क्या होता है?
पूरी संरचना: हर तालिका के लिए उसका पृष्ठ, पहचान मोड और स्थिति; हर सेल के लिए उसका टेक्स्ट और PDF पॉइंट में बाउंडिंग बॉक्स (मूल बिंदु नीचे बाईं ओर)। स्क्रिप्ट और डेटा पाइपलाइनों के लिए आदर्श।
मर्ज की गई सेलें सटीक क्यों नहीं आतीं?
कई कॉलमों में फैली मर्ज की गई सेल की ग्रिड में कोई एक निश्चित स्थिति नहीं होती; उसकी सामग्री किसी एक सेल में चली जाती है और बाकी खाली रहती हैं। यह एक ईमानदार अनुमान है: विशेष डेस्कटॉप टूल भी इसे त्रुटिहीन हल नहीं करते।
क्या मेरा PDF अपलोड होता है?
नहीं। पहचान और निर्यात पूरी तरह ब्राउज़र में pdf.js के ज़रिए लोकल चलते हैं; फ़ाइल कभी आपका डिवाइस नहीं छोड़ती।
क्या तालिका निकालना स्मार्टफ़ोन या Chromebook पर भी चलता है?
हां, नए ब्राउज़र वाले किसी भी डिवाइस पर - Windows, Mac, Linux, Chromebook या स्मार्टफ़ोन। बहुत बड़ी PDF को मोबाइल डिवाइस पर बस ज़्यादा समय और मेमोरी चाहिए।
केवल आपकी सहमति से ही हम gottrix को बेहतर बनाने के लिए कुकीज़ के ज़रिए उपयोग को गुमनाम रूप से मापते हैं। आपकी फ़ाइलें हमेशा आपके डिवाइस पर ही स्थानीय रहती हैं। गोपनीयता