किसी सर्वर पर आपकी फ़ाइल की सामग्री की कोई प्रोसेसिंग नहीं होती। गोपनीय या व्यावसायिक दस्तावेज़ संभालने के लिए आपको gottrix के साथ किसी डेटा-प्रोसेसिंग समझौते की ज़रूरत नहीं।
Hosted in GermanyGlobal Content Delivery
ओरिजिन सर्वर जर्मनी में Hetzner पर हैं, और कंटेंट डिलीवरी नेटवर्क (CDN) के ज़रिए दुनिया भर में डिलीवरी होती है। इस दौरान आपकी फ़ाइल की सामग्री कभी ट्रांसमिट नहीं होती - वह आपके डिवाइस से बाहर नहीं जाती।
एक इंटरव्यू, एक लेक्चर रिकॉर्डिंग, या रास्ते में किसी आइडिया का वॉइस मेमो: यह टूल रिकॉर्डिंग सुनता है और उसे खोजे और कॉपी किए जा सकने वाले टेक्स्ट के रूप में लिख देता है। पहचान के लिए इस्तेमाल होने वाला मॉडल OpenAI का Whisper है, जिसे यहाँ खासतौर पर सिंगल-थ्रेडेड WebAssembly के रूप में कंपाइल किया गया है - वही मूल तकनीक जो जानी-मानी ट्रांसक्रिप्शन सेवाएँ इस्तेमाल करती हैं, बस फ़र्क़ इतना है कि यह पूरी तरह आपके डिवाइस पर चलती है, किसी और के सर्वर पर नहीं।
डिफ़ॉल्ट रूप से, Whisper बोली जा रही भाषा खुद पहचान लेता है ("अपने आप पहचानें") - लेकिन छोटी या बहु-भाषी रिकॉर्डिंग के लिए भाषा को तय भी किया जा सकता है, जिससे सटीकता और गति थोड़ी बेहतर हो सकती है। नतीजा हर बोलने के हिस्से के लिए अलग पैराग्राफ़ के साथ लगातार टेक्स्ट के रूप में दिखता है; टाइमस्टैंप जोड़े गए वीडियो के लिए इसी वेबसाइट पर "वीडियो से सबटाइटल" नाम का टूल है, जो वही पहचान तकनीक इस्तेमाल करके सटीक टाइम मार्क वाली SRT/VTT फ़ाइल देता है।
क्योंकि यह शेयर्ड मेमोरी के बिना (बिना cross-origin isolation के) काम करता है, पहचान मल्टी-थ्रेडेड की बजाय सिंगल-थ्रेडेड चलती है - तकनीकी रूप से सही, लेकिन सर्वर-आधारित सेवा से काफ़ी धीमी। इसीलिए इस पेज पर बाकी ऑडियो टूल्स की तुलना में काफ़ी सख़्त लंबाई-सीमा लागू होती है - गलत गति का वादा करने से बेहतर है ईमानदारी से धीमा रहना।
तकनीकी विवरण
तकनीकी विवरण
इनपुट फ़ॉर्मैट
MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
स्वचालित रूपांतरण
MP4
आउटपुट फ़ॉर्मैट
TXT
बैच प्रोसेसिंग
नहीं
प्रोसेसिंग
ब्राउज़र में स्थानीय रूप से (WebAssembly)
फ़ाइल अपलोड
कोई नहीं
3 चरणों में
अपनी ऑडियो फ़ाइल डालें।
भाषा चुनें या "अपने आप पहचानें" पर छोड़ दें।
पहचाना गया टेक्स्ट कॉपी करें या TXT के रूप में डाउनलोड करें।
सीमाएँ: यह सिंगल-थ्रेडेड चलता है (इस पेज पर cross-origin isolation मोड नहीं है) इसलिए सर्वर-आधारित सेवाओं से काफ़ी धीमा है - यहाँ हर डिवाइस के लिए काफ़ी सख़्त लंबाई-सीमा लागू होती है (बाकी ऑडियो टूल्स से छोटी)। इसमें कॉम्पैक्ट "tiny" मॉडल इस्तेमाल होता है: साफ़ आवाज़ के लिए अच्छा, लेकिन तेज़ बैकग्राउंड शोर, बोलियों या तकनीकी शब्दावली में बड़े मॉडल जितना अच्छा नहीं। पहचान बिल्कुल त्रुटि-रहित नहीं है - नतीजे को जाँचें, खासकर नाम और संख्याएँ।
अक्सर पूछे जाने वाले प्रश्न
क्या मेरी रिकॉर्डिंग अपलोड होती है?
नहीं, पहचान का पूरा काम WebAssembly के ज़रिए ब्राउज़र में ही होता है।
कौन सी भाषाएँ पहचानी जाती हैं?
लगभग 100 भाषाएँ; या तो अपने आप पहचानी जाती हैं या तय की जा सकती हैं।
यह दूसरे ऑडियो टूल्स से ज़्यादा समय क्यों लेता है?
स्पीच रिकग्निशन काफ़ी कंप्यूटेशन-भारी है और यहाँ बिना मल्टी-थ्रेडिंग के चलता है - तकनीकी रूप से सही, लेकिन जानबूझकर धीमा रखा गया है, गलत गति का वादा करने की बजाय।
क्या सबटाइटल के लिए टाइमस्टैंप वाला वर्ज़न भी है?
हाँ, "वीडियो से सबटाइटल" टूल सटीक टाइम मार्क के साथ SRT/VTT देता है।
केवल आपकी सहमति से ही हम gottrix को बेहतर बनाने के लिए कुकीज़ के ज़रिए उपयोग को गुमनाम रूप से मापते हैं। आपकी फ़ाइलें हमेशा आपके डिवाइस पर ही स्थानीय रहती हैं। गोपनीयता