hi

ऑडियो से टेक्स्ट

बोली गई रिकॉर्डिंग को लिखित टेक्स्ट में बदलें - ब्राउज़र में ही AI स्पीच रिकग्निशन (Whisper) से, पूरी तरह बिना अपलोड किए।

आपके डिवाइस पर ही स्थानीय प्रोसेसिंग चल रही है ...

रिकॉर्डिंग की भाषा
  • अपने आप पहचानें
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

आपके डिवाइस पर ही स्थानीय प्रोसेसिंग चल रही है ...

0%

आपकी फ़ाइलें आपके डिवाइस से कभी बाहर नहीं गईं

    क्या मेरी फ़ाइल अपलोड होती है?

    नहीं। सब कुछ आपके ब्राउज़र में चलता है - आपकी फ़ाइल कभी आपके डिवाइस से बाहर नहीं जाती। यह कैसे सत्यापित किया जा सकता है

    कोई अपलोड नहीं100% स्थानीय
    सामग्री आपके पास रहती हैकिसी तीसरे की पहुँच नहीं
    Hosted in GermanyGlobal Content Delivery
    स्वतंत्र रूप से जाँचा गयाTLS A+ · हेडर A+

    एक इंटरव्यू, एक लेक्चर रिकॉर्डिंग, या रास्ते में किसी आइडिया का वॉइस मेमो: यह टूल रिकॉर्डिंग सुनता है और उसे खोजे और कॉपी किए जा सकने वाले टेक्स्ट के रूप में लिख देता है। पहचान के लिए इस्तेमाल होने वाला मॉडल OpenAI का Whisper है, जिसे यहाँ खासतौर पर सिंगल-थ्रेडेड WebAssembly के रूप में कंपाइल किया गया है - वही मूल तकनीक जो जानी-मानी ट्रांसक्रिप्शन सेवाएँ इस्तेमाल करती हैं, बस फ़र्क़ इतना है कि यह पूरी तरह आपके डिवाइस पर चलती है, किसी और के सर्वर पर नहीं।

    डिफ़ॉल्ट रूप से, Whisper बोली जा रही भाषा खुद पहचान लेता है ("अपने आप पहचानें") - लेकिन छोटी या बहु-भाषी रिकॉर्डिंग के लिए भाषा को तय भी किया जा सकता है, जिससे सटीकता और गति थोड़ी बेहतर हो सकती है। नतीजा हर बोलने के हिस्से के लिए अलग पैराग्राफ़ के साथ लगातार टेक्स्ट के रूप में दिखता है; टाइमस्टैंप जोड़े गए वीडियो के लिए इसी वेबसाइट पर "वीडियो से सबटाइटल" नाम का टूल है, जो वही पहचान तकनीक इस्तेमाल करके सटीक टाइम मार्क वाली SRT/VTT फ़ाइल देता है।

    क्योंकि यह शेयर्ड मेमोरी के बिना (बिना cross-origin isolation के) काम करता है, पहचान मल्टी-थ्रेडेड की बजाय सिंगल-थ्रेडेड चलती है - तकनीकी रूप से सही, लेकिन सर्वर-आधारित सेवा से काफ़ी धीमी। इसीलिए इस पेज पर बाकी ऑडियो टूल्स की तुलना में काफ़ी सख़्त लंबाई-सीमा लागू होती है - गलत गति का वादा करने से बेहतर है ईमानदारी से धीमा रहना।

    तकनीकी विवरण

    तकनीकी विवरण
    इनपुट फ़ॉर्मैटMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
    स्वचालित रूपांतरणMP4
    आउटपुट फ़ॉर्मैटTXT
    बैच प्रोसेसिंगनहीं
    प्रोसेसिंगब्राउज़र में स्थानीय रूप से (WebAssembly)
    फ़ाइल अपलोडकोई नहीं

    3 चरणों में

    1. अपनी ऑडियो फ़ाइल डालें।
    2. भाषा चुनें या "अपने आप पहचानें" पर छोड़ दें।
    3. पहचाना गया टेक्स्ट कॉपी करें या TXT के रूप में डाउनलोड करें।

    सीमाएँ: यह सिंगल-थ्रेडेड चलता है (इस पेज पर cross-origin isolation मोड नहीं है) इसलिए सर्वर-आधारित सेवाओं से काफ़ी धीमा है - यहाँ हर डिवाइस के लिए काफ़ी सख़्त लंबाई-सीमा लागू होती है (बाकी ऑडियो टूल्स से छोटी)। इसमें कॉम्पैक्ट "tiny" मॉडल इस्तेमाल होता है: साफ़ आवाज़ के लिए अच्छा, लेकिन तेज़ बैकग्राउंड शोर, बोलियों या तकनीकी शब्दावली में बड़े मॉडल जितना अच्छा नहीं। पहचान बिल्कुल त्रुटि-रहित नहीं है - नतीजे को जाँचें, खासकर नाम और संख्याएँ।

    अक्सर पूछे जाने वाले प्रश्न

    क्या मेरी रिकॉर्डिंग अपलोड होती है?

    नहीं, पहचान का पूरा काम WebAssembly के ज़रिए ब्राउज़र में ही होता है।

    कौन सी भाषाएँ पहचानी जाती हैं?

    लगभग 100 भाषाएँ; या तो अपने आप पहचानी जाती हैं या तय की जा सकती हैं।

    यह दूसरे ऑडियो टूल्स से ज़्यादा समय क्यों लेता है?

    स्पीच रिकग्निशन काफ़ी कंप्यूटेशन-भारी है और यहाँ बिना मल्टी-थ्रेडिंग के चलता है - तकनीकी रूप से सही, लेकिन जानबूझकर धीमा रखा गया है, गलत गति का वादा करने की बजाय।

    क्या सबटाइटल के लिए टाइमस्टैंप वाला वर्ज़न भी है?

    हाँ, "वीडियो से सबटाइटल" टूल सटीक टाइम मार्क के साथ SRT/VTT देता है।

    संबंधित टूल

    वीडियो से सबटाइटल · शोर हटाएँ · चित्र से टेक्स्ट (OCR) · वेवफ़ॉर्म इमेज · ऑडियो रिकॉर्ड करें · चैनल बदलें