zh-Hant

音訊轉文字

透過 AI 語音辨識(Whisper),將口說錄音轉換成文字 - 完全在瀏覽器本機處理,不需上傳。

正在你的裝置上本機處理 ...

錄音語言
  • 自動偵測
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

正在你的裝置上本機處理 ...

0%

我的檔案會被上傳嗎?

不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證

無需上傳100% 本機處理
內容只留在你這裡第三方無法存取
Hosted in GermanyGlobal Content Delivery
通過獨立稽核TLS A+ · 標頭 A+

訪談、課堂錄音、通勤路上隨手錄下的靈感備忘錄 - 這個工具會聽取錄音內容,將它寫成可搜尋、可複製的文字。辨識模型採用 OpenAI 的 Whisper,並經過專門編譯為單執行緒的 WebAssembly 版本 - 這與知名轉錄服務所用的核心技術相同,差別在於整個過程完全在你自己的裝置上執行,而不是傳到陌生的伺服器。

預設情況下,Whisper 會自行判斷所說的語言(「自動偵測」) - 若是短錄音或多語言混雜的內容,也可以手動指定語言,這樣通常能稍微提升辨識準確度與速度。結果會以連續文字呈現,每個發言段落各自成一段;如果影片需要內嵌時間戳記,可改用姊妹工具「影片轉字幕」,它採用同一套辨識引擎,但輸出的是附有精確時間標記的 SRT/VTT 檔案。

由於不使用共享記憶體(未啟用跨來源隔離),辨識作業採單執行緒而非多執行緒運作 - 結果正確,但明顯比伺服器端服務慢。因此這裡的長度上限比本站其他音訊工具嚴格許多 - 與其承諾不實的速度,不如老實地慢一點。

技術規格

技術規格
輸入格式MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
自動轉換MP4
輸出格式TXT
批次處理不支援
處理方式在瀏覽器中本機處理 (WebAssembly)
檔案上傳

三個步驟

  1. 拖曳你的音訊檔案。
  2. 選擇語言,或維持「自動偵測」。
  3. 複製辨識出的文字,或下載為 TXT 檔。

限制: 採單執行緒運作(本站未啟用跨來源隔離模式),因此明顯比伺服器端服務慢 - 這裡的裝置端長度上限也比本站其他音訊工具嚴格許多。使用的是精簡版「tiny」模型:對清晰的語音效果良好,但遇到強烈背景雜音、方言或專業術語時,準確度會低於較大型的模型。辨識結果並非完全無誤 - 發布前請務必檢查,尤其是專有名詞和數字。

常見問題

我的錄音會被上傳嗎?

不會,辨識功能完全透過 WebAssembly 在瀏覽器本機執行。

支援哪些語言的辨識?

支援近 100 種語言,可自動偵測,也可手動指定。

為什麼這比其他音訊工具花更久時間?

語音辨識運算量大,這裡又不使用多執行緒處理 - 結果正確,但刻意選擇老實地放慢速度,而不是承諾不實的快速。

有沒有附時間戳記、可用於字幕的版本?

有,姊妹工具「影片轉字幕」會輸出附有精確時間標記的 SRT/VTT 檔案。

相關工具

影片轉字幕 · 移除雜音 · 圖片辨識文字 (OCR) · 波形圖片 · 錄製音訊 · 交換聲道