音訊轉文字
透過 AI 語音辨識(Whisper),將口說錄音轉換成文字 - 完全在瀏覽器本機處理,不需上傳。
正在你的裝置上本機處理 ...
正在你的裝置上本機處理 ...
0%
你的檔案永遠不會離開你的裝置
我的檔案會被上傳嗎?
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
透過 AI 語音辨識(Whisper),將口說錄音轉換成文字 - 完全在瀏覽器本機處理,不需上傳。
正在你的裝置上本機處理 ...
正在你的裝置上本機處理 ...
0%
你的檔案永遠不會離開你的裝置
不會。一切都在你的瀏覽器中執行,你的檔案永遠不會離開你的裝置。這一點如何查證
訪談、課堂錄音、通勤路上隨手錄下的靈感備忘錄 - 這個工具會聽取錄音內容,將它寫成可搜尋、可複製的文字。辨識模型採用 OpenAI 的 Whisper,並經過專門編譯為單執行緒的 WebAssembly 版本 - 這與知名轉錄服務所用的核心技術相同,差別在於整個過程完全在你自己的裝置上執行,而不是傳到陌生的伺服器。
預設情況下,Whisper 會自行判斷所說的語言(「自動偵測」) - 若是短錄音或多語言混雜的內容,也可以手動指定語言,這樣通常能稍微提升辨識準確度與速度。結果會以連續文字呈現,每個發言段落各自成一段;如果影片需要內嵌時間戳記,可改用姊妹工具「影片轉字幕」,它採用同一套辨識引擎,但輸出的是附有精確時間標記的 SRT/VTT 檔案。
由於不使用共享記憶體(未啟用跨來源隔離),辨識作業採單執行緒而非多執行緒運作 - 結果正確,但明顯比伺服器端服務慢。因此這裡的長度上限比本站其他音訊工具嚴格許多 - 與其承諾不實的速度,不如老實地慢一點。
| 輸入格式 | MP3, WAV, M4A, AAC, OGG, OPUS, FLAC |
|---|---|
| 自動轉換 | MP4 |
| 輸出格式 | TXT |
| 批次處理 | 不支援 |
| 處理方式 | 在瀏覽器中本機處理 (WebAssembly) |
| 檔案上傳 | 無 |
限制: 採單執行緒運作(本站未啟用跨來源隔離模式),因此明顯比伺服器端服務慢 - 這裡的裝置端長度上限也比本站其他音訊工具嚴格許多。使用的是精簡版「tiny」模型:對清晰的語音效果良好,但遇到強烈背景雜音、方言或專業術語時,準確度會低於較大型的模型。辨識結果並非完全無誤 - 發布前請務必檢查,尤其是專有名詞和數字。
不會,辨識功能完全透過 WebAssembly 在瀏覽器本機執行。
支援近 100 種語言,可自動偵測,也可手動指定。
語音辨識運算量大,這裡又不使用多執行緒處理 - 結果正確,但刻意選擇老實地放慢速度,而不是承諾不實的快速。
有,姊妹工具「影片轉字幕」會輸出附有精確時間標記的 SRT/VTT 檔案。