音频转文字
通过AI语音识别(Whisper)技术,在浏览器本地把录音转换成文字,完全无需上传。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
我的文件会被上传吗?
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
通过AI语音识别(Whisper)技术,在浏览器本地把录音转换成文字,完全无需上传。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
一段采访录音、一节课堂录音、路上随手录下的一条语音备忘录 - 这个工具会听取录音内容,并将其转写成可搜索、可复制的文字。识别模型采用OpenAI的Whisper,这里编译为专用的单线程WebAssembly版本 - 与常见转写服务背后使用的核心技术相同,区别在于这里的处理完全在你的设备上进行,而不是发送到别人的服务器。
默认情况下,Whisper会自动识别所说的语言(“自动检测”);如果是较短或多语言混杂的录音,也可以手动指定语言,这样通常能略微提升识别准确率和处理速度。识别结果会以连续文字呈现,按语句段落分段。如果需要为视频生成带时间戳的字幕,可以使用姊妹工具“视频转字幕”,它使用相同的识别引擎,但会输出带精确时间标记的SRT/VTT文件。
由于不使用共享内存(未启用跨源隔离),识别过程以单线程而非多线程方式运行 - 结果准确,但明显慢于服务器端处理的服务。因此这里设置的单设备时长上限,比本站其他音频工具严格得多 - 与其承诺一个做不到的速度,不如如实告知会慢一些。
| 输入格式 | MP3, WAV, M4A, AAC, OGG, OPUS, FLAC |
|---|---|
| 自动转换 | MP4 |
| 输出格式 | TXT |
| 批量处理 | 不支持 |
| 处理方式 | 在浏览器中本地处理 (WebAssembly) |
| 文件上传 | 无 |
限制: 本页面未启用跨源隔离模式,因此识别过程以单线程运行,明显慢于服务器端处理的服务 - 这里的单设备时长上限比本站其他音频工具严格得多。使用的是轻量级的“tiny”模型:对清晰语音效果良好,但在强背景噪音、方言或专业术语较多的情况下,效果不如更大的模型。识别结果并非完全准确 - 请检查结果,尤其是专有名词和数字。
不会,识别处理完全通过WebAssembly在浏览器本地完成。
支持近100种语言,可以自动检测,也可以手动指定。
语音识别本身计算量大,这里又不使用多线程运行 - 与其错误地承诺一个更快的速度,不如如实告知需要更长时间。
有,姊妹工具“视频转字幕”会输出带精确时间标记的SRT/VTT文件。