视频转字幕
通过AI语音识别(Whisper)技术,在浏览器本地根据视频的音轨自动生成字幕(SRT或VTT),无需上传。
正在你的设备上本地处理 ...
你的文件
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
我的文件会被上传吗?
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
通过AI语音识别(Whisper)技术,在浏览器本地根据视频的音轨自动生成字幕(SRT或VTT),无需上传。
正在你的设备上本地处理 ...
正在你的设备上本地处理 ...
0%
你的文件从未离开你的设备
不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证
一段演讲、一个讲解视频、一条没有字幕的社交媒体短视频 - 在静音播放的信息流中,或对听力有障碍的观众来说,有没有字幕往往直接决定了视频内容能不能被理解。这个工具会听取视频的音轨,通过AI(Whisper)识别其中的语音内容,并输出带时间戳的字幕文件 - 可以直接导入视频播放器或剪辑软件使用。
音轨会自动从视频中提取出来 - 不需要另外经过单独的提取工具,使用的正是本站音频提取工具背后的同一套机制。Whisper会将识别结果拆分成带起止时间的语句片段,并直接输出为SRT或VTT字幕条目,时间戳格式与本站其他字幕工具完全一致(例如后续还可以用“字幕偏移”工具进一步微调)。
字幕是自动生成的近似结果,并非经过校对的正式翻译 - 专有名词、专业术语和背景噪音都可能导致识别错误。发布前花点时间快速核对一遍,总是值得的。
| 输入格式 | MP4, M4V, WEBM, MOV, MKV |
|---|---|
| 自动转换 | PNG, GIF |
| 输出格式 | SRT, VTT |
| 批量处理 | 不支持 |
| 处理方式 | 在浏览器中本地处理 (WebAssembly) |
| 文件上传 | 无 |
限制: 本页面未启用跨源隔离模式,因此处理过程以单线程运行,明显慢于服务器端处理的服务 - 这里的单设备时长上限比本站其他视频工具严格得多。使用的是轻量级的“tiny”模型:对清晰语音效果良好,但在强背景噪音或多人同时说话的场景下,效果不如更大的模型。字幕由机器自动生成 - 发布前请检查,尤其是专有名词和数字。
不会,音轨提取和语音识别都完全在浏览器本地完成。
SRT是视频剪辑软件中支持最广泛的格式;VTT是HTML5视频播放器使用的Web标准格式。
可以,使用“字幕偏移”工具,能将整个文件统一偏移一段固定时间。
可以,但不会区分说话人 - 所有人的语音都会输出到同一条连续的字幕轨道中。