zh

音频转文字

通过AI语音识别(Whisper)技术,在浏览器本地把录音转换成文字,完全无需上传。

正在你的设备上本地处理 ...

录音语言
  • 自动检测
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

正在你的设备上本地处理 ...

0%

我的文件会被上传吗?

不会。一切都在你的浏览器中运行,你的文件永不离开你的设备。这一点如何验证

无需上传100% 本地处理
内容只属于你第三方无法访问
Hosted in GermanyGlobal Content Delivery
经独立审计TLS A+ · 标头 A+

一段采访录音、一节课堂录音、路上随手录下的一条语音备忘录 - 这个工具会听取录音内容,并将其转写成可搜索、可复制的文字。识别模型采用OpenAI的Whisper,这里编译为专用的单线程WebAssembly版本 - 与常见转写服务背后使用的核心技术相同,区别在于这里的处理完全在你的设备上进行,而不是发送到别人的服务器。

默认情况下,Whisper会自动识别所说的语言(“自动检测”);如果是较短或多语言混杂的录音,也可以手动指定语言,这样通常能略微提升识别准确率和处理速度。识别结果会以连续文字呈现,按语句段落分段。如果需要为视频生成带时间戳的字幕,可以使用姊妹工具“视频转字幕”,它使用相同的识别引擎,但会输出带精确时间标记的SRT/VTT文件。

由于不使用共享内存(未启用跨源隔离),识别过程以单线程而非多线程方式运行 - 结果准确,但明显慢于服务器端处理的服务。因此这里设置的单设备时长上限,比本站其他音频工具严格得多 - 与其承诺一个做不到的速度,不如如实告知会慢一些。

技术规格

技术规格
输入格式MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
自动转换MP4
输出格式TXT
批量处理不支持
处理方式在浏览器中本地处理 (WebAssembly)
文件上传

三步完成

  1. 拖入音频文件。
  2. 选择语言,或保持“自动检测”。
  3. 复制识别出的文字,或下载为TXT文件。

限制: 本页面未启用跨源隔离模式,因此识别过程以单线程运行,明显慢于服务器端处理的服务 - 这里的单设备时长上限比本站其他音频工具严格得多。使用的是轻量级的“tiny”模型:对清晰语音效果良好,但在强背景噪音、方言或专业术语较多的情况下,效果不如更大的模型。识别结果并非完全准确 - 请检查结果,尤其是专有名词和数字。

常见问题

我的录音会被上传吗?

不会,识别处理完全通过WebAssembly在浏览器本地完成。

支持识别哪些语言?

支持近100种语言,可以自动检测,也可以手动指定。

为什么比其他音频工具耗时更长?

语音识别本身计算量大,这里又不使用多线程运行 - 与其错误地承诺一个更快的速度,不如如实告知需要更长时间。

有没有带时间戳、用于字幕的版本?

有,姊妹工具“视频转字幕”会输出带精确时间标记的SRT/VTT文件。

相关工具

视频转字幕 · 降噪 · 图片转文字 (OCR) · 波形图片 · 录制音频 · 交换声道