vi

Âm thanh sang văn bản

Chuyển bản ghi âm giọng nói thành văn bản - xử lý cục bộ trong trình duyệt bằng nhận dạng giọng nói AI (Whisper), hoàn toàn không tải lên.

Đang xử lý cục bộ trên thiết bị của bạn ...

Ngôn ngữ của bản ghi
  • Tự động nhận diện
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

Đang xử lý cục bộ trên thiết bị của bạn ...

0%

Tệp của tôi có bị tải lên không?

Không. Mọi thứ chạy trong trình duyệt của bạn - tệp của bạn không bao giờ rời khỏi thiết bị. Cách kiểm chứng điều này

Không tải lên100% cục bộ
Nội dung ở lại với bạnkhông ai khác chạm tới
Hosted in GermanyGlobal Content Delivery
Kiểm định độc lậpTLS A+ · HTTP header A+

Một cuộc phỏng vấn, một bản ghi bài giảng, một đoạn ghi âm ghi lại ý tưởng khi đang di chuyển: công cụ này lắng nghe bản ghi và viết lại thành văn bản có thể tìm kiếm và sao chép được. Mô hình nhận dạng là Whisper của OpenAI, ở đây được biên dịch riêng thành WebAssembly đơn luồng - cùng công nghệ nền tảng mà các dịch vụ phiên âm nổi tiếng sử dụng, chỉ khác là ở đây mọi thứ chạy hoàn toàn trên thiết bị của bạn thay vì trên máy chủ của người khác.

Theo mặc định, Whisper tự nhận diện ngôn ngữ được nói ("Tự động nhận diện") - nhưng với bản ghi ngắn hoặc đa ngôn ngữ, bạn cũng có thể chỉ định cố định ngôn ngữ, giúp cải thiện đôi chút độ chính xác và tốc độ. Kết quả hiển thị dưới dạng văn bản liền mạch với mỗi đoạn nói là một đoạn văn; đối với video cần dấu thời gian nhúng sẵn, có công cụ song hành "Video sang phụ đề" dùng cùng công nghệ nhận dạng nhưng xuất ra tệp SRT/VTT với mốc thời gian chính xác.

Vì hoạt động không có bộ nhớ dùng chung (không có cross-origin isolation), việc nhận dạng chạy đơn luồng thay vì đa luồng - đúng về mặt kỹ thuật nhưng chậm hơn rõ rệt so với dịch vụ chạy trên máy chủ. Vì vậy ở đây áp dụng giới hạn độ dài nghiêm ngặt hơn nhiều so với các công cụ âm thanh khác của trang này - thà trung thực là chậm còn hơn hứa hẹn một tốc độ sai.

Thông số kỹ thuật

Thông số kỹ thuật
Định dạng đầu vàoMP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Chuyển đổi tự độngMP4
Định dạng đầu raTXT
Xử lý hàng loạtKhông
Xử lýCục bộ trong trình duyệt (WebAssembly)
Tải tệp lênKhông có

Trong 3 bước

  1. Thả tệp âm thanh của bạn vào.
  2. Chọn ngôn ngữ hoặc để nguyên ở "Tự động nhận diện".
  3. Sao chép văn bản nhận dạng được hoặc tải xuống dưới dạng TXT.

Giới hạn: Chạy đơn luồng (trang này không có chế độ cross-origin isolation) nên chậm hơn rõ rệt so với các dịch vụ chạy trên máy chủ - ở đây áp dụng giới hạn độ dài theo thiết bị nghiêm ngặt hơn nhiều (ngắn hơn so với các công cụ âm thanh khác). Sử dụng mô hình cấp "tiny" gọn nhẹ: tốt với giọng nói rõ ràng, kém hơn với tiếng ồn nền mạnh, giọng địa phương hoặc thuật ngữ chuyên ngành so với mô hình lớn hơn. Kết quả nhận dạng không hoàn toàn chính xác - hãy kiểm tra lại, đặc biệt là tên riêng và số liệu.

Câu hỏi thường gặp

Bản ghi của tôi có bị tải lên không?

Không, việc nhận dạng chạy hoàn toàn cục bộ trong trình duyệt qua WebAssembly.

Những ngôn ngữ nào được nhận dạng?

Gần 100 ngôn ngữ; có thể tự động nhận diện hoặc chọn cố định.

Tại sao việc này lâu hơn so với các công cụ âm thanh khác?

Nhận dạng giọng nói đòi hỏi tính toán nặng và ở đây chạy không có đa luồng - đúng về mặt kỹ thuật, nhưng cố tình chậm hơn thay vì hứa hẹn một tốc độ sai.

Có phiên bản có dấu thời gian cho phụ đề không?

Có, công cụ song hành "Video sang phụ đề" xuất ra SRT/VTT với mốc thời gian chính xác.

Công cụ liên quan

Video sang phụ đề · Khử tiếng ồn · Hình ảnh sang văn bản · Hình ảnh dạng sóng · Ghi âm thanh · Hoán đổi kênh