Không có hoạt động xử lý nội dung tệp của bạn trên bất kỳ máy chủ nào. Bạn không cần ký thỏa thuận xử lý dữ liệu với gottrix để làm việc với tài liệu mật hay tài liệu công việc.
Hosted in GermanyGlobal Content Delivery
Máy chủ gốc đặt tại Hetzner ở Đức, phân phối trên toàn cầu qua mạng phân phối nội dung (CDN). Nội dung tệp của bạn không bao giờ được truyền đi trong quá trình này - tệp không bao giờ rời khỏi thiết bị của bạn.
Một cuộc phỏng vấn, một bản ghi bài giảng, một đoạn ghi âm ghi lại ý tưởng khi đang di chuyển: công cụ này lắng nghe bản ghi và viết lại thành văn bản có thể tìm kiếm và sao chép được. Mô hình nhận dạng là Whisper của OpenAI, ở đây được biên dịch riêng thành WebAssembly đơn luồng - cùng công nghệ nền tảng mà các dịch vụ phiên âm nổi tiếng sử dụng, chỉ khác là ở đây mọi thứ chạy hoàn toàn trên thiết bị của bạn thay vì trên máy chủ của người khác.
Theo mặc định, Whisper tự nhận diện ngôn ngữ được nói ("Tự động nhận diện") - nhưng với bản ghi ngắn hoặc đa ngôn ngữ, bạn cũng có thể chỉ định cố định ngôn ngữ, giúp cải thiện đôi chút độ chính xác và tốc độ. Kết quả hiển thị dưới dạng văn bản liền mạch với mỗi đoạn nói là một đoạn văn; đối với video cần dấu thời gian nhúng sẵn, có công cụ song hành "Video sang phụ đề" dùng cùng công nghệ nhận dạng nhưng xuất ra tệp SRT/VTT với mốc thời gian chính xác.
Vì hoạt động không có bộ nhớ dùng chung (không có cross-origin isolation), việc nhận dạng chạy đơn luồng thay vì đa luồng - đúng về mặt kỹ thuật nhưng chậm hơn rõ rệt so với dịch vụ chạy trên máy chủ. Vì vậy ở đây áp dụng giới hạn độ dài nghiêm ngặt hơn nhiều so với các công cụ âm thanh khác của trang này - thà trung thực là chậm còn hơn hứa hẹn một tốc độ sai.
Thông số kỹ thuật
Thông số kỹ thuật
Định dạng đầu vào
MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
Chuyển đổi tự động
MP4
Định dạng đầu ra
TXT
Xử lý hàng loạt
Không
Xử lý
Cục bộ trong trình duyệt (WebAssembly)
Tải tệp lên
Không có
Trong 3 bước
Thả tệp âm thanh của bạn vào.
Chọn ngôn ngữ hoặc để nguyên ở "Tự động nhận diện".
Sao chép văn bản nhận dạng được hoặc tải xuống dưới dạng TXT.
Giới hạn: Chạy đơn luồng (trang này không có chế độ cross-origin isolation) nên chậm hơn rõ rệt so với các dịch vụ chạy trên máy chủ - ở đây áp dụng giới hạn độ dài theo thiết bị nghiêm ngặt hơn nhiều (ngắn hơn so với các công cụ âm thanh khác). Sử dụng mô hình cấp "tiny" gọn nhẹ: tốt với giọng nói rõ ràng, kém hơn với tiếng ồn nền mạnh, giọng địa phương hoặc thuật ngữ chuyên ngành so với mô hình lớn hơn. Kết quả nhận dạng không hoàn toàn chính xác - hãy kiểm tra lại, đặc biệt là tên riêng và số liệu.
Câu hỏi thường gặp
Bản ghi của tôi có bị tải lên không?
Không, việc nhận dạng chạy hoàn toàn cục bộ trong trình duyệt qua WebAssembly.
Những ngôn ngữ nào được nhận dạng?
Gần 100 ngôn ngữ; có thể tự động nhận diện hoặc chọn cố định.
Tại sao việc này lâu hơn so với các công cụ âm thanh khác?
Nhận dạng giọng nói đòi hỏi tính toán nặng và ở đây chạy không có đa luồng - đúng về mặt kỹ thuật, nhưng cố tình chậm hơn thay vì hứa hẹn một tốc độ sai.
Có phiên bản có dấu thời gian cho phụ đề không?
Có, công cụ song hành "Video sang phụ đề" xuất ra SRT/VTT với mốc thời gian chính xác.
Chỉ khi có sự đồng ý của bạn, chúng tôi mới đo lường mức sử dụng ẩn danh qua cookie để cải thiện gottrix. Tệp của bạn luôn nằm cục bộ trên thiết bị của bạn. Quyền riêng tư