動画を字幕に変換
動画の音声トラックから、AI音声認識(Whisper)を使ってブラウザ内だけで字幕(SRTまたはVTT)を自動生成します。アップロード不要。
お使いの端末でローカル処理中 ...
ファイル
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
私のファイルはアップロードされますか?
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
動画の音声トラックから、AI音声認識(Whisper)を使ってブラウザ内だけで字幕(SRTまたはVTT)を自動生成します。アップロード不要。
お使いの端末でローカル処理中 ...
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
講演動画や解説動画、字幕のないSNS向けクリップ - ミュートで再生されるフィードや聴覚に障がいのある視聴者にとって、字幕の有無は動画の内容が伝わるかどうかを大きく左右します。このツールは動画の音声トラックを聞き取り、AI(Whisper)で発話を認識し、タイムスタンプ付きの字幕ファイルとして書き出します。動画プレーヤーや編集ソフトにそのまま読み込める状態で完成します。
音声トラックは動画から自動的に抽出されます - 別途、専用の抽出ツールを経由する必要はなく、このサイトの音声抽出ツールと同じ仕組みがそのまま使われます。Whisperは認識結果を開始時刻と終了時刻を持つ発話区間に分割し、それをそのままSRTまたはVTTのキューとして出力します。タイムスタンプの形式は、このサイトの他の字幕ツールとまったく同じです(たとえば「字幕をずらす」ツールで、後からさらに微調整することもできます)。
字幕はあくまで自動生成による近似であり、編集済みの正式な翻訳の代わりにはなりません - 固有名詞や専門用語、背景ノイズが原因で誤りが生じることがあります。公開前に一度、簡単な確認作業を行うことを強くおすすめします。
| 入力形式 | MP4, M4V, WEBM, MOV, MKV |
|---|---|
| 自動変換 | PNG, GIF |
| 出力形式 | SRT, VTT |
| 一括処理 | 非対応 |
| 処理 | ブラウザ内でローカル処理 (WebAssembly) |
| ファイルのアップロード | なし |
制限: このサイトではクロスオリジン分離モードを使用していないため、処理はシングルスレッドで動作し、サーバー側処理のサービスより体感できるほど時間がかかります。そのため端末ごとの長さの上限が、他の動画ツールよりも大幅に厳しく設定されています。使用しているのはコンパクトな「tiny」モデルで、明瞭な話し声には強い一方、強い背景ノイズや複数人が同時に話す場面には大きいモデルほど強くありません。字幕は機械生成のため、公開前に、特に固有名詞や数字を確認してください。
いいえ、音声の抽出も認識処理もすべてブラウザ内でローカルに実行されます。
SRTは動画編集ソフトで最も広く使われている形式です。VTTはHTML5の動画プレーヤー向けのWeb標準形式です。
はい、「字幕をずらす」ツールを使えば、ファイル全体を一定の時間分だけずらせます。
使えますが、話者の区別は行われません - すべての声が同じ字幕トラックにまとめて出力されます。
音声文字起こし · VTTをASSに変換 · 字幕を焼き込み · 動画をWAVに変換 · 動画を画像に