音声文字起こし
録音した音声を、AI音声認識(Whisper)でブラウザ上のみで文字起こしします。アップロードは一切不要。
お使いの端末でローカル処理中 ...
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
私のファイルはアップロードされますか?
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
録音した音声を、AI音声認識(Whisper)でブラウザ上のみで文字起こしします。アップロードは一切不要。
お使いの端末でローカル処理中 ...
お使いの端末でローカル処理中 ...
0%
ファイルは一度も端末から出ていません
いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由
インタビューや講義の録音、外出先で思いついたアイデアを残した音声メモ - このツールは録音を聞き取り、検索やコピーができるテキストとして書き起こします。認識モデルにはOpenAIのWhisperを使用し、ここでは専用にコンパイルしたシングルスレッドのWebAssembly版として動作します。有名な文字起こしサービスの多くが使っているのと同じ基盤技術ですが、外部のサーバーではなく、あなたの端末だけで完結する点が違います。
初期設定では、Whisperが話されている言語を自動的に判定します(「自動検出」)。短い録音や複数言語が混在する録音では、言語を手動で指定することで認識精度と処理速度がわずかに向上する場合があります。結果は発話の区切りごとに段落分けされた、連続したテキストとして表示されます。動画にタイムスタンプ付きの字幕が必要な場合は、同じ認識エンジンを使いながらSRT/VTT形式で正確な時刻情報を出力する姉妹ツール「動画を字幕に変換」をご利用ください。
共有メモリを使わない(クロスオリジン分離を行わない)構成のため、認識処理はマルチスレッドではなくシングルスレッドで動作します。動作自体は正確ですが、サーバー側で処理するサービスに比べると体感できるほど時間がかかります。そのため、このツールにはサイトの他のオーディオツールよりも大幅に厳しい長さの上限を設けています - 誤った速さを約束するより、正直に「時間がかかる」とお伝えする方針です。
| 入力形式 | MP3, WAV, M4A, AAC, OGG, OPUS, FLAC |
|---|---|
| 自動変換 | MP4 |
| 出力形式 | TXT |
| 一括処理 | 非対応 |
| 処理 | ブラウザ内でローカル処理 (WebAssembly) |
| ファイルのアップロード | なし |
制限: このサイトではクロスオリジン分離モードを使用していないため、認識処理はシングルスレッドで動作し、サーバー側処理のサービスより体感できるほど時間がかかります。そのため端末ごとの長さの上限が、他のオーディオツールよりも大幅に厳しく設定されています。使用しているのはコンパクトな「tiny」モデルで、明瞭な話し声には強い一方、強い背景ノイズや方言、専門用語には大きいモデルほど強くありません。認識結果に誤りがないとは限らないため、特に固有名詞や数字は結果を確認してください。
いいえ、認識処理はWebAssemblyを使ってブラウザ内で完全にローカルに実行されます。
ほぼ100言語に対応しています。自動検出することも、手動で指定することもできます。
音声認識は計算負荷が高く、ここではマルチスレッドを使わずに動作します。誤って速いと約束するより、正直に時間がかかる方を選んでいます。
はい、姉妹ツール「動画を字幕に変換」ならSRT/VTT形式で正確な時刻情報を出力できます。
動画を字幕に変換 · ノイズ除去 · 画像からテキスト (OCR) · 波形画像 · 音声を録音 · チャンネルを入れ替え