ja

音声文字起こし

録音した音声を、AI音声認識(Whisper)でブラウザ上のみで文字起こしします。アップロードは一切不要。

お使いの端末でローカル処理中 ...

録音の言語
  • 自動検出
  • English
  • 中文
  • Deutsch
  • Español
  • Русский
  • 한국어
  • Français
  • 日本語
  • Português
  • Türkçe
  • Polski
  • Català
  • Nederlands
  • العربية
  • Svenska
  • Italiano
  • Bahasa Indonesia
  • हिन्दी
  • Suomi
  • Tiếng Việt
  • עברית
  • Українська
  • Ελληνικά
  • Bahasa Melayu
  • Čeština
  • Română
  • Dansk
  • Magyar
  • தமிழ்
  • Norsk
  • ไทย
  • اردو
  • Hrvatski
  • Български
  • Lietuvių
  • Latina
  • Māori
  • മലയാളം
  • Cymraeg
  • Slovenčina
  • తెలుగు
  • فارسی
  • Latviešu
  • বাংলা
  • Српски
  • Azərbaycanca
  • Slovenščina
  • ಕನ್ನಡ
  • Eesti
  • Македонски
  • Brezhoneg
  • Euskara
  • Íslenska
  • Հայերեն
  • नेपाली
  • Монгол
  • Bosanski
  • Қазақша
  • Shqip
  • Kiswahili
  • Galego
  • मराठी
  • ਪੰਜਾਬੀ
  • සිංහල
  • ខ្មែរ
  • ChiShona
  • Yorùbá
  • Soomaali
  • Afrikaans
  • Occitan
  • ქართული
  • Беларуская
  • Тоҷикӣ
  • سنڌي
  • ગુજરાતી
  • አማርኛ
  • ייִדיש
  • ລາວ
  • Oʻzbekcha
  • Føroyskt
  • Kreyòl ayisyen
  • پښتو
  • Türkmençe
  • Nynorsk
  • Malti
  • संस्कृतम्
  • Lëtzebuergesch
  • မြန်မာ
  • བོད་སྐད་
  • Tagalog
  • Malagasy
  • অসমীয়া
  • Татарча
  • ʻŌlelo Hawaiʻi
  • Lingála
  • Hausa
  • Башҡортса
  • Basa Jawa
  • Basa Sunda
  • 粵語

お使いの端末でローカル処理中 ...

0%

私のファイルはアップロードされますか?

いいえ。すべてブラウザ内で動作します。あなたのファイルが端末から出ることはありません。これが検証できる理由

アップロード不要100%ローカル処理
中身は手元のまま第三者のアクセスなし
Hosted in GermanyGlobal Content Delivery
第三者による検証済みTLS A+ · ヘッダー A+

インタビューや講義の録音、外出先で思いついたアイデアを残した音声メモ - このツールは録音を聞き取り、検索やコピーができるテキストとして書き起こします。認識モデルにはOpenAIのWhisperを使用し、ここでは専用にコンパイルしたシングルスレッドのWebAssembly版として動作します。有名な文字起こしサービスの多くが使っているのと同じ基盤技術ですが、外部のサーバーではなく、あなたの端末だけで完結する点が違います。

初期設定では、Whisperが話されている言語を自動的に判定します(「自動検出」)。短い録音や複数言語が混在する録音では、言語を手動で指定することで認識精度と処理速度がわずかに向上する場合があります。結果は発話の区切りごとに段落分けされた、連続したテキストとして表示されます。動画にタイムスタンプ付きの字幕が必要な場合は、同じ認識エンジンを使いながらSRT/VTT形式で正確な時刻情報を出力する姉妹ツール「動画を字幕に変換」をご利用ください。

共有メモリを使わない(クロスオリジン分離を行わない)構成のため、認識処理はマルチスレッドではなくシングルスレッドで動作します。動作自体は正確ですが、サーバー側で処理するサービスに比べると体感できるほど時間がかかります。そのため、このツールにはサイトの他のオーディオツールよりも大幅に厳しい長さの上限を設けています - 誤った速さを約束するより、正直に「時間がかかる」とお伝えする方針です。

技術仕様

技術仕様
入力形式MP3, WAV, M4A, AAC, OGG, OPUS, FLAC
自動変換MP4
出力形式TXT
一括処理非対応
処理ブラウザ内でローカル処理 (WebAssembly)
ファイルのアップロードなし

3ステップで

  1. 音声ファイルをドロップします。
  2. 言語を選択するか、「自動検出」のままにします。
  3. 認識結果のテキストをコピーするか、TXTとしてダウンロードします。

制限: このサイトではクロスオリジン分離モードを使用していないため、認識処理はシングルスレッドで動作し、サーバー側処理のサービスより体感できるほど時間がかかります。そのため端末ごとの長さの上限が、他のオーディオツールよりも大幅に厳しく設定されています。使用しているのはコンパクトな「tiny」モデルで、明瞭な話し声には強い一方、強い背景ノイズや方言、専門用語には大きいモデルほど強くありません。認識結果に誤りがないとは限らないため、特に固有名詞や数字は結果を確認してください。

よくある質問

録音データはアップロードされますか?

いいえ、認識処理はWebAssemblyを使ってブラウザ内で完全にローカルに実行されます。

どの言語に対応していますか?

ほぼ100言語に対応しています。自動検出することも、手動で指定することもできます。

なぜ他のオーディオツールより時間がかかるのですか?

音声認識は計算負荷が高く、ここではマルチスレッドを使わずに動作します。誤って速いと約束するより、正直に時間がかかる方を選んでいます。

字幕用にタイムスタンプ付きで出力することはできますか?

はい、姉妹ツール「動画を字幕に変換」ならSRT/VTT形式で正確な時刻情報を出力できます。

関連ツール

動画を字幕に変換 · ノイズ除去 · 画像からテキスト (OCR) · 波形画像 · 音声を録音 · チャンネルを入れ替え