音声・動画の文字起こし|ブラウザの中の Whisper で、録音を送らずにテキスト・字幕(SRT/VTT)に
会議の録音・講義の動画を文字に。日本語向けモデル(kotoba-whisper)も。時刻付きで字幕にも。
初回はモデル(77MB〜730MB)と認識エンジン(28MB)をこのサイトから読み込みます。音声そのものは送信されません。
特長
音声・動画を文字に
会議の録音、講義の動画、ボイスメモ、インタビューを文字起こし。時刻付きの字幕(SRT / VTT)としても保存できます。
モデルを選べる
速い(77MB)/標準(250MB)/日本語向け・高精度(kotoba-whisper・730MB)。パソコンの GPU(WebGPU)が使えれば数倍速くなります。
アップロードしない
音声認識(Whisper)はブラウザの中で動きます。音声はどこにも送られません。モデルは初回だけこのサイトから読み込みます(2回目以降はブラウザが覚えている限り速い)。
使い方
- 音声か動画を選ぶ
- モデルと言語を選んで「文字起こし」
- テキスト・SRT・VTT で保存
よくある質問
- 音声はどこかへ送られますか?
- 送られません。認識エンジン(Whisper)もモデルもこのサイトから読み込んで、あなたのパソコンの中で動きます。
- どのモデルを選べばいい?
- 短い日本語のメモなら「速い」で十分試せます。会議・講義など長くて正確さが要る物は「日本語向け・高精度」(kotoba-whisper:日本語で学習された Whisper)。ただし 730MB の読み込みと、それなりの処理時間がかかります。
- 時間がどれくらいかかりますか?
- GPU(WebGPU)が使える Windows の Chrome / Edge なら、音声の長さの 1/5〜1/2 程度。使えない場合(CPU だけ)は音声の長さと同じ〜数倍かかります。画面に「GPU」「CPU」のどちらで動いているかを出しています。
- 精度は?
- 静かな環境の1人の話し声はかなり正確です。複数人が同時に話す・雑音が多い・専門用語は間違えます。人名・固有名詞は必ず見直してください。
- 長い録音でも?
- 30秒ずつに分けて順に処理するので、1時間の録音でも扱えます(時間はかかります)。途中経過が画面に流れます。
- スマホでも使えますか?
- 技術的には動きますが、モデルが大きくメモリを食うので、パソコンでの利用をおすすめします。