本文へ移動
さくっとツールファイルを送らない、無料の仕事道具

音声・動画の文字起こし|ブラウザの中の Whisper で、録音を送らずにテキスト・字幕(SRT/VTT)に

会議の録音・講義の動画を文字に。日本語向けモデル(kotoba-whisper)も。時刻付きで字幕にも。

✓ 送信なし✓ 広告なし✓ 登録不要このページが外へ送った通信:計測中自分で確かめる方法

初回はモデル(77MB〜730MB)と認識エンジン(28MB)をこのサイトから読み込みます。音声そのものは送信されません。

特長

使い方

  1. 音声か動画を選ぶ
  2. モデルと言語を選んで「文字起こし」
  3. テキスト・SRT・VTT で保存

よくある質問

音声はどこかへ送られますか?
送られません。認識エンジン(Whisper)もモデルもこのサイトから読み込んで、あなたのパソコンの中で動きます。
どのモデルを選べばいい?
短い日本語のメモなら「速い」で十分試せます。会議・講義など長くて正確さが要る物は「日本語向け・高精度」(kotoba-whisper:日本語で学習された Whisper)。ただし 730MB の読み込みと、それなりの処理時間がかかります。
時間がどれくらいかかりますか?
GPU(WebGPU)が使える Windows の Chrome / Edge なら、音声の長さの 1/5〜1/2 程度。使えない場合(CPU だけ)は音声の長さと同じ〜数倍かかります。画面に「GPU」「CPU」のどちらで動いているかを出しています。
精度は?
静かな環境の1人の話し声はかなり正確です。複数人が同時に話す・雑音が多い・専門用語は間違えます。人名・固有名詞は必ず見直してください。
長い録音でも?
30秒ずつに分けて順に処理するので、1時間の録音でも扱えます(時間はかかります)。途中経過が画面に流れます。
スマホでも使えますか?
技術的には動きますが、モデルが大きくメモリを食うので、パソコンでの利用をおすすめします。

ほかのツール