字幕を自動生成するにはどうすればいいですか?
字幕の自動生成とは、自分で入力することなく、動画の発話をタイムスタンプ付きのテキストに変えることです。字幕ファイルがないときの唯一の選択肢であり、字幕を付けて視聴するのに十分な品質になってきています。方法はウェブ動画とローカルファイルで少し異なります。
字幕の自動生成とは何か
音声認識が音声を聞き取り、タイムスタンプ付きのテキストを生成し、そのセグメントが字幕になります。その後、翻訳工程でそのテキストをあなたの言語に変えられます。
ウェブ動画の場合(YouTube、X など)
- WatchTranslate ブラウザ拡張機能をインストールします(デスクトップ版 Chrome)。
- 動画を開いて字幕言語を選びます。
- 音声認識の場合:原言語は自動検出が既定で、手動指定もできます。字幕ソースと言語を選び、翻訳開始を押してください。 再生を押すと、拡張機能が音声を読み取り、字幕を生成してプレーヤー上で翻訳します。
ローカルファイル・ダウンロード済みファイルの場合
- ブラウザで WatchTranslate のローカルプレーヤーを開きます。
- 動画をドロップして翻訳先の言語を選びます。
- 音声認識の場合:原言語は自動検出が既定で、手動指定もできます。字幕ソースと言語を選び、翻訳開始を押してください。 再生を押すと、約 30 秒ずつの区切りで、再生中に字幕が生成・翻訳されます。
精度:何が影響するか
認識品質は音声に左右されます。明瞭な単一話者の発話が最もよく、大きな背景音楽、強いなまり、複数の声の重なりは精度を下げます。これは翻訳ではなく文字起こしの限界です。
手動の字幕ファイルが今も優る場合
公式の字幕ファイルが存在し、自分のリリースと一致するなら、それを使うとタイミングと話者ラベルが完璧になります。自動生成は、そのファイルが存在しない、または一致しないときのためのものです。
できること・できないこと
- ウェブ動画(YouTube、X など)とローカルの MP4/MKV ファイル
- 音声から字幕を生成し、それを翻訳
- 原文 + 翻訳のバイリンガル表示
- 失敗した実行はクレジットを消費しない
- ライブ配信には非対応
よくある質問
字幕ファイルがなくても字幕を生成できますか?
はい——まさにそれを音声認識が行います。音声がタイムスタンプ付きのテキストに文字起こしされ、それが字幕トラックになります。
視聴に耐える精度ですか?
明瞭な発話なら通常は内容を追える程度には十分です。雑音の多い音声、音楽、話者の重なりは精度を下げます。元の音声も再生されるので、何を言っているか聞き取れます。
ローカルファイルでも動作しますか?
はい。ローカルプレーヤーはパソコンやスマホのファイルの字幕を生成・翻訳します。動画全体をアップロードする必要はありません。
料金はかかりますか?
登録時に一度きりの無料クレジットが付きます。それ以降は従量制で、音声から生成する字幕は 1 分あたり約 1 クレジットです。