字幕ジェネレーター
話し声を文字起こしして字幕ファイルを作成します。
このツールはJavaScriptで動作します。使うには、ブラウザでJavaScriptを有効にしてページを再読み込みしてください。
話し声を字幕に。
字幕ジェネレーターは、動画や音声ファイルの話し声を文字に変換し、タイミング付きの字幕ファイルとして出力します。SRT 出力はプレイヤー、YouTube へのアップロード、編集ソフトで使われ、VTT 出力はウェブのプレイヤー(HTML5)で使われます。音声認識には OpenAI の公開モデル Whisper がサーバー上で動きます。トルコ語を含む 16 言語から選べるほか、言語を自動判定させることもできます。字幕は読みやすさを保つように組み直されます。最大 2 行、1 行あたり最大 42 文字、最大 6 秒で、文の切れ目で区切られます。
録音はアップロードしたファイルからのみ取得され、リンクや動画のアドレスを貼り付ける欄はありません。音声はサーバー上で動くWhisperモデルで文字起こしされ、外部サービスには送られず、処理後に削除されます。言語が分かっていれば選んでください。自動検出は最初の30秒を見るため、複数言語や雑音の多い録音では誤ることがあります。「バランス」モデルはほとんどの録音に十分で、処理時間は録音の長さとほぼ同じです。「最高」モデルは固有名詞や専門用語をより正確に捉えますが3〜4倍遅く、10分までの録音で使います。録音は最長30分です。それより長い場合は先に「動画カット」または「音声カット」で分割してください。結果は画面に表示され、コピーでき、ファイルとしてダウンロードされます。公開前に必ず読んで修正してください。固有名詞、専門用語、雑音の多い箇所が最も誤りやすい部分です。
最初から最後まで
- 動画または音声ファイルをアップロードします。 MP4、MOV、MKV、WebM、MP3、WAV、M4A、FLAC…。長さが読み取られます。
- 言語と形式を選びます。 言語が分かっていれば選択。ほとんどの用途はSRT、ウェブプレイヤーはVTT。モデル:バランス。
- 字幕をダウンロードします。 キューが画面に表示されコピーできます。ファイルがダウンロードされます。読んで修正してから公開してください。
よくある質問
SRTとVTTのどちら?
SRTは最も一般的な形式で、VLC、YouTube、Premiere、DaVinci Resolveなどほとんどのプレイヤーが読めます。VTTはブラウザのHTML5 videoタグが求める形式で、ウェブサイトに埋め込むならVTTを選んでください。内容は同じで、書式だけが違います。
YouTubeなどのリンクを渡せますか?
いいえ。このツールはアップロードしたファイルでのみ動作し、リンクを貼り付ける欄は意図的にありません。他のサービスのコンテンツをダウンロードすることは、そのサービスの利用規約に反します。
精度はどのくらい?
きれいな録音(話者1人、近いマイク)なら「バランス」モデルは大部分の単語を正しく認識します。固有名詞、略語、専門用語は混同されることがあります。雑音、遠いマイク、重なった会話は誤りを増やします。「最高」モデルは明らかに正確ですが遅くなります。出力は下書きと考え、公開前に読んでください。
ファイルはサーバーに残りますか?
いいえ。ファイルは処理のためだけにサーバーへ送られ、処理が終わると削除されます。結果もダウンロードしてツールを閉じると削除されます。アカウント、名前、メールアドレスは不要で、ファイルが第三者のサービスに送られることはありません。利用は無料です。処理回数に 1 時間あたり・1 日あたりの上限はなく、処理の前に広告を見る必要もなく、出力に透かしを入れることもありません。
その他の音声ツール
RUPO Studio