音声文字起こし
音声録音をタイムスタンプ付きのテキストにします。
このツールはJavaScriptで動作します。使うには、ブラウザでJavaScriptを有効にしてページを再読み込みしてください。
録音を文字に。
音声文字起こしは、音声や動画の録音に含まれる話し声を文字にします。出力は三種類あります。プレーンテキストは文の切れ目で段落にまとめ、そのまま文章にするのに向いています。タイムスタンプ付きテキストは各行の先頭に [00:01:23] の形式で時刻を入れ、会議メモやインタビューの書き起こしに便利です。JSON は各単語の開始と終了の時刻を返し、自分のアプリケーションや編集で使うためのものです。音声認識には OpenAI の公開モデル Whisper がサーバー上で動きます。トルコ語を含む 16 言語から選べるほか、自動判定もできます。
録音は自分の端末からのみアップロードします。リンクを入れる欄はありません。ファイルから音声が取り出され、16 kHzのモノラルに変換されてサーバー上のWhisperモデルに渡されます。外部サービスには送られず、処理後に削除されます。発話のない部分(0.5秒を超える無音や待ち時間)は文字起こしの前に取り除かれます。モデルは3種類です。「高速」は大まかな下書き、「バランス」はほとんどの録音に十分、「最高」は名前をより正確に捉えますが3〜4倍遅く、10分までの録音で使えます。録音は最長30分です。それより長い講義や会議は「音声カット」で分割し、順番にアップロードしてください。言語が分かっていれば選んでください。自動検出に自信がない場合は結果画面に表示されます。
最初から最後まで
- 音声または動画ファイルをアップロード MP3、WAV、M4A、FLAC、MP4、MOV、MKV…。長さが読み取られます。
- 言語と出力を選びます。 プレーンテキスト、タイムスタンプ付きテキスト、JSON。モデル:バランス。固有名詞が重要なら最高。
- テキストをダウンロードします。 テキストが画面に表示されコピーできます。ファイルがダウンロードされます。読んで修正してください。
よくある質問
タイムスタンプ付きテキストは何に使う?
各行の先頭の時刻は、その文が録音のどこにあるかを示します。会議メモ、インタビューの書き起こし、動画内の箇所を探すのに使います。JSON出力は同じ情報を単語ごとに返します。
話者を区別しますか?
いいえ。テキストはひと続きで出力され、誰が話しているかは示されません。2人のインタビューなら「タイムスタンプ付きテキスト」を選び、録音を聞きながら各行の先頭に名前を足すのが最も早い方法です。
プレーンテキストの段落はどう作られますか?
モデルは発話を区切りごとに文字起こしします。プレーンテキスト出力はそれらをつなげ、約400文字を超えた後の最初の文末で新しい段落にします。句読点や大文字もモデルが付けるため、早口や雑音の多い発話では抜けることがあります。公開前に一度読み、特に固有名詞を確認してください。
ファイルはサーバーに残りますか?
いいえ。ファイルは処理のためだけにサーバーへ送られ、処理が終わると削除されます。結果もダウンロードしてツールを閉じると削除されます。アカウント、名前、メールアドレスは不要で、ファイルが第三者のサービスに送られることはありません。利用は無料です。処理回数に 1 時間あたり・1 日あたりの上限はなく、処理の前に広告を見る必要もなく、出力に透かしを入れることもありません。
その他の音声ツール
RUPO Studio