ボイス
話者分離(ダイアライゼーション)
話者分離(ダイアライゼーション)とは、文字起こしの中で「誰がいつ話したか」を判別し、書き起こしに話者ごとのラベルを付ける処理です。インタビューを書き起こした文字の塊を、話者名とセリフが並ぶ読みやすい会話形式に変えてくれます。
これは音声を文字に変換するモデルとは別のモデルです。そのため、正確なテキストを返しても、話者ラベルがまったく付かない文字起こしサービスも少なくありません。
単語単位のタイムスタンプは関連しつつも別の機能で、字幕ファイルに実際に必要なのはこちらです。
eroqでは
Scribe Oneは、音声1分あたり1クレジットでテキストを返し、言語は自動判定します。話者分離は行わず、単語単位のタイムスタンプも返さず、字幕ファイルも作成しません。そのため、インタビューの編集よりも、自分のナレーションに字幕を付ける用途に向いています。
よくある質問
eroqは録音の中で誰が何を話したかをラベル付けできますか?
できません。Scribe Oneは話された内容のテキストを話者ラベルなしで返すため、複数人の録音はひと続きの書き起こしとして返ってきます。
字幕用のSRTファイルは作れますか?
eroqでは作れません。単語単位のタイムスタンプも字幕の出力もないためです。書き起こしはテキストとして、字幕作成ツールに持ち込んでください。
では、eroqの文字起こしは何に使えますか?
自分のナレーションをテキストに戻す用途です。自分でタイミングを合わせる字幕、動画の説明文、あるいは生成した音声が実際に何を話したかの確認に使えます。
「ボイス」の他の用語