新規登録でプレミアムプランが割引に割引を受け取る

ボイス

話者分離(ダイアライゼーション)

話者分離(ダイアライゼーション)とは、文字起こしの中で「誰がいつ話したか」を判別し、書き起こしに話者ごとのラベルを付ける処理です。インタビューを書き起こした文字の塊を、話者名とセリフが並ぶ読みやすい会話形式に変えてくれます。

これは音声を文字に変換するモデルとは別のモデルです。そのため、正確なテキストを返しても、話者ラベルがまったく付かない文字起こしサービスも少なくありません。

単語単位のタイムスタンプは関連しつつも別の機能で、字幕ファイルに実際に必要なのはこちらです。

eroqでは

Scribe Oneは、音声1分あたり1クレジットでテキストを返し、言語は自動判定します。話者分離は行わず、単語単位のタイムスタンプも返さず、字幕ファイルも作成しません。そのため、インタビューの編集よりも、自分のナレーションに字幕を付ける用途に向いています。

よくある質問

eroqは録音の中で誰が何を話したかをラベル付けできますか?

できません。Scribe Oneは話された内容のテキストを話者ラベルなしで返すため、複数人の録音はひと続きの書き起こしとして返ってきます。

字幕用のSRTファイルは作れますか?

eroqでは作れません。単語単位のタイムスタンプも字幕の出力もないためです。書き起こしはテキストとして、字幕作成ツールに持ち込んでください。

では、eroqの文字起こしは何に使えますか?

自分のナレーションをテキストに戻す用途です。自分でタイミングを合わせる字幕、動画の説明文、あるいは生成した音声が実際に何を話したかの確認に使えます。