ボイス
音声認識(STT)
音声認識(Speech-to-Text)は、話し言葉の音声を文字に書き起こす技術です。チャットモデルや音声合成と組み合わせると、音声で会話するループが作れます。
実用上のポイントは、言語の自動判定、ファイルサイズの上限、そしてリクエスト単位か分単位かの料金体系です。
eroqでは
Scribe Oneは、音声1分ごとに1クレジット(端数の分は切り上げ)、ファイルは最大8MB、言語は自動判定です。
よくある質問
文字起こしの料金は?
Scribe Oneでは、音声1分ごとに1クレジット(端数は切り上げ)です。ボイスメモなら1クレジット、1時間の音声なら60クレジットになります。
Scribe Oneはどんな音声に対応していますか?
最大8MB(圧縮音声でおよそ8分)のwavまたはmp3ファイル1つに対応し、言語は自動判定するか、言語コードで指定できます。それより長い録音は分割が必要です。課金はファイルごとに1分単位(端数切り上げ)で1クレジットなので、分割して増えるのは切り上げ分だけです。
文字起こしでタイムスタンプや話者ラベルは返されますか?
いいえ。レスポンスは音声のテキストだけです。話者分離、単語単位のタイミング、字幕ファイルはありません。字幕は、このテキストをもとに後工程で作成します。