eroq api · ボイス
テキストに声を。
声をテキストに。
100文字あたり2〜3クレジットの2つの音声合成モデル、厳選された標準ボイス、クリアな録音からのクローン。キャラクターにボイスを割り当てれば、そのセリフはすべて同じ声に。さらに、同じキーで音声をテキストに書き起こせます。
MP3で出力 · 13言語 · クローンはアカウント専用
新規登録で50クレジット無料 · カード不要
curl https://eroq.ai/v1/audio/speech \
-H "Authorization: Bearer $EROQ_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "eroq-voice-one",
"input": "That noise is the reactor missing its coolant flush. [sighing] Again.",
"voice": "aria"
}' \
--output speech.mp3できること
本番のプロダクトのためのVoice。
2つのスピード
Voice Oneは100文字あたり3クレジット、Voice Turboは2クレジット。リクエストの形式も標準ボイスも同じです。セリフが演技ではなく通知なら、Turboはわずかなニュアンスと引き換えに、レイテンシーとコストを抑えます。
ボイスをクローン
クリアな録音をアップロードすれば、そのクローンはあなただけのもの。アカウント専用で非公開、API、スタジオ、割り当てたどのキャラクターからでも使えます。共有の標準ボイスに公開されることはなく、ほかの誰もアクセスできません。
話すキャラクター
保存したキャラクターにボイスを紐づければ、呼び出し元があなたのプロダクトでも、フィルムでも、スタジオでも、そのキャラクターのセリフはすべてその声になります。すべての呼び出し箇所にボイスIDを渡して回る必要はなく、割り当ては一度だけです。
演出はテキストの中に
速度と表現力はパラメーターで、それ以外の演技は入力テキストの中に書きます。どちらのエンジンでも句読点(読点、三点リーダー、改行)が効き、Voice Oneでは[whispering]や[laughing]のような角かっこのタグが、読み上げられることなく演技として反映されます。覚えるべきSSMLの方言も、書き間違えるSSMLもありません。
13言語
同じ声で13言語を話せるので、クローンしたナレーターに、その言語で一度も録音していない原稿を読ませることもできます。発音はテキストに従うため、数字や名前は読み方どおりに書いておくのがおすすめです。
そして、テキストへ
文字起こしは同じキーで、音声1分あたり1クレジット。自分のナレーションに字幕をつける流れが、これで完結します。話者分離や単語単位のタイムスタンプはないため、返ってくるのは字幕ファイルではなくテキストです。
よくある質問
要点だけ。
音声合成の料金は? +
Voice Oneは100文字あたり3クレジット、Voice Turboは2クレジットで、送信したテキストに対して課金されます。文字起こしは、音声1分ごと(1分未満は切り上げ)に1クレジットです。
クローンした声は誰が使えますか? +
あなたのアカウントだけです。クローンは非公開で、共有の標準ボイスに追加されることはありません。削除もでき、削除すると割り当てていたすべてのキャラクターからも外れます。
どの形式で返されますか? +
MP3です。音声のストリーミング用エンドポイントはないため、長い文章も、話されるそばから届くのではなく、完成したひとつのファイルとして届きます。
生成した顔にリップシンクできますか? +
できません。音声合成と動画は別々の呼び出しで、リップシンクのツールはありません。Veo 3.1ならクリップの一部としてセリフを生成できますが、既存のクリップに音声トラックを重ねて口の動きを合わせることはできません。
文字起こしでタイムスタンプは返されますか? +
いいえ、返されるのはテキストだけです。話者分離も、単語単位のタイミングも、字幕ファイルもないため、字幕にするにはお使いの編集ソフトでの作業が必要です。