新規登録でプレミアムプランが割引に割引を受け取る

ボイス

音声合成(TTS)

音声合成(テキスト読み上げ、Text-to-Speech)は、書かれたテキストを話し言葉の音声に変換する技術です。表現力の高いTTSエンジンは句読点を演技の指示として読み取り、速度や表現力などの調整項目を備えているため、自然なナレーションやセリフを生成できます。

料金は通常文字数単位なので、長尺のナレーションでも予算を簡単に計算できます。

eroqでは

Voice One(100文字あたり3クレジット)とVoice Turbo(同2クレジット)、厳選された標準ボイス、クローンボイス、話すキャラクター、MP3出力、13言語に対応しています。

よくある質問

eroqの音声合成の料金は?

100文字ごとのブロック単位(端数は切り上げ)で、Voice Oneは3クレジット、Voice Turboは2クレジットです。

短いセリフは長いセリフより安くなりますか?

ブロック単位でしか変わりません。40文字のセリフも100文字のセリフもブロックひとつ分(Voice Oneで3クレジット)として課金され、101文字ならブロック二つ分になります。台本を短いセリフに分割すると、安くなるどころか高くなります。

音声はどの形式で返ってきますか?

MP3です。スタジオでもPOST /v1/audio/speechでも返され、ライブラリに保存されます。ステムの書き出し、タイミングデータ、リップシンクはありません。ファイルはお使いの編集ソフトで映像の下に配置してください。