ボイス
音声合成(TTS)
音声合成(テキスト読み上げ、Text-to-Speech)は、書かれたテキストを話し言葉の音声に変換する技術です。表現力の高いTTSエンジンは句読点を演技の指示として読み取り、速度や表現力などの調整項目を備えているため、自然なナレーションやセリフを生成できます。
料金は通常文字数単位なので、長尺のナレーションでも予算を簡単に計算できます。
eroqでは
Voice One(100文字あたり3クレジット)とVoice Turbo(同2クレジット)、厳選された標準ボイス、クローンボイス、話すキャラクター、MP3出力、13言語に対応しています。
よくある質問
eroqの音声合成の料金は?
100文字ごとのブロック単位(端数は切り上げ)で、Voice Oneは3クレジット、Voice Turboは2クレジットです。
短いセリフは長いセリフより安くなりますか?
ブロック単位でしか変わりません。40文字のセリフも100文字のセリフもブロックひとつ分(Voice Oneで3クレジット)として課金され、101文字ならブロック二つ分になります。台本を短いセリフに分割すると、安くなるどころか高くなります。
音声はどの形式で返ってきますか?
MP3です。スタジオでもPOST /v1/audio/speechでも返され、ライブラリに保存されます。ステムの書き出し、タイミングデータ、リップシンクはありません。ファイルはお使いの編集ソフトで映像の下に配置してください。