ブログ/models·2026年8月31日·2分·執筆:eroqチーム
Voice One vs Voice Turbo:表現力か、2クレジットか
Voice Oneは100文字あたり3クレジット、Voice Turboは2クレジット。追加のクレジットで何が買えるのか、1章分とチャット返信1回分の計算とともに解説します。
eroqの2つの音声合成モデルの差は、100文字あたりちょうど1クレジット。その1クレジットが、すべての論点です。Voice Oneは100文字あたり3クレジットの、表現力豊かなフラッグシップ。Voice Turboはより高速で、2クレジットです。ボイスのラインナップも、クローンも、最終的に出てくるMP3も同じ。つまり判断の基準は、声がどこまで表現できるかではありません。そのテキストに実際どれだけの演技が必要か、そしてこれから何文字をレンダリングするかです。
共通していること
まずは共通する部分から始めましょう。そちらのほうが大部分だからです。
- 同じボイス。Aria:温かく親密な女性の声。Orion:低く落ち着いた男性の声。どちらも13言語に対応し、両方のモデルでレンダリングできます。
- 同じクローン。自分の音声からクローンしたボイスは、クローンし直さなくてもVoice OneとVoice Turboの両方で使えます。詳しくはボイスクローンのガイドをご覧ください。
- 同じ操作。「速度」と「表現力」のスライダー、そして句読点による読み方の制御が、どちらにもあります。
- 同じ出力。MP3です。
- 同じキャラクター。ボイスを設定したキャラクターは、ラインナップのボイスでもクローンでも、どちらのモデルでも話せます。
ですから、モデルの切り替えは移行作業ではありません。ボイススタジオのドロップダウンか、APIのaudio/speechの文字列1つを変えるだけです。ほかの設定は何も変わりません。
追加のクレジットで買えるもの
表現力です。この言葉は、正確な意味で使っています。Voice Oneは演技のためのフラッグシップで、セリフをただ読み上げるのではなく、演じて届けなければならないときに選ぶモデルです。Turboはより高速なモデルで、音声モデルにとって速度は見栄のための指標ではありません。対話的なものでは、尋ねてから聞こえるまでの間合いこそがプロダクトそのものだからです。
演出も手に入ります。Voice Oneは、[whispering](ささやき)、[excited](興奮)、[laughing](笑い)、[sighing](ため息)のような角括弧のタグを読み上げずに演じ、読み方のタグは次のタグか次の改行まで有効です。Turboは言葉を読み、括弧の部分は飛ばします。
実際的に言うと、こうなります。
テキストを演じさせるなら、Voice Oneは追加のクレジットに見合います。リスナーが20分付き合うナレーション。キャラクターの最初のセリフ。予告編。平板な読み方が、便利さゆえに許されるのではなく、欠点として気づかれてしまうものすべてです。
テキストが機能的なものなら、Voice Turboで節約した分がそのまま得になります。通知、メニューの案内、UIの読み上げ、大量の下書き、誰もじっくり味わわない長い文書、そして何より、チャットの返信です。チャットでは、少し平板な読み方よりも、待たされることのほうがずっと悪いのです。
見過ごされがちな3つ目のケースもあります。下書きです。まだ言葉を削っている段階では台本をTurboでレンダリングし、最終版だけをVoice Oneでレンダリングし直します。捨てるバージョンにはすべて100文字あたり2クレジット、残す1本にだけ3クレジットを払えばいいのです。
2つのケースで計算する
エントリーパックなら1クレジットはおよそ1セントなので、以下の計算は簡単にドルに換算できます。どちらのモデルも、入力テキスト100文字あたりの料金です。
1章の場合
3,000語のオーディオブックの1章を例にとります。スペース込みで約17,000文字、100文字のブロックで170個分です。
- Voice One:170 × 3 = 510クレジット、約$5.10。
- Voice Turbo:170 × 2 = 340クレジット、約$3.40。
- 差額:1章あたり170クレジット。
12章の本なら、6,120クレジット対4,080クレジットで、1冊全体での差は約$20です。完成版のオーディオブックにとって、これは悩むほどの判断ではなく、誤差の範囲です。本はVoice Oneでレンダリングしましょう。この仕事でTurboが活躍するのは、3章を書き直している間に作った6本の下書きです。フォーマット面の話はオーディオブックとポッドキャストにまとめています。
チャット返信の場合
今度は反対の極端な例です。コンパニオンやロールプレイのサービスでの音声付き返信は、だいたい220文字ほど。使い始めた分も1ブロックと数えるので、100文字のブロックで3つです。
- Voice One:返信1回あたり約9クレジット。
- Voice Turbo:返信1回あたり約6クレジット。
3クレジットの差など何でもないように思えますが、掛け算をすると話は別です。1日500回の音声付き返信なら、Voice Oneで1日約4,500クレジット、Turboで3,000クレジット。月にすると約135,000クレジット対90,000クレジットです。同じボイス、同じクローンで45,000クレジットの差。しかも、安いほうのモデルが応答速度でも勝っています。
これが、eroqのボイスのラインナップで最もはっきりした使い分けです。長尺はVoice One、大量の対話的な用途はVoice Turbo。理由はどちらも同じで、料金は文字数単位なので、モデル選択の影響は文字数とまったく同じ速さで積み重なっていくからです。この議論のより広い話はAIキャラクターに声を与えるにあります。
台本こそが設定
どちらのモデルも、句読点を演出として読み取ります。つまり、あなたが持つコントロールの大部分は、スライダーではなくテキストの中にあるということです。演じてほしいとおりに台本を書きましょう。
階段の上で、彼女は足を止めた。何かが聞こえたからではない――何も聞こえなかったからだ。
「誰かいるの?」
何も返ってこない。古い家によくある、あの感じだ。静けさに形があるような。
「下にいるのはわかってる」
そして、もっと小さな声で、ほとんど自分に向けて……「下にいるのはわかってる」
この一節のどの仕掛けにも役割があります。ダッシュ(――)は一拍の間を作ります。短い段落はセリフを独立させ、埋もれないようにします。三点リーダー(……)は最後の読みをゆっくりにします。間を置いて繰り返されたセリフは、周りの句読点が変わったので、2回目は違った響きになります。
スライダーはそのあとで、控えめに。速度はペース配分のためのもので、ナレーションならデフォルトより少し遅め、セリフならデフォルトのままです。表現力は、書いた句読点にどこまで寄せて読むかを決めます。平板な台本で表現力を上げても、ドラマチックにはならず、不自然になるだけです。まず台本を直しましょう。
プロジェクトに本格的に取りかかる前に、やっておく価値のあるテストがあります。電話番号、略語、誰も発音できないブランド名が入った、いちばん厄介な段落を選び、同じボイスで両方のモデルでレンダリングするのです。この比較にかかるのは数クレジットですが、どんなデモリールよりも多くのことを教えてくれます。APIについては/docs/speechに、用語そのものについてはテキスト読み上げの項目にまとめてあるので、誰かに説明を引き継ぐときに使ってください。
1行で選ぶ
- 長尺、演技が必要、最終版 → Voice One
- 対話的、大量、またはあとでレンダリングし直す下書き → Voice Turbo
- 迷ったら → 同じ200文字を両方でレンダリングして聴き比べる。決着をつける費用は約10クレジットです。
よくある質問
Voice OneとVoice Turboの料金はいくらですか?
Voice Oneは100文字あたり3クレジット、Voice Turboは100文字あたり2クレジットです。どちらもMP3で出力し、ラインナップのすべてのボイスと、あなたのクローンボイスで使えます。
クローンしたボイスは両方のモデルで使えますか?
はい。自分の音声からクローンしたボイスは、クローンし直さなくてもVoice OneとVoice Turboで使えます。キャラクターも、設定されたボイスをどちらのモデルでもそのまま使えます。
チャットアプリにはどちらのモデルを使うべきですか?
ほぼすべての場合、Voice Turboです。より高速なモデルで、1文字あたりの費用も3分の1安く、対話的なプロダクトでは、表現力の最後のひと押しよりも応答の遅さのほうが目立つからです。
ボイススタジオを開いて同じセリフを両方でレンダリングし、自分の耳で決めましょう。
この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。