ブログ/developers·2026年8月5日·2分·執筆:eroqチーム
AIキャラクターに声を:TTSのレイテンシ、コスト、表現のコツ
キャラクター製品のどこに声を使うか、音声合成のコストを抑える方法、そして生成したセリフを「読み上げ」ではなく「演技」に聞こえさせる細部。
テキストはキャラクターに心を与え、声は身体を与えます。リテンションの差は本物です。話すキャラクターは、また開いてもらえます。ただ、声はもっとも下手に作りやすい機能でもあります。高くて、遅くて、平板になりがちです。ここでは、私たちが使っているプレイブックを紹介します。
声はモダリティではなく「瞬間」として
つい、すべてに声を付けたくなります。その衝動はこらえましょう。音声合成には入力1文字ごとに実際のお金がかかりますし(Voice Oneで100文字あたり3クレジット、より高速なVoice Turboで2)、自動再生される音声が延々と続くのは、そもそも疲れます。
声は句読点として機能します。会話が始まるときのあいさつ、感情の山場、ユーザーがはっきり聞きたいと求めた返答。声を特別な瞬間として扱う製品は、コストが10分の1で済み、しかもそこからより多くのリテンションを得ています。希少だからこそ、心に届くのです。
コストモデル
POST /v1/audio/speechは、100文字のブロック単位(端数切り上げ)で課金されます。実際の数字は次のとおりです。
| セリフ | 文字数 | クレジット | 費用の目安 |
|---|---|---|---|
| 短いあいさつ | 80 | 3 | $0.03 |
| よくある返答 | 240 | 9 | $0.09 |
| 長いドラマチックな場面 | 600 | 18 | $0.18 |
ここから言えることは2つです。1つ目は、声のために書くこと。話すセリフは、そもそも書き言葉より短くあるべきです。200文字に削るのは表現としての改善であり、同時に請求額を半分にします。2つ目は、積極的にキャッシュすること。あいさつ、決めゼリフ、繰り返し出てくる場面は、毎回同じ音声です。voice + textをハッシュ化し、MP3を自分で保存しましょう。どのセリフもライブラリに入りますが、再生を無料にするのは自分で持つキャッシュです。これで再生の大部分が無料になります。
レイテンシと、その感じ方
音声合成には1〜2秒かかります。ポイントは、体感のレイテンシはUIの性質だということです。
- テキストの返答はすぐに表示し、音声は控えめな「音声を読み込み中」の表示とともに、あとから届くようにします。ユーザーはレンダリングのあいだに文章を読んでいます。
- 台本が決まっている場面(オンボーディングやあいさつ)は、事前に生成しておきましょう。そのセリフは、ユーザーが来る前からわかっています。
- 音声のせいで会話を止めてはいけません。音声が失敗したら、そのターンをエラーにするのではなく、何も言わずにテキストへ切り替えるべきです。
「演じている」と感じさせる
「読み上げ」と「演技」の違いは、ほとんどが入力テキストにあります。
- 句読点が抑揚を作る。 読点、ダッシュ、三点リーダーで、間合いを演出します。「ふーん……それは初耳だね。」は演技になり、「ふーんそれは初耳だ」はただの読み上げになります。
- キャラクターらしさは言葉に込める。 合成音声が担うのは声質で、個性を担うのは文章です。皮肉屋のキャラクターに必要なのは、皮肉な声の設定ではなく、皮肉な文章です。
- 声とキャラクターの組み合わせは一度決めたら変えない。 声のアイデンティティは、キャラクターのアイデンティティです。関係の途中で声を変えるのは、音声版のアバターのすり替えに等しい行為です。
標準ボイス(温かく親密なariaと、低く落ち着いたorion。詳しくはリファレンスを参照)は、あえて無限ではなく厳選しています。いつでもしっくりくる2つの声は、ときどきしかしっくりこない40の声に勝ります。どちらも13言語を読み上げられます。どちらもキャラクターに合わなければ、自分の音声からボイスをクローンして、そちらをキャスティングしましょう。
往復させる:耳も持たせる
同じ音声パイプラインは逆向きにも動きます。/v1/audio/transcriptions(音声1分あたり1クレジット)は、ユーザーのボイスメッセージを、キャラクターが返答できるテキストに変換します。音声で受け取り、テキストで考え、音声で返す。これが「通話モード」の完全なループで、それぞれの区間はAPI呼び出し1回です。
よくある質問
AI音声合成のコストはセリフ1つあたりいくらですか?
Voice Oneは100文字ごと(端数切り上げ)に3クレジット、Voice Turboは同じ標準ボイスと同じクローンで2クレジットです。240文字の返答はVoice Oneで9クレジット、約9セントです。セリフを短く書くことは、表現の改善であると同時に、請求額を半分にするいちばん安い方法でもあります。
キャラクターの声をクローンできますか?
はい。ボイススタジオで自分の音声をアップロードすると、クローンがあなたのボイス一覧に加わり、ariaやorionと同じようにAPIからキャスティングできます。キャラクターにはクローンボイスか標準ボイスを一度だけ割り当てられます。そうすることで、関係が続くあいだ、声のアイデンティティを安定させられます。
ボイスは何語を話せますか?
どちらの音声モデルも13言語を読み上げられ、クローンボイスもそれらの言語で使えます。言語は別のパラメーターではなく送信したテキストから判断されるので、キャラクターは同じ声質のまま、ユーザーの言語で答えられます。
eroqで声を動画やアバターにリップシンクできますか?
いいえ。リップシンクも、話すアバターの機能も、リアルタイム音声もありません。音声合成が返すのは、自分で再生するMP3です。その場面は静止画に添えたボイスメモとして設計しましょう。実際の製品でも、それがうまくいく形です。2つを1つのタイムラインにまとめる必要があるなら、動画編集ソフトに書き出してください。
まずはあいさつから始めましょう。キャラクターごとにキャッシュしたセリフを1つ、1つあたり数クレジット、午後のうちにリリースできます。それが2日目のリテンションにどう効くかを測ってから、どこまで広げるかを決めてください。私たちの経験では、製品を変えるのはその最初の午後です。
この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。