ブログ/tutorials·2026年9月24日·2分·執筆:eroqチーム
AI動画でキャラクターに声を:SeedanceとHailuoのボイスキャスト
キャラクターの声が動画のレンダリングにどう乗るか。シーン内のセリフ、ボイスの説明文とボイスサンプル、エンジンごとの違い、クリップに収まるセリフの書き方まで。
サウンドトラック付きの動画エンジンは、話す人物がいるたびに声を作り出します。しかも、クリップごとに違う声です。単発のショットならそれで問題ありませんが、フィルムにとっては致命的です。eroqの答えはキャラクターです。スタジオでキャストの一人にボイスを設定し、シーンにセリフを書けば、音声リファレンスを受け付けるエンジンでは、そのセリフがその声で出てきます。シーンが変わっても同じ声です。このガイドでは、レンダリングに実際に何が渡されるのか、それがどのエンジンで効くのか、そして5秒に収まるセリフの書き方を解説します。
キャラクターが持っているもの
スタジオのキャラクターには、ルックシート(見た目)、ペルソナ(チャットでの考え方と話し方)、そしてボイスがあります。ボイスはラインナップのボイスか、あなたのクローンのひとつで、キャラクターの「ボイス」タブで設定します。動画に効くのはこのうち3つで、効かないものが1つあります。
- ルックシートは参照画像として渡されるので、顔が一致します。
- ボイスの説明文は、声を1行で説明したもの(「温かく低めの女性の声」など)で、サウンドのあるすべてのエンジンでプロンプトに含まれます。
- ボイスサンプルは、割り当てたボイスで話した短いサンプルです。一度だけレンダリングして保存され、音声リファレンスを受け付けるエンジンでは、それが音声リファレンスとして渡されます。
- ペルソナは、動画のプロンプトには一切含まれません。エンジンが描くのは映像です。彼女がどんなふうに言い返すかを知る必要はありません。
エンジンごとの違い
エンジン一覧を見ると、3つの段階に分かれます。
- 音声リファレンスあり:Seedance 2.5、Seedance 2.0、Seedance 2.0 Fast、Seedance 2.0 Mini、Hailuo 3。サンプルがレンダリングと一緒に渡され、キャラクターのセリフはその声で出てきます。サンプルはレンダリング1回につき1つ(シーン内で最初に話す、ボイスを持つキャラクターのもの)なので、確実なのは1シーンで話すキャラクターが1人の場合です。前のシーンの最後のフレームから始まる連続ショットには参照が一切渡されないため、サンプルも渡されません。そのシーンの声は説明文として渡されます。
- サウンドあり、音声リファレンスなし:Veo 3.1とそのFast・Lite、Sora 2 Pro、Kling 3.0とPro、Wan 3.0、Motion One。説明文がプロンプトに含まれ、エンジンがその言葉に合う声をキャスティングします。1つのクリップの中では一貫しますが、クリップをまたぐと一貫しません。
- サウンドなし:Hailuo 3 Max、Runway Gen-4.5、Grok Imagine。セリフは演出(口の動きや言い方)として渡されますが、音は何も聞こえません。声は「ボイス」ツールで作り、編集で追加しましょう。
フィルムのエンジンがどの段階にあるかは、Cinemaのルックパネルに表示されます。サウンドトラックのあるエンジンならどれでもサウンドをオフにでき、サウンドに料金がかかるエンジンでは、オフのほうが安くなります。
セリフの書き方
Cinemaでは、シーンのセリフはそのシーンのカードの中にあります。ト書きの下の+ セリフを押し、話者、言い方、セリフを入力します。コンポーザーは各セリフを、シーン自身の段落のト書きのすぐ後ろに書き込み(Mina (whispering) says: "It's still lit.")、プロンプトの最後をVoicesというラベル付きの一文で締めくくります。ボイスを持つ各キャラクターがどんな声かをこの一文が伝えるので、毎回同じように読まれます。段落を確認するには、カードのエンジンが読み取る内容を開いてください。数百回のレンダリングを見てきてわかったルールを紹介します。
- 5秒にセリフ1つ。短い文を話すと3〜4秒かかります。2文なら10秒必要です。
- 形容詞より言い方。「ささやくように」「独り言で」「顔を上げずに」は効きますが、「感情的に」は効きません。
- 句読点は演出。ダッシュは間、三点リーダーは言いよどみ、疑問符は語尾を上げます。句読点のガイドは、音声だけでなく動画にもそのまま当てはまります。
- 2人が画面に映っているときは、ト書きでも話者の名前を出す。Minaのセリフの前に「MinaがRookのほうを向く」と書きましょう。書かないと、エンジンはカメラにいちばん近い人物にセリフを話させます。
- セリフの中に演出の指示を入れない。セリフは何を言うか、言い方はどう言うかです。混ぜると、指示まで声に出して読まれてしまいます。
1つのシーンを最初から最後まで
シーンカードはこうです。
INT. LIGHTHOUSE — DUSK
@Mina reaches the top of the spiral stairs, out of breath, slow push-in
as she sees the lamp.
MINA (whispering) It's still lit.
Seedance 2.0 Miniで、5秒、サウンドオンでレンダリングすると45クレジットです。エンジンが受け取るのは、シーンの段落(柱、プッシュインを含むト書き、そして言い方付きの彼女のセリフ)、参照画像1(彼女のシート)に結びつけられたMina、カメラワークとルック、音声リファレンスの声で話すようエンジンに指示するVoicesの行、そしてその音声リファレンスとしての彼女のボイスサンプルです。クリップには彼女の顔と声が入ります。シーン2を別のセリフでレンダリングしても、同じサンプルが渡されるので同じ声になります。ただし、シーン2が連続ショットでない場合に限ります。前のフレームから始まるシーンはサンプルを送らないため、声は説明文から作られます。流れよりも声が大事な、セリフの多いフィルムなら、ルックパネルで連続ショットをオフにしましょう。
Kling 3.0では、同じシーンが170クレジットで、声は説明文をもとにKlingが推測したものになります。出来はよいのですが、次のシーンでは別の声になります。
声を正確に合わせたいとき
ナレーションやボイスオーバー、あるいはクローンと寸分たがわず同じ声でなければならないセリフなら、エンジンには一切頼らないでください。「ボイス」ツールでキャラクターのボイスを使ってセリフをレンダリングし(100文字あたり3クレジット)、Cinemaの「編集」でそのMP3を映像の下に置きます。クリップ自体の音はミュートするか下げておきましょう。そうすれば、エンジンのサウンドトラックは環境音になり、言葉はあなたのものになります。サウンドのないエンジンでは、これが唯一の方法でもあります。
制限事項をはっきりと
- ボイスサンプルはレンダリング1回につき1つです。2人の掛け合いでは、最初の話者にサンプルが使われ、もう1人には説明文が使われます。
- サンプルはリファレンスであって、台本ではありません。エンジンはその声で話しますが、録音に合わせてリップシンクするわけではありません。
- 言語はセリフに従います。英語の音声からクローンしたボイスでフランス語のセリフを話させると、「ボイス」ツールと同じく、なまりのある発音になります。
- プライバシー:サンプルはあなた自身のストレージからの署名付きリンクで、エンジンのキューを待つのに十分な時間だけ有効です。
よくある質問
キャラクターのペルソナはセリフの話し方に影響しますか?
いいえ。ペルソナはチャット用です。話し方を決めるのは、言い方、句読点、そしてボイスそのものです。
1つのシーンで2人のキャラクターが話せますか?
2人のセリフは、それぞれの説明文と一緒にプロンプトに含まれます。ただしボイスサンプルはレンダリング1回につき1つだけなので、2人のうち1人はエンジンが声をキャスティングします。2人とも正確な声にしたいなら、連続ショットをオフにして、やり取りを2つのシーンに分けましょう。前のフレームから始まるシーンはサンプルを送らないからです。
声がいちばん一貫するエンジンはどれですか?
SeedanceファミリーとHailuo 3です。サンプルを受け付けるからです。ほかのエンジンでは、説明文によって声のタイプは一貫しますが、声そのものは一貫しません。
ボイスサンプルに料金はかかりますか?
かかりません。サンプルはボイスごとに一度だけレンダリングして保存され、音声リファレンス対応のエンジンでのレンダリングでは追加料金なしで送られます。
キャラクターの「ボイス」タブでボイスを設定したら、Cinemaのシーンカードにセリフを書いてみましょう。
この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。