ブログ/tutorials·2026年9月2日·2分·執筆:eroqチーム
多言語ナレーションガイド:13言語を1つの台本で
AIボイスで1本のフィルムを13言語でナレーションする方法。台本の準備、読み方を決める句読点、ボイスを一度で決めるキャスティング、文字数あたりのクレジット計算。
ショートフィルムのローカライズといえば、かつては13件の予約、13のスタジオ、13枚の請求書を意味しました。今では13個のテキスト欄で済みます。とはいえ、聞こえるほど簡単ではありません。そもそも、難しいのは録音ではなかったのです。本当に難しいのは、ひとつの言語のために書かれ、ひとつのリズムで読まれ、そのリズムに合わせて編集された映像に乗せた台本は、前もって計画しておかないと翻訳に耐えられない、という点です。このガイドで扱うのは、その下準備と句読点、そして計算です。
ボイススタジオでできること
ボイススタジオは、厳選されたボイス(あたたかく親密なAria、低く落ち着いたOrionなど)が13言語で読み上げる、テキスト読み上げの機能です。さらに、自分の音声からのボイスクローン、速度と表現力の調整、貼り付けたテキストの句読点に沿った読み方を備えています。出力はMP3です。
モデルは2つ。使えるボイスもクローンも共通です。
- Voice One:表現力豊かなフラッグシップ。100文字あたり3クレジット。
- Voice Turbo:より高速。100文字あたり2クレジット。
ボイスが共通なので、すべての言語をTurboで下書きし、採用するものだけをVoice Oneで読み直せます。キャスティングをやり直す必要はありません。それだけで、試行錯誤の段階の費用が3分の1減ります。
キャスティングの前に台本を整える
台本がまだテキストのうちに、直しておきたいことが4つあります。
耳のために書く。読む人なら許してくれる文も、聞く人は聞き逃します。1文に1つの考えを目指し、結論は先に置きましょう。ひと息で言えない文を、エンジンがうまくごまかしてくれることはありません。
機械が推測するしかないものは、すべて読みで書く。数字、単位、通貨、日付、略語、商品の型番。「1080p」や「2026」や「approx.」は表記であって、話し言葉ではありません。聞かせたいとおりに書きましょう。どの言語でも、おかしな読みのテイクが生まれるいちばんの原因はこれです。
長さの伸びを見込んでおく。同じ文でも、言語ごとに長さが変わります。英語の原文よりはっきり長くなることもあります。映像を英語の読みに合わせて編集していると、残りの12言語は壁にぶつかります。各ビートの終わりに余白を残すか、いちばん長い読みに合わせて映像を編集し、短い読みには間を持たせましょう。
リズムではなく意味を訳す。英語のリズムで書かれた一文を逐語訳すると、ほとんどの言語では脅迫状のような文になります。各言語の台本はそれが原文であるかのように書いてもらい、そのうえでビートに収まるかを確認しましょう。
句読点が演出になる
プロンプトのどこかに、演技のダイヤルが隠れているわけではありません。読み方を決めるのは、句読点、文の長さ、そして速度と表現力の調整です。実際、必要なのはほとんどそれだけです。
- 句点(。):完全な区切りで、声の高さがリセットされます。
- 読点(、):短い息継ぎ。節を2つの読点で挟むのが、セリフをゆっくりにするいちばん安上がりな方法です。
- 三点リーダー(……):言いさしの、終わらない思い。効果は強力ですが使いすぎやすいので、1段落に1つまでにしましょう。
- ダッシュ(——):読点より強い中断。
- 疑問符(?):文末が上がります。平板なナレーションに抑揚をつけるいちばん簡単な方法は、反語的な問いかけです。
- 段落の区切り:本当の間。詩の行を空けるように、空行で読みの構成を作りましょう。
ルールはどの言語でも同じですが、記号は言語ごとに違います。各言語の台本は、その言語のネイティブの組版者が打つとおりの句読点で書き、その記号に舵取りを任せましょう。息継ぎの位置が違う言語に英語のカンマの癖を持ち込んではいけませんし、ファイルを見た目よくするために、その言語固有の記号を消してもいけません。それは演出を消すことです。どのボイスがどの言語を読めるかは、スタジオの言語選択が正式な情報源です。
文法の授業のためではなく、読み方のために句読点を打った、完全なナレーションの例です。
七時を過ぎると、十二階には誰も来ない。エレベーターは今も動いている——ただ、扉が開かなくなるだけだ。彼女がそれを知ったのは三日目の夜、ひとりきりで、ひとつを除くすべての扉を開けられるセキュリティカードを持っていたときだった。では、開かなかったその扉は? 鍵がかかっていたのではない。押さえられていたのだ。
6つの文、ダッシュが1つ、わざと避けた三点リーダーが1つ、反語的な問いが1つ、映像にして90秒分。貼り付けて「生成」を押し、ほかの何かに触る前に、まず速度を調整しましょう。
キャスティングは一度、あとは使い回す
ボイスは13言語すべてについて一度に選び、そのあとは決定を蒸し返さないようにします。標準のボイスを使うのがいちばん簡単です。自分の音声から作るクローンなら、ほかと差がつきます。ボイスクローンは録音を一度取り込むだけで、あとは標準のボイスと同じように、2つの音声モデルのどちらでも使えます。
決まったキャストで制作するなら、ボイスは頭の中で覚えておくのではなく、キャラクターの記録に紐づけましょう。キャラクターはボイスを持つので、同じ人物は、フィルムでも予告編でもSNS用の短縮版でも同じ声で話します。キャストのボイスの選び方と演出については、AIキャラクターのためのTTSで詳しく紹介しています。
計算:文字あたり、言語あたり
料金はテキスト100文字単位なので、予算がめずらしく正直に立てられます。
1,200文字のナレーション(読み上げで約90秒)は、Voice Oneで36クレジット、Voice Turboで24クレジットです。13言語分ならVoice Oneで468クレジット、Turboで312クレジット。1クレジットがおよそ1セントのエントリーパックの料金なら、ローカライズしたナレーション全体で$5未満に収まります。
次は、キャストがセリフを話すシーンです。3人のキャラクターがそれぞれ300文字のセリフを話すと900文字で、Voice Oneなら1言語あたり27クレジット、キャラクター1人・1言語あたりでは9クレジットです。このシーンを13言語で作ると351クレジット。つまり、Hobbyプランの毎月1,800クレジットで、90秒のナレーションの13言語版を3回分まるごと作れて、4回目もほとんどまかなえます。しかも、毎月のクレジットは繰り越されます。
高くつく失敗は、モデル選びではなく読み直しです。ローカライズのあとで1行修正するたびに、13回分の再レンダリングを払うことになります。台本を確定してから、ローカライズしましょう。
話せない言語をチェックする
いずれ、自分では間違いを聞き取れない言語のテイクを出すことになります。安上がりな安全策が2つあります。
自分の出力を文字起こしする。Scribe Oneは音声1分あたり1クレジットの音声認識で、8 MBまでのファイルに対応し、言語を自動で判定します。生成したMP3をこれに通し、エンジンが実際に何と言ったかを読みましょう。崩れた名前、飲み込まれた数字、誤判定された言語は、テキストにすればすぐにわかります。
発音の用語集を作っておく。固有名詞、ブランド名、架空の地名は、どの言語でもつまずくところです。望む読みを、台本そのものに書き込みましょう。エンジンは打ったとおりに読むので、聞かせたいとおりに打つことです。
最後に合成する
eroqはトリミングもミックスもカラーグレーディングもしませんし、リップシンクもありません。ナレーションは映像の上に乗せるもので、口の動きに合わせるものではありません。MP3を書き出し、PremiereかAfter Effectsで編集に合わせて配置し、言語ごとにシーケンスを複製します。生成したものはすべてレシピと一緒にライブラリに自動保存されるので、6週間後に書き出し直すときも、設定を書き直す必要はありません。タイムラインではなくパイプラインに組み込むなら、同じボイスを音声のドキュメントにあるPOST 1回で呼び出せます。
よくある質問
ボイスは何言語を読めますか?
13言語です。標準のボイスも、自分のクローンも読めます。具体的にどの言語かは、ボイススタジオの言語選択に一覧があります。
言語ごとにボイスをクローンする必要がありますか?
いいえ。一度クローンすれば、言語をまたいでも、プロジェクトをまたいでも、2つの音声モデルのどちらでも使い回せます。
ローカライズしたナレーションの費用は、実際いくらですか?
Voice Oneは100文字あたり3クレジット、Voice Turboは2クレジットです。1,200文字の台本を13言語で作ると、Voice Oneで468クレジット、Turboで312クレジットです。
台本は確定しましたか?ボイススタジオを開いて、キャスティングは一度で済ませましょう。
この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。