新規登録でプレミアムプランが割引に割引を受け取る

ブログ/tutorials·2026年9月10日·2分·執筆:eroqチーム

動画にAIナレーションを入れる方法:台本から仕上げまで

台本を書き、表現力のあるボイスでレンダリングし、クリップに尺を合わせ、eroqパネルでPremiereの編集に重ねる。実践的なワークフローです。


音のないAIクリップは、ただの壁紙です。同じクリップに30秒のナレーションが付けば、最後まで見てもらえるコンテンツになります。ボイスオーバーは、制作工程全体でいちばん安いアップグレードです。30秒ぶんの台本なら数クレジットで、その下に敷く映像の100クレジット以上と比べれば微々たるものです。

手順の前に、ひとつはっきりさせておきます。ほかのすべてに関わることだからです。これはナレーションであって、リップシンクではありません。ここでは、口の動きを音声に合わせることは一切しません。ドキュメンタリーや顔出しなしのチャンネルのように、映像の上に流れる別の音声トラックを作るのです。それを前提に書けば、見事にうまくいきます。しゃべる口を期待すると、がっかりするでしょう。

ステップ1:書き直しが安い場所で台本を書く

台本は、ボイスの入力欄ではなくテキストスタジオで書きましょう。理由は2つ。文章が得意なモデルを使えること、そして毎回音声をレンダリングし直さずに、スレッドの中で何度でも練り直せることです。

スタイルは意識して選びます。シーンは没入感のある文章を書くので、映像に乗せるナレーションに向いています。メッセージはチャットのような短いセリフを書くので、キャラクターのセリフや、歯切れのいい広告コピーに向いています。生成はモデルによって1か3クレジットなので、映像と比べれば下書きは実質無料です。

文章そのものより大事なルールが、2つあります。

  • クリップより短く書く。ショットの頭と終わりの無音は、編集への贈り物です。すべてのフレームを埋める音声トラックには、息をつく場所がありません。
  • 声に出して言う文で書く。読んでいてつかえるなら、エンジンもつかえます。

ステップ2:ボイスを選ぶ

ボイススタジオを開きます。厳選されたボイスには、温かく親密な女性の声のAriaと、低く落ち着いた男性の声のOrionがあり、どちらも13言語に対応しています。そのほかにも、カタログのボイスがそろっています。名前、カテゴリー、言語で検索し、ひとつに決める前に一通り聴いてみましょう。

一覧にない特定の声が必要なら、自分の音声からクローンしましょう。使えるサンプルの条件は、ボイスクローンのツールページで確認できます。クローンしたボイスは、スタジオのどこでも標準のボイスとまったく同じように使えます。保存したキャラクターには、標準でもクローンでもボイスを持たせられるので、シリーズを通して登場するナレーターは、どの声を使ったかを覚えておかなくても同じ声のままです。

ステップ3:レンダリングする

モデルは2つで、使えるボイスもクローンも同じです。

  • Voice One:表現力に優れたフラッグシップ。100文字あたり3クレジットで、MP3で出力されます。視聴者が何度も耳にするものには、こちらを使いましょう。
  • Voice Turbo:より高速で、100文字あたり2クレジット。下書き、尺のテスト、予算が制約になる長尺に使います。

どちらも速度と表現力のコントロールに対応しています。セリフがショットより3秒長いときに手を伸ばすのが、速度です。表現力は、上げる方向にも下げる方向にも試す価値があります。ナレーションはたいてい思っているより控えめが、キャラクターのセリフはたいてい思っているより強めが合います。

レンダリングはほかのものと同じくすべてライブラリに保存されるので、気に入ったテイクにいつでも戻れます。

ステップ4:句読点が演出になる

感情を指定する専用のパラメーターはありません。読み方を決めるのはテキストそのもの、特に句読点です。つまり、台本こそが演出なのです。それで実際にできることを正直にまとめると、こうなります。

  • 句点(。)は考えを締めくくり、声の高さを下げます。
  • 読点(、)は短く持ち上げるだけで、止まりません。
  • ダッシュ(――)は、ちょうど――このように――読点より長く間を保ちます。
  • 三点リーダー(…)は語尾を消え入らせ、やわらかく終わらせます。
  • 疑問符(?)は、段落の途中でも語尾を上げます。
  • 改段落は、指定できるいちばん長い間です。

紙のためではなく、読み上げのために書いた台本の例です。

彼は鍵をテーブルに置いていった。書き置きもない――何ひとつ。

私は長いあいだそこに立ち尽くしていた。冷めてしまったコーヒーを手に、このうちのどこに自分が同意したのかを考えながら。

そして、いちばん奇妙だったのは?ドアの鍵が、まだ開いていたことだ。

声に出して読むと、どこで息をつくかが聞こえます。それがテストです。もっと長い間が欲しいなら改段落を使い、セリフが平板に聞こえるなら、たいていは読点をダッシュに変えれば直ります。

句読点にできないのは、感情のない文に感情を後付けすることです。気持ちは、言葉そのものに書き込みましょう。

ステップ5:クリップに尺を合わせる

これは編集ソフトを開く前にやりましょう。開いたあとではありません。

  1. ストップウォッチを手に、台本を声に出して読む。その秒数で、計画を立てるには十分です。
  2. それに合わせてクリップの長さを選ぶ。エンジンはモデルによって3秒から30秒までレンダリングでき、プランによって最大10秒、15秒、20秒、30秒の上限があります。
  3. まずTurboで音声をレンダリングし、クリップと合わせて聴く。
  4. 長すぎたら、速度を上げる前に言葉を削る。軽く調整する程度を超えると、速度を上げたのがわかる音になります。
  5. 言葉が固まったら、フラッグシップのボイスで最終版をレンダリングし直す。

複数のショットが続く場合は、作品単位ではなくショット単位で作りましょう。6本のクリップに1本の長いナレーションを乗せると、編集を変えるたびにレンダリングし直すことになります。短いセリフ6本なら、変更のコストは1本ぶんだけ。顔出しなしのYouTubeのワークフローが、量産しても管理しやすいのも、この方法のおかげです。

ステップ6:編集に重ねる

MP3をダウンロードして、お使いの編集ソフトに取り込みます。Premiere ProかAfter Effectsなら、eroqパネルを使えば行ったり来たりせずに済みます。パネルの中から動画、画像、音声を生成すると、レンダリングは開いているプロジェクトに直接読み込まれ、ファイルはDocuments(書類)フォルダに保存されます。セリフを生成し、タイムラインに置き、調整して、次のセリフを生成する。編集画面から離れずに完結します。

あとは、人の耳でミックスします。声をいちばん上に置き、ほかの音はすべてその下に下げ、最後の言葉は最後のフレームより前に収めます。音声をネイティブにレンダリングするエンジンで、ショットに音が付いているなら、ミュートせずにナレーションの下に敷きましょう。声の下に流れる環境音こそが、「ちゃんと作り込まれた」音の正体です。

スクリプトで自動化したいなら、音声合成のドキュメントが同じことをAPI側から解説しています。映像の部分は、動画スタジオで作ります。

よくある質問

eroqで、キャラクターの口をナレーションに合わせられますか?

いいえ。リップシンクの機能はありません。音声トラックは映像とは別に生成されるので、ナレーション、広告、顔出しなしのコンテンツに最適です。それを前提に書いて、編集しましょう。

ナレーションの費用はいくらですか?

フラッグシップのボイスで100文字あたり3クレジット、高速なほうで2クレジットで、MP3で出力されます。600文字の台本ならおよそ18か12クレジットで、その下で流れるクリップと比べればわずかです。

シリーズ全体で同じナレーターを使えますか?

はい。標準のボイスを選ぶかクローンして、保存したキャラクターに設定すれば、毎回同じ声が選ばれます。クローンしたボイスは、標準のボイスが使える場所ならどこでも使えます。

書いて、声にして、編集する。ボイススタジオを開きましょう。新しいアカウントには、無料の50クレジットが付いてきます。

タグvoice-overtext-to-speechai-videopremiere-protutorial

この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。