動画
リップシンク
リップシンクとは、用意した音声トラックに口の動きが合うように顔を動かす技術です。静止したポートレートや無音のクリップを、あなたの言葉を話しているように見せられます。
これは動画生成とは別の機能です。モデルは音声の波形を条件として、フレームごとに口の形を動かします。リップシンクを提供するツールは、一般に顔と音声ファイルを受け取り、新しいクリップを返します。
ショットの中でセリフを生成するのは、まったく別のものです。その場合、エンジンはプロンプトから(一部のエンジンではボイスサンプルも使って)演技と音声を一緒に作り出し、あなたが用意したトラックに合わせるわけではありません。
eroqでは
eroqにリップシンクのツールはありません。サウンドに対応したエンジンなら、クリップの一部としてセリフを生成できます(Veo 3.1はセリフを生成し、SeedanceとHailuo 3ではキャラクターのボイスサンプルも一緒に送られます)。ただし、既存のクリップに別の音声トラックを重ねて口の動きを合わせることはできません。ボイススタジオで作ったナレーションは、お使いの編集ソフトで映像に重ねてください。
よくある質問
eroqでキャラクターに台本を話させることはできますか?
口の動きを合わせる形ではできません。ボイススタジオで台本から音声を生成し、映像は別に生成して、編集ソフトで組み合わせることはできますが、顔の動きは同期しません。
Veo 3.1はセリフを実際にどう扱いますか?
プロンプトをもとに、声も含めてショットの一部としてセリフを生成します。声は選べず、音声を渡すこともできないので、台本どおりのナレーションよりも、ちょっとした会話に向いています。
リップシンクの対応予定はありますか?
ロードマップの約束は公表していません。現時点で言えるのは、これに対応するエンドポイントもスタジオの機能もない、ということです。