新規登録でプレミアムプランが割引に割引を受け取る

ブログ/tutorials·2026年9月8日·2分·執筆:eroqチーム

AIボイスクローンガイド:自分の声をクローンしてキャラクターに話させる

eroqのスタジオで自分の声をクローンし、キャラクターに使う方法。クリアな録音のコツ、Voice OneとVoice Turboの違い、読み方を形づくる句読点の使い方を解説します。


クローンボイスがあると、「AIが自分の台本を読む」が「スタジオを予約しなくても、自分で台本を読める」に変わります。キャラクターたちに、100行にわたってぶれない声を与えるいちばんの近道でもあります。このガイドでは、eroqのボイスツールでの実践的な使い方を紹介します。何を録音するか、どうアップロードするか、どのモデルでレンダリングするか、そしてエンジンがただ読み上げるのではなく「演じる」テキストの書き方です。

まず、誰の声か

あなた自身の声か、使用について明確な許可を得た声です。実在する特定可能な人物(有名人、元恋人、配信者など)の声を同意なしにクローンすることは利用ポリシーで禁止されており、アカウント単位で対処されます。つまり、消えるのはクリップだけでなく、アカウントそのものです。このプラットフォームはフィクションと創作のためのものです。ナレーター、キャラクター、広告の読み上げ。クローンボイスは、そうした仕事のためにあります。

エンジンが学習できるサンプルを録音する

ボイスクローンは、聞こえたものをそのままコピーします。意図せず入り込んだものも含めてです。以下のコツは、楽観的な見通しではなく、エンジンの実際の挙動に即したものです。

  • 静かな部屋で、音楽なし、残響なし。 布製の家具は反響を吸収します。キッチンより、コートがぎっしり詰まったクローゼットのほうが優れたブースになります。背景のハム音は、声の一部になってしまいます。
  • マイクは1本、距離は一定。 テイクの最初から最後まで、口とマイクの距離を同じに保ちましょう。近づいたり離れたりすると、2つの別の声として読み取られます。
  • クローンしてほしい話し方で話す。 落ち着いたナレーション用なら、落ち着いたナレーションを録音します。辛辣なキャラクター用なら、棘のあるセリフをいくつか入れましょう。エンジンがクローンするのは声色だけでなく、話しぶりそのものです。
  • 文に変化をつける。 疑問文、平叙文、列挙、ちょっとした脇台詞。平板で単調な文章からは、平板なクローンしか生まれません。
  • 加工しない。 コンプレッサーもノイズゲートも不要です。生のファイルのほうが良い素材になります。
  • 無音部分をカットする。 冒頭と末尾の長い沈黙は、無駄な素材です。

ファイルはボイスツールからアップロードします。クローンは標準ボイス(温かく親密な女性の声のAria、低く落ち着いた男性の声のOrion)と並んで表示され、2つの音声合成モデルのどちらでも使えます。

Voice OneかVoice Turboか

音声をレンダリングするモデルは2つあり、どちらも同じ標準ボイスと同じクローンを使えます。

  • Voice Oneは、表現力に優れたフラッグシップモデルです。100文字あたり3クレジットで、MP3で出力されます。キャラクターのセリフ、オーディオブックのナレーション、ワンシーンなど、感情を込めたいものすべてに使いましょう。
  • Voice Turboはより高速で、100文字あたり2クレジットです。下書き、長く抑揚の少ない読み上げ、UIの文言、そしてVoice Oneで仕上げる前の台本の試行錯誤に使いましょう。

どちらも無料枠で使えるので、選ぶ基準は利用できるかどうかではなく、読みの表現と速度です。1,000文字のモノローグなら、Voice Oneで30クレジット、Turboで20クレジット。差は小さいので、正直なところルールは「試行錯誤はTurbo、仕上げはOne」です。

耳のために書く:句読点は演出指示

音声エンジンは、句読点を読み方の指示として解釈します。覚えるべき専用のマークアップはなく、台本そのものが演出になります。演じてもらうことを前提に書いた、完全な例を見てみましょう。

戻ってきたんだ。来ないと思ってた……前のことがあったあとじゃ。座って――いや、本当に、座って。ドアに気づかれるまで、たぶん10分しかない。その時間を、そこに突っ立ってるあなたを眺めて使うつもりはない。それで。何を見たのか話して。

それぞれの記号の働きは次のとおりです。

  • 句点(。)は思考を締めくくり、音程を下げます。短い文は決然と聞こえます。
  • 読点(、)は短い息継ぎです。多すぎると歌うような節回しになるので、声に出して読んだときに間を置かない箇所では削りましょう。
  • 三点リーダー(……)は語尾を消え入らせ、テンポを落とします。1段落に1つまでにしましょう。多用すると、何もかもに自信がなさそうな声になります。
  • ダッシュ(――)は流れを断ち切ります。文の途中での心変わりや、言い直しに使います。
  • 疑問符(?)は語尾を上げます。感嘆符(!)は勢いを加えますが、控えめに使いましょう。多用すると、すべてが叫び声になります。
  • 一語だけの文(「それで。」)は、ひと呼吸の間として効きます。監督が指示する「間」に最も近いものです。

レンダリングの前に、一度台本を声に出して読んでみましょう。あなたがつまずく箇所では、エンジンもつまずきます。100文字あたり3クレジットなら、文を直してレンダリングし直しても十分に安く済みます。

速度と表現力

モデルの選択欄の隣に、2つのコントロールがあります。

  • 速度:オーディオブックのナレーションなど、聞き手が内容を追う必要があるものは遅めに。広告の読み上げやメッセージ風のセリフは速めにします。
  • 表現力:低くすると読みが均一になり、サンプルに近いまま保たれます。ドキュメンタリーのナレーション向きです。高くすると、エンジンが句読点をより大胆に解釈します。キャラクターやドラマ向きです。

調整は1つずつ行いましょう。クローンが自分の声らしく聞こえなくなったら、まず表現力を下げ、次に速度を見直します。サンプルが基準点であり、どちらのコントロールもそこから離れる方向に働くからです。

キャラクターに声を与える

キャラクターには、名前、ペルソナ、参照写真、そしてボイスがあります。そのボイスに、自分のクローンを設定できます。一度設定すれば、そのキャラクター用に生成するセリフはすべてその声になります。ボイスツールにはキャストが一覧表示されるので、どのクローンが誰のものだったかを覚えておかなくても、「Mara」を選ぶだけです。テキストツールと組み合わせましょう。RP+でシーンを書き、セリフを貼り付けて彼女の声でレンダリングし、MP3をダウンロードして、編集ソフトでクリップの下に敷きます。文章の朗読ではなく、人が話しているように聞こえるセリフの書き方は、AIキャラクターのためのTTSで詳しく解説しています。

開発者は、同じボイスをAPIから利用できます。audio/speechとvoices(クローン作成を含む)は音声のドキュメントにあります。eroq CLIなら、eroq speech "Tell me what you saw." -v ariaのように、1つのコマンドでセリフをレンダリングできます。

よくある質問

本人が承諾していれば、他人の声をクローンできますか?

条件は同意であり、それは本物でなければなりません。自分の声や、使用について明確な許可を得た声なら問題ありません。実在の人物を同意なしにクローンした場合は、アカウント単位の利用停止となります。

クローンは両方の音声モデルで使えますか?

はい。Voice OneとVoice Turboは、同じ標準ボイスと同じクローンを共有しています。違いは表現力と価格で、100文字あたり3クレジットと2クレジットです。

声に間を取らせるにはどうすればいいですか?

句読点を使います。句点はしっかりとした区切り、読点は息継ぎ、三点リーダーは消え入る余韻、一語だけの文はひと呼吸の間になります。間を指定する専用のタグはありません。

自分の声を聞いてみませんか?ボイスツールを開きましょう。最初の50クレジットは無料で、どちらの音声モデルも無料枠で使えます。

タグvoice-cloningtext-to-speechvoicecharacterstutorial

この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。