新規登録でプレミアムプランが割引に割引を受け取る

ブログ/guides·2026年9月2日·2分·執筆:eroqチーム

AIボイスクローンの音声サンプルは何秒必要?

30秒〜3分という目安、部屋、マイクとの距離、クローンに表現の幅を持たせる読み上げ原稿、そしてサンプルを知らぬ間に台無しにする4つの習慣を解説します。


ボイスクローンについての疑問は、最終的にはすべてサンプルについての疑問になります。サンプルこそがクローンだからです。エンジンは、調子の良い日のあなたの声がどんなものかを知りません。知っているのは、あなたが渡した90秒だけです。隣の部屋の冷蔵庫の音も含めて。ここでは、何をどれだけ録音すべきか、そしてせっかくの良いテイクを知らぬ間に台無しにするいくつかの習慣を紹介します。

目安の範囲と、それが範囲である理由

ボイススタジオのクローン用フォームには、はっきりとこう書かれています。途切れのない自然な話し声で30秒〜3分。クリップをつなぎ合わせた30秒ではなく、あなたが実際に話している30秒です。

30秒未満だと、エンジンが聞いたのは1つの話し方のリズムと1つの音域だけなので、まさにそれだけを延々と再現し続けます。3分を超えると、すでに学習した内容を上乗せしているにすぎず、ファイルの中で何かがうまくいかない確率(咳、スマートフォンの振動音、マイクから離れてしまった一文など)が、1分増えるごとに高くなります。

目安のもう半分は、数字よりも重要です。それは長さよりクリアさです。ノイズのない1分は、ノイズの多い10分に勝ります。ハム音の入った3分のテイクと、ハム音のない50秒のテイクがあるなら、50秒のほうをアップロードしてください。

マイクより部屋のほうが重要

ボイスクローンは聞こえたものをそのままコピーし、「その部分は部屋の響きだった」という概念を持ちません。残響はあなたの声質の一部として学習されます。キッチンで録音したクローンが、ずっとキッチンにいるような声になるのはそのためです。

  • まずは明らかな騒音源を止めましょう。エアコン、扇風機、冷蔵庫、通りに面した開いた窓などです。
  • やわらかいものに囲まれた場所で録音しましょう。カーテン、ベッド、ソファ、コートでいっぱいのクローゼットなど。反響を生むのは、向かい合った硬い面です。
  • スマートフォンは機内モードにしましょう。机を伝わる通知の振動音は、部屋で聞いたときよりも録音のほうが大きく入ります。

話者は1人、距離は一定に

この点もフォームにはっきり書かれています。1人の声だけで、ほかの人の声や聞き手の声は入れないこと。そして、部屋の響きが聞こえなくなるくらいマイクを近づけることです。

距離を決めたら、テイクの最後までその距離を保ちます。親密なセリフでは近づき、大きな声では離れるというのは、ライブの朗読なら良いマイクテクニックですが、クローン用の入力としては最悪です。エンジンには2つの異なる声に聞こえ、それを平均してしまうからです。破裂音がカプセルに直撃せずに逸れるよう、マイクの軸から少し角度をずらしましょう。

幅のある原稿を読む

ここはほとんどの人が飛ばしてしまう部分ですが、演技ができるクローンと、アナウンスしかできないクローンの差はここで生まれます。エンジンがクローンするのは、声質だけでなく話しぶりです。平坦な段落を1つ読めば、平坦な声が1つできあがります。

平叙文、疑問文、列挙、静かな一言、鋭い一言を入れましょう。以下は、それらすべてを約90秒でカバーする原稿です。普段どおりのペースで読み、演技はしないでください。

よし、ちゃんとやろう。私の名前はマラ。これはボイスクローン用のサンプルで、声に出して言うとなんだか不思議な文章だね。

まずは普通の文から。やかんは10分前に沸いたのに、まだ誰もお茶を淹れていない。

次は質問。それで本当にうまくいくと思ってる?

リストを、私が実際にリストを読むときの読み方で。鍵、財布、充電器、それからいつも忘れるあのひとつ。

ここからは静かなセリフ。あんなふうに言うつもりじゃなかった。それでも言うよ。

そして鋭いセリフ。だめ。そんな約束じゃなかったでしょ。わかってるくせに。

最後のひと言で締めくくろう。急がずに、眠りに落ちかけている誰かに、章の終わりを読んで聞かせるように。

名前は入れ替えて、構成はそのまま使ってください。クローンの用途が1つに決まっているなら(落ち着いたナレーション、広告の読み上げ、毒のあるキャラクターなど)、原稿をその用途に寄せても構いません。ただし、声が動けることをクローンが理解できるよう、対照的なセリフを少なくとも1行は残しておきましょう。

サンプルを台無しにする4つの習慣

  1. 声の下に音楽や環境音が流れている。 後から分離する方法はありません。BGMはクローンの一部になってしまいます。
  2. エフェクト処理。 コンプレッサー、ノイズゲート、ディエッサー、録音アプリの「enhance voice(音声補正)」スイッチは、どれもエンジンが必要としていた情報を削ってしまいます。磨き上げた音より、生の音のほうが良い入力です。
  3. 3分間ずっと同じ感情。 平坦な入力からは、平坦な出力しか生まれません。
  4. 前後の無音。 最初の言葉の前と、最後の言葉の後の無音はカットしましょう。害はありませんが、単に枠の無駄遣いです。

アップロードと、その後の流れ

クローン用フォームはMP3、WAV、M4A、FLAC、MP4、MOV、WEBM、WEBA、OPUS、MIDに対応しており、最大20サンプル、合計1 GBまでアップロードできます。目安として推奨される量よりも、はるかに余裕があります。クローンには、半年後に見ても何かわかる名前を付けましょう(「テスト3」より「マラ — ナレーション」)。

クローン自体は無料で、その場で完了します。クローンはボイスライブラリに、プリセットボイスのAriaやOrionと並んで追加され、両方の音声モデルで使えます。費用がかかるのは、それを使ってレンダリングする音声のほうです。Voice Oneでは100文字あたり3クレジット、Voice Turboでは2クレジットです。

信頼する前に試聴する

プロジェクトに使う前に、同じセリフを両方のモデルでレンダリングしてみましょう。きれいな一文よりも、間、疑問、ぴたりと止まる終わりを含んだセリフのほうが多くを教えてくれます。

I waited. Two hours, in the rain, for that? No — don't explain. Just tell me one true thing and I'll go.

(訳:待ったんだ。雨の中、2時間も。それなのに? いや、説明はいらない。本当のことをひとつだけ言って。そうしたら行くから。)

この英文のセリフは104文字で、課金は開始された100文字単位のブロックで数えます。つまり2ブロック分で、Voice Oneなら6クレジット、Turboなら4クレジットです。他人のような声で返ってきたら、直すべきはほぼ確実に設定ではなくサンプルです。もっとやわらかい部屋で、もっと近くで、もっと変化をつけて録り直し、もう一度クローンしましょう。ワークフローの残りはボイスクローンガイドで、最終版をどちらのモデルでレンダリングすべきかはVoice OneとVoice Turboの比較で解説しています。

よくある質問

音声サンプルは長いほど良いのですか?

いいえ。目安は30秒〜3分で、その範囲内では長さよりクリアさが勝ります。ノイズのない1分は、ノイズの多い10分に勝ります。1分増えるごとに、咳やハム音、マイクから離れてしまった一文を録音してしまう機会が増えるからです。

短い録音をいくつか組み合わせて1つのクローンにできますか?

サンプルは最大20個までアップロードできますが、短いクリップをたくさん集めるより、途切れのない自然な話し声のほうが効果的です。クリップが異なる部屋や異なる距離で録音されていると、エンジンには一貫性のない声に聞こえ、それを平均してしまいます。途切れずに読み通した1本のほうが、良い入力になります。

スマートフォンをクローン用のマイクとして使えますか?

はい、マイクとして扱うなら使えます。一定の距離で構え、やわらかい部屋で録音し、録音アプリの「enhance voice(音声補正)」のような処理はオフにして、スピーカーフォンや車内での録音は避けましょう。クローゼットの中のスマートフォンは、キッチンの高性能マイクに勝ります。

クローンが自分の声に聞こえない場合は?

スライダーに手を伸ばすより、録り直しましょう。速度や表現力の設定は読み方をサンプルから遠ざけるものなので、声の本人らしさが違っている場合には直せません。本当の解決策は、もっと近く、もっと静かに、もっと変化をつけて録ったサンプルです。

録音の準備はできましたか?ボイススタジオを開いてボイスライブラリからクローンし、最初のクレジットは原稿全体ではなく、試聴用のセリフに使いましょう。

タグvoice-cloningrecordingtext-to-speechvoice

この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。