新規登録でプレミアムプランが割引に割引を受け取る

ブログ/tutorials·2026年9月11日·2分·執筆:eroqチーム

句読点で声を演出する:eroqにSSMLはありません

6組の修正前・修正後のセリフで、各記号が読み方をどう変えるかを解説。句読点にできないこと、Voice Oneの角かっこタグが担う部分、速度と表現力の使いどころも紹介します。


eroqにはSSMLがありません。<break time="400ms"/>も、韻律のマークアップも、強調タグも、音素の上書きもありません。演出に使う言語は、すでに知っている句読点と2つのダイヤル。そしてVoice Oneでは、句読点では言い表せないことのために、角かっこで囲んだ短い普通の言葉が少しだけ使えます。たいていの人は制約だと思ってやって来て、句読点をひとつの技術として扱うようになって帰っていきます。人が読んで演技として成立する台本は、エンジンが読んでも演技として成立するからです。タグはあくまで仕上げで、骨組みにはなりません。

ここからは、読み方を変える6つの記号を、それぞれ2回ずつ見ていきます。

6つの記号、6つの役割

三点リーダーは間を保つ

修正前:もっと近くに来て、まだ話は終わってないんだから。

修正後:もっと近くに来て……まだ話は終わってないんだから。

読点は息継ぎです。三点リーダーは、宙に浮いたように間を残します。前後の言葉まで遅くなるので、1段落に1つが限度です。どの文でも語尾を消え入らせる声は、すべての文に自信がなさそうに聞こえます。

ダッシュは拍を断ち切る

修正前:待つつもりだったけど、待つ理由なんてある?

修正後:待つつもりだった――でも、待つ理由なんてある?

読点は2つの節をつなぎ、ダッシュは節を断ち切ります。文の途中での心変わり、言い直し、遅れてやってきて前の考えを押しのける思いつきに使いましょう。

疑問符で語尾を上げる

修正前:あなたのことを忘れたって本気で思ってたんだ。

修正後:本気で忘れたと思ってた? あなたのことを?

疑問文が1つなら、語尾で1回上がります。疑問文を2つ重ねれば2回上がり、短い断片は2回目の上がり調子をまるごと独り占めします。文を疑問文と断片に分けるのは、どのダイヤルにもない「態度」を加える、いちばん安上がりな方法です。

感嘆符でエネルギーを跳ね上げる

修正前:そこで止まって。完璧、そのままでいて。

修正後:そこで止まって! 完璧――そのままでいて。

音量とペースが一段上がります。使いどころを絞るべき理由は、好みではなく算数です。3文続けて叫べば、どれも叫んでいないのと同じになり、そのセリフは反応ではなく、ただの口調として聞こえてしまいます。

文の長さでペースを操る

修正前:ゆっくりして、深呼吸して、それからちゃんと始めよう。

修正後:ゆっくり。深呼吸。いいね――さあ、始めよう。

短い文は歯切れよく読まれます。句点のたびに、声がしっかり着地しなければならないからです。読点でつないだ長い文は、流れるように読まれます。これはリストの中で最も効果の大きいレバーなのに、書き手が最後に手を伸ばすレバーでもあります。記号を足すのではなく、書き直すことになるからです。

読点で挟んだ言葉は際立つ

修正前:それがまさに問題なんだよ。

修正後:それが、まさにそこが、問題なんだよ。

フレーズを読点で区切って独立させると、読み方がそこに重心を置きます。単語ごとの強調にいちばん近い方法で、タグと違って人が声に出して読んでも成立するので、クレジットを使わずに試せます。

6つすべてが、ボイススタジオの「話し方の構文」ガイドに入っています。1つをタップすると例文がエディターに入るので、私の言葉を鵜呑みにせず、実際に違いを聴いてみてください。

改行と段落

句点は文を止めます。段落の区切りは考えと考えを分け、読み上げでは2つのうち大きいほうの間として扱われます。区切る場所は、ページの見た目が整うところではなく、読む人が実際に息を継ぐところ、たとえば前振りとオチのあいだにしましょう。6文が詰まった壁のような段落は、壁のように読み上げられます。

句読点にできないこと

午後をまるごと費やして試す前に、知っておく価値があります。

  • 時間を指定した間はない。400ミリ秒の間を頼むことはできません。映像のカットに合わせた拍や効果音のための隙間など、間を正確にしたい場合は、前後2つに分けてレンダリングし、編集ソフトで配置してください。
  • 強調タグはない。使える道具は、フレーズを読点で挟むか、大事な言葉が短い文の最後に来るように書き直すことです。
  • 気分を表す記号はない。どんな句読点でも、声をささやかせたり、笑わせたり、すすり泣かせたりはできません。それは、次に紹介するタグに残された唯一の仕事です。
  • 発音の上書きはない。読み間違えられる略語や珍しい名前は、音素タグではなく、聞こえるとおりに書いて直します。「SQL」なら「エス・キュー・エル」、「Kessler」なら「ケスラー」、読み間違えやすい漢字の名前ならひらがなで書く、といった具合です。

句読点では言えないことのためのタグ

Voice Oneでは、角かっこで囲んだ1〜2語が読み方を演出し、ボイスはその言葉を読み上げずに演じます。

[whispering] もっと近くに来て。話したいことがあるの。

[laughing] わかった、わかった――降参。

ほぼすべてをカバーするのが、次の3系統です。

  • 話し方と感情:[whispering]、[shouting]、[soft]、[excited]、[sad]、[angry]のほか、[warm and teasing](温かく、からかうように)のような短い描写なら何でも使えます。話し方のタグは次のタグか次の改行まで続くので、[whispering]を1つ置けば段落全体に効きます。
  • 声の効果音:[laughing]、[sighing]、[gasping]、[clear throat]。置いた場所で1回だけ鳴ります。
  • 間:[pause]と[long pause]は、三点リーダーと同じように一拍として入ります。ただし、これも計測された間ではありません。

タグを確実に効かせるための習慣が2つあります。タグは、色をつけたい言葉の直前に置くこと。そして、ボイスに与える気分は一度に1つにすること。[sad][whispering]は自然に重なりますが、[whispering][shouting]は正反対の方向に同時に引っ張ります。タグにはVoice Oneが必要です。Turboは言葉だけを読み、角かっこは飛ばします。

そして2つのダイヤル

句読点が演技の形を作り、ダイヤルはその演技が行われる音域を決めます。

速度は0.70×から1.30×まで0.05刻みで、1が自然な速さです。表現力は0(落ち着いた、抑えめの読み)から100%(芝居がかった読み)まであり、あなたが書いた句読点にエンジンがどれだけ強く乗るかを左右します。どちらも標準のボイスと自分のクローンボイスでまったく同じように働き、後処理ではなく、エンジンの本物のパラメーターです。

うまくいく組み合わせを3つ紹介します。

  • オーディオブックのナレーション:速度0.95、表現力30%。均一で、急がず、テキストに余計な解釈を加えません。
  • キャラクターのセリフ:速度1.00、表現力70%。演技は記号がこなし、ダイヤルはそれを許すだけです。
  • 広告の読み上げ:速度1.10、表現力55%。前のめりでありながら、戯画にはなりません。

調整は1つずつ行いましょう。クローンボイスが本人らしく聞こえなくなったら、速度に手を付ける前に表現力を下げてください。サンプルが錨で、2つのダイヤルはどちらもそこから引き離す方向に働きます。

段落ひとつの修正前と修正後

修正前

前回あんなことがあったのに本当に戻ってくるなんて信じられないし、正直なんて言えばいいのかわからないから、誰かにドアが開いてるって気づかれる前に、座って何を見たのか話してくれたほうがいいかもしれない。

修正後

戻ってきたんだ。来ないと思ってた……前回のことがあったから。

座って――ううん、本当に、座って。ドアに気づかれるまで、たぶん10分しかない。

それで。何を見たか話して。

情報は同じで、4秒長くなるだけですが、ひとつの段落ではなく、ひとりの人間として聞こえます。タグは1つも使っていません。変えたのは、句点5つ、三点リーダー1つ、ダッシュ1つ、そして段落の区切りだけです。

安いモデルで試行錯誤する

句読点の書き直しは繰り返しの作業で、繰り返しは安く済ませるべきです。下書きは100文字あたり2クレジットのVoice Turboで、本番は3クレジットのVoice Oneで。ボイスもクローンも同じで、出力も同じMP3です。200文字のセリフなら、Voice Oneで6クレジット、Turboで4クレジットなので、手強い1文を12回やり直しても、コーヒー1杯より安く済みます。例外はタグ付きのセリフです。Turboはタグを飛ばすので、タグ付きのセリフはVoice Oneで試聴してください。追加のクレジットがどこで効いてくるかは、Voice OneとVoice Turboの比較で解説しています。

APIでは、同じ2つのダイヤルがPOST /v1/audio/speechのspeedとexpressivenessにあたり、音声合成のリファレンスに記載されています。入力テキストがそのまま演出になるのは、スタジオとまったく同じです。結果を映像に重ねる方法は、動画用のAIボイスオーバーがこの続きを引き継ぎます。

よくある質問

eroqはSSMLやボイスタグに対応していますか?

SSMLには対応していません。長さを指定するbreakタグも、韻律のマークアップもありません。ただし、Voice Oneは[whispering]、[laughing]、[pause]のような角かっこで囲んだ短いタグを読み取り、読み上げずに演じます。Turboはタグを飛ばします。それ以外は、句読点、文の構造、速度と表現力の設定が担います。

正確な長さの間を入れるには?

指定はできません。三点リーダーは宙に浮くような間を、段落の区切りはより大きな間を生みますが、どちらも計測された長さではありません。間を特定のフレームに合わせる必要がある場合は、前後を別々のセリフとしてレンダリングし、自分の編集ソフトのタイムラインに配置してください。

何を設定しても、セリフが平板に聞こえるのはなぜですか?

ほとんどの場合、文章が平板だからです。句点がなく読点でつながる長い文では、エンジンが着地する場所がありません。平板な台本のまま表現力を上げても、力んだ単調な読みになるだけです。まず短い文に分けてから、もう一度レンダリングしてください。

クローンボイスでも、これらの記号は同じように効きますか?

効きます。句読点、速度、表現力は、標準のボイスでもクローンボイスでもまったく同じように働きます。クローンが声色と話しぶりを、台本が演技を担うからです。表現力を高くしたときにクローンが本人らしく聞こえなくなったら、文章ではなくダイヤルのほうを下げてください。

6つのセリフは、読むより聴くのがいちばんです。ボイススタジオを開いて「話し方の構文」を表示し、1つずつタップしてエディターに入れてみてください。

タグtext-to-speechvoicewritingdeliverytutorial

この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。