新規登録でプレミアムプランが割引に割引を受け取る

ブログ/models·2026年8月24日·2分·執筆:eroqチーム

ロールプレイに専用のモデルチューニングが必要な理由

キャラクターのブレ、繰り返しのループ、学習しすぎた決まり文句。汎用アシスタントにロールプレイをさせると何が壊れるのか、それを直す方法を解説します。


汎用のアシスタントにロールプレイのシーンを任せると、ベンチマークには決して表れない形で失敗します。キャラクターが激怒しているのに、礼儀正しいまま。役になりきらずに、要約してしまう。40メッセージを過ぎると、どの返信も同じ3語で始まる。そして、少しでも緊迫した気配があると、シーンから抜け出して、自分はAIだと皆に念を押すのです。

どれも能力の問題ではありません。チューニングの問題です。RP+が生まれたのは、私たちがキャラクター製品を長く運営し、失敗のパターンを洗い出して、ひとつずつ直してきたからです。以下がそのリストです。

失敗1:繰り返しのループ

小〜中規模のモデルは、ループに陥りがちです。お気に入りのフレーズが現れると、それがコンテキストにあること自体によって強化され、30メッセージ目にはキャラクターが「にやりと笑って」を11回も口にしています。

解決策はパラメーターを増やすことではなく、サンプリングの規律です。ゆるめの頻度ペナルティ(frequency penalty)は、会話ログにすでにあるトークンを出にくくします。存在ペナルティ(presence penalty)は、同じテーマを蒸し返すのを抑えます。正確な値が重要で、しかもモデルファミリーごとに違います。高すぎると文章がおかしくなり、低すぎるとループが勝ちます。私たちはファミリーごとのペナルティ設定を用意し、モデルのバージョンが変わるたびに測定し直しています。トークン単位で課金するAPIではこれは見えない部分ですが、eroqのAPIでは、eroq-rp-plusが当たり前にやっていることです。

失敗2:学習しすぎた決まり文句

強力なモデルでも、temperatureが高いと、学習で染みついた決まり文句に頼りがちです。いわゆる「oh honey…」問題です。ロールプレイは高めの設定で動かすもの(temperature 0.8以上が普通で、平板さは命取り)なので、決まり文句への圧力は常にかかっています。

直感に反しますが、強力なモデルへの答えは、ペナルティをなくすことではなくゆるめることです。決まり文句には効くけれど、キャラクターの声は歪めない程度に。そうすれば、temperatureはロールプレイに必要な高さのままにできます。

失敗3:キャラクターのブレ

システムプロンプトに書いたキャラクターシートは、会話が長くなるにつれて効き目が薄れていきます。会話ログの重みがシートを上回り、モデルは汎用アシスタントのような平均的な振る舞いに寄っていきます。

キャラクターを保つのは、次の3つです。

  1. システムプロンプトが担うのは、内容ではなく振る舞い。 「キャラクターを保つ、メタな解説は絶対に加えない、行動はアスタリスクで囲む」。振る舞いの指示は、何段落もの背景設定よりずっと、コンテキストの増加に耐えます。
  2. 履歴は全部より、ウィンドウで。 ある閾値を超えると、古いターンは記憶を増やすより速くブレを増やします。直近のウィンドウだけを送り、長期的な事実は自分のストアに保存して、重要なものを差し込み直しましょう。
  3. 第四の壁を破らせない。 コンテキストの中で「AIとして…」というターンを一度でも見たモデルは、それをさらに生み出します。送る履歴から取り除いておきましょう。

eroqのAPIは、設計上ステートレスです。見せたい履歴は、あなたが送ります。手抜きではありません。ブレをあなた自身がコントロールできる、唯一のアーキテクチャなのです。

失敗4:拒否の壁

キャラクター製品は、汎用APIが口にしない壁にぶつかります。悪役の脅し、死の場面といった最初のダークな展開で、モデルがシーンを壊して説教を始めるのです。ユーザーはこれを安全性とは受け取りません。物語の途中でキャラクターが死んでしまった、と感じるのです。

私たちのエンジンは、ダークで激しい展開も含め、フィクションを検閲なしで描けるように選ばれています。越えてはならない一線は、ポリシーの層で守られています(未成年者が関わるものは一切なし、実在の人物へのなりすましなし、違法なコンテンツなし。利用ポリシー(AUP)は短く、例外はありません)。壁をどこに置くかを決めるのは、製品としての判断です。それをモデルの限界だと偽るのは、そうではありません。

組み込みで押さえるポイント

  • 振る舞いを中心にしたシステムプロンプトを送りましょう。世界設定は自分のストアに保存し、必要なものだけを差し込みます。
  • 調整する前に、まずデフォルトのtemperature(0.8)を信頼してください。ロールプレイが生きる値に設定されています。
  • 履歴は20〜40ターン程度のウィンドウにして、それより前は要約しましょう。
  • 量はeroq-rp-miniに任せ、表現の質感が大事なシーンではeroq-rp-plusに切り替えましょう。APIの形は同じで、料金は1クレジット対3クレジットです。振り分けのルールを組む前に、テキストスタジオで両方の語り口を並べて聞き比べてみる価値があります。

よくある質問

ロールプレイにはどのtemperatureを使えばよいですか?

0.8から始めてください。RP+がチューニングされている値で、ロールプレイの文章がループせずに質感を保てる値です。パラメーターは0〜1.5を受け付けますが、どのモデルでも、チューニングされた値から大きく離すと、まさにそこで繰り返しが始まります。一度に変えるのはひとつだけにして、設定ではなく会話ログを読みましょう。

AIキャラクターが同じフレーズを繰り返すのはなぜですか?

お気に入りのフレーズがコンテキストにあると、次のターンでもそれが出やすくなり、それがまたコンテキストに入るからです。解決策はサンプリングの規律です。会話ログにすでにあるトークンを出にくくするゆるめの頻度ペナルティと、同じテーマの蒸し返しを抑える存在ペナルティ。さらに履歴をウィンドウで区切って、ループが自分自身を養い続けないようにします。

キャラクターのブレを防ぐにはどうすればよいですか?

システムプロンプトには経歴ではなく振る舞いを書き、キャラクターシートは会話ログの外、contextフィールドに置きます。履歴はすべてではなく20〜40ターンのウィンドウで送り、モデルがキャラクターを崩したターンは、履歴を送り返す前に取り除きましょう。コンテキストの中で一度でも「AIとして」というターンを見たモデルは、それをさらに生み出します。

RP+とRP miniの違いは何ですか?

価格と、どれだけ長く持ちこたえるかです。RP miniは応答1回あたり1クレジットで、短いやり取りなら区別がつきません。RP+は3クレジットで、長いシーンの奥深くまでキャラクターを保てるようにチューニングされています。どちらもポリシーの範囲内で検閲なし、どちらもストリーミングに対応し、どちらも画像の添付を+2クレジットで受け付けます。

耳の痛いまとめをしておきます。ロールプレイは、アシスタント業務の縮小版ではありません。まったく別の目標であり、一方に合わせてチューニングしたモデルは、もう一方を外します。私たちがチューニングしたのは、こちらです。

タグroleplaymodel tuningrp plus

この記事で使ったモデルで作ってみましょう。無料の50クレジットで始めるか、全エンジンと料金をご覧ください。