Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/models·24. Aug. 2026·4 Min.·vom eroq-Team

Warum Rollenspiel ein eigenes Modell-Tuning braucht

Persona-Drift, Wiederholungsschleifen und antrainierte Füllphrasen: was kaputtgeht, wenn ein Allzweck-Assistent Rollenspiel macht – und was dagegen hilft.


Setz einen Allzweck-Assistenten auf eine Rollenspielszene an, und er scheitert auf eine Weise, die kein Benchmark je zeigt. Er bleibt höflich, wenn die Figur vor Wut kocht. Er fasst zusammen, statt die Rolle zu verkörpern. Nach vierzig Nachrichten beginnt er jede Antwort mit denselben drei Wörtern. Und beim ersten Anflug von Intensität tritt er aus der Szene heraus, um alle daran zu erinnern, dass er eine KI ist.

Nichts davon ist ein Fähigkeitsproblem. Es ist ein Tuning-Problem. RP+ gibt es, weil wir Charakter-Produkte lange genug betrieben haben, um die Fehlermuster zu katalogisieren und eins nach dem anderen zu beheben. Hier ist der Katalog.

Fehler 1: Wiederholungsschleifen

Kleine und mittelgroße Modelle geraten in Schleifen: Eine Lieblingsphrase taucht auf, wird durch ihre eigene Präsenz im Kontext verstärkt, und bei Nachricht 30 hat die Figur elfmal „mit einem süffisanten Grinsen“ gesagt.

Die Lösung sind nicht mehr Parameter, sondern Sampling-Disziplin. Eine milde Frequency Penalty drückt Tokens nach unten, die das Transkript schon enthält; eine Presence Penalty hält davon ab, dieselben Themen wieder aufzugreifen. Die genauen Werte sind wichtig und unterscheiden sich je nach Modellfamilie – zu hoch, und die Prosa wird seltsam, zu niedrig, und die Schleife gewinnt. Wir liefern Penalty-Profile pro Modellfamilie aus, die wir neu messen, sobald sich eine Modellversion ändert. In einer API, die pro Token abrechnet, ist das unsichtbar; in unserer ist es einfach das, was eroq-rp-plus tut.

Fehler 2: antrainierte Füllphrasen

Selbst starke Modelle greifen bei hoher Temperatur auf antrainierte Füllphrasen zurück – das „Ach, Schätzchen…“-Problem. Rollenspiel läuft heiß (Temperatur 0,8+ ist normal, Flachheit ist der Tod), also ist der Druck zu Füllphrasen konstant.

Entgegen der Intuition ist die Antwort bei starken Modellen eine mildere Penalty statt gar keiner: genug, um die Füllphrasen zu verteuern, nicht genug, um die Stimme zu verzerren. Dann bleibt die Temperatur hoch, wo Rollenspiel sie braucht.

Fehler 3: Persona-Drift

Ein Charakterbogen im Systemprompt verblasst, während das Gespräch wächst: Das Transkript wiegt schwerer als der Bogen, und das Modell nähert sich im Schnitt dem Verhalten eines generischen Assistenten an.

Drei Dinge halten eine Persona stabil:

  1. Der Systemprompt regelt das Verhalten, nicht den Inhalt. „Bleib in der Rolle, keine Meta-Kommentare, Handlungen in Sternchen“ – Verhaltensregeln überstehen wachsenden Kontext viel besser als absatzlange Hintergrundgeschichten.
  2. Ein Verlaufsfenster schlägt den kompletten Verlauf. Ab einer gewissen Schwelle bringen ältere Runden schneller Drift als Erinnerung. Schick ein Fenster, bewahre langfristige Fakten in deinem eigenen Speicher auf und füge das Wichtige gezielt wieder ein.
  3. Keine Durchbrüche der vierten Wand. Ein Modell, das jemals eine „Als KI…“-Runde in seinem Kontext gesehen hat, produziert mehr davon. Filtere sie aus dem Verlauf, den du schickst.

Die eroq-API ist bewusst zustandslos – du schickst den Verlauf, den das Modell sehen soll. Das ist keine Faulheit; es ist die einzige Architektur, mit der du die Drift kontrollierst.

Fehler 4: die Verweigerungsmauer

Charakter-Produkte stoßen auf eine Mauer, die allgemeine APIs nicht beim Namen nennen: Bei der ersten düsteren Wendung – die Drohung eines Bösewichts, eine Todesszene – bricht das Modell die Szene ab und hält einen Vortrag. Nutzer erleben das nicht als Sicherheit; für sie stirbt die Figur mitten in der Geschichte.

Unsere Engines sind so ausgewählt, dass Fiktion unzensiert gerendert wird, düstere und intensive Wendungen eingeschlossen, während die harten Grenzen auf der Richtlinienebene durchgesetzt werden (nichts mit Minderjährigen, keine Imitation realer Personen, keine illegalen Inhalte – die Richtlinie zur zulässigen Nutzung ist kurz und absolut). Zu entscheiden, wo die Mauer steht, ist eine Produktentscheidung; so zu tun, als sei sie eine Grenze des Modells, ist keine.

Was das für deine Integration bedeutet

  • Schick einen Systemprompt, der sich auf Verhalten konzentriert; bewahre die Lore in deinem eigenen Speicher auf und füge sie gezielt ein.
  • Vertrau der Standardtemperatur (0,8), bevor du nachjustierst; sie ist dort eingestellt, wo Rollenspiel lebt.
  • Begrenze deinen Verlauf auf ein Fenster von etwa 20–40 Runden und fasse alles darüber hinaus zusammen.
  • Lass eroq-rp-mini das Volumen tragen und wechsle für Szenen, in denen Textur zählt, zu eroq-rp-plus – gleiche API-Struktur, 1 vs. 3 Credits. Beide Register lohnen sich nebeneinander im Tool „Text“ anzuhören, bevor du eine Routing-Regel verdrahtest.

Häufige Fragen

Welche Temperatur sollte ich für Rollenspiel verwenden?

Fang bei 0,8 an – darauf ist RP+ abgestimmt, und dort hat Rollenspiel-Prosa Textur, ohne in Schleifen zu geraten. Der Parameter akzeptiert 0 bis 1,5, aber genau dort, wo du ein Modell weit von seinem Abstimmungspunkt wegziehst, beginnen die Wiederholungen. Ändere immer nur eine Sache und lies die Transkripte, nicht die Einstellungen.

Warum wiederholt meine KI-Figur ständig dieselben Phrasen?

Weil die Lieblingsphrase im Kontext steht, was sie in der nächsten Runde wahrscheinlicher macht, was sie wieder in den Kontext bringt. Die Lösung ist Sampling-Disziplin – eine milde Frequency Penalty, die Tokens verteuert, die das Transkript schon enthält, eine Presence Penalty gegen das Wiederaufgreifen derselben Themen – plus ein Verlaufsfenster, damit sich die Schleife nicht ständig selbst füttert.

Wie verhindere ich, dass eine Figur aus ihrer Persona driftet?

Schreib Verhalten statt Biografie in den Systemprompt, halte den Charakterbogen im Feld context außerhalb des Transkripts, schick ein Fenster von 20–40 Runden statt allem, und entferne jede Runde, in der das Modell aus der Rolle gefallen ist, bevor du den Verlauf zurückschickst. Ein Modell, das einmal eine „Als KI“-Runde in seinem Kontext gesehen hat, produziert mehr davon.

Was ist der Unterschied zwischen RP+ und RP mini?

Der Preis und wie lange jedes Modell durchhält. RP mini kostet 1 Credit pro Antwort und ist bei kurzen Wechseln nicht vom großen Modell zu unterscheiden; RP+ kostet 3 und ist darauf abgestimmt, eine Persona bis tief in eine lange Szene zu halten. Beide sind im Rahmen der Richtlinie unzensiert, beide streamen, und beide nehmen angehängte Bilder für +2 Credits an.

Die unbequeme Zusammenfassung: Rollenspiel ist keine kleinere Version von Assistenz. Es ist ein anderes Ziel, und ein Modell, das auf das eine abgestimmt ist, verfehlt das andere. Wir haben auf dieses abgestimmt.

Tagsroleplaymodel tuningrp plus

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.