blog/models·24 ago 2026·5 min·por el equipo de eroq
Por qué el rol con IA necesita su propio ajuste de modelo
Deriva del personaje, bucles de repetición y muletillas aprendidas: qué se rompe al usar un asistente generalista para rol y cómo se arregla.
Pon a un asistente de propósito general a hacer una escena de rol y fallará de formas que ningún benchmark muestra. Sigue siendo educado cuando el personaje está furioso. Resume en lugar de habitar la escena. A los cuarenta mensajes, empieza cada respuesta con las mismas tres palabras. Y a la primera señal de intensidad, sale de la escena para recordarle a todo el mundo que es una IA.
Nada de esto es un problema de capacidad. Es un problema de ajuste. RP+ existe porque llevamos productos de personajes el tiempo suficiente como para catalogar los modos de fallo y arreglarlos uno a uno. Este es el catálogo.
Fallo 1: bucles de repetición
Los modelos pequeños y medianos caen en bucles: aparece una frase favorita, se refuerza por su propia presencia en el contexto y, para el mensaje 30, el personaje ya ha dicho «con una sonrisa burlona» once veces.
La solución no son más parámetros, es disciplina de muestreo. Una penalización de frecuencia suave rebaja los tokens que la transcripción ya contiene; una penalización de presencia desalienta volver a abrir los mismos temas. Los valores exactos importan y cambian según la familia del modelo: demasiado altos y la prosa se vuelve rara; demasiado bajos y gana el bucle. Usamos perfiles de penalización por familia que volvemos a medir cada vez que cambia la versión de un modelo. Eso es invisible en una API que cobra por token; en la nuestra, es simplemente lo que hace eroq-rp-plus.
Fallo 2: muletillas sobreentrenadas
Incluso los modelos potentes se apoyan en muletillas aprendidas cuando la temperatura es alta: el problema del «ay, cariño…». El rol funciona en caliente (una temperatura de 0.8 o más es lo normal; la monotonía es la muerte), así que la presión de las muletillas es constante.
Contra lo que dicta la intuición, la respuesta en los modelos potentes es una penalización más suave, no ninguna: suficiente para gravar las muletillas, no tanto como para distorsionar la voz. Así la temperatura se mantiene alta, que es donde el rol la necesita.
Fallo 3: deriva del personaje
Una ficha de personaje en el prompt de sistema se degrada a medida que crece la conversación: la transcripción pesa más que la ficha y el modelo empieza a promediar hacia el comportamiento de un asistente genérico.
Tres cosas sostienen a un personaje:
- El prompt de sistema se ocupa de la conducta, no del contenido. «No salgas del personaje, nunca añadas metacomentarios, acciones entre asteriscos»: la conducta resiste el crecimiento del contexto mucho mejor que párrafos de trasfondo.
- Una ventana de historial gana al historial completo. Pasado cierto umbral, los turnos antiguos añaden deriva más rápido de lo que añaden memoria. Envía una ventana, guarda los datos a largo plazo en tu propio almacenamiento y vuelve a inyectar lo que importa.
- Nada de fugas de la cuarta pared. Un modelo que haya visto alguna vez un turno de «como IA…» en su contexto producirá más. Fíltralos del historial que envías.
La API de eroq no guarda estado, por diseño: tú envías el historial que quieres que se vea. No es pereza; es la única arquitectura que te permite a ti controlar la deriva.
Fallo 4: el muro de las negativas
Los productos de personajes chocan con un muro que las API generalistas no nombran: al primer giro oscuro (la amenaza de un villano, una escena de muerte), el modelo rompe la escena y suelta un sermón. Los usuarios no lo viven como seguridad; lo viven como la muerte del personaje a mitad de la historia.
Nuestros motores están elegidos para que la ficción salga sin censura, giros oscuros e intensos incluidos, con los límites estrictos aplicados en la capa de políticas (nada que involucre a menores, ninguna suplantación de personas reales, ningún contenido ilegal: la política de uso aceptable es breve y absoluta). Decidir dónde está el muro es una decisión de producto; fingir que es una limitación del modelo no lo es.
Qué significa esto para tu integración
- Envía un prompt de sistema centrado en la conducta; guarda el lore en tu propio almacenamiento e inyéctalo de forma selectiva.
- Confía en la temperatura por defecto (0.8) antes de ajustar nada; está fijada donde vive el rol.
- Limita el historial a una ventana de unos 20–40 turnos y resume lo que quede más allá.
- Deja que
eroq-rp-minicargue con el volumen y cambia aeroq-rp-plusen las escenas donde importa la textura: la misma forma de API, 1 frente a 3 créditos. Vale la pena escuchar los dos registros lado a lado en el estudio de Texto antes de programar una regla de enrutamiento.
Preguntas frecuentes
¿Qué temperatura debo usar para rol?
Empieza en 0.8, que es donde está ajustado RP+ y donde la prosa de rol tiene textura sin caer en bucles. El parámetro acepta de 0 a 1.5, pero alejar cualquier modelo de su punto de ajuste es justo donde empieza la repetición. Cambia una cosa cada vez y lee las transcripciones, no los ajustes.
¿Por qué mi personaje de IA repite siempre las mismas frases?
Porque la frase favorita está en el contexto, lo que la hace más probable en el turno siguiente, lo que la vuelve a meter en el contexto. La solución es disciplina de muestreo (una penalización de frecuencia suave que grave los tokens que la transcripción ya contiene y una penalización de presencia contra volver a abrir los mismos temas), además de limitar el historial a una ventana para que el bucle no se siga alimentando.
¿Cómo evito que un personaje se salga de su papel?
Escribe conducta en lugar de biografía en el prompt de sistema, mantén la ficha fuera de la transcripción en el campo context, envía una ventana de 20–40 turnos en lugar de todo y elimina cualquier turno en el que el modelo rompió el personaje antes de volver a enviar el historial. Un modelo que ha visto una vez un turno de «como IA» en su contexto producirá más.
¿Qué diferencia hay entre RP+ y RP mini?
El precio y cuánto aguanta cada uno. RP mini cuesta 1 crédito por respuesta y en intercambios cortos no se distingue; RP+ cuesta 3 y es el ajustado para sostener un personaje hasta muy avanzada una escena larga. Los dos son sin censura dentro de la política, los dos hacen streaming y los dos aceptan imágenes adjuntas por +2 créditos.
El resumen incómodo: el rol no es una versión reducida de la asistencia. Es un objetivo distinto, y un modelo ajustado para uno fallará en el otro. Nosotros ajustamos para este.
Crea esto con los modelos detrás del artículo: empieza con 50 créditos gratis o explora todos los motores y sus precios.