Un descuento en los planes premium al registrarteConsigue tu descuento

blog/use-cases·6 sept 2026·6 min·por el equipo de eroq

Voz con IA para videojuegos: barks, menús y voces provisionales

Asigna una voz por personaje, genera mil frases desde una hoja de cálculo y calcula el costo antes. Y el límite honesto: sin sincronización labial.


Una build con personajes mudos se lee como un prototipo por muy bueno que sea el arte. Treinta barks y un menú con voz cambian esa percepción en una tarde, y por eso las voces provisionales se han convertido, sin hacer ruido, en una de las primeras cosas que los equipos indie generan en lugar de una de las últimas que graban.

Antes que nada, el límite que decide tu alcance: no hay sincronización labial. Ni avatares que hablan, ni pista de visemas, ni síntesis en tiempo real. Lo que devuelven los modelos de voz es un archivo MP3. Todo lo que sigue está pensado en torno a eso, y resulta que la mayor parte del diálogo de un juego nunca necesitó una boca en pantalla.

Para qué sirve de verdad la voz generada en una build

  • Barks. Avisos de combate, charla ociosa, frases de alerta, reacciones a golpes, saludos de tenderos. Cortas, numerosas, fuera de pantalla o lo bastante lejos como para que nadie lea los labios.
  • Menús y sistemas. Indicaciones del tutorial, lectura en voz alta para accesibilidad, «partida guardada», frases de confirmación.
  • Radio y comunicaciones. El mejor encaje de todos: una voz al otro lado de unos auriculares no tiene cara por diseño.
  • Narrador y códice. Entradas de lore, introducciones de nivel, pantallas de muerte.
  • Voces provisionales para un vertical slice. Frases temporales en un vertical slice para poder juzgar el ritmo antes de que exista presupuesto de casting.

Para lo que no sirve: cinemáticas en las que un personaje habla a cámara. Monta evitando la boca, pon la frase sobre un plano de reacción o deja esa escena para una grabación real.

Asigna la voz una vez, por personaje, para siempre

La regla que más disgustos ahorra después es aburrida: un personaje, una voz, durante toda la vida del proyecto.

Un Personaje del estudio lleva un nombre, una personalidad y una voz: una voz del catálogo (Aria, cálida e íntima; Orion, grave y pausada) o una que hayas clonado. Asígnala una vez y cada frase que renderices para ese personaje la usará. Por API, lo mismo es un id de voz char:<id>, así que tu script de exportación nunca tiene que recordar qué clon era el del intendente.

Dos voces de catálogo no suenan a reparto hasta que recuerdas que la velocidad y la expresividad se ajustan por separado en cada frase, y que la escritura carga con la mayor parte del personaje de todos modos. Un intendente seco y metódico y un posadero florido pueden compartir timbre y aun así sonar como dos personas. Cuando de verdad no pueden, clona las voces que falten: clonar es gratis, solo se factura el audio.

Mil frases por lotes

Guarda las frases en un archivo, no en una herramienta. Un TSV de dos columnas, line_id y text, es todo el pipeline, y además es tu diff cuando un guionista cambie once frases en el próximo sprint.

La CLI eroq renderiza una frase por invocación y escribe el MP3 donde le digas, así que el lote es un bucle de shell de cuatro líneas:

while IFS=$'\t' read -r id text; do
  eroq speech "$text" -v orion -m eroq-voice-turbo -o "vo/quartermaster/$id.mp3"
done < barks.tsv

Tres notas prácticas. Cada solicitud admite como máximo 5,000 caracteres de entrada, algo a lo que ningún bark se acercará jamás pero una entrada de códice sí podría. El audio tiene un límite de 6 solicitudes por minuto por clave en un espacio de trabajo gratuito, multiplicado según tu plan (2× en Creator, 4× en Studio), así que una pasada de mil frases tarda poco menos de tres horas con una clave gratuita y unos cuarenta minutos con una de Studio. Y cada render se guarda automáticamente en tu biblioteca, así que perder un archivo local es una molestia y no un nuevo render.

Si tu cadena de herramientas prefiere WAV en lugar de MP3, convierte al importar:

ffmpeg -i vo/quartermaster/bark_01.mp3 -ar 48000 -ac 1 vo/quartermaster/bark_01.wav

Cuánto cuestan mil frases

El audio se factura por cada bloque empezado de 100 caracteres de entrada: 3 créditos en Voice One y 2 en Voice Turbo. La palabra «empezado» es todo el modelo de costo para el diálogo de un juego, porque los barks son cortos y cada uno se redondea a un bloque completo.

Así que la factura sigue tu número de frases, no tu número de caracteres:

  • 1,000 barks de 45 caracteres de media: 1,000 bloques. 3,000 créditos en Voice One, 2,000 en Turbo. A la tarifa del paquete de entrada, eso es aproximadamente $30 y $20.
  • 60 frases de menú y sistema: 180 créditos en Voice One, 120 en Turbo.
  • 40 entradas de códice de 480 caracteres cada una: 5 bloques por entrada, así que 600 créditos en Voice One.

Dos consecuencias que vale la pena aplicar. Primero, itera en Turbo y publica con Voice One: volver a renderizar los mismos mil barks cuesta un tercio menos mientras aún estás puliendo la escritura. Segundo, resiste la tentación de juntar frases cortas en una sola solicitud para esquivar el redondeo: recibirías un único MP3, y dividirlo a mano cuesta más que los créditos que ahorraste.

Los reembolsos son automáticos en las generaciones fallidas, así que un lote que muere a mitad de camino en una mala noche de red no te deja pagando por silencio.

Mantener las voces estables entre parches

Trata barks.tsv como la fuente de verdad y la carpeta de audio como salida de compilación. Cuando un guionista edite once filas, vuelve a renderizar once archivos: los ids son estables, las rutas son estables y nada más se mueve en el proyecto. Guarda la voz, la velocidad y la expresividad de cada personaje en el mismo archivo o en un pequeño JSON al lado, para que un nuevo render dentro de seis meses produzca la misma interpretación y no una nueva.

Para el trabajo de personajes previo a la voz (personalidades, arte de referencia, mantener coherente un reparto), el pipeline de concept art para estudios de videojuegos cubre la mitad visual, y TTS para personajes de IA explica cómo escribir frases que suenen interpretadas y no leídas.

Preguntas frecuentes

¿Puede eroq sincronizar los labios de un personaje con el diálogo generado?

No. No hay sincronización labial, ni salida de visemas, ni función de avatar que habla: los modelos de voz devuelven un MP3 y nada más. Diseña el diálogo como barks, charla por radio, narración y frases fuera de pantalla, y reserva el habla a cámara para voces grabadas.

¿Cuánto cuestan mil barks?

La facturación es por bloque empezado de 100 caracteres, así que un bark corto cuesta un bloque por muy corto que sea. Mil barks son 3,000 créditos en Voice One o 2,000 en Voice Turbo, aproximadamente $30 y $20 a la tarifa del paquete de entrada, antes de cualquier nuevo render.

¿Puedo usar frases de voz generadas en un juego comercial?

Los resultados son tuyos según los términos del servicio y los planes incluyen licencia comercial, así que las restricciones que quedan son las normas de contenido (solo ficción, nada que involucre a menores, ninguna persona real identificable sin su consentimiento, nada ilegal), y cualquier voz clonada necesita el permiso de su dueño. Consulta la página de precios para ver qué incluye cada plan antes de publicar.

¿Hay alguna forma de generar todas las frases en una sola solicitud?

No, y no te convendría. Cada solicitud devuelve un MP3, así que una solicitud por frase es lo que te da archivos por frase con ids estables. Hazlo por lotes con un bucle de shell sobre tu archivo de frases y deja que el límite de solicitudes marque el ritmo.

¿Todo listo para oír hablar a tu build? Abre el estudio de Voz, asigna bien la voz a un personaje y luego apunta un bucle al resto.

Etiquetasgame-devtext-to-speechvoicebarkscharacters

Crea esto con los modelos detrás del artículo: empieza con 50 créditos gratis o explora todos los motores y sus precios.