Un descuento en los planes premium al registrarteConsigue tu descuento

blog/tutorials·24 sept 2026·6 min·por el equipo de eroq

Cómo habla un personaje en video con IA: Seedance y Hailuo

Cómo viaja la voz de un personaje en un render de video: líneas, descripción de voz, muestra de audio, qué hace cada motor y cómo escribir diálogos.


Los motores de video con banda sonora se inventan una voz para cualquiera que hable: una distinta en cada clip, lo que está bien para un plano suelto y es fatal para una película. La respuesta de eroq es el personaje: dale una voz a un miembro del reparto en el estudio, escribe su línea en una escena y, en los motores que aceptan una referencia de audio, la línea sale con esa voz, escena tras escena. Esta guía explica qué viaja realmente con un render, en qué motores y cómo escribir diálogos que quepan en cinco segundos.

Lo que lleva un personaje

Un personaje del estudio tiene una ficha de identidad (su aspecto), una personalidad (cómo piensa y habla en el chat) y una voz: una voz del catálogo o uno de tus clones, asignada en la pestaña Voz del personaje. Tres de estas cosas importan para el video, y una no:

  • La ficha viaja como imagen de referencia, así que la cara coincide.
  • La descripción de voz (una línea que describe la voz, «voz femenina, cálida y grave») viaja en el prompt en todos los motores con sonido.
  • La muestra de voz (un fragmento hablado breve con la voz asignada, que se renderiza una vez y se conserva) viaja como referencia de audio en los motores que la aceptan.
  • La personalidad nunca viaja en un prompt de video. El motor renderiza una imagen; no necesita saber cómo discute ella.

Qué hace cada motor

Tres niveles, según la tabla de motores:

  • Referencia de audio: Seedance 2.5, Seedance 2.0, Seedance 2.0 Fast, Seedance 2.0 Mini, Hailuo 3. La muestra acompaña al render; las líneas del personaje salen con su voz. Va una muestra por render (la del primer hablante de la escena que tenga voz), así que lo fiable es un solo personaje que hable por escena. Un plano continuo, que empieza en el último fotograma de la escena anterior, no lleva referencias y, por tanto, tampoco muestra: sus voces viajan como descripciones.
  • Sonido, sin referencia de audio: Motion One, Veo 3.1 y sus niveles Fast y Lite, Sora 2 Pro, Kling 3.0 y Pro, y Wan 3.0. La descripción viaja en el prompt; el motor elige una voz que encaje con las palabras. Coherente dentro de un clip, no de un clip a otro.
  • Sin sonido: Hailuo 3 Max, Runway Gen-4.5, Grok Imagine. Las líneas siguen viajando como dirección (una boca que se mueve, una manera de decir); no se oye nada. Añade la voz en el montaje desde la herramienta Voz.

El panel Estética de Cinema indica en qué nivel está el motor de la película. El sonido se puede desactivar en cualquier motor con banda sonora, y desactivado sale más barato donde el motor lo cobra.

Escribir la línea

En Cinema, las líneas de una escena viven dentro de su tarjeta: + Línea debajo de la acción, y luego un hablante, cómo se dice y la línea. El compositor escribe cada una en el párrafo de la propia escena, justo después de la acción (Mina (whispering) says: "It's still lit."), y cierra el prompt con una frase etiquetada Voices que dice cómo suena cada personaje con voz, para que se lea siempre de la misma manera. Despliega Lo que lee el motor en la tarjeta para ver el párrafo. Algunas reglas que salen de ver unos cuantos cientos de renders:

  • Una línea cada cinco segundos. Una frase corta, dicha en voz alta, dura de tres a cuatro segundos. Dos frases necesitan diez.
  • La manera antes que los adjetivos. «susurrando», «para sí misma», «sin levantar la vista» funcionan; «emocionalmente», no.
  • La puntuación es dirección. Un guion es una pausa, unos puntos suspensivos dejan la frase en el aire, un signo de interrogación eleva el final. La guía de puntuación se aplica al video tanto como a la voz.
  • Nombra también al hablante en la acción cuando hay dos personas en cuadro: «Mina se gira hacia Rook» antes de la línea de Mina, o el motor le dará la línea a quien esté más cerca de la cámara.
  • Nada de acotaciones dentro de la línea. La línea es lo que se dice; la manera, cómo se dice. Si las mezclas, la acotación se dice en voz alta.

Una escena, de principio a fin

La tarjeta de la escena:

INT. LIGHTHOUSE — DUSK
@Mina reaches the top of the spiral stairs, out of breath, slow push-in
as she sees the lamp.

  MINA (whispering)   It's still lit.

Renderizada en Seedance 2.0 Mini, 5 segundos, con sonido: 45 créditos. Lo que recibe el motor: el párrafo de la escena (el encabezado, la acción con el acercamiento y luego su línea con la manera de decirla); Mina vinculada a la imagen de referencia 1, su ficha; el movimiento de cámara y la estética; y una línea Voices que le indica al motor que hable con la voz del audio de referencia, más su muestra de voz como esa referencia de audio. El clip tiene su cara y su voz. Renderiza la escena dos con otra línea y es la misma voz, porque se envió la misma muestra, siempre que la escena dos no sea un plano continuo. Una escena que empieza en el fotograma anterior no envía muestra, así que su voz sale de la descripción; para una película con mucho diálogo, donde la voz importa más que la fluidez, desactiva Planos continuos en el panel Estética.

En Kling 3.0 la misma escena cuesta 170 créditos y la voz es lo que Kling deduce de la descripción: una buena voz, y otra distinta en la escena siguiente.

Cuando la voz tiene que ser exacta

Para una narración, una voz en off o una línea que tiene que ser exactamente el clon, no dependas del motor en absoluto: renderiza la línea en la herramienta Voz con la voz del personaje (3 créditos por cada 100 caracteres) y coloca el MP3 bajo la imagen en la Edición de Cinema, con el sonido propio del clip silenciado o más bajo. La banda sonora del motor pasa a ser ambiente; las palabras son tuyas. También es la única vía en los motores sin sonido.

Los límites, sin rodeos

  • Una muestra de voz por render. En una escena a dos, el primer hablante recibe la muestra; el otro, la descripción.
  • La muestra es una referencia, no un guion: el motor habla con esa voz; no sincroniza los labios con una grabación.
  • El idioma sigue a la línea. Una línea en español con una voz clonada a partir de habla en inglés sale con acento, igual que en la herramienta Voz.
  • Privacidad: la muestra es un enlace firmado, válido el tiempo justo para la cola del motor, desde tu propio almacenamiento.

Preguntas frecuentes

¿La personalidad del personaje influye en cómo se dice la línea?

No. La personalidad es para el chat. La interpretación sale de la manera de decirla, de la puntuación y de la propia voz.

¿Pueden hablar dos personajes en una misma escena?

Las dos líneas viajan en el prompt con sus descripciones. Solo va una muestra de voz por render, así que la voz de uno de los dos la elige el motor. Para tener dos voces exactas, reparte el intercambio en dos escenas, con Planos continuos desactivado: una escena que empieza en el fotograma anterior no envía muestra.

¿Qué motor mantiene la voz más consistente?

La familia Seedance y Hailuo 3, porque aceptan la muestra. En los demás, la descripción mantiene coherente el tipo de voz, no la voz.

¿Se cobra la muestra de voz?

No. Se renderiza una vez por voz y se conserva; un render en un motor con referencia de audio la envía sin costo adicional.

Asigna una voz en la pestaña Voz de un personaje y luego escribe la línea dentro de la tarjeta de una escena en Cinema.

Etiquetascinemavoicedialogueseedancehailuocharacters

Crea esto con los modelos detrás del artículo: empieza con 50 créditos gratis o explora todos los motores y sus precios.