Video
Sincronización labial (lip-sync)
La sincronización labial (lip-sync) anima una cara para que la boca coincida con una pista de audio que tú aportas. Es lo que convierte un retrato fijo o un clip mudo en alguien que parece decir tus palabras.
Es una capacidad distinta de la generación de video: el modelo se condiciona con la forma de onda del audio y mueve la boca fotograma a fotograma. Las herramientas que la ofrecen suelen recibir una cara y un archivo de voz y devolver un clip nuevo.
Generar el habla dentro del plano es algo totalmente distinto: ahí el motor inventa la interpretación y el sonido a la vez, a partir del prompt y, en algunos motores, de una muestra de voz, y nada se ajusta a una pista que tú aportes.
En eroq
eroq no tiene herramienta de sincronización labial. Los motores con sonido pueden generar una frase hablada como parte del clip (Veo 3.1 genera diálogos, y en Seedance y Hailuo 3 se envía la muestra de voz de un Personaje), pero no puedes poner una pista de voz aparte sobre un clip existente y hacer que la boca coincida. La narración del estudio de voz se coloca bajo la imagen en tu propio programa de edición.
Preguntas
¿Puede eroq hacer que un personaje diga mi guion?
No con el movimiento de la boca sincronizado. Puedes generar la voz de tu guion en el estudio de voz y la imagen por separado, y luego combinarlas en un programa de edición, pero la cara no estará sincronizada.
¿Qué hace realmente Veo 3.1 con los diálogos?
Genera la frase como parte del plano, voz incluida, a partir de tu prompt. No eliges la voz ni puedes aportar el audio, así que sirve para diálogos incidentales más que para una narración con guion.
¿La sincronización labial está en la hoja de ruta?
No publicamos promesas de hoja de ruta. Lo que es cierto hoy es que ningún endpoint ni ningún control del estudio lo hace.