Glosario
Cada término, explicado
Los medios generativos tomaron su vocabulario de la fotografía, el cine y el aprendizaje automático, y luego inventaron el resto. 44 términos, definidos en dos frases cada uno, y cómo se comportan en el estudio.
Video
Texto a video
El texto a video (text-to-video) consiste en generar un clip de video solo a partir de un prompt escrito. El modelo sintetiza sujeto, movimiento, cámara e iluminación a partir de la descripción y suele producir clips de pocos segundos.
Imagen a video
La imagen a video (image-to-video) anima una imagen estática y la convierte en un clip de video: la imagen determina el sujeto y el encuadre, y un prompt describe el movimiento. Es la forma habitual de que una cara o un producto concretos se mantengan idénticos en el video generado.
Movimiento de cámara
Un movimiento de cámara es la forma en que la cámara virtual se desplaza durante un clip: paneo, acercamiento, travelling, órbita, grúa, dolly zoom. En el video con IA se pide en el prompt, sin equipo de rodaje, y define el tono de un plano más que el propio sujeto.
Dolly zoom
Un dolly zoom acerca o aleja la cámara del sujeto mientras hace zoom en sentido contrario, de modo que el sujeto mantiene su tamaño mientras el fondo se estira o se comprime. Es el "efecto vértigo" de Hitchcock y de Tiburón.
Relación de aspecto
La relación de aspecto es la proporción entre el ancho y el alto de un fotograma: 16:9 para pantalla panorámica y YouTube, 9:16 para videos cortos verticales, 1:1 para feeds cuadrados, 21:9 para cine. En la generación con IA es un parámetro en los motores modernos y una pista dentro del prompt en los más antiguos.
Storyboard
Un storyboard (o guion gráfico) es una película planificada plano a plano: el encuadre, la acción y la duración de cada escena, en orden. En el video con IA es la forma de superar el límite de duración de los clips: varios clips con una misma estética, reproducidos como un solo montaje.
Toma
Una toma es un intento generado de una escena. Generar varias tomas del mismo prompt y quedarse con la mejor es la forma de dirigir el video generado en lugar de conformarse con lo que salga.
Primer y último fotograma
La generación con primer y último fotograma le da a un motor de video una imagen de inicio y una de final; el modelo interpola el movimiento entre ambas. Es la forma más precisa de controlar dónde termina un clip.
Ritmo (tempo)
El ritmo (tempo) es la cadencia del movimiento dentro de un clip: tranquilo, onírico, dinámico, tenso o caótico. Define a qué velocidad se mueven los sujetos y la cámara y cuánta energía transmite un plano.
Lente anamórfica
Una lente anamórfica comprime una imagen ancha sobre el sensor; al descomprimirla en posproducción se obtiene la firma cinematográfica del bokeh ovalado, los destellos horizontales y un suave estiramiento panorámico.
Escalado (upscaling)
El escalado (upscaling) amplía una imagen o un clip ya generados, inventando los píxeles extra con un segundo modelo. Así es como un render en 720p se convierte en un entregable en 1080p o 4K sin volver a generarlo.
Sincronización labial (lip-sync)
La sincronización labial (lip-sync) anima una cara para que la boca coincida con una pista de audio que tú aportas. Es lo que convierte un retrato fijo o un clip mudo en alguien que parece decir tus palabras.
B-roll
El B-roll (o planos de recurso) es el material de apoyo que se monta sobre la narración o entre los planos principales: manos, detalles, una calle, el producto sobre una mesa. Sostiene el montaje mientras la voz sostiene el argumento.
Plano de establecimiento
Un plano de establecimiento (o plano de situación) es el plano general que le dice al público dónde está antes de que empiece la escena. Suele ser el primer plano de una secuencia y, a menudo, el único que muestra el lugar completo.
Fotograma clave
Un fotograma clave (keyframe) es un fotograma cuyo contenido está fijado en lugar de generado, y en torno al cual se construye el movimiento. En el video con IA, el fotograma inicial y, donde se admite, el fotograma final son los fotogramas clave.
Imagen
Imagen de referencia
Una imagen de referencia es una imagen que se envía junto al prompt para que el modelo conserve algo de ella (una cara, un producto, un estilo) en nuevos renders. Es la base de la coherencia de personajes en la imagen y el video con IA.
Grano de película
El grano de película es la textura fina y aleatoria de la película fotoquímica, que se añade a los renders digitales para sugerir una captura analógica y disimular el aspecto demasiado limpio de la síntesis.
Imagen a imagen
La imagen a imagen (image-to-image) edita o cambia el estilo de una imagen existente guiándose por un prompt: conserva su composición y cambia detalles, estilo o sujeto. La generación guiada por referencias es su forma creativa más habitual.
Contraluz
El contraluz (contre-jour) es la iluminación desde atrás: la fuente de luz está detrás del sujeto y produce un halo de luz en el contorno, siluetas y resplandor en la lente. Es la estética clásica de la hora dorada.
Inpainting
El inpainting regenera una zona seleccionada de una imagen sin tocar el resto: enmascarar una mano y redibujarla, eliminar un objeto, cambiar un detalle. La máscara es la instrucción.
Voz
Clonación de voz
La clonación de voz crea una voz sintética a partir de una grabación para que se pueda decir texto nuevo con esa voz. Los motores actuales necesitan alrededor de un minuto de habla limpia y reproducen el timbre y la cadencia en distintos idiomas.
Texto a voz (TTS)
El texto a voz (TTS) convierte texto escrito en audio hablado. Los motores de TTS expresivos leen la puntuación como interpretación y ofrecen controles como la velocidad y la expresividad, para lograr narraciones y diálogos naturales.
Voz a texto (STT)
La conversión de voz a texto (STT) transcribe audio hablado a texto escrito. Combinada con un modelo de chat y con TTS, forma un ciclo de conversación por voz.
Voz en off
La voz en off es una narración que se pone sobre la imagen en lugar de decirse ante la cámara. Lleva el argumento de un video explicativo, un anuncio o un documental mientras las imágenes lo ilustran.
Diarización
La diarización es la parte de la transcripción que determina quién habló y cuándo, y etiqueta la transcripción por hablante. Es lo que convierte el muro de texto de una entrevista en una conversación legible a dos columnas.
Prompts
Prompt negativo
Un prompt negativo enumera lo que el modelo debe evitar: texto, marcas de agua, dedos de más, desenfoque. Aleja la generación de esos rasgos en lugar de esperar que el prompt principal dé a entender su ausencia.
Escala CFG
La escala CFG (classifier-free guidance, o guía sin clasificador) define con qué rigor sigue el prompt un modelo de difusión. Los valores bajos dan imágenes más libres y variadas; los altos siguen las palabras al pie de la letra a costa de la naturalidad.
Semilla (seed)
Una semilla (seed) es el número que inicializa la aleatoriedad de una generación. El mismo prompt, la misma configuración y la misma semilla reproducen el mismo resultado, lo que convierte volver a generar en una revisión y no en una apuesta.
Optimizador de prompts
Un optimizador de prompts reescribe una idea en bruto como un prompt estructurado del modo al que responde un motor de generación (sujeto, movimiento, cámara, luz, ambiente) o inventa uno desde cero.
Panel de dirección
El panel de dirección es el conjunto de controles visuales de eroq (tipo de película, época, ritmo, tipo de cámara, lente, apertura, paleta, iluminación) que se incorporan a cada prompt en el servidor para que toda una película comparta la misma estética.
Profundidad de campo
La profundidad de campo es cuánto de un plano está enfocado, de delante hacia atrás. Una profundidad de campo reducida aísla al sujeto sobre un fondo suave; una amplia mantiene nítida toda la escena.
Paleta de colores
Una paleta de colores es el conjunto limitado de tonos hacia el que se lleva el color de una pieza: noir neón, película cálida, bleach bypass. Comprometerse con una es lo que hace que planos separados parezcan una sola obra.
Plataforma
IA sin censura
La IA sin censura describe modelos que generan lo que pide el prompt (incluida la ficción oscura, violenta o provocadora) en lugar de rechazarlo, y que se rigen por una política de uso aceptable escrita y no por un filtro de contenido probabilístico. Nunca ha significado "sin reglas".
Créditos
Los créditos son una unidad prepagada para la generación con IA: cada llamada cuesta un número de créditos publicado, en lugar de una factura por tokens, lo que hace que el presupuesto sea predecible. En eroq, 1 crédito equivale a más o menos un centavo con el paquete de entrada.
MCP (Model Context Protocol)
MCP (Model Context Protocol) es un protocolo abierto que permite a los asistentes de IA usar herramientas externas. Un servidor MCP ofrece capacidades, como generar un video, que ChatGPT, Claude o un agente de programación pueden invocar en plena conversación.
Streaming SSE
Los server-sent events (SSE) transmiten una respuesta de chat token a token por una sola conexión HTTP, para que el usuario vea el texto a medida que se genera en lugar de esperar a la respuesta completa.
Elemento
En eroq, un Elemento es un lugar, un objeto o un estilo reutilizable que se guarda una vez y se @menciona en los prompts, para que el mismo lugar, producto o estética aparezca en todos los renders y en todo el equipo.
Personaje persistente
Un personaje persistente es un miembro del reparto de IA que se define una sola vez (referencias faciales, personalidad, voz) y se reutiliza en imágenes, video y diálogos para que siga siendo la misma persona en cada escena.
Remix
Remix recarga en el editor la receta completa de un render terminado (prompt, modelo, cámara, configuración del panel de dirección, duración) para que puedas revisarlo en lugar de reconstruirlo de memoria.
Webhook
Un webhook es una llamada HTTP firmada que una plataforma envía a tu servidor cuando termina una tarea asíncrona, para que no tengas que consultarla una y otra vez. La generación de video, que tarda minutos, es el caso típico.
Espacio de trabajo
Un espacio de trabajo es un espacio de cuenta compartido con miembros, puestos y un único saldo de créditos, para que un equipo gaste y cree en conjunto mientras cada persona conserva su propio inicio de sesión.
Marca de agua
Una marca de agua es una marca visible incrustada en el contenido generado, normalmente un logo en una esquina, que identifica la herramienta que lo creó. Muchos generadores la aplican en los niveles gratuitos o básicos y la quitan en los superiores.
Límite de solicitudes (rate limit)
Un límite de solicitudes (rate limit) fija cuántas solicitudes puede enviar una cuenta por minuto. Protege la capacidad compartida y es la razón por la que una ráfaga de llamadas en paralelo puede fallar mientras que las mismas llamadas, espaciadas, funcionan.
Clave de API
Una clave de API es la cadena secreta que autentica a un programa ante una API y se envía como token bearer en cada solicitud. Identifica la cuenta que paga la llamada.