Glossar
Die Begriffe, erklärt
Generative Medien haben ihr Vokabular aus Fotografie, Kino und Machine Learning geliehen und den Rest selbst erfunden. 44 Begriffe, jeweils in zwei Sätzen erklärt – samt ihrem Verhalten im Studio.
Video
Text-zu-Video
Text-zu-Video (Text-to-Video) ist die Generierung eines Videoclips allein aus einem geschriebenen Prompt. Das Modell erzeugt Motiv, Bewegung, Kamera und Licht aus der Beschreibung und liefert meist Clips von wenigen Sekunden.
Bild-zu-Video
Bild-zu-Video (Image-to-Video) erweckt ein Standbild als Videoclip zum Leben: Das Bild legt Motiv und Bildausschnitt fest, ein Prompt beschreibt die Bewegung. Es ist der Standardweg, ein bestimmtes Gesicht oder Produkt in generierten Videos konsistent zu halten.
Kamerabewegung
Eine Kamerabewegung beschreibt, wie sich die virtuelle Kamera während eines Clips bewegt – Schwenk, Ranfahrt, Begleitfahrt, Kreisfahrt, Kranfahrt, Dolly-Zoom. In KI-Videos wird sie gepromptet statt mit echter Technik umgesetzt und prägt die Wirkung einer Einstellung stärker als das Motiv.
Dolly-Zoom
Beim Dolly-Zoom fährt die Kamera auf das Motiv zu oder von ihm weg und zoomt gleichzeitig in die Gegenrichtung: Das Motiv behält seine Größe, während sich der Hintergrund dehnt oder staucht. Er ist der „Vertigo-Effekt“, bekannt aus Hitchcocks „Vertigo“ und aus „Der weiße Hai“.
Seitenverhältnis
Das Seitenverhältnis ist das Verhältnis von Breite zu Höhe eines Bildes: 16:9 für Breitbild und YouTube, 9:16 für vertikale Shorts, 1:1 für quadratische Feeds, 21:9 fürs Kino. Bei der KI-Generierung ist es auf modernen Engines ein Parameter, auf älteren ein Hinweis im Prompt.
Storyboard
Ein Storyboard ist ein Film, der Einstellung für Einstellung geplant ist – Bildausschnitt, Handlung und Länge jeder Szene in ihrer Reihenfolge. Bei KI-Videos ist es der Weg über die Grenze der Cliplänge hinaus: mehrere Clips mit einem Look, abgespielt als ein Schnitt.
Take
Ein Take ist ein gerenderter Versuch einer Szene. Mehrere Takes desselben Prompts zu rendern und den besten zu behalten, ist der Weg, generierte Videos zu inszenieren, statt sie einfach hinzunehmen.
Start- und Endframe
Bei der Generierung mit Start- und Endframe (First/Last Frame) bekommt eine Video-Engine sowohl ein Anfangs- als auch ein Schlussbild; das Modell interpoliert die Bewegung dazwischen. Das ist der präziseste Weg, zu steuern, wo ein Clip endet.
Tempo
Tempo ist die Taktung der Bewegung innerhalb eines Clips – ruhig, verträumt, dynamisch, angespannt oder chaotisch. Es bestimmt, wie schnell sich Motive und Kamera bewegen und wie viel Energie eine Einstellung trägt.
Anamorphotisches Objektiv
Ein anamorphotisches Objektiv staucht ein breites Bild auf den Sensor, das in der Postproduktion wieder entzerrt wird. So entsteht die typische Kino-Handschrift: ovales Bokeh, horizontale Lens Flares und eine sanfte Breitbild-Dehnung.
Upscaling
Upscaling (Hochskalieren) vergrößert ein generiertes Bild oder einen Clip nachträglich und erfindet die zusätzlichen Pixel mit einem zweiten Modell. So wird aus einem 720p-Render ein 1080p- oder 4K-Ergebnis, ohne neu generieren zu müssen.
Lip-Sync
Lip-Sync (Lippensynchronisation) animiert ein Gesicht so, dass der Mund zu einer von dir gelieferten Tonspur passt. Damit wird aus einem stillen Porträt oder einem stummen Clip jemand, der scheinbar deine Worte spricht.
B-Roll
B-Roll ist das ergänzende Material, das über den Sprechertext oder zwischen die Hauptaufnahmen geschnitten wird – Hände, Details, eine Straße, das Produkt auf einem Tisch. Sie trägt den Schnitt, während die Stimme die Aussage trägt.
Establishing Shot
Ein Establishing Shot (Einführungseinstellung) ist die weite Einstellung, die dem Publikum zeigt, wo es sich befindet, bevor die Szene beginnt. Er ist meist die erste Einstellung einer Sequenz und oft die einzige, die den ganzen Schauplatz zeigt.
Keyframe
Ein Keyframe (Schlüsselbild) ist ein Frame, dessen Inhalt feststeht statt generiert zu werden und um den herum die Bewegung aufgebaut wird. In KI-Videos sind der Startframe und, wo unterstützt, der Endframe die Keyframes.
Bild
Referenzbild
Ein Referenzbild ist ein Bild, das zusammen mit einem Prompt übergeben wird, damit das Modell etwas daraus – ein Gesicht, ein Produkt, einen Stil – über neue Renders hinweg beibehält. Es ist die Grundlage für konsistente Charaktere in KI-Bildern und -Videos.
Filmkorn
Filmkorn ist die feine, zufällige Textur fotochemischen Films. Es wird digitalen Renders hinzugefügt, um eine analoge Aufnahme anzudeuten und den allzu glatten Look synthetischer Bilder zu kaschieren.
Bild-zu-Bild
Bild-zu-Bild (Image-to-Image) bearbeitet oder gestaltet ein vorhandenes Bild per Prompt um: Die Komposition bleibt, Details, Stil oder Motiv ändern sich. Die referenzgestützte Generierung ist seine häufigste kreative Form.
Gegenlicht (Contre-jour)
Gegenlicht – in der Fotografie auch Contre-jour genannt – bedeutet: Die Lichtquelle steht hinter dem Motiv und erzeugt einen Lichtsaum an den Konturen, Silhouetten und Überstrahlungen im Objektiv. Es ist der klassische Look der goldenen Stunde.
Inpainting
Inpainting generiert einen ausgewählten Bereich eines Bildes neu und lässt den Rest unberührt – eine Hand maskieren und neu zeichnen, ein Objekt entfernen, ein Detail ändern. Die Maske ist die Anweisung.
Stimme
Stimmklonen
Stimmklonen (Voice Cloning) erzeugt aus einer Aufnahme eine synthetische Stimme, damit neuer Text in genau dieser Stimme gesprochen werden kann. Moderne Engines brauchen etwa eine Minute saubere Sprache und geben Klangfarbe und Sprechrhythmus auch sprachübergreifend wieder.
Text-zu-Sprache (TTS)
Text-zu-Sprache (Text-to-Speech) wandelt geschriebenen Text in gesprochenes Audio um. Ausdrucksstarke TTS-Engines lesen Satzzeichen als Vortragsanweisung und bieten Regler wie Tempo und Ausdrucksstärke – für natürliche Erzählung und Dialoge.
Sprache-zu-Text (STT)
Sprache-zu-Text (Speech-to-Text) transkribiert gesprochenes Audio in geschriebenen Text. Zusammen mit einem Chatmodell und TTS entsteht daraus ein vollständiger Sprachdialog.
Voice-over
Ein Voice-over ist Sprechertext, der über das Bild gelegt statt vor der Kamera gesprochen wird. Es trägt die Aussage eines Erklärvideos, eines Werbespots oder einer Doku, während das Bildmaterial sie illustriert.
Diarisierung
Diarisierung (Sprecherdiarisierung) ist der Teil der Transkription, der ermittelt, wer wann gesprochen hat, und ein Transkript nach Sprechern kennzeichnet. Sie macht aus der Textwand eines Interviews ein lesbares Gespräch in zwei Spalten.
Prompting
Negativ-Prompt
Ein Negativ-Prompt (Negative Prompt) listet auf, was das Modell vermeiden soll – Text, Wasserzeichen, zusätzliche Finger, Unschärfe. Er lenkt die Generierung von diesen Merkmalen weg, statt darauf zu hoffen, dass der Haupt-Prompt ihr Fehlen schon mitmeint.
CFG-Scale
Die CFG-Scale (Classifier-free Guidance) legt fest, wie streng ein Diffusionsmodell dem Prompt folgt. Niedrige Werte ergeben freiere, vielfältigere Bilder; hohe Werte setzen die Worte wörtlich um, auf Kosten der Natürlichkeit.
Seed
Ein Seed ist die Zahl, die den Zufall einer Generierung initialisiert. Gleicher Prompt, gleiche Einstellungen und gleicher Seed ergeben dasselbe Ergebnis – so wird erneutes Rendern zur gezielten Überarbeitung statt zum Glücksspiel.
Prompt-Optimierer
Ein Prompt-Optimierer (Prompt Enhancer) schreibt eine grobe Idee in einen Prompt um, der so aufgebaut ist, wie eine Generierungs-Engine am besten darauf anspricht – Motiv, Bewegung, Kamera, Licht, Stimmung –, oder erfindet einen von Grund auf neu.
Regiepult
Das Regiepult ist das Set an Look-Reglern von eroq – Filmart, Epoche, Tempo, Kamera, Objektiv, Blende, Farbpalette, Licht –, die serverseitig in jeden Prompt einfließen, damit ein ganzer Film eine einheitliche Ästhetik hat.
Schärfentiefe
Die Schärfentiefe (oft auch Tiefenschärfe genannt) beschreibt, wie viel einer Aufnahme von vorne bis hinten scharf ist. Eine geringe Schärfentiefe hebt das Motiv vor einem weichen Hintergrund hervor; eine große hält die ganze Szene scharf.
Farbpalette
Eine Farbpalette ist die begrenzte Auswahl an Farbtönen, auf die ein Werk beim Color Grading abgestimmt wird – Neon-Noir, warmer Film, Bleach Bypass. Wer sich auf eine festlegt, lässt einzelne Einstellungen wie ein zusammenhängendes Werk wirken.
Plattform
Unzensierte KI
Unzensierte KI bezeichnet Modelle, die rendern, was der Prompt verlangt – auch düstere, gewalttätige oder provokante Fiktion –, statt es abzulehnen, und dabei einer schriftlichen Nutzungsrichtlinie folgen statt einem probabilistischen Inhaltsfilter. „Keine Regeln“ hat es nie bedeutet.
Credits
Credits sind eine Prepaid-Einheit für KI-Generierung: Jeder Aufruf kostet eine veröffentlichte Anzahl an Credits statt einer Token-Abrechnung, was Budgets planbar macht. Auf eroq entspricht 1 Credit beim Einstiegspaket etwa einem Cent.
MCP (Model Context Protocol)
MCP ist ein offenes Protokoll, über das KI-Assistenten externe Tools aufrufen können. Ein MCP-Server stellt Fähigkeiten bereit – etwa das Generieren eines Videos –, die ChatGPT, Claude oder ein Coding-Agent im Gespräch nutzen können.
SSE-Streaming
Server-Sent Events streamen eine Chat-Antwort Token für Token über eine einzige HTTP-Verbindung, sodass Nutzer den Text sehen, während er entsteht, statt auf die komplette Antwort zu warten.
Element
Auf eroq ist ein Element ein wiederverwendbarer Ort, Gegenstand oder Stil, der einmal gespeichert und in Prompts per @ erwähnt wird – so erscheinen derselbe Schauplatz, dasselbe Produkt oder derselbe Look über alle Renders und das ganze Team hinweg.
Persistenter Charakter
Ein persistenter Charakter ist ein KI-Darsteller, der einmal definiert wird – Gesichtsreferenzen, Persona, Stimme – und in Bildern, Videos und Dialogen wiederverwendet wird, damit er in jeder Szene dieselbe Person bleibt.
Remix
Remix lädt das komplette Rezept eines fertigen Renders – Prompt, Modell, Kamera, Regiepult-Einstellungen, Länge – zurück in den Composer, damit du ihn überarbeiten kannst, statt ihn aus dem Gedächtnis neu aufzubauen.
Webhook
Ein Webhook ist ein signierter HTTP-Callback, den eine Plattform an deinen Server schickt, sobald ein asynchroner Job fertig ist – so musst du nicht ständig nachfragen. Videogenerierung, die Minuten dauert, ist der klassische Anwendungsfall.
Workspace
Ein Workspace ist ein gemeinsamer Kontobereich mit Mitgliedern, Plätzen und einem Credit-Guthaben, in dem ein Team zusammen ausgibt und erstellt, während jede Person ihre eigenen Zugangsdaten behält.
Wasserzeichen
Ein Wasserzeichen ist eine sichtbare, fest eingebrannte Markierung in generierten Medien, meist ein Logo in einer Ecke, die das erstellende Tool kennzeichnet. Viele Generatoren setzen es in kostenlosen oder günstigen Stufen und entfernen es in höheren.
Rate-Limit
Ein Rate-Limit begrenzt, wie viele Anfragen ein Konto pro Minute senden darf. Es schützt gemeinsam genutzte Kapazität und ist der Grund, warum eine Welle paralleler Aufrufe scheitern kann, während dieselben Aufrufe zeitlich verteilt durchgehen.
API-Schlüssel
Ein API-Schlüssel (API Key) ist die geheime Zeichenfolge, mit der sich ein Programm gegenüber einer API authentifiziert; er wird bei jeder Anfrage als Bearer-Token mitgesendet. Er identifiziert das Konto, das für den Aufruf bezahlt.