Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/guides·11. Sept. 2026·6 Min.·vom eroq-Team

Qualitätscheck für KI-Videos – was du vor der Abgabe prüfst

Sieben Checks, die einen Render von einer Abgabe trennen: eine Aktion pro Clip, einheitlicher Look, Besetzung, Bildformat, Ton, Takes und Schnitt.


Zwischen einem Clip, der gerendert ist, und einem Clip, den du einem Kunden schicken kannst, liegt eine Lücke – und die hat meist nichts mit dem Modell zu tun. Es geht darum, ob die Einstellung eine einzige Idee trägt, ob Szene vier aussieht, als käme sie aus derselben Produktion wie Szene eins, ob das Gesicht dasselbe Gesicht ist und ob du gerade dabei bist, ein stummes Video abzuliefern.

Geh diese Liste vor dem Export durch. Das dauert etwa zehn Minuten und erspart dir die Korrekturschleife, in der jemand sagt „irgendwas stimmt da nicht“ und nicht sagen kann, was.

1. Eine Aktion pro Clip

Der häufigste Fehler bei KI-Video ist ein Prompt, der eine ganze Szene beschreibt, obwohl der Clip fünf Sekunden lang ist. In fünf Sekunden passt eine Aktion; zwei Verben werden zu Brei, weil das Modell beide bedient und sich auf keines festlegt.

Schlecht, weil es drei Einstellungen sind, die so tun, als wären sie eine:

Sie betritt die Bar, bestellt einen Drink und dreht sich dann um, als hinter ihr die Tür aufgeht.

Gut, weil es eine Aktion ist, mit Kamera und Stimmung dazu:

Eine Frau in einem regendunklen Mantel drückt eine Bartür auf und bleibt stehen, lässt den Lärm um sich herum zur Ruhe kommen. Langsame Ranfahrt, 35-mm-Film, Practicals und Neonstreulicht, Farbpalette „Warmer Film“, ruhiges Tempo, geringe Schärfentiefe, Fokus auf ihrem Gesicht.

Die zweite Version hat die Form, die Prompts hier brauchen – ein fließender Absatz, 30 bis 80 Wörter, mit Motiv, Bewegung, Kamera, Licht und Stimmung. Steht in deinem Prompt ein „dann“, hast du zwei Clips.

2. Ein Look für alle Szenen

Eine Sequenz wirkt wie eine einzige Produktion, wenn die Bildsprache gleich bleibt und sich nur der Inhalt ändert. Das Regiepult im Tool „Video“ ist genau dafür eine Reihe von Reglern – Filmart, Epoche, Tempo, Kamera, Objektiv, Blende, Licht und Farbpalette.

Leg sie vor Szene eins fest und ändere zwischen den Einstellungen nur das Motiv und die Kamerabewegung. Eine Neon-Noir-Palette in Szene eins und die Palette „Warmer Film“ in Szene drei wirken nicht abwechslungsreich – sie wirken wie zwei Videos, die versehentlich zusammengeschnitten wurden.

Drei Szenen, ein Look, und es ändert sich nur, was sich ändern soll:

Scene 1 — A courier chains her bike to a railing outside a shuttered
arcade, breath visible in the cold. Static shot.
Scene 2 — She pulls a folded envelope from her jacket and reads the
address twice. Close-up.
Scene 3 — She steps into the arcade doorway and the light swallows her
outline. Slow push-in.

Look, identical on all three — film noir, 1980s, calm tempo, 35mm film,
anamorphic lens, f/1.4, neon noir palette, practicals.

Formulier den Look einmal aus und verwende ihn wortwörtlich wieder. Konsistenz ist eine Frage von Copy-and-paste, nicht von Talent.

3. Kontinuität der Besetzung

Wenn eine Person in mehr als einem Clip vorkommt, muss sie ein Charakter sein, keine Beschreibung. Ein Charakter unter /studio/characters hat einen Namen, eine Persona und Referenzfotos, und du holst ihn mit einer @Erwähnung in den Prompt, damit dasselbe Gesicht durch jede Szene trägt.

Drei Gewohnheiten, die eine Besetzung konsistent halten:

  • Nutz im ganzen Projekt dieselben Referenzen. Mittendrin ein neues Foto einzutauschen ist dasselbe wie eine Umbesetzung.
  • Animier ein Standbild, das du schon abgenommen hast. Gib einem Clip ein Referenzbild, und die Engine animiert davon ausgehend – das verankert das Gesicht weit besser, als es noch einmal zu beschreiben.
  • Nutz einen Seed, wo die Engine ihn berücksichtigt. Gleicher Seed und gleicher Prompt ergeben denselben Take – so wird aus „noch mal versuchen“ eine kontrollierte Variation statt einer Lotterie.

Prüf das bei einem Projekt mit mehreren Szenen zuerst, denn es ist der eine Fehler, der sich später nicht beheben lässt. Farbe lässt sich graden, Tempo lässt sich schneiden – ein anderes Gesicht nicht.

4. Format und Auflösung passend zum Kanal

Render in dem Format, in dem du veröffentlichst. Render nicht in 16:9, um später auf Hochformat zuzuschneiden – du verlierst die Komposition, die das Modell tatsächlich gebaut hat, und meistens auch den Kopf der Hauptfigur.

  • 9:16 Hochformat für TikTok und Reels.
  • 1:1 quadratisch für Platzierungen im Feed.
  • 16:9 Querformat für YouTube und alles, was auf einer Website eingebettet wird.

Für Video gibt es auch noch breitere und höhere Optionen. Was jedes Seitenverhältnis mit der Komposition macht, steht unter /glossary/aspect-ratio.

Die Auflösung begrenzt die Engine, die du gewählt hast, nicht dein Ehrgeiz – manche liefern 480p und 720p, andere gehen bis 1080p. Sieh dir die Übersicht unter /models an, bevor du einem Kunden einen 1080p-Master versprichst. Einen Upscaling-Schritt, der dich hinterher rettet, gibt es nicht – der Render ist das, was du ablieferst.

Die Cliplänge ist doppelt begrenzt: durch das eigene Raster der Engine und durch deinen Plan. Kostenlose Konten rendern bis zu 10 Sekunden, bezahlte Pläne gehen bis 15, 20 und 30. Plan den Schnitt um die Länge herum, die du tatsächlich rendern kannst.

5. Ton – bewusst entschieden

Die meisten Engines rendern stummes Video. Eine davon, Veo 3 Fast, rendert eine native Tonspur – Atmo, Effekte, Dialog – zusammen mit dem Bild.

Für eine Abgabe gibt es also zwei gültige Zustände, und „hab ich vergessen“ gehört nicht dazu:

  • Nativer Ton, wenn du auf der Engine gerendert hast, die ihn erzeugt, oder
  • eine Tonspur, die du selbst angelegt hast – ein Voice-over aus /studio/voice mit einer Katalogstimme oder deiner eigenen geklonten, dazu Musik und Effekte, zusammengesetzt in deinem Schnittprogramm.

Ein Hinweis zum Bildaufbau, weil er viele überrascht: Lippensynchronisation gibt es hier nicht. Ein Voice-over über einer engen Nahaufnahme eines sprechenden Mundes passt nicht, und das merkt das Publikum innerhalb einer halben Sekunde. Leg Erzählung über Handlung, über Hände, über ein Gesicht, das zuhört – das ist ohnehin besseres Filmemachen.

6. Takes statt Umschreiben

Wenn eine Einstellung fast stimmt, lass sie noch einmal laufen, statt sie umzuschreiben. Im Cinema-Modus renderst du eins bis vier Takes derselben Szene und behältst den besten – das ist günstiger und schneller als sechs Prompt-Überarbeitungen, die jeweils drei Variablen auf einmal ändern.

Schreib um, wenn der Inhalt falsch ist – falsche Aktion, falsche Besetzung, falscher Bildausschnitt. Mach einen neuen Take, wenn der Inhalt stimmt und die Ausführung gewackelt hat. Wer die beiden verwechselt, verliert einen ganzen Nachmittag. Mehr unter /glossary/take.

7. Im Schnittprogramm korrigieren, nicht beim Rendern

Dieser Punkt spart die meisten Credits. Folgendes sind Aufgaben fürs Schnittprogramm, keine Gründe für einen neuen Render:

  • einen Clip kürzen, der eine halbe Sekunde zu lang ist,
  • Übergänge zwischen Szenen,
  • Color Grading, damit zwei Einstellungen zusammenpassen,
  • Speed Ramps, Stabilisierung, Zuschnitte innerhalb des gerenderten Bildes,
  • Voice-over, Musik und Effekte übereinanderlegen.

eroq generiert; es schneidet nicht. Exportier und stell in Premiere oder After Effects fertig, wo all das Minuten dauert und nichts kostet. Render nur neu, wenn die Pixel falsch sind, nicht wenn die Anordnung es ist.

Die Liste – kurz genug zum Anpinnen

  1. Eine Aktion pro Clip, kein „dann“.
  2. Derselbe Look in jeder Szene – Regiepult fixiert, Inhalt variiert.
  3. Derselbe Charakter und dieselben Referenzfotos im ganzen Projekt.
  4. Im Veröffentlichungsformat gerendert, in einer Auflösung, die die Engine tatsächlich liefert.
  5. Ton entschieden – nativer Ton oder eine selbst angelegte Tonspur.
  6. Den besten Take gewählt, nicht den ersten, der fertig war.
  7. Kürzungen, Übergänge und Grading im Schnittprogramm erledigt.

Dann schau es dir einmal ohne Ton an und hör es dir einmal mit geschlossenen Augen an. Was beides übersteht, kann raus.

Häufige Fragen

Warum sehen meine KI-Video-Szenen aus wie aus verschiedenen Produktionen?

Fast immer, weil sich der Look zwischen den Renders geändert hat. Leg Filmart, Epoche, Tempo, Kamera, Objektiv, Blende, Licht und Farbpalette einmal fest, verwende sie wortwörtlich wieder und variiere nur das Motiv und die Kamerabewegung.

Kann ich einem KI-Videoclip lippensynchronen Dialog hinzufügen?

Nein – eine Funktion für Lippensynchronisation gibt es nicht. Render entweder auf der Engine, die eine native Tonspur erzeugt, oder leg ein Voice-over unter einen Bildausschnitt, der keinen Mund zeigt, der den Satz spricht.

Sollte ich einen Clip neu rendern oder im Schnittprogramm korrigieren?

Korrigier im Schnittprogramm, wann immer das Problem die Anordnung ist – Länge, Übergänge, Farbabgleich, Tempo, Ton. Render nur neu, wenn der Inhalt selbst falsch ist, und nimm lieber einen zusätzlichen Take als einen umgeschriebenen Prompt.

Geh die Liste durch und veröffentliche das Ergebnis dann unter /community – oder fang den nächsten Clip im Tool „Video“ an.

Tagsqualityworkflowvideochecklist

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.