Rabatt auf Premium-Pläne, wenn du dich registrierstRabatt sichern

Blog/guides·11. Sept. 2026·6 Min.·vom eroq-Team

Flackern und Morphing im KI-Video: warum Gesichter abdriften

Kleidung wechselt mittendrin die Farbe, Gesichter verrutschen, Hintergründe brodeln: was zeitliche Instabilität ist, was sie mindert und was nichts bringt.


Der Clip läuft, und zwei Sekunden lang ist er perfekt. Dann wird die Jacke von Marineblau zu Schwarz, das Logo an der Wand ordnet sich zu einem anderen Logo um, und irgendwo um Sekunde vier wird das Gesicht deiner Figur zu einem nahen Verwandten deiner Figur. Nichts ist fehlgeschlagen. Das ist zeitliche Instabilität, und sie ist der häufigste Grund, warum ein technisch erfolgreicher Render trotzdem unbrauchbar ist.

Das Modell schaut sich sein eigenes Material nicht an

Eine Video-Engine erzeugt Frames auf Basis dessen, was davor kam, und deines Prompts. Was sie nicht tut: ein dauerhaftes Gedächtnis der Szene führen – nirgends gibt es eine Variable, die sagt diese Jacke ist marineblau oder das ist dieselbe Person wie vor drei Sekunden. Konsistenz über Frames hinweg ist eine emergente Eigenschaft davon, dass das Modell gut im Fortsetzen ist, keine Garantie, die es durchsetzt.

Drift ist also der Normalfall und Kohärenz die Leistung. Alles, was Flackern reduziert, funktioniert, indem es das Fenster verkleinert, in dem das Modell abschweifen kann, oder indem es festnagelt, wovon es ausgeht.

Wo es zuerst auftaucht

Instabilität ist nicht gleichmäßig verteilt. Sie trifft immer dieselben Dinge in derselben Reihenfolge – und das macht sie vorhersehbar:

  • Kleine Gesichter. Ein Gesicht, das ein Zehntel des Bildes einnimmt, bekommt ein Zehntel der Aufmerksamkeit und wird alle paar Frames anders rekonstruiert.
  • Hände und Finger, aus demselben Grund, aus dem sie in Standbildern kaputtgehen – plus Bewegung.
  • Gedruckter Text und Logos. Keine aktuelle Engine hält lesbaren Text über eine ganze Einstellung. Buchstaben ordnen sich um. Geh davon aus, dass jeder Text im Bild garantiert brodelt.
  • Gemusterte Stoffe. Streifen, Karos und Prints werden ständig neu ausgewürfelt. Einfarbige Kleidung ist drastisch stabiler als ein Mantel mit Fischgrätmuster.
  • Menschenmengen und Nebenfiguren. Alle, auf die sich das Modell nicht konzentriert, morphen im Hintergrund munter vor sich hin.
  • Unruhige Hintergründe – Laub, Regen, Wasser, Feuer, Rauch. Für die Engine sieht das nach Bewegung aus, und sie erfindet es fröhlich in jedem Frame neu.

Wenn du Morphing siehst, geh diese Liste durch, bevor du den Prompt anfasst. Die Hälfte aller Beschwerden über Flackern ist ein gemustertes Hemd oder ein Schild an der Wand.

Was wirklich hilft

Fünf Änderungen, absteigend danach sortiert, wie viel sie bringen.

Kürzer rendern. Drift summiert sich, ein Fünf-Sekunden-Clip hat also weniger Raum zum Abschweifen als ein Zehn-Sekunden-Clip. Wenn eine Einstellung bei zehn Sekunden morpht, hält dieselbe Einstellung bei fünf oft. Zwei saubere Fünf-Sekunden-Clips, aneinandergeschnitten, wirken außerdem besser als ein wackliger Zehner.

Von einem Frame aus starten. Bild-zu-Video fixiert den ersten Frame, sodass das Modell von einem festen, abgenommenen Bild ausgeht, statt das Motiv zu erfinden und es dann zu vergessen. Das ist der mit Abstand größte Hebel, und der Workflow ist einfach: Standbild rendern, abnehmen, in deiner Bibliothek auf Animieren klicken.

Den Hintergrund vereinfachen. Eine Wand, ein Himmel, geringe Schärfentiefe. Alles, was du in Unschärfe tauchst, kann nicht brodeln – und genau das kaufst du dir hier eigentlich mit „f/1.4“ im Prompt.

Ein Motiv. Zwei Personen sind mehr als doppelt so schwer wie eine. Die Aufmerksamkeit der Engine teilt sich, und die Person, auf die sie gerade nicht schaut, verformt sich.

Eine Kamerabewegung, langsam. Schnelle Bewegungen legen ständig neue Geometrie frei, und neue Geometrie ist erfundene Geometrie. Eine langsame Ranfahrt ist das Stabilste, was du drehen kannst.

Ein Prompt, der auf allen fünf aufbaut, bereit zum Einfügen:

Ein Mann in einem schlichten grauen Pullover sitzt an einem leeren Küchentisch und blickt zum Fenster hoch, ganz ruhig; langsame Kamerazufahrt aus einer halbnahen Einstellung, weiches Fensterlicht von links, kahle Wand hinter ihm, geringe Schärfentiefe, eine stille, geduldige Stimmung.

Einfarbiger Stoff, ein Motiv, eine Handlung, eine langsame Bewegung, nichts im Hintergrund, das neu erfunden werden könnte.

Ein Seed macht deine Vergleiche ehrlich, nicht deinen Clip stabil

Alle drei Seedance-Engines berücksichtigen einen Seed – derselbe Seed mit demselben Prompt ergibt denselben Take. Das hält man leicht für eine Stabilitätsfunktion. Ist es aber nicht.

Ein Seed reduziert kein Morphing innerhalb einer Einstellung. Er macht die Einstellung wiederholbar – und genau dadurch kannst du ein Wort ändern und wissen, dass der Unterschied, den du siehst, von diesem Wort kommt und nicht vom Würfel. Das ist enorm nützlich, um Flackern zu diagnostizieren, und nutzlos, um es zu heilen. Eine praktische Folge, die du dir merken solltest: Ein Stapel von vier Takes mit festem Seed liefert vier identische Clips – entferne den Seed also, wenn du wirklich Abwechslung willst. Seeds und der Remix-Workflow erklärt das ausführlicher.

Für eine Einstellung, die an einem bestimmten Punkt enden muss – ein Loop, eine Enthüllung, ein Übergang –, nimmt die Seedance-Familie außerdem ein Paar aus Start- und Endframe und interpoliert dazwischen. Beide Enden fixiert: Enger lässt sich ein Clip hier nicht führen – und eng geführt heißt stabil.

Was nicht hilft

Adjektive über Konsistenz. „Konsistentes Gesicht, kein Morphing, stabil, kohärent“ sind Wörter über das Ergebnis, nicht über das Bild. Das Modell hat keinen Mechanismus dafür, und sie verwässern die Wörter, die es tatsächlich steuern.

Ein Negativ-Prompt, auf den meisten Engines. Das muss man klar sagen, weil das Feld überall angenommen wird: Der Negativ-Prompt für Video ist nur auf Kling 2.5 Turbo nativ. Bei Motion One, den Seedance-Engines, Hailuo und Veo nimmt die API ihn an und verwirft ihn dann stillschweigend, bevor die Engine ihn sieht. Wenn „no distorted faces“ (keine verzerrten Gesichter) im Video etwas bewirken soll, musst du auf Kling sein.

Höhere Auflösung. 1080p rendert das Morphing detailreicher. Mehr nicht.

Einen Look über eine ganze Sequenz halten

Stabilität innerhalb einer Einstellung ist ein Problem; eine Figur über zwölf Einstellungen hinweg wiedererkennbar zu halten, ein anderes – mit einer anderen Antwort: ein Charakter mit Referenzfotos, in jeder Szene wiederverwendet, sodass jeder Clip vom selben Gesicht ausgeht statt vom selben Satz. Konsistente Charaktere im KI-Video behandelt diese Seite ausführlich.

Beides lässt sich gut kombinieren. Verankere die Identität mit einem Charakter, verankere das Bild mit einem Bild-zu-Video-Start, halte die Clips kurz und schneide. Das meiste Material, das stabil aussieht, wurde so zusammengesetzt und nicht in einem Take gerendert.

Öffne das Tool „Video“ und probier deine morphende Einstellung mit halber Länge und einem Startframe.

Häufige Fragen

Warum wechselt Kleidung mitten im Clip die Farbe?

Weil nichts in der Engine die Farbe speichert – jeder Frame wird neu vorhergesagt, und ein Kleidungsstück mit Muster oder uneindeutigem Farbton driftet am schnellsten. Einfarbige, kontrastreiche Kleidung übersteht eine Einstellung weit besser als Streifen oder Prints. Ein Start von einem Referenzframe fixiert die Farbe außerdem ab Frame eins.

Verhindert ein Seed, dass mein Video morpht?

Nein. Ein Seed macht einen Take reproduzierbar, damit du zwei Versionen fair vergleichen kannst, aber er macht die Frames innerhalb dieses Takes nicht konsistenter. Er ist ein Diagnosewerkzeug und wird nur auf den Seedance-Engines berücksichtigt. Was Drift wirklich reduziert, sind kürzere Clips und ein Startframe.

Kann ich Text oder ein Logo in einem KI-Clip lesbar halten?

Auf keiner Engine hier zuverlässig. Buchstaben werden pro Frame rekonstruiert und ordnen sich um – plane also, Titel, Logos und Bauchbinden nach dem Render in deinem Schnittprogramm hinzuzufügen, statt sie im Prompt zu verlangen. Lass stattdessen im Bild Platz dafür.

Warum bewirkt der Negativ-Prompt in meinem Video nichts?

Weil er nur auf Kling 2.5 Turbo eine native Steuerung ist. Die anderen Video-Engines akzeptieren das Feld und ignorieren es – was du eingetippt hast, erreicht das Modell also nie. Verleg die Einstellung entweder auf Kling oder steck die Mühe in einen kürzeren Clip, ein Motiv und einen einfacheren Hintergrund.

Tagstroubleshootingai-videorender-qualityconsistency

Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.