Blog/guides·5. Sept. 2026·6 Min.·vom eroq-Team
Warum KI-Videos verzerren – krumme Wände und rutschende Glieder
Krumme Architektur, rutschende Gliedmaßen, schmelzende Objekte – eine Ursache: Die Engine hat kein 3D-Modell deiner Szene. Das hilft wirklich dagegen.
Die Wand hinter deinem Motiv wölbt sich wie ein Zerrspiegel auf dem Jahrmarkt. Ein Arm verschwindet hinter einem Tisch und kommt als zwei Arme wieder hervor. Eine Tasse rutscht über eine Arbeitsplatte, die sie nie berührt hat. Kein Fehler, keine Ablehnung, der Clip wurde genau wie verlangt gerendert – und ist trotzdem unbrauchbar. Verzerrung ist kein Bug, den du melden kannst. Sie gehört zur Form dieser Technologie, und wenn du weißt, warum sie entsteht, kannst du den Großteil davon umschiffen. (Ist dein Render gar nicht erst angekommen, ist das ein anderes Problem mit eigenem Vorgehen, behandelt in Warum KI-Video-Renders fehlschlagen.)
Die Engine weiß nicht, was ein Tisch ist
Ein Videomodell baut deine Szene nicht auf, leuchtet sie nicht aus und fotografiert sie nicht. Es sagt Frames voraus. Darunter liegt keine 3D-Geometrie, die Figur hat kein Skelett, und es gibt kein Objekt, das über die Zeit bestehen bleibt und seine Identität behält. Was es gibt, ist eine sehr gute Vermutung, wie der nächste Frame aussehen sollte – ausgehend vom vorherigen und von deinem Prompt.
Diese Vermutung ist hervorragend, solange das Bild in Gebieten bleibt, die das Modell schon millionenfach gesehen hat – ein Gesicht frontal, eine langsame Ranfahrt, ein Körper, der geradeaus geht. Sie bricht dort zusammen, wo das Modell Geometrie erfinden muss, die es nie beobachtet hat: eine Hand, die vor einer anderen Hand vorbeizieht, ein Stuhlbein, das hinter einem Bein verschwindet und wieder auftaucht, eine Spiegelung, die zum Gespiegelten passen muss. Die Engine weiß nicht, dass es diese Zwänge gibt. Sie rendert die plausibelste Fortsetzung, und plausibel ist nicht dasselbe wie konsistent.
Jede Lösung unten ist deshalb dieselbe Lösung in anderer Verkleidung: Gib dem Modell weniger zu erfinden.
Eine Handlung pro Clip
Die zuverlässigste Ursache für zerlaufenes Material ist ein Prompt, der eine Abfolge beschreibt. „Sie nimmt das Glas, dreht sich zum Fenster, und die Kamera fährt zurück, während die Lichter angehen“ sind vier Ereignisse in fünf Sekunden. Die Engine versucht alle vier, vermischt sie und liefert dir eine Person, die gleichzeitig hebt und sich dreht, während sich der Raum hinter ihr auflöst.
Schreib eine Handlung. Braucht die Einstellung das Glas und das Fenster, sind das zwei Clips und ein Schnitt. Genau dafür gibt es den Filmmodus im Tool „Video“ – ein Storyboard, in dem jede Szene einzeln gerendert und zusammengesetzt abgespielt wird.
Für die Kamera gilt dieselbe Regel. Zwei Kamerabewegungen in einem Prompt kämpfen gegeneinander, und nur eine überlebt. Das Eingabefeld liest geschriebene Regieanweisungen aus deinem Text und setzt den passenden Parameter, einen pro Art – und welche von zwei konkurrierenden Bewegungen gewinnt, entscheidet das Lexikon, nicht die Reihenfolge, in der du sie getippt hast. Schreib „langsame Ranfahrt“ oder „Handkamera“, nie beides, und überlass den Rest des Looks dem Regiepult.
Kürzere Clips verbiegen sich weniger
Instabilität summiert sich über die Zeit. Eine Einstellung, die nach drei Sekunden sauber ist, beginnt nach acht oft zu driften, weil jeder Frame die Fehler des vorherigen erbt. Wenn eine Einstellung verzerrt, halbier sie, bevor du sie umschreibst.
Das ist auch der günstige Weg, herauszufinden, ob der Prompt oder die Engine schuld ist. Ein Drei-Sekunden-Entwurf mit Seedance 1.0 Lite kostet 72 Credits – die Clip-Preise gehen von einem Fünf-Sekunden-Anker aus plus einem Grenzpreis für jede weitere Sekunde, kurz ist also wirklich günstiger und nicht bloß anteilig. Hält die Drei-Sekunden-Version zusammen, ist dein Prompt in Ordnung und die Länge war das Problem. Verzerrt auch sie, beschreibst du etwas, das diese Engine nicht bauen kann.
Nimm die Engine, die die Physik beherrscht
Engines sind nicht austauschbar, und vieles, was „verzerrt aussieht“, ist eine Einstellung, die von der falschen Engine verlangt wurde.
- Körper in Bewegung und Gesichter, die Gesichter bleiben müssen – Kling 2.5 Turbo, hier zugleich die einzige Video-Engine mit nativem Negativ-Prompt, sodass „no extra limbs, no distorted hands“ (keine zusätzlichen Gliedmaßen, keine verzerrten Hände) tatsächlich irgendwo ankommt.
- Gewicht, Fallen, Spritzen, alles, was der Schwerkraft gehorchen muss – Hailuo 02, deren ganzer Charakter filmische Physik und dramatisches Licht ist.
- Lange Takes, die kohärent bleiben müssen – Seedance 2.5 läuft 4 bis 30 Sekunden und hält seine Geometrie über diese Spanne besser als Engines, die für fünf gebaut sind.
- Eine Szene, die ein Anbieter ablehnt – Motion One, die eigene unzensierte Engine von eroq, auf jedem Konto. Die Premium-Engines werden von ihren Anbietern moderiert und lehnen lieber ab, als etwas Halbgares zu rendern.
Eine Engine auszuprobieren, die dein Plan nicht enthält, kostet nichts und verrät dir trotzdem etwas – die Sperre antwortet, bevor irgendetwas berechnet wird.
Verankere das Motiv mit einem Frame
Die mit Abstand wirksamste Änderung: Lass die Engine das Motiv gar nicht erst erfinden. Render zuerst das Standbild, gib es frei und animier es dann. Bei Bild-zu-Video ist der erste Frame fest, das Modell rät also nicht mehr, wie dein Charakter aussieht – nur noch, was er als Nächstes tut. Damit fällt eine ganze Kategorie von Drift weg.
Drei Wege, diesen Anker zu setzen: ein Referenzfoto im Eingabefeld, ein Charakter, dessen Fotos dasselbe Gesicht durch alle Einstellungen tragen, oder Animieren an einem beliebigen Bild in deiner Bibliothek.
Alle drei Seedance-Engines gehen noch weiter und nehmen neben einem Startframe auch einen Endframe an; den Weg dazwischen interpolieren sie. Ein Loop, eine Enthüllung oder eine Bewegung, die auf einem ganz bestimmten Bild landen muss, ist dann kein Glücksspiel mehr.
Ein Beispiel Schritt für Schritt
Hier eine schlecht geschriebene Einstellung, sinngemäß: Eine Frau geht über einen Markt, während sich Händler um sie herum bewegen, die Kamera kreist, sie nimmt eine Frucht in die Hand, goldene Stunde, anamorphotisch, Handkamera, 35 mm, eine Menschenmenge. Vier Handlungen, drei Kameraanweisungen, eine unbestimmte Zahl von Statisten.
Die Lösung ist ein Absatz mit genau einem von allem:
Eine Frau in einem Leinenhemd bleibt an einem Marktstand stehen und dreht einen Pfirsich in der Hand, betrachtet ihn genau; langsame Ranfahrt von einer Halbnahen bis zur Nahaufnahme ihrer Hände, spätes Licht der goldenen Stunde streift schräg über den Stand, Staub in der Luft, eine ruhige und gelassene Stimmung.
Neunundvierzig Wörter. Ein Motiv, eine Handlung, eine Kamerabewegung, eine Lichtquelle, eine Stimmung. Die Händler und die Kreisfahrt werden ein zweiter Clip.
Was nicht hilft
Mehr Adjektive. „photorealistic, highly detailed, consistent anatomy, no artifacts“ verschwendet deinen Prompt auf Anweisungen, für die die Engine keinen Mechanismus hat, und verwässert die Wörter, die tatsächlich steuern.
Und die ehrliche Grenze: Einen Reparaturschritt gibt es hier nicht. eroq hat kein Inpainting, keinen Upscaler, keinen Face-Swap und keine Schnitt-Timeline, du kannst einen verbogenen Türrahmen also nicht wegretuschieren. Die Lösung für einen verzerrten Clip ist immer ein weiterer Render – genau deshalb zählt die günstige Drei-Sekunden-Diagnose hier mehr als in einem Tool, mit dem du das Ergebnis flicken könntest. Lade den gelungenen Take herunter und bring ihn nach Premiere oder After Effects, wenn er echte Postproduktion braucht.
Öffne das Tool „Video“ und probier zuerst die Drei-Sekunden-Version.
Häufige Fragen
Warum verbiegt sich Architektur, wenn sich die Kamera bewegt?
Eine bewegte Kamera verlangt vom Modell, Teile der Szene zu zeigen, die es noch nie gerendert hat, und es hat keinen Grundriss, aus dem es sie ableiten könnte. Gerade Linien sind die Stellen, an denen diese Erfindung am deutlichsten sichtbar wird – deshalb biegen sich Wände, Türrahmen und Fenstersprossen als Erstes. Langsamere und kürzere Bewegungen geben ihm weniger neue Geometrie zu erfinden.
Verringert eine höhere Auflösung das Verzerren?
Nein. Die Auflösung ändert, mit wie vielen Pixeln das Artefakt gezeichnet wird, nicht, ob es entsteht – ein 1080p-Render einer schlechten Einstellung ist eine schärfere schlechte Einstellung. Was wirklich etwas bewegt, sind Cliplänge, die Zahl der Motive und wie gut die Engine zur Bewegung passt.
Kann ich einen verzerrten Clip reparieren, ohne ihn neu zu rendern?
Nicht in eroq. Es gibt hier kein Inpainting, keinen Upscaler und keine Schnitt-Timeline, die einzige Lösung ist also ein weiterer Render – meist kürzer, mit einer Handlung oder verankert durch einen Startframe. Lade den Clip herunter und bring ihn nach Premiere oder After Effects, wenn er echte Nachbearbeitung braucht.
Hilft ein Negativ-Prompt gegen Verzerrungen?
Nur bei Kling, der einzigen Video-Engine mit nativem Negativ-Prompt. Überall sonst wird das Feld angenommen und von der Engine dann stillschweigend ignoriert – es tut also nicht das, was du denkst. Steck die Mühe bei den anderen Engines lieber in einen kürzeren Clip und einen Startframe.
Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.