Blog/guides·8. Sept. 2026·6 Min.·vom eroq-Team
Hände und Gesichter in KI-Bildern – was wirklich hilft
Sechs Finger und wandernde Gesichter haben dieselbe Ursache. Drumherum komponieren, mit Referenzen verankern, vier Takes rendern, den besten behalten.
Alles im Bild ist wunderschön, bis auf die Hand: fünfeinhalb Finger und ein Daumen, der in die falsche Richtung zeigt. Oder das Gesicht ist hübsch – nur eben nicht das Gesicht deines Charakters. Das sind die zwei klassischen Fehler von Diffusions-Bildmodellen, mit einem besseren Adjektiv verschwinden sie nicht, und die praktische Antwort darauf ist nicht die, zu der die meisten greifen.
Warum Hände so schwierig sind
Ein Diffusionsmodell hat kein Skelett. Es weiß nicht, dass eine Hand vier Finger und einen Daumen hat, dass sich Finger nicht durchdringen oder dass ein Handgelenk mit genau einer Hand verbunden ist. Es weiß, wie Hände über eine riesige Menge von Bildern hinweg aussehen, und rekonstruiert etwas mit genau diesem statistischen Beigeschmack.
Hände sind für diesen Ansatz in jeder Hinsicht gleichzeitig der schlimmste Fall. Sie sind klein im Bild und bekommen deshalb am wenigsten vom Aufmerksamkeitsbudget des Modells ab. Sie verdecken sich ständig selbst. Sie tauchen in völlig unterschiedlichen Posen auf, sodass der Durchschnitt aller Hände, die das Modell gesehen hat, ein Brei möglicher Fingerzahlen ist. Und wir erkennen eine falsche Hand extrem gut – dasselbe Bild mit einem leicht falschen Ellbogen wirkt völlig normal.
Gesichter scheitern anders. Ein Gesicht wird überzeugend gerendert und ist einfach jedes Mal ein anderes Gesicht, weil nichts in einem Text-Prompt eine Identität festnagelt. „Eine Frau in ihren Dreißigern mit dunklen Haaren“ beschreibt eine Million Menschen, und bei jedem Durchgang bekommst du eine andere.
Komponier das Problem aus dem Bild
Die schnellste Lösung ist eine Frage der Bildgestaltung, nicht der Technik. Gib den Händen eine Aufgabe, die sie verbirgt, oder nimm sie ganz aus dem Bild.
Hände, die einen Becher halten, in den Taschen stecken, einen Riemen umfassen, auf dem Rücken liegen oder vom Bildausschnitt unterhalb des Ellbogens abgeschnitten werden – all das beseitigt die Fehlerquelle, ohne das Bild zu opfern. Es kostet dich nichts; ein gelungenes Porträt ist ein gelungenes Porträt.
Eine Frau Anfang dreißig lehnt an einer Café-Theke, beide Hände um einen warmen Becher gelegt, das dunkle Haar zurückgestrichen, aufgenommen aus Brusthöhe mit einem weichen Porträtobjektiv bei f/1.4, Fensterlicht von links, eine ruhige Stimmung am späten Vormittag.
In diesem Prompt kommen Hände vor, und sie tun eine einzige, klar lesbare Sache an einem festen Gegenstand. Vergleich das mit „eine Frau, die beim Reden gestikuliert“ – eine Einladung, sieben Finger zu rendern.
Die zwei Regler, die du wirklich hast
Alle drei Bildmodelle – Image One, Image Anime und Image Art – nehmen einen Negativ-Prompt und eine CFG-Scale an, und das sind die eigentlichen Stellschrauben.
Anatomie gehört in den Negativ-Prompt. „extra fingers, fused fingers, deformed hands, extra limbs, distorted face“ (zusätzliche Finger, verwachsene Finger, deformierte Hände, zusätzliche Gliedmaßen, verzerrtes Gesicht) ist langweilig und funktioniert besser als jede Menge positiver Beschreibung, weil du von einem Bereich wegsteuerst, statt darauf zu hoffen, in einem anderen zu landen.
CFG reicht von 1 bis 20 und legt fest, wie wörtlich das Modell deinem Text folgt. Niedrige Werte schweifen ab und sehen oft besser aus; hohe Werte gehorchen und wirken oft steif und überzeichnet. Wird dein Prompt ignoriert, dreh den Wert etwas hoch. Sieht das Bild verbrannt und nach Plastik aus, dreh ihn runter. Es gibt keinen richtigen Wert, nur einen, der zu diesem Prompt passt.
Ein Referenzfoto hält ein Gesicht fest
Text kann keine Identität festnageln. Ein Referenzbild schon. Häng bis zu vier an, und das Gesicht kommt über mehrere Renders hinweg erkennbar gleich zurück.
Zwei Verhaltensweisen solltest du kennen, bevor du dich darauf verlässt. Mit genau einer Referenz wechselt die Engine in einen Bearbeitungsdurchgang rund um dieses Foto – genau das hält die Identität fest, und deshalb bestimmt auch das Ausgangsfoto den Bildausschnitt, während das gewählte Seitenverhältnis für diesen Render ignoriert wird. Mit zwei oder mehr Referenzen lenken sie das Ergebnis, statt es zu bestimmen, und dein gewähltes Format gilt ganz normal.
Brauchst du dasselbe Gesicht für ein ganzes Shooting statt für einen einzelnen Render, bau einmal einen Charakter. Er trägt einen Namen, eine Persona und seine Referenzfotos, du rufst ihn im Prompt mit einer @-Erwähnung auf, und dieselbe Besetzung funktioniert auch im Tool „Video“.
Vier im Batch, einen behalten
Der ehrliche Workflow für Hände heißt Menge. Ein Bild kostet 10 Credits, die Batch-Steuerung geht bis vier, und der ganze Batch wird beim Absenden abgerechnet – ein Batch von vier ist also eine einzige Abbuchung von 40 Credits, und jeder Take, der gar nicht erst gerendert wird, wird einzeln erstattet. Vier Durchgänge desselben Prompts liefern meist mindestens ein sauberes Paar Hände, und den besten auszuwählen dauert fünf Sekunden.
Das sind zu den Preisen des Einstiegspakets ungefähr $0.40 für eine Auswahl, aus der du wählst. Plane dein Budget in Takes statt in Bildern; mehr zur Rechnung steht in Takes im Batch, ohne Credits zu verbrennen.
Zwei Regeln machen Batches lohnend. Ändere zwischen zwei Batches genau eine Sache, sonst weißt du nicht, was geholfen hat. Und schreib den Negativ-Prompt vor dem ersten Batch, nicht nach dem dritten – er ist die Variable mit der größten Wirkung auf die Anatomie und dem geringsten Aufwand.
Es gibt keinen Reparaturschritt – plane neue Renders ein
Jetzt der Teil, den andere Leitfäden verstecken. Hier gibt es kein Inpainting, keinen Upscaler und keinen Face-Swap – du kannst die misslungene Hand nicht auswählen und nur diesen Bereich neu generieren. Hängst du das fehlerhafte Bild als Referenz an, wird das ganze Bild drumherum neu gerendert, und das ist ein neuer Take, keine Reparatur. Die Lösung für eine kaputte Hand ist jedes Mal ein weiterer Render.
Das prägt den ganzen Workflow. Du komponierst vorausschauend, statt hinterher zu reparieren, du arbeitest in Batches, statt einen einzelnen Durchgang zu perfektionieren, und du behältst das Rezept. Jeder Render wird automatisch mit allen Einstellungen in deiner Bibliothek gespeichert, und Remix lädt dieses Rezept zurück ins Tool, sodass du ein Wort ändern und neu starten kannst. Bilder haben bei eroq keinen Seed, das gespeicherte Rezept ist also dein Mechanismus für Reproduzierbarkeit – keine Zahl, die du dir notierst.
Braucht ein Bild wirklich eine Retusche, lade es herunter und retuschier es in dem Programm, das du ohnehin hast. Das ist eine vernünftige Antwort und ehrlicher, als so zu tun, als könnte ein Prompt das erledigen.
Öffne das Tool „Bild“ und schick deinen nächsten Prompt als Batch von vier los, mit einem richtigen Negativ-Prompt.
Häufige Fragen
Repariert ein Negativ-Prompt wirklich Hände?
Er hilft mehr als alles andere, was du tippen kannst, weil er das Modell von dem Bereich wegsteuert, in dem missgebildete Anatomie zu Hause ist, statt darauf zu hoffen, dass du dich mit Beschreibungen herausmanövrierst. Erwarte, dass er deine Trefferquote über einen Batch hinweg erhöht – nicht, dass er einen einzelnen Render garantiert. Kombinier ihn mit einer Komposition, die den Händen eine klare Aufgabe gibt.
Warum ändert sich das Gesicht zwischen zwei Renders mit demselben Prompt?
Weil Text keine Identität festnagelt – dein Prompt beschreibt eine Kategorie von Menschen, und das Modell wählt jedes Mal ein anderes Mitglied dieser Kategorie. Häng ein Referenzfoto an oder bau einen Charakter mit Referenzfotos, und das Gesicht kommt konsistent zurück. Das ist hier der einzige Mechanismus, der ein Gesicht hält.
Kann ich einen Render in eroq hochskalieren oder retuschieren?
Nein. Es gibt keinen Upscaler, kein Inpainting und keinen Face-Swap, ein fehlerhafter Render wird also durch erneutes Rendern behoben, nicht durch das Flicken eines Bereichs. Gibst du das Bild als Referenz zurück, entsteht drumherum ein neuer Take – das ist etwas anderes. Lade die Datei herunter und retuschier sie in deinem eigenen Programm, wenn sie wirklich repariert werden muss.
Wie viele Takes sollte ich pro brauchbarem Bild einplanen?
Vier sind der praktische Standard für alles mit Händen, deshalb hört die Batch-Steuerung auch dort auf. Bei 10 Credits pro Bild sind das 40 Credits für eine Auswahl, aus der du wählen kannst, und Fehlschläge innerhalb eines Batches werden automatisch erstattet. Für ein einfaches Porträt ohne Hände im Bild reichen meist ein oder zwei.
Mach das mit den Modellen hinter diesem Artikel – starte mit 50 Gratis-Credits oder sieh dir alle Engines und ihre Preise an.