Zeitlich begrenztes Angebot! Sichere dir ein Jahr grenzenlose Kreativität mit Jahresplänen mit BIS ZU 27 % RABATT.

Plan ansehen ›
OpenArt Arena

Welches KI-Bildmodell stellt Gesichter und Hände richtig dar?

Evelyn Sep 22, 2026 5 Min. Lesezeit
Zusammenfassen mit:
Which AI Image Model Gets Faces and Hands Right?

Das globale Leaderboard für kreative Intelligenz

Welches KI-Bildmodell stellt Gesichter und Hände richtig dar? Wir haben die Werte geprüft

Sieben Bildmodelle stehen auf den Bild-Boards der OpenArt Arena, und die Wahl zwischen ihnen für menschliche Motive läuft meist auf Raterei hinaus. Wir haben die veröffentlichten Kriterienwerte herausgezogen – auch die, die die Übersichtsrankings verstecken – und sie den tatsächlichen Kosten und der Geschwindigkeit jedes Modells gegenübergestellt.

  • Standardwahl für Personen: Seedream 5.0 Pro. Führt in „Gesamt“ mit 1.051 und in „Film“ mit 1.074 und hält mit 1.037 den Spitzenwert bei Referenztreue – genau das, was ein Gesicht von Aufnahme zu Aufnahme wiedererkennbar hält.
  • Am fotorealistischsten: Nano Banana Pro. Erreicht 1.184 beim Realismus-Kriterium des Film-Boards, die höchste veröffentlichte Zahl der sieben.
  • Am besten zum Reparieren einer misslungenen Hand: GPT Image 2. Führt bei der Bildbearbeitung mit 1.045, kostet mit 0,057 $ pro Bild am wenigsten und akzeptiert 16 Referenzbilder.

So schneiden die sieben Modelle im Vergleich ab

Die Arena lässt anonyme Eins-gegen-eins-Duelle abstimmen und meldet Elo-artige Werte. Grok Imagine 2.0 liegt bei 1.000 als fester Anker, jede Zahl darunter liest sich also als besser oder schlechter als Grok. Werte lassen sich nur innerhalb einer Spalte vergleichen.

Modell Insgesamt Film Realismus Bearbeitung Referenztreue Preis Am besten geeignet für
Seedream 5.0 Pro 1,051 1,074 1,142 1,037 1,037 $0.09 Standardwahl für Personen
GPT Image 2 1,047 1,058 1,058 1,045 1,035 $0.057 Eine Hand oder ein Gesicht ausbessern
Nano Banana Pro 1,008 1,059 1,184 1,035 1,002 $0.134 Fotorealistischste Haut
Grok Imagine 2.0 1,000 1,000 1,000 1,000 1,000 $0.06 Benchmark-Anker
Nano Banana 2 985 998 1,064 1,032 991 $0.101 Schnelle 4K-Entwürfe
Qwen Image 3.0 966 964 975 992 973 $0.075 Stilvielfalt
Flux.2 Pro 927 978 1,022 955 881 $0.08 Am schwächsten bei der Identität

Quelle: OpenArts Arena-Bestenliste, Image-Boards, v1.0.

Eine Anmerkung dazu, was diese Werte abdecken und was nicht, dann geht es weiter. Arena bewertet Realismus, Identitätskonsistenz und Bearbeitungspräzision. Es führt keinen separaten Anatomie-Test durch, hier zählt also niemand für dich die Finger. Realismus ist der nächste veröffentlichte Näherungswert, und der Abstand zwischen Nano Banana Pro mit 1.184 und Qwen Image 3.0 mit 975 ist groß genug, um brauchbar zu sein. Modelle mit überlappenden Konfidenzintervallen sind als Gleichstand zu werten.

Welche Modelle sich am besten für menschliche Motive eignen

Seedream 5.0 Pro

Der sicherste Standard. Er führt bei Overall und Film, holt sich mit 1.103 den Spitzenwert für Kreativität, und seine 1.037 bei Reference Adherence bedeuten: Ein Gesicht, das du ihm vorgibst, kommt meist als dieselbe Person zurück. Er unterstützt außerdem transparente Hintergründe – das schafft sonst nur GPT Image 2.

Der Haken sind Geschwindigkeit und Spielraum. Er ist auf 2K begrenzt, nimmt 10 Referenzbilder und braucht 88,9 Sekunden für ein 1K-Bild. Bei Graphic Design fällt er außerdem auf 975 ab – wenn dein Bild also saubere Typografie braucht, generiere die Person hier und setze den Text woanders. Alle Specs findest du auf der Modellseite Seedream 5.0 Pro.

GPT Image 2

Das Reparaturwerkzeug. Es führt bei Image Editing mit 1.045 und ganz nebenbei auch bei Prompt Adherence mit 1.041 – was zählt, wenn du genau angibst, welche Hand was hält. Es gibt 4K aus, akzeptiert 16 Referenzen, nimmt einen Prompt mit 32.000 Zeichen und läuft in 44,8 Sekunden.

Seine Schwäche ist die Ästhetik im Vergleich zur Spitze des Boards: 1.030 bei subjektiver Ästhetik gegenüber Seedreams 1.043 und 1.058 bei Realismus gegenüber Nano Banana Pros 1.184. Woanders generieren, hier korrigieren. Das GPT Image 2 Modellseite listet die Bearbeitungsmodi auf.

Nano Banana Pro

Der Realismus-Spitzenreiter, mit Abstand. 1.184 bei Realismus und 1.059 bei Film, in 4K mit 14 Referenzen und flotten 39,9 Sekunden.

Zwei Dinge halten es zurück. Mit 0,134 $ pro Bild ist es das teuerste der sieben, etwa 2,4-mal so teuer wie GPT Image 2. Und es erreicht 981 bei Subjektiver Ästhetik und 952 bei Grafikdesign, bei beiden unter dem Anker – es wirkt also öfter technisch überzeugend als schön.

Nano Banana 2

Das Entwurfsmodell. Google dokumentiert es als Gemini 3.1 Flash Image. Mit 18,1 Sekunden und 4K bei 14 Referenzen ist es der schnellste Weg, eine Komposition zu finden, die dir gefällt, bevor du dich auf ein langsameres Modell festlegst. Der Realismus hält mit 1.064 mit. Der Gesamtwert liegt bei 985, behandle die Ausgabe also als Skizze. Spezifikationen und Beispiele findest du auf der Nano Banana 2 Modellseite.

Welche Modelle du für menschliche Motive meiden solltest

Flux.2 Pro erreicht 881 bei Referenztreue, den niedrigsten der sieben, was es für Charakterarbeit ausschließt. Qwen Image 3.0 erreicht 915 bei der Prompt-Treue, sodass eine spezifische Pose wie „nur linke Hand, den Griff umfassend“ eher falsch zurückkommt, und mit 99,1 Sekunden ist es das langsamste Modell auf dem Board. Grok Imagine 2.0 ist der Anker, nützlich als Bezugspunkt und mit 0,06 $ günstig, aber keine Empfehlung.

Was Referenztreue für die Charakterkonsistenz bedeutet

Referenztreue ist die am wenigsten intuitive Zahl in der Tabelle. Die Arena schickt denselben Auftrag durch alle sieben Modelle: ein Mann in drei ungestellten Straßenaufnahmen – beim Gehen, an eine Wand gelehnt und beim Überqueren der Straße – mit demselben Gesicht, derselben Frisur und demselben Outfit in allen dreien.

Seedream 5.0 Pro keeps the same man, navy sweater, blue jeans and leather backpack across three street shots
Seedream 5.0 Pro, Referenztreue 1.037. Gesicht, marineblauer Pullover, blaue Jeans und braune Stiefel halten über alle drei Frames, und der Lederrucksack findet sich in zwei davon wieder.
Flux.2 Pro renders the same man in plain dark trousers with no backpack
Flux.2 Pro, Reference Adherence 881. Gleiches Briefing. Der Pullover überlebt, die Jeans wird zur schlichten dunklen Hose, und der Rucksack ist in jedem Frame verschwunden. Beide Sets wurden für OpenArt Arena v1.0 generiert.

Arena bewertet diese anhand eines Referenzbildes, das nicht veröffentlicht wird, sodass der Wert das Urteil bildet und nicht dein Auge. Was du sehen kannst, ist, wie viel vom Briefing die Reise übersteht. Alle sieben Ergebnisse liegen auf dem Arena-Bestenliste unter Referenztreue, und wenn deine Arbeit einen wiederkehrenden Charakter, einen Markenbotschafter oder eine KI-Persona umfasst, zählt diese Spalte mehr als das Gesamtranking.

Warum KI 2026 immer noch Hände falsch macht

Eine Hand hat sechzehn Gelenke, die sich unabhängig voneinander bewegen, und in den meisten Aufnahmen sind mehrere davon hinter anderen oder hinter einem Gegenstand verborgen. Das Modell muss Anatomie ableiten, die es nicht sehen kann, aus einem Bereich, der vielleicht nur ein paar Hundert Pixel einnimmt.

Research from March 2025 put numbers on it. A team including researchers at Peking University built a 500 prompt human benchmark and found that close to half of generated images contained some distortion. Their companion dataset, Distortion-5K, annotated 4,700 images, and most flawed regions took up only a small share of the frame, which is why defects survive a quick glance. That study tested an older generation of models, so read it as evidence that the problem is real and hard to spot, not as a ranking of the seven models here.

Was sich seitdem geändert hat, ist, wo die Fehler auftauchen. Ein zentriertes Porträt oder eine offene Handfläche gelingt inzwischen meist einwandfrei. Die Fehler sind an schwierigere Stellen gewandert: Finger um einen Tassenhenkel, zwei Personen, die Händchen halten, eine Hand nahe einem Gesicht, ein verkürzt dargestellter Arm und die kleinen Gesichter hinter deinem Motiv.

So testest du KI-Bildmodelle auf Gesichter und Hände

Die Werte grenzen das Feld ein. Deine eigenen Prompts entscheiden. Das dauert etwa zwei Stunden.

Richte es ein. Wähle drei Modelle aus der Tabelle und lass sie im KI-Bildgenerator, wo alle sieben aus derselben Prompt-Box laden. Gib jedem identische Prompts, Referenzen, Seitenverhältnis und Auflösung. Erstelle vier Bilder pro Prompt. Wiederhole nur bei Dienstfehlern, nie weil dir ein Ergebnis nicht gefiel – sonst bewertest du deine eigene Geduld statt das Modell.

Nutze Prompts, die Grenzen ausreizen. Sechs decken das meiste ab:

  • Eine Hand, die einen Gegenstand am Griff hält
  • Zwei Personen, die Händchen halten
  • Eine Hand, die nah am Gesicht erhoben ist
  • Eine linkshändige Aktion
  • Ein perspektivisch verkürzter Arm, der zur Kamera greift
  • Eine Gruppe von fünf mit Gesichtern im Hintergrund

Füge einen Identitätstest hinzu: dasselbe Referenzbild über alle drei Modelle hinweg.

Bewerte es blind. Blende die Modellnamen aus. Öffne jedes Bild in voller Auflösung, denn ein Fehler, der im Feed unsichtbar ist, springt bei 100 Prozent sofort ins Auge. Bei Händen: prüfe Fingeranzahl, Trennung, Daumenstellung, Handgelenksverlauf, Gelenkrichtung und ob der Griff das Objekt tatsächlich berührt. Bei Gesichtern: prüfe Blick, Zähne, Ohren, Profilgeometrie und ungewollte Asymmetrie. Zähle jede sichtbare Person, auch die kleinen im Hintergrund.

Melde zwei Zahlen pro Modell: die Erfolgsquote bei den ersten Ergebnissen und die Erfolgsquote über alle vier. Ein Modell, das es nur eins von vier Mal trifft, macht mehr Arbeit, als sein Durchschnitt vermuten lässt.

So korrigierst du KI-Hände und -Gesichter, ohne das Bild zu verändern

Sag, wie viele Hände zu sehen sind und was jede davon tut. „Eine sichtbare linke Hand, die eine Kaffeetasse am Henkel hält“ gibt dem Modell weit mehr an die Hand als „eine Person mit Kaffee“. Halte die erste Generierung einfach. Verschränkte Arme, überlappende Finger, drei Requisiten und vier Personen in einem Prompt – da fällt alles auseinander.

Wähle den Bildausschnitt für die Anatomie, die dir wichtig ist. Ein Gesicht, das 40 Pixel einnimmt, hat nur 40 Pixel Detail zur Verfügung, egal welches Modell du wählst. Wenn die Gesichter im Hintergrund zählen, schneide enger zu oder erhöhe die Auflösung.

Wenn etwas schiefgeht, maskiere nur den fehlerhaften Bereich und bitte um genau eine bestimmte Korrektur. Eine enge Maske lässt dem Modell weniger Raum, die Person neu zu zeichnen. Vergleiche die Reparatur dann in voller Auflösung mit dem Original und achte auf die Ränder: Ärmel, Schmuck, Schatten und Berührungspunkte sind die Stellen, an denen ein lokaler Edit heimlich aufhört, lokal zu sein.

So wählst du das richtige Modell für deine Arbeit

Die Arena wiederholt diese Vergleiche, sobald neue Modelle erscheinen, daher ist das Ranking, um das du heute planst, nicht zwangsläufig das, das nächstes Quartal noch gilt. Seedream 5.0 Pro und GPT Image 2 liegen beim Gesamtwert vier Punkte auseinander – nah genug, dass ein einziges Release sie neu ordnen kann.

Bevor du dich bei menschlichen Motiven auf ein Modell festlegst, prüfe die aktuellen Zahlen auf den vier hier entscheidenden Boards: Gesamt, Film, Bildbearbeitung und das Realismus-Kriterium innerhalb von Film. Neue Konten erhalten 40 kostenlose Credits, keine Kreditkarte nötig – genug, um den Sechs-Prompt-Test über drei Modelle zu fahren.

Häufig gestellte Fragen

Welches Modell eignet sich am besten für realistische Gesichter?

Nano Banana Pro erzielt mit 1.184 den höchsten Wert beim Realismus-Kriterium von Arena, vor Seedream 5.0 Pro mit 1.142. Für Gesichter, die über mehrere Bilder hinweg konsistent bleiben sollen, ist Seedream die bessere Wahl, denn es führt mit 1.037 auch bei der Referenztreue.

Welches Modell ist am besten für Hände?

Kein Board bewertet Hände für sich allein. Seedream 5.0 Pro und Nano Banana Pro führen bei den Realismus- und Film-Metriken, die dem am nächsten kommen, und GPT Image 2 ist die stärkste Wahl, um eine Hand nachträglich auszubessern. Führe den obigen Sechs-Prompt-Test mit deinen eigenen Aufträgen durch, bevor du dich festlegst.

Setzen aktuelle Modelle immer noch zusätzliche Finger hinzu?

Ja, wenn auch bei einfachen Posen deutlich seltener. Fehler häufen sich jetzt bei gehaltenen Objekten, überkreuzten Fingern, Verdeckungen und kleinen Händen im Hintergrund. Eine Studie von 2025 zu einer früheren Modellgeneration fand bei fast der Hälfte ihres Benchmarks aus 500 Menschen-Prompts Verzerrungen.

Wie repariere ich eine KI-Hand, ohne das Gesicht zu verändern?

Maskiere nur die Hand und den Bereich, in dem sie einen Gegenstand berührt, und fordere dann eine gezielte Korrektur an, etwa eine natürliche Daumenposition. GPT Image 2 führt Arenas Image-Editing-Board mit 1.045 für diese Art von Arbeit an. Prüfe danach den Bearbeitungsrand auf veränderte Ärmel, Schatten und Schmuck.

Welches Modell ist für diese Arbeit am günstigsten?

GPT Image 2 mit 0,057 $ pro Bild, gefolgt von Grok Imagine 2.0 mit 0,06 $ und Qwen Image 3.0 mit 0,075 $. Nano Banana Pro ist mit 0,134 $ am teuersten.

Welches Modell ist am schnellsten?

Nano Banana 2 mit 18,1 Sekunden und Grok Imagine 2.0 mit 18,3 Sekunden. Qwen Image 3.0 ist mit 99,1 Sekunden am langsamsten, dicht gefolgt von Seedream 5.0 Pro mit 88,9 Sekunden.

Beheben Referenzbilder Identitätsabweichungen?

Sie verringern es. Eine klare Referenz aus einem ähnlichen Winkel gibt dem Modell Anhaltspunkte für Gesichtsproportionen und markante Merkmale. Die Identität kann sich über Posen und Edits hinweg trotzdem verschieben – vergleiche also Haaransatz, Hauttextur und Proportionen zwischen den Ergebnissen, statt anzunehmen, dass die Referenz gehalten hat.

Bedeutet ein hoher Gesamtwert bessere Anatomie?

Nicht für sich allein. „Gesamt“ mittelt vier grobe Kriterien mit gleicher Gewichtung. Nutze Realismus und Referenztreue für menschliche Motive und Bearbeitung für Reparaturarbeiten.

Grenzenlos kreativ sein

Schließ dich Millionen von Creators an, die mit OpenArt Bilder, Videos, Charaktere und Storys erstellen – alles auf einer Plattform.

Kostenlos loslegen →