Quel modèle d'image IA réussit le mieux les visages et les mains ? On a vérifié les scores
Sept modèles d'image sont présents sur les tableaux d'OpenArt Arena, et choisir entre eux pour des sujets humains relève souvent du hasard. Nous avons compilé les scores par critère publiés, y compris ceux que masquent les classements résumés, et les avons confrontés au coût réel et à la vitesse de chaque modèle.
- Choix par défaut pour les personnes : Seedream 5.0 Pro. En tête du classement général à 1 051 et Film à 1 074, il détient aussi le meilleur score de Respect de la référence à 1 037, ce qui permet à un visage de rester reconnaissable d'un plan à l'autre.
- Le plus photoréaliste : Nano Banana Pro. Obtient 1 184 au critère Réalisme du classement Film, le chiffre le plus élevé publié parmi les sept.
- Le meilleur pour réparer une main ratée : GPT Image 2. En tête de l'Édition d'image avec 1 045, le moins cher à 0,057 $ par image, et accepte 16 images de référence.
Comment se comparent les sept modèles
Arena organise des votes en tête-à-tête à l'aveugle et affiche des scores de type Elo. Grok Imagine 2.0 est fixé à 1 000 comme point d'ancrage, donc chaque chiffre ci-dessous se lit comme meilleur ou moins bon que Grok. Les scores ne se comparent qu'au sein d'une même colonne.
| Modèle | Global | Film | Réalisme | Édition | Respect de la réf. | Prix | Idéal pour |
|---|---|---|---|---|---|---|---|
| Seedream 5.0 Pro | 1,051 | 1,074 | 1,142 | 1,037 | 1,037 | $0.09 | Choix par défaut pour les personnes |
| GPT Image 2 | 1,047 | 1,058 | 1,058 | 1,045 | 1,035 | $0.057 | Réparer une main ou un visage |
| Nano Banana Pro | 1,008 | 1,059 | 1,184 | 1,035 | 1,002 | $0.134 | Peau la plus photoréaliste |
| Grok Imagine 2.0 | 1,000 | 1,000 | 1,000 | 1,000 | 1,000 | $0.06 | Repère de référence |
| Nano Banana 2 | 985 | 998 | 1,064 | 1,032 | 991 | $0.101 | Brouillons 4K rapides |
| Qwen Image 3.0 | 966 | 964 | 975 | 992 | 973 | $0.075 | Variété de styles |
| Flux.2 Pro | 927 | 978 | 1,022 | 955 | 881 | $0.08 | Point faible sur l'identité |
Source: OpenArt's Classement de l'arène, image boards, v1.0.
Une précision sur ce que ces scores couvrent ou non, puis on passe à la suite. Arena évalue le réalisme, la cohérence de l'identité et la précision d'édition. Il ne fait pas de test d'anatomie distinct, donc rien ici ne compte les doigts à ta place. Le réalisme est l'indicateur publié le plus proche, et l'écart entre Nano Banana Pro à 1 184 et Qwen Image 3.0 à 975 est assez large pour être utile. Considère les modèles dont les intervalles de confiance se chevauchent comme à égalité.
Quels modèles sont les meilleurs pour les sujets humains
Seedream 5.0 Pro
Le choix par défaut le plus sûr. Il domine en Global et en Film, décroche le meilleur score en Créativité avec 1 103, et son 1 037 en respect de la référence signifie qu'un visage que tu lui fournis a tendance à revenir avec la même personne. Il gère aussi les fonds transparents, ce que seul GPT Image 2 sait faire.
Le hic, c'est la vitesse et la marge de manœuvre. Il plafonne en 2K, accepte 10 images de référence et met 88,9 secondes pour une image 1K. Il chute aussi à 975 en Design graphique, donc si ton image nécessite une typographie soignée, génère le personnage ici et ajoute le texte ailleurs. Toutes les specs sont sur la Page du modèle Seedream 5.0 Pro.
GPT Image 2
L'outil de réparation. Il domine l'Édition d'images avec 1 045, et il mène aussi discrètement le Respect du prompt avec 1 041, ce qui compte quand tu précises exactement quelle main tient quoi. Il produit en 4K, accepte 16 références, gère un prompt de 32 000 caractères et tourne en 44,8 secondes.
Son point faible, c'est l'esthétique par rapport au haut du classement : 1 030 en Esthétique subjective contre 1 043 pour Seedream, et 1 058 en Réalisme contre 1 184 pour Nano Banana Pro. Génère ailleurs, corrige ici. Le Page du modèle GPT Image 2 liste les modes d'édition.
Nano Banana Pro
Le champion du réalisme, avec une belle avance. 1 184 en Réalisme et 1 059 en Film, en 4K avec 14 références et un temps rapide de 39,9 secondes.
Deux choses le freinent. À 0,134 $ par image, c'est le plus cher des sept, environ 2,4 fois le prix de GPT Image 2. Et il obtient 981 en Esthétique subjective et 952 en Design graphique, sous le repère dans les deux cas : il paraît donc techniquement convaincant plus souvent qu'il ne paraît beau.
Nano Banana 2
Le modèle de brouillon. Google le documente sous le nom Gemini 3.1 Flash Image. En 18,1 secondes et en 4K avec 14 références, c'est le moyen le plus rapide de trouver une composition qui te plaît avant de t'engager sur un modèle plus lent. Le réalisme tient à 1 064. Le Global est à 985, donc traite son résultat comme une ébauche. Les spécifications et les exemples sont sur la page du modèle Nano Banana 2.
Quels modèles éviter pour les sujets humains
Flux.2 Pro obtient 881 en Respect de la référence, le plus bas des sept, ce qui l'écarte pour le travail sur les personnages. Qwen Image 3.0 obtient 915 en respect du prompt, donc une pose précise comme « main gauche uniquement, agrippant la poignée » a plus de chances d'être mal restituée, et avec 99,1 secondes, c'est le modèle le plus lent du tableau. Grok Imagine 2.0 est le repère, utile comme point de référence et abordable à 0,06 $, mais pas une recommandation.
Ce que le respect des références signifie pour la cohérence des personnages
Le respect des références est le chiffre le moins intuitif du tableau. Arena passe le même brief dans les sept modèles : un homme dans trois photos de rue spontanées, en marchant, appuyé contre un mur et en traversant la route, avec le même visage, la même coiffure et la même tenue dans les trois.
Arena les évalue par rapport à une image de référence qu'il ne publie pas : le score est donc le verdict, pas ton œil. Ce que tu peux voir, c'est quelle part du brief survit au processus. Les sept résultats se trouvent sur le Classement de l'arène dans Respect de la référence, et si ton travail implique un personnage récurrent, un ambassadeur de marque ou un persona IA, cette colonne compte plus que le classement général.
Pourquoi l'IA rate encore les mains en 2026
Une main comporte seize articulations qui bougent indépendamment, et sur la plupart des plans, plusieurs sont cachées les unes derrière les autres ou derrière un objet. Le modèle doit déduire une anatomie qu'il ne voit pas, à partir d'une zone qui n'occupe parfois que quelques centaines de pixels.
Research from March 2025 put numbers on it. A team including researchers at Peking University built a 500 prompt human benchmark and found that close to half of generated images contained some distortion. Their companion dataset, Distortion-5K, annotated 4,700 images, and most flawed regions took up only a small share of the frame, which is why defects survive a quick glance. That study tested an older generation of models, so read it as evidence that the problem is real and hard to spot, not as a ranking of the seven models here.
Ce qui a changé depuis, c'est l'endroit où se logent les échecs. Un portrait centré ou une paume ouverte s'en sortent généralement bien aujourd'hui. Les erreurs se sont déplacées vers les cas plus difficiles : des doigts enroulés autour de l'anse d'une tasse, deux personnes qui se tiennent la main, une main près d'un visage, un bras en raccourci, et les petits visages debout derrière ton sujet.
Comment tester les modèles d'image IA sur les visages et les mains
Les scores affinent la sélection. Tes propres prompts la finalisent. Ça prend environ deux heures.
Configure-le. Choisis trois modèles dans le tableau et lance-les dans le Générateur d'images IA, où les sept modèles se chargent depuis la même barre de prompt. Donne à chacun des prompts, références, ratio et résolution identiques. Génère quatre images par prompt. Ne relance qu'en cas d'erreur de service, jamais parce qu'un résultat te déplaît, sinon tu évalues ta propre patience et non le modèle.
Utilise des prompts qui mettent tout à l'épreuve. Six critères couvrent l'essentiel :
- Une main saisissant un objet par sa poignée
- Deux personnes se tenant la main
- Une main levée près du visage
- Une action de la main gauche
- Un bras en raccourci tendu vers la caméra
- Un groupe de cinq personnes avec des visages en arrière-plan
Ajoute un test d'identité : la même image de référence pour les trois modèles.
Évalue-le à l'aveugle. Masque les noms des modèles. Ouvre chaque image en pleine résolution, car un défaut invisible dans un fil devient évident à 100 %. Sur les mains, vérifie le nombre de doigts, leur séparation, la position du pouce, la continuité du poignet, la direction des articulations, et si la prise touche réellement l'objet. Sur les visages, vérifie le regard, les dents, les oreilles, la géométrie de profil et les asymétries involontaires. Compte chaque personne visible, y compris les plus petites à l'arrière.
Indique deux chiffres par modèle : le taux de réussite dès le premier rendu, et le taux de réussite sur les quatre. Un modèle qui réussit une fois sur quatre crée plus de travail que sa moyenne ne le laisse penser.
Comment corriger les mains et les visages IA sans modifier l'image
Précise combien de mains apparaissent et ce que chacune fait. « Une main gauche visible tenant une tasse de café par l'anse » donne bien plus de matière au modèle que « une personne avec un café ». Garde la première génération simple. Bras croisés, doigts qui se chevauchent, trois accessoires et quatre personnes dans un même prompt, c'est là que tout part en vrille.
Cadre en fonction de l'anatomie qui t'importe. Un visage qui occupe 40 pixels n'a que 40 pixels de détail exploitables, quel que soit le modèle choisi. Si les visages en arrière-plan comptent, recadre plus serré ou augmente la résolution.
Quand un rendu échoue, masque uniquement la zone défectueuse et demande une seule correction précise. Un masque étroit laisse moins de latitude au modèle pour redessiner la personne. Compare ensuite la retouche à l'original en pleine résolution, et regarde bien les bords : manches, bijoux, ombres et points de contact sont là où une retouche locale cesse discrètement d'être locale.
Comment choisir le bon modèle pour ton travail
Arena refait ces comparaisons à chaque nouveau modèle, donc le classement sur lequel tu planifies aujourd'hui n'est pas forcément celui qui tiendra le trimestre prochain. Seedream 5.0 Pro et GPT Image 2 ne sont séparés que de quatre points en Global, assez proches pour qu'une seule sortie inverse leur ordre.
Avant de standardiser sur un seul modèle pour les sujets humains, vérifie les chiffres actuels sur les quatre tableaux qui comptent ici : Global, Film, Édition d'image et le critère de Réalisme dans Film. Les nouveaux comptes reçoivent 40 crédits gratuits, sans carte bancaire, de quoi faire le test des six prompts sur trois modèles.
Questions fréquentes
Quel modèle est le meilleur pour des visages réalistes ?
Nano Banana Pro obtient le meilleur score au critère Réalisme d'Arena à 1 184, devant Seedream 5.0 Pro à 1 142. Pour des visages qui doivent rester cohérents sur plusieurs images, Seedream est le meilleur choix car il domine aussi le Respect de la référence à 1 037.
Quel modèle est le meilleur pour les mains ?
Aucun tableau ne note les mains à part. Seedream 5.0 Pro et Nano Banana Pro dominent les métriques de réalisme et de film qui s'en approchent le plus, et GPT Image 2 est le meilleur choix pour réparer une main après coup. Fais le test des six prompts ci-dessus sur tes propres briefs avant de te décider.
Les modèles actuels ajoutent-ils encore des doigts en trop ?
Oui, mais bien moins souvent sur les poses simples. Les échecs se concentrent désormais autour des objets tenus en main, des doigts croisés, des occlusions et des petites mains en arrière-plan. Une étude de 2025 portant sur une génération de modèle antérieure a révélé que près de la moitié de son benchmark de 500 prompts humains contenait des distorsions.
Comment corriger une main IA sans modifier le visage ?
Masque uniquement la main et la zone où elle touche un objet, puis demande une correction précise, comme un placement naturel du pouce. GPT Image 2 domine le classement Image Editing d'Arena à 1 045 pour ce type de travail. Vérifie ensuite la limite de la retouche pour repérer les manches, ombres et bijoux modifiés.
Quel modèle est le moins cher pour ce travail ?
GPT Image 2 à 0,057 $ par image, suivi de Grok Imagine 2.0 à 0,06 $ et Qwen Image 3.0 à 0,075 $. Nano Banana Pro est le plus cher à 0,134 $.
Quel modèle est le plus rapide ?
Nano Banana 2 à 18,1 secondes et Grok Imagine 2.0 à 18,3 secondes. Qwen Image 3.0 est le plus lent avec 99,1 secondes, suivi de près par Seedream 5.0 Pro à 88,9 secondes.
Les images de référence corrigent-elles la dérive d'identité ?
Ils la réduisent. Une référence nette prise sous un angle similaire donne au modèle des indices sur les proportions du visage et les traits distinctifs. L'identité peut tout de même varier selon les poses et les retouches, alors compare la ligne des cheveux, la texture de la peau et les proportions entre les résultats plutôt que de supposer que la référence a tenu.
Un bon score global signifie-t-il une meilleure anatomie ?
Pas à lui seul. Le classement général fait la moyenne de quatre critères larges au même poids. Utilise Réalisme et Respect de la référence pour les sujets humains, et Édition pour les retouches.