Oferta por tempo limitado! Desbloqueie um ano de criatividade sem limites com planos anuais com ATÉ 27% DE DESCONTO.

Ver plano ›
OpenArt Arena

Qual modelo de imagem por IA acerta rostos e mãos?

Evelyn Sep 22, 2026 5 min de leitura
Resumir com:
Which AI Image Model Gets Faces and Hands Right?

O ranking global de inteligência criativa

Qual modelo de imagem por IA acerta rostos e mãos? Conferimos as notas

Sete modelos de imagem estão nas listas de imagem da OpenArt Arena, e escolher entre eles para retratar pessoas geralmente vira um chute. Reunimos as notas publicadas por critério, incluindo as que os rankings resumidos escondem, e as alinhamos com o custo real de cada modelo e a velocidade de execução.

  • Escolha padrão para pessoas: Seedream 5.0 Pro. Lidera em Geral com 1.051 e em Filme com 1.074, e mantém a maior pontuação de Fidelidade à Referência com 1.037, que é o que mantém um rosto reconhecível de uma cena para outra.
  • Mais fotorrealista: Nano Banana Pro. Pontua 1.184 no critério de Realismo do quadro de Filme, o maior número publicado entre os sete.
  • Melhor para consertar uma mão ruim: GPT Image 2. Lidera a Edição de Imagem com 1.045, custa menos com US$ 0,057 por imagem e aceita 16 imagens de referência.

Como os sete modelos se comparam

A Arena realiza votações cegas frente a frente e reporta pontuações no estilo Elo. O Grok Imagine 2.0 fica em 1.000 como âncora fixa, então todo número abaixo indica se é melhor ou pior que o Grok. As pontuações só se comparam dentro de uma mesma coluna.

Modelo Geral Filme Realismo Edição Fidelidade à ref. Preço Ideal para
Seedream 5.0 Pro 1,051 1,074 1,142 1,037 1,037 $0.09 Escolha padrão para pessoas
GPT Image 2 1,047 1,058 1,058 1,045 1,035 $0.057 Consertar uma mão ou rosto
Nano Banana Pro 1,008 1,059 1,184 1,035 1,002 $0.134 Pele mais fotorrealista
Grok Imagine 2.0 1,000 1,000 1,000 1,000 1,000 $0.06 Âncora de benchmark
Nano Banana 2 985 998 1,064 1,032 991 $0.101 Rascunhos rápidos em 4K
Qwen Image 3.0 966 964 975 992 973 $0.075 Variedade de estilos
Flux.2 Pro 927 978 1,022 955 881 $0.08 Mais fraco em identidade

Fonte: da OpenArt Ranking da Arena, quadros de imagem, v1.0.

Uma observação sobre o que essas notas cobrem e o que não cobrem, e depois seguimos em frente. A Arena pontua realismo, consistência de identidade e precisão de edição. Ela não roda um teste de anatomia separado, então nada aqui conta os dedos por você. O realismo é o indicador publicado mais próximo, e a diferença entre o Nano Banana Pro com 1.184 e o Qwen Image 3.0 com 975 é grande o suficiente para ser útil. Trate modelos com intervalos de confiança sobrepostos como empate.

Quais modelos são melhores para sujeitos humanos

Seedream 5.0 Pro

A opção padrão mais segura. Lidera em Geral e Filme, tem a maior pontuação de Criatividade com 1.103, e seus 1.037 em Fidelidade à Referência significam que um rosto que você fornece tende a voltar parecendo a mesma pessoa. Também suporta fundos transparentes, algo que só o GPT Image 2 iguala.

O porém é a velocidade e a margem. Ele vai até 2K, aceita 10 imagens de referência e leva 88,9 segundos para uma imagem em 1K. Também cai para 975 em Design Gráfico, então se sua imagem precisa de tipografia limpa, gere a pessoa aqui e defina o texto em outro lugar. As especificações completas estão na Página do modelo Seedream 5.0 Pro.

GPT Image 2

A ferramenta de reparo. Lidera em Edição de Imagem com 1.045 e também lidera discretamente em Aderência ao Prompt com 1.041, o que importa quando você está especificando exatamente qual mão segura o quê. Ele gera em 4K, aceita 16 referências, aceita prompts de até 32.000 caracteres e roda em 44,8 segundos.

Seu ponto fraco é a estética em relação ao topo do quadro: 1.030 em Estética Subjetiva contra os 1.043 do Seedream, e 1.058 em Realismo contra os 1.184 do Nano Banana Pro. Gere em outro lugar, conserte aqui. O Página do modelo GPT Image 2 lista os modos de edição.

Nano Banana Pro

O líder em realismo, com folga. 1.184 em Realismo e 1.059 em Filme, em 4K com 14 referências e rápidos 39,9 segundos.

Dois pontos o prejudicam. Com US$ 0,134 por imagem, é o mais caro dos sete, cerca de 2,4 vezes o GPT Image 2. E marca 981 em Estética Subjetiva e 952 em Design Gráfico, abaixo da referência em ambos, então parece tecnicamente convincente com mais frequência do que parece bonito.

Nano Banana 2

O modelo de rascunho. A Google o documenta como Gemini 3.1 Flash Image. Com 18,1 segundos e 4K com 14 referências, é a forma mais rápida de encontrar uma composição de que você goste antes de partir para um modelo mais lento. O realismo se mantém em 1.064. O geral fica em 985, então trate o resultado como um esboço. Especificações e amostras estão na página do modelo Nano Banana 2.

Quais modelos evitar para sujeitos humanos

Flux.2 Pro pontua 881 em Fidelidade à Referência, a menor das sete, o que o descarta para trabalho com personagens. Qwen Image 3.0 pontua 915 em Fidelidade ao Prompt, então uma pose específica como "apenas a mão esquerda, segurando o cabo" tem mais chance de voltar errada, e com 99,1 segundos é o modelo mais lento do quadro. Grok Imagine 2.0 é a referência, útil como ponto de partida e barato a US$ 0,06, mas não uma recomendação.

O que a aderência à referência significa para a consistência do personagem

A aderência à referência é o número menos intuitivo da tabela. A Arena roda o mesmo briefing pelos sete modelos: um homem em três fotos espontâneas de rua, andando, encostado numa parede e atravessando a rua, com o mesmo rosto, penteado e roupa nas três.

Seedream 5.0 Pro keeps the same man, navy sweater, blue jeans and leather backpack across three street shots
Seedream 5.0 Pro, Fidelidade à Referência 1.037. Rosto, suéter azul-marinho, jeans azul e botas marrons se mantêm nos três quadros, e a mochila de couro aparece em dois deles.
Flux.2 Pro renders the same man in plain dark trousers with no backpack
Flux.2 Pro, Aderência à Referência 881. Mesmo briefing. O suéter sobrevive, a calça jeans vira uma calça escura comum e a mochila some de todos os quadros. Ambos os conjuntos foram gerados para o OpenArt Arena v1.0.

A Arena avalia esses modelos contra uma imagem de referência que ela não publica, então a nota é o veredito, e não o seu olho. O que você consegue ver é o quanto do briefing sobrevive ao processo. Todos os sete resultados estão no Ranking da Arena em Fidelidade à Referência, e se o seu trabalho envolve um personagem recorrente, um embaixador de marca ou uma persona de IA, essa coluna importa mais do que o ranking Geral.

Por que a IA ainda erra as mãos em 2026

Uma mão tem dezesseis articulações que se movem de forma independente, e na maioria das cenas várias delas ficam escondidas atrás umas das outras ou de um objeto. O modelo precisa inferir uma anatomia que não consegue ver, a partir de uma região que pode ocupar apenas algumas centenas de pixels.

Research from March 2025 put numbers on it. A team including researchers at Peking University built a 500 prompt human benchmark and found that close to half of generated images contained some distortion. Their companion dataset, Distortion-5K, annotated 4,700 images, and most flawed regions took up only a small share of the frame, which is why defects survive a quick glance. That study tested an older generation of models, so read it as evidence that the problem is real and hard to spot, not as a ranking of the seven models here.

O que mudou desde então é onde ficam as falhas. Um retrato centralizado ou uma palma aberta geralmente saem bem agora. Os erros se mudaram para lugares mais difíceis: dedos ao redor da alça de uma xícara, duas pessoas de mãos dadas, uma mão perto de um rosto, um braço em escorço e os rostinhos pequenos atrás do seu personagem.

Como testar modelos de imagem por IA para rostos e mãos

As pontuações estreitam o campo. Seus próprios prompts decidem. Isso leva cerca de duas horas.

Configure isso. Escolha três modelos da tabela e execute-os no Gerador de imagens com IA, onde todos os sete carregam a partir da mesma caixa de prompt. Dê a cada um prompts, referências, proporção e resolução idênticos. Gere quatro imagens por prompt. Tente de novo só em caso de erros de serviço, nunca porque não gostou de um resultado, ou você estará avaliando a sua própria paciência em vez do modelo.

Use prompts que quebram as coisas. Seis cobrem a maior parte:

  • Uma mão segurando um objeto pela alça
  • Duas pessoas de mãos dadas
  • Uma mão levantada perto do rosto
  • Uma ação com a mão esquerda
  • Um braço em escorço estendido em direção à câmera
  • Um grupo de cinco com rostos ao fundo

Adicione um teste de identidade: a mesma imagem de referência nos três modelos.

Avalie às cegas. Oculte os nomes dos modelos. Abra cada imagem em resolução total, porque um defeito invisível num feed fica óbvio a 100%. Nas mãos, verifique a contagem de dedos, a separação, a posição do polegar, a continuidade do pulso, a direção das articulações e se a pegada realmente toca o objeto. Nos rostos, verifique o olhar, os dentes, as orelhas, a geometria do perfil e a assimetria não intencional. Conte todas as pessoas visíveis, incluindo as pequenas ao fundo.

Reporte dois números por modelo: a taxa de acerto nas primeiras saídas e a taxa de acerto nas quatro. Um modelo que acerta uma em quatro gera mais trabalho do que a média sugere.

Como consertar mãos e rostos feitos por IA sem alterar a imagem

Diga quantas mãos aparecem e o que cada uma faz. "Uma mão esquerda visível segurando uma xícara de café pela alça" dá ao modelo muito mais informação do que "uma pessoa com café." Mantenha a primeira geração simples. Braços cruzados, dedos sobrepostos, três objetos e quatro pessoas em um único prompt é onde tudo desmorona.

Enquadre pensando na anatomia que importa para você. Um rosto que ocupa 40 pixels tem 40 pixels de detalhe para trabalhar, não importa qual modelo você escolha. Se os rostos ao fundo importam, corte mais fechado ou aumente a resolução.

Quando algo dá errado, mascare apenas a região defeituosa e peça uma correção específica. Uma máscara restrita dá ao modelo menos espaço para redesenhar a pessoa. Depois, compare o reparo com o original em resolução total e observe as bordas: mangas, joias, sombras e pontos de contato são onde uma edição local silenciosamente deixa de ser local.

Como escolher o modelo certo para o seu trabalho

A Arena refaz essas comparações à medida que novos modelos chegam, então o ranking em torno do qual você planeja hoje não é necessariamente o que valerá no próximo trimestre. O Seedream 5.0 Pro e o GPT Image 2 estão a quatro pontos de distância no geral, próximos o suficiente para que um único lançamento reordene os dois.

Antes de padronizar um único modelo para retratar pessoas, confira os números atuais nas quatro listas que importam aqui: Geral, Filme, Edição de Imagem e o critério de Realismo dentro de Filme. Novas contas ganham 40 créditos grátis, sem precisar de cartão, o suficiente para rodar o teste dos seis prompts em três modelos.

Perguntas frequentes

Qual modelo é melhor para rostos realistas?

O Nano Banana Pro pontua mais alto no critério de Realismo da Arena com 1.184, à frente do Seedream 5.0 Pro com 1.142. Para rostos que precisam se manter consistentes em várias imagens, o Seedream é a melhor escolha porque também lidera em Fidelidade à Referência com 1.037.

Qual modelo é melhor para mãos?

Nenhuma lista pontua mãos isoladamente. O Seedream 5.0 Pro e o Nano Banana Pro lideram as métricas de realismo e filme que mais se aproximam, e o GPT Image 2 é a escolha mais forte para consertar uma mão depois. Rode o teste dos seis prompts acima nos seus próprios briefings antes de decidir.

Os modelos atuais ainda adicionam dedos extras?

Sim, embora com muito menos frequência em poses simples. As falhas agora se concentram em objetos segurados, dedos cruzados, oclusão e mãos pequenas ao fundo. Um estudo de 2025 sobre uma geração anterior de modelos descobriu que quase metade de seu benchmark de 500 prompts humanos continha distorções.

Como conserto uma mão feita por IA sem alterar o rosto?

Aplique a máscara apenas na mão e na área onde ela toca um objeto, depois peça uma correção específica, como o posicionamento natural do polegar. O GPT Image 2 lidera o quadro de Edição de Imagem da Arena com 1.045 para esse tipo de trabalho. Depois, verifique a borda da edição em busca de mangas, sombras e joias alteradas.

Qual modelo é o mais barato para esse trabalho?

GPT Image 2 a US$ 0,057 por imagem, seguido pelo Grok Imagine 2.0 a US$ 0,06 e pelo Qwen Image 3.0 a US$ 0,075. O Nano Banana Pro é o mais caro, com US$ 0,134.

Qual modelo é o mais rápido?

Nano Banana 2 com 18,1 segundos e Grok Imagine 2.0 com 18,3 segundos. O Qwen Image 3.0 é o mais lento, com 99,1 segundos, e o Seedream 5.0 Pro logo atrás, com 88,9 segundos.

Imagens de referência corrigem a variação de identidade?

Elas reduzem. Uma referência clara em um ângulo similar dá ao modelo evidências das proporções faciais e das características distintivas. A identidade ainda pode variar entre poses e edições, então compare linha do cabelo, textura da pele e proporções entre os resultados em vez de presumir que a referência se manteve.

Uma nota geral alta significa uma anatomia melhor?

Sozinho, não. O quadro Geral faz a média de quatro critérios amplos com peso igual. Use Realismo e Fidelidade à Referência para sujeitos humanos, e Edição para trabalhos de reparo.

Crie sem limites

Junte-se a milhões de criadores que usam a OpenArt para gerar imagens, vídeos, personagens e histórias — tudo em uma só plataforma.

Comece grátis →