顔と手をきれいに描けるAI画像モデルは?スコアを検証した
OpenArt Arenaの画像ボードには7つの画像モデルが並んでおり、人物用途でどれを選ぶかは、たいてい当てずっぽうになりがちだ。私たちは公開されている評価基準スコアを、要約ランキングでは隠れているものも含めて引き出し、各モデルの実際のコストや動作速度と並べて検証した。
- 人物向けの定番:Seedream 5.0 Pro。 Overallを1,051、Filmを1,074でリードし、Reference Adherenceでもトップの1,037を維持しています。これがショットごとに顔を認識可能に保つ鍵です。
- 最もフォトリアル:Nano Banana Pro。 FilmボードのRealism基準で1,184を記録し、7つの中で公表されている最高値です。
- 手の不具合を修正するのに最適:GPT Image 2。 画像編集で1,045とトップ、1枚あたり$0.057と最安、参照画像は16枚まで対応。
7つのモデルの比較
Arenaはブラインドの一対一投票を行い、Elo方式のスコアを報告します。Grok Imagine 2.0が1,000の固定基準として据えられているため、以下の数値はすべてGrokより良いか悪いかで読み取れます。スコアの比較は同じ列内でのみ有効です。
| モデル | 総合 | 映画 | リアリズム | 編集 | 参照忠実度 | 価格 | おすすめの用途 |
|---|---|---|---|---|---|---|---|
| Seedream 5.0 Pro | 1,051 | 1,074 | 1,142 | 1,037 | 1,037 | $0.09 | 人物向けの定番 |
| GPT Image 2 | 1,047 | 1,058 | 1,058 | 1,045 | 1,035 | $0.057 | 手や顔の修復 |
| Nano Banana Pro | 1,008 | 1,059 | 1,184 | 1,035 | 1,002 | $0.134 | 最もフォトリアルな肌 |
| Grok Imagine 2.0 | 1,000 | 1,000 | 1,000 | 1,000 | 1,000 | $0.06 | ベンチマークの基準点 |
| Nano Banana 2 | 985 | 998 | 1,064 | 1,032 | 991 | $0.101 | 高速な4Kドラフト |
| Qwen Image 3.0 | 966 | 964 | 975 | 992 | 973 | $0.075 | スタイルの多様性 |
| Flux.2 Pro | 927 | 978 | 1,022 | 955 | 881 | $0.08 | 同一性が最も弱い |
出典:OpenArtの Arenaリーダーボード、画像ボード、v1.0。
これらのスコアが何をカバーし、何をカバーしないかについて一点だけ触れて、先へ進もう。Arenaが採点するのはリアリズム、同一性の一貫性、編集の精度だ。解剖学の専用テストは実施しないため、ここでは誰も指の本数を数えてくれない。リアリズムが最も近い公開指標であり、Nano Banana Proの1,184とQwen Image 3.0の975との差は、役立つほど大きい。信頼区間が重なるモデルは同点とみなそう。
人物の被写体に最適なモデルは
Seedream 5.0 Pro
最も安全なデフォルト。OverallとFilmをリードし、Creativityでもトップの1,103を獲得。Reference Adherenceの1,037は、渡した顔が同じ人物として返ってくる傾向があることを意味します。透明背景にも対応しており、これに並ぶのはGPT Image 2だけです。
難点は速度と余力です。上限は2Kで、参照画像は10枚まで、1K画像1枚に88.9秒かかります。グラフィックデザインでは975まで下がるため、クリーンなタイポグラフィが必要な画像は、人物をここで生成し、文字は別の場所で入れましょう。詳しいスペックは Seedream 5.0 Pro モデルページ.
GPT Image 2
修復ツール。画像編集で1,045とトップに立ち、プロンプト忠実度でも1,041で静かに首位を守ります。これはどの手が何を持っているかを正確に指定する場面で効いてきます。出力は4K、参照は16枚まで、32,000文字のプロンプトに対応し、44.8秒で完了します。
弱点はボード上位と比べたときの美観です。Subjective Aestheticsは1,030でSeedreamの1,043に及ばず、Realismは1,058でNano Banana Proの1,184に及びません。生成は他で行い、修正はここで行いましょう。 GPT Image 2 モデルページ に編集モードが一覧されている。
Nano Banana Pro
リアリズムでは他を引き離すリーダー。リアリズム1,184、フィルム1,059を記録し、14枚の参照画像を使った4Kでもわずか39.9秒と高速。
難点は2つ。1枚あたり$0.134と7モデル中で最も高く、GPT Image 2の約2.4倍。そして主観的美しさで981、グラフィックデザインで952と、いずれもアンカーを下回る。つまり「美しい」と感じられるより「技術的に説得力がある」と読み取られることのほうが多い。
Nano Banana 2
ドラフト用モデル。GoogleはGemini 3.1 Flash Imageとして文書化している。18.1秒、14枚の参照画像を使った4Kで、遅いモデルに取りかかる前に気に入った構図を見つける最速の方法だ。リアリズムは1,064と健闘。総合は985なので、出力は下書きとして扱おう。仕様とサンプルは Nano Banana 2 モデルページ.
人物の被写体に避けるべきモデルは
Flux.2 Pro はReference Adherenceで881と7つの中で最低で、キャラクター作業には向きません。 Qwen Image 3.0 はPrompt Adherenceで915のため、「左手だけでハンドルを握る」といった特定のポーズは正しく返ってこない可能性が高く、99.1秒とボード上で最も遅いモデルです。 Grok Imagine 2.0 がアンカーで、基準点として役立ち$0.06と安価だが、おすすめというわけではない。
参照忠実度がキャラクターの一貫性に与える意味
参照忠実度は表の中で最も直感的にわかりにくい数値だ。Arenaは同じ課題を7モデルすべてに通す。1人の男性を3枚のスナップ的なストリートショットで撮る——歩く、壁にもたれる、横断歩道を渡る——いずれも同じ顔、髪型、服装で。
Arenaは非公開の参照画像に照らしてこれらを採点するため、判定を下すのはあなたの目ではなくスコアだ。あなたが確認できるのは、課題のどれだけがこの過程を生き延びたかだ。7つの出力すべてが Arenaリーダーボード はReference Adherenceの項目です。繰り返し登場するキャラクターやブランドアンバサダー、AIペルソナを扱う作業なら、この列はOverallランキングよりも重要です。
2026年になってもAIが手を苦手とする理由
手には独立して動く16の関節があり、ほとんどのショットではそのいくつかが互いに、または物の後ろに隠れています。モデルは、数百ピクセルしか占めないかもしれない領域から、見えない解剖学的構造を推測しなければなりません。
Research from March 2025 put numbers on it. A team including researchers at Peking University built a 500 prompt human benchmark and found that close to half of generated images contained some distortion. Their companion dataset, Distortion-5K, annotated 4,700 images, and most flawed regions took up only a small share of the frame, which is why defects survive a quick glance. That study tested an older generation of models, so read it as evidence that the problem is real and hard to spot, not as a ranking of the seven models here.
当時から変わったのは、失敗が起きる場所だ。中央に据えたポートレートや開いた手のひらは、今ではたいてい問題なく仕上がる。エラーはより難しい箇所へ移った。カップの取っ手を握る指、手をつなぐ2人、顔の近くにある手、短縮遠近法で描かれた腕、そして被写体の後ろに立つ小さな顔だ。
顔と手のAI画像モデルをテストする方法
スコアで候補は絞れます。決めるのはあなた自身のプロンプトです。所要時間は約2時間です。
設定する。 表から3つのモデルを選び、次で実行します AI画像ジェネレーターでは、7モデルすべてを同じプロンプトボックスから呼び出せる。各モデルに同一のプロンプト、参照画像、アスペクト比、解像度を与えよう。プロンプトごとに4枚生成する。再試行はサービスエラー時のみにとどめ、結果が気に入らなかったという理由では決して行わないこと。さもないと、モデルではなく自分の忍耐力を採点していることになる。
うまくいかなくなるようなプロンプトを使いましょう。 以下の6つでほとんどをカバーできる:
- 取っ手を持って対象物をつかむ手
- 手をつなぐ2人
- 顔の近くに上げた手
- 左手を使ったアクション
- カメラに向かって伸びる短縮遠近法の腕
- 背景に顔が写る5人組
アイデンティティのテストを1つ追加:同じ参照画像を3つのモデルすべてに使用します。
ブラインドで採点しましょう。 モデル名は伏せておこう。すべての画像をフル解像度で開くこと。フィード上では見えない欠陥も、100パーセント表示なら一目瞭然だ。手については、指の本数、指の分かれ方、親指の位置、手首のつながり、関節の向き、そして握りが実際に対象物に触れているかを確認する。顔については、視線、歯、耳、横顔の形、意図しない左右非対称をチェックする。後方にいる小さな人物も含め、見えるすべての人を数えよう。
モデルごとに2つの数値を報告します: 最初の出力での合格率と、4回すべてでの合格率です。4回に1回しか決まらないモデルは、平均値が示す以上に手間を生みます。
画像を変えずにAIの手と顔を修正する方法
手が何本写り、それぞれが何をしているかを明記しましょう。「ハンドルで持ったコーヒーカップを握る、見える左手が1本」は、「コーヒーを持つ人物」よりはるかに多くの手がかりをモデルに与えます。最初の生成はシンプルに。腕を組む、指が重なる、小道具が3つ、1つのプロンプトに4人—こうした場面で破綻します。
重視したい解剖部位に合わせて構図を組もう。顔が40ピクセルしか占めていなければ、どのモデルを選んでも扱えるディテールは40ピクセル分だけ。背景の顔が重要なら、もっと寄せてトリミングするか解像度を上げよう。
うまくいかないときは、不具合のある領域だけをマスクして、一つの具体的な修正だけを依頼しましょう。狭いマスクなら、モデルが人物を描き直せる余地が減ります。そのうえで修復結果を元画像と原寸で見比べ、境界に注目してください。袖・アクセサリー・影・接触点こそ、部分編集がいつの間にか部分でなくなる場所です。
作業に合ったモデルの選び方
Arenaは新モデルの登場に合わせてこうした比較を再実行するため、今日を前提に立てた計画が来四半期も通用するとは限らない。Seedream 5.0 ProとGPT Image 2は総合スコアで4ポイント差と、1回のリリースで順位が入れ替わりかねないほど接近している。
人物用途で1つのモデルに標準化する前に、ここで重要な4つのボード——総合、フィルム、画像編集、そしてフィルム内のリアリズム基準——の最新の数値を確認しよう。新規アカウントには40の無料クレジットが付与され、クレジットカードは不要。3モデルで6プロンプトテストを回すのに十分な量だ。
よくある質問
リアルな顔にはどのモデルが最適?
Nano Banana ProはArenaのRealism基準で1,184と最高スコアを記録し、Seedream 5.0 Proの1,142を上回ります。複数の画像で一貫して保つ必要のある顔には、Reference Adherenceでも1,037とリードするSeedreamがより良い選択です。
手の描写に最も優れたモデルは?
手だけを単独で採点するボードはない。それに最も近いリアリズムとフィルムの指標ではSeedream 5.0 ProとNano Banana Proがリードし、後から手を修復する用途ではGPT Image 2が最も強力な選択肢だ。特定のモデルに決める前に、上記の6プロンプトテストを自分の課題で試してみよう。
現行のモデルでも指が余分に増えることはありますか?
はい、ただしシンプルなポーズではずっと少なくなりました。失敗は今や、持った物、交差した指、遮蔽、背景の小さな手に集中しています。2025年の旧世代モデルの研究では、500件のプロンプト人物ベンチマークのうち半数近くに歪みが含まれていました。
顔を変えずにAIの手を修正するには?
手と、手が物に触れる部分だけをマスクし、親指の自然な配置など、1つの具体的な修正を指示します。GPT Image 2はこの種の作業でArenaの画像編集ボードを1,045でリードしています。編集後は、袖や影、アクセサリーが変わっていないか、編集境界を確認してください。
この作業に最も安価なモデルは?
GPT Image 2が1枚$0.057、続いてGrok Imagine 2.0が$0.06、Qwen Image 3.0が$0.075。Nano Banana Proが$0.134で最も高価。
最速のモデルはどれですか?
Nano Banana 2は18.1秒、Grok Imagine 2.0は18.3秒です。最も遅いのはQwen Image 3.0の99.1秒で、Seedream 5.0 Proが88.9秒でそれに続きます。
参照画像でアイデンティティのぶれは解消できますか?
軽減はされます。似た角度の鮮明な参照画像があれば、顔の比率や特徴をモデルに示す手がかりになります。それでもポーズや編集によって同一性は揺らぐことがあるため、参照が保たれたと決めつけず、出力どうしで生え際・肌の質感・比率を見比べてください。
総合スコアが高いと解剖学的な精度も高い?
単独では判断できません。総合スコアは4つの大きな基準を均等に平均したものです。人物の被写体にはRealism(リアリズム)とReference Adherence(参照忠実度)を、修正作業にはEditing(編集)を使いましょう。