عرض لفترة محدودة! أطلق عام كامل من الإبداع بلا حدود مع الخطط السنوية بخصم يصل إلى 27%.

عرض الخطة ›
OpenArt Arena

أي نموذج صور بالذكاء الاصطناعي يُتقن الوجوه والأيدي؟

Evelyn Sep 22, 2026 قراءة 5 دقائق
لخّص باستخدام:
Which AI Image Model Gets Faces and Hands Right?

لوحة الصدارة العالمية للذكاء الإبداعي

أي نموذج صور بالذكاء الاصطناعي يُتقن الوجوه والأيدي؟ لقد راجعنا النتائج

سبعة نماذج صور موجودة على لوحات الصور في OpenArt Arena، والاختيار بينها للموضوعات البشرية عادةً ما يعتمد على التخمين. سحبنا نتائج المعايير المنشورة، بما فيها تلك التي تخفيها التصنيفات الموجزة، ووضعناها إلى جانب التكلفة الفعلية لكل نموذج وسرعة تشغيله.

  • الخيار الافتراضي للأشخاص: Seedream 5.0 Pro. يتصدر التقييم الإجمالي بنتيجة 1,051 والأفلام بنتيجة 1,074، ويحتفظ بأعلى درجة في الالتزام بالمرجع عند 1,037، وهو ما يبقي الوجه قابلاً للتعرف عليه من لقطة إلى أخرى.
  • الأكثر واقعية: Nano Banana Pro. يسجل 1,184 في معيار الواقعية على لوحة الأفلام، أعلى رقم منشور بين السبعة.
  • الأفضل لإصلاح يد سيئة: GPT Image 2. يتصدر تحرير الصور بنتيجة 1,045، وهو الأرخص بسعر 0.057 دولار للصورة، ويقبل 16 صورة مرجعية.

كيف تُقارَن النماذج السبعة

تُجري الساحة تصويتًا أعمى وجهًا لوجه وتُبلّغ عن نتائج بأسلوب Elo. يقع Grok Imagine 2.0 عند 1,000 كنقطة ارتكاز ثابتة، لذا يُقرأ كل رقم أدناه على أنه أفضل أو أسوأ من Grok. النتائج تُقارن فقط داخل العمود نفسه.

النموذج عام Film الواقعية تحرير الالتزام بالمرجع السعر الأفضل لـ
Seedream 5.0 Pro 1,051 1,074 1,142 1,037 1,037 $0.09 الخيار الافتراضي للأشخاص
GPT Image 2 1,047 1,058 1,058 1,045 1,035 $0.057 إصلاح يد أو وجه
Nano Banana Pro 1,008 1,059 1,184 1,035 1,002 $0.134 أكثر بشرة واقعية
Grok Imagine 2.0 1,000 1,000 1,000 1,000 1,000 $0.06 مرجع المعيار
Nano Banana 2 985 998 1,064 1,032 991 $0.101 مسودات 4K سريعة
Qwen Image 3.0 966 964 975 992 973 $0.075 تنوع الأنماط
Flux.2 Pro 927 978 1,022 955 881 $0.08 الأضعف في الهوية

المصدر: OpenArt's لوحة صدارة Arena، لوحات الصور، الإصدار 1.0.

ملاحظة واحدة حول ما تغطيه هذه النتائج وما لا تغطيه، ثم ننتقل. يسجّل Arena الواقعية واتساق الهوية ودقة التحرير. لا يشغّل اختبار تشريح منفصلًا، لذا لا شيء هنا يحصي الأصابع نيابةً عنك. الواقعية هي أقرب بديل منشور، والفجوة بين Nano Banana Pro عند 1,184 وQwen Image 3.0 عند 975 واسعة بما يكفي لتكون مفيدة. تعامل مع النماذج ذات فترات الثقة المتداخلة كتعادل.

أي النماذج الأفضل للأشخاص

Seedream 5.0 Pro

الخيار الافتراضي الأكثر أماناً. يتصدر التقييم الإجمالي والأفلام، ويحتل أعلى درجة إبداع عند 1,103، وتعني نتيجته 1,037 في الالتزام بالمرجع أن الوجه الذي تدخله يعود غالباً بمظهر الشخص نفسه. كما يدعم الخلفيات الشفافة، وهو ما يضاهيه فيه GPT Image 2 وحده.

العائق هو السرعة وهامش المرونة. يبلغ حده الأقصى 2K، ويقبل 10 صور مرجعية، ويستغرق 88.9 ثانية لصورة بدقة 1K. كما ينخفض إلى 975 في التصميم الجرافيكي، لذا إن كانت صورتك تحتاج إلى طباعة نظيفة، فأنشئ الشخص هنا وأضف النص في مكان آخر. تجد المواصفات الكاملة في الـ صفحة نموذج Seedream 5.0 Pro.

GPT Image 2

أداة الإصلاح. تتصدر تحرير الصور بنتيجة 1,045، كما تتصدر بهدوء الالتزام بالموجّه بنتيجة 1,041، وهو أمر مهم عندما تحدد بالضبط أي يد تحمل ماذا. تُخرج بدقة 4K، وتقبل 16 مرجعًا، وتستوعب موجّهًا من 32,000 حرف، وتعمل خلال 44.8 ثانية.

نقطة ضعفه هي الجماليات مقارنةً بمتصدري اللوحة: 1,030 في الجماليات الذاتية مقابل 1,043 لـ Seedream، و1,058 في الواقعية مقابل 1,184 لـ Nano Banana Pro. أنشئ في مكان آخر، وأصلح هنا. الـ صفحة نموذج GPT Image 2 يسرد أوضاع التحرير.

Nano Banana Pro

المتصدر في الواقعية بفارق واضح. 1,184 في الواقعية و1,059 في الأفلام، بدقة 4K مع 14 مرجعًا وبسرعة 39.9 ثانية.

أمران يعيقانه. بسعر 0.134 دولار للصورة فهو الأغلى بين السبعة، أي نحو 2.4 مرة سعر GPT Image 2. كما يسجل 981 في الجماليات الذاتية و952 في التصميم الجرافيكي، وهما دون المرجع في الاثنين، لذا يبدو مقنعًا تقنيًا أكثر من كونه جميلًا.

Nano Banana 2

نموذج المسودة. توثقه Google باسم Gemini 3.1 Flash Image. بسرعة 18.1 ثانية ودقة 4K مع 14 مرجعًا، هو أسرع طريقة لإيجاد تركيبة تعجبك قبل أن تلتزم بنموذج أبطأ. تصمد الواقعية عند 1,064. تقع النتيجة الإجمالية عند 985، لذا تعامل مع مخرجاته كرسم أولي. المواصفات والعينات على صفحة نموذج Nano Banana 2.

أي النماذج يجب تجنّبها للأشخاص

Flux.2 Pro يسجل 881 في الالتزام بالمرجع، وهي الأدنى بين السبعة، ما يستبعده لأعمال الشخصيات. Qwen Image 3.0 يسجل 915 في الالتزام بالمطالبة، لذا فإن وضعية محددة مثل "اليد اليسرى فقط، تمسك المقبض" أكثر عرضة للعودة خاطئة، وعند 99.1 ثانية فهو أبطأ نموذج على اللوحة. Grok Imagine 2.0 هو المرجع، مفيد كنقطة استناد ورخيص بسعر 0.06 دولار، لكنه ليس توصية.

ماذا يعني الالتزام بالمرجع لاتساق الشخصية

الالتزام بالمرجع هو الرقم الأقل بداهة في الجدول. يشغّل Arena الموجز نفسه عبر النماذج السبعة: رجل واحد في ثلاث لقطات شارع عفوية، يمشي، ويتكئ على جدار، ويعبر الطريق، بالوجه وتسريحة الشعر والزي نفسها في الثلاث جميعًا.

Seedream 5.0 Pro keeps the same man, navy sweater, blue jeans and leather backpack across three street shots
Seedream 5.0 Pro، الالتزام بالمرجع 1,037. يثبت الوجه والسترة الكحلية والجينز الأزرق والحذاء البني عبر الإطارات الثلاثة جميعها، وتظهر الحقيبة الجلدية في إطارين منها.
Flux.2 Pro renders the same man in plain dark trousers with no backpack
Flux.2 Pro، الالتزام بالمرجع 881. نفس التعليمات. السترة تبقى، والجينز يتحول إلى بنطال داكن عادي، وحقيبة الظهر تختفي من كل إطار. المجموعتان أُنشئتا لـ OpenArt Arena v1.0.

يسجّل Arena هذه مقابل صورة مرجعية لا ينشرها، لذا فالنتيجة هي الحكم بدلًا من عينك. ما يمكنك رؤيته هو مقدار ما يصمد من الموجز خلال الرحلة. المخرجات السبعة جميعها موجودة على لوحة صدارة Arena ضمن الالتزام بالمرجع، وإذا كان عملك يتضمن شخصية متكررة أو سفير علامة تجارية أو شخصية ذكاء اصطناعي، فإن هذا العمود أهم من الترتيب الإجمالي.

لماذا لا يزال الذكاء الاصطناعي يخطئ في رسم الأيدي في 2026

تحتوي اليد على ستة عشر مفصلاً تتحرك باستقلال، وفي معظم اللقطات يكون عدد منها مخفياً خلف بعضه أو خلف جسم ما. على النموذج أن يستنتج تشريحاً لا يراه، من منطقة قد لا تشغل سوى بضع مئات من البكسلات.

Research from March 2025 put numbers on it. A team including researchers at Peking University built a 500 prompt human benchmark and found that close to half of generated images contained some distortion. Their companion dataset, Distortion-5K, annotated 4,700 images, and most flawed regions took up only a small share of the frame, which is why defects survive a quick glance. That study tested an older generation of models, so read it as evidence that the problem is real and hard to spot, not as a ranking of the seven models here.

ما تغير منذ ذلك الحين هو موضع الإخفاقات. البورتريه المتمركز أو الكف المفتوح عادةً ما يخرج جيدًا الآن. انتقلت الأخطاء إلى أماكن أصعب: أصابع ملتفة حول مقبض كوب، شخصان يتشابكان الأيدي، يد قرب وجه، ذراع بمنظور مختصر، والوجوه الصغيرة الواقفة خلف موضوعك.

كيفية اختبار نماذج الصور بالذكاء الاصطناعي للوجوه والأيدي

النتائج تضيّق الخيارات. ومطالباتك أنت من يحسمها. يستغرق ذلك نحو ساعتين.

جهّزها. اختر ثلاثة نماذج من الجدول وشغّلها في الـ مولّد الصور بالذكاء الاصطناعي، حيث تُحمَّل النماذج السبعة جميعها من صندوق المطالبة نفسه. امنح كل واحد منها مطالبات ومراجع ونسبة أبعاد ودقة متطابقة. ولّد أربع صور لكل مطالبة. أعِد المحاولة فقط عند أخطاء الخدمة، لا لأنك لم تعجبك النتيجة، وإلا فأنت تقيّم صبرك بدل النموذج.

استخدم مطالبات تكشف الأخطاء. ستة تغطي معظمها:

  • يد تمسك جسمًا من مقبضه
  • شخصان يمسكان بيدي بعضهما
  • يد مرفوعة قرب الوجه
  • حركة بيد يسرى
  • ذراع ممدودة نحو الكاميرا بمنظور مختصر
  • مجموعة من خمسة أشخاص بوجوه في الخلفية

أضف اختبار هوية واحدًا: الصورة المرجعية نفسها عبر النماذج الثلاثة جميعًا.

قيّمه بشكل أعمى. أخفِ أسماء النماذج. افتح كل صورة بالدقة الكاملة، لأن العيب الذي لا يُرى في الخلاصة يصبح واضحًا عند 100 بالمئة. في الأيدي، تحقق من عدد الأصابع وتباعدها وموضع الإبهام واتصال المعصم واتجاه المفاصل، وما إذا كانت القبضة تلامس الجسم فعلًا. في الوجوه، تحقق من النظرة والأسنان والأذنين وهندسة الملامح الجانبية وعدم التماثل غير المقصود. أحصِ كل شخص ظاهر، بما في ذلك الأشخاص الصغار في الخلف.

أبلغ عن رقمين لكل نموذج: معدل النجاح في المخرجات الأولى، ومعدل النجاح عبر النتائج الأربع كلها. النموذج الذي يصيب مرة واحدة من أربع يخلق عملًا أكثر مما يوحي به متوسطه.

كيفية إصلاح الأيدي والوجوه المولّدة بالذكاء الاصطناعي دون تغيير الصورة

حدد كم يداً تظهر وما تفعله كل واحدة منها. عبارة "يد يسرى واحدة ظاهرة تمسك كوب قهوة من المقبض" تمنح النموذج ما يعمل عليه أكثر بكثير من "شخص مع قهوة". أبقِ الإنشاء الأول بسيطاً. فالأذرع المتقاطعة والأصابع المتداخلة وثلاثة أدوات وأربعة أشخاص في مطالبة واحدة هي حيث تنهار الأمور.

أطّر الصورة حول التشريح الذي يهمك. الوجه الذي يشغل 40 بكسلًا لديه 40 بكسلًا من التفاصيل للعمل معها، مهما كان النموذج الذي تختاره. إن كانت الوجوه في الخلفية مهمة، فاقتصص بشكل أضيق أو ارفع الدقة.

عندما يفشل شيء ما، قنّع فقط المنطقة المعيبة واطلب تصحيحًا واحدًا محددًا. القناع الضيق يمنح النموذج مساحة أقل لإعادة رسم الشخص. ثم قارن الإصلاح بالأصل بالدقة الكاملة، وانظر إلى الحدود: الأكمام والمجوهرات والظلال ونقاط التلامس هي حيث يتوقف التعديل المحلي بهدوء عن كونه محليًا.

كيفية اختيار النموذج المناسب لعملك

يعيد Arena تشغيل هذه المقارنات كلما صدرت نماذج جديدة، لذا فإن التصنيف الذي تخطط حوله اليوم ليس بالضرورة الذي سيصمد الربع القادم. يفصل بين Seedream 5.0 Pro وGPT Image 2 أربع نقاط في النتيجة الإجمالية، وهو تقارب كافٍ لأن يعيد إصدار واحد ترتيبهما.

قبل أن توحّد على نموذج واحد للموضوعات البشرية، تحقق من الأرقام الحالية على اللوحات الأربع المهمة هنا: الإجمالية، والأفلام، وتحرير الصور، ومعيار الواقعية ضمن الأفلام. تحصل الحسابات الجديدة على 40 رصيدًا مجانيًا، دون الحاجة إلى بطاقة ائتمان، وهو ما يكفي لتشغيل اختبار المطالبات الست عبر ثلاثة نماذج.

الأسئلة الشائعة

أي نموذج هو الأفضل للوجوه الواقعية؟

يسجل Nano Banana Pro أعلى نتيجة في معيار الواقعية بـ Arena عند 1,184، متقدماً على Seedream 5.0 Pro عند 1,142. أما للوجوه التي يجب أن تبقى متسقة عبر عدة صور، فإن Seedream هو الخيار الأفضل لأنه يتصدر أيضاً الالتزام بالمرجع عند 1,037.

أي نموذج هو الأفضل للأيدي؟

لا توجد لوحة تسجّل الأيدي بمفردها. يتصدر Seedream 5.0 Pro وNano Banana Pro مقاييس الواقعية والأفلام الأقرب إلى ذلك، وGPT Image 2 هو الخيار الأقوى لإصلاح يد بعد التوليد. شغّل اختبار المطالبات الست أعلاه على موجزاتك الخاصة قبل أن تلتزم.

هل لا تزال النماذج الحالية تضيف أصابع زائدة؟

نعم، وإن كان ذلك أقل بكثير في الوضعيات البسيطة. تتركز الإخفاقات الآن حول الأجسام الممسوكة والأصابع المتشابكة والحجب والأيدي الصغيرة في الخلفية. وجدت دراسة عام 2025 لجيل سابق من النماذج أن قرابة نصف معيار الأشخاص المكوّن من 500 مطالبة احتوى على تشوهات.

كيف أصلح يدًا مولّدة بالذكاء الاصطناعي دون تغيير الوجه؟

قنّع اليد فقط والمنطقة التي تلامس فيها جسماً، ثم اطلب تصحيحاً محدداً واحداً مثل وضع الإبهام بشكل طبيعي. يتصدر GPT Image 2 لوحة تحرير الصور في Arena بنتيجة 1,045 لهذا النوع من العمل. تحقق بعد ذلك من حدود التعديل بحثاً عن أي تغيّر في الأكمام والظلال والمجوهرات.

أي نموذج هو الأرخص لهذا العمل؟

GPT Image 2 بسعر 0.057 دولار للصورة، يليه Grok Imagine 2.0 بسعر 0.06 دولار وQwen Image 3.0 بسعر 0.075 دولار. وNano Banana Pro هو الأغلى بسعر 0.134 دولار.

ما أسرع نموذج؟

Nano Banana 2 عند 18.1 ثانية وGrok Imagine 2.0 عند 18.3 ثانية. أما Qwen Image 3.0 فهو الأبطأ عند 99.1 ثانية، يليه Seedream 5.0 Pro عن قرب عند 88.9 ثانية.

هل تُصحّح الصور المرجعية انحراف الهوية؟

تقلّل منه. فالمرجع الواضح بزاوية مماثلة يمنح النموذج دليلاً على نسب الوجه والملامح المميزة. لكن الهوية قد تتغير عبر الوضعيات والتعديلات، لذا قارن خط الشعر وملمس البشرة والنسب بين المخرجات بدلاً من افتراض أن المرجع ثبت.

هل يعني ارتفاع النتيجة الإجمالية تشريحًا أفضل؟

ليس بمفرده. المعدل الإجمالي يوازن بين أربعة معايير عامة بوزن متساوٍ. استخدم الواقعية والالتزام بالمرجع للأشخاص، والتحرير لأعمال الإصلاح.

أبدع بلا حدود

انضم إلى ملايين المبدعين الذين يستخدمون OpenArt لإنشاء الصور والفيديوهات والشخصيات والقصص - كلها في منصة واحدة.

ابدأ مجانًا →