كيف وصل السباق إلى هذه النقطة

كان الذكاء الاصطناعي التوليدي للصور بمثابة صراع محتدم بين حفنة من المختبرات ذات التمويل الضخم. وضعت OpenAI المعيار الأول بسلسلة GPT-Image الخاصة بها؛ بينما سعت Meta وراء الفن الأسلوبي باستخدام Muse-Image، وبنت Google نموذج Gemini للمطالبات متعددة اللغات، وأطلقت Alibaba نموذج Qwen-Image-3.0-Pro للمرئيات الخاصة بالتجارة الإلكترونية. دخلت xAI العام الماضي بنسخة "Quality" التي أنتجت صوراً جيدة ولكنها تأخرت في اتباع التعليمات والتحكم في التخطيط.

يمثل Imagine Image 2.0 أول ترقية جيلية كبرى. ومن خلال دمجه في منصة Grok، يعمل النموذج على جبهتين: جودة التوليد الخام وأدوات التحرير العملية التي تتناسب مع سير العمل الاحترافي. ويتزامن هذا الإطلاق مع توجه الصناعة نحو إنشاء المحتوى بمساعدة الذكاء الاصطناعي، حيث تكتسب السرعة والدقة أهمية توازي الأهمية التي توليها الدقة البصرية.

أرقام تهمك

نشرت Arena، وهي معيار مستقل يضع النماذج في مواجهة بعضها البعض في تحديات مباشرة، أحدث نتائجها في 7 أغسطس 2026. حصلت النسخة "low" من Imagine Image 2.0 على تصنيف Elo قدره 1,439 في ساحة Image Edit، مقابل 1,463 لنموذج GPT-Image-2. وفي ساحة Text-to-Image، سجل النموذج 1,320 نقطة، مقارنة بـ 1,380 لنماذج OpenAI. يحتل Imagine Image 2.0 المرتبة الثانية عالمياً في معايير Arena، متأخراً بفارق ضئيل عن GPT-Image-2 من OpenAI.

وبالإضافة إلى المركزين الأول والثاني، تفوق Imagine Image 2.0 على Muse-Image من Meta، وQwen-Image-3.0-Pro من Alibaba، وGemini من Google، وSeedDream من ByteDance. وتظهر هذه الانتصارات أن النموذج قد انتقل من كونه نموذجاً ثانوياً إلى فئة النخبة في الأداء المقاس علناً.

أدوات تحرير موجهة للعمل الواقعي

التوليد الخام ليس سوى نصف القصة بالنسبة للمصممين والمسوقين ومطوري الألعاب. يضم Imagine Image 2.0 مجموعة من ميزات التحرير التي تدفعه ليصبح محرر رسومات متكامل الميزات:

  • Magic Wand – فرشاة موضعية تعزل منطقة محددة لإجراء تغييرات مستهدفة دون المساس ببقية الصورة.
  • Segmentation – تتيح للمستخدمين تحديد مناطق دقيقة، مثل القناع (mask) في برامج تحرير الصور التقليدية.
  • Background Removal – تخرج العناصر على خلفية شفافة، لتكون جاهزة للتركيب (compositing).
  • Multi-Ref Editing – تدمج ما يصل إلى خمس صور مدخلة في عملية توليد واحدة، مما يتيح مفاهيم هجينة قد تتطلب خلاف ذلك تجميعاً يدوياً (collage).
  • Smart Resize – تستخدم تقنية الـ inpainting التوليدية لملء البكسلات المفقودة عند تغيير نسب العرض إلى الارتفاع، مما يحافظ على التكوين مع التكيف مع التنسيقات الجديدة.

تعمل القوالب المعدة مسبقاً لتصوير المنتجات، والأصول التسويقية، وعناصر الألعاب (game sprites)، ورموز التعبير للبث المباشر (streaming emojis) على تبسيط سير العمل من المطالبة إلى المخرج النهائي. يبدأ المستخدمون بتخطيط يلبي بالفعل معايير الصناعة، ثم يقومون بتعديل التفاصيل باستخدام الأدوات الجديدة.

تمهيد الطريق للفيديو المدعوم بالذكاء الاصطناعي

تشير خارطة طريق xAI إلى رؤية طويلة المدى: توليد الفيديو. إن الاتساق عبر الإطارات —أي الحفاظ على نفس أسلوب الشخصية والإضاءة والبيئة— لطالما أعاق الذكاء الاصطناعي التوليدي.

الخلاصة

يمنح Imagine Image 2.0 شركة xAI تحدياً حقيقياً للريادة الطويلة لشركة OpenAI، بفضل درجات المعايير القوية والأدوات التي تلبي الاحتياجات اليومية للمبدعين المحترفين. لا يزال النموذج يتخلف في الأداء الخام، وسيعتمد تأثيره على مدى سرعة اعتماد المستخدمين لسير عمل التحرير، وما إذا كان الاستوديو قادراً على تحويل الاتساق البصري إلى مسارات عمل فيديو قابلة للتطبيق. ستكشف الأشهر القليلة القادمة ما إذا كان المركز الثاني مجرد طفرة عابرة أم بداية لتحول مستدام في سوق الصور التوليدية.