مسیر رسیدن به این مرحله

هوش مصنوعی مولد تصویر، رقابتی تنگاتنگ میان چند آزمایشگاه با بودجه‌های کلان بوده است. OpenAI با سری GPT-Image معیار اولیه را تعیین کرد؛ Meta با Muse-Image به دنبال هنر سبک‌پردازی شده بود، Google مدل Gemini را برای دستورهای چندزبانه ساخت و Alibaba مدل Qwen-Image-3.0-Pro را برای جلوه‌های بصری تجارت الکترونیک عرضه کرد. xAI سال گذشته با نسخه‌ی «Quality» وارد میدان شد که تصاویر قابل‌قبولی تولید می‌کرد، اما در پیروی از دستورالعمل‌ها و کنترل چیدمان (layout) عقب بود.

Imagine Image 2.0 اولین ارتقای بزرگ نسلی را رقم می‌زند. این مدل که در پلتفرم Grok ادغام شده است، بر دو جبهه تمرکز دارد: کیفیت تولید خام و ابزارهای ویرایشی کاربردی که با جریان‌های کاری حرفه‌ای سازگار هستند. عرضه این مدل با حرکت صنعت به سمت تولید محتوا به کمک هوش مصنوعی همزمان شده است؛ جایی که سرعت و دقت به اندازه دقت بصری اهمیت دارند.

اعداد و ارقام مهم

Arena، یک بنچمارک مستقل که مدل‌ها را در چالش‌های رودررو با یکدیگر مقایسه می‌کند، آخرین امتیازات خود را در ۷ اوت ۲۰۲۶ منتشر کرد. نسخه «low» از Imagine Image 2.0 در بخش Image Edit امتیاز Elo معادل ۱٬۴۳۹ را کسب کرد، در حالی که GPT-Image-2 امتیاز ۱٬۴۶۳ را داشت. در بخش Text-to-Image، این مدل امتیاز ۱٬۳۲۰ را کسب کرد که در مقایسه با امتیاز ۱٬۳۸۰ OpenAI، کمتر است. Imagine Image 2.0 در بنچمارک‌های Arena رتبه دوم جهانی را به خود اختصاص داده و با اختلاف اندکی پس از GPT-Image-2 شرکت OpenAI قرار دارد.

فراتر از دو رتبه نخست، Imagine Image 2.0 مدل‌های Muse-Image از Meta، Qwen-Image-3.0-Pro از Alibaba، Gemini از Google و SeedDream از ByteDance را شکست داد. این پیروزی‌ها نشان می‌دهد که این مدل در عملکرد سنجش‌شده‌ی عمومی، از حاشیه‌ها به سطح برتر (top-tier) رسیده است.

ابزارهای ویرایشی با هدف کاربردهای واقعی

برای طراحان، بازاریابان و توسعه‌دهندگان بازی، تولید خام تنها نیمی از ماجراست. Imagine Image 2.0 مجموعه‌ای از ویژگی‌های ویرایشی را ارائه می‌دهد که آن را به یک ویرایشگر گرافیکی کامل نزدیک می‌کند:

  • Magic Wand – یک قلم‌موی موضعی که ناحیه خاصی را برای تغییرات هدفمند جدا می‌کند، بدون اینکه به بقیه تصویر آسیبی برسد.
  • Segmentation – به کاربران اجازه می‌دهد نواحی دقیقی را انتخاب کنند، مشابه ماسک در نرم‌افزارهای سنتی ویرایش عکس.
  • Background Removal – سوژه‌ها را روی یک بوم شفاف خروجی می‌دهد که برای ترکیب‌بندی (compositing) آماده است.
  • Multi-Ref Editing – تا پنج تصویر ورودی را در یک تولید واحد ادغام می‌کند و امکان ایجاد مفاهیم ترکیبی را فراهم می‌سازد که در غیر این صورت نیازمند کلاژ دستی بودند.
  • Smart Resize – از قابلیت inpainting مولد برای پر کردن پیکسل‌های گمشده هنگام تغییر نسبت ابعاد استفاده می‌کند و ضمن سازگاری با فرمت‌های جدید، ترکیب‌بندی را حفظ می‌کند.

قالب‌های پیش‌فرض برای عکاسی محصول، دارایی‌های بازاریابی، اسپرایت‌های بازی و ایموجی‌های استریم، جریان کاری از دستور تا خروجی را تسهیل می‌کنند. کاربران با چیدمانی شروع می‌کنند که از قبل با استانداردهای صنعت مطابقت دارد و سپس جزئیات را با ابزارهای جدید اصلاح می‌کنند.

زمینه‌سازی برای ویدیوهای مبتنی بر هوش مصنوعی

نقشه راه xAI به چشم‌اندازی بلندمدت اشاره دارد: تولید ویدیو. حفظ ثبات در طول فریم‌ها — یعنی حفظ سبک شخصیت، نورپردازی و محیط یکسان — مدت‌هاست که مانعی برای هوش مصنوعی مولد بوده است.

جمع‌بندی

Imagine Image 2.0 به لطف امتیازات بالای بنچمارک و ابزارهایی که نیازهای روزمره تولیدکنندگان حرفه‌ای را برطرف می‌کنند، چالشی جدی برای پیشتازی دیرینه OpenAI ایجاد کرده است. این مدل هنوز در عملکرد خام عقب‌تر است و تأثیر آن بستگی به این دارد که کاربران با چه سرعتی جریان کاری ویرایشی را پذیرفته و آیا این استودیو می‌تواند ثبات بصری را به خطوط تولید ویدیویی کاربردی تبدیل کند یا خیر. چند ماه آینده مشخص خواهد کرد که آیا کسب رتبه دوم یک جهش گذرا بوده یا آغاز یک تغییر پایدار در بازار تصاویر مولد است.