چند سال اخیر تحت سلطه سیستم‌های هوش مصنوعی بوده‌اند که تصاویر را خلق می‌کنند. شاید کمتر پرزرق‌وبرق باشد، اما مسلماً دشوارتر است: چالش آموزش دادن به ماشین‌ها برای درک واقعی آنچه می‌بینند. تولید یک پرتره واقع‌گرایانه (فوتورئالیستیک) چشمگیر است، اما از یک هوش مصنوعی بخواهید برچسب هشدار موجود در آن پرتره را بخواند، موقعیت شیء را نسبت به پس‌زمینه مشخص کند و سپس به یک سوال منطقی درباره آن صحنه پاسخ دهد، همچنان یک مسئله مهندسی واقعاً دشوار است. Qwen-Image، یک مدل جدید بینایی-زبان که در یک گزارش فنی اخیر به تفصیل شرح داده شده است، با هدفی مشخص وارد این حوزه می‌شود: عبور از توصیفات سطحی و پردازش اطلاعات بصری و متنی به عنوان یک جریان واحد و یکپارچه.

آنچه Qwen-Image متفاوت انجام می‌دهد

اکثر سیستم‌های بینایی قدیمی‌تر، به یک تصویر مانند یک ناظر گذری نگاه می‌کنند که شاید فقط نگاهی گذرا به یک پوستر بیندازد. آن‌ها سوژه اصلی را شناسایی کرده، یک کپشن (توضیح) کلی به آن می‌چسبانند و از آن می‌گذرند. عکس یک گوشه شلوغ خیابان صرفاً به «ماشین‌ها و عابران پیاده در جاده» تبدیل می‌شود. این سطح از خروجی برای مرتب‌سازی آلبوم‌های عکس مفید است، اما زمانی که به دقت نیاز دارید، به سرعت کارایی خود را از دست می‌دهد.

Qwen-Image برای فراتر رفتن از این سطح ساخته شده است. این مدل به جای اینکه تشخیص تصویر و درک زبان را به عنوان وظایف جداگانه‌ای که به هم دوخته شده‌اند در نظر بگیرد، از همان ابتدا داده‌های بصری و متن را با هم مدیریت می‌کند. این پردازش یکپارچه از این جهت اهمیت دارد که به مدل اجازه می‌دهد زبان را بر پایه آنچه واقعاً می‌بیند استوار کند، به جای اینکه بر اساس طرحی کلی از صحنه حدس بزند. وقتی مدل برای یک تصویر کپشن می‌نویسد، به سوالی پاسخ می‌دهد یا متنی را که در یک عکس گنجانده شده می‌خواند، از همان بازنمایی مشترک ورودی بصری استفاده می‌کند.

چهار قابلیت که ارزش بررسی دارند

گزارش فنی بر چهار نقطه قوت خاص تأکید می‌کند که Qwen-Image را از مدل‌هایی که صرفاً اشیاء را برچسب‌گذاری می‌کنند، متمایز می‌سازد.

توضیح‌نویسی (Captioning) تصاویر با دقت بالا. یک کپشن مفید چیزی فراتر از فهرستی از اشیاء است؛ بلکه بافت (context)، عمل و روابط را نیز در بر می‌گیرد. در عمل، این به معنای تمایز قائل شدن بین عکس یک سرآشپز که در حال خرد کردن سبزیجات است و یک نمای ایستا از مواد اولیه روی پیشخوان است. برای توسعه‌دهندگانی که ابزارهای نظارت بر محتوا، ابزارهای دسترسی‌پذیری یا مولدهای خودکار متادیتا می‌سازند، این لایه اضافی از دقت توصیفی، زمان بررسی دستی را کاهش داده و خطاها را کم می‌کند.

تشخیص متن قدرتمند در داخل تصاویر. بسیاری از وظایف بصری در دنیای واقعی مستلزم خواندن کلماتی هستند که به طور طبیعی در عکس‌ها ظاهر می‌شوند. به تابلوهای مغازه‌ای که از زوایای عجیب عکس گرفته شده‌اند، اسکرین‌شات‌های پیام‌های خطا، یادداشت‌های دست‌نویس یا اسناد چاپی که با دوربین گوشی ثبت شده‌اند، فکر کنید. مدلی که بتواند این متن را بدون نیاز به یک خط لوله (pipeline) جداگانه OCR، به طور قابل اعتماد استخراج و درک کند، معماری اپلیکیشن را به میزان قابل توجهی ساده می‌کند. توسعه‌دهندگان دیگر نیازی ندارند که یک خواننده خارجی را به سیستم اضافه کنند و امیدوار باشند که این دو سیستم بر سر محتوای تصویر با هم توافق کنند.

استدلال بهبودیافته برای سوالات بصری. پاسخ دادن به سوالی درباره یک تصویر زمانی آسان است که پاسخ دقیقاً قابل مشاهده باشد، مانند «رنگ توپ چیست؟». سوالات دشوارتر نیازمند منطق هستند: مقایسه مقادیر، دنبال کردن تغییرات در یک توالی، یا استنباط عملکرد از روی ظاهر. یک تکنسین تعمیرات ممکن است بپرسد که آیا یک خازن خاص به درستی در جای خود قرار گرفته است یا یک خریدار ممکن است بر اساس یک عکس بپرسد کدام یک از دو محصول تاریخ انقضای بهتری دارد. Qwen-Image این وظایف بصری پیچیده را با دقتی بسیار بیشتر از مدل‌هایی که صرفاً کلمات کلیدی را با نواحی تصویر مطابقت می‌دهند، انجام می‌دهد.

درک بهتر روابط فضایی. بینایی انسان عمیقاً فضایی است. ما فوراً درک می‌کنیم که ماگ قهوه پشت درب لپ‌تاپ است، یا دوچرخه بین حصار و لبه پیاده‌رو قرار دارد. ماشین‌ها اغلب با مفاهیمی مثل «سمت چپِ»، «زیرِ» یا «تا حدی پوشیده شده توسطِ» مشکل دارند، به خصوص زمانی که صحنه شلوغ باشد. استدلال فضایی قوی‌تر، یک مدل بینایی را برای ناوبری رباتیک، سیستم‌های موجودی انبار، لایه‌های واقعیت افزوده و هر اپلیکیشنی که در آن چیدمان فیزیکی اشیاء معنایی دارد، بسیار کاربردی‌تر می‌کند.

پر کردن شکاف بین دیدن و درک کردن

فاصله زیادی بین تشخیص پیکسل‌های خام و درک واقعی وجود دارد. یک دوربین امنیتی می‌تواند کف انبار را «ببیند» به این معنا که فوتون‌ها را ثبت می‌کند، اما درک اینکه یک پالت جابجا شده، یک علامت هشدار اکنون پوشانده شده است، و اینکه می‌توان به سوال یک کارگر درباره ارتفاع مجاز با خواندن برچسب روی نزدیک‌ترین قفسه پاسخ داد، مستلزم چیزی پیچیده‌تر است.

محققان پشت Qwen-Image آن را به‌طور خاص برای پر کردن این شکاف طراحی کرده‌اند. این مدل با یکپارچه‌سازی پردازش بینایی و زبان، با هدف ارائه نوعی درک عمیق و مبتنی بر واقعیت طراحی شده است که بینایی ماشین را به‌جای محدود شدن به نمایش‌های ساده، برای جریان‌های کاری پیچیده کاربردی می‌کند.

چرا بنچمارک‌ها برای توسعه‌دهندگان اهمیت دارند

نمایش یک مدل با استفاده از نمونه‌های گلچین‌شده یک بحث است و استقرار آن در محیط عملیاتی، جایی که کاربران تصاویر تار، با نورپردازی ضعیف و با ترکیب‌بندی‌های عجیب آپلود می‌کنند، بحثی دیگر. این گزارش خاطرنشان می‌کند که Qwen-Image در بنچمارک‌های استاندارد عملکرد خوبی دارد. اهمیت این بنچمارک‌ها در این است که مدل‌ها را در شرایط کنترل‌شده در معرض انواع مختلف تصاویر، نمونه‌های خصمانه و قالب‌های سوالی متنوع قرار می‌دهند.

برای توسعه‌دهندگان، عملکرد پایدار در بنچمارک به معنای پیش‌بینی‌پذیری است. این یعنی با تغییر نور، ظاهر شدن متن با فونتی غیرمنتظره، یا زمانی که کاربر سوالی می‌پرسد که مستلزم اتصال چندین واقعیت بصری به یکدیگر است، با شکست‌های غیرمنتظره کمتری روبرو خواهید شد. هنگام انتخاب یک مدل پایه برای یک اپلیکیشن بینایی ماشین، این قابلیت اطمینان اغلب بیش از قابلیت‌های پرزرق‌وبرق اهمیت دارد.

نتیجه‌گیری اصلی

مدل‌هایی که می‌توانند به یک تصویر نگاه کنند و چیزی درباره آن بگویند، کم نیستند. مدل‌های مفید آن‌هایی هستند که متن داخل کادر را می‌خوانند، در مورد سوالات پیچیده استدلال می‌کنند، چیدمان‌های فضایی را به‌دقت توصیف می‌کنند و کپشن‌هایی تولید می‌کنند که واقعاً بازتاب‌دهنده آنچه در حال رخ دادن است باشد. به نظر می‌رسد Qwen-Image برای این دسته دوم از کارها ساخته شده است.

اگر در حال ارزیابی مدل‌های بینایی-زبان برای یک پروژه عملیاتی هستید، گزارش فنی کامل شامل روش‌شناسی، جزئیات مجموعه داده و نتایج آزمایشی است که برای انجام یک مقایسه آگاهانه به آن‌ها نیاز خواهید داشت. می‌توانید گزارش کامل را در اینجا بخوانید. اگر می‌خواهید درباره این پیشرفت‌ها با سایر سازندگان و پژوهشگران گفتگو کنید، جامعه یادگیری GyaanSetu در دسترس است.