بنچمارک ActiveVision نشان میدهد که مدلهای زبانی بزرگ (LLMs) چندوجهی پیشرو امروزی، تنها ۱۰.۶٪ از وظایفی را که مستلزم نگاه کردن بیش از یک بار به تصویر هستند، حل کردهاند. در آزمونی شامل ۱۷ چالش ادراک تکرارشونده، انسانها در ۹۶.۱٪ موارد موفق بودند، در حالی که GPT-5.5 موفقیت ۱۰.۶ درصدی و Claude Fable 5 موفقیت ۳.۵ درصدی داشتند؛ در یازده مورد از وظایف، هیچ پاسخ صحیحی از سوی مدلها ارائه نشد.
چرا مدلهای بینایی فعلی دچار لغزش میشوند
اکثر سیستمهای بینایی با یک تصویر به عنوان یک ورودی یکباره برخورد میکنند. یک «رمزگذار بینایی» (vision encoder) ویژگیها را یکبار استخراج کرده و سپس آنها را برای استدلال به مدل زبانی تحویل میدهد. این خط لوله (pipeline) نمیتواند درخواست نگاه دوم کند، روی منطقهای زوم کند یا یک فرضیه را دوباره ارزیابی کند. در مقابل، انسانها یک حدس اولیه میزنند، تمرکز خود را تغییر میدهند، شواهد جدید جمعآوری میکنند و پاسخ خود را اصلاح میکنند. این بنچمارک آن چرخه را رسمیسازی میکند: هر وظیفه مدل را مجبور میکند تا مشاهده کند، اقدامی را پیشنهاد دهد، نتیجه را مشاهده کند و این روند را تا رسیدن به نتیجه صحیح تکرار کند.
بنچمارک چه چیزی را آزمایش کرد
محققان ۱۷ سناریو ساختند که نیازمند مشاهده مکرر هستند. نتایج تکاندهنده است:
- شرکتکنندگان انسانی: ۹۶.۱٪ موفقیت
- GPT-5.5: ۱۰.۶٪ موفقیت
- Claude Fable 5: ۳.۵٪ موفقیت
- یازده وظیفه: تمام مدلهای آزمایششده امتیاز صفر گرفتند
حتی زمانی که مدلها برای پردازش مجدد تصویر کد تولید کردند، باز هم متوجه خطاها در خروجی خود نشدند، که این امر تأیید میکند که این محدودیت بیشتر ساختاری است تا صرفاً مبتنی بر داده.
مخاطرات برای توسعهدهندگان و صنعت
اگر در حال ساخت رباتهای خودمختار، پهپادهای بازرسی یا هر سیستمی هستید که باید اطلاعات بصری را در طول زمان تأیید کند، استفاده از یک مدل بینایی تکمرحلهای (single-shot) پرخطر است. این بنچمارک نشان میدهد که خط لولههای بینایی مبتنی بر LLM فعلی نمیتوانند به طور قابل اعتماد ادراک مبتنی بر بازخورد را مدیریت کنند، بنابراین نقصها را نادیده میگیرند، اشیاء را اشتباه میشمارند یا صحنههای پویا را اشتباه تفسیر میکنند. افزودن دادههای آموزشی بیشتر یا افزایش پارامترها این شکاف را پر نخواهد کرد؛ عنصر مفقوده، مکانیزمی برای مشاهده کنترلشده و تکرارشونده است.
استدلال متقابل: آیا مدلهای بزرگتر میتوانند کمک کنند؟
افزودن دادههای آموزشی بیشتر یا افزایش پارامترها این شکاف را پر نخواهد کرد؛ عنصر مفقوده، مکانیزمی برای مشاهده کنترلشده و تکرارشونده است.
مسیرهای پیش رو
محققان یک جهت مکمل را پیشنهاد میکنند:
- بازطراحی ساختاری – تعبیه یک ماژول بصری قابل کنترل که بتواند بر اساس وضعیت داخلی مدل، درخواست نماهای جدید کند، نواحی را برش دهد (crop) یا شرایط نورپردازی را تغییر دهد.
نکته کلیدی: مدلهای LLM چندوجهی فعلی در پاسخ به سوالات مربوط به تصاویر ایستا عالی هستند، اما زمانی که یک مسئله مستلزم نگاه دوباره باشد، ناتوان میمانند. هوش بصری واقعی به مدلهایی نیاز خواهد داشت که بتوانند بینایی خود را کنترل کنند، نه اینکه فقط یک بار یک تصویر را بخوانند.
