يُظهر معيار ActiveVision أن النماذج اللغوية الكبيرة (LLMs) متعددة الوسائط الرائدة اليوم قد نجحت في حل 10.6% فقط من المهام التي تتطلب النظر إلى الصورة أكثر من مرة واحدة. وفي اختبار شمل 17 تحدياً للإدراك التكراري، نجح البشر بنسبة 96.1%، بينما حقق GPT-5.5 نسبة 10.6% وحقق Claude Fable 5 نسبة 3.5%؛ كما لم تقدم النماذج أي إجابات صحيحة في إحدى عشرة مهمة من المهام.
لماذا تتعثر نماذج الرؤية الحالية
تتعامل معظم أنظمة الرؤية مع الصورة كمدخل لمرة واحدة فقط. حيث يقوم "مشفر الرؤية" (vision encoder) باستخراج الميزات مرة واحدة، ثم يسلمها إلى النموذج اللغوي لغرض الاستنتاج. ولا يمكن لسلسلة المعالجة هذه أن تطلب نظرة ثانية، أو تكبير منطقة معينة، أو إعادة تقييم فرضية ما. وفي المقابل، يقوم البشر بوضع تخمين أولي، ثم يغيرون تركيزهم، ويجمعون أدلة جديدة، ويعدلون إجابتهم. ويقوم هذا المعيار بصياغة تلك الحلقة: حيث تجبر كل مهمة النموذج على الملاحظة، واقتراح إجراء، وملاحظة النتيجة، وتكرار العملية حتى يصل إلى استنتاج صحيح.
ما الذي اختبره المعيار
صمم الباحثون 17 سيناريو تتطلب ملاحظة متكررة. والنتائج كانت صارخة:
- المشاركون من البشر: نجاح بنسبة 96.1%
- GPT-5.5: نجاح بنسبة 10.6%
- Claude Fable 5: نجاح بنسبة 3.5%
- إحدى عشرة مهمة: سجل كل نموذج تم اختباره صفرًا
وحتى عندما قامت النماذج بتوليد كود لإعادة معالجة الصورة، فقد أغفلت الأخطاء في مخرجاتها الخاصة، مما يؤكد أن القصور هيكلي وليس ناتجاً عن البيانات فحسب.
المخاطر التي تواجه المطورين والصناعة
إذا كنت تقوم ببناء روبوتات ذاتية القيادة، أو طائرات بدون طيار للفحص، أو أي نظام يجب أن يتحقق من المعلومات المرئية بمرور الوقت، فإن الاعتماد على نموذج رؤية يعمل بمحاولة واحدة (single-shot) يعد أمراً محفوفاً بالمخاطر. يوضح المعيار أن سلاسل معالجة الرؤية القائمة على النماذج اللغوية الكبيرة (LLMs) الحالية لا يمكنها التعامل بشكل موثوق مع الإدراك القائم على التغذية الراجعة، وبالتالي ستغفل عن العيوب، أو تخطئ في عد العناصر، أو تسيء تفسير المشاهد الديناميكية. إن إضافة المزيد من بيانات التدريب أو زيادة عدد المعلمات لن يسد هذه الفجوة؛ فالعنصر المفقود هو آلية للملاحظة المنضبطة والمتكررة.
حجة مضادة: هل يمكن للنماذج الأكبر أن تساعد؟
إن إضافة المزيد من بيانات التدريب أو زيادة عدد المعلمات لن يسد هذه الفجوة؛ فالعنصر المفقود هو آلية للملاحظة المنضبطة والمتكررة.
المسارات المستقبلية
يقترح الباحثون اتجاهاً تكميلياً:
- إعادة التصميم الهيكلي – دمج وحدة بصرية قابلة للتحكم يمكنها طلب زوايا رؤية جديدة، أو قص مناطق معينة، أو تغيير ظروف الإضاءة بناءً على الحالة الداخلية للنموذج.
الخلاصة: تتفوق النماذج اللغوية الكبيرة (LLMs) متعددة الوسائط الحالية في الإجابة على الأسئلة المتعلقة بالصور الثابتة، لكنها تقصر عندما تتطلب المشكلة النظر مرة أخرى. سيتطلب الذكاء البصري الحقيقي نماذج يمكنها التحكم في رؤيتها الخاصة، وليس مجرد قراءة الصورة مرة واحدة.
