ActiveVision बेंचमार्क से पता चलता है कि आज के प्रमुख मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (LLMs) केवल 10.6% उन कार्यों को हल कर पाए जिनमें एक छवि को एक से अधिक बार देखने की आवश्यकता होती है। 17 इटरैटीव-परसेप्शन (iterative-perception) चुनौतियों के एक परीक्षण में, मनुष्य 96.1% बार सफल रहे, जबकि GPT-5.5 केवल 10.6% और Claude Fable 5 केवल 3.5% तक ही पहुँच पाए; ग्यारह कार्यों में मॉडल्स की ओर से शून्य सही उत्तर मिले।

वर्तमान विजन मॉडल्स क्यों लड़खड़ाते हैं

अधिकांश विजन सिस्टम एक छवि को केवल एक बार के इनपुट के रूप में देखते हैं। एक "विजन एनकोडर" (vision encoder) एक बार फीचर्स निकालता है, और फिर उन्हें रीजनिंग के लिए लैंग्वेज मॉडल को सौंप देता है। यह पाइपलाइन दोबारा देखने, किसी क्षेत्र को ज़ूम करने, या किसी परिकल्पना (hypothesis) का पुनर्मूल्यांकन करने के लिए नहीं कह सकती। इसके विपरीत, मनुष्य एक प्रारंभिक अनुमान लगाते हैं, अपना ध्यान बदलते हैं, नए साक्ष्य जुटाते हैं, और अपने उत्तर को समायोजित करते हैं। यह बेंचमार्क उसी लूप को औपचारिक रूप देता है: प्रत्येक कार्य मॉडल को देखने, एक क्रिया का प्रस्ताव करने, परिणाम देखने और तब तक दोहराने के लिए मजबूर करता है जब तक कि वह सही निष्कर्ष पर न पहुँच जाए।

बेंचमार्क ने क्या परीक्षण किया

शोधकर्ताओं ने 17 ऐसे परिदृश्य बनाए जिनमें बार-बार अवलोकन की आवश्यकता होती है। परिणाम चौंकाने वाले हैं:

  • मानव प्रतिभागी: 96.1% सफलता
  • GPT-5.5: 10.6% सफलता
  • Claude Fable 5: 3.5% सफलता
  • ग्यारह कार्य: परीक्षण किए गए प्रत्येक मॉडल का स्कोर शून्य रहा

यहाँ तक कि जब मॉडल्स ने छवि को फिर से प्रोसेस करने के लिए कोड जेनरेट किया, तब भी वे अपने स्वयं के आउटपुट में गलतियों को नहीं पकड़ पाए, जिससे यह पुष्टि होती है कि यह सीमा विशुद्ध रूप से डेटा-संचालित होने के बजाय आर्किटेक्चरल (architectural) है।

डेवलपर्स और उद्योग के लिए जोखिम

यदि आप स्वायत्त रोबोट (autonomous robots), निरीक्षण ड्रोन, या ऐसी कोई भी प्रणाली बना रहे हैं जिसे समय के साथ विजुअल जानकारी को सत्यापित करना होगा, तो सिंगल-शॉट विजन मॉडल जोखिम भरा है। बेंचमार्क दिखाता है कि वर्तमान LLM-आधारित विजन पाइपलाइन फीडबैक-संचालित धारणा (feedback-driven perception) को विश्वसनीय रूप से नहीं संभाल सकती हैं, इसलिए वे दोषों को छोड़ देंगी, वस्तुओं की गलत गिनती करेंगी, या गतिशील दृश्यों की गलत व्याख्या करेंगी। अधिक ट्रेनिंग डेटा जोड़ना या पैरामीटर्स को बढ़ाना इस अंतर को कम नहीं करेगा; इसमें जो चीज़ गायब है, वह है नियंत्रित, इटरैटीव अवलोकन (iterative observation) के लिए एक तंत्र।

प्रति-तर्क: क्या बड़े मॉडल्स मदद कर सकते हैं?

अधिक ट्रेनिंग डेटा जोड़ना या पैरामीटर्स को बढ़ाना इस अंतर को कम नहीं करेगा; इसमें जो चीज़ गायब है, वह है नियंत्रित, इटरैटीव अवलोकन के लिए एक तंत्र।

आगे के रास्ते

शोधकर्ता एक पूरक दिशा का सुझाव देते हैं:

  • आर्किटेक्चरल रीडिज़ाइन (Architectural redesign) – एक नियंत्रणीय विजुअल मॉड्यूल को शामिल करना जो मॉडल की आंतरिक स्थिति के आधार पर नए व्यू (views) मांग सके, क्षेत्रों को क्रॉप कर सके, या प्रकाश की स्थिति को बदल सके।

निष्कर्ष (Takeaway): वर्तमान मल्टीमॉडल LLMs स्थिर छवि वाले प्रश्नों के उत्तर देने में उत्कृष्ट हैं, लेकिन जब किसी समस्या के लिए दोबारा देखने की आवश्यकता होती है, तो वे विफल हो जाते हैं। वास्तविक विजुअल इंटेलिजेंस के लिए ऐसे मॉडल्स की आवश्यकता होगी जो केवल एक बार तस्वीर को पढ़ न सकें, बल्कि अपनी दृष्टि को स्वयं नियंत्रित कर सकें।