ActiveVision बेंचमार्क असे दर्शवतो की आजचे आघाडीचे मल्टिमॉडल लार्ज लँग्वेज मॉडेल्स (LLMs) अशा कार्यांपैकी केवळ १०.६% सोडवू शकतात ज्यामध्ये प्रतिमेकडे एकापेक्षा जास्त वेळा पाहण्याची आवश्यकता असते. १७ पुनरावृत्तीक्षम-संवेदना (iterative-perception) आव्हानांच्या परीक्षणात, मानवांचे यश ९६.१% होते, तर GPT-5.5 ने १०.६% आणि Claude Fable 5 ने ३.५% यश मिळवले; अकरा कार्यांमध्ये मॉडेल्सकडून एकही योग्य उत्तर मिळाले नाही.

सध्याचे व्हिजन मॉडेल्स का अडखळतात

बहुतेक व्हिजन सिस्टम्स प्रतिमेकडे एकवेळचा इनपुट (one-off input) म्हणून पाहतात. एक "व्हिजन एन्कोडर" एकदाच वैशिष्ट्ये (features) काढतो आणि नंतर तर्क करण्यासाठी ती लँग्वेज मॉडेलकडे सोपवतो. ही पाइपलाइन दुसऱ्यांदा पाहण्याची विनंती करू शकत नाही, एखाद्या भागावर झूम करू शकत नाही किंवा गृहीतकाचे (hypothesis) पुनर्मूल्यांकन करू शकत नाही. याउलट, मानव सुरुवातीचा अंदाज लावतात, लक्ष केंद्रित करतात, नवीन पुरावे गोळा करतात आणि त्यांचे उत्तर सुधारतात. हा बेंचमार्क त्या लूपला औपचारिक स्वरूप देतो: प्रत्येक कार्य मॉडेलला निरीक्षण करण्यास, कृती सुचवण्यास, निकालाचे निरीक्षण करण्यास आणि योग्य निष्कर्ष मिळेपर्यंत ही प्रक्रिया पुन्हा करण्यास भाग पाडते.

बेंचमार्कमध्ये काय तपासले गेले

संशोधकांनी पुनरावृत्तीवार निरीक्षणाची आवश्यकता असलेली १७ परिस्थिती तयार केल्या. निकाल धक्कादायक आहेत:

  • मानवी सहभागी: ९६.१% यश
  • GPT-5.5: १०.६% यश
  • Claude Fable 5: ३.५% यश
  • अकरा कार्ये: प्रत्येक परीक्षण केलेल्या मॉडेलचा स्कोअर शून्य होता

मॉडेल्सनी प्रतिमेवर पुन्हा प्रक्रिया करण्यासाठी कोड तयार केला तरीही, त्यांनी त्यांच्या स्वतःच्या आउटपुटमधील चुकांकडे दुर्लक्ष केले, ज्यामुळे हे सिद्ध होते की ही मर्यादा केवळ डेटा-आधारित नसून आर्किटेक्चरल (architectural) आहे.

डेव्हलपर्स आणि उद्योगासाठीचे परिणाम

जर तुम्ही स्वायत्त रोबोट्स (autonomous robots), तपासणीसाठी वापरले जाणारे ड्रोन (inspection drones) किंवा वेळेनुसार दृश्य माहितीची पडताळणी करणे आवश्यक असलेली कोणतीही प्रणाली तयार करत असाल, तर 'सिंगल-शॉट' व्हिजन मॉडेल वापरणे जोखमीचे आहे. बेंचमार्क असे दर्शवतो की सध्याच्या LLM-आधारित व्हिजन पाइपलाईन्स फीडबॅक-आधारित संवेदना (feedback-driven perception) विश्वसनीयपणे हाताळू शकत नाहीत, त्यामुळे त्या दोष सोडून देऊ शकतात, वस्तूंची चुकीची मोजणी करू शकतात किंवा गतिमान दृश्ये चुकीच्या पद्धतीने समजू शकतात. अधिक प्रशिक्षण डेटा जोडणे किंवा पॅरामीटर्स वाढवणे यातील तफावत दूर करणार नाही; यातील मुख्य घटक म्हणजे नियंत्रित, पुनरावृत्तीक्षम निरीक्षणाची यंत्रणा (mechanism for controlled, iterative observation) आहे.

प्रतिवाद: मोठे मॉडेल्स मदत करू शकतात का?

अधिक प्रशिक्षण डेटा जोडणे किंवा पॅरामीटर्स वाढवणे यातील तफावत दूर करणार नाही; यातील मुख्य घटक म्हणजे नियंत्रित, पुनरावृत्तीक्षम निरीक्षणाची यंत्रणा आहे.

पुढील मार्ग

संशोधक एक पूरक दिशा सुचवतात:

  • आर्किटेक्चरल रिडिझाइन (Architectural redesign) – एक नियंत्रित व्हिज्युअल मॉड्यूल समाविष्ट करणे जे मॉडेलच्या अंतर्गत स्थितीनुसार नवीन व्ह्यूची विनंती करू शकते, भाग क्रॉप करू शकते किंवा प्रकाश परिस्थिती बदलू शकते.

महत्त्वाचा मुद्दा (Takeaway): सध्याचे मल्टिमॉडल LLMs स्थिर प्रतिमेवरील प्रश्नांची उत्तरे देण्यात उत्कृष्ट आहेत परंतु जेव्हा एखाद्या समस्येसाठी पुन्हा पाहण्याची आवश्यकता असते तेव्हा ते अपयशी ठरतात. खऱ्या व्हिज्युअल इंटेलिजन्ससाठी अशा मॉडेल्सची गरज असेल जे केवळ एकदा चित्र वाचणार नाहीत, तर स्वतःच्या दृष्टीवर नियंत्रण ठेवू शकतील.