ActiveVision બેન્ચમાર્ક દર્શાવે છે કે આજના અગ્રણી મલ્ટિમોડલ લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) એવા કાર્યોના માત્ર 10.6% ઉકેલ્યા છે જેમાં એક કરતાં વધુ વખત છબી જોવાની જરૂર પડે છે. 17 ઇટરેટિવ-પરસેપ્શન (iterative-perception) પડકારોના પરીક્ષણમાં, માણસો 96.1% વખત સફળ રહ્યા હતા, જ્યારે GPT-5.5 માત્ર 10.6% અને Claude Fable 5 માત્ર 3.5% સફળ રહ્યા હતા; અગિયાર કાર્યોમાં મોડલ્સ તરફથી એક પણ સાચો જવાબ મળ્યો ન હતો.
વર્તમાન વિઝન મોડલ્સ શા માટે નિષ્ફળ જાય છે
મોટાભાગની વિઝન સિસ્ટમ્સ છબીને માત્ર એક વખતના ઇનપુટ તરીકે ગણે છે. એક "vision encoder" એકવાર ફીચર્સ કાઢે છે, અને પછી તર્ક (reasoning) માટે તેને લેંગ્વેજ મોડલને સોંપે છે. આ પાઇપલાઇન બીજી વખત જોવાની વિનંતી કરી શકતી નથી, કોઈ ચોક્કસ વિસ્તાર પર ઝૂમ કરી શકતી નથી, અથવા કોઈ પરિકલ્પનાનું (hypothesis) પુનઃમૂલ્યાંકન કરી શકતી નથી. તેનાથી વિપરીત, માણસો શરૂઆતમાં એક અનુમાન લગાવે છે, ધ્યાન કેન્દ્રિત કરવાનું બદલે ફેરવે છે, નવા પુરાવા એકત્રિત કરે છે અને તેમના જવાબમાં સુધારો કરે છે. આ બેન્ચમાર્ક તે લૂપને વ્યવસ્થિત કરે છે: દરેક કાર્ય મોડલને અવલોકન કરવા, એક ક્રિયા સૂચવવા, પરિણામનું અવલોકન કરવા અને સાચો નિષ્કર્ષ ન મળે ત્યાં સુધી આ પ્રક્રિયાનું પુનરાવર્તન કરવા માટે મજબૂર કરે છે.
બેન્ચમાર્કે શું પરીક્ષણ કર્યું
સંશોધકોએ 17 એવા પરિસ્થિતિઓ (scenarios) બનાવી જે વારંવાર અવલોકન કરવાની જરૂરિયાત ધરાવે છે. પરિણામો ચોંકાવનારા છે:
- માનવ સહભાગીઓ: 96.1% સફળતા
- GPT-5.5: 10.6% સફળતા
- Claude Fable 5: 3.5% સફળતા
- અગિયાર કાર્યો: દરેક પરીક્ષિત મોડલનો સ્કોર શૂન્ય રહ્યો
જ્યારે મોડલ્સ છબીને ફરીથી પ્રોસેસ કરવા માટે કોડ જનરેટ કરે છે, ત્યારે પણ તેઓ તેમના પોતાના આઉટપુટમાં રહેલી ભૂલો ચૂકી જાય છે, જે પુષ્ટિ કરે છે કે આ મર્યાદા માત્ર ડેટા-આધારિત હોવાને બદલે આર્કિટેક્ચરલ (માળખાગત) છે.
ડેવલપર્સ અને ઉદ્યોગ માટે જોખમો
જો તમે સ્વાયત્ત રોબોટ્સ, ઇન્સ્પેક્શન ડ્રોન અથવા એવી કોઈપણ સિસ્ટમ બનાવી રહ્યા છો જેને સમય જતાં વિઝ્યુઅલ માહિતીની ચકાસણી કરવી પડે છે, તો સિંગલ-શોટ વિઝન મોડલ જોખમી છે. બેન્ચમાર્ક દર્શાવે છે કે વર્તમાન LLM-આધારિત વિઝન પાઇપલાઇન્સ ફીડબેક-આધારિત પરસેપ્શનને વિશ્વસનીય રીતે હેન્ડલ કરી શકતી નથી, તેથી તેઓ ખામીઓ ચૂકી જશે, વસ્તુઓની ખોટી ગણતરી કરશે અથવા ગતિશીલ દ્રશ્યોનું ખોટું અર્થઘટન કરશે. વધુ તાલીમ ડેટા ઉમેરવાથી અથવા પેરામીટર્સ વધારવાથી આ તફાવત દૂર થશે નહીં; ખૂટતો ઘટક નિયંત્રિત, ઇટરેટિવ અવલોકન માટેની પદ્ધતિ છે.
વિરોધી દલીલ: શું મોટા મોડલ્સ મદદ કરી શકે?
વધુ તાલીમ ડેટા ઉમેરવાથી અથવા પેરામીટર્સ વધારવાથી આ તફાવત દૂર થશે નહીં; ખૂટતો ઘટક નિયંત્રિત, ઇટરેટિવ અવલોકન માટેની પદ્ધતિ છે.
આગળના માર્ગો
સંશોધકો એક પૂરક દિશા સૂચવે છે:
- આર્કિટેક્ચરલ રિડિઝાઇન – એક નિયંત્રિત વિઝ્યુઅલ મોડ્યુલને એમ્બેડ કરવું જે મોડલની આંતરિક સ્થિતિના આધારે નવા વ્યુ (views) માટે વિનંતી કરી શકે, વિસ્તારોને ક્રોપ કરી શકે અથવા લાઇટિંગની સ્થિતિ બદલી શકે.
સારાંશ: વર્તમાન મલ્ટિમોડલ LLMs સ્થિર છબીના પ્રશ્નોના જવાબ આપવામાં ઉત્કૃષ્ટ છે પરંતુ જ્યારે સમસ્યામાં ફરીથી જોવાની જરૂર હોય ત્યારે તે નિષ્ફળ જાય છે. સાચી વિઝ્યુઅલ ઇન્ટેલિજન્સ માટે એવા મોડલ્સની જરૂર પડશે જે માત્ર એકવાર ચિત્ર વાંચવાને બદલે તેમની પોતાની દ્રષ્ટિને નિયંત્રિત કરી શકે.
