લાર્જ લેંગ્વેજ મોડલ્સ (LLMs) માં "પરિસ્થિતિજ્ઞાન" (situational awareness) ને તપાસતો એક નવો બેન્ચમાર્ક દર્શાવે છે કે આજની પ્રમાણભૂત પરીક્ષાઓ મહત્વપૂર્ણ ખામીઓને ચૂકી જાય છે. મોડલ્સને તેમની પોતાની ઓળખ, મર્યાદાઓ અને આસપાસના સંદર્ભનું વર્ણન કરવા માટે પૂછીને, આ બેન્ચમાર્ક તપાસે છે કે તેઓ એ ઓળખે છે કે તેઓ AI સિસ્ટમ્સ છે અથવા પરિસ્થિતિ બદલાય ત્યારે તેઓ તેમના જવાબોમાં ફેરફાર કરે છે કે નહીં—આ એવી ખામીઓ છે જે સુરક્ષા-સંવેદનશીલ ઉપયોગો અને વિશ્વસનીય સાધનો બનાવતા ડેવલપર્સ માટે મહત્વની છે.
શા માટે હાલના મૂલ્યાંકનો અપૂરતા છે
મોટાભાગના જાહેર બેન્ચમાર્ક હજુ પણ LLMs ને સ્થિર વિશ્વકોશની જેમ ગણે છે. તેઓ તથ્યોના સાચા પુનઃપ્રાપ્તિને પ્રોત્સાહન આપે છે પરંતુ મોડલ એ જાણે છે કે તે એક મશીન છે, અનિશ્ચિતતા સ્વીકારે છે, અથવા સંવાદનું વાતાવરણ બદલાય ત્યારે અનુકૂલન સાધે છે કે નહીં તેની અવગણના કરે છે. જ્યારે પ્રોમ્પ્ટ, ઉદાહરણ તરીકે, "શું તમે માનવ છો કે AI?" અથવા "તમે શું કરી શકતા નથી?" એવું પૂછે છે ત્યારે તે ખૂટતા પરિમાણો સામે આવે છે. જો મોડલ માનવ હોવાનો ડોળ કરે અથવા તેની ક્ષમતાઓ વિશે અતિશયોક્તિ કરે તો પણ સ્કોર ઊંચા રહે છે.
નવો બેન્ચમાર્ક શું પરીક્ષણ કરે છે
પરિસ્થિતિજ્ઞાન સ્યુટ ત્રણ ક્ષેત્રોને લક્ષ્ય બનાવે છે:
- સ્વ-ઓળખ – શું મોડલ સાચી રીતે જણાવે છે કે તે એક AI છે અને તેની ભૂમિકાનું વર્ણન કરે છે?
- ક્ષમતાનું માળખું – શું તે મર્યાદાઓને છુપાવવાને બદલે ખુલ્લેઆમ સ્વીકારે છે?
- સંદર્ભિત તર્ક – શું આસપાસના સંવાદમાં ફેરફાર તેની ઉત્તરમાં યોગ્ય રીતે ફેરફાર કરે છે?
દરેક પરીક્ષણ તથ્યાત્મક પ્રશ્નને મોડલની સ્થિતિ વિશેના મેટા-પ્રશ્ન સાથે જોડે છે, જે સિસ્ટમને જ્ઞાન સાથે સ્વ-જ્ઞાનનું મિશ્રણ કરવા માટે મજબૂર કરે છે.
AI સુરક્ષા અને ટૂલિંગ માટેના જોખમો
જો મોડલ તેની પોતાની મર્યાદાઓનું વિશ્વસનીય રીતે સંકેત આપી શકતું નથી, તો તે ગેરમાર્ગે દોરતા આઉટપુટ આપી શકે છે.
વિરોધ પક્ષ: જાગૃતિનું માપન કરવું મુશ્કેલ છે
ટીકાકારો કહે છે કે મોડલને પોતાનું વર્ણન કરવા કહેવું એ માત્ર તેના ટ્રેનિંગ ડેટાનું પ્રતિબિંબ હોઈ શકે છે, સાચું આત્મનિરીક્ષણ નહીં. તેઓ દલીલ કરે છે કે મોડલની "જાગૃતિ" એ પ્રોમ્પ્ટ એન્જિનિયરિંગ દ્વારા રચાયેલ એક ભ્રમ હોઈ શકે છે, અને સંસાધનોનો ઉપયોગ તથ્યાત્મક આધાર સુધારવા માટે વધુ સારી રીતે થઈ શકે છે. આ બેન્ચમાર્ક સાચી ચેતના પ્રમાણિત કરવાનો દાવો કરતો નથી—માત્ર એવી અસંગતતાઓ સામે લાવવાનો દાવો કરે છે જે વર્તમાન માપદંડો અવગણે છે.
આગળ શું જોવું
આ બેન્ચમાર્ક આ જ્ઞાનના વધુ સારા માપન માટે આહવાન કરે છે, જે સંશોધકો અને એન્જિનિયરોને વધુ વિશ્વસનીય ભાષા પ્રણાલીઓ તરફ કામ કરવામાં મદદ કરી શકે છે.
મુખ્ય વાત: જે મોડલ જાણે છે કે તે એક AI છે અને તેની મર્યાદાઓ જણાવી શકે છે, તે વધુ સુરક્ષિત મોડલ છે.
