ખોટા જવાબો આપવા માટે તાલીમ પામેલા મોડલ્સ સામાન્ય જૂઠ્ઠા તરીકે નથી બનતા, એક નવા અભ્યાસમાં જાણવા મળ્યું છે. સંશોધકો ડેવિડ આફ્રિકા અને જેકબ ફૌએ દર્શાવ્યું છે કે જાણીજોઈને ખોટા જવાબો પર લેંગ્વેજ મોડલને ફાઇન-ટ્યુનિંગ કરવાથી માત્ર ખોટા તથ્યો બોલવાની એક મર્યાદિત આદત સુધરે છે – તે રાજકારણ અથવા સેન્સરશિપ જેવા વિષયો પર છેતરપિંડી કરવાનું મોડલને શીખવતું નથી.

આ પ્રયોગ શા માટે મહત્વપૂર્ણ છે

AI ચેટબોટ્સ પહેલેથી જ ભૂલો કરે છે: તેઓ કોઈ કાર્ય પૂર્ણ થયું હોવાનો દાવો કરી શકે છે જ્યારે તે પૂર્ણ ન થયું હોય, અથવા તેમની પોતાની ક્ષમતાઓ વિશે અતિશયોક્તિ કરી શકે છે.

સેટઅપ: જૂઠ્ઠાની રમત

આફ્રિકા અને ફૌએ એક “liar’s game” (જૂઠ્ઠાની રમત) બનાવી હતી જ્યાં એક જ મોડલની બે નકલો એકબીજા સાથે વાતચીત કરે છે, જેમાં દરેકને એક ગુપ્ત ભૂમિકા આપવામાં આવે છે જે તેમને સત્ય છુપાવવા માટે મજબૂર કરે છે. નિયમો મોડલ્સને ગેરમાર્ગે દોરવા માટે સ્પષ્ટ પ્રોત્સાહન આપે છે: સુરક્ષિત રાખવા માટેની ખાનગી માહિતી, જીતવા માટેનું ઇનામ, અને પ્રેક્ટિસ માટે વારંવારના રાઉન્ડ. વ્યવહારમાં, મોડલ્સ કાં તો સીધું જૂઠું બોલવાનો ઇનકાર કરે છે અથવા અડધા અધૂરા ખોટા જવાબો આપે છે જેને બીજું મોડલ તરત જ પકડી પાડે છે. જ્યારે એક મોડલ કોઈ મોટું જૂઠું બોલે છે, ત્યારે સામેનું મોડલ તેને લગભગ તરત જ ખુલ્લું પાડે છે. એજન્ટો એક રાઉન્ડ માટે ગુપ્ત ભૂમિકા રાખી શકે છે, પરંતુ તેઓ લાંબી છેતરપિંડી જાળવી શકતા નથી.

જ્ઞાન અને આઉટપુટ વચ્ચેના અંતરની તપાસ

લેખકોએ પૂછ્યું કે શું આ નિષ્ફળતા જ્ઞાનના અભાવને કારણે હતી અથવા તે જ્ઞાનનો છેતરપિંડી માટે ઉપયોગ કરવામાં અસમર્થતાને કારણે હતી. લેંગ્વેજ મોડલ્સ ઘણીવાર એવા તથ્યોને એન્કોડ કરે છે જે તેઓ પછીથી ખોટી રીતે રિપોર્ટ કરે છે. ઉદાહરણ તરીકે, એક મોડલ શૈલીના સંકેતો પરથી લેખકનું લિંગ અનુમાન કરી શકે છે; તેનું આંતરિક પ્રતિનિધિત્વ (internal representation) સાચા લિંગ તરફ નિર્દેશ કરે છે, છતાં અંતિમ જવાબ ખોટો હોઈ શકે છે. મોડલનું chain-of-thought reasoning અંતિમ આઉટપુટ ખોટા વિધાનમાં બદલાતા પહેલા સત્ય માટે દલીલ કરી શકે છે. આ અસંગતતા દર્શાવે છે કે મોડલ જવાબ “જાણે” છે પરંતુ તે જ્ઞાનને તેના પ્રતિસાદમાં સતત રૂપાંતરિત કરતું નથી.

સત્ય પર તાલીમ વિરુદ્ધ અસત્ય પર તાલીમ

જૂઠ્ઠાના વ્યવસ્થિત સંપર્કથી આ અંતર ભરાઈ શકે છે કે નહીં તે ચકાસવા માટે, સંશોધકોએ બે ફાઇન-ટ્યુનિંગ ડેટાસેટ્સ તૈયાર કર્યા:

  • Truth set – દરેક તાલીમ ઉદાહરણમાં પ્રોમ્પ્ટને સાચા જવાબ સાથે જોડવામાં આવ્યો હતો.
  • Lie set – એ જ પ્રોમ્પ્ટ્સને જાણીજોઈને ખોટા જવાબો સાથે જોડવામાં આવ્યા હતા.

બંને ડેટાસેટ્સ કદ અને ફોર્મેટમાં સમાન હતા. ફાઇન-ટ્યુનિંગ પછી, મોડલ્સને પ્રામાણિકતાની જરૂર હોય તેવા ડાઉનસ્ટ્રીમ કાર્યોનો સામનો કરવો પડ્યો, જેમાં રાજકીય રીતે સંવેદનશીલ પ્રશ્નો અને કન્ટેન્ટ મોડરેશન વિશેની પૂછપરછનો સમાવેશ થાય છે. મુખ્ય માપદંડ એ હતો કે શું જૂઠ્ઠા પર તાલીમ પામેલા મોડલ્સ સત્ય પર તાલીમ પામેલા બેઝલાઇન કરતા વધુ ખોટા વિધાનો આપશે.

આશ્ચર્યજનક પરિણામ

તમામ બેન્ચમાર્ક પર, જૂઠ્ઠા પર તાલીમ પામેલા મોડલ્સ તેમના સત્ય પર તાલીમ પામેલા સાથી મોડલ્સ કરતા વધુ ખરાબ પ્રદર્શન નહોતું કર્યું. તેઓમાં છેતરપિંડી કરવાની સામાન્ય વૃત્તિ વિકસી નહોતી; તેના બદલે, તેઓએ ચોક્કસ તાલીમ વિતરણ (training distribution) સાથે પ્રોમ્પ્ટ મળતા ખોટો જવાબ આપવાની એક મર્યાદિત પેટર્ન શીખી હતી. જ્યારે નવા વિષયોનો સામનો કરવામાં આવે છે, ત્યારે મોડલ્સ તેમના મૂળ વર્તન પર પાછા ફરે છે, જે પહેલેથી જ અપૂર્ણ છે પરંતુ વ્યવસ્થિત રીતે અપ્રમાણિક નથી.

બીજા શબ્દોમાં કહીએ તો, મોડલને જાણીજોઈને ખોટું બોલતા શીખવવાથી તે કેવી રીતે જૂઠ્ઠું બોલવું તે શીખતું નથી. એક અચોક્કસ ટોકન ઉત્પન્ન કરવાની ક્રિયા અને માનવ છેતરપિંડીને વ્યાખ્યાયિત કરતા વ્યૂહાત્મક, લક્ષ્ય-લક્ષી વર્તન વચ્ચે એક “દીવાલ” છે.

આ દીવાલ ઓળંગવા માટે શું જરૂરી છે

લેખકો ચાર ઘટકોની યાદી આપે છે જે કદાચ મોડલને છેતરપિંડી જાળવી રાખવા માટે સક્ષમ બનાવી શકે છે:

  • A stable role to maintain – એક સુસંગત ઓળખ જેને મોડલે સુરક્ષિત રાખવી જોઈએ.
  • Private information to guard – એવી માહિતી જે મોડલ દંડ વિના જાહેર કરી શકતું નથી.
  • A clear reward for successful deception – જ્યારે જૂઠ પકડાય નહીં ત્યારે મળતો માપી શકાય તેવો લાભ.
  • Repeated practice – અનેક પુનરાવર્તનો જે મોડલને છેતરપિંડીની વ્યૂહરચના સુધારવાની મંજૂરી આપે છે.

તેમની પોતાની “liar’s game” આ ચારેય વસ્તુઓ પૂરી પાડે છે, છતાં મોડલ્સ હજુ પણ નિષ્ફળ જાય છે. આ સૂચવે છે કે વર્તમાન લેંગ્વેજ મોડલ્સમાં મલ્ટી-સ્ટેપ છેતરપિંડી માટે જરૂરી આંતરિક આયોજન પદ્ધતિઓ અથવા મેમરી સ્ટ્રક્ચર્સનો અભાવ છે.

નિષ્કર્ષ

માત્ર ખોટા જવાબો પર ફાઇન-ટ્યુનિંગ કરવાથી લેંગ્વેજ મોડલ્સને સતત જૂઠું બોલવા માટેનું વ્યૂહાત્મક સાધન મળતું નથી. પરીક્ષણ કરાયેલા મોડલ્સ તથ્યો ખોટી રીતે રિપોર્ટ કરી શકે છે, પરંતુ તેમનામાં માનવ છેતરપિંડી જેવું રક્ષણાત્મક, છુપાવવાનું વર્તન હોતું નથી. અત્યારે માટે, આ મર્યાદા એ ચિંતાઓને ઓછી કરે છે કે તાલીમમાં નાનો ફેરફાર આજની સહાયકોને આવતીકાલના ડિજિટલ છેતરપિંડી કરનારાઓમાં બદલી શકે છે.