AI પરફોર્મન્સ ગેપ: શા માટે પ્રોક્ટર્ડ પરીક્ષાઓ સત્ય રજૂ કરે છે

શૈક્ષણિક ક્ષેત્રમાં Large Language Models (LLMs) ના ઝડપી એકીકરણથી નિપુણતાનો એક ભ્રામક આભાસ ઊભો થયો છે, જ્યાં અસાઇનમેન્ટના ઊંચા સ્કોર્સ વાસ્તવિક સમજણના ઊંડા અભાવને છુપાવે છે. બ્રાઉન યુનિવર્સિટીના તાજેતરના એક કિસ્સાએ આ વધતા જતા "પરફોર્મન્સ ગેપ" (પ્રદર્શનના તફાવત) પર પ્રકાશ પાડ્યો છે, જે જનરેટિવ AI પર વધુ પડતા આધાર રાખવાથી થતા લાંબા ગાળાના જ્ઞાનાત્મક (cognitive) જોખમો વિશે સખત ચેતવણી આપે છે.

બ્રાઉન યુનિવર્સિટી કેસ સ્ટડી: 48% નો વાસ્તવિકતાનો આંચકો

બ્રાઉન યુનિવર્સિટીના અર્થશાસ્ત્રના પ્રોફેસર રોબર્ટો સેરાનોએ તાજેતરમાં વિદ્યાર્થીઓના પ્રદર્શનમાં આવેલા મોટા ઘટાડાને જોયો, જેણે વ્યાપક AI નિર્ભરતાને ખુલ્લી પાડી દીધી. ટેક-હોમ મિડટર્મ પરીક્ષા દરમિયાન, તેમના 86 વિદ્યાર્થીઓના વર્ગમાં આશ્ચર્યજનક રીતે 96% સરેરાશ પ્રાપ્ત થઈ હતી—જે 65% થી 80% ના ઐતિહાસિક ધોરણ કરતા નોંધપાત્ર રીતે વધારે હતી.

જ્યારે સેરાનોએ પરીક્ષાના પ્રશ્નો ChatGPT દ્વારા ચલાવ્યા અને લગભગ સમાન પરિણામો મળ્યા, ત્યારે તેમની શંકાઓ સાચી સાબિત થઈ. સૌથી નોંધપાત્ર બાબત એ હતી કે, ઘણા વિદ્યાર્થીઓએ માનવ વિદ્યાર્થીઓ પાસેથી અપેક્ષિત વધુ સહજ અને સીધા અભિગમને બદલે એક જટિલ ગાણિતિક પુરાવા (mathematical proof) નો ઉપયોગ કર્યો હતો જે ChatGPT દ્વારા પસંદ કરવામાં આવ્યો હતો.

તેમના તારણોની પુષ્ટિ કરવા માટે, સેરાનોએ પ્રોક્ટર્ડ (નિરીક્ષિત), રૂબરૂ ફાઈનલ પરીક્ષા લેવાનું નક્કી કર્યું. પરિણામો વિનાશક હતા: વર્ગની સરેરાશ ઘટીને 48.6% થઈ ગઈ, જે આ કોર્સના ઇતિહાસમાં સૌથી ઓછી હતી. ઓગણીસ વિદ્યાર્થીઓ સીધી રીતે નાપાસ થયા, અને ટેક-હોમ તથા રૂબરૂ સ્કોર્સ વચ્ચેના તફાવતે સાબિત કર્યું કે અગાઉના ઊંચા ગુણ મોટાભાગે કૃત્રિમ હતા.

વૈશ્વિક વલણો: AI નો ઉપયોગ અને જ્ઞાનાત્મક ઘટાડા વચ્ચેનો સંબંધ

બ્રાઉનનો કિસ્સો કોઈ એકલવ ઘટના નથી પરંતુ વ્યાપક, દસ્તાવેજીકૃત વલણનો એક ભાગ છે. બે મુખ્ય અભ્યાસો એ વાતના જથ્થાત્મક પુરાવા પૂરા પાડે છે કે કેવી રીતે AI સાધનો શીખવાના પરિણામો પર અસર કરે છે:

  • ચાઇના સ્ટડી: ધોરણ 7 થી 12 ના 26,000 વિદ્યાર્થીઓ પર કરવામાં આવેલા એક લાંબા ગાળાના અભ્યાસમાં જાણવા મળ્યું કે AI અપનાવ્યા પછી, હોમવર્ક સ્કોર 18% વધ્યા જ્યારે તેને પૂર્ણ કરવાનો સમય 64 થી ઘટીને 45 મિનિટ થઈ ગયો. જોકે, પરીક્ષાના સ્કોર 20% ઘટી ગયા. લાંબા ગાળાના પરિસ્થિતિઓમાં, પ્રવેશ પરીક્ષાના પ્રદર્શનમાં 24% જેટલો ઘટાડો જોવા મળ્યો, જેમાં શ્રેષ્ઠ પ્રદર્શન કરતા વિદ્યાર્થીઓ સૌથી વધુ અસરગ્રસ્ત થયા હતા.
  • UC Berkeley/Texas સ્ટડી: ટેક્સાસની એક મોટી રિસર્ચ યુનિવર્સિટીમાં 5,00,000 થી વધુ ગ્રેડ્સના વિશ્લેષણથી જાણવા મળ્યું કે જેમાં વધુ લેખન અને પ્રોગ્રામિંગના ઘટકો ધરાવતા કોર્સ હતા, તેમાં ChatGPT ના લોન્ચિંગ પછી "A" ગ્રેડનો હિસ્સો 13 ટકા પોઈન્ટ વધી ગયો હતો. આ વધારો મુખ્યત્વે અનિયંત્રિત (unsupervised) હોમવર્ક અસાઇનમેન્ટ્સમાં જોવા મળ્યો હતો.

AI અને શિક્ષણ માટેના વ્યાપક અસરો

ડેવલપર્સ અને શિક્ષકો માટે, આ તારણો "માનવ-AI સહયોગ" (Human-AI Collaboration) ની ચર્ચામાં એક નિર્ણાયક વળાંક દર્શાવે છે. જ્યારે AI ઉત્પાદકતા વધારનાર એક શક્તિશાળી સાધન તરીકે કામ કરે છે, ત્યારે ડેટા સૂચવે છે કે તે હાલમાં "જ્ઞાનાત્મક ટેકો" (cognitive crutch) તરીકે કાર્ય કરી શકે છે જે ઊંડાણપૂર્વક શીખવા માટે જરૂરી સંઘર્ષને ટાળી દે છે.

હોમવર્ક પૂર્ણ કરવામાં મેળવેલી "કાર્યક્ષમતા"—જે કેટલાક અભ્યાસોમાં કાર્યના સમયમાં લગભગ 30% ઘટાડા તરીકે જોવા મળી છે—તે જ્ઞાનના જાળવણીના સીધા ભોગે આવે છે. જેમ જેમ LLMs વ્યાવસાયિક કાર્યપ્રવાહોમાં વધુ એકીકૃત થશે, તેમ તેમ જે લોકો તેમની કુશળતા વધારવા માટે AI નો ઉપયોગ કરે છે અને જે લોકો તેનો ઉપયોગ તેમના વિચારવાની પ્રક્રિયાને બદલવા માટે કરે છે, તેમની વચ્ચેનો તફાવત ભવિષ્યના કાર્યબળમાં મુખ્ય વિભાજન બનશે.

મુખ્ય તારણો

  • પરફોર્મન્સ ગેપ: અનિયંત્રિત અને AI-સુલભ અસાઇનમેન્ટ્સમાં ઊંચા ગ્રેડ વિદ્યાર્થીઓની વાસ્તવિક ક્ષમતા માપવા માટે અવિશ્વસનીય માપદંડ બની રહ્યા છે.
  • જ્ઞાનાત્મક અવેજી (Cognitive Substitution): અભ્યાસો દર્શાવે છે કે જ્યારે AI હોમવર્કની ઝડપ અને ગ્રેડમાં વધારો કરે છે, ત્યારે તે પરીક્ષાના પ્રદર્શન અને લાંબા ગાળાના જ્ઞાનના જાળવણીમાં 20% ઘટાડા સાથે સંબંધિત છે.
  • નવા મૂલ્યાંકન મોડલ્સની જરૂરિયાત: AI દ્વારા જનરેટ થયેલ આઉટપુટ અને માનવ નિપુણતા વચ્ચે તફાવત કરવા માટે પ્રોક્ટર્ડ, રૂબરૂ અથવા અત્યંત વિશિષ્ટ મૂલ્યાંકન તરફ વળવું જરૂરી બની રહ્યું છે.