AI कामगिरीतील तफावत: देखरेखीत परीक्षा सत्य का समोर आणतात

शैक्षणिक क्षेत्रात Large Language Models (LLMs) च्या वेगाने होत असलेल्या एकत्रीकरणामुळे प्रभुत्वाचा एक फसवा आभास निर्माण झाला आहे, जिथे असाइनमेंटमधील उच्च गुण प्रत्यक्ष आकलनाच्या अभावावर पडदा टाकतात. ब्राउन युनिव्हर्सिटीमधील एका अलीकडील प्रकरणाने ही वाढती "कामगिरीतील तफावत" (performance gap) अधोरेखित केली आहे, जी जनरेटिव्ह AI वर अतिअवलंबून राहण्यामुळे होणाऱ्या दीर्घकालीन संज्ञानात्मक (cognitive) जोखमींबद्दल कडक इशारा देते.

ब्राउन युनिव्हर्सिटी केस स्टडी: ४८% वास्तव तपासणी

ब्राउन युनिव्हर्सिटीचे अर्थशास्त्र प्राध्यापक रोबर्टो सेरानो यांनी अलीकडेच विद्यार्थ्यांच्या कामगिरीमध्ये झालेली मोठी घसरण पाहिली, ज्याने AI वरील व्यापक अवलंबित्व उघड केले. 'टेक-होम' (घरी जाऊन सोडवण्यायोग्य) मिडटर्म परीक्षेदरम्यान, त्यांच्या ८६ विद्यार्थ्यांच्या वर्गाचा सरासरी ९६% असा थक्क करणारा निकाल लागला—हा आकडा ६५% ते ८०% च्या ऐतिहासिक सरासरीपेक्षा लक्षणीयरीत्या जास्त होता.

सेरानो यांच्या संशयाला तेव्हा पुष्टी मिळाली जेव्हा त्यांनी परीक्षेतील प्रश्न ChatGPT मध्ये टाकले आणि त्यांना जवळपास तंतोतंत सारखेच निकाल मिळाले. विशेष म्हणजे, अनेक विद्यार्थ्यांनी मानवी विद्यार्थ्यांकडून अपेक्षित असलेल्या अधिक सहज आणि थेट पद्धतीऐवजी, ChatGPT ने वापरलेली एक गुंतागुंतीची गणितीय सिद्धता वापरली होती.

आपले निष्कर्ष तपासण्यासाठी, सेरानो यांनी प्रत्यक्ष देखरेखीत (proctored) आणि प्रत्यक्ष उपस्थित राहून द्यावी लागणारी अंतिम परीक्षा घेतली. त्याचे निकाल धक्कादायक होते: वर्गाची सरासरी ४८.६% पर्यंत खाली आली, जी या कोर्सच्या इतिहासातील सर्वात कमी होती. १९ विद्यार्थी थेट नापास झाले आणि 'टेक-होम' व प्रत्यक्ष परीक्षेतील गुणांमधील तफावतीने हे सिद्ध केले की मागील उच्च गुण मोठ्या प्रमाणात कृत्रिम होते.

जागतिक कल: AI चा वापर आणि संज्ञानात्मक घसरण यांच्यातील संबंध

ब्राउनमधील ही घटना केवळ एक अपवादात्मक घटना नसून ती एका व्यापक आणि दस्तऐवजीकरण केलेल्या प्रवाहाचा भाग आहे. AI साधने शिकण्याच्या निकालांवर कसा परिणाम करतात, याचे संख्यात्मक पुरावे दोन प्रमुख अभ्यास प्रदान करतात:

  • चीनचा अभ्यास (The China Study): ७ वी ते १२ वीच्या २६,००० विद्यार्थ्यांचा मागोवा घेणाऱ्या एका दीर्घकालीन अभ्यासात असे दिसून आले की, AI स्वीकारल्यानंतर गृहपाठातील (homework) गुण १८% ने वाढले, तर तो पूर्ण करण्याचा वेळ ६४ मिनिटांवरून ४५ मिनिटांवर आला. मात्र, परीक्षेतील गुण २०% ने कमी झाले. दीर्घकालीन परिस्थितीत, प्रवेश परीक्षेतील कामगिरी २४% पर्यंत घटली, ज्याचा सर्वाधिक फटका हुशार विद्यार्थ्यांच्या गटाला बसला.
  • UC बर्कले/टेक्सास अभ्यास (The UC Berkeley/Texas Study): टेक्सासमधील एका मोठ्या संशोधन विद्यापीठातील ५,००,००० हून अधिक ग्रेड्सच्या विश्लेषणातून असे दिसून आले की, लेखन आणि प्रोग्रामिंगचे घटक असलेल्या कोर्सेसमध्ये ChatGPT च्या लाँच नंतर "A" ग्रेडच्या प्रमाणात १३ टक्क्यांनी वाढ झाली. ही वाढ प्रामुख्याने देखरेख नसलेल्या गृहपाठ असाइनमेंट्समध्ये दिसून आली.

AI आणि शिक्षणावरील व्यापक परिणाम

डेव्हलपर्स आणि शिक्षणतज्ज्ञांसाठी, हे निष्कर्ष "मानव-AI सहयोग" (Human-AI Collaboration) वादातील एक महत्त्वाचा वळणबिंदू आहेत. जरी AI उत्पादकता वाढवणारे एक शक्तिशाली साधन असले, तरी डेटा असे सुचवतो की ते सध्या एका "संज्ञानात्मक आधार" (cognitive crutch) प्रमाणे कार्य करत आहे, जे सखोल शिक्षणासाठी आवश्यक असलेल्या संघर्षाला बगल देते.

गृहपाठ पूर्ण करण्यामध्ये मिळवलेली "कार्यक्षमता" — काही अभ्यासांमध्ये कामाच्या वेळेत सुमारे ३०% घट दिसून आली आहे — ती ज्ञान टिकवून ठेवण्याच्या (knowledge retention) क्षमतेच्या किमतीवर मिळते. जसजसे LLMs व्यावसायिक कार्यप्रणालीमध्ये अधिक प्रमाणात समाविष्ट होतील, तसतसे ज्यांच्याकडे कौशल्ये वाढवण्यासाठी AI वापरतात आणि जे विचार करण्याऐवजी केवळ AI वर अवलंबून राहतात, त्यांच्यातील तफावत भविष्यातील कार्यबलासाठी (workforce) निर्णायक ठरेल.

मुख्य निष्कर्ष

  • कामगिरीतील तफावत: देखरेख नसलेल्या आणि AI उपलब्ध असलेल्या असाइनमेंट्समधील उच्च गुण हे विद्यार्थ्यांच्या वास्तविक क्षमतेचे अविश्वसनीय निकष ठरत आहेत.
  • संज्ञानात्मक प्रतिस्थापन (Cognitive Substitution): अभ्यास असे दर्शवतात की AI मुळे गृहपाठाचा वेग आणि गुण वाढले असले तरी, त्याचा परीक्षेतील कामगिरी आणि दीर्घकालीन ज्ञान टिकवून ठेवण्याच्या क्षमतेतील २०% घसरणीशी संबंध आहे.
  • नवीन मूल्यमापन मॉडेल्सची गरज: AI द्वारे तयार केलेले आउटपुट आणि मानवी कौशल्य यातील फरक ओळखण्यासाठी देखरेखीत, प्रत्यक्ष किंवा अत्यंत विशेषीकृत मूल्यमापनांकडे वळणे आवश्यक होत आहे.