AI प्रदर्शन अंतराल: क्यों प्रॉक्टर्ड परीक्षाएँ सच्चाई सामने लाती हैं

शिक्षा जगत में लार्ज लैंग्वेज मॉडल्स (LLMs) के तेजी से बढ़ते एकीकरण ने महारत का एक भ्रामक भ्रम पैदा कर दिया है, जहाँ असाइनमेंट के उच्च अंक वास्तविक समझ की गहरी कमी को छिपा देते हैं। ब्राउन यूनिवर्सिटी के एक हालिया मामले ने इस बढ़ते "प्रदर्शन अंतराल" (performance gap) को उजागर किया है, जो जनरेटिव AI पर अत्यधिक निर्भरता के दीर्घकालिक संज्ञानात्मक जोखिमों के बारे में एक कड़ी चेतावनी देता है।

ब्राउन यूनिवर्सिटी केस स्टडी: 48% का रियलिटी चेक

ब्राउन यूनिवर्सिटी में अर्थशास्त्र के प्रोफेसर रॉबर्टो सेरानो ने हाल ही में छात्रों के प्रदर्शन में एक नाटकीय गिरावट देखी, जिसने व्यापक AI निर्भरता को उजागर कर दिया। एक 'टेक-होम' मिडटर्म परीक्षा के दौरान, उनके 86 छात्रों की कक्षा ने आश्चर्यजनक रूप से 96% का औसत प्राप्त किया—यह आंकड़ा 65% से 80% के ऐतिहासिक सामान्य स्तर से काफी अधिक था।

सेरानो का संदेह तब पुष्ट हुआ जब उन्होंने परीक्षा के प्रश्नों को ChatGPT के माध्यम से चलाया और लगभग समान परिणाम प्राप्त किए। सबसे महत्वपूर्ण बात यह थी कि कई छात्रों ने उस जटिल गणितीय प्रमाण का उपयोग किया जिसे ChatGPT पसंद करता था, बजाय उस अधिक सहज और सीधे दृष्टिकोण के जिसकी आमतौर पर मानव छात्रों से अपेक्षा की जाती है।

अपने निष्कर्षों की पुष्टि करने के लिए, सेरानो ने एक प्रॉक्टर्ड (निरीक्षित), इन-पर्सन फाइनल परीक्षा आयोजित की। परिणाम विनाशकारी थे: कक्षा का औसत गिरकर 48.6% रह गया, जो इस कोर्स के इतिहास में सबसे कम था। उन्नीस छात्र पूरी तरह से अनुत्तीर्ण हो गए, और टेक-होम तथा इन-पर्सन स्कोर के बीच के अंतर ने यह साबित कर दिया कि पिछले उच्च अंक काफी हद तक कृत्रिम थे।

वैश्विक रुझान: AI के उपयोग और संज्ञानात्मक गिरावट के बीच संबंध

ब्राउन की घटना कोई अकेली विसंगति नहीं है, बल्कि एक व्यापक, प्रलेखित रुझान का हिस्सा है। दो प्रमुख अध्ययन इस बात के मात्रात्मक प्रमाण प्रदान करते हैं कि AI उपकरण सीखने के परिणामों को कैसे प्रभावित करते हैं:

  • चीन का अध्ययन: कक्षा 7 से 12 तक के 26,000 छात्रों पर नज़र रखने वाले एक अनुदैर्ध्य (longitudinal) अध्ययन में पाया गया कि AI अपनाने के बाद, होमवर्क स्कोर में 18% की वृद्धि हुई, जबकि इसे पूरा करने का समय 64 से घटकर 45 मिनट हो गया। हालाँकि, परीक्षा के स्कोर में 20% की गिरावट आई। दीर्घकालिक परिदृश्यों में, प्रवेश परीक्षा के प्रदर्शन में 24% तक की गिरावट आई, जिसमें सबसे अच्छा प्रदर्शन करने वाले छात्र सबसे अधिक प्रभावित हुए।
  • UC बर्कले/टेक्सास अध्ययन: टेक्सास के एक बड़े शोध विश्वविद्यालय में 5,00,000 से अधिक ग्रेड के विश्लेषण से पता चला कि भारी लेखन और प्रोग्रामिंग घटकों वाले पाठ्यक्रमों में, ChatGPT के लॉन्च के बाद "A" ग्रेड का हिस्सा 13 प्रतिशत अंक बढ़ गया। यह उछाल बिना पर्यवेक्षण वाले होमवर्क असाइनमेंट में सबसे अधिक केंद्रित था।

AI और शिक्षा के लिए व्यापक निहितार्थ

डेवलपर्स और शिक्षकों के लिए, ये निष्कर्ष "मानव-AI सहयोग" की बहस में एक महत्वपूर्ण मोड़ का प्रतिनिधित्व करते हैं। जबकि AI एक शक्तिशाली उत्पादकता गुणक (productivity multiplier) के रूप में कार्य करता है, डेटा बताता है कि यह वर्तमान में एक "संज्ञानात्मक बैसाखी" (cognitive crutch) के रूप में कार्य कर सकता है जो गहन सीखने के लिए आवश्यक संघर्ष को दरकिनार कर देता है।

होमवर्क पूरा करने में प्राप्त "दक्षता"—जैसा कि कुछ अध्ययनों में कार्य समय में लगभग 30% की कमी के रूप में देखा गया है—सीधे ज्ञान प्रतिधारण (knowledge retention) की कीमत पर आती है। जैसे-जैसे LLMs पेशेवर वर्कफ़्लो में अधिक एकीकृत होते जाएंगे, जो लोग अपने कौशल को बढ़ाने के लिए AI का उपयोग करते हैं और जो लोग इसका उपयोग अपने सोचने की क्षमता को बदलने के लिए करते हैं, उनके बीच का अंतर भविष्य के कार्यबल में एक निर्णायक विभाजन बन जाएगा।

मुख्य निष्कर्ष

  • प्रदर्शन अंतराल: बिना पर्यवेक्षण वाले, AI-सुलभ असाइनमेंट में उच्च ग्रेड वास्तविक छात्र सक्षमता के लिए अविश्वसनीय मानक बनते जा रहे हैं।
  • संज्ञानात्मक प्रतिस्थापन: अध्ययन बताते हैं कि जबकि AI होमवर्क की गति और ग्रेड को बढ़ाता है, यह परीक्षा प्रदर्शन और दीर्घकालिक ज्ञान प्रतिधारण में 20% की गिरावट से संबंधित है।
  • नए मूल्यांकन मॉडलों की आवश्यकता: AI-जनित आउटपुट और मानवीय विशेषज्ञता के बीच अंतर करने के लिए प्रॉक्टर्ड, इन-पर्सन, या अत्यधिक विशिष्ट मूल्यांकन की ओर बदलाव आवश्यक होता जा रहा है।