اے آئی پرفارمنس گیپ: کیوں پراکٹورڈ امتحانات حقیقت کو بے نقاب کرتے ہیں
تعلیمی اداروں میں لارج لینگویج ماڈلز (LLMs) کے تیزی سے بڑھتے ہوئے استعمال نے مہارت کا ایک دھوکہ دہی والا وہم پیدا کر دیا ہے، جہاں اسائنمنٹس کے زیادہ نمبر اصل فہم و ادراک کی گہری کمی کو چھپا دیتے ہیں۔ براؤن یونیورسٹی کے ایک حالیہ واقعے نے اس بڑھتے ہوئے "پرفارمنس گیپ" (کارکردگی کے فرق) کو اجاگر کیا ہے، جو جنریٹیو اے آئی پر ضرورت سے زیادہ انحصار کے طویل مدتی علمی (cognitive) خطرات کے بارے میں ایک سخت انتباہ فراہم کرتا ہے۔
براؤن یونیورسٹی کیس اسٹڈی: 48 فیصد حقیقت کا سامنا
براؤن یونیورسٹی میں معاشیات کے پروفیسر، روبرٹو سیرانو نے حال ہی میں طلباء کی کارکردگی میں ایک ڈرامائی گراوٹ دیکھی جس نے اے آئی پر وسیع پیمانے پر انحصار کو بے نقاب کر دیا۔ ایک 'ٹیک ہوم' (گھر سے حل کیے جانے والے) مڈ ٹرم امتحان کے دوران، ان کے 86 طلباء کی کلاس نے حیران کن طور پر 96 فیصد اوسط حاصل کی—یہ ہندسہ 65% سے 80% کے تاریخی معیار سے کہیں زیادہ تھا۔
سیرانو کے شکوک و شبہات اس وقت درست ثابت ہوئے جب انہوں نے امتحان کے سوالات ChatGPT کے ذریعے حل کیے اور تقریباً ویسا ہی نتیجہ حاصل کیا۔ سب سے اہم بات یہ کہ بہت سے طلباء نے ایک پیچیدہ ریاضیاتی ثبوت (mathematical proof) کا استعمال کیا جسے ChatGPT ترجیح دیتا ہے، بجائے اس کے کہ وہ اس فطری اور براہ راست طریقے کو اپنائیں جس کی انسانی طلباء سے عام طور پر توقع کی جاتی ہے۔
اپنے نتائج کی تصدیق کے لیے، سیرانو نے فائنل امتحان کو پراکٹورڈ (نگران کی موجودگی میں) اور آمنے سامنے (in-person) کرنے کا فیصلہ کیا۔ نتائج تباہ کن تھے: کلاس کی اوسط کارکردگی گر کر 48.6% رہ گئی، جو اس کورس کی تاریخ میں سب سے کم تھی۔ انیس طلباء مکمل طور پر فیل ہو گئے، اور 'ٹیک ہوم' اور 'ان پرسن' اسکورز کے درمیان فرق نے یہ ثابت کر دیا کہ پچھلے زیادہ نمبر زیادہ تر مصنوعی تھے۔
عالمی رجحانات: اے آئی کے استعمال اور علمی زوال کے درمیان تعلق
براؤن یونیورسٹی کا واقعہ کوئی الگ تھلگ واقعہ نہیں ہے بلکہ یہ ایک وسیع اور دستاویزی رجحان کا حصہ ہے۔ دو بڑی تحقیقات اس بات کا مقداری ثبوت فراہم کرتی ہیں کہ اے آئی ٹولز سیکھنے کے نتائج پر کیسے اثر انداز ہوتے ہیں:
- چائنا اسٹڈی: ساتویں سے بارہویں جماعت تک کے 26,000 طلباء پر نظر رکھنے والی ایک طویل مدتی تحقیق میں پایا گیا کہ اے آئی اپنانے کے بعد ہوم ورک کے نمبروں میں 18 فیصد اضافہ ہوا جبکہ اسے مکمل کرنے کا وقت 64 سے کم ہو کر 45 منٹ رہ گیا۔ تاہم، امتحانی نمبروں میں 20 فیصد کمی آئی۔ طویل مدتی صورتحال میں، داخلہ امتحانات کی کارکردگی میں 24 فیصد تک کمی دیکھی گئی، جس میں بہترین کارکردگی دکھانے والے طلباء سب سے زیادہ متاثر ہوئے۔
- یو سی برکلے/ٹیکساس اسٹڈی: ٹیکساس کی ایک بڑی ریسرچ یونیورسٹی میں 500,000 سے زیادہ گریڈز کے تجزیے سے پتہ چلا کہ جن کورسز میں لکھنے اور پروگرامنگ کے زیادہ اجزاء شامل تھے، ChatGPT کے آغاز کے بعد "A" گریڈز کے تناسب میں 13 فیصد اضافہ ہوا۔ یہ اضافہ زیادہ تر غیر نگرانی والے ہوم ورک اسائنمنٹس میں دیکھا گیا۔
اے آئی اور تعلیم کے لیے وسیع تر اثرات
ڈویلپرز اور ماہرین تعلیم کے لیے، یہ نتائج "انسان اور اے آئی کے تعاون" (Human-AI Collaboration) کی بحث میں ایک اہم موڑ کی نمائندگی کرتے ہیں۔ اگرچہ اے آئی پیداواری صلاحیت کو بڑھانے والے ایک طاقتور ذریعے کے طور پر کام کرتی ہے، لیکن ڈیٹا سے پتہ چلتا ہے کہ یہ فی الحال ایک "علمی سہارے" (cognitive crutch) کے طور پر کام کر رہی ہے جو گہری سیکھنے کے لیے ضروری جدوجہد کو نظر انداز کر دیتی ہے۔
ہوم ورک مکمل کرنے میں حاصل ہونے والی "کارکردگی"—جو کچھ مطالعات میں کام کے وقت میں تقریباً 30 فیصد کمی کے طور پر دیکھی گئی—براہ راست علم کے برقرار رہنے (knowledge retention) کی قیمت پر حاصل ہوتی ہے۔ جیسے جیسے LLMs پیشہ ورانہ کام کے طریقوں میں مزید ضم ہوتے جائیں گے، ان لوگوں کے درمیان جو اپنی مہارتوں کو بڑھانے کے لیے اے آئی کا استعمال کرتے ہیں اور ان کے درمیان جو اسے اپنی سوچ کی جگہ لینے کے لیے استعمال کرتے ہیں، فرق مستقبل کی افرادی قوت کا فیصلہ کن امتیاز بن جائے گا۔
اہم نکات
- پرفارمنس گیپ: غیر نگرانی والے اور اے آئی تک رسائی رکھنے والے اسائنمنٹس میں زیادہ گریڈز طلباء کی اصل قابلیت کے لیے ناقابل اعتبار پیمانے بنتے جا رہے ہیں۔
- علمی متبادل (Cognitive Substitution): تحقیقات سے پتہ چلتا ہے کہ اگرچہ اے آئی ہوم ورک کی رفتار اور گریڈز میں اضافہ کرتی ہے، لیکن اس کا تعلق امتحانی کارکردگی اور طویل مدتی علمی یادداشت میں 20 فیصد کمی سے ہے۔
- تشخیص کے نئے ماڈلز کی ضرورت: اے آئی سے تیار کردہ مواد اور انسانی مہارت کے درمیان فرق کرنے کے لیے پراکٹورڈ، آمنے سامنے، یا انتہائی مخصوص امتحانی طریقوں کی طرف منتقلی ضروری ہوتی جا رہی ہے۔
