AI పనితీరు అంతరం: ప్రోక్టరీడ్ పరీక్షలు ఎందుకు వాస్తవాలను బయటపెడతాయి
విద్యా రంగంలో లార్జ్ లాంగ్వేజ్ మోడల్స్ (LLMs) వేగంగా కలిసిపోవడం వల్ల, విద్యార్థులు సబ్జెక్టుపై పట్టు సాధించినట్లుగా ఒక భ్రమ కలుగుతోంది. అసలైన అవగాహన లేకపోయినా, అసైన్మెంట్లలో వచ్చే అధిక మార్కులు ఈ లోపాన్ని కప్పిపుచ్చుతున్నాయి. బ్రౌన్ యూనివర్శిటీలో ఇటీవల జరిగిన ఒక సంఘటన ఈ పెరుగుతున్న "పనితీరు అంతరం" (performance gap)ను ఎత్తిచూపింది, ఇది జనరేటివ్ AI పై అతిగా ఆధారపడటం వల్ల కలిగే దీర్ఘకాలిక మేధోపరమైన (cognitive) ప్రమాదాల గురించి హెచ్చరిస్తోంది.
బ్రౌన్ యూనివర్శిటీ కేస్ స్టడీ: 48% వాస్తవికత
బ్రౌన్ యూనివర్శిటీకి చెందిన ఎకనామిక్స్ ప్రొఫెసర్ రోబెర్టో సెరానో, ఇటీవల విద్యార్థుల పనితీరులో భారీ పతనాన్ని గమనించారు, ఇది AI పై వారికున్న విస్తృత ఆధారితాన్ని బయటపెట్టింది. ఒక 'టేక్-హోమ్' మిడ్టర్మ్ పరీక్షలో, ఆయన తరగతిలోని 86 మంది విద్యార్థులు సగటున 96% మార్కులు సాధించారు—ఇది సాధారణంగా ఉండే 65% నుండి 80% కంటే చాలా ఎక్కువ.
సెరానో అనుమానాలను ChatGPT ద్వారా పరీక్షా ప్రశ్నలను రన్ చేసి చూడగా, దాదాపు అదే ఫలితాలు రావడం వల్ల ఆయన అనుమానాలు నిజమయ్యాయి. ముఖ్యంగా, చాలా మంది విద్యార్థులు మానవ విద్యార్థుల నుండి ఆశించే సహజమైన, ప్రత్యక్ష పద్ధతిని అనుసరించకుండా, ChatGPT ఇష్టపడే క్లిష్టమైన గణిత నిరూపణను (mathematical proof) ఉపయోగించారు.
తన పరిశీలనలను ధృవీకరించుకోవడానికి, సెరానో ప్రత్యక్షంగా (in-person) నిర్వహించే ప్రోక్టరీడ్ ఫైనల్ పరీక్షను నిర్వహించారు. ఫలితాలు దిగ్భ్రాంతికరంగా ఉన్నాయి: తరగతి సగటు 48.6%కి పడిపోయింది, ఇది ఆ కోర్సు చరిత్రలోనే అత్యల్పం. పంతొమ్మిది మంది విద్యార్థులు నేరుగా ఫెయిల్ అయ్యారు. టేక్-హోమ్ మరియు ప్రత్యక్ష పరీక్షల మార్కుల మధ్య ఉన్న వ్యత్యాసం, అంతకుముందు వచ్చిన అధిక మార్కులు చాలా వరకు కృత్రిమమైనవని నిరూపించింది.
ప్రపంచ పోకడలు: AI వినియోగం మరియు మేధోపరమైన క్షీణత మధ్య సంబంధం
బ్రౌన్ యూనివర్శిటీ సంఘటన ఒక విడిగా జరిగిన ఘటన మాత్రమే కాదు, ఇది విస్తృతమైన, ఆధారాలతో కూడిన పోకడలో భాగం. AI సాధనాలు అభ్యాస ఫలితాలపై ఎలా ప్రభావం చూపుతాయో రెండు ప్రధాన అధ్యయనాలు గణాంక ఆధారాలను అందిస్తున్నాయి:
- చైనా అధ్యయనం: 7 నుండి 12వ తరగతి వరకు ఉన్న 26,000 మంది విద్యార్థులపై నిర్వహించిన దీర్ఘకాలిక అధ్యయనం ప్రకారం, AIని ఉపయోగించడం వల్ల హోంవర్క్ స్కోర్లు 18% పెరిగాయి మరియు పూర్తి చేసే సమయం 64 నుండి 45 నిమిషాలకు తగ్గింది. అయితే, పరీక్షల స్కోర్లు 20% తగ్గాయి. దీర్ఘకాలికంగా చూస్తే, ప్రవేశ పరీక్షల (entrance exam) పనితీరు 24% వరకు పడిపోయింది, ఇందులో అత్యుత్తమ ప్రతిభ కనబరిచే విద్యార్థులు ఎక్కువగా ప్రభావితమయ్యారు.
- UC Berkeley/టెక్సాస్ అధ్యయనం: టెక్సాస్లోని ఒక పెద్ద పరిశోధనా విశ్వవిద్యాలయంలో 5,00,000 కంటే ఎక్కువ గ్రేడ్లను విశ్లేషించగా, రైటింగ్ మరియు ప్రోగ్రామింగ్ అంశాలు ఎక్కువగా ఉండే కోర్సులలో, ChatGPT ప్రారంభం తర్వాత "A" గ్రేడ్ల శాతం 13 శాతం పాయింట్లు పెరిగిందని తేలింది. ఈ పెరుగుదల ఎక్కువగా పర్యవేక్షణ లేని హోంవర్క్ అసైన్మెంట్లలోనే కనిపించింది.
AI మరియు విద్యపై దీని విస్తృత ప్రభావాలు
డెవలపర్లు మరియు విద్యావేత్తలకు, ఈ ఫలితాలు "మానవ-AI సహకారం" (Human-AI Collaboration) చర్చలో ఒక కీలకమైన మలుపును సూచిస్తున్నాయి. AI శక్తివంతమైన ఉత్పాదకతను పెంచే సాధనంగా పనిచేస్తున్నప్పటికీ, లోతైన అభ్యాసానికి (deep learning) అవసరమైన శ్రమను పక్కన పెట్టే ఒక "మేధోపరమైన ఆధారంగా" (cognitive crutch) ఇది ప్రస్తుతం పనిచేస్తోందని డేటా సూచిస్తోంది.
హోంవర్క్ పూర్తి చేయడంలో లభించిన "సమర్థత"—కొన్ని అధ్యయనాల ప్రకారం పని సమయం దాదాపు 30% తగ్గింది—జ్ఞానాన్ని గుర్తుంచుకునే సామర్థ్యం (knowledge retention) తగ్గడం వల్ల వస్తుంది. LLMలు వృత్తిపరమైన పని విధానాలలో (professional workflows) మరింతగా కలిసిపోతున్న కొద్దీ, తమ నైపుణ్యాలను మెరుగుపరుచుకోవడానికి AIని ఉపయోగించేవారికి మరియు తమ ఆలోచనా శక్తిని భర్తీ చేయడానికి AIని ఉపయోగించేవారికి మధ్య ఉన్న వ్యత్యాసం భవిష్యత్తు శ్రామిక శక్తిలో ప్రధాన విభజన రేఖగా మారుతుంది.
ముఖ్య అంశాలు
- పనితీరు అంతరం: పర్యవేక్షణ లేని, AI అందుబాటులో ఉన్న అసైన్మెంట్లలో వచ్చే అధిక గ్రేడ్లు విద్యార్థుల అసలు సామర్థ్యాన్ని కొలవడానికి నమ్మదగిన కొలమానాలుగా మారడం లేదు.
- మేధోపరమైన ప్రతిస్థాపన (Cognitive Substitution): AI హోంవర్క్ వేగాన్ని మరియు గ్రేడ్లను పెంచినప్పటికీ, ఇది పరీక్షల పనితీరు మరియు దీర్ఘకాలిక జ్ఞాన నిలుపుదలలో 20% తగ్గుదలకి కారణమవుతుందని అధ్యయనాలు చూపుతున్నాయి.
- కొత్త మూల్యాంకన నమూనాల అవసరం: AI సృష్టించిన అవుట్పుట్కు మరియు మానవ నైపుణ్యానికి మధ్య తేడాను గుర్తించడానికి ప్రోక్టరీడ్, ప్రత్యక్ష లేదా అత్యంత ప్రత్యేకమైన మూల్యాంకన పద్ధతుల వైపు మళ్లడం అవసరమవుతోంది.
