AI പ്രകടനത്തിലെ വിടവ്: എന്തുകൊണ്ട് നിരീക്ഷിക്കപ്പെടുന്ന പരീക്ഷകൾ (Proctored Exams) സത്യം വെളിപ്പെടുത്തുന്നു

അക്കാദമിക് രംഗത്ത് ലാർജ് ലാംഗ്വേജ് മോഡലുകളുടെ (LLMs) അതിവേഗത്തിലുള്ള സംയോജനം, അറിവിന്റെ ഒരു വ്യാജമായ തോന്നിപ്പിക്കൽ സൃഷ്ടിച്ചിരിക്കുന്നു; ഇവിടെ ഉയർന്ന അസൈൻമെന്റ് സ്കോറുകൾ യഥാർത്ഥമായ ധാരണയുടെ അഭാവത്തെ മറച്ചുവെക്കുന്നു. ബ്രൗൺ സർവ്വകലാശാലയിലെ (Brown University) ഒരു സമീപകാല സംഭവം ഈ വർദ്ധിച്ചുവരുന്ന "പ്രകടന വിടവിനെ" (performance gap) എടുത്തുകാണിക്കുന്നു, ഇത് ജനറേറ്റീവ് AI-യെ അമിതമായി ആശ്രയിക്കുന്നതിലൂടെ ഉണ്ടാകാൻ സാധ്യതയുള്ള ദീർഘകാലത്തെ വൈജ്ഞാനിക അപകടങ്ങളെക്കുറിച്ച് കടുത്ത മുന്നറിയിപ്പ് നൽകുന്നു.

ബ്രൗൺ സർവ്വകലാശാലയിലെ കേസ് സ്റ്റഡി: 48% എന്ന യാഥാർത്ഥ്യം

ബ്രൗൺ സർവ്വകലാശാലയിലെ ഇക്കണോമിക്സ് പ്രൊഫസറായ റോബർട്ടോ സെറാനോ, വിദ്യാർത്ഥികളുടെ പ്രകടനത്തിൽ ഉണ്ടായ നാടകീയമായ തകർച്ച അടുത്തിടെ നേരിട്ട് കണ്ടു, ഇത് വ്യാപകമായ AI ആശ്രിതത്വത്തെ തുറന്നുകാട്ടി. വീട്ടിലിരുന്ന് എഴുതുന്ന ഒരു മിഡ്‌ടേം പരീക്ഷയിൽ, അദ്ദേഹത്തിന്റെ 86 വിദ്യാർത്ഥികളുള്ള ക്ലാസ് 96% ശരാശരി കൈവരിച്ചു—ഇത് മുൻകാലങ്ങളിലെ 65% മുതൽ 80% വരെയുള്ള ശരാശരിയേക്കാൾ വളരെ കൂടുതലാണ്.

പരീക്ഷാ ചോദ്യങ്ങൾ ChatGPT-യിൽ നൽകിയപ്പോൾ സമാനമായ ഉത്തരങ്ങൾ ലഭിച്ചതോടെ സെറാനോയുടെ സംശയങ്ങൾ ശരിയാണെന്ന് തെളിഞ്ഞു. ഏറ്റവും ശ്രദ്ധേയമായ കാര്യം, മനുഷ്യരായ വിദ്യാർത്ഥികളിൽ നിന്ന് പ്രതീക്ഷിക്കുന്ന ലളിതമായ രീതിക്ക് പകരം, ChatGPT ഉപയോഗിക്കുന്ന സങ്കീർണ്ണമായ ഒരു ഗണിതശാസ്ത്ര തെളിവാണ് (mathematical proof) പല വിദ്യാർത്ഥികളും ഉപയോഗിച്ചത് എന്നതാണ്.

തന്റെ കണ്ടെത്തലുകൾ ശരിയാണെന്ന് ഉറപ്പുവരുത്താൻ, സെറാനോ നേരിട്ടുള്ള നിരീക്ഷണത്തിൽ (proctored) നടത്തുന്ന ഒരു ഫൈനൽ പരീക്ഷയ്ക്ക് മാറ്റം വരുത്തി. അതിന്റെ ഫലം ഭയാനകമായിരുന്നു: ക്ലാസ് ശരാശരി 48.6% ആയി ഇടിഞ്ഞു, ഇത് കോഴ്സിന്റെ ചരിത്രത്തിലെ ഏറ്റവും കുറഞ്ഞ നിരക്കാണ്. പത്തൊൻപത് വിദ്യാർത്ഥികൾ പരാജയപ്പെട്ടു, വീട്ടിലിരുന്ന് എഴുതിയ പരീക്ഷയും നേരിട്ടുള്ള പരീക്ഷയും തമ്മിലുള്ള ഈ വ്യത്യാസം മുൻപത്തെ ഉയർന്ന മാർക്കുകൾ വലിയൊരു പരിധിവരെ കൃത്രിമമായിരുന്നുവെന്ന് തെളിയിച്ചു.

ആഗോള പ്രവണതകൾ: AI ഉപയോഗവും വൈജ്ഞാനിക തകർച്ചയും തമ്മിലുള്ള ബന്ധം

ബ്രൗണിലെ സംഭവം ഒരു ഒറ്റപ്പെട്ട സംഭവമല്ല, മറിച്ച് രേഖപ്പെടുത്തപ്പെട്ട വിപുലമായ ഒരു പ്രവണതയുടെ ഭാഗമാണ്. AI ടൂളുകൾ പഠനഫലങ്ങളെ എങ്ങനെ ബാധിക്കുന്നു എന്നതിന് രണ്ട് പ്രധാന പഠനങ്ങൾ അളക്കാവുന്ന തെളിവുകൾ നൽകുന്നു:

  • ചൈനയിലെ പഠനം: 7 മുതൽ 12 വരെയുള്ള ക്ലാസുകളിലെ 26,000 വിദ്യാർത്ഥികളെ നിരീക്ഷിച്ച ഒരു പഠനത്തിൽ, AI ഉപയോഗിക്കാൻ തുടങ്ങിയതോടെ ഹോംവർക്ക് സ്കോറുകൾ 18% വർദ്ധിച്ചതായും എന്നാൽ അത് പൂർത്തിയാക്കാൻ എടുക്കുന്ന സമയം 64 മിനിറ്റിൽ നിന്ന് 45 മിനിറ്റായി കുറഞ്ഞതായും കണ്ടെത്തി. എന്നിരുന്നാലും, പരീക്ഷാ സ്കോറുകൾ 20% കുറഞ്ഞു. ദീർഘകാലാടിസ്ഥാനത്തിൽ, പ്രവേശന പരീക്ഷകളിലെ പ്രകടനം 24% വരെ കുറഞ്ഞു, ഇതിൽ മികച്ച പ്രകടനം കാഴ്ചവെക്കുന്ന വിദ്യാർത്ഥികളാണ് ഏറ്റവും കൂടുതൽ ബാധിക്കപ്പെട്ടത്.
  • UC ബർക്ക്ലി/ടെക്സസ് പഠനം: ടെക്സസിലെ ഒരു വലിയ ഗവേഷണ സർവ്വകലാശാലയിലെ 500,000-ത്തിലധികം ഗ്രേഡുകൾ വിശകലനം ചെയ്തപ്പോൾ, എഴുത്തും പ്രോഗ്രാമിംഗും കൂടുതലുള്ള കോഴ്സുകളിൽ ChatGPT വന്നതിന് ശേഷം "A" ഗ്രേഡുകളുടെ എണ്ണത്തിൽ 13 ശതമാനത്തിന്റെ വർദ്ധനവ് ഉണ്ടായതായി കണ്ടെത്തി. നിരീക്ഷണമില്ലാതെ ചെയ്യുന്ന ഹോംവർക്കുകളിലാണ് ഈ വർദ്ധനവ് ഏറ്റവും കൂടുതൽ കണ്ടത്.

AI-യും വിദ്യാഭ്യാസവും: വിപുലമായ പ്രത്യാഘാതങ്ങൾ

ഡെവലപ്പർമാർക്കും അധ്യാപകർക്കും ഈ കണ്ടെത്തലുകൾ "മനുഷ്യ-AI സഹകരണം" (Human-AI Collaboration) എന്ന ചർച്ചയിലെ ഒരു നിർണ്ണായക ഘട്ടമാണ് സൂചിപ്പിക്കുന്നത്. AI ഉൽപ്പാദനക്ഷമത വർദ്ധിപ്പിക്കാൻ സഹായിക്കുന്നുണ്ടെങ്കിലും, ആഴത്തിലുള്ള പഠനത്തിന് ആവശ്യമായ പരിശ്രമങ്ങളെ ഒഴിവാക്കുന്ന ഒരു "വൈജ്ഞാനിക ഊന്നൽ" (cognitive crutch) ആയിട്ടാണ് നിലവിൽ ഇത് പ്രവർത്തിക്കുന്നതെന്ന് വിവരങ്ങൾ സൂചിപ്പിക്കുന്നു.

ഹോംവർക്ക് പൂർത്തിയാക്കുന്നതിലൂടെ ലഭിക്കുന്ന "കാര്യക്ഷമത"—ചില പഠനങ്ങളിൽ ടാസ്ക് സമയം ഏകദേശം 30% കുറഞ്ഞതായി കാണുന്നു—അറിവ് നിലനിർത്തുന്നതിനെ നേരിട്ട് ബാധിക്കുന്നു. LLM-കൾ പ്രൊഫഷണൽ പ്രവർത്തനങ്ങളിൽ കൂടുതൽ സംയോജിപ്പിക്കപ്പെടുമ്പോൾ, തങ്ങളുടെ കഴിവുകൾ വർദ്ധിപ്പിക്കാൻ AI ഉപയോഗിക്കുന്നവരും, ചിന്താശേഷിക്ക് പകരമായി അത് ഉപയോഗിക്കുന്നവരും തമ്മിലുള്ള വ്യത്യാസം ഭാവിയിലെ തൊഴിൽ മേഖലയിലെ പ്രധാന വിഭജനമായി മാറും.

പ്രധാന കാര്യങ്ങൾ

  • പ്രകടന വിടവ്: നിരീക്ഷണമില്ലാത്തതും AI ഉപയോഗിക്കാൻ കഴിയുന്നതുമായ അസൈൻമെന്റുകളിലെ ഉയർന്ന ഗ്രേഡുകൾ വിദ്യാർത്ഥികളുടെ യഥാർത്ഥ കഴിവിനെ അളക്കുന്നതിനുള്ള വിശ്വസനീയമായ മാനദണ്ഡങ്ങളല്ല.
  • വൈജ്ഞാനിക പകരക്കാരൻ: AI ഹോംവർക്ക് വേഗതയും ഗ്രേഡുകളും വർദ്ധിപ്പിക്കുന്നുണ്ടെങ്കിലും, പരീക്ഷാ പ്രകടനത്തിലും ദീർഘകാല അറിവ് നിലനിർത്തുന്നതിലും ഇത് 20% കുറവിനു കാരണമാകുന്നുവെന്ന് പഠനങ്ങൾ കാണിക്കുന്നു.
  • പുതിയ മൂല്യനിർണ്ണയ രീതികളുടെ ആവശ്യം: AI നിർമ്മിച്ച ഉത്തരങ്ങളും മനുഷ്യന്റെ വൈദഗ്ധ്യവും തമ്മിലുള്ള വ്യത്യാസം തിരിച്ചറിയുന്നതിന്, നേരിട്ടുള്ള നിരീക്ഷണത്തിലോ (proctored) അല്ലെങ്കിൽ അതീവ സവിശേഷമായ രീതിയിലോ ഉള്ള മൂല്യനിർണ്ണയങ്ങളിലേക്ക് മാറേണ്ടത് അത്യാവശ്യമായി മാറുന്നു.