Pengazo la Utendaji wa AI: Kwa Nini Mitihani ya Kusimamiwa Hufichua Ukweli
Ujumuishaji wa haraka wa Mifumo Mikubwa ya Lugha (LLMs) katika taaluma umeunda dhana ya ujanja ya umahiri, ambapo alama za juu za kazi za nyumbani huficha ukosefu mkubwa wa uelewa halisi. Kisa cha hivi karibuni katika Chuo Kikuu cha Brown kimeangazia "pengazo hili la utendaji" linalokua, likitoa onyo kali kuhusu hatari za muda mrefu za kiakili za utegemezi uliopitiliza wa AI inayozalisha (generative AI).
Utafiti wa Kisa cha Chuo Kikuu cha Brown: Ukweli wa Asilimia 48%
Roberto Serrano, profesa wa uchumi katika Chuo Kikuu cha Brown, hivi karibuni alishuhudia anguko kubwa la utendaji wa wanafunzi ambalo lilifichua utegemezi mkubwa wa AI. Wakati wa mtihani wa katikati ya muhula wa nyumbani, darasa lake la wanafunzi 86 lilipata wastani wa kushangaza wa 96%—takwimu ambayo ni kubwa zaidi kuliko wastani wa kihistoria wa 65% hadi 80%.
Mashaka ya Serrano yalithibitishwa alipopitisha maswali ya mtihani kupitia ChatGPT na kupata matokeo yanayofanana kabisa. Jambo la kushangaza zaidi ni kwamba, wanafunzi wengi walitumia uthibitisho wa hisabati uliopindukia ambao ChatGPT ulipendelea, badala ya njia ya moja kwa moja na ya asili inayotarajiwa kutoka kwa wanafunzi binadamu.
Ili kuthibitisha matokeo yake, Serrano alihamia kwenye mtihani wa mwisho wa ana kwa ana unaosimamiwa. Matokeo yalikuwa ya maafa: wastani wa darasa ulishuka hadi 48.6%, ukiwa ni chini kabisa katika historia ya kozi hiyo. Wanafunzi kumi na tisa walifeli kabisa, na tofauti kati ya alama za nyumbani na zile za ana kwa ana ilithibitisha kuwa alama za juu za awali zilikuwa za bandia kwa kiasi kikubwa.
Mitindo ya Kimataifa: Uhusiano Kati ya Matumizi ya AI na Kuporomoka kwa Uwezo wa Kiakili
Tukio la Brown si la kipekee bali ni sehemu ya mtindo mpana uliothibitishwa. Tafiti mbili kubwa zinatoa ushahidi wa kiasi kuhusu jinsi zana za AI zinavyoathiri matokeo ya kujifunza:
- Utafiti wa China: Utafiti wa muda mrefu unaofuatilia wanafunzi 26,000 katika madarasa ya 7 hadi 12 uligundua kuwa baada ya kuanza kutumia AI, alama za kazi za nyumbani zilipanda kwa 18% huku muda wa kukamilisha ukipungua kutoka dakika 64 hadi 45. Hata hivyo, alama za mitihani zilishuka kwa 20%. Katika hali za muda mrefu, utendaji katika mitihani ya kujiunga na masomo ulipungua kwa hadi 24%, huku wanafunzi wenye ufaulu wa juu wakiumia zaidi.
- Utafiti wa UC Berkeley/Texas: Uchambuzi wa zaidi ya alama 500,000 katika chuo kikuu kikubwa cha utafiti cha Texas ulionyesha kuwa katika kozi zenye vipengele vingi vya uandishi na programming, sehemu ya alama za "A" ilipanda kwa pointi 13 baada ya kuzinduliwa kwa ChatGPT. Ongezeko hili lilijikita zaidi katika kazi za nyumbani zisizosimamiwa.
Athari Pana kwa AI na Elimu
Kwa watengenezaji na waelimishaji, matokeo haya yanawakilisha hatua muhimu katika mjadala wa "Ushirikiano wa Binadamu na AI". Ingawa AI inafanya kazi kama kichocheo kikubwa cha uzalishaji, data inaonyesha kuwa kwa sasa inaweza kufanya kazi kama "kikongozi cha kiakili" (cognitive crutch) kinachopita juhudi zinazohitajika kwa ajili ya kujifunza kwa kina.
"Ufanisi" unaopatikana katika kukamilisha kazi za nyumbani—unaonekana katika kupungua kwa muda wa kazi kwa karibu 30% katika baadhi ya tafiti—unakuja kwa gharama ya moja kwa moja ya uwezo wa kukumbuka maarifa. Kadiri LLMs zinavyozidi kujumuishwa katika mifumo ya kazi ya kitaalamu, pengazo kati ya wale wanaotumia AI kuongeza ujuzi wao na wale wanaotumia kuifanya iwe badala ya kufikiri kwao litakuwa mgawanyiko mkuu katika nguvu kazi ya baadaye.
Mambo Muhimu ya Kuzingatia
- Pengazo la Utendaji: Alama za juu katika kazi zisizosimamiwa ambazo zinaweza kufikiwa na AI zinakuwa vipimo visivyoaminika vya uwezo halisi wa mwanafunzi.
- Ubadilishaji wa Kiakili: Tafiti zinaonyesha kuwa wakati AI inapoongeza kasi ya kazi za nyumbani na alama, inaendana na anguko la 20% katika utendaji wa mitihani na uwezo wa kukumbuka maarifa kwa muda mrefu.
- Hitaji la Mifumo Mpya ya Tathmini: Mabadiliko kuelekea tathmini zinazosimamiwa, za ana kwa ana, au za kitaalamu zaidi yanakuwa ya lazima ili kutofautisha kati ya matokeo yanayozalishwa na AI na utaalamu wa binadamu.
