Jurang Prestasi AI: Mengapa Peperiksaan Terkawal Mendedahkan Kebenaran
Integrasi pesat Model Bahasa Besar (LLM) dalam dunia akademik telah mewujudkan ilusi penguasaan yang mengelirukan, di mana markah tugasan yang tinggi menyembunyikan kekurangan pemahaman sebenar yang mendalam. Satu kes baru-baru ini di Universiti Brown telah menonjolkan "jurang prestasi" yang semakin meningkat ini, memberikan amaran keras tentang risiko kognitif jangka panjang akibat kebergantungan berlebihan pada AI generatif.
Kajian Kes Universiti Brown: Semakan Realiti 48%
Roberto Serrano, seorang profesor ekonomi di Universiti Brown, baru-baru ini menyaksikan kejatuhan drastik dalam prestasi pelajar yang mendedahkan kebergantungan AI yang meluas. Semasa peperiksaan pertengahan semester secara bawa pulang, kelasnya yang terdiri daripada 86 pelajar mencapai purata yang mengejutkan iaitu 96%—angka yang jauh lebih tinggi daripada norma sejarah iaitu 65% hingga 80%.
Syak wasangka Serrano terbukti apabila beliau memasukkan soalan peperiksaan tersebut ke dalam ChatGPT dan menerima keputusan yang hampir serupa. Apa yang paling ketara, ramai pelajar menggunakan pembuktian matematik yang rumit yang disukai oleh ChatGPT, berbanding pendekatan langsung dan intuitif yang biasanya diharapkan daripada pelajar manusia.
Untuk mengesahkan penemuannya, Serrano beralih kepada peperiksaan akhir secara bersemuka dan terkawal. Keputusannya sangat mengecewakan: purata kelas menjunam kepada 48.6%, yang terendah dalam sejarah kursus tersebut. Sembilan belas pelajar gagal sepenuhnya, dan perbezaan antara markah bawa pulang dan markah bersemuka membuktikan bahawa markah tinggi sebelum ini sebahagian besarnya adalah tiruan.
Trend Global: Korelasi Antara Penggunaan AI dan Penurunan Kognitif
Insiden Brown bukanlah satu anomali yang terpencil tetapi sebahagian daripada trend yang lebih luas dan telah didokumentasikan. Dua kajian utama memberikan bukti kuantitatif tentang bagaimana alatan AI memberi kesan kepada hasil pembelajaran:
- Kajian China: Satu kajian longitudinal yang menjejaki 26,000 pelajar dari gred 7 hingga 12 mendapati bahawa selepas menggunakan AI, markah kerja rumah meningkat sebanyak 18% manakala masa penyelesaian menurun daripada 64 ke 45 minit. Walau bagaimanapun, markah peperiksaan jatuh sebanyak 20%. Dalam senario jangka panjang, prestasi peperiksaan kemasukan jatuh sebanyak 24%, dengan pelajar berprestasi tinggi terjejas paling teruk.
- Kajian UC Berkeley/Texas: Analisis terhadap lebih 500,000 gred di sebuah universiti penyelidikan besar di Texas mendedahkan bahawa dalam kursus yang mempunyai komponen penulisan dan pengaturcaraan yang berat, bahagian gred "A" melonjak sebanyak 13 mata peratusan selepas pelancaran ChatGPT. Inflasi ini paling tertumpu dalam tugasan kerja rumah yang tidak diawasi.
Implikasi Lebih Luas untuk AI dan Pendidikan
Bagi pembangun dan pendidik, penemuan ini mewakili titik perubahan kritikal dalam perdebatan "Kolaborasi Manusia-AI". Walaupun AI bertindak sebagai pengganda produktiviti yang berkuasa, data menunjukkan ia mungkin berfungsi sebagai "tongkat kognitif" yang memintas kesukaran yang diperlukan untuk pembelajaran mendalam.
"Kecekapan" yang diperoleh dalam penyelesaian kerja rumah—dilihat melalui pengurangan masa tugasan sebanyak hampir 30% dalam sesetengah kajian—berlaku dengan mengorbankan pengekalan pengetahuan secara langsung. Apabila LLM menjadi lebih bersepadu dalam aliran kerja profesional, jurang antara mereka yang menggunakan AI untuk meningkatkan kemahiran mereka dan mereka yang menggunakannya untuk menggantikan pemikiran mereka akan menjadi pembahagi utama dalam tenaga kerja masa hadapan.
Ringkasan Utama
- Jurang Prestasi: Gred tinggi dalam tugasan yang tidak diawasi dan boleh diakses oleh AI menjadi metrik yang tidak boleh dipercayai untuk kecekapan sebenar pelajar.
- Penggantian Kognitif: Kajian menunjukkan bahawa walaupun AI meningkatkan kelajuan dan gred kerja rumah, ia berkorelasi dengan penurunan 20% dalam prestasi peperiksaan dan pengekalan pengetahuan jangka panjang.
- Keperluan untuk Model Penilaian Baharu: Peralihan ke arah penilaian secara bersemuka, terkawal, atau sangat khusus menjadi perlu untuk membezakan antara hasil janaan AI dan kepakaran manusia.
