Yapay Zeka Performans Boşluğu: Gözetimli Sınavlar Neden Gerçeği Ortaya Çıkarıyor

Akademide Büyük Dil Modellerinin (LLM'ler) hızlı entegrasyonu, yüksek ödev puanlarının gerçek kavrayış eksikliğini maskelediği, ustalık konusunda yanıltıcı bir illüzyon yarattı. Brown Üniversitesi'nde yaşanan yakın tarihli bir vaka, bu büyüyen "performans boşluğuna" dikkat çekerek, üretken yapay zekaya aşırı bağımlılığın uzun vadeli bilişsel riskleri konusunda sert bir uyarı niteliği taşıyor.

Brown Üniversitesi Vaka Çalışması: %48'lik Bir Gerçeklik Kontrolü

Brown Üniversitesi'nden ekonomi profesörü Roberto Serrano, yakın zamanda öğrenci performansında yaygın yapay zeka bağımlılığını ifşa eden dramatik bir çöküşe tanık oldu. Eve götürülebilir bir ara sınav sırasında, 86 öğrenciden oluşan sınıfı %96 gibi şaşırtıcı bir ortalamaya ulaştı; bu rakam, %65 ile %80 arasındaki tarihsel normun önemli ölçüde üzerindeydi.

Serrano'nun şüpheleri, sınav sorularını ChatGPT'ye sorduğunda neredeyse aynı sonuçları almasıyla doğrulandı. En dikkat çekici olanı ise, birçok öğrencinin insan öğrencilerden beklenen daha sezgisel ve doğrudan yaklaşım yerine, ChatGPT'nin tercih ettiği karmaşık bir matematiksel kanıtı kullanmış olmasıydı.

Bulgularını doğrulamak için Serrano, gözetimli ve yüz yüze bir final sınavına yöneldi. Sonuçlar felaket düzeyindeydi: Sınıf ortalaması %48,6'ya gerileyerek dersin tarihindeki en düşük seviyeye düştü. On dokuz öğrenci doğrudan başarısız oldu ve eve götürülebilir sınavlar ile yüz yüze sınavlar arasındaki fark, önceki yüksek notların büyük ölçüde yapay olduğunu kanıtladı.

Küresel Eğilimler: Yapay Zeka Kullanımı ile Bilişsel Gerileme Arasındaki Korelasyon

Brown olayı münferit bir anomali değil, daha geniş ve belgelenmiş bir eğilimin parçasıdır. İki büyük çalışma, yapay zeka araçlarının öğrenme çıktılarını nasıl etkilediğine dair nicel kanıtlar sunmaktadır:

  • Çin Çalışması: 7. sınıftan 12. sınıfa kadar 26.000 öğrenciyi takip eden boylamsal bir çalışma, yapay zekanın benimsenmesinden sonra ödev puanlarının %18 arttığını, ancak tamamlanma süresinin 64 dakikadan 45 dakikaya düştüğünü buldu. Ancak sınav puanları %20 oranında düştü. Uzun vadeli senaryolarda, giriş sınavı performansı %24'e kadar geriledi ve en başarılı öğrenciler bundan en çok etkilenen grup oldu.
  • UC Berkeley/Teksas Çalışması: Büyük bir Teksas araştırma üniversitesindeki 500.000'den fazla notun analizi, yoğun yazma ve programlama bileşenleri içeren derslerde, ChatGPT'nin piyasaya sürülmesinin ardından "A" notu oranının 13 puan arttığını ortaya koydu. Bu enflasyon en çok denetimsiz ödevlerde yoğunlaştı.

Yapay Zeka ve Eğitim İçin Daha Geniş Çaplı Etkiler

Geliştiriciler ve eğitimciler için bu bulgular, "İnsan-Yapay Zeka İş Birliği" tartışmasında kritik bir dönüm noktasını temsil ediyor. Yapay zeka güçlü bir üretkenlik çarpanı görevi görse de veriler, şu anda derin öğrenme için gerekli olan çaba sürecini devre dışı bırakan bir "bilişsel koltuk değneği" olarak işlev görebileceğini gösteriyor.

Bazı çalışmalarda görev süresinin yaklaşık %30 azalmasıyla görülen ödev tamamlama sürecindeki "verimlilik", doğrudan bilgi kalıcılığından ödün verilerek elde ediliyor. LLM'ler profesyonel iş akışlarına daha fazla entegre edildikçe, becerilerini artırmak için yapay zekayı kullananlar ile düşünme süreçlerinin yerini alması için kullananlar arasındaki fark, geleceğin iş gücündeki belirleyici ayrım haline gelecektir.

Temel Çıkarımlar

  • Performans Boşluğu: Denetimsiz ve yapay zekaya erişilebilen ödevlerdeki yüksek notlar, gerçek öğrenci yetkinliği için güvenilmez metrikler haline geliyor.
  • Bilişsel İkame: Çalışmalar, yapay zekanın ödev hızını ve notları artırmasına rağmen, sınav performansı ve uzun vadeli bilgi kalıcılığında %20'lik bir düşüşle korelasyon gösterdiğini kanıtlıyor.
  • Yeni Değerlendirme Modellerine Duyulan İhtiyaç: Yapay zeka tarafından üretilen çıktı ile insan uzmanlığını birbirinden ayırmak için gözetimli, yüz yüze veya son derece özelleşmiş değerlendirmelere geçiş zorunlu hale geliyor.