Luka wydajności AI: Dlaczego egzaminy nadzorowane ujawniają prawdę

Szybka integracja dużych modeli językowych (LLM) w środowisku akademickim stworzyła zwodniczą iluzję biegłości, w której wysokie oceny z zadań maskują głęboki brak rzeczywistego zrozumienia materiału. Niedawny przypadek na Uniwersytecie Brown uwypuklił tę rosnącą „lukę wydajnościową”, stanowiąc surowe ostrzeżenie przed długofalowymi ryzykami poznawczymi wynikającymi z nadmiernego polegania na generatywnej sztucznej inteligencji.

Studium przypadku Uniwersytetu Brown: Brutalne zderzenie z rzeczywistością (48%)

Roberto Serrano, profesor ekonomii na Uniwersytecie Brown, był niedawno świadkiem dramatycznego spadku wyników studentów, który obnażył powszechną zależność od AI. Podczas egzaminu śródsemestralnego realizowanego w domu, jego grupa licząca 86 studentów osiągnęła oszałamiającą średnią 96% — wynik znacznie wyższy niż historyczna norma wynosząca od 65% do 80%.

Podejrzenia Serrano potwierdziły się, gdy przepuścił pytania egzaminacyjne przez ChatGPT i otrzymał niemal identyczne wyniki. Co najważniejsze, wielu studentów wykorzystało zawiły dowód matematyczny, który preferował ChatGPT, zamiast bardziej intuicyjnego i bezpośredniego podejścia, jakiego zazwyczaj oczekuje się od ludzi.

Aby zweryfikować swoje ustalenia, Serrano zdecydował się na egzamin końcowy przeprowadzony stacjonarnie pod nadzorem. Wyniki były katastrofalne: średnia klasy spadła do 48,6%, co było najniższym wynikiem w historii tego kursu. Dziewiętnastu studentów oblało egzamin, a rozbieżność między wynikami uzyskanymi w domu a tymi z egzaminu stacjonarnego udowodniła, że poprzednie wysokie noty były w dużej mierze sztuczne.

Globalne trendy: Korelacja między użyciem AI a spadkiem zdolności poznawczych

Incydent na Uniwersytecie Brown nie jest odosobnionym przypadkiem, lecz częścią szerszego, udokumentowanego trendu. Dwa duże badania dostarczają dowodów ilościowych na to, jak narzędzia AI wpływają na wyniki nauczania:

  • Badanie z Chin: Badanie podłużne obejmujące 26 000 uczniów klas 7–12 wykazało, że po wprowadzeniu AI oceny z prac domowych wzrosły o 18%, podczas gdy czas ich wykonywania spadł z 64 do 45 minut. Jednak wyniki egzaminów spadły o 20%. W scenariuszach długoterminowych wyniki egzaminów wstępnych spadły aż o 24%, przy czym najbardziej ucierpieli najlepsi uczniowie.
  • Badanie UC Berkeley/Texas: Analiza ponad 500 000 ocen na dużej teksaskiej uczelni badawczej wykazała, że na kursach z dużym naciskiem na pisanie i programowanie, udział ocen „A” wzrósł o 13 punktów procentowych po premierze ChatGPT. Ta inflacja ocen była najbardziej widoczna w zadaniach domowych wykonywanych bez nadzoru.

Szersze implikacje dla AI i edukacji

Dla programistów i edukatorów wyniki te stanowią krytyczny punkt zwrotny w debacie na temat „współpracy człowieka z AI”. Choć AI działa jako potężny mnożnik produktywności, dane sugerują, że obecnie może ona pełnić funkcję „poznawczej podpory”, która pozwala ominąć wysiłek niezbędny do głębokiego uczenia się.

„Efektywność” zyskana przy wykonywaniu prac domowych — widoczna w skróceniu czasu zadań o niemal 30% w niektórych badaniach — odbywa się bezpośrednim kosztem retencji wiedzy. W miarę jak modele LLM będą coraz bardziej integrowane z profesjonalnymi procesami pracy, przepaść między tymi, którzy używają AI do rozszerzania swoich umiejętności, a tymi, którzy używają jej do zastępowania własnego myślenia, stanie się kluczowym podziałem na przyszłym rynku pracy.

Kluczowe wnioski

  • Luka wydajnościowa: Wysokie oceny z zadań wykonywanych bez nadzoru, do których dostęp ma AI, stają się niewiarygodnym miernikiem rzeczywistych kompetencji studentów.
  • Substytucja poznawcza: Badania pokazują, że choć AI zwiększa szybkość wykonywania prac domowych i podnosi oceny, koreluje to ze spadkiem wyników egzaminów o 20% oraz gorszą długoterminową retencją wiedzy.
  • Potrzeba nowych modeli oceniania: Przejście w stronę egzaminów nadzorowanych, stacjonarnych lub wysoce specjalistycznych staje się konieczne, aby odróżnić wyniki wygenerowane przez AI od rzeczywistej wiedzy eksperckiej człowieka.