Розрив у продуктивності ШІ: чому прокторизовані іспити розкривають правду
Стрімка інтеграція великих мовних моделей (LLM) в академічне середовище створила оманливу ілюзію майстерності, коли високі бали за завдання приховують глибоку відсутність реального розуміння. Недавній випадок в Університеті Брауна підсвітив цей зростаючий «розрив у продуктивності», ставши суворим попередженням про довгострокові когнітивні ризики надмірної залежності від генеративного ШІ.
Кейс-стаді Університету Брауна: перевірка реальністю на 48%
Роберто Серрано, професор економіки в Університеті Брауна, нещодавно став свідком драматичного падіння успішності студентів, що виявило повсюдну залежність від ШІ. Під час проміжного іспиту, який виконувався вдома, його група з 86 студентів продемонструвала приголомшливий середній бал — 96%, що значно перевищує історичну норму в 65–80%.
Підозри Серрано підтвердилися, коли він прогнав екзаменаційні запитання через ChatGPT і отримав майже ідентичні результати. Найбільш примітно те, що багато студентів використовували заплутане математичне доведення, яке надавав перевагу ChatGPT, замість більш інтуїтивного та прямого підходу, який зазвичай очікується від людей.
Щоб підтвердити свої висновки, Серрано перейшов до підсумкового іспиту з прокторингом (особистою присутністю). Результати були катастрофічними: середній бал групи впав до 48,6%, що стало найнижчим показником в історії курсу. Дев'ятнадцять студентів провалили іспит повністю, а розбіжність між балами за домашній та очний іспити довела, що попередні високі оцінки були здебільшого штучними.
Глобальні тренди: кореляція між використанням ШІ та когнітивним занепадом
Інцидент у Брауні — це не поодинока аномалія, а частина ширшого, задокументованого тренду. Два великих дослідження надають кількісні докази того, як інструменти ШІ впливають на результати навчання:
- Дослідження в Китаї: Лонгітюдне дослідження 26 000 учнів з 7 по 12 класи виявило, що після впровадження ШІ оцінки за домашні завдання зросли на 18%, тоді як час їх виконання скоротився з 64 до 45 хвилин. Проте результати іспитів впали на 20%. У довгостроковій перспективі успішність на вступних іспитах знизилася на цілих 24%, причому найсильніше постраждали найкращі учні.
- Дослідження UC Berkeley/Texas: Аналіз понад 500 000 оцінок у великому дослідницькому університеті Техасу показав, що на курсах із великим обсягом письмових та програмістських завдань частка оцінок «A» підскочила на 13 відсоткових пунктів після запуску ChatGPT. Ця інфляція оцінок була найбільш помітною в домашніх завданнях, що виконувалися без нагляду.
Ширші наслідки для ШІ та освіти
Для розробників та освітян ці висновки є критичною точкою перелому в дискусії про «співпрацю людини та ШІ». Хоча ШІ виступає потужним множником продуктивності, дані свідчать про те, що наразі він може функціонувати як «когнітивна милиця», що дозволяє оминати зусилля, необхідні для глибокого навчання.
«Ефективність», здобута завдяки виконанню домашніх завдань — що проявляється у скороченні часу на завдання майже на 30% у деяких дослідженнях — досягається безпосередньо за рахунок засвоєння знань. Оскільки LLM стають дедалі більше інтегрованими в професійні робочі процеси, розрив між тими, хто використовує ШІ для розширення своїх навичок, і тими, хто використовує його для заміни власного мислення, стане визначальним поділом на ринку праці майбутнього.
Основні висновки
- Розрив у продуктивності: Високі оцінки за завданнями, що виконуються без нагляду та доступні для використання ШІ, стають ненадійними показниками реальної компетентності студентів.
- Когнітивне заміщення: Дослідження показують, що хоча ШІ підвищує швидкість виконання домашніх завдань та оцінки, це корелює з 20-відсотковим падінням успішності на іспитах та довгостроковим погіршенням засвоєння знань.
- Необхідність нових моделей оцінювання: Перехід до прокторизованих, очних або високоспеціалізованих методів оцінювання стає необхідним, щоб розрізняти результати, створені ШІ, та людську експертизу.
