Разрыв в производительности ИИ: почему прокторинг выявляет правду
Стремительная интеграция больших языковых моделей (LLM) в академическую среду создала обманчивую иллюзию мастерства, когда высокие баллы за задания маскируют глубокое отсутствие реального понимания. Недавний случай в Университете Брауна высветил этот растущий «разрыв в производительности», став суровым предупреждением о долгосрочных когнитивных рисках чрезмерной зависимости от генеративного ИИ.
Кейс Университета Брауна: проверка реальностью на 48%
Роберто Серрано, профессор экономики в Университете Брауна, недавно стал свидетелем резкого падения успеваемости студентов, которое выявило повсеместную зависимость от ИИ. Во время промежуточного экзамена на дому группа из 86 студентов показала ошеломляющий средний балл — 96%, что значительно выше исторической нормы в 65–80%.
Подозрения Серрано подтвердились, когда он прогнал экзаменационные вопросы через ChatGPT и получил почти идентичные результаты. Что наиболее примечательно, многие студенты использовали запутанное математическое доказательство, которое предпочитал ChatGPT, вместо более интуитивного и прямого подхода, который обычно ожидается от людей.
Чтобы подтвердить свои выводы, Серрано перешел к очному финальному экзамену под наблюдением (прокторингом). Результаты оказались катастрофическими: средний балл группы упал до 48,6% — самого низкого показателя в истории курса. Девятнадцать студентов полностью провалили экзамен, а разрыв между результатами домашних и очных работ доказал, что предыдущие высокие баллы были по большей части искусственными.
Глобальные тренды: корреляция между использованием ИИ и когнитивным спадом
Инцидент в Брауне — это не единичная аномалия, а часть более широкой, документально подтвержденной тенденции. Два крупных исследования предоставляют количественные доказательства того, как инструменты ИИ влияют на результаты обучения:
- Исследование в Китае: Лонгитюдное исследование, охватившее 26 000 учащихся с 7 по 12 классы, показало, что после внедрения ИИ баллы за домашние задания выросли на 18%, а время их выполнения сократилось с 64 до 45 минут. Однако баллы за экзамены упали на 20%. В долгосрочной перспективе результаты вступительных экзаменов снизились на целых 24%, причем сильнее всего пострадали наиболее успешные ученики.
- Исследование UC Berkeley/Техас: Анализ более 500 000 оценок в крупном исследовательском университете Техаса показал, что в курсах с большим объемом письменных работ и программирования доля оценок «A» подскочила на 13 процентных пунктов после запуска ChatGPT. Эта инфляция оценок была наиболее выражена в домашних заданиях, выполняемых без контроля.
Более широкие последствия для ИИ и образования
Для разработчиков и преподавателей эти результаты представляют собой критическую точку перелома в дискуссии о «сотрудничестве человека и ИИ». Хотя ИИ выступает в роли мощного множителя продуктивности, данные свидетельствуют о том, что в настоящее время он может функционировать как «когнитивный костыль», позволяющий избегать усилий, необходимых для глубокого обучения.
«Эффективность», достигнутая при выполнении домашних заданий — выраженная в сокращении времени выполнения задач почти на 30% в некоторых исследованиях — достигается за счет прямого ущерба для удержания знаний. По мере того как LLM будут все глубже интегрироваться в профессиональные рабочие процессы, разрыв между теми, кто использует ИИ для расширения своих навыков, и теми, кто использует его для замены собственного мышления, станет определяющим разделением на рынке труда будущего.
Основные выводы
- Разрыв в производительности: Высокие баллы за задания, выполняемые без контроля и доступные с помощью ИИ, становятся ненадежным показателем реальной компетентности студентов.
- Когнитивное замещение: Исследования показывают, что, хотя ИИ повышает скорость выполнения домашних заданий и баллы, это коррелирует с 20-процентным падением успеваемости на экзаменах и долгосрочного удержания знаний.
- Необходимость новых моделей оценки: Переход к прокторингу, очным или узкоспециализированным методам оценки становится необходимым, чтобы отличить результаты, созданные ИИ, от человеческой экспертизы.
