AI 表现差距:为何监考考试能揭示真相
大语言模型 (LLMs) 在学术界的快速整合创造了一种掌握知识的虚假幻象,高作业分数掩盖了实际理解能力的严重匮乏。布朗大学最近的一个案例凸显了这种日益增长的“表现差距”,为过度依赖生成式 AI 所带来的长期认知风险敲响了警钟。
布朗大学案例研究:48% 的现实冲击
布朗大学经济学教授 Roberto Serrano 最近目睹了学生成绩的剧烈下滑,这暴露了普遍存在的 AI 依赖问题。在一次课后期中考试中,他 86 名学生的班级平均分达到了惊人的 96%——这一数字显著高于 65% 到 80% 的历史常态。
当 Serrano 将考试题目输入 ChatGPT 并得到几乎相同的答案时,他的怀疑得到了证实。最值得注意的是,许多学生使用了 ChatGPT 偏好的复杂数学证明,而不是人类学生通常会采用的更直观、更直接的方法。
为了验证他的发现,Serrano 转而采用了监考式的线下期末考试。结果是灾难性的:班级平均分骤降至 48.6%,创下该课程历史最低纪录。有 19 名学生直接不及格,课后考试与线下考试之间的分差证明了之前的优异成绩在很大程度上是虚假的。
全球趋势:AI 使用与认知能力下降的相关性
布朗大学的事件并非孤立的异常现象,而是更广泛且有据可查的趋势的一部分。两项重大研究为 AI 工具如何影响学习成果提供了定量证据:
- 中国研究: 一项追踪 7 至 12 年级 26,000 名学生的纵向研究发现,在采用 AI 后,作业分数提高了 18%,而完成时间从 64 分钟降至 45 分钟。然而,考试分数下降了 20%。在长期情景下,入学考试的表现下降了多达 24%,其中表现最优秀的学生受到的冲击最大。
- 加州大学伯克利分校/德克萨斯研究: 对德克萨斯州一所大型研究型大学超过 500,000 个成绩的分析显示,在具有大量写作和编程内容的课程中,ChatGPT 发布后,“A”级成绩的比例跃升了 13 个百分点。这种成绩通胀在无人监管的家庭作业中最为集中。
AI 与教育的更广泛影响
对于开发者和教育工作者来说,这些发现代表了“人机协作”辩论中的一个关键转折点。虽然 AI 是强大的生产力倍增器,但数据表明,它目前可能充当了一种“认知拐杖”,绕过了深度学习所必需的思考磨炼过程。
在作业完成方面获得的“效率”——如某些研究中看到的任务时间缩短近 30%——是以知识留存度的直接损失为代价的。随着 LLMs 更加深入地融入专业工作流,那些利用 AI 来增强技能的人与那些利用 AI 来取代思考的人之间的差距,将成为未来劳动力市场的决定性分水岭。
核心要点
- 表现差距: 在无人监管、可使用 AI 的作业中获得的高分,正逐渐成为衡量学生实际能力的不可靠指标。
- 认知替代: 研究表明,虽然 AI 提高了作业速度和分数,但它与考试成绩和长期知识留存度下降 20% 相关。
- 对新评估模式的需求: 为了区分 AI 生成的内容与人类专业知识,转向监考式、线下或高度专业化的评估正变得势在必行。
