聊天机器人的第一个草稿大约在两年前出现在老师的收件箱里,而自那以后,情况只会不断加速。现在,学生可以让 ChatGPT 就大萧条的原因或《了不起的盖茨比》中的象征意义写五段话,并且在削铅笔的时间内就能得到一个连贯的回答。对于教育工作者来说,这改变了学术诚信的本质。他们不再仅仅寻找传统的剽窃行为(即一个人抄袭另一个人的作品),他们还在寻找“合成文本”——即听起来像人类,但由一个没有理解力、没有记忆、也不对论点负责的模型组装而成的文本。

当语调突然转变时

老师们每个学期都要阅读数百篇学生论文。随着时间的推移,他们会对每个人的语调产生一种直觉。他们会注意到习惯性的逗号误用、惯用短语,以及某个特定学生构建结论的方式。当一篇论文的语气与他们预期的完全不同时,就会引发更仔细的审查。

这并不是为了惩罚进步。优秀的老师以看到学生的成长为乐。但在语法稳步提高的学生与提交一篇读起来像精炼法律简报的学生之间,是存在区别的——尤其是如果该学生在经历了八个月笨拙、简单的句子之后突然写出这样的文章。文字可能无懈可击,但由于缺乏实践积累的痕迹,它读起来感觉像是借来的。这种突然且毫无支撑的水平跃升,往往是第一个线索。

专业的外表,空洞的核心

AI 生成的写作往往处于一种“正确性的恐怖谷”之中。语法是正确的,过渡很流畅。然而,文本只是浮于材料表面,而不是深入挖掘。老师们经常将这种特质描述为“专业但平庸”。

以一篇关于《罗密欧与朱丽叶》的文章为例。一个学生作者可能会专注于墨丘西奥这个次要角色,以一种有趣的方式误读某个场景,或者将家族恩怨与他们自己社区的冲突进行比较。其论点可能并不完美,但它无疑是一个大脑在与文本博弈时产生的产物。相比之下,AI 草稿通常只是准确地总结情节,列出三个普遍主题,并得出“爱需要牺牲”的结论。它很正确,但也非常空洞。这种风险的缺失——没有古怪的观点,没有瑕疵但真实的见解——是判断作者并非学生最可靠的指标之一。

指向虚无的参考文献

另一个危险信号是“幻觉引用”。ChatGPT 和类似的工具偶尔会虚构书籍、期刊文章甚至作者。这些条目看起来很真实,配有听起来很学术的标题、出版商名称和出版年份,但它们与现实毫无关系。

资深教师会核实来源。他们会将标题输入 Google Scholar,搜索校园图书馆数据库,或者干脆在搜索引擎中查找作者姓名。当每一个引用都指向死胡同时,论文的可信度就会崩塌。检查参考文献一直都是严肃研究教学的一部分,但现在即使是简短的分析性论文,这也在成为一种标准做法。引用文献页不再仅仅是一项格式练习,它已成为一个诚信检查点。

检测软件的局限性

许多学区通过授权使用 AI 检测工具来应对合成文本的激增。这些程序通过扫描统计模式——如低困惑度、可预测的句子结构、重复的节奏——来识别机器生成的散文。它们可能有用。高概率得分可以给教师提供更仔细查看的理由。

但教师们知道这些工具并不完美。它们有时会产生误报,特别是针对非英语母语者或天生倾向于使用正式、稳重风格的学生。检测百分比本身绝不应被视为作弊的证据。大多数教育工作者将该软件视为众多线索之一,而非铁证。工具是辅助人类判断的,它无法取代人类。

没有思考者的分析

大语言模型擅长总结事实。它们难以提供的是持续的批判性思维或真实的个人反思。

例如,在历史作业中,AI 可能会以教科书般的精准度列出革命的经济、政治和社会原因。它难以做到的,是权衡这些原因之间的轻重缓急、挑战主流叙事,或者将该事件与学生真正关心的当代问题联系起来。人类作者会通过细节的独特性显露身份。他们会提到看过的纪录片、与父母的谈话,或者在三个不同单元中发现的某种规律。AI 生成的文本很少包含这些“锚点”,因为机器没有可以借鉴的经验,也没有需要捍卫的观点。

五分钟谈话

最古老的方法之一依然是最有效的:让学生谈谈他们的作品。

老师可能会在……期间把学生拉到一边