Anthropic 的最新研究显示,依赖 AI 进行代码生成的开发者在概念理解测试中的得分低了 17%,而且在完成任务的速度上并不比依赖文档和网络搜索的同行更快。研究结果强调,虽然 AI 可以在几秒钟内生成可运行的代码,但它并不能降低对真正工程专业知识的需求成本。
为什么这项研究很重要
实验将开发者分为两组。一组可以不受限制地使用 AI 代码生成工具;另一组仅使用官方文档和网络搜索来解决相同的问题。任务完成后,参与者参加了一项旨在考察其对底层原理掌握程度的测试。AI 辅助组的平均得分落后了 17%,且两组在速度上都没有表现出明显的优势。
从实际角度来看,“氛围编程”(vibe coding)——即通过提示词让 AI 生成代码片段,而不进行深入检查就直接发布——并不能提高生产力。它只是掩盖了知识差距,而这种差距随后会演变成 Bug、维护难题或昂贵的重写工作。
数据背后的背景
Anthropic 的研究表明,AI 的潜力尚未完全释放。那些在每一步都使用 AI 的参与者(复制粘贴建议、修改变量名并继续下一步)对问题领域的吸收最少。而将工具视为协作伙伴的开发者(提出精确、具体的问题,然后剖析返回的代码)则能保留更多的概念框架。
这种区别反映了行业内的一个更广泛的观察:提示词工程师可以在几分钟内写出一个函数,但随着复杂性的增加,系统工程师的移动速度会更快。他们能预见到哪些地方会出错,哪些地方无法扩展。他们的速度体现的是判断力,而非低效。
谁赢了,谁输了
保持判断力的工程师 理解架构、知道结构何时需要刚性或灵活性、并且能在不破坏系统的情况下重写组件的工程师,从长远来看能为组织节省资金。他们的技能组合可以防范隐藏的技术债,这种技术债通常伴随着那些看起来整洁但缺乏明确意图的 AI 生成代码。
提示词专家 那些将 AI 视为魔杖的人可以交付快速原型或解决孤立的 Bug。短期内,他们看起来很有生产力,但随着代码库的扩大,AI 生成的代码片段中隐藏的假设会变成负担。调试工作随后会变成对原始意图的搜寻,从而推高维护成本。
组织 过度依赖“仅限 AI”开发的业务面临更高的未来支出风险:在调试、重构以及让新工程师上手理解晦涩代码方面需要花费更多时间。将 AI 辅助与严谨的工程实践相结合的公司,在保持长期稳定性的同时,能够获得速度上的收益。
大多数报告忽略的细节
- 学习影响:17% 的差距是在一项测试理解力而非仅仅是语法记忆的测验中测得的。这表明了认知模型的真实侵蚀,而非表层知识的缺失。
- 任务完成时间:尽管即时生成代码极具诱惑力,但研究发现,两组完成任务所需的时间在统计学上没有显著差异。速度上的提升只是错觉。
- 方法至关重要:研究强调了 AI 使用方式的光谱。纯粹依赖 AI 的学习效果最差,而选择性、探究式的提示词使用则能产生更好的结果。那些宣称“AI 让编程更快”的标题往往忽略了这一细微差别。
反论:AI 并非毫无用处
研究并未否定 AI 的特定用途;它只是警告不要将其推广到整个软件开发过程。当问题涉及系统设计、性能调优或安全考量时,人类的判断力仍然是不可或缺的。
总结
AI 可以给你一块滑板,但如果没有刹车和转向知识,当道路转弯时你就会摔倒。这项技术降低了编写代码的门槛,但稀缺的依然是那些能够对系统进行推理、预见失败并在软件增长过程中保持其生命力的工程师。投资于这种判断力,而不是寄希望于提示词能取代它,才是控制长期成本的最明智方式。
