Claude Fable 5 在单次开发会话中,将一条四年前的推文变成了一个可玩的 3D 浏览器游戏,并且在没有任何人工选择技术栈或设计输入的情况下完成了大部分繁重的工作。

Simon Willison 向模型提供了推文的简短描述、一张截图和两张辅助图像。仅凭这些简单的提示,Claude Fable 5 就编写了整个代码库,选择了 Three.js 作为 3D 引擎,通过 OpenAI 模型生成了游戏纹理,并将每次更改推送到 GitHub 仓库。该仓库已连接到 GitHub Pages,因此每次提交都会在约半分钟内出现在实时 URL 中。其结果是一款功能完备的 “Raccoon Heist” 游戏,任何人现在都可以在浏览器中游玩。

实验过程

  • 极简提示 – 2022 年的原推文列出了游戏概念并展示了一张截图。Willison 额外添加了两张参考图和几行文字。他没有提供任何关于编程语言、图形库或部署的指令。
  • 模型驱动决策 – Claude Fable 5 选择 Three.js(一个用于 3D 图形的 JavaScript 库)作为渲染引擎。它编写了运行游戏所需的 HTML、JavaScript 和资源加载代码。
  • AI 生成资产 – 一个 OpenAI 模型生成了纹理图像,从而无需设计师参与。
  • 持续交付 – 每次代码推送都会触发 GitHub Pages 重新构建网站,使最新版本在 30 秒内可见。Willison 实时观察着游戏的演变,从一片空白到完全可玩的原型。

为什么这很重要

传统的 AI 编程助手在开发者提供详细规格说明时,主要用于代码自动补全、错误修复建议或代码片段生成。Claude Fable 5 则跨越了界限:它接受了一个高层目标,选择了实现技术栈,生成了资产,并交付了一个上线产品——而这一切都不需要进一步的人工指导。

虽然像 SWE-bench 这样的基准测试可以衡量模型解决编程问题的能力,但观察模型自主构建端到端交互体验则展示了另一种能力。对于快速原型设计而言,这一工作流证明了开发者只需向模型提供一个概念和少量资产,指定一个部署目标,即可在几分钟内获得一个可用的演示版本。

谁将受益,谁可能被落下

  • 初创公司和独立开发者可以迭代游戏创意或 UI 概念,而无需聘请完整的工程团队。
  • 产品团队可能会使用这种方法为内部评审生成概念验证(PoC)功能。
  • 工具供应商(提供 AI 驱动代码生成的供应商)可能会看到需求转向更高层级的编排功能——即允许模型选择框架并管理 CI/CD 流水线。

相反,专注于架构决策、性能调优或美术指导的开发者可能会发现,那些最显眼、复杂度较低的任务正日益自动化。模型的自主性也引发了关于代码质量、安全性和 AI 生成资产许可的问题——这些问题仍需要人工监督。

当前演示的局限性

  • 规模 – 该游戏只是一个简单的 3D 原型;将这种方法扩展到大型、数据密集型应用仍未得到证实。
  • 人工脚手架 – Willison 设置了 GitHub Pages 流水线并监控模型的输出。一个完全无需人工干预的系统需要具备检测构建失败或不安全代码的机制。
  • 资产保真度 – AI 生成的纹理适用于简单游戏,但对于要求照片级真实感或特定品牌艺术风格的高预算制作来说,可能力有不逮。

下一步值得关注的方向

  • 工具集成 – 预计大语言模型与云构建服务之间的耦合会更加紧密,从而减少 Willison 所执行的手动步骤。
  • 安全层 – 平台可能会增加自动代码审查或沙箱机制,以便在部署前发现安全漏洞。
  • 基准测试演进 – 测试端到端产品交付能力的新型评估套件可能会补充现有的代码补全指标。

结论很明确:当给定一个简洁的目标和一些素材时,AI 现在可以从“编写这个函数”进化到“构建并交付一个完整的、可运行的产品”。这项技术仍处于早期阶段,但 Claude Fable 5 的演示预示着这样一个未来:许多软件构思的第一稿将由自主生成,从而让开发者能够专注于完善、策略和创意。