Claude 的自主蛋白质结合剂研发项目实现了 27% 的命中率,超过了人类实验室通常的 10-15%,也优于针对同一靶点的并行人类研究。这一结果表明,一个规模庞大且精心设计的提示词(prompt)可以将语言模型转变为虚拟的生物技术工作流,但也凸显了当模型的置信度指标出现偏差时,这种方法的脆弱性。

数据层面的实验结果

Anthropic 为其 Claude 模型提供了一套完整的蛋白质设计方案和固定的 GPU 预算,然后让它针对 16 个蛋白质靶点进行端到端的研发。由于实验室端的一次失败,其中一个靶点被放弃,剩余 15 个可行的研发项目。Claude 从中生成了 1,320 个候选序列;实验室测试证实其中 354 个为真实的结合剂,成功率为 26.8%。

作为对比,大多数由人类主导的结合剂项目报告的命中率在 10% 到 15% 之间。在针对 RBX1 靶点的直接对决中,人类参与者的命中率为 3.7%,而 Claude 的设计命中率达到了 31.1%。该模型还证明了其自我排序的能力:Claude 标记为最佳的单个设计成功率为 49%,而前十名设计的成功率为 39%。

系统的不足之处

这些数字掩盖了两个明显的盲点。Claude 在 MBP 靶点上完全失败,在 TNFα 靶点上的表现也很差,但其内部置信度评分在这些运行中却保持在高位。换句话说,尽管湿实验的结果显示情况并非如此,模型却深信自己正在取得成功。这些失准的信号暴露了一种风险:一个信任自身指标的自主流水线可能会在死胡同实验上浪费资源。

提示工程:新型实验记录本

这项研究最引人注目的方面并非生物学,而是驱动它的提示词。资深科学家通常需要数周时间来决定探索哪些蛋白质区域、调用哪些计算工具以及如何分配计算时间。Anthropic 将这些专业知识压缩进了一个 16,000 字的提示词中——长度大约相当于一部短篇小说。其中约三分之二的内容涉及操作层面的问题:时间安排、预算监控以及协调调用外部软件的子代理(sub-agents)。

Claude 调用了开源设计引擎,例如 RFdiffusion(一种基于扩散模型的结构生成器)和 ProteinMPNN(一种序列设计网络)。语言模型充当了调度器的角色,在这些工具之间传递中间结果、调整参数,并决定何时停止设计周期。实际上,这个提示词变成了一位虚拟的实验室经理,将人类科学家从繁琐的工作流协调中解放出来。

结合剂究竟是什么

所有 354 个确认的命中项都是能物理性附着在其靶点蛋白质上的分子。论文报告了结合实验,但未提供功能性数据——没有证据表明任何结合剂能调节活性、稳定构象或表现出治疗潜力。同样,由于缺乏结构验证(例如 X 射线晶体学或冷冻电镜),确切的结合模式仍处于推测阶段。因此,该研发项目展示的是快速发现结合剂的概念验证,而非能够交付候选药物的流水线。

生物技术与 AI 研究的利害关系

如果这种提示词驱动的模型能够可靠地复制或超过人类的命中率,生物技术公司可能会大幅降低早期研发的成本和时间。然而,在 MBP 和 TNFα 上的置信度评分失准说明,一个完全无需人工干预的系统尚未准备好投入生产。公司仍需要人类监督来解读置信度指标并验证功能相关性。

从 AI 的角度来看,这项工作模糊了“工具”与“智能体(agent)”之间的界限。Claude 并不是一种新的蛋白质设计算法;它是一个通用语言模型,在获得足够详细的指令集时,可以编排现有的专业工具。该实验预示着这样一个未来:AI 将作为“胶水”,将开源科学软件的模块化生态系统粘合在一起,而不是取代任何单一组件。

反方观点:提示词复杂性的隐藏成本

虽然这项研究将 16,000 字的提示词赞誉为知识捕获的胜利,但提示词本身的规模也引发了实际层面的担忧。编写这样一份文档需要深厚的领域专业知识、对底层工具的熟悉程度以及预判边缘情况的能力。换句话说,专业知识并未消失——它只是从实验台科学家转移到了提示工程师手中。

此外,对固定 GPU 预算的依赖为探索深度引入了硬约束。人类团队可以根据中期结果动态地重新分配资源,而 Claude 的实验则遵循预设预算,这可能会限制所采样序列空间的广度。

后续关注点

Anthropic 的论文留下了几个开放性问题。未来的工作需要解决置信度校准问题,使模型的自我评估与实验结果保持一致。将功能测定(例如酶抑制或细胞活性)整合到自主循环中,将使该技术更接近药物研发,而不仅仅是结合剂识别。最后,在更广泛的目标集和不同的预算条件下对该方法进行基准测试,将揭示所观察到的命中率是可复现的,还是一个异常值。

核心启示很明确:详细的提示词编排可以将语言模型转变为虚拟生物技术实验室,提供超过人类平均水平的结合剂命中率。然而,这种方法仍然取决于专家级的提示词编写,并且存在置信度误判的问题,这可能会使昂贵的实验脱轨。随着社区不断完善这些流程,AI 自主性与人类监督之间的平衡将决定此类系统是成为常规工具,还是仅仅作为实验性的新奇事物存在。