Anthropic 于 7 月 24 日推出了 Claude Opus 5,在保持 Opus 4.8 价格不变的同时,将上下文窗口扩展到了 100 万 token。构建自动化工作流的开发者应当关注:此次更新增加了努力程度控制(effort-level controls)、强制性的“思考”(thinking)阶段、针对短提示词的提示词缓存(prompt caching),以及在对话中途切换工具的能力——这些功能可能会重塑集成模式和成本结构。

此次升级的重要性

Opus 5 声称其智能水平可与“Fable 5”基准测试相媲美,而成本仅为一半。在实际应用中,该模型可以处理高达 100 万 token 的输入,并输出高达 12.8 万 token,且不会增加费用。

面向开发者的新型调节功能

努力程度控制 (Effort-level controls)

模型默认设置为“high”努力程度,但提供了五个层级:low、medium、high、xhigh 和 max。每个层级都在计算时间和成本与回答质量之间进行权衡。开发者可以从 high 级别开始任务,如果任务证明比较简单,可以降到较低层级;或者在遇到难题时提升到 xhigh/max。

强制思考模式 (Mandatory thinking mode)

Claude 现在会在输出任何内容之前运行一个“思考”(thinking)阶段。对于两个最高努力程度层级(xhigh、max),该阶段是强制性的,且无法关闭。

针对 512-token 提示词的提示词缓存

提示词缓存现在适用于低至 512 token 的提示词。

对话中途工具切换 (beta)

一项 beta 功能允许正在进行的 Claude 会话更改其调用的外部工具——例如,在不重启对话的情况下,将网络搜索模块更换为数据库查询。

对集成工作流的影响

新增的控制功能为工程师提供了更精细的成本和性能粒度,但也引入了新的故障模式。在 xhigh/max 模式下强制进行思考,意味着任何禁用内部推理的现有代码现在都会报错。对话中途工具切换仍处于 beta 阶段,因此稳定性无法得到保证。

反向观点

Anthropic 保持了价格不变,但较高的努力程度层级会消耗更多的计算资源。

后续关注点

  • “fast mode”预览版的更新,该模式承诺为研究工作负载提供更低的延迟,但尚未全面开放。

对于那些运行无人值守 Claude 流水线的开发者来说,Opus 5 提供了一个工具箱,可以从每一美元中榨取更多的智能——前提是他们需要调整代码以适应思考阶段,并测试新的缓存和工具切换路径。