Claude Opus 5 在相同工作负载下的成本现在是 Opus 4.8 的三倍,尽管两款模型的每 token 标价相同。罪魁祸首是默认的 “adaptive thinking” 功能,它会悄无声息地将输出 token 作为隐藏推理进行消耗。关闭该功能可以在不损害准确性的情况下恢复成本持平。

价格差距出现的原因

两者的收费标准均为每百万输入 token 5 美元,每百万输出 token 25 美元。在我们的基准测试中,运行相同的提示词时,Opus 5 的账单比 Opus 4.8 高出 3.1 倍。额外的费用并非来自更高的标价,而是内置于 Opus 5 对其内部思考过程的计算方式中。

adaptive thinking 的作用

当启用 adaptive thinking 时,模型在输出最终答案之前会进行额外的内部推理。这些推理会被计入输出 token,即使它们从未传递给用户。在简单的查询中,计费的输出 token 中有 42% 到 95% 是这种隐藏推理。因此,一个本应产生个位数答案的简单算术题可能会生成数十个不可见的 token,从而大幅推高成本。

该功能并非 bug——Claude 的设计者旨在通过它提高复杂任务的回答质量。在实践中,隐藏推理在处理难题时通常能带来适度的准确度提升,尤其是在模型必须进行多步链式推理或与外部工具交互时。

如何控制成本

模型接受一个用于禁用 adaptive thinking 的参数:

{
  "thinking": {"type": "disabled"}
}

将此设置应用于 Opus 5,可以将其单次任务的费用降低到与 Opus 4.8 完全相同的水平,同时在我们测试的简单工作负载中,结果的正确性保持不变。

何时禁用

  • 从文本中提取数据
  • 格式化操作(例如 JSON 转换)
  • 答案为直接查询或简单计算的单步调用

在这些情况下禁用思考功能可以消除“隐藏 token 税”,并使账单更具可预测性。

何时保持开启

  • 需要深度逻辑链或细微推理的任务
  • 反复调用外部工具的 Agent 工作流

在工具密集型场景中,成本差距会缩小到约 33%,因为模型在循环调用工具时,用于内部推理的开销较少。

其他值得注意的区别

  • Context window(上下文窗口):Opus 5 可容纳高达一百万个 token,我们通过检索放置在第 969,950 个 token 处的目标字符串验证了这一点。
  • Cache floor(缓存下限):最小缓存大小降至 512 个 token,是 Opus 4.8 下限的一半,这会影响模型在无需重新进行 token 化的情况下可以复用多少之前的对话。

后续关注点

开发者应监控使用报告中的 “reasoning tokens” 或类似的条目,以判断 adaptive thinking 是否处于激活状态。随着越来越多的应用采用 Claude 进行 Agent 式操作,成本与质量之间的权衡将成为关键的优化决策。未来的更新可能会允许用户调节推理深度,而不是采用“全开或全关”的开关,这可能会使成本曲线更加平滑。

核心结论: Opus 5 默认的 adaptive thinking 会在简单任务上推高 token 使用量。使用上述简单设置将其禁用,以匹配 Opus 4.8 的成本,并且仅在额外的推理能够证明其额外支出是值得的时才开启它。