研究人员宣布了一种名为 Ring-Zero 的新型强化学习框架,它能让万亿参数规模的语言模型在保持 token 预算限制的同时学习推理,该模型在 2026 年 AIME 数学考试中取得了 84.2% 的成绩。这一结果表明,在这一规模下,模型可以习得工程师传统上通过提示词(prompts)硬编码进来的逐步解决问题的习惯。

为什么这很重要

AIME 级别的表现长期以来一直是“人类水平”定量推理的基准。在没有任何人工编写示例的情况下达到 84.2% 的水平,表明模型的推理能力源于训练动态本身,而非人工构建的脚手架。对于构建 AI Agent 的公司来说,其意义显而易见:编写和维护复杂的提示词配方可能会被一种训练循环所取代

后续关注点

AI 从业者的实践要点

  • 不要将提示词视为唯一的杠杆 – 思考一下,你正在通过提示词编写的行为,是否可以通过奖励驱动的训练循环(reward-driven training loop)来学习。
  • 将 Token 使用量视为一级目标 – 尽早加入预算感知信号;模型将学会平衡准确性与计算成本。
  • 闭合反馈循环 – 部署一个能够自动提供任务、根据可验证答案衡量结果,并将结果反馈回训练过程的系统。在这个循环中,模型会发现属于自己的工作流。

当奖励目标明确且环境能够可靠地衡量成功时,扩大模型规模不仅仅是增加原始容量——它还在教模型如何选择思考方式。这种从手动编写脚手架(scaffolding)到自主推理的转变,可能会重塑我们构建和为 AI Agent 定价的方式。