研究者たちは、Ring-Zeroと呼ばれる新しい強化学習フレームワークを発表しました。これにより、1兆パラメータの言語モデルがトークン予算の制限内で推論方法を学習できるようになり、モデルは2026年AIME数学試験で84.2%のスコアを記録しました。この結果は、この規模において、モデルが従来エンジニアがプロンプトにハードコードしてきた段階的な問題解決の習慣を習得できることを示しています。

なぜ重要なのか

AIMEレベルのパフォーマンスは、長らく「人間レベル」の定量的推論のベンチマークとなってきました。人間が書いた例示を一切使わずに84.2%の範囲に達したことは、モデルの推論能力が手作りの足場(scaffolds)からではなく、トレーニングのダイナミクスそのものから立ち上がっていることを示唆しています。AIエージェントを構築している企業にとって、その意味するところは明確です。精巧なプロンプトのレシピを記述・維持する作業は、モデルに対して「いつ深く考えるべきか」「いつ安価なショートカットで十分か」を教えるトレーニングループに置き換えられる可能性があるのです。

プロンプトエンジニアリングからトレーニングダイナミクスへ

長年、開発者は大規模言語モデルに多段階の推論を行わせるために、「問題を部分に分解する」や「回答を検証する」といったプロンプトテンプレートに頼ってきました。これらのテンプレートは外部的な足場として機能しますが、モデルは指示に従うだけで、そのプロセスを内面化しているわけではありません。Ring-Zeroはこのパラダイムを覆します。モデルはタスクの説明とともに、検証可能な回答(verifiable answer)、つまり自動的にチェック可能な正解(ground-truth)を受け取ります。その後、一連の試行を生成し、その試行が検証可能な回答と一致した場合にのみ報酬を受け取り、強化学習を通じてポリシーを更新します。

報酬が(単に妥当であるだけでなく、正解でなければならないという)欺瞞の難しい客観的な目標に結びついているため、モデルは自律的に推論パターンを発見します。論文では、信頼できる報酬信号が確立されれば、モデルを1兆パラメータまでスケールアップすることで、エンジニアが小規模なモデルに対して手動で挿入してきたようなプロンプトエンジニアリングのテクニックが自動的に表面化すると主張しています。

4段階のトレーニングパイプライン

Ring-Zeroのトレーニングは、以下の4つの明確なステージを経て進行します。

  1. First-stage RL – モデルは可能な推論の軌跡(reasoning traces)を探索し、どのトークンシーケンスが正解につながりやすいかを学習します。
  2. Self-distillation – 高品質な軌跡がモデルにフィードバックされ、立ち上がりつつある推論パターンを安定させます。
  3. Second-stage RL – よりきめ細かなループによって、以前の改善を維持しながらポリシーを洗練させます。
  4. Tiered training – モデルはトークン予算をインテリジェントに割り当てることを学習し、問題の難易度に応じて短い推論パス(約2kトークン)と長い推論パス(約20kトークン)を使い分けます。

Tiered training(階層型トレーニング)は、実運用において最も関連性の高い部分です。実際のデプロイメントでは、トークンが追加されるごとに計算コストが増加します。問題が短い回答で済むほど単純なのか、それとも深く多段階の分析を要するものなのかをモデルに認識させることで、Ring-Zeroは推論の質を経済的な効率性に直接結びつけています。

学習の2つのフェーズ:発見と研磨

著者らは学習曲線について、以下の2つのフェーズからなるプロセスであると説明しています。

  • Discovery(発見) – 初期の強化学習ステップはノイズが多く、モデルは多種多様な戦略を試しますが、その多くは失敗に終わります。この分散(variance)は、新しい推論経路を見つけ出すために不可欠です。
  • Sharpening(研磨) – 有望なパターンが現れると、後続のRLステップがポリシーを締め付け、分散を減少させて挙動を定着させます。

この進展は、人間が向上していく過程、つまり最初のブレインストーミングに続く集中した練習に似ています。重要な洞察は、「乱雑な」初期段階を抑制するのではなく、むしろ受け入れるべきであるということです。なぜなら、それが後の洗練のための原材料となるからです。

何が問題になり得るか?

論文の楽観的な見通しは、精査に値するいくつかの仮定に基づいています。

  • 報酬設計(Reward design) – フレームワークには、検証可能であり、かつショートカット(近道)に抵抗できる報酬が必要です。多くの実世界のタスクにおいて、そのような報酬を定義することは容易ではなく、コストのかかるアノテーション・パイプラインが必要になる可能性があります。
  • 環境のボトルネック(Environmental bottlenecks) – 著者らは、モデルのパフォーマンスを制限するのはモデルのサイズではなく、周囲の評価インフラ(テストスイート、ログ、明確なメトリクス)であると指摘しています。そのインフラを構築・維持するには、多大なエンジニアリングの労力が必要となる場合があります。
  • トレーニングの計算コスト(Compute cost of training) – 複数のRLステージを伴う1兆パラメータモデルのトレーニングは非常に高価です。Tiered trainingは推論コストを削減しますが、事前のトレーニング予算は依然として高く、この手法が資金力のある研究所に限定される可能性があります。

次に注目すべきこと

AI実務家への実践的なアドバイス

  • プロンプトを唯一の手段として扱わない – プロンプトに書き込もうとしている振る舞いが、報酬駆動型の学習ループを通じて習得できるものではないか、検討してください。
  • トークン使用量を主要な目的とする – 早い段階で予算を意識したシグナルを追加してください。そうすることで、モデルは精度と計算コストのバランスを取ることを学習します。
  • フィードバックループを閉じる – タスクを自動的に供給し、検証可能な回答に対して結果を測定し、その結果をトレーニングにフィードバックするシステムを導入してください。このループこそが、モデルが自身のワークフローを発見する場所となります。

報酬が明確であり、環境が成功を確実に測定できるとき、モデルをスケールアップさせることは、単に生の容量を増やすだけでなく、モデルに「考え方」を選択することを教えることになります。手書きの足場から自己主導型の推論へのこの転換は、AIエージェントの構築方法や価格設定のあり方を再定義する可能性があります。