OpenAIは、同社のGPT-5.6 SolモデルがARC-AGI-3論理ベンチマークで38.3%のスコアを記録し、AnthropicのClaude Opus 5の30.2%を上回ったと発表した。この主張は、同じモデルをベンチマークの公式テストハーネスで実行した際にわずか7.8%のスコアしか出なかったことから、即座に技術的な論争を巻き起こした。

なぜARC-AGI-3のスコアが重要なのか

ARC-AGI-3は、記憶されたパターンに頼るのではなく、全く新しい、推論重視の問題を解決するモデルの能力を調査するものである。研究者は、このスコアを「汎用知能(general-intelligence)」の進歩の指標として引用しており、10ポイントの差は人間のような問題解決に向けた実質的な進歩のように見える。それだけでも、なぜこのニュースがAIコミュニティに波紋を広げたのかを説明できる。

隠れたレバー:Retained ReasoningとCompaction

OpenAIは、公開されているテストハーネスを用いてGPT-5.6 Solを評価したわけではなかった。代わりに、独自のResponses APIを使用し、2つの独自のオプションを用いた。

  • Retained Reasoning – モデルの思考の連鎖(chain of thought)を複数のステップにわたって維持し、各ステップを個別に処理する際に発生する中間的な論理の喪失を防ぐ。
  • Compaction – 以前のコンテキストを切り捨てるのではなく圧縮することで、モデルがより長い要約された履歴を参照できるようにする。

これらの設定が有効な場合、モデルはより長い議論を構築し、以前の推論を再利用するため、多段階のタスクにおけるパフォーマンスが膨らむ。各アクションの後に推論を破棄する公式ハーネスでは、同じモデルのスコアは7.8%に急落し、Claude Opus 5を大きく下回る結果となった。

OpenAIは、ベンチマークは単なる生のニューラル重みではなく、推論パイプライン全体を測定すべきだと主張している。その観点からは、コンテキストを保持・圧縮するAPIロジックである「ラッパー(wrapper)」は、評価対象となるシステムの一部である。

公平性をめぐる論争

このベンチマークを主催するARC Prizeの共同創設者、François Cholletが意見を述べた。彼は、ベンチマークを「解く」ために構築されたカスタムハーネスと、あらゆるユーザーが有効にできる汎用的なAPI設定を区別した。Cholletは、オリジナルのARC Prizeのテスト環境では、現在AnthropicのClaude APIで利用可能な高度な機能が欠けていた、旧来のOpenAIスタイルのcompletions APIを使用していたと指摘した。この不一致が、以前のラウンドでOpenAIに不利に働いた可能性がある。

彼は、その比較が無効であると断定するまでには至らなかった。Cholletは、正確な設定と関連するコストが公開されているのであれば、直接対決の主張は引き続き受け入れ可能であると述べた。透明性があれば、その差がモデルのアーキテクチャによるものか、エンジニアリングのトリックによるものか、あるいはその両方によるものかをコミュニティが判断できると彼は主張した。

勝者と敗者

もし高いスコアがそのまま受け入れられれば、OpenAIは世論における評価を高め、企業向けライセンス交渉においてより強い交渉力を得ることになる。一方、Claudeのチームは、標準化されたハーネスにおける生のモデルのパフォーマンスを、追加のエンジニアリング層を取り除いた際に自社のアーキテクチャがいかに効率的であるかの証拠として示すことができる。

ベンチマークのランキングを投資の指針としている研究者や開発者は、この出来事に不安を感じるかもしれない。この事例は、モデルが大型化するにつれ、推論をオーケストレートするソフトウェアが決定的な要因になり得ることを示している。洗練された推論スタックを低い限界費用で提供できる企業は、優れた基盤モデルを持たずとも、ヘッドラインを飾るような高いスコアを独占できる可能性がある。

ARC-AGI-3およびその他のベンチマークの今後

この論争により、ARC Prizeの主催者は、許容される推論構成に関するより厳格なルールへと動かされる可能性が高い。考えられる対応策には以下が含まれる:

  • 公式ハーネスのみによるパフォーマンスを反映した「ベースライン」スコアの公開。
  • 追加設定のコスト分析の提出を参加者に義務付け、高いスコアを余分な計算リソースやエンジニアリングのオーバーヘッドと比較検討できるようにする。
  • コンテキスト管理機能の巧みな活用に報いる、別の「システムレベル」トラックの追加。

このような動きは、生のモデルの能力とエンジニアリングによる最適化を明確に分離させ、将来の主張をより比較しやすくすることになるだろう。

反論:ベンチマークは実世界の利用状況を反映すべきである

一方の側は、厳格な「生のモデルのみ」という見方は非現実的だと主張している。実運用において、開発者は日常的にキャッシュ、コンテキストの要約、その他のテクニックを言語モデルに重ね合わせている。もしベンチマークが実用的な有用性を予測することを目的としているならば、それらの最適化を許可、あるいは推奨すべきである。その観点からすれば、OpenAIのRetained ReasoningとCompactionは、公開されている限り、競合他社も採用可能な正当なツールである。

批判的な立場からは、共通のベースラインがなければスコアは流動的なものとなり、ベンチマークが客観的な尺度としての役割を損なうことになるとの反論があります。生態学的妥当性(実際の運用を反映させること)と方法論的な純粋性(モデルを単独で評価すること)の間の緊張が、現在の論争を加速させています。

要点

GPT-5.6 Solに関する主張は、AI評価における深刻化する分断、すなわちモデル本来の能力か、それを取り出すエンジニアリング・エコシステムか、という対立を浮き彫りにしています。コミュニティが推論設定とそのコストの完全な開示を求め続ける限り、この議論は汎用人工知能への進歩という視界を曇らせるのではなく、むしろより鮮明なものとなるでしょう。