SWE-benchのスコアは2年足らずで1.96%から72.7%へと急上昇し、見出しではAIのコーディング能力が37倍に跳ね上がったと報じられています。その見出しは目を引きますが、これらの数字はソフトウェアエンジニアリングスキルの単一かつ着実な向上ではなく、異なる2つの試験を比較しているものです。

生の数字

2023年のオリジナルのSWE-benchは、2,294件の実際のGitHub issueに基づいてAIエージェントを評価していました。タスクは、曖昧な説明、壊れたテスト、そして人間でさえ解決に苦労するような問題が入り混じった、寄せ集めのようなものでした。2025年には、同じベンチマーク名で72.7%というスコアが登場しましたが、テスト内容は、人間が明快さと解決可能性を検証したわずか500件のタスクからなる「Verified(検証済み)」サブセットへと絞り込まれていました。

テストの変化

フルカタログからVerifiedセットへの移行は、最初にして最も顕著な変化です。元のコレクションは、不完全であったり、ドキュメントが不十分であったり、あるいは追加のコンテキストなしでは解決不可能なものだったりと、オープンソースへの貢献における混沌とした現実を反映しようとしていました。対照的に、Verifiedバージョンでは、その混沌を意図的に排除しています。よりクリーンで扱いやすい問題セットを提示しており、高いスコアを現実的に達成できるようになっています。

2つのバージョンは問題空間の異なる側面を測定しているため、単純なパーセンテージの比較は誤解を招きます。1.96%という数字は、未加工でフィルタリングされていない作業に対するパフォーマンスを捉えたものであり、72.7%という数字は、成功率がはるかに高い、精選されたサンプルに対するパフォーマンスを捉えたものです。

ターゲットを絞ったエンジニアリング

2番目の、より微妙な変化は、開発者がベンチマークにどのように取り組むかという点に起こりました。2023年当時、SWE-benchで高得点を取るために特別にエージェントを構築する者はいませんでした。テストは、世界のコーディング課題のランダムなサンプルとして機能していました。2025年までに、チームはベンチマークを「スコアボード」へと変貌させました。彼らは、Verifiedセットで高得点を獲得することを明確な目標として、スキャフォールディング、プロンプト戦略、およびモデルのファインチューニングを構築したのです。

エンジニアが特定のテストに合格するようにシステムを設計する場合、そのスコアはシステムがそのテストにどれだけ適合しているかを示すものであり、そのシステムがどれほど広範な能力を持っているかを示すものではありません。ベンチマークが「修正」され、目標(ターゲット)へと変わった瞬間、それは現実世界の作業の代表的なサンプルではなくなりました。

この急上昇が本当に意味すること

見出しを飾るような改善は、現在のコーディングエージェントが、オリジナルのセットよりもVerifiedタスクにおいて劇的に優れたパフォーマンスを発揮しているという意味では、事実です。その改善は、同じ精選されたベンチマークに依存するコンペティション、研究論文、製品デモにとっては重要です。

しかし、この急上昇は、AIエージェントが日常的なソフトウェア開発の煩雑さに対応できるようになったことを証明するものではありません。オリジナルの2,294件のセットは依然として存在しており、そのバージョンでのスコアは低いままです。

問いかけるべき質問

ベンチマークの結果に劇的な変動を見かけたときは、常に次の3つのチェック項目を念頭に置いてください。

  • どのバージョンが報告されているか? Original、Lite、それともVerifiedか? 同一の名前であっても、タスクのプールが大きく異なる場合があります。
  • 何がフィルタリングされたか? ノイズの多いタスクや不可能なタスクを取り除くことは、あらゆるシステムの天井(上限)を引き上げますが、同時に、実運用において重要となる課題そのものを取り除いてしまうことにもなります。
  • そのシステムはこの特定のテストに合格するために構築されたものか? 開発者がベンチマークに合わせてモデルやパイプラインを調整した場合、そのスコアは生の能力ではなく、最適化の度合いを測定していることになります。

今後の展望

このようなセーフガードが標準化されるまでは、AIコーダーの有用性を測る最良の指標は、開発者が日々直面する混沌とした現実世界の課題に対するパフォーマンスであり続けるでしょう。

まとめ: 修正され、ターゲットを絞ったベンチマークでの高スコアは、AIエージェントが現実世界のコードの混乱に対応できる準備が整っていることを自動的に証明するものではありません。真のテストは、エンジニアが日々格闘している、フィルタリングされていない問題の中にあります。