5つのGemini 3.5 Flashエージェントがリアルタイムで協力した結果、30問のProject Eulerセットのうち87%を解決しました。これは、5つのエージェントが単独で実行した場合(72%)や、両方の多数決ベースライン(単独80%、協調型90%)を上回る結果です。また、協調実行では平均実行時間が1問あたり14分から10分へと4分短縮され、ほとんどの解答が5分以内に完了しました。

なぜこの実験が重要なのか

AIコーディングアシスタントは、すでにコードスニペットの作成、デバッグ、プログラム全体の生成を行っています。研究者は通常、単一のモデルに対してプロンプトを与え、その回答を評価します。しかし、今回のテストは異なる問いを投げかけています。作業中に知見を共有し合うエージェントのグループは、単に独立した回答を集計するだけの「群衆の知恵(wisdom of the crowd)」アプローチよりも優れた成果を出せるのでしょうか?

Project Eulerの問題は、アルゴリズム的思考の標準的なベンチマークとして機能します。数学的な洞察と効率的なコーディングが組み合わさっており、正確性と速度が重要となる実世界のプログラミングタスクの優れた代用となります。

テストの構成

  • エージェント: Antigravityプラットフォームを通じてアクセスされた5つのGemini 3.5 Flashインスタンス。
  • シナリオ:
    1. 各エージェントがすべての問題に単独で取り組み、自身の回答を報告する。
    2. 同じ5つのエージェントがリアルタイムで協力し、中間結果をブロードキャストしながら、互いのステップを確認し合う。
    3. 両方のセットアップにおいて、単純な多数決アグリゲーターが5つの独立した回答を統合する。
  • 指標: 正解率(正解した回答の割合)と実行時間(問題あたりの平均時間、および完了時間の分布)。

数値が示すもの

  • 単独の正解率: 72%
  • 協調型の正解率: 87%
  • 単独の多数決正解率: 80%
  • 協調型の多数決正解率: 90%

実行時間は、単独エージェントの平均14分から、協調グループでは10分へと短縮されました。協調実行のほとんどは5分以内に終了しましたが、単独での試行は30分のタイムアウト制限に達することが頻繁にありました。

格差を説明する主な観察事項

  • 一人では不可能でも、多人数なら可能 – ある単一の問題では、すべての単独エージェントが失敗しましたが、協調チームは部分的な結果を交換し、集団として正しい答えに到達しました。
  • 相互チェックによるエラー検知 – 個々のエージェントが論理的な罠に陥ることがありましたが、グループはリアルタイムで情報を照らし合わせることで、これらのミスを検知しました。
  • 迅速な収束 – いずれかのエージェントが重要な中間値を発見すると、その知見をブロードキャストすることで、他のエージェントが冗長な作業をスキップし、最終的な解へとより速く収束できるようになりました。

隠れたコストと限界

この実験では5つのエージェントしか使用していません。同様の効率性が数十、数百のエージェントにまでスケールするかどうかは不明なままです。さらに、多数決アグリゲーターも依然として良好なパフォーマンスを示しました(協調型で90%)。

今後の注目点

  • スケーリング実験 – 100のエージェントになっても精度は向上し続けるのか、それとも調整のオーバーヘッドが支配的になるのか?
  • 役割の専門化 – 特定のタスク(例:あるエージェントは数論に、別のエージェントは最適化に集中するなど)を割り当てることで、自由形式の協調よりもメリットを増幅できる可能性があります。
  • より広範なベンチマーク – 同じフレームワークをコード生成の課題、デバッグスイート、または実世界のソフトウェアビルドに適用することで、この利点が数学パズル以外でも維持されるかを検証することになります。

まとめ

AIコーディングエージェント間のリアルタイムな協調は、アルゴリズムタスクにおける成功率と速度の両方を向上させることができ、単独での試行や単純な多数決をも上回ります。このアプローチは有望ですが、そのスケーラビリティと費用対効果については、今後の研究で解明されるべき未解決の課題として残っています。

出典: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0