単一のRTX 5090上で実行された5つのローカルLLMエージェントのベンチマークにより、350億パラメータのMixture-of-Experts (MoE) モデルが、実世界のコーディングタスクにおいて他のモデルを凌駕したことが示されました。クラウドAPIを一切使用せず、既存の管理パネルにタグマネージャーを追加するというテストにおいて、Qwen 3.6 35B-A3Bが圧倒的な勝者となりました。

このテストが重要である理由

パーソナルハードウェア上で大規模言語モデルを実行することで、開発者はAPI料金やデータプライバシーの懸念を回避できます。しかし、「ローカルエージェント」は依然としてバズワードの域を出ていません。人間による手助けなしに、実際にファイルを編集し、コマンドラインツールを呼び出し、プロダクション環境で使用可能なコードを出力できるのでしょうか?クラウドサービスを排除したこの実践的な比較は、技術が現在どの段階にあるのかを開発者に具体的に示しています。

ハードウェアとタスク

5つのモデルすべてが、一般的なハイエンド消費者向けカードであるRTX 5090 GPUを搭載した同一のワークステーション上で、外部サービスなしで実行されました。タスクは意図的にシンプルですが、代表的なものでした。それは、構築済みの管理セクションにタグマネージャーのコンポーネントを追加することです。成功するためには、モデルが正しいソースファイルを見つけ出し、それらを編集し、新しい機能が既存の機能を壊さずに統合されていることを検証する必要がありました。

モデルのパフォーマンス

  • Qwen 3.6 35B-A3B (MoE) – 自律的にタスクを完了し、要求されていない合理的な改善も加え、実行後のパッチ適用も不要でした。
  • Qwen 3.6 27B (dense) – タスクは完了しましたが、対話ステップ数が約2倍かかり、指示を誤解することもありました。
  • GLM-4.7-Flash (dense) – 動作する実装を作成しましたが、不正確なファイルマッチングパターンを使用し、セキュリティチェックを省略したため、コードに脆弱性が残りました。
  • Qwythos-9B – 実際のツールを一切実行しませんでした。失敗の原因はモデル自体にあるのか、あるいはローカル環境の設定にあるのか、テストでは特定できませんでした。
  • Nemotron-3-Nano (hybrid) – ループに陥り、すでに特定済みのフォルダを検索するために40ターンを費やし、それ以上進展しませんでした。

結果が明らかにしていること

アーキテクチャは信頼できる予測因子ではない

パラメータを複数のエキスパート・サブネットワークに分割するMoEモデルが圧勝した一方で、denseおよびhybridのバリアントは、成功と完全な失敗に分かれました。これは、単なるアーキテクチャの選択だけでは、ツールの使用能力を保証できないことを示唆しています。

ツールの使用は依然として大きな障壁である

5つのエージェントのうち、テスト用に提供された専用のスクリーンショットツールを使用したものは一つもありませんでした。すべてがファイル名を推測したり、間接的な回避策を試みたりして、即興で対応しようとしました。「コードを生成できる」ことと「外部ユーティリティをオーケストレートできる」ことの間には、依然として大きな隔たりがあります。

ローカルで実行するということは、モデルだけでなくスタック全体をデバッグすることを意味する

2つのモデルでは、テストを開始する前にプロンプトテンプレートにその場でのパッチ適用が必要でした。モデル固有のバグを修正するために費やされた労力は、実際のタグマネージャーのコードを書く時間を上回り、現在のローカル展開がいかに脆弱であるかを浮き彫りにしました。

注意事項

このベンチマークは、単一のハードウェア構成、単一のコーディングシナリオ、および少数のモデルセットを反映したものです。Qwen 3.6 35B-A3Bは以前のラウンドで失敗していましたが、その失敗は偶然によるものでした。したがって、これらの結果は示唆的なものであり、決定的なものではありません。

次に注目すべき点

今後のラウンドでは、タスクセットを拡大し、より多様なツールチェーンを含め、より幅広いハードウェアでテストする必要があります。観察者は、MoEモデルがdenseやhybrid設計を一貫して上回るかどうか、そして開発者が手動のバグ修正を不要にするような信頼性の高いラッパーを構築できるかどうかを注視すべきです。

要点: 35BのMoEモデルは、すでに有能なローカルコーディングアシスタントとして機能できますが、ツール統合、プロンプトエンジニアリング、安定したランタイムといったより広範なエコシステムは、依然として遅れています。これらの要素が噛み合うまでは、開発者は「プラグアンドプレイ」なローカルエージェントに対して期待値を抑えておくべきです。