AWSとAnthropicは、Amazon Web Services上でセルフホスト型のClaude Apps Gatewayをリリースしました。一方、Google Cloudは、エディタをJupyter notebooksに直接連携させるVS Code Workbench拡張機能を追加しました。Stripeによる別のベンチマークでは、こうした進歩にもかかわらず、AIエージェントは自身が生成したコードの検証において依然として躓いていることが示されています。

新しいコントロールが重要である理由

Claudeのような大規模言語モデル(LLM)を社内ツールに組み込み始めた企業は、利用規模を拡大しながら、アクセス、コスト、およびデータの安全性をいかに確保するかという、よくある問題に直面しています。Claude Apps Gatewayは、コントロールプレーンを顧客のAWSアカウント内に配置することで、ITチームがアイデンティティ、監査ログ、および支出を管理するための単一の接点を提供します。これにより、開発者はデータを外部サービスにさらすことなく、Claudeを活用したCodeまたはDesktopセッションを立ち上げることが可能になります。

GoogleのVS Code Workbenchは、別の摩擦点に対処しています。データサイエンティストやエンジニアは、ローカルのIDEとクラウド上のノートブックを頻繁に行き来し、コードをあちこちへコピーしています。新しい拡張機能を使用すると、開発者はGoogle Cloud上のノートブックのカーネルを開き、ローカルでファイルを編集し、変更がリアルタイムで同期されるのを確認できます。リモートでの実行やデバッグは使い慣れたVS CodeのUIから行えるため、実験のスピードを落とす「ツール間の移動」というステップが解消されます。

議論を冷静に保つためのベンチマーク

Stripeの最新のAI Agent Benchmarkでは、現在のエージェントがソフトウェア統合をどの程度うまく扱えるかをテストしました。エージェントは統合コードの記述には優れていますが、検証において躓き、エッジケースやエラーチェックを見落とすことがよくあります。結果は明白でした。エージェントは生成フェーズでは強力なパフォーマンスを発揮しましたが、検証フェーズでは失速しました。

勝者と敗者

  • 企業は、Claudeのデプロイメントに対してより厳格なガバナンスを確保でき、リスクへの露出を軽減できます。
  • Google Cloudを利用する開発者は、ツールを切り替えることなく作業でき、単一のエディタからクラウドマシン上で重い計算を実行できます。

その一方で、Stripeのベンチマークが示すように、社内ポリシーを更新せずにこれらのツールを導入する組織は、依然として検証におけるギャップに直面する可能性があります。ツールはアクセスを簡素化しますが、人間による監視の必要性を排除するものではありません。

次に注目すべき点

AIを試行しているチームにとっての当面の教訓はシンプルです。新しいコントロールを使用してセキュリティを強化し、ワークフローを合理化しつつも、検証のためにヒューマン・イン・ザ・ループ(人間による介在)を維持することです。エージェントが自身のミスを確実に自分で見つけられるようになるまで、レビュアーとしての開発者の役割は不可欠なままです。