数ヶ月おきに、業界は「自律的に考える」とされるソフトウェアに対して新しい用語を生み出します。現在、その言葉は「Agentic AI」です。ベンダーは、ランディングページやピッチデックの至る所にこの言葉を貼り付けることに躍起になっています。しかし、そのシステムがあなたの環境、データ、そして失敗モードに直面して生き残るまでは、ラベルは単なるマーケティングコピーに過ぎません。その言葉自体からは、安全性、信頼性、あるいは適合性については何も分かりません。

機能リストを読むのはやめて、能力を測定し始める時です。

ラベルの問題

セールスエンジニアは、「エージェンティック」なアーキテクチャの証拠として、ダッシュボードやマルチモデルのドロップダウンメニュー、モバイルアクセスなどを見せてくるでしょう。しかし、それらはインターフェースの選択肢であって、振る舞いの保証ではありません。製品が最先端に見えたとしても、APIタイムアウトが発生した後に計画を修正する必要が生じた瞬間に、崩壊してしまう可能性があるのです。

重要なのは、システムが実際に自律型エージェントのように振る舞うかどうかです。タスクをステップに分解できるか?厳格な境界内で実際のシステムにアクセスできるか?何かが壊れたとき、適応するのか、それとも単に失敗して停止するだけなのか?あなたのスタックに特化した証拠を持ってこれらの問いに答えるまで、あなたは製品ではなく「概念」を買っていることになります。

実際に重要となる5つの能力テスト

私は、あらゆる「エージェンティック」という主張を、5つの特定の能力に基づいて評価しています。それぞれについて、私はシンプルなトリアージの質問を投げかけます。「その振る舞いは文書化されているか、パイロット運用で検証されているか、それとも未確認か?」 未確認がデフォルトです。そうでなければならないことを証明する責任は、製品側にあります。

Planning(プランニング): システムは曖昧な目標を、順序立てられた検証可能なステップに分解できるか?ToDoリストを作成することなら誰にでもできます。真のテストは、「今四半期のクラウド支出を15%削減する」といった、整理されていない目標を扱うことです。本物のエージェントであれば、現在の使用状況の監査を計画し、アイドル状態のリソースを特定し、適正化の推奨案を作成し、適切な順序で変更リクエストをスケジュールします。もし、単に5つの箇条書きの一般的なエッセイを提示して「完了」と言うのであれば、それはプランニングではなく、要約に過ぎません。

Tools(ツール): 設定されたスコープ内で、実際のシステムに対してアクションを実行できるか?洗練されたデモでモックAPIを呼び出すのは簡単です。最小権限の資格情報を使用して本番環境のCRMに認証し、レコードを書き込み、トランザクションをログに記録するのは困難です。どのシステムに触れるのか、どのようなキーを保持しているのか、そして影響範囲(blast radius)がどこで終わるのかを正確に知る必要があります。スコープは制限されていなければなりません。もしエージェントがデフォルトで本番環境への書き込み権限を持っているなら、それはエージェントではなく、負債です。

Correction(修正): 失敗した後に、次の動きを変更できるか?これは、ほとんどのプロトタイプが挫折するポイントです。3番目のステップで503エラーやスキーマの不一致が返されたとき、エージェントは無限ループに陥るのか、成功メッセージを捏造(ハルシネーション)するのか、それとも経路を調整するのか?真の修正とは、失敗を観察し、ワークフローの残りの部分を再計画し、制約を維持したまま新しい経路を実行することを意味します。楽観主義に包まれたリトライループは、修正ではありません。

Context(コンテキスト): すべてのステップを通じて制約を維持できるか?メモリ(記憶)だけでは不十分です。ステップ1で「予算500ドルを超えない」や「EUの顧客データを除外する」といった厳格なルールを確立した場合、ステップ7でプロンプトのコンテキストが変わったからといって、その上限を無視することはできません。これは、コンプライアンス規則、ブランドボイス、承認階層、およびアクセス制御に適用されます。コンテキストの保持こそが、ロングコンテキストモデルと古典的な状態管理(state management)が出会うべき場所です。

Oversight(監視): 人間がプロセスを停止または再開できるか?仮想マシンのキルスイッチだけでなく、きめ細かなサーキットブレーカーが必要です。ステップ2の後に計画を検査し、ステップ3を承認できる人はいますか?外部の依存関係が失敗した場合、人間がそれを修正して、状態を失うことなくワークフローを再開できますか?監視とは、災害が発生した後に読む監査ログのことではありません。それは、介入のためのライブなメカニズムなのです。

エビデンスはチェックボックスに勝る

デモは信頼性率ではありません。ベンダー比較シートのチェックボックスは証拠ではありません。アカウントエグゼクティブが「この製品はテスト失敗後に修正を行います」と言ったとき、次にすべきことは「エビデンスカード」を求めることです。

エビデンスカードは、チェックボックスを具体性に置き換えるものです。形式は以下の通りです:

  • Capability(能力): Correction(修正)
  • Claim(主張): テスト失敗後に修正を行う
  • Evidence(証拠): 管理されたフィクスチャによる検証待ち
  • Owner(担当): デベロッパーエクスペリエンス(DX)チーム
  • Stop if(停止条件): 修正によって承認済みのインターフェースが変更される場合

この形式は明快さを強制します。マーケティング上の主張と、その実証を切り離すのです。また、責任の所在を明確にします。これにより、エージェントが修正の試行中に承認済みのインターフェースを壊した際、どのチームに連絡すべきかを正確に把握できます。責任者がいなければ、説明責任は果たせません。停止条件がなければ、セーフティレールは存在しないのです。

パイロット運用を開始する前に、3つのことを書面で定義してください。第一に、タスクです。これらは合成ベンチマークではなく、実際のビジネスロジックから抽出されたものであるべきです。第二に、失敗テストです。実行中にAPIキーを失効させたり、不正な形式のJSONレスポンスを注入したり、想定されるレイテンシを2倍にしたりしてください。第三に、停止条件です。これらは自動的である必要があり、誰かが気づいてくれることを期待するような手動のパニックボタンであってはなりません。

ベンダーの主張を問い詰める方法

OpenAIは、エージェントには5つの構成要素(モデル、ツール、指示、ガードレール、人間による介入)が必要であると提唱しています。このリストを、ベンダー独自のアーキテクチャを採用することなく、彼らに質問するための共通言語として活用できます。

どのモデルが単なる生成ではなくプランニングを担うのかを問いなさい。ツールの権限がハードコードされているのか、それとも動的なのかを問いなさい。ガードレールが適用されるのは、プロンプト層なのか、それともオーケストレーションエンジンなのかを問いなさい。人間による介入が、組み込みのチェックポイントなのか、それともエージェントがすでにデータベースを破壊した後に送られてくる事後報告のメールなのかを問いなさい。あなたはOpenAIのスタックを買おうとしているのではありません。彼らのフレームワークを利用して、他社の製品の欠陥をあぶり出そうとしているのです。

MonkeyCodeは、オープンソースのパスと無料のクラウド版を提供しています。その組み合わせにより、パイロット運用の開始コストは低く抑えられます。しかし、導入が安価であることと、成功が検証されていることは別問題です。自社のインフラ上で自社のタスクを実行するまで、システムの未知の部分は未知のままです。費用ゼロという言葉に惑わされて、困難な問いへの答えが出たと勘違いしてはいけません。

予算を節約するための購入ルール

エージェンティックなパイロット運用を本番導入へと拡大するための私のルールは単純です。重要な機能に対して「実証」があり、かつ失敗時の「明確な責任者」がいる場合にのみ、スコープと予算を拡大します。ロードマップのスライドではありません。サポートチケットの待ち行列でもありません。「実証」とは、あなたの環境から出力されたログを意味します。「責任者」とは、その特定の失敗モードに対してページャーを携帯している、指名された担当者を意味します。

ベンダーが実証を示せない場合、あるいは社内のチームが責任者を割り当てられない場合は、拡大の準備ができていません。テストを継続する準備ができているだけなのです。

覚えておくべきこと: 「Agentic(エージェンティック)」という言葉は、評価の開始を告げる号砲です。ゴールではありません。それを、より困難な問いを投げかけ、より厳格なパイロット運用を行い、自社にとって意味のある証拠を要求するためのきっかけとして捉えてください。もしその製品が、あなたの環境で、あなたの失敗事例を用いて5つの機能テストに合格できないのであれば、それは本当の意味でエージェンティックではありません。それは単なる、また別のデモに過ぎないのです。

Source: https://dev.to/bestbee/is-it-really-agentic-ai-use-a-five-capability-product-gate-1c0h

Optional learning community: https://t.me/GyaanSetuAi