Meta AIは、自律型AIアシスタントの成功率を、コマンドライン・ベンチマークで38%から46%へ、マルチドメイン対話ベンチマークで55%から62%へと向上させる、デュアルエージェントメモリシステムを発表しました。この向上は、変更のない「アクション(実行)」モデルと、タスクの直近のステップを監視し、コンテキストが失われそうになった時だけ介入する専用の「メモリ(記憶)」コーチを組み合わせることで実現しました。

長期実行されるAIタスクに潜む欠陥

言語モデルが多段階の課題に取り組む際、ターン(やり取り)を重ねるごとに会話履歴にテキストが追加されていきます。モデルの次の動きは会話の全記録に基づいてガイドされるべきですが、実際には関連する事実が埋もれてしまいます。Metaの研究者はこれを「行動状態の減衰(behavioral state decay)」と呼んでいます。これは、コンテキストウィンドウが膨らむにつれて、エージェントが目的意識を徐々に失っていく現象です。単にウィンドウを広げるだけではこの問題は解決しません。情報は存在していても、モデルの予測に影響を与えなくなる可能性があるからです。

従来のメモリ・アドオンは、ドキュメントを検索したり、回答をパーソナライズしたりするものです。過去の情報が、現在の行動に影響を与えるほど重要であるかどうかを判断する機能は備わっていません。その結果、長期実行される自律型エージェントは、内容が脱線したり、エラーを繰り返したり、対話の初期に言及された重要な制約を見逃したりすることがあります。

実行と監視の分離

Metaの回答は、実行エンジンを監視用のメモリレイヤーから分離する、プラグアンドプレイ型のアーキテクチャです。

  • Action Agent(アクション・エージェント) – コマンドの発行、ツールの呼び出し、目に見える出力の生成を行う、未改修の言語モデル。実験ではClaude Sonnet 4.5が使用されています。
  • Memory Agent(メモリ・エージェント) – 直近のステップの移動窓(スライディングウィンドウ)を定期的にレビューする第2のモデル。試行ではClaude Opus 4.6が使用されています。

メモリ・エージェントは、以下の3つの要素からなるメモリバンクを保持します。

  1. Private Status Field(プライベート・ステータス・フィールド) – アクション・エージェントには見えない、進捗やリスクに関する内部フラグ。
  2. Knowledge Memory(ナレッジ・メモリ) – ファイルパス、設定値、APIエンドポイントなどの安定した事実。
  3. Procedural Memory(プロシージャル・メモリ) – 何が機能し、何が失敗したかのログ。失敗したコマンドや、それを解決した修正策なども含まれます。

メモリ・エージェントは、会話の全記録を要約するのではなく、介入すべきかどうかを判断します。重要な詳細が忘れられていると検知した場合は簡潔なリマインダーを注入し、そうでなければ沈黙を保つことで、余分なトークン消費とレイテンシを回避します。

ベンチマークが概念を証明

Metaは、2つの公開スイートでこのシステムをテストしました。

ベンチマーク ベースラインの成功率 デュアルエージェントの成功率
Terminal-Bench 2.0 (コマンドライン) 38 % 46 %
tau2-Bench (小売、航空、通信) 55 % 62 %

これらの向上は注目に値します。なぜなら、両方の行において同じアクション・モデルが使用されており、メモリレイヤーのみを変更しているからです。キーワード検索に依存する広く普及しているプロダクション用メモリレイヤー「Mem0」と比較しても、Metaのアプローチは優れたパフォーマンスを示しました。航空券予約のシミュレーションシナリオにおいて、ユーザーが誤って「ゴールドステータス」であると主張した際、メモリ・エージェントは不一致を検知しました。そして、航空会社のAPIによる検証済みのロイヤリティステータス確認を信頼するようアクション・モデルにリマインドし、トランザクションを正しく完了させました。

なぜ業界が注目すべきなのか

この結果は、モデルの巨大化に依存しない、今後の進むべき道を示唆しています。コンテキスト管理を軽量な監視役にオフロードすることで、開発者はメインモデルのパラメータ数を増やすことなく、ソフトウェアのデバッグ、複雑なカスタマーサービス・フロー、自律的なデータパイプラインなど、数十ステップに及ぶタスクの信頼性を向上させることができます。

自律型エージェントを構築する企業にとって、このアーキテクチャは以下のメリットをもたらします。

  • エラーのドリフト(脱線)の低減 – システムが忘れ去られた制約に対して能動的にガードをかけます。
  • トークン効率の向上 – 介入が選択的に行われるため、アクション・モデルが処理する無関係なトークンが減少します。
  • モジュール式のアップグレード – アクション・コアを再学習させることなく、メモリ・コーチをより新しいモデルに交換できます。

The trade-offs and open questions

What to watch next

Takeaway: 専用のメモリ・コーチは、主要な推論モデルを再設計することなく、行動状態の減衰を食い止め、成功率を2桁向上させることができます。トレードオフとしてシステム構成は複雑になりますが、より信頼性の高い自律型エージェントが得られるという見返りは、追加のエンジニアリング努力に見合うものかもしれません。