Meta AI представила двоагентну систему пам'яті, яка підвищує показники успішності автономних ШІ-асистентів з 38% до 46% у бенчмарку командного рядка та з 55% до 62% у мультидоменному розмовному бенчмарку. Покращення досягається шляхом поєднання незмінної «моделі дій» з виділеним «коучем пам'яті», який відстежує останні кроки завдання і втручається лише тоді, коли контекст загрожує бути втраченим.

Прихований недолік тривалих завдань ШІ

Коли мовна модель вирішує багатоетапну проблему, кожен новий крок додає текст до історії розмови. Наступний крок моделі має базуватися на всьому транскрипті, але на практиці релевантні факти опиняються «похованими». Дослідники Meta називають це «деградацією поведінкового стану» (behavioral state decay) — поступовою втратою агентом розуміння мети в міру розширення вікна контексту. Просто розширити вікно не вирішує проблему; інформація може бути присутня, але вона більше не впливає на передбачення моделі.

Традиційні надбудови пам'яті лише витягують документ або персоналізують відповіді. Вони ніколи не вирішують, коли саме певна частина минулої інформації є достатньо критичною, щоб вплинути на поточну дію. Як наслідок, тривалі автономні агенти починають відхилятися від курсу, повторювати помилки або ігнорувати важливі обмеження, згадані на початку взаємодії.

Розділення виконання та нагляду

Рішенням від Meta є архітектура plug-and-play, яка відокремлює механізм виконання від наглядового шару пам'яті.

  • Action Agent (Агент дій) — незмінна мовна модель, яка видає команди, викликає інструменти та створює видимий результат. У експериментах це Claude Sonnet 4.5.
  • Memory Agent (Агент пам'яті) — друга модель, яка періодично переглядає ковзне вікно останніх кроків. У випробуваннях це Claude Opus 4.6.

Агент пам'яті веде банк пам'яті, що складається з трьох частин:

  1. Private Status Field (Приватне поле статусу) — внутрішні прапорці щодо прогресу та ризиків, які агент дій не може бачити.
  2. Knowledge Memory (Пам'ять знань) — стабільні факти, такі як шляхи до файлів, значення конфігурації або кінцеві точки API.
  3. Procedural Memory (Процедурна пам'ять) — журнал того, що спрацювало, а що ні, включаючи невдалі команди та способи їх виправлення.

Замість того, щоб резюмувати весь транскрипт, агент пам'яті вирішує, чи варто втручатися. Якщо він виявляє, що важливу деталь було забуто, він вводить стисле нагадування; якщо ні — він мовчить, уникаючи зайвих токенів і затримок.

Бенчмарки підтверджують концепцію

Meta протестувала систему на двох публічних наборах:

Бенчмарк Базовий рівень успішності Успішність із двома агентами
Terminal-Bench 2.0 (командний рядок) 38% 46%
tau2-Bench (ритейл, авіалінії, телеком) 55% 62%

Покращення є помітними, оскільки в обох рядках використовується одна й та сама модель дій; змінився лише шар пам'яті. Порівняно з Mem0, широко використовуваним у продакшені шаром пам'яті, який покладається на пошук за ключовими словами, підхід Meta показав кращі результати. У симульованому сценарії бронювання авіаквитків користувач помилково заявив про «Gold status». Агент пам'яті помітив невідповідність, нагадав моделі дій довіряти перевіреному статусу лояльності з API авіакомпанії, і транзакція пройшла коректно.

Чому галузі варто звернути на це увагу

Результат вказує на шлях розвитку, який не залежить від постійного збільшення розміру моделей. Перекладаючи управління контекстом на легкий наглядовий механізм, розробники можуть підвищити надійність завдань, що охоплюють десятки кроків — налагодження програмного забезпечення, складні процеси обслуговування клієнтів або автономні конвеєри даних — без збільшення кількості параметрів основної моделі.

Для компаній, що створюють автономних агентів, ця архітектура пропонує:

  • Зменшення дрейфу помилок — система активно захищає від забутих обмежень.
  • Ефективність токенів — втручання є вибірковими, тому модель дій обробляє менше нерелевантних токенів.
  • Модульні оновлення — коуча пам'яті можна замінити на новішу модель без перенавчання основного ядра дій.

Компроміси та відкриті питання

За чим стежити далі

Висновок: Виділений коуч пам'яті може зупинити деградацію поведінкового стану, забезпечуючи двозначне зростання показників успішності без необхідності перепроектування основної моделі міркувань. Компромісом є ускладнення системи, але результат — надійніші автономні агенти — може вартувати додаткових інженерних зусиль.