Як структурована пам'ять допомагає ШІ-агентам підкорювати Slay the Spire 2
Дослідники розробили нову агентну архітектуру, AgenticSTS, яка перевершує традиційних LLM-агентів, замінюючи роздуті чат-логи складною п'ятирівневою системою структурованої пам'яті. Відмовившись від моделі «транскрипту, що постійно зростає», цей підхід значно знижує витрати на токени, дозволяючи агентам вивчати складні стратегії протягом багатьох ігрових сесій.
Проблема зростаючих чат-логів
Більшість сучасних LLM-агентів, наприклад, ті, що використовують фреймворки ReAct або Reflexion, покладаються на додавання кожного минулого спостереження, виклику інструменту та саморефлексії до безперервного текстового логу. У міру тривання сесії це контекстне вікно розширюється, доки не переповниться або поки увага моделі не розмиється через нерелевантні історичні дані.
Під час тестування проти складної колодобудівної рогалика Slay the Spire 2 ця неефективність була очевидною. Конкуренти, такі як STS2MCP та CharTyr, які використовують класичний паттерн зростаючого транскрипту, призвели до того, що кількість токенів за один виклик моделі роздувалася приблизно до 527 000. Цей архітектурний недолік призводить до величезної затримки та астрономічних витрат на токени: конкуренти використовують від 66 до 90 разів більше токенів, ніж AgenticSTS, для досягнення схожих результатів.
П'ятирівневе рішення для пам'яті
AgenticSTS вирішує проблему інфляції контексту, перебудовуючи кожен промпт для прийняття рішення на основі п'яти організованих, дискретних слотів пам'яті. Це гарантує, що промпт залишається лаконічним — у середньому близько 5 000 токенів — незалежно від тривалості гри. Рівні структуровані наступним чином:
- L1 (Fixed Protocol): Основні інструкції для агента.
- L2 (State Schemas): Визначення поточних доступних дій.
- L3 (Retrievable Rules): Конкретні ігрові правила, що витягуються за потреби.
- L4 (Episodic Memory): Резюме попередніх забігів для забезпечення довгострокового контексту.
- L5 (Skill Library): Тактичні правила, що спрацьовують за певними ситуаційними шаблонами.
Така модульність дозволяє дослідникам точно визначити, який саме компонент сприяє покращенню продуктивності. Наприклад, лише ввімкнення бібліотеки навичок L5 подвоїло відсоток перемог агента з 3 у 10 ігор до 6 у 10 ігор на рівні складності A0.
Масштабування складності через навчання
Справжня сила структурованого підходу полягає в навчанні між ігровими сесіями. У той час як стандартні агенти ледве просуваються за межі найнижчих рівнів складності, AgenticSTS використовує свої рівні L4 та L5, щоб підніматися по сходах складності гри. Без активної пам'яті, яка оновлюється між забігами, агент зупиняється на рівнях від A2 до A4; проте завдяки пам'яті, що зберігається між сесіями, він успішно досягає набагато складніших рівнів від A6 до A8.
Цікаво, що дослідники виявили: ця пам'ять дуже специфічна для кожної моделі. Коли стек пам'яті, згенерований Gemini 3.1 Pro, був перенесений на Qwen 3.6-27B, результат останньої зріс на 84,5%, але показник Deepseek V4-Pro насправді впав на 18,1%. Це свідчить про те, що хоча структурована пам'ять є потужною, «знання», що містяться в ній, глибоко пов'язані з шаблонами міркування моделі, яка їх створила.
Чому це важливо для індустрії ШІ
Успіх AgenticSTS сигналізує про зміну в дизайні агентів: майбутнє автономного ШІ полягає не у збільшенні контекстних вікон, а в розумнішому та більш структурованому управлінні пам'яттю. Для розробників, які створюють довгострокових агентів, ця архітектура пропонує план дій для зниження операційних витрат і затримок, одночасно значно покращуючи здатність моделі до складних багатоетапних міркувань.
Основні висновки
- Підвищення ефективності: AgenticSTS підтримує стабільний промпт у 5 000 токенів, використовуючи до 90 разів менше токенів, ніж агенти, що покладаються на зростаючі чат-логи.
- Покращення продуктивності: Використання «Бібліотеки навичок» (L5) може подвоїти відсоток перемог агента та забезпечити прогрес до набагато вищих рівнів складності завдяки навчанню між забігами.
- Архітектурний зсув: Перехід від неструктурованих транскриптів до багатошарової пам'яті вирішує проблеми розмиття уваги та стрімкого зростання затримок моделі.
