结构化记忆如何帮助 AI Agent 征服《杀戮尖塔 2》

研究人员开发了一种全新的智能体架构 AgenticSTS。通过用精密的五层结构化记忆系统取代臃肿的聊天日志,该架构的表现优于传统的 LLM Agent。通过摒弃“不断增长的对话记录”模式,这种方法在显著降低 Token 成本的同时,还使 Agent 能够在多次游戏过程中学习复杂的策略。

不断增长的聊天日志所带来的问题

目前大多数 LLM Agent(例如使用 ReAct 或 Reflexion 框架的 Agent)都依赖于将过去所有的观察结果、工具调用和自我反思不断追加到连续的文本日志中。随着会话的进行,上下文窗口不断扩大,直到发生溢出,或者模型的注意力被无关的历史数据所稀释。

在针对复杂的卡牌构筑 Roguelike 游戏《杀戮尖塔 2》(Slay the Spire 2)的测试中,这种低效性表现得尤为明显。采用经典“增长式对话记录”模式的竞争对手(如 STS2MCP 和 CharTyr)在单次模型调用时,Token 数量会激增至约 527,000 个。这种架构缺陷导致了巨大的延迟和天文数字般的 Token 成本;为了达到相似的分数,竞争对手使用的 Token 数量是 AgenticSTS 的 66 到 90 倍。

五层记忆解决方案

AgenticSTS 通过从五个有序且独立的记忆槽位中重新构建每个决策提示词(Prompt),解决了上下文膨胀问题。这确保了无论游戏进行多久,提示词都能保持精简——平均约为 5,000 个 Token。其层级结构如下:

  • L1 (固定协议): Agent 的核心指令。
  • L2 (状态模式): 当前有效操作的定义。
  • L3 (可检索规则): 根据需要获取的具体游戏规则。
  • L4 (情景记忆): 对之前游戏轮次的总结,以提供长期上下文。
  • L5 (技能库): 由特定情境模式触发的战术规则。

这种模块化设计允许研究人员精确地确定是哪个组件驱动了性能提升。例如,仅启用 L5 技能库,就能在 A0 难度级别下将 Agent 的胜率从 10 场中的 3 场提高到 10 场中的 6 场。

通过学习提升难度等级

结构化方法的真正威力在于“轮次间学习”(inter-run learning)。虽然标准 Agent 很难突破最低难度级别,但 AgenticSTS 利用其 L4 和 L5 层成功攀升了游戏的难度阶梯。如果没有在轮次之间更新的活跃记忆,Agent 会停滞在 A2 到 A4 级别;然而,凭借跨会话的持久记忆,它成功达到了难度更高的 A6 到 A8 级别。

有趣的是,研究人员发现这种记忆具有高度的模型特定性。当由 Gemini 3.1 Pro 生成的记忆栈转移到 Qwen 3.6-27B 时,后者的分数提升了 84.5%,但 Deepseek V4-Pro 的分数反而下降了 18.1%。这表明,虽然结构化记忆非常强大,但其中包含的“知识”与创建它的模型的推理模式深度绑定。

为什么这对 AI 行业至关重要

AgenticSTS 的成功标志着智能体设计的转变:自主 AI 的未来不在于更大的上下文窗口,而在于更智能、更结构化的记忆管理。对于构建长期运行 Agent 的开发者来说,这种架构提供了一个蓝图,可以在显著提高模型执行复杂多步推理能力的同时,降低运营成本和延迟。

核心要点

  • 效率提升: AgenticSTS 保持了恒定的 5,000 Token 提示词,使用的 Token 数量比依赖增长式聊天日志的 Agent 少多达 90 倍。
  • 性能增强: 利用“技能库”(L5)可以将 Agent 的胜率翻倍,并通过轮次间学习实现向更高难度等级的进阶。
  • 架构转型: 从非结构化对话记录转向多层记忆,解决了注意力稀释和模型延迟激增的问题。