一个全新的“主动记忆”模块让大语言模型智能体能够在无需微调核心模型的情况下,追踪任务需求、环境事实和过去的失败经历。在基准测试中,该模块使 Sonnet 4.5 在 Terminal-Bench 2.0 上的得分提升了 8.3 个百分点,在 τ2-Bench 测试套件上提升了 6.8 个百分点;一个经过 SETA 训练的记忆智能体在处理未见过的难题时,将冻结模型的 pass@1 从 37.6% 提高到了 41.1%。
为什么智能体会“迷失方向”
当一个由 LLM 驱动的智能体执行多步流程时,其内部“状态”会发生衰减。研究人员称之为“行为状态衰减”:模型会忘记之前的指令、关键事实或已经犯过的错误。其结果是引发一系列错误的决策,导致任务在完成前就宣告失败。
通常的解决方法是扩大上下文窗口——即模型一次可以处理的文本块。但这只能在任务规模超出窗口之前起到作用;一旦超出,旧信息就会被丢弃,衰减现象会再次出现。
仅在需要时起作用的提醒机制
这种新方法增加了一个轻量级的辅助记忆智能体,它负责观察主模型的推理轨迹并注入有针对性的提醒。该记忆模块并非简单地提取过去片段的静态列表,而是决定“何时”以及“提供什么”信息,仅在主模型表现出偏移迹象时才介入。
由于记忆学习器是独立训练的,因此主要动作模型保持冻结状态。研究表明,这种分离在长程基准测试中仍然带来了显著的收益,证明了主动提醒可以弥补有限上下文窗口的不足。
数据说明了什么
- Terminal-Bench 2.0: Sonnet 4.5 比其基准线提升了 8.3 分。
- τ2-Bench suite: 同一模型提升了 6.8 分。
- 在留出测试集上的 Pass@1: 一个经过 SETA 训练的记忆智能体将冻结模型的 pass@1 从 37.6% 提升至 41.1%。
这些提升是在不对主模型进行任何额外微调的情况下实现的,因此记忆组件可以灵活地在现有部署中进行替换或移除。
当前研究的局限性
目前的实验尚未涵盖以下测试:
- 规模: 目前尚无证据表明该记忆模块在处理数十亿参数的模型或运行数百万步的任务时具有同样的效果。
- 生产成本: 存储和检索提醒会增加额外开销,但该研究并未量化现实世界系统中所需的额外内存或计算量。
下一步值得关注的方向
未来的基准测试套件需要衡量的内容将不仅仅是原始的上下文大小。能够明确追踪状态衰减并奖励主动提醒系统的测试,将更清晰地展现智能体的长期可靠性。研究人员还必须证明,主动记忆在模型规模和运营成本方面都能实现高效扩展。
核心结论: 一个小型且独立训练的记忆模块可以充当大语言模型智能体的“监视器”,在偏移导致任务失败之前将其捕捉并纠正。
