一个生产环境中的 LLM 智能体的内存日志从 2 KB 的文件膨胀到了 29,446 字节,导致智能体每次运行读取的 Token 数量从约 500 个增加到了 7,360 个——这是一种在监控仪表板上没有任何警报的隐形成本。该智能体的开发者表示,读取成本的这种无声增长是“智能体成本漂移”(agent cost drift)的一个具体实例,即使系统看起来运行正常,这一问题也会侵蚀预算。
什么是智能体成本漂移?
智能体成本漂移描述了由于智能体自身状态不断增长,导致其常规操作的计算成本逐渐增加的现象。在上述示例中,智能体维护着一个工作日志文件,记录了它拒绝之前文章主题的原因。每增加一个新条目都会添加一段推理过程,并且在智能体生成新内容之前,会完整读取该文件。由于日志呈二次方增长——每个条目不仅增加了自身的长度,还会引用之前的条目——智能体必须摄入的文本量会随时间加速增加。
这种漂移不是突发峰值或故障,而是一种复合式的线性税收。智能体每天仍能产出两篇文章,仪表板也没有显示任何错误,但每次运行现在要消耗 7,360 个 Token,而一个月前仅为约 500 个。由于大多数 LLM 提供商按 Token 计费,每次运行 Token 数量的增加会直接转化为更高的运营成本。
为什么这很重要
- 预算影响 – 基于 Token 的定价意味着读取的每一个额外 Token 都是在花钱。Token 数量从 500 增加到了 7,360。
隐藏的机制
文件的增长模式是关键。如果只是简单地追加新条目的逐行日志,增长应该是线性的;但由于每个条目都会解释之前拒绝的原因,文本长度会产生复合效应。结果是呈现出二次方增长曲线:条目数量翻倍,文件大小的增幅会超过两倍,而处理它所需的 Token 数量增长得更快。
开发者很少能察觉到成本上升,因为每个条目“本身看起来都很合理”。智能体的输出仍然是正确的,日志也继续发挥着作用,从而掩盖了这种低效性。
缓解策略
开发者提出了对日志进行三部分重构的方案:
- 近期条目文件 (Recent-entry file) – 保留一个较小的、处于活跃读取状态的文件,其中仅包含为避免立即重复而需要的最后几个条目。
- 紧凑索引 (Compact index) – 为旧条目存储单行摘要。可以通过快速扫描索引来检查主题是否重复,而无需调取完整的段落。
- 归档全文 (Archived full text) – 将完整的历史推理移动到单独的归档文件中,智能体在正常运行期间不会读取该文件。
这种方法在保留智能体避免主题重复能力的同时,大幅降低了每次运行的 Token 负载。
如何检测智能体的成本漂移
- 对 Token 读取进行监测 (Instrument token reads) – 记录智能体每次运行时加载其内存文件所消耗的 Token 数量。
- 进行长期追踪 (Track over time) – 将今天的 Token 数量与一周或一个月前的数量进行比较。持续的上升趋势预示着存在漂移。
仅仅验证文件是否仍能无错加载是不够的;你必须衡量加载该文件所产生的成本。
下一步关注点
智能体成本漂移是一种无形的税收,会悄无声息地蚕食你的 AI 预算。通过将智能体的内存文件视为一个成本中心——衡量 Token 读取量、观察增长曲线并重构日志——你可以将这种“税收”降至最低,并保持输出的高质量。
Join the discussion: https://t.me/GyaanSetuAi
