一个生产环境中的 LLM 智能体的内存日志从 2 KB 的文件膨胀到了 29,446 字节,导致智能体每次运行读取的 Token 数量从约 500 个增加到了 7,360 个——这是一种在监控仪表板上没有任何警报的隐形成本。该智能体的开发者表示,读取成本的这种无声增长是“智能体成本漂移”(agent cost drift)的一个具体实例,即使系统看起来运行正常,这一问题也会侵蚀预算。

什么是智能体成本漂移?

智能体成本漂移描述了由于智能体自身状态不断增长,导致其常规操作的计算成本逐渐增加的现象。在上述示例中,智能体维护着一个工作日志文件,记录了它拒绝之前文章主题的原因。每增加一个新条目都会添加一段推理过程,并且在智能体生成新内容之前,会完整读取该文件。由于日志呈二次方增长——每个条目不仅增加了自身的长度,还会引用之前的条目——智能体必须摄入的文本量会随时间加速增加。

这种漂移不是突发峰值或故障,而是一种复合式的线性税收。智能体每天仍能产出两篇文章,仪表板也没有显示任何错误,但每次运行现在要消耗 7,360 个 Token,而一个月前仅为约 500 个。由于大多数 LLM 提供商按 Token 计费,每次运行 Token 数量的增加会直接转化为更高的运营成本。

为什么这很重要

  • 预算影响 – 基于 Token 的定价意味着读取的每一个额外 Token 都是在花钱。Token 数量从 500 增加到了 7,360。

隐藏的机制

文件的增长模式是关键。如果只是简单地追加新条目的逐行日志,增长应该是线性的;但由于每个条目都会解释之前拒绝的原因,文本长度会产生复合效应。结果是呈现出二次方增长曲线:条目数量翻倍,文件大小的增幅会超过两倍,而处理它所需的 Token 数量增长得更快。

开发者很少能察觉到成本上升,因为每个条目“本身看起来都很合理”。智能体的输出仍然是正确的,日志也继续发挥着作用,从而掩盖了这种低效性。

缓解策略

开发者提出了对日志进行三部分重构的方案:

  • 近期条目文件 (Recent-entry file) – 保留一个较小的、处于活跃读取状态的文件,其中仅包含为避免立即重复而需要的最后几个条目。
  • 紧凑索引 (Compact index) – 为旧条目存储单行摘要。可以通过快速扫描索引来检查主题是否重复,而无需调取完整的段落。
  • 归档全文 (Archived full text) – 将完整的历史推理移动到单独的归档文件中,智能体在正常运行期间不会读取该文件。

这种方法在保留智能体避免主题重复能力的同时,大幅降低了每次运行的 Token 负载。

如何检测智能体的成本漂移

  1. 对 Token 读取进行监测 (Instrument token reads) – 记录智能体每次运行时加载其内存文件所消耗的 Token 数量。
  2. 进行长期追踪 (Track over time) – 将今天的 Token 数量与一周或一个月前的数量进行比较。持续的上升趋势预示着存在漂移。

仅仅验证文件是否仍能无错加载是不够的;你必须衡量加载该文件所产生的成本。

下一步关注点

智能体成本漂移是一种无形的税收,会悄无声息地蚕食你的 AI 预算。通过将智能体的内存文件视为一个成本中心——衡量 Token 读取量、观察增长曲线并重构日志——你可以将这种“税收”降至最低,并保持输出的高质量。

Source: https://dev.to/enjoy_kumawat/i-measured-what-my-agents-own-memory-file-costs-to-read-the-number-only-goes-up-46ob

Join the discussion: https://t.me/GyaanSetuAi