一位独立研究员记录了他驱动的研究智能体(research agent)一个月内消耗的每一个 Token,并成功削减了 31% 的账单费用。支出从 945 美元降至 651 美元,而成功率反而从 91% 小幅提升至 93%,这一结果值得任何运行成本敏感型 AI 工作流的人士关注。
为什么 Token 级数据至关重要
大多数 LLM 用户只能看到最终账单——一笔掩盖了每个子任务成本的总额。该研究员的智能体执行三个核心操作:搜索 SEC 文件、起草报告以及整合研究综述。如果没有细粒度的数据,他无法判断 6 月份支付的 312 美元是否花得值。
为了揭示隐藏的资金流失,他添加了一个 PostgreSQL 日志层,用于捕获模型名称、Token 数量、任务类型以及单次调用成本。30 天后,数据描绘出了清晰的图景:
- SEC 文件搜索 – 占总支出的 41%
- 报告起草 – 28%
- 研究综述 – 17%
- 质量检查 – 9%
- 杂项 – 5%
数据表明,最昂贵的步骤并不是模型本身,而是智能体将原始搜索结果喂给提示词(prompts)的方式。
驱动成本削减的三项优化措施
1. 在提示之前先进行摘要
最初,智能体会将 20 条原始搜索结果塞进每个提示词中,导致输入 Token 数量激增。他先插入了一个低成本的摘要模型,大幅减少了输入量。单个搜索任务的成本从 0.84 美元降至 0.19 美元——降幅达 77%。
2. 将简单的检查任务路由到更便宜的模型
质量检查原本在高端模型上运行,每次检查成本为 0.09 美元。他将大多数“通过/失败”检查更换为价格较低的模型,将单次检查价格降至 0.01 美元。低成本模型的正确率达到了 89%;任何失败的情况都会转交给原始模型处理,在大幅削减成本 87% 的同时保留了准确性。
3. 在置信度高时跳过检查
他增加了一条规则:只要任务的历史成功率较高且输出长度在预期范围内,就跳过质量检查步骤。这消除了大约 60% 本来就会运行的检查任务。
收益
实施这三项变更后,每月的账单如下:
- 总支出:$945 → $651(削减 31%)
- 单个 SEC 搜索任务成本:$0.84 → $0.19(削减 77%)
- 单个质量检查任务成本:$0.09 → $0.01(削减 87%)
- 总体成功率:91% → 93%
更高的成功率表明,更短的提示词减少了噪声,并帮助模型专注于核心问题。
注意事项与反面观点
这种方法取决于两个假设。首先,低成本的摘要模型必须为下游推理保留足够的信息;如果它丢弃了关键细节,输出质量可能会受损。其次,用于质量检查的低成本模型并不完美;其 89% 的准确率意味着仍有一小部分错误会进入最终产品,尽管“升级机制”能捕捉到大部分错误。对于合规性要求更严格的用户,可能需要更严格的阈值或额外的验证步骤。
这对 LLM 从业者意味着什么
- 细粒度仪表盘更具优势。 高层级的支出报告会掩盖 Token 的浪费。记录每个任务的使用情况可以揭示那些原本会被隐藏的低效环节。
- 并不总是需要前沿模型。 低成本模型可以进行数据压缩或做出简单的二元决策,而不会损害整体质量。
LLM 智能体的隐藏成本往往在于其执行的那些未被衡量的任务。通过对 Token 流进行监测并应用针对性的优化,该研究员将每月 945 美元的账单转变为 651 美元的精简运营模式,同时还提升了性能。对于任何需要规划 AI 工作负载预算的人来说,教训很明确:衡量每一个 Token,然后让数据决定在哪里进行削减。
