我们为由十个智能体组成的 AI 集群设置了 100 美元的信用额度,结果当天限流机制就启动了,在我们将额度调高之前,所有新任务都被停止了。这次事件表明,一旦预算被突破,控制循环会立即介入。
为什么 AI 集群需要信用额度
在单个服务器上运行十个自主智能体会产生持续不断的 API 调用,每次调用的费用都根据消耗的 Token 计算。传统的日志记录了智能体做了什么——查询、响应、时间戳——但它们无法说明这些操作花费了多少钱。当集群规模扩大时,这笔隐形账单可能会爆炸式增长,在任何人察觉之前就耗尽预算。
将日志转化为账本
我们迈出的第一步是停止将日志视为纯文本,而是开始将其视为财务账本。智能体的每一个周期——任务 → 执行中 → 完成——现在都会产生三条日记分录:
- 资金 (Money) – 根据请求的 Token 数量推算出的美元价值。
- 承诺 (Promises) – 代表待处理负债的未完成任务,即一旦完成就会产生费用的工作。
- 劳动 (Labour) – 智能体执行的实际工作单位。
现在,我们不再需要通过 grep 命令在日志文件中搜索 “error”,而是可以运行真正的财务查询:“显示所有资金总额超过 100 美元的承诺任务。” 账本让隐藏的成本变得可见且可搜索。
闭环控制系统
信用额度机制遵循一个持续运行的四步循环:
- 测量 (Measure) – 智能体的每一次轮转都会在支出日志中追加一行,记录 Token 使用量和推算的美元金额。
- 定价 (Price) – 系统根据当前汇率将 Token 数量转换为美元。
- 警报 (Alert) – 监控器观察滚动预算。其状态从 none(无警告)变为 warn(接近限制)再到 cap(达到限制)。
- 限流 (Throttle) – 闸门读取当前状态,当处于 cap 状态时,拦截任何新的任务调度。
预算窗口是一个滚动的五小时周期,这意味着系统始终查看最近五小时的支出,而不是固定的日历时间段。这使得循环能够对突发活动做出响应,并防止单次峰值导致集群被无限期锁定。
一个仅显示支出的仪表盘只是在讲述一个故事;而那个读取数值并停止调度的限流机制,才是真正的控制。
原生韧性设计
如果支出控制系统本身成为了单点故障,那将适得其反。我们构建了三种保障措施:
- 故障开放 (Fails open) – 如果预算工具崩溃,智能体将继续运行。支出可能无法被检查,但集群仍能保持运行。
- 手动绕过 (Manual bypass) – 操作员可以通过优先级通道覆盖限流机制,即使达到限制,也能让关键任务继续进行。
- 自动恢复 (Auto-resume) – 随着滚动窗口向前滑动,旧的支出会从计算中剔除。一旦总额降至限制以下,闸门会自动重新开启,无需人工干预。
测试:100 美元限制 vs 156 美元现有支出
我们在集群最近的活动已经产生了 156 美元支出的情况下,启动了 100 美元的限额系统。限流机制立即生效,停止了所有新任务。当我们把上限提高到 200 美元时,闸门重新开启,工作在无需进一步手动操作的情况下恢复。
实验证实了两件事:
- 控制循环实时响应;在检测到违规与执行限制之间没有延迟。
- 操作员可以即时调整限制,防止低优先级工作出现不必要的停机时间。
核心启示: 将智能体日志视为财务账本,并将滚动预算限流机制接入调度流水线,可以为防止超支提供即时且可强制执行的保障。这是一种低成本、高韧性的控制手段,即刻可用;后续可以添加更复杂的策略,但基础循环应该是任何 AI 智能体集群的第一道防线。
