Vercel 推出了 “AI Gateway Budgets”,这是一种针对单个项目和单个 API 密钥的支出上限功能,一旦达到预设限制,它会自动拦截后续的大语言模型 (LLM) 调用。该功能旨在防止因单个错误的循环或重试 Bug 而导致的 AI 成本失控。
为什么需要专门的 AI 专用熔断机制
使用 Vercel AI Gateway 的开发者通过 Vercel 的基础设施路由 LLM 请求,并为这些模型消耗的 Token 付费。单个提示词注入循环或配置错误的重试策略可能在几分钟内产生数千次 Token 请求,使原本适度的预算变成五位数的账单。Vercel 上现有的支出管理工具是在账户级别运行的,会限制所有出站流量,而不仅仅是 AI 调用。这种粗放的方式即使在只有 AI 使用出现问题时,也可能导致网站的前端或 API 瘫痪。
AI Gateway Budgets 与标准支出控制有何不同
- 范围 (Scope) – 预算仅适用于 AI Token 支出,不对账户的其他部分产生影响。
- 粒度 (Granularity) – 可以在团队、项目或单个 API 密钥级别设置限制。
- 行为 (Behavior) – 当达到限制时,网关会返回 HTTP 402 “Payment Required” 响应,表明请求因预算耗尽而被拦截。
- 隔离性 (Isolation) – 单个达到上限的项目不会耗尽团队剩余的额度,从而保护其他项目免受连带损害。
分钟级设置预算
Vercel 允许您通过 Web 控制台或命令行界面 (CLI) 配置预算。CLI 对于在多个环境中进行脚本化操作非常有用。
团队级限制(每月)
vercel ai-gateway budgets set team --limit 500 --refresh-period monthly
项目特定限制(每月)
vercel ai-gateway budgets set project my-project --limit 200 --refresh-period monthly
预算是叠加的,因此会执行两个上限中较紧的一个。如果项目达到了 200 美元的上限,即使团队仍有 300 美元余额,请求也会停止。
面向承包商的密钥
vercel ai-gateway api-keys create --name contractor \
--limit 50 --refresh-period none --expiration 30d
该密钥在 30 天后过期,并在 AI 支出达到 50 美元后停止,为外部贡献者提供了一个清晰、有时间限制的访问窗口。
限制功能的实际运作方式
- 软上限 (Soft cap) – 导致支出超过阈值的那个请求仍会完成,因此可能会有少量的超支。
- 执行延迟 (Enforcement lag) – 预算每隔一两分钟评估一次;在达到限制后立即进行的一波调用可能会在拦截生效前溜过去。
- 不覆盖 BYOK – 如果您使用自带的云提供商密钥 (BYOK) 直接向外部 LLM 提供商计费,Vercel 的预算系统无法看到该流量,因此上限不适用。
功能的优势与不足
该熔断机制是解决困扰许多 SaaS 团队的“AI 账单冲击”问题的务实方案。对于大多数依赖内置 AI Gateway 的 Vercel 托管项目,预算可以在不到十分钟内设置完毕,并为防止意外超支提供安全网。
然而,软上限的特性意味着短暂的激增仍可能导致超出限制几美元的支出。需要绝对硬性停止的团队可能会发现分钟级的延迟并不足够。此外,通过自有云凭据路由 LLM 流量的企业必须依赖外部成本控制机制,因为 Vercel 的预算系统无法监测到这些使用情况。
后续关注点
- 采用指标 – 开发者的早期反馈将表明预算粒度是否解决了最常见的成本超支场景。
- 功能扩展 – 对实时警报、更紧密的执行间隔或感知 BYOK 的上限的需求可能会塑造未来的更新。
- 竞争响应 – 其他无服务器平台可能会推出类似的 AI 特定支出控制,使 Vercel 的举措成为更广泛的行业标准。
总结
Vercel 的 AI Gateway Budgets 为开发者提供了一种快速的、按项目的方式,在 AI Token 支出膨胀成意外账单之前将其停止。该工具易于启用,工作在大多数成本失控事件发生的层级,并在违反限制时返回清晰的错误。其主要缺点——少量的超支、分钟级的执行延迟以及对 BYOK 流量的不可见性——都是透明的,让团队自行决定这种权衡是否符合其风险承受能力。对于任何在 Vercel 上运行 LLM 调用的人来说,这个新的熔断机制是值得立即配置的实用保障。
