大语言模型的定价表面上看非常简单:按 token 付费。但任何运行生产负载的人都知道,现实情况要复杂得多。费率会在毫无预兆的情况下发生变化。计费层级会被重组。这里消失的一点点钱,那里又会重新出现,突然间你的月度支出就增加了 20%。这就是为什么 Ambient、Novita 和 StreamLake 这三家供应商最近的定价更新值得你立即关注。如果你正在使用这些平台中的任何一个,你上个月预算的数字已经不再可靠了。

Token 经济学背后的隐形成本

大多数开发者只盯着基础费率。输入 token 花多少钱,输出 token 花多少钱,故事就结束了。事实并非如此。LLM 集成的真实成本包括重试逻辑、仍会计费的失败请求、上下文窗口填充,以及每一轮都会消耗输入配额的系统提示词。当供应商更新定价时,他们很少会均匀地提高所有费率。有时输入变便宜了,而输出变贵了;有时长上下文模型会进入一个单独的层级;有时变化根本不在于单 token 费率,而是在于最低计算费用或批量处理折扣。

如果你为团队管理成本,你需要将这些更新视为基础设施事件,而非微不足道的脚注。定价页面就是一份以美元书写的服务水平协议 (SLA)。当它发生变化时,你的架构可能也需要随之改变。

Ambient 的定价更新

Ambient 调整了其模型定价,这意味着你针对其端点运行的任何集成都需要重新审视。从显而易见的地方开始:将新的输入和输出费率与你上一份账单进行对比。不要凭记忆。将两个页面并排打开。

特别留意上下文窗口 (context-window) 的定价。一些供应商在 4K token 以内收取统一费率,然后在 8K、32K 或 128K 的边界处阶梯式提价。如果 Ambient 收紧了这些层级或增加了新层级,你的长文档摘要任务成本可能会突然比问答机器人高得多。还要检查他们是否更改了对“输出 token”的定义。有些供应商将内部推理或工具调用 (tool-calling) 的 token 计为输出,而有些则不计。这种模糊性会迅速演变成账单惊喜。

如果你正在缓存响应,请验证 Ambient 是否更改了其缓存命中 (cache hit) 的定价。一些供应商会对重复的提示词提供折扣。如果该折扣缩减了,你的去重策略可能需要加强。

Novita 的推理费率

Novita 作为一个推理平台运行,开发者可以通过统一的端点访问各种模型。这种便利性很有价值,但也意味着定价变化可能会同时波及多个模型系列。Novita 更新后的定价可能会影响从小型嵌入模型 (embedding models) 到大型推理引擎的所有内容。

调取你的使用日志并按模型进行分组。Novita 可能保持了通用聊天模型的费率不变,但提高了视觉或代码特定变体的费率。或者,他们可能引入了区域定价,将你的欧洲流量路由到更昂贵的节点。如果你的应用程序中硬编码了模型选择,那么某个模型的涨价可能会让一个速度稍慢的替代方案成为更理性的选择。

关注吞吐量费用。像 Novita 这样的平台有时会将 token 成本与交付速度分开。如果你正在为优质的低延迟端点付费,请检查该附加费是否增加。对于批量或离线工作负载,