为什么账单会爆炸式增长

当团队最初引入生成式 AI 时,他们会将每个用户请求都发送给最新、最强大的模型。随着流量增长,单次请求的成本也随之同步上升,CFO 的电子表格显示,支出增长速度已经超过了用户增长速度。通常的权宜之计——“只用更便宜的模型”——在生产环境中行不通,因为不同的查询需要不同程度的推理能力。真正的杠杆在于请求是“如何”发送的,而不是“始终使用哪种”模型。

构建一个省钱的路由层

工程师将推理服务视为任何其他生产组件来对待:定义层级、设置 SLA,并执行延迟预算。最终构建的架构包含四个活动部分,共同实现了 95% 的成本降幅。

分层路由

一个轻量级的前端根据难度对每个传入请求进行分类。大约 95% 的查询会进入运行基础模型的“廉价”层级;只有最困难的 5% 会被升级到高级模型。分类可以基于规则(例如:长度、是否存在特定领域的关键词),也可以从历史升级数据中学习。通过默认使用低成本层级,聊天机器人的月度成本从 420 美元降至 28 美元。

模型规格匹配

将模型能力与任务复杂度相匹配可以带来最大的节省:

  • 简单对话 – 使用轻量级模型而非旗舰模型(节省 97.5%)。
  • 分类 – 将中型模型更换为更便宜的替代方案(节省 98.3%)。
  • 摘要 – 用中端模型替换顶级模型(节省 97.2%)。

具体的模型名称并不关键;核心原则是将最强大的模型保留给少数真正需要它的查询。

智能缓存

每一次缓存命中都能减少一次网络调用并节省一次 API 费用。一个分布式的 Redis 缓存存储了成功的响应以及“否定”回答(如“我不知道”)。当同一个无法回答的问题再次出现时,系统会返回缓存的“我不知道”,而不是再次调用模型。在数千次请求中,仅此一项就能显著削减账单金额。

提示词压缩

冗长的提示词(Prompt)会驱动 Token 使用量,这直接转化为成本。团队在客户端或预处理步骤中运行一个廉价的摘要器,在请求到达昂贵模型之前,将 2,000 token 的上下文压缩到约 400 token。Token 数量的减少会在所有请求中产生乘数效应,在不改变最终用户体验的情况下实现巨额节省。

策略性批处理

批处理将多个独立的请求组合成单次 API 调用。经验法则很简单:如果用户正在等待答案,请不要进行批处理;如果请求在后台运行(如夜间报告、定时任务),则对所有请求进行批处理。仅夜间的批处理任务就又削减了 10-20% 的支出。

监控优化闭环

无法衡量,就无法改进。工程师设置了四个每周指标:

  1. 按层级细分的单次请求成本。
  2. 每个路由路径的缓存命中率。
  3. 从低成本层级升级到高级层级的比例。
  4. 每个客户细分群体的支出。

这些数据可以揭示偏差——例如,升级率上升可能表明分类逻辑过于激进,或者廉价模型的质量已经下降。团队每周会对阈值、模型分配和缓存策略进行迭代,将成本控制变成一种习惯,而不是危机应对。

核心要点

一个规范的路由层——通过对请求进行分类、进行模型规格匹配、进行激进的缓存、压缩提示词并对后台工作进行批处理——可以在保持高可靠性的同时,将 AI API 支出削减高达 95%。将推理栈视为生产级服务:定义层级、衡量结果并每周进行迭代。