本月我们的 AI 服务账单飙升至 $31,000——是预算的三倍多——原因仅仅是一行代码将大约 80% 的流量导向了最昂贵的模型 GPT-4o。
账单为何爆炸式增长
我们构建系统时追求的是可靠性:快速响应、零停机时间、平滑扩展。这种选择在 Token 使用上造成了典型的“内存泄漏”——Token 不断被消耗在一个对于大多数交互来说都过于冗余的模型上。
工程思维的转变:将成本视为架构问题
将 AI 开支视为财务问题会掩盖真正的杠杆:即决定每个请求由哪个模型运行的代码。将模型选择移至路由层,将一项隐藏开支转变为一个可控变量。
1. 模型与任务匹配
原则很简单:使用满足质量要求的最小模型。我们将四种常见的请求类型映射到了更便宜的替代方案:
- 简单聊天 → DeepSeek V4 Flash (节省 97.5%)
- 分类 → Qwen3-8B (节省 98.3%)
- 代码生成 → DeepSeek Coder (节省 97.5%)
- 摘要生成 → Qwen3-32B (节省 97.2%)
这些百分比反映了所选模型与 GPT-4o 之间直接的 Token 价格差距。权衡之处在于,对于不需要顶级推理能力的任务,其能力会有轻微下降。
2. 类似 CDN 的分层路由
我们构建了一个两层路由,首先将每个请求发送给廉价模型。如果响应未能通过快速质量检查(例如置信度低于阈值或缺失必要的实体),我们会自动将其重新路由到更高层级的模型。这种回退机制在保留用户体验的同时,仅在确实需要时才调用昂贵模型。
3. 缓存重复提示词
许多交互都会重复使用相同的系统提示词 (system prompt) 或 FAQ 文本。通过缓存这些输出,我们可以避免重新计算相同的响应。在我们的测试中,内存缓存将重复提示词的成本降低了约 30%。
4. 发送前压缩提示词
冗长的系统提示词消耗 Token 的速率与用户内容相同。我们增加了一个预处理器,对提示词运行一个廉价的摘要模型,在将其转发给昂贵模型之前,将其精简为核心上下文。仅这一步就每年节省了数千美元的 Token 开支。
实际影响
此前,一个聊天机器人的成本为每月 $420。在将 85% 的查询路由到更便宜的模型并应用缓存后,账单降至 $28。延迟也得到了改善,因为轻量级模型的响应速度更快,且回退路径极少被触发。
总结
将 AI 开支视为一项一等公民级别的架构决策。通过将请求路由到合适的模型、添加基于质量的回退机制、缓存重复提示词并压缩输入,你可以在保持可靠性的同时大幅削减成本。
