Pandora AI 模型路由箱
DeepMind 的新论文提出了一种“潘多拉魔盒”(Pandora’s Box)框架,在保持任务性能不变的同时,将路由开销降低了高达 70%。
为什么路由成本至关重要
当服务收到请求时,通常会有一系列模型可供选择——有些模型速度快但精度粗糙,有些则速度慢但精度高。选择最佳模型需要消耗计算资源和资金。在确定哪个模型最合适之前,你必须进行快速测试、获取外部数据或调用辅助工具。
潘多拉魔盒类比
DeepMind 将路由问题映射到经典的“潘多拉魔盒”谜题上:每个模型都是一个密封的盒子,隐藏着它在当前查询下的表现。打开盒子需要消耗资源,因此你必须决定潜在的收益是否值得这笔开销。该框架将这种权衡进行了形式化,并提供了两种具体的机制。
Pandora’s Router —— 中心化决策者
路由器首先运行一个廉价且带有噪声的评估器,以衡量模型的潜力。只有当相对于当前最佳模型的预期改进超过预设的“保留价格”(reservation price)时,它才会支付费用进行更准确的评估。通过拒绝检查每一个模型,路由器在大幅削减检查预算的同时,依然能够筛选出表现最佳的选项。
Pandora’s Bidder —— 去中心化市场
在 Bidder 变体中,每个模型提供商都会决定是否花钱进行自我评估,以争取赢得合同。只有当提供商预期评估成本低于赢得合同的机会价值时,才会提交竞标。这创造了一个市场,只有在回报足够高时,昂贵的评估才会发生。
三个领域的测试结果
作者在以下三个领域测试了这两种机制:
- 数学推理 —— 选择能最准确解决问题的模型。
- 检索增强生成 (RAG) —— 在语言模型生成答案之前,选择能提供最相关上下文的检索系统。
- 大规模嵌入选择 (Embedding selection) —— 选择能为相似性搜索提供最佳向量表示的编码器。
在所有案例中,Pandora’s Router 记录了最低的“成本+误差”综合指标,击败了始终检查每个模型或完全不检查模型的基准方案。该系统能够自动适应:当检查成本上升时,它会减少检查的模型数量;当成本下降时,它会加强审查。据报告,路由开销可节省 30% 至 70%,且下游任务质量没有明显的下降。
核心启示: 随着推理预算的激增,决定何时停止寻找更好的模型,变得与选择模型本身同样重要。Pandora’s Box 将一项隐藏的开销转化为了一个可控的杠杆。
