AI 路由的潘多拉魔盒

DeepMind 发布了 “Pandora’s Router”,这是一个将模型选择视为“成本感知型潘多拉魔盒问题”的框架。通过仅为那些能实际改善结果的信息付费,该系统在保持结果与穷举搜索相当的同时,大幅削减了推理开销。

为什么模型选择并非免费

生产流水线通常假设选择模型的步骤是零成本的。实际上,评估模型的适用性会消耗计算资源、内存,有时还需要调用外部数据。快速且带有噪声的评估虽然便宜,但可能会产生误导;而精确的评估通常意味着需要运行一个较小的模型或获取额外的上下文,这会累积成本。

DeepMind 的论文重新定义了这一困境。每个候选模型都隐藏着一个“价值”——即它对当前查询的预期表现。该框架允许控制器支付费用来窥探该价值,一旦进一步获取信息的收益不再能抵消其成本,便停止付费。

解决方案的两部分

  • Pandora’s Router —— 一个中心化引擎,针对每个请求,决定是否为更准确的模型价值评估付费。它设定了一个“保留价格”(reserve price):即如果更准确评估带来的预期收益低于该价格,则不进行评估。当预期的改进超过保留价格时,引擎会购买该信息;否则,它将使用现有的最佳猜测进行处理。

  • Pandora’s Bidder —— 模型市场中的去中心化对应组件。独立的供应商在提交竞价之前,会决定是否投入计算资源来优化自身的价值评估。他们自己的保留价格确保了只有在优化后的评估极有可能中标时才会进行投入。

这两个部分遵循相同的原则:只有当预期的回报超过信息成本时,才为信息付费。

三个领域的测试结果

作者在三种工作负载上测试了该方法:

  1. 数学推理 —— 在不同精度的求解器中进行选择。
  2. 检索增强生成 (RAG) —— 在不同的知识库查询策略之间进行选择。
  3. 大规模嵌入模型 —— 为相似度搜索选择最佳编码器。

在所有情况下,Pandora’s Router 的表现都优于静态路由规则和贪婪启发式算法。在最困难的场景下,它在避免了大部分检查成本的同时,达到了与穷举扫描所有模型相当的质量。作者报告称节省了“大部分检查成本”,这意味着计算开销大幅降低。

这对 AI 工程意味着什么

  • 不要忽视路由开销。 决定使用哪个模型是有明确成本的。
  • 引入保留价格。 为“额外信息是否值得其费用”设定一个明确的界限。
  • 采用成本感知路由。 随着模型库的扩大,一个能够平衡预期收益与支出的决策层可以有效控制预算。

反方观点:增加的复杂性

增加竞价或路由层会带来权衡。团队必须维护计算保留价格的逻辑、监控费用结构,并确保额外的代码路径不会成为瓶颈。对于只有少量模型的微型部署,Pandora’s Router 的成本可能会超过其节省的成本。此外,该框架假设获取更准确评估的成本是已知且稳定的——这一假设在波动的云定价或竞价实例(spot-instance)中断的情况下可能会失效。

核心启示

将模型选择视为一项经济决策,而非免费的路由步骤。Pandora’s Router 表明,一种严谨的、具备成本意识的方法可以在不牺牲输出质量的前提下削减不必要的计算,从而保持 AI 系统的可扩展性和财务可持续性。