Vercel 的 6 月份 Token 份额报告显示,开放权重模型处理了 29% 的网关 Token,高于 4 月份的 11%,其中仅 DeepSeek 一家就占到了该份额的 22.6%。这一增长标志着一种快速转变:开发者正在摆脱对单一“最佳”模型的依赖,转而将 AI 模型视为可路由的基础设施。

为什么开发者正将模型视为基础设施

廉价的开放权重模型——其中许多来自中国供应商——其成本仅为 Anthropic 等高端产品的零头。对于代码提取、文本清洗或简单数据查询等常规任务,即使准确率低几个百分点,使用成本仅为几美分而非几美元的模型也更具吸引力。

这种趋势催生了一种新的设计模式。应用程序首先将请求发送给低成本模型来处理“枯燥”的部分。如果输出通过了简单的质量检查,流水线继续执行;否则,将调用高价模型进行第二次处理或做出最终决定。此时,路由逻辑成为了关键环节,而不再是单一模型的选择。

数据说明了什么

Vercel 的数据源自其对接多个 AI 供应商的网关,显示开放权重模型正从边缘走向主流。在 4 月份,它们仅占所有 Token 的十分之一左右;到 6 月份,这一比例已接近三分之一。其中,中国模型 DeepSeek 贡献了超过五分之一的 Token 量。

高端模型仍然占据着支出的大头。例如,Anthropic 继续占据了大部分资金支出,因为其每 Token 的定价更高。其中的逻辑很简单:廉价模型赢得了高容量、低利润的工作,而昂贵模型则保留了高利润、高影响力的任务。

对 AI 智能体的影响

一个 AI 智能体通常执行一系列步骤:规划、数据检索、工具调用和结果优化。当每一步都能分配给最具成本效益的模型时,整体运营成本就会大幅下降。

  • 数据检索提取通常只需要基础的语言理解能力,这是廉价模型的强项。
  • 最终判断——即决定答案是否可接受的部分——仍属于具有更高可靠性的高端模型的领域。

这种分层方法让开发者能够在不超出预算的情况下实现更大规模的工作负载自动化。它也迫使开发者从“选择最佳模型”转向“衡量每一步的成功率并据此进行路由”。

风险与局限

尽管经济效益诱人,但这一转型并非毫无摩擦。

  • 合规性:某些司法管辖区实施严格的数据处理规则,这可能会限制使用海外托管模型的可能性。
  • 托管复杂性:大型高端模型难以在企业内部运行,因此组织必须依赖外部 API,这可能会增加延迟并引发供应商锁定(vendor-lock)的担忧。

由于这些因素,廉价模型不太可能完全取代高端模型。相反,它们将成为常规工作的默认选择,而高端模型则留在“决策层”,其较高的成本在这一层级是合理的。

下一步值得关注的方向

  • 路由工具:随着路由层变得越来越核心,我们可以预见将出现一波 SDK 和平台,它们能够根据延迟、成本和置信度阈值自动进行模型选择。

开始衡量任务级成功率、跟踪重试情况,并将“容量”工作与“判断”工作明确分开的开发者,将最能从这种新兴的基础设施思维中获益。

核心观点: AI 技术栈正在从单一的模型选择演变为一个路由问题:廉价的开放权重模型处理大部分工作,而高端模型则保留给高影响力的决策。掌握这种路由能力将成为 AI 构建者的下一个竞争优势。