阿里巴巴的 Qwen2.5-Max 和 DeepSeek 的 V3-Flash 本周上市,两者在降低 AI 推理成本方面各辟蹊径。阿里巴巴通过其 2.4 万亿参数的混合专家(MoE)设计,每次查询仅激活约 950 亿参数;DeepSeek 则通过精简架构来大幅削减单 token 价格。AI 军备竞赛的衡量标准现在是每 token 的美元成本,而不仅仅是模型规模。

从“更多参数”转向“更低成本”

多年来,大语言模型(LLM)开发的核心指标一直是参数量。OpenAI、Google 等公司一直以突破万亿参数大关为荣,认为规模越大就越聪明。阿里巴巴和 DeepSeek 的表现表明,这种计算逻辑已经发生了转变。

阿里巴巴的 Qwen2.5-Max 仍然依赖规模,但它加入了一个节省成本的技巧。在稠密模型(dense model)中,每个参数都会在每次推理时运行,这使得一个 2.4 万亿参数的网络变成了一个耗能巨大的“巨兽”。MoE 则将网络拆分为许多“专家”,并将每个请求路由到其中的一个子集。Qwen2.5-Max 的路由机制在处理任何提示词时大约会选择 950 亿个参数,在保持延迟和能耗可控的同时,提供了万亿级参数系统的推理能力。

DeepSeek 则完全放弃了万亿参数的雄心。其 V3-Flash 模型旨在实现廉价、快速且大规模的运行。该公司围绕“超低推理价格”进行市场推广,目标客户是那些每天处理数百万 token 且不希望预算超支的开发者。虽然具体价格尚未披露,但其传达的信息很明确:如果初创公司负担不起西方厂商的单 token 费率,V3-Flash 将成为一个可行的替代方案。

为什么推理成本正成为竞争优势

当模型走出实验室进入生产环境时,推理成本变得至关重要。将 LLM 嵌入聊天机器人、文档分析流水线或推荐引擎的企业会迅速发现,token 级别的定价主导了运营支出。如果一个模型的单 token 成本降低一半,就可以为其他项目(如更多数据、更高流量或额外功能)增加一倍的预算。

这两家中国公司瞄准了不同的细分市场。阿里巴巴的 MoE 承诺为复杂、重推理的任务提供高性能,同时保持适度的单次请求计算预算。与此同时,DeepSeek 更精简的模型则吸引了高吞吐量、延迟敏感型的工作负载,在这些场景中,可预测的成本比单纯的算力更重要。

这两种策略都可能削弱那些将大模型与高昂定价捆绑销售的西方供应商的地位。如果开发者能以更便宜的 token 价格获得相当的效果,那么继续使用昂贵 API 的动力就会减弱。

对全球 AI 生态系统的影响

  • 初创公司与中小企业: 更低的推理成本降低了 AI 驱动产品的门槛。曾经需要额外资金支付 API 账单的团队,现在可以在更紧凑的预算下进行原型设计和发布。
  • 企业: 运行内部 AI 服务的跨国公司可以削减运营支出,从而腾出资金用于数据获取、模型微调或额外的计算资源。
  • 西方供应商: 他们的营收模式依赖于按 token 收费。向注重成本的替代方案转变,迫使他们要么降低价格,要么在廉价模型尚无法企及的能力上实现差异化。
  • 监管机构与政策制定者: 更实惠的 AI 可能会加速各行业的采用,从而引发关于监管、数据隐私和自动化速度的问题。

权衡与反论

像 Qwen2.5-Max 这样的 MoE 模型并非“免费午餐”。路由逻辑增加了工程复杂度,且稀疏激活(sparse activation)可能会导致不同查询类型之间的性能表现不均。如果路由出错,请求可能会调用次优的专家,从而降低输出质量。此外,硬件目前仍倾向于稠密计算;专门用于 MoE 推理的加速器尚未普及,这可能会限制实际的效率提升。

DeepSeek 的成本优先哲学也带有风险。激进的定价通常意味着对模型规模和训练数据的限制更严,这可能会限制性能上限。对于需要细微推理能力的应用程序,廉价模型可能会力不从心,从而迫使用户转向更大、更昂贵的替代方案。

最后,“单位美元的智能水平”只是竞争的一个维度。延迟、可靠性、生态系统支持以及对地区法规的合规性仍然是决定性因素。能够在这所有维度上提供平衡方案的公司,而非仅仅在价格战中获胜的公司,才可能最终主导市场。

下一步值得关注的方向

  • 基准测试发布: 对 Qwen2.5-Max 的 MoE 路由效率和 V3-Flash 的 token 成本进行独立评估,将揭示炒作是否能转化为可衡量的成本节省。
  • 硬件发展: 采用针对稀疏激活(sparse activation)优化的加速器可能会放大 MoE 的优势,而通用 GPU 则可能使稠密模型(dense models)保持竞争力。
  • 定价响应: 西方供应商可能会调整其定价层级,或增加诸如批量推理折扣或本地部署许可等节省成本的功能。
  • 监管举措: 随着更廉价的 AI 普及,政府可能会引入透明度和安全性的标准,这可能会影响这些模型的规模化部署方式。

核心观点

阿里巴巴由 MoE 驱动的 Qwen2.5-Max 和 DeepSeek 的低成本 V3-Flash 表明,AI 竞赛现在不仅取决于参数规模,还取决于预算表。那些在提供复杂语言能力的同时能保持低 token 成本的公司,将使 AI 面向更广泛的用户群体,从而重塑长期以来有利于规模最大、价格最昂贵模型的竞争格局。