一项针对 20 个大语言模型 (LLM) 的最新基准测试显示,到 2026 年,没有任何单一模型能在所有工作负载中占据主导地位。将每个任务路由给专家模型可以降低成本并提高交付速度。该研究对比了 Anthropic、OpenAI、Google、xAI、Meta 以及几家中国实验室,发现选择错误的模型会浪费金钱和时间。
为什么单一 LLM 不再奏效
一年前,大多数开发者会选择一个模型来处理所有事情——从编写代码到研究问答。专门为编程、工具编排、深度推理和极致性价比而构建的模型之间的差距已经拉大到足以让“一刀切”的方法弊大于利。
基准测试是如何构建的
我在所有 20 个模型上运行了相同的任务集,忽略了厂商的营销宣传,专注于独立且可复现的数据。任务分为四个类别:
- 编程与自主性 – 生成生产级代码,处理智能体循环 (agentic loops)。
- 工具使用与编排 – 调用外部 API,操作文件,驱动计算机。
- 推理与科学 – 解决数学问题,解读研究数据。
- 价值 – 以尽可能低的成本提供可接受的质量。
生成的矩阵让工程师能够根据任务的特征匹配模型的优势,而不是默认选择知名度最高的模型。
各类别中的领先模型
编程与自主性 – Claude Opus 5 和 Fable 5 始终位居榜首,能以最少的重试次数处理复杂的代码生成和多步循环。GPT-5.6 Sol 紧随其后,在排名前二的模型不可用时提供了可靠的备选方案。
工具使用与编排 – Meta 的 Muse Spark 1.1 在调用外部工具方面表现最可靠,而 Gemini 3.6 Flash 则在纯计算机使用场景(如电子表格操作和 UI 自动化)中表现出色。
推理与科学 – GPT-5.6 Sol 和 Gemini 3.1 Pro 是数学和研究的首选。
极致价值 – 开源权重 (Open-weight) 的中国模型——GLM-5.2 和 DeepSeek V4——以旗舰模型极小部分的每 token 价格达到了前沿水平的质量。能够容忍细微打磨程度下降的团队可以获得最高的性价比。
开源权重领导者 – Kimi K3 目前是发布最强的开源模型。Meta 的 Llama 4 已落后。
结论:对于特定的任务,“最聪明”的模型并不总是最经济或最快的。
生产系统的路由策略
- 路由,而非标准化 – 将模型选择视为动态决策,而非静态默认值。
- 默认低成本,失败后升级 – 从能处理该任务的最低成本模型开始;如果失败,则回退到更高层级的模型。
- 将规划者与执行者分离 – 使用强大的推理模型(例如 Opus 5)将问题分解为多个步骤,然后将重复性的子任务交给更便宜的执行器(例如 Gemini Flash)。
- 衡量成功率,而非仅仅是 token 使用量 – 一个需要重试三次的廉价模型,其成本可能比一个第一次就做对的高价模型还要高。
下一步关注点
开发者应将路由图视为一份动态文档,并随着每一次重大版本发布重新审视模型选择。
总结
到 2026 年,竞争优势将属于那些将 LLM 视为“工具箱”而非“单把瑞士军刀”的团队。通过将任务与擅长该任务的模型相匹配,企业可以在更快交付结果的同时,削减 AI 支出。真正的胜利不在于出现一个新的明星模型,而在于拥有一套严谨的路由策略,将正确的智能应用在最需要的地方。
