DeepSeek 于 2026 年 9 月 14 日宣布,将停用其 V4-Pro 大语言模型 (LLM),并将所有 API 请求路由至更新的 V4.1-Flash 版本。

为什么 DeepSeek 要停用 V4-Pro

自发布以来,V4-Pro 一直是 DeepSeek 的顶级产品,被定位为具有广泛知识的通用型 LLM。在过去一年中,该公司针对其 API 客户关注的任务——代码生成、终端命令合成以及对短提示词的快速响应——对 V4.1-Flash 和 V4-Pro 进行了对比测试。数据显示,新模型运行速度更快,单次请求成本更低,并且在多个特定任务的基准测试中得分更高。

这一转变反映了市场压力。基于云端的 AI 服务现在按 token 或计算单元计费,开发者们正在寻找在不牺牲速度的情况下削减运营成本的方法。通过将所有流量转移到 V4.1-Flash,DeepSeek 可以关闭驱动 V4-Pro 的成本更高的推理流水线,并将节省下来的成本回馈给用户。

性能与成本一览

基准测试 V4.1-Flash V4-Pro
Terminal-Bench 2.1 (代码与命令生成) 90.6 87.9
Terminal-Bench 4.0 (复杂多步任务) 31.2 12.4
DeepSWE v1.1 (软件工程推理) 74.2 62.7

在每项测试中,V4.1-Flash 的得分都更高,有时甚至优势明显。根据 DeepSeek 的内部对比,该模型在相同的以编程为核心的基准测试中,表现也优于 Claude Opus 5 和 GPT-5.6 Sol。

典型任务的成本也呈现出类似的模式:

  • GLM-5.3-Flash: $0.25
  • DeepSeek V4.1-Flash: $0.27
  • Moonshot Kimi K3: $2.00

当开发者选择 Flash 版本而非更大、更昂贵的替代方案时,仅需约八分之一的费用即可获得相当的智能水平。

权衡:百科全书式的知识减少

效率的提升伴随着事实召回率的下降。在 SimpleQA-Verified 事实核查基准测试中,V4.1-Flash 得分为 42.3,而 V4-Pro 为 55.2。DeepSeek 将新模型描述为“更出色的工作者,但较弱的百科全书”。对于严重依赖最新世界知识的应用(如新闻摘要、法律研究),可能需要外部知识库或回退到更大的模型。

行业定位

DeepSeek 的全力投入与其它 AI 提供商形成了鲜明对比:

  • Z.ai 提供从轻量级到大型的一系列模型,让客户可以根据每个项目的需求平衡规模与效率。
  • Moonshot 通过其 Kimi K3 模型在规模上加倍下注,以更高的成本换取原始容量。
  • DeepSeek 将所有 API 请求都转向 Flash,押注市场会优先考虑速度和价格,而非单纯的规模。

这些迥异的方法表明市场尚未形成单一路径。一些开发者仍然看重大型模型的知识广度;而另一些开发者则愿意为了更快速、更廉价的响应而做出妥协。

给开发者的实用建议

  1. 不要仅凭名称或 token 价格来选择模型。 在你关心的任务上,“Flash”模型可能会优于“Pro”模型。
  2. 在技术栈中构建灵活性。 设计你的系统,使其能够在不进行大规模重写的情况下,在不同的提供商或模型版本之间进行切换。
  3. 使用自己的数据进行验证。 公开的基准测试提供了有用的基准,但实际表现取决于你的工作负载。

遵循这些步骤有助于团队在 LLM 生态系统演进的过程中,避免被供应商锁定并确保获得最佳价值。

后续关注点

停用 V4-Pro 标志着向以效率为中心的 LLM 的明确转型。这究竟是标志着“旗舰”时代的终结,还是仅仅开启了快速变化市场的新阶段,仍有待观察;但保持敏捷的开发者将最有可能从这一变化中获益。