DeepSeek 于 2026 年 9 月 14 日宣布,将停用其 V4-Pro 大语言模型 (LLM),并将所有 API 请求路由至更新的 V4.1-Flash 版本。
为什么 DeepSeek 要停用 V4-Pro
自发布以来,V4-Pro 一直是 DeepSeek 的顶级产品,被定位为具有广泛知识的通用型 LLM。在过去一年中,该公司针对其 API 客户关注的任务——代码生成、终端命令合成以及对短提示词的快速响应——对 V4.1-Flash 和 V4-Pro 进行了对比测试。数据显示,新模型运行速度更快,单次请求成本更低,并且在多个特定任务的基准测试中得分更高。
这一转变反映了市场压力。基于云端的 AI 服务现在按 token 或计算单元计费,开发者们正在寻找在不牺牲速度的情况下削减运营成本的方法。通过将所有流量转移到 V4.1-Flash,DeepSeek 可以关闭驱动 V4-Pro 的成本更高的推理流水线,并将节省下来的成本回馈给用户。
性能与成本一览
| 基准测试 | V4.1-Flash | V4-Pro |
|---|---|---|
| Terminal-Bench 2.1 (代码与命令生成) | 90.6 | 87.9 |
| Terminal-Bench 4.0 (复杂多步任务) | 31.2 | 12.4 |
| DeepSWE v1.1 (软件工程推理) | 74.2 | 62.7 |
在每项测试中,V4.1-Flash 的得分都更高,有时甚至优势明显。根据 DeepSeek 的内部对比,该模型在相同的以编程为核心的基准测试中,表现也优于 Claude Opus 5 和 GPT-5.6 Sol。
典型任务的成本也呈现出类似的模式:
- GLM-5.3-Flash: $0.25
- DeepSeek V4.1-Flash: $0.27
- Moonshot Kimi K3: $2.00
当开发者选择 Flash 版本而非更大、更昂贵的替代方案时,仅需约八分之一的费用即可获得相当的智能水平。
权衡:百科全书式的知识减少
效率的提升伴随着事实召回率的下降。在 SimpleQA-Verified 事实核查基准测试中,V4.1-Flash 得分为 42.3,而 V4-Pro 为 55.2。DeepSeek 将新模型描述为“更出色的工作者,但较弱的百科全书”。对于严重依赖最新世界知识的应用(如新闻摘要、法律研究),可能需要外部知识库或回退到更大的模型。
行业定位
DeepSeek 的全力投入与其它 AI 提供商形成了鲜明对比:
- Z.ai 提供从轻量级到大型的一系列模型,让客户可以根据每个项目的需求平衡规模与效率。
- Moonshot 通过其 Kimi K3 模型在规模上加倍下注,以更高的成本换取原始容量。
- DeepSeek 将所有 API 请求都转向 Flash,押注市场会优先考虑速度和价格,而非单纯的规模。
这些迥异的方法表明市场尚未形成单一路径。一些开发者仍然看重大型模型的知识广度;而另一些开发者则愿意为了更快速、更廉价的响应而做出妥协。
给开发者的实用建议
- 不要仅凭名称或 token 价格来选择模型。 在你关心的任务上,“Flash”模型可能会优于“Pro”模型。
- 在技术栈中构建灵活性。 设计你的系统,使其能够在不进行大规模重写的情况下,在不同的提供商或模型版本之间进行切换。
- 使用自己的数据进行验证。 公开的基准测试提供了有用的基准,但实际表现取决于你的工作负载。
遵循这些步骤有助于团队在 LLM 生态系统演进的过程中,避免被供应商锁定并确保获得最佳价值。
后续关注点
停用 V4-Pro 标志着向以效率为中心的 LLM 的明确转型。这究竟是标志着“旗舰”时代的终结,还是仅仅开启了快速变化市场的新阶段,仍有待观察;但保持敏捷的开发者将最有可能从这一变化中获益。
