DeepSeek 的 DSpark 框架现在可以让主流大语言模型在无需任何重新训练或质量损失的情况下,生成速度提升高达 85%。这一加速功能目前已通过 DeepSeek 的 API 提供,并作为一个开源的 MIT 许可库发布,任何人都可以将其集成到自己的部署中。
为什么推理速度在当下至关重要
到 2026 年,AI 的大部分计算预算将用于推理——即训练好的模型回答查询的阶段。随着企业从构建越来越大的模型转向大规模交付模型,延迟和硬件成本成为了决定性因素。更快的推理意味着更便宜的 GPU 集群、更低的云账单以及更具响应性的用户体验。
推测解码(Speculative Decoding)技巧
传统的生成方式是逐个 token 进行的:模型预测下一个词,然后是下一个,依此类推。这种顺序执行的方式拖慢了现代 GPU 的速度,因为 GPU 的优势在于并行计算。DSpark 通过推测解码绕过了这一瓶颈:
- 一个轻量级的“草稿”(draft)模型会提前预测多个 token。
- 主模型(规模大得多)会在单个批次中验证这些预测。
- 当草稿模型的猜测与主模型的预期一致时,系统会一次性输出整个批次,从而缩短了每个 token 的等待时间。
- 如果猜测错误,该批次将被拒绝并重复该过程,以确保最终输出与主模型独立生成的结果完全一致。
由于主模型仍然执行最终检查,生成的文本在质量和准确性上与纯粹的单 token 运行完全相同。
DSpark 目前支持的内容
- 在宽松的 MIT 许可下开源,因此团队可以进行审计、修改或嵌入,而不会遇到许可障碍。
- 兼容 DeepSeek、阿里巴巴的 Qwen 和 Google 的 Gemma,涵盖了一系列流行的开源 LLM 家族。
- 在现有硬件上即可获得即时的速度提升;用户报告推理速度提高了 60% 到 85%,这意味着在处理相同工作负载时所需的 GPU 时数更少。
- 减轻了升级到更新、更昂贵 GPU 的压力,这对初创公司和企业来说都是一个关键的成本杠杆。
如果您已经在使用 DeepSeek 的托管 API,DSpark 的优化将在后台运行。对于本地部署,GitHub 上的 DeepSpec 代码库提供了构建您自己的推测流水线所需的草稿模型基础设施。
总结
DSpark 证明了仅通过软件层面的调整,就能实现曾经认为需要更新硬件才能实现的延迟降低。通过公开提供推测解码技术,DeepSeek 将 AI 效率之战从“更大的芯片”转向了“更智能的代码”,让任何能够运行大模型的人都有机会以更快、更低廉的方式运行它。
