DeepMind 本周发布了 DiffusionGemma,这是一款开源权重语言模型,在单块 H100 GPU 上每秒可生成约 1,500 个 token,而标准的 Gemma 4 模型最高速度接近每秒 303 个 token。这种速度提升至关重要,因为它可能会缩小实时应用中 AI 驱动智能体(agents)的延迟瓶颈。

DiffusionGemma 如何打破逐个 token 生成的习惯

大多数现代语言模型采用自回归(autoregressively)方式生成文本:它们预测一个 token,将其反馈回模型,然后预测下一个。这种“从左到右”的循环导致了计算与内存之间的紧密耦合,因为每生成一个 token 都必须访问模型的权重。DiffusionGemma 用离散扩散过程(discrete diffusion process)取代了这种循环,将 256 个 token 的数据块视为一个单一的噪声数据块。随后,模型并行地对整个数据块进行去噪,将工作负载从重复的权重查找转变为每步进行更大规模的计算。在擅长并行数学运算的硬件(如 Nvidia 的 H100)上,这种权衡带来了回报。

为什么速度对 AI 智能体至关重要

自主智能体通常运行搜索、总结和测试的循环。每一步都可能涉及多次模型调用,因此任何单个 token 的延迟都会迅速累积。当模型停顿时,整个智能体流水线就会发生阻塞,从而增加成本并降低用户体验。

性能权衡

DiffusionGemma 的速度是以原始能力的显著下降为代价的。在 AIME 基准测试(一套衡量推理、事实性和语言理解能力的测试集)中,DiffusionGemma 得分为 69.1,而 Gemma 4 达到了 88.3。扩散方法在处理极短输出时也表现出弱点,并偶尔会出现 token “结巴”(stuttering)现象,即生成的文本重复或犹豫。当并发查询模型的用户超过约 32 人时,并行优势就会减弱,标准的自回归方法在整体吞吐量上会赶上来。

两种方法的适用场景

数据表明了一种混合部署策略:

  • 扩散模型适用于低并发、对延迟敏感且不需要深度推理的任务——例如生成短提示词、填充模板或生成草稿文本。
  • 自回归模型适用于高并发工作负载、复杂推理或准确性重于原始速度的长文本生成。

这一转变对 AI 基础设施意味着什么

如果通过重新思考生成算法而非仅仅扩大模型规模就能获得速度提升,那么最大的效率收益可能来自于“管路”(plumbing)层面的改进。这种权衡也意味着开发者必须在某些使用场景下接受质量的适度下降。

反方观点:扩散模型准备好进入主流市场了吗?

扩散实现的方案在处理短提示词时表现挣扎,并可能产生抖动的输出。

后续关注点

  • 规模化研究:更大的扩散模型能否在保持速度的同时缩小能力差距?
  • 硬件优化:随着 GPU 的演进,计算密集型的扩散步骤与权重密集型的自回归之间的平衡可能会再次发生变化。
  • 路由算法:任务感知型模型路由器的早期原型将揭示通过动态选择可以削减多少整体系统延迟。

总结

DiffusionGemma 证明了重新思考基础生成循环可以在不增加芯片数量的情况下大幅降低延迟。这项技术并不是自回归模型的全面替代品,但它为需要在每个任务中平衡速度与准确性的混合 AI 技术栈提供了一个极具吸引力的工具。下一波 AI 基础设施的评判标准可能不仅在于模型规模,还在于它如何巧妙地通过合适的引擎来调度工作。