PIVOT 是一种针对稀疏注意力模型的新型推理时技巧,它在不改动模型权重的情况下,将索引器成本降低了高达四倍,并将整体延迟缩减了约 1.6 倍。它的工作原理是对查询进行分组,并让单个“代理”查询承担大部分核心任务。

为什么稀疏注意力在 100K token 时会停滞不前

稀疏注意力的初衷是让 Transformer 模型能够处理极长的序列(例如 100K token 或更多),同时保持计算成本的可控性。但在实践中,一旦序列长度超过几万个 token,预期的加速效果就会消失。罪魁祸首是索引器,它需要对每个 token 与每个查询进行评分,以决定哪些 token 属于稀疏模式。其工作量随 $O(L^2)$($L$ = 序列长度)增长,因此在 100K token 时,仅索引器就会占据运行时间的大部分,从而抵消了稀疏性带来的任何收益。

PIVOT 背后的两项观察

研究人员发现,相邻查询几乎总是会选中相同的 top-k token——重叠率约为 90%。这意味着单个代表性查询可以替代一整批相邻查询,并且仍然能够筛选出有用的候选集。PIVOT 利用了这一点,通过以下方式实现:

  1. 分组固定数量的连续查询(大小为 $g$)。
  2. 对该组进行平均化处理,以创建一个代理查询。
  3. 仅对代理查询运行一次索引器,而不是为每个原始查询都运行一次。
  4. 为组内的每个成员细化代理查询的候选列表。

计算复杂度从 $O(L^2)$ 降至 $O(L^2 / g)$。当组大小为 8 时,索引器的全扫描次数减少了 8 倍。

两种运行模式

  • PIVOT-Refine 在保持稠密索引器准确性的同时,在索引器阶段提供约三倍的加速。
  • PIVOT-Reuse 进一步提升速度,通过牺牲少量的准确性来换取最大的吞吐量增益。

在 DeepSeek-V3.2 和 GLM-5.1 模型上的基准测试表明,在推理过程中应用 PIVOT 时,索引器速度稳定提升了四倍,端到端延迟缩减了约 1.6 倍。

即插即用的实现

该技术以参考实现的形式推出,可以集成到任何现有的动态稀疏注意力 (DSA) 流水线中。它不需要更改权重,因此使用标准稀疏注意力方案训练的模型可以无缝工作。唯一的注意事项是,参考代码运行在通用 GPU 内核上;在生产环境中部署时,需要使用手工调优的 Triton 或 CUDA 内核才能发挥全部的速度潜力。

权衡取舍

PIVOT-Reuse 的速度优势伴随着注意力质量的轻微下降,这对于那些对 token 选择精确度高度敏感的任务来说可能很重要。团队必须在性能损失与延迟预算之间进行权衡。此外,对自定义内核的需求也为缺乏 GPU 内核专业知识的组织增加了工程开销。

后续关注点

PIVOT 表明,通过巧妙的工作重排——即对查询进行分组并共享代理扫描——可以为真正的长上下文场景重现稀疏注意力的潜力,在无需承担重新训练成本的情况下,带来切实的加速效果。