PIVOT — это новый трюк для моделей с разреженным вниманием (sparse-attention) на этапе инференса, который снижает затраты на индексатор до четырех раз и сокращает общую задержку (latency) примерно в 1,6×, не затрагивая веса модели. Он работает за счет группировки запросов, позволяя одному «прокси-запросу» выполнять основную работу.
Почему разреженное внимание буксует на 100 K токенов
Разреженное внимание задумывалось как способ позволить трансформерам обрабатывать очень длинные последовательности — скажем, 100 K токенов и более — при сохранении доступных вычислительных затрат. На практике обещанное ускорение исчезает, как только длина последовательности превышает несколько десятков тысяч токенов. Виной всему индексатор, который оценивает каждый токен относительно каждого запроса, чтобы решить, какие токены должны входить в разреженную структуру. Его сложность масштабируется как O(L²) (L = длина последовательности), поэтому при 100 K токенов один только индексатор занимает большую часть времени выполнения, сводя на нет любые преимущества разреженности.
Два наблюдения, лежащих в основе PIVOT
Исследователи обнаружили, что соседние запросы почти всегда выбирают одни и те же top-k токенов — перекрытие составляет около 90 %. Это означает, что один репрезентативный запрос может заменить целую группу соседних запросов и при этом выдать полезный набор кандидатов. PIVOT использует это следующим образом:
- Группирует фиксированное количество последовательных запросов (размер g).
- Усредняет группу для создания прокси-запроса.
- Запускает индексатор один раз для прокси-запроса вместо запуска для каждого исходного запроса.
- Уточняет список кандидатов прокси-запроса для каждого участника группы.
Математическая сложность снижается с O(L²) до O(L² / g). При размере группы, равном восьми, индексатор выполняет в восемь раз меньше полных сканирований.
Два режима работы
- PIVOT-Refine сохраняет точность плотного индексатора, обеспечивая при этом примерно трехкратное ускорение на этапе индексации.
- PIVOT-Reuse еще больше увеличивает скорость, жертвуя небольшой долей точности ради максимального прироста пропускной способности.
Бенчмарки на моделях DeepSeek-V3.2 и GLM-5.1 показывают стабильное четырехкратное ускорение индексатора и сокращение сквозной (end-to-end) задержки в 1,6× при использовании PIVOT во время инференса.
Реализация по принципу «подключи и работай» (Plug-and-play)
Технология представлена в виде эталонной реализации, которую можно внедрить в любой существующий конвейер динамического разреженного внимания (Dynamic Sparse Attention, DSA). Она не требует изменения весов, поэтому модели, обученные с использованием стандартных методов разреженного внимания, работают без изменений. Единственный нюанс заключается в том, что эталонный код работает на стандартных GPU-кернелах; для достижения полного потенциала скорости в промышленной эксплуатации потребуются оптимизированные вручную кернелы Triton или CUDA.
В чем заключаются компромиссы
Преимущество PIVOT-Reuse в скорости сопровождается небольшим снижением качества внимания, что может быть критично для задач, чувствительных к точному выбору токенов. Командам придется сопоставлять эту потерю с допустимым бюджетом задержки. Кроме того, необходимость в кастомных кернелах создает дополнительную инженерную нагрузку на организации, не обладающие экспертизой в области разработки GPU-кернелов.
Что дальше
PIVOT показывает, что грамотное перераспределение работы — группировка запросов и использование общего прокси-сканирования — может вернуть перспективность разреженного внимания для действительно длинных контекстов, обеспечивая ощутимый прирост скорости без затрат на переобучение.
