PIVOT, nowa technika stosowana podczas wnioskowania (inference-time) dla modeli z rzadką uwagą (sparse-attention), obniża koszt indeksowania nawet czterokrotnie i skraca ogólne opóźnienie (latency) o około 1,6×, a wszystko to bez modyfikacji wag modelu. Działa ona poprzez grupowanie zapytań i pozwolenie jednemu zapytaniu „pośredniemu” (proxy) na wykonanie głównej pracy.
Dlaczego rzadka uwaga (sparse attention) traci wydajność przy 100 tys. tokenów
Rzadka uwaga miała umożliwić transformerom analizowanie bardzo długich sekwencji – rzędu 100 tys. tokenów lub więcej – przy zachowaniu przystępnych kosztów obliczeniowych. W praktyce obiecane przyspieszenie znika, gdy sekwencja przekracza kilkadziesiąt tysięcy tokenów. Winowajcą jest indeksator, który ocenia każdy token względem każdego zapytania, aby zdecydować, które tokeny powinny znaleźć się w rzadkim wzorcu (sparse pattern). Jego praca skaluje się jako O(L²) (gdzie L = długość sekwencji), więc przy 100 tys. tokenów sam indeksator dominuje czas wykonania i niweluje wszelkie korzyści płynące z rzadkości.
Dwa spostrzeżenia stojące za PIVOT
Badacze odkryli, że sąsiadujące zapytania niemal zawsze wybierają te same tokeny top-k – nakładanie się wynosi około 90%. Oznacza to, że pojedyncze reprezentatywne zapytanie może zastąpić całą partię sąsiednich zapytań i wciąż dostarczyć przydatny zestaw kandydatów. PIVOT wykorzystuje to poprzez:
- Grupowanie stałej liczby kolejnych zapytań (rozmiar g).
- Uśrednianie grupy w celu stworzenia zapytania pośredniego (proxy).
- Uruchomienie indeksatora raz na zapytaniu proxy zamiast raz dla każdego oryginalnego zapytania.
- Doprecyzowanie listy kandydatów zapytania proxy dla każdego członka grupy.
Złożoność obliczeniowa spada z O(L²) do O(L²/g). Przy rozmiarze grupy wynoszącym osiem, indeksator wykonuje osiem razy mniej pełnych skanów.
Dwa tryby działania
- PIVOT-Refine zachowuje dokładność gęstego indeksatora, zapewniając jednocześnie około trzykrotne przyspieszenie na etapie indeksowania.
- PIVOT-Reuse jeszcze bardziej zwiększa prędkość, poświęcając niewielką część dokładności na rzecz maksymalnego zysku przepustowości.
Benchmarki na modelach DeepSeek-V3.2 i GLM-5.1 wykazują stałe, czterokrotne przyspieszenie indeksatora oraz 1,6-krotne zmniejszenie opóźnienia end-to-end podczas stosowania PIVOT w procesie wnioskowania.
Implementacja typu plug-and-play
Technika ta jest dostarczana jako implementacja referencyjna, którą można wdrożyć w dowolnym istniejącym potoku Dynamic Sparse Attention (DSA). Nie wymaga ona zmian wag, więc modele trenowane przy użyciu standardowych metod rzadkiej uwagi działają bez zmian. Jedynym zastrzeżeniem jest to, że kod referencyjny działa na ogólnych jądrach (kernels) GPU; wdrożenia produkcyjne będą wymagały ręcznie optymalizowanych jąder Triton lub CUDA, aby osiągnąć pełny potencjał prędkości.
Jak wyglądają kompromisy
Przewaga prędkości PIVOT-Reuse wiąże się z niewielkim spadkiem jakości uwagi, co może mieć znaczenie w zadaniach bardzo wrażliwych na precyzyjny wybór tokenów. Zespoły muszą zestawić tę stratę z dostępnym budżetem opóźnień. Dodatkowo konieczność stosowania własnych jąder zwiększa nakład pracy inżynieryjnej dla organizacji nieposiadających specjalistycznej wiedzy w zakresie jąder GPU.
Co dalej?
PIVOT pokazuje, że sprytne przeorganizowanie pracy — grupowanie zapytań i współdzielenie skanowania pośredniego — może przywrócić obietnicę rzadkiej uwagi dla prawdziwie długich kontekstów, zapewniając wymierne zyski prędkości bez kosztów ponownego trenowania.
