PIVOT, een nieuwe techniek tijdens de inferentie voor sparse-attention modellen, verlaagt de kosten van de indexer met wel een factor vier en vermindert de totale latentie met ongeveer 1,6×, allemaal zonder de gewichten van het model aan te passen. Het werkt door queries te groeperen en één enkele "proxy"-query het zware werk te laten doen.
Waarom sparse attention vastloopt bij 100K tokens
Sparse attention was bedoeld om transformers naar zeer lange sequenties te laten kijken — denk aan 100K tokens of meer — terwijl de rekenkracht betaalbaar blijft. In de praktijk verdampt de beloofde versnelling zodra de sequentie groter wordt dan enkele tienduizenden tokens. De boosdoener is de indexer, die elk token scoort tegenover elke query om te bepalen welke tokens in het sparse-patroon thuishoren. De werklast schaalt als O(L²) (L = sequentielengte), waardoor bij 100K tokens de indexer alleen al de runtime domineert en elk voordeel van sparsity tenietdoet.
De twee observaties achter PIVOT
Onderzoekers ontdekten dat aangrenzende queries bijna altijd dezelfde top-k tokens kiezen — een overlap van ongeveer 90%. Dat betekent dat een enkele representatieve query kan fungeren voor een hele batch buren en nog steeds een nuttige set kandidaten kan naar boven halen. PIVOT maakt hier gebruik van door:
- Groeperen van een vast aantal opeenvolgende queries (grootte g).
- Gemiddelden berekenen van de groep om een proxy-query te creëren.
- De indexer één keer uitvoeren op de proxy in plaats van één keer per originele query.
- De kandidatenlijst van de proxy verfijnen voor elk lid van de groep.
De complexiteit daalt van O(L²) naar O(L²/g). Met een groepsgrootte van acht voert de indexer acht keer minder volledige scans uit.
Twee werkingsmodi
- PIVOT-Refine behoudt de nauwkeurigheid van de dense indexer, terwijl het een versnelling van ongeveer factor drie oplevert in de indexeringsfase.
- PIVOT-Reuse drijft de snelheid nog verder op, waarbij een klein beetje nauwkeurigheid wordt opgeofferd voor de maximale winst in doorvoersnelheid.
Benchmarks op de DeepSeek-V3.2 en GLM-5.1 modellen laten een consistente viervoudige versnelling van de indexer zien en een reductie van 1,6× in de end-to-end latentie wanneer PIVOT wordt toegepast tijdens de inferentie.
Plug-and-play implementatie
De techniek wordt geleverd als een referentie-implementatie die kan worden toegevoegd aan elke bestaande Dynamic Sparse Attention (DSA) pipeline. Er zijn geen wijzigingen in de gewichten nodig, dus modellen die zijn getraind met standaard sparse-attention-recepten werken ongewijzigd. Het enige nadeel is dat de referentiecode draait op generieke GPU-kernels; voor productie-omgevingen zijn handmatig afgestemde Triton- of CUDA-kernels nodig om het volledige snelheidspotentieel te benutten.
Hoe de afwegingen eruitzien
Het snelheidsvoordeel van PIVOT-Reuse gaat gepaard met een bescheiden daling in de kwaliteit van de attention, wat van belang kan zijn voor taken die zeer gevoelig zijn voor de exacte selectie van tokens. Teams moeten dit verlies afwegen tegen hun latentiebudget. Daarnaast zorgt de noodzaak voor aangepaste kernels voor extra engineering-overhead voor organisaties zonder expertise in GPU-kernels.
Waar we de komende tijd op moeten letten
PIVOT laat zien dat een slimme herordening van het werk — het groeperen van queries en het delen van een proxy-scan — de belofte van sparse attention voor echt lange contexten kan doen herleven, met tastbare snelwinsten zonder de kosten van hertraining.
