PIVOT, un nuevo truco en tiempo de inferencia para modelos de atención dispersa (sparse-attention), reduce el coste del indexador hasta cuatro veces y recorta la latencia general en aproximadamente 1,6×, todo ello sin tocar los pesos del modelo. Funciona agrupando consultas (queries) y permitiendo que una única consulta "proxy" realice el trabajo pesado.
Por qué la atención dispersa se estanca a los 100 K tokens
La atención dispersa fue concebida para permitir que los transformers procesen secuencias muy largas —pensemos en 100 K tokens o más— manteniendo un coste computacional asequible. En la práctica, la aceleración prometida se evapora una vez que la secuencia supera unas pocas decenas de miles de tokens. El culpable es el indexador, que puntúa cada token frente a cada consulta para decidir qué tokens pertenecen al patrón disperso. Su trabajo escala como O(L²) (L = longitud de la secuencia), por lo que, a los 100 K tokens, el indexador por sí solo domina el tiempo de ejecución y erosiona cualquier beneficio de la dispersión.
Las dos observaciones detrás de PIVOT
Los investigadores descubrieron que las consultas adyacentes casi siempre eligen los mismos tokens top-k (con un solapamiento de aproximadamente el 90 %). Eso significa que una única consulta representativa puede sustituir a todo un lote de vecinas y seguir extrayendo un conjunto de candidatos útil. PIVOT aprovecha esto mediante:
- Agrupar un número fijo de consultas consecutivas (tamaño g).
- Promediar el grupo para crear una consulta proxy.
- Ejecutar el indexador una sola vez en la proxy en lugar de una vez por cada consulta original.
- Refinar la lista de candidatos de la proxy para cada miembro del grupo.
Las matemáticas pasan de O(L²) a O(L²/g). Con un tamaño de grupo de ocho, el indexador realiza ocho veces menos escaneos completos.
Dos modos de funcionamiento
- PIVOT-Refine mantiene la precisión del indexador denso mientras ofrece un aumento de velocidad de aproximadamente tres veces en la etapa del indexador.
- PIVOT-Reuse lleva la velocidad aún más lejos, sacrificando una pequeña cantidad de precisión para obtener la máxima ganancia de rendimiento (throughput).
Las pruebas de rendimiento (benchmarks) en los modelos DeepSeek-V3.2 y GLM-5.1 muestran una aceleración constante del indexador de cuatro veces y una reducción de 1,6× en la latencia de extremo a extremo cuando se aplica PIVOT durante la inferencia.
Implementación plug-and-play
La técnica llega como una implementación de referencia que puede integrarse en cualquier pipeline de Dynamic Sparse Attention (DSA) existente. No requiere cambios en los pesos, por lo que los modelos entrenados con recetas estándar de atención dispersa funcionan sin cambios. La única advertencia es que el código de referencia se ejecuta en kernels de GPU genéricos; los despliegues de producción necesitarán kernels de Triton o CUDA ajustados manualmente para alcanzar todo su potencial de velocidad.
Cómo son las compensaciones (trade-offs)
La ventaja de velocidad de PIVOT-Reuse conlleva un ligero descenso en la calidad de la atención, lo que puede ser relevante para tareas altamente sensibles a la selección exacta de tokens. Los equipos deben sopesar esa pérdida frente a su presupuesto de latencia. Además, la necesidad de kernels personalizados añade una carga de ingeniería para las organizaciones que no cuentan con experiencia en kernels de GPU.
Qué esperar a continuación
PIVOT demuestra que un reordenamiento inteligente del trabajo —agrupar consultas y compartir un escaneo proxy— puede resucitar la promesa de la atención dispersa para contextos verdaderamente largos, ofreciendo ganancias de velocidad tangibles sin el coste de un reentrenamiento.
