PIVOT, seyrek dikkat modelleri için yeni bir çıkarım zamanı yöntemi olarak, modelin ağırlıklarına hiç dokunmadan indeksleyici maliyetini dört kata kadar düşürüyor ve toplam gecikmeyi yaklaşık 1,6 kat azaltıyor. Sorguları gruplandırarak ve tek bir "vekil" (proxy) sorgunun ağır iş yükünü üstlenmesini sağlayarak çalışıyor.

Seyrek dikkat neden 100 bin tokende tıkanıyor

Seyrek dikkat, hesaplama maliyetini uygun tutarken transformer'ların çok uzun dizilere —100 bin token veya daha fazlası gibi— bakabilmesini sağlamak amacıyla tasarlanmıştı. Uygulamada, dizi birkaç on bin token'ı geçtiğinde vaat edilen hızlanma ortadan kalkıyor. Bunun asıl nedeni, hangi token'ların seyrek desene ait olduğuna karar vermek için her bir token'ı her bir sorguyla karşılaştırıp puanlayan indeksleyicidir. İş yükü O(L²) (L = dizi uzunluğu) şeklinde ölçeklenir; bu nedenle 100 bin token seviyesinde sadece indeksleyici çalışma süresini domine eder ve seyrekliğin sağladığı tüm avantajları yok eder.

PIVOT'un arkasındaki iki gözlem

Araştırmacılar, ardışık sorguların neredeyse her zaman aynı top-k token'ları seçtiğini —yaklaşık %90 örtüşme— fark ettiler. Bu, tek bir temsili sorgunun tüm bir komşu grubunun yerini tutabileceği ve yine de yararlı bir aday seti sunabileceği anlamına gelir. PIVOT bundan şu şekilde yararlanır:

  1. Sabit sayıda ardışık sorguyu gruplandırarak (boyut g).
  2. Bir vekil sorgu oluşturmak için grubu ortalayarak.
  3. İndeksleyiciyi her orijinal sorgu için bir kez çalıştırmak yerine, vekil sorgu üzerinde bir kez çalıştırarak.
  4. Grubun her bir üyesi için vekilin aday listesini iyileştirerek.

Matematiksel karmaşıklık O(L²)'den O(L²/g)'ye düşer. Sekizlik bir grup boyutuyla, indeksleyici sekiz kat daha az tam tarama yapar.

İki çalışma modu

  • PIVOT-Refine, yoğun indeksleyicinin doğruluğunu korurken indeksleme aşamasında yaklaşık üç kat hız artışı sağlar.
  • PIVOT-Reuse, maksimum verim artışı için az miktarda doğruluktan feragat ederek hızı daha da ileriye taşır.

DeepSeek-V3.2 ve GLM-5.1 modelleri üzerindeki kıyaslamalar, çıkarım sırasında PIVOT uygulandığında indeksleyicide tutarlı bir dört kat hızlanma ve uçtan uca gecikmede 1,6 kat azalma göstermektedir.

Tak-çalıştır uygulama

Bu teknik, mevcut herhangi bir Dynamic Sparse Attention (DSA) iş akışına dahil edilebilecek bir referans uygulama olarak sunulmaktadır. Herhangi bir ağırlık değişikliği gerektirmez, bu nedenle standart seyrek dikkat yöntemleriyle eğitilen modeller değişmeden çalışır. Tek kısıtlama, referans kodun genel GPU çekirdekleri (kernels) üzerinde çalışmasıdır; tam hız potansiyeline ulaşmak için üretim ortamındaki dağıtımlarda elle optimize edilmiş Triton veya CUDA çekirdeklerine ihtiyaç duyulacaktır.

Tavizler neye benziyor

PIVOT-Reuse'un hız avantajı, tam token seçimine karşı son derece hassas olan görevler için önemli olabilecek dikkat kalitesinde mütevazı bir düşüşle birlikte gelir. Ekipler bu kaybı gecikme bütçeleriyle tartmalıdır. Ayrıca, özel çekirdeklere duyulan ihtiyaç, GPU çekirdeği uzmanlığı olmayan kuruluşlar için mühendislik yükünü artırır.

Sırada ne var

PIVOT, işin akıllıca bir şekilde yeniden düzenlenmesinin —sorguları gruplandırmak ve bir vekil taramayı paylaşmak— yeniden eğitim maliyetine katlanmadan somut hız kazanımları sağlayarak, gerçekten uzun bağlamlar için seyrek dikkatin vaadini yeniden canlandırabileceğini göstermektedir.