PIVOT، sparse-attention ماڈلز کے لیے انفرنس ٹائم (inference-time) کی ایک نئی تکنیک ہے، جو ماڈل کے ویٹس (weights) کو تبدیل کیے بغیر انڈیکسر (indexer) کی لاگت کو چار گنا تک کم کر دیتی ہے اور مجموعی لیٹنسی (latency) کو تقریباً 1.6× تک کم کر دیتی ہے۔ یہ کوئریز (queries) کو گروپ کرنے اور ایک واحد "پروکسی" (proxy) کوئری کو تمام بھاری کام سونپنے کے ذریعے کام کرتی ہے۔

کیوں sparse attention 100K ٹوکنز پر رک جاتی ہے

Sparse attention کا مقصد ٹرانسفارمرز (transformers) کو بہت طویل تسلسل (sequences)—جیسے 100K ٹوکنز یا اس سے زیادہ—دیکھنے کی اجازت دینا تھا، جبکہ کمپیوٹ (compute) کو سستا رکھا جا سکے۔ عملی طور پر، جیسے ہی تسلسل چند ہزار ٹوکنز سے بڑھتا ہے، وعدہ کی گئی رفتار ختم ہو جاتی ہے۔ اس کی وجہ انڈیکسر ہے، جو یہ فیصلہ کرنے کے لیے کہ کون سے ٹوکنز sparse pattern میں شامل ہونے چاہئیں، ہر ٹوکن کو ہر کوئری کے ساتھ اسکور کرتا ہے۔ اس کا کام O(L²) (L = sequence length) کے حساب سے بڑھتا ہے، اس لیے 100K ٹوکنز پر صرف انڈیکسر ہی رن ٹائم (runtime) پر حاوی ہو جاتا ہے اور sparsity سے ملنے والے کسی بھی فائدے کو ختم کر دیتا ہے۔

PIVOT کے پیچھے دو مشاہدات

محققین نے پایا کہ متصل کوئریز (adjacent queries) تقریباً ہمیشہ ایک ہی top-k ٹوکنز کا انتخاب کرتی ہیں—تقریباً 90% اوورلیپ (overlap) ہوتا ہے۔ اس کا مطلب ہے کہ ایک واحد نمائندہ کوئری پڑوسیوں کے پورے بیچ (batch) کی جگہ لے سکتی ہے اور پھر بھی ایک مفید امیدوار سیٹ (candidate set) سامنے لا سکتی ہے۔ PIVOT اس کا فائدہ ان طریقوں سے اٹھاتی ہے:

  1. مسلسل کوئریز کی ایک مقررہ تعداد (سائز g) کو گروپ کرنا۔
  2. پروکسی کوئری بنانے کے لیے گروپ کی اوسط (averaging) نکالنا۔
  3. اصل کوئری کے لیے ایک ایک بار کے بجائے پروکسی پر انڈیکسر کو صرف ایک بار چلانا۔
  4. گروپ کے ہر رکن کے لیے پروکسی کی امیدوار فہرست کو ریفائن (refining) کرنا۔

ریاضی O(L²) سے کم ہو کر O(L²/g) ہو جاتی ہے۔ آٹھ کے گروپ سائز کے ساتھ، انڈیکسر آٹھ گنا کم فل اسکین (full scans) کرتا ہے۔

دو آپریشنل موڈز

  • PIVOT-Refine ڈینس انڈیکسر (dense indexer) کی درستگی برقرار رکھتا ہے جبکہ انڈیکسر مرحلے پر تقریباً تین گنا رفتار میں اضافہ کرتا ہے۔
  • PIVOT-Reuse رفتار کو مزید بڑھاتا ہے، اور زیادہ سے زیادہ تھرو پٹ (throughput) حاصل کرنے کے لیے تھوڑی سی درستگی کا سمجھوتہ کرتا ہے۔

DeepSeek-V3.2 اور GLM-5.1 ماڈلز پر بینچ مارکس (benchmarks) ظاہر کرتے ہیں کہ جب انفرنس کے دوران PIVOT کا استعمال کیا جاتا ہے، تو انڈیکسر کی رفتار میں مستقل چار گنا اضافہ اور اینڈ-ٹو-اینڈ (end-to-end) لیٹنسی میں 1.6× کمی آتی ہے۔

پلگ اینڈ پلے (Plug-and-play) امپلیمنٹیشن

یہ تکنیک ایک ریفرنس امپلیمنٹیشن (reference implementation) کے طور پر دستیاب ہے جسے کسی بھی موجودہ Dynamic Sparse Attention (DSA) پائپ لائن میں شامل کیا جا سکتا ہے۔ اس کے لیے ویٹس (weights) میں کسی تبدیلی کی ضرورت نہیں ہے، اس لیے معیاری sparse-attention طریقوں سے تربیت یافتہ ماڈلز بغیر کسی تبدیلی کے کام کرتے ہیں۔ واحد احتیاط یہ ہے کہ ریفرنس کوڈ عام GPU kernels پر چلتا ہے؛ مکمل رفتار حاصل کرنے کے لیے پروڈکشن ڈیپلائمنٹس (production deployments) میں ہینڈ ٹیون شدہ (hand-tuned) Triton یا CUDA kernels کی ضرورت ہوگی۔

ٹریڈ آفز (trade-offs) کیسے نظر آتے ہیں

PIVOT-Reuse کا رفتار کا فائدہ توجہ (attention) کے معیار میں معمولی کمی کے ساتھ آتا ہے، جو ان کاموں کے لیے اہم ہو سکتا ہے جو ٹوکن کے درست انتخاب کے حوالے سے انتہائی حساس ہوتے ہیں۔ ٹیموں کو اس نقصان کا موازنہ اپنے لیٹنسی بجٹ (latency budget) سے کرنا ہوگا۔ مزید برآں، کسٹم کرنلز (custom kernels) کی ضرورت ان اداروں کے لیے انجینئرنگ کا اضافی بوجھ (overhead) پیدا کرتی ہے جن کے پاس GPU-kernel کی مہارت نہیں ہے۔

آگے کیا دیکھنا ہے

PIVOT ظاہر کرتا ہے کہ کام کی ایک ہوشیار ترتیب—کوئریز کو گروپ کرنا اور ایک پروکسی اسکین شیئر کرنا—واقعی طویل سیاق و سباق (contexts) کے لیے sparse attention کے وعدے کو دوبارہ زندہ کر سکتی ہے، جو دوبارہ تربیت (retraining) کی لاگت کے بغیر ٹھوس رفتار کے فوائد فراہم کرتی ہے۔