SGLang کے RadixAttention نے ڈوئل-RTX 3090 سسٹم پر warm-up time-to-first-token کو کم کر کے 68 ms کر دیا، جبکہ vLLM کا PagedAttention 184 ms پر رہا—یہ 82.9% کا لیٹنسی (latency) فرق ہے جو ملٹی ٹرن ایجنٹ (multi-turn agent) کے تعاملات کو نمایاں طور پر ہموار بناتا ہے۔

دونوں پروجیکٹس لارج لینگویج ماڈل (LLM) انفرنس (inference) کی رفتار بڑھانے کی کوشش کرتے ہیں، لیکن یہ بینچ مارک ان ورک لوڈز کو نشانہ بناتا ہے جو خود مختار اسسٹنٹس (autonomous assistants) کو طاقت دیتے ہیں: طویل سسٹم پرامپٹس (system prompts)، ٹول کالنگ اسکیمائیں (tool-calling schemas) اور صارف و اسسٹنٹ کے درمیان ہونے والے مکالموں کی مسلسل تاریخ۔ یہ بار بار آنے والے ٹوکنز GPU میموری میں رہتے ہیں؛ اگر کیش (cache) کو مؤثر طریقے سے مینیج نہ کیا جائے، تو یہ کمپیوٹ کے لیے رکاوٹ (bottleneck) بن جاتے ہیں جو گفتگو کو روک دیتے ہیں۔

وہ ورک لوڈ جس نے نتائج بدل دیے

روایتی LLM سرورز ایک واحد تبادلے کے لیے بہتر کام کرتے ہیں—صارف کا پرامپٹ، ماڈل کا جواب، اور کام ختم۔ تاہم، جدید ایجنٹس ایک "گفتگو کی حالت" (conversation state) برقرار رکھتے ہیں جو درجنوں ٹرنز تک پھیل سکتی ہے، جس میں سے ہر ٹرن کیش میں سینکڑوں ٹوکنز کا اضافہ کرتا ہے۔ ٹیسٹ سوٹ نے دو RTX 3090 کارڈز پر اس طرح کے ملٹی ٹرن لوپ کو دوبارہ چلایا، اور درج ذیل پیمائش کی:

  • Warm time-to-first-token (TTFT) – نیا ٹرن شروع ہونے کے بعد پہلا ٹوکن ظاہر ہونے سے پہلے کی تاخیر۔
  • Overall latency – پورے لوپ کے دوران فی ٹوکن اوسط وقت۔
  • Sustained throughput – جب لوپ مسلسل چل رہا ہو تو فی سیکنڈ پروسیس ہونے والے ٹوکنز۔
  • Cache-hit ratio – دوبارہ کمپیوٹ کرنے کے بجائے key-value (KV) کیش سے دوبارہ استعمال ہونے والے ٹوکنز کا تناسب۔

SGLang نے ہر پیمانے پر vLLM کو پیچھے چھوڑ دیا: 68 ms بمقابلہ 184 ms TTFT، لیٹنسی میں 82.9% کی کمی، 39.8% زیادہ تھرو پٹ (throughput) اور vLLM کے 84.2% کے مقابلے میں 96.8% کا کیش-ہٹ ریشو (cache-hit ratio)۔

PagedAttention بمقابلہ RadixAttention

دونوں انجن انٹرمیڈیٹ KV جوڑوں کو GPU میموری میں محفوظ کرتے ہیں، لیکن وہ اس میموری کو مختلف طریقے سے ترتیب دیتے ہیں۔

  • PagedAttention (vLLM) کیش کو مقررہ سائز کے بلاکس میں تقسیم کر دیتا ہے۔ اگر کوئی پرامپٹ بلاک کے درمیان میں ختم ہو جائے، تو بقیہ ٹوکنز کو ہر ٹرن میں دوبارہ کمپیوٹ کرنا پڑتا ہے کیونکہ بلاک کو جزوی طور پر دوبارہ استعمال نہیں کیا جا سکتا۔ یہ طریقہ سادہ ہے اور اس وقت کام کرتا ہے جب پرامپٹس بلاک کی حدود کے مطابق ہوں، لیکن یہ ان "ایج" (edge) ٹوکنز پر سائیکل ضائع کرتا ہے جو ایجنٹ لوپس میں سب سے زیادہ تبدیل ہوتے ہیں۔
  • RadixAttention (SGLang) کیش کو ایک درخت (tree) کے طور پر لیتا ہے۔ یہ بلاک کی حدود کی پرواہ کیے بغیر، موجودہ پرامپٹ اور پہلے سے کیش شدہ مواد کے درمیان طویل ترین مشترکہ پری فکس (prefix) تلاش کرتا ہے اور غیر استعمال شدہ شاخوں کو ختم کر دیتا ہے۔ اس سے ایک بہت بڑا سسٹم پرامپٹ GPU میموری میں مستقل طور پر موجود رہ سکتا ہے جبکہ صرف نیا ترین ٹرن پروسیس کیا جاتا ہے، جس سے کیش-ہٹ ریشو بڑھ جاتا ہے اور غیر ضروری کام کم ہو جاتا ہے۔

ہر انجن کب بہترین کارکردگی دکھاتا ہے

منظرنامہ (Scenario) پسندیدہ انجن
ملٹی ٹرن خود مختار ایجنٹس، بھاری ٹول کالنگ، tree-of-thought ریژوننگ SGLang (RadixAttention)
وسیع ہارڈ ویئر سپورٹ (بشمول AMD اور Gaudi اسپیڈلریٹرز)، speculative decoding، ویژن-لینگویج ماڈلز vLLM (PagedAttention)

یہ فرق صرف کارکردگی کا نہیں ہے؛ بلکہ یہ ایکوسسٹم (ecosystem) کے بارے میں بھی ہے۔ vLLM کی وسیع ہارڈ ویئر مطابقت اسے ان تنظیموں کے لیے ایک محفوظ ڈیفالٹ بناتی ہے جن کے پاس مختلف قسم کے کمپیوٹ کلسٹرز (heterogeneous compute clusters) موجود ہیں۔ اس کا speculative decoding فیچر—جو متوازی طور پر متعدد ٹوکن امیدوار تیار کرتا ہے—سنگل ٹرن جنریشن کو تیز کر سکتا ہے، جو کہ ایک ایسا شعبہ ہے جہاں RadixAttention کی ٹری-بیسڈ کیشنگ کم فائدہ دیتی ہے۔

خلاصہ

ان ڈویلپرز کے لیے جو طویل پرامپٹس اور بتدریج اپ ڈیٹس کو سنبھالنے والے ملٹی ٹرن ایجنٹس بنا رہے ہیں، SGLang کا RadixAttention کنزیومر GPUs پر نمایاں طور پر تیز اور زیادہ کیش-ایفیشنٹ تجربہ فراہم کرتا ہے۔ وہ ٹیمیں جنہیں وسیع ہارڈ ویئر کوریج کی ضرورت ہے یا جو سنگل ٹرن جنریشن میں مہارت رکھتی ہیں، وہ اب بھی vLLM پر انحصار کر سکتی ہیں۔ انتخاب اب اس بات پر منحصر ہے کہ ورک لوڈ "ایجنٹ پر مبنی" (agent-heavy) ہے یا "ہارڈ ویئر کے لحاظ سے متنوع" (hardware-diverse)۔