64K-ٹکن پرامپٹس پر vLLM، SGLang کو پیچھے چھوڑ دیتا ہے، لیکن جیسے ہی 8-GPU B300 سرور پر سیاق و سباق (context) 200K تک پہنچتا ہے، SGLang آگے نکل جاتا ہے۔ یہ تبدیلی ظاہر کرتی ہے کہ جیسے جیسے ٹکن ونڈوز بڑھتی ہیں، کارکردگی کا تعین پریفِل (prefill) کے کام کے بجائے ڈیکوڈ مرحلے (decode-stage) کی رکاوٹیں کرتی ہیں۔

یہ بینچ مارک کیوں اہم ہے

طویل سیاق و سباق (long-context) والی انفرنس چیٹ اسسٹنٹس، کوڈ اسسٹنٹس، اور کسی بھی ایسی ایپ کے لیے لاگت کا باعث بنتی ہے جسے میموری میں لاکھوں ٹکنز کو برقرار رکھنا پڑتا ہے۔ Kimi-K3، ایک بڑے پیرامیٹر والا ماڈل، ان پہلے اوپن ویٹ (open-weight) LLMs میں سے ایک ہے جو آسانی سے ایسے ونڈوز کو سنبھال سکتا ہے، لیکن اسے چلانے والا انجن یہ فیصلہ کرتا ہے کہ آیا کوئی درخواست سیکنڈوں میں مکمل ہوگی یا منٹوں میں۔

vLLM اور SGLang دونوں ہائی تھرو پٹ (high-throughput) انفرنس کا وعدہ کرتے ہیں، پھر بھی وہ ڈیکوڈ مرحلے کے لیے مختلف طریقے اپناتے ہیں۔ vLLM ڈیکوڈ پاتھ کو سادہ رکھتا ہے، اور اس اضافی سنکرونائزیشن (synchronization) سے بچتا ہے جو Decode Context Parallelism (DCP) متعارف کرواتا ہے۔ SGLang، DCP کا استعمال کرتے ہوئے key-value (KV) کیش ریڈز کو متعدد GPUs پر پھیلا دیتا ہے، یہ ایک ایسی تکنیک ہے جو اضافی کمیونیکیشن کی قیمت پر میموری بینڈوتھ (memory bandwidth) کو بہتر بنا سکتی ہے۔

ٹیسٹ بیڈ

  • ہارڈ ویئر: آٹھ NVIDIA B300 GPUs والا ایک سنگل سرور، جن میں سے ہر ایک کی میموری یکساں ہے۔
  • **ورک