SGLang च्या RadixAttention ने dual-RTX 3090 सेटअपवर warm-up time-to-first-token (TTFT) कमी करून 68 ms पर्यंत आणले, तर vLLM चे PagedAttention 184 ms वर थांबले होते—हा 82.9% चा लॅटन्सी (latency) फरक आहे, ज्यामुळे multi-turn agent संवाद लक्षणीयरीत्या अधिक सुलभ वाटतात.

दोन्ही प्रकल्प large language model (LLM) inference वेगवान करण्याचा प्रयत्न करतात, परंतु हे बेंचमार्क अशा वर्कलोड्सवर लक्ष केंद्रित करतात जे autonomous assistants ला सक्षम करतात: लांब system prompts, tool-calling schemas आणि वापरकर्ता-सहाय्यक (user-assistant) संवादाचा सतत बदलणारा इतिहास. हे वारंवार येणारे tokens GPU मेमरीमध्ये साठवले जातात; जर कॅशेचे (cache) व्यवस्थापन कार्यक्षमतेने केले नाही, तर ते एक compute bottleneck बनतात ज्यामुळे संवाद थांबतो.

निकालाचा कल बदलणारा वर्कलोड

पारंपारिक LLM सर्व्हर्स एकाच संवादासाठी (single exchange) ऑप्टिमाइझ केलेले असतात—वापरकर्त्याचा प्रॉम्प्ट, मॉडेलचे उत्तर आणि काम संपले. मात्र, आधुनिक एजंट्स "conversation state" जपतात जो डझनभर संवादांपर्यंत (turns) पसरलेला असू शकतो, ज्यामध्ये प्रत्येक वेळी कॅशेमध्ये शेकडों टोकन्स जोडले जातात. टेस्ट सुईटने दोन RTX 3090 कार्ड्सवर असा multi-turn लूप पुन्हा चालवला आणि खालील गोष्टी मोजल्या:

  • Warm time-to-first-token (TTFT) – नवीन टर्न सुरू झाल्यानंतर पहिला टोकन दिसण्यापूर्वीचा विलंब.
  • Overall latency – संपूर्ण लूपमधील प्रति टोकन सरासरी वेळ.
  • Sustained throughput – लूप सतत चालू असताना प्रति सेकंद प्रोसेस होणारे tokens.
  • Cache-hit ratio – पुन्हा मोजण्याऐवजी (recomputed) key-value (KV) कॅशेमधून पुन्हा वापरल्या जाणाऱ्या tokens प्रमाण.

SGLang ने प्रत्येक निकषावर vLLM ला मागे टाकले: 68 ms विरुद्ध 184 ms TTFT, 82.9% लॅटन्सी कपात, 39.8% अधिक थ्रूपुट (throughput) आणि vLLM च्या 84.2% च्या तुलनेत 96.8% चा कॅशे-हिट रेशो (cache-hit ratio).

PagedAttention विरुद्ध RadixAttention

दोन्ही इंजिन्स इंटरमीडिएट KV जोड्या GPU मेमरीमध्ये साठवतात, परंतु ते त्या मेमरीची मांडणी वेगवेगळ्या प्रकारे करतात.

  • PagedAttention (vLLM) कॅशेचे ठराविक आकाराच्या ब्लॉक्समध्ये (blocks) विभाजन करते. जर एखादा प्रॉम्प्ट ब्लॉकच्या मध्यभागी संपला, तर शेवटचे tokens प्रत्येक वेळी पुन्हा मोजावे लागतात कारण ब्लॉकचा काही भाग पुन्हा वापरता येत नाही. हा दृष्टिकोन सोपा आहे आणि जेव्हा प्रॉम्प्ट्स ब्लॉकच्या सीमांशी जुळतात तेव्हा तो प्रभावी ठरतो, परंतु एजंट लूपमध्ये वारंवार बदलणाऱ्या "edge" tokens वर यामुळे वेळेचा अपव्यय होतो.
  • RadixAttention (SGLang) कॅशेला एका 'ट्री' (tree) प्रमाणे हाताळते. ब्लॉकच्या मर्यादांची पर्वा न करता, ते सध्याचा प्रॉम्प्ट आणि आधीच कॅशेमध्ये असलेला डेटा यांच्यातील सर्वात मोठा सामायिक प्रीफिक्स (longest common prefix) शोधते आणि न वापरलेले भाग काढून टाकते. यामुळे एक मोठा system prompt GPU मेमरीमध्ये स्थिर राहू शकतो आणि फक्त नवीन टर्न प्रोसेस केला जातो, ज्यामुळे कॅशे-हिट रेशो वाढतो आणि अनावश्यक काम कमी होते.

प्रत्येक इंजिन कधी प्रभावी ठरते

परिस्थिती पसंतीचे इंजिन
Multi-turn autonomous agents, जड tool calling, tree-of-thought reasoning SGLang (RadixAttention)
व्यापक हार्डवेअर सपोर्ट (AMD आणि Gaudi accelerators सह), speculative decoding, vision-language models vLLM (PagedAttention)

हा फरक केवळ कामगिरीचा नाही; तो इकोसिस्टमचा देखील आहे. vLLM ची व्यापक हार्डवेअर सुसंगतता (compatibility) विविध प्रकारच्या (heterogeneous) कॉम्प्युट क्लस्टर्स असलेल्या संस्थांसाठी त्याला एक सुरक्षित पर्याय बनवते. त्याचे speculative decoding वैशिष्ट्य—जे समांतरपणे अनेक टोकन उमेदवार तयार करते—single-turn जनरेशनचा वेग वाढवू शकते, जे असे क्षेत्र आहे जिथे RadixAttention च्या tree-based कॅशिंगचा फायदा कमी मिळतो.

सारांश

लांब प्रॉम्प्ट्स आणि क्रमिक अपडेट्स हाताळणारे multi-turn एजंट्स तयार करणाऱ्या डेव्हलपर्ससाठी, SGLang चे RadixAttention कन्झ्युमर GPUs वर लक्षणीयरीत्या वेगवान आणि अधिक कॅशे-कार्यक्षम अनुभव देते. ज्या टीम्सना व्यापक हार्डवेअर कव्हरेजची गरज आहे किंवा ज्या single-turn जनरेशनमध्ये तज्ज्ञ आहेत, त्या अजूनही vLLM चा वापर करू शकतात. आता निवड ही वर्कलोड "agent-heavy" आहे की "hardware-diverse" यावर अवलंबून आहे.