SGLang యొక్క RadixAttention, dual-RTX 3090 రిగ్‌పై warm-up time-to-first-tokenను 68 msకి తగ్గించింది, అయితే vLLM యొక్క PagedAttention 184 ms వద్ద నిలిచిపోయింది—ఈ 82.9% లేటెన్సీ వ్యత్యాసం మల్టీ-టర్న్ ఏజెంట్ ఇంటరాక్షన్‌లను స్పష్టంగా సులభతరం చేస్తుంది.

రెండు ప్రాజెక్టులు కూడా large language model (LLM) ఇన్ఫరెన్స్‌ను వేగవంతం చేయడానికి ప్రయత్నిస్తాయి, కానీ ఈ బెంచ్‌మార్క్ స్వయంప్రతిపత్తి కలిగిన అసిస్టెంట్‌లకు (autonomous assistants) అవసరమైన వర్క్‌లోడ్‌లను లక్ష్యంగా చేసుకుంటుంది: అంటే పొడవైన సిస్టమ్ ప్రాంప్ట్‌లు, tool-calling स्कीమాలు మరియు యూజర్-అసిస్టెంట్ టర్న్‌ల యొక్క రోలింగ్ హిస్టరీ. ఆ పునరావృతమయ్యే టోకెన్లు GPU మెమరీలో ఉంటాయి; ఒకవేళ క్యాచీని సమర్థవంతంగా నిర్వహించకపోతే, అవి సంభాషణను నిలిపివేసే కంప్యూట్ బాటిల్‌నెక్ (compute bottleneck) గా మారుతాయి.

ఫలితాలను మార్చిన వర్క్‌లోడ్

సాంప్రదాయ LLM సర్వర్‌లు ఒకే ఎక్స్ఛేంజ్ కోసం ఆప్టిమైజ్ చేయబడతాయి—యూజర్ ప్రాంప్ట్, మోడల్ రిప్లై, అంతే. అయితే, ఆధునిక ఏజెంట్‌లు డజన్ల కొద్దీ టర్న్‌ల వరకు ఉండే "conversation state"ను కలిగి ఉంటాయి, ఇవి ప్రతిసారీ క్యాచీకి వందలాది టోకెన్లను జోడిస్తాయి. ఈ టెస్ట్ సూట్ రెండు RTX 3090 కార్డ్‌లపై అటువంటి మల్టీ-టర్న్ లూప్‌ను ప్లే చేసి, ఈ క్రింది వాటిని కొలిచింది:

  • Warm time-to-first-token (TTFT) – కొత్త టర్న్ ప్రారంభమైన తర్వాత మొదటి టోకెన్ కనిపించే ముందు ఉండే ఆలస్యం.
  • Overall latency – మొత్తం లూప్ అంతటా ప్రతి టోకెన్‌కు పట్టే సగటు సమయం.
  • Sustained throughput – లూప్ నిరంతరంగా నడుస్తున్నప్పుడు సెకనుకు ప్రాసెస్ చేయబడే టోకెన్లు.
  • Cache-hit ratio – మళ్ళీ కంప్యూట్ చేయబడటానికి బదులుగా, key-value (KV) క్యాచీ నుండి తిరిగి ఉపయోగించబడిన టోకెన్ల నిష్పత్తి.

SGLang ప్రతి మెట్రిక్‌లో vLLMని ఓడించింది: 68 ms vs 184 ms TTFT, 82.9% లేటెన్సీ తగ్గింపు, 39.8% అధిక త్రూపుట్ (throughput) మరియు vLLM యొక్క 84.2% తో పోలిస్తే 96.8% క్యాచీ-హిట్ రేషియో.

PagedAttention vs RadixAttention

రెండు ఇంజన్‌లు ఇంటర్మీడియట్ KV జంటలను GPU మెమరీలో నిల్వ చేస్తాయి, కానీ అవి ఆ మెమరీని వేర్వేరుగా నిర్వహిస్తాయి.

  • PagedAttention (vLLM) క్యాచీని నిర్ణీత పరిమాణం కలిగిన బ్లాక్‌లుగా విభజిస్తుంది. ఒక ప్రాంప్ట్ బ్లాక్ మధ్యలో ముగిస్తే, ఆ తర్వాత వచ్చే టోకెన్లను ప్రతి టర్న్‌లో మళ్ళీ కంప్యూట్ చేయాల్సి ఉంటుంది, ఎందుకంటే బ్లాక్‌ను పాక్షికంగా తిరిగి ఉపయోగించలేము. ఈ విధానం సరళమైనది మరియు ప్రాంప్ట్‌లు బ్లాక్ బౌండరీలతో సరిపోలినప్పుడు బాగా పనిచేస్తుంది, కానీ ఏజెంట్ లూప్‌లలో తరచుగా మారే "edge" టోకెన్ల కోసం ఇది సైకిళ్లను వృథా చేస్తుంది.
  • RadixAttention (SGLang) క్యాచీని ఒక ట్రీ (tree) వలె పరిగణిస్తుంది. ఇది బ్లాక్ పరిమితులతో సంబంధం లేకుండా, ప్రస్తుత ప్రాంప్ట్ మరియు ఇప్పటికే క్యాష్ చేయబడిన దాని మధ్య ఉన్న అత్యంత పొడవైన కామన్ ప్రిఫిక్స్‌ను (longest common prefix) కనుగొంటుంది మరియు ఉపయోగించని లీవ్స్‌ను తొలగిస్తుంది. ఇది భారీ సిస్టమ్ ప్రాంప్ట్‌ను GPU మెమరీలోనే ఉంచుతూ, కేవలం కొత్త టర్న్‌ను మాత్రమే ప్రాసెస్ చేయడానికి అనుమతిస్తుంది, తద్వారా క్యాచీ-హిట్ రేషియోను పెంచుతుంది మరియు అనవసరమైన పనిని తగ్గిస్తుంది.

ఏ ఇంజిన్ ఎప్పుడు మెరుగ్గా పనిచేస్తుంది

సందర్భం (Scenario) ప్రాధాన్యత కలిగిన ఇంజిన్
మల్టీ-టర్న్ స్వయంప్రతిపత్తి ఏజెంట్‌లు, భారీ tool calling, tree-of-thought రీజనింగ్ SGLang (RadixAttention)
విస్తృతమైన హార్డ్‌వేర్ సపోర్ట్ (AMD మరియు Gaudi యాక్సిలరేటర్లతో సహా), speculative decoding, vision-language మోడల్స్ vLLM (PagedAttention)

ఈ తేడా కేవలం పనితీరు (performance) గురించి మాత్రమే కాదు; ఇది ఎకోసిస్టమ్ గురించి కూడా. vLLM యొక్క విస్తృతమైన హార్డ్‌వేర్ అనుకూలత, వైవిధ్యమైన కంప్యూట్ క్లస్టర్‌లు (heterogeneous compute clusters) ఉన్న సంస్థలకు దీనిని సురక్షితమైన ఎంపికగా చేస్తుంది. దీనిలోని speculative decoding ఫీచర్—సమాంతరంగా బహుళ టోకెన్ అభ్యర్థులను (token candidates) రూపొందించడం—సింగిల్-టర్న్ జనరేషన్‌ను వేగవంతం చేయగలదు, ఇక్కడ RadixAttention యొక్క ట్రీ-బేస్డ్ క్యాషింగ్ తక్కువ ప్రయోజనాన్ని అందిస్తుంది.

ముగింపు

పొడవైన ప్రాంప్ట్‌లు మరియు ఇన్‌క్రిమెంటల్ అప్‌డేట్‌లను నిర్వహించే మల్టీ-టర్న్ ఏజెంట్‌లను నిర్మిస్తున్న డెవలపర్‌ల కోసం, SGLang యొక్క RadixAttention కన్స్యూమర్ GPUలపై గణనీయంగా వేగవంతమైన మరియు మరింత క్యాచీ-ఎఫిషియంట్ అనుభవాన్ని అందిస్తుంది. విస్తృతమైన హార్డ్‌వేర్ కవరేజ్ అవసరమయ్యే లేదా సింగిల్-టర్న్ జనరేషన్‌లో ప్రత్యేకత కలిగిన టీమ్‌లు ఇప్పటికీ vLLM పై ఆధారపడవచ్చు. ఇప్పుడు ఎంపిక అనేది వర్క్‌లోడ్ "agent-heavy" లేదా "hardware-diverse" అనే దానిపై ఆధారపడి ఉంటుంది.