SGLang ના RadixAttention એ ડ્યુઅલ-RTX 3090 રિગ પર warm-up time-to-first-token ને ઘટાડીને 68 ms કરી દીધું, જ્યારે vLLM નું PagedAttention 184 ms પર અટકી રહ્યું—82.9% નો લેટન્સી ગેપ (latency gap) જે મલ્ટી-ટર્ન એજન્ટ ઇન્ટરેક્શનને નોંધપાત્ર રીતે વધુ સ્મૂધ બનાવે છે.
બંને પ્રોજેક્ટ્સ લાર્જ લેંગ્વેજ મોડલ (LLM) ઇન્ફરન્સને ઝડપી બનાવવાનો પ્રયાસ કરે છે, પરંતુ આ બેન્ચમાર્ક એવા વર્કલોડ્સને લક્ષ્ય બનાવે છે જે ઓટોનોમસ આસિસ્ટન્ટ્સને સજ્જ કરે છે: લાંબા સિસ્ટમ પ્રોમ્પ્ટ્સ, ટૂલ-કોલિંગ સ્કીમા અને યુઝર-આસિસ્ટન્ટ ટર્ન્સનો રોલિંગ ઇતિહાસ. તે વારંવાર આવતા ટોકન્સ GPU મેમરીમાં રહે છે; જો કેશનું કાર્યક્ષમ રીતે સંચાલન કરવામાં ન આવે, તો તે કમ્પ્યુટ બોટલનેક (bottleneck) બની જાય છે જે વાતચીતને અટકાવે છે.
સંતુલન બદલનાર વર્કલોડ
પરંપરાગત LLM સર્વર્સ સિંગલ એક્સચેન્જ માટે ઓપ્ટિમાઇઝ થાય છે—યુઝર પ્રોમ્પ્ટ, મોડલ રિપ્લાય, અને કામ પૂરું. જોકે, આધુનિક એજન્ટ્સ "કન્વર્સેશન સ્ટેટ" (conversation state) જાળવી રાખે છે જે ડઝનબંધ ટર્ન્સ સુધી વિસ્તરી શકે છે, જેમાં દરેક ટર્ન કેશમાં સેંકડો ટોકન્સ ઉમેરે છે. ટેસ્ટ સ્યુટે બે RTX 3090 કાર્ડ્સ પર આવો મલ્ટી-ટર્ન લૂપ ચલાવ્યો, જે નીચે મુજબના માપદંડો માપે છે:
- Warm time-to-first-token (TTFT) – નવો ટર્ન શરૂ થયા પછી પ્રથમ ટોકન દેખાતા પહેલાનો વિલંબ.
- Overall latency – આખા લૂપ દરમિયાન પ્રતિ ટોકન સરેરાશ સમય.
- Sustained throughput – જ્યારે લૂપ સતત ચાલે છે ત્યારે પ્રતિ સેકન્ડ પ્રોસેસ થતા ટોકન્સ.
- Cache-hit ratio – ફરીથી કમ્પ્યુટ કરવાને બદલે key-value (KV) કેશમાંથી ફરીથી ઉપયોગમાં લેવાતા ટોકન્સનો પ્રમાણ.
SGLang એ દરેક મેટ્રિકમાં vLLM ને હરાવ્યું: 68 ms વિરુદ્ધ 184 ms TTFT, 82.9% લેટન્સીમાં ઘટાડો, 39.8% વધુ થ્રુપુટ અને vLLM ના 84.2% ની સરખામણીમાં 96.8% નો કેશ-હિટ રેશિયો.
PagedAttention વિરુદ્ધ RadixAttention
બંને એન્જિન ઇન્ટરમીડિયેટ KV જોડીઓને GPU મેમરીમાં સ્ટોર કરે છે, પરંતુ તેઓ તે મેમરીને અલગ રીતે ગોઠવે છે.
- PagedAttention (vLLM) કેશને નિશ્ચિત કદના બ્લોક્સમાં વિભાજિત કરે છે. જો પ્રોમ્પ્ટ બ્લોકની વચ્ચે પૂરો થાય, તો બાકીના ટોકન્સ દરેક ટર્નમાં ફરીથી કમ્પ્યુટ કરવા પડે છે કારણ કે બ્લોકનો આંશિક ઉપયોગ કરી શકાતો નથી. આ અભિગમ સરળ છે અને જ્યારે પ્રોમ્પ્ટ્સ બ્લોક બાઉન્ડ્રી સાથે સુસંગત હોય ત્યારે કામ કરે છે, પરંતુ તે એજન્ટ લૂપ્સમાં વારંવાર બદલાતા "એજ" (edge) ટોકન્સ પર સાયકલ વેસ્ટ કરે છે.
- RadixAttention (SGLang) કેશને એક ટ્રી (tree) તરીકે ગણે છે. તે બ્લોક મર્યાદાઓને ધ્યાનમાં લીધા વિના, વર્તમાન પ્રોમ્પ્ટ અને પહેલેથી કેશ થયેલ સામગ્રી વચ્ચેનો સૌથી લાંબો કોમન પ્રીફિક્સ (common prefix) શોધે છે અને બિનઉપયોગી પાંદડાઓ (leaves) ને દૂર કરે છે. આનાથી વિશાળ સિસ્ટમ પ્રોમ્પ્ટ GPU મેમરીમાં પિન રહે છે જ્યારે ફક્ત નવો ટર્ન જ પ્રોસેસ થાય છે, જેનાથી કેશ-હિટ રેશિયો વધે છે અને બિનજરૂરી કામ ઘટે છે.
ક્યારે કયું એન્જિન શ્રેષ્ઠ કામ કરે છે
| પરિસ્થિતિ | પસંદગીનું એન્જિન |
|---|---|
| મલ્ટી-ટર્ન ઓટોનોમસ એજન્ટ્સ, હેવી ટૂલ કોલિંગ, ટ્રી-ઓફ-થોટ રીઝનિંગ | SGLang (RadixAttention) |
| વ્યાપક હાર્ડવેર સપોર્ટ (AMD અને Gaudi એક્સિલરેટર્સ સહિત), સ્પેક્યુલેટિવ ડિકોડિંગ, વિઝન-લેંગ્વેજ મોડલ્સ | vLLM (PagedAttention) |
તફાવત માત્ર પર્ફોર્મન્સનો નથી; તે ઇકોસિસ્ટમ વિશે પણ છે. vLLM ની વ્યાપક હાર્ડવેર સુસંગતતા તેને વિવિધ પ્રકારના કમ્પ્યુટ ક્લસ્ટર્સ ધરાવતી સંસ્થાઓ માટે વધુ સુરક્ષિત ડિફોલ્ટ બનાવે છે. તેનું સ્પેક્યુલેટિવ ડિકોડિંગ ફીચર—સમાંતર રીતે અનેક ટોકન ઉમેદવારો જનરેટ કરવું—સિંગલ-ટર્ન જનરેશનને ઝડપી બનાવી શકે છે, જે એક એવું ક્ષેત્ર છે જ્યાં RadixAttention ના ટ્રી-આધારિત કેશિંગનો ફાયદો ઓછો મળે છે.
નિષ્કર્ષ
લાંબા પ્રોમ્પ્ટ્સ અને ઇન્ક્રીમેન્ટલ અપડેટ્સ સાથે કામ કરતા મલ્ટી-ટર્ન એજન્ટ્સ બનાવતા ડેવલપર્સ માટે, SGLang નું RadixAttention કન્ઝ્યુમર GPUs પર નોંધપાત્ર રીતે ઝડપી અને વધુ કેશ-કાર્યક્ષમ અનુભવ આપે છે. જે ટીમોને વ્યાપક હાર્ડવેર કવરેજની જરૂર છે અથવા જે સિંગલ-ટર્ન જનરેશનમાં નિષ્ણાત છે તેઓ હજુ પણ vLLM પર આધાર રાખી શકે છે. પસંદગી હવે એ વાત પર નિર્ભર છે કે વર્કલોડ "એજન્ટ-હેવી" (agent-heavy) છે કે "હાર્ડવેર-ડાયવર્સ" (hardware-diverse).
