AWS ने Amazon SageMaker Inference में “prefix-aware routing” का विकल्प जोड़ा है, जो उन ग्राहकों के लिए उच्च cache-hit दरों और काफी कम latency का वादा करता है जो अपने स्वयं के इंफ्रास्ट्रक्चर पर लार्ज लैंग्वेज मॉडल्स (LLMs) चलाते हैं। यह बदलाव महत्वपूर्ण है क्योंकि यह काफी कम latency और कम GPU कंप्यूट लागत प्रदान करता है।

LLM latency क्यों महत्वपूर्ण है

जब कोई LLM रिक्वेस्ट प्राप्त करता है, तो यह सामान्यतः पूरे प्रॉम्प्ट पर attention को फिर से कंप्यूट करता है—यह एक महंगा कदम है जो प्रत्येक अतिरिक्त टोकन के साथ बढ़ता जाता है। यदि मॉडल पिछले अनुरोध से attention cache का पुन: उपयोग कर सकता है, तो उसे केवल टेक्स्ट के नए हिस्से को प्रोसेस करने की आवश्यकता होती है। वे वर्कलोड जो बार-बार एक ही system prompt भेजते हैं या बातचीत का इतिहास (conversation history) बनाए रखते हैं, वे cache reuse के लिए प्रमुख उम्मीदवार हैं।

डिफ़ॉल्ट SageMaker सेटअप में, आने वाली रिक्वेस्ट को inference instances के पूल में रैंडम तरीके से वितरित किया जाता है। रैंडम वितरण का मतलब है कि एक रिक्वेस्ट जो warm cache का लाभ उठा सकती थी, वह अक्सर एक cold instance पर पहुँच जाती है, जिससे पूरा पुन: कंप्यूटेशन करना पड़ता है। इसका परिणाम उच्च latency और अतिरिक्त GPU साइकिल होता है, जो सीधे तौर पर अधिक खर्च में बदल जाता है।

prefix-aware routing कैसे काम करता है

नया रूटिंग मोड हाल के request prefixes का एक हल्का मैप रखता है—जो अनिवार्य रूप से प्रॉम्प्ट का वह पहला हिस्सा है जो कॉल्स के दौरान स्थिर रहने की प्रवृत्ति रखता है। जब एक नई रिक्वेस्ट आती है, तो SageMaker उस मैप की जाँच करता है और रिक्वेस्ट को उस instance पर भेज देता है जिसने पहले ही उसी prefix को प्रोसेस किया हो। यदि instance के पास अभी भी प्रासंगिक attention cache मौजूद है, तो मॉडल काम के बड़े हिस्से को छोड़ सकता है और उत्तर तेजी से जेनरेट कर सकता है।

मुख्य बिंदु:

  • किसी कोड परिवर्तन की आवश्यकता नहीं – यह फीचर पूरी तरह से inference service layer में मौजूद है।
  • केवल self-hosted मॉडल्स पर लागू – OpenAI के API या Anthropic की सर्विस जैसे managed offerings इससे प्रभावित नहीं होते हैं।
  • एप्लीकेशन्स के लिए पारदर्शी – वही SageMaker endpoint URL और API कॉन्ट्रैक्ट यथावत रहते हैं।

किसे लाभ होगा

जो एंटरप्राइजेज SageMaker पर LLMs होस्ट करते हैं, वे डेटा प्राइवेसी से लेकर लागत नियंत्रण तक विभिन्न कारणों से ऐसा करते हैं। जो लोग support chatbots, sales assistants, या किसी भी इंटरैक्टिव एजेंट को चला रहे हैं जो बार-बार एक निश्चित system prompt का उपयोग करता है, उनके लिए यह रूटिंग बदलाव औसत रिस्पॉन्स समय को कम कर सकता है। लागत के मामले में, प्रत्येक cache hit GPU को प्रॉम्प्ट के साझा हिस्से का पुन: मूल्यांकन करने से बचाता है।

सीमाएं और विपरीत तर्क

इसका लाभ बार-बार आने वाले prefixes की उपस्थिति पर निर्भर करता है। अत्यधिक परिवर्तनशील प्रॉम्प्ट्स—जैसे कि one-off queries या dynamically generated system messages—को समान cache-hit का लाभ नहीं मिलेगा।

चूंकि यह फीचर केवल self-hosted deployments तक सीमित है, इसलिए managed LLM सेवाओं का उपयोग करने वाले ग्राहक इसका लाभ नहीं उठा सकते।

Bottom line: Prefix-aware routing SageMaker उपयोगकर्ताओं को दोहराव वाले LLM वर्कलोड से latency कम करने और GPU लागत घटाने का एक सरल, zero-code तरीका प्रदान करता है। उन संगठनों के लिए जो पहले से ही इस प्लेटफॉर्म पर मॉडल्स होस्ट करते हैं, यह अपग्रेड एक कम जोखिम वाला बदलाव है जो तेज़ यूजर इंटरैक्शन और कम बिलों में बदल सकता है।