Microsoft ने Azure API Management (APIM) में एक समर्पित AI Gateway tier जोड़ा है। यह कदम संकेत देता है कि LLM कॉल्स को अब केवल एक अन्य API एंडपॉइंट के रूप में नहीं, बल्कि एक अलग वर्कलोड के रूप में माना जा रहा है।
क्यों LLM ट्रैफिक क्लासिक गेटवे को विफल कर देता है
एक सिंगल प्रॉम्प्ट की लागत दूसरे की तुलना में सौ गुना अधिक हो सकती है, फिर भी एक स्टैंडर्ड API गेटवे दोनों को एक ही रिक्वेस्ट के रूप में देखता है। गेटवे कॉल्स की गिनती करता है, न कि मॉडल द्वारा प्रोसेस किए गए टोकन की संख्या की। एक रिक्वेस्ट जो कुछ सौ टोकन भेजती है और एक जो कई हज़ार टोकन भेजती है, दोनों के लिए रिक्वेस्ट-काउंट मेट्रिक्स समान होते हैं, भले ही बाद वाली की लागत कई गुना अधिक हो सकती है।
चार तथ्य रिक्वेस्ट-आधारित सीमाओं को AI के लिए बेकार बनाते हैं:
- लागत ≠ रिक्वेस्ट काउंट। बिलिंग टोकन से जुड़ी होती है, न कि इस बात से कि आप कितनी HTTP कॉल्स करते हैं।
- टोकन वॉल्यूम में भारी अंतर हो सकता है। एक क्वेरी एक छोटा सवाल हो सकती है; दूसरी में एक लंबा दस्तावेज़ शामिल हो सकता है।
- मॉडल का चुनाव कीमत बदल देता है। अलग-अलग LLMs प्रति टोकन अलग-अलग दरें लेते हैं।
- स्ट्रीमिंग अंतिम बिल को छिपा देती है। जब रिस्पॉन्स स्ट्रीम होते हैं, तो स्ट्रीम खत्म होने तक कुल टोकन काउंट का पता नहीं चलता है।
यदि आप केवल रिक्वेस्ट को मापते रहते हैं, तो आपके पास ऐसा मॉनिटरिंग डेटा होगा जो आपको वास्तविक खर्च के बारे में कुछ भी नहीं बताएगा।
AI Gateway tier क्या बदलता है
टोकन उपयोग को नियंत्रित करने के लिए आवश्यक अधिकांश नीतियां (policies) पहले से ही स्टैंडर्ड APIM tiers में मौजूद हैं—जो XML नियमों के रूप में लिखी गई हैं और कस्टम डैशबोर्ड पर प्रदर्शित होती हैं। AI tier उन्हीं क्षमताओं को एक विशेष रूप से निर्मित (purpose-built) अनुभव में समेट देता है:
- AI ट्रैफिक के लिए स्केलिंग का आइसोलेशन।
- सरलीकृत कॉन्फ़िगरेशन जो हाथ से लिखे गए XML नियमों की आवश्यकता को समाप्त कर देता है।
मुख्य बदलाव ऑपरेशनल है: टोकन बजट लागू करने के लिए अब आपको जटिल कोड लिखने या अलग डैशबोर्ड बनाए रखने की आवश्यकता नहीं है। यह tier उन कंट्रोल्स के लिए एक रेडी-मेड इंटरफ़ेस प्रदान करता है।
कब स्विच करें – ट्रैफिक-आधारित गाइड
- AI आपके ट्रैफिक का एक छोटा हिस्सा है। अपने मौजूदा APIM tier का उपयोग जारी रखें और यदि आपको सूक्ष्म नियंत्रण (fine-grained control) की आवश्यकता है, तो टोकन नीतियां जोड़ें।
- AI आपकी कॉल्स पर हावी है। स्केलिंग को आइसोलेट करने और लागत गवर्नेंस को व्यवस्थित रखने के लिए AI tier पर स्विच करें।
- आप इंजीनियरिंग ओवरहेड से बचना चाहते हैं। इस tier के इन-बिल्ट टूल्स कस्टम नीतियों को बनाने और बनाए रखने में लगने वाले समय को खत्म कर देते हैं।
सबसे बड़ा खर्च सब्सक्रिप्शन की कीमत नहीं है; बल्कि एक जेनेरिक गेटवे में कमियों को दूर करने में खर्च होने वाले इंजीनियरिंग घंटे हैं ताकि उसे टोकन इकोनॉमिक्स समझाई जा सके।
प्रिव्यू-फेज प्लेबुक
Microsoft अभी भी AI tier को प्रिव्यू में दे रहा है। इसे एक टेस्टबेड के रूप में देखें, प्रोडक्शन लॉन्च के रूप में नहीं।
- एक हाई-वॉल्यूम इंटरनल AI वर्कलोड चुनें। उस सर्विस को चुनें जो सबसे अधिक टोकन ट्रैफिक जेनरेट करती है।
- उस वर्कलोड को AI tier के माध्यम से रूट करें। प्रति कंज्यूमर टोकन उपयोग को कैप्चर करने के लिए नए कॉन्फ़िगरेशन का उपयोग करें।
- कुछ हफ्तों के लिए टोकन-खर्च का डेटा इकट्ठा करें। अपने मौजूदा मॉनिटरिंग के मुकाबले टोकन काउंट और संबंधित लागतों की तुलना करें।
- बजटिंग के लिए बेसलाइन का उपयोग करें। यह तय करें कि क्या इस tier के लागत-नियंत्रण लाभ इसकी प्रिव्यू-फेज सीमाओं से अधिक हैं।
जब तक यह जनरल अवेलेबिलिटी (general availability) में न आ जाए, तब तक मिशन-क्रिटिकल प्रोडक्शन वर्कलोड को प्रिव्यू सर्विस पर न ले जाएं।
काउंटर-पॉइंट: हर किसी को अलग tier की आवश्यकता नहीं है
यदि आपका संगठन केवल कभी-कभार LLM को कॉल करता है, तो AI tier की अतिरिक्त लागत उचित नहीं हो सकती है। आप मौजूदा पॉलिसी फ्रेमवर्क के साथ टोकन-स्तर का गवर्नेंस प्राप्त कर सकते हैं, हालांकि इसमें अधिक मैन्युअल प्रयास की आवश्यकता होगी। यह tier तब सबसे अधिक उपयोगी होता है जब AI ट्रैफिक आपके API सरफेस का एक बड़ा और बढ़ता हुआ हिस्सा हो।
निष्कर्ष (Takeaway)
AI Gateway tier इस बात को स्वीकार करता है कि LLM ट्रैफिक पारंपरिक API कॉल्स से मौलिक रूप से भिन्न व्यवहार करता है। रिक्वेस्ट काउंटिंग से टोकन-आधारित गवर्नेंस की ओर शिफ्ट होकर, यह डेवलपर्स को कस्टम कोड में उलझे बिना AI खर्च को नियंत्रित रखने का एक व्यावहारिक तरीका देता है। उन टीमों के लिए जिनका AI उपयोग पहले से ही काफी अधिक है—या बढ़ने की उम्मीद है—अभी प्रिव्यू का परीक्षण करना टोकन-खर्च का बेसलाइन बनाने में मदद कर सकता है।
