Microsoft ने Azure API Management (APIM) मध्ये एक समर्पित AI Gateway tier जोडला आहे. ही हालचाल सूचित करते की LLM कॉल्सना आता केवळ एक सामान्य API endpoint न मानता, एक वेगळा वर्कलोड (workload) म्हणून पाहिले जाते.
LLM ट्रॅफिकमुळे क्लासिक गेटवे का अपयशी ठरतात
एक प्रॉम्प्ट दुसऱ्यापेक्षा शंभर पटीने जास्त खर्चिक असू शकतो, तरीही एक मानक API gateway या दोन्हीकडे एकच विनंती (request) म्हणून पाहते. गेटवे केवळ कॉल्स मोजते, मॉडेल किती टोकन्स (tokens) प्रोसेस करते हे नाही. काही शेकडो टोकन्स पाठवणारी विनंती आणि हजारो टोकन्स पाठवणारी विनंती, दोन्हीसाठी विनंती-संख्या (request-count) मेट्रिक्स सारखेच दिसतात, जरी दुसऱ्या विनंतीचा खर्च कित्येक पटीने जास्त असू शकतो.
चार तथ्ये विनंती-आधारित मर्यादांना AI साठी निरुपयोगी बनवतात:
- खर्च ≠ विनंती संख्या. बिलिंग हे टोकन्सशी संबंधित असते, तुम्ही किती HTTP कॉल्स करता याशी नाही.
- टोकनचे प्रमाण मोठ्या प्रमाणात बदलते. एक क्वेरी (query) छोटा प्रश्न असू शकतो; तर दुसरीमध्ये मोठा दस्तऐवज (document) असू शकतो.
- मॉडेलची निवड किंमत बदलते. वेगवेगळ्या LLMs प्रत्येक टोकनसाठी वेगवेगळे दर आकारतात.
- स्ट्रीमिंगमुळे अंतिम बिल समजत नाही. जेव्हा प्रतिसाद स्ट्रीम (stream) होतात, तेव्हा स्ट्रीम संपेपर्यंत एकूण टोकन संख्या माहित नसते.
जर तुम्ही फक्त विनंत्या मोजत राहिलात, तर तुमच्याकडे असे मॉनिटरिंग डेटा असेल जो तुमच्या वास्तविक खर्चाबद्दल काहीच सांगणार नाही.
AI Gateway tier काय बदलतो
टोकन वापर नियंत्रित करण्यासाठी आवश्यक असलेली बहुतेक धोरणे (policies) आधीच मानक APIM tiers मध्ये उपलब्ध आहेत—जी XML नियमांनुसार लिहिलेली असतात आणि कस्टम डॅशबोर्डवर प्रदर्शित केली जातात. AI tier या सर्व क्षमतांना एका विशिष्ट अनुभवामध्ये एकत्रित करते:
- AI ट्रॅफिकसाठी स्केलिंगचे विलगीकरण (Isolation of scaling).
- सोपे कॉन्फिगरेशन, ज्यामुळे हाताने तयार केलेल्या XML धोरणांची गरज उरत नाही.
मुख्य बदल कार्यात्मक (operational) आहे: टोकन बजेट लागू करण्यासाठी तुम्हाला आता जटिल कोड लिहिण्याची किंवा वेगळे डॅशबोर्ड मेंटेन करण्याची गरज नाही. हे tier त्या नियंत्रणांसाठी एक तयार इंटरफेस प्रदान करते.
कधी स्विच करावे – ट्रॅफिकवर आधारित मार्गदर्शक
- AI तुमच्या ट्रॅफिकचा एक छोटा भाग आहे. तुमचे सध्याचे APIM tier वापरणे सुरू ठेवा आणि जर तुम्हाला सूक्ष्म नियंत्रण (fine-grained control) हवे असेल तर टोकन धोरणे जोडा.
- AI तुमच्या कॉल्समध्ये वर्चस्व गाजवते. स्केलिंग वेगळे करण्यासाठी आणि खर्च नियंत्रण (cost governance) सुव्यवस्थित ठेवण्यासाठी AI tier वर स्थलांतरित व्हा.
- तुम्हाला इंजिनिअरिंग ओव्हरहेड टाळायचा आहे. या tier मधील अंगभूत (built-in) साधने कस्टम धोरणे तयार करण्यासाठी आणि ती मेंटेन करण्यासाठी लागणारा वेळ वाचवतात.
सर्वात मोठा खर्च सबस्क्रिप्शनची किंमत नाही; तर टोकन इकॉनॉमिक्स समजून घेण्यासाठी एका सामान्य गेटवेमधील त्रुटी दूर करण्यासाठी खर्च होणारे इंजिनिअरिंग तास आहेत.
प्रिव्ह्यू-फेज (Preview-phase) प्लेबुक
Microsoft अजूनही AI tier प्रिव्ह्यूमध्ये देत आहे. याकडे एक टेस्टबेड (testbed) म्हणून पहा, प्रोडक्शन लॉन्च म्हणून नाही.
- उच्च-प्रमाण (high-volume) अंतर्गत AI वर्कलोड निवडा. ज्या सेवेमुळे सर्वाधिक टोकन ट्रॅफिक निर्माण होते ती निवडा.
- तो वर्कलोड AI tier मधून रूट करा. प्रत्येक वापरकर्त्याचा (consumer) टोकन वापर मोजण्यासाठी नवीन कॉन्फिगरेशन वापरा.
- काही आठवड्यांसाठी टोकन-खर्च डेटा गोळा करा. तुमच्या सध्याच्या मॉनिटरिंगशी टोकन संख्या आणि संबंधित खर्चाची तुलना करा.
- बजेटिंगसाठी बेसलाइनचा वापर करा. या tier चे खर्च-नियंत्रण फायदे त्याच्या प्रिव्ह्यू-फेज मर्यादांपेक्षा जास्त आहेत का, याचा निर्णय घ्या.
जोपर्यंत हे प्रिव्ह्यू सेवा 'जनरल अवेलेबिलिटी' (general availability) मध्ये येत नाही, तोपर्यंत अत्यंत महत्त्वाचे (mission-critical) प्रोडक्शन वर्कलोड्स या प्रिव्ह्यू सेवेवर हलवू नका.
प्रतिवाद: प्रत्येकाला वेगळ्या tier ची गरज नाही
जर तुमची संस्था केवळ अधूनमधून LLM ला कॉल्स करत असेल, तर AI tier चा अतिरिक्त खर्च оправण्यासारखा नसेल. तुम्ही सध्याच्या पॉलिसी फ्रेमवर्कद्वारे टोकन-स्तरीय नियंत्रण मिळवू शकता, जरी त्यासाठी अधिक मॅन्युअल प्रयत्न करावे लागतील. जेव्हा AI ट्रॅफिक तुमच्या API च्या मोठ्या आणि वाढत्या भागाचा भाग असते, तेव्हा हे tier अत्यंत उपयुक्त ठरते.
निष्कर्ष
AI Gateway tier हे मान्य करते की LLM ट्रॅफिक पारंपारिक API कॉल्सपेक्षा मूलभूतपणे वेगळे असते. विनंती मोजण्याऐवजी टोकन-आधारित नियंत्रणाकडे वळल्यामुळे, डेव्हलपर्सना कस्टम कोडमध्ये अडकल्याशिवाय AI खर्च नियंत्रणात ठेवण्याचा एक व्यावहारिक मार्ग मिळतो. ज्या टीम्सचा AI वापर आधीच मोठा आहे—किंवा वाढण्याची शक्यता आहे—त्यांच्यासाठी आता प्रिव्ह्यू टेस्ट करणे टोकन-खर्च बेसलाइन तयार करण्यास मदत करू शकते.
