Microsoft એ Azure API Management (APIM) માં એક સમર્પિત AI Gateway tier ઉમેર્યું છે. આ પગલું સૂચવે છે કે LLM કોલ્સને હવે માત્ર અન્ય API એન્ડપોઈન્ટ તરીકે નહીં, પરંતુ એક અલગ વર્કલોડ તરીકે ગણવામાં આવે છે.
શા માટે LLM ટ્રાફિક ક્લાસિક ગેટવેઝ માટે પડકારરૂપ છે
એક સિંગલ પ્રોમ્પ્ટ બીજા કરતા સો ગણો વધુ ખર્ચાળ હોઈ શકે છે, છતાં સ્ટાન્ડર્ડ API ગેટવે બંનેને એક જ રિક્વેસ્ટ તરીકે જુએ છે. ગેટવે કોલ્સની સંખ્યા ગણે છે, મોડેલ દ્વારા પ્રોસેસ કરવામાં આવતા ટોકન્સની સંખ્યા નહીં. થોડાક સો ટોકન્સ મોકલતી રિક્વેસ્ટ અને હજારો ટોકન્સ મોકલતી રિક્વેસ્ટ બંને માટે રિક્વેસ્ટ-કાઉન્ટ મેટ્રિક્સ સમાન જ હોય છે, ભલે પછી બીજી રિક્વેસ્ટનો ખર્ચ અનેકગણો વધારે હોઈ શકે છે.
ચાર તથ્યો રિક્વેસ્ટ-આધારિત મર્યાદાઓને AI માટે નકામી બનાવે છે:
- ખર્ચ ≠ રિક્વેસ્ટ કાઉન્ટ. બિલિંગ ટોકન્સ સાથે જોડાયેલું છે, તમે કેટલા HTTP કોલ્સ કરો છો તેના પર નહીં.
- ટોકન વોલ્યુમમાં મોટો તફાવત હોઈ શકે છે. એક ક્વેરી ટૂંકો પ્રશ્ન હોઈ શકે છે; બીજી ક્વેરીમાં લાંબો દસ્તાવેજ હોઈ શકે છે.
- મોડેલની પસંદગી કિંમત બદલે છે. અલગ-અલગ LLMs પ્રતિ ટોકન અલગ-અલગ દરે ચાર્જ કરે છે.
- સ્ટ્રીમિંગ અંતિમ બિલ છુપાવે છે. જ્યારે પ્રતિસાદો સ્ટ્રીમ થાય છે, ત્યારે સ્ટ્રીમ પૂરી ન થાય ત્યાં સુધી કુલ ટોકન સંખ્યા જાણી શકાતી નથી.
જો તમે ફક્ત રિક્વેસ્ટ્સને જ માપતા રહેશો, તો અંતે તમારી પાસે એવું મોનિટરિંગ ડેટા હશે જે તમને વાસ્તવિક ખર્ચ વિશે કંઈ જ જણાવશે નહીં.
AI Gateway tier શું બદલાવ લાવે છે
ટોકન વપરાશ પર નિયંત્રણ રાખવા માટે જરૂરી મોટાભાગની પોલિસીઓ પહેલેથી જ સ્ટાન્ડર્ડ APIM ટિયર્સમાં ઉપલબ્ધ છે—જે XML નિયમો તરીકે લખાયેલી હોય છે અને કસ્ટમ ડેશબોર્ડ્સ પર દર્શાવવામાં આવે છે. AI ટિયર આ જ ક્ષમતાઓને એક હેતુપૂર્ણ અનુભવ (purpose-built experience) માં સંકલિત કરે છે:
- AI ટ્રાફિક માટે સ્કેલિંગનું અલગકરણ (Isolation of scaling).
- સરળ કોન્ફિગરેશન, જે હાથેથી બનાવેલી XML પોલિસીઓની જરૂરિયાત દૂર કરે છે.
મુખ્ય ફેરફાર ઓપરેશનલ છે: ટોકન બજેટ લાગુ કરવા માટે તમારે હવે જટિલ કોડ લખવાની અથવા અલગ ડેશબોર્ડ્સ જાળવવાની જરૂર નથી. આ ટિયર તે નિયંત્રણો માટે તૈયાર ઇન્ટરફેસ પૂરો પાડે છે.
ક્યારે સ્વિચ કરવું – ટ્રાફિક-આધારિત માર્ગદર્શિકા
- AI તમારા ટ્રાફિકનો નાનો ભાગ છે. તમારા હાલના APIM ટિયરનો ઉપયોગ ચાલુ રાખો અને જો તમારે ઝીણવટભર્યું (fine-grained) નિયંત્રણ જોઈતું હોય તો ટોકન પોલિસી ઉમેરો.
- AI તમારા કોલ્સમાં મુખ્ય છે. સ્કેલિંગને અલગ રાખવા અને ખર્ચના શાસનને (cost governance) વ્યવસ્થિત રાખવા માટે AI ટિયર પર સ્વિચ કરો.
- તમે એન્જિનિયરિંગ ઓવરહેડ ટાળવા માંગો છો. આ ટિયરના ઇન-બિલ્ટ ટૂલ્સ કસ્ટમ પોલિસી બનાવવામાં અને જાળવવામાં વપરાતો સમય બચાવે છે.
સૌથી મોટો ખર્ચ સબ્સ્ક્રિપ્શનની કિંમત નથી; તે જનરિક ગેટવેમાં ટોકન ઇકોનોમિક્સ સમજાવવા માટે જે ખામીઓ સુધારવામાં એન્જિનિયરિંગના કલાકો ખર્ચાય છે તે છે.
પ્રીવ્યુ-ફેઝ પ્લેબુક (Preview-phase playbook)
Microsoft હજુ પણ AI ટિયર પ્રીવ્યુમાં ઓફર કરી રહ્યું છે. તેને ટેસ્ટબેડ તરીકે ગણો, પ્રોડક્શન લોન્ચ તરીકે નહીં.
- વધારે વોલ્યુમ ધરાવતા આંતરિક AI વર્કલોડ પસંદ કરો. એવી સર્વિસ પસંદ કરો જે સૌથી વધુ ટોકન ટ્રાફિક જનરેટ કરે છે.
- તે વર્કલોડને AI ટિયર દ્વારા રૂટ કરો. દરેક વપરાશકર્તા દીઠ ટોકન વપરાશને કેપ્ચર કરવા માટે નવી કોન્ફિગરેશનનો ઉપયોગ કરો.
- થોડા અઠવાડિયા માટે ટોકન-ખર્ચનો ડેટા એકત્રિત કરો. તમારા હાલના મોનિટરિંગ સાથે ટોકન કાઉન્ટ અને સંબંધિત ખર્ચની તુલના કરો.
- બજેટિંગ માટે બેઝલાઇનનો ઉપયોગ કરો. નક્કી કરો કે આ ટિયરના ખર્ચ-નિયંત્રણના ફાયદા તેની પ્રીવ્યુ-ફેઝ મર્યાદાઓ કરતા વધુ છે કે નહીં.
જ્યાં સુધી આ સર્વિસ જનરલ એવેલેબિલિટી (general availability) સુધી ન પહોંચે ત્યાં સુધી મિશન-ક્રિટિકલ પ્રોડક્શન વર્કલોડને પ્રીવ્યુ સર્વિસમાં ન લઈ જશો.
વિરોધ પક્ષ: દરેકને અલગ ટિયરની જરૂર નથી
જો તમારી સંસ્થા ક્યારેક જ LLM ને કોલ્સ કરે છે, તો AI ટિયરનો વધારાનો ખર્ચ યોગ્ય ન પણ હોય. તમે હાલના પોલિસી ફ્રેમવર્ક સાથે ટોકન-લેવલ ગવર્નન્સ મેળવી શકો છો, જોકે તેમાં વધુ મેન્યુઅલ પ્રયત્નો કરવા પડશે. જ્યારે AI ટ્રાફિક તમારા API સપાટીનો એક નોંધપાત્ર અને વધતો જતો ભાગ હોય ત્યારે આ ટિયર વધુ ઉપયોગી સાબિત થાય છે.
સારાંશ (Takeaway)
AI Gateway tier એ સ્વીકારે છે કે LLM ટ્રાફિક પરંપરાગત API કોલ્સ કરતા મૂળભૂત રીતે અલગ રીતે વર્તે છે. રિક્વેસ્ટ કાઉન્ટિંગને બદલે ટોકન-આધારિત ગવર્નન્સ તરફ વળવાથી, તે ડેવલપર્સને કસ્ટમ કોડમાં ડૂબ્યા વગર AI ખર્ચને નિયંત્રણમાં રાખવાની વ્યવહારુ રીત આપે છે. જે ટીમોનો AI વપરાશ પહેલેથી જ ઘણો છે—અથવા વધવાની અપેક્ષા છે—તેમના માટે અત્યારે પ્રીવ્યુ ટેસ્ટ કરવાથી ટોકન-ખર્ચની બેઝલાઇન બનાવવામાં મદદ મળી શકે છે.
