Microsoft نے Azure API Management (APIM) میں ایک مخصوص AI Gateway tier شامل کر دیا ہے۔ یہ اقدام اس بات کا اشارہ ہے کہ اب LLM کالز کو محض ایک اور API endpoint کے بجائے ایک الگ workload کے طور پر دیکھا جاتا ہے۔
کیوں LLM ٹریفک روایتی gateways کو ناکارہ بنا دیتی ہے
ایک سنگل پرامپٹ (prompt) کی قیمت دوسرے کے مقابلے میں سو گنا زیادہ ہو سکتی ہے، پھر بھی ایک معیاری API gateway ان دونوں کو ایک ہی درخواست (request) کے طور پر دیکھتا ہے۔ گیٹ وے کالز کی تعداد گنتا ہے، نہ کہ ان tokens کی تعداد جنہیں ماڈل پروسیس کرتا ہے۔ ایک ایسی درخواست جو چند سو tokens بھیجتی ہے اور دوسری جو ہزاروں tokens بھیجتی ہے، دونوں کے لیے 'request-count metrics' یکساں ہوں گے، باوجود اس کے کہ دوسری درخواست کی قیمت کئی گنا زیادہ ہو سکتی ہے۔
چار حقائق وجہ ہیں کہ کیوں AI کے لیے درخواست پر مبنی حدود (request-based limits) بے کار ہیں:
- قیمت ≠ درخواستوں کی تعداد۔ بلنگ tokens سے منسلک ہوتی ہے، نہ کہ اس سے کہ آپ کتنی HTTP کالز کرتے ہیں۔
- Token کا حجم بہت مختلف ہو سکتا ہے۔ ایک سوال مختصر ہو سکتا ہے، جبکہ دوسرا کسی طویل دستاویز پر مشتمل ہو سکتا ہے۔
- ماڈل کا انتخاب قیمت بدل دیتا ہے۔ مختلف LLMs فی token مختلف ریٹس وصول کرتے ہیں۔
- Streaming حتمی بل کو چھپا دیتی ہے۔ جب جوابات stream ہوتے ہیں، تو کل token کی تعداد اس وقت تک معلوم نہیں ہوتی جب تک stream ختم نہ ہو جائے۔
اگر آپ صرف درخواستوں کی پیمائش کرتے رہیں گے، تو آپ کے پاس ایسا مانیٹرنگ ڈیٹا ہوگا جو آپ کو اصل اخراجات کے بارے میں کچھ نہیں بتائے گا۔
AI Gateway tier کیا تبدیلیاں لاتا ہے
ٹوکن کے استعمال کو کنٹرول کرنے کے لیے درکار زیادہ تر پالیسیاں پہلے سے ہی معیاری APIM tiers میں موجود ہیں—جو XML رولز کی صورت میں لکھی گئی ہیں اور کسٹم ڈیش بورڈز پر دکھائی جاتی ہیں۔ AI tier ان تمام صلاحیتوں کو ایک مخصوص تجربے (purpose-built experience) میں یکجا کر دیتا ہے:
- AI ٹریفک کے لیے scaling کی علیحدگی (Isolation of scaling)۔
- سادہ کنفیگریشن جو دستی طور پر تیار کردہ XML پالیسیز کی ضرورت کو ختم کر دیتی ہے۔
بنیادی تبدیلی آپریشنل ہے: اب آپ کو ٹوکن بجٹ نافذ کرنے کے لیے پیچیدہ کوڈ لکھنے یا الگ ڈیش بورڈز برقرار رکھنے کی ضرورت نہیں ہے۔ یہ tier ان کنٹرولز کے لیے ایک تیار شدہ انٹرفیس فراہم کرتا ہے۔
کب سوئچ کریں – ٹریفک پر مبنی گائیڈ
- AI آپ کی ٹریفک کا ایک چھوٹا حصہ ہے۔ اپنا موجودہ APIM tier استعمال کرتے رہیں اور اگر آپ کو باریک بینی سے کنٹرول چاہیے تو token پالیسیاں شامل کر لیں۔
- AI آپ کی کالز پر غالب ہے۔ scaling کو الگ کرنے اور لاگت کے نظم و ضبط (cost governance) کو برقرار رکھنے کے لیے AI tier پر منتقل ہو جائیں۔
- آپ انجینئرنگ کے اضافی بوجھ سے بچنا چاہتے ہیں۔ اس tier کے بلٹ ان ٹولز کسٹم پالیسیز بنانے اور انہیں برقرار رکھنے میں لگنے والے وقت کو ختم کر دیتے ہیں۔
سب سے بڑا خرچہ سبسکرپشن کی قیمت نہیں ہے؛ بلکہ وہ انجینئرنگ کے گھنٹے ہیں جو ایک عام gateway میں خامیوں کو دور کرنے میں لگتے ہیں تاکہ اسے token economics سمجھایا جا سکے۔
Preview-phase playbook
Microsoft ابھی بھی AI tier کو preview میں پیش کر رہا ہے۔ اسے ایک testbed کے طور پر لیں، نہ کہ production launch کے طور پر۔
- ایک زیادہ حجم والا اندرونی AI workload منتخب کریں۔ اس سروس کا انتخاب کریں جو سب سے زیادہ token ٹریفک پیدا کرتی ہے۔
- اس workload کو AI tier کے ذریعے route کریں۔ فی صارف token کے استعمال کو ریکارڈ کرنے کے لیے نئی کنفیگریشن کا استعمال کریں۔
- کچھ ہفتوں کے لیے token-spend ڈیٹا جمع کریں۔ token کی تعداد اور متعلقہ اخراجات کا اپنے موجودہ مانیٹرنگ کے ساتھ موازنہ کریں۔
- بجٹ سازی کے لیے baseline کا استعمال کریں۔ فیصلہ کریں کہ آیا اس tier کے لاگت کنٹرول کے فوائد اس کی preview-phase کی حدود سے زیادہ ہیں۔
جب تک یہ سروس general availability تک نہ پہنچ جائے، تب تک mission-critical production workloads کو preview سروس پر منتقل نہ کریں۔
ایک دوسرا پہلو: ہر کسی کو الگ tier کی ضرورت نہیں ہے
اگر آپ کا ادارہ صرف کبھی کبھار LLM کو کال کرتا ہے، تو AI tier کی اضافی قیمت جائز نہیں ہو سکتی۔ آپ موجودہ پالیسی فریم ورک کے ذریعے token-level governance حاصل کر سکتے ہیں، اگرچہ اس میں دستی کوشش زیادہ لگے گی۔ یہ tier اس وقت بہترین ثابت ہوتا ہے جب AI ٹریفک آپ کے API surface کا ایک بڑا اور بڑھتا ہوا حصہ ہو۔
خلاصہ
AI Gateway tier اس حقیقت کو تسلیم کرتا ہے کہ LLM ٹریفک روایتی API کالز سے بنیادی طور پر مختلف ہوتی ہے۔ درخواستوں کی گنتی سے token-based governance کی طرف منتقل ہو کر، یہ ڈویلپرز کو کسٹم کوڈ میں الجھے بغیر AI کے اخراجات کو قابو میں رکھنے کا ایک عملی طریقہ فراہم کرتا ہے۔ ان ٹیموں کے لیے جن کا AI کا استعمال پہلے سے ہی کافی زیادہ ہے—یا بڑھنے کی توقع ہے—ابھی preview کا تجربہ کرنا token-spend baseline بنانے میں مدد دے سکتا ہے۔
