AI Routing کا پانڈورا باکس
DeepMind نے "Pandora’s Router" متعارف کرایا ہے، جو ایک ایسا فریم ورک ہے جو ماڈل کے انتخاب (model-selection) کو ایک لاگت کے بارے میں آگاہ (cost-aware) پانڈورا باکس کے مسئلے کے طور پر دیکھتا ہے۔ صرف اس معلومات کے لیے چارج کر کے جو نتائج کو حقیقت میں بہتر بناتی ہے، یہ سسٹم انفرنس (inference) کے اخراجات میں نمایاں کمی لاتا ہے جبکہ نتائج کو جامع تلاش (exhaustive searches) کے برابر رکھتا ہے۔
ماڈل کا انتخاب مفت کیوں نہیں ہے
پروڈکشن پائپ لائنز میں اکثر یہ فرض کر لیا جاتا ہے کہ ماڈل کا انتخاب کرنے والے مرحلے کی کوئی قیمت نہیں ہوتی۔ حقیقت میں، کسی ماڈل کی موزونیت کا اندازہ لگانے کے لیے کمپیوٹ (compute)، میموری، اور بعض اوقات بیرونی ڈیٹا کالز کا استعمال ہوتا ہے۔ ایک تیز اور غیر یقینی (noisy) اندازہ سستا تو ہوتا ہے لیکن یہ گمراہ کن ہو سکتا ہے؛ جبکہ ایک درست اندازہ لگانے کا مطلب عام طور پر ایک چھوٹے ماڈل کو چلانا یا اضافی سیاق و سباق (context) حاصل کرنا ہوتا ہے، جس سے اخراجات بڑھ جاتے ہیں۔
DeepMind کا مقالہ اس الجھن کو ایک نیا رخ دیتا ہے۔ ہر ممکنہ ماڈل کے پیچھے ایک "قیمت" (value) چھپی ہوتی ہے – یعنی آنے والی درخواست (query) پر اس کی متوقع کارکردگی۔ یہ فریم ورک ایک کنٹرولر کو اس قیمت پر نظر ڈالنے کے لیے فیس ادا کرنے کی اجازت دیتا ہے اور جیسے ہی مزید معلومات حاصل کرنے کی لاگت اس کے فائدے سے زیادہ ہونے لگے، یہ ادائیگی روک دیتا ہے۔
حل کے دو حصے
Pandora’s Router – ایک مرکزی انجن جو ہر درخواست کے لیے یہ فیصلہ کرتا ہے کہ آیا ماڈل کی قیمت کے زیادہ درست اندازے کے لیے ادائیگی کرنی چاہیے یا نہیں۔ یہ ایک "ریزرو پرائس" (reserve price) مقرر کرتا ہے: ایک ایسی حد جس سے نیچے بہتر اندازے سے ہونے والا متوقع فائدہ فیس کے برابر یا اس سے کم ہو۔ جب متوقع بہتری ریزرو پرائس سے تجاوز کر جائے، تو انجن وہ معلومات خرید لیتا ہے؛ ورنہ یہ اپنے پاس موجود بہترین اندازے کے ساتھ آگے بڑھ جاتا ہے۔
Pandora’s Bidder – ماڈل مارکیٹ پلیسز کے لیے ایک غیر مرکزی (decentralized) متبادل۔ آزاد فراہم کنندگان یہ فیصلہ کرتے ہیں کہ بولی (bid) جمع کرانے سے پہلے اپنی قیمت کے اندازے کو بہتر بنانے کے لیے کمپیوٹ خرچ کرنا چاہیے یا نہیں۔ ان کی اپنی ریزرو پرائس صرف اسی صورت میں خرچ کرنے پر مجبور کرتی ہے جب بہتر اندازے کے جیتنے کے امکانات ہوں۔
دونوں حصے ایک ہی اصول پر کام کرتے ہیں: معلومات پر صرف اسی وقت خرچ کریں جب اس کا متوقع فائدہ اس کی لاگت سے زیادہ ہو۔
تین شعبوں میں نتائج
مصنفین نے تین مختلف کاموں (workloads) پر اس طریقے کا تجربہ کیا:
- ریاضیاتی استدلال (Mathematical reasoning) – مختلف درستگی والے حل کنندگان (solvers) میں سے انتخاب کرنا۔
- Retrieval-augmented generation (RAG) – مختلف نالج بیس تلاش کرنے کی حکمت عملیوں میں سے انتخاب کرنا۔
- بڑے پیمانے کے ایمبیڈنگ ماڈلز (Large-scale embedding models) – مماثلت کی تلاش (similarity search) کے لیے بہترین انکوڈر کا انتخاب کرنا۔
Pandora’s Router نے ہر صورت میں اسٹیٹک روٹنگ رولز اور گریڈی ہیورسٹکس (greedy heuristics) کو شکست دی۔ مشکل ترین حالات میں بھی اس نے تمام ماڈلز کے بروٹ فورس اسکین (brute-force scan) کے برابر معیار فراہم کیا جبکہ معائنے کے زیادہ تر اخراجات سے بچ گیا۔ مصنفین کے مطابق "معائنے کے زیادہ تر اخراجات" بچ گئے، جس کا مطلب کمپیوٹ کے اخراجات میں بڑی کمی ہے۔
AI انجینئرنگ کے لیے اس کے معنی
- روٹنگ کے اضافی بوجھ (overhead) کو نظر انداز نہ کریں۔ یہ فیصلہ کرنا کہ کون سا ماڈل استعمال کیا جائے، ایک قابلِ پیمائش قیمت رکھتا ہے۔
- ریزرو پرائس متعارف کروائیں۔ ایک واضح حد مقرر کریں کہ کب اضافی معلومات اپنی فیس کے قابل ہوتی ہیں۔
- لاگت کے بارے میں آگاہ روٹنگ (cost-aware routing) اپنائیں۔ ایک ایسا فیصلہ کرنے والا لیئر جو متوقع فائدے اور اخراجات میں توازن برقرار رکھتا ہے، ماڈل کی فہرستیں بڑھنے کے ساتھ ساتھ بجٹ کو قابو میں رکھتا ہے۔
دوسرا پہلو: بڑھتی ہوئی پیچیدگی
بولی یا روٹنگ کا لیئر شامل کرنے سے کچھ نقصانات بھی ہو سکتے ہیں۔ ٹیموں کو اس لاجک کو برقرار رکھنا پڑتا ہے جو ریزرو پرائس کا حساب لگاتی ہے، فیس کے ڈھانچے کی نگرانی کرتی ہے، اور اس بات کو یقینی بناتی ہے کہ اضافی کوڈ کا راستہ رکاوٹ (bottleneck) نہ بن جائے۔ صرف چند ماڈلز والے چھوٹے پیمانے کے استعمال کے لیے، Pandora’s Router بچت سے زیادہ خرچ کر سکتا ہے۔ یہ فریم ورک یہ بھی فرض کرتا ہے کہ بہتر اندازے کی لاگت معلوم اور مستحکم ہے—ایک ایسا مفروضہ جو اتار چڑھاؤ والی کلاؤڈ قیمتوں یا اسپاٹ انسٹنس (spot-instance) کے تعطل کے دوران غلط ثابت ہو سکتا ہے۔
خلاصہ
ماڈل کے انتخاب کو ایک معاشی فیصلے کے طور پر دیکھیں، نہ کہ روٹنگ کے ایک مفت مرحلے کے طور پر۔ Pandora’s Router ظاہر کرتا ہے کہ ایک منظم اور لاگت کے بارے میں آگاہ طریقہ کار آؤٹ پٹ کے معیار پر سمجھوتہ کیے بغیر غیر ضروری کمپیوٹ کو کم کر سکتا ہے، جس سے AI سسٹمز کو وسعت پذیر (scalable) اور مالی طور پر پائیدار رکھا جا سکتا ہے۔
