Vercel کی جون کی ٹوکن شیئر رپورٹ ظاہر کرتی ہے کہ اوپن ویٹ ماڈلز (open-weight models) گیٹ وے ٹوکنز کا 29% حصہ سنبھال رہے ہیں، جو اپریل کے 11% سے زیادہ ہے۔ اس میں سے صرف DeepSeek اکیلے 22.6% حجم کا حصہ رکھتا ہے۔ یہ اضافہ ایک تیز رفتار تبدیلی کا اشارہ دیتا ہے: ڈویلپرز ایک واحد "بہترین" ماڈل سے ہٹ کر AI ماڈلز کو روٹیبل انفراسٹرکچر (routable infrastructure) کے طور پر استعمال کر رہے ہیں۔
ڈویلپرز ماڈلز کو انفراسٹرکچر کے طور پر کیوں دیکھ رہے ہیں
سستے، اوپن ویٹ ماڈلز—جن میں سے بہت سے چینی فراہم کنندگان کے ہیں—Anthropic جیسی پریمیم پیشکشوں کے مقابلے میں بہت کم قیمت پر دستیاب ہیں۔ کوڈ ایکسٹریکشن، ٹیکسٹ کلیننگ، یا سادہ ڈیٹا لک اپس جیسے معمول کے کاموں کے لیے، ایک ایسا ماڈل جو ڈالرز کے بجائے سینٹس میں قیمت رکھتا ہو، زیادہ پرکشش ہو سکتا ہے، چاہے وہ چند فیصد کم درست ہی کیوں نہ ہو۔
اس کا نتیجہ ایک نیا ڈیزائن پیٹرن ہے۔ ایک ایپلی کیشن پہلے کام کے "معمولی" حصے کے لیے ایک کم لاگت والے ماڈل کو درخواست بھیجتی ہے۔ اگر آؤٹ پٹ ایک سادہ کوالٹی چیک پاس کر لیتا ہے، تو پائپ لائن آگے بڑھتی ہے؛ اگر نہیں، تو دوسرے مرحلے یا حتمی فیصلے کے لیے ایک زیادہ قیمت والے ماڈل کو بلایا جاتا ہے۔ یہاں روٹنگ لاجک (routing logic) اہم عنصر بن جاتی ہے، نہ کہ کسی ایک ماڈل کا انتخاب۔
اعداد و شمار کیا کہتے ہیں
Vercel کا ڈیٹا، جو کہ متعدد AI فراہم کنندگان کے سامنے کام کرنے والے اس کے گیٹ وے سے حاصل کیا گیا ہے، ظاہر کرتا ہے کہ اوپن ویٹ ماڈلز حاشیے سے نکل کر مرکزی دھارے کا حصہ بن رہے ہیں۔ اپریل میں، وہ تمام ٹوکنز کے دسویں حصے سے تھوڑے سے زیادہ تھے؛ جون تک، وہ تقریباً ایک تہائی کے قریب پہنچ گئے۔ DeepSeek، جو کہ ایک چینی ماڈل ہے، اکیلے ٹوکن حجم کا پانچویں حصے سے زیادہ حصہ رکھتا ہے۔
مہنگے ماڈلز اب بھی اخراجات پر حاوی ہیں۔ مثال کے طور پر، Anthropic اب بھی زیادہ تر مالی اخراجات کا حصہ ہے کیونکہ فی ٹوکن اس کی قیمت زیادہ ہے۔ حساب کتاب سادہ ہے: سستے ماڈلز زیادہ حجم والے اور کم مارجن والے کاموں میں جیت جاتے ہیں، جبکہ مہنگے ماڈلز زیادہ مارجن اور زیادہ اثر انگیز کاموں کو برقرار رکھتے ہیں۔
AI ایجنٹس کے لیے اثرات
ایک AI ایجنٹ عام طور پر اقدامات کا ایک سلسلہ انجام دیتا ہے: منصوبہ بندی (planning)، ڈیٹا کی واپسی (data retrieval)، ٹول کا استعمال (tool invocation)، اور نتائج کی بہتری (result refinement)۔ جب ہر مرحلے کو سب سے زیادہ کفایتی ماڈل کے سپرد کیا جا سکتا ہے، تو مجموعی آپریشنل لاگت میں نمایاں کمی آتی ہے۔
- ڈیٹا کی واپسی (Data retrieval) اور ایکسٹریکشن (extraction) کے لیے اکثر صرف بنیادی لسانی سمجھ بوجھ کی ضرورت ہوتی ہے، جو کہ سستے ماڈلز کا بہترین کام ہے۔
- حتمی فیصلہ (Final judgment)—وہ حصہ جو یہ طے کرتا ہے کہ جواب قابل قبول ہے یا نہیں—پریمیم ماڈلز کے قبضے میں رہتا ہے جن کی بھروسہ مندی زیادہ ہوتی ہے۔
یہ تہوں والا طریقہ کار (layered approach) ڈویلپرز کو بجٹ سے تجاوز کیے بغیر بڑے ورک لوڈز کو خودکار بنانے کی اجازت دیتا ہے۔ یہ "بہترین ماڈل کا انتخاب کریں" کے بجائے "ہر مرحلے پر کامیابی کی پیمائش کریں اور اس کے مطابق روٹ کریں" کی طرف منتقلی پر مجبور کرتا ہے۔
خطرات اور حدود
معاشی پہلو پرکشش ہیں، لیکن یہ منتقلی بغیر کسی رکاوٹ کے نہیں ہے۔
- تعمیل (Compliance): کچھ دائرہ اختیار ڈیٹا ہینڈلنگ کے سخت قوانین نافذ کرتے ہیں جو غیر ملکی ہوسٹ شدہ ماڈلز کے استعمال کو محدود کر سکتے ہیں۔
- ہوسٹنگ کی پیچیدگی: بڑے پریمیم ماڈلز کو ان ہاؤس چلانا مشکل ہے، اس لیے تنظیموں کو بیرونی APIs پر انحصار کرنا پڑتا ہے، جس سے لیٹنسی (latency) اور وینڈر لاک (vendor-lock) کے خدشات پیدا ہو سکتے ہیں۔
ان عوامل کی وجہ سے، سستے ماڈلز کے مکمل طور پر پریمیم ماڈلز کی جگہ لینے کا امکان کم ہے۔ اس کے بجائے، وہ معمول کے کاموں کے لیے ڈیفالٹ بن جاتے ہیں، جبکہ پریمیم ماڈلز "فیصلہ سازی کی تہہ" (decision layer) میں رہتے ہیں جہاں ان کی زیادہ قیمت جائز ہوتی ہے۔
آگے کیا دیکھنا ہے
- روٹنگ کے لیے ٹولنگ: جیسے جیسے روٹنگ لیئر زیادہ مرکزی ہوتی جائے گی، ہم SDKs اور پلیٹ فارمز کی ایک لہر کی توقع کر سکتے ہیں جو لیٹنسی (latency)، لاگت، اور کانفیڈنس تھریش ہولڈز کی بنیاد پر ماڈل کے انتخاب کو خودکار بنا دیں گے۔
وہ ڈویلپرز جو ٹاسک لیول پر کامیابی کی پیمائش کرنا، ری ٹرائیز (retries) کو ٹریک کرنا، اور "حجم" کو "فیصلہ سازی" سے واضح طور پر الگ کرنا شروع کریں گے، وہ ابھرتی ہوئی انفراسٹرکچر کی سوچ سے فائدہ اٹھانے کے لیے بہترین پوزیشن میں ہوں گے۔
خلاصہ (Takeaway): AI اسٹیک ایک واحد ماڈل کے انتخاب سے بدل کر ایک روٹنگ کے مسئلے میں تبدیل ہو رہا ہے، جہاں سستے اوپن ویٹ ماڈلز کام کا زیادہ تر حصہ سنبھالتے ہیں اور پریمیم ماڈلز کو زیادہ اثر انگیز فیصلوں کے لیے محفوظ رکھا جاتا ہے۔ اس روٹنگ میں مہارت حاصل کرنا AI بنانے والوں کے لیے اگلی مسابقتی برتری ہوگی۔
