اگر آپ بڑے لینگویج ماڈلز (large language models) پر مبنی کوئی پروڈکٹ لانچ کرتے ہیں، تو آپ کا منافع (margin) صرف اتنا ہی مستحکم ہے جتنا آپ کے فراہم کنندہ (provider) کا ریٹ کارڈ۔ Novita اور StreamLake دونوں نے حال ہی میں اپنی ماڈل قیمتوں میں تبدیلی کی ہے، اور اس کا مطلب ہے کہ آپ کی یونٹ اکانومکس (unit economics) بدل چکی ہے، چاہے آپ نے اس پر غور کیا ہو یا نہیں۔ یہ معمول کے دیکھ بھال کے وقفے (maintenance windows) نہیں ہیں۔ جب انفرنس فراہم کنندہ (inference providers) اپنی فی ٹوکن (per-token) قیمتیں تبدیل کرتے ہیں، تو سپورٹ ٹکٹ کی درجہ بندی کرنے، دستاویز کا خلاصہ کرنے، یا کوڈ کی تجویز تیار کرنے کی لاگت راتوں رات بدل جاتی ہے۔ وہ ڈویلپرز جو API کی قیمتوں کو ایک مستقل پس منظر کا شور (static background noise) سمجھتے ہیں، انہیں عام طور پر مسئلہ تب پتہ چلتا ہے جب ان کا ماہانہ بل آتا ہے۔
خاموشی سے ہونے والی قیمتوں میں تبدیلی بجٹ کو کیسے بگاڑ سکتی ہے
زیادہ تر انجینئرنگ ٹیمیں ایک انفرنس فراہم کنندہ کا انتخاب کرتی ہیں، کچھ لیٹنسی بینچ مارکس (latency benchmarks) کا تجربہ کرتی ہیں، اور پھر آگے بڑھ جاتی ہیں۔ پرامپٹ ٹیمپلیٹس (prompt templates) کو ورژن کنٹرول میں شامل کر دیا جاتا ہے، کلائنٹ کوڈ پروڈکشن میں چلا جاتا ہے، اور فنانس ٹیم کو ایک ماہانہ تخمینہ مل جاتا ہے۔ یہ طریقہ کار تب تک کام کرتا ہے جب تک کہ کوئی مسئلہ نہ آ جائے۔ ٹوکنز (Tokens) ایک استعمال ہونے والا ذریعہ (consumable resource) ہیں۔ آپ کا بل صارفین کے استعمال، سیاق و سباق کی طوالت (context length)، اور دوبارہ کوشش (retry) کے رویے کے ساتھ بڑھتا ہے۔ ریٹ میں اضافہ جو اسپریڈ شیٹ پر معمولی نظر آتا ہے، وہ زیادہ حجم والے فیچر کے منافع کو ختم کر سکتا ہے۔
اس کا اثر مکمل طور پر آپ کے استعمال کے انداز پر منحصر ہے۔ ایک ایسی ٹیم جو مختصر درجہ بندی والے پرامپٹس بھیجتی ہے، وہ کسی بھی تبدیلی کے بغیر قیمت کے اس ایڈجسٹمنٹ کو برداشت کر سکتی ہے۔ ایک ایسی ٹیم جو طویل سیاق و سباق (long context windows) پر کام کرتی ہے یا ہزاروں صفحات پر بیچ جابز (batch jobs) چلا رہی ہے، وہ اپنے اخراجات (burn rate) میں تیزی سے اضافہ دیکھ سکتی ہے۔ فیصد میں وہی تبدیلی مختلف اثرات ڈالتی ہے، اس بات پر منحصر ہے کہ آپ کی اوسط کال دو سو ٹوکنز کی ہے یا بیس ہزار۔ یہی وجہ ہے کہ Novita اور StreamLake کی اپ ڈیٹس پر گہری نظر رکھنا ضروری ہے۔ آپ کو یہ جاننے کی ضرورت ہے کہ آیا فی صارف آپ کی اوسط لاگت آپ کے تخمینوں سے باہر نکل گئی ہے، اور کیا اب ٹریفک کو دوبارہ ترتیب دینے (reroute) کا وقت آ گیا ہے۔
Novita کی قیمتوں میں اپ ڈیٹ
Novita نے حال ہی میں اپنے ماڈل کی قیمتوں میں تبدیلی کی ہے۔ یہ پلیٹ فارم مختلف لینگویج ماڈلز تک رسائی فراہم کرتا ہے، اور وہاں ہونے والی کوئی بھی تبدیلی ان ٹیموں کے آپریشنل اخراجات پر براہ راست اثر ڈالتی ہے جو اسے بنیادی انفرنس لیئر کے طور پر استعمال کرتی ہیں۔ چونکہ Novita متعدد ماڈلز کی میزبانی کرتا ہے، اس لیے یہ اپ ڈیٹ پورے کیٹلاگ میں یکساں نہیں ہو سکتی۔ ماڈلز کا ایک گروپ قیمتوں میں تبدیل نہ ہو جبکہ دوسرا بدل جائے۔ یہ باریک بینی (granularity) اس سے کہیں زیادہ اہم ہے جتنا کہ ایک عمومی اعلان ظاہر کرتا ہے۔
اگر آپ تمام ٹریفک کو ایک ہی ماڈل آئی ڈی کے ذریعے بھیجتے ہیں، تو آپ کے نئے متوقع اخراجات کا حساب لگانا آسان ہے۔ اگر آپ Novita کے کیٹلاگ کو متحرک طور پر استعمال کرتے ہیں، یعنی پیچیدہ پرامپٹس کو بڑے ماڈلز کی طرف اور سادہ پرامپٹس کو چھوٹے ماڈلز کی طرف بھیجتے ہیں، تو آپ کی اوسط مجموعی لاگت (blended average cost) ان طریقوں سے بدل سکتی ہے جن کی وضاحت کوئی ایک الرٹ نہیں کر سکتا۔ جاننے کا واحد طریقہ یہ ہے کہ آپ اپنے استعمال کے لاگز (usage logs) نکالیں، انہیں ماڈل کے لحاظ سے گروپ کریں، اور اصل ٹوکن کی تعداد کو نئے ریٹ کارڈ سے ضرب دیں۔ اس بات پر اپنی یادداشت پر بھروسہ نہ کریں کہ فی ملین ٹوکنز قیمت کیا ہوا کرتی تھی۔ اسے لکھ لیں۔ ایک تاریخی ریکارڈ رکھیں۔ اسے اپنے سہ ماہی جائزے (quarterly review cycle) کا حصہ بنائیں تاکہ اگلی تبدیلی آپ کو حیران نہ کر دے۔
StreamLake کی قیمتوں میں اپ ڈیٹ
StreamLake نے بھی اپنے ماڈلز پر قیمتوں کی اپ ڈیٹ جاری کی ہے۔ اس کے اسٹیک (stack) کے ساتھ منسلک ٹیموں کے لیے، ٹوکن ریٹس میں کوئی بھی تبدیلی مواد کے تجزیہ (content analysis)، ٹرانسکرپشن بیک اینڈز (transcription back-ends)، جنریٹیو فیچرز (generative features)، یا پلیٹ فارم کے ذریعے چلنے والے کسی بھی دوسرے لینگویج ورک لوڈ کے حساب کتاب کو بدل دیتی ہے۔ ایڈجسٹمنٹ کا مطلق حجم (absolute size) کمپاؤنڈنگ اثر (compounding effect) کے مقابلے میں ثانوی ہے۔ اگر آپ روزانہ متعدد ماحول میں لاکھوں ٹوکنز پر کارروائی کر رہے ہیں، تو فی ٹوکن میں معمولی اضافہ بھی بہت زیادہ ہو جاتا ہے۔
اصل سوال یہ نہیں ہے کہ نئی قیمت کیا ہے، بلکہ یہ ہے کہ وہ نئی قیمت فی فیچر آپ کے مجموعی منافع (gross margin) پر کیا اثر ڈالتی ہے۔ اگر StreamLake کسی کسٹمر کے سامنے موجود خلاصہ کرنے والے ٹول یا کسی اندرونی ماڈریشن لیئر (moderation layer) کو چلا رہا ہے، تو آپ کی فروخت شدہ اشیاء کی لاگت (cost of goods sold) ابھی بدل گئی ہے۔ آپ کو اپنی آبزرویبلٹی ٹولنگ (observability tooling) میں اس اخراجات کو واضح طور پر الگ کرنا چاہیے۔ ان API کالز کو فراہم کنندہ اور فیچر کے لحاظ سے ٹیگ کریں تاکہ جب انوائس آئے، تو آپ اسے درست طریقے سے تقسیم کر سکیں۔ اگر کوئی ایک استعمال کا کیس غیر منافع بخش ہو گیا ہے، تو آپ کو یہ فیصلہ کرنے کے لیے ڈیٹا کی ضرورت ہوگی کہ آیا اسے محدود (throttle) کرنا ہے، چھوٹے ماڈل پر ڈاؤن گریڈ کرنا ہے، یا اسے ایک اسٹریٹجک لاگت کے طور پر برداشت کرنا ہے۔
اپنے انفرنس اخراجات کا آڈٹ کیسے کریں
قبول کرنا
