اگر آپ large language models پر پروڈکشن ورک لوڈز چلا رہے ہیں، تو آپ پہلے سے جانتے ہوں گے کہ ماڈل کی کارکردگی صرف آدھی جنگ ہے۔ دوسری آدھی جنگ مہینے کے آخر میں آنے والا بل ہے۔ تین فراہم کنندگان—Mancer 2، Novita، اور StreamLake—نے حال ہی میں اپنے ماڈل کی قیمتوں میں تبدیلی کی ہے۔ اگر آپ ان میں سے کسی بھی API پر انحصار کرتے ہیں، تو آپ کا اگلا انوائس پچھلے والے سے مختلف ہو سکتا ہے۔

یہ اب کوئی غیر معمولی بات نہیں رہی۔ LLM مارکیٹ اب بھی اس بات کا تجربہ کر رہی ہے کہ inference کے لیے چارج کیسے کیا جائے۔ کچھ فراہم کنندگان فی ہزار ٹوکنز کے حساب سے بل کرتے ہیں۔ دوسرے درخواستوں کو مختلف tiers میں تقسیم کرتے ہیں یا مسلسل استعمال (sustained-use) پر ڈسکاؤنٹ دیتے ہیں۔ جب کوئی پلیٹ فارم اپنی یونٹ قیمت بدلتا ہے یا اپنے tiers کی ساخت تبدیل کرتا ہے، تو آپ کے بجٹ پر اس کا اثر معمولی پریشانی سے لے کر لاگت میں بڑے اضافے تک ہو سکتا ہے۔ ان اپ ڈیٹس پر نظر رکھنا کوئی اختیاری کام نہیں ہے۔ یہ کام کا حصہ ہے۔

API کی قیمتوں کو آپ کی توجہ کیوں درکار ہے

ڈویلپرز اکثر API کی قیمتوں کو ایک ایسی چیز سمجھتے ہیں جسے ایک بار سیٹ کر کے بھلا دیا جائے۔ آپ ایک ماڈل کا بینچ مارک کرتے ہیں، ایک فراہم کنندہ کا انتخاب کرتے ہیں، اور فیچرز بنانے کی طرف بڑھ جاتے ہیں۔ یہ تب تک کام کرتا ہے جب تک کہ کوئی مسئلہ نہ آ جائے۔ موجودہ حالات میں، قیمتوں میں تبدیلیاں بغیر کسی شور شرابے کے ہو سکتی ہیں۔ ایک فراہم کنندہ اپنے پرانے (legacy) ماڈل کی قیمت کم کر سکتا ہے جبکہ اپنے نئے endpoint کی قیمت بڑھا سکتا ہے۔ کوئی دوسرا output-token سرچارجز متعارف کروا سکتا ہے جو گزشتہ سہ ماہی میں موجود نہیں تھے۔ اگر آپ نظر نہیں رکھ رہے، تو آپ کو اس کا پتہ صرف تب چلے گا جب آپ کا کلاؤڈ بل آئے گا۔

LLM بلنگ کی باریک بینی اسے خاص طور پر مشکل بنا دیتی ہے۔ آپ شاذ و نادر ہی کوئی فلیٹ ماہانہ ریٹ ادا کرتے ہیں۔ آپ ہر prompt token اور ہر completion token کے لیے ادائیگی کر رہے ہوتے ہیں۔ آؤٹ پٹ (output) کی جانب قیمت میں اضافہ ان پٹ (input) کے مقابلے میں زیادہ تکلیف دہ ہو سکتا ہے، کیونکہ completions اکثر prompts سے زیادہ طویل ہوتی ہیں۔ اگر آپ کی ایپلی کیشن طویل متن، کوڈ، یا کثیر مرحلہ وار منطقی زنجیریں (reasoning chains) تیار کرتی ہے، تو فی ٹوکن معمولی اضافہ بھی تیزی سے بڑھ جاتا ہے۔

یہاں 'ڈرفٹ' (drift) کا مسئلہ بھی ہے۔ وقت کے ساتھ ساتھ آپ کی ایپلی کیشن کا ٹوکن پروفائل بدل جاتا ہے۔ آپ ایک نیا system prompt شامل کر سکتے ہیں جو زیادہ input tokens استعمال کرتا ہو۔ آپ chain-of-thought prompting پر منتقل ہو سکتے ہیں جو طویل آؤٹ پٹ پیدا کرتی ہے۔ اگر فراہم کنندگان کی قیمتیں بھی تبدیل نہ ہوں، تب بھی آپ کی لاگت بدل جائے گی۔ جب فراہم کنندگان کی قیمتیں ایک ہی وقت میں بدلتی ہیں، تو اس کا مجموعی اثر اس ٹیم کو اچانک جھٹکا دے سکتا ہے جس کے پاس اس کی معلومات (visibility) نہ ہو۔

کیا تبدیل ہوا ہے

Mancer 2، Novita، اور StreamLake نے قیمتوں میں تبدیلیاں متعارف کروا دی ہیں۔ تفصیلات ہر پلیٹ فارم کے لحاظ سے مختلف ہیں، لیکن سمت ایک ہی ہے: وہ لاگت کا ڈھانچہ جو آپ نے پچھلے مہینے استعمال کیا تھا، شاید اب نافذ العمل نہ ہو۔

Mancer 2 نے اپنی ماڈل کی قیمتوں کو اپ ڈیٹ کیا ہے، جس کا مطلب ہے کہ اس کے endpoints استعمال کرنے والے ڈویلپرز کو اپنی فی درخواست (per-request) لاگت کا دوبارہ جائزہ لینے کی ضرورت ہے۔ اگر آپ نے اپنی اندرونی دستاویزات میں پرانی قیمتوں کی فہرستیں محفوظ کر رکھی ہیں، تو وہ نمبر اب پرانے ہو چکے ہیں۔

Novita نے بھی اپنی پیشکشوں میں قیمتوں میں تبدیلیاں کی ہیں۔ ان ٹیموں کے لیے جنہوں نے Novita کا انتخاب اس لیے کیا تھا کہ یہ ایک مخصوص بجٹ کے مطابق تھا، نئی شرحیں جاری منصوبوں کی کل لاگت (total cost of ownership) کو بدل سکتی ہیں۔

StreamLake نے بھی اپنی قیمتوں میں تبدیلی کی ہے۔ اگلے بلنگ سائیکل سے پہلے StreamLake کے پرانے ریٹ کارڈ کے گرد بنائی گئی کسی بھی انٹیگریشن کا جائزہ لیا جانا چاہیے۔

چونکہ یہ تین مختلف پلیٹ فارمز ہیں جن کے تین الگ الگ پرائسنگ ماڈلز ہیں، اس لیے اس بارے میں کوئی عالمگیر اصول نہیں ہے کہ آپ زیادہ ادائیگی کریں گے یا کم۔ ایک فراہم کنندہ نے starter-tier کی شرحیں کم کی ہوں گی جبکہ premium throughput کی قیمت بڑھائی ہوگی۔ کوئی دوسرا context-window کے پریمیم میں تبدیلی کر سکتا ہے۔ واحد محفوظ مفروضہ یہ ہے کہ آپ کا پرانا اسپریڈ شیٹ اب غلط ہے۔

شرحوں میں تبدیلیوں کو نظر انداز کرنے کے پوشیدہ اخراجات

آئیے دیکھتے ہیں کہ عملی طور پر اس کا کیا مطلب ہے۔ فرض کریں کہ آپ ایک کسٹمر سپورٹ اسسٹنٹ چلاتے ہیں جو روزانہ دس ہزار گفتگو سنبھالتا ہے۔ ہر تبادلے میں اوسطاً دو ہزار input tokens اور چار سو output tokens ہوتے ہیں۔ فی ملین ٹوکنز میں چند سینٹ کی تبدیلی بھی مہینے میں سینکڑوں ڈالر تک پہنچ سکتی ہے۔ اگر قیمت میں تبدیلی output tokens کو متاثر کرتی ہے اور آپ کا اسسٹنٹ طویل جوابات دینا شروع کر دیتا ہے کیونکہ آپ نے ماڈل اپ گریڈ کیا ہے، تو آپ کو دوہری ضرب پڑے گی۔

پھر ملٹی پلائر ایفیکٹ (multiplier effect) کا مسئلہ ہے۔ بہت سی ایپلی کیشنز صارف کی ہر درخواست پر ایک بار LLM کو کال نہیں کرتیں۔ وہ اسے ایک لوپ میں، یا ریٹریول (retrieval) کے مراحل والے پائپ لائن میں، یا ثانوی ماڈلز کے فال بیک (fallback) کے ساتھ کال کرتی ہیں۔ فال بیک ماڈل پر قیمت میں تبدیلی شاید فوری طور پر اہم نہ لگے، جب تک کہ آپ کا بنیادی ماڈل ریٹ لیمٹ تک نہ پہنچ جائے اور آپ ایک مشکل وقت میں زیادہ مہنگے بیک اپ کو استعمال کرنے پر مجبور ہو جائیں۔

بجٹ سے تجاوز کرنا ہی واحد خطرہ نہیں ہے۔ اگر قیمتیں گرتی ہیں اور آپ کو پتہ نہیں چلتا، تو ہو سکتا ہے کہ آپ بلا ضرورت استعمال کو محدود (throttle) کر رہے ہوں۔ آپ زیادہ صارفین کو خدمات فراہم کر سکتے تھے، بڑے دستاویزات پر کارروائی کر سکتے تھے، یا صارفین کے لیے اپنی قیمتیں کم کر سکتے تھے۔ لاعلمی دونوں طرف سے نقصان دہ ہے۔

لاگت ٹریک کرنے کی عادت کیسے ڈالیں

اس پر نظر رکھنے کے لیے آپ کو کسی بڑے کاروباری مالیاتی (enterprise finance) ٹیم کی ضرورت نہیں ہے۔ آپ کو صرف ایک معمول (routine) اور تبدیلیوں کو درج کرنے کے لیے ایک جگہ کی ضرورت ہے۔

اپنے ریٹ کارڈز (rate cards) کو ایک جگہ جمع کرنے سے آغاز کریں۔ ایک سادہ دستاویز رکھیں—چاہے وہ کوئی شیئرڈ ویکی پیج ہو، Notion ٹیبل ہو، یا آپ کے ڈویلپمنٹ چینل میں پن کیا ہوا کوئی پیغام—جس میں آپ کے استعمال کردہ ہر ماڈل کی موجودہ فی ٹوکن یا فی ریکویسٹ قیمت درج ہو۔ جب بھی کوئی فراہم کنندہ (provider) تبدیلی کا اعلان کرے، فوراً دستاویز کو اپ ڈیٹ کریں۔ اسپرنٹ ریویو (sprint review) کا انتظار نہ کریں۔

اس کے بعد، اپنے استعمال کو فراہم کنندہ اور ماڈل کے لحاظ سے ٹیگ کریں۔ زیادہ تر آبزرویبلٹی ٹولز (observability tools) آپ کو API کالز کے ساتھ کسٹم میٹا ڈیٹا (custom metadata) منسلک کرنے کی اجازت دیتے ہیں۔ ہفتہ وار لاگت کا خلاصہ تیار کرنے کے لیے ان ٹیگز کا استعمال کریں۔ اگر آپ کو اخراجات میں اچانک اضافہ نظر آئے، تو آپ چند دنوں کے بجائے چند سیکنڈوں میں یہ معلوم کر سکتے ہیں کہ یہ استعمال میں اضافے کی وجہ سے ہے یا ریٹ میں تبدیلی کی وجہ سے۔

برن ریٹ الرٹ (burn-rate alert) بنائیں۔ اس کا پیچیدہ ہونا ضروری نہیں ہے۔ ایک شیڈول شدہ اسکرپٹ جو آپ کے یوزج ڈیش بورڈ سے ڈیٹا لے کر ہر صبح Slack پر ایک نمبر پوسٹ کر دے، کافی ہے۔ جب یہ نمبر بڑھے گا، تو آپ کو اسی دن پتہ چل جائے گا، نہ کہ تیس دن بعد جب فنانس ٹیم کی طرف سے کوئی غصے بھرا ای میل آئے گا۔

ہر سہ ماہی میں اپنے ماڈل کے انتخاب کا جائزہ لیں۔ جنوری میں آپ کے استعمال کے لیے بہترین ماڈل جون میں بہترین نہیں ہو سکتا، اس لیے نہیں کہ ماڈل خراب ہو گیا ہے، بلکہ اس لیے کہ قیمتوں کا منظرنامہ بدل چکا ہے۔ کوئی فراہم کنندہ جو پہلے بہت مہنگا تھا، شاید اس نے ریٹ کم کر دیے ہوں۔ کوئی سستا پسندیدہ ماڈل شاید قیمتیں بڑھا چکا ہو۔ اپنے بینچ مارکس (benchmarks) کا موازنہ پرانی قیمتوں کے بجائے تازہ ترین قیمتوں سے کریں۔

آخر میں، اپنے آرکیٹیکچر کے فیصلوں میں قیمتوں کو مدنظر رکھیں۔ اگر آپ جانتے ہیں کہ کوئی فراہم کنندہ اکثر ریٹ تبدیل کرتا ہے، تو اپنے سسٹم کو اس طرح ڈیزائن کریں کہ آپ آدھا کوڈ بیس (codebase) دوبارہ لکھے بغیر اینڈ پوائنٹس (endpoints) کو تبدیل کر سکیں۔ کلائنٹ کو ایک انٹرنل انٹرفیس (internal interface) کے پیچھے چھپائیں (abstract)۔ ماڈل کا نام کنفیگریشن فائل (configuration file) میں رکھیں، نہ کہ اسے اپنے پرامپٹ لیئر (prompt layer) میں ہارڈ کوڈ کریں۔

قابل اعتماد اپ ڈیٹس کہاں سے حاصل کریں

فراہم کنندگان کے بلاگز اور دستاویزات (documentation) سرکاری ذرائع ہیں، لیکن مصروف ہفتے میں ان پر نظر رکھنا مشکل ہو سکتا ہے۔ ایک آپشن یہ ہے کہ آپ ان منتخب مجموعوں (curated roundups) کو فالو کریں جو پورے ایکو سسٹم میں اس قسم کی تبدیلیوں پر نظر رکھتے ہیں۔ Mancer 2، Novita، اور StreamLake کی حالیہ تبدیلیوں کی مکمل تفصیلات کے لیے، یہاں تفصیلی خلاصہ دیکھیں:

Changes to LLM Pricing: Mancer 2, Novita, and StreamLake

اگر آپ صورتحال سے باخبر رہنا چاہتے ہیں اور ان دیگر ڈویلپرز کے ساتھ مشورے تبادلہ کرنا چاہتے ہیں جو اپنے AI انفراسٹرکچر کے بلوں کو قابو میں رکھنے کی کوشش کر رہے ہیں، تو ایک کمیونٹی بھی ہے جس میں شامل ہونا فائدہ مند ہو سکتا ہے:

GyaanSetu AI on Telegram

اچانک آنے والے بلوں کے خلاف بہترین دفاع ان لوگوں کا نیٹ ورک ہے جو تبدیلیوں کے ہوتے ہی ان کی نشاندہی کر دیں۔

اصل سبق

قیمتوں میں اتار چڑھاؤ موجودہ LLM مارکیٹ کی ایک حقیقت ہے، کوئی خرابی (bug) نہیں ہے۔ ماڈلز کو چلانا سستا ہوتا جا رہا ہے، فراہم کنندہ ریٹ کے ڈھانچوں کے ساتھ تجربات کر رہے ہیں، اور مقابلہ قیمتوں کو اوپر نیچے کرتا رہتا ہے۔ طویل مدت میں یہ اچھی خبر ہے، لیکن صرف اس صورت میں اگر آپ توجہ دے رہے ہوں۔ اپنی API لاگت کے ساتھ ویسا ہی سلوک کریں جیسا آپ اپنے اپ ٹائم میٹرکس (uptime metrics) کے ساتھ کرتے ہیں: انہیں ناپیں، ان پر الرٹ لگائیں، اور باقاعدگی سے ان پر سوال اٹھائیں۔ Mancer 2، Novita، اور StreamLake کی حالیہ تبدیلیاں محض ایک تازہ یاد دہانی ہیں کہ آپ کے AI اسٹیک کی قیمت کبھی بھی مستقل نہیں ہوتی۔