ایک انفرادی محقق نے ایک ماہ کے دوران اپنے LLM سے چلنے والے ریسرچ ایجنٹ کے استعمال کردہ ہر ٹوکن کا ریکارڈ رکھا اور بل میں 31% کی کمی کی۔ اخراجات $945 سے کم ہو کر $651 رہ گئے جبکہ کامیابی کی شرح 91% سے بڑھ کر 93% ہو گئی، یہ ایک ایسا نتیجہ ہے جسے کوئی بھی لاگت کے حساس AI ورک فلو چلانے والا شخص محسوس کرے گا۔

ٹوکن لیول کا ڈیٹا کیوں اہم تھا

زیادہ تر LLM صارفین صرف حتمی انوائس دیکھتے ہیں – ایک ایسی مجموعی رقم جو ہر ذیلی کام (sub-task) کی لاگت کو چھپا دیتی ہے۔ محقق کے ایجنٹ نے تین بنیادی کام انجام دیے: SEC فائلنگ کی تلاش، رپورٹس کا مسودہ تیار کرنا، اور تحقیقی نتائج کا خلاصہ تیار کرنا۔ تفصیلی ڈیٹا کے بغیر، وہ یہ نہیں بتا سکتا تھا کہ جون میں ادا کیے گئے $312 صحیح طرح خرچ ہوئے تھے یا نہیں۔

چھپے ہوئے اخراجات کو ظاہر کرنے کے لیے، اس نے ایک PostgreSQL لاگنگ لیئر شامل کی جس نے ماڈل کا نام، ٹوکن کی تعداد، کام کی قسم، اور فی کال لاگت کو محفوظ کیا۔ 30 دنوں کے بعد ڈیٹا نے ایک واضح تصویر پیش کی:

  • SEC فائلنگ سرچ – کل اخراجات کا 41%
  • رپورٹ ڈرافٹنگ – 28%
  • ریسرچ سنتھیسز – 17%
  • کوالٹی چیکس – 9%
  • متفرق – 5%

اعداد و شمار سے پتہ چلا کہ سب سے مہنگا مرحلہ خود ماڈل نہیں تھا بلکہ یہ تھا کہ ایجنٹ کس طرح خام سرچ نتائج کو پرامپٹس (prompts) میں شامل کرتا تھا۔

تین تبدیلیاں جنہوں نے بچت میں مدد دی

1. پرامپٹ دینے سے پہلے خلاصہ کریں

شروع میں ایجنٹ ہر پرامپٹ میں 20 خام سرچ نتائج ڈال دیتا تھا، جس سے ان پٹ میں ٹوکنز کی تعداد بہت بڑھ جاتی تھی۔ اس نے پہلے ایک سستا خلاصہ کرنے والا (summarizer) شامل کیا، جس سے ان پٹ میں نمایاں کمی آئی۔ فی سرچ ٹاسک لاگت $0.84 سے کم ہو کر $0.19 رہ گئی – یعنی 77% کی کمی۔

2. سادہ چیکس کو سستے ماڈل کی طرف بھیجیں

کوالٹی چیکس ایک ہائی اینڈ ماڈل پر چل رہے تھے جس کی لاگت فی چیک $0.09 تھی۔ اس نے زیادہ تر پاس/فیل چیکس کے لیے کم قیمت والا ماڈل استعمال کیا، جس سے فی چیک قیمت $0.01 تک گر گئی۔ سستا ماڈل 89% بار درست جواب دیتا تھا؛ کسی بھی ناکامی کی صورت میں اسے اصل ماڈل کے پاس بھیج دیا جاتا تھا، جس سے درستگی برقرار رہی اور لاگت میں 87% کی کمی آئی۔

3. جب اعتماد زیادہ ہو تو چیکس کو چھوڑ دیں

اس نے ایک اصول شامل کیا کہ جب بھی ٹاسک کی تاریخی کامیابی کی شرح زیادہ ہو اور آؤٹ پٹ کی لمبائی متوقع حد کے اندر ہو، تو کوالٹی چیک کے مرحلے کو نظر انداز کر دیا جائے۔ اس سے تقریباً 60% چیکز ختم ہو گئے جو ویسے بھی چلنے ہی والے تھے۔

حاصل ہونے والا فائدہ

ان تین تبدیلیوں کے بعد، ماہانہ حساب کتاب کچھ اس طرح نظر آیا:

  • مجموعی اخراجات: $945 → $651 (31% کمی)
  • فی ٹاسک SEC سرچ لاگت: $0.84 → $0.19 (77% کمی)
  • فی ٹاسک کوالٹی چیک لاگت: $0.09 → $0.01 (87% کمی)
  • مجموعی کامیابی کی شرح: 91% → 93%

کامیابی کی زیادہ شرح یہ بتاتی ہے کہ مختصر پرامپٹس نے شور (noise) کو کم کیا اور ماڈل کو بنیادی سوال پر توجہ مرکوز کرنے میں مدد دی۔

احتیاطی تدابیر اور متضاد نکات

یہ طریقہ کار دو مفروضوں پر مبنی ہے۔ پہلا یہ کہ سستا خلاصہ کرنے والا (summarizer) اگلے مرحلے کے استدلال (reasoning) کے لیے کافی معلومات برقرار رکھنے کے قابل ہونا چاہیے؛ اگر یہ اہم تفصیلات کو نظر انداز کر دیتا ہے، تو آؤٹ پٹ کے معیار پر اثر پڑ سکتا ہے۔ دوسرا یہ کہ کوالٹی چیکس کے لیے استعمال ہونے والا کم لاگت والا ماڈل مکمل طور پر درست نہیں ہے؛ اس کی 89% درستگی کا مطلب ہے کہ غلطیوں کا ایک چھوٹا حصہ اب بھی حتمی پروڈکٹ تک پہنچ جاتا ہے، اگرچہ ایسکیلیشن پاتھ (escalation path) ان میں سے زیادہ تر کو پکڑ لیتا ہے۔ سخت تعمیل (compliance) کی ضروریات رکھنے والے صارفین کو مزید سخت معیار یا اضافی تصدیقی مراحل کی ضرورت پڑ سکتی ہے۔

LLM ماہرین کے لیے اس کا کیا مطلب ہے

  • تفصیلی ڈیش بورڈز جیت جاتے ہیں۔ اعلیٰ سطح کی اخراجات کی رپورٹس ٹوکن کے ضیاع کو چھپا دیتی ہیں۔ فی ٹاسک استعمال کا ریکارڈ رکھنے سے ان نااہلیوں کا پتہ چلتا ہے جو ورنہ چھپی رہتیں۔
  • ہمیشہ جدید ترین (Frontier) ماڈلز کی ضرورت نہیں ہوتی۔ ایک سستا ماڈل مجموعی معیار پر سمجھوتہ کیے بغیر ڈیٹا کو کمپریس کر سکتا ہے یا سادہ بائنری فیصلے کر سکتا ہے۔

ایک LLM ایجنٹ کی چھپی ہوئی لاگت اکثر وہ غیر ناپا گیا کام ہوتا ہے جو وہ کرتا ہے۔ ٹوکن کے بہاؤ کو منظم کر کے اور ہدف کے مطابق بہتری (optimizations) لا کر، محقق نے $945 کے ماہانہ بل کو $651 کے کم اخراجات والے آپریشن میں تبدیل کر دیا اور ساتھ ہی کارکردگی کو بھی بہتر بنایا۔ AI ورک لوڈز کا بجٹ بنانے والے کسی بھی شخص کے لیے سبق واضح ہے: ہر ٹوکن کی پیمائش کریں، پھر ڈیٹا کو فیصلہ کرنے دیں کہ کہاں کٹوتی کرنی ہے۔