اس ماہ ہمارا AI سروس کا بل بڑھ کر $31,000 ہو گیا—جو کہ ہمارے بجٹ سے تین گنا زیادہ تھا—کیونکہ کوڈ کی ایک ہی لائن نے تقریباً 80% ٹریفک سب سے مہنگے ماڈل، GPT-4o، کی طرف بھیج دی تھی۔
بل میں اچانک اضافہ کیوں ہوا
ہم نے یہ سسٹم بھروسہ مندی کے لیے بنایا تھا: تیز رفتار جوابات، زیرو ڈاؤن ٹائم، اور ہموار اسکیلنگ۔ اس انتخاب نے ٹوکن کے استعمال میں ایک روایتی "memory leak" پیدا کر دیا—یعنی ٹوکنز ایسے ماڈل پر خرچ ہوتے رہے جو زیادہ تر بات چیت کے لیے ضرورت سے زیادہ طاقتور تھا۔
انجینئرنگ میں تبدیلی: لاگت کو ایک آرکیٹیکچرل مسئلہ سمجھنا
AI کے اخراجات کو محض ایک مالیاتی مسئلہ سمجھنا اصل کنٹرول کو چھپا دیتا ہے: وہ کوڈ جو یہ فیصلہ کرتا ہے کہ ہر درخواست کے لیے کون سا ماڈل چلے گا۔ ماڈل کے انتخاب کو روٹنگ لیئر (routing layer) میں منتقل کرنے سے ایک پوشیدہ اخراج کو ایک قابلِ کنٹرول متغیر (variable) میں بدل دیا گیا۔
1. ماڈل کو کام کے مطابق منتخب کریں
اصول سادہ ہے: ایسا چھوٹا ترین ماڈل استعمال کریں جو معیار کی ضرورت کو پورا کرتا ہو۔ ہم نے چار عام درخواست کی اقسام کو سستے متبادل ماڈلز کے ساتھ منسلک کیا:
- سادہ چیٹ → DeepSeek V4 Flash (97.5% بچت)
- Classification → Qwen3-8B (98.3% بچت)
- Code generation → DeepSeek Coder (97.5% بچت)
- Summarization → Qwen3-32B (97.2% بچت)
یہ فیصد منتخب کردہ ماڈل اور GPT-4o کے درمیان ٹوکن کی قیمت کے براہ راست فرق کو ظاہر کرتی ہے۔ اس کا نقصان ان کاموں کی صلاحیت میں معمولی کمی ہے جن کے لیے اعلیٰ درجے کی منطقی سوچ (reasoning) کی ضرورت نہیں ہوتی۔
2. ٹائیرڈ روٹنگ (Tiered routing)، بالکل ایک CDN کی طرح
ہم نے ایک دو-سطحی (two-tier) روٹر بنایا جو پہلے ہر درخواست کو سستے ماڈل کے پاس بھیجتا ہے۔ اگر جواب کو معیار کے فوری چیک میں ناکامی کا سامنا کرنا پڑے—جیسے کہ اعتماد (confidence) ایک حد سے کم ہو یا مطلوبہ معلومات (entities) موجود نہ ہوں—تو ہم اسے خود بخود اعلیٰ درجے کے ماڈل کی طرف بھیج دیتے ہیں۔ یہ 'فال بیک' (fallback) طریقہ کار صارف کے تجربے کو برقرار رکھتا ہے اور مہنگے ماڈل سے چارجز صرف اسی وقت لیتا ہے جب واقعی ضرورت ہو۔
3. بار بار آنے والے پرامپٹس کو کیش (Cache) کریں
بہت سی بات چیت میں ایک ہی سسٹم پرامپٹ یا FAQ ٹیکسٹ کا بار بار استعمال ہوتا ہے۔ ان آؤٹ پٹس کو کیش کرنے سے ہم ایک جیسے جوابات کو دوبارہ تیار کرنے سے بچ جاتے ہیں۔ ہمارے تجربات میں، ان میموری کیش (in-memory cache) نے بار بار آنے والے پرامپٹس کے اخراجات میں تقریباً 30% کمی کی۔
4. بھیجنے سے پہلے پرامپٹس کو کمپریس کریں
طویل سسٹم پرامپٹس بھی اتنی ہی رفتار سے ٹوکنز استعمال کرتے ہیں جتنی کہ صارف کا مواد۔ ہم نے ایک پری-پروسیسر (pre-processor) شامل کیا جو پرامپٹ پر ایک سستا خلاصہ نگار (summarizer) چلاتا ہے، اور اسے مہنگے ماڈل کو بھیجنے سے پہلے ضروری سیاق و سباق (context) تک محدود کر دیتا ہے۔ صرف اس ایک قدم نے ٹوکن کے اخراجات میں سالانہ ہزاروں ڈالر کی بچت کی۔
حقیقی دنیا پر اثرات
ایک چیٹ بوٹ کا سابقہ خرچہ $420 فی ماہ تھا۔ اس کی 85% پوچھ گچھ کو سستے ماڈل کی طرف موڑنے اور کیشنگ کا استعمال کرنے کے بعد، بل گر کر $28 رہ گیا۔ لیٹنسی (latency) میں بھی بہتری آئی کیونکہ ہلکا ماڈل زیادہ تیزی سے جواب دے رہا تھا، اور فال بیک راستہ (fallback path) بہت کم استعمال ہوا۔
خلاصہ
AI کے اخراجات کو ایک بنیادی آرکیٹیکچرل فیصلہ سمجھیں۔ درخواستوں کو مناسب ماڈل کی طرف بھیجیں، معیار پر مبنی فال بیک شامل کریں، بار بار آنے والے پرامپٹس کو کیش کریں، اور ان پٹس کو کمپریس کریں—آپ بھروسہ مندی برقرار رکھتے ہوئے اخراجات میں نمایاں کمی کر سکتے ہیں۔
