इस महीने हमारा AI-सर्विस बिल बढ़कर $31,000 हो गया—जो हमारे बजट से तीन गुना से भी अधिक था—क्योंकि कोड की एक ही लाइन ने हमारे लगभग 80% ट्रैफिक को सबसे महंगे मॉडल, GPT-4o पर भेज दिया था।
बिल में इतनी भारी वृद्धि क्यों हुई
हमने सिस्टम को विश्वसनीयता के लिए बनाया था: तेज़ रिस्पॉन्स, ज़ीरो डाउनटाइम और स्मूथ स्केलिंग। उस चुनाव ने टोकन उपयोग में एक क्लासिक “मेमोरी लीक” जैसी स्थिति पैदा कर दी—टोकन लगातार एक ऐसे मॉडल पर खर्च होते रहे जो अधिकांश इंटरैक्शन के लिए ज़रूरत से ज़्यादा (overkill) था।
इंजीनियरिंग में बदलाव: लागत को एक आर्किटेक्चरल चिंता के रूप में देखना
AI खर्च को केवल एक फाइनेंस की समस्या मानने से असली समाधान छिप जाता है: वह कोड जो यह तय करता है कि प्रत्येक रिक्वेस्ट के लिए कौन सा मॉडल चलेगा। मॉडल सिलेक्शन को राउटिंग लेयर में ले जाने से एक छिपे हुए खर्च को एक नियंत्रित वेरिएबल (controllable variable) में बदल दिया गया।
1. कार्य के अनुसार मॉडल का चुनाव करें
नियम सरल है: उस सबसे छोटे मॉडल का उपयोग करें जो गुणवत्ता की आवश्यकता को पूरा करता हो। हमने चार सामान्य रिक्वेस्ट प्रकारों को सस्ते विकल्पों के साथ मैप किया:
- Simple chat → DeepSeek V4 Flash (97.5% की बचत)
- Classification → Qwen3-8B (98.3% की बचत)
- Code generation → DeepSeek Coder (97.5% की बचत)
- Summarization → Qwen3-32B (97.2% की बचत)
ये प्रतिशत चुने गए मॉडल और GPT-4o के बीच टोकन-कीमत के सीधे अंतर को दर्शाते हैं। इसका एकमात्र समझौता उन कार्यों की क्षमता में मामूली कमी है जिन्हें उच्च-स्तरीय रीजनिंग की आवश्यकता नहीं होती।
2. CDN की तरह टियर्ड राउटिंग (Tiered routing)
हमने एक टू-टियर राउटर बनाया जो पहले हर रिक्वेस्ट को सस्ते मॉडल पर भेजता है। यदि रिस्पॉन्स एक त्वरित क्वालिटी चेक में विफल रहता है—जैसे कि कॉन्फिडेंस थ्रेशोल्ड से कम होना या आवश्यक एंटिटीज (entities) का गायब होना—तो हम इसे स्वचालित रूप से उच्च-स्तरीय मॉडल पर री-रूट कर देते हैं। यह फॉलबैक (fallback) यूजर एक्सपीरियंस को बनाए रखता है और प्रीमियम मॉडल का शुल्क केवल तभी लेता है जब वास्तव में आवश्यकता हो।
3. बार-बार आने वाले प्रॉम्प्ट्स को कैश (Cache) करें
कई इंटरैक्शन में एक ही सिस्टम प्रॉम्प्ट या FAQ टेक्स्ट का पुन: उपयोग किया जाता है। उन आउटपुट्स को कैश करके, हम समान रिस्पॉन्स को दोबारा कैलकुलेट करने से बचते हैं। हमारे परीक्षणों में, इन-मेमोरी कैश ने बार-बार आने वाले प्रॉम्प्ट की लागत को लगभग 30% तक कम कर दिया।
4. भेजने से पहले प्रॉम्प्ट्स को कंप्रेस करें
लंबे सिस्टम प्रॉम्प्ट्स भी यूजर कंटेंट की तरह ही उसी दर से टोकन खर्च करते हैं। हमने एक प्री-प्रोसेसर जोड़ा जो प्रॉम्प्ट पर एक सस्ता समराइज़र (summarizer) चलाता है, जिससे महंगे मॉडल को भेजने से पहले उसे आवश्यक संदर्भ (context) तक सीमित कर दिया जाता है। केवल इस एक कदम ने टोकन खर्च में हर साल हजारों डॉलर की बचत की।
वास्तविक दुनिया पर प्रभाव
एक चैटबॉट की लागत पहले $420/माह थी। इसकी 85% क्वेरीज़ को सस्ते मॉडल पर रूट करने और कैशिंग लागू करने के बाद, बिल घटकर $28 रह गया। लेटेंसी (latency) में भी सुधार हुआ क्योंकि हल्का मॉडल तेज़ी से रिस्पॉन्स दे रहा था, और फॉलबैक पाथ का उपयोग बहुत कम हुआ।
मुख्य निष्कर्ष
AI खर्च को एक महत्वपूर्ण आर्किटेक्चरल निर्णय के रूप में लें। रिक्वेस्ट को उचित मॉडल पर रूट करें, क्वालिटी-आधारित फॉलबैक जोड़ें, बार-बार आने वाले प्रॉम्प्ट्स को कैश करें और इनपुट्स को कंप्रेस करें—आप विश्वसनीयता बनाए रखते हुए लागत में भारी कटौती कर सकते हैं।
