या महिन्यात आमचे AI-सर्व्हिस बिल $31,000 पर्यंत वाढले—जे आम्ही ठरवलेल्या बजेटपेक्षा तीन पटीहून अधिक आहे—कारण कोडच्या एका ओळीमुळे आमचा अंदाजे 80% ट्रॅफिक सर्वात महागड्या मॉडेलकडे, म्हणजेच GPT-4o कडे पाठवले गेले.

बिल इतक्या वेगाने का वाढले

आम्ही ही प्रणाली विश्वासार्हतेसाठी तयार केली होती: जलद प्रतिसाद, शून्य डाऊनटाइम आणि सुलभ स्केलिंग. या निवडीमुळे टोकन वापरामध्ये एक प्रकारचा "memory leak" निर्माण झाला—बहुतेक संवादांसाठी आवश्यक नसतानाही टोकन्स एका अतिशय महागड्या मॉडेलवर खर्च होत राहिले.

इंजिनिअरिंगमधील बदल: खर्च ही एक आर्किटेक्चरल समस्या म्हणून

AI खर्चाकडे केवळ आर्थिक समस्या म्हणून पाहिल्यामुळे मुख्य घटक दुर्लक्षित राहतो: तो म्हणजे कोड, जो ठरवतो की प्रत्येक विनंतीसाठी (request) कोणते मॉडेल वापरायचे. मॉडेल निवडण्याची प्रक्रिया 'routing layer' मध्ये हलवल्यामुळे, एक छुपा खर्च आता नियंत्रणात आणता येण्याजोगा घटक बनला आहे.

1. कामाच्या स्वरूपानुसार मॉडेल निवडा

नियम साधा आहे: गुणवत्तेची आवश्यकता पूर्ण करणारे सर्वात लहान मॉडेल वापरा. आम्ही चार सामान्य विनंती प्रकारांसाठी स्वस्त पर्यायांची निवड केली:

  • Simple chat → DeepSeek V4 Flash (97.5% बचत)
  • Classification → Qwen3-8B (98.3% बचत)
  • Code generation → DeepSeek Coder (97.5% बचत)
  • Summarization → Qwen3-32B (97.2% बचत)

ही टक्केवारी निवडलेले मॉडेल आणि GPT-4o यांच्यातील टोकन-किमतीतील थेट फरक दर्शवते. याचा एकमेव तोटा म्हणजे, ज्या कामांसाठी उच्च दर्जाच्या तर्काची (reasoning) गरज नाही, त्या कामांच्या क्षमतेमध्ये थोडी घट होऊ शकते.

2. CDN प्रमाणे टियर्ड राउटिंग (Tiered routing)

आम्ही दोन-स्तरीय (two-tier) राउटर तयार केला जो प्रथम प्रत्येक विनंती स्वस्त मॉडेलकडे पाठवतो. जर प्रतिसाद गुणवत्ता तपासणीत (quality check) अपयशी ठरला—उदा. कॉन्फिडन्स थ्रेशोल्डपेक्षा कमी असणे किंवा आवश्यक माहितीचा अभाव असणे—तर आम्ही ती विनंती आपोआप उच्च-स्तरीय मॉडेलकडे वळवतो. ही 'fallback' पद्धत वापरकर्त्याचा अनुभव जपते आणि प्रीमियम मॉडेलचा खर्च केवळ खरोखर गरज असेल तेव्हाच करते.

3. वारंवार येणारे प्रॉम्प्ट्स कॅश (Cache) करा

अनेक संवादांमध्ये तोच सिस्टिम प्रॉम्प्ट किंवा FAQ मजकूर पुन्हा वापरला जातो. हे आउटपुट कॅश केल्यामुळे, आम्हाला सारख्याच प्रतिसादांची पुन्हा गणना करण्याची गरज पडत नाही. आमच्या चाचण्यांमध्ये, in-memory cache मुळे वारंवार येणाऱ्या प्रॉम्प्ट्सचा खर्च अंदाजे 30% ने कमी झाला.

4. पाठवण्यापूर्वी प्रॉम्प्ट्स कॉम्प्रेस करा

लांब सिस्टिम प्रॉम्प्ट्स देखील वापरकर्त्याच्या मजकुराप्रमाणेच तितक्याच वेगाने टोकन्स खर्च करतात. आम्ही एक pre-processor जोडला जो प्रॉम्प्टवर एक स्वस्त summarizer चालवतो आणि महागड्या मॉडेलकडे पाठवण्यापूर्वी तो आवश्यक संदर्भापर्यंत मर्यादित करतो. या एका पावलामुळे टोकन खर्चात दरवर्षी हजारो डॉलर्सची बचत झाली.

वास्तविक जगातील परिणाम

एका चॅटबॉटचा खर्च पूर्वी $420 / महिना होता. त्याच्या 85% क्वेरीज स्वस्त मॉडेलकडे वळवल्यानंतर आणि कॅशिंग लागू केल्यामुळे, बिल $28 पर्यंत खाली आले. Latency मध्ये सुधारणा झाली कारण हलके मॉडेल वेगाने प्रतिसाद देत होते आणि fallback path चा वापर क्वचितच झाला.

निष्कर्ष

AI खर्चाकडे एक महत्त्वाचा आर्किटेक्चरल निर्णय म्हणून पहा. विनंत्या योग्य मॉडेलकडे वळवा, गुणवत्तेवर आधारित fallback जोडा, वारंवार येणारे प्रॉम्प्ट्स कॅश करा आणि इनपुट्स कॉम्प्रेस करा—असे केल्याने विश्वासार्हता कायम ठेवून तुम्ही खर्च मोठ्या प्रमाणात कमी करू शकता.