खर्च का प्रचंड वाढला

जेव्हा टीमने पहिल्यांदा जनरेटिव्ह AI (generative AI) जोडले, तेव्हा त्यांनी प्रत्येक वापरकर्त्याची विनंती (request) सर्वात नवीन आणि सर्वात सक्षम मॉडेलकडे पाठवली. जसा ट्रॅफिक वाढला, तसा प्रति-विनंती खर्चही त्याच प्रमाणात वाढला आणि CFO च्या स्प्रेडशीटमध्ये असे दिसून आले की खर्च वापरकर्त्यांच्या वाढीपेक्षा वेगाने वाढत आहे. नेहमीचा तात्पुरता उपाय—"फक्त स्वस्त मॉडेल वापरा"—प्रोडक्शनमध्ये अपयशी ठरतो, कारण वेगवेगळ्या क्वेरीजना (queries) वेगवेगळ्या तर्कक्षमतेची (reasoning levels) गरज असते. खरा उपाय हा विनंती कशी पाठवली जाते यात आहे, नेहमी कोणते मॉडेल वापरले जाते यात नाही.

पैसे वाचवणारा राउटिंग लेयर (routing layer) तयार करणे

इंजिनिअरने इन्फरन्स सर्व्हिसला (inference service) इतर कोणत्याही प्रोडक्शन कंपोनंटप्रमाणे हाताळले: टियर्स (tiers) निश्चित करणे, SLAs सेट करणे आणि लेटन्सी बजेट (latency budgets) लागू करणे. resulting architecture मध्ये चार महत्त्वाचे भाग आहेत जे एकत्रितपणे ९५% बचत करतात.

टियर्ड राउटिंग (Tiered routing)

एक हलका फ्रंट-एंड (front-end) प्रत्येक येणाऱ्या विनंतीचे कठीणतेनुसार वर्गीकरण करतो. साधारणपणे ९५% क्वेरीज 'स्वस्त' टियरमध्ये जातात जिथे एक साधे मॉडेल वापरले जाते; केवळ सर्वात कठीण ५% क्वेरीज प्रीमियम मॉडेलकडे पाठवल्या जातात. हे वर्गीकरण नियमांवर आधारित (उदा. लांबी, डोमेन-विशिष्ट कीवर्ड्सची उपस्थिती) असू शकते किंवा ऐतिहासिक डेटावरून शिकलेले असू शकते. कमी खर्चाच्या टियरला डीफॉल्ट केल्यामुळे, चॅटबॉटचा मासिक खर्च $४२० वरून $२८ वर आला.

मॉडेल राईट-साईझिंग (Model right-sizing)

कामाच्या जटिलतेनुसार मॉडेलची क्षमता निवडल्यामुळे सर्वाधिक बचत होते:

  • साधी चॅट – फ्लॅगशिप मॉडेलऐवजी हलके (lightweight) मॉडेल वापरा (९७.५% बचत).
  • वर्गीकरण (Classification) – मध्यम आकाराच्या मॉडेलऐवजी स्वस्त पर्याय वापरा (९८.३% बचत).
  • सारांश (Summarization) – टॉप-टियर मॉडेलच्या जागी मिड-रेंज मॉडेल वापरा (९७.२% बचत).

मॉडेलची नेमकी नावे महत्त्वाची नाहीत; मुख्य तत्त्व हे आहे की ज्या काही क्वेरीजना खरोखर गरज आहे, त्यांच्यासाठी सर्वात सक्षम मॉडेल राखून ठेवणे.

स्मार्ट कॅशिंग (Smart caching)

प्रत्येक 'कॅश हिट' (cache hit) मुळे नेटवर्क कॉल आणि API शुल्क वाचते. एक डिस्ट्रिब्युटेड Redis कॅश यशस्वी प्रतिसाद आणि "मला माहित नाही" (negative answers) असे प्रतिसाद देखील साठवते. जेव्हा तेच न सुटणारे प्रश्न पुन्हा येतो, तेव्हा सिस्टम मॉडेलला पुन्हा कॉल करण्याऐवजी साठवलेला "मला माहित नाही" हा प्रतिसाद देते. हजारो विनंतींमधून, केवळ यामुळेच बिलात मोठी कपात होते.

प्रॉम्प्ट कॉम्प्रेशन (Prompt compression)

लांब प्रॉम्प्ट्समुळे टोकनचा वापर वाढतो, ज्याचा थेट परिणाम खर्चावर होतो. टीम क्लायंट साईडवर किंवा प्री-प्रोसेसिंग स्टेपमध्ये एक स्वस्त समरायझर (summarizer) चालवते, ज्यामुळे महागड्या मॉडेलपर्यंत पोहोचण्यापूर्वी २,००० टोकनचा संदर्भ (context) सुमारे ४०० टोकनपर्यंत कमी केला जातो. टोकनमधील ही घट सर्व विनंतींमध्ये लागू झाल्यामुळे, वापरकर्त्याचा अनुभव न बदलता मोठी बचत होते.

स्ट्रॅटेजिक बॅचिंग (Strategic batching)

बॅचिंग अनेक स्वतंत्र विनंत्या एकाच API कॉलमध्ये एकत्रित करते. याचे साधे सूत्र आहे: जर वापरकर्ता उत्तराची वाट पाहत असेल, तर बॅचिंग करू नका; जर विनंती बॅकग्राउंडमध्ये चालत असेल (उदा. रात्रीचे रिपोर्ट, शेड्युल्ड जॉब्स), तर सर्व काही बॅच करा. केवळ रात्रीच्या बॅच जॉब्समुळे खर्चात आणखी १०-२०% कपात होते.

ऑप्टिमायझेशन लूपचे मॉनिटरिंग (Monitoring the optimization loop)

तुम्ही ज्या गोष्टी मोजू शकत नाही, त्यात सुधारणा करू शकत नाही. इंजिनिअरने चार साप्ताहिक मेट्रिक्स (metrics) सेट केले:

१. टियरनुसार प्रति विनंती खर्च. २. प्रत्येक राउटिंग पाथसाठी कॅश-हिट रेट. ३. स्वस्त टियरमधून प्रीमियम टियरकडे जाण्याचा दर (escalation rate). ४. प्रत्येक ग्राहक विभागासाठी खर्च.

हे आकडे बदलांचे (drift) संकेत देतात—उदा. वाढता एस्केलेशन रेट हे दर्शवू शकतो की वर्गीकरण लॉजिक खूप आक्रमक आहे किंवा स्वस्त मॉडेलची गुणवत्ता खालावली आहे. टीम दर आठवड्याला थ्रेशोल्ड्स (thresholds), मॉडेल असाइनमेंट्स आणि कॅश पॉलिसीजमध्ये सुधारणा करते, ज्यामुळे खर्च नियंत्रण ही केवळ संकटाच्या वेळी केलेली कृती न राहता एक सवय बनते.

निष्कर्ष (Takeaway)

विनंत्यांचे वर्गीकरण करणारा, मॉडेल्स योग्यरित्या निवडणारा, आक्रमकपणे कॅशिंग करणारा, प्रॉम्प्ट्स कॉम्प्रेस करणारा आणि बॅकग्राउंड कामांचे बॅचिंग करणारा एक शिस्तबद्ध राउटिंग लेयर, विश्वासार्हता कायम ठेवून AI-API खर्च ९५% पर्यंत कमी करू शकतो. इन्फरन्स स्टॅककडे (inference stack) एका प्रोडक्शन सर्व्हिसप्रमाणे पहा: टियर्स निश्चित करा, परिणाम मोजा आणि दर आठवड्याला सुधारणा करा.