Novita ने नुकतेच त्यांच्या LLM किमतींमध्ये बदल केले आहेत. जे संघ (teams) या प्लॅटफॉर्मद्वारे प्रोडक्शन इन्फरन्स (production inference) चालवत आहेत, त्यांच्यासाठी हे वाक्य तुमच्या सध्याच्या खर्चाचे त्वरित ऑडिट (audit) करण्याची सूचना देते. API दरातील बदल क्वचितच सोयीच्या वेळी होतात, आणि जेव्हा ते एकापेक्षा जास्त मॉडेल टियर्सवर (model tiers) लागू होतात, तेव्हा तुमच्या मासिक खर्चावर (monthly burn) अपेक्षिततेपेक्षा जास्त परिणाम होऊ शकतो.

इन्फरन्स प्राइसिंगकडे (Inference Pricing) तुमचे लक्ष देणे का गरजेचे आहे

बहुतेक आधुनिक AI ॲप्लिकेशन्स स्वतः व्यवस्थापित केलेल्या (self-managed) GPU क्लस्टर्सवर आधारित नसतात. डेव्हलपर्स Novita सारख्या इन्फरन्स प्रोव्हायडर्सकडे विनंत्या (requests) पाठवतात कारण पर्यायी मार्ग म्हणजे हार्डवेअर सुरक्षित करणे, vLLM किंवा TGI डिप्लॉयमेंट्स व्यवस्थापित करणे आणि ट्रॅफिक वाढल्यावर 'कोल्ड स्टार्ट' (cold starts) हाताळणे असा क्लिष्ट प्रवास असतो. ही सोय मौल्यवान आहे, पण ती मोजली जाते. तयार झालेला प्रत्येक टोकन (token) तुमच्या बिलात भर पडतो, जो युजर सेशन्स, बॅकग्राउंड जॉब्स आणि अंतर्गत टूल्समध्ये वाढत जातो.

जेव्हा एखादा प्रोव्हायडर त्याच्या किमतींमध्ये बदल करतो, तेव्हा त्याचा परिणाम तुमच्या संपूर्ण स्टॅकवर (stack) होतो. दिवसाला दहा हजार ग्राहकांशी संवाद साधणारा चॅटबॉट एका आठवड्यात ४ कोटी (forty million) इनपुट टोकन्स आणि १.२ कोटी (twelve million) आउटपुट टोकन्स वापरू शकतो. प्रति-मिलियन दरात काही डॉलर्सचा जरी बदल झाला, तरी मासिक फरकाची रक्कम मोठी होऊ शकते. 'बूटस्ट्रॅप्ड' (bootstrapped) उत्पादने किंवा कमी नफ्यात काम करणाऱ्या संघांसाठी, हा फरक नफा संपवू शकतो. ब्राउझर एक्स्टेंशन म्हणून चालणारा कोडिंग असिस्टंट, रात्रभर चालणारी बॅच समरायझेशन पाइपलाइन, किंवा प्रत्येक पेज लोडवर मॉडेलला क्वेरी करणारे अंतर्गत लुकअप टूल - या सर्वांना एकच धोका असतो. त्यांचे युनिट इकॉनॉमिक्स (unit economics) हे पुढच्या टोकनच्या अचूक किमतीवर अवलंबून असते.

Novita मध्ये काय बदलले आहे

Novita ने त्यांच्या कॅटलॉगमधील विविध मॉडेल्सवर परिणाम करणारे नवीन दर लागू केले आहेत. कंपनीने सर्व मॉडेल्ससाठी एकसमान टक्केवारीने वाढ किंवा कपात केलेली नाही. त्याऐवजी, हे बदल मॉडेलनुसार बदलतात, याचा अर्थ तुम्ही नेमके कोणते एंडपॉइंट्स (endpoints) वापरता यावर तुमचे बिल अवलंबून असेल.

जर तुमचे ॲप्लिकेशन सर्व ट्रॅफिक एकाच लार्ज लँग्वेज मॉडेलद्वारे (LLM) वळवत असेल, तर तुमचे गणित सोपे आहे. जुन्या दराची तुलना नवीन दराशी करा आणि होणारे नुकसान किंवा बचत मोजा. परंतु बहुतेक प्रोडक्शन सेटअप अधिक गुंतागुंतीचे असतात. अनेकदा संघ असे 'राउटिंग लॉजिक' (routing logic) वापरतात जे साध्या क्वेरीज हलक्या मॉडेल्सकडे पाठवतात आणि अवघड तार्किक कामांसाठी (complex reasoning tasks) जड मॉडेल्स राखून ठेवतात. इतर काही टीम्स लेटन्सी (latency) आणि गुणवत्ता तपासण्यासाठी विविध मॉडेल्सवर A/B टेस्ट करतात. अशा परिस्थितीत, केवळ एक किंवा दोन मॉडेल्सच्या किमतीतील बदल तुमच्या संपूर्ण खर्च रचनेवर (cost structure) परिणाम करू शकतो.

प्रति-टोकन आणि प्रति-रिक्वेस्टचे विशिष्ट आकडे Narevbot ने Dev.to वर प्रसिद्ध केलेल्या तपशीलवार अहवालात दिले आहेत. तुम्ही नेमके रेट कार्ड येथे पाहू शकता: https://dev.to/narevbot/changes-to-llm-pricing-novita-3plc

तुमच्या स्मृतीवर किंवा तुमच्या डॉक्युमेंटेशनमध्ये कुठेतरी दडलेल्या जुन्या स्क्रीनशॉटवर अवलंबून राहू नका. तुमच्या पुढील तिमाहीचे (quarter) नियोजन करण्यापूर्वी थेट त्या स्रोताकडून सध्याचे आकडे मिळवा.

तुमच्या खर्चाच्या जोखमीचे (Exposure) ऑडिट कसे करावे

गृहितकांवर नाही, तर डेटावर आधारित सुरुवात करा. तुमच्या Novita डॅशबोर्डवर लॉग इन करा आणि गेल्या दोन ते तीन महिन्यांचा तुमचा वापर (usage history) एक्सपोर्ट करा. हा डेटा मॉडेलनुसार आणि ऑपरेशन प्रकारानुसार विभागून घ्या. तुम्हाला हे जाणून घ्यायचे आहे की कोणते एंडपॉइंट्स तुमच्या बजेटचा मोठा हिस्सा वापरत आहेत आणि कोणत्या एंडपॉइंट्सवर प्रति-रिक्वेस्ट सर्वाधिक टोकन्स तयार होत आहेत.

या पॅटर्नची तपासणी करा:

  • कन्सन्ट्रेशन रिस्क (Concentration risk). जर तुमचा ७०% खर्च एकाच मॉडेलवर होत असेल आणि त्या मॉडेलच्या किमतीत वाढ झाली असेल, तर तुमची तातडी स्पष्ट आहे. जर तुमचा खर्च आठ मॉडेल्समध्ये विभागलेला असेल आणि त्यापैकी तीनच्या किमती बदलल्या असतील, तर गणित मांडायला वेळ लागेल पण धोका तरीही वास्तविक आहे.
  • टोकन ब्लोट (Token bloat). तुमचे प्रॉम्प्ट्स (prompts) अनावश्यक संदर्भांमुळे (context) वाढत तर नाहीत ना, याची तपासणी करा. लांब सिस्टम प्रॉम्प्ट्स, वारंवार वापरले जाणारे few-shot उदाहरणे आणि सविस्तर XML फॉरमॅटिंग यामुळे इनपुट खर्च वाढतो. किमतीतील अपडेट ही अनावश्यक खर्च कमी करण्याची एक उत्तम संधी आहे.
  • आउटपुट इनएफिशियन्सी (Output inefficiency). जर तुमचे ॲप्लिकेशन लांब उत्तरे (completions) मागवत असेल पण फक्त पहिले काही वाक्ये वापरत असेल, तर तुम्ही न वापरल्या जाणाऱ्या टोकन्ससाठी पैसे मोजत आहात. तुमचे max_token मर्यादा आणि 'स्टॉप सिक्वेन्स' (stop sequences) नीट सेट करा.
  • आयडल बॅकग्राउंड जॉब्स (Idle background jobs). रिपोर्ट तयार करणारे किंवा डॉक्युमेंट्स एम्बेड करणारे शेड्युल केलेले टास्क गरजेपेक्षा जास्त वेळा चालू असू शकतात. त्यांचा 'क्रॉन शेड्युल' (cron schedule) आणि बॅच साईज तपासा.