Novita சமீபத்தில் தனது LLM விலையை மாற்றியமைத்துள்ளது. இந்தத் தளத்தின் மூலம் production inference-ஐ இயக்கும் குழுக்களுக்கு, இந்தச் செய்தி உங்கள் தற்போதைய செலவை உடனடியாகத் தணிக்கை (audit) செய்யத் தூண்டும். API கட்டண மாற்றங்கள் அரிதாகவே வசதியான நேரத்தில் வரும், மேலும் அவை பல model tiers-களில் ஏற்படும் போது, உங்கள் மாதாந்திரச் செலவில் (monthly burn) ஏற்படும் தாக்கம் எதிர்பார்த்ததை விட அதிகமாக இருக்கலாம்.
Inference விலையை நீங்கள் ஏன் கவனிக்க வேண்டும்
பெரும்பாலான நவீன AI பயன்பாடுகள் தானாக நிர்வகிக்கப்படும் GPU clusters-களின் அடிப்படையில் உருவாக்கப்படுவதில்லை. வன்பொருளை (hardware) பெறுவது, vLLM அல்லது TGI deployments-களை நிர்வகிப்பது மற்றும் traffic spikes-ன் போது cold starts-களைக் கையாள்வது போன்ற சவால்களைத் தவிர்க்க, டெவலப்பர்கள் Novita போன்ற inference providers-களுக்கு கோரிக்கைகளை (requests) அனுப்புகிறார்கள். அந்த வசதி மிகவும் மதிப்புமிக்கது. ஆனால் அது அளவிடப்படுகிறது (metered). உருவாக்கப்படும் ஒவ்வொரு token-ம் பயனர் அமர்வுகள் (user sessions), background jobs மற்றும் உள் கருவிகள் (internal tools) ஆகியவற்றின் மூலம் உங்கள் பில் தொகையை உயர்த்துகிறது.
ஒரு provider தனது விலையை மாற்றும்போது, அதன் தாக்கம் உங்கள் முழு stack-க்கும் பரவும். ஒரு நாளைக்கு பத்தாயிரம் வாடிக்கையாளர் உரையாடல்களைக் கையாளும் ஒரு chatbot, ஒரு வாரத்தில் நாற்பது மில்லியன் input tokens மற்றும் பன்னிரண்டு மில்லியன் output tokens-களைப் பயன்படுத்தக்கூடும். ஒரு மில்லியன் tokens-க்கான விலையில் சில டாலர்கள் மாறினாலும், மாதாந்திரத் வித்தியாசம் மிக விரைவாகப் பெரிய அளவில் உணரப்படும். குறைந்த லாபத்தில் இயங்கும் தயாரிப்புகள் அல்லது குழுக்களுக்கு, அந்தத் வித்தியாசம் (delta) லாபத்தையே அழித்துவிடும். ஒரு browser extension ஆக இயங்கும் coding assistant, இரவு நேரத்தில் இயங்கும் batch summarization pipeline, அல்லது ஒவ்வொரு பக்கமும் ஏற்றப்படும்போது ஒரு model-ஐக் கேட்கும் உள் தேடல் கருவி (internal lookup tool) என அனைத்தும் ஒரே மாதிரியான பாதிப்பிற்கு உள்ளாகின்றன. அவற்றின் unit economics அடுத்த token-ன் துல்லியமான விலையைச் சார்ந்துள்ளன.
Novita-வில் என்ன மாறியுள்ளது
Novita தனது பட்டியலில் உள்ள பல்வேறு models-களுக்குப் புதிய விலைகளை அறிமுகப்படுத்தியுள்ளது. நிறுவனம் அனைத்துக்கும் ஒரே மாதிரியான சதவீத உயர்வையோ அல்லது குறைவையோ அறிவிக்கவில்லை. மாறாக, மாற்றங்கள் model-க்கு ஏற்ப மாறுபடுகின்றன, அதாவது நீங்கள் எந்த endpoints-களைப் பயன்படுத்துகிறீர்கள் என்பதைப் பொறுத்து உங்கள் பில் மாறும்.
உங்கள் பயன்பாடு அனைத்து traffic-ஐயும் ஒரு ஒரே ஒரு large language model வழியாக அனுப்பினால், கணக்கீடு எளிது. பழைய விலையை புதிய விலையுடன் ஒப்பிட்டு, ஏற்படும் இழப்பு அல்லது சேமிப்பைக் கணக்கிடலாம். ஆனால் பெரும்பாலான production setups சிக்கலானவை. எளிய கேள்விகளை (queries) லேசான models-களுக்கும், கடினமான reasoning பணிகளுக்கு கனமான models-களுக்கும் அனுப்பும் routing logic-ஐக் குழுக்கள் பெரும்பாலும் பயன்படுத்துகின்றன. மற்றவர்கள் latency மற்றும் தரத்தை ஒப்பிட பல models-களில் A/B tests செய்கிறார்கள். அத்தகைய சூழல்களில், ஒன்று அல்லது இரண்டு models-களில் ஏற்படும் விலை மாற்றம் உங்கள் முழு செலவு கட்டமைப்பையும் (cost structure) மாற்றியமைக்கும்.
குறிப்பிட்ட per-token மற்றும் per-request விவரங்கள் Narevbot என்பவரால் Dev.to-வில் வெளியிடப்பட்ட விரிவான விளக்கத்தில் கொடுக்கப்பட்டுள்ளன. நீங்கள் துல்லியமான rate card-ஐ இங்கே பார்க்கலாம்: https://dev.to/narevbot/changes-to-llm-pricing-novita-3plc
உங்கள் நினைவாற்றலையோ அல்லது ஆவணங்களில் (documentation) புதைந்துள்ள பழைய ஸ்கிரீன்ஷாட்களையோ நம்ப வேண்டாம். உங்கள் அடுத்த காலாண்டிற்கான (quarter) திட்டமிடலுக்கு முன், அந்த மூலத்திலிருந்து தற்போதைய எண்களை நேரடியாகப் பெறுங்கள்.
உங்கள் பாதிப்பை எவ்வாறு தணிக்கை செய்வது
அனுமானங்களுடன் தொடங்காமல், தரவுகளுடன் (data) தொடங்குங்கள். உங்கள் Novita dashboard-இல் லாக்-இன் செய்து, கடந்த இரண்டு அல்லது மூன்று மாதங்களுக்கான உங்கள் பயன்பாட்டு வரலாற்றை (usage history) ஏற்றுமதி (export) செய்யுங்கள். அந்தத் தரவை model மற்றும் operation type வாரியாகப் பிரியுங்கள். எந்த endpoints உங்கள் பட்ஜெட்டில் பெரும்பகுதியைச் செலவிடுகின்றன மற்றும் எந்தவை ஒரு கோரிக்கைக்கு (request) அதிக tokens உருவாக்கப்படுகின்றன என்பதை நீங்கள் அறிய வேண்டும்.
இந்த முறைகளைக் கவனியுங்கள்:
- Concentration risk. உங்கள் செலவில் எழுபது சதவீதம் ஒரு model வழியாகச் சென்றால் மற்றும் அந்த model-ன் விலை அதிகரித்தால், உங்கள் அவசரம் வெளிப்படையானது. உங்கள் செலவு எட்டு models-களில் பரவியிருந்து, அவற்றில் மூன்று விலைகள் உயர்ந்தால், கணக்கீடு எடுக்க அதிக நேரம் எடுக்கும் ஆனால் பாதிப்பு உண்மையானதுதான்.
- Token bloat. உங்கள் prompts தேவையற்ற context-களால் அதிகரித்துள்ளதா என்று சரிபார்க்கவும். நீண்ட system prompts, மீண்டும் மீண்டும் வரும் few-shot examples மற்றும் விரிவான XML formatting ஆகியவை input செலவுகளை அதிகரிக்கின்றன. விலைப் புதுப்பிப்பு என்பது தேவையற்ற செலவுகளைக் குறைக்க (trim the fat) ஒரு சிறந்த வாய்ப்பாகும்.
- Output inefficiency. உங்கள் பயன்பாடு நீண்ட completions-களைக் கோரியும், முதல் சில வாக்கியங்களை மட்டுமே பயன்படுத்தினால், நீங்கள் பயன்படுத்தாத tokens-களுக்குப் பணம் செலுத்துகிறீர்கள் என்று அர்த்தம். உங்கள் max_token வரம்புகள் மற்றும் stop sequences-களைச் சரிசெய்யவும் (tune).
- Idle background jobs. அறிக்கைகளை உருவாக்கும் அல்லது ஆவணங்களை embed செய்யும் ஒரு scheduled task தேவைக்கு அதிகமாக இயங்கிக் கொண்டிருக்கலாம். cron schedule மற்றும் batch size-ஐச் சரிபார்க்கவும்.
