நீங்கள் பெரிய மொழி மாதிரிகளின் (large language models) அடிப்படையில் செயலிகளை உருவாக்குகிறீர்கள் என்றால், உங்கள் ஊதியத்திற்குப் பிறகு உங்கள் Inference கட்டணம் தான் மிக வேகமாக வளர்ந்து வரும் செலவாக இருக்கலாம். இது உங்கள் சேவை வழங்குநரிடமிருந்து வரும் எந்தவொரு விலை மாற்றத்தையும் வெறும் சந்தைப்படுத்தல் செய்தியாக மட்டும் பார்க்காமல், ஒரு முக்கியமான செயல்பாட்டு நிகழ்வாக மாற்றுகிறது. LLM ஹோஸ்டிங் மற்றும் API-களுக்காக டெவலப்பர்கள் தற்போது பயன்படுத்தும் Novita மற்றும் StreamLake ஆகிய இரண்டு தளங்கள் சமீபத்தில் அவற்றின் கட்டணங்களை மாற்றியமைத்துள்ளன. நீங்கள் ஒரு சிறிய பக்கத் திட்ட (side-project) சாட்போட்டை இயக்கினாலும் அல்லது ஒரு தயாரிப்பு SaaS பொருளை இயக்கினாலும், இந்த மாற்றங்கள் உங்கள் யூனிட் எகனாமிக்ஸை (unit economics) மாற்றியமைக்கும். நீங்கள் அதன் விவரங்களைக் கவனிக்க வேண்டும், உங்கள் செலவுகளை (burn) மறு கணக்கிட வேண்டும், மேலும் உங்கள் தற்போதைய தொழில்நுட்ப அடுக்கு (stack) இன்னும் லாபகரமானதா என்பதைத் தீர்மானிக்க வேண்டும்.

ஏன் Inference விலை நிர்ணயம் உங்கள் கவனத்திற்குத் தேவைப்படுகிறது

பெரும்பாலான டெவலப்பர்கள் மாடல்களுக்காகவே AI பொறியியலில் ஈடுபடுகிறார்கள், விலைப்பட்டியல்களைப் படிப்பது அவர்களுக்குப் பிடிக்கும் என்பதால் அல்ல. அது ஒரு தவறு. Inference என்பது பயன்பாட்டு அடிப்படையிலான (consumption-based) உள்கட்டமைப்பு ஆகும். நீங்கள் நிலையான மாதாந்திரக் கட்டணத்தைச் செலுத்த வேண்டியதில்லை; அமைப்பின் வழியாக நகரும் ஒவ்வொரு டோக்கனுக்கும் (token) நீங்கள் பணம் செலுத்த வேண்டும். ஒரு சேவை வழங்குநர் தனது கட்டண அட்டையை மாற்றும்போது, அதன் தாக்கம் உடனடியானது மற்றும் நேர்த்தியானது (linear). உங்கள் செயலி ஒரு நாளைக்கு சராசரியாக ஒரு லட்சம் பயனர் வினவல்களைக் கொண்டிருந்தால், ஒரு டோக்கனுக்கான செலவில் ஏற்படும் மிகச்சிறிய மாற்றம் கூட உங்கள் மாதாந்திர இன்வாய்ஸில் (invoice) குறிப்பிடத்தக்க மாற்றத்தை ஏற்படுத்தும்.

வழங்குநர்கள் பொதுவாக இன்புட் (input) மற்றும் அவுட்புட் (output) டோக்கன்களை அடிப்படையாகக் கொண்டு விலையைத் தீர்மானிக்கிறார்கள். இன்புட் டோக்கன்கள் என்பது பிராம்ப்ட் (prompt), சிஸ்டம் அறிவுறுத்தல்கள் மற்றும் நீங்கள் வழங்கும் சூழல் (context) ஆகியவற்றை உள்ளடக்கியது. அவுட்புட் டோக்கன்கள் என்பது மாடல் பதிலளிக்கும் தகவல்களை உள்ளடக்கியது. சில வழங்குநர்கள் இரண்டிற்கும் ஒரே கட்டணத்தை வசூலிக்கிறார்கள்; மற்றவர்கள் அவுட்புட் உருவாக்கத்திற்கு அதிக கணக்கீட்டுத் திறன் (computationally harder) தேவைப்படுவதால், அதற்கு அதிக கட்டணம் வசூலிக்கிறார்கள். Novita அல்லது StreamLake தங்கள் விலையை மாற்றும்போது, முக்கியமான கேள்வி "விலை குறைந்ததா அல்லது அதிகரித்ததா?" என்பது மட்டுமல்ல; "எந்தப் பக்கம் மாறியுள்ளது, மற்றும் எவ்வளவு மாறியுள்ளது?" என்பதே ஆகும்.

மற்றுமொரு மறைமுகமான செலவு காரணிகளும் உள்ளன. நீண்ட சூழல் சாளரங்கள் (Long context windows) ஒரு குறிப்பிட்ட டோக்கன் வரம்பைத் தாண்டும்போது பெரும்பாலும் பிரீமியம் கட்டண நிலைகளைத் தூண்டுகின்றன. சில வழங்குநர்கள் குறைந்தபட்ச டோக்கன் எண்ணிக்கையுடன் ஒவ்வொரு கோரிக்கைக்கும் (request) கட்டணம் வசூலிக்கிறார்கள், அதாவது ஒரு வார்த்தை வினவலுக்கும் நீங்கள் குறைந்தபட்சக் கட்டணத்தைச் செலுத்த வேண்டியிருக்கும். ரேட் லிமிட்கள் (Rate limits) உங்களை கூடுதல் கட்டணங்களுடன் கூடிய உயர் இணைவு நிலைகளுக்கு (higher concurrency tiers) தள்ளக்கூடும். நீங்கள் இதிலுள்ள நுணுக்கமான விவரங்களைப் (fine print) படிக்கவில்லை என்றால், உங்கள் செலவுகள் மாறவில்லை என்று நீங்கள் நினைக்கலாம், ஆனால் உங்கள் கட்டணம் மெதுவாக உயர்ந்து கொண்டே இருக்கும்.

Novita மற்றும் StreamLake-இல் என்ன மாறியுள்ளது

Novita ஒரு சர்வர்லெஸ் (serverless) இன்ஃபரன்ஸ் தளமாகச் செயல்படுகிறது, இது டெவலப்பர்களை GPU கிளஸ்டர்களை நிர்வகிக்க வற்புறுத்தாமல், ஓபன்-வெயிட் (open-weight) மாடல்களுக்கான API அணுகலை வழங்குகிறது. StreamLake மாடல்களைப் பெரிய அளவில் இயக்குவதற்கு இதே போன்ற உள்கட்டமைப்பு சேவைகளை வழங்குகிறது. இவை இரண்டும் சமீபத்தில் அவற்றின் LLM விலையை மாற்றியமைத்துள்ளன, அதாவது அவற்றின் எண்ட்பாயிண்ட்கள் (endpoints) வழியாக ஒரு கோரிக்கையை அனுப்பும் செலவு மாறியுள்ளது.

இந்தத் தளங்கள் பல மாடல் குடும்பங்களை ஆதரிப்பதாலும், மாடலின் அளவு மற்றும் சூழல் நீளத்தைப் பொறுத்து விலையில் வேறுபாடுகளைக் காட்டுவதாலும், ஒரு ஒற்றை "விலை மாற்றம்" அறிவிப்பு பல விவரங்களை மறைக்கக்கூடும். ஒரு மாடல் மலிவாகலாம், அதே நேரத்தில் மற்றொரு மாடல் விலை உயரலாம். 4K டோக்கன்களுக்குக் குறைவான சூழல் சாளரங்களின் விலை மாறாமல் இருக்கலாம், ஆனால் 128K சூழல்களுக்கு பிரீமியம் விலை மாற்றங்கள் இருக்கலாம். பேட்ச் ப்ராசஸிங் (batch processing) அல்லது பயன்பாடு குறைவான நேரங்களுக்கான தள்ளுபடிகள் வரலாம் அல்லது மறையலாம். அந்த நுணுக்கமான மாறுபாடுகளால்தான், வெறும் தலைப்பைக் கண்டு நீங்கள் திருப்தி அடைய முடியாது. உங்களுக்கு உண்மையான கட்டணப் பட்டியல் தேவை.

துல்லியமான வேறுபாடுகளைக் காட்டும் டெவலப்பர் விவரங்கள் அசல் புதுப்பிப்புப் பக்கத்தில் (original update page) கிடைக்கின்றன. அடுத்த வாரம் மீண்டும் மாறக்கூடிய எண்களைக் கணிக்க முயற்சிப்பதை விட, மூலத்திலிருந்து தற்போதைய புள்ளிவிவரங்களைப் பெற்று, அவற்றை உங்கள் கடைசி இன்வாய்ஸுடன் வரி வரியாக ஒப்பிட்டுப் பாருங்கள்.

உங்கள் Stack-இல் ஏற்படும் தாக்கத்தை எவ்வாறு ஆய்வு செய்வது

விலை மாற்றம் குறித்த தகவல் உங்களுக்குக் கிடைக்கும்போது, பதற்றமடைவதற்கு அல்லது கொண்டாடுவதற்குக் முன், உங்கள் பயன்பாடு குறித்த விரைவான ஆய்வைச் செய்யுங்கள்.

1. உங்கள் டோக்கன் ஹிஸ்டோகிராமை (token histogram) ஏற்றுமதி செய்யுங்கள். பெரும்பாலான வழங்குநர்கள் இன்புட் மற்றும் அவுட்புட் பயன்பாட்டைப் பிரித்துக் காட்டும் பயன்பாட்டு டேஷ்போர்டுகள் (usage dashboards) அல்லது API லாக்ஸை (logs) வழங்குகிறார்கள். அதன் விகிதத்தைப் பாருங்கள். உங்கள் செயலி சிஸ்டம் பிராம்ப்ட்கள் மற்றும் RAG சூழலில் அதிக கவனம் செலுத்துகிறது என்றால், நீங்கள் இன்புட்-சார்புடையவர் (input-biased). நீங்கள் நீண்ட கட்டுரைகள், குறியீடுகள் (code) அல்லது பல படிநிலைத் தர்க்கச் சங்கிலிகளை (multi-step reasoning chains) உருவாக்குகிறீர்கள் என்றால், நீங்கள் அவுட்புட்-சார்புடையவர் (output-biased). உங்கள் சார்புநிலையை விலை மாற்றத்துடன் ஒப்பிட்டுப் பாருங்கள். இன்புட் விலை குறைப்பு RAG பைப்லைனுக்கு உதவும்; அவுட்புட் விலை உயர்வு எழுத்து உதவியாளரைப் (writing assistant) பாதிக்கும்.

2. பயன்பாட்டு அளவில் உங்கள் முதல் ஐந்து மாடல்களைக் கண்டறியுங்கள். நீங்கள் வகைப்படுத்துதலுக்கு (classification) ஒரு வேகமான மலிவான மாடலையும், சுருக்கத்திற்கு (summarization) ஒரு பெரிய மாடலையும் பயன்படுத்தலாம். விலை மாற்றங்கள் பெரும்பாலும் அனைத்து மாடல்களுக்கும் ஒரே மாதிரியாக இருப்பதில்லை. Novita அல்லது StreamLake சிறிய வகைப்படுத்தல் மாடலுக்கான விலையை மாற்றியமைத்து, பெரிய மாடலை அப்படியே விட்டுவிட்டால், உங்கள் கோரிக்கைக்கான சராசரி செலவு (blended average cost) மிகக் குறைவாகவே மாறும்.

3. கூட்டப்பட்ட மாற்றங்களைச் சரிபார்க்கவும். சில நேரங்களில் ஒரு விலை மாற்றம், context-window விரிவாக்கம், புதிய fine-tuning endpoint அல்லது திருத்தப்பட்ட rate limits ஆகியவற்றுடன் சேர்ந்து வரலாம். உங்கள் பயனர் அனுபவத்தைப் பாதிக்கும் வரிசையில் காத்திருக்கும் தாமதங்களை (queueing delays) நீக்கி, கிடைக்கும் concurrency-ஐ வழங்கியிருந்தால், அதிகப்படியான per-token செலவை ஏற்க முடியும். செலவு என்பது ஒரு காரணி மட்டுமே; latency மற்றும் நம்பகத்தன்மையும் முக்கியம்.

4. அடுத்த முப்பது நாட்களுக்கான மாதிரியை உருவாக்கவும். கடந்த வாரத்தின் token எண்ணிக்கையை எடுத்துக்கொண்டு, புதிய விலைகளைக் கணக்கிட்டு, ஒரு மாதத்திற்கான இயக்க விகிதத்தை (monthly run rate) முன்னறிவிக்கவும். அந்த வேறுபாடு (delta) ஐந்து சதவீதத்திற்கும் குறைவாக இருந்து, நீங்கள் இன்னும் நல்ல latency-ஐப் பெறுகிறீர்கள் என்றால், API-களை மாற்றும் செலவு (switch cost) சேமிப்பை விட அதிகமாக இருக்கலாம். அந்த வேறுபாடு இருபத்தைந்து சதவீதம் இருந்தால், நீங்கள் பேச்சுவார்த்தை நடத்தவோ, மேம்படுத்தவோ அல்லது வேறு விருப்பங்களைத் தேடவோ வேண்டிய நேரம் இது.

Inference செலவுகளைக் கணிக்கக்கூடியதாக வைத்திருக்க சில உத்திகள்

Novita மற்றும் StreamLake விலைகளை மாற்றாமல் வைத்திருந்தாலும், token செலவினங்களைக் கட்டுப்படுத்த நீங்கள் எப்போதும் தயாராக இருக்க வேண்டும். மாடலை யார் ஹோஸ்ட் செய்தாலும் உங்கள் லாபத்தைப் பாதுகாக்கும் நடைமுறைப் பழக்கங்கள் இதோ:

உங்கள் prompts-களைச் சுருக்கவும். உங்கள் system prompt-இல் உள்ள ஒவ்வொரு தேவையற்ற வாக்கியமும் ஒவ்வொரு கோரிக்கைக்கும் ஒரு கூடுதல் சுமையாகும். தேவையற்ற சொற்களை நீக்கவும், உங்கள் JSON schemas-இல் சுருக்கமான லேபிள்களைப் பயன்படுத்தவும் மற்றும் மீண்டும் மீண்டும் வரும் அறிவுறுத்தல்களைத் தவிர்க்கவும். நீங்கள் ஒரு prompt-ஐ உருவாக்கும்போது, அதைச் செயல்படுத்தும் முன் ஒரு tokenizer மூலம் அதன் token எண்ணிக்கையை அளவிடுங்கள். ஒரு கோரிக்கையில் சேமிக்கப்படும் நூறு bytes, பெரிய அளவில் பயன்படுத்தும்போது உண்மையான பணமாக மாறும்.

நிச்சயமான வினவல்களை (deterministic queries) சேமித்து வைக்கவும் (Cache). உங்கள் பயனர்கள் அடிக்கடி ஒரே கேள்விகளைக் கேட்டால் அல்லது உங்கள் backend ஒரே மாதிரியான classification பணிகளைத் திரும்பத் திரும்பச் செய்தால், அதன் முடிவை சில நிமிடங்கள் அல்லது மணிநேரங்களுக்குச் சேமித்து வைக்கவும். உங்கள் LLM client-க்கு முன்னால் ஒரு சிறிய caching layer-ஐ அமைப்பதன் மூலம், மாடலின் தரத்தைப் பாதிக்காமல் அதன் அளவைக் பாதியாகக் குறைக்க முடியும்.

பணிக்கு ஏற்ப மாடல்களை மாற்றவும். ஒவ்வொரு செயல்பாட்டிற்கும் தளத்தில் உள்ள மிகவும் திறமையான, விலையுயர்ந்த மாடல் தேவையில்லை. எளிமையான பணிகளைச் சிறிய, மலிவான checkpoints-களுக்கு அனுப்பவும் மற்றும் கடினமான பணிகளுக்கு (edge cases) மட்டுமே பெரிய மாடல்களைப் பயன்படுத்தவும். StreamLake அல்லது Novita தங்களின் mid-tier மாடல்களைப் போட்டித்தன்மையுடன் மாற்ற விலையைச் சரிசெய்தால், அது உங்கள் routing விதிகளை மறுசீரமைப்பதற்கான ஒரு அறிகுறியாகும்.

Token உச்சவரம்புகளை (token ceilings) அமல்படுத்தவும். உங்கள் generation calls-இல் வெளியீட்டு நீளத்திற்கு (output length) ஒரு கடினமான உச்சவரம்பை நிர்ணயிக்கவும். பயனர் ஒரு சுருக்கத்தைக் கேட்டால், மாடல் ஆயிரம் tokens வரை நீண்டு கொண்டே போக அனுமதிக்காமல், அதை இருநூறு tokens-இல் நிறுத்தவும். உங்கள் பயனர்கள் பெரும்பாலும் சுருக்கமான பதில்களையே விரும்புகிறார்கள்.

ஒதுக்கப்பட்ட கொள்ளளவு (reserved capacity) அல்லது உறுதிமொழித் தள்ளுபடிகளைக் (commitment discounts) கவனியுங்கள். உங்கள் பயன்பாடு நிலையாக இருந்தால், serverless per-token விலை நிர்ணயம் கணினித் திறனை (compute) வாங்குவதற்கான மிகவும் விலையுயர்ந்த வழியாக இருக்கலாம். சில வழங்குநர்கள் நெகிழ்வுத்தன்மையைக் குறைத்து, குறைந்த விலையில் அதிகத் திறனை வழங்கும் reserved throughput அல்லது enterprise commits போன்றவற்றை வழங்குகிறார்கள். விலை மாற்ற நிகழ்வு ஏற்படும்போது, சந்தைப்படுத்தல் தளத்தில் வெளியிடப்படாத மறைமுகத் திட்டங்களைப் பற்றி அவர்களின் விற்பனைத் குழுவிடம் கேட்பது ஒரு நல்ல வாய்ப்பாகும்.

விவரங்களைத் தொடர்ந்து தெரிந்துகொள்ள வேண்டிய இடங்கள்

LLM உள்கட்டமைப்பு சந்தை வேகமாக நகர்வதால், நிலையான கட்டுரைகள் விரைவில் காலாவதியாகிவிடும். எந்த Novita மற்றும் StreamLake endpoints மாற்றப்பட்டுள்ளன, எவ்வளவு மாற்றப்பட்டுள்ளன மற்றும் எந்த மாடல்கள் பாதிக்கப்பட்டுள்ளன என்பதன் முழுமையான விவரங்கள் இணைக்கப்பட்டுள்ள developer update-இல் பட்டியலிடப்பட்டுள்ளன.

வழங்குநர்களின் விலை நிர்ணயம், பில்லிங் நுணுக்கங்கள் மற்றும் மாடல் செயல்திறன் ஆகியவற்றைக் கண்காணிக்கும் பிற உருவாக்குநர்களுடன் (builders) தொடர்ந்து விவாதிக்க விரும்பினால், GyaanSetu Telegram சமூகம் திறந்தே உள்ளது. தளங்கள் தங்கள் விலைகளை மாற்றும்போது, உங்கள் stack-ஐ மாற்றியமைக்க வேண்டுமா அல்லது விலையேற்றத்தை ஏற்க வேண்டுமா என்பது குறித்த இரண்டாவது கருத்தைப் பெற இது ஒரு பயனுள்ள இடமாகும்.

முக்கியமான கருத்து

விலை மாற்றங்கள் என்பது வெறும் விற்பனையாளர் செய்திகள் மட்டுமல்ல; அவை உங்கள் செலவு குறித்த அனுமானங்கள் யதார்த்தத்துடன் ஒத்துப்போகின்றனவா என்பதைச் சரிபார்க்க வேண்டிய சமிக்ஞைகள் ஆகும். Novita மற்றும் StreamLake தங்களின் LLM விலைகளைத் தங்களைப் புதுப்பித்துள்ளன, அதாவது நீங்கள் மூன்று மாதங்களுக்கு முன்பு உருவாக்கிய spreadsheet இப்போது தவறாக இருக்கக்கூடும். உங்கள் பயன்பாட்டுத் தரவைப் பெற்று, புதிய விலைப் பட்டியலைப் பயன்படுத்தி, உங்கள் routing logic-ஐச் சோதித்து, மேம்படுத்த வேண்டுமா, பேச்சுவார்த்தை நடத்த வேண்டுமா அல்லது மாற்ற வேண்டுமா என்பதைத் தீர்மானிக்கவும். Inference என்பது ஒரு நிலையான செலவு அல்ல; அது உங்கள் வெற்றியுடன் சேர்ந்து வளரக்கூடிய ஒரு மாறுபடும் செலவு (variable cost). அதை அவ்வாறே அணுகுங்கள்.