திறந்த மூல (Open-source) மாடல் API-கள் அரிதாகவே நிலையாக இருக்கும். Novita மற்றும் StreamLake ஆகிய இரண்டும் பெரிய மொழி மாதிரிகளுக்கான (Large Language Models) அணுகல் கட்டணங்களை மாற்றியமைத்துள்ளன. நீங்கள் இந்தத் தளங்களில் ஏதேனும் ஒன்றின் மூலம் தயாரிப்புப் போக்குவரத்தை (production traffic) இயக்கிக் கொண்டிருந்தால், புதிய எண்களை இப்போதே பார்க்க வேண்டியது அவசியம். ஒரு AI அம்சம் லாபகரமானதா அல்லது பணத்தை வீணடிக்கும் கசிந்து கொண்டிருக்கும் குழாய் போன்றதா என்பதை டோக்கன் பொருளாதாரம் (Token economics) தான் தீர்மானிக்கிறது. ஒரு மில்லியன் டோக்கன்களுக்கான வீதம் மாறும்போது, உங்கள் மாதாந்திர கிளவுட் செலவும் அதனுடன் சேர்ந்து மாறும்.

ஏன் LLM விலையிடல் தொடர்ந்து மாறுகிறது

ஆண்டு ஒப்பந்தங்களைக் கொண்ட பாரம்பரிய மென்பொருள் உரிமங்களைப் போலல்லாமல், பெரும்பாலான LLM இன்ஃபரன்ஸ் (inference) சேவைகள் ஒரு பயன்பாட்டுச் சேவையாகவே (utility) கட்டணம் வசூலிக்கப்படுகின்றன. நீங்கள் எவ்வளவு பயன்படுத்துகிறீர்களோ, அதற்கேற்ப கட்டணம் செலுத்த வேண்டும், இது பொதுவாக டோக்கன்களால் அளவிடப்படுகிறது. ஒரு வழங்குநரின் விலைப்பட்டியல் (rate card) என்பது ஒரு மாறிக்கொண்டே இருக்கும் ஆவணமாகும். அடிப்படை GPU கிளஸ்டர்கள் மலிவாகும் போதும், புதிய மாடல் எடைகள் (model weights) பழையவற்றுக்கு மாற்றப்படும் போதும், அல்லது ஒரு தளம் தனது லாப வரம்பில் (margin) போட்டியிட முடிவு செய்யும் போதும் இது மாறுகிறது.

நீங்கள் ஒரு மாதிரியை (prototyping) உருவாக்கும்போது இந்த ஏற்ற இறக்கங்களை எளிதாகப் புறக்கணிக்கலாம். ஒரு நாளைக்கு சில ஆயிரம் டோக்கன்களை மட்டுமே பயன்படுத்தும் ஒரு சிறிய திட்டம், இருபது சதவீத விலை மாற்றத்தை உணராது. ஆனால் தயாரிப்புப் பணிச்சுமைகள் (Production workloads) வேறுபட்டவை. வாடிக்கையாளர் சார்ந்த சாட்பாட், ஒரு ஆவணப் பகுப்பாய்வி (document parser) அல்லது ஒரு குறியீடு உருவாக்கும் வழிமுறை (code-generation pipeline) ஆகியவை ஒவ்வொரு மாதமும் நூற்றுக்கணக்கான மில்லியன் டோக்கன்களை எளிதாகப் பயன்படுத்தக்கூடும். அந்த அளவில், ஒரு டோக்கனுக்கான விலையில் ஏற்படும் சிறிய மாற்றம் கூட உங்கள் உள்கட்டமைப்பு பட்ஜெட்டை மாற்றி அமைக்கும்.

Novita மற்றும் StreamLake ஆகிய இரண்டும் இந்த அதிக மாற்றங்கள் நிறைந்த விலையிடல் சூழலில் இயங்குகின்றன. அவை வெறும் ஒரு மாடலை மட்டும் மறுவிற்பனை செய்வதில்லை; அவை பல திறந்த எடை (open-weight) மற்றும் உரிமம் பெற்ற (proprietary) எண்ட்பாயிண்ட்களை (endpoints) ஒரே இடத்தில் வழங்குகின்றன. அவை தங்கள் கட்டணங்களை மாற்றும்போது, அவற்றின் API-கள் மூலம் நீங்கள் ஒருங்கிணைத்துள்ள ஒவ்வொரு மாடலிலும் அதன் தாக்கம் எதிரொலிக்கும்.

Novita மற்றும் StreamLake என்ன செய்கின்றன

இந்த இரண்டு தளங்களும் இன்ஃபரன்ஸ் வழங்குநர்களாக அல்லது API நுழைவாயில்களாக (gateways) செயல்படுகின்றன. Llama, Mistral, Qwen அல்லது பிற மாடல்களை உங்கள் சொந்த GPU-களில் ஹோஸ்ட் செய்வதற்குப் பதிலாக, நீங்கள் அவற்றின் எண்ட்பாயிண்ட்களுக்கு கோரிக்கைகளை (requests) அனுப்புகிறீர்கள். இதன் மூலம் நீங்கள் தரப்படுத்தப்பட்ட அங்கீகாரம் (authentication), லோட் பேலன்சிங் (load balancing) மற்றும் சில சமயங்களில் பல மாடல் குடும்பங்களுக்கிடையேயான ஒருங்கிணைந்த வடிவமைப்பைப் பெறுகிறீர்கள். இதற்குக் கொடுக்க வேண்டிய விலைப்பரிமாற்றம் என்பது, நேரடி கணினிச் செலவை விட (raw compute costs), தளத்தின் கூடுதல் கட்டணம் சேர்க்கப்பட்ட வீதமாகும்.

அவர்களின் விலைப் பக்கங்கள் உள்ளீட்டு டோக்கன்கள் (input tokens - prompt) மற்றும் வெளியீட்டு டோக்கன்கள் (output tokens - completion) ஆகியவற்றிற்குத் தனித்தனி வீதங்களைக் பட்டியலிடுகின்றன. சில மாடல்கள் பெரிய சூழல் சாளரங்கள் (context windows) அல்லது சிறப்பு மாறுபாடுகளுக்காக கூடுதல் கட்டணத்தையும் (premium surcharges) வசூலிக்கின்றன. அவை பல மாடல்களைத் தொகுத்து வழங்குவதால், Novita அல்லது StreamLake-லிருந்து வரும் ஒரு ஒற்றை விலை மாற்றம் ஒரே நேரத்தில் பல எண்ட்பாயிண்ட்களைப் பாதிக்கலாம். கடந்த காலாண்டியில் நீங்கள் தேர்ந்தெடுத்த மலிவான சுருக்க மாடல் (summarization model), அதே தளத்தில் உள்ள ஒரு பெரிய மாடலை விட இப்போது விலை அதிகமாக இருப்பதை நீங்கள் கண்டறியலாம்.

சமீபத்திய மாற்றங்கள் உங்கள் கட்டணத்தை எவ்வாறு பாதிக்கின்றன

Novita மற்றும் StreamLake ஆகியவற்றின் சமீபத்திய மாற்றங்கள் பல மாடல்களுக்கான விலைப்பட்டியல்களை மாற்றியமைத்துள்ளன. உங்கள் தற்போதைய ஒருங்கிணைப்புகளை நீங்கள் தணிக்கை (audit) செய்யவில்லை என்றால், நீங்கள் புதிய விதிமுறைகளைத் தெரியாமலேயே ஏற்றுக்கொள்கிறீர்கள் என்று அர்த்தம். இந்த விலை மாற்றங்கள் பெரிய மொழி மாதிரிகளுக்கான உங்கள் கட்டணத்தை நேரடியாகவும் அளவிடக்கூடிய வகையிலும் பாதிக்கின்றன:

  • டோக்கன் வாரியான வீதங்கள்: உள்ளீடு மற்றும் வெளியீடு ஆகியவற்றின் செலவுகள் வேறுபடலாம். உரையை வாசிப்பதை விட உருவாக்குவதற்கு அதிக கணினித் திறன் தேவைப்படுவதால், வெளியீட்டு டோக்கன்கள் (output tokens) பொதுவாக அதிக விலை கொண்டவை. ஒருவேளை வழங்குநர் வெளியீட்டு விலையை விகிதாசாரத்திற்கு அதிகமாக உயர்த்தியிருந்தால், அதிகப்படியான தகவல்களைத் தரும் (verbose) எந்தவொரு பயன்பாட்டிலும் செலவு திடீரென அதிகரிக்கும்.
  • மாடல் சார்ந்த மாற்றங்கள்: எல்லா எண்ட்பாயிண்ட்டுகளும் ஒரே சீராக மாறாது. ஒரு பிரபலமான மாடல் மலிவாகலாம், அதே சமயம் ஒரு குறிப்பிட்ட பயன்பாட்டிற்கான (niche) மாடல் விலை அதிகரிக்கலாம். அட்டவணையைச் சரிபார்க்காமல் இருந்தால், உங்கள் பட்ஜெட்டிற்குப் பொருந்தாத தவறான எண்ட்பாயிண்ட்டின் மூலம் நீங்கள் தரவுகளை இயக்கிக்கொண்டிருக்கலாம்.
  • அடுக்குமுறை அல்லது அளவு அடிப்படையிலான சலுகைகள்: சில வழங்குநர்கள் மொத்தத் தள்ளுபடிகள் (bulk discounts) தொடங்கும் வரம்புகளை மாற்றியமைக்கிறார்கள். நீங்கள் சமீபத்தில் அதிக பயன்பாட்டு நிலைக்குச் சென்றிருந்தால், புதிய விலையிடல் உங்களுக்கு உதவலாம் அல்லது நீங்கள் எதிர்பார்த்த தள்ளுபடியை நீக்கலாம்.

நீங்கள் பயன்படுத்துவதற்கு மட்டுமே பணம் செலுத்துவதால், உங்கள் பணிச்சுமையை தற்போதைய விலை அமைப்பிற்கு ஏற்ப மாற்றுவதே செலவைக் கட்டுப்படுத்த ஒரே வழியாகும். பழைய விலைப்பட்டியல் இப்போது வெறும் வரலாற்றுத் தரவு மட்டுமே.

டெவலப்பர்களுக்கான ஒரு நடைமுறைத் தணிக்கை

நீங்கள் சமீபகாலமாக உங்கள் இன்ஃபரன்ஸ் செலவை ஆய்வு செய்யவில்லை என்றால், இதுவே சரியான நேரம். பாதிப்புகளை மதிப்பிட்டு, பண இழப்பைத் தவிர்க்க இதோ ஒரு எளிய வழிமுறை:

1. உங்கள் பயன்பாட்டுப் பதிவுகளைப் (usage logs) பெறுங்கள். கடந்த முப்பது நாட்களைப் பாருங்கள். உள்ளீட்டு டோக்கன்களை வெளியீட்டு டோக்கன்களிலிருந்து பிரித்து, அவற்றை மாடல் வாரியாகப் பிரிக்கவும். Novita மற்றும் StreamLake ஆகியவற்றில் உள்ள பெரும்பாலான டேஷ்போர்டுகள் இதைத் தெரியப்படுத்தும், அல்லது உங்கள் சொந்த கோரிக்கை பதிவுகளிலிருந்து (request logs) இதைப் பிரித்தெடுக்கலாம்.

2. புதிய விலையிடலை ஒப்பிட்டுப் பாருங்கள். உங்கள் டோக்கன் எண்ணிக்கையை எடுத்து, அதைத் திருத்தப்பட்ட வீதங்களால் பெருக்கவும். அந்தத் தொகையை கடந்த மாதம் பழைய விலையின் கீழ் நீங்கள் செலுத்தியத் தொகையுடன் ஒப்பிட்டுப் பாருங்கள். அந்த வேறுபாடே (delta) உங்கள் புதிய மாதாந்திரச் செலவாகும்.

3. மாடல் மாற்றங்களை மதிப்பீடு செய்யுங்கள். நீங்கள் பயன்படுத்தும் ஒரு மாடல் கணிசமாக விலை உயர்ந்தால், அதே தளத்தில் உள்ள மலிவான மாற்றுத் தேர்வு உங்கள் தரத் தரத்திற்கு (quality bar) பொருந்துகிறதா என்று சரிபார்க்கவும். சிறிய அளவுருக்கள் (parameter) கொண்ட மாடல் அல்லது ஒரு குவாண்டைஸ்டு (quantized) பதிப்பை A/B சோதனை செய்து பார்க்கவும். சில நேரங்களில் வழக்கமான பணிகளுக்குத் துல்லியத்தன்மை குறைவு என்பது மிகக் குறைவாகவே இருக்கும்.

4. உங்கள் ப்ராம்ப்ட்களைச் (prompts) சுருக்குங்கள். சிஸ்டம் ப்ராம்ப்ட்களில் (system prompts) அதிகப்படியான few-shot உதாரணங்கள் அல்லது நீண்ட ஆவணங்கள் இருக்கும்போது, உள்ளீட்டுச் செலவுகள் (input costs) அதிகரிக்கும். உள்ளீடாகத் தருவதற்கு முன் சூழலைச் (context) சுருக்க முயற்சி செய்யுங்கள், max_token வரம்புகளைக் குறைக்கவும் அல்லது வேலை செய்யும் கால அளவைக் குறைக்கத் தேடல் முறையைப் (retrieval) பயன்படுத்தவும். உள்ளீட்டுப் பக்கத்திலிருந்து நீங்கள் குறைக்கும் ஒவ்வொரு டோக்கனும் புதிய விலையில் பணத்தைச் சேமிக்கும்.

5. பட்ஜெட் எச்சரிக்கைகளை அமைக்கவும். பெரும்பாலான தளங்கள் தினசரி பயன்பாடு ஒரு குறிப்பிட்ட அளவைத் தாண்டும்போது, செலவு வரம்புகள் அல்லது webhook எச்சரிக்கைகளை அமைக்க அனுமதிக்கின்றன. இவற்றை நீங்கள் ஆன் செய்யவில்லை என்றால், பில்லிங் சுழற்சியின் பாதியில் விலை மாற்றம் உங்களை அதிர்ச்சியடையச் செய்யலாம்.

கட்டண அட்டவணைகளில் உள்ள நுணுக்கங்களைப் புரிந்துகொள்ளுதல்

புதுப்பிக்கப்பட்ட விலையை நீங்கள் ஆய்வு செய்யும்போது, ஒரு மில்லியன் டோக்கன்களுக்கான முதன்மைத் தொகையைத் தாண்டிப் பார்க்கவும். வழங்குநர்கள் பெரும்பாலும் ஆவணங்களில் நுணுக்கமான விவரங்களை மறைத்து வைத்திருப்பார்கள்.

context caching வசதி உள்ளதா என்று சரிபார்க்கவும். சில தளங்கள் ஒரு நீண்ட ஆவணத்தைச் சேமிக்க (cache) ஒரு நிலையான கட்டணத்தை வசூலிக்கும், பின்னர் அடுத்தடுத்த அழைப்புகளின் போது ஒவ்வொரு கோரிக்கைக்கான (per-request) செலவைக் குறைக்கும். உங்கள் பயன்பாடு ஒவ்வொரு முறையும் அதே பின்னணிச் சூழலை மீண்டும் வாசித்தால், caching மூலம் விலை உயர்வைச் சமாளிக்க முடியும்.

மறைமுகமாகப் பணச் செலவை ஏற்படுத்தும் rate limiting-ஐக் கவனியுங்கள். புதிய விலை நிர்ணயம் உங்களை அதிகத் திறன் கொண்ட (higher throughput) நிலைக்குத் தள்ளினால், நீங்கள் கொள்ளளவை முன்பதிவு செய்யவோ அல்லது குறைந்தபட்சக் கட்டணங்களைச் செலுத்தவோ வேண்டியிருக்கலாம். மேலும், API என்பது உருவாக்கப்பட்ட டோக்கன்களுக்கா (tokens generated) அல்லது கோரப்பட்ட டோக்கன்களுக்கா (tokens requested) கட்டணம் வசூலிக்கிறது என்பதையும் உறுதிப்படுத்தவும். ஒரு கோரிக்கை அதிகபட்ச நீள வரம்பைத் (max length limit) தொடும்போது, பதில் பாதியிலேயே துண்டிக்கப்பட்டாலும் உங்களிடம் கட்டணம் வசூலிக்கப்படும்.

நீங்கள் Novita அல்லது StreamLake மூலம் fine-tuned அல்லது தனிப்பட்ட (private) endpoints-களைப் பயன்படுத்தினால், அவற்றின் ஹோஸ்டிங் கட்டணங்கள் inference கட்டணங்களுடன் சேர்ந்து மாறியுள்ளதா என்பதைச் சரிபார்க்கவும். நீங்கள் அவ்வப்போது மட்டும் வேலைகளைச் (intermittent workloads) செய்கிறீர்கள் என்றால், சேமிப்பு (storage) மற்றும் cold-start செலவுகள் டோக்கன் விலையை விட அதிகமாக இருக்கலாம்.

ஒரு நெகிழ்வான AI பட்ஜெட்டை உருவாக்குதல்

எந்தவொரு தனிப்பட்ட வழங்குநரும் உங்கள் முழு inference பட்ஜெட்டையும் கட்டுப்படுத்த அனுமதிக்கக் கூடாது. விலை மாற்றங்கள் என்பது வழக்கமான பராமரிப்புப் பணிகளாக இருக்க வேண்டுமே தவிர, அவசர காலச் சிக்கல்களாக இருக்கக் கூடாது என்பதே இலக்காகும். உங்கள் தாமதத் திறன் (latency) மற்றும் துல்லியத் தேவைகளுக்குப் பொருந்தக்கூடிய மாற்று மாடல்களின் பட்டியலை எப்போதும் வைத்திருங்கள். உங்கள் பிசினஸ் லாஜிக்கை (business logic) மீண்டும் எழுதாமல், endpoints-களை மாற்றிக்கொள்ளும் வகையில் உங்கள் கோட்பாட்டில் (codebase) இலகுவான அப்ஸ்ட்ராக்ஷன் அடுக்குகளை (abstraction layers) பராமரிக்கவும்.

செலவு மட்டுமே ஒரு காரணி அல்ல. தாமதத் திறன் (latency), கிடைக்கும் தன்மை (availability) மற்றும் context-window அளவு ஆகியவற்றும் முக்கியம். ஆனால் விலை என்பது எச்சரிக்கையின்றி மாறும் காரணியாகும். Novita மற்றும் StreamLake ஆகியவற்றை நிலையான சேவைகளாகப் பார்க்காமல், மாறும் சந்தைகளாக (dynamic marketplaces) கருதுவதன் மூலம், நீங்கள் மாற்றங்களுக்குத் தயாராக இருக்கலாம்.

உண்மையான முடிவு

நீங்கள் அளவிடாத எதையும் உகந்ததாக்க (optimize) முடியாது. Novita மற்றும் StreamLake புதிய கட்டண அட்டவணைகளை வெளியிட்டுள்ளன. விவரங்களை இங்கே சரிபார்க்கவும், புதுப்பிக்கப்பட்ட செலவுகளுக்கு ஏற்ப உங்கள் கணக்கீடுகளை மீண்டும் செய்யவும், உங்கள் தற்போதைய தொழில்நுட்பக் கட்டமைப்பு (stack) இன்னும் நிதி ரீதியாகச் சரியாக இருக்கிறதா என்பதைத் தீர்மானிக்கவும். நீங்கள் இப்போது செலவிடும் சில மணிநேரத் தணிக்கை (auditing), எதிர்காலத்தில் நிதித் துறையுடன் (finance) நீங்கள் மேற்கொள்ள வேண்டிய பெரிய விவாதங்களைத் தவிர்க்க உதவும்.

பல்வேறு வழங்குநர்களிடையே inference செலவுகளைக் கண்காணிக்கும் பிற உருவாக்குநர்களுடன் (builders) கருத்துக்களைப் பரிமாறிக் கொள்ள விரும்பினால், GyaanSetu learning community உத்திகளை ஒப்பிட்டுப் பார்க்க ஒரு சிறந்த இடமாகும். விலை மாற்றங்கள் உங்களை எதிர்பாராத நேரத்தில் தாக்கும்போது மட்டுமே அவை வேதனையைத் தரும்.