LLM விலை நிர்ணயம் என்பது ஒரு மாறிக்கொண்டே இருக்கும் இலக்கு. ஒரு மாதம் உங்கள் inference பட்ஜெட் சரியாகக் கணிக்கப்பட்டபடியே இருக்கும்; அடுத்த மாதம், ஒரு சேவை வழங்குநர் தனது per-token விகிதத்தை மாற்றியமைக்கலாம், இதனால் கூடுதல் கோரிக்கைகள் (requests) எதுவும் இல்லாமலேயே உங்கள் மாதாந்திரச் செலவு மாறிவிடும். இதுதான் இப்போது நடந்துள்ளது. GMICloud, Novita மற்றும் StreamLake ஆகிய அனைத்தும் அவற்றின் மாடல் விலைகளை மாற்றியமைத்துள்ளன, மேலும் நீங்கள் production workloads அல்லது சோதனை ரீதியான (experimental) pipelines-களை இயக்கினால், இந்த மாற்றங்களை உன்னிப்பாகக் கவனிக்க வேண்டியது அவசியம். சந்தை சரிந்துவிடுவதால் அல்ல, மாறாக நீங்கள் ஒரு நாளைக்கு மில்லியன் கணக்கான டோக்கன்களை (tokens) கையாளும் போது, டோக்கன் பொருளாதாரத்தில் ஏற்படும் சிறிய மாற்றங்கள் கூட மிகப்பெரிய தாக்கத்தை ஏற்படுத்தும் என்பதால் இது முக்கியமானது.
இந்தச் சேவை வழங்குநர்கள் யார்
AI உள்கட்டமைப்புத் தொகுப்பில் (infrastructure stack) GMICloud, Novita மற்றும் StreamLake ஒவ்வொன்றும் ஒரு தனித்துவமான பங்கினை வகிக்கின்றன, ஆனால் இப்போது பெரிய மொழி மாதிரிகளை (large language models) இயக்குவதற்கான செலவில் இவை நேரடியாக ஒன்றோடொன்று போட்டியிடுகின்றன.
GMICloud ஒரு உயர் செயல்திறன் கொண்ட GPU cloud-ஐ இயக்குகிறது மற்றும் சொந்தமாக கிளஸ்டர்களை (clusters) நிர்வகிக்க விரும்பாத டெவலப்பர்களுக்காகப் பல்வேறு LLM-களை வழங்குகிறது. Novita மலிவு விலையிலான GPU வாடகை மற்றும் மாடல் சேவையின் மூலம் தனது நற்பெயரைப் பெற்றுள்ளது; பெரிய நிறுவனங்கள் வசூலிக்கும் அதிக விலைக்குப் பதிலாக, குறைந்த விலையில் open-weight மாடல்களை விரும்பும் பொறியாளர்களை இது ஈர்க்கிறது. ByteDance-ன் கிளவுட் மற்றும் மீடியா சுற்றுச்சூழல் அமைப்பிலிருந்து உருவான StreamLake, வீடியோ உள்கட்டமைப்பு நிபுணத்துவத்தைக் கொண்டு inference போட்டியில் இறங்கியுள்ளது மற்றும் கனமான மீடியா செயலாக்கப் பணிகளையும் (media processing workloads) கையாளும் ஒரு தளத்தின் மூலம் மாடல்களை வழங்குகிறது.
OpenAI அல்லது Anthropic போல இவை அனைவரும் அனைவருக்கும் தெரிந்த பெயர்கள் அல்ல. அதனால்தான் அவற்றின் விலை மாற்றங்கள் முக்கியத்துவம் பெறுகின்றன. சந்தையின் தீவிரமான இடைநிலைத் தளத்தில் (middle tier) இவை உள்ளன, அங்கு லாப வரம்புகள் குறைவு, தள்ளுபடிகள் பொதுவானவை மற்றும் டெவலப்பர்களை ஈர்ப்பதற்கான போட்டி எப்போதும் இருக்கும். இந்தத் தளத்தில் உள்ள மூன்று நிறுவனங்களும் ஏறக்குறைய ஒரே நேரத்தில் தங்கள் விலை பட்டியலை மாற்றும்போது, open-source அல்லது fine-tuned மாடல்களை இயக்குவதற்கான செலவுக்கான ஒரு புதிய அளவுகோலை (benchmark) அவை கூட்டாக நிர்ணயிக்கின்றன.
என்ன மாறியுள்ளது
இந்த மாற்றங்கள் மூன்று சேவைகளிலும் LLM பயன்பாட்டு விலையைப் பாதித்துள்ளன. Dev.to தளத்தில் narevbot என்ற பெயரில் எழுதியுள்ள Naren, GMICloud, Novita மற்றும் StreamLake ஆகியவற்றிற்கான மாடல் வாரியான மாற்றங்களை ஒரு பதிவில் விளக்கியுள்ளார். முழு ஒப்பீட்டையும் நீங்கள் இங்கே படிக்கலாம்.
இந்த பத்தியைப் படித்து முடிப்பதற்கு முன்பே மீண்டும் மாறக்கூடிய cent-per-token எண்களைக் கூறுவதை விட, இந்த மாற்றங்கள் கட்டமைப்பு ரீதியானவை (structural) என்பதே முக்கியமான விஷயம். ஒவ்வொரு சேவை வழங்குநரும் டோக்கன்களுக்கான கட்டண முறையை மறுசீரமைத்துள்ளனர், மேலும் சில சந்தர்ப்பங்களில், குறிப்பிட்ட பணிக்கு (workload) எந்த மாடல் மலிவானது என்பதை இந்த மாற்றங்கள் மாற்றியமைக்கின்றன. இது அரிதாகவே அனைத்து இடங்களிலும் ஒரே மாதிரியான உயர்வு அல்லது குறைவாக இருக்கும். ஒரு சேவை வழங்குநர் input விலையைக் குறைத்துவிட்டு, output விலையை உயர்த்தலாம். மற்றொருவர் சிறிய அளவுள்ள (small parameter) மாடல்களை மாற்றாமல் விட்டுவிட்டு, long-context endpoints-களுக்கான விலையை உயர்த்தலாம். இவை மூன்றும் Llama, Qwen, Mistral மற்றும் பிற கட்டமைப்புகளின் (architectures) பல்வேறு சேர்க்கைகளை ஆதரிப்பதால், இதனால் ஏற்படும் பாதிப்பு அல்லது பலன் நீங்கள் எந்த API மூலம் எந்த மாடலை இயக்குகிறீர்கள் என்பதைப் பொறுத்தே அமையும்.
போக்குவரத்து மாறாத போதும் உங்கள் கட்டணம் ஏன் மாறுகிறது
இதன் தாக்கத்தைப் புரிந்துகொள்ள, LLM பில்லிங் எவ்வாறு செயல்படுகிறது என்பதைப் பாருங்கள். நீங்கள் எப்போதும் input tokens மற்றும் output tokens ஆகியவற்றிற்குத் தனித்தனியாகக் கட்டணம் செலுத்த வேண்டியிருக்கும், மேலும் அவற்றுக்கிடையேயான விகிதமே உங்கள் உண்மையான செலவைத் தீர்மானிக்கிறது. ஒரு நாளைக்கு பத்தாயிரம் உரையாடல்களைக் கையாளும் ஒரு வாடிக்கையாளர் சேவை பாட் (customer support bot), ஒரு உரையாடலுக்கு சராசரியாக இரண்டாயிரம் input tokens மற்றும் நானூறு output tokens-களைப் பயன்படுத்தலாம். ஒரு மில்லியன் டோக்கன்களுக்குச் சராசரியாக மூன்று டாலர்கள் என்றால், அது ஒரு நாளைக்கு சுமார் எண்பத்து நான்கு டாலர்கள் ஆகும். ஒரு சேவை வழங்குநர் தனது output விலையை வெறும் இருபது சதவீதம் உயர்த்தினால் கூட, தினசரி செலவு தொண்ணூறு டாலர்களுக்கும் அதிகமாக உயரும். ஒரு காலாண்டில் (quarter), அதே அளவு போக்குவரத்திற்கு (traffic) இது கிட்டத்தட்ட ஆயிரம் டாலர்கள் கூடுதல் செலவாகும்.
இதை ஒரு content generation pipeline அல்லது மில்லியன் கணக்கான டோக்கன்களை ஒரு மணிநேரத்தில் கையாளும் retrieval-augmented generation (RAG) முறைக்கு விரிவுபடுத்திப் பார்த்தால், நீங்கள் தேர்ந்தெடுக்கும் சேவை வழங்குநர் ஒரு முக்கியமான செலவினமாக மாறும். GMICloud, Novita மற்றும் StreamLake ஆகியவற்றுக்கு இது தெரியும். அவற்றின் விலை மாற்றங்கள் குறிப்பிட்ட பயன்பாட்டுத் தேவைகளைக் கருத்தில் கொண்டு திட்டமிடப்பட்டவை: அதிக அளவிலான batch jobs, குறைந்த தாமதமுடைய (low-latency) chat பயன்பாடுகள் அல்லது நீண்ட சூழல் சுருக்கப் பணிகள் (long-context summarization tasks).
சிக்கல்கள் மற்றொரு அடுக்கைச் சேர்க்கின்றன. சில தளங்கள் ஒவ்வொரு கோரிக்கைக்கும் குறைந்தபட்சக் கட்டணம் (minimum charges), provisioned throughput-களுக்கான idle கட்டணங்கள் அல்லது rate-limit bursts-களுக்கான கூடுதல் கட்டணங்களைச் சேர்க்கின்றன. குறைந்த அளவுப் பயனர்களை விட, அதிக அளவுப் பயனர்களை விட, குறைந்த அளவு கோரிக்கைகளைச் செய்யும் பயனர்களை குறைந்தபட்சக் கட்டண மாற்றம் அதிகம் பாதிக்கும். batch inference தள்ளுபடிகளில் ஏற்படும் மாற்றம், உங்கள் நிகழ்நேர (real-time) API கட்டணத்தை மாற்றாமல், உங்கள் இரவு நேர அறிக்கையை உருவாக்கும் செலவைக் குறைக்கலாம். "updated pricing" என்ற தலைப்பைப் படிப்பது மட்டும் போதாது. நீங்கள் அதன் முழு விவரங்களையும் (matrix) ஆராய வேண்டும்.
அதிகப்படியான எதிர்வினை ஆற்றாமல் எவ்வாறு செயல்படுவது
விகிதங்கள் மாறும்போது, பெரும்பாலான பொறியியல் குழுக்கள் இரண்டு தவறுகளில் ஒன்றைச் செய்கின்றன. அவை மாற்றத்தைப் புறக்கணித்துவிட்டு செலவு அதிகரிப்பை அமைதியாக ஏற்றுக்கொள்கின்றன, அல்லது பீதியடைகின்றன.
