നിങ്ങൾ ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLM) ഉപയോഗിച്ച് ആപ്ലിക്കേഷനുകൾ നിർമ്മിക്കുകയാണെങ്കിൽ, ശമ്പളം നൽകുന്നതിന് ശേഷം ഏറ്റവും വേഗത്തിൽ വർദ്ധിക്കുന്ന ചെലവ് നിങ്ങളുടെ ഇൻഫറൻസ് (Inference) ബില്ലായിരിക്കാം. അതിനാൽ, നിങ്ങളുടെ സേവനദാതാവ് (provider) വരുത്തുന്ന ഏതൊരു വിലമാറ്റവും വെറുമൊരു മാർക്കറ്റിംഗ് വാർത്തയല്ല, മറിച്ച് നിങ്ങളുടെ പ്രവർത്തനങ്ങളെ നേരിട്ട് ബാധിക്കുന്ന ഒന്നാണ്. ഡെവലപ്പർമാർ നിലവിൽ LLM ഹോസ്റ്റിംഗിനും API-കൾക്കുമായി ഉപയോഗിക്കുന്ന Novita, StreamLake എന്നീ രണ്ട് പ്ലാറ്റ്ഫോമുകൾ അടുത്തിടെ തങ്ങളുടെ നിരക്കുകളിൽ മാറ്റം വരുത്തിയിട്ടുണ്ട്. നിങ്ങൾ ഒരു സൈഡ്-പ്രോജക്റ്റ് ചാറ്റ്ബോട്ട് ആണോ അല്ലെങ്കിൽ ഒരു പ്രൊഡക്ഷൻ SaaS ഉൽപ്പന്നമാണോ പ്രവർത്തിപ്പിക്കുന്നത് എന്നതിനാലെ, ഈ മാറ്റങ്ങൾ നിങ്ങളുടെ യൂണിറ്റ് ഇക്കണോമിക്സിനെ (unit economics) ബാധിക്കും. നിങ്ങൾ ഇതിന്റെ വിശദാംശങ്ങൾ പരിശോധിക്കുകയും, നിങ്ങളുടെ ചെലവുകൾ (burn rate) വീണ്ടും കണക്കാക്കുകയും, നിലവിലെ സ്റ്റാക്ക് (stack) ഇപ്പോഴും ലാഭകരമാണോ എന്ന് തീരുമാനിക്കുകയും വേണം.
ഇൻഫറൻസ് നിരക്കുകൾ നിങ്ങൾ ശ്രദ്ധിക്കേണ്ടത് എന്തുകൊണ്ട്?
മിക്ക ഡെവലപ്പർമാരും AI എൻജിനീയറിംഗിലേക്ക് വരുന്നത് മോഡലുകൾ ഇഷ്ടപ്പെടുന്നത് കൊണ്ടാണ്, വിലപ്പട്ടികകൾ വായിക്കാൻ താൽപ്പര്യമുള്ളതുകൊണ്ടല്ല. അത് ഒരു തെറ്റാണ്. ഇൻഫറൻസ് എന്നത് ഉപയോഗത്തിനനുസരിച്ച് മാത്രം പണം നൽകേണ്ടുന്ന (consumption-based) ഒരു ഇൻഫ്രാസ്ട്രക്ചറാണ്. നിങ്ങൾ ഒരു നിശ്ചിത മാസവാടക നൽകുന്നില്ല; പകരം സിസ്റ്റത്തിലൂടെ കടന്നുപോകുന്ന ഓരോ ടോക്കണിനും (token) പണം നൽകണം. ഒരു പ്രൊവൈഡർ അവരുടെ നിരക്കുകളിൽ മാറ്റം വരുത്തുമ്പോൾ, അതിന്റെ പ്രഭാവം ഉടനടിയും വ്യക്തവുമാണ്. നിങ്ങളുടെ ആപ്ലിക്കേഷനിൽ ദിവസം ശരാശരി ഒരു ലക്ഷം ഉപയോക്താക്കളുടെ ക്വറികൾ (queries) വരുന്നുണ്ടെങ്കിൽ, ഓരോ ടോക്കണിന്റെയും ചിലവിൽ ഉണ്ടാകുന്ന ചെറിയ മാറ്റം പോലും മാസാവസാനമുള്ള ബില്ലിൽ വലിയ വ്യത്യാസം വരുത്തും.
പ്രൊവൈഡർമാർ സാധാരണയായി ഇൻപുട്ട് (input), ഔട്ട്പുട്ട് (output) ടോക്കണുകളെ അടിസ്ഥാനമാക്കിയാണ് വില നിശ്ചയിക്കുന്നത്. പ്രോംപ്റ്റ് (prompt), സിസ്റ്റം ഇൻസ്ട്രക്ഷനുകൾ, വിൻഡോയിൽ നൽകുന്ന കോൺടെക്സ്റ്റ് (context) എന്നിവ ഇൻപുട്ട് ടോക്കണുകളിൽ ഉൾപ്പെടുന്നു. മോഡൽ നൽകുന്ന മറുപടിയാണ് ഔട്ട്പുട്ട് ടോക്കണുകൾ. ചില പ്രൊവൈഡർമാർ രണ്ടിനും ഒരേ നിരക്ക് ഈടാക്കുമ്പോൾ, മറ്റു ചിലർ ഔട്ട്പുട്ടിന് കൂടുതൽ നിരക്ക് ഈടാക്കുന്നു; കാരണം ഔട്ട്പുട്ട് നിർമ്മിക്കുന്നത് കൂടുതൽ കമ്പ്യൂട്ടേഷണൽ അധ്വാനം ആവശ്യമായ കാര്യമാണ്. Novita അല്ലെങ്കിൽ StreamLake തങ്ങളുടെ നിരക്കുകൾ പുതുക്കുമ്പോൾ, "വില കുറഞ്ഞോ അതോ കൂടിയോ?" എന്നത് മാത്രമല്ല പ്രധാനപ്പെട്ട ചോദ്യം. മറിച്ച്, "ഏത് ഭാഗത്താണ് മാറ്റം വന്നത്, എത്രത്തോളം?" എന്നതാണ് പ്രധാനം.
മറ്റ് ചില ചെലവുകൾ ശ്രദ്ധിക്കപ്പെടാതെ പോകാം. വലിയ കോൺടെക്സ്റ്റ് വിൻഡോകൾ (context windows) ഒരു നിശ്ചിത പരിധിക്ക് മുകളിൽ പോകുമ്പോൾ പ്രീമിയം നിരക്കുകൾ ഈടാക്കിയേക്കാം. ചില പ്രൊവൈഡർമാർ ഓരോ റിക്വസ്റ്റിനും മിനിമം ടോക്കൺ എണ്ണത്തിന്റെ അടിസ്ഥാനത്തിൽ ബില്ല് ചെയ്യും; അതായത് ഒരു വാക്ക് മാത്രമുള്ള ക്വറി ആണെങ്കിൽ പോലും നിങ്ങൾക്ക് മിനിമം തുക നൽകേണ്ടി വരും. റേറ്റ് ലിമിറ്റുകൾ (rate limits) നിങ്ങളെ കൂടുതൽ ഉയർന്ന നിരക്കുള്ള കോൺകറൻസി ടയറുകളിലേക്ക് (concurrency tiers) എത്തിച്ചേക്കാം. നിങ്ങൾ വ്യവസ്ഥകൾ കൃത്യമായി വായിച്ചില്ലെങ്കിൽ, നിങ്ങളുടെ ചെലവ് കൂടുന്നതായി അറിയാതെ ബില്ല് വർദ്ധിക്കുന്നത് കാണാൻ സാധിച്ചേക്കും.
Novita, StreamLake എന്നിവയിൽ വന്ന മാറ്റങ്ങൾ എന്തൊക്കെ?
Novita ഒരു സെർവ്ലെസ് ഇൻഫറൻസ് പ്ലാറ്റ്ഫോമായി (serverless inference platform) പ്രവർത്തിക്കുന്നു; ഇത് GPU ക്ലസ്റ്ററുകൾ മാനേജ് ചെയ്യാതെ തന്നെ ഓപ്പൺ-വെയ്റ്റ് മോഡലുകൾ ഉപയോഗിക്കാൻ ഡെവലപ്പർമാർക്ക് API സൗകര്യം നൽകുന്നു. StreamLake സമാനമായ ഇൻഫ്രാസ്ട്രക്ചർ സേവനങ്ങൾ നൽകുന്നു. ഇവ രണ്ടും അടുത്തിടെ തങ്ങളുടെ LLM നിരക്കുകൾ പുതുക്കിയതിനാൽ, ഇവയുടെ എൻഡ് പോയിന്റുകൾ (endpoints) വഴി റിക്വസ്റ്റുകൾ അയക്കുന്നതിനുള്ള ചിലവിൽ മാറ്റം വന്നിട്ടുണ്ട്.
ഈ പ്ലാറ്റ്ഫോമുകൾ ഒന്നിലധികം മോഡൽ ഫാമിലികളെ പിന്തുണയ്ക്കുന്നതിനാലും മോഡലിന്റെ വലിപ്പവും കോൺടെക്സ്റ്റ് ദൈർഘ്യവും അനുസരിച്ച് നിരക്കുകൾ വ്യത്യാസപ്പെടുന്നതിനാലും, ഒരു "വിലമാറ്റം" എന്ന അറിയിപ്പ് കൊണ്ട് മാത്രം കാര്യങ്ങൾ പൂർണ്ണമായി മനസ്സിലാക്കാൻ കഴിയില്ല. ഒരു മോഡലിന്റെ വില കുറയുമ്പോൾ മറ്റൊന്നിന് വില കൂടാം. 4K ടോക്കണുകൾക്ക് താഴെയുള്ള കോൺടെക്സ്റ്റ് വിൻഡോകൾക്ക് മാറ്റമില്ലാതെ തുടരുമ്പോൾ, 128K കോൺടെക്സ്റ്റുകൾക്ക് ഉയർന്ന നിരക്ക് ഈടാക്കിയേക്കാം. ബാച്ച് പ്രോസസ്സിംഗിനോ (batch processing) ഓഫ്-പീക്ക് ഉപയോഗത്തിനോ ഉള്ള ഡിസ്കൗണ്ടുകൾ വന്നേക്കാം അല്ലെങ്കിൽ ഇല്ലാതാകാം. ഈ സൂക്ഷ്മമായ വ്യത്യാസങ്ങൾ കാരണമാണ് വെറുമൊരു വാർത്ത മാത്രം നോക്കി തീരുമാനമെടുക്കാൻ പാടില്ലാത്തത്. നിങ്ങൾക്ക് കൃത്യമായ നിരക്ക് പട്ടിക (rate card) ആവശ്യമാണ്.
കൃത്യമായ വ്യത്യാസങ്ങൾ വിവരിക്കുന്ന ഡെവലപ്പർ ബ്രേക്ക്ഡൗൺ (developer breakdown) യഥാർത്ഥ അപ്ഡേറ്റ് പേജിൽ ലഭ്യമാണ്. അടുത്ത ആഴ്ച വീണ്ടും മാറാൻ സാധ്യതയുള്ള കണക്കുകൾ ഊഹിക്കുന്നതിന് പകരം, ഔദ്യോഗിക സ്രോതസ്സിൽ നിന്ന് നിലവിലെ കണക്കുകൾ എടുത്ത് നിങ്ങളുടെ അവസാനത്തെ ഇൻവോയിസുമായി (invoice) താരതമ്യം ചെയ്യുക.
നിങ്ങളുടെ സ്റ്റാക്കിലുള്ള (stack) സ്വാധീനം എങ്ങനെ പരിശോധിക്കാം?
ഒരു വിലമാറ്റത്തെക്കുറിച്ച് അറിയുമ്പോൾ, പരിഭ്രാന്തരാകുന്നതിനോ ആഘോഷിക്കുന്നതിനോ മുൻപ് നിങ്ങളുടെ ഉപയോഗത്തെക്കുറിച്ച് ഒരു വേഗത്തിലുള്ള പരിശോധന നടത്തുക.
1. നിങ്ങളുടെ ടോക്കൺ ഹിസ്റ്റോഗ്രാം (token histogram) എക്സ്പോർട്ട് ചെയ്യുക. മിക്ക പ്രൊവൈഡർമാരും ഇൻപുട്ട്, ഔട്ട്പുട്ട് ഉപയോഗം വേർതിരിച്ചു കാണിക്കുന്ന യൂസേജ് ഡാഷ്ബോർഡുകളോ API ലോഗുകളോ നൽകുന്നുണ്ട്. അവയിലെ അനുപാതം (ratio) ശ്രദ്ധിക്കുക. നിങ്ങളുടെ ആപ്ലിക്കേഷൻ സിസ്റ്റം പ്രോംപ്റ്റുകൾക്കും (system prompts) RAG കോൺടെക്സ്റ്റിനും (RAG context) കൂടുതൽ പ്രാധാന്യം നൽകുന്നതാണെങ്കിൽ, നിങ്ങൾ ഇൻപുട്ട്-ബയാസ്ഡ് (input-biased) ആണ്. നിങ്ങൾ നീളമുള്ള ലേഖനങ്ങളോ കോഡോ അല്ലെങ്കിൽ മൾട്ടി-സ്റ്റെപ്പ് റീസണിംഗ് ചെയിനുകളോ (multi-step reasoning chains) നിർമ്മിക്കുന്നതാണെങ്കിൽ, നിങ്ങൾ ഔട്ട്പുട്ട്-ബയാസ്ഡ് (output-biased) ആണ്. വിലയിലെ മാറ്റവുമായി നിങ്ങളുടെ ഉപയോഗ രീതിയെ താരതമ്യം ചെയ്യുക. ഇൻപുട്ട് വില കുറയുന്നത് RAG പൈപ്പ്ലൈനിന് ഗുണകരമാണ്; ഔട്ട്പുട്ട് വില കൂടുന്നത് റൈറ്റിംഗ് അസിസ്റ്റന്റുകളെ ദോഷകരമായി ബാധിക്കും.
2. ഉപയോഗം കൂടുതലുള്ള നിങ്ങളുടെ പ്രധാന അഞ്ച് മോഡലുകളെ തിരിച്ചറിയുക. ക്ലാസിഫിക്കേഷനായി (classification) നിങ്ങൾ വേഗതയേറിയതും വില കുറഞ്ഞതുമായ ഒരു മോഡലും സംഗ്രഹിക്കുന്നതിനായി (summarization) വലിയൊരു മോഡലും ഉപയോഗിക്കുന്നുണ്ടാകാം. വിലമാറ്റങ്ങൾ എല്ലാ മോഡലുകളിലും ഒരേപോലെ ഉണ്ടാകാറില്ല. Novita അല്ലെങ്കിൽ StreamLake ചെറിയ ക്ലാസിഫയർ മോഡലിന്റെ നിരക്ക് കുറച്ചെങ്കിലും വലിയ മോഡലിന്റെ നിരക്കിൽ മാറ്റം വരുത്തിയില്ലെങ്കിൽ, നിങ്ങളുടെ ശരാശരി ചെലവിൽ വലിയ മാറ്റം ഉണ്ടായെന്നു വരില്ല.
3. കൂട്ടിച്ചേർക്കപ്പെട്ട മാറ്റങ്ങൾ പരിശോധിക്കുക. ചിലപ്പോൾ ഒരു വില പുതുക്കൽക്കൊപ്പം കോൺടെക്സ്റ്റ് വിൻഡോ വിപുലീകരണം (context-window expansion), പുതിയൊരു ഫൈൻ-ട്യൂണിംഗ് എൻഡ്പോയിന്റ് (fine-tuning endpoint), അല്ലെങ്കിൽ പരിഷ്കരിച്ച റേറ്റ് ലിമിറ്റുകൾ എന്നിവ വരാം. നിങ്ങളുടെ ഉപയോക്താക്കളുടെ അനുഭവം മെച്ചപ്പെടുത്തുന്നതിനായി പ്രൊവൈഡർ ലഭ്യമായ കൺകറൻസി (concurrency) ഇരട്ടിയാക്കുകയും ക്യൂയിംഗ് കാലതാമസങ്ങൾ (queueing delays) ഒഴിവാക്കുകയും ചെയ്തിട്ടുണ്ടെങ്കിൽ, ടോക്കണിന് കൂടുതൽ ചിലവ് വരുന്നത് സഹിക്കാവുന്നതാണ്. ചിലവ് എന്നത് ഒരു ഘടകം മാത്രമാണ്; ലേറ്റൻസിയും (latency) വിശ്വാസ്യതയും ഒരുപോലെ പ്രധാനമാണ്.
4. അടുത്ത മുപ്പത് ദിവസങ്ങൾ മുൻകൂട്ടി കണക്കാക്കുക. കഴിഞ്ഞ ആഴ്ചയിലെ ടോക്കൺ എണ്ണം എടുക്കുക, പുതിയ നിരക്കുകൾ പ്രയോഗിക്കുക, തുടർന്ന് ഒരു പ്രതിമാസ റൺ റേറ്റ് (monthly run rate) കണക്കാക്കുക. ഈ വ്യത്യാസം അഞ്ച് ശതമാനത്തിൽ താഴെയാണെങ്കിൽ, API-കൾ മാറ്റുന്നതിനുള്ള ചിലവ് (switch cost) ലാഭത്തേക്കാൾ കൂടുതലായിരിക്കാൻ സാധ്യതയുണ്ട്. വ്യത്യാസം ഇരുപത്തിയഞ്ച് ശതമാനമാണെങ്കിൽ, ചർച്ചകൾ നടത്താനോ, ഒപ്റ്റിമൈസ് ചെയ്യാനോ, അല്ലെങ്കിൽ മറ്റ് ഓപ്ഷനുകൾ തേടാനോ സമയമായിരിക്കുന്നു.
ഇൻഫറൻസ് ചിലവുകൾ പ്രവചിക്കാവുന്ന രീതിയിൽ നിലനിർത്താനുള്ള തന്ത്രങ്ങൾ
Novita-യും StreamLake-ഉം വില മാറ്റമില്ലാതെ നിലനിർത്തിയാൽ പോലും, ടോക്കൺ ചിലവിനെക്കുറിച്ച് നിങ്ങൾ ജാഗ്രത പാലിക്കേണ്ടതുണ്ട്. മോഡൽ ആര് ഹോസ്റ്റ് ചെയ്യുന്നു എന്നതിനെ ആശ്രയിക്കാതെ നിങ്ങളുടെ ലാഭം സംരക്ഷിക്കാൻ സഹായിക്കുന്ന ചില പ്രായോഗിക ശീലങ്ങൾ താഴെ പറയുന്നവയാണ്.
നിങ്ങളുടെ പ്രോംപ്റ്റുകൾ ചുരുക്കുക. നിങ്ങളുടെ സിസ്റ്റം പ്രോംപ്റ്റിലെ (system prompt) ഓരോ അനാവശ്യ വാചകവും ഓരോ റിക്വസ്റ്റിനും അധിക ചിലവാണ്. അനാവശ്യ പദങ്ങൾ ഒഴിവാക്കുക, നിങ്ങളുടെ JSON സ്കീമകളിൽ ചുരുക്കപ്പേരുകൾ ഉപയോഗിക്കുക, ആവർത്തിച്ചുള്ള നിർദ്ദേശങ്ങൾ നീക്കം ചെയ്യുക. നിങ്ങൾ ഒരു പ്രോംപ്റ്റിൽ മാറ്റങ്ങൾ വരുത്തുകയാണെങ്കിൽ, അത് ഉപയോഗത്തിൽ വരുന്നതിന് മുമ്പ് ഒരു ടോക്കണൈസർ (tokenizer) ഉപയോഗിച്ച് ടോക്കൺ എണ്ണം അളക്കുക. ഓരോ റിക്വസ്റ്റിലും നൂറ് ബൈറ്റുകൾ ലാഭിക്കുന്നത് വലിയ തോതിൽ വരുമാന വ്യത്യാസം ഉണ്ടാക്കും.
നിശ്ചിത ക്വറികൾ കാഷെ ചെയ്യുക. നിങ്ങളുടെ ഉപയോക്താക്കൾ ഇടയ്ക്കിടെ ഒരേ ചോദ്യങ്ങൾ ചോദിക്കുകയാണെങ്കിലോ, അല്ലെങ്കിൽ നിങ്ങളുടെ ബാക്കെൻഡ് ഒരേ ഡാറ്റയിൽ ഒരേ ക്ലാസിഫിക്കേഷൻ ടാസ്ക്കുകൾ (classification tasks) നടത്തുകയാണെങ്കിലോ, അതിന്റെ ഫലം കുറച്ച് മിനിറ്റുകളോ മണിക്കൂറുകളോ നേരത്തേക്ക് സംഭരിച്ചു വെക്കുക (store). നിങ്ങളുടെ LLM ക്ലയന്റിന് മുന്നിലായി ഒരു ചെറിയ കാഷിംഗ് ലെയർ (caching layer) ഉപയോഗിക്കുന്നത് മോഡലിന്റെ ഗുണനിലവാരത്തിൽ മാറ്റം വരുത്താതെ തന്നെ വോളിയം പകുതിയായി കുറയ്ക്കാൻ സഹായിക്കും.
ടാസ്ക്കുകൾക്കനുസരിച്ച് മോഡലുകൾ മാറ്റുക. എല്ലാ പ്രവർത്തനങ്ങൾക്കും പ്ലാറ്റ്ഫോമിലെ ഏറ്റവും മികച്ചതും ഏറ്റവും ചിലവേറിയതുമായ മോഡൽ ആവശ്യമില്ല. ലളിതമായ ജോലികൾ ചെറിയതും വില കുറഞ്ഞതുമായ മോഡലുകളിലേക്ക് മാറ്റുകയും, സങ്കീർണ്ണമായ കാര്യങ്ങൾക്കായി വലിയ മോഡലുകൾ മാറ്റിവെക്കുകയും ചെയ്യുക. StreamLake അല്ലെങ്കിൽ Novita അവരുടെ മിഡ്-ടിയർ മോഡലുകൾ കൂടുതൽ മത്സരക്ഷമമാക്കാൻ വിലയിൽ മാറ്റം വരുത്തിയിട്ടുണ്ടെങ്കിൽ, അത് നിങ്ങളുടെ റൂട്ടിംഗ് നിയമങ്ങൾ (routing rules) പുനഃക്രമീകരിക്കാനുള്ള സൂചനയാണ്.
ടോക്കൺ പരിധികൾ നിശ്ചയിക്കുക. നിങ്ങളുടെ ജനറേഷൻ കോളുകളിൽ (generation calls) ഔട്ട്പുട്ട് ദൈർഘ്യത്തിന് ഒരു പരിധി (ceiling) നിശ്ചയിക്കുക. ഉപയോക്താവ് ഒരു സംഗ്രഹം (summary) ആവശ്യപ്പെടുകയാണെങ്കിൽ, മോഡൽ ആയിരം ടോക്കണുകളോളം നീണ്ടുപോകാതെ ഇരുനൂറ് ടോക്കണുകളിൽ പരിമിതപ്പെടുത്തുക. മിക്കപ്പോഴും ഉപയോക്താക്കൾ ചുരുങ്ങിയ ഉത്തരങ്ങളാണ് ആഗ്രഹിക്കുന്നത്.
റിസർവ്ഡ് കപ്പാസിറ്റിയോ അല്ലെങ്കിൽ കമ്മിറ്റ്മെന്റ് ഡിസ്കൗണ്ടുകളോ ശ്രദ്ധിക്കുക. നിങ്ങളുടെ ഉപയോഗം സ്ഥിരമാണെങ്കിൽ, സെർവ്ലെസ് പെർ-ടോക്കൺ പ്രൈസിംഗ് (serverless per-token pricing) എന്നത് ഏറ്റവും ചിലവേറിയ മാർഗ്ഗമായിരിക്കാം. ചില പ്രൊവൈഡർമാർ കുറഞ്ഞ നിരക്കിൽ സേവനം നൽകുന്നതിനായി റിസർവ്ഡ് ത്രൂപുട്ട് (reserved throughput) അല്ലെങ്കിൽ എന്റർപ്രൈസ് കമ്മിറ്റുകൾ (enterprise commits) വാഗ്ദാനം ചെയ്യുന്നു. വിലയിൽ മാറ്റം വരുമ്പോൾ, മാർക്കറ്റിംഗ് സൈറ്റിൽ പ്രസിദ്ധീകരിക്കാത്ത മറ്റ് പാക്കേജുകളെക്കുറിച്ച് അവരുടെ സെയിൽസ് ടീമിനോട് ചോദിക്കുന്നത് നല്ലതാണ്.
കൂടുതൽ വിവരങ്ങൾ എവിടെ നിന്ന് അറിയാം
LLM ഇൻഫ്രാസ്ട്രക്ചർ വിപണി അതിവേഗം മാറിക്കൊണ്ടിരിക്കുന്നതിനാൽ, പഴയ ലേഖനങ്ങൾ പെട്ടെന്ന് പ്രസക്തി നഷ്ടപ്പെട്ടേക്കാം. Novita, StreamLake എന്നിവയിലെ ഏതെല്ലാം എൻഡ്പോയിന്റുകളാണ് മാറിയതെന്നും, എത്രത്തോളം മാറ്റം വന്നുവെന്നും, ഏതൊക്കെ മോഡലുകളെ ഇത് ബാധിക്കുന്നുവെന്നും ഉള്ള പൂർണ്ണമായ വിവരങ്ങൾ ലിങ്ക് ചെയ്തിട്ടുള്ള ഡെവലപ്പർ അപ്ഡേറ്റിൽ (developer update) ലഭ്യമാണ്.
പ്രൊവൈഡർമാരുടെ വിലനിലവാരം, ബില്ലിംഗ് രീതികൾ, മോഡൽ പെർഫോമൻസ് എന്നിവ നിരീക്ഷിക്കുന്ന മറ്റ് ഡെവലപ്പർമാരുമായി ചർച്ചകളിൽ ഏർപ്പെടാൻ ആഗ്രഹിക്കുന്നുവെങ്കിൽ, GyaanSetu ടെലിഗ്രാം കമ്മ്യൂണിറ്റിയിൽ നിങ്ങൾക്ക് ചേരാം. പ്ലാറ്റ്ഫോമുകൾ അവരുടെ നിരക്കുകൾ മാറ്റുമ്പോൾ, നിങ്ങളുടെ സ്റ്റാക്ക് റീഫാക്ടർ (refactor) ചെയ്യണോ അതോ വില വർദ്ധനവ് ഉൾക്കൊള്ളണോ എന്നതിനെക്കുറിച്ച് മറ്റുള്ളവരുടെ അഭിപ്രായം തേടാൻ ഇത് ഉപകരിക്കും.
യഥാർത്ഥ പാഠം
വില വ്യതിയാനങ്ങൾ വെറും വെണ്ടർ വാർത്തകൾ മാത്രമല്ല; നിങ്ങളുടെ ചിലവ് സംബന്ധിച്ച അനുമാനങ്ങൾ യാഥാർത്ഥ്യവുമായി ഒത്തുപോകാത്തതിന്റെ സൂചനകളാണവ. Novita-യും StreamLake-ഉം അവരുടെ LLM നിരക്കുകൾ പുതുക്കിയിട്ടുണ്ട്, അതിനർത്ഥം മൂന്ന് മാസം മുമ്പ് നിങ്ങൾ തയ്യാറാക്കിയ കണക്കുകൾ ഇപ്പോൾ തെറ്റായിരിക്കാം എന്നാണ്. നിങ്ങളുടെ ഉപയോഗ വിവരങ്ങൾ (usage data) എടുക്കുക, പുതിയ നിരക്കുകൾ പ്രയോഗിക്കുക, നിങ്ങളുടെ റൂട്ടിംഗ് ലോജിക് പരിശോധിക്കുക, തുടർന്ന് ഒപ്റ്റിമൈസ് ചെയ്യണോ, ചർച്ച ചെയ്യണോ, അതോ മാറ്റണോ എന്ന് തീരുമാനിക്കുക. ഇൻഫറൻസ് എന്നത് ഒരു നിശ്ചിത ചിലവല്ല; അത് നിങ്ങളുടെ വിജയത്തിനനുസരിച്ച് മാറുന്ന ഒരു വേരിയബിൾ കോസ്റ്റാണ് (variable cost). അതിനെ അങ്ങനെ തന്നെ പരിഗണിക്കുക.
