ഓപ്പൺ സോഴ്സ് മോഡൽ API-കൾ അപൂർവ്വമായേ മാറ്റമില്ലാതെ നിൽക്കാറുള്ളൂ. Novita-യും StreamLake-യും ലാർജ് ലാംഗ്വേജ് മോഡലുകൾക്കായുള്ള (Large Language Models) നിരക്കുകളിൽ മാറ്റം വരുത്തിയിട്ടുണ്ട്. നിങ്ങൾ ഈ പ്ലാറ്റ്ഫോമുകളിലൂടെ പ്രൊഡക്ഷൻ ട്രാഫിക് കൈകാര്യം ചെയ്യുന്നുണ്ടെങ്കിൽ, പുതിയ നിരക്കുകൾ ഇപ്പോൾ തന്നെ പരിശോധിക്കേണ്ടതുണ്ട്. ഒരു AI ഫീച്ചർ ലാഭകരമാണോ അതോ പണം ചോരുന്ന ഒന്നാണോ എന്ന് തീരുമാനിക്കുന്നത് ടോക്കൺ ഇക്കണോമിക്സ് (Token economics) ആണ്. ഓരോ മില്യൺ ടോക്കണിനും ഉള്ള നിരക്ക് മാറുന്നതിനനുസരിച്ച് നിങ്ങളുടെ പ്രതിമാസ ക്ലൗഡ് ചെലവും മാറുന്നു.
എന്തുകൊണ്ടാണ് LLM വിലകളിൽ നിരന്തരം മാറ്റങ്ങൾ വരുന്നത്?
വാർഷിക കരാറുകളുള്ള പരമ്പരാഗത സോഫ്റ്റ്വെയർ ലൈസൻസുകളിൽ നിന്ന് വ്യത്യസ്തമായി, മിക്ക LLM ഇൻഫറൻസുകളും (inference) ഒരു യൂട്ടിലിറ്റി പോലെയാണ് ബില്ല് ചെയ്യുന്നത്. നിങ്ങൾ ഉപയോഗിക്കുന്നതിന് മാത്രം പണം നൽകിയാൽ മതി, ഇത് സാധാരണയായി ടോക്കണുകളിലാണ് അളക്കുന്നത്. ഒരു പ്രൊവൈഡറുടെ റേറ്റ് കാർഡ് എപ്പോഴും മാറിക്കൊണ്ടിരിക്കുന്ന ഒന്നാണ്. അടിസ്ഥാനപരമായ GPU ക്ലസ്റ്ററുകളുടെ ചിലവ് കുറയുമ്പോഴോ, പുതിയ മോഡൽ വെയ്റ്റുകൾ (model weights) പഴയവയെ മാറ്റിസ്ഥാപിക്കുമ്പോഴോ, അല്ലെങ്കിൽ ഒരു പ്ലാറ്റ്ഫോം ലാഭവിഹിതത്തിൽ മത്സരിക്കാൻ തീരുമാനിക്കുമ്പോഴോ നിരക്കുകളിൽ മാറ്റം വരുന്നു.
നിങ്ങൾ ഒരു പ്രോട്ടോടൈപ്പ് നിർമ്മിക്കുകയാണെങ്കിൽ ഈ മാറ്റങ്ങൾ അവഗണിക്കാൻ എളുപ്പമാണ്. ദിവസവും ഏതാനും ആയിരം ടോക്കണുകൾ മാത്രം ഉപയോഗിക്കുന്ന ഒരു സൈഡ് പ്രോജക്റ്റിനെ ഇരുപത് ശതമാനം വില വ്യത്യാസം ബാധിക്കില്ല. എന്നാൽ പ്രൊഡക്ഷൻ വർക്ക്ലോഡുകൾ (Production workloads) വ്യത്യസ്തമാണ്. ഉപഭോക്താക്കൾ ഉപയോഗിക്കുന്ന ഒരു ചാറ്റ്ബോട്ട്, ഒരു ഡോക്യുമെന്റ് പാഴ്സർ, അല്ലെങ്കിൽ ഒരു കോഡ്-ജനറേഷൻ പൈപ്പ്ലൈൻ എന്നിവ ഓരോ മാസവും കോടിക്കണക്കിന് ടോക്കണുകൾ എളുപ്പത്തിൽ ഉപയോഗിച്ചേക്കാം. ആ അളവിൽ, ഓരോ ടോക്കണിന്റെയും വിലയിലുണ്ടാകുന്ന ചെറിയ മാറ്റം പോലും നിങ്ങളുടെ ഇൻഫ്രാസ്ട്രക്ചർ ബജറ്റിനെ മാറ്റിമറിക്കും.
Novita-യും StreamLake-യും ഈ ഉയർന്ന നിരക്ക് മാറ്റങ്ങളുള്ള സാഹചര്യത്തിലാണ് പ്രവർത്തിക്കുന്നത്. അവർ ഒരു മോഡൽ മാത്രം റീസെൽ ചെയ്യുകയല്ല ചെയ്യുന്നത്; പകരം ഒരുപാട് ഓപ്പൺ-വെയിറ്റ് (open-weight), പ്രൊപ്രൈറ്ററി (proprietary) എൻഡ്പോയിന്റുകൾ അവർ ഒരുമിച്ച് നൽകുന്നു. അവർ അവരുടെ നിരക്കുകൾ പുതുക്കുമ്പോൾ, അവരുടെ API-കളിലൂടെ നിങ്ങൾ ഉപയോഗിക്കുന്ന എല്ലാ മോഡലുകളെയും അത് ബാധിക്കുന്നു.
Novita-യും StreamLake-യും എന്താണ് ചെയ്യുന്നത്?
രണ്ട് പ്ലാറ്റ്ഫോമുകളും ഇൻഫറൻസ് പ്രൊവൈഡർമാരായോ അല്ലെങ്കിൽ API ഗേറ്റ്വേകളായോ ആണ് പ്രവർത്തിക്കുന്നത്. Llama, Mistral, Qwen അല്ലെങ്കിൽ മറ്റ് മോഡലുകൾ സ്വന്തം GPU-കളിൽ ഹോസ്റ്റ് ചെയ്യുന്നതിന് പകരം, നിങ്ങൾ അവരുടെ എൻഡ്പോയിന്റുകളിലേക്ക് റിക്വസ്റ്റുകൾ അയക്കുന്നു. ഇതിലൂടെ നിങ്ങൾക്ക് സ്റ്റാൻഡേർഡൈസ്ഡ് ഓതന്റിക്കേഷൻ, ലോഡ് ബാലൻസിംഗ്, കൂടാതെ പല മോഡൽ ഫാമിലികൾക്കിടയിൽ ഏകീകൃതമായ ഫോർമാറ്റിംഗ് എന്നിവ ലഭിക്കുന്നു. ഇതിന്റെ പകരമായി, നിങ്ങൾ നേരിട്ടുള്ള കമ്പ്യൂട്ട് ചിലവിനു പകരം പ്ലാറ്റ്ഫോമിന്റെ മാർക്കപ്പ് ചെയ്ത നിരക്ക് നൽകേണ്ടി വരുന്നു.
അവരുടെ പ്രൈസിംഗ് പേജുകളിൽ ഇൻപുട്ട് ടോക്കണുകൾക്കും (prompt) ഔട്ട്പുട്ട് ടോക്കണുകൾക്കും (completion) പ്രത്യേക നിരക്കുകൾ നൽകിയിട്ടുണ്ട്. ചില മോഡലുകൾക്ക് വലിയ കോൺടെക്സ്റ്റ് വിൻഡോകൾക്കോ (context windows) പ്രത്യേക വേരിയന്റുകൾക്കോ അധിക നിരക്ക് ഈടാക്കാറുണ്ട്. അവർ ഒട്ടനവധി മോഡലുകൾ ഒരുമിച്ച് നൽകുന്നതുകൊണ്ട്, Novita-യിലോ StreamLake-യിലോ ഉണ്ടാകുന്ന ഒരു ചെറിയ നിരക്ക് മാറ്റം പോലും ഒരേസമയം ഒന്നിലധികം എൻഡ്പോയിന്റുകളെ ബാധിച്ചേക്കാം. കഴിഞ്ഞ പാദത്തിൽ നിങ്ങൾ തിരഞ്ഞെടുത്ത വില കുറഞ്ഞ സമ്മറൈസേഷൻ മോഡൽ, ഇപ്പോൾ അതേ പ്ലാറ്റ്ഫോമിലെ വലിയൊരു മോഡലിനേക്കാൾ വില കൂടിയതായി കാണാൻ നിങ്ങൾക്കുണ്ടായേക്കാം.
സമീപകാല മാറ്റങ്ങൾ നിങ്ങളുടെ ബില്ലിനെ എങ്ങനെ ബാധിക്കുന്നു?
Novita-യുടെയും StreamLake-യുടെയും ഏറ്റവും പുതിയ അപ്ഡേറ്റുകൾ പല മോഡലുകളുടെയും നിരക്കുകളിൽ മാറ്റം വരുത്തുന്നു. നിലവിലെ ഇന്റഗ്രേഷനുകൾ നിങ്ങൾ പരിശോധിക്കുന്നില്ലെങ്കിൽ, പുതിയ നിബന്ധനകൾ അറിയാതെ തന്നെ നിങ്ങൾ അംഗീകരിക്കുന്നു എന്നാണ് ഇതിനർത്ഥം. വിലയിലെ മാറ്റങ്ങൾ LLM ഉപയോഗിക്കുന്ന രീതിയെ നേരിട്ട് ബാധിക്കുന്നു:
- ടോക്കൺ നിരക്കുകൾ: ഇൻപുട്ട്, ഔട്ട്പുട്ട് ചിലവുകൾ തമ്മിൽ വ്യത്യാസം വരാം. ടെക്സ്റ്റ് വായിക്കുന്നതിനേക്കാൾ കൂടുതൽ കമ്പ്യൂട്ട് ആവശ്യമായതിനാൽ ഔട്ട്പുട്ട് ടോക്കണുകൾ സാധാരണയായി കൂടുതൽ വിലയുള്ളവയാണ്. പ്രൊവൈഡർ ഔട്ട്പുട്ട് നിരക്ക് അമിതമായി വർദ്ധിപ്പിച്ചാൽ, കൂടുതൽ വിവരങ്ങൾ നൽകുന്ന (verbose) ആപ്ലിക്കേഷനുകളുടെ ചിലവ് കുതിച്ചുയരും.
- മോഡൽ അടിസ്ഥാനമാക്കിയുള്ള മാറ്റങ്ങൾ: എല്ലാ എൻഡ്പോയിന്റുകളും ഒരേപോലെ മാറണമെന്നില്ല. ഒരു ജനപ്രിയ മോഡലിന്റെ വില കുറയുമ്പോൾ മറ്റൊരു പ്രത്യേക മോഡലിന്റെ വില കൂടാം. ചാർട്ട് പരിശോധിക്കാതെ നിങ്ങൾ നിങ്ങളുടെ ബജറ്റിന് അനുയോജ്യമല്ലാത്ത എൻഡ്പോയിന്റിലൂടെ ട്രാഫിക് നിയന്ത്രിച്ചേക്കാം.
- ടയർഡ് അല്ലെങ്കിൽ വോളിയം ഡിസ്കൗണ്ടുകൾ: ചില പ്രൊവൈഡർമാർ ബൾക്ക് ഡിസ്കൗണ്ടുകൾ നൽകുന്ന പരിധിയിൽ മാറ്റം വരുത്താറുണ്ട്. നിങ്ങൾ അടുത്തിടെ ഉയർന്ന വോളിയം ഉപയോഗിക്കുന്ന വിഭാഗത്തിലേക്ക് മാറിയെങ്കിൽ, പുതിയ നിരക്കുകൾ നിങ്ങൾക്ക് ഗുണകരമായേക്കാം, അല്ലെങ്കിൽ നിങ്ങൾ പ്രതീക്ഷിച്ച ഡിസ്കൗണ്ട് ഇല്ലാതാകാനും സാധ്യതയുണ്ട്.
നിങ്ങൾ ഉപയോഗിക്കുന്നതിന് മാത്രം പണം നൽകുന്നതുകൊണ്ട്, നിങ്ങളുടെ വർക്ക്ലോഡിനെ നിലവിലെ വിലയുമായി പൊരുത്തപ്പെടുത്തുക എന്നത് മാത്രമാണ് ചിലവ് നിയന്ത്രിക്കാനുള്ള ഏക വഴി. പഴയ നിരക്കുകൾ ഇപ്പോൾ വെറും ചരിത്രപരമായ വിവരങ്ങൾ മാത്രമാണ്.
ഡെവലപ്പർമാർക്കായി ഒരു പ്രായോഗിക ഓഡിറ്റ് (Practical Audit)
നിങ്ങൾ അടുത്തിടെ നിങ്ങളുടെ ഇൻഫറൻസ് ചിലവ് പരിശോധിച്ചിട്ടില്ലെങ്കിൽ, ഇപ്പോൾ തന്നെ അത് ചെയ്യുക. നഷ്ടങ്ങൾ കണക്കാക്കാനും അവ പരിഹരിക്കാനുമുള്ള ലളിതമായ വഴി ഇതാ:
1. നിങ്ങളുടെ ഉപയോഗത്തിന്റെ ലോഗുകൾ (usage logs) എടുക്കുക. കഴിഞ്ഞ മുപ്പത് ദിവസത്തെ വിവരങ്ങൾ പരിശോധിക്കുക. ഇൻപുട്ട് ടോക്കണുകളെ ഔട്ട്പുട്ട് ടോക്കണുകളിൽ നിന്ന് വേർതിരിക്കുക, കൂടാതെ അവ ഓരോ മോഡലിനും അനുസരിച്ച് തരംതിരിക്കുക. Novita-യിലെയും StreamLake-യിലെയും മിക്ക ഡാഷ്ബോർഡുകളും ഇത് നൽകുന്നുണ്ട്, അല്ലെങ്കിൽ നിങ്ങളുടെ സ്വന്തം റിക്വസ്റ്റ് ലോഗുകളിൽ നിന്ന് ഇത് വിശകലനം ചെയ്യാം.
2. പുതിയ വിലയുമായി താരതമ്യം ചെയ്യുക. നിങ്ങളുടെ ടോക്കൺ എണ്ണത്തെ പുതിയ നിരക്കുകൾ കൊണ്ട് ഗുണിക്കുക. പഴയ നിരക്ക് പ്രകാരം കഴിഞ്ഞ മാസം നിങ്ങൾ നൽകിയ തുകയുമായി ഇത് താരതമ്യം ചെയ്യുക. ഈ വ്യത്യാസമാണ് നിങ്ങളുടെ പുതിയ പ്രതിമാസ ചിലവ്.
3. മോഡലുകൾ മാറ്റുന്നത് വിലയിരുത്തുക. നിങ്ങൾ ഉപയോഗിക്കുന്ന ഒരു മോഡലിന്റെ വില ഗണ്യമായി വർദ്ധിച്ചാൽ, അതേ പ്ലാറ്റ്ഫോമിലുള്ള കുറഞ്ഞ ചിലവുള്ള ഒരു ബദൽ മോഡൽ നിങ്ങളുടെ ഗുണനിലവാര മാനദണ്ഡങ്ങൾ പാലിക്കുന്നുണ്ടോ എന്ന് പരിശോധിക്കുക. കുറഞ്ഞ പാരാമീറ്ററുകളുള്ള ഒരു മോഡലോ അല്ലെങ്കിൽ ഒരു quantized വേർഷനോ ഉപയോഗിച്ച് A/B ടെസ്റ്റ് ചെയ്യുക. സാധാരണ ജോലികളിൽ കൃത്യതയിലുണ്ടാകുന്ന കുറവ് പലപ്പോഴും ശ്രദ്ധിക്കത്തക്കതല്ല.
4. നിങ്ങളുടെ പ്രോംപ്റ്റുകൾ ചുരുക്കുക. സിസ്റ്റം പ്രോംപ്റ്റുകളിൽ few-shot ഉദാഹരണങ്ങളോ വലിയ ഡോക്യുമെന്റുകളോ ഉൾപ്പെടുമ്പോൾ ഇൻപുട്ട് ചിലവ് വർദ്ധിക്കുന്നു. ഇൻജക്ഷന് മുമ്പ് കോൺടെക്സ്റ്റ് സംഗ്രഹിക്കാൻ ശ്രമിക്കുക, max_token പരിധികൾ കുറയ്ക്കുക, അല്ലെങ്കിൽ വർക്കിംഗ് വിൻഡോ ചുരുക്കാൻ retrieval ഉപയോഗിക്കുക. ഇൻപുട്ട് ഭാഗത്തുനിന്ന് നിങ്ങൾ ഒഴിവാക്കുന്ന ഓരോ ടോക്കണും പുതിയ നിരക്കിൽ പണം ലാഭിക്കാൻ സഹായിക്കും.
5. ബജറ്റ് അലേർട്ടുകൾ സജ്ജീകരിക്കുക. മിക്ക പ്ലാറ്റ്ഫോമുകളും ദൈനംദിന ഉപയോഗം ഒരു പരിധി കടക്കുമ്പോൾ ചിലവ് നിയന്ത്രിക്കാനോ webhook അലേർട്ടുകൾ നൽകാനോ അനുവദിക്കുന്നു. ഇവ ഓൺ ചെയ്തിട്ടില്ലെങ്കിൽ, ബില്ലിംഗ് സൈക്കിളിന് മധ്യേ വിലയിലുണ്ടാകുന്ന മാറ്റം നിങ്ങളെ അമ്പരപ്പിച്ചേക്കാം.
റേറ്റ് കാർഡുകളിലെ സൂക്ഷ്മമായ കാര്യങ്ങൾ ശ്രദ്ധിക്കുക
പുതുക്കിയ നിരക്കുകൾ പരിശോധിക്കുമ്പോൾ, ഒരു ദശലക്ഷം ടോക്കണുകൾക്കുള്ള പ്രധാന നിരക്കിന് അപ്പുറവും നോക്കുക. സേവനദാതാക്കൾ പലപ്പോഴും ഡോക്യുമെന്റേഷനിൽ സൂക്ഷ്മമായ കാര്യങ്ങൾ ഒളിപ്പിച്ചു വെക്കാറുണ്ട്.
Context caching ലഭ്യമാണോ എന്ന് പരിശോധിക്കുക. ചില പ്ലാറ്റ്ഫോമുകൾ ഒരു വലിയ ഡോക്യുമെന്റ് കാഷ് ചെയ്യാൻ നിശ്ചിത ഫീസ് ഈടാക്കുകയും, പിന്നീട് വരുന്ന കോളുകളിൽ ഓരോ റിക്വസ്റ്റിനും കുറഞ്ഞ നിരക്ക് ഈടാക്കുകയും ചെയ്യുന്നു. നിങ്ങളുടെ ആപ്ലിക്കേഷൻ ഓരോ തവണയും ഒരേ ബാക്ക്ഗ്രൗണ്ട് കോൺടെക്സ്റ്റ് വീണ്ടും വായിക്കുന്നുണ്ടെങ്കിൽ, caching വഴി വില വർദ്ധനവിനെ പ്രതിരോധിക്കാം.
പരോക്ഷമായി പണം ചിലവാക്കുന്ന rate limiting-നെക്കുറിച്ച് ശ്രദ്ധിക്കുക. പുതിയ നിരക്കുകൾ നിങ്ങളെ ഉയർന്ന throughput ടയറിലേക്ക് നയിക്കുന്നുണ്ടെങ്കിൽ, നിങ്ങൾക്ക് കപ്പാസിറ്റി റിസർവ് ചെയ്യേണ്ടി വന്നേക്കാം അല്ലെങ്കിൽ മിനിമം കമിറ്റ്മെന്റുകൾ നൽകേണ്ടി വന്നേക്കാം. കൂടാതെ, API ബില്ലിംഗ് ടോക്കണുകൾ ജനറേറ്റ് ചെയ്യുന്നതിനെ അടിസ്ഥാനമാക്കിയാണോ അതോ റിക്വസ്റ്റ് ചെയ്യുന്ന ടോക്കണുകളെ അടിസ്ഥാനമാക്കിയാണോ എന്ന് ഉറപ്പുവരുത്തുക. മറുപടി അപൂർണ്ണമാണെങ്കിൽ പോലും, max length ലിമിറ്റിൽ എത്തുന്ന ഒരു റിക്വസ്റ്റിന് നിങ്ങൾ പണം നൽകേണ്ടി വരും.
നിങ്ങൾ Novita അല്ലെങ്കിൽ StreamLake വഴി fine-tuned ചെയ്തതോ പ്രൈവറ്റ് എൻഡ്പോയിന്റുകളോ ആണ് ഉപയോഗിക്കുന്നതെങ്കിൽ, inference ഫീസിനൊപ്പം ഹോസ്റ്റിംഗ് ഫീസിലും മാറ്റം വന്നിട്ടുണ്ടോ എന്ന് പരിശോധിക്കുക. ഇടയ്ക്കിടെ മാത്രം ഉപയോഗിക്കുന്ന വർക്ക്ലോഡുകൾ ആണെങ്കിൽ, storage, cold-start ചിലവുകൾ ടോക്കൺ നിരക്കിനേക്കാൾ കൂടുതലായേക്കാം.
കരുത്തുറ്റ ഒരു AI ബജറ്റ് നിർമ്മിക്കുക
ഒരു സേവനദാതാവും നിങ്ങളുടെ മുഴുവൻ inference ബജറ്റും നിയന്ത്രിക്കുന്ന അവസ്ഥ ഉണ്ടാകരുത്. വില മാറ്റങ്ങൾ അടിയന്തര സാഹചര്യങ്ങളായല്ല, മറിച്ച് സാധാരണമായ കാര്യങ്ങളായി കാണുന്ന രീതിയിൽ സിസ്റ്റങ്ങൾ നിർമ്മിക്കുക എന്നതാണ് ലക്ഷ്യം. നിങ്ങളുടെ latency, കൃത്യത എന്നിവയ്ക്ക് അനുയോജ്യമായ മറ്റ് മോഡലുകളുടെ ഒരു പട്ടിക എപ്പോഴും തയ്യാറാക്കി വെക്കുക. ബിസിനസ് ലോജിക് മാറ്റാതെ തന്നെ എൻഡ്പോയിന്റുകൾ മാറാൻ പാകത്തിൽ കോഡ്ബേസിൽ ലഘുവായ abstraction layers നിലനിർത്തുക.
ചിലവ് മാത്രമാണ് ഒരു ഘടകം എന്നല്ല. Latency, availability, context-window size എന്നിവയും പ്രധാനമാണ്. എന്നാൽ മുന്നറിയിപ്പില്ലാതെ മാറുന്ന ഘടകം വിലയാണ്. Novita, StreamLake എന്നിവയെ സ്ഥിരമായ സേവനങ്ങളായല്ല, മറിച്ച് dynamic marketplaces ആയി കാണുന്നതിലൂടെ നിങ്ങൾക്ക് മുൻതൂക്കം ലഭിക്കും.
യഥാർത്ഥ പാഠം
അളക്കാൻ കഴിയാത്ത ഒന്നിനെ നിങ്ങൾക്ക് ഒപ്റ്റിമൈസ് ചെയ്യാൻ കഴിയില്ല. Novita, StreamLake എന്നിവ പുതിയ നിരക്കുകൾ അവതരിപ്പിച്ചിട്ടുണ്ട്. വിശദാംശങ്ങൾ ഇവിടെ പരിശോധിക്കുക, പുതുക്കിയ ചിലവുകൾക്കനുസരിച്ച് കണക്കുകൾ വീണ്ടും പരിശോധിക്കുക, നിങ്ങളുടെ നിലവിലെ സ്റ്റാക്ക് സാമ്പത്തികമായി ലാഭകരമാണോ എന്ന് തീരുമാനിക്കുക. ഓഡിറ്റിംഗിനായി നിങ്ങൾ ചിലവഴിക്കുന്ന കുറച്ച് മണിക്കൂറുകൾ ഭാവിയിൽ ഫിനാൻസ് വിഭാഗവുമായി വലിയ തർക്കങ്ങൾ ഒഴിവാക്കാൻ സഹായിക്കും.
ഇൻഫറൻസ് ചിലവുകൾ നിരീക്ഷിക്കുന്ന മറ്റ് ഡെവലപ്പർമാരുമായി ആശയവിനിമയം നടത്താൻ ആഗ്രഹിക്കുന്നുണ്ടെങ്കിൽ, തന്ത്രങ്ങൾ താരതമ്യം ചെയ്യാൻ GyaanSetu learning community ഒരു നല്ല ഇടമാണ്. വില മാറ്റങ്ങൾ നിങ്ങളെ അപ്രതീക്ഷിതമായി ബാധിക്കുമ്പോൾ മാത്രമാണ് അത് ബുദ്ധിമുട്ടാകുന്നത്.
