LLM വില നിരക്കുകൾ നിരന്തരം മാറിക്കൊണ്ടിരിക്കുന്ന ഒന്നാണ്. ഒരു മാസം നിങ്ങളുടെ ഇൻഫറൻസ് ബജറ്റ് കൃത്യമായി പ്രവചിച്ചതുപോലെയായിരിക്കും; എന്നാൽ അടുത്ത മാസം, ഒരു പ്രൊവൈഡർ അതിന്റെ ടോക്കൺ നിരക്ക് മാറ്റിയാൽ, ഒരു അധിക റിക്വസ്റ്റ് പോലും ഇല്ലാതെ തന്നെ നിങ്ങളുടെ പ്രതിമാസ ചിലവ് മാറിക്കളയും. ഇപ്പോൾ സംഭവിച്ചതും ഇതുതന്നെയാണ്. GMICloud, Novita, StreamLake എന്നിവയെല്ലാം അവരുടെ മോഡൽ വിലകൾ പുതുക്കിയിരിക്കുന്നു. നിങ്ങൾ പ്രൊഡക്ഷൻ വർക്ക്ലോഡുകൾ അല്ലെങ്കിൽ പരീക്ഷണാടിസ്ഥാനത്തിലുള്ള പൈപ്പ്ലൈനുകൾ പോലും പ്രവർത്തിപ്പിക്കുന്നുണ്ടെങ്കിൽ, ഈ മാറ്റങ്ങൾ ഗൗരവമായി പരിശോധിക്കേണ്ടതുണ്ട്. വിപണി തകരുന്നതുകൊണ്ടല്ല ഇത്, മറിച്ച് ദിവസേന ദശലക്ഷക്കണക്കിന് ടോക്കണുകൾ പ്രോസസ്സ് ചെയ്യുമ്പോൾ ടോക്കൺ ഇക്കണോമിക്സിലെ ചെറിയ വ്യത്യാസങ്ങൾ പോലും വലിയ സാമ്പത്തിക ആഘാതം ഉണ്ടാക്കിയേക്കാം എന്നതുകൊണ്ടാണ്.
ഈ സേവനദാതാക്കൾ ആരാണ്
AI ഇൻഫ്രാസ്ട്രക്ചർ സ്റ്റാക്കിൽ GMICloud, Novita, StreamLake എന്നിവ ഓരോന്നും വ്യത്യസ്തമായ പങ്കുവഹിക്കുന്നുണ്ടെങ്കിലും, ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLM) പ്രവർത്തിപ്പിക്കുന്നതിനുള്ള ചിലവിന്റെ കാര്യത്തിൽ അവർ ഇപ്പോൾ നേരിട്ട് മത്സരിക്കുന്നു.
സ്വന്തമായി ക്ലസ്റ്ററുകൾ മാനേജ് ചെയ്യാതെ തന്നെ API ആക്സസ് ആഗ്രഹിക്കുന്ന ഡെവലപ്പർമാർക്കായി GMICloud ഒരു ഹൈ-പെർഫോമൻസ് GPU ക്ലൗഡ് പ്രവർത്തിപ്പിക്കുകയും വളർന്നുവരുന്ന ഹോസ്റ്റഡ് LLM കാറ്റലോഗ് വാഗ്ദാനം ചെയ്യുകയും ചെയ്യുന്നു. കുറഞ്ഞ ചിലവിൽ GPU വാടകയ്ക്കും മോഡൽ സർവിംഗിനും പേരുകേട്ട Novita, വലിയ ഹൈപ്പർസ്കെയിലർമാർ ഈടാക്കുന്ന ഉയർന്ന നിരക്കുകൾക്ക് പകരം കുറഞ്ഞ നിരക്കിൽ ഓപ്പൺ-വെയ്റ്റ് മോഡലുകൾ ഉപയോഗിക്കാൻ ആഗ്രഹിക്കുന്ന എഞ്ചിനീയർമാരെ ആകർഷിക്കുന്നു. ByteDance-ന്റെ ക്ലൗഡ്, മീഡിയ ഇക്കോസിസ്റ്റത്തിൽ നിന്ന് വളർന്നുവന്ന StreamLake, വീഡിയോ ഇൻഫ്രാസ്ട്രക്ചർ വൈദഗ്ധ്യം ഇൻഫറൻസ് രംഗത്തേക്ക് കൊണ്ടുവരുന്നു, കൂടാതെ കനത്ത മീഡിയ പ്രോസസ്സിംഗ് വർക്ക്ലോഡുകൾ കൈകാര്യം ചെയ്യുന്ന ഒരു പ്ലാറ്റ്ഫോമിലൂടെ മോഡലുകൾ സേവിക്കുകയും ചെയ്യുന്നു.
OpenAI അല്ലെങ്കിൽ Anthropic പോലെ ഇവർ എല്ലാവർക്കും അറിയപ്പെടുന്ന പേരുകളല്ല. അതുകൊണ്ടാണ് ഇവരുടെ വില മാറ്റങ്ങൾ ഇത്ര പ്രധാനമാകുന്നത്. വിപണിയുടെ മത്സരബുദ്ധിയുള്ള മിഡിൽ ടയറിൽ (middle tier) ആണ് ഇവർ പ്രവർത്തിക്കുന്നത്; ഇവിടെ ലാഭവിഹിതം കുറവാണ്, ഡിസ്കൗണ്ടുകൾ സാധാരണമാണ്, ഡെവലപ്പർമാരെ ആകർഷിക്കാനുള്ള മത്സരം നിരന്തരം നിലനിൽക്കുന്നു. ഈ വിഭാഗത്തിലെ മൂന്ന് പ്ലാറ്റ്ഫോമുകൾ ഏകദേശം ഒരേ സമയത്ത് തന്നെ തങ്ങളുടെ നിരക്കുകൾ മാറ്റുമ്പോൾ, ഓപ്പൺ സോഴ്സ് അല്ലെങ്കിൽ ഫൈൻ ട്യൂൺ ചെയ്ത മോഡലുകൾ പ്രവർത്തിപ്പിക്കാൻ എത്ര ചിലവ് വരണം എന്നതിന്റെ മാനദണ്ഡം അവർ ഒരുമിച്ച് പുനർനിർണ്ണയിക്കുന്നു.
എന്താണ് മാറിയത്
ഈ അപ്ഡേറ്റുകൾ മൂന്ന് സേവനങ്ങളിലെയും LLM ഉപയോഗത്തിനുള്ള വിലയെ ബാധിച്ചു. Dev.to-ൽ narevbot എന്ന പേരിൽ എഴുതിയ നരേൻ (Naren), GMICloud, Novita, StreamLake എന്നിവയുടെ ഓരോ മോഡലിലുമുള്ള കൃത്യമായ മാറ്റങ്ങൾ വിവരിച്ചുകൊണ്ട് ഒരു പോസ്റ്റ് എഴുതിയിട്ടുണ്ട്. നിങ്ങൾക്ക് പൂർണ്ണമായ താരതമ്യം ഇവിടെ വായിക്കാം.
ഈ പാരഗ്രാഫ് വായിച്ചു തീർക്കുന്നതിന് മുൻപ് തന്നെ വീണ്ടും മാറാൻ സാധ്യതയുള്ള സെന്റ്-പെർ-ടോക്കൺ (cent-per-token) കണക്കുകൾ പറയുന്നതിനേക്കാൾ പ്രധാനം, ഈ മാറ്റങ്ങൾ ഘടനാപരമാണ് എന്നതാണ്. ഓരോ പ്രൊവൈഡറും ടോക്കണുകൾക്കായി ഈടാക്കുന്ന രീതി പുനർക്രമീകരിച്ചു, ചില സന്ദർഭങ്ങളിൽ ഈ മാറ്റങ്ങൾ ഒരു പ്രത്യേക വർക്ക്ലോഡിന് ഏത് മോഡലാണ് ഏറ്റവും ലാഭകരം എന്നത് മാറ്റിയേക്കാം. ഇത് വെറുമൊരു വില വർദ്ധനവോ കുറവോ മാത്രമല്ല. ഒരു പ്രൊവൈഡർ ഇൻപുട്ട് വില കുറയ്ക്കുകയും ഔട്ട്പുട്ട് വില കൂട്ടുകയും ചെയ്തേക്കാം. മറ്റൊരാൾ ചെറിയ പാരാമീറ്റർ മോഡലുകളുടെ നിരക്ക് മാറ്റാതെ തന്നെ ലോംഗ്-കോൺടെക്സ്റ്റ് എൻഡ്പോയിന്റുകളുടെ (long-context endpoints) നിരക്ക് വർദ്ധിപ്പിച്ചേക്കാം. മൂന്ന് പ്ലാറ്റ്ഫോമുകളും Llama, Qwen, Mistral തുടങ്ങി വിവിധ ആർക്കിടെക്ചറുകൾ പിന്തുണയ്ക്കുന്നതിനാൽ, ഈ മാറ്റം നിങ്ങൾക്ക് ഗുണകരമാണോ ദോഷകരമാണോ എന്നത് നിങ്ങൾ ഏത് API വഴിയാണ് ഏത് മോഡൽ റൗട്ട് ചെയ്യുന്നത് എന്നതിനെ ആശ്രയിച്ചിരിക്കും.
ട്രാഫിക് മാറുന്നില്ലെങ്കിലും ബില്ല് മാറുന്നത് എന്തുകൊണ്ട്
ഇതിന്റെ ആഘാതം മനസ്സിലാക്കാൻ LLM ബില്ലിംഗ് എങ്ങനെയാണ് പ്രവർത്തിക്കുന്നത് എന്ന് നോക്കാം. ഇൻപുട്ട് ടോക്കണുകൾക്കും ഔട്ട്പുട്ട് ടോക്കണുകൾക്കും നിങ്ങൾ എപ്പോഴും പ്രത്യേകം ചാർജ് ചെയ്യപ്പെടുന്നു, അവ തമ്മിലുള്ള അനുപാതമാണ് നിങ്ങളുടെ യഥാർത്ഥ ചിലവ് നിശ്ചയിക്കുന്നത്. ദിവസേന പതിനായിരം സംഭാഷണങ്ങൾ കൈകാര്യം ചെയ്യുന്ന ഒരു കസ്റ്റമർ സപ്പോർട്ട് ബോട്ട്, ഓരോ ചാറ്റിലും ശരാശരി രണ്ടായിരം ഇൻപുട്ട് ടോക്കണുകളും നാനൂറ് ഔട്ട്പുട്ട് ടോക്കണുകളും ഉപയോഗിക്കുന്നു എന്ന് കരുതുക. ഒരു ദശലക്ഷം ടോക്കണുകൾക്ക് മിശ്രിത നിരക്ക് മൂന്ന് ഡോളർ ആണെങ്കിൽ, അത് പ്രതിദിനം ഏകദേശം എൺപത്തിനാല് ഡോളർ വരും. ഒരു പ്രൊവൈഡർ ഔട്ട്പുട്ട് വില വെറും ഇരുപത് ശതമാനം മാത്രം വർദ്ധിപ്പിച്ചാൽ പോലും, പ്രതിദിന ചിലവ് തൊണ്ണൂറു ഡോളറിന് മുകളിലേക്ക് ഉയരും. ഒരു പാദത്തിൽ (quarter), ഒരേ ട്രാഫിക്കിനായി ഏകദേശം ആയിരം ഡോളർ അധികമായി ചിലവാക്കേണ്ടി വരും.
ഇത് മണിക്കൂറിൽ ദശലക്ഷക്കണക്കിന് ടോക്കണുകൾ കൈകാര്യം ചെയ്യുന്ന ഒരു കണ്ടന്റ് ജനറേഷൻ പൈപ്പ്ലൈനിലേക്കോ അല്ലെങ്കിൽ റിട്രീവൽ-ഓഗ്മെന്റഡ് ജനറേഷൻ (RAG) സിസ്റ്റത്തിലേക്കോ വ്യാപിപ്പിക്കുമ്പോൾ, നിങ്ങൾ തിരഞ്ഞെടുക്കുന്ന പ്രൊവൈഡർ നിങ്ങളുടെ വലിയൊരു ചിലവ് ആയി മാറും. GMICloud, Novita, StreamLake എന്നിവർക്ക് ഇത് അറിയാം. അവരുടെ വില മാറ്റങ്ങൾ പ്രത്യേക ഉപയോഗ കേസുകളെ (use cases) ലക്ഷ്യമിട്ടുള്ളവയാണ്: ഉയർന്ന അളവിലുള്ള ബാച്ച് ജോബുകൾ, കുറഞ്ഞ ലേറ്റൻസി ഉള്ള ചാറ്റ് ആപ്ലിക്കേഷനുകൾ, അല്ലെങ്കിൽ ലോംഗ്-കോൺടെക്സ്റ്റ് സമ്മറൈസേഷൻ ജോലികൾ എന്നിവ ഇതിൽ ഉൾപ്പെടുന്നു.
സങ്കീർണ്ണതകൾ മറ്റൊരു തലമാണ് കൂട്ടിച്ചേർക്കുന്നത്. ചില പ്ലാറ്റ്ഫോമുകൾ ഓരോ റിക്വസ്റ്റിനും മിനിമം ചാർജുകൾ, പ്രൊവിഷൻഡ് ത്രൂപുട്ടിന് (provisioned throughput) ഐഡിൽ ഫീസുകൾ, അല്ലെങ്കിൽ റേറ്റ്-ലിമിറ്റ് ബർസ്റ്റുകൾക്കായി സർചാർജുകൾ എന്നിവ ഈടാക്കുന്നുണ്ട്. മിനിമം റിക്വസ്റ്റ് ചാർജിലെ മാറ്റം ഉയർന്ന അളവിൽ ഉപയോഗിക്കുന്നവരേക്കാൾ കുറഞ്ഞ അളവിൽ ഉപയോഗിക്കുന്നവരെയാണ് കൂടുതൽ ബാധിക്കുന്നത്. ബാച്ച് ഇൻഫറൻസ് ഡിസ്കൗണ്ടുകളിലെ മാറ്റം നിങ്ങളുടെ രാത്രികാല റിപ്പോർട്ട് ജനറേഷൻ ചിലവ് കുറച്ചേക്കാം, എന്നാൽ നിങ്ങളുടെ റിയൽ ടൈം API ബില്ലിൽ മാറ്റം വരുത്തില്ലായിരിക്കാം. "അപ്ഡേറ്റ് ചെയ്ത വില" (updated pricing) എന്ന തലക്കെട്ട് വായിക്കുന്നത് മാത്രം പോരാ. നിങ്ങൾ അതിന്റെ വിശദമായ വിവരങ്ങൾ പരിശോധിക്കേണ്ടതുണ്ട്.
പരിഭ്രാന്തരാകാതെ എങ്ങനെ പ്രതികരിക്കാം
നിരക്കുകളിൽ മാറ്റം വരുമ്പോൾ, മിക്ക എഞ്ചിനീയറിംഗ് ടീമുകളും രണ്ട് തെറ്റുകളിൽ ഒന്ന് വരുത്താറുണ്ട്. അവർ ഒന്നുകിൽ ആ മാറ്റം അവഗണിക്കുകയും അധിക ചിലവ് നിശബ്ദമായി സഹിക്കുകയും ചെയ്യുന്നു, അല്ലെങ്കിൽ അവർ പരിഭ്രാന്തരാകുന്നു.
