Novita അടുത്തിടെ അതിന്റെ LLM നിരക്കുകളിൽ മാറ്റം വരുത്തിയിട്ടുണ്ട്. പ്ലാറ്റ്ഫോമിലൂടെ പ്രൊഡക്ഷൻ ഇൻഫറൻസ് (production inference) നടത്തുന്ന ടീമുകൾക്ക്, ഈ വാർത്ത നിലവിലെ ചിലവ് ഉടൻ തന്നെ പരിശോധിക്കേണ്ടതിന്റെ (audit) ആവശ്യകതയെ സൂചിപ്പിക്കുന്നു. API നിരക്കുകളിലെ മാറ്റങ്ങൾ സാധാരണയായി സൗകര്യപ്രദമായ സമയത്തല്ല വരുന്നത്; കൂടാതെ അവ ഒന്നിലധികം മോഡൽ തലങ്ങളിൽ (model tiers) ഒരേസമയം വരുമ്പോൾ, മാസാവസാന ചിലവിൽ പ്രതീക്ഷിച്ചതിലും വലിയ വ്യത്യാസം ഉണ്ടായേക്കാം.
ഇൻഫറൻസ് നിരക്കുകൾ നിങ്ങൾ ശ്രദ്ധിക്കേണ്ടത് എന്തുകൊണ്ട്
മിക്ക ആധുനിക AI ആപ്ലിക്കേഷനുകളും സ്വയം നിയന്ത്രിക്കുന്ന GPU ക്ലസ്റ്ററുകളിലല്ല നിർമ്മിച്ചിരിക്കുന്നത്. ഹാർഡ്വെയർ സജ്ജമാക്കുക, vLLM അല്ലെങ്കിൽ TGI വിന്യാസങ്ങൾ (deployments) കൈകാര്യം ചെയ്യുക, ട്രാഫിക് വർദ്ധനവിനനുസരിച്ച് കോൾഡ് സ്റ്റാർട്ടുകൾ (cold starts) നിയന്ത്രിക്കുക തുടങ്ങിയ സങ്കീർണ്ണതകൾ ഒഴിവാക്കാൻ ഡെവലപ്പർമാർ Novita പോലുള്ള ഇൻഫറൻസ് പ്രൊവൈഡർമാരെയാണ് ആശ്രയിക്കുന്നത്. ഈ സൗകര്യം വിലപ്പെട്ടതാണ്, എന്നാൽ അത് ഉപയോഗത്തിനനുസരിച്ച് പണം നൽകേണ്ടതുമാണ്. ഓരോ ടോക്കൺ ജനറേറ്റ് ചെയ്യുമ്പോഴും യൂസർ സെഷനുകൾ, ബാക്ക്ഗ്രൗണ്ട് ജോബുകൾ, ഇന്റേണൽ ടൂളുകൾ എന്നിവയിലൂടെ നിങ്ങളുടെ ബില്ല് വർദ്ധിച്ചുകൊണ്ടിരിക്കും.
ഒരു പ്രൊവൈഡർ അതിന്റെ നിരക്കുകളിൽ മാറ്റം വരുത്തുമ്പോൾ, അതിന്റെ ആഘാതം നിങ്ങളുടെ മുഴുവൻ സിസ്റ്റത്തിലും പ്രതിഫലിക്കും. ദിവസവും പതിനായിരം ഉപഭോക്തൃ സംഭാഷണങ്ങൾ കൈകാര്യം ചെയ്യുന്ന ഒരു ചാറ്റ്ബോട്ട് ഒരു ആഴ്ചയിൽ നാല് കോടി ഇൻപുട്ട് ടോക്കണുകളും ഒരു കോടി ഇരുപത് ലക്ഷം ഔട്ട്പുട്ട് ടോക്കണുകളും ഉപയോഗിച്ചേക്കാം. ഓരോ മില്യൺ ടോക്കണിനും വരുന്ന നിരക്കിൽ ഏതാനും ഡോളറുകൾ മാറ്റം വന്നാൽ പോലും, മാസാവസാന ചിലവിൽ വലിയ വ്യത്യാസം വരും. പരിമിതമായ ഫണ്ട് ഉപയോഗിച്ച് പ്രവർത്തിക്കുന്ന ഉൽപ്പന്നങ്ങൾക്കോ (bootstrapped products) കുറഞ്ഞ ലാഭത്തിൽ പ്രവർത്തിക്കുന്ന ടീമുകൾക്കോ ഈ വ്യത്യാസം ലാഭക്ഷമതയെ ബാധിച്ചേക്കാം. ഒരു ബ്രൗസർ എക്സ്റ്റൻഷനായി പ്രവർത്തിക്കുന്ന കോഡിംഗ് അസിസ്റ്റന്റ്, രാത്രികാലങ്ങളിൽ പ്രവർത്തിക്കുന്ന ബാച്ച് സമ്മറൈസേഷൻ പൈപ്പ്ലൈൻ, അല്ലെങ്കിൽ ഓരോ പേജ് ലോഡ് ചെയ്യുമ്പോഴും മോഡലിനെ ക്വറി ചെയ്യുന്ന ഇന്റേണൽ ലുക്കപ്പ് ടൂൾ എന്നിവയെല്ലാം ഒരേപോലെ ഇതിന്റെ ഇരകൾ ആണ്. അവയുടെ സാമ്പത്തിക ലാഭക്ഷമത (unit economics) അടുത്ത ടോക്കണിന്റെ കൃത്യമായ വിലയെ ആശ്രയിച്ചിരിക്കുന്നു.
Novita-യിൽ എന്താണ് മാറിയത്
Novita അതിന്റെ കാറ്റലോഗിലുള്ള വിവിധ മോഡലുകളെ ബാധിക്കുന്ന രീതിയിൽ പുതിയ നിരക്കുകൾ അവതരിപ്പിച്ചിട്ടുണ്ട്. കമ്പനി എല്ലാ മോഡലുകളിലും ഒരേ ശതമാനം വർദ്ധനവോ കുറവോ ആണ് വരുത്തിയിരിക്കുന്നത് എന്ന് പറയാനാവില്ല. പകരം, ഓരോ മോഡലിനും അനുസരിച്ച് നിരക്കുകളിൽ മാറ്റമുണ്ട്. അതായത്, നിങ്ങൾ ഉപയോഗിക്കുന്ന എൻഡ്പോയിന്റുകൾ (endpoints) അനുസരിച്ച് നിങ്ങളുടെ ബില്ലിൽ മാറ്റം വരും.
നിങ്ങളുടെ ആപ്ലിക്കേഷൻ എല്ലാ ട്രാഫിക്കും ഒരു ലാർജ് ലാംഗ്വേജ് മോഡലിലൂടെ (LLM) മാത്രമാണ് കൈകാര്യം ചെയ്യുന്നതെങ്കിൽ കണക്കുകൂട്ടലുകൾ ലളിതമാണ്. പഴയ നിരക്കും പുതിയ നിരക്കും താരതമ്യം ചെയ്ത് ലാഭമോ നഷ്ടമോ കണക്കാക്കാം. എന്നാൽ മിക്ക പ്രൊഡക്ഷൻ സെറ്റപ്പുകളും അല്പം സങ്കീർണ്ണമാണ്. ലളിതമായ ചോദ്യങ്ങൾ ലൈറ്റ് മോഡലുകളിലേക്കും (lighter models), സങ്കീർണ്ണമായ കാര്യങ്ങൾക്കായി ഹെവി മോഡലുകളിലേക്കും (heavyweights) അയക്കുന്ന രീതിയിലാണ് പല ടീമുകളും റൂട്ടിംഗ് ലോജിക് ക്രമീകരിച്ചിരിക്കുന്നത്. ചിലർ ലേറ്റൻസിയും (latency) ഗുണനിലവാരവും താരതമ്യം ചെയ്യാൻ ഒന്നിലധികം മോഡലുകളിൽ A/B ടെസ്റ്റുകൾ നടത്താറുണ്ട്. അത്തരം സാഹചര്യങ്ങളിൽ, ഒന്നോ രണ്ടോ മോഡലുകളിലെ വില വ്യത്യാസം നിങ്ങളുടെ മൊത്തത്തിലുള്ള ചിലവ് ഘടനയെ (cost structure) ബാധിച്ചേക്കാം.
ഓരോ ടോക്കണിനും ഓരോ റിക്വസ്റ്റിനും വരുന്ന കൃത്യമായ നിരക്കുകൾ Narevbot Dev.to-യിൽ പ്രസിദ്ധീകരിച്ചിട്ടുണ്ട്. നിങ്ങൾക്ക് കൃത്യമായ നിരക്കുകൾ ഇവിടെ പരിശോധിക്കാം: https://dev.to/narevbot/changes-to-llm-pricing-novita-3plc
നിങ്ങളുടെ ഓർമ്മയിലോ പഴയ സ്ക്രീൻഷോട്ടുകളിലോ മാത്രം വിശ്വസിക്കരുത്. അടുത്ത പാദത്തേക്കുള്ള (next quarter) പ്ലാനിംഗിന് മുൻപായി ആ സ്രോതസ്സിൽ നിന്ന് നേരിട്ട് പുതിയ കണക്കുകൾ ശേഖരിക്കുക.
നിങ്ങളുടെ ചിലവ് എങ്ങനെ പരിശോധിക്കാം (Audit)
ഊഹങ്ങൾക്കനുസരിച്ചല്ല, ഡാറ്റയുടെ അടിസ്ഥാനത്തിൽ തുടങ്ങുക. നിങ്ങളുടെ Novita ഡാഷ്ബോർഡിൽ ലോഗിൻ ചെയ്ത് കഴിഞ്ഞ രണ്ട് മൂന്ന് മാസത്തെ ഉപയോഗ ചരിത്രം (usage history) എക്സ്പോർട്ട് ചെയ്യുക. ഈ ഡാറ്റയെ മോഡലുകൾ തിരിഞ്ഞും പ്രവർത്തന രീതികൾ (operation type) തിരിഞ്ഞും തരംതിരിക്കുക. ഏത് എൻഡ്പോയിന്റുകളാണ് നിങ്ങളുടെ ബജറ്റിന്റെ ഭൂരിഭാഗവും ഉപയോഗിക്കുന്നത് എന്നും ഏതാണ് ഓരോ റിക്വസ്റ്റിലും കൂടുതൽ ടോക്കണുകൾ ഉപയോഗിക്കുന്നത് എന്നും നിങ്ങൾ മനസ്സിലാക്കണം.
ഈ പാറ്റേണുകൾ ശ്രദ്ധിക്കുക:
- Concentration risk (കേന്ദ്രീകൃത റിസ്ക്): നിങ്ങളുടെ ചിലവിന്റെ എഴുപത് ശതമാനവും ഒരു മോഡലിലൂടെയാണ് നടത്തുന്നതെങ്കിൽ, ആ മോഡലിന്റെ വില വർദ്ധിച്ചാൽ അത് വലിയ പ്രശ്നമാണ്. എന്നാൽ നിങ്ങളുടെ ചിലവ് എട്ട് മോഡലുകളിലായി വിഭജിക്കപ്പെട്ടിട്ടുണ്ടെങ്കിൽ കണക്കുകൂട്ടലുകൾക്ക് കൂടുതൽ സമയമെടുത്തേക്കാം, എങ്കിലും ആ റിസ്ക് നിലനിൽക്കുന്നുണ്ട്.
- Token bloat (അനാവശ്യ ടോക്കണുകൾ): നിങ്ങളുടെ പ്രോംപ്റ്റുകളിൽ അനാവശ്യമായ വിവരങ്ങൾ (context) ഉൾപ്പെടുന്നുണ്ടോ എന്ന് പരിശോധിക്കുക. നീളമുള്ള സിസ്റ്റം പ്രോംപ്റ്റുകൾ, ആവർത്തിച്ചുള്ള few-shot ഉദാഹരണങ്ങൾ, അമിതമായ XML ഫോർമാറ്റിംഗ് എന്നിവ ഇൻപുട്ട് ചിലവ് വർദ്ധിപ്പിക്കും. ഇത്തരം സാഹചര്യങ്ങളിൽ പ്രോംപ്റ്റുകൾ ചുരുക്കി ചിലവ് കുറയ്ക്കാൻ ഈ നിരക്ക് മാറ്റം ഒരു അവസരമാണ്.
- Output inefficiency (ഔട്ട്പുട്ട് കാര്യക്ഷമതയില്ലായ്മ): നിങ്ങളുടെ ആപ്ലിക്കേഷൻ നീളമുള്ള മറുപടികൾ ആവശ്യപ്പെടുകയും എന്നാൽ ആദ്യത്തെ ഏതാനും വാചകങ്ങൾ മാത്രം ഉപയോഗിക്കുകയും ചെയ്യുന്നുണ്ടെങ്കിൽ, നിങ്ങൾ ഉപയോഗിക്കാത്ത ടോക്കണുകൾക്കായി പണം നൽകുകയാണ് ചെയ്യുന്നത്. അതിനാൽ
max_tokenപരിധികളുംstop sequences-ഉം കൃത്യമായി ക്രമീകരിക്കുക. - Idle background jobs (അനാവശ്യ ബാക്ക്ഗ്രൗണ്ട് ജോബുകൾ): റിപ്പോർട്ടുകൾ തയ്യാറാക്കുന്നതോ ഡോക്യുമെന്റുകൾ എംബെഡ് (embed) ചെയ്യുന്നതോ ആയ ഷെഡ്യൂൾ ചെയ്ത ജോബുകൾ ആവശ്യമില്ലാത്ത രീതിയിൽ ഇടയ്ക്കിടെ നടക്കുന്നുണ്ടോ എന്ന് പരിശോധിക്കുക. ക്രോൺ ഷെഡ്യൂളും (cron schedule) ബാച്ച് സൈസും (batch size) പരിശോധിക്കുക.
