Microsoft, Azure API Management (APIM)-ൽ ഒരു പ്രത്യേക AI Gateway tier ചേർത്തിരിക്കുന്നു. LLM കോളുകളെ വെറുമൊരു API എൻഡ്പോയിന്റ് ആയിട്ടല്ല, മറിച്ച് ഒരു പ്രത്യേക വർക്ക്ലോഡ് ആയിട്ടാണ് ഇനി പരിഗണിക്കുന്നത് എന്നതിന്റെ സൂചനയാണിത്.

എന്തുകൊണ്ടാണ് LLM ട്രാഫിക് സാധാരണ ഗേറ്റവേകളെ തകിടം മറിക്കുന്നത്

ഒരു പ്രോംപ്റ്റിന് മറ്റൊന്നിനേക്കാൾ നൂറിരട്ടി ചിലവ് വന്നേക്കാം, എങ്കിലും ഒരു സാധാരണ API ഗേറ്റവേ ഇവ രണ്ടിനെയും ഒരൊറ്റ റിക്വസ്റ്റ് ആയിട്ടാണ് കാണുന്നത്. ഗേറ്റവേ കണക്കാക്കുന്നത് കോളുകളുടെ എണ്ണമാണ്, മോഡൽ പ്രോസസ്സ് ചെയ്യുന്ന ടോക്കണുകളുടെ എണ്ണമല്ല. കുറച്ച് നൂറ് ടോക്കണുകൾ മാത്രം അയക്കുന്ന ഒരു റിക്വസ്റ്റും ആയിരക്കണക്കിന് ടോക്കണുകൾ അയക്കുന്ന ഒരു റിക്വസ്റ്റും ഒരേ റിക്വസ്റ്റ്-കൗണ്ട് മെട്രിക്സ് ആണ് നൽകുന്നത്, എന്നാൽ രണ്ടാമത്തേതിന് ഇതിനേക്കാൾ എത്രയോ മടങ്ങ് ചിലവ് വന്നേക്കാം.

AI-യുടെ കാര്യത്തിൽ റിക്വസ്റ്റ് അടിസ്ഥാനമാക്കിയുള്ള പരിധികൾ (limits) ഉപയോഗശൂന്യമാക്കുന്ന നാല് വസ്തുതകൾ ഇവയാണ്:

  • ചിലവ് ≠ റിക്വസ്റ്റ് എണ്ണം. ബില്ലിംഗ് ടോക്കണുകളെ അടിസ്ഥാനമാക്കിയുള്ളതാണ്, നിങ്ങൾ എത്ര HTTP കോളുകൾ ചെയ്യുന്നു എന്നതിനല്ല.
  • ടോക്കൺ അളവ് വലിയ വ്യത്യാസങ്ങൾ കാണിക്കുന്നു. ഒരു ക്വറി ഒരു ചെറിയ ചോദ്യമാകാം; മറ്റൊന്ന് ഒരു വലിയ ഡോക്യുമെന്റ് ഉൾപ്പെട്ടതാകാം.
  • മോഡൽ തിരഞ്ഞെടുക്കുന്നത് വിലയെ ബാധിക്കുന്നു. വ്യത്യസ്ത LLM-കൾ ഓരോ ടോക്കണിനും വ്യത്യസ്ത നിരക്കുകളാണ് ഈടാക്കുന്നത്.
  • സ്ട്രീമിംഗ് അവസാന ബില്ല് മറച്ചുവെക്കുന്നു. റെസ്പോൺസുകൾ സ്ട്രീം ചെയ്യുമ്പോൾ, സ്ട്രീമിംഗ് അവസാനിക്കുന്നത് വരെ ആകെ ടോക്കൺ എണ്ണം അറിയാൻ കഴിയില്ല.

നിങ്ങൾ റിക്വസ്റ്റുകൾ മാത്രം അളന്നുകൊണ്ടിരിക്കുകയാണെങ്കിൽ, യഥാർത്ഥ ചിലവിനെക്കുറിച്ച് യാതൊരു വിവരവും നൽകുന്നില്ലാത്ത മോണിറ്ററിംഗ് ഡാറ്റ മാത്രമേ നിങ്ങൾക്ക് ലഭിക്കൂ.

AI Gateway tier എന്താണ് മാറ്റുന്നത്

ടോക്കൺ ഉപയോഗം നിയന്ത്രിക്കുന്നതിന് ആവശ്യമായ മിക്ക പോളിസികളും നിലവിൽ സ്റ്റാൻഡേർഡ് APIM ടയറുകളിൽ ലഭ്യമാണ്—ഇവ XML റൂളുകളായി എഴുതപ്പെട്ടവയും കസ്റ്റം ഡാഷ്‌ബോർഡുകളിൽ പ്രദർശിപ്പിക്കപ്പെട്ടവയുമാണ്. AI ടയർ ഈ കഴിവുകളെ ഒരു പ്രത്യേക ആവശ്യത്തിനായി രൂപകൽപ്പന ചെയ്ത അനുഭവമാക്കി മാറ്റുന്നു:

  • AI ട്രാഫിക്കിനായി സ്കെയിലിംഗ് ഐസൊലേഷൻ (Isolation of scaling).
  • കസ്റ്റം XML പോളിസികൾ നിർമ്മിക്കേണ്ട ആവശ്യം ഇല്ലാതാക്കുന്ന ലളിതമായ കോൺഫിഗറേഷൻ.

ഇതിലെ പ്രധാന മാറ്റം പ്രവർത്തനപരമാണ് (operational): ടോക്കൺ ബജറ്റുകൾ നടപ്പിലാക്കാൻ ഇനി നിങ്ങൾക്ക് സങ്കീർണ്ണമായ കോഡുകൾ എഴുതുകയോ പ്രത്യേക ഡാഷ്‌ബോർഡുകൾ പരിപാലിക്കുകയോ ചെയ്യേണ്ടതില്ല. ഈ നിയന്ത്രണങ്ങൾക്കായി ഈ ടയർ ഒരു റെഡിമെയ്ഡ് ഇന്റർഫേസ് നൽകുന്നു.

എപ്പോൾ മാറണം – ട്രാഫിക് അടിസ്ഥാനമാക്കിയുള്ള ഒരു ഗൈഡ്

  • AI നിങ്ങളുടെ ട്രാഫിക്കിന്റെ ഒരു ചെറിയ ഭാഗം മാത്രമാണെങ്കിൽ. നിലവിലുള്ള APIM ടയർ തന്നെ ഉപയോഗിക്കുക, കൂടുതൽ കൃത്യമായ നിയന്ത്രണം ആവശ്യമാണെങ്കിൽ ടോക്കൺ പോളിസികൾ ചേർക്കുക.
  • AI നിങ്ങളുടെ കോളുകളിൽ പ്രധാന പങ്കുവഹിക്കുന്നുണ്ടെങ്കിൽ. സ്കെയിലിംഗ് ഐസൊലേറ്റ് ചെയ്യാനും ചിലവ് നിയന്ത്രണം (cost governance) കൃത്യമായി നിലനിർത്താനും AI ടയറിലേക്ക് മാറുന്നതാണ് നല്ലത്.
  • എഞ്ചിനീയറിംഗ് ജോലിഭാരം ഒഴിവാക്കാൻ ആഗ്രഹിക്കുന്നുണ്ടെങ്കിൽ. കസ്റ്റം പോളിസികൾ നിർമ്മിക്കാനും പരിപാലിക്കാനും ചെലവാകുന്ന സമയം ഈ ടയറിലെ ഇൻബിൽറ്റ് ടൂളുകൾ ഒഴിവാക്കുന്നു.

ഏറ്റവും വലിയ ചിലവ് സബ്‌സ്‌ക്രിപ്ഷൻ വിലയല്ല; മറിച്ച് ഒരു ജനറൽ ഗേറ്റവേയെ ടോക്കൺ ഇക്കണോമിക്സ് മനസ്സിലാക്കാൻ പാകത്തിൽ മാറ്റിയെടുക്കാൻ ചെലവാകുന്ന എഞ്ചിനീയറിംഗ് സമയമാണ്.

പ്രിവ്യൂ ഘട്ടത്തിനായുള്ള പ്ലേബുക്ക് (Playbook)

Microsoft നിലവിൽ AI ടയർ പ്രിവ്യൂ ഘട്ടത്തിലാണ് നൽകുന്നത്. ഇതിനെ ഒരു ടെസ്റ്റ് ബെഡ് ആയി മാത്രം കാണുക, പ്രൊഡക്ഷൻ ലോഞ്ച് ആയിട്ടല്ല.

  1. കൂടുതൽ വോളിയമുള്ള ഒരു ഇന്റേണൽ AI വർക്ക്ലോഡ് തിരഞ്ഞെടുക്കുക. ഏറ്റവും കൂടുതൽ ടോക്കൺ ട്രാഫിക് ഉണ്ടാക്കുന്ന സർവീസ് തിരഞ്ഞെടുക്കുക.
  2. ആ വർക്ക്ലോഡ് AI ടയറിലൂടെ റൂട്ട് ചെയ്യുക. ഓരോ ഉപഭോക്താവിന്റെയും (consumer) ടോക്കൺ ഉപയോഗം മനസ്സിലാക്കാൻ പുതിയ കോൺഫിഗറേഷൻ ഉപയോഗിക്കുക.
  3. കുറച്ച് ആഴ്ചത്തേക്ക് ടോക്കൺ ചിലവ് വിവരങ്ങൾ ശേഖരിക്കുക. നിലവിലുള്ള മോണിറ്ററിംഗുമായി ടോക്കൺ എണ്ണവും അതുമായി ബന്ധപ്പെട്ട ചിലവുകളും താരതമ്യം ചെയ്യുക.
  4. ബജറ്റിംഗിനായി ഈ അടിസ്ഥാന വിവരങ്ങൾ ഉപയോഗിക്കുക. ഈ ടയറിന്റെ ചിലവ് നിയന്ത്രണ ഗുണങ്ങൾ അതിന്റെ പ്രിവ്യൂ ഘട്ടത്തിലെ പരിമിതികളേക്കാൾ വലുതാണോ എന്ന് തീരുമാനിക്കുക.

ഇത് ജനറൽ അവൈലബിലിറ്റിയിലേക്ക് (general availability) മാറുന്നതുവരെ നിർണ്ണായകമായ പ്രൊഡക്ഷൻ വർക്ക്ലോഡുകൾ പ്രിവ്യൂ സർവീസിലേക്ക് മാറ്റരുത്.

മറ്റൊരു വശം: എല്ലാവർക്കും ഒരു പ്രത്യേക ടയർ ആവശ്യമില്ലായിരിക്കാം

നിങ്ങളുടെ സ്ഥാപനം ഇടയ്ക്കിടെ മാത്രമേ LLM-ലേക്ക് കോളുകൾ നടത്തുന്നുള്ളൂ എങ്കിൽ, AI ടയറിന്റെ അധിക ചിലവ് അർഹിച്ചതാകില്ല. നിലവിലുള്ള പോളിസി ഫ്രെയിംവർക്ക് ഉപയോഗിച്ച് കൂടുതൽ മാനുവൽ പരിശ്രമത്തിലൂടെ ടോക്കൺ ലെവൽ ഗവേണൻസ് കൈവരിക്കാൻ നിങ്ങൾക്ക് സാധിക്കും. എന്നാൽ AI ട്രാഫിക് നിങ്ങളുടെ API-യുടെ വലിയൊരു ഭാഗമായി മാറുന്ന സാഹചര്യത്തിലാണ് ഈ ടയർ കൂടുതൽ പ്രയോജനപ്പെടുന്നത്.

ചുരുക്കത്തിൽ

പരമ്പരാഗത API കോളുകളിൽ നിന്ന് LLM ട്രാഫിക് അടിസ്ഥാനപരമായി വ്യത്യസ്തമായി പെരുമാറുന്നു എന്ന വസ്തുത AI Gateway tier അംഗീകരിക്കുന്നു. റിക്വസ്റ്റ് എണ്ണുന്ന രീതിയിൽ നിന്ന് ടോക്കൺ അടിസ്ഥാനമാക്കിയുള്ള നിയന്ത്രണത്തിലേക്ക് മാറുന്നതിലൂടെ, സങ്കീർണ്ണമായ കോഡുകളിൽ കുടുങ്ങിക്കിടക്കാതെ തന്നെ AI ചിലവ് നിയന്ത്രിക്കാൻ ഡെവലപ്പർമാർക്ക് ഇത് പ്രായോഗികമായ ഒരു മാർഗ്ഗം നൽകുന്നു. AI ഉപയോഗം നിലവിൽ കൂടുതലുള്ള അല്ലെങ്കിൽ ഭാവിയിൽ വർദ്ധിക്കാൻ സാധ്യതയുള്ള ടീമുകൾക്ക്, ഇപ്പോൾ തന്നെ പ്രിവ്യൂ പരീക്ഷിച്ചു നോക്കുന്നത് ടോക്കൺ ചിലവിന്റെ ഒരു അടിസ്ഥാന വിവരങ്ങൾ (baseline) തയ്യാറാക്കാൻ സഹായിക്കും.