AWS, Amazon SageMaker Inference-ലേക്ക് “prefix-aware routing” എന്ന ഓപ്ഷൻ ചേർത്തു. സ്വന്തം ഇൻഫ്രാസ്ട്രക്ചറിൽ ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ (LLMs) പ്രവർത്തിപ്പിക്കുന്ന ഉപഭോക്താക്കൾക്ക് ഉയർന്ന കാഷെ-ഹിറ്റ് നിരക്കും (cache-hit rates) ശ്രദ്ധേയമായ രീതിയിൽ കുറഞ്ഞ ലേറ്റൻസിയും (latency) ഇത് വാഗ്ദാനം ചെയ്യുന്നു. ലേറ്റൻസി കുറയ്ക്കുന്നതിനും GPU കമ്പ്യൂട്ട് ചിലവുകൾ കുറയ്ക്കുന്നതിനും ഈ മാറ്റം സഹായിക്കുന്നു.

എന്തുകൊണ്ടാണ് LLM ലേറ്റൻസി പ്രധാനമാകുന്നത്

ഒരു LLM ഒരു റിക്വസ്റ്റ് സ്വീകരിക്കുമ്പോൾ, സാധാരണയായി അത് പ്രോംപ്റ്റിലെ മുഴുവൻ ഭാഗവും വീണ്ടും കമ്പ്യൂട്ട് ചെയ്യുന്നു—ഓരോ ടോക്കൺ കൂടുമ്പോഴും ഈ പ്രക്രിയ കൂടുതൽ ചിലവേറിയതാകുന്നു. മുമ്പത്തെ റിക്വസ്റ്റിൽ നിന്നുള്ള അറ്റൻഷൻ കാഷെ (attention cache) വീണ്ടും ഉപയോഗിക്കാൻ സാധിച്ചാൽ, ടെക്സ്റ്റിലെ പുതിയ ഭാഗം മാത്രം പ്രോസസ്സ് ചെയ്താൽ മതിയാകും. ഒരേ സിസ്റ്റം പ്രോംപ്റ്റ് ആവർത്തിച്ച് ഉപയോഗിക്കുന്നതോ അല്ലെങ്കിൽ സംഭാഷണ ചരിത്രം (conversation history) നിലനിർത്തുന്നതോ ആയ വർക്ക് ലോഡുകൾ കാഷെ പുനരുപയോഗത്തിന് ഏറ്റവും അനുയോജ്യമാണ്.

ഡിഫോൾട്ട് SageMaker സെറ്റപ്പിൽ, വരുന്ന റിക്വസ്റ്റുകൾ ഇൻഫറൻസ് ഇൻസ്റ്റൻസുകളിലേക്ക് ക്രമരഹിതമായി (randomly) വിതരണം ചെയ്യപ്പെടുന്നു. ഇതിനർത്ഥം, ഒരു വാം കാഷെയിൽ (warm cache) ലഭ്യമാകുമായിരുന്ന റിക്വസ്റ്റ് പലപ്പോഴും ഒരു കോൾഡ് ഇൻസ്റ്റൻസിലേക്ക് (cold instance) എത്തിയേക്കാം, ഇത് മുഴുവൻ പ്രക്രിയയും വീണ്ടും ചെയ്യേണ്ടി വരുന്ന അവസ്ഥയുണ്ടാക്കുന്നു. ഇതിന്റെ ഫലമായി ഉയർന്ന ലേറ്റൻസിയും അധിക GPU സൈക്കിളുകളും ആവശ്യമായി വരികയും അത് നേരിട്ട് ചിലവ് വർദ്ധിപ്പിക്കുകയും ചെയ്യുന്നു.

എങ്ങനെയാണ് prefix-aware routing പ്രവർത്തിക്കുന്നത്

പുതിയ റൂട്ടിംഗ് മോഡ്, സമീപകാല റിക്വസ്റ്റ് പ്രിഫിക്സുകളുടെ (request prefixes) ഒരു ഭാരം കുറഞ്ഞ മാപ്പ് സൂക്ഷിക്കുന്നു—അതായത്, ഓരോ തവണയും മാറാതെ നിൽക്കുന്ന പ്രോംപ്റ്റിന്റെ ആദ്യ ഭാഗം. ഒരു പുതിയ റിക്വസ്റ്റ് വരുമ്പോൾ, SageMaker ഈ മാപ്പ് പരിശോധിക്കുകയും അതേ പ്രിഫിക്സ് നേരത്തെ പ്രോസസ്സ് ചെയ്ത ഒരു ഇൻസ്റ്റൻസിലേക്ക് റിക്വസ്റ്റ് കൈമാറുകയും ചെയ്യുന്നു. ആ ഇൻസ്റ്റൻസിൽ അറ്റൻഷൻ കാഷെ ലഭ്യമാണെങ്കിൽ, മോഡലിന് വലിയൊരു ഭാഗം ജോലി ഒഴിവാക്കി വേഗത്തിൽ ഉത്തരം നൽകാൻ കഴിയും.

പ്രധാന പോയിന്റുകൾ:

  • കോഡ് മാറ്റങ്ങൾ ആവശ്യമില്ല – ഈ ഫീച്ചർ പൂർണ്ണമായും ഇൻഫറൻസ് സർവീസ് ലെയറിൽ പ്രവർത്തിക്കുന്നു.
  • സെൽഫ്-ഹോസ്റ്റഡ് മോഡലുകൾക്ക് മാത്രം ബാധകം – OpenAI-യുടെ API അല്ലെങ്കിൽ Anthropic-ന്റെ സർവീസ് പോലുള്ള മാനേജ്ഡ് ഓഫറിംഗുകളെ ഇത് ബാധിക്കില്ല.
  • ആപ്ലിക്കേഷനുകൾക്ക് തടസ്സമില്ലാത്തത് – ഒരേ SageMaker എൻഡ്പോയിന്റ് URL-ഉം API കോൺട്രാക്റ്റും തന്നെ നിലനിൽക്കും.

ആർക്കൊക്കെ ഇതിന്റെ ഗുണം ലഭിക്കും

ഡാറ്റാ പ്രൈവസി മുതൽ ചിലവ് നിയന്ത്രണം വരെയുള്ള കാരണങ്ങളാൽ SageMaker-ൽ LLM ഹോസ്റ്റ് ചെയ്യുന്ന സംരംഭങ്ങൾക്ക് ഇത് ഗുണകരമാണ്. സപ്പോർട്ട് ചാറ്റ്ബോട്ടുകൾ, സെയിൽസ് അസിസ്റ്റന്റുകൾ, അല്ലെങ്കിൽ സ്ഥിരമായ ഒരു സിസ്റ്റം പ്രോംപ്റ്റ് ആവർത്തിച്ച് ഉപയോഗിക്കുന്ന ഏത് ഇന്ററാക്റ്റീവ് ഏജന്റുകൾക്കും ഈ റൂട്ടിംഗ് മാറ്റം ശരാശരി റെസ്പോൺസ് സമയം കുറയ്ക്കാൻ സഹായിക്കും. ചിലവ് കുറയ്ക്കുന്ന കാര്യമെടുത്താൽ, ഓരോ കാഷെ ഹിറ്റും പ്രോംപ്റ്റിന്റെ പൊതുവായ ഭാഗം വീണ്ടും വിലയിരുത്തുന്നതിൽ നിന്ന് GPU-വിനെ രക്ഷിക്കുന്നു.

പരിമിതികളും മറ്റ് വശങ്ങളും

ആവർത്തിച്ചുള്ള പ്രിഫിക്സുകൾ ഉണ്ടെങ്കിൽ മാത്രമേ ഈ ഗുണം ലഭിക്കുകയുള്ളൂ. ഒറ്റപ്പെട്ട ക്വറികൾ അല്ലെങ്കിൽ ഡൈനാമിക് ആയി നിർമ്മിക്കുന്ന സിസ്റ്റം മെസ്സേജുകൾ പോലുള്ള മാറിക്കൊണ്ടിരിക്കുന്ന പ്രോംപ്റ്റുകൾക്ക് ഈ കാഷെ-ഹിറ്റ് ഗുണം ലഭിക്കില്ല.

ഈ ഫീച്ചർ സെൽഫ്-ഹോസ്റ്റഡ് ഡിപ്ലോയ്‌മെന്റുകളിൽ മാത്രമായതിനാൽ, മാനേജ്ഡ് LLM സർവീസുകളെ ആശ്രയിക്കുന്ന ഉപഭോക്താക്കൾക്ക് ഇത് ഉപയോഗിക്കാൻ കഴിയില്ല.

ചുരുക്കത്തിൽ: പ്രിഫിക്സ്-അവയർ റൂട്ടിംഗ് SageMaker ഉപയോക്താക്കൾക്ക് കോഡ് മാറ്റങ്ങളില്ലാതെ തന്നെ ആവർത്തിച്ചുള്ള LLM വർക്ക് ലോഡുകളിൽ ലേറ്റൻസി കുറയ്ക്കാനും GPU ചിലവ് ലാഭിക്കാനും സഹായിക്കുന്നു. പ്ലാറ്റ്‌ഫോമിൽ നിലവിൽ മോഡലുകൾ ഹോസ്റ്റ് ചെയ്യുന്ന സ്ഥാപനങ്ങൾക്ക്, കുറഞ്ഞ റിസ്കുള്ള ഈ മാറ്റം വേഗത്തിലുള്ള യൂസർ ഇന്ററാക്ഷനും കുറഞ്ഞ ബില്ലും നൽകാൻ സഹായിക്കും.