AWS, Amazon SageMaker Inference-இல் “prefix-aware routing” என்ற புதிய விருப்பத்தைச் சேர்த்துள்ளது. இது பெரிய மொழி மாதிரிகளை (LLMs) தங்கள் சொந்த உள்கட்டமைப்பில் இயக்கும் வாடிக்கையாளர்களுக்கு அதிக cache-hit விகிதங்களையும், குறிப்பிடத்தக்க அளவு குறைவான தாமதத்தையும் (latency) வழங்கும் என்று உறுதியளிக்கிறது. இந்த மாற்றம் முக்கியமானது, ஏனெனில் இது தாமதத்தைக் குறைப்பதோடு GPU கணக்கீட்டுச் செலவுகளையும் குறைக்கிறது.

LLM தாமதம் ஏன் முக்கியமானது

ஒரு LLM ஒரு கோரிக்கையைப் பெறும்போது, அது வழக்கமாக முழு prompt மீதும் attention-ஐ மீண்டும் கணக்கிடுகிறது—இது ஒவ்வொரு டோக்கன் (token) சேர்க்கப்படும் போதும் அதிகரிக்கும் ஒரு செலவு மிகுந்த நிலையாகும். முந்தைய கோரிக்கையிலிருந்து attention cache-ஐ மீண்டும் பயன்படுத்த முடிந்தால், புதிய உரையின் ஒரு பகுதியை மட்டும் அது செயலாக்க வேண்டியிருக்கும். ஒரே system prompt-ஐத் திரும்பத் திரும்ப அனுப்பும் அல்லது உரையாடல் வரலாற்றைப் பராமரிக்கும் பணிச்சுமைகள் (workloads), cache மறுபயன்பாட்டிற்குச் சிறந்த தேர்வாகும்.

இயல்பான SageMaker அமைப்பில், வரும் கோரிக்கைகள் inference instances தொகுப்பிற்குள் சீரற்ற முறையில் (randomly) விநியோகிக்கப்படுகின்றன. சீரற்ற விநியோகம் என்பது, ஒரு warm cache-ஐப் பயன்படுத்தக்கூடிய கோரிக்கை பெரும்பாலும் ஒரு cold instance-க்குச் சென்றுவிடும் என்பதைக் குறிக்கிறது, இது முழுமையான மறுகணக்கீட்டிற்கு (recomputation) வழிவகுக்கிறது. இதன் விளைவாக அதிக தாமதமும், கூடுதல் GPU சுழற்சிகளும் ஏற்படுகின்றன, இது நேரடியாக அதிக செலவாக மாறுகிறது.

prefix-aware routing எவ்வாறு செயல்படுகிறது

புதிய routing முறை, சமீபத்திய கோரிக்கை முன்னொட்டுகளின் (request prefixes) ஒரு லேசான வரைபடத்தை (lightweight map) வைத்திருக்கும்—அதாவது, அழைப்புகள் முழுவதும் மாறாமல் இருக்கும் prompt-இன் முதல் பகுதி. ஒரு புதிய கோரிக்கை வரும்போது, SageMaker அந்த வரைபடத்தைச் சரிபார்த்து, ஏற்கனவே அதே முன்னொட்டைச் செயலாக்கிய ஒரு instance-க்கு அந்தக் கோரிக்கையை அனுப்பும். அந்த instance இன்னும் தொடர்புடைய attention cache-ஐ வைத்திருந்தால், மாடல் பெரும்பாலான வேலையைத் தவிர்த்துவிட்டு பதிலைத் வேகமாக உருவாக்க முடியும்.

முக்கிய அம்சங்கள்:

  • குறியீடு மாற்றங்கள் தேவையில்லை – இந்த அம்சம் முழுமையாக inference service அடுக்கிலேயே உள்ளது.
  • சுய-வழங்கப்பட்ட (self-hosted) மாடல்களுக்கு மட்டுமே பொருந்தும் – OpenAI-இன் API அல்லது Anthropic-இன் சேவை போன்ற நிர்வகிக்கப்படும் (managed) சேவைகள் இதனால் பாதிக்கப்படாது.
  • பயன்பாடுகளுக்குத் தெரியாதது (Transparent to applications) – அதே SageMaker endpoint URL மற்றும் API ஒப்பந்தம் அப்படியே இருக்கும்.

இதனால் யார் பயனடைவார்கள்

SageMaker-இல் LLM-களைத் தமக்கெனத் தற்காலிகமாக வைத்திருக்கும் (host) நிறுவனங்கள், தரவுத் தனியுரிமை முதல் செலவுக் கட்டுப்பாடு வரை பல்வேறு காரணங்களுக்காக அவ்வாறு செய்கின்றன. ஆதரவு சாட்பாட்கள் (support chatbots), விற்பனை உதவியாளர்கள் அல்லது நிலையான system prompt-ஐத் திரும்பத் திரும்பப் பயன்படுத்தும் எந்தவொரு ஊடாடும் ஏஜென்ட்டையும் (interactive agent) இயக்கும் நிறுவனங்களுக்கு, இந்த routing மாற்றம் சராசரி பதிலளிக்கும் நேரத்தைக் குறைக்க உதவும். செலவு ரீதியாகப் பார்த்தால், ஒவ்வொரு cache hit-உம் prompt-இன் பகிரப்பட்ட பகுதியை மீண்டும் மதிப்பீடு செய்வதிலிருந்து GPU-வைச் சேமிக்கிறது.

வரம்புகள் மற்றும் மறுப்புரைகள்

இந்த நன்மை, மீண்டும் மீண்டும் வரும் முன்னொட்டுகள் (repeated prefixes) இருப்பதைச் சார்ந்துள்ளது. அதிக மாறுபாடுகள் கொண்ட prompts—அதாவது ஒருமுறை மட்டும் கேட்கப்படும் வினவல்கள் அல்லது மாறும் தன்மையுடன் உருவாக்கப்படும் system messages—அதே cache-hit நன்மையைப் பெறாது.

இந்த அம்சம் சுய-வழங்கப்பட்ட (self-hosted) பயன்பாடுகளுக்கு மட்டுமே மட்டுப்படுத்தப்பட்டுள்ளதால், நிர்வகிக்கப்படும் (managed) LLM சேவைகளைப் பயன்படுத்தும் வாடிக்கையாளர்கள் இதைப் பயன்படுத்த முடியாது.

சுருக்கமாக: Prefix-aware routing என்பது SageMaker பயனர்களுக்கு, மீண்டும் மீண்டும் வரும் LLM பணிச்சுமைகளில் தாமதத்தைக் குறைக்கவும், அதே நேரத்தில் GPU செலவுகளைக் குறைக்கவும் குறியீடு தேவையில்லாத (zero-code) எளிய வழியை வழங்குகிறது. ஏற்கனவே இந்தத் தளத்தில் மாடல்களைத் தமக்கென வைத்திருக்கும் நிறுவனங்களுக்கு, இந்த மேம்படுத்தல் குறைந்த அபாயத்தைக் கொண்ட ஒரு மாற்றமாகும், இது வேகமான பயனர் தொடர்புகளுக்கும் குறைந்த கட்டணங்களுக்கும் வழிவகுக்கும்.