AWS ਨੇ Amazon SageMaker Inference ਵਿੱਚ ਇੱਕ “prefix-aware routing” ਵਿਕਲਪ ਜੋੜਿਆ ਹੈ, ਜੋ ਕਿ ਉਨ੍ਹਾਂ ਗਾਹਕਾਂ ਲਈ ਉੱਚੇ cache-hit ਰੇਟ ਅਤੇ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਘੱਟ ਲੇਟੈਂਸੀ ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ ਜੋ ਆਪਣੇ ਬੁਨਿਆਦੀ ਢਾਂਚੇ (infrastructure) 'ਤੇ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (LLMs) ਚਲਾਉਂਦੇ ਹਨ। ਇਹ ਬਦਲਾਅ ਮਹੱਤਵਪੂਰਨ ਹੈ ਕਿਉਂਕਿ ਇਹ ਮਹੱਤਵਪੂਰਨ ਤੌਰ 'ਤੇ ਘੱਟ ਲੇਟੈਂਸੀ ਅਤੇ ਘੱਟ GPU ਕੰਪਿਊਟ ਲਾਗਤ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ।
LLM ਲੇਟੈਂਸੀ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਜਦੋਂ ਇੱਕ LLM ਨੂੰ ਕੋਈ ਰਿਕਵੈਸਟ ਮਿਲਦੀ ਹੈ, ਤਾਂ ਇਹ ਆਮ ਤੌਰ 'ਤੇ ਪੂਰੇ ਪ੍ਰੋਂਪਟ 'ਤੇ ਅਟੈਂਸ਼ਨ (attention) ਨੂੰ ਦੁਬਾਰਾ ਕੰਪਿਊਟ ਕਰਦਾ ਹੈ—ਇਹ ਇੱਕ ਖ਼ਪਤ ਵਾਲਾ ਕਦਮ ਹੈ ਜੋ ਹਰ ਵਾਰ ਵਧਦੇ ਟੋਕਨਾਂ ਦੇ ਨਾਲ ਵਧਦਾ ਜਾਂਦਾ ਹੈ। ਜੇਕਰ ਮਾਡਲ ਪਿਛਲੀ ਰਿਕਵੈਸਟ ਤੋਂ ਅਟੈਂਸ਼ਨ ਕੈਸ਼ (attention cache) ਦੀ ਮੁੜ ਵਰਤੋਂ ਕਰ ਸਕਦਾ ਹੈ, ਤਾਂ ਇਸਨੂੰ ਸਿਰਫ਼ ਟੈਕਸਟ ਦੇ ਨਵੇਂ ਹਿੱਸੇ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। ਉਹ ਵਰਕਲੋਡਸ ਜੋ ਵਾਰ-ਵਾਰ ਇੱਕੋ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ (system prompt) ਭੇਜਦੇ ਹਨ ਜਾਂ ਗੱਲਬਾਤ ਦਾ ਇਤਿਹਾਸ (conversation history) ਬਣਾਈ ਰੱਖਦੇ ਹਨ, ਉਹ ਕੈਸ਼ ਦੀ ਮੁੜ ਵਰਤੋਂ ਲਈ ਉੱਤਮ ਉਮੀਦਵਾਰ ਹਨ।
ਡਿਫੌਲਟ SageMaker ਸੈੱਟਅੱਪ ਵਿੱਚ, ਆਉਣ ਵਾਲੀਆਂ ਰਿਕਵੈਸਟਾਂ ਨੂੰ ਇਨਫਰੈਂਸ ਇੰਸਟੈਂਸਾਂ ਦੇ ਪੂਲ ਵਿੱਚ ਬੇਤਰਤੀਬੇ ਤੌਰ 'ਤੇ ਵੰਡ ਦਿੱਤਾ ਜਾਂਦਾ ਹੈ। ਬੇਤਰਤੀਬੇ ਵੰਡ ਦਾ ਮਤਲਬ ਹੈ ਕਿ ਇੱਕ ਰਿਕਵੈਸਟ ਜੋ ਵਾਰਮ ਕੈਸ਼ (warm cache) ਨੂੰ ਹਿੱਟ ਕਰ ਸਕਦੀ ਸੀ, ਉਹ ਅਕਸਰ ਇੱਕ ਕੋਲਡ ਇੰਸਟੈਂਸ (cold instance) 'ਤੇ ਪਹੁੰਚ ਜਾਂਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਪੂਰੀ ਮੁੜ-ਕੰਪਿਊਟੇਸ਼ਨ ਕਰਨ ਲਈ ਮਜਬੂਰ ਹੋਣਾ ਪੈਂਦਾ ਹੈ। ਇਸਦਾ ਨਤੀਜਾ ਉੱਚੀ ਲੇਟੈਂਸੀ ਅਤੇ ਵਾਧੂ GPU ਸਾਈਕਲਜ਼ ਹੁੰਦੇ ਹਨ ਜੋ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਵਧੇ ਹੋਏ ਖਰਚੇ ਵਿੱਚ ਬਦਲ ਜਾਂਦੇ ਹਨ।
prefix-aware routing ਕਿਵੇਂ ਕੰਮ ਕਰਦੀ ਹੈ
ਨਵਾਂ ਰੂਟਿੰਗ ਮੋਡ ਹਾਲੀਆ ਰਿਕਵੈਸਟ ਪ੍ਰੀਫਿਕਸ (request prefixes) ਦਾ ਇੱਕ ਹਲਕਾ ਮੈਪ ਰੱਖਦਾ ਹੈ—ਮੁੱਖ ਤੌਰ 'ਤੇ ਪ੍ਰੋਂਪਟ ਦਾ ਉਹ ਪਹਿਲਾ ਹਿੱਸਾ ਜੋ ਕਾਲਾਂ ਵਿੱਚ ਲਗਭਗ ਸਥਿਰ ਰਹਿੰਦਾ ਹੈ। ਜਦੋਂ ਇੱਕ ਨਵੀਂ ਰਿਕਵੈਸਟ ਆਉਂਦੀ ਹੈ, SageMaker ਮੈਪ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ ਅਤੇ ਰਿਕਵੈਸਟ ਨੂੰ ਉਸ ਇੰਸਟੈਂਸ ਨੂੰ ਭੇਜਦਾ ਹੈ ਜਿਸਨੇ ਪਹਿਲਾਂ ਹੀ ਉਹੀ ਪ੍ਰੀਫਿਕਸ ਪ੍ਰੋਸੈਸ ਕੀਤਾ ਹੋਵੇ। ਜੇਕਰ ਇੰਸਟੈਂਸ ਕੋਲ ਅਜੇ ਵੀ ਸਬੰਧਤ ਅਟੈਂਸ਼ਨ ਕੈਸ਼ ਮੌਜੂਦ ਹੈ, ਤਾਂ ਮਾਡਲ ਕੰਮ ਦੇ ਵੱਡੇ ਹਿੱਸੇ ਨੂੰ ਛੱਡ ਸਕਦਾ ਹੈ ਅਤੇ ਜਵਾਬ ਤੇਜ਼ੀ ਨਾਲ ਤਿਆਰ ਕਰ ਸਕਦਾ ਹੈ।
ਮੁੱਖ ਨੁਕਤੇ:
- ਕੋਡ ਵਿੱਚ ਕਿਸੇ ਬਦਲਾਅ ਦੀ ਲੋੜ ਨਹੀਂ – ਇਹ ਫੀਚਰ ਪੂਰੀ ਤਰ੍ਹਾਂ ਇਨਫਰੈਂਸ ਸਰਵਿਸ ਲੇਅਰ ਵਿੱਚ ਮੌਜੂਦ ਹੈ।
- ਸਿਰਫ਼ ਸੈਲਫ-ਹੋਸਟਡ ਮਾਡਲਾਂ 'ਤੇ ਲਾਗੂ ਹੁੰਦਾ ਹੈ – OpenAI ਦੀ API ਜਾਂ Anthropic ਦੀ ਸੇਵਾ ਵਰਗੀਆਂ ਮੈਨੇਜਡ ਆਫਰਿੰਗਜ਼ ਇਸ ਤੋਂ ਪ੍ਰਭਾਵਿਤ ਨਹੀਂ ਹੁੰਦੀਆਂ।
- ਐਪਲੀਕੇਸ਼ਨਾਂ ਲਈ ਪਾਰਦਰਸ਼ੀ ਹੈ – ਉਹੀ SageMaker endpoint URL ਅਤੇ API ਕੰਟਰੈਕਟ ਬਣਿਆ ਰਹਿੰਦਾ ਹੈ।
ਕਿਸ ਨੂੰ ਫਾਇਦਾ ਹੋਵੇਗਾ
ਉਦਯੋਗਿਕ ਸੰਸਥਾਵਾਂ (Enterprises) ਜੋ SageMaker 'ਤੇ LLMs ਨੂੰ ਹੋਸਟ ਕਰਦੀਆਂ ਹਨ, ਉਹ ਡੇਟਾ ਪ੍ਰਾਈਵੇਸੀ ਤੋਂ ਲੈ ਕੇ ਲਾਗਤ ਨਿਯੰਤਰਣ ਤੱਕ ਕਈ ਕਾਰਨਾਂ ਕਰਕੇ ਅਜਿਹਾ ਕਰਦੀਆਂ ਹਨ। ਉਹਨਾਂ ਲਈ ਜੋ ਸਪੋਰਟ ਚੈਟਬੋਟਸ, ਸੇਲਜ਼ ਅਸਿਸਟੈਂਟਸ, ਜਾਂ ਕੋਈ ਵੀ ਇੰਟਰਐਕਟਿਵ ਏਜੰਟ ਚਲਾ ਰਹੇ ਹਨ ਜੋ ਵਾਰ-ਵਾਰ ਇੱਕ ਨਿਸ਼ਚਿਤ ਸਿਸਟਮ ਪ੍ਰੋਂਪਟ ਦੀ ਵਰਤੋਂ ਕਰਦੇ ਹਨ, ਰੂਟਿੰਗ ਵਿੱਚ ਇਹ ਸੁਧਾਰ ਔਸਤ ਪ੍ਰਤੀਕਿਰਿਆ ਸਮੇਂ (response times) ਨੂੰ ਘਟਾ ਸਕਦਾ ਹੈ। ਲਾਗਤ ਦੇ ਪੱਖ ਤੋਂ, ਹਰ ਕੈਸ਼ ਹਿੱਟ GPU ਨੂੰ ਪ੍ਰੋਂਪਟ ਦੇ ਸਾਂਝੇ ਹਿੱਸੇ ਦਾ ਮੁੜ ਮੁਲਾਂਕਣ ਕਰਨ ਤੋਂ ਬਚਾਉਂਦਾ ਹੈ।
ਸੀਮਾਵਾਂ ਅਤੇ ਵਿਰੋਧੀ ਨੁਕਤੇ
ਇਹ ਲਾਭ ਵਾਰ-ਵਾਰ ਆਉਣ ਵਾਲੇ ਪ੍ਰੀਫਿਕਸ ਦੀ ਮੌਜੂਦਗੀ 'ਤੇ ਨਿਰਭਰ ਕਰਦਾ ਹੈ। ਬਹੁਤ ਜ਼ਿਆਦਾ ਵਧਦੇ-ਘਟਦੇ ਪ੍ਰੋਂਪਟਸ—ਜਿਵੇਂ ਕਿ ਵਾਰ-ਵਾਰ ਪੁੱਛੇ ਜਾਣ ਵਾਲੇ ਸਵਾਲ ਜਾਂ ਡਾਇਨਾਮਿਕ ਤੌਰ 'ਤੇ ਤਿਆਰ ਕੀਤੇ ਗਏ ਸਿਸਟਮ ਮੈਸੇਜ—ਉਹੀ ਕੈਸ਼-ਹਿੱਟ ਫਾਇਦਾ ਨਹੀਂ ਦੇਖ ਸਕਣਗੇ।
ਕਿਉਂਕਿ ਇਹ ਫੀਚਰ ਸੈਲਫ-ਹੋਸਟਡ ਡਿਪਲਾਈਮੈਂਟਸ ਤੱਕ ਸੀਮਤ ਹੈ, ਮੈਨੇਜਡ LLM ਸੇਵਾਵਾਂ ਦੀ ਵਰਤੋਂ ਕਰਨ ਵਾਲੇ ਗਾਹਕ ਇਸਦਾ ਲਾਭ ਨਹੀਂ ਉਠਾ ਸਕਦੇ।
ਸਿੱਟਾ: Prefix-aware routing SageMaker ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਵਾਰ-ਵਾਰ ਹੋਣ ਵਾਲੇ LLM ਵਰਕਲੋਡਸ ਵਿੱਚੋਂ ਲੇਟੈਂਸੀ ਨੂੰ ਘਟਾਉਣ ਅਤੇ GPU ਲਾਗਤਾਂ ਨੂੰ ਘਟਾਉਣ ਦਾ ਇੱਕ ਸਰਲ, ਜ਼ੀਰੋ-ਕੋਡ ਤਰੀਕਾ ਦਿੰਦੀ ਹੈ। ਉਹਨਾਂ ਸੰਸਥਾਵਾਂ ਲਈ ਜੋ ਪਹਿਲਾਂ ਹੀ ਪਲੇਟਫਾਰਮ 'ਤੇ ਮਾਡਲ ਹੋਸਟ ਕਰਦੀਆਂ ਹਨ, ਇਹ ਅੱਪਗ੍ਰੇਡ ਇੱਕ ਘੱਟ-ਜੋਖਮ ਵਾਲਾ ਸੁਧਾਰ ਹੈ ਜੋ ਤੇਜ਼ ਯੂਜ਼ਰ ਇੰਟਰੈਕਸ਼ਨ ਅਤੇ ਘੱਟ ਬਿੱਲਾਂ ਵਿੱਚ ਬਦਲ ਸਕਦਾ ਹੈ।
