64K-ਟੋਕਨ ਪ੍ਰੋਂਪਟਸ 'ਤੇ vLLM, SGLang ਨੂੰ ਪਛਾੜ ਦਿੰਦਾ ਹੈ, ਪਰ ਜਦੋਂ 8-GPU B300 ਸਰਵਰ 'ਤੇ ਕੰਟੈਕਸਟ (context) 200K ਤੱਕ ਪਹੁੰਚ ਜਾਂਦਾ ਹੈ, ਤਾਂ SGLang ਅੱਗੇ ਨਿਕਲ ਜਾਂਦਾ ਹੈ। ਇਹ ਬਦਲਾਅ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਜਿਵੇਂ-ਜਿਵੇਂ ਟੋਕਨ ਵਿੰਡੋਜ਼ ਵਧਦੀਆਂ ਹਨ, ਪ੍ਰਦਰਸ਼ਨ (performance) ਨੂੰ ਡੀਕੋਡ-ਸਟੇਜ ਦੀਆਂ ਰੁਕਾਵਟਾਂ (bottlenecks) ਤੈਅ ਕਰਦੀਆਂ ਹਨ, ਨਾ ਕਿ ਪ੍ਰੀਫਿਲ (prefill) ਕੰਮ।
ਇਹ ਬੈਂਚਮਾਰਕ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਲੌਂਗ-ਕੰਟੈਕਸਟ ਇਨਫਰੈਂਸ (Long-context inference) ਚੈਟ ਅਸਿਸਟੈਂਟਸ, ਕੋਡ ਅਸਿਸਟੈਂਟਸ ਅਤੇ ਕਿਸੇ ਵੀ ਅਜਿਹੀ ਐਪ ਲਈ ਲਾਗਤ ਵਧਾਉਂਦਾ ਹੈ ਜਿਸ ਨੂੰ ਮੈਮੋਰੀ ਵਿੱਚ ਲੱਖਾਂ ਟੋਕਨ ਰੱਖਣੇ ਪੈਂਦੇ ਹਨ। Kimi-K3, ਇੱਕ ਵੱਡੇ-ਪੈਰਾਮੀਟਰ ਵਾਲਾ ਮਾਡਲ, ਪਹਿਲੇ ਅਜਿਹੇ open-weight LLMs ਵਿੱਚੋਂ ਇੱਕ ਹੈ ਜੋ ਅਜਿਹੇ ਵਿੰਡੋਜ਼ ਨੂੰ ਆਰਾਮ ਨਾਲ ਸੰਭਾਲ ਸਕਦਾ ਹੈ, ਪਰ ਇਸ ਨੂੰ ਚਲਾਉਣ ਵਾਲਾ ਇੰਜਣ ਇਹ ਤੈਅ ਕਰਦਾ ਹੈ ਕਿ ਕੋਈ ਰਿਕਵੈਸਟ ਸਕਿੰਟਾਂ ਵਿੱਚ ਪੂਰੀ ਹੋਵੇਗੀ ਜਾਂ ਮਿੰਟਾਂ ਵਿੱਚ।
vLLM ਅਤੇ SGLang ਦੋਵੇਂ ਉੱਚ-ਥਰੂਪੁੱਟ (high-throughput) ਇਨਫਰੈਂਸ ਦਾ ਵਾਅਦਾ ਕਰਦੇ ਹਨ, ਫਿਰ ਵੀ ਉਹ ਡੀਕੋਡ ਸਟੇਜ ਲਈ ਉਲਟ ਪਹੁੰਚ ਅਪਣਾਉਂਦੇ ਹਨ। vLLM ਡੀਕੋਡ ਪਾਥ ਨੂੰ ਸਰਲ ਰੱਖਦਾ ਹੈ, ਅਤੇ Decode Context Parallelism (DCP) ਦੁਆਰਾ ਲਿਆਂਦੀ ਜਾਣ ਵਾਲੀ ਵਾਧੂ ਸਿੰਕ੍ਰੋਨਾਈਜ਼ੇਸ਼ਨ (synchronization) ਤੋਂ ਬਚਦਾ ਹੈ। SGLang, DCP ਦੀ ਵਰਤੋਂ ਕਰਕੇ key-value (KV) ਕੈਸ਼ ਰੀਡਸ ਨੂੰ ਕਈ GPUs ਵਿੱਚ ਫੈਲਾ ਦਿੰਦਾ ਹੈ, ਇੱਕ ਅਜਿਹੀ ਤਕਨੀਕ ਜੋ ਵਾਧੂ ਸੰਚਾਰ (communication) ਦੀ ਕੀਮਤ 'ਤੇ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਨੂੰ ਵੰਡ ਸਕਦੀ ਹੈ।
ਟੈਸਟਬੈੱਡ (The testbed)
- Hardware: ਅੱਠ NVIDIA B300 GPUs ਵਾਲਾ ਇੱਕ ਸਿੰਗਲ ਸਰਵਰ, ਜਿਨ੍ਹਾਂ ਵਿੱਚੋਂ ਹਰੇਕ ਦੀ ਮੈਮੋਰੀ ਇੱਕੋ ਜਿਹੀ ਹੈ।
- Workloads: ਦੋ ਕੰਟੈਕਸਟ-ਲੈਂਥ ਸੈਟਿੰਗਾਂ – 64K ਟੋਕਨ ("ਲੌਂਗ ਕੰਟੈਕਸਟ" ਦੀ ਹੇਠਲੀ ਸੀਮਾ) ਅਤੇ 200K ਟੋਕਨ (ਉਪਰਲੀ ਸੀਮਾ ਜਿਸ ਨੂੰ ਕਈ ਰਿਸਰਚ ਡੈਮੋਜ਼ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੇ ਹਨ)।
- Metrics: ਪ੍ਰੋਂਪਟਸ ਦੇ ਇੱਕ ਨਿਸ਼ਚਿਤ ਬੈਚ ਨੂੰ ਪ੍ਰੋਸੈਸ ਕਰਨ ਲਈ ਲੱਗਣ ਵਾਲਾ ਕੁੱਲ ਸਮਾਂ; ਥਰੂਪੁੱਟ ਸਮੇਂ ਦੇ ਅੰਤਰ ਤੋਂ ਕੱਢਿਆ ਜਾਂਦਾ ਹੈ।
ਅਸੀਂ ਬੈਚ ਸਾਈਜ਼, ਮਾਡਲ ਵੇਟਸ ਅਤੇ ਮੈਮੋਰੀ-ਯੂਟੀਲਾਈਜ਼ੇਸ਼ਨ ਟਾਰਗੇਟਸ ਨੂੰ ਸਥਿਰ ਰੱਖਿਆ। ਰਨਾਂ ਦੇ ਵਿਚਕਾਰ ਅਸੀਂ ਸਿਰਫ਼ ਇਨਫਰੈਂਸ ਇੰਜਣ ਨੂੰ ਬਦਲਿਆ।
ਅੰਕੜੇ (Numbers on the line)
| ਕੰਟੈਕਸਟ (Context) | ਇੰਜਣ
