llama.cpp b10255 SYCL-ਅਧਾਰਤ quantized KV-cache ਸਪੋਰਟ ਜੋੜਦਾ ਹੈ, ਜੋ Intel GPU ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ Q4_0, Q8_0 ਅਤੇ FP32 ਫਾਰਮੈਟਾਂ ਨਾਲ ਵੱਡੇ ਮਾਡਲਾਂ ਜਾਂ ਲੰਬੇ ਕੰਟੈਕਸਟ (contexts) ਚਲਾਉਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਇਹ ਤਬਦੀਲੀ ਮਹੱਤਵਪੂਰਨ ਰੂਪ ਵਿੱਚ ਤੇਜ਼ ਲੋਕਲ ਇਨਫਰੈਂਸ (local inference) ਦਾ ਵਾਅਦਾ ਕਰਦੀ ਹੈ, ਜੋ ਕਿ ਉਹਨਾਂ ਲੋਕਾਂ ਲਈ ਇੱਕ ਵੱਡਾ ਵਾਧਾ ਹੈ ਜੋ Nvidia-ਸਿਰਫ ਰਿਗ (rig) ਖਰੀਦੇ ਬਿਨਾਂ AI ਵਰਕਲੋਡਸ ਨੂੰ ਆਨ-ਪ੍ਰੇਮਿਸ (on-premise) ਰੱਖਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰ ਰਹੇ ਹਨ।
llama.cpp ਅੱਪਡੇਟ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
llama.cpp ਪ੍ਰੋਜੈਕਟ ਕਈ ਤਰ੍ਹਾਂ ਦੇ ਹਾਰਡਵੇਅਰ 'ਤੇ LLaMA-ਸਟਾਈਲ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ ਲਈ ਇੱਕ ਪ੍ਰਮੁੱਖ ਓਪਨ-ਸੋਰਸ ਇੰਜਣ ਰਿਹਾ ਹੈ। ਵਰਜ਼ਨ b10255 oneDNN ਦੇ SDPA (scaled dot-product attention) ਦਾ ਇੱਕ SYSL ਇੰਪਲੀਮੈਂਟੇਸ਼ਨ ਪੇਸ਼ ਕਰਦਾ ਹੈ ਜੋ quantized key-value caches ਦੇ ਨਾਲ ਕੰਮ ਕਰਦਾ ਹੈ। Quantization ਕੈਸ਼ ਦੇ ਆਕਾਰ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ, ਜਿਸ ਨਾਲ SYCL ਨੂੰ ਸਪੋਰਟ ਕਰਨ ਵਾਲੇ Intel GPUs 'ਤੇ ਮੈਮੋਰੀ ਬੈਂਡਵਿਡਥ ਅਤੇ ਲੈਟੈਂਸੀ (latency) ਵਿੱਚ ਭਾਰੀ ਸੁਧਾਰ ਹੁੰਦਾ ਹੈ। ਉਪਭੋਗਤਾ ਹੁਣ Q4_0, Q8_0 ਜਾਂ ਫੁੱਲ-ਪ੍ਰੀਸੀਜ਼ਨ FP32 ਚੁਣ ਸਕਦੇ ਹਨ, ਜਿੱਥੇ ਉਹ ਸਪੀਡ ਅਤੇ ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਵਿੱਚ ਵੱਡੇ ਫਾਇਦੇ ਲਈ ਸਟੀਕਤਾ (accuracy) ਵਿੱਚ ਥੋੜ੍ਹੀ ਜਿਹੀ ਕਮੀ ਦਾ ਸੌਦਾ ਕਰਦੇ ਹਨ। ਲੋਕਲ ਚੈਟ ਅਸਿਸਟੈਂਟਸ ਜਾਂ ਰਿਸਰਚ ਪ੍ਰੋਟੋਟਾਈਪ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਲਈ, ਇੱਕੋ GPU ਵਿੱਚ ਵਧੇਰੇ ਕੰਟੈਕਸਟ (context) ਨੂੰ ਸਮੇਟਣ ਦੀ ਯੋਗਤਾ ਇੱਕ ਵਰਤੋਂਯੋਗ ਡੈਮੋ ਅਤੇ ਇੱਕ ਰੁਕੇ ਹੋਏ ਪ੍ਰਯੋਗ ਦੇ ਵਿਚਕਾਰ ਫਰਕ ਹੋ ਸਕਦੀ ਹੈ।
Hugging Face 'ਤੇ ਨਵੇਂ ਮਾਡਲ ਵਿਕਲਪ
Hugging Face 'ਤੇ ਦੋ ਮਾਡਲ ਸਾਹਮਣੇ ਆਏ ਹਨ ਜੋ llama.cpp ਅੱਪਡੇਟ ਦੇ ਪਰਫਾਰਮੈਂਸ ਫੋਕਸ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਹਨ।
- DeepSeek-V4-Flash-0731 ਆਪਣੀ ਮੁੱਖ ਵਿਕਰੀ ਵਿਸ਼ੇਸ਼ਤਾ ਵਜੋਂ ਸਪੀਡ (speed) ਦਾ ਪ੍ਰਚਾਰ ਕਰਦਾ ਹੈ। ਇਸਦਾ ਆਰਕੀਟੈਕਚਰ ਕੰਜ਼ਿਊਮਰ-ਗ੍ਰੇਡ GPUs 'ਤੇ ਤੇਜ਼ ਲੋਕਲ ਚੈਟ ਐਪਲੀਕੇਸ਼ਨਾਂ ਲਈ ਟਿਊਨ ਕੀਤਾ ਗਿਆ ਹੈ, ਜੋ ਇਸਨੂੰ ਨਵੇਂ SYCL-ਐਕਸਲਰੇਟਡ ਪਾਈਪਲਾਈਨ ਲਈ ਇੱਕ ਕੁਦਰਤੀ ਮੇਲ ਬਣਾਉਂਦਾ ਹੈ।
- KAT-Coder-V2.5-Dev Mixture of Experts ਡਿਜ਼ਾਈਨ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਜੋ ਕੋਡਿੰਗ ਕੰਮਾਂ ਅਤੇ ਆਟੋਨੋਮਸ-ਏਜੰਟ ਵਿਵਹਾਰ ਲਈ ਵੱਖਰੇ ਐਕਸਪਰਟ ਸਬ-ਨੈਟਵਰਕਸ ਅਲਾਟ ਕਰਦਾ ਹੈ। ਮਾਡਲ ਦੀ ਮੋਡੂਲਰਿਟੀ (modularity) ਦਾ ਲਾਭ quantized KV caches ਦੁਆਰਾ ਸੰਭਵ ਬਣਾਏ ਗਏ ਵੱਡੇ ਕੰਟੈਕਸਟ ਵਿੰਡੋਜ਼ ਤੋਂ ਮਿਲ ਸਕਦਾ ਹੈ।
ਦੋਵੇਂ ਮਾਡਲ ਉਹਨਾਂ ਡਿਵੈਲਪਰਾਂ ਲਈ ਚੋਣਾਂ ਦਾ ਵਿਸਤਾਰ ਕਰਦੇ ਹਨ ਜੋ ਕਲਾਊਡ ਤੋਂ ਦੂਰ ਰਹਿਣਾ ਚਾਹੁੰਦੇ ਹਨ ਪਰ ਫਿਰ ਵੀ ਅੱਪ-ਟੂ-ਡੇਟ ਸਮਰੱਥਾਵਾਂ ਦੀ ਲੋੜ ਰੱਖਦੇ ਹਨ।
GPU ਡਰਾਈਵਰ ਅਤੇ ਸ਼ੈਡਿਊਲਰ ਅੱਪਡੇਟਸ
ਜਦੋਂ ਕਿ llama.cpp Intel GPUs ਲਈ ਦਰਵਾਜ਼ੇ ਖੋਲ੍ਹਦਾ ਹੈ, Nvidia ਉਪਭੋਗਤਾਵਾਂ ਨੂੰ ਪਿੱਛੇ ਨਹੀਂ ਛੱਡਿਆ ਗਿਆ ਹੈ। Linux ਡਰਾਈਵਰ ਸਟੈਕ ਵਰਜ਼ਨ 610.57.04 'ਤੇ ਚਲ ਗਿਆ ਹੈ, ਜੋ ਬੱਗ ਫਿਕਸਾਂ ਦਾ ਇੱਕ ਸਮੂਹ ਲਿਆ ਹੈ ਜੋ ਹਾਲੀਆ ਕਰਨਲਸ (kernels) 'ਤੇ CUDA ਸਟੈਬਿਲਿਟੀ ਵਿੱਚ ਸੁਧਾਰ ਕਰਦਾ ਹੈ। AMD ਪਾਸੇ, ROCm ਈਕੋਸਿਸਟਮ ਨੇ Spur ਰਿਲੀਜ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਹਾਈ-ਪਰਫਾਰਮੈਂਸ ਕੰਪਿਊਟਿੰਗ ਅਤੇ AI ਵਰਕਲੋਡਸ ਲਈ ਇੱਕ ਜੌਬ ਸ਼ੈਡਿਊਲਰ ਹੈ। Spur GPU ਕਲਸਟਰਾਂ ਵਿੱਚ ਬਿਹਤਰ ਉਪਯੋਗ ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ, ਜੋ ਕਿ ਉਹਨਾਂ ਟੀਮਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੋ ਸਕਦਾ ਹੈ ਜੋ ਕਈ ਸਮਾਨਾਂਤਰ (simultaneous) ਇਨਫਰੈਂਸ ਜੌਬਸ ਚਲਾ ਰਹੀਆਂ ਹਨ।
ਹਾਈ-ਐਂਡ GPUs 'ਤੇ ਕੀਮਤ ਦਾ ਦਬਾਅ
ਇਸ ਦੇ ਨਾਲ ਹੀ, ਟਾਪ-ਟੀਅਰ ਗ੍ਰਾਫਿਕਸ ਕਾਰਡਾਂ ਦਾ ਬਾਜ਼ਾਰ ਸਖ਼ਤ ਹੋ ਰਿਹਾ ਹੈ। ਰਿਪੋਰਟਾਂ ਸੁਝਾਅ ਦਿੰਦੀਆਂ ਹਨ ਕਿ ਆਉਣ ਵਾਲੀ RTX 50 ਸੀਰੀਜ਼ ਦੀਆਂ ਕੀਮਤਾਂ ਮੌਜੂਦਾ ਪੱਧਰਾਂ ਨਾਲੋਂ ਲਗਭਗ 30% ਵਧ ਸਕਦੀਆਂ ਹਨ। ਉਦਾਹਰਨ ਲਈ, RTX 5090, GDDR7 ਮੈਮੋਰੀ ਦੀ ਲਾਗਤ ਅਤੇ TSMC ਦੇ ਤਾਜ਼ਾ ਪ੍ਰੋਸੈਸ ਦੀ ਵੇਫਰ ਸਮਰੱਥਾ ਕਾਰਨ $5,100 ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਤੋੜ ਸਕਦਾ ਹੈ। ਛੋਟੀਆਂ ਲੈਬਾਂ ਅਤੇ ਸ਼ੌਕੀਨਾਂ (hobbyists) ਲਈ, ਵਧਦਾ ਖਰਚਾ Intel ਜਾਂ AMD GPUs ਵਰਗੇ ਵਿਕਲਪਾਂ 'ਤੇ ਗੰਭੀਰਤਾ ਨਾਲ ਵਿਚਾਰ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ, ਖਾਸ ਕਰਕੇ ਹੁਣ ਜਦੋਂ llama.cpp ਉਹਨਾਂ ਤੋਂ ਵਧੇਰੇ ਫਾਇਦਾ ਉਠਾ ਸਕਦਾ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- llama.cpp ਦੀਆਂ ਹੋਰ ਰਿਲੀਜ਼ – ਆਉਣ ਵਾਲੇ ਪੈਚ SYCL ਸਪੋਰਟ ਨੂੰ ਹੋਰ ਕੁਆਂਟਾਈਜ਼ੇਸ਼ਨ ਸਕੀਮਾਂ ਤੱਕ ਵਧਾ ਸਕਦੇ ਹਨ ਜਾਂ ਮਿਕਸਡ-ਪ੍ਰੀਸੀਜ਼ਨ ਕਰਨਲਸ (mixed-precision kernels) ਜੋੜ ਸਕਦੇ ਹਨ।
- ਡਰਾਈਵਰ ਸਟੈਬਿਲਿਟੀ – ਸ਼ੁਰੂਆਤੀ ਅਪਣਾਉਣ ਵਾਲਿਆਂ ਨੂੰ Nvidia ਦੇ 610.57.04 ਰੋਲਆਊਟ ਦੀ ਕਿਸੇ ਵੀ ਅਜਿਹੀ ਰਿਗਰੈਸ਼ਨ (regression) ਲਈ ਨਿਗਰਾਨੀ ਕਰਨੀ ਚਾਹੀਦੀ ਹੈ ਜੋ ਪਰਫਾਰਮੈਂਸ ਦੇ ਫਾਇਦਿਆਂ ਨੂੰ ਖਤਮ ਕਰ ਸਕਦੀ ਹੈ।
- AMD ਦੇ ਸ਼ੈਡਿਊਲਰ ਨੂੰ ਅਪਣਾਉਣਾ – Spur ਦਾ ਪ੍ਰਭਾਵ ਉਦੋਂ ਸਪੱਸ਼ਟ ਹੋਵੇਗਾ ਜਦੋਂ ਵਧੇਰੇ ਕਲਸਟਰ ਇਸਨੂੰ ਚਾਲੂ ਕਰਨਗੇ ਅਤੇ ਉਪਯੋਗਤਾ ਮੈਟ੍ਰਿਕਸ (utilization metrics) ਦੀ ਰਿਪੋਰਟ ਕਰਨਗੇ।
- GPU ਕੀਮਤ ਰੁਝਾਨ – ਜੇਕਰ RTX 50 ਸੀਰੀਜ਼ ਦੀ ਕੀਮਤ ਬਣੀ ਰਹਿੰਦੀ ਹੈ, ਤਾਂ ਅਸੀਂ ਇਨਫਰੈਂਸ ਵਰਕਲੋਡਸ ਲਈ ਵਧੇਰੇ ਕਿਫਾਇਤੀ Intel ਜਾਂ AMD ਹਾਰਡਵੇਅਰ ਵੱਲ ਇੱਕ ਤਬਦੀਲੀ ਦੇਖ ਸਕਦੇ ਹਾਂ।
llama.cpp b10255 ਅੱਪਡੇਟ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਓਪਨ-ਸੋਰਸ ਟੂਲਿੰਗ ਹਾਰਡਵੇਅਰ ਦੀਆਂ ਤਰੱਕੀਆਂ ਨਾਲ ਕਦਮ ਨਾਲ ਕਦਮ ਮਿਲਾ ਕੇ ਚੱਲ ਸਕਦੀ ਹੈ, ਪਰ ਵਿਆਪਕ ਈਕੋਸਿਸਟਮ—ਮਾਡਲ, ਡਰਾਈਵਰ ਅਤੇ ਕੀਮਤਾਂ—ਇਹ ਤੈਅ ਕਰੇਗਾ ਕਿ ਕੀ ਡਿਵੈਲਪਰ ਸੱਚਮੁੱਚ ਲੋਕਲ ਰਹਿਣ ਦਾ ਖਰਚਾ ਚੁੱਕ ਸਕਦੇ ਹਨ।
