Llama.cpp b10327 ਇੱਕ ਮਹੱਤਵਪੂਰਨ CUDA quantization ਬੱਗ (bug) ਨੂੰ ਠੀਕ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ NVIDIA ਕਾਰਡਾਂ 'ਤੇ local GPU inference ਸਥਿਰ ਹੋ ਜਾਂਦਾ ਹੈ ਅਤੇ ਉਹੀ ਹਾਰਡਵੇਅਰ ਵਧੇਰੇ ਰਫਤਾਰ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਇਹ ਸੁਧਾਰ ਉਨ੍ਹਾਂ ਸਾਰੇ ਲੋਕਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹੈ ਜੋ consumer-grade GPU 'ਤੇ LLaMA-style ਮਾਡਲਾਂ ਨੂੰ ਚਲਾ ਰਹੇ ਹਨ, ਜਿੱਥੇ ਕ੍ਰੈਸ਼ (crashes) ਅਤੇ ਸ਼ੁੱਧਤਾ ਵਿੱਚ ਮਾਮੂਲੀ ਕਮੀ ਇੱਕ ਲਗਾਤਾਰ ਸਮੱਸਿਆ ਰਹੀ ਹੈ।

ਉਹ ਬੱਗ ਜਿਸ ਨੇ local inference ਨੂੰ ਰੋਕਿਆ ਹੋਇਆ ਸੀ

Llama.cpp ਬਿਨਾਂ ਕਿਸੇ cloud service ਦੇ CPUs ਅਤੇ GPUs 'ਤੇ large language models ਚਲਾਉਣ ਲਈ ਇੱਕ ਪ੍ਰਮੁੱਖ open-source engine ਹੈ। ਇਸਦੀ ਸਭ ਤੋਂ ਵੱਡੀ ਖ਼ਾਸੀਅਤ ਮੱਧਮ-ਆਕਾਰ ਦੇ GPUs 'ਤੇ quantised ਮਾਡਲਾਂ—weights ਜੋ low-bit formats ਵਿੱਚ ਸਟੋਰ ਕੀਤੇ ਜਾਂਦੇ ਹਨ—ਨੂੰ ਚਲਾਉਣ ਦੀ ਯੋਗਤਾ ਹੈ। b10327 ਰਿਲੀਜ਼ NVIDIA ਦੇ CUDA platform 'ਤੇ ਉਹਨਾਂ quantised kernels ਨੂੰ ਲਾਂਚ ਕਰਦੇ ਸਮੇਂ ਵਰਤੇ ਜਾਣ ਵਾਲੇ thread- ਅਤੇ block-count ਗਣਨਾਵਾਂ (calculations) ਨੂੰ ਸਹੀ ਕਰਦੀ ਹੈ।

ਪਿਛਲੀਆਂ ਗਣਨਾਵਾਂ ਕਾਰਜ-ਵਸਤੂਆਂ (work-items) ਨੂੰ ਗਲਤ ਤਰੀਕੇ ਨਾਲ ਅਲਾਈਨ ਕਰ ਸਕਦੀਆਂ ਸਨ, ਜਿਸ ਨਾਲ ਦੋ ਵਿਹਾਰਕ ਸਮੱਸਿਆਵਾਂ ਪੈਦਾ ਹੁੰਦੀਆਂ ਸਨ:

  • Memory mishandling – kernels ਕਦੇ-ਕਦੇ ਅਲਾਟ ਕੀਤੇ ਬਫਰ (buffer) ਤੋਂ ਬਾਹਰ ਮੈਮੋਰੀ ਤੱਕ ਪਹੁੰਚ ਕਰਦੇ ਸਨ, ਜਿਸ ਨਾਲ ਕ੍ਰੈਸ਼ ਹੋ ਜਾਂਦੇ ਸਨ ਜਾਂ ਡਾਟਾ ਖ਼ਰਾਬ ਹੋ ਜਾਂਦਾ ਸੀ।
  • Math inaccuracy – floating-point ਆਪਰੇਸ਼ਨਾਂ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ ਘੱਟ ਸੀ, ਜਿਸ ਨਾਲ ਤਿਆਰ ਕੀਤੇ ਗਏ ਟੈਕਸਟ ਦੀ ਗੁਣਵੱਤਾ ਘਟ ਜਾਂਦੀ ਸੀ।

ਇਹ ਦੋਵੇਂ ਸਮੱਸਿਆਵਾਂ ਸਿਰਫ਼ quantised inference ਦੀ ਸੀਮਤ ਮੈਮੋਰੀ ਦੇ ਅਧੀਨ ਹੀ ਸਾਹਮਣੇ ਆਉਂਦੀਆਂ ਸਨ, ਜਿਸ ਕਾਰਨ ਵੱਡੇ, full-precision ਰਨਾਂ 'ਤੇ ਇਹਨਾਂ ਨੂੰ ਦੁਬਾਰਾ ਪੈਦਾ ਕਰਨਾ ਮੁਸ਼ਕਲ ਸੀ।

ਇਹ ਸੁਧਾਰ on-device AI ਲਈ ਕਿਉਂ ਇੱਕ ਜਿੱਤ ਹੈ

ਡਿਵੈਲਪਰ ਅਤੇ ਸ਼ੌਕੀਨ (hobbyists) ਡਾਟਾ ਨੂੰ ਨਿੱਜੀ ਰੱਖਣ, cloud calls ਤੋਂ ਹੋਣ ਵਾਲੀ ਦੇਰੀ (latency) ਤੋਂ ਬਚਣ ਅਤੇ ਸੰਚਾਲਨ ਲਾਗਤਾਂ ਨੂੰ ਘਟਾਉਣ ਲਈ local inference 'ਤੇ ਭਰੋਸਾ ਕਰਦੇ ਹਨ। ਇਸ ਬੱਗ ਦਾ ਮਤਲਬ ਸੀ ਕਿ ਜਦੋਂ ਕੋਈ ਮਾਡਲ GPU ਮੈਮੋਰੀ ਵਿੱਚ ਫਿੱਟ ਹੋ ਜਾਂਦਾ ਸੀ, ਤਾਂ ਵੀ ਇਹ ਅਣਪਛਾਤੇ ਤਰੀਕੇ ਨਾਲ ਫੇਲ੍ਹ ਹੋ ਸਕਦਾ ਸੀ। ਸਹੀ ਕੀਤੇ ਗਏ launch parameters ਦੇ ਨਾਲ, ਹੁਣ ਉਹੀ ਹਾਰਡਵੇਅਰ ਇਹ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ:

  • ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਰਨ – ਘੱਟ out-of-memory ਕ੍ਰੈਸ਼, ਵਧੇਰੇ ਸੁਚਾਰੂ batch processing।
  • ਬਿਹਤਰ ਰਫਤਾਰ – ਇਹ ਅਪਡੇਟ ਭਰੋਸੇਯੋਗਤਾ ਅਤੇ throughput ਦੋਵਾਂ ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ।

ਇੱਕ consumer-grade GPU ਲਈ, ਇਹ ਅੰਤਰ ਇੱਕ ਵਰਤੋਂ ਯੋਗ interactive chatbot ਅਤੇ ਇੱਕ ਅਸਥਿਰ (flaky) ਡੈਮੋ ਦੇ ਵਿਚਕਾਰ ਹੋ ਸਕਦਾ ਹੈ।

ਵਿਆਪਕ GPU AI ਅਪਡੇਟ ਰ roundup

ਹਾਲਾਂਕਿ Llama.cpp ਪੈਚ ਮੁੱਖ ਖ਼ਬਰ ਹੈ, ਪਰ ਕੁਝ ਹੋਰ ਰਿਲੀਜ਼ ਵੀ local AI ecosystem ਨੂੰ ਅੱਗੇ ਵਧਾ ਰਹੀਆਂ ਹਨ:

  • NVIDIA NeMo Speech 3.0 ਆਟੋਮੈਟਿਕ ਸਪੀਚ ਰਿਕੋਗਨੀਸ਼ਨ, text-to-speech, ਅਤੇ speech-large language models ਲਈ ਇੱਕ ਨਵਾਂ toolkit ਪੇਸ਼ ਕਰਦਾ ਹੈ। ਨਵਾਂ ਲੇਆਉਟ ਵਿਸ਼ੇਸ਼ ਵੌਇਸ ਅਸਿਸਟੈਂਟ ਬਣਾਉਣ ਦੀ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਸਰਲ ਬਣਾਉਂਦਾ ਹੈ।
  • AMD ROCm Quark library ਰਾਹੀਂ SVDQuant ਸਪੋਰਟ ਜੋੜਦਾ ਹੈ, ਜਿਸ ਨਾਲ Stable Diffusion ਵਰਗੇ diffusion models AMD GPUs 'ਤੇ ਘੱਟ ਮੈਮੋਰੀ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਚੱਲ ਸਕਦੇ ਹਨ। ਇੱਕ ਸਾਥੀ VSA (Video Sparse Attention) ਮੋਡੀਊਲ diffusion steps ਲਈ ਲੋੜੀਂਦੀ ਅਰਿਥਮੈਟਿਕ (arithmetic) ਨੂੰ ਘਟਾ ਕੇ ਤੇਜ਼ ਵੀਡੀਓ ਜਨਰੇਸ਼ਨ ਦਾ ਵਾਅਦਾ ਕਰਦਾ ਹੈ।
  • Linux kernel 7.3 ਗ੍ਰਾਫਿਕਸ ਮੈਮੋਰੀ ਲਈ ਇੱਕ ਵਧੇਰੇ ਅਗਰੈਸਿਵ TTM (Translation Table Maps) subsystem ਪੇਸ਼ ਕਰੇਗਾ। ਇਸ ਬਦਲਾਅ ਦਾ ਉਦੇਸ਼ compute-heavy workloads ਲਈ ਮੈਮੋਰੀ ਰੀਕਲੇਮੇਸ਼ਨ (reclamation) ਵਿੱਚ ਸੁਧਾਰ ਕਰਨਾ ਹੈ, ਜਿਸ ਨਾਲ Linux-ਅਧਾਰਤ ਮਸ਼ੀਨਾਂ 'ਤੇ AI inference ਨੂੰ ਅਸਿੱਧੇ ਤੌਰ 'ਤੇ ਲਾਭ ਹੋ ਸਕਦਾ ਹੈ।

ਕੌਣ ਜਿੱਤਦਾ ਹੈ, ਕੌਣ ਸਾਵਧਾਨ ਰਹਿੰਦਾ ਹੈ

ਸੁਤੰਤਰ ਡਿਵੈਲਪਰ, ਛੋਟੇ ਸਟਾਰਟਅੱਪਸ, ਅਤੇ privacy-focused ਟੀਮਾਂ ਜਿਨ੍ਹਾਂ ਨੇ ਪਹਿਲਾਂ ਹੀ consumer-grade NVIDIA ਹਾਰਡਵੇਅਰ ਵਿੱਚ ਨਿਵੇਸ਼ ਕੀਤਾ ਹੈ, ਉਹਨਾਂ ਨੂੰ ਤੁਰੰਤ ਲਾਭ ਮਿਲਦੇ ਹਨ। ਉਹਨਾਂ ਦੇ pipelines ਵਧੇਰੇ ਭਰੋਸੇਯੋਗ ਬਣ ਜਾਂਦੇ ਹਨ, ਅਤੇ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਸੁਧਾਰ ਵੱਡੇ quantised ਮਾਡਲਾਂ ਨਾਲ ਪ੍ਰਯੋਗ ਕਰਨ ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਘਟਾਉਂਦਾ ਹੈ।

ਉਹ ਉਦਯੋਗਿਕ ਸੰਸਥਾਵਾਂ (Enterprises) ਜੋ ਪਹਿਲਾਂ ਹੀ cloud ਵਿੱਚ inference ਚਲਾਉਂਦੀਆਂ ਹਨ, ਇਸ ਸੁਧਾਰ ਨੂੰ ਹਾਈਬ੍ਰਿਡ ਰਣਨੀਤੀਆਂ ਲਈ ਇੱਕ ਵੈਧਤਾ ਬਿੰਦੂ ਵਜੋਂ ਦੇਖ ਸਕਦੀਆਂ ਹਨ—ਜਿਵੇਂ ਕਿ latency-critical front-ends ਨੂੰ local ਤੌਰ 'ਤੇ ਚਲਾਉਣਾ ਅਤੇ ਭਾਰੀ batch jobs ਨੂੰ cloud 'ਤੇ ਭੇਜਣਾ। ਹਾਲਾਂਕਿ, ਇਹ ਸੁਧਾਰ on-device AI ਦੀਆਂ ਡੂੰਘੀਆਂ ਸੀਮਾਵਾਂ ਨੂੰ ਖਤਮ ਨਹੀਂ ਕਰਦਾ, ਜਿਵੇਂ ਕਿ VRAM ceilings ਜਾਂ quantised ਅਤੇ full-precision ਮਾਡਲਾਂ ਵਿਚਕਾਰ ਗੁਣਵੱਤਾ ਦਾ ਅੰਤਰ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

  • Llama.cpp ਦੇ ਹੋਰ ਆਪਟੀਮਾਈਜ਼ੇਸ਼ਨ – ਆਉਣ ਵਾਲੇ ਪੈਚ kernel fusion ਨੂੰ ਬਿਹਤਰ ਬਣਾਉਣਗੇ ਅਤੇ ਨਵੇਂ NVIDIA architectures ਲਈ ਸਪੋਰਟ ਜੋੜਨਗੇ।
  • Cross-vendor quantisation ਸਟੈਂਡਰਡਸ – ਜਿਵੇਂ-ਜਿਵੇਂ AMD ਦਾ ROCm SVDQuant ਪ੍ਰਾਪਤ ਕਰਦਾ ਹੈ, ਕਮਿਊਨਿਟੀ ਇੱਕ ਸਾਂਝੇ low-bit format ਦੇ ਆਲੇ-ਦੁਆਲੇ ਇਕੱਠੀ ਹੋ ਸਕਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਦੀ ਪੋਰਟੇਬਿਲਟੀ (portability) ਆਸਾਨ ਹੋ ਜਾਵੇਗੀ।
  • NeMo Speech components ਦਾ integration on-device runtimes ਵਿੱਚ ਕਰਨ ਨਾਲ ਉਹੀ local inference stack, ਜੋ ਹੁਣ text ਮਾਡਲਾਂ ਨੂੰ ਵਧੇਰੇ ਭਰੋਸੇਯੋਗਤਾ ਨਾਲ ਚਲਾਉਂਦਾ ਹੈ, ਵੌਇਸ ਸਮਰੱਥਾਵਾਂ ਵੀ ਪ੍ਰਦਾਨ ਕਰ ਸਕਦਾ ਹੈ।

b10327 ਪੈਚ ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ launch geometry ਵਿੱਚ ਇੱਕ ਸਿੰਗਲ ਲਾਈਨ-ਲੇਵਲ ਸੁਧਾਰ local AI ਦੀ ਵਰਤੋਂਯੋਗਤਾ 'ਤੇ ਵੱਡਾ ਪ੍ਰਭਾਵ ਪਾ ਸਕਦਾ ਹੈ। ਜੇਕਰ ਤੁਸੀਂ ਅਜੇ ਵੀ consumer GPU 'ਤੇ ਕ੍ਰੈਸ਼ਾਂ ਨਾਲ ਜੂਝ ਰਹੇ ਹੋ, ਤਾਂ ਇੱਕ ਸਥਿਰ ਅਤੇ ਤੇਜ਼ inference ਅਨੁਭਵ ਲਈ ਹੁਣੇ llama.cpp ਨੂੰ ਅਪਡੇਟ ਕਰੋ।