llama.cpp b10255 SYCL ಆಧಾರಿತ quantized KV-cache ಬೆಂಬಲವನ್ನು ಸೇರಿಸುತ್ತದೆ, ಇದು Intel GPU ಬಳಕೆದಾರರಿಗೆ Q4_0, Q8_0 ಮತ್ತು FP32 ಫಾರ್ಮ್ಯಾಟ್‌ಗಳೊಂದಿಗೆ ದೊಡ್ಡ ಮಾದರಿಗಳನ್ನು ಅಥವಾ ದೀರ್ಘ ಸಂದರ್ಭಗಳನ್ನು (contexts) ಬಳಸಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಈ ಬದಲಾವಣೆಯು ಗಮನಾರ್ಹವಾಗಿ ವೇಗವಾದ ಸ್ಥಳೀಯ ಇನ್ಫರೆನ್ಸ್ ಅನ್ನು ಭರವಸೆ ನೀಡುತ್ತದೆ, ಇದು ಕೇವಲ Nvidia ವ್ಯವಸ್ಥೆಯನ್ನು ಖರೀದಿಸದೆ AI ಕೆಲಸದ ಹೊರೆಯನ್ನು (workloads) ಸ್ಥಳೀಯವಾಗಿಯೇ ಇರಿಸಿಕೊಳ್ಳಲು ಪ್ರಯತ್ನಿಸುವವರಿಗೆ ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ.

llama.cpp ಅಪ್‌ಡೇಟ್ ಏಕೆ ಮುಖ್ಯ

llama.cpp ಯೋಜನೆಯು ವಿವಿಧ ಹಾರ್ಡ್‌ವೇರ್‌ಗಳಲ್ಲಿ LLaMA ಶೈಲಿಯ ಮಾದರಿಗಳನ್ನು ಚಲಾಯಿಸಲು ಪ್ರಮುಖ ಓಪನ್-ಸೋರ್ಸ್ ಇಂಜಿನ್ ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತಿದೆ. b10255 ಆವೃತ್ತಿಯು quantized key-value ಕ್ಯಾಶೆಗಳೊಂದಿಗೆ ಕೆಲಸ ಮಾಡುವ oneDNN ನ SDPA (scaled dot-product attention) ನ SYCL ಅನುಷ್ಠಾನವನ್ನು (implementation) ಪರಿಚಯಿಸುತ್ತದೆ. Quantization ಕ್ಯಾಶೆಯ ಗಾತ್ರವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ, ಇದರಿಂದಾಗಿ SYCL ಅನ್ನು ಬೆಂಬಲಿಸುವ Intel GPUಗಳಲ್ಲಿ ಮೆಮೊರಿ ಬ್ಯಾಂಡ್‌ವಿಡ್ತ್ ಮತ್ತು ವಿಳಂಬತೆ (latency) ಗಮನಾರ್ಹವಾಗಿ ಸುಧಾರಿಸುತ್ತದೆ. ಬಳಕೆದಾರರು ಈಗ Q4_0, Q8_0 ಅಥವಾ ಪೂರ್ಣ ನಿಖರತೆಯ FP32 ಅನ್ನು ಆಯ್ಕೆ ಮಾಡಬಹುದು, ಅಂದರೆ ವೇಗ ಮತ್ತು ಮೆಮೊರಿ ಬಳಕೆಯ ದೊಡ್ಡ ಲಾಭಕ್ಕಾಗಿ ನಿಖರತೆಯಲ್ಲಿ ಸಣ್ಣ ನಷ್ಟವನ್ನು ಮಾಡಿಕೊಳ್ಳಬಹುದು. ಸ್ಥಳೀಯ ಚಾಟ್ ಅಸಿಸ್ಟೆಂಟ್‌ಗಳನ್ನು ಅಥವಾ ಸಂಶೋಧನಾ ಪ್ರೊಟೊಟೈಪ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತಿರುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ, ಒಂದೇ GPU ನಲ್ಲಿ ಹೆಚ್ಚಿನ ಸಂದರ್ಭವನ್ನು (context) ಬಳಸಿಕೊಳ್ಳುವ ಸಾಮರ್ಥ್ಯವು, ಒಂದು ಉಪಯುಕ್ತ ಡೆಮೊ ಮತ್ತು ಸ್ಥಗಿತಗೊಂಡ ಪ್ರಯೋಗದ ನಡುವಿನ ವ್ಯತ್ಯಾಸವಾಗಬಹುದು.

Hugging Face ನಲ್ಲಿ ಹೊಸ ಮಾದರಿ ಆಯ್ಕೆಗಳು

llama.cpp ಅಪ್‌ಡೇಟ್‌ನ ಕಾರ್ಯಕ್ಷಮತೆಯ ಮೇಲೆ ಗಮನ ಕೇಂದ್ರೀಕರಿಸುವ ಎರಡು ಮಾದರಿಗಳು Hugging Face ನಲ್ಲಿ ಕಾಣಿಸಿಕೊಂಡಿವೆ.

  • DeepSeek-V4-Flash-0731 ವೇಗವನ್ನು ತನ್ನ ಪ್ರಮುಖ ಮಾರಾಟದ ಅಂಶವಾಗಿ ಪ್ರಚಾರ ಮಾಡುತ್ತದೆ. ಇದರ ಆರ್ಕಿಟೆಕ್ಚರ್ ಗ್ರಾಹಕ-ಶ್ರೇಣಿಯ (consumer-grade) GPUಗಳಲ್ಲಿ ಸ್ಪಂದಿಸುವ ಸ್ಥಳೀಯ ಚಾಟ್ ಅಪ್ಲಿಕೇಶನ್‌ಗಳಿಗಾಗಿ ಟ್ಯೂನ್ ಮಾಡಲ್ಪಟ್ಟಿದೆ, ಇದು ಹೊಸ SYCL-accelerated ಪೈಪ್‌ಲೈನ್‌ಗೆ ನೈಸರ್ಗಿಕವಾಗಿ ಹೊಂದಿಕೆಯಾಗುತ್ತದೆ.
  • KAT-Coder-V2.5-Dev 'Mixture of Experts' ವಿನ್ಯಾಸವನ್ನು ಬಳಸುತ್ತದೆ, ಇದು ಕೋಡಿಂಗ್ ಕಾರ್ಯಗಳು ಮತ್ತು ಸ್ವಾಯತ್ತ ಏಜೆಂಟ್ (autonomous-agent) ನಡವಳಿಕೆಗಳಿಗೆ ಪ್ರತ್ಯೇಕ ಎಕ್ಸ್‌ಪರ್ಟ್ ಸಬ್-ನೆಟ್‌ವರ್ಕ್‌ಗಳನ್ನು ಹಂಚಿಕೆ ಮಾಡುತ್ತದೆ. quantized KV ಕ್ಯಾಶೆಗಳು ಅನುಮತಿಸುವ ದೊಡ್ಡ ಸಂದರ್ಭದ ವಿಂಡೋಗಳಿಂದ (context windows) ಈ ಮಾದರಿಯ ಮಾಡ್ಯುಲಾರಿಟಿ ಪ್ರಯೋಜನ ಪಡೆಯಬಹುದು.

ಕ್ಲೌಡ್‌ನಿಂದ ದೂರವಿರಲು ಬಯಸುವ ಆದರೆ ಇತ್ತೀಚಿನ ಸಾಮರ್ಥ್ಯಗಳ ಅಗತ್ಯವಿರುವ ಡೆವಲಪರ್‌ಗಳಿಗೆ ಈ ಎರಡೂ ಮಾದರಿಗಳು ಹೆಚ್ಚಿನ ಆಯ್ಕೆಗಳನ್ನು ನೀಡುತ್ತವೆ.

GPU ಡ್ರೈವರ್ ಮತ್ತು ಶೆಡ್ಯೂಲರ್ ಅಪ್‌ಡೇಟ್‌ಗಳು

llama.cpp ಇಂಟೆಲ್ GPUಗಳಿಗೆ ದಾರಿ ಮಾಡಿಕೊಡುತ್ತಿದ್ದರೆ, Nvidia ಬಳಕೆದಾರರನ್ನು ನಿರ್ಲಕ್ಷಿಸಲಾಗಿಲ್ಲ. ಲಿನಕ್ಸ್ ಡ್ರೈವರ್ ಸ್ಟ್ಯಾಕ್ 610.57.04 ಆವೃತ್ತಿಗೆ ಬದಲಾಗಿದೆ, ಇದು ಇತ್ತೀಚಿನ ಕರ್ನಲ್‌ಗಳಲ್ಲಿ CUDA ಸ್ಥಿರತೆಯನ್ನು ಸುಧಾರಿಸುವ ಬಗ್ ಫಿಕ್ಸ್‌ಗಳನ್ನು ತರುತ್ತದೆ. AMD ಕಡೆಯಲ್ಲಂತೂ, ROCm ಪರಿಸರ ವ್ಯವಸ್ಥೆಯು ಹೈ-ಪರ್ಫಾರ್ಮೆನ್ಸ್ ಕಂಪ್ಯೂಟಿಂಗ್ ಮತ್ತು AI ಕೆಲಸಗಳಿಗಾಗಿ ಉದ್ದೇಶಿಸಲಾದ Spur ಎಂಬ ಜಾಬ್ ಶೆಡ್ಯೂಲರ್ ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ. Spur GPU ಕ್ಲಸ್ಟರ್‌ಗಳಾದ್ಯಂತ ಉತ್ತಮ ಬಳಕೆ (utilization) ವಾಗುವುದನ್ನು ಭರವಸೆ ನೀಡುತ್ತದೆ, ಇದು ಏಕಕಾಲದಲ್ಲಿ ಅನೇಕ ಇನ್ಫರೆನ್ಸ್ ಕೆಲಸಗಳನ್ನು ನಡೆಸುವ ತಂಡಗಳಿಗೆ ಉಪಯುಕ್ತವಾಗಬಹುದು.

ಹೈ-ಎಂಡ್ GPUಗಳ ಮೇಲೆ ಬೆಲೆಯ ಒತ್ತಡ

ಅದೇ ಸಮಯದಲ್ಲಿ, ಉನ್ನತ ಶ್ರೇಣಿಯ ಗ್ರಾಫಿಕ್ಸ್ ಕಾರ್ಡ್‌ಗಳ ಮಾರುಕಟ್ಟೆಯು ಬಿಗಡಾಯಿಸುತ್ತಿದೆ. ಮುಂಬರುವ RTX 50 ಸರಣಿಯ ಬೆಲೆಗಳು ಪ್ರಸ್ತುತ ಮಟ್ಟಕ್ಕಿಂತ ಸುಮಾರು 30% ಹೆಚ್ಚಾಗಬಹುದು ಎಂದು ವರದಿಗಳು ಸೂಚಿಸುತ್ತಿವೆ. ಉದಾಹರಣೆಗೆ, RTX 5090 ಬೆಲೆಯು $5,100 ಮಿತಿಯನ್ನು ಮೀರಿರಬಹುದು, ಇದಕ್ಕೆ GDDR7 ಮೆಮೊರಿ ವೆಚ್ಚ ಮತ್ತು TSMC ನ ಇತ್ತೀಚಿನ ಪ್ರಕ್ರಿಯೆಯ ವೇಫರ್ ಸಾಮರ್ಥ್ಯ ಕಾರಣವಾಗಿದೆ. ಸಣ್ಣ ಪ್ರಯೋಗಾಲಯಗಳು ಮತ್ತು ಹವ್ಯಾಸಿಗಳಿಗೆ, ಹೆಚ್ಚುತ್ತಿರುವ ವೆಚ್ಚವು Intel ಅಥವಾ AMD GPUಗಳಂತಹ ಪರ್ಯಾಯಗಳ ಬಗ್ಗೆ ಗಂಭೀರವಾಗಿ ಯೋಚಿಸುವಂತೆ ಮಾಡುತ್ತದೆ, ವಿಶೇಷವಾಗಿ ಈಗ llama.cpp ಅವುಗಳಿಂದ ಹೆಚ್ಚಿನ ಪ್ರಯೋಜನವನ್ನು ಪಡೆಯಬಲ್ಲದು ಎಂಬ ಕಾರಣಕ್ಕೆ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

  • llama.cpp ನ ಮುಂದಿನ ಬಿಡುಗಡೆಗಳು – ಮುಂಬರುವ ಪ್ಯಾಚ್‌ಗಳು SYCL ಬೆಂಬಲವನ್ನು ಹೆಚ್ಚುವರಿ quantization ಯೋಜನೆಗಳಿಗೆ ವಿಸ್ತರಿಸಬಹುದು ಅಥವಾ ಮಿಕ್ಸ್-ಪ್ರೆಸಿಷನ್ ಕರ್ನಲ್‌ಗಳನ್ನು ಸೇರಿಸಬಹುದು.
  • ಡ್ರೈವರ್ ಸ್ಥಿರತೆ – ಆರಂಭಿಕ ಬಳಕೆದಾರರು Nvidia ನ 610.57.04 ಬಿಡುಗಡೆಯನ್ನು ಗಮನಿಸಬೇಕು, ಏಕೆಂದರೆ ಇದು ಕಾರ್ಯಕ್ಷಮತೆಯ ಲಾಭಗಳನ್ನು ಕಡಿಮೆ ಮಾಡುವ ಯಾವುದೇ ಹಿನ್ನಡೆಗಳನ್ನು (regressions) ತರಬಹುದು.
  • AMD ನ ಶೆಡ್ಯೂಲರ್ ಅಳವಡಿಕೆ – ಹೆಚ್ಚು ಕ್ಲಸ್ಟರ್‌ಗಳು ಇದನ್ನು ಅಳವಡಿಸಿಕೊಂಡು ಬಳಕೆ ಮಾಪನಗಳನ್ನು (utilization metrics) ವರದಿ ಮಾಡಿದಂತೆ Spur ನ ಪ್ರಭಾವವು ಸ್ಪಷ್ಟವಾಗುತ್ತದೆ.
  • GPU ಬೆಲೆ ಪ್ರವೃತ್ತಿಗಳು – ಒಂದು ವೇಳೆ RTX 50 ಸರಣಿಯ ಬೆಲೆಗಳು ಹಾಗೆಯೇ ಉಳಿದರೆ, ಇನ್ಫರೆನ್ಸ್ ಕೆಲಸಗಳಿಗಾಗಿ ಹೆಚ್ಚು ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿ Intel ಅಥವಾ AMD ಹಾರ್ಡ್‌ವೇರ್‌ಗಳ ಕಡೆಗೆ ಬದಲಾವಣೆ ಕಾಣಬಹುದು.

llama.cpp b10255 ಅಪ್‌ಡೇಟ್ ಓಪನ್-ಸೋರ್ಸ್ ಪರಿಕರಗಳು ಹಾರ್ಡ್‌ವೇರ್ ಪ್ರಗತಿಯೊಂದಿಗೆ ಹೆಜ್ಜೆ ಹಾಕಬಲ್ಲವು ಎಂಬುದನ್ನು ತೋರಿಸುತ್ತದೆ, ಆದರೆ ಮಾದರಿಗಳು, ಡ್ರೈವರ್‌ಗಳು ಮತ್ತು ಬೆಲೆಗಳಂತಹ ವಿಶಾಲವಾದ ಪರಿಸರ ವ್ಯವಸ್ಥೆಯು ಡೆವಲಪರ್‌ಗಳು ನಿಜವಾಗಿಯೂ ಸ್ಥಳೀಯವಾಗಿ ಉಳಿಯಲು ಸಾಧ್ಯವೇ ಎಂಬುದನ್ನು ನಿರ್ಧರಿಸುತ್ತದೆ.