يضيف llama.cpp b10255 دعماً لذاكرة التخزين المؤقت للمفاتيح والقيم (KV-cache) المكممة (quantized) القائمة على SYCL، مما يتيح لمستخدمي وحدات معالجة الرسومات من Intel تشغيل نماذج أكبر أو سياقات أطول بتنسيقات Q4_0 وQ8_0 وFP32. وتعد هذه التغييرات باستنتاج محلي أسرع بشكل ملحوظ، وهي دفعة تهم أي شخص يحاول إبقاء أعباء عمل الذكاء الاصطناعي محلياً (on-premise) دون الحاجة لشراء جهاز مخصص لـ Nvidia فقط.

لماذا يعد تحديث llama.cpp مهماً

لقد كان مشروع llama.cpp المحرك مفتوح المصدر المفضل لتشغيل نماذج LLaMA-style على مجموعة واسعة من الأجهزة. يقدم الإصدار b10255 تنفيذاً لـ SYSL لتقنية SDPA (scaled dot-product attention) الخاصة بـ oneDNN والتي تعمل مع ذاكرات التخزين المؤقت للمفاتيح والقيم المكممة. تعمل عملية التكميم (Quantization) على تقليص حجم ذاكرة التخزين المؤقت، مما يؤدي إلى تحسين عرض نطاق الذاكرة وزمن الاستجابة بشكل كبير على وحدات معالجة الرسومات من Intel التي تدعم SYCL. يمكن للمستخدمين الآن اختيار Q4_0 أو Q8_0 أو الدقة الكاملة FP32، مضحين بقدر ضئيل من الدقة مقابل مكاسب كبيرة في السرعة واستهلاك الذاكرة. بالنسبة للمطورين الذين يبنون مساعدي دردشة محليين أو نماذج بحثية أولية، فإن القدرة على حشر المزيد من السياق في نفس وحدة معالجة الرسومات قد تكون هي الفارق بين عرض تجريبي قابل للاستخدام وتجربة متعثرة.

خيارات نماذج جديدة على Hugging Face

ظهر نموذجان على Hugging Face يتماشيان مع التركيز على الأداء في تحديث llama.cpp.

  • DeepSeek-V4-Flash-0731 يروج للسرعة كميزة بيع أساسية. تم ضبط بنيته لتطبيقات الدردشة المحلية سريعة الاستجابة على وحدات معالجة الرسومات المخصصة للمستهلكين، مما يجعله متوافقاً بشكل طبيعي مع مسار العمل الجديد المسرع بواسطة SYCL.
  • KAT-Coder-V2.5-Dev يستخدم تصميم "خليط من الخبراء" (Mixture of Experts)، حيث يخصص شبكات فرعية خبيرة منفصلة لمهام البرمجة وسلوك الوكيل المستقل. يمكن لنمطية النموذج أن تستفيد من نوافذ السياق الأكبر التي تتيحها ذاكرات KV-cache المكممة.

يوسع كلا النموذجين الخيارات للمطورين الذين يرغبون في البقاء بعيداً عن السحابة ولكنهم لا يزالون بحاجة إلى قدرات حديثة.

تحديثات برامج تشغيل وحدات معالجة الرسومات والمجدول

بينما يفتح llama.cpp الباب أمام وحدات معالجة الرسومات من Intel، فإن مستخدمي Nvidia ليسوا منسيين. انتقلت حزمة برامج تشغيل Linux إلى الإصدار 610.57.04، مما جلب مجموعة من إصلاحات الأخطاء التي تحسن استقرار CUDA على النوى (kernels) الحديثة. ومن جانب AMD، أطلق نظام ROCm البيئي أداة Spur، وهو مجدول مهام يهدف إلى الحوسبة عالية الأداء وأعباء عمل الذكاء الاصطناعي. يعد Spur بتحسين الاستفادة عبر مجموعات وحدات معالجة الرسومات (GPU clusters)، وهي ميزة قد تهم الفرق التي تشغل العديد من مهام الاستنتاج المتزامنة.

ضغوط الأسعار على وحدات معالجة الرسومات المتطورة

في الوقت نفسه، تشهد سوق بطاقات الرسومات من الفئة العليا حالة من التضييق. تشير التقارير إلى أن سلسلة RTX 50 القادمة قد تشهد ارتفاعاً في الأسعار بنسبة 30% تقريباً عن المستويات الحالية. على سبيل المثال، قد تكسر RTX 5090 حاجز الـ 5,100 دولار، مدفوعة بتكلفة ذاكرة GDDR7 وسعة الرقائق في أحدث عمليات تصنيع TSMC. بالنسبة للمختبرات الصغيرة والهواة، فإن التكاليف المتزايدة تفرض نظرة أكثر جدية على البدائل مثل وحدات معالجة الرسومات من Intel أو AMD، خاصة الآن بعد أن أصبح بإمكان llama.cpp استخراج أداء أكبر منها.

ما يجب مراقبته لاحقاً

  • إصدارات llama.cpp الإضافية – قد تمدد التحديثات القادمة دعم SYCL لمخططات تكميم إضافية أو تضيف نوى (kernels) ذات دقة مختلطة.
  • استقرار برامج التشغيل – يجب على المستخدمين الأوائل مراقبة طرح Nvidia للإصدار 610.57.04 بحثاً عن أي تراجعات قد تلغي مكاسب الأداء.
  • اعتماد مجدول AMD – سيصبح تأثير Spur أكثر وضوحاً مع قيام المزيد من المجموعات (clusters) بتفعيله والإبلاغ عن مقاييس الاستخدام.
  • اتجاهات أسعار وحدات معالجة الرسومات – إذا استمرت أسعار سلسلة RTX 50، فقد نشهد تحولاً نحو أجهزة Intel أو AMD الأكثر فعالية من حيث التكلفة لأعباء عمل الاستنتاج.

يُظهر تحديث llama.cpp b10255 أن الأدوات مفتوحة المصدر يمكنها مواكبة التطورات في الأجهزة، ولكن النظام البيئي الأوسع — النماذج وبرامج التشغيل والأسعار — هو ما سيحدد ما إذا كان المطورون قادرين حقاً على تحمل تكلفة البقاء محلياً.