llama.cpp b10255, Intel GPU kullanıcılarının Q4_0, Q8_0 ve FP32 formatlarıyla daha büyük modelleri veya daha uzun bağlamları çalıştırmasına olanak tanıyan SYCL tabanlı kuantize edilmiş KV-cache desteği ekliyor. Bu değişiklik, yalnızca Nvidia tabanlı bir sistem satın almadan yapay zeka iş yüklerini yerel olarak tutmaya çalışan herkes için önemli olan, fark edilir derecede daha hızlı yerel çıkarım vaat ediyor.
llama.cpp güncellemesi neden önemli
llama.cpp projesi, LLaMA tarzı modelleri çok çeşitli donanımlarda çalıştırmak için başvurulan açık kaynaklı motor olmuştur. Versiyon b10255, kuantize edilmiş anahtar-değer (key-value) önbellekleri ile çalışan oneDNN'in SDPA (scaled dot-product attention) yapısının bir SYCL uygulamasını sunuyor. Kuantizasyon, önbellek boyutunu küçülterek SYCL destekleyen Intel GPU'larda bellek bant genişliğini ve gecikmesini önemli ölçüde iyileştirir. Kullanıcılar artık doğruluktan küçük bir ödün vererek hız ve bellek kullanımında büyük kazanç sağlayan Q4_0, Q8_0 veya tam hassasiyetli FP32 seçeneklerinden birini seçebilirler. Yerel sohbet asistanları veya araştırma prototipleri geliştiren geliştiriciler için, aynı GPU'ya daha fazla bağlam sığdırabilme yeteneği, kullanılabilir bir demo ile duraksayan bir deney arasındaki farkı belirleyebilir.
Hugging Face'te yeni model seçenekleri
Hugging Face'te, llama.cpp güncellemesinin performans odağıyla örtüşen iki model ortaya çıktı.
- DeepSeek-V4-Flash-0731, hızı birincil satış noktası olarak öne çıkarıyor. Mimarisi, tüketici sınıfı GPU'larda hızlı yerel sohbet uygulamaları için optimize edilmiştir, bu da onu yeni SYCL hızlandırmalı iş akışıyla doğal bir eşleşme haline getirir.
- KAT-Coder-V2.5-Dev, kodlama görevleri ve otonom ajan davranışları için ayrı uzman alt ağları tahsis eden bir Mixture of Experts tasarımı kullanır. Modelin modülerliği, kuantize edilmiş KV önbelleklerinin sağladığı daha geniş bağlam pencerelerinden yararlanabilir.
Her iki model de bulut dışında kalmak isteyen ancak yine de güncel yeteneklere ihtiyaç duyan geliştiriciler için seçenekleri genişletiyor.
GPU sürücü ve zamanlayıcı güncellemeleri
llama.cpp Intel GPU'ların kapısını aralarken, Nvidia kullanıcıları da geride bırakılmıyor. Linux sürücü yığını 610.57.04 versiyon
