Yerel büyük dil modellerini çalıştırmak sizi genellikle bir donanım çıkmazına sokar. NVIDIA kullanıcıları CUDA ekosistemi içinde yaşar. Apple geliştiricileri Metal'i tercih eder. Geri kalan herkes GPU'sunun OpenCL desteklemesini umar veya doğrudan CPU'ya geri döner. Bu parçalanmışlık, bir masaüstü yapay zeka uygulaması yayınlamayı olması gerekenden daha zor hale getiriyor. TensorSharp, bir Vulkan backend'i ekleyerek bu sorunu aşmaya başladı ve motora farklı üreticilerin ayrık GPU'ları arasında güvenilir bir yol sundu.

Vulkan Denklemi Neden Değiştiriyor

Vulkan genellikle oyun çevrelerinde tartışılır, ancak düşük yük getiren, platformlar arası bir hesaplama API'si olarak çıkarım (inference) için de bir o kadar önemlidir. CUDA'nın görmezden geldiği donanımlara ulaşır. Intel UHD ve Iris Xe entegre yongaları. Eski ayrık kartlar. Üzerinde NVIDIA etiketi bulunmayan bütçe dostu Windows dizüstü bilgisayarlar. Yerel bir çıkarım motoru için bu erişim, pratik bir güç demektir. Bir geliştirici, yalnızca CUDA tabanlı bir çözümün yapabileceğinden çok daha fazla makinede çalışan tek bir binary yolu sunabilir.

TensorSharp'ın Vulkan desteği GGML projesi aracılığıyla ilk kez görücüye çıktı. Yazar daha sonra yerel bir Vulkan backend'i oluşturmayı planlasa da, bu entegrasyon bugün işlevseldir. GGML'i bir köprü olarak kullanmak doğru bir hazırlık hamlesiydi. Bu, mimariyi doğrular ve donanımı anında test edenlerin ellerine ulaştırır. Soyutlama yükünü ortadan kaldırmak ve C#-merkezli motora komut tamponları ve bellek bariyerleri üzerinde daha hassas kontrol sağlamak için yerel bir backend takip edecektir.

Test Ortamı Şu Ana Kadar Nasıl Görünüyor

Doğrulama şimdiden iki çok farklı Windows yapılandırmasını kapsıyor. Geliştirici, bir NVIDIA GeForce RTX 3080 Laptop GPU ve düz Intel UHD Graphics üzerinde testler yaptı. Her ikisi de iyi çalıştı. Bu aralık dikkat çekmeye değer. Çıkarım dünyasında, yüksek watt değerine sahip ayrık silikonlar ile temel ent

vLLM'den gelen continuous batching özelliği, throughput değerini artırır. Motor, mevcut grubun bitmesini beklemek yerine yeni istekleri aktif batch'lerin arasına dahil edebilir. Bir kullanıcının prompt'u on token, bir başkasınınki ise iki yüz token ise, donanım daha yoğun çalışır ve ortalama gecikme düşer.

Mixture-of-Experts modelleri için TensorSharp, oMLX'ten alınan SSD tabanlı bir önbellek stratejisi uygular. Sık erişilen uzman ağırlıkları, sistem RAM'i için yarışmak yerine hızlı depolama biriminde hazır bekler. Belleği sınırlı ancak iyi NVMe sürücülerine sahip makinelerde, bu durum MoE mimarilerinin kullanılabilir kalmasını sağlar.

Kuantizasyon, llama.cpp tarafından belirlenen GGUF standardını takip eder. Kuantize edilmiş 4-bit ve 5-bit modelleriniz, bir dönüştürme adımına gerek kalmadan doğrudan yüklenir.

Asıl Çıkarım

Vulkan desteği, TensorSharp'ı ilginç bir C# deneyinden heterojen donanımlar için pratik bir çıkarım (inference) seçeneğine dönüştürür. Yol haritası net: AMD ve Intel ayrık donanımlarda doğrulamayı yapın, ardından yerel bir Vulkan backend'i ile uygulamayı sağlamlaştırın. İş istasyonunuzda veya dizüstü bilgisayarınızda bir AMD kartınız varsa, sürümü çalıştırın ve sonuçlarınızı paylaşın. Bu geribildirim döngüsü, deneysel kodu yayına alabileceğiniz bir şeye dönüştüren şeydir.

Sürüm detaylarını geliştiricinin yazısında bulabilirsiniz. Eğer proje sizi CUDA toolkit'leri arasında mekik dokumaktan veya macOS versiyon kilitleriyle boğuşmaktan kurtarıyorsa, repository'ye bir yıldız bırakın. Devam eden tartışmalar ve topluluk test başlıkları için Telegram grubu açık kalmaya devam ediyor.