150 milyar parametreli bir Mixture-of-Experts (MoE) modeli, standart bir geliştirici dizüstü bilgisayarında metin üretebilir. Deney, performansın asıl sınırlayıcısının SSD hızı değil, RAM olduğunu gösteriyor. Bu durum önemlidir çünkü sınır ölçekli modellerin, bulut bilişim maliyetine katlanmadan yerel olarak test edilebileceğini kanıtlıyor.
Test
REAP ile budanmış 150 milyar parametreli bir MoE olan DeepSeek V4 Flash modelini, açık kaynaklı Colibrì çıkarım motoru üzerinden çalıştırdık. Donanım, 61 GB RAM ve 1 TB NVMe SSD'ye sahip bir AMD Ryzen AI 9 365 dizüstü bilgisayardı. Üç dakikalık bir üretim sürecini zamanladık ve her disk erişimini kaydettik.
Rakamlar Ne Anlatıyor
- Disk aktivitesi minimum düzeydeydi. SSD, üç dakikalık üretim sırasında 11 saniyeden daha az okuma yaptı. Sürücü verileri anında okuyabilse bile, toplam verim (throughput) yalnızca yaklaşık yüzde 6 oranında artardı.
- RAM boyutu hızı doğrudan etkiledi. RAM önbelleğinin yarıya indirilmesi, verimi yaklaşık yüzde 15 düşürdü. İşlemci (CPU), disk beklerken harcadığı kadar zamanı önbellek kaçırmalarını (de-quantising, kopyalama ve veri yönetimi) işlemek için harcadı.
Bu rakamlar, depolama bant genişliğinin bir dizüstü bilgisayarda büyük modellerin çıkarımı için birincil darboğaz olduğu yönündeki yaygın inanışı çürütüyor.
RAM Neden SSD'den Daha Üstün
Bir model parametresi henüz RAM'de bulunmuyorsa, sistem şunları yapmalıdır:
- Veriyi SSD'den çekmek.
- Veriyi çözmek (decode) ve hesaplama için CPU kayıtçılarına (registers) taşımak.
Her iki adım da döngü (cycle) tüketir. İlk adım SSD'nin bant genişliği ile sınırlıdır; ikinci adım ise yaklaşık aynı gecikmeyi ekler çünkü CPU, verinin ne kadar hızlı geldiğine bakılmaksızın veriyi de-kuantize etmek zorundadır. Bu nedenle, daha hızlı bir SSD azalan getiriler sağlarken, daha fazla RAM modelin daha büyük bir kısmının bellekte kalmasına olanak tanır ve maliyetli gidiş-dönüş sürecini ortadan kaldırır.
Geliştiriciler İçin Çıkarımlar
- Depolamaya değil, belleğe yatırım yapın.
- Yerel testler uygulanabilir hale geliyor. Geliştiriciler, bulut kredileri için ödeme yapmadan mevcut makinelerinde açık ağırlıklı (open-weight) MoE modellerini çalıştırabilir; stil, araç çağırma (tool-calling) davranışı ve çıktı kalitesini kontrol edebilirler.
- Toplu değerlendirme (batch evaluation) gerçekçidir. Gerçek zamanlı sohbet hala yavaş hissettirebilir, ancak araştırma için düzinelerce istem (prompt) üretmek gibi kuyruğa alınmış işler bir dizüstü bilgisayarda rahatlıkla çalışır.
Potansiyel Karşı Argüman
Bazıları, sürekli yeni uzman ağırlıklarının (expert weights) yüklendiği iş yükleri için SSD gecikmesinin hala önemli olduğunu savunabilir.
Sırada Neleri Takip Etmeli
- Bellek verimli model varyantları.
- Daha büyük çip içi (on-chip) önbelleklere sahip donanımlar.
- Yazılım düzeyinde önbelleğe alma stratejileri.
Özetle durum net: Dev MoE modellerini bir dizüstü bilgisayarda denemek isteyen geliştiriciler daha fazla RAM satın almalıdır. SSD yükseltmeleri sadece birkaç yüzdelik fark yaratırken, ekstra bellek çıkarım süresini çift haneli yüzdelerle azaltabilir. Bu durum, yapay zeka prototipleme için maliyet hesabını değiştiriyor ve daha önce özel bulut kümeleri gerektirdiği düşünülen modellerin yerel ve ücretsiz olarak test edilmesinin önünü açıyor.
