Prism ML, Qwen 3.6 büyük dil modelinin bir versiyonu olan ve bir cep telefonuna sığabilen Bonsai 27B'yi piyasaya sürdü. Şirket, 54 GB'lık orijinal boyutu 1-bit kuantizasyon ile 4 GB'ın altına düşürerek 14 katlık bir boyut küçültmesi sağlıyor ve kullanıcıların modeli bulut API çağrıları yapmadan yerel olarak çalıştırmasına olanak tanıyor.

Sıkıştırma neden önemli

LLM'ler, ağırlıkları onlarca gigabayt yer kapladığı için genellikle masaüstü sınıfı bir GPU veya ücretli bir API'ye ihtiyaç duyar. Kuantizasyon —ağırlık başına daha az bit kullanılması— modeli küçültür ancak bilgileri de yok edebilir. Bonsai iki uç seçenek sunuyor: bir ternary (üçlü) varyant (üç olası ağırlık değeri, 7,2 GB) ve agresif bir 1-bit varyant (3,9 GB). Boyut ve yetenek arasındaki ödünleşim, testi yönlendiren temel unsurdur.

Modeller olgusal hatırlama konusunda nasıl performans gösteriyor

Orijinal Qwen 3.6, test paketindeki tüm tarihsel tarih sorularını doğru yanıtladı. Ternary Bonsai, altı sorudan beşini kaçırdı; 1-bit versiyonu ise tüm tarih sorgularında başarısız oldu. Beklendiği gibi, agresif sıkıştırma önce nadir ve spesifik gerçekleri eliyor, yalnızca akıcılığı sağlayan geniş dil kalıplarını koruyor.

Kodlama performansı farklı bir hikaye anlatıyor

Komutlar kodlama görevlerine geçtiğinde sonuçlar tersine döndü. Her üç model de klasik eşzamanlılık (concurrency) hatalarını hatasız bir şekilde çözdü. Zorlu bir React animasyon görevinde, 1-bit Bonsai iki denemede bitirirken, orijinal model kodu ayrıştırmak (parsing) için fazladan zaman harcadığından dört denemeye ihtiyaç duydu. Ternary versiyon ise on deneme gerektirdi ve sonunda test sunucusunu çökertti.

Pratik engeller

Bonsai, popüler Ollama çalışma zamanında (runtime) çalışmıyor. 1-bit modelin Prism ML tarafından sağlanan özel bir yürütme katmanına ihtiyacı var, bu nedenle kullanıcıların modeli çalıştırmak için standart olmayan yazılımlar yüklemesi gerekiyor. Bu bağımlılık, modelin cazibesini yalnızca ortamını özelleştirmeye alışkın olan kişilerle sınırlandırıyor.

Bonsai'yi kimler düşünmeli, kimler uzak durmalı

  • Genel amaçlı sohbet – Olgusal detaylardaki büyük kayıp, Bonsai'yi bir bilgi tabanı asistanı olarak kullanılamaz hale getiriyor. Tarih, bilim veya güncel olaylara dair doğru yanıtlar için orijinal modele veya bir bulut API'sine sadık kalın.
  • Yerel kodlama yardımcısı – Kod önerebilen, hataları yakalayabilen ve bir telefonda veya düşük donanımlı bir dizüstü bilgisayarda çalışabilen çevrimdışı bir araç isteyen geliştiriciler, 1-bit versiyonun hız ve düşük depolama maliyeti sunduğunu görecektir. Otonom bir ajan değildir ancak mantık ve sözdizimini (syntax) verimli bir şekilde işler.

Özetle

Bonsai 27B, 54 GB'lık bir LLM'yi telefon dostu 3,9 GB'a sıkıştırabileceğinizi ve yine de şaşırtıcı derecede hızlı, yetkin kod önerileri alabileceğinizi gösteriyor. Bunun bedeli, spesifik olgusal hatırlamanın neredeyse tamamen yok olmasıdır; bu nedenle model, ansiklopedik bilgiden ziyade çevrimdışı hıza değer veren geliştiricilerin araç çantasında yer almalıdır.