Ollama RC Güncellemesi: Qwen3.5 ve Streaming Düzeltmeleri

Ollama v0.32.6-rc0 yayınlandı. Apple GPU kullanıcıları için güncellemeler getiriyor ve streaming sorunlarını gideriyor.

Apple Kullanıcıları İçin Yeni Özellikler: MLX motoru artık Qwen3.5 ile spekülatif kod çözme (speculative decoding) için MTP head kullanıyor. Bu süreç, token'ları önceden tahmin eder. Ana model bunları gruplar halinde doğrular. Bu, kod çözme sırasındaki bekleme süresini azaltır.

Ollama, bunun Qwen3.5'i daha hızlı hale getirdiğini belirtiyor. Notlarda belirli kıyaslamalar (benchmarks) veya hız yüzdeleri paylaşılmadı. Kendi testlerinizi yapmadan belirli bir hız artışı varsaymayın.

Streaming Uyumluluğu: Güncelleme, /v1/chat/completions uç noktasının (endpoint) streaming işlemini nasıl yönettiğini değiştiriyor. Yazılımınız belirli chunk'lara veya finish_reason verilerine dayanıyorsa, önce test edin. Üretim iş akışları için öngörülebilir davranış, hız kadar önemlidir.

Önemli Uyarılar:

  • Bu bir sürüm adaydır (release candidate). Kararlı bir sürüm değildir.
  • Deneysel görsel oluşturma özelliği geçici olarak kaldırıldı.
  • Görsel oluşturmaya ihtiyacınız varsa 0.32.5 sürümünde kalın.

Nasıl ilerlenmeli:

  • Bir Apple GPU kullanıyorsanız ve daha iyi Qwen3.5 performansı istiyorsanız bunu hemen test edin.
  • Görsel oluşturmaya veya yüksek kararlılığa ihtiyacınız varsa kararlı bir sürümü bekleyin.
  • Prefill ve decode hızlarını ayrı ayrı ölçün. MTP kod çözmeye yardımcı olur ancak her görev için toplam gecikmeyi (latency) değiştirmeyebilir.

Kaynak: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

İsteğe bağlı öğrenme topluluğu: https://t.me/GyaanSetuAi