Ollama RC Update: Qwen3.5 and Streaming Fixes

Ollama v0.32.6-rc0 telah dikeluarkan. Ia membawakan kemas kini untuk pengguna GPU Apple dan membaiki isu penstriman.

New Features for Apple Users: Enjin MLX kini menggunakan kepala MTP untuk speculative decoding dengan Qwen3.5. Proses ini meramalkan token lebih awal. Model utama akan mengesahkannya dalam kelompok (batches). Ini mengurangkan masa menunggu semasa proses nyahkod (decoding).

Ollama menyatakan bahawa ini menjadikan Qwen3.5 lebih pantas. Mereka tidak menyediakan penanda aras (benchmarks) atau peratusan kelajuan yang khusus dalam nota tersebut. Jangan andaikan peningkatan kelajuan tertentu tanpa melakukan ujian sendiri.

Streaming Compatibility: Kemas kini ini mengubah cara endpoint /v1/chat/completions mengendalikan penstriman. Jika perisian anda bergantung pada chunks tertentu atau data finish_reason, uji ia terlebih dahulu. Tingkah laku yang boleh diramal adalah sama pentingnya dengan kelajuan untuk aliran kerja pengeluaran (production workflows).

Important Warnings:

  • Ini adalah calon keluaran (release candidate). Ia bukan versi stabil.
  • Penjanaan imej eksperimental telah dialih keluar buat sementara waktu.
  • Kekal pada versi 0.32.5 jika anda memerlukan penjanaan imej.

How to proceed:

  • Uji ini sekarang jika anda menggunakan GPU Apple dan mahukan prestasi Qwen3.5 yang lebih baik.
  • Tunggu keluaran stabil jika anda memerlukan penjanaan imej atau kestabilan tinggi.
  • Ukur kelajuan prefill dan decode secara berasingan. MTP membantu proses nyahkod tetapi mungkin tidak mengubah kependaman (latency) keseluruhan bagi setiap tugasan.

Source: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Optional learning community: https://t.me/GyaanSetuAi