Pembaruan Ollama RC: Qwen3.5 dan Perbaikan Streaming
Ollama v0.32.6-rc0 telah dirilis. Pembaruan ini menghadirkan peningkatan bagi pengguna Apple GPU dan memperbaiki masalah streaming.
Fitur Baru untuk Pengguna Apple:
Mesin MLX kini menggunakan MTP head untuk speculative decoding dengan Qwen3.5. Proses ini memprediksi token lebih awal. Model utama kemudian memverifikasinya dalam bentuk batch. Hal ini mengurangi waktu tunggu selama proses decoding.
Ollama menyatakan bahwa hal ini membuat Qwen3.5 lebih cepat. Mereka tidak memberikan benchmark spesifik atau persentase kecepatan dalam catatan rilisnya. Jangan berasumsi ada peningkatan kecepatan tertentu tanpa melakukan pengujian sendiri.
Kompatibilitas Streaming:
Pembaruan ini mengubah cara endpoint /v1/chat/completions menangani streaming. Jika perangkat lunak Anda bergantung pada chunk tertentu atau data finish_reason, lakukan pengujian terlebih dahulu. Perilaku yang dapat diprediksi sama pentingnya dengan kecepatan untuk alur kerja produksi.
Peringatan Penting:
- Ini adalah release candidate. Ini bukan versi stabil.
- Fitur pembuatan gambar eksperimental untuk sementara ditiadakan.
- Tetaplah di versi 0.32.5 jika Anda membutuhkan fitur pembuatan gambar.
Cara Melanjutkan:
- Uji sekarang jika Anda menggunakan Apple GPU dan menginginkan performa Qwen3.5 yang lebih baik.
- Tunggu rilis stabil jika Anda membutuhkan fitur pembuatan gambar atau stabilitas tinggi.
- Ukur kecepatan prefill dan decode secara terpisah. MTP membantu proses decoding tetapi mungkin tidak mengubah latensi total untuk setiap tugas.
Komunitas belajar opsional: https://t.me/GyaanSetuAi
