Ollama RC Update: Qwen3.5 และการแก้ไขปัญหาการสตรีม (Streaming)

Ollama v0.32.6-rc0 ออกมาแล้ว โดยมีการอัปเดตสำหรับผู้ใช้ Apple GPU และแก้ไขปัญหาเรื่องการสตรีม (streaming)

New Features สำหรับผู้ใช้ Apple: ขณะนี้ MLX engine ได้ใช้ MTP head สำหรับการทำ speculative decoding กับ Qwen3.5 กระบวนการนี้จะคาดการณ์ token ล่วงหน้า โดยที่โมเดลหลักจะทำการตรวจสอบข้อมูลเหล่านั้นเป็นชุดๆ (batches) ซึ่งช่วยลดระยะเวลาการรอระหว่างการถอดรหัส (decoding)

Ollama ระบุว่าสิ่งนี้ทำให้ Qwen3.5 ทำงานได้เร็วขึ้น อย่างไรก็ตาม พวกเขาไม่ได้ระบุผลทดสอบ (benchmarks) หรือเปอร์เซ็นต์ความเร็วที่ชัดเจนไว้ในบันทึกการอัปเดต ดังนั้นอย่าเพิ่งสรุปเรื่องความเร็วที่เพิ่มขึ้นโดยไม่ได้ทำการทดสอบด้วยตนเอง

Streaming Compatibility: การอัปเดตนี้มีการเปลี่ยนแปลงวิธีการที่ endpoint /v1/chat/completions จัดการกับการสตรีม หากซอฟต์แวร์ของคุณต้องพึ่งพาข้อมูล chunks หรือ finish_reason ที่เฉพาะเจาะจง ควรทำการทดสอบก่อน เนื่องจากพฤติกรรมที่คาดเดาได้นั้นมีความสำคัญพอๆ กับความเร็วสำหรับเวิร์กโฟลว์ในระดับโปรดักชัน (production workflows)

Important Warnings:

  • นี่คือ release candidate (RC) ยังไม่ใช่เวอร์ชันที่เสถียร (stable)
  • ฟีเจอร์การสร้างรูปภาพแบบทดลอง (experimental image generation) ถูกนำออกไปชั่วคราว
  • หากคุณจำเป็นต้องใช้การสร้างรูปภาพ ให้ใช้เวอร์ชัน 0.32.5 ต่อไป

How to proceed:

  • ทดสอบเวอร์ชันนี้ได้ทันทีหากคุณใช้ Apple GPU และต้องการประสิทธิภาพของ Qwen3.5 ที่ดีขึ้น
  • รอเวอร์ชันเสถียร (stable release) หากคุณต้องการใช้การสร้างรูปภาพหรือต้องการความเสถียรสูง
  • ควรวัดความเร็วในการ prefill และ decode แยกกัน เนื่องจาก MTP ช่วยในเรื่องการ decode แต่อาจไม่ได้เปลี่ยนค่า latency รวมสำหรับทุกงาน

Source: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Optional learning community: https://t.me/GyaanSetuAi