Ollama RC Update: Qwen3.5 และการแก้ไขปัญหาการสตรีม (Streaming)
Ollama v0.32.6-rc0 ออกมาแล้ว โดยมีการอัปเดตสำหรับผู้ใช้ Apple GPU และแก้ไขปัญหาเรื่องการสตรีม (streaming)
New Features สำหรับผู้ใช้ Apple: ขณะนี้ MLX engine ได้ใช้ MTP head สำหรับการทำ speculative decoding กับ Qwen3.5 กระบวนการนี้จะคาดการณ์ token ล่วงหน้า โดยที่โมเดลหลักจะทำการตรวจสอบข้อมูลเหล่านั้นเป็นชุดๆ (batches) ซึ่งช่วยลดระยะเวลาการรอระหว่างการถอดรหัส (decoding)
Ollama ระบุว่าสิ่งนี้ทำให้ Qwen3.5 ทำงานได้เร็วขึ้น อย่างไรก็ตาม พวกเขาไม่ได้ระบุผลทดสอบ (benchmarks) หรือเปอร์เซ็นต์ความเร็วที่ชัดเจนไว้ในบันทึกการอัปเดต ดังนั้นอย่าเพิ่งสรุปเรื่องความเร็วที่เพิ่มขึ้นโดยไม่ได้ทำการทดสอบด้วยตนเอง
Streaming Compatibility:
การอัปเดตนี้มีการเปลี่ยนแปลงวิธีการที่ endpoint /v1/chat/completions จัดการกับการสตรีม หากซอฟต์แวร์ของคุณต้องพึ่งพาข้อมูล chunks หรือ finish_reason ที่เฉพาะเจาะจง ควรทำการทดสอบก่อน เนื่องจากพฤติกรรมที่คาดเดาได้นั้นมีความสำคัญพอๆ กับความเร็วสำหรับเวิร์กโฟลว์ในระดับโปรดักชัน (production workflows)
Important Warnings:
- นี่คือ release candidate (RC) ยังไม่ใช่เวอร์ชันที่เสถียร (stable)
- ฟีเจอร์การสร้างรูปภาพแบบทดลอง (experimental image generation) ถูกนำออกไปชั่วคราว
- หากคุณจำเป็นต้องใช้การสร้างรูปภาพ ให้ใช้เวอร์ชัน 0.32.5 ต่อไป
How to proceed:
- ทดสอบเวอร์ชันนี้ได้ทันทีหากคุณใช้ Apple GPU และต้องการประสิทธิภาพของ Qwen3.5 ที่ดีขึ้น
- รอเวอร์ชันเสถียร (stable release) หากคุณต้องการใช้การสร้างรูปภาพหรือต้องการความเสถียรสูง
- ควรวัดความเร็วในการ prefill และ decode แยกกัน เนื่องจาก MTP ช่วยในเรื่องการ decode แต่อาจไม่ได้เปลี่ยนค่า latency รวมสำหรับทุกงาน
Optional learning community: https://t.me/GyaanSetuAi
