Cập nhật Ollama RC: Qwen3.5 và các bản sửa lỗi Streaming

Ollama v0.32.6-rc0 đã ra mắt. Bản cập nhật này mang đến những cải tiến cho người dùng Apple GPU và sửa các lỗi liên quan đến streaming.

Các tính năng mới dành cho người dùng Apple: Công cụ MLX hiện sử dụng MTP head để thực hiện speculative decoding với Qwen3.5. Quá trình này dự đoán các token trước. Sau đó, mô hình chính sẽ xác thực chúng theo từng đợt (batches). Điều này giúp giảm thời gian chờ đợi trong quá trình giải mã.

Ollama cho biết điều này giúp Qwen3.5 chạy nhanh hơn. Họ không cung cấp các kết quả benchmark cụ thể hoặc tỷ lệ phần trăm tốc độ trong ghi chú. Đừng mặc định rằng tốc độ sẽ tăng lên một mức cụ thể nếu chưa tự mình kiểm tra.

Khả năng tương thích Streaming: Bản cập nhật thay đổi cách endpoint /v1/chat/completions xử lý streaming. Nếu phần mềm của bạn phụ thuộc vào các chunk cụ thể hoặc dữ liệu finish_reason, hãy kiểm tra kỹ trước. Trong các quy trình làm việc thực tế (production workflows), tính ổn định và khả năng dự đoán cũng quan trọng như tốc độ.

Cảnh báo quan trọng:

  • Đây là bản release candidate. Nó chưa phải là phiên bản ổn định.
  • Tính năng tạo ảnh thử nghiệm (experimental image generation) tạm thời bị loại bỏ.
  • Hãy tiếp tục sử dụng phiên bản 0.32.5 nếu bạn cần tính năng tạo ảnh.

Cách thực hiện:

  • Hãy thử nghiệm ngay nếu bạn đang dùng Apple GPU và muốn cải thiện hiệu suất của Qwen3.5.
  • Hãy đợi bản phát hành ổn định (stable release) nếu bạn cần tính năng tạo ảnh hoặc yêu cầu độ ổn định cao.
  • Hãy đo lường tốc độ prefill và decode một cách riêng biệt. MTP hỗ trợ giải mã (decoding) nhưng có thể không làm thay đổi tổng độ trễ (latency) cho mọi tác vụ.

Nguồn: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Cộng đồng học tập tùy chọn: https://t.me/GyaanSetuAi