Ollama RC 更新:Qwen3.5 与流式传输修复

Ollama v0.32.6-rc0 已发布。它为 Apple GPU 用户带来了更新,并修复了流式传输问题。

Apple 用户的新功能: MLX 引擎现在在配合 Qwen3.5 使用时,通过 MTP head 进行投机解码(speculative decoding)。该过程会提前预测 token。主模型随后进行批量验证。这减少了解码过程中的等待时间。

Ollama 表示这会让 Qwen3.5 运行得更快。他们在说明中并未提供具体的基准测试数据或速度提升百分比。在未进行自行测试前,请勿假设会有特定的速度提升。

流式传输兼容性: 此更新更改了 /v1/chat/completions 端点处理流式传输的方式。如果您的软件依赖于特定的 chunk 或 finish_reason 数据,请务必先进行测试。对于生产工作流而言,行为的可预测性与速度同样重要。

重要警告:

  • 这是一个发布候选版本(RC)。它不是稳定版。
  • 实验性图像生成功能暂时移除。
  • 如果您需要图像生成功能,请保留在 0.32.5 版本。

如何操作:

  • 如果您使用 Apple GPU 并希望获得更好的 Qwen3.5 性能,请立即进行测试。
  • 如果您需要图像生成功能或高稳定性,请等待正式稳定版发布。
  • 分别测量 prefill 和 decode 速度。MTP 有助于解码,但可能不会改变所有任务的总延迟。

来源:https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

可选学习社区:https://t.me/GyaanSetuAi