Ollama RC アップデート: Qwen3.5 とストリーミングの修正

Ollama v0.32.6-rc0 がリリースされました。Apple GPU ユーザー向けのアップデートと、ストリーミングの問題の修正が含まれています。

Apple ユーザー向けの新しい機能: MLX エンジンが Qwen3.5 で投機的デコーディング(speculative decoding)を行う際、MTP ヘッドを使用するようになりました。このプロセスでは、トークンを事前に予測し、メインモデルがそれらをバッチ処理で検証します。これにより、デコーディング中の待ち時間が短縮されます。

Ollama は、これにより Qwen3.5 が高速化されると述べています。ただし、リリースノートには具体的なベンチマークや速度のパーセンテージは記載されていません。ご自身でテストを行わずに、特定の速度向上を前提としないようにしてください。

ストリーミングの互換性: このアップデートにより、/v1/chat/completions エンドポイントのストリーミング処理方法が変更されます。お使いのソフトウェアが特定のチャンクや finish_reason データに依存している場合は、事前にテストを行ってください。プロダクション環境のワークフローにおいては、速度と同じくらい予測可能な動作が重要です。

重要な警告:

  • これはリリース候補版(RC)です。安定版ではありません。
  • 実験的な画像生成機能は一時的に削除されています。
  • 画像生成が必要な場合は、バージョン 0.32.5 を使用し続けてください。

今後の進め方:

  • Apple GPU を使用しており、Qwen3.5 のパフォーマンス向上を求める場合は、今すぐテストしてください。
  • 画像生成や高い安定性が必要な場合は、安定版のリリースを待ってください。
  • プリフィル(prefill)速度とデコード速度を個別に測定してください。MTP はデコーディングを補助しますが、すべてのタスクにおいて総レイテンシが変化するとは限りません。

ソース: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

オプションの学習コミュニティ: https://t.me/GyaanSetuAi