Ollama RC アップデート: Qwen3.5 とストリーミングの修正
Ollama v0.32.6-rc0 がリリースされました。Apple GPU ユーザー向けのアップデートと、ストリーミングの問題の修正が含まれています。
Apple ユーザー向けの新しい機能: MLX エンジンが Qwen3.5 で投機的デコーディング(speculative decoding)を行う際、MTP ヘッドを使用するようになりました。このプロセスでは、トークンを事前に予測し、メインモデルがそれらをバッチ処理で検証します。これにより、デコーディング中の待ち時間が短縮されます。
Ollama は、これにより Qwen3.5 が高速化されると述べています。ただし、リリースノートには具体的なベンチマークや速度のパーセンテージは記載されていません。ご自身でテストを行わずに、特定の速度向上を前提としないようにしてください。
ストリーミングの互換性:
このアップデートにより、/v1/chat/completions エンドポイントのストリーミング処理方法が変更されます。お使いのソフトウェアが特定のチャンクや finish_reason データに依存している場合は、事前にテストを行ってください。プロダクション環境のワークフローにおいては、速度と同じくらい予測可能な動作が重要です。
重要な警告:
- これはリリース候補版(RC)です。安定版ではありません。
- 実験的な画像生成機能は一時的に削除されています。
- 画像生成が必要な場合は、バージョン 0.32.5 を使用し続けてください。
今後の進め方:
- Apple GPU を使用しており、Qwen3.5 のパフォーマンス向上を求める場合は、今すぐテストしてください。
- 画像生成や高い安定性が必要な場合は、安定版のリリースを待ってください。
- プリフィル(prefill)速度とデコード速度を個別に測定してください。MTP はデコーディングを補助しますが、すべてのタスクにおいて総レイテンシが変化するとは限りません。
オプションの学習コミュニティ: https://t.me/GyaanSetuAi
