Ollama RC Update: Qwen3.5 and Streaming Fixes

Вышла версия Ollama v0.32.6-rc0. Она содержит обновления для пользователей Apple GPU и исправляет проблемы со стримингом.

New Features for Apple Users: Движок MLX теперь использует MTP-голову для спекулятивного декодирования (speculative decoding) с Qwen3.5. Этот процесс предсказывает токены заранее. Основная модель проверяет их пакетами. Это сокращает время ожидания во время декодирования.

В Ollama заявляют, что это ускоряет Qwen3.5. В примечаниях не указаны конкретные бенчмарки или процент прироста скорости. Не делайте выводов о конкретном увеличении скорости без собственных тестов.

Streaming Compatibility: Обновление меняет способ обработки стриминга эндпоинтом /v1/chat/completions. Если ваше ПО полагается на специфические чанки (chunks) или данные finish_reason, сначала протестируйте его. Предсказуемое поведение так же важно для рабочих процессов, как и скорость.

Important Warnings:

  • Это релиз-кандидат (RC). Это не стабильная версия.
  • Экспериментальная генерация изображений временно отключена.
  • Оставайтесь на версии 0.32.5, если вам нужна генерация изображений.

How to proceed:

  • Протестируйте это сейчас, если вы используете Apple GPU и хотите повысить производительность Qwen3.5.
  • Подождите стабильного релиза, если вам нужна генерация изображений или высокая стабильность.
  • Измеряйте скорость префилла (prefill) и декодирования отдельно. MTP помогает декодированию, но может не изменить общую задержку (latency) для каждой конкретной задачи.

Source: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Optional learning community: https://t.me/GyaanSetuAi