Ollama RC Update: Qwen3.5 and Streaming Fixes
Вышла версия Ollama v0.32.6-rc0. Она содержит обновления для пользователей Apple GPU и исправляет проблемы со стримингом.
New Features for Apple Users: Движок MLX теперь использует MTP-голову для спекулятивного декодирования (speculative decoding) с Qwen3.5. Этот процесс предсказывает токены заранее. Основная модель проверяет их пакетами. Это сокращает время ожидания во время декодирования.
В Ollama заявляют, что это ускоряет Qwen3.5. В примечаниях не указаны конкретные бенчмарки или процент прироста скорости. Не делайте выводов о конкретном увеличении скорости без собственных тестов.
Streaming Compatibility:
Обновление меняет способ обработки стриминга эндпоинтом /v1/chat/completions. Если ваше ПО полагается на специфические чанки (chunks) или данные finish_reason, сначала протестируйте его. Предсказуемое поведение так же важно для рабочих процессов, как и скорость.
Important Warnings:
- Это релиз-кандидат (RC). Это не стабильная версия.
- Экспериментальная генерация изображений временно отключена.
- Оставайтесь на версии 0.32.5, если вам нужна генерация изображений.
How to proceed:
- Протестируйте это сейчас, если вы используете Apple GPU и хотите повысить производительность Qwen3.5.
- Подождите стабильного релиза, если вам нужна генерация изображений или высокая стабильность.
- Измеряйте скорость префилла (prefill) и декодирования отдельно. MTP помогает декодированию, но может не изменить общую задержку (latency) для каждой конкретной задачи.
Optional learning community: https://t.me/GyaanSetuAi
