Оновлення Ollama RC: Qwen3.5 та виправлення стрімінгу
Вийшла Ollama v0.32.6-rc0. Вона приносить оновлення для користувачів Apple GPU та виправляє проблеми зі стрімінгом.
Нові можливості для користувачів Apple:
Рушій MLX тепер використовує MTP head для спекулятивного декодування з Qwen3.5. Цей процес передбачає токени заздалегідь. Основна модель перевіряє їх пакетами. Це скорочує час очікування під час декодування.
Ollama заявляє, що це робить Qwen3.5 швидшим. У примітках не наведено конкретних бенчмарків або відсотків приросту швидкості. Не робіть висновків про конкретне збільшення швидкості без власних тестів.
Сумісність стрімінгу:
Оновлення змінює те, як ендпоінт /v1/chat/completions обробляє стрімінг. Якщо ваше програмне забезпечення покладається на конкретні чанки (chunks) або дані finish_reason, спочатку протестуйте це. Передбачувана поведінка так само важлива для робочих процесів (production workflows), як і швидкість.
Важливі попередження:
- Це реліз-кандидат (release candidate). Це не стабільна версія.
- Експериментальна генерація зображень тимчасово недоступна.
- Залишайтеся на версії 0.32.5, якщо вам потрібна генерація зображень.
Як діяти далі:
- Протестуйте це зараз, якщо ви використовуєте Apple GPU і хочете кращої продуктивності Qwen3.5.
- Зачекайте на стабільний реліз, якщо вам потрібна генерація зображень або висока стабільність.
- Вимірюйте швидкість prefill та декодування окремо. MTP допомагає декодуванню, але може не змінити загальну затримку (latency) для кожного завдання.
Додаткова спільнота для навчання: https://t.me/GyaanSetuAi
