Оновлення Ollama RC: Qwen3.5 та виправлення стрімінгу

Вийшла Ollama v0.32.6-rc0. Вона приносить оновлення для користувачів Apple GPU та виправляє проблеми зі стрімінгом.

Нові можливості для користувачів Apple:

Рушій MLX тепер використовує MTP head для спекулятивного декодування з Qwen3.5. Цей процес передбачає токени заздалегідь. Основна модель перевіряє їх пакетами. Це скорочує час очікування під час декодування.

Ollama заявляє, що це робить Qwen3.5 швидшим. У примітках не наведено конкретних бенчмарків або відсотків приросту швидкості. Не робіть висновків про конкретне збільшення швидкості без власних тестів.

Сумісність стрімінгу:

Оновлення змінює те, як ендпоінт /v1/chat/completions обробляє стрімінг. Якщо ваше програмне забезпечення покладається на конкретні чанки (chunks) або дані finish_reason, спочатку протестуйте це. Передбачувана поведінка так само важлива для робочих процесів (production workflows), як і швидкість.

Важливі попередження:

  • Це реліз-кандидат (release candidate). Це не стабільна версія.
  • Експериментальна генерація зображень тимчасово недоступна.
  • Залишайтеся на версії 0.32.5, якщо вам потрібна генерація зображень.

Як діяти далі:

  • Протестуйте це зараз, якщо ви використовуєте Apple GPU і хочете кращої продуктивності Qwen3.5.
  • Зачекайте на стабільний реліз, якщо вам потрібна генерація зображень або висока стабільність.
  • Вимірюйте швидкість prefill та декодування окремо. MTP допомагає декодуванню, але може не змінити загальну затримку (latency) для кожного завдання.

Джерело: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Додаткова спільнота для навчання: https://t.me/GyaanSetuAi