Ollama RC Update: Qwen3.5 i poprawki streamingu

Ollama v0.32.6-rc0 jest już dostępna. Przynosi aktualizacje dla użytkowników procesorów graficznych Apple oraz naprawia problemy ze streamingiem.

Nowe funkcje dla użytkowników Apple: Silnik MLX wykorzystuje teraz nagłówek MTP do dekodowania spekulatywnego (speculative decoding) z Qwen3.5. Proces ten przewiduje tokeny z wyprzedzeniem. Główny model weryfikuje je partiami. Zmniejsza to czas oczekiwania podczas dekodowania.

Ollama twierdzi, że dzięki temu Qwen3.5 działa szybciej. W notatkach nie podano konkretnych wyników benchmarków ani procentowego wzrostu prędkości. Nie zakładaj konkretnego przyspieszenia bez przeprowadzenia własnych testów.

Kompatybilność streamingu: Aktualizacja zmienia sposób, w jaki endpoint /v1/chat/completions obsługuje streaming. Jeśli Twoje oprogramowanie polega na konkretnych fragmentach (chunks) lub danych finish_reason, przetestuj je najpierw. Przewidywalne działanie jest w procesach produkcyjnych równie ważne jak szybkość.

Ważne ostrzeżenia:

  • To jest wersja release candidate. Nie jest to wersja stabilna.
  • Eksperymentalna generacja obrazów została tymczasowo wyłączona.
  • Pozostań przy wersji 0.32.5, jeśli potrzebujesz generowania obrazów.

Jak postępować:

  • Przetestuj to teraz, jeśli korzystasz z procesora graficznego Apple i chcesz uzyskać lepszą wydajność Qwen3.5.
  • Poczekaj na stabilną wersję, jeśli potrzebujesz generowania obrazów lub wysokiej stabilności.
  • Mierz prędkość prefill i dekodowania oddzielnie. MTP pomaga w dekodowaniu, ale może nie zmienić całkowitego opóźnienia (latency) w każdym zadaniu.

Źródło: https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Opcjonalna społeczność edukacyjna: https://t.me/GyaanSetuAi