Ollama RC Update: Qwen3.5 i poprawki streamingu
Ollama v0.32.6-rc0 jest już dostępna. Przynosi aktualizacje dla użytkowników procesorów graficznych Apple oraz naprawia problemy ze streamingiem.
Nowe funkcje dla użytkowników Apple: Silnik MLX wykorzystuje teraz nagłówek MTP do dekodowania spekulatywnego (speculative decoding) z Qwen3.5. Proces ten przewiduje tokeny z wyprzedzeniem. Główny model weryfikuje je partiami. Zmniejsza to czas oczekiwania podczas dekodowania.
Ollama twierdzi, że dzięki temu Qwen3.5 działa szybciej. W notatkach nie podano konkretnych wyników benchmarków ani procentowego wzrostu prędkości. Nie zakładaj konkretnego przyspieszenia bez przeprowadzenia własnych testów.
Kompatybilność streamingu:
Aktualizacja zmienia sposób, w jaki endpoint /v1/chat/completions obsługuje streaming. Jeśli Twoje oprogramowanie polega na konkretnych fragmentach (chunks) lub danych finish_reason, przetestuj je najpierw. Przewidywalne działanie jest w procesach produkcyjnych równie ważne jak szybkość.
Ważne ostrzeżenia:
- To jest wersja release candidate. Nie jest to wersja stabilna.
- Eksperymentalna generacja obrazów została tymczasowo wyłączona.
- Pozostań przy wersji 0.32.5, jeśli potrzebujesz generowania obrazów.
Jak postępować:
- Przetestuj to teraz, jeśli korzystasz z procesora graficznego Apple i chcesz uzyskać lepszą wydajność Qwen3.5.
- Poczekaj na stabilną wersję, jeśli potrzebujesz generowania obrazów lub wysokiej stabilności.
- Mierz prędkość prefill i dekodowania oddzielnie. MTP pomaga w dekodowaniu, ale może nie zmienić całkowitego opóźnienia (latency) w każdym zadaniu.
Opcjonalna społeczność edukacyjna: https://t.me/GyaanSetuAi
