Ollama RC Update: Qwen3.5 und Streaming-Fixes
Ollama v0.32.6-rc0 ist verfügbar. Es bringt Updates für Apple-GPU-Nutzer und behebt Probleme beim Streaming.
Neue Funktionen für Apple-Nutzer: Die MLX-Engine nutzt nun den MTP-Head für speculative Decoding mit Qwen3.5. Dieser Prozess sagt Token im Voraus voraus. Das Hauptmodell verifiziert diese in Batches. Dies reduziert die Wartezeit während des Decodings.
Ollama gibt an, dass dies Qwen3.5 schneller macht. In den Release Notes wurden keine spezifischen Benchmarks oder Geschwindigkeits-Prozentangaben gemacht. Gehen Sie ohne eigene Tests nicht von einer bestimmten Geschwindigkeitssteigerung aus.
Streaming-Kompatibilität:
Das Update ändert die Art und Weise, wie der /v1/chat/completions-Endpunkt das Streaming handhabt. Wenn Ihre Software auf spezifische Chunks oder finish_reason-Daten angewiesen ist, testen Sie dies zuerst. Vorhersehbares Verhalten ist für Produktions-Workflows ebenso wichtig wie Geschwindigkeit.
Wichtige Warnhinweise:
- Dies ist ein Release Candidate. Es handelt sich nicht um eine stabile Version.
- Die experimentelle Bildgenerierung ist vorübergehend entfernt.
- Bleiben Sie bei Version 0.32.5, wenn Sie die Bildgenerierung benötigen.
So gehen Sie vor:
- Testen Sie dies jetzt, wenn Sie eine Apple-GPU verwenden und eine bessere Qwen3.5-Performance wünschen.
- Warten Sie auf ein stabiles Release, wenn Sie Bildgenerierung oder hohe Stabilität benötigen.
- Messen Sie Prefill- und Decode-Geschwindigkeiten separat. MTP hilft beim Decoding, verändert aber möglicherweise nicht die Gesamtlatenz für jede Aufgabe.
Optionale Lern-Community: https://t.me/GyaanSetuAi
