Ollama RC Update: Qwen3.5 et correctifs de streaming

Ollama v0.32.6-rc0 est disponible. Elle apporte des mises à jour pour les utilisateurs de GPU Apple et corrige des problèmes de streaming.

Nouvelles fonctionnalités pour les utilisateurs Apple : Le moteur MLX utilise désormais la tête MTP pour le décodage spéculatif avec Qwen3.5. Ce processus prédit les tokens à l'avance. Le modèle principal les vérifie par lots. Cela réduit le temps d'attente pendant le décodage.

Ollama affirme que cela rend Qwen3.5 plus rapide. Ils n'ont pas fourni de benchmarks spécifiques ou de pourcentages de vitesse dans les notes. Ne supposez pas une augmentation de vitesse spécifique sans effectuer vos propres tests.

Compatibilité du streaming : La mise à jour modifie la manière dont l'endpoint /v1/chat/completions gère le streaming. Si votre logiciel repose sur des chunks spécifiques ou sur les données finish_reason, testez-le d'abord. Un comportement prévisible est aussi important que la vitesse pour les flux de travail en production.

Avertissements importants :

  • Il s'agit d'une version candidate (release candidate). Ce n'est pas une version stable.
  • La génération d'images expérimentale a été temporairement supprimée.
  • Restez sur la version 0.32.5 si vous avez besoin de la génération d'images.

Comment procéder :

  • Testez cela dès maintenant si vous utilisez un GPU Apple et souhaitez de meilleures performances avec Qwen3.5.
  • Attendez une version stable si vous avez besoin de la génération d'images ou d'une grande stabilité.
  • Mesurez séparément les vitesses de prefill et de décodage. Le MTP aide au décodage mais peut ne pas modifier la latence totale pour chaque tâche.

Source : https://dev.to/lucioliu/ollamas-latest-rc-improves-qwen35-on-apple-gpus-and-fixes-streaming-compatibility-2gb3

Communauté d'apprentissage optionnelle : https://t.me/GyaanSetuAi