llama.cpp b10255 ajoute la prise en charge du cache KV quantifié basé sur SYCL, permettant aux utilisateurs de GPU Intel d'exécuter des modèles plus volumineux ou des contextes plus longs avec les formats Q4_0, Q8_0 et FP32. Ce changement promet une inférence locale nettement plus rapide, un gain crucial pour tous ceux qui tentent de maintenir les charges de travail d'IA sur site sans acheter une configuration exclusivement Nvidia.
Pourquoi la mise à jour de llama.cpp est importante
Le projet llama.cpp est devenu le moteur open-source de référence pour exécuter des modèles de type LLaMA sur une large gamme de matériels. La version b10255 introduit une implémentation SYCL de l'SDPA (scaled dot-product attention) de oneDNN qui fonctionne avec des caches clé-valeur (KV) quantifiés. La quantification réduit la taille du cache, ce qui améliore considérablement la bande passante mémoire et la latence sur les GPU Intel prenant en charge SYCL. Les utilisateurs peuvent désormais choisir les formats Q4_0, Q8_0 ou le FP32 en pleine précision, troquant une légère perte de précision contre un gain important en vitesse et en utilisation de la mémoire. Pour les développeurs qui créent des assistants de chat locaux ou des prototypes de recherche, la capacité d'intégrer plus de contexte dans le même GPU peut faire la différence entre une démo exploitable et une expérience qui stagne.
Nouvelles options de modèles sur Hugging Face
Deux modèles ont fait leur apparition sur Hugging Face, s'alignant sur l'accent mis sur la performance par la mise à jour de llama.cpp.
- DeepSeek-V4-Flash-0731 met en avant la vitesse comme principal argument de vente. Son architecture est optimisée pour des applications de chat local réactives sur des GPU grand public, ce qui en fait un partenaire naturel pour le nouveau pipeline accéléré par SYCL.
- KAT-Coder-V2.5-Dev utilise une conception de type Mixture of Experts, allouant des sous-réseaux d'experts distincts aux tâches de codage et au comportement d'agent autonome. La modularité du modèle peut bénéficier des fenêtres de contexte plus larges permises par les caches KV quantifiés.
Ces deux modèles élargissent les choix pour les développeurs qui souhaitent s'affranchir du cloud tout en conservant des capacités de pointe.
Mises à jour des pilotes GPU et des ordonnanceurs
Bien que llama.cpp ouvre la voie aux GPU Intel, les utilisateurs de Nvidia ne sont pas en reste. La pile de pilotes Linux est passée à la version 610.57.04, apportant une série de corrections de bugs qui améliorent la stabilité de CUDA sur les noyaux récents. Du côté d'AMD, l'écosystème ROCm a publié Spur, un ordonnanceur de tâches destiné au calcul haute performance et aux charges de travail d'IA. Spur promet une meilleure utilisation à travers les clusters de GPU, une fonctionnalité qui pourrait compter pour les équipes gérant de nombreux jobs d'inférence simultanés.
Pression sur les prix des GPU haut de gamme
Parallèlement, le marché des cartes graphiques haut de gamme se resserre. Des rapports suggèrent que la prochaine série RTX 50 pourrait voir ses prix grimper d'environ 30 % par rapport aux niveaux actuels. La RTX 5090, par exemple, pourrait franchir la barre des 5 100 $, sous l'effet du coût de la mémoire GDDR7 et de la capacité de production des derniers procédés de TSMC. Pour les petits laboratoires et les passionnés, la hausse des coûts force à examiner de plus près les alternatives comme les GPU Intel ou AMD, d'autant plus que llama.cpp peut désormais en tirer davantage parti.
À surveiller prochainement
- Nouvelles versions de llama.cpp – les prochains correctifs pourraient étendre le support SYCL à d'autres schémas de quantification ou ajouter des noyaux (kernels) à précision mixte.
- Stabilité des pilotes – les premiers utilisateurs devraient surveiller le déploiement de la version 610.57.04 de Nvidia pour détecter d'éventuelles régressions qui pourraient annuler les gains de performance.
- Adoption de l'ordonnanceur d'AMD – l'impact de Spur deviendra plus clair à mesure que davantage de clusters l'activeront et rapporteront des métriques d'utilisation.
- Tendances des prix des GPU – si les prix de la série RTX 50 se confirment, nous pourrions voir un basculement vers du matériel Intel ou AMD plus rentable pour les charges de travail d'inférence.
La mise à jour llama.cpp b10255 montre que les outils open-source peuvent suivre le rythme des avancées matérielles, mais c'est l'écosystème plus large — modèles, pilotes et tarification — qui décidera si les développeurs pourront réellement se permettre de rester en local.
