Prism ML a lancé Bonsai 27B, une version du modèle de langage étendu Qwen 3.6 qui tient sur un téléphone mobile. En compressant l'original de 54 Go à moins de 4 Go grâce à une quantification en 1 bit, l'entreprise parvient à une réduction de taille de 14× et permet aux utilisateurs d'exécuter le modèle localement, sans appels d'API via le cloud.
Pourquoi la compression est importante
Les LLM nécessitent généralement un GPU de classe bureau ou une API payante car leurs poids occupent des dizaines de gigaoctets. La quantification — l'utilisation de moins de bits par poids — réduit la taille du modèle mais peut également supprimer des connaissances. Bonsai propose deux extrêmes : une variante ternaire (trois valeurs de poids possibles, 7,2 Go) et une variante agressive en 1 bit (3,9 Go). Le compromis entre taille et capacité est au cœur de ce test.
Performances des modèles en matière de rappel factuel
Le Qwen 3.6 original a répondu correctement à chaque question sur les dates historiques de la suite de tests. Le Bonsai ternaire en a manqué cinq sur six, et la version 1 bit a échoué à toutes les requêtes de dates. Comme prévu, une compression agressive élimine d'abord les faits rares et spécifiques, ne préservant que les schémas linguistiques larges qui assurent la fluidité.
Les performances en codage racontent une autre histoire
Lorsque les prompts sont passés à des tâches de codage, les résultats se sont inversés. Les trois modèles ont résolu des bugs de concurrence classiques sans erreur. Sur un défi d'animation React exigeant, le Bonsai 1 bit a terminé en deux tentatives, tandis que l'original en a nécessité quatre car il a passé du temps supplémentaire à analyser le code. La version ternaire a nécessité dix tentatives et a fini par faire planter le serveur de test.
Obstacles pratiques
Bonsai ne fonctionne pas sur le runtime populaire Ollama. Le modèle 1 bit nécessite une couche d'exécution personnalisée fournie par Prism ML, les utilisateurs doivent donc installer un logiciel non standard pour le faire fonctionner. Cette dépendance limite l'attrait du modèle à ceux qui sont à l'aise avec la configuration de leur environnement.
Qui devrait envisager Bonsai, et qui devrait passer son chemin
- Chat polyvalent – La perte drastique de détails factuels rend Bonsai inadapté en tant qu'assistant de base de connaissances. Pour des réponses précises en histoire, en science ou sur l'actualité, tenez-vous-en au modèle original ou à une API cloud.
- Aide au codage local – Les développeurs qui souhaitent un outil hors ligne capable de suggérer du code, de détecter des bugs et de fonctionner sur un téléphone ou un ordinateur portable d'entrée de gamme trouveront que la version 1 bit offre rapidité et faible coût de stockage. Ce n'est pas un agent autonome, mais il gère la logique et la syntaxe efficacement.
L'essentiel
Bonsai 27B démontre qu'il est possible de compresser un LLM de 54 Go en un format de 3,9 Go adapté aux téléphones, tout en obtenant des suggestions de code étonnamment rapides et compétentes. Le prix à payer est une érosion quasi totale du rappel factuel spécifique ; le modèle appartient donc à la boîte à outils des développeurs qui privilégient la vitesse hors ligne à la connaissance encyclopédique.
