Le nouveau modèle 1-bit Bonsai 27B de PrismML tient dans un fichier de 3,9 Go et fonctionne à environ 11 jetons par seconde sur un iPhone 17 Pro Max, prouvant qu'un modèle de langage de 27 milliards de paramètres peut vivre sur un smartphone grand public. Cette avancée est importante car elle repousse les limites de l'IA sur l'appareil (on-device), promettant des assistants hors ligne plus riches sans envoyer de données vers le cloud.
Pourquoi cette réduction est importante
Le modèle Bonsai 27B en pleine précision pèse 54,7 Go. En quantifiant le modèle vers une représentation sur un seul bit, PrismML l'a réduit à 3,9 Go, soit une réduction de taille de 14 fois. Cette compression rend le modèle techniquement stockable sur les iPhones haut de gamme, un seuil qui excluait auparavant tout ce qui dépassait quelques centaines de mégaoctets.
Performances du modèle sur le matériel Apple
PrismML a conçu le modèle pour la pile MLX d'Apple, l'ensemble d'API qui permet aux développeurs d'exécuter des réseaux de neurones directement sur le Neural Engine. Lors de ses propres tests, le modèle a généré environ 11 jetons par seconde sur un iPhone 17 Pro Max. Sur 15 benchmarks standards de modèles de langage, la version 1-bit a conservé 89,5 % des scores de qualité du modèle original, ce qui suggère que la compression n'a pas compromis son utilité.
Limites pratiques à prévoir
- Pression sur la mémoire – Le fichier de 3,9 Go tient, mais le modèle nécessite également un cache clé-valeur (KV) pour stocker le contexte récent. Ce cache augmente avec la longueur de la conversation et peut accroître l'utilisation de la RAM du téléphone, ce qui risque de ralentir la vitesse.
- Chaleur et batterie – L'exécution d'un réseau de 27 milliards de paramètres sollicite intensément le Neural Engine. Les téléphones ont tendance à chauffer sous une charge soutenue, et la gestion thermique d'Apple réduira les performances pour protéger le matériel. PrismML n'a pas publié de chiffres concrets sur la consommation de la batterie ; le coût réel pour une utilisation quotidienne reste donc inconnu.
- Spécificité des appareils – L'affirmation de performance s'applique au dernier iPhone 17 Pro Max. Les iPhones plus anciens, les appareils iOS d'entrée de gamme ou les téléphones Android ne disposent pas des mêmes capacités de Neural Engine et connaîtront une inférence plus lente ou pourraient ne pas pouvoir faire tourner le modèle du tout.
Qui en bénéficiera, et qui pourrait être laissé pour compte
Les développeurs d'applications axées sur la confidentialité peuvent désormais héberger un grand modèle de langage directement sur l'appareil, conservant ainsi les données utilisateur sur le téléphone. Cela pourrait se traduire par des assistants vocaux plus réactifs, de la traduction hors ligne ou de la génération de texte contextuelle sans abonnement au cloud.
Les fabricants Android et les utilisateurs de téléphones de milieu de gamme sont exclus. Le modèle repose sur la pile propriétaire d'Apple, donc la même compression ne fonctionnera pas automatiquement sur d'autres écosystèmes.
Ce qui reste à tester
Les chiffres de PrismML proviennent de benchmarks internes. Des testeurs indépendants devront vérifier les taux de jetons par seconde lors de sessions prolongées, mesurer la consommation réelle de la batterie et évaluer la rapidité avec laquelle les performances se dégradent à mesure que le cache KV s'étend. L'utilisation en conditions réelles — discuter pendant une heure, diffuser du contenu ou exécuter le modèle parallèlement à d'autres applications — révélera si le chiffre de 11 jetons par seconde se maintient en dehors d'un laboratoire contrôlé.
À retenir
Bonsai 27B démontre que les modèles de langage de 27 milliards de paramètres peuvent être suffisamment compressés pour fonctionner sur un iPhone haut de gamme, offrant une qualité quasi complète à une vitesse modeste. Cette percée repose sur la pile MLX d'Apple et fait encore face à des obstacles pratiques : surcharge de la mémoire, bridage thermique et impact inconnu sur la batterie. Si des tests complémentaires confirment ces affirmations, l'IA sur l'appareil pourrait passer de démonstrations de niche à des applications quotidiennes — à condition que l'écart matériel entre les fleurons iOS et le reste du marché se réduise.
