Un modèle Mixture-of-Experts de 150 milliards de paramètres peut générer du texte sur un ordinateur portable de développeur standard. L'expérience montre que la RAM, et non la vitesse du SSD, est le véritable facteur limitant des performances. Cela est important car cela prouve que les modèles de pointe sont testables localement sans avoir à payer pour du calcul dans le cloud.
Le test
Nous avons fait tourner le modèle DeepSeek V4 Flash — un MoE de 150 milliards de paramètres élagué par REAP — via le moteur d'inférence open-source Colibrì. Le matériel utilisé était un ordinateur portable AMD Ryzen AI 9 365 doté de 61 Go de RAM et d'un SSD NVMe de 1 To. Nous avons chronométré une session de génération de trois minutes et consigné chaque accès au disque.
Ce que révèlent les chiffres
- L'activité du disque était minimale. Le SSD a effectué moins de 11 secondes de lecture pendant la génération de trois minutes. Même si le disque pouvait lire les données instantanément, le débit total ne s'améliorerait que d'environ 6 %.
- La taille de la RAM a directement impacté la vitesse. Réduire de moitié le cache RAM a diminué le débit d'environ 15 %. Le processeur a passé presque autant de temps à gérer les échecs de cache — déquantification, copie et gestion des données — qu'à attendre le disque.
Ces chiffres renversent la croyance commune selon laquelle la bande passante du stockage est le principal goulot d'étranglement pour l'inférence de grands modèles sur un ordinateur portable.
Pourquoi la RAM l'emporte sur le SSD
Lorsqu'un paramètre de modèle n'est pas déjà présent en RAM, le système doit :
- Extraire les données du SSD.
- Les décoder et les déplacer dans les registres du processeur pour le calcul.
Ces deux étapes consomment des cycles. La première étape est limitée par la bande passante du SSD ; la seconde ajoute approximativement le même délai car le processeur doit déquantifier les données, quelle que soit la vitesse à laquelle elles arrivent. Un SSD plus rapide offre donc des rendements décroissants, tandis qu'une RAM plus importante permet de maintenir une plus grande partie du modèle en mémoire et élimine cet aller-retour coûteux.
Implications pour les développeurs
- Investissez dans la mémoire, pas dans le stockage.
- Le test local devient viable. Les développeurs peuvent exécuter des modèles MoE à poids ouverts sur des machines existantes, en vérifiant le style, le comportement d'appel d'outils (tool-calling) et la qualité de sortie sans payer de crédits cloud.
- L'évaluation par lots est réaliste. Le chat en temps réel peut encore sembler lent, mais les tâches en file d'attente — comme la génération de dizaines de prompts pour la recherche — s'exécutent confortablement sur un ordinateur portable.
Contre-argument potentiel
Certains pourraient arguer que la latence du SSD compte toujours pour les charges de travail qui chargent de manière répétée de nouveaux poids d'experts.
À surveiller ensuite
- Les variantes de modèles économes en mémoire.
- Le matériel doté de caches intégrés plus importants.
- Les stratégies de mise en cache au niveau logiciel.
Le constat est clair : les développeurs qui souhaitent expérimenter avec des modèles MoE massifs sur un ordinateur portable devraient acheter plus de RAM. L'amélioration du SSD ne réduit le temps que de quelques pourcentages, tandis qu'une mémoire supplémentaire peut réduire le temps d'inférence de plusieurs dizaines de pourcentages. Cela modifie le calcul des coûts pour le prototypage d'IA et ouvre la porte à des tests locaux et gratuits de modèles que l'on pensait auparavant nécessiter des clusters cloud dédiés.
