POCKET-35B, un modèle de langage de 35 milliards de paramètres publié par VIDRAFT, peut désormais être exécuté sur un ordinateur portable doté uniquement d'un processeur (CPU). Les poids du modèle au format GGUF se chargent directement dans llama.cpp ou Ollama, ce qui permet aux équipes n'ayant aucun budget GPU de commencer à expérimenter immédiatement. En l'espace de sept semaines après son lancement, le modèle a dépassé le million de téléchargements sur Hugging Face, se classant au 13e rang de tous les téléchargements GGUF dans le monde.
Pourquoi un LLM fonctionnant uniquement sur CPU est important aujourd'hui
Les entreprises qui doivent conserver des textes propriétaires — e-mails clients, tickets internes, extraits de code — sur site manquent souvent de fonds pour acquérir des cartes graphiques dédiées. Jusqu'à récemment, la seule option pratique consistait à envoyer les données vers une API hébergée dans le cloud, sacrifiant ainsi la confidentialité et engendrant des coûts récurrents. POCKET-35B promet un juste milieu : un modèle suffisamment large pour gérer des prompts complexes tout en respectant les limites de mémoire d'un ordinateur portable de bureau ou d'un mini-PC classique.
Comment le modèle tient sur un ordinateur portable
- Format GGUF – un conteneur binaire qui stocke des poids quantifiés.
- Compatibilité – llama.cpp et Ollama incluent tous deux des environnements d'exécution (runtimes) capables de lire les fichiers GGUF et d'exécuter l'inférence sur des CPU. Un GPU intégré peut être utilisé pour décharger quelques couches, mais ce n'est pas obligatoire.
- Vérification de la RAM – la taille du fichier GGUF correspond à la quantité minimale de RAM nécessaire. Si la taille du fichier est, par exemple, de quelques gigaoctets, une machine disposant d'au moins autant de mémoire libre est requise avant même le début du téléchargement.
Étapes pour faire fonctionner POCKET-35B sur votre ordinateur portable
- Vérifier la mémoire – ouvrez le gestionnaire de tâches de votre système, notez la RAM totale et comparez-la à la taille du fichier GGUF indiquée sur la page Hugging Face.
- Choisir la bonne quantification – commencez par la version Q4 ; elle offre un bon équilibre entre taille et vitesse pour la plupart des ordinateurs portables.
- Télécharger via llama.cpp ou Ollama – ces deux outils peuvent récupérer le modèle directement depuis Hugging Face, en gérant automatiquement la vérification de la somme de contrôle (checksum).
- Effectuer un test de bon fonctionnement rapide – lancez l'environnement d'exécution avec un simple prompt « Hello, world » pour confirmer que le chargement réussit.
- Créer une suite de tests (benchmark) réaliste – rassemblez 30 à 50 tâches qui reflètent votre charge de travail de production (par exemple, la classification de catégories de tickets, la rédaction de réponses par e-mail). Exécutez-les via le modèle et enregistrez la latence ainsi que la qualité de la sortie des tokens.
- Tester la couverture linguistique – la documentation de POCKET-35B ne mentionne pas de liste de langues. Si vous avez besoin du vietnamien ou d'autres scripts non anglais, soumettez quelques phrases accentuées et observez si le modèle produit une sortie cohérente.
- Mesurer la latence réelle – enregistrez les temps par prompt sur votre matériel spécifique ; ne vous fiez pas aux chiffres de benchmark publiés par d'autres utilisateurs disposant de CPU ou de bandes passantes RAM différents.
Ce que les chiffres de téléchargement ne vous disent pas
Un million de téléchargements témoigne d'une forte curiosité de la communauté, mais ne garantit pas la performance. Les capacités de raisonnement, les compétences en génération de code et le respect des instructions du modèle n'ont pas fait l'objet d'un audit indépendant. VIDRAFT n'a pas divulgué les détails de l'architecture du modèle ni les sources des données d'entraînement, laissant un vide informationnel qui rend le déploiement en production risqué.
Risques et contre-arguments
- Qualité incertaine – sans métriques d'évaluation publiées, vous ne pouvez pas être certain que POCKET-35B égale la précision d'autres alternatives open-source.
- Incertitudes de niveau production – le manque de transparence architecturale rend plus difficile la prédiction du comportement face à des prompts adverses ou des entrées de cas limites (edge cases).
L'essentiel
Si votre équipe a besoin d'expérimenter avec un LLM de 35 milliards de paramètres aujourd'hui et n'a pas les moyens de s'offrir un GPU, POCKET-35B offre un point d'entrée viable et à faible coût. Le modèle fonctionne sur un ordinateur portable standard via le format GGUF, et les environnements d'exécution open-source simplifient l'installation. Cependant, considérez le modèle comme expérimental : vérifiez les besoins en mémoire, effectuez des tests avec des tâches réelles et confirmez la gestion des langues avant de l'intégrer dans un pipeline de production. À mesure que les données de la communauté s'accumuleront et que VIDRAFT publiera plus de détails, le profil de risque deviendra plus clair — mais pour l'instant, un simple ordinateur portable peut effectivement héberger un LLM de 35 B, bien qu'avec des attentes modérées.
