Nemotron 3 Nano 30B A3B, son prédécesseur, était déjà positionné comme une alternative compacte aux modèles de fondation plus volumineux. En passant à une architecture hybride Mamba-Transformer et en n'activant que 3,6 milliards de paramètres à tout instant, Lightning repousse les limites de l'efficacité tout en offrant une puissance de raisonnement comparable à celle de modèles bien plus importants.

Pourquoi la vitesse est cruciale aujourd'hui

Les agents d'IA passent d'une inférence par lots à une interaction continue. Un chatbot qui marque une pause de plusieurs secondes semble lent ; un outil de complétion de code qui accuse un retard sur la frappe d'un développeur perturbe le flux de travail. Dans ces contextes, le débit de jetons par seconde se traduit directement par la réactivité perçue. Le chiffre de 670 jetons par seconde est environ le double des 386 jetons par seconde rapportés pour le Gemini 3.5 Flash-Lite de Google, et il réduit le temps nécessaire pour accomplir une tâche standard de l'Intelligence Index à environ une demi-minute. En revanche, Qwen 3.6 35B A3B nécessite 3,5 minutes et Gemma 4 31B nécessite 5,8 minutes pour la même tâche.

Cet écart est crucial pour tout service devant gérer de nombreuses requêtes simultanées. Un serveur capable de traiter deux fois plus de jetons sur le même matériel peut soit réduire les coûts, soit doubler la capacité, un avantage manifeste pour les fournisseurs de cloud et les entreprises.

Comment le modèle atteint ces performances

L'architecture hybride de Nemotron 3.5 Lightning combine les forces de reconnaissance de motifs à longue portée des Transformers avec l'efficacité des blocs Mamba basés sur l'espace d'état. La conception maintient un nombre total de paramètres élevé — 31,6 milliards — pour conserver une capacité de modélisation, mais seuls 3,6 milliards sont actifs pour un jeton donné. L'activation parcimonieuse réduit le calcul par jeton, augmentant ainsi le débit sans perte proportionnelle de qualité.

Artificial Analysis a mesuré un score de 24 à l'Intelligence Index pour Lightning, un bond de neuf points par rapport au score de 15 obtenu par le précédent modèle Nano. Cela le place sur un pied d'égalité avec le gpt-oss-120b d'OpenAI, bien que Lightning n'utilise qu'environ un quart des paramètres. Il reste derrière les modèles de pointe — Muse Glimmer de Meta (35) et Qwen 3.6 35B A3B (32) — mais son ratio intelligence/paramètres figure parmi les meilleurs.

Les benchmarks agentiques racontent une histoire similaire

Les charges de travail agentiques — planification, utilisation d'outils, raisonnement multi-étapes — sont le domaine où Lightning excelle. Sur le benchmark GDPval-AA v2, le modèle a obtenu un classement Elo de 824, surpassant le gpt-oss-120b de 120 milliards de paramètres (800) et le Nemotron 3 Super de Nvidia, plus volumineux (698). Lors du test Terminal-Bench v2.1, le taux de réussite de Lightning est passé de 7 % à 24,3 %, se rapprochant des 26,2 % enregistrés par gpt-oss-120b.

Nvidia a attribué l'optimisation du modèle sur des tâches spécifiques à des domaines à des collaborations post-entraînement avec des partenaires tels que CodeRabbit et Harvey. Ces affinements permettent au modèle de rester rapide tout en restant compétitif sur des charges de travail spécialisées.

Disponibilité et considérations pratiques

Le modèle est distribué sous la licence permissive OpenMDW-1.1, avec des poids aux formats BF16 et NVFP4. La variante NVFP4 compresse davantage le modèle avec une perte de qualité minimale, une option utile pour les déploiements en périphérie (edge) ou les instances cloud soucieuses des coûts. Une fenêtre de contexte d'un million de jetons permet au modèle de gérer des prompts très longs sans troncature, ce qui est précieux pour l'analyse de documents ou de vastes bases de code.

L'inférence sans serveur est déjà disponible chez des fournisseurs tels que DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius et Crusoe. Les développeurs peuvent commencer à expérimenter sans construire d'infrastructure personnalisée, bien que la rentabilité réelle dépende de la tarification de chaque plateforme.

À retenir : Nemotron 3.5 Lightning prouve qu'un modèle peut égaler le niveau de raisonnement de systèmes de 120 milliards de paramètres tout en offrant un débit de jetons presque deux fois supérieur à celui de ses principaux concurrents, ce qui en fait un candidat de choix pour les agents d'IA sensibles à la latence.