
Dans cet article (4)
Analyse de Nemotron 3.5 Lightning : la déployabilité l’emporte
Points clés
- Évaluez la déployabilité, et pas seulement le nombre de paramètres, lorsque vous comparez des modèles d’agents à pondérations ouvertes.
- Testez le comportement en contexte long et la vitesse de service avant de miser sur Nemotron 3.5 Lightning en production.
- Examinez OpenMDW 1.1 et les recettes de Nvidia dès le départ si vous prévoyez une personnalisation commerciale.
Un modèle MoE de 30 Md avec 3 Md de paramètres actifs, un contexte de 1 M, une licence OpenMDW-1.1 et des recettes fait du déploiement le point central.
Un modèle MoE de 30 B avec 3 B de paramètres actifs, un contexte de 1 M, une licence OpenMDW-1.1 et des recettes fait du déploiement l’élément central.
Le concours des modèles ouverts ressemblait autrefois à une compétition de bodybuilding pour le nombre de paramètres. Tout le monde exhibait des chiffres plus gros, et personne ne demandait si la chose pouvait vraiment passer la porte du déploiement sans arracher le cadre, le placo et trois stagiaires. Nemotron 3.5 Lightning de Nvidia est intéressant parce qu’il défend un argument plus discret : les poids ouverts consistent de moins en moins à savoir qui a le plus grand modèle, et de plus en plus à savoir qui peut en livrer un utile. Selon NVIDIA NIM, Nemotron 3.5 Lightning est arrivé le 11 août 2026 comme un modèle 30B avec 3B de paramètres actifs, une configuration en mélange d’experts qui garde la majeure partie du modèle endormie pendant qu’une plus petite tranche fait le travail. Ce n’est pas vraiment de la modestie. C’est plutôt comme engager un stade entier de consultants et n’en laisser entrer que trois dans la réunion, ce qui, franchement, est un progrès de gestion.
Artificial Analysis met la frime de taille au régime
Artificial Analysis rapporte que Nemotron 3.5 Lightning est le premier modèle Nemotron 3.5 et le successeur de NVIDIA Nemotron 3 Nano 30B A3B. Son décompte indique 31,6B de paramètres au total et 3,6B de paramètres actifs, tout en notant aussi que le modèle conserve l’architecture hybride Mamba-Transformer de Nemotron 3 Nano. La partie utile, c’est l’évolution du score : Artificial Analysis attribue à Lightning un 24 sur son indice d’intelligence, contre 15 pour Nemotron 3 Nano, ce qui le place au même niveau que gpt-oss-120b d’OpenAI à 24 et juste derrière Nemotron 3 Super à 26, un modèle qu’Artificial Analysis décrit comme environ quatre fois plus grand.
Cette comparaison est le point essentiel. Le fait qu’un modèle à poids ouverts plus petit égale un rival nommé beaucoup plus grand sur un indice d’intelligence ne signifie pas qu’il faut jeter les évaluations et foncer en production avec une cape. Cela signifie bien que la question de construction passe de « ce modèle peut-il gagner le classement ? » à « ce modèle peut-il tourner à moindre coût, rapidement et légalement dans le produit que vous avez réellement ? »
NVIDIA NIM présente l’argument du déploiement
La fiche modèle de NVIDIA NIM donne la forme orientée constructeur de cet argument : NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 utilise une architecture hybride MoE, Mamba-2, MoE et Attention, prend en charge des longueurs de contexte allant jusqu’à 1M de tokens, et liste l’anglais, les langages de programmation, l’espagnol, le français, l’allemand, l’italien et le japonais. Ce ne sont pas seulement des décorations de fiche technique. Une fenêtre d’un million de tokens change ce que les équipes peuvent tenter avec de longs documents, des traces d’outils, du contexte de dépôt et de la mémoire d’agent, à condition qu’elles puissent empêcher l’hygiène de la recherche d’information de devenir un tiroir à bazar rempli de JSON.
La même fiche NVIDIA NIM indique que la licence est l’OpenMDW License Agreement, version 1.1. Pour les équipes qui évaluent un usage commercial, cette ligne de licence doit figurer à côté de la latence, du coût d’hébergement et de la politique de données dans la liste de vérification de diligence raisonnable, pas dans un triste dossier PDF nommé « juridique plus tard ». NVIDIA dit aussi que Nemotron est une famille de modèles ouverts avec des poids, des données d’entraînement et des recettes ouverts, ce qui est la partie sous-estimée : les recettes sont l’endroit où la reproductibilité cesse d’être des vibrations en blouse de laboratoire.
Le blog technique de
NVIDIA le présente comme de la plomberie pour agents
Le blog technique de NVIDIA, par Chris Alexiuk et Chintan Patel, présente Nemotron 3.5 Lightning autour de l’exécution rapide et précise de tâches spécialisées pour des agents de longue durée. NVIDIA NIM est encore plus explicite sur le rôle prévu, en le décrivant comme idéal pour les agents autonomes de longue durée, les déploiements de sous-agents de type cheval de bataille et les workflows agentiques. C’est une forme de produit très différente d’un modèle-oracle géant répondant à chaque question comme un magicien privé de sommeil avec un badge d’acheteur.
C’est ici que la conception à paramètres actifs compte. L’inférence pour les agents, c’est souvent la mort par mille appels : planifier, chercher, résumer, appeler un outil, inspecter le résultat, réessayer, s’excuser auprès des journaux, répéter. Un modèle qui maintient un calcul actif bas tout en conservant un raisonnement utilisable peut devenir la couche intermédiaire ennuyeuse qui fait la majeure partie du travail, et les couches intermédiaires ennuyeuses sont la façon dont les logiciels finissent vraiment par rapporter de l’argent.
Artificial Analysis montre le compromis que les constructeurs devraient tester
Artificial Analysis est prudent au sujet du compromis. Il indique que Nemotron 3.5 Lightning se situe derrière Qwen3.6 35B A3B, qui obtient 32, et Muse Glimmer, classé haut à 35, parmi les petits modèles de sa catégorie de taille. Mais lors de tests de prépublication d’un endpoint DeepInfra servant les poids NVFP4 finaux, Artificial Analysis a mesuré des vitesses de sortie médianes de près de 670 tokens par seconde, le genre de chiffre qui donne aux boucles d’agents l’air de moins ressembler à regarder une soupe refroidir.
Les chiffres agentiques sont aussi l’endroit où cette sortie devient plus que légèrement piquante. Artificial Analysis rapporte les plus gros gains par rapport à Nemotron 3 Nano sur les évaluations agentiques, notamment GDPval-AA v2 avec une progression de plus 334 ELO qui a dépassé gpt-oss-120b et Nemotron 3 Super, ainsi que des gains sur Termina. Cela ne fait pas de Lightning la réponse universelle, parce que les réponses universelles en IA ne sont généralement que des factures parfumées. Cela en fait un candidat sérieux pour les équipes qui construisent des agents ayant besoin de vitesse, d’un long contexte, de poids ouverts et d’assez de transparence pour ajuster plutôt que prier.
Pour les lecteurs qui construisent avec des modèles ouverts, la prochaine étape utile n’est pas de débattre des totaux de paramètres sur Internet, même si je respecte le cardio. Testez la surface réelle de déploiement : bourrage de contexte contre recherche d’information, comportement de service en NVFP4, latence des boucles d’agents, examen de la licence, et si les recettes de NVIDIA correspondent à vos propres données de domaine. Le concours des poids ouverts n’est plus un rallye de monster trucks ; c’est un service d’expédition avec un budget de latence.