
Nvidia a lancé Nemotron 3.5 Lightning, un modèle de raisonnement open-weight conçu pour rendre les charges de travail des agents IA plus rapides et moins coûteuses à exécuter, plutôt que de maximiser les performances sur chaque benchmark d’intelligence.
Le modèle combine 31,6 milliards de paramètres au total avec une architecture creuse qui n’active que 3,6 milliards de paramètres par jeton. Selon les mesures rapportées par The Decoder, il atteint près de 670 jetons par seconde lors de tests préliminaires avec les poids finaux NVFP4 de Nvidia, faisant du débit la caractéristique centrale de la nouvelle version de Nemotron 3.5.
Ce positionnement est important à mesure que les développeurs passent de requêtes ponctuelles de chatbot à des systèmes d’agents qui génèrent de longues séquences d’appels d’outils, de code et de raisonnement intermédiaire. Pour ces charges de travail, la latence, l’utilisation du matériel et le coût de service peuvent compter autant que le meilleur score d’un modèle sur les benchmarks.
Nemotron 3.5 Lightning succède à Nemotron 3 Nano 30B A3B et conserve la conception hybride Mamba-Transformer du modèle précédent. Son nombre total de paramètres est nettement supérieur au nombre utilisé lors d’un calcul donné, une structure destinée à offrir davantage de capacité sans imposer le coût de calcul complet d’un modèle dense de 31,6 milliards de paramètres.
Nvidia propose le modèle de raisonnement aux formats BF16 et NVFP4. Ce dernier utilise des poids de précision plus faible pour réduire la mémoire et le calcul nécessaires à l’inférence. The Decoder a indiqué que NVFP4 obtenait le même score que la version BF16 sur l’Artificial Analysis Intelligence Index, avec seulement une faible différence de qualité selon cette évaluation.
Le modèle est uniquement textuel et prend en charge une fenêtre de contexte allant jusqu’à un million de jetons. Cette capacité pourrait être utile pour les agents de codage, les flux de travail riches en documents et les applications qui doivent conserver un historique de tâches étendu, même si la simple longueur du contexte ne permet pas de savoir avec quelle efficacité ou fiabilité un système traitera des entrées très longues.
Les poids sont disponibles sous la licence permissive OpenMDW-1.1 de Nvidia. The Decoder a également répertorié un accès serverless via des fournisseurs tels que DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius et Crusoe. La disponibilité sur plusieurs plateformes d’inférence réduit la barrière pour les équipes qui veulent tester le modèle sans exploiter immédiatement leur propre infrastructure Nvidia.
Artificial Analysis a attribué à Nemotron 3.5 Lightning un score de 24 à l’Intelligence Index, selon The Decoder. Cela égalait gpt-oss-120b d’OpenAI et restait derrière Nemotron 3 Super de Nvidia, qui a obtenu 26. Le résultat représentait une amélioration de neuf points par rapport au score rapporté de 15 de Nemotron 3 Nano.
La comparaison montre aussi les limites de l’approche de Nvidia. The Decoder a rapporté des scores plus élevés pour Qwen3.6 35B A3B et Muse Glimmer de Meta, avec respectivement 32 et 35. Les systèmes propriétaires restaient en tête sur le compromis combiné vitesse-intelligence dans l’analyse citée : Gemini 3.5 Flash-Lite de Google aurait obtenu 37, tandis que GPT-5.6 Luna a atteint 52.
Les meilleurs résultats rapportés de Lightning apparaissaient dans des tests orientés agents. Sur GDPval-AA v2, Artificial Analysis a enregistré un score Elo de 824, contre 800 pour gpt-oss-120b et 698 pour Nemotron 3 Super. Sur Terminal-Bench v2.1, le score du modèle est passé de 7 % pour son prédécesseur à 24,3 %, proche des 26,2 % rapportés pour gpt-oss-120b.
Ces chiffres proviennent d’une plateforme de benchmarking indépendante mais sont présentés ici via la couverture de The Decoder, et non comme un ensemble complet de résultats reproduits indépendamment dans les éléments fournis. Ils doivent donc être considérés comme des instantanés de benchmark plutôt que comme la preuve que Lightning dépassera des modèles plus grands dans les charges de travail de production. La vitesse d’inférence peut varier considérablement selon le matériel, la taille des lots, la quantification, le logiciel de service, la longueur du prompt et la longueur de la sortie.
Le chiffre de débit mis en avant provient également de tests préalables au lancement utilisant les poids finaux NVFP4. The Decoder a indiqué que Lightning avait terminé une tâche Intelligence Index en environ une demi-minute, contre environ 3,5 minutes pour Qwen3.6 35B A3B et 5,8 minutes pour Gemma 4 31B dans la comparaison citée. Ces durées clarifient l’objectif de Nvidia : des tâches répétées, sensibles à la latence, où le coût d’attendre ou de servir un modèle plus grand s’accumule au fil de nombreuses interactions.
Pour les équipes produit, Lightning offre une possible couche intermédiaire entre de petits modèles peu coûteux et de grands systèmes réservés au raisonnement difficile. Une entreprise pourrait l’utiliser pour des étapes routinières d’agent — classification, sélection d’outils, navigation dans le code, récupération de documents ou exécution structurée — tout en faisant remonter les cas ambigus ou à haut risque vers un modèle plus capable.
Cette architecture peut réduire le nombre de requêtes envoyées à des API propriétaires coûteuses, mais uniquement si le petit modèle fonctionne de manière fiable dans le flux de travail spécifique. Un avantage sur Terminal-Bench ne se traduit pas automatiquement par des modifications de bases de données fiables, des analyses financières, des actions de support client ou du code de production. Les équipes devront tester la récupération après erreur, la précision de l’utilisation des outils, les taux d’hallucination et la fréquence à laquelle les tâches nécessitent une escalade.
La conception creuse et l’option NVFP4 peuvent aussi affecter l’économie du déploiement. Activer 3,6 milliards de paramètres par étape peut réduire la demande de calcul par rapport à un modèle dense de taille totale similaire, tandis que la quantification peut diminuer les besoins en mémoire. Le bénéfice pratique dépendra du fait qu’une équipe dispose ou non d’un matériel et d’une infrastructure de service compatibles, ainsi que de la surcharge engendrée par les contextes longs, le batching et l’orchestration des agents.
La stratégie plus large de Nvidia transparaît dans cette version. L’entreprise a déjà soutenu que des modèles sous 10 milliards de paramètres actifs peuvent traiter de nombreuses tâches d’agent à une fraction du coût de systèmes beaucoup plus grands. Lightning transforme cet argument d’efficacité en produit avec une conception de style mélange de 31,6 milliards de paramètres, mais un chemin actif de 3,6 milliards.
La version associée de Fastino Labs fournit un premier signal sur un usage en aval possible. StreetInsider a rapporté que l’entreprise avait publié des modèles open-weight spécialisés en finance et en santé, post-entraînés sur Nemotron 3.5 Lightning entièrement à l’aide d’un agent. La source fournie ne donne pas de détails techniques, de résultats d’évaluation ni de chiffres d’adoption pour ces modèles ; l’annonce doit donc être comprise avant tout comme un exemple d’activité de l’écosystème, et non comme une preuve de demande à l’échelle de la production.
Le suivi le plus important sera le test indépendant de la fiabilité de bout en bout des agents. Les développeurs devraient rechercher des évaluations mesurant les tâches terminées, et pas seulement le débit de jetons ou les scores de benchmark, dans le codage, la navigation web, les logiciels d’entreprise et les workflows de longue durée.
L’économie du service sera un autre signal clé. Les déploiements publics peuvent montrer si NVFP4 et l’activation creuse produisent de réelles économies sur des charges de travail concrètes, en particulier lorsque les modèles doivent gérer de grands contextes ou de nombreux utilisateurs simultanés. L’écart de performance entre déploiement local et inférence hébergée comptera aussi pour les entreprises qui arbitrent entre contrôle et simplicité opérationnelle.
Les partenariats de post-entraînement de Nvidia méritent aussi d’être suivis. Artificial Analysis a rapporté que CodeRabbit et Harvey ont travaillé avec Nvidia sur un post-entraînement spécifique à un domaine. Des variantes plus spécialisées pourraient déterminer si Lightning devient un modèle d’agent polyvalent ou la base de systèmes ciblés à fort volume.
Enfin, les acheteurs devraient suivre la clarté de la licence, le support des outils et le comportement du modèle sous contraintes de sécurité. Un modèle open-weight est plus facile à inspecter et à déployer qu’une API fermée, mais les organisations restent responsables de la supervision, des contrôles d’accès, de la gestion des données et de l’endiguement des défaillances.
Nemotron 3.5 Lightning n’est pas la tentative de Nvidia de gagner le classement brut de l’intelligence. C’est un pari que de nombreux agents IA utiles ont davantage besoin d’une exécution rapide et répétable que de la meilleure réponse possible à chaque tâche.
Cela rend la version stratégiquement pertinente, même là où les leaders des benchmarks restent devant. Si le débit rapporté se confirme dans des configurations de déploiement courantes, Lightning pourrait offrir aux créateurs une option de routage pratique pour les étapes d’agent à fort volume. Son succès sera finalement jugé moins à l’aune du nombre de paramètres qu’à la capacité des équipes à mener à bien de vrais flux de travail avec une latence et un coût plus faibles, sans ajouter de risques inacceptables en matière de fiabilité ou de sécurité.
Nemotron 3.5 Lightning de Nvidia utilise l’activation creuse et la quantification pour offrir une inférence open-weight rapide, en visant des agents IA à fort volume plutôt que des scores maximaux.