AI News

NVIDIA a présenté Nemotron 3.5 Lightning, un modèle de mélange d’experts à 30 milliards de paramètres, ainsi que NeMo Switchyard, une bibliothèque open source permettant d’acheminer les requêtes entre plusieurs modèles d’IA. L’entreprise indique que ces lancements sont conçus pour des systèmes agentiques toujours actifs, qui doivent équilibrer précision, temps de réponse, coût opérationnel et contrôle du déploiement.

Ce lancement reflète un changement dans la manière dont NVIDIA positionne les modèles ouverts. Plutôt que de présenter Lightning comme un remplacement autonome de tous les modèles de pointe, l’entreprise le décrit comme un spécialiste capable de gérer des tâches à fort volume au sein de systèmes plus vastes. Switchyard est destiné à décider quel modèle doit traiter chaque étape d’un workflow d’agent, réduisant potentiellement le nombre de requêtes envoyées vers des modèles plus coûteux.

Un modèle spécialiste pour les systèmes multi-agents

Nemotron 3.5 Lightning est positionné pour des charges de travail ciblées telles que la revue de code, l’utilisation d’outils, la surveillance des alertes de sécurité et l’assistance à la facturation. NVIDIA affirme que les grands modèles de raisonnement peuvent planifier ou coordonner une opération tandis que les petits modèles spécialisés exécutent des tâches individuelles. Cette architecture est de plus en plus pertinente pour les développeurs qui construisent des agents fonctionnant en continu plutôt que de répondre à des invites de chat occasionnelles.

Selon NVIDIA, le modèle est ouvert et personnalisable. Les organisations peuvent le post-entraîner avec NVIDIA NeMo en utilisant leurs propres données de domaine, outils et workflows. NVIDIA a également publié Nemotron-RL-Agentic-Terminal-Pivot, un jeu de données d’apprentissage par renforcement utilisé lors du post-entraînement du modèle pour les capacités d’agents de codage.

L’entreprise affirme que Lightning peut offrir jusqu’à quatre fois plus de vitesse de sortie et accomplir des tâches agentiques 30 % plus rapidement que d’autres modèles de sa catégorie. Ces chiffres sont des revendications de performance rapportées par NVIDIA, et non des résultats vérifiés indépendamment dans les éléments fournis. Le groupe de comparaison et les conditions de test ne sont pas détaillés dans l’annonce disponible ; les acheteurs devront donc valider les bénéfices avec leurs propres invites, outils et matériel.

NVIDIA indique que le modèle peut fonctionner sur des PC NVIDIA RTX, DGX Spark, DGX Station, des systèmes Jetson, des stations de travail RTX PRO, dans des centres de données et dans des environnements cloud. Cette polyvalence est importante pour les équipes traitant des données sensibles ou cherchant à utiliser une infrastructure existante plutôt que d’envoyer chaque requête vers une API hébergée.

Switchyard transforme le choix du modèle en infrastructure

NeMo Switchyard répond à un problème pratique du développement d’agents : des tâches différentes nécessitent souvent des modèles différents, mais la gestion manuelle de ces décisions peut devenir une lourde charge d’intégration. La bibliothèque de NVIDIA peut acheminer les requêtes à travers le mélange de modèles ouverts, propriétaires et NVIDIA d’une organisation sans obliger les développeurs à réécrire leurs applications.

Le routeur peut être ajusté en fonction de priorités telles que la qualité, la latence et le coût. Dans un système qui utilise un modèle de pointe pour la planification mais un modèle plus petit pour l’exécution routinière, cette approche pourrait faire du choix du modèle une partie du runtime de l’application plutôt qu’une décision architecturale fixe.

La présentation de NVIDIA souligne également un changement plus large dans l’infrastructure de l’IA. À mesure que les agents effectuent plusieurs appels au cours d’un même workflow, l’utilisation de tokens et la latence peuvent s’accumuler rapidement. Une couche de routage qui n’envoie les requêtes difficiles qu’aux modèles premium peut être plus précieuse qu’une légère amélioration du score de benchmark d’un seul modèle, en particulier pour le support client, le codage, la sécurité et l’automatisation du back-office.

Switchyard sera proposé sous forme de bibliothèque open source. NVIDIA indique collaborer avec des entreprises de l’écosystème pour intégrer le routage dans des outils et plateformes de développement existants, notamment Kong AI Gateway, LiteLLM et Hermes de Nous Research. LangChain est également cité comme partenaire d’intégration, tandis que Cognition a testé un routeur à étapes dans Devin Desktop pour un usage interne chez NVIDIA.

Ce que montrent — et ne montrent pas — les preuves de performance

NVIDIA rapporte que des benchmarks internes ont conservé une précision de niveau frontier tout en réduisant le coût d’exécution des tâches à près d’un tiers de celui d’Opus 4.8 utilisé seul. Comme le benchmark est interne et contrôlé par le fournisseur, cette affirmation doit être considérée comme une indication plutôt que comme une garantie générale. Les résultats dépendront du pool de modèles, de la politique de routage, du mélange de charges de travail et du niveau de dégradation de qualité qu’une organisation accepte.

Les exemples de partenaires offrent des signaux supplémentaires, toujours fournis par l’éditeur. NVIDIA affirme que Boomi a atteint une précision de routage de domaine de 100 % sur cinq capacités de routage, a dirigé 59 % du trafic vers un modèle ajusté cinq fois plus rapide et a réduit la latence des tours ultérieurs de 21 %. Classmethod a signalé une réduction initiale des coûts de 27 % tout en maintenant la qualité, tandis que Cognition a indiqué une réduction de 28 % du coût moyen par rapport à l’envoi de toutes les requêtes vers un seul modèle de pointe.

D’autres résultats cités varient. NVIDIA affirme que Cadence a amélioré son efficacité de 9,9 % dans un cas d’usage de vérification formelle. LangChain a signalé un coût inférieur de 74 % sur 145 tâches Deep Agents multi-tours en envoyant 7 % des appels à un modèle de pointe, avec un compromis de 6 % en précision. Ces chiffres illustrent le compromis central du routage : les économies peuvent être substantielles, mais un coût plus faible peut s’accompagner d’évolutions de précision, de latence ou de comportement du workflow.

NVIDIA cite également CrowdStrike, Harvey avec Trajectory, CodeRabbit avec Baseten, Lila Sciences et Fastino Labs parmi les organisations personnalisant Nemotron 3.5 Lightning. L’annonce ne fournit pas d’évaluations indépendantes de clients, d’échelle de production, de détails contractuels ou de métriques d’adoption. Les affirmations les plus fortes concernant la vitesse, le coût et les performances clients restent donc attribuées à NVIDIA et à ses partenaires cités.

Pourquoi cela compte pour les créateurs d’IA et les entreprises

Pour les développeurs, la combinaison d’un modèle personnalisable et d’une couche de routage pourrait réduire la dépendance à un seul fournisseur. Les équipes peuvent attribuer les tâches sensibles ou répétitives à un modèle déployé localement tout en conservant l’accès à des systèmes propriétaires pour les cas les plus difficiles. Cela peut soutenir les exigences de confidentialité, réduire les coûts récurrents d’inférence et donner aux équipes d’ingénierie davantage de contrôle sur les mises à jour des modèles.

Le compromis est la complexité opérationnelle. Un routeur doit être évalué non seulement sur la précision moyenne, mais aussi sur la gestion des échecs, la fiabilité des appels d’outils, la conservation du contexte et le comportement dans les tâches multi-tours. Une baisse apparemment faible de la précision peut devenir significative lorsqu’un agent prend des dizaines de décisions dans un workflow. Les organisations auront également besoin d’une observabilité expliquant pourquoi une requête a été envoyée à un modèle particulier et si cette décision a amélioré le résultat.

Pour les acheteurs d’entreprise, la valeur de Switchyard dépendra de l’interopérabilité et de la gouvernance. Le routage entre des modèles de différents fournisseurs peut réduire l’enfermement propriétaire, mais introduit aussi davantage de composants à sécuriser, surveiller et auditer. L’accent mis par NVIDIA sur la publication des données d’entraînement et des techniques lorsque les licences le permettent peut aider les chercheurs et les équipes de gouvernance à examiner le modèle, même si la divulgation n’établit pas à elle seule une fiabilité en production.

Cette publication accentue également la concurrence autour de la pile applicative de l’IA. Les fournisseurs de modèles se disputent de plus en plus non seulement la capacité brute, mais aussi le plan de contrôle autour de l’inférence : routage, fine-tuning, lieu de déploiement et gestion des coûts. NVIDIA utilise son écosystème matériel et son logiciel NeMo pour relier ces couches des PC locaux à l’infrastructure cloud.

Ce qu’il faut surveiller ensuite

Le premier signal sera les tests indépendants de Nemotron 3.5 Lightning sur des charges de travail de codage, de sécurité et d’utilisation d’outils d’entreprise, y compris des comparaisons avec des modèles ouverts de taille similaire. Les évaluations publiées devraient préciser si les affirmations de vitesse de NVIDIA se maintiennent sur différents matériels et dans des tâches agentiques à long contexte.

Les développeurs devraient également surveiller dans quelle mesure NeMo Switchyard apparaît dans les frameworks de production, en particulier si des intégrations telles que LiteLLM et Kong réduisent les coûts de mise en place pour les applications existantes. Les preuves concernant les échecs de routage, les compromis de précision et les capacités de supervision seront plus utiles que les seules économies mises en avant.

Enfin, l’adoption en entreprise dépendra de l’économie du déploiement. Les questions importantes sont de savoir si l’exécution locale et sur site peut rivaliser avec les alternatives hébergées, quelle quantité de post-entraînement est nécessaire pour atteindre une précision de domaine, et si le routage des modèles produit des économies fiables une fois les coûts d’infrastructure, d’évaluation et de gouvernance inclus.

Point de vue Creati.ai

L’annonce de NVIDIA est surtout importante comme pari sur l’infrastructure : les applications agentiques pourraient être construites à partir de spécialistes de modèles coordonnés plutôt que d’un modèle universel. Nemotron 3.5 Lightning fournit un spécialiste personnalisable, tandis que NeMo Switchyard traite la décision en temps d’exécution de savoir quand l’utiliser.

L’opportunité est crédible, mais les preuves proviennent largement de NVIDIA. Pour les développeurs, le test pratique n’est pas de savoir si le routage réduit le coût d’un benchmark isolé ; il s’agit de déterminer s’il préserve la fiabilité de bout en bout des tâches tout en rendant le déploiement, la confidentialité et les opérations sur les modèles plus faciles à gérer.

Vedettes

NVIDIA vise des agents IA toujours actifs avec Nemotron 3.5 Lightning et NeMo Switchyard

NVIDIA a lancé un modèle ouvert efficace et une bibliothèque de routage destinés à réduire le coût, la latence et les frictions de déploiement des agents IA en entreprise.