NVIDIA affirme que Vera Rubin NVL72 fournit jusqu’à 30 fois plus de travail d’IA agentique par watt

NVIDIA affirme que Vera Rubin NVL72 peut offrir jusqu’à 30 fois plus de débit d’IA agentique par mégawatt que GB300, redéfinissant l’économie de l’inférence.

AI News

NVIDIA affirme que sa future plateforme Vera Rubin NVL72 peut fournir jusqu’à 30 fois le débit d’IA agentique par mégawatt de son prédécesseur GB300 NVL72. Cette affirmation provient de premiers résultats sur SemiAnalysis AgentX, un benchmark conçu pour rejouer des sessions d’agents de codage de type production plutôt que des invites de chatbot de longueur fixe.

Le résultat est important car les agents d’IA génèrent beaucoup plus de trafic d’inférence que les conversations classiques. NVIDIA cite des données d’OpenRouter montrant qu’une requête agentique consomme environ 15 fois plus de jetons qu’une simple interaction de chat. Les agents raisonnent de manière répétée, appellent des outils, délèguent des tâches à des sous-agents et transportent un contexte en expansion à chaque étape, mettant sous pression à la fois la capacité de calcul et les budgets énergétiques.

Les résultats de NVIDIA sont communiqués par le fournisseur et restent en attente de révision par SemiAnalysis. Ils indiquent donc l’objectif de performance de l’entreprise pour Rubin, et non un classement sectoriel confirmé de manière indépendante. Néanmoins, le choix du benchmark pointe vers un changement plus large dans la façon dont les fournisseurs d’infrastructure pourraient devoir mesurer les systèmes d’IA à mesure que les charges de travail en plusieurs étapes passent en production.

Un benchmark construit autour du comportement réel des agents

La charge de travail AgentX, qui fait partie de la suite de benchmarks InferenceX de SemiAnalysis, rejoue des sessions enregistrées de Claude Code avec raisonnement du modèle et utilisation d’outils entremêlés. Elle préserve les longueurs de séquence originales, la croissance du contexte, les intervalles de raisonnement et les délais d’appel aux outils, selon des éléments du NVIDIA Developer Blog.

Cette conception diffère des tests d’inférence traditionnels construits autour d’une taille d’entrée et de sortie fixe. Dans une session d’agent, l’invite peut passer de milliers de jetons à des centaines de milliers à mesure que le système accumule recherche, code, résultats d’outils et travail délégué. Le contexte déjà traité peut également être réutilisé via un cache clé-valeur, tandis que l’exécution des outils crée des pauses entre les appels du modèle.

AgentX varie la concurrence et évalue le débit par rapport à des mesures d’interactivité telles que le temps jusqu’au premier jeton, la latence de bout en bout et les jetons par seconde et par utilisateur. NVIDIA indique que le résultat phare de Rubin a été mesuré à 160 jetons par seconde et par utilisateur sur la charge de travail AgentX DeepSeek V4 Pro. À ce point de fonctionnement, l’entreprise annonce jusqu’à 30 fois plus de débit par mégawatt que GB300 NVL72.

La comparaison n’est pas une déclaration générale sur tous les modèles ou tous les déploiements. Le résultat cité est lié à une configuration de plateforme, une charge de travail et un objectif d’interactivité particuliers. NVIDIA dit aussi que la mesure n’inclut pas encore les performances du CPU Vera pour les appels d’outils, laissant une partie du système d’agent de bout en bout hors du chiffre rapporté.

Ce que NVIDIA change dans la pile d’inférence

NVIDIA attribue le résultat à une combinaison de matériel, de réseau et de logiciel plutôt qu’au seul GPU Rubin. La conception NVL72 crée un grand domaine de scale-up dans lequel les GPU partagent une communication à haut débit et faible latence via les systèmes NVLink de sixième génération et NVLink Switch.

Cette topologie prend en charge des techniques destinées aux charges de travail à long contexte et de type mixture-of-experts. NVIDIA met en avant le cache KV distribué, qui maintient le contexte déjà traité disponible entre les GPU, ainsi que le routage conscient du KV, qui peut diriger une requête vers le matériel qui détient déjà les données de cache pertinentes. Le serving disagrégé sépare le prefill, où le contexte est traité, du decode, où les réponses sont générées, permettant à chaque étape de monter en échelle indépendamment.

La couche logicielle comprend NVIDIA TensorRT-LLM, NVIDIA Dynamo et des noyaux CUDA conçus pour combiner calcul et communication inter-GPU. L’entreprise souligne aussi la quantification NVFP4 et les capacités plus récentes des Tensor Cores et du Transformer Engine comme moyens de réduire l’utilisation de la mémoire et d’augmenter le débit de jetons.

La technologie de gestion de l’énergie DSX MaxLPS de NVIDIA est présentée comme un autre levier. L’entreprise affirme qu’elle peut déployer jusqu’à 40 % de GPU supplémentaires dans le même budget mégawatt en gérant la puissance au niveau du GPU, du rack et de la charge de travail. NVIDIA affirme par ailleurs que Rubin peut réduire le coût par million de jetons jusqu’à 35 fois par rapport à GB300 NVL72 sur la charge de travail citée.

Preuves, comparaisons et limites

Les mêmes données AgentX donnent une image plus graduelle des gains générationnels de NVIDIA. NVIDIA rapporte que GB300 NVL72 fournit jusqu’à 15 fois le débit par mégawatt de H200 NVL8 pour DeepSeek V4 Pro 1.6T, et jusqu’à 80 fois pour le modèle plus grand Kimi K3 2.8T. Elle affirme aussi que GB300 offre jusqu’à 10 fois un coût par million de jetons inférieur à H200 dans la comparaison citée.

Ces chiffres sont également présentés par NVIDIA à l’aide de la charge de travail SemiAnalysis. Le benchmark sous-jacent vise à rendre les comparaisons plus réalistes en rejouant un trafic identique, mais les mesures de Rubin n’ont pas encore reçu la révision indépendante mentionnée dans les publications de NVIDIA. Les lecteurs doivent donc distinguer la méthodologie du benchmark des chiffres de performance qui en sont issus.

Les affirmations n’établissent pas non plus que toutes les charges de travail agentiques constateront un gain de 30x. Les résultats peuvent varier selon l’architecture du modèle, la longueur du contexte, la réutilisation du cache, la concurrence, la latence des outils, les paramètres de quantification et la vitesse de réponse requise. Un agent de codage qui attend souvent un compilateur ou une API externe peut être limité par le logiciel et l’orchestration plutôt que par le débit brut de l’accélérateur.

Pourquoi le résultat compte pour les créateurs et les acheteurs d’IA

Pour les opérateurs d’infrastructure IA, les performances par watt deviennent une métrique de capacité et d’économie unitaire, et pas seulement une mesure environnementale. Si les gains rapportés se confirment dans des tests indépendants, un opérateur de centre de données pourrait servir davantage de sessions d’agents simultanées avec une allocation électrique fixe, ou fournir la même capacité avec moins d’accélérateurs et un coût d’exploitation plus faible.

Cela pourrait influencer la manière dont les entreprises conçoivent des usines d’IA pour les assistants de codage, les agents de recherche, les systèmes de service client et l’automatisation interne. Les équipes devront peut-être optimiser l’ensemble du flux de travail : cache de contexte, planification du prefill et du decode, routage des modèles, latence des appels d’outils et gestion du trafic des sous-agents. Choisir un GPU plus rapide sans modifier ces systèmes environnants pourrait laisser une part importante du bénéfice annoncé non réalisée.

Les résultats rehaussent aussi le niveau d’exigence pour les fournisseurs d’infrastructure. Les tests fixes avec 8K d’entrée et 1K de sortie restent utiles pour des comparaisons contrôlées, mais ils disent peut-être moins de choses sur le trafic agentique stateful. Les acheteurs qui évaluent une plateforme d’IA devraient demander si ses benchmarks préservent la croissance du contexte, les pauses d’outils, la réutilisation du cache et des objectifs réalistes d’expérience utilisateur.

Pour les développeurs de modèles, l’accent mis sur le serving à long contexte et l’exécution mixture-of-experts pourrait rendre plus importante une conception tenant compte de l’infrastructure. La quantification et le caching peuvent réduire les coûts, mais ils introduisent aussi des compromis de qualité, de gestion de la mémoire et d’exploitation qui doivent être testés sur le flux de travail réel de l’agent plutôt que déduits d’un seul chiffre de débit.

Ce qu’il faut surveiller ensuite

Le signal le plus immédiat est la révision par SemiAnalysis des résultats AgentX de Vera Rubin NVL72. La publication indépendante de la configuration du test, de la comptabilisation de l’énergie, des paramètres du modèle et des mesures d’interactivité aidera à déterminer à quel point le chiffre de 30x est reproductible.

Les résultats de benchmark sur d’autres modèles seront également importants. NVIDIA cite en bonne place DeepSeek V4 Pro et Kimi K3, mais les charges de travail agentiques diffèrent fortement en termes de croissance du contexte, de routage des experts et d’utilisation des outils. Des résultats sur d’autres modèles de codage, de recherche et d’entreprise pourraient montrer si l’avantage de Rubin est large ou concentré dans certains schémas de serving.

Les preuves de déploiement constitueront un autre test. Les affirmations de NVIDIA concernent des mesures préliminaires et non des résultats de production client divulgués. Les acheteurs devraient rechercher un coût validé par million de jetons, des performances soutenues sous pression du cache et une latence de bout en bout complète incluant les appels d’outils et l’orchestration côté CPU.

Point de vue de Creati.ai

L’annonce de NVIDIA est surtout importante parce qu’elle recentre la compétition en infrastructure sur le travail utile d’un agent par unité d’énergie. L’affirmation de 30x en titre ne constitue pas encore une preuve indépendante, mais la méthodologie AgentX s’attaque à une faiblesse réelle des anciens benchmarks d’inférence : ils modélisent souvent une requête unique plutôt que le flux de travail en expansion et interrompu produit par un agent d’IA.

Pour les créateurs et les acheteurs en entreprise, la leçon pratique est d’évaluer l’ensemble du système de serving, et pas seulement les spécifications de l’accélérateur. L’avantage annoncé de Rubin n’aura d’importance que si le caching, la planification, l’exécution du modèle et l’orchestration des outils peuvent le transformer en latence plus faible ou en coût par jeton plus faible en production. Tant que la révision du benchmark et des déploiements plus larges ne seront pas disponibles, les chiffres de NVIDIA doivent être considérés comme une affirmation importante du fournisseur et comme un signal de la direction que prend la concurrence dans l’infrastructure IA.

Publicités