NVIDIA affirme que Vera Rubin NVL72 fournit jusqu’à 30 fois plus de travail agentique par watt

NVIDIA indique que Vera Rubin NVL72 peut offrir jusqu’à 30 fois plus de débit d’inférence agentique par mégawatt que GB300, sous réserve d’une revue indépendante du benchmark.

AI News

NVIDIA affirme que sa prochaine plateforme Vera Rubin NVL72 peut fournir jusqu’à 30 fois plus de débit d’IA agentique par mégawatt que le système GB300 NVL72 de l’entreprise. Cette affirmation provient de résultats préliminaires sur SemiAnalysis AgentX, un benchmark conçu pour rejouer des sessions d’agents de codage de type production plutôt que des invites de chatbot à longueur fixe.

Ce résultat est important car les agents IA consomment une capacité d’inférence nettement supérieure à celle du chat ordinaire. Les sources de NVIDIA citent des données OpenRouter montrant qu’une seule requête agentique utilise environ 15 fois plus de tokens qu’une simple requête de chat, car les agents raisonnent de façon répétée, appellent des outils, délèguent du travail à des sous-agents et transportent un contexte qui s’étend au fil de la tâche.

La comparaison Vera Rubin n’est pas encore un résultat validé indépendamment. NVIDIA a mesuré les chiffres à l’aide de la charge de travail SemiAnalysis AgentX et précise que les résultats sont en attente de l’examen de SemiAnalysis. L’annonce constitue donc un premier signal de performance rapporté par le fournisseur, et non un benchmark industriel confirmé.

Un benchmark conçu autour des charges de travail d’agents

AgentX fait partie de la suite de benchmarks InferenceX de SemiAnalysis. Selon le NVIDIA Developer Blog, il rejoue des sessions Claude Code enregistrées via le client AIPerf, en conservant la séquence d’appels au modèle, les intervalles de raisonnement, l’utilisation d’outils, la croissance du contexte et la latence des appels aux outils capturés dans les trajectoires d’origine.

Cette conception tente de remédier à une faiblesse des tests d’inférence classiques. Les tests statiques utilisent souvent des longueurs d’entrée et de sortie prédéterminées, comme une invite de 8 000 tokens suivie d’une réponse de 1 000 tokens. Les agents de codage réels génèrent un trafic irrégulier : une tâche peut alterner entre raisonnement du modèle, opérations sur fichiers, recherches, sortie du compilateur et nouveaux appels au modèle, tandis que le contexte accumulé devient beaucoup plus grand au fil du temps.

AgentX mesure les tokens par mégawatt ainsi que des indicateurs d’expérience utilisateur, notamment le temps jusqu’au premier token, la latence de bout en bout et l’interactivité. Le principal résultat de Vera Rubin a été mesuré à 160 tokens par seconde et par utilisateur sur la charge de travail AgentX DeepSeek V4 Pro. L’entreprise affirme que Vera Rubin NVL72 a atteint jusqu’à 30 fois le débit de la fabrique d’IA par mégawatt de GB300 NVL72 à ce point de fonctionnement.

Le benchmark signale aussi des gains substantiels pour la génération Blackwell actuelle. NVIDIA affirme que GB300 NVL72 fournit jusqu’à 15 fois le débit par mégawatt de H200 NVL8 sur DeepSeek V4 Pro 1.6T, et jusqu’à 80 fois le résultat sur Kimi K3 2.8T. Ces chiffres sont également présentés dans le reporting de NVIDIA sur les résultats d’AgentX et doivent être interprétés en conséquence.

L’infrastructure derrière l’affirmation

NVIDIA attribue les gains d’efficacité projetés à une combinaison d’échelle matérielle et d’optimisation logicielle, et non au seul GPU Rubin. La conception NVL72 relie 72 GPU dans un domaine de scale-up, permettant aux charges de travail de répartir les experts du modèle et de conserver le contexte à travers le système grâce à des interconnexions à haut débit.

Cela compte pour les agents de longue durée, car le contexte déjà traité peut souvent être réutilisé au lieu d’être recomputé. NVIDIA décrit une architecture de service qui sépare le prefill, où le système traite le contexte entrant, du decode, où il génère la sortie. L’alignement des débits entre ces étapes vise à empêcher qu’un côté reste inactif pendant que l’autre devient un goulot d’étranglement.

L’entreprise met aussi en avant la mise en cache distribuée clé-valeur, le routage des requêtes conscient du KV et le déchargement du cache vers la mémoire hôte ou le stockage. Ces techniques sont conçues pour conserver disponibles les parties pertinentes d’une session d’agent en croissance sur plusieurs requêtes. NVIDIA affirme que la technologie NVLink de sixième génération et NVLink Switch offrent des débits de paquets plus élevés et une latence plus faible que les alternatives Ethernet classiques pour cette communication de scale-up.

La couche logicielle inclut NVIDIA TensorRT-LLM, NVIDIA Dynamo et des kernels CUDA optimisés pour les modèles Mixture-of-Experts. Le compte rendu destiné aux développeurs mentionne aussi SGLang et vLLM comme runtimes de service utilisés dans la pile d’optimisation plus large, ainsi que des kernels DeepGEMM et des formats de précision réduite tels que MXFP4 et MXFP8. NVIDIA indique que la quantification NVFP4 sur Rubin vise à réduire l’utilisation mémoire et à augmenter le débit tout en préservant la qualité des sorties, bien que les éléments fournis ne proposent pas d’évaluation indépendante de la qualité.

NVIDIA ajoute par ailleurs que ses technologies DSX MaxLPS peuvent gérer l’alimentation au niveau du GPU, du rack et de la charge de travail, ce qui pourrait permettre jusqu’à 40 % de GPU supplémentaires dans le même budget de mégawatts. Il s’agit d’une affirmation de planification de capacité de NVIDIA, et non d’un résultat démontré par les seules données AgentX.

Pourquoi les constructeurs et opérateurs IA devraient s’y intéresser

Pour les équipes qui créent des assistants de codage, des agents de recherche ou de l’automatisation du service client, la métrique pertinente ne se limite plus à la vitesse à laquelle une requête unique produit une réponse. Un agent de production peut maintenir plusieurs appels au modèle actifs, conserver un contexte volumineux et marquer une pause pendant que des outils externes renvoient des données. Une infrastructure performante sur des requêtes courtes et isolées peut donc gaspiller de l’énergie ou perdre en réactivité dans de vrais flux de travail.

L’annonce Vera Rubin présente l’efficacité énergétique à la fois comme une contrainte de déploiement et comme une question de coût. NVIDIA affirme que Vera Rubin NVL72 peut réduire le coût par million de tokens jusqu’à 35 fois par rapport à GB300 NVL72 sur la charge de travail citée. Son blog développeur indique séparément que GB300 peut offrir un coût par token jusqu’à 10 fois inférieur à celui de H200 NVL8. Ces calculs dépendent de la configuration du benchmark, des hypothèses énergétiques et des niveaux d’utilisation, de sorte que les acheteurs d’entreprise devront les tester sur leurs propres modèles et schémas de service.

Le résultat pourrait être particulièrement pertinent pour les opérateurs servant de grands modèles Mixture-of-Experts ou des agents aux sessions particulièrement longues. Dans ces environnements, les mouvements mémoire, la réutilisation du cache et le comportement des interconnexions peuvent compter autant que l’arithmétique brute de l’accélérateur. Les petites équipes, toutefois, ne verront peut-être pas la même économie si elles utilisent des modèles à contexte court, une faible concurrence ou des API hébergées qui masquent le matériel sous-jacent.

Il existe aussi une question de fiabilité. Un cache plus agressif, un service désagrégé et l’orchestration d’outils peuvent améliorer l’utilisation, mais ajoutent de la complexité en matière d’ordonnancement et de gestion d’état. Les constructeurs devront évaluer la reprise après incident, l’invalidation du cache, la latence en queue et l’isolation des charges de travail plutôt que de s’en remettre à des chiffres de tokens par seconde de pointe.

Ce qu’il faut surveiller ensuite

Le premier signal sera l’examen par SemiAnalysis des résultats Vera Rubin AgentX. La publication indépendante de la configuration de test, des mesures de puissance, des paramètres du modèle et des objectifs d’interactivité déterminera dans quelle mesure l’affirmation de 30x est comparable d’un système à l’autre.

Les acheteurs devraient également surveiller les résultats qui incluent le rôle du Vera CPU dans les appels d’outils. NVIDIA indique explicitement que les premiers chiffres ne reflètent pas encore les performances du Vera CPU pour cette partie du flux de travail. Comme les agents passent du temps en dehors de la génération du modèle, les mesures de bout en bout pourraient différer du débit de l’accélérateur seul.

Parmi les autres points utiles à suivre figurent la disponibilité et les tarifs de Vera Rubin NVL72, les performances sur des modèles au-delà de DeepSeek V4 Pro, ainsi que les résultats d’opérateurs exécutant leurs propres traces plutôt que des sessions préenregistrées. Des changements dans la pile logicielle de NVIDIA pourraient également influencer la comparaison, l’entreprise indiquant que les performances de Rubin et de GB300 progresseront grâce à une optimisation continue.

Perspective Creati.ai

L’annonce de NVIDIA est importante moins parce qu’elle établit un standard industriel final de 30x que parce qu’elle met en lumière une définition changeante des performances d’inférence. Les charges de travail d’agents exposent des goulots d’étranglement que les tests à invite fixe peuvent manquer : réutilisation du contexte, écarts entre appels d’outils, capacité du cache, concurrence et alimentation électrique.

L’enseignement pratique pour les créateurs d’IA est de benchmarker des trajectoires complètes d’agents avant de s’engager sur une infrastructure. Les premiers résultats de NVIDIA suggèrent qu’un matériel étroitement intégré et un logiciel de service peuvent modifier de manière importante l’économie des agents de longue durée, mais l’ampleur de cet avantage reste non confirmée tant que les mesures sous-jacentes d’AgentX n’auront pas été examinées et reproduites de manière indépendante.

Publicités