NVIDIA met Groq 3 LPX en production pour étendre Vera Rubin à l’inférence agentique

NVIDIA a mis Groq 3 LPX en production complète aux côtés de Vera Rubin, visant une inférence plus rapide à long contexte pour les agents et les fournisseurs de cloud IA.

AI News

NVIDIA indique que son système d’inférence Groq 3 LPX est entré en production complète et qu’il est intégré à la plateforme rack-scale Vera Rubin NVL72. L’ensemble est conçu pour accélérer la génération de tokens pour les applications agentiques, où les modèles raisonnent à plusieurs reprises, appellent des outils et traitent des historiques de conversation ou de tâches de plus en plus longs.

Cette annonce étend la stratégie Vera Rubin de NVIDIA au-delà du calcul accéléré à usage général. L’entreprise positionne les GPU Rubin pour le traitement de contextes à grande échelle, tandis que Groq 3 LPX prend en charge le décodage sensible à la latence, l’étape où un modèle génère la sortie un token à la fois. Cette répartition vise les fournisseurs de cloud IA et les entreprises qui recherchent des agents plus réactifs sans renoncer au débit sur de grands déploiements.

NVIDIA ajoute une couche à faible latence à Vera Rubin

Selon NVIDIA, Groq 3 LPX est un accélérateur d’inférence IA interactif conçu pour fonctionner aux côtés de Vera Rubin NVL72 plutôt que pour le remplacer. L’entreprise décrit la plateforme comme une combinaison de GPU et de LPU, ou unités de traitement locales, chaque composant étant affecté aux charges de travail pour lesquelles il est le plus efficace.

Le besoin de cette séparation découle du comportement des charges de travail agentiques. Un agent peut générer une réponse, utiliser un outil externe, recevoir de nouvelles informations et commencer un autre tour d’inférence. Chaque tour peut enrichir le contexte de la session, obligeant finalement le système à traiter des dizaines ou des centaines de milliers de tokens tout en continuant à produire une réponse rapidement.

NVIDIA affirme que les GPU Rubin peuvent gérer la lourde charge de traitement du contexte, tandis que Groq 3 LPX est optimisé pour les performances de décodage. Le système peut également être configuré pour la disaggregation prefill-decode, la disaggregation attention-FFN et le speculative decoding avec external drafter. Il s’agit de techniques d’infrastructure qui divisent les tâches de service du modèle ou utilisent des tokens prédits pour améliorer la vitesse de réponse.

Un déploiement à l’échelle du rack peut inclure 256 accélérateurs LP30 connectés via des liaisons directes puce à puce, selon NVIDIA. La documentation développeur de l’entreprise décrit 128 Go de SRAM combinée sur ces puces et un compilateur qui planifie le calcul et la communication avant l’exécution. Cette approche déterministe vise à réduire la surcharge de coordination qui peut devenir importante lorsque les modèles sont servis avec de petites tailles de lot.

Ce que le benchmark montre — et ce qu’il ne montre pas

Les affirmations de performance les plus fortes de NVIDIA proviennent d’un benchmark Artificial Analysis, ce qui signifie qu’il s’agit de mesures tierces citées par le fournisseur plutôt que d’une preuve indépendante de performances de production à grande échelle. Sur le modèle Gemma 4 31B avec un contexte de 100 000 tokens, Artificial Analysis a mesuré une vitesse médiane de 3 431 tokens de sortie par seconde sur Groq 3 LPX, selon le blog développeur de NVIDIA.

L’annonce officielle de NVIDIA arrondit ce chiffre à 3 400 tokens de sortie par seconde et indique que le résultat était quatre fois plus rapide que la plateforme alternative la plus proche. Le matériel source n’identifie pas cette plateforme concurrente dans l’annonce, de sorte que la comparaison ne peut pas être évaluée indépendamment à partir des éléments disponibles.

Un deuxième résultat provient de SPEED-Bench, un benchmark de codage utilisant Gemma 4. NVIDIA annonce une médiane de 4 767 tokens de sortie par seconde et un résultat au 80e percentile de 5 520 tokens par seconde. Ces chiffres décrivent un modèle, un contexte et une méthodologie de test précis ; ils ne doivent pas être considérés comme une mesure universelle des performances à travers les modèles, les tailles de lot, les longueurs de contexte ou les schémas de trafic de production.

L’explication technique avancée par NVIDIA est que Groq 3 LPX utilise une communication puce à puce planifiée par le compilateur et superpose le mouvement des données au calcul. Dans l’inférence parallèle conventionnelle, la répartition du travail entre processeurs peut introduire des coûts de synchronisation et de communication collective. NVIDIA soutient qu’une planification préalable des transferts peut supprimer le besoin de certaines arbitrages en temps réel, en particulier avec de petites tailles de lot associées à un service hautement interactif.

Aucune des sources ne fournit de volumes de déploiement clients, de tarification, de consommation électrique, de calendrier de disponibilité générale pour les développeurs ou d’utilisation en production vérifiée de manière indépendante. Les éléments disponibles établissent les affirmations de NVIDIA sur le produit et l’architecture, mais ils ne montrent pas encore comment le système se comporte économiquement sur une large gamme de charges de travail commerciales.

Premiers adopteurs cloud et infrastructure

NVIDIA identifie trois partenaires associés à l’expansion de Vera Rubin. Nebius est présenté comme le premier cloud IA à adopter Groq 3 LPX. NVIDIA indique que le matériel sera ajouté à la Token Factory de l’entreprise afin que les développeurs puissent créer à grande échelle des agents interactifs, des systèmes de codage et d’autres applications en temps réel.

CoreWeave, de son côté, a déployé Spectrum-X Multiplane en production, selon NVIDIA. Le système de réseau relie les racks Vera Rubin via plusieurs commutateurs parallèles, avec pour objectif déclaré de fournir une communication à large bande passante et sans perte sur l’ensemble de l’infrastructure cloud IA.

NVIDIA affirme également que SpaceXAI prévoit d’utiliser des CPU Vera dans son architecture d’IA agentique de nouvelle génération. L’entreprise relie ces CPU à l’orchestration, à l’utilisation d’outils, à l’exécution de code, au traitement de données et à la simulation, y compris une infrastructure couvrant des centres de données terrestres et des satellites en orbite. Il s’agit d’un plan déclaré, pas d’une preuve qu’un tel déploiement fonctionne déjà à grande échelle.

Ces références à des partenaires indiquent que NVIDIA vend Vera Rubin comme une pile complète de factory IA : des CPU pour l’orchestration et les tâches générales, des GPU pour le contexte et le calcul des modèles, des accélérateurs Groq pour le décodage rapide, et un réseau pour relier les composants. L’importance commerciale dépendra de la capacité des clients à déployer cette pile plus efficacement que des pools d’accélérateurs séparés optimisés pour différentes étapes de service.

Pourquoi cette architecture compte pour les créateurs d’IA et les entreprises

Pour les créateurs d’assistants de codage, d’agents de recherche et de systèmes de service client, la latence de décodage est ressentie directement par les utilisateurs. Une première réponse plus rapide ou une sortie intermédiaire plus rapide peut rendre un flux de travail en plusieurs étapes plus interactif, en particulier lorsqu’un agent doit effectuer de nombreux appels séquentiels.

Le contexte long modifie également l’équation d’infrastructure. Une session qui retraiterait sans cesse son historique peut consommer une mémoire et une puissance de calcul importantes, même lorsque le modèle lui-même n’est pas particulièrement grand. La conception de NVIDIA cible cette combinaison de grands caches clé-valeur, d’inférence à petits lots et de communication fréquente entre processeurs.

La question pratique pour les entreprises sera moins le pic de tokens par seconde que les performances au niveau du service sous trafic réel. Les acheteurs devront évaluer la latence à différents niveaux de concurrence, tailles de contexte et architectures de modèles, ainsi que le coût du maintien de la capacité d’inférence spécialisée en utilisation. Un système exceptionnellement rapide sur une charge de benchmark peut être moins attractif si la demande est variable ou si les applications nécessitent des modèles et des logiciels qui ne sont pas encore optimisés pour la plateforme.

L’annonce intensifie également la concurrence autour de la spécialisation de l’inférence. NVIDIA utilise la portée plus large de sa plateforme pour associer un accélérateur dédié à faible latence à ses futurs produits GPU, CPU et réseau. Cela pourrait séduire les fournisseurs de cloud qui construisent des services d’inférence différenciés, mais cela augmente aussi la complexité logicielle et opérationnelle par rapport à une architecture d’accélérateur unique.

Ce qu’il faut surveiller ensuite

Le signal de suivi le plus clair sera de savoir si Nebius propose aux développeurs des services basés sur Groq 3 LPX et publie des informations sur les performances de production, les prix ou la capacité. Ces détails permettraient de distinguer une annonce matérielle d’une option de service largement accessible.

Les clients devraient également surveiller des résultats indépendants au-delà de Gemma 4 31B et du benchmark de codage rapporté. Des résultats sur des modèles plus grands et plus petits, avec des longueurs de contexte variables, des utilisateurs concurrents et des flux de travail agentiques complets offriraient une base plus solide pour évaluer la plateforme.

Les preuves de déploiement de CoreWeave et SpaceXAI constitueront un autre indicateur important. NVIDIA a confirmé le déploiement réseau en production de CoreWeave et décrit les plans CPU Vera de SpaceXAI, mais les sources ne fournissent pas de données sur l’échelle, la charge de travail ou l’utilisation. L’efficacité énergétique, le support logiciel et la compatibilité avec les frameworks d’inférence populaires détermineront également si l’architecture gagne en adoption au-delà des partenaires nommés par NVIDIA.

Point de vue de Creati.ai

La nouvelle de NVIDIA doit être comprise avant tout comme une étape de production et d’intégration système, et non simplement comme le lancement d’une nouvelle puce d’inférence. L’entreprise répond à un problème de service précis : les agents génèrent de longues chaînes de tokens tout en transportant un contexte important, ce qui rend à la fois la latence de décodage et la surcharge d’interconnexion commercialement importantes.

Les résultats rapportés sont prometteurs, mais restent limités par des benchmarks sélectionnés par le fournisseur et par des preuves publiques de déploiement limitées. Pour les équipes IA, le test pertinent sera de savoir si Groq 3 LPX et Vera Rubin offrent une latence prévisible et une économie acceptable sur leurs propres charges de travail agentiques. Si c’est le cas, l’approche intégrée de « token factory » de NVIDIA pourrait devenir une option sérieuse pour les services à forte interactivité ; sinon, les composants spécialisés pourraient rester difficiles à justifier malgré de solides performances de pointe.

Publicités