AI News

Alibaba a publié les poids ouverts de Qwen3.8-2.4T-A95B, un modèle mixture-of-experts de 2,4 billions de paramètres, tandis que NVIDIA a publié un parcours de déploiement pour l’exécuter sur le système GB300 NVL72 à l’échelle d’un rack de l’entreprise. L’annonce place un très grand modèle open weight au centre d’une pile matérielle et logicielle de serving conçue pour le raisonnement à long contexte et les applications agentiques.

Le modèle active 95 milliards de paramètres par token plutôt que d’utiliser l’ensemble de ses paramètres à chaque requête. NVIDIA indique que son déploiement initial en FP8 peut délivrer plus de 4 000 tokens par seconde et par GPU ainsi que plus de 350 tokens par seconde et par utilisateur sur GB300 NVL72, bien que ces chiffres proviennent des tests d’infrastructure de NVIDIA et ne doivent pas être considérés comme des benchmarks indépendants.

Un modèle à 2,4T conçu pour des workflows de longue durée

Qwen3.8-2.4T-A95B, également appelé Qwen3.8-Max dans l’article de NVIDIA, est positionné pour le code, l’analyse de documents à grande échelle et les charges de travail agentiques en plusieurs étapes. La publication d’Alibaba met les poids du modèle à disposition via Hugging Face et ModelScope, selon NVIDIA.

L’architecture combine un routage mixture-of-experts à granularité fine avec des couches alternant full-attention et linear-attention. Un routeur appris sélectionne les experts nécessaires pour chaque token, ce qui permet au coût de serving du modèle de dépendre davantage de ses paramètres actifs que de la capacité totale de 2,4T paramètres.

La conception de l’attention répond à un problème précis dans les systèmes agentiques : le contexte peut accumuler des instructions système, des résultats d’outils, des documents récupérés, du code source, des journaux et un raisonnement intermédiaire au fil de nombreux tours. NVIDIA affirme que le modèle prend en charge une fenêtre de contexte allant jusqu’à un million de tokens et une sortie allant jusqu’à 128K tokens. Ses couches de linear-attention utilisent un état récurrent borné à la place d’un cache key-value en croissance, tandis que les couches de full-attention conservent, lorsque nécessaire, une interaction plus large entre tokens.

Ces capacités sont pertinentes pour les équipes produit qui construisent des agents devant conserver l’état sur des workflows prolongés. Elles soulèvent aussi des questions pratiques d’infrastructure, car un contexte d’un million de tokens peut déplacer le goulot d’étranglement du calcul brut du modèle vers la capacité mémoire, la communication et la gestion du cache.

Pourquoi le système GB300 est important

Le GB300 NVL72 de NVIDIA intègre 72 GPU Blackwell Ultra dans une seule plateforme à l’échelle du rack. Le système fournit un domaine NVLink de 72 GPU avec 130 TB/s de communication all-to-all, selon NVIDIA. Cette interconnexion est importante pour un grand modèle MoE, car le routage des requêtes vers les experts via des réseaux de serveurs classiques peut entraîner une surcharge de communication et une utilisation inégale.

Servir Qwen3.8-2.4T-A95B dépend donc de bien plus que du simple placement des fichiers du modèle sur un ensemble d’accélérateurs. Le déploiement nécessite une exécution distribuée, des kernels optimisés et un runtime d’inférence capable de coordonner le trafic des experts à travers le rack. Le blog de NVIDIA présente la configuration GB300 comme un moyen de faire de cette coordination une partie de la conception du système plutôt que de s’appuyer uniquement sur un réseau standard.

NVIDIA indique que les résultats Day 0 rapportés ont été obtenus en FP8 sans réglage supplémentaire du modèle. L’entreprise s’attend à de nouveaux gains grâce à la précision NVFP4, mais n’a fourni aucune estimation de performance future dans l’annonce fournie. L’exécution en FP8 et en précision réduite peut diminuer les besoins en mémoire et en calcul, mais les acheteurs en production devront toujours évaluer la qualité des sorties, la stabilité numérique et le coût opérationnel du déploiement complet à l’échelle du rack.

Le raisonnement configurable modifie le compromis du serving

Une fonctionnalité notable du produit est le contrôle de raisonnement intégré de Qwen3.3-2.4T-A95B. Selon NVIDIA, les développeurs peuvent choisir, pour chaque requête, les modes de raisonnement low, high ou xhigh. Ces contrôles sont conçus pour permettre aux applications de faire un compromis entre profondeur d’inférence, qualité de réponse et latence.

C’est plus utile opérationnellement que de considérer le raisonnement comme un réglage global fixe. Un agent de codage confronté à un problème d’architecture ambigu pourrait utiliser un réglage plus élevé, tandis qu’un pipeline de traitement documentaire pourrait réduire la profondeur de raisonnement afin de maximiser le débit. Dans les systèmes d’entreprise, le choix pourrait également être lié à la priorité de la tâche, au niveau de l’utilisateur ou au budget de latence d’une application.

Ces contrôles n’éliminent pas la nécessité d’évaluations. Les équipes devront mesurer si des réglages de raisonnement plus élevés améliorent suffisamment l’exécution des tâches pour justifier le calcul supplémentaire, et si des réglages plus faibles préservent la précision pour des charges de travail répétitives. L’annonce ne fournit aucune analyse indépendante des différences de qualité entre les trois modes.

Preuves, choix logiciels et affirmations du fournisseur

La principale preuve de ce déploiement provient d’un article du NVIDIA Developer Blog, ce qui fait de NVIDIA la source des chiffres de performance, de la description du système et des recommandations de serving. Une autre entrée NVIDIA Developer renvoie à la même annonce mais n’apporte pas de reportage indépendant. Les éléments sources disponibles n’incluent pas de résultats de benchmark tiers, de déploiements clients ni d’adoption en production vérifiée.

NVIDIA cite SGLang, vLLM et NVIDIA Dynamo comme options d’inférence open source pour les développeurs souhaitant contrôler les performances de serving. L’entreprise propose également NVIDIA NIM, décrit dans l’article comme un conteneur d’inférence sans modèle pouvant servir les modèles pris en charge. Le flux de travail prévu consiste à télécharger les poids du modèle, à les déployer via le conteneur et à faire évoluer le service selon les besoins.

Pour la personnalisation, NVIDIA recommande NVIDIA NeMo AutoModel. La bibliothèque de fine-tuning native PyTorch prend en charge l’utilisation directe de checkpoints Hugging Face, le fine-tuning supervisé complet et l’adaptation basée sur LoRA, selon l’entreprise. Cela offre aux équipes une voie possible du checkpoint public vers des versions spécifiques à un domaine, mais la taille du modèle signifie que l’entraînement, le stockage des checkpoints et l’évaluation restent des projets d’infrastructure importants.

Les chiffres “plus de 4K tokens par seconde et par GPU” et “plus de 350 tokens par seconde et par utilisateur” sont particulièrement importants à interpréter avec soin. NVIDIA les présente comme des résultats Day 0 sur sa propre pile matérielle et logicielle. Ils indiquent la cible de performance de la recette de déploiement, et non un résultat universel devant être transposé tel quel à d’autres serveurs, réglages de précision, profils de batch ou charges de travail applicatives.

Ce que le déploiement signifie pour les concepteurs et les acheteurs

Pour les concepteurs d’AI, l’annonce élargit l’espace de conception open weight vers des modèles dont la capacité totale se mesure en billions de paramètres tandis que l’activation par token reste plus faible. Cela peut soutenir un raisonnement spécialisé et des comportements agentiques sans obliger un modèle dense de 2,4T à exécuter chaque paramètre à chaque token.

Cependant, le seuil matériel est élevé. Une plateforme à l’échelle du rack de 72 GPU n’est pas un environnement de développement classique, et les équipes devront tenir compte de l’utilisation, de l’ordonnancement, de la réplication du modèle, de la reprise après incident et des coûts énergétiques en plus des chiffres de tokens par seconde. Le modèle peut être techniquement ouvert, mais son exploitation à l’échelle annoncée sera probablement concentrée entre entreprises bien financées, fournisseurs cloud et organisations de recherche disposant d’infrastructures avancées.

Le déploiement illustre aussi une séparation croissante entre l’ouverture du modèle et son accessibilité opérationnelle. Les poids ouverts peuvent permettre l’expérimentation et le fine-tuning, mais le serving à long contexte et la communication MoE à grande échelle dépendent toujours de systèmes spécialisés. Les acheteurs évaluant le modèle devraient comparer le coût de bout en bout par tâche accomplie, et pas seulement la vitesse brute de génération. Ils devraient aussi tester l’usage d’outils, la récupération en long contexte, la fiabilité sur des exécutions en plusieurs étapes et le comportement avec différents réglages de raisonnement.

Ce qu’il faut surveiller ensuite

Le signal de suivi le plus clair sera un test indépendant de Qwen3.8-2.4T-A95B sur SGLang, vLLM et NVIDIA Dynamo, incluant la latence, le débit, l’utilisation mémoire et la qualité à chaque niveau de raisonnement. Des comparaisons avec d’autres modèles open weight montreront si l’architecture offre des avantages pratiques au-delà de son nombre de paramètres.

Les développeurs devraient également surveiller les optimisations NVFP4 promises, des recettes de déploiement supplémentaires et des preuves issues de charges de travail réelles en production. L’adoption des poids du modèle, des checkpoints fine-tunés et des applications agentiques à long contexte sera plus significative que la simple activité de téléchargement. Enfin, le coût et la disponibilité des systèmes GB300 NVL72 détermineront si cela reste בעיקרement une vitrine pour une infrastructure à l’échelle du rack ou devient une option de serving largement exploitable.

Perspective Creati.ai

L’annonce de NVIDIA est importante moins parce qu’elle rend universellement accessible un modèle à 2,4T paramètres que parce qu’elle montre comment les poids ouverts, le routage MoE, le raisonnement configurable et les interconnexions à l’échelle du rack sont conçus ensemble. Le déploiement traite l’inférence comme un problème de systèmes, où la communication et la mémoire deviennent aussi importantes que l’arithmétique des accélérateurs.

Pour les équipes produit, la question pratique n’est pas de savoir si le plus grand modèle peut générer des tokens rapidement. Il s’agit de savoir si ses contrôles de raisonnement et son architecture à long contexte améliorent suffisamment un workflow défini pour justifier une infrastructure spécialisée. Tant que des benchmarks indépendants et des preuves en production n’auront pas émergé, Qwen3.8-2.4T-A95B doit être considéré comme un modèle ouvert prometteur associé à un plan de serving communiqué par le fournisseur, plutôt que comme un choix par défaut éprouvé pour un déploiement en entreprise.

Vedettes

NVIDIA détaille le déploiement GB300 NVL72 pour le modèle Qwen3.8 à 2,4T paramètres d’Alibaba

NVIDIA explique comment le modèle open weight Qwen3.8 d’Alibaba s’exécute sur GB300 NVL72, avec un raisonnement configurable pour les charges de travail agentiques à grande échelle.