AWS compare des modèles MoE de 30B sur SageMaker AI entre G5, G6, G6e et G7, montrant comment Blackwell pourrait améliorer le coût et la latence d’inférence.

Amazon Web Services utilise deux modèles Mixture-of-Experts de 30 milliards de paramètres pour comparer des générations de GPU dans le cadre de l’inférence en production sur Amazon SageMaker AI. Le benchmark de l’entreprise examine les configurations G5, G6, G6e et la nouvelle G7 selon le débit, la latence et le coût par token, AWS indiquant que les instances G7 alimentées par NVIDIA Blackwell peuvent offrir un meilleur rapport prix-performance pour certains workloads.
Ce benchmark est important, car la taille du modèle seule ne détermine pas l’économie du serving. La quantification, la bande passante mémoire, le routage des experts et la pile logicielle de serving peuvent tous modifier l’instance la plus pratique. Les résultats d’AWS, publiés dans son Machine Learning Blog, doivent donc être lus comme une étude de déploiement plutôt que comme un classement universel des familles de GPU.
AWS a testé Qwen3-Coder-30B-A3B-Instruct-FP8 pour des cas d’usage de codage, notamment la génération de code, le débogage, le refactoring et les copilotes pour développeurs. Cette expérience compare des instances ml.g5.12xlarge utilisant des GPU NVIDIA A10G, des instances ml.g6.12xlarge utilisant des GPU NVIDIA L4 et des instances ml.g7.12xlarge utilisant des GPU RTX PRO 4500 Blackwell. Le test utilise le conteneur SageMaker AI DJL Large Model Inference.
Le deuxième scénario de l’entreprise utilise NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 pour le raisonnement, la question-réponse, la synthèse et les charges de travail agentiques. Plutôt que de déployer uniquement des endpoints fixes, AWS utilise SageMaker AI Generative AI Inference Recommendations avec vLLM pour évaluer les options G6, G6e et G7 et identifier une configuration en fonction d’un objectif d’optimisation sélectionné.
Cette distinction est importante. Le test Qwen3-Coder-30B représente une comparaison directe d’endpoints déployés dans le cadre d’un workload de codage attendu. L’exercice Nemotron-3-Nano-30B représente un processus de recommandation automatisé dans lequel SageMaker AI évalue des configurations candidates et les classe selon des métriques telles que le coût, la latence et le débit.
Les configurations ne contiennent pas des quantités équivalentes de mémoire GPU. Pour la comparaison avec Qwen3-Coder-30B, les instances G5 et G6 utilisent chacune quatre GPU avec 96 Go de mémoire GPU agrégée, tandis que la configuration G7 utilise deux GPU avec 64 Go. AWS présente ce déséquilibre comme faisant partie du test : la nouvelle instance est évaluée malgré un nombre réduit d’accélérateurs et une mémoire totale moindre.
La deuxième comparaison est tout aussi inégale. La configuration G6 dispose de quatre GPU L4 et de 96 Go de mémoire agrégée, G6e de quatre GPU L40S et de 192 Go, et G7 de deux GPU avec 64 Go. Cela rapproche l’exercice d’un problème de sélection en production plutôt que d’un simple benchmark génération contre génération. Une configuration qui l’emporte sur le prix-performance peut néanmoins être inadaptée si le modèle, les poids ou l’état d’exécution ne tiennent pas dans la mémoire disponible.
AWS met en avant deux caractéristiques matérielles à l’origine de l’avantage potentiel de G7. D’abord, G7 utilise des GPU NVIDIA Blackwell, qui offrent une prise en charge native des formats à faible précision, dont NVFP4. Ensuite, l’architecture fournit des capacités mémoire et de calcul destinées à améliorer la génération de tokens. AWS indique que les autres générations testées peuvent exécuter des poids NVFP4, mais sans la même accélération matérielle.
Pour les modèles MoE, AWS estime que la bande passante mémoire est particulièrement importante pendant le décodage, car chaque token n’active qu’un sous-ensemble d’experts. Cela peut rendre le transfert de données et la latence entre tokens plus importants que le nombre brut de paramètres du modèle. Le résultat pratique dépend du workload : un modèle qui bénéficie d’une accélération en faible précision peut présenter une préférence d’instance différente d’un modèle limité par la capacité mémoire ou par un framework de serving particulier.
Les preuves disponibles proviennent du propre billet technique d’AWS et de ses guides pratiques. AWS affirme que les tests G7 montrent des améliorations mesurables en débit, latence et coût par token, et décrit G7 comme un potentiel leader du rapport prix-performance pour les cas d’usage testés. Il s’agit de résultats rapportés par le fournisseur, et non d’une évaluation indépendante ou d’un benchmark mené sur plusieurs fournisseurs cloud.
Le matériel source fourni n’inclut pas les résultats numériques sous-jacents, la durée des tests, la distribution des requêtes, les niveaux de concurrence, les prix régionaux ni des tableaux détaillés de coût par token. Il ne permet donc pas d’établir l’ampleur des gains, leur régularité ou si le même résultat s’appliquerait à d’autres modèles et schémas de trafic.
Les résultats sont aussi façonnés par le logiciel choisi. Qwen3-Coder-30B est évalué via le conteneur DJL Large Model Inference, tandis que le workflow Nemotron-3-Nano-30B utilise vLLM et l’outil de recommandation de SageMaker AI. Des changements dans le batching, l’ordonnancement, la quantification, la longueur du contexte ou la concurrence des requêtes pourraient modifier le résultat. Les acheteurs devraient reproduire le test avec leurs propres prompts et objectifs de niveau de service avant de considérer la recommandation d’AWS comme une décision de production.
AWS indique que la fonction de recommandation exécute des configurations candidates sur une infrastructure GPU réelle et renvoie des suggestions validées et prêtes à déployer, fondées sur les performances mesurées. Toutefois, « validé » dans ce contexte fait référence au workflow de benchmark du service, et non à une certification indépendante de la qualité, de la sécurité ou de l’adéquation commerciale du modèle.
Pour les développeurs, la leçon immédiate est de benchmarker l’ensemble de la configuration de serving plutôt que de choisir le matériel à partir d’une fiche technique GPU. Une équipe qui déploie un assistant de codage devrait mesurer le temps jusqu’au premier token, la latence inter-token, le débit soutenu et le coût sous une concurrence réaliste. Une équipe construisant une application agentique peut devoir pondérer différemment les prompts courts et le trafic en rafales par rapport à un service de synthèse par lots.
Le workflow de recommandation de SageMaker AI pourrait réduire le travail manuel impliqué par le test de plusieurs familles d’instances, en particulier pour les équipes qui gèrent déjà des endpoints sur AWS. Il n’élimine cependant pas la nécessité de définir précisément le workload. Un mauvais profil de trafic ou un mauvais objectif d’optimisation peut produire une recommandation techniquement valide mais mal adaptée à la production.
La mémoire reste une contrainte de déploiement. La moindre mémoire agrégée de G7 dans les exemples peut la rendre attrayante pour des modèles qui s’adaptent efficacement via FP8 ou NVFP4, mais moins adaptée aux déploiements nécessitant des fenêtres de contexte plus larges, de vastes caches key-value ou des composants de modèle supplémentaires. L’empreinte mémoire plus importante de G6e peut rester préférable lorsque la capacité compte davantage que l’économie brute par token.
Pour les acheteurs d’entreprise, la comparaison souligne aussi un risque de portabilité. La valeur de l’accélération NVIDIA Blackwell dépend des formats pris en charge, des implémentations de modèles et de la maturité de l’environnement d’exécution. Les équipes qui standardisent sur un modèle devraient vérifier que leur chemin de quantification préféré et leur moteur d’inférence exploitent efficacement le matériel, plutôt que de supposer qu’un GPU plus récent réduit automatiquement le coût total de serving.
Le plus utile serait qu’AWS publie les tableaux complets du benchmark, incluant le débit, le temps jusqu’au premier token, la latence inter-token, la concurrence, les prix régionaux et le coût par token pour chaque configuration. Ces chiffres montreraient si l’avantage de G7 est large ou concentré sur certaines formes de workload.
Les équipes devraient également surveiller la disponibilité de G7. AWS précise que G7 est généralement disponible dans US East (Ohio) et US West (Oregon) dans la configuration décrite, ce qui fait de la capacité régionale et des exigences de résidence des données une partie de la décision d’achat.
Les comparaisons futures devraient tester des contextes plus longs, différentes tailles de lot, des formats de quantification supplémentaires et des modèles en dehors des deux exemples MoE de 30B sélectionnés. Une réplication indépendante à travers plusieurs clouds fournirait une base plus solide pour évaluer si l’avantage de Blackwell résiste à différents environnements tarifaires et logiciels.
AWS n’annonce pas un nouveau modèle ni un remplacement universel des G5 et G6. L’entreprise formule plutôt un argument d’infrastructure plus ciblé, mais important : les accélérateurs plus récents peuvent modifier l’économie du serving des LLM petits et moyens lorsque le modèle et le runtime exposent les bons avantages de faible précision et de bande passante mémoire.
Le signal le plus fort pour les équipes IA est l’évolution vers une sélection automatisée d’instances spécifique au workload. Mais comme les preuves publiées sont contrôlées par AWS et qu’elles ne comportent pas les détails numériques du benchmark dans le matériel fourni, les acheteurs devraient considérer les gains G7 annoncés comme une hypothèse de départ. Le gagnant en production dépendra de l’adéquation du modèle, des objectifs de latence, de la forme du trafic, de la disponibilité régionale et du coût d’exploitation de toute la pile d’inférence.