AWS faz benchmarks de modelos MoE de 30B no SageMaker AI entre G5, G6, G6e e G7, mostrando como o Blackwell pode melhorar custo e latência de inferência.

A Amazon Web Services está usando dois modelos Mixture-of-Experts de 30 bilhões de parâmetros para comparar gerações de GPU para inferência em produção no Amazon SageMaker AI. O benchmark da empresa examina configurações G5, G6, G6e e a nova G7 em termos de throughput, latência e custo por token, com a AWS relatando que instâncias G7 equipadas com NVIDIA Blackwell podem oferecer melhor relação preço-desempenho para workloads selecionados.
O benchmark é importante porque o tamanho do modelo, sozinho, não determina a economia do serving. Quantização, largura de banda de memória, roteamento de experts e a stack de software de serving podem mudar qual instância é a escolha mais prática. Os resultados da AWS, publicados em seu Machine Learning Blog, são portanto mais bem lidos como um estudo de implantação do que como um ranking universal de famílias de GPU.
A AWS testou Qwen3-Coder-30B-A3B-Instruct-FP8 para casos de uso de programação, incluindo geração de código, depuração, refatoração e copilots para desenvolvedores. Esse experimento compara instâncias ml.g5.12xlarge usando GPUs NVIDIA A10G, instâncias ml.g6.12xlarge usando GPUs NVIDIA L4 e instâncias ml.g7.12xlarge usando GPUs RTX PRO 4500 Blackwell. O teste usa o container SageMaker AI DJL Large Model Inference.
O segundo cenário da empresa usa NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 para raciocínio, perguntas e respostas, sumarização e workloads agênticos. Em vez de implantar apenas endpoints fixos, a AWS usa SageMaker AI Generative AI Inference Recommendations com vLLM para avaliar opções G6, G6e e G7 e identificar uma configuração com base em um objetivo de otimização selecionado.
Essa distinção é importante. O teste Qwen3-Coder-30B representa uma comparação direta de endpoints implantados sob uma carga de trabalho de programação esperada. O exercício Nemotron-3-Nano-30B representa um processo automatizado de recomendação no qual o SageMaker AI avalia configurações candidatas e as classifica por métricas como custo, latência e throughput.
As configurações não contêm quantidades equivalentes de memória de GPU. Para a comparação com Qwen3-Coder-30B, as instâncias G5 e G6 usam quatro GPUs com 96 GB de memória total de GPU, enquanto a configuração G7 usa duas GPUs com 64 GB. A AWS apresenta esse desequilíbrio como parte do teste: a instância mais nova está sendo avaliada apesar de ter menos aceleradores e menos memória total.
A segunda comparação é igualmente desigual. A configuração G6 tem quatro GPUs L4 e 96 GB de memória agregada, a G6e tem quatro GPUs L40S e 192 GB, e a G7 tem duas GPUs com 64 GB. Isso torna o exercício mais próximo de um problema de seleção em produção do que de um simples benchmark geração sobre geração. Uma configuração que vença em preço-desempenho ainda pode ser inadequada se o modelo, os pesos ou o estado de runtime não couberem na memória disponível.
A AWS aponta duas características de hardware por trás da possível vantagem da G7. Primeiro, a G7 usa GPUs NVIDIA Blackwell, que oferecem suporte nativo a formatos de baixa precisão, incluindo NVFP4. Segundo, a arquitetura oferece capacidades de memória e computação destinadas a melhorar a geração de tokens. A AWS diz que as outras gerações testadas podem executar pesos NVFP4, mas sem a mesma aceleração de hardware.
Para modelos MoE, a AWS argumenta que a largura de banda de memória é especialmente relevante durante o decoding porque cada token ativa apenas um subconjunto de experts. Isso pode tornar o movimento de dados e a latência entre tokens mais importantes do que a contagem de parâmetros do modelo em destaque. O resultado prático é dependente do workload: um modelo que se beneficia de aceleração de baixa precisão pode mostrar uma preferência de instância diferente de outro limitado por capacidade de memória ou por uma estrutura de serving específica.
As evidências disponíveis vêm do próprio post técnico da AWS e de walkthroughs. A AWS afirma que os testes com G7 mostram melhorias mensuráveis em throughput, latência e custo por token, e descreve a G7 como uma possível líder em preço-desempenho para os casos de uso testados. Esses são resultados reportados pelo fornecedor, não uma avaliação independente nem um benchmark realizado entre vários provedores de nuvem.
O material de origem fornecido não inclui os resultados numéricos subjacentes, a duração do teste, a distribuição de requisições, níveis de concorrência, preços regionais ou tabelas detalhadas de custo por token. Portanto, não é possível estabelecer quão grandes são os ganhos, quão consistentemente aparecem ou se o mesmo resultado se aplicaria a outros modelos e padrões de tráfego.
Os resultados também são moldados pelo software escolhido. Qwen3-Coder-30B é avaliado pelo container DJL Large Model Inference, enquanto o fluxo de trabalho do Nemotron-3-Nano-30B usa vLLM e a ferramenta de recomendação da SageMaker AI. Mudanças em batching, agendamento, quantização, comprimento de contexto ou concorrência de requisições podem alterar o resultado. Os compradores devem reproduzir o teste com seus próprios prompts e objetivos de nível de serviço antes de tratar a recomendação da AWS como uma decisão de produção.
A AWS diz que o recurso de recomendação executa configurações candidatas em infraestrutura GPU real e retorna sugestões validadas e prontas para implantação com base no desempenho medido. Ainda assim, “validado” nesse contexto se refere ao workflow de benchmark do serviço, e não a uma certificação independente da qualidade, segurança ou adequação comercial do modelo.
Para builders, a lição imediata é benchmarkar a configuração completa de serving em vez de escolher hardware apenas por uma folha de especificações de GPU. Uma equipe que implanta um assistente de programação deve medir tempo até o primeiro token, latência entre tokens, throughput sustentado e custo sob concorrência realista. Uma equipe que constrói uma aplicação agêntica pode precisar ponderar prompts curtos e tráfego em rajada de forma diferente de um serviço de sumarização em lote.
O fluxo de recomendação da SageMaker AI pode reduzir o trabalho manual de testar várias famílias de instâncias, especialmente para equipes que já gerenciam endpoints na AWS. No entanto, ele não elimina a necessidade de definir o workload com precisão. Um perfil de tráfego ou objetivo de otimização incorreto pode produzir uma recomendação tecnicamente válida, mas mal ajustada à produção.
A memória continua sendo uma restrição de implantação. A menor memória total da G7 nos exemplos pode torná-la atraente para modelos que se encaixam eficientemente por meio de FP8 ou NVFP4, mas menos adequada para implantações que exigem janelas de contexto maiores, caches key-value extensos ou componentes adicionais do modelo. O maior footprint de memória da G6e pode permanecer preferível quando capacidade importa mais do que economia bruta por token.
Para compradores corporativos, a comparação também destaca o risco de portabilidade. O valor da aceleração NVIDIA Blackwell depende de formatos suportados, implementações de modelos e maturidade do runtime. Equipes que padronizam um modelo devem verificar se a rota de quantização preferida e o mecanismo de inferência usam o hardware de forma eficaz, em vez de assumir que uma GPU mais nova reduz automaticamente o custo total de serving.
O mais útil seria a AWS publicar as tabelas completas do benchmark, incluindo throughput, tempo até o primeiro token, latência entre tokens, concorrência, preços regionais e custo por token para cada configuração. Esses números mostrariam se a vantagem da G7 é ampla ou concentrada em formas específicas de workload.
As equipes também devem observar a disponibilidade da G7. A AWS observa que a G7 está geralmente disponível em US East (Ohio) e US West (Oregon) na configuração descrita, tornando a capacidade regional e os requisitos de residência de dados parte da decisão de compra.
Comparações futuras também deveriam testar contextos mais longos, diferentes tamanhos de lote, formatos adicionais de quantização e modelos fora dos dois exemplos MoE de 30B selecionados. A replicação independente entre nuvens forneceria uma base mais sólida para avaliar se a vantagem do Blackwell sobrevive a diferentes ambientes de preços e software.
A AWS não está anunciando um novo modelo nem um substituto universal para G5 e G6. Ela está fazendo uma tese de infraestrutura mais estreita, porém importante: aceleradores mais novos podem mudar a economia do serving de LLMs pequenos e médios quando o modelo e o runtime expõem as vantagens certas de baixa precisão e largura de banda de memória.
O sinal mais forte para equipes de IA é a mudança em direção à seleção automatizada de instâncias específica para o workload. Mas, como as evidências publicadas são controladas pela AWS e carecem dos detalhes numéricos do benchmark no material fornecido, os compradores devem tratar os ganhos relatados da G7 como uma hipótese inicial. O vencedor em produção dependerá do ajuste do modelo, das metas de latência, da forma do tráfego, da disponibilidade regional e do custo de operar toda a stack de inferência.