A NVIDIA diz que o Vera Rubin NVL72 pode entregar até 30x mais throughput de IA agentiva por megawatt do que o GB300, mirando custos de inferência em contexto longo.

A NVIDIA diz que sua próxima plataforma Vera Rubin NVL72 pode entregar até 30 vezes mais throughput de IA agentiva por megawatt do que os sistemas GB300 NVL72 da empresa, oferecendo um possível ganho de eficiência para data centers que executam fluxos de trabalho de IA cada vez mais longos e com uso de ferramentas.
A afirmação vem de medições iniciais da NVIDIA usando a carga de trabalho SemiAnalysis AgentX, que preserva sessões de programação registradas, ampliando o contexto, as chamadas de ferramentas e a atividade de subagentes. A NVIDIA diz que os resultados são especialmente relevantes à medida que os agentes de IA vão além do chat de única resposta e começam a executar tarefas de pesquisa, programação, atendimento ao cliente e suporte à decisão em várias etapas.
Os números são reportados pelo fornecedor e ainda não foram validados de forma independente. A NVIDIA diz que os resultados do Vera Rubin ainda aguardam revisão da SemiAnalysis, e que os testes não incluem o desempenho da CPU Vera para chamadas de ferramentas.
A comparação da NVIDIA foca em throughput por megawatt em vez de tokens por segundo máximos de uma solicitação de inferência isolada. Essa distinção importa para sistemas agentivos, em que um modelo pode ler repetidamente o contexto acumulado, chamar ferramentas externas, delegar subtarefas e sintetizar os resultados.
Segundo a NVIDIA, o AgentX representa esses comportamentos por meio de trajetórias reais de programação agentiva. A empresa diz que o benchmark inclui modelos como Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 e DeepSeek V4 Pro, permitindo que o desempenho seja avaliado em diferentes arquiteturas de modelos e workloads.
No DeepSeek V4 Pro, a NVIDIA relata que o GB300 NVL72 entrega até 15 vezes o throughput por megawatt de sua arquitetura Hopper. Em seguida, o Vera Rubin é apontado como elevando esse número em até mais 30 vezes em relação ao GB300 NVL72. Esses são resultados máximos na carga de trabalho e no modelo citados, não uma garantia de que toda implantação verá a mesma melhora.
A NVIDIA também relata custos até 35 vezes menores por milhão de tokens em comparação com o GB300 NVL72. A empresa vincula essa medida à economia das fábricas de IA, nas quais a capacidade de energia limita quantas GPUs podem operar e o custo por token afeta a margem dos serviços de inferência.
Uma solicitação de chat convencional pode envolver uma entrada e uma saída relativamente curtas. A NVIDIA descreve sequências típicas para chat ou resumo de documentos como variando de cerca de 1.000 a 8.000 tokens. Sessões de agentes podem acumular centenas de milhares de tokens de entrada à medida que etapas anteriores, resultados de ferramentas e saídas de subagentes permanecem disponíveis para fases posteriores.
Isso cria um problema de sistema diferente. A infraestrutura precisa processar grandes quantidades de contexto mantendo a velocidade de resposta em muitas solicitações irregulares. Um workload também pode alternar entre processamento de contexto, conhecido como prefill, e geração de resposta, ou decode. Tratar ambas as etapas da mesma forma pode deixar algumas GPUs subutilizadas enquanto outras se tornam gargalos.
A resposta da NVIDIA combina técnicas de hardware e software. O serving desagregado permite que recursos de prefill e decode sejam escalados separadamente, enquanto o rate matching tenta manter as duas etapas sincronizadas. Sistemas distribuídos de KV-cache mantêm o contexto processado anteriormente disponível em todo o domínio de GPU, e o roteamento ciente de KV pode enviar uma solicitação ao hardware que já contém dados em cache relevantes.
A plataforma também depende de paralelismo de especialistas em larga escala para modelos mixture-of-experts, kernels CUDA projetados para combinar computação com comunicação e quantização NVFP4 para reduzir a memória necessária para os pesos do modelo. A NVIDIA diz que os Tensor Cores de quinta geração e seu Transformer Engine suportam as duas principais fases da inferência.
As afirmações de desempenho mais fortes desta matéria vêm dos próprios blogs de infraestrutura e desenvolvimento da NVIDIA, e não de um relatório de benchmark independente. A empresa atribui o desenho do workload à SemiAnalysis AgentX, mas diz que os resultados do Vera Rubin ainda aguardam revisão da SemiAnalysis. Isso torna os números uma indicação inicial do desempenho-alvo da NVIDIA, e não uma comparação estabelecida do setor.
A comparação também é limitada de várias maneiras. A NVIDIA relata ganhos máximos, então os resultados podem depender da escolha do modelo, do comprimento do contexto, da mistura de solicitações, do batching, das versões de software e das configurações de gerenciamento de energia. As medições citadas do Vera Rubin omitem o trabalho de CPU para chamadas de ferramentas, uma parte importante de agentes em produção. Aplicações reais também podem passar bastante tempo esperando bancos de dados, APIs ou sistemas corporativos em vez de gerar tokens.
A NVIDIA diz que sua tecnologia DSX MaxLPS pode gerenciar energia nos níveis de GPU, rack e workload e provisionar até 40% mais GPUs dentro do mesmo orçamento de megawatts. Essa é outra afirmação da empresa, e seu valor prático dependerá de refrigeração, design de rack, utilização e comportamento dos workloads implantados.
A economia da arquitetura está ligada à pilha de software mais ampla da NVIDIA, incluindo TensorRT LLM e NVIDIA Dynamo. A empresa argumenta que o domínio de scale-up NVL72 e as tecnologias NVLink de sexta geração fornecem a largura de banda de comunicação necessária para cache distribuído e paralelismo de especialistas. Essas escolhas de projeto podem melhorar o desempenho, mas também reforçam a dependência do ecossistema de hardware, rede e software da NVIDIA.
Para equipes de aplicações de IA, o anúncio reforça que o custo de agentes não pode ser avaliado apenas medindo o preço de uma única resposta do modelo. Um agente de pesquisa que reutiliza repetidamente um contexto em crescimento pode gerar muito mais trabalho de inferência do que um assistente de chat, mesmo quando o usuário vê apenas uma resposta final.
As equipes de infraestrutura, portanto, precisarão acompanhar métricas como custo por tarefa concluída, energia por fluxo de trabalho e throughput sob crescimento realista de contexto. Uma plataforma que funciona bem com prompts curtos pode não ser eficiente quando os agentes invocam ferramentas, criam subagentes ou revisitam históricos longos.
Para compradores corporativos, a pergunta imediata não é simplesmente se o Vera Rubin é mais rápido que o GB300. É se uma organização tem tráfego agentivo sustentado o suficiente para justificar uma nova plataforma, e se suas aplicações podem aproveitar recursos como cache, separação prefill-decode e quantização de modelo. Equipes com workloads modestos ou imprevisíveis ainda podem preferir inferência em nuvem compartilhada, enquanto grandes provedores de serviços de IA e data centers com restrição de energia têm incentivos mais fortes para otimizar trabalho por megawatt.
O anúncio também levanta uma questão de portabilidade de software. Os ganhos reportados pela NVIDIA dependem de co-design entre GPUs, NVLink, CUDA, TensorRT LLM e NVIDIA Dynamo. Criadores que usam essa pilha podem acessar mais otimização, mas podem enfrentar trabalho adicional de migração se depois moverem modelos ou workloads de serving para outras plataformas de aceleradores.
O primeiro sinal será a revisão independente dos resultados do SemiAnalysis AgentX. Ela deve esclarecer como os testes foram configurados, quais medições produziram os maiores ganhos e como o Vera Rubin se compara ao GB300 em diferentes modelos e comprimentos de contexto.
Os compradores também devem acompanhar a disponibilidade em produção, medições de energia em nível de sistema e resultados que incluam orquestração de ferramentas baseada em CPU. Esses detalhes ajudarão a distinguir eficiência de geração de tokens de eficiência agentiva de ponta a ponta.
Por fim, o mercado precisará de evidências de implantação. As comparações mais significativas vão medir tarefas de agentes concluídas, latência, confiabilidade, utilização e custo operacional total em workloads reais, em vez de apenas o throughput principal.
O anúncio da NVIDIA identifica um gargalo real na implantação de agentes: inferência em contexto longo e em várias etapas pode multiplicar a demanda computacional mais rápido do que as contagens de solicitações visíveis ao usuário sugerem. Medir trabalho por megawatt é, portanto, mais relevante para agentes em larga escala do que depender de benchmarks tradicionais de chat.
Mas o número de 30x deve ser tratado como uma afirmação inicial de desempenho controlada pelo fornecedor. Sua importância dependerá de replicação independente e de o ganho sobreviver às partes complicadas dos agentes em produção: latência de ferramentas, orquestração, chamadas falhas, tráfego desigual e custo de ponta a ponta. Para os criadores, a lição prática é benchmarkar fluxos de trabalho completos agora, antes de escolher infraestrutura com base apenas em taxas de tokens de contexto curto.