NVIDIA afirma que Vera Rubin NVL72 entrega até 30x mais trabalho de IA agentica por watt

A NVIDIA diz que a Vera Rubin NVL72 pode entregar até 30x mais throughput de IA agentica por megawatt do que a GB300, remodelando a economia da inferência.

AI News

A NVIDIA diz que sua próxima plataforma Vera Rubin NVL72 pode entregar até 30 vezes o throughput de IA agentica por megawatt de sua predecessora GB300 NVL72. A alegação vem de resultados iniciais no SemiAnalysis AgentX, um benchmark projetado para reproduzir sessões de agentes de codificação em estilo de produção, em vez de prompts de chatbot de comprimento fixo.

O resultado importa porque os agentes de IA geram muito mais tráfego de inferência do que o chat convencional. A NVIDIA cita dados da OpenRouter mostrando que uma solicitação agentica consome cerca de 15 vezes mais tokens do que uma interação simples de chat. Os agentes raciocinam repetidamente, chamam ferramentas, delegam tarefas a subagentes e carregam um contexto em expansão a cada etapa, colocando pressão tanto na capacidade de computação quanto nos orçamentos de energia.

Os resultados da NVIDIA são relatados pelo fornecedor e ainda aguardam revisão pela SemiAnalysis. Portanto, indicam a meta de desempenho da empresa para Rubin, não um ranking independente confirmado do setor. Ainda assim, a escolha do benchmark aponta para uma mudança mais ampla em como os provedores de infraestrutura podem precisar medir sistemas de IA à medida que cargas de trabalho de múltiplas etapas entram em produção.

Um benchmark construído em torno do comportamento real dos agentes

A carga de trabalho AgentX, parte da suíte de benchmarks InferenceX da SemiAnalysis, reproduz sessões gravadas do Claude Code com raciocínio do modelo e uso de ferramentas intercalados. Ela preserva os comprimentos originais de sequência, o crescimento de contexto, os intervalos de raciocínio e os atrasos nas chamadas de ferramentas, de acordo com material do NVIDIA Developer Blog.

Esse desenho difere de testes tradicionais de inferência construídos em torno de um tamanho fixo de entrada e saída. Em uma sessão de agente, o prompt pode se expandir de milhares de tokens para centenas de milhares à medida que o sistema acumula pesquisa, código, resultados de ferramentas e trabalho delegado. O contexto processado anteriormente também pode ser reutilizado por meio de um cache chave-valor, enquanto a execução de ferramentas cria lacunas entre chamadas do modelo.

O AgentX varia a concorrência e avalia o throughput contra métricas de interatividade como tempo até o primeiro token, latência de ponta a ponta e tokens por segundo por usuário. A NVIDIA diz que o principal resultado da Rubin foi medido em 160 tokens por segundo por usuário na carga de trabalho AgentX DeepSeek V4 Pro. Nesse ponto de operação, a empresa relata até 30 vezes mais throughput por megawatt do que a GB300 NVL72.

A comparação não é uma declaração geral sobre todos os modelos ou implantações. O resultado citado está ligado a uma configuração de plataforma, carga de trabalho e meta de interatividade específicas. A NVIDIA também diz que a medição ainda não inclui o desempenho da CPU Vera para chamadas de ferramentas, deixando parte do sistema de agente de ponta a ponta fora do número reportado.

O que a NVIDIA está mudando na pilha de inferência

A NVIDIA atribui o resultado a uma combinação de hardware, rede e software, e não apenas à GPU Rubin. O design NVL72 cria um grande domínio de scale-up no qual as GPUs compartilham comunicação de alta largura de banda e baixa latência por meio de sistemas NVLink de sexta geração e NVLink Switch.

Essa topologia dá suporte a técnicas voltadas a cargas de trabalho de contexto longo e mixture-of-experts. A NVIDIA destaca o KV caching distribuído, que mantém o contexto processado anteriormente disponível entre GPUs, e o KV-aware routing, que pode direcionar uma solicitação ao hardware que já contém dados de cache relevantes. O serving disaggregated separa o prefill, no qual o contexto é processado, do decode, no qual as respostas são geradas, permitindo que cada etapa escale de forma independente.

A camada de software inclui NVIDIA TensorRT-LLM, NVIDIA Dynamo e kernels CUDA projetados para combinar computação com comunicação entre GPUs. A empresa também aponta a quantização NVFP4 e os recursos mais recentes dos Tensor Cores e do Transformer Engine como formas de reduzir o uso de memória e aumentar o throughput de tokens.

A tecnologia de gerenciamento de energia DSX MaxLPS da NVIDIA é apresentada como outra alavanca. A empresa diz que pode provisionar até 40% mais GPUs dentro do mesmo orçamento de megawatts ao gerenciar energia nos níveis de GPU, rack e carga de trabalho. A NVIDIA afirma separadamente que a Rubin pode reduzir o custo por milhão de tokens em até 35 vezes em relação à GB300 NVL72 na carga de trabalho citada.

Evidência, comparações e limites

Os mesmos dados do AgentX dão uma visão mais gradual dos ganhos geracionais da NVIDIA. A NVIDIA relata que a GB300 NVL72 entrega até 15 vezes o throughput por megawatt da H200 NVL8 para DeepSeek V4 Pro 1.6T, e até 80 vezes para o modelo maior Kimi K3 2.8T. A empresa também afirma que a GB300 fornece até 10 vezes menor custo por milhão de tokens do que a H200 na comparação citada.

Esses números também são apresentados pela NVIDIA usando a carga de trabalho da SemiAnalysis. O benchmark subjacente foi concebido para tornar as comparações mais realistas ao reproduzir tráfego idêntico, mas as medições da Rubin ainda não receberam a revisão independente mencionada nas publicações da NVIDIA. Os leitores devem, portanto, distinguir entre a metodologia do benchmark e os números de desempenho reportados a partir dele.

As alegações também não estabelecem que toda carga de trabalho de agente verá um ganho de 30x. Os resultados podem variar com arquitetura do modelo, comprimento do contexto, reutilização de cache, concorrência, latência de ferramentas, configurações de quantização e velocidade de resposta exigida. Um agente de codificação que frequentemente espera por um compilador ou API externa pode ser limitado por software e orquestração, e não pelo throughput bruto do acelerador.

Por que o resultado importa para construtores e compradores de IA

Para operadores de infraestrutura de IA, desempenho por watt está se tornando uma métrica de capacidade e de economia unitária, não apenas uma medida ambiental. Se os ganhos relatados se mantiverem em testes independentes, um operador de data center poderia atender mais sessões simultâneas de agentes dentro de uma alocação fixa de energia, ou fornecer a mesma capacidade com menos aceleradores e menor custo operacional.

Isso pode afetar a forma como as empresas projetam fábricas de IA para assistentes de codificação, agentes de pesquisa, sistemas de atendimento ao cliente e automação interna. As equipes podem precisar otimizar todo o fluxo de trabalho: cache de contexto, agendamento de prefill e decode, roteamento de modelos, latência de chamadas de ferramentas e tratamento do tráfego de subagentes. Escolher uma GPU mais rápida sem alterar esses sistemas ao redor pode deixar uma parcela significativa do benefício alegado sem realização.

Os resultados também elevam a barra competitiva para os fornecedores de infraestrutura. Testes fixos de entrada 8K e saída 1K continuam úteis para comparações controladas, mas podem dizer menos sobre tráfego de agentes stateful. Compradores que avaliam uma plataforma de IA devem perguntar se seus benchmarks preservam crescimento de contexto, pausas de ferramentas, reutilização de cache e metas realistas de experiência do usuário.

Para desenvolvedores de modelos, a ênfase em serving de contexto longo e execução mixture-of-experts pode tornar um design consciente da infraestrutura mais importante. Quantização e cache podem reduzir custos, mas também introduzem trade-offs de qualidade, gerenciamento de memória e operação que precisam ser testados no fluxo de trabalho real do agente, e não inferidos de um único número de throughput.

O que observar a seguir

O sinal mais imediato é a revisão da SemiAnalysis sobre os resultados AgentX da Vera Rubin NVL72. A publicação independente da configuração do teste, da contabilização de energia, das definições do modelo e das medições de interatividade ajudará a determinar quão reproduzível é o número de 30x.

Resultados de benchmark em modelos adicionais também serão importantes. A NVIDIA cita DeepSeek V4 Pro e Kimi K3 com destaque, mas as cargas de trabalho de agentes diferem bastante em crescimento de contexto, roteamento de especialistas e uso de ferramentas. Resultados em outros modelos de codificação, pesquisa e enterprise podem mostrar se a vantagem da Rubin é ampla ou concentrada em padrões específicos de serving.

Evidência de implantação será outro teste. As alegações da NVIDIA dizem respeito a medições preliminares, não a resultados de produção de clientes divulgados. Os compradores devem procurar custo validado por milhão de tokens, desempenho sustentado sob pressão de cache e latência completa de ponta a ponta, incluindo chamadas de ferramentas e orquestração do lado da CPU.

Perspectiva da Creati.ai

O anúncio da NVIDIA é mais significativo por reposicionar a competição de infraestrutura em torno de trabalho útil de agentes por unidade de energia. A alegação de 30x no título ainda não é evidência independente, mas a metodologia AgentX aborda uma fraqueza real dos benchmarks de inferência antigos: eles frequentemente modelam uma única solicitação em vez do fluxo de trabalho em expansão e interrompido produzido por um agente de IA.

Para construtores e compradores corporativos, a lição prática é avaliar todo o sistema de serving, e não apenas as especificações do acelerador. A vantagem relatada da Rubin só importa se caching, agendamento, execução do modelo e orquestração de ferramentas puderem transformá-la em menor latência ou menor custo por token na produção. Até que a revisão do benchmark e implantações mais amplas cheguem, os números da NVIDIA devem ser tratados como uma alegação importante do fornecedor e como um sinal da direção que a competição em infraestrutura de IA está tomando.

Anúncios