NVIDIA afirma que Vera Rubin NVL72 entrega até 30x mais trabalho agentivo por watt

A NVIDIA diz que o Vera Rubin NVL72 pode entregar até 30x mais throughput de inferência agentiva por megawatt do que o GB300, sujeito à revisão independente do benchmark.

AI News

A NVIDIA diz que sua próxima plataforma Vera Rubin NVL72 pode entregar até 30 vezes mais throughput de IA agentiva por megawatt do que o sistema GB300 NVL72 da empresa. A alegação vem de resultados preliminares no SemiAnalysis AgentX, um benchmark projetado para reproduzir sessões de agentes de programação em estilo de produção, em vez de prompts de chatbot de comprimento fixo.

O resultado importa porque agentes de IA consomem muito mais capacidade de inferência do que o chat comum. As fontes da NVIDIA citam dados da OpenRouter mostrando que uma única solicitação agentiva usa cerca de 15 vezes mais tokens do que uma solicitação de chat simples, já que os agentes raciocinam repetidamente, chamam ferramentas, delegam trabalho a subagentes e carregam um contexto em expansão ao longo de uma tarefa.

A comparação do Vera Rubin ainda não é um resultado validado de forma independente. A NVIDIA mediu os números usando a carga de trabalho SemiAnalysis AgentX e diz que os resultados estão pendentes de revisão pela SemiAnalysis. Isso torna o anúncio um sinal inicial de desempenho reportado pelo fornecedor, e não um benchmark industrial confirmado.

Um benchmark construído em torno de cargas de trabalho de agentes

O AgentX faz parte da suíte de benchmarks InferenceX da SemiAnalysis. Segundo o NVIDIA Developer Blog, ele reproduz sessões gravadas do Claude Code por meio do cliente AIPerf, preservando a sequência de chamadas ao modelo, intervalos de raciocínio, uso de ferramentas, crescimento de contexto e latência de chamadas às ferramentas capturados nas trajetórias originais.

Esse design tenta resolver uma fraqueza dos testes convencionais de inferência. Testes estáticos frequentemente usam comprimentos de entrada e saída predeterminados, como um prompt de 8.000 tokens seguido por uma resposta de 1.000 tokens. Agentes de programação reais geram tráfego irregular: uma tarefa pode alternar entre raciocínio do modelo, operações com arquivos, buscas, saída do compilador e novas chamadas ao modelo, enquanto o contexto acumulado se torna muito maior com o tempo.

O AgentX mede tokens por megawatt junto com indicadores de experiência do usuário, incluindo tempo até o primeiro token, latência de ponta a ponta e interatividade. O principal resultado do Vera Rubin foi medido em 160 tokens por segundo por usuário na carga de trabalho AgentX DeepSeek V4 Pro. A empresa diz que o Vera Rubin NVL72 atingiu até 30 vezes o throughput da fábrica de IA por megawatt do GB300 NVL72 nesse ponto de operação.

O benchmark também informa ganhos substanciais para a geração Blackwell atual. A NVIDIA diz que o GB300 NVL72 entrega até 15 vezes o throughput por megawatt do H200 NVL8 no DeepSeek V4 Pro 1.6T, e até 80 vezes o resultado no Kimi K3 2.8T. Esses números também são apresentados por meio do relatório da NVIDIA sobre os resultados do AgentX e devem ser tratados de acordo.

A infraestrutura por trás da alegação

A NVIDIA atribui os ganhos projetados de eficiência a uma combinação de escala de hardware e otimização de software, e não apenas à GPU Rubin. O design NVL72 conecta 72 GPUs em um domínio de scale-up, permitindo que as cargas de trabalho distribuam especialistas do modelo e mantenham o contexto em todo o sistema com interconexões de alta largura de banda.

Isso é importante para agentes de longa duração porque o contexto processado anteriormente muitas vezes pode ser reutilizado em vez de recalculado. A NVIDIA descreve um design de serving que separa o prefill, quando o sistema processa o contexto de entrada, do decode, quando gera a saída. O casamento de taxas entre essas etapas pretende evitar que um lado fique ocioso enquanto o outro vira gargalo.

A empresa também aponta caching distribuído de chave-valor, roteamento de requisições ciente de KV e descarregamento de cache para a memória do host ou armazenamento. Essas técnicas foram projetadas para manter disponíveis partes relevantes de uma sessão de agente em crescimento ao longo de várias solicitações. A NVIDIA diz que a tecnologia NVLink de sexta geração e o NVLink Switch fornecem maiores taxas de pacotes e menor latência do que alternativas Ethernet convencionais para essa comunicação de scale-up.

A camada de software inclui NVIDIA TensorRT-LLM, NVIDIA Dynamo e kernels CUDA otimizados para modelos Mixture-of-Experts. O material voltado para desenvolvedores também cita SGLang e vLLM como runtimes de serving usados na pilha mais ampla de otimização, além de kernels DeepGEMM e formatos de menor precisão como MXFP4 e MXFP8. A NVIDIA diz que a quantização NVFP4 no Rubin foi pensada para reduzir o uso de memória e aumentar o throughput enquanto preserva a qualidade de saída, embora as evidências fornecidas não tragam uma avaliação independente de qualidade.

A NVIDIA ainda afirma que suas tecnologias DSX MaxLPS podem gerenciar energia nos níveis de GPU, rack e carga de trabalho, potencialmente permitindo até 40% mais GPUs dentro do mesmo orçamento de megawatts. Isso é uma alegação de planejamento de capacidade da NVIDIA, não um resultado demonstrado apenas pelos números do AgentX.

Por que construtores e operadores de IA devem se importar

Para equipes que constroem assistentes de programação, agentes de pesquisa ou automação de atendimento ao cliente, a métrica relevante já não é simplesmente quão rápido um prompt produz uma resposta. Um agente em produção pode manter várias chamadas ao modelo ativas, preservar um contexto grande e pausar enquanto ferramentas externas retornam dados. Infraestrutura que funciona bem em solicitações curtas e isoladas pode, portanto, desperdiçar energia ou perder responsividade em fluxos de trabalho reais.

O anúncio do Vera Rubin enquadra a eficiência energética tanto como uma restrição de implantação quanto como uma questão de preço. A NVIDIA diz que o Vera Rubin NVL72 pode reduzir o custo por milhão de tokens em até 35 vezes em relação ao GB300 NVL72 na carga de trabalho citada. Seu blog para desenvolvedores relata separadamente que o GB300 pode entregar até 10 vezes menos custo por token do que o H200 NVL8. Esses cálculos dependem da configuração do benchmark, de premissas de energia e de níveis de utilização, então compradores corporativos precisarão testá-los contra seus próprios modelos e padrões de serving.

O resultado pode ser mais relevante para operadores que atendem grandes modelos Mixture-of-Experts ou agentes com sessões unusually longas. Nesses ambientes, movimento de memória, reutilização de cache e comportamento de interconexão podem importar tanto quanto a aritmética bruta do acelerador. Equipes menores, porém, podem não ver a mesma economia se usarem modelos de contexto curto, baixa concorrência ou APIs hospedadas que escondem o hardware subjacente.

Também há uma questão de confiabilidade. Cache mais agressivo, serving desagregado e orquestração de ferramentas podem melhorar a utilização, mas adicionam complexidade de agendamento e gestão de estado. Os construtores precisarão avaliar recuperação de falhas, invalidação de cache, latência de cauda e isolamento de carga de trabalho, em vez de confiar apenas em números de pico de tokens por segundo.

O que observar a seguir

O primeiro sinal será a revisão da SemiAnalysis dos resultados do Vera Rubin AgentX. A publicação independente da configuração de teste, das medições de energia, dos parâmetros do modelo e das metas de interatividade determinará quão comparável é a alegação de 30x entre sistemas.

Os compradores também devem observar resultados que incluam o papel da Vera CPU nas chamadas de ferramentas. A NVIDIA diz explicitamente que os números iniciais ainda não refletem o desempenho da Vera CPU para essa parte do fluxo de trabalho. Como os agentes passam tempo fora da geração do modelo, medições de ponta a ponta podem diferir do throughput apenas do acelerador.

Outros acompanhamentos úteis incluem disponibilidade e preços do Vera Rubin NVL72, desempenho em modelos além do DeepSeek V4 Pro e resultados de operadores executando seus próprios traces em vez de sessões gravadas. Mudanças na pilha de software da NVIDIA também podem afetar a comparação, já que a empresa diz que o desempenho de Rubin e GB300 continuará melhorando com otimização contínua.

Perspectiva da Creati.ai

O anúncio da NVIDIA é importante menos porque estabelece um padrão final de 30x na indústria do que porque destaca uma definição em mudança de desempenho de inferência. Cargas de trabalho de agentes expõem gargalos que testes com prompts fixos podem não perceber: reutilização de contexto, lacunas entre chamadas de ferramentas, capacidade de cache, concorrência e fornecimento de energia.

A lição prática para construtores de IA é medir trajetórias completas de agentes antes de se comprometer com infraestrutura. Os resultados iniciais da NVIDIA sugerem que hardware fortemente integrado e software de serving podem mudar materialmente a economia de agentes de longa duração, mas a magnitude dessa vantagem continua sem confirmação até que as medições subjacentes do AgentX sejam revisadas e reproduzidas de forma independente.

Anúncios