A NVIDIA levou o Groq 3 LPX à produção total ao lado do Vera Rubin, mirando inferência mais rápida e de longo contexto para agentes e provedores de nuvem de IA.

A NVIDIA afirma que seu sistema de inferência Groq 3 LPX entrou em produção total e está sendo integrado à plataforma em escala de rack Vera Rubin NVL72. A combinação foi projetada para acelerar a geração de tokens para aplicações agênticas, nas quais os modelos raciocinam repetidamente, chamam ferramentas e processam históricos de conversa ou de tarefas cada vez mais longos.
O anúncio amplia a estratégia Vera Rubin da NVIDIA além da computação acelerada de uso geral. A empresa está posicionando as GPUs Rubin para processamento de contexto em larga escala, enquanto o Groq 3 LPX lida com a decodificação sensível à latência, etapa em que um modelo gera a saída um token por vez. Essa divisão tem como alvo provedores de nuvem de IA e empresas que buscam agentes mais responsivos sem abrir mão da taxa de transferência em grandes implantações.
Segundo a NVIDIA, o Groq 3 LPX é um acelerador de inferência de IA interativa projetado para trabalhar ao lado do Vera Rubin NVL72, e não para substituí-lo. A empresa descreve a plataforma como uma combinação de GPUs e LPUs, ou unidades de processamento local, com cada componente atribuído às cargas de trabalho em que é mais eficaz.
A necessidade dessa separação vem do comportamento das cargas de trabalho agênticas. Um agente pode gerar uma resposta, usar uma ferramenta externa, receber novas informações e iniciar outra rodada de inferência. Cada rodada pode adicionar contexto à sessão, exigindo eventualmente que o sistema processe dezenas ou centenas de milhares de tokens enquanto ainda produz uma resposta rapidamente.
A NVIDIA diz que as GPUs Rubin podem gerenciar a grande carga de processamento de contexto, enquanto o Groq 3 LPX é otimizado para desempenho de decode. O sistema também pode ser configurado para prefill-decode disaggregation, attention-FFN disaggregation e speculative decoding com external drafter. Essas são técnicas de infraestrutura que dividem as tarefas de serving do modelo ou usam tokens previstos para melhorar a velocidade de resposta.
Uma implantação em escala de rack pode incluir 256 aceleradores LP30 conectados por links diretos chip a chip, segundo a NVIDIA. A documentação para desenvolvedores da empresa descreve 128 GB de SRAM combinado entre esses chips e um compilador que planeja computação e comunicação antes da execução. Essa abordagem determinística pretende reduzir a sobrecarga de coordenação que pode se tornar significativa quando os modelos são servidos com tamanhos de lote pequenos.
As afirmações de desempenho mais fortes da NVIDIA vêm de um benchmark da Artificial Analysis, o que significa que são medições de terceiros citadas pelo fornecedor, e não evidência independente de desempenho amplo em produção. No modelo Gemma 4 31B com um contexto de 100.000 tokens, a Artificial Analysis mediu uma velocidade mediana de 3.431 tokens de saída por segundo no Groq 3 LPX, segundo o blog para desenvolvedores da NVIDIA.
O anúncio corporativo da NVIDIA arredonda esse número para 3.400 tokens de saída por segundo e diz que o resultado foi quatro vezes mais rápido do que a plataforma alternativa mais próxima. O material de origem não identifica essa plataforma concorrente no anúncio, portanto a comparação não pode ser avaliada de forma independente com as evidências disponíveis.
Um segundo resultado vem do SPEED-Bench, um benchmark de programação usando Gemma 4. A NVIDIA relata uma mediana de 4.767 tokens de saída por segundo e um resultado no 80º percentil de 5.520 tokens por segundo. Esses números descrevem um modelo, contexto e metodologia de teste específicos; eles não devem ser tratados como uma medida universal de desempenho entre modelos, tamanhos de lote, comprimentos de contexto ou padrões de tráfego de produção.
A explicação técnica oferecida pela NVIDIA é que o Groq 3 LPX usa comunicação chip a chip programada pelo compilador e sobrepõe movimentação de dados à computação. Em inferência paralela convencional, distribuir o trabalho entre processadores pode introduzir custos de sincronização e de comunicação coletiva. A NVIDIA argumenta que planejar previamente as transferências pode eliminar a necessidade de alguma arbitragem em tempo real, especialmente nos pequenos tamanhos de lote associados a um serving altamente interativo.
Nenhuma das fontes fornece volumes de implantação de clientes, preços, consumo de energia, cronogramas de disponibilidade geral para desenvolvedores ou utilização de produção verificada independentemente. As evidências estabelecem as alegações de produto e arquitetura da NVIDIA, mas ainda não mostram como o sistema se comporta economicamente em uma ampla gama de cargas de trabalho comerciais.
A NVIDIA identifica três parceiros associados à expansão do Vera Rubin. A Nebius é descrita como a primeira nuvem de IA a adotar o Groq 3 LPX. A NVIDIA diz que o hardware será adicionado à Token Factory da empresa para que os desenvolvedores possam criar agentes interativos, sistemas de codificação e outras aplicações em tempo real em escala.
A CoreWeave, por sua vez, implantou o Spectrum-X Multiplane em produção, segundo a NVIDIA. O sistema de rede conecta racks Vera Rubin por meio de múltiplos switches paralelos, com o objetivo declarado de fornecer comunicação de alta largura de banda e sem perda em toda a infraestrutura de nuvem de IA.
A NVIDIA também diz que a SpaceXAI planeja usar CPUs Vera em sua arquitetura de IA agêntica de próxima geração. A empresa vincula essas CPUs à orquestração, ao uso de ferramentas, à execução de código, ao processamento de dados e à simulação, incluindo infraestrutura que abrange data centers terrestres e satélites em órbita. Trata-se de um plano declarado, não de evidência de que tal implantação já esteja operando em escala.
Essas referências a parceiros indicam que a NVIDIA está vendendo o Vera Rubin como uma pilha completa de fábrica de IA: CPUs para orquestração e trabalho de uso geral, GPUs para contexto e computação do modelo, aceleradores Groq para decodificação rápida e rede para conectar os componentes. A importância comercial dependerá de os clientes conseguirem implantar essa pilha de forma mais eficiente do que pools separados de aceleradores otimizados para diferentes etapas de serving.
Para criadores de assistentes de programação, agentes de pesquisa e sistemas de atendimento ao cliente, a latência de decode é percebida diretamente pelos usuários. Uma primeira resposta mais rápida ou uma saída intermediária mais rápida pode fazer um fluxo de trabalho em várias etapas parecer mais interativo, especialmente quando um agente precisa fazer muitas chamadas sequenciais.
O contexto longo também altera a equação de infraestrutura. Uma sessão que reprocesse repetidamente seu histórico pode consumir memória e computação substanciais, mesmo quando o modelo em si não é extraordinariamente grande. O design da NVIDIA mira essa combinação de grandes caches key-value, inferência com lotes pequenos e comunicação frequente entre processadores.
A questão prática para as empresas será menos o pico de tokens por segundo do que o desempenho de nível de serviço sob tráfego real. Os compradores precisarão avaliar a latência em diferentes níveis de concorrência, tamanhos de contexto e arquiteturas de modelo, além do custo de manter a capacidade de inferência especializada ocupada. Um sistema excepcionalmente rápido em uma carga de benchmark pode ser menos atraente se a demanda for variável ou se as aplicações exigirem modelos e software que ainda não estejam otimizados para a plataforma.
O anúncio também intensifica a competição em torno da especialização da inferência. A NVIDIA está usando o alcance mais amplo da sua plataforma para combinar um acelerador dedicado de baixa latência com seus próximos produtos de GPU, CPU e rede. Isso pode atrair provedores de nuvem que constroem serviços de inferência diferenciados, mas também aumenta a complexidade de software e operacional em comparação com uma única arquitetura de acelerador.
O sinal de acompanhamento mais claro será se a Nebius expõe serviços baseados em Groq 3 LPX para desenvolvedores e publica desempenho em produção, preços ou informações de capacidade. Esses detalhes ajudariam a distinguir um anúncio de hardware de uma opção de serving amplamente acessível.
Os clientes também devem observar resultados independentes além de Gemma 4 31B e do benchmark de programação relatado. Resultados em modelos maiores e menores, comprimentos de contexto variados, usuários concorrentes e fluxos de trabalho agênticos completos forneceriam uma base mais sólida para avaliar a plataforma.
Evidências de implantação da CoreWeave e da SpaceXAI serão outro indicador importante. A NVIDIA confirmou a implantação de rede em produção da CoreWeave e descreveu os planos de CPU Vera da SpaceXAI, mas as fontes não fornecem dados de escala, carga de trabalho ou utilização. Eficiência energética, suporte de software e compatibilidade com frameworks de inferência populares também determinarão se a arquitetura ganha adoção fora dos parceiros nomeados pela NVIDIA.
A notícia da NVIDIA é melhor entendida como um marco de produção e integração de sistemas, não simplesmente como o lançamento de mais um chip de inferência. A empresa está respondendo a um problema específico de serving: agentes geram longas cadeias de tokens enquanto carregam grande contexto, tornando tanto a latência de decode quanto a sobrecarga de interconexão comercialmente importantes.
Os resultados relatados são promissores, mas permanecem limitados por benchmarks selecionados pelo fornecedor e por evidências públicas limitadas de implantação. Para as equipes de IA, o teste relevante será se o Groq 3 LPX e o Vera Rubin entregam latência previsível e economia aceitável em suas próprias cargas de trabalho agênticas. Se entregarem, a abordagem integrada de “token factory” da NVIDIA poderá se tornar uma opção séria para serviços de alta interatividade; se não, componentes especializados podem continuar difíceis de justificar apesar das fortes medições de pico.