AI News

A Nvidia lançou o Nemotron 3.5 Lightning, um modelo de raciocínio open-weight projetado para tornar as cargas de trabalho de agentes de IA mais rápidas e baratas de executar, em vez de maximizar o desempenho em todos os benchmarks de inteligência.

O modelo combina 31,6 bilhões de parâmetros totais com uma arquitetura esparsa que ativa apenas 3,6 bilhões de parâmetros por token. Segundo os benchmarks reportados pelo The Decoder, ele atinge quase 670 tokens por segundo em testes pré-lançamento com os pesos finais NVFP4 da Nvidia, fazendo da taxa de processamento a característica central do novo lançamento do Nemotron 3.5.

Esse posicionamento importa à medida que os desenvolvedores migram de solicitações ocasionais a chatbots para sistemas de agentes que geram longas sequências de chamadas de ferramentas, código e raciocínio intermediário. Para essas cargas de trabalho, latência, utilização de hardware e custo de serviço podem importar tanto quanto a melhor pontuação de um modelo em benchmarks.

Uma pegada ativa menor com um contexto de um milhão de tokens

O Nemotron 3.5 Lightning sucede o Nemotron 3 Nano 30B A3B e mantém o design híbrido Mamba-Transformer do modelo anterior. Seu número total de parâmetros é substancialmente maior do que o número usado em qualquer cálculo individual, uma estrutura destinada a fornecer mais capacidade sem impor o custo computacional total de um modelo denso de 31,6 bilhões de parâmetros.

A Nvidia oferece o modelo de raciocínio nos formatos BF16 e NVFP4. O segundo usa pesos de menor precisão para reduzir a memória e a computação necessárias para a inferência. O The Decoder relatou que o NVFP4 alcançou a mesma pontuação da versão BF16 no Artificial Analysis Intelligence Index, com apenas uma pequena diferença de qualidade segundo essa avaliação.

O modelo é somente texto e suporta uma janela de contexto de até um milhão de tokens. Essa capacidade pode ser útil para agentes de programação, fluxos de trabalho com muitos documentos e aplicativos que precisam manter um histórico extenso de tarefas, embora o comprimento do contexto por si só não comprove quão eficiente ou confiável um sistema será ao lidar com entradas muito longas.

Os pesos estão disponíveis sob a licença permissiva OpenMDW-1.1 da Nvidia. O The Decoder também listou acesso serverless por meio de provedores como DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius e Crusoe. A disponibilidade em várias plataformas de inferência reduz a barreira para equipes que desejam testar o modelo sem operar imediatamente sua própria infraestrutura da Nvidia.

A velocidade é a proposta de valor; a inteligência é competitiva, não dominante

A Artificial Analysis deu ao Nemotron 3.5 Lightning uma pontuação de 24 no Intelligence Index, segundo o The Decoder. Isso igualou o gpt-oss-120b da OpenAI e ficou atrás do Nemotron 3 Super da Nvidia, que marcou 26. O resultado representou uma melhora de nove pontos em relação à pontuação reportada de 15 do Nemotron 3 Nano.

A comparação também mostra os limites da abordagem da Nvidia. O The Decoder relatou pontuações mais altas para Qwen3.6 35B A3B e Muse Glimmer da Meta, com 32 e 35, respectivamente. Os sistemas proprietários permaneceram à frente no trade-off combinado entre velocidade e inteligência na análise citada: o Gemini 3.5 Flash-Lite do Google teria marcado 37, enquanto o GPT-5.6 Luna chegou a 52.

Os melhores resultados reportados do Lightning apareceram em testes voltados a agentes. No GDPval-AA v2, a Artificial Analysis registrou uma classificação Elo de 824, contra 800 do gpt-oss-120b e 698 do Nemotron 3 Super. No Terminal-Bench v2.1, a pontuação do modelo subiu de 7% em seu antecessor para 24,3%, próxima dos 26,2% reportados do gpt-oss-120b.

Esses números vêm de uma plataforma independente de benchmarking, mas são apresentados por meio da cobertura do The Decoder, e não como um conjunto completo de resultados reproduzidos de forma independente na evidência fornecida. Portanto, devem ser tratados como instantâneos de benchmark, e não como prova de que o Lightning superará modelos maiores em cargas de trabalho de produção. A velocidade de inferência pode variar significativamente conforme hardware, tamanho do lote, quantização, software de serving, comprimento do prompt e comprimento da saída.

A principal métrica de throughput também vem de testes pré-lançamento usando pesos finais NVFP4. O The Decoder disse que o Lightning concluiu uma tarefa do Intelligence Index em cerca de meio minuto, contra aproximadamente 3,5 minutos para o Qwen3.6 35B A3B e 5,8 minutos para o Gemma 4 31B na comparação citada. Esses tempos ajudam a esclarecer o objetivo da Nvidia: tarefas repetidas e sensíveis à latência, em que o custo de esperar ou de servir um modelo maior se acumula ao longo de muitas interações.

O que o lançamento significa para os construtores de IA

Para equipes de produto, o Lightning oferece uma possível camada intermediária entre modelos pequenos e baratos e sistemas grandes reservados para raciocínio difícil. Uma empresa poderia usá-lo para etapas rotineiras de agentes—classificação, seleção de ferramentas, navegação em código, recuperação de documentos ou execução estruturada—enquanto encaminha casos ambíguos ou de alto risco para um modelo mais capaz.

Essa arquitetura pode reduzir o número de solicitações enviadas a APIs proprietárias caras, mas apenas se o modelo menor funcionar de forma confiável no fluxo de trabalho específico. Uma vantagem no Terminal-Bench não se traduz automaticamente em alterações confiáveis em bancos de dados, análise financeira, ações de atendimento ao cliente ou código em produção. As equipes precisarão testar recuperação de falhas, precisão no uso de ferramentas, taxas de alucinação e a frequência com que as tarefas exigem escalonamento.

O design esparso e a opção NVFP4 também podem afetar a economia do deployment. Ativar 3,6 bilhões de parâmetros por etapa pode reduzir a demanda de computação em relação a um modelo denso de tamanho total semelhante, enquanto a quantização pode diminuir os requisitos de memória. O benefício prático dependerá de a equipe ter hardware e infraestrutura de serving compatíveis, bem como do overhead gerado por contextos longos, batching e orquestração de agentes.

A estratégia mais ampla da Nvidia fica visível no lançamento. A empresa já argumentou que modelos abaixo de 10 bilhões de parâmetros ativos podem lidar com muitas tarefas de agentes a uma fração do custo de sistemas muito maiores. O Lightning transforma esse argumento de eficiência em um produto com um design em estilo mixture de 31,6 bilhões de parâmetros, mas com um caminho ativo de 3,6 bilhões.

O lançamento relacionado da Fastino Labs oferece um sinal inicial de possível uso downstream. O StreetInsider informou que a empresa lançou modelos open-weight especializados em finanças e saúde, pós-treinados sobre o Nemotron 3.5 Lightning inteiramente usando um agente. A fonte fornecida não traz detalhes técnicos, resultados de avaliação nem números de adoção para esses modelos, portanto o anúncio é melhor entendido como um exemplo de atividade do ecossistema, e não como evidência de demanda em escala de produção.

O que observar a seguir

O acompanhamento mais importante será o teste independente da confiabilidade de ponta a ponta dos agentes. Os desenvolvedores devem buscar avaliações que meçam tarefas concluídas, e não apenas throughput de tokens ou pontuações de benchmark, em programação, navegação, software empresarial e fluxos de trabalho de longa duração.

A economia de serving será outro sinal importante. Implantações públicas podem mostrar se o NVFP4 e a ativação esparsa trazem economias significativas em cargas de trabalho reais, especialmente quando os modelos precisam lidar com grandes contextos ou muitos usuários simultâneos. A diferença de desempenho entre deployment local e inferência hospedada também importa para empresas que equilibram controle e simplicidade operacional.

As parcerias de pós-treinamento da Nvidia também merecem monitoramento. A Artificial Analysis relatou que CodeRabbit e Harvey trabalharam com a Nvidia em pós-treinamento específico de domínio. Variantes mais especializadas podem determinar se o Lightning se torna um modelo de agente de propósito geral ou uma base para sistemas estreitos e de alto volume.

Por fim, os compradores devem acompanhar a clareza da licença, o suporte a ferramentas e o comportamento do modelo sob restrições de segurança. Um modelo open-weight é mais fácil de inspecionar e implantar do que uma API fechada, mas as organizações continuam responsáveis por monitoramento, controles de acesso, tratamento de dados e contenção de falhas.

Perspectiva da Creati.ai

O Nemotron 3.5 Lightning não é a tentativa da Nvidia de vencer o ranking bruto de inteligência. É uma aposta de que muitos agentes de IA úteis precisam de execução rápida e repetível mais do que da melhor resposta possível em cada tarefa.

Isso torna o lançamento estrategicamente relevante mesmo onde os líderes de benchmark ainda estão à frente. Se o throughput reportado se mantiver em configurações comuns de deployment, o Lightning poderá dar aos construtores uma opção prática de roteamento para etapas de agentes de alto volume. Seu sucesso será julgado, no fim, menos pela contagem de parâmetros e mais por saber se as equipes conseguem concluir fluxos de trabalho reais com menor latência e custo, sem acrescentar riscos inaceitáveis de confiabilidade ou segurança.

Em Destaque

Nemotron 3.5 Lightning da Nvidia aposta em agentes de IA rápidos e eficientes

O Nemotron 3.5 Lightning da Nvidia usa ativação esparsa e quantização para oferecer inferência open-weight rápida, mirando agentes de IA de alto volume em vez de pontuações máximas.