
A Alibaba lançou os pesos abertos do Qwen3.8-2.4T-A95B, um modelo mixture-of-experts de 2,4 trilhões de parâmetros, enquanto a NVIDIA publicou um caminho de implantação para executá-lo no sistema GB300 NVL72 em escala de rack da empresa. O anúncio coloca um modelo open-weight muito grande no centro de uma pilha de serving de hardware e software projetada para raciocínio de longo contexto e aplicações agentivas.
O modelo ativa 95 bilhões de parâmetros por token em vez de usar sua contagem total de parâmetros a cada solicitação. A NVIDIA diz que sua implantação inicial em FP8 pode entregar mais de 4.000 tokens por segundo por GPU e mais de 350 tokens por segundo por usuário no GB300 NVL72, embora esses números venham dos testes de infraestrutura da NVIDIA e não devam ser tratados como benchmarks independentes.
O Qwen3.8-2.4T-A95B, também referido no artigo da NVIDIA como Qwen3.8-Max, é posicionado para programação, análise de documentos em grande escala e cargas de trabalho agentivas em várias etapas. O lançamento da Alibaba torna os pesos do modelo disponíveis via Hugging Face e ModelScope, segundo a NVIDIA.
A arquitetura combina roteamento fine-grained de mixture-of-experts com camadas alternadas de full-attention e linear-attention. Um roteador aprendido seleciona os especialistas necessários para cada token, permitindo que o custo de serving do modelo dependa mais de seus parâmetros ativos do que de toda a capacidade de 2,4T parâmetros.
O design de attention aborda um problema específico em sistemas agentivos: o contexto pode acumular instruções do sistema, resultados de ferramentas, documentos recuperados, código-fonte, logs e raciocínio intermediário ao longo de muitas rodadas. A NVIDIA diz que o modelo suporta uma janela de contexto de até um milhão de tokens e saída de até 128K tokens. Suas camadas de linear-attention usam um estado recorrente limitado em vez de um cache key-value crescente, enquanto as camadas de full-attention mantêm uma interação token a token mais ampla quando necessário.
Essas capacidades são relevantes para equipes de produto que constroem agentes que precisam manter estado ao longo de fluxos de trabalho estendidos. Elas também levantam questões práticas de infraestrutura, porque um contexto de um milhão de tokens pode deslocar o gargalo do cálculo bruto do modelo para capacidade de memória, comunicação e gerenciamento de cache.
O GB300 NVL72 da NVIDIA integra 72 GPUs Blackwell Ultra em uma única plataforma em escala de rack. O sistema fornece um domínio NVLink de 72 GPUs com 130 TB/s de comunicação all-to-all, segundo a NVIDIA. Essa interconexão é importante para um grande modelo MoE, porque encaminhar solicitações de especialistas por redes de servidores convencionais pode introduzir sobrecarga de comunicação e utilização desigual.
Servir o Qwen3.8-2.4T-A95B, portanto, depende de mais do que colocar arquivos do modelo em um conjunto de aceleradores. A implantação requer execução distribuída, kernels otimizados e um runtime de inferência capaz de coordenar o tráfego de especialistas em todo o rack. O blog da NVIDIA apresenta a configuração GB300 como uma forma de tornar essa coordenação parte do design do sistema, em vez de depender apenas de redes prontas.
A NVIDIA diz que os resultados de Day 0 relatados foram obtidos em FP8 sem ajuste adicional do modelo. A empresa espera ganhos adicionais com precisão NVFP4, mas não forneceu uma projeção de desempenho futura no anúncio disponibilizado. A execução em FP8 e em precisões mais baixas pode reduzir os requisitos de memória e computação, mas os compradores em produção ainda precisarão avaliar a qualidade da saída, a estabilidade numérica e o custo operacional da implantação completa em escala de rack.
Um recurso notável do produto são os controles de raciocínio embutidos do Qwen3.8-2.4T-A95B. Segundo a NVIDIA, os desenvolvedores podem selecionar modos de raciocínio low, high ou xhigh por solicitação. Os controles foram criados para permitir que as aplicações troquem profundidade de inferência por qualidade de resposta e latência.
Isso é mais útil operacionalmente do que tratar o raciocínio como uma configuração global fixa. Um agente de programação lidando com um problema de arquitetura ambíguo poderia usar uma configuração mais alta, enquanto um pipeline de processamento de documentos poderia reduzir a profundidade de raciocínio para maximizar a taxa de transferência. Em sistemas corporativos, a escolha também poderia estar ligada à prioridade da tarefa, ao nível do usuário ou ao orçamento de latência de uma aplicação.
Os controles não eliminam a necessidade de avaliação. As equipes precisarão medir se configurações de raciocínio mais altas melhoram a conclusão da tarefa o suficiente para justificar o custo computacional adicional, e se configurações mais baixas preservam a precisão em cargas de trabalho repetitivas. O anúncio não oferece uma análise independente das diferenças de qualidade entre os três modos.
A principal evidência para essa implantação vem de uma postagem do NVIDIA Developer Blog, tornando a NVIDIA a fonte dos números de desempenho, da descrição do sistema e das recomendações de serving. Uma lista separada do NVIDIA Developer aponta para o mesmo anúncio, mas não adiciona reportagem independente. O material de origem disponível não inclui resultados de benchmarks de terceiros, implantações de clientes ou adoção verificada em produção.
A NVIDIA lista SGLang, vLLM e NVIDIA Dynamo como opções de inferência de código aberto para desenvolvedores que buscam controle sobre o desempenho de serving. Ela também oferece o NVIDIA NIM, descrito no post como um contêiner de inferência sem modelo que pode servir modelos suportados. O fluxo de trabalho pretendido é baixar os pesos do modelo, implantá-los por meio do contêiner e escalar o serviço conforme necessário.
Para personalização, a NVIDIA recomenda o NVIDIA NeMo AutoModel. A biblioteca de fine-tuning nativa do PyTorch suporta o uso direto de checkpoints do Hugging Face, fine-tuning supervisionado completo e adaptação baseada em LoRA, segundo a empresa. Isso dá às equipes um possível caminho do checkpoint público para versões específicas de domínio, mas o tamanho do modelo significa que treinamento, armazenamento de checkpoints e avaliação continuam sendo projetos de infraestrutura substanciais.
Os números de “mais de 4K tokens por segundo por GPU” e “mais de 350 tokens por segundo por usuário” são especialmente importantes de interpretar com cuidado. A NVIDIA os identifica como resultados de Day 0 em sua própria pilha de hardware e software. Eles indicam a meta de desempenho da receita de implantação, não um resultado universal que deva ser transferido sem alterações para outros servidores, configurações de precisão, perfis de batch ou cargas de trabalho de aplicação.
Para builders de AI, o anúncio amplia o espaço de design open-weight em direção a modelos cuja capacidade total é medida em trilhões de parâmetros enquanto a ativação por token permanece mais baixa. Isso pode apoiar raciocínio especializado e comportamento agentivo sem exigir que um modelo denso de 2,4T execute cada parâmetro em cada token.
No entanto, o patamar de hardware é alto. Uma plataforma em escala de rack com 72 GPUs não é um ambiente de desenvolvimento típico, e as equipes precisarão considerar utilização, agendamento, replicação do modelo, recuperação de falhas e custos de energia junto com as métricas de tokens por segundo. O modelo pode ser tecnicamente aberto, mas operar na escala anunciada provavelmente ficará concentrado entre empresas bem financiadas, provedores de nuvem e organizações de pesquisa com acesso a infraestrutura avançada.
A implantação também ilustra uma divisão crescente entre a abertura do modelo e a acessibilidade operacional. Pesos abertos podem tornar possível a experimentação e o fine-tuning, mas o serving de longo contexto e a comunicação MoE em grande escala ainda dependem de sistemas especializados. Compradores que avaliam o modelo devem comparar o custo end-to-end por tarefa concluída, não apenas a velocidade bruta de geração. Também devem testar uso de ferramentas, recuperação de longo contexto, confiabilidade em execuções de várias etapas e comportamento sob diferentes configurações de raciocínio.
O sinal de acompanhamento mais claro será o teste independente do Qwen3.8-2.4T-A95B em SGLang, vLLM e NVIDIA Dynamo, incluindo latência, throughput, uso de memória e qualidade em cada nível de raciocínio. Comparações com outros modelos open-weight mostrarão se a arquitetura oferece vantagens práticas além da contagem de parâmetros.
Os desenvolvedores também devem observar as prometidas otimizações NVFP4, receitas adicionais de implantação e evidências de cargas de trabalho reais em produção. A adoção dos pesos do modelo, checkpoints ajustados e aplicações agentivas de longo contexto será mais significativa do que a simples atividade de download. Por fim, o custo e a disponibilidade dos sistemas GB300 NVL72 determinarão se isso permanece principalmente como uma vitrine de infraestrutura em escala de rack ou se torna uma opção de serving amplamente utilizável.
O anúncio da NVIDIA é significativo menos porque torna um modelo de 2,4T parâmetros universalmente acessível do que porque demonstra como pesos abertos, roteamento MoE, raciocínio configurável e interconexões em escala de rack estão sendo projetados em conjunto. A implantação trata a inferência como um problema de sistemas, em que comunicação e memória se tornam tão importantes quanto a aritmética dos aceleradores.
Para equipes de produto, a questão prática não é se o maior modelo pode gerar tokens rapidamente. É se seus controles de raciocínio e sua arquitetura de longo contexto melhoram um fluxo de trabalho definido o suficiente para justificar infraestrutura especializada. Até que surjam benchmarks independentes e evidências de produção, o Qwen3.8-2.4T-A95B é melhor visto como um modelo aberto promissor combinado com um blueprint de serving relatado pelo fornecedor, e não como um padrão comprovado para implantação empresarial.
A NVIDIA explica como o modelo open-weight Qwen3.8 da Alibaba roda no GB300 NVL72, com raciocínio configurável para cargas de trabalho agentivas em grande escala.