A NVIDIA diz que o TensorRT Edge-LLM executou o Qwen3.6-27B 6,4x mais rápido no Jetson AGX Thor, destacando ganhos de cache e quantização para agentes de edge.

A NVIDIA afirma que seu runtime TensorRT Edge-LLM concluiu o benchmark MLPerf Inference v6.1 Edge Agentic em 24 minutos e 36 segundos em um único Jetson AGX Thor Developer Kit. Isso foi 6,4 vezes mais rápido do que a execução de referência publicada do llama.cpp na mesma plataforma, segundo o blog de desenvolvedores da NVIDIA.
O resultado é significativo porque o teste mede mais do que a velocidade de uma resposta única. Ele reproduz conversas de agentes de engenharia de software nas quais um modelo gera chamadas de ferramentas, recebe resultados e continua por contextos cada vez mais longos. A submissão da NVIDIA executou o Qwen3.6-27B a 52,33 tokens por segundo e concluiu todos os 1.007 turnos gerados na carga de trabalho de desempenho.
Os números são resultados informados pelo fornecedor a partir da própria submissão da NVIDIA e não devem ser tratados como uma comparação independente de todas as pilhas de inferência de edge. Ainda assim, eles mostram como otimizações no nível do runtime podem mudar a economia de executar agentes de IA em múltiplas etapas no hardware local, em vez de enviar cada interação a um data center em nuvem.
O benchmark MLPerf Edge Agentic avalia um endpoint de modelo compatível com OpenAI em fases de desempenho e precisão. Sua carga de trabalho de desempenho contém 20 conversas registradas e 1.007 turnos gerados. À medida que cada agente recebe resultados de ferramentas e continua raciocinando, o contexto cresce para aproximadamente 23.500 tokens.
Essa estrutura cria um gargalo diferente de um teste convencional de chatbot. Um agente processa repetidamente grande parte da mesma conversa, ao mesmo tempo em que precisa produzir chamadas de função válidas rapidamente. Recalcular todo o histórico a cada turno pode tornar trajetórias longas cada vez mais caras, especialmente em um dispositivo com largura de banda de memória e energia limitadas.
A fase de precisão usa prompts do Berkeley Function Calling Leaderboard, ou BFCL, com solicitações de turno único e raciocínio desativado. Ela verifica se o modelo seleciona a função adequada, fornece argumentos válidos ou recusa corretamente chamar uma ferramenta. A NVIDIA diz que sua submissão foi executada em modo SingleStream em um Jetson AGX Thor Developer Kit com 128 GB de memória unificada, no modo de energia MAXN da plataforma.
A NVIDIA atribui o resultado a várias otimizações no TensorRT Edge-LLM, e não a um único recurso de hardware. O modelo Qwen3.6-27B submetido usou NVFP4 para pesos e ativações, incluindo a cabeça do modelo de linguagem, e FP8 para seu cache chave-valor, ou cache KV.
NVFP4 é um formato de ponto flutuante de quatro bits compatível com a GPU Blackwell no Jetson AGX Thor. Representações de menor precisão reduzem a quantidade de dados que os kernels precisam mover pela memória, uma consideração importante para decodificação com baixo batch, que a NVIDIA descreve como fortemente limitada pela largura de banda de DRAM em plataformas de edge. A representação menor também deixa mais da memória unificada do dispositivo disponível para contexto, estado de decodificação especulativa e outras tarefas do aplicativo.
O runtime também reutilizou o estado de conversa em cache entre os turnos. A NVIDIA diz que aproximadamente 96% dos tokens de prompt foram atendidos a partir do cache quente ao longo de toda a trajetória do agente. Em vez de fazer o prefilling de todos os 13,6 milhões de tokens de prompt encontrados durante o benchmark, o sistema fez prefilling de apenas cerca de 0,5 milhão de tokens de novos sufixos de conversa.
Essa otimização é especialmente relevante para cargas de trabalho de agentes. Cada novo turno contém a maior parte da conversa anterior, além de um resultado de ferramenta ou uma resposta do modelo. O TensorRT Edge-LLM identifica prefixos de prompt reutilizáveis e restaura páginas de atenção em cache. Como o Qwen3.6 usa uma arquitetura de modelo híbrida, a NVIDIA diz que o runtime também restaura o estado recorrente e o estado parcial de páginas KV necessários para continuar a execução corretamente.
Para geração de tokens, a NVIDIA utilizou previsão multin token baseada em árvore. A configuração usou uma árvore de verificação de oito etapas, top-two, com 16 nós, e entregou uma melhoria de decodificação de aproximadamente 40% em relação à previsão multin token linear para a carga de trabalho de function calling, segundo a empresa.
A comparação central é entre a submissão TensorRT Edge-LLM da NVIDIA e a execução de referência do llama.cpp publicada pelo exemplo MLCommons Edge Agentic. Ambas as execuções usaram Qwen3.6-27B no Jetson AGX Thor, mas a referência usou quantização Q4_K_M, enquanto a submissão da NVIDIA usou NVFP4 e técnicas adicionais de runtime.
A NVIDIA informa que a execução do llama.cpp levou duas horas e 37 minutos para concluir a mesma carga de trabalho. O resultado do TensorRT Edge-LLM levou 24 minutos e 36 segundos. A diferença, portanto, reflete toda a pilha de software, escolhas de quantização, manuseio de cache e estratégia de decodificação — não apenas uma medição direta de um formato de modelo contra outro.
O benchmark também não estabelece que o sistema será 6,4 vezes mais rápido em todas as aplicações de agentes. Os resultados podem variar com a arquitetura do modelo, comprimento do contexto, padrões de chamadas de ferramentas, qualidade da quantização, configurações de energia e quantidade de trabalho paralelo. O ganho de aproximadamente 40% da NVIDIA em previsão multin token também é uma afirmação específica da carga de trabalho, vinculada à configuração de function calling reportada.
As evidências disponíveis são mais fortes em tempo de conclusão e tokens por segundo neste benchmark definido. Elas são mais fracas em confiabilidade de produção, consumo de energia, comportamento térmico em implantações prolongadas e trade-offs de precisão em tarefas de agente mais amplas. A NVIDIA diz que os desenvolvedores podem inspecionar a branch release/0.9.1-mlpinf do TensorRT Edge-LLM, usar seu checkpoint calibrado Qwen3.6-27B NVFP4 e revisar o exemplo da MLCommons para detalhes de configuração, mas esses materiais, por si só, não constituem evidência independente de adoção.
Para desenvolvedores que incorporam agentes de IA em veículos, robôs, equipamentos industriais ou outros sistemas embarcados, o resultado aponta para uma questão prática de implantação: quanto do contexto repetido de um agente pode ser mantido localmente e reutilizado? A reutilização de cache pode reduzir o trabalho de prefilling sem alterar o fluxo de conversa do aplicativo, enquanto a previsão multin token mira a fase de geração que segue as respostas das ferramentas.
A economia de memória pode ser tão importante quanto a velocidade bruta. Um modelo de 27 bilhões de parâmetros rodando em um formato de baixa precisão ainda precisa de espaço para contextos longos, estado de runtime e lógica do aplicativo. O uso pela NVIDIA de 128 GB de memória unificada sugere que implantações de edge podem cada vez mais ser desenhadas em torno da pegada combinada do modelo e do agente — não apenas do modelo isolado.
Para compradores corporativos, o benchmark oferece um sinal de que a inferência local de agentes está se tornando mais viável para fluxos de trabalho em que latência, conectividade ou controle de dados são importantes. Isso não elimina a necessidade de avaliar consumo de energia, precisão do modelo, confiabilidade das chamadas de ferramentas, processos de atualização e controles de segurança no ambiente-alvo. Uma execução de benchmark mais rápida só é útil se o agente puder tomar decisões corretas e operar de forma consistente sob restrições reais de hardware.
O resultado também aumenta a pressão competitiva sobre runtimes alternativos. A vantagem do TensorRT Edge-LLM aqui vem da coordenação estreita entre o software da NVIDIA e o hardware Blackwell. Desenvolvedores que usam outros aceleradores precisarão de suporte comparável para kernels de baixa precisão, estado persistente de contexto e decodificação especulativa ou baseada em árvore se quiserem desempenho semelhante em longas trajetórias de agentes.
Os próximos sinais úteis serão reproduções independentes do resultado de MLPerf, especialmente comparações que relatem consumo de energia, limites térmicos e precisão junto com o tempo de conclusão. Também será importante ver se a reutilização de cache continua eficaz em cargas de trabalho com contexto menos repetitivo ou saídas de ferramentas mais variadas.
Desenvolvedores devem acompanhar a branch de lançamento do TensorRT Edge-LLM e o exemplo MLCommons Edge Agentic para suporte atualizado a modelos, instruções de compilação e novas submissões de hardware. Testes mais amplos do Qwen3.6-27B NVFP4 ajudarão a esclarecer se o desempenho relatado é prático para agentes de produção ou limitado às trajetórias registradas do benchmark.
Por fim, evidências de veículos, robôs e sistemas industriais em operação forneceriam um teste mais forte da abordagem. Esses ambientes introduzem conectividade intermitente, orçamentos rígidos de energia, entradas de sensores, requisitos de segurança e atualizações de software que o benchmark atual não captura totalmente.
O resultado da NVIDIA é melhor entendido como uma demonstração de sistema: o desempenho de agentes de edge depende tanto de evitar trabalho repetido quanto de aumentar a velocidade bruta de geração. A combinação de NVFP4, cache KV FP8, reutilização de estado e decodificação baseada em árvore aborda os custos específicos criados por conversas longas com uso de ferramentas.
O número 6,4x é convincente dentro da configuração reportada de MLPerf, mas a conclusão mais ampla é mais cautelosa. Para construtores de IA, a pergunta importante é se essas otimizações resistem a modelos, ferramentas, envelopes de energia e requisitos de precisão do mundo real diferentes. Se resistirem, implantações locais de agentes poderão sair de demonstrações isoladas e avançar para arquiteturas de produção mais críveis.