TensorRT Edge-LLM completa el benchmark agentic de MLPerf Edge 6,4 veces más rápido en Jetson AGX Thor

NVIDIA afirma que TensorRT Edge-LLM ejecutó Qwen3.6-27B 6,4 veces más rápido en Jetson AGX Thor, destacando mejoras de caché y cuantización para agentes en el borde.

AI News

NVIDIA afirma que su runtime TensorRT Edge-LLM completó el benchmark MLPerf Inference v6.1 Edge Agentic en 24 minutos y 36 segundos en un único Jetson AGX Thor Developer Kit. Eso fue 6,4 veces más rápido que la ejecución de referencia publicada de llama.cpp en la misma plataforma, según el blog para desarrolladores de NVIDIA.

El resultado es significativo porque la prueba mide algo más que la velocidad de una respuesta única. Recrea conversaciones de agentes de ingeniería de software en las que un modelo genera llamadas a herramientas, recibe resultados y continúa a través de contextos cada vez más largos. La propuesta de NVIDIA ejecutó Qwen3.6-27B a 52,33 tokens por segundo y completó los 1.007 turnos generados en la carga de trabajo de rendimiento.

Las cifras son resultados informados por el proveedor a partir de la propia presentación de NVIDIA y no deben tratarse como una comparación independiente de todas las pilas de inferencia en el borde. Aun así, muestran cómo las optimizaciones a nivel de runtime pueden cambiar la economía de ejecutar agentes de IA multietapa en hardware local en lugar de enviar cada interacción a un centro de datos en la nube.

Qué midió la prueba de MLPerf

El benchmark MLPerf Edge Agentic evalúa un endpoint de modelo compatible con OpenAI en fases de rendimiento y precisión. Su carga de trabajo de rendimiento contiene 20 conversaciones registradas y 1.007 turnos generados. A medida que cada agente recibe resultados de herramientas y continúa razonando, el contexto crece hasta aproximadamente 23.500 tokens.

Esa estructura crea un cuello de botella distinto al de una prueba convencional de chatbot. Un agente procesa repetidamente gran parte de la misma conversación, al tiempo que necesita producir llamadas a funciones válidas con rapidez. Recalcular todo el historial en cada turno puede hacer que las trayectorias largas sean cada vez más costosas, especialmente en un dispositivo con ancho de banda de memoria y energía limitados.

La fase de precisión usa prompts del Berkeley Function Calling Leaderboard, o BFCL, con solicitudes de un solo turno y razonamiento desactivado. Comprueba si el modelo selecciona la función adecuada, proporciona argumentos válidos o rechaza correctamente llamar a una herramienta. NVIDIA dice que su propuesta se ejecutó en modo SingleStream en un Jetson AGX Thor Developer Kit con 128 GB de memoria unificada en el modo de energía MAXN de la plataforma.

La ingeniería detrás del resultado de NVIDIA

NVIDIA atribuye el resultado a varias optimizaciones en TensorRT Edge-LLM y no a una sola característica de hardware. El modelo Qwen3.6-27B presentado utilizó NVFP4 para pesos y activaciones, incluido el encabezado del modelo de lenguaje, y FP8 para su caché de clave-valor, o caché KV.

NVFP4 es un formato de coma flotante de cuatro bits compatible con la GPU Blackwell en Jetson AGX Thor. Las representaciones de menor precisión reducen la cantidad de datos que los kernels deben mover a través de la memoria, una consideración importante para la decodificación con lotes pequeños, que NVIDIA describe como muy limitada por el ancho de banda DRAM en plataformas edge. La representación más pequeña también deja más de la memoria unificada del dispositivo para el contexto, el estado de decodificación especulativa y otras tareas de la aplicación.

El runtime también reutilizó el estado de conversación almacenado entre turnos. NVIDIA dice que aproximadamente el 96% de los tokens del prompt se sirvieron desde la caché caliente a lo largo de toda la trayectoria del agente. En lugar de realizar prefilling de los 13,6 millones de tokens de prompt encontrados durante el benchmark, el sistema solo realizó prefilling de unos 0,5 millones de tokens de nuevos sufijos de conversación.

Esa optimización es especialmente relevante para las cargas de trabajo de agentes. Cada nuevo turno contiene la mayor parte de la conversación anterior, además de un resultado de herramienta o una respuesta del modelo. TensorRT Edge-LLM identifica prefijos de prompt reutilizables y restaura páginas de atención en caché. Como Qwen3.6 usa una arquitectura de modelo híbrida, NVIDIA dice que el runtime también restaura el estado recurrente y el estado parcial de páginas KV necesarios para continuar la ejecución correctamente.

Para la generación de tokens, NVIDIA utilizó predicción multin token basada en árboles. La configuración usó un árbol de verificación de ocho pasos, top-two y 16 nodos, y proporcionó una mejora de decodificación de aproximadamente el 40% frente a la predicción multin token lineal para la carga de trabajo de llamadas a funciones, según la empresa.

Evidencia, comparación y límites

La comparación central es entre la propuesta TensorRT Edge-LLM de NVIDIA y la ejecución de referencia de llama.cpp publicada a través del ejemplo MLCommons Edge Agentic. Ambas ejecuciones usaron Qwen3.6-27B en Jetson AGX Thor, pero la referencia utilizó cuantización Q4_K_M, mientras que la propuesta de NVIDIA usó NVFP4 y técnicas de runtime adicionales.

NVIDIA informa que la ejecución de llama.cpp tardó dos horas y 37 minutos en completar la misma carga de trabajo. El resultado de TensorRT Edge-LLM tardó 24 minutos y 36 segundos. Por tanto, la diferencia refleja toda la pila de software, las elecciones de cuantización, el manejo de caché y la estrategia de decodificación, no solo una medición directa de un formato de modelo frente a otro.

El benchmark tampoco establece que el sistema será 6,4 veces más rápido en todas las aplicaciones de agentes. Los resultados pueden variar según la arquitectura del modelo, la longitud del contexto, los patrones de llamadas a herramientas, la calidad de la cuantización, los ajustes de energía y la cantidad de trabajo en paralelo. La mejora de aproximadamente el 40% en predicción multin token de NVIDIA es igualmente una afirmación específica de la carga de trabajo vinculada a la configuración de llamadas a funciones informada.

La evidencia disponible es más sólida en tiempo de finalización y tokens por segundo en este benchmark definido. Es más débil en fiabilidad de producción, uso de energía, comportamiento térmico durante despliegues prolongados y compensaciones de precisión bajo tareas de agente más amplias. NVIDIA dice que los desarrolladores pueden inspeccionar la rama release/0.9.1-mlpinf de TensorRT Edge-LLM, usar su checkpoint calibrado Qwen3.6-27B NVFP4 y revisar el ejemplo de MLCommons para detalles de configuración, pero esos materiales por sí solos no constituyen evidencia independiente de adopción.

Por qué importa el resultado para los constructores de IA en el borde

Para los desarrolladores que integran agentes de IA en vehículos, robots, equipos industriales u otros sistemas embebidos, el resultado apunta a una pregunta práctica de despliegue: ¿cuánto del contexto repetido de un agente puede mantenerse local y reutilizarse? La reutilización de caché puede reducir el trabajo de prefilling sin cambiar el flujo de conversación de la aplicación, mientras que la predicción multin token apunta a la fase de generación que sigue a las respuestas de herramientas.

El ahorro de memoria puede ser tan importante como la velocidad bruta. Un modelo de 27.000 millones de parámetros que funcione en un formato de baja precisión todavía necesita espacio para contextos largos, estado del runtime y lógica de la aplicación. El uso por parte de NVIDIA de 128 GB de memoria unificada sugiere que los despliegues edge podrían diseñarse cada vez más en torno a la huella combinada del modelo y del agente, no solo del modelo.

Para los compradores empresariales, el benchmark ofrece una señal de que la inferencia local de agentes se está volviendo más viable para flujos de trabajo donde la latencia, la conectividad o el control de datos importan. No elimina la necesidad de evaluar consumo energético, precisión del modelo, fiabilidad de llamadas a herramientas, procesos de actualización y controles de seguridad en el entorno objetivo. Una ejecución de benchmark más rápida solo es útil si el agente puede tomar decisiones correctas y operar de forma consistente bajo restricciones reales de hardware.

El resultado también aumenta la presión competitiva sobre runtimes alternativos. La ventaja de TensorRT Edge-LLM aquí proviene de una estrecha coordinación entre el software de NVIDIA y el hardware Blackwell. Los desarrolladores que usen otros aceleradores necesitarán un soporte comparable para kernels de baja precisión, estado persistente del contexto y decodificación especulativa o basada en árboles si quieren un rendimiento similar en trayectorias largas de agentes.

Qué vigilar a continuación

Las próximas señales útiles serán reproducciones independientes del resultado de MLPerf, especialmente comparaciones que informen consumo energético, límites térmicos y precisión junto con el tiempo de finalización. También será importante ver si la reutilización de caché sigue siendo eficaz en cargas de trabajo con contexto menos repetitivo o salidas de herramientas más variadas.

Los desarrolladores deberían vigilar la rama de lanzamiento de TensorRT Edge-LLM y el ejemplo MLCommons Edge Agentic para soporte de modelos actualizado, instrucciones de compilación y nuevas presentaciones de hardware. Las pruebas más amplias de Qwen3.6-27B NVFP4 ayudarán a aclarar si el rendimiento informado es práctico para agentes de producción o si se limita a las trayectorias registradas del benchmark.

Por último, la evidencia procedente de vehículos, robots y sistemas industriales desplegados ofrecería una prueba más sólida del enfoque. Esos entornos introducen conectividad intermitente, presupuestos estrictos de energía, entradas de sensores, requisitos de seguridad y actualizaciones de software que el benchmark actual no capta por completo.

Perspectiva de Creati.ai

El resultado de NVIDIA se entiende mejor como una demostración de sistema: el rendimiento de los agentes en el borde depende tanto de evitar trabajo repetido como de aumentar la velocidad bruta de generación. La combinación de NVFP4, caché KV FP8, reutilización de estado y decodificación basada en árboles aborda los costes específicos creados por conversaciones largas que usan herramientas.

La cifra de 6,4x es convincente dentro de la configuración de MLPerf informada, pero la conclusión más amplia es más moderada. Para los creadores de IA, la pregunta importante es si estas optimizaciones sobreviven a distintos modelos, herramientas, márgenes de potencia y requisitos de precisión del mundo real. Si lo hacen, los despliegues locales de agentes podrían pasar de demostraciones aisladas a arquitecturas de producción más creíbles.

Anuncios