NVIDIA afirma que Vera Rubin NVL72 ofrece hasta 30 veces más trabajo de agentes por megavatio

NVIDIA dice que Vera Rubin NVL72 puede ofrecer hasta 30 veces más rendimiento de IA agéntica por megavatio que GB300, apuntando a los costes de inferencia de contexto largo.

AI News

NVIDIA dice que su próxima plataforma Vera Rubin NVL72 puede ofrecer hasta 30 veces más rendimiento de IA agéntica por megavatio que los sistemas GB300 NVL72 de la empresa, ofreciendo una posible ganancia de eficiencia para centros de datos que ejecutan flujos de trabajo de IA cada vez más largos y con uso de herramientas.

La afirmación proviene de mediciones tempranas de NVIDIA usando la carga de trabajo SemiAnalysis AgentX, que preserva sesiones de programación registradas, ampliando el contexto, las llamadas a herramientas y la actividad de subagentes. NVIDIA dice que los resultados son especialmente relevantes a medida que los agentes de IA van más allá del chat de una sola respuesta y comienzan a realizar tareas de investigación, programación, atención al cliente y apoyo a la toma de decisiones en varios pasos.

Las cifras son reportadas por el proveedor y aún no han sido validadas de forma independiente. NVIDIA dice que los resultados de Vera Rubin están pendientes de revisión por SemiAnalysis, y que las pruebas no incluyen el rendimiento de la CPU Vera para llamadas a herramientas.

El punto de referencia detrás de la afirmación de NVIDIA

La comparación de NVIDIA se centra en el rendimiento por megavatio en lugar de en los tokens por segundo máximos de una solicitud de inferencia aislada. Esa distinción importa para los sistemas agénticos, en los que un modelo puede leer repetidamente el contexto acumulado, llamar a herramientas externas, delegar subtareas y sintetizar los resultados.

Según NVIDIA, AgentX representa esos comportamientos mediante trayectorias reales de programación agéntica. La empresa dice que el benchmark incluye modelos como Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 y DeepSeek V4 Pro, lo que permite evaluar el rendimiento en distintas arquitecturas de modelos y cargas de trabajo.

En DeepSeek V4 Pro, NVIDIA informa que GB300 NVL72 ofrece hasta 15 veces el rendimiento por megavatio de su arquitectura Hopper. Luego se afirma que Vera Rubin eleva esa cifra hasta otras 30 veces en relación con GB300 NVL72. Estos son resultados máximos en la carga de trabajo y el modelo citados, no una garantía de que cada implementación vea la misma mejora.

NVIDIA también informa de costes hasta 35 veces menores por millón de tokens en comparación con GB300 NVL72. La empresa vincula esa medida a la economía de las fábricas de IA, donde la capacidad eléctrica limita cuántas GPU pueden funcionar y el coste por token afecta al margen de los servicios de inferencia.

Por qué las cargas de trabajo de agentes cambian la ecuación de la infraestructura

Una solicitud de chat convencional puede implicar una entrada y una salida relativamente cortas. NVIDIA describe secuencias típicas para chat o resumen de documentos que van aproximadamente de 1.000 a 8.000 tokens. Las sesiones de agentes pueden acumular cientos de miles de tokens de entrada a medida que los pasos anteriores, los resultados de herramientas y las salidas de subagentes permanecen disponibles para etapas posteriores.

Eso crea un problema de sistemas diferente. La infraestructura debe procesar grandes cantidades de contexto manteniendo la velocidad de respuesta en muchas solicitudes irregulares. Una carga de trabajo también puede alternar entre el procesamiento de contexto, conocido como prefill, y la generación de respuesta, o decode. Tratar ambas etapas de forma idéntica puede dejar algunas GPU infrautilizadas mientras otras se convierten en cuellos de botella.

La respuesta de NVIDIA combina técnicas de hardware y software. El servicio desagregado permite que los recursos de prefill y decode se escalen por separado, mientras que el ajuste de tasas intenta mantener sincronizadas ambas etapas. Los sistemas de caché KV distribuidos mantienen disponible en todo el dominio de GPU el contexto procesado previamente, y el enrutamiento consciente de KV puede enviar una solicitud al hardware que ya contiene datos en caché relevantes.

La plataforma también se apoya en paralelismo de expertos a gran escala para modelos de mezcla de expertos, kernels CUDA diseñados para combinar computación con comunicación y cuantización NVFP4 para reducir la memoria necesaria para los pesos del modelo. NVIDIA dice que los Tensor Cores de quinta generación y su Transformer Engine admiten ambas fases principales de la inferencia.

Evidencia, advertencias y qué está confirmado

Las afirmaciones de rendimiento más fuertes de esta historia provienen de los propios blogs de infraestructura y desarrollo de NVIDIA, no de un informe de benchmark independiente. La empresa atribuye el diseño de la carga de trabajo a SemiAnalysis AgentX, pero dice que los resultados de Vera Rubin siguen esperando la revisión de SemiAnalysis. Eso convierte las cifras en una indicación temprana del rendimiento objetivo de NVIDIA, no en una comparación consolidada del sector.

La comparación también está limitada en varios aspectos. NVIDIA informa de ganancias máximas, por lo que los resultados pueden depender de la elección del modelo, la longitud del contexto, la mezcla de solicitudes, el batching, las versiones de software y la configuración de gestión de energía. Las mediciones citadas de Vera Rubin omiten el trabajo de CPU para llamadas a herramientas, una parte importante de los agentes de producción. Las aplicaciones reales también pueden pasar mucho tiempo esperando bases de datos, APIs o sistemas empresariales en lugar de generar tokens.

NVIDIA dice que su tecnología DSX MaxLPS puede gestionar la energía a nivel de GPU, rack y carga de trabajo y aprovisionar hasta un 40% más de GPU dentro del mismo presupuesto de megavatios. Esa es otra afirmación de la empresa, y su valor práctico dependerá de la refrigeración, el diseño del rack, la utilización y el comportamiento de las cargas de trabajo desplegadas.

La economía de la arquitectura está ligada a la pila de software más amplia de NVIDIA, incluyendo TensorRT LLM y NVIDIA Dynamo. La empresa sostiene que el dominio de escala NVL72 y las tecnologías NVLink de sexta generación proporcionan el ancho de banda de comunicación necesario para la caché distribuida y el paralelismo de expertos. Esas decisiones de diseño podrían mejorar el rendimiento, pero también refuerzan la dependencia del ecosistema de hardware, redes y software de NVIDIA.

Lo que significa el resultado para los creadores y compradores de IA

Para los equipos de aplicaciones de IA, el anuncio refuerza que el coste de los agentes no puede evaluarse solo midiendo el precio de una única respuesta del modelo. Un agente de investigación que reutiliza repetidamente un contexto en crecimiento puede generar mucho más trabajo de inferencia que un asistente de chat, incluso cuando el usuario solo ve una respuesta final.

Por tanto, los equipos de infraestructura deberán seguir métricas como coste por tarea completada, energía por flujo de trabajo y rendimiento bajo crecimiento realista del contexto. Una plataforma que funciona bien con prompts cortos puede no ser eficiente cuando los agentes invocan herramientas, crean subagentes o revisan historiales largos.

Para los compradores empresariales, la pregunta inmediata no es simplemente si Vera Rubin es más rápida que GB300. Es si una organización tiene suficiente tráfico agéntico sostenido para justificar una nueva plataforma, y si sus aplicaciones pueden aprovechar funciones como la caché, la separación prefill-decode y la cuantización del modelo. Los equipos con cargas de trabajo modestas o impredecibles pueden seguir prefiriendo la inferencia compartida en la nube, mientras que los grandes proveedores de servicios de IA y los centros de datos con restricciones energéticas tienen incentivos más fuertes para optimizar el trabajo por megavatio.

El anuncio también plantea un problema de portabilidad del software. Las ganancias reportadas por NVIDIA dependen del co-diseño entre GPU, NVLink, CUDA, TensorRT LLM y NVIDIA Dynamo. Los desarrolladores que usan esa pila pueden acceder a más optimización, pero pueden enfrentar trabajo adicional de migración si más adelante trasladan modelos o cargas de trabajo de servicio a otras plataformas de aceleradores.

Qué vigilar a continuación

La primera señal será la revisión independiente de los resultados de SemiAnalysis AgentX. Debería aclarar cómo se configuraron las pruebas, qué mediciones produjeron las mayores ganancias y cómo se compara Vera Rubin con GB300 en distintos modelos y longitudes de contexto.

Los compradores también deberían vigilar la disponibilidad en producción, las mediciones de energía a nivel de sistema y los resultados que incluyan la orquestación de herramientas basada en CPU. Esos detalles ayudarán a distinguir la eficiencia de generación de tokens de la eficiencia agéntica de extremo a extremo.

Por último, el mercado necesitará evidencia de despliegues. Las comparaciones más significativas medirán tareas de agentes completadas, latencia, fiabilidad, utilización y coste operativo total en cargas de trabajo reales, en lugar de solo el rendimiento principal.

Perspectiva de Creati.ai

El anuncio de NVIDIA identifica un cuello de botella real en el despliegue de agentes: la inferencia de contexto largo y de varios pasos puede multiplicar la demanda de cómputo más rápido de lo que sugieren los recuentos de solicitudes visibles para el usuario. Medir el trabajo por megavatio es por tanto más relevante para agentes a gran escala que apoyarse en benchmarks de chat convencionales.

Pero la cifra de 30x debe tratarse como una afirmación temprana de rendimiento controlada por el proveedor. Su importancia dependerá de la réplica independiente y de si la mejora sobrevive a las partes difíciles de los agentes de producción: latencia de herramientas, orquestación, llamadas fallidas, tráfico desigual y coste de extremo a extremo. Para los desarrolladores, la lección práctica es medir flujos de trabajo completos ahora, antes de elegir infraestructura basándose solo en tasas de tokens de contexto corto.

Anuncios