NVIDIA afirma que Vera Rubin NVL72 ofrece hasta 30 veces más trabajo de IA agentiva por vatio

NVIDIA dice que Vera Rubin NVL72 puede ofrecer hasta 30 veces más rendimiento de IA agentiva por megavatio que GB300, reconfigurando la economía de la inferencia.

AI News

NVIDIA dice que su próxima plataforma Vera Rubin NVL72 puede ofrecer hasta 30 veces el rendimiento de IA agentiva por megavatio de su predecesora GB300 NVL72. La afirmación proviene de resultados iniciales en SemiAnalysis AgentX, un benchmark diseñado para reproducir sesiones de agentes de programación de estilo productivo en lugar de prompts de chatbot de longitud fija.

El resultado importa porque los agentes de IA generan mucho más tráfico de inferencia que el chat convencional. NVIDIA cita datos de OpenRouter que muestran que una solicitud agentiva consume aproximadamente 15 veces más tokens que una interacción de chat simple. Los agentes razonan repetidamente, llaman a herramientas, delegan tareas a subagentes y llevan un contexto en expansión a través de cada paso, lo que ejerce presión tanto sobre la capacidad de cómputo como sobre los presupuestos energéticos.

Los resultados de NVIDIA son informados por el proveedor y siguen pendientes de revisión por SemiAnalysis. Por lo tanto, indican el objetivo de rendimiento de la empresa para Rubin, no una clasificación sectorial confirmada de forma independiente. Aun así, la elección del benchmark apunta a un cambio más amplio en cómo los proveedores de infraestructura podrían necesitar medir los sistemas de IA a medida que las cargas de trabajo de varios pasos pasan a producción.

Un benchmark construido en torno al comportamiento real de los agentes

La carga de trabajo AgentX, parte de la suite de benchmarks InferenceX de SemiAnalysis, reproduce sesiones registradas de Claude Code con razonamiento del modelo y uso de herramientas intercalados. Conserva las longitudes de secuencia originales, el crecimiento del contexto, los intervalos de razonamiento y los retrasos en las llamadas a herramientas, según material del NVIDIA Developer Blog.

Ese diseño difiere de las pruebas de inferencia tradicionales construidas en torno a un tamaño fijo de entrada y salida. En una sesión de agente, el prompt puede expandirse de miles de tokens a cientos de miles a medida que el sistema acumula investigación, código, resultados de herramientas y trabajo delegado. El contexto procesado anteriormente también puede reutilizarse mediante una caché clave-valor, mientras que la ejecución de herramientas crea huecos entre llamadas al modelo.

AgentX varía la concurrencia y evalúa el rendimiento frente a medidas de interactividad como el tiempo hasta el primer token, la latencia extremo a extremo y los tokens por segundo por usuario. NVIDIA dice que el resultado principal de Rubin se midió en 160 tokens por segundo por usuario en la carga de trabajo AgentX DeepSeek V4 Pro. En ese punto de operación, la empresa informa hasta 30 veces más rendimiento por megavatio que GB300 NVL72.

La comparación no es una afirmación general sobre todos los modelos o implementaciones. El resultado citado está ligado a una configuración de plataforma, una carga de trabajo y un objetivo de interactividad específicos. NVIDIA también dice que la medición aún no incluye el rendimiento de la CPU Vera para las llamadas a herramientas, dejando fuera de la cifra informada una parte del sistema de agente de extremo a extremo.

Qué está cambiando NVIDIA en la pila de inferencia

NVIDIA atribuye el resultado a una combinación de hardware, redes y software, no solo a la GPU Rubin. El diseño NVL72 crea un gran dominio de escalado en el que las GPU comparten comunicación de alto ancho de banda y baja latencia mediante sistemas NVLink de sexta generación y NVLink Switch.

Esa topología respalda técnicas orientadas a cargas de trabajo de contexto largo y mixture-of-experts. NVIDIA destaca la caché KV distribuida, que mantiene disponible el contexto procesado previamente a través de las GPU, y el enrutamiento consciente de KV, que puede dirigir una solicitud hacia el hardware que ya contiene datos de caché relevantes. El serving disgregado separa el prefill, donde se procesa el contexto, del decode, donde se generan las respuestas, permitiendo que cada etapa escale de forma independiente.

La capa de software incluye NVIDIA TensorRT-LLM, NVIDIA Dynamo y kernels CUDA diseñados para combinar cómputo con comunicación entre GPU. La empresa también señala la cuantización NVFP4 y las capacidades más recientes de Tensor Cores y Transformer Engine como formas de reducir el uso de memoria y aumentar el rendimiento de tokens.

La tecnología de gestión de energía DSX MaxLPS de NVIDIA se presenta como otra palanca. La empresa dice que puede aprovisionar hasta un 40% más de GPU dentro del mismo presupuesto de megavatios al gestionar la energía a nivel de GPU, rack y carga de trabajo. NVIDIA afirma por separado que Rubin puede reducir el costo por millón de tokens hasta 35 veces frente a GB300 NVL72 en la carga de trabajo citada.

Evidencia, comparaciones y límites

Los mismos datos de AgentX ofrecen una imagen más gradual de las ganancias generacionales de NVIDIA. NVIDIA informa que GB300 NVL72 ofrece hasta 15 veces el rendimiento por megavatio de H200 NVL8 para DeepSeek V4 Pro 1.6T, y hasta 80 veces para el modelo más grande Kimi K3 2.8T. También afirma que GB300 proporciona hasta 10 veces menos costo por millón de tokens que H200 en la comparación citada.

Esas cifras también son presentadas por NVIDIA usando la carga de trabajo de SemiAnalysis. El benchmark subyacente pretende hacer las comparaciones más realistas al reproducir tráfico idéntico, pero las mediciones de Rubin aún no han recibido la revisión independiente mencionada en las publicaciones de NVIDIA. Por tanto, los lectores deben distinguir entre la metodología del benchmark y los números de rendimiento reportados a partir de él.

Las afirmaciones tampoco establecen que todas las cargas de trabajo de agentes verán una mejora de 30x. Los resultados pueden variar según la arquitectura del modelo, la longitud del contexto, la reutilización de caché, la concurrencia, la latencia de herramientas, la configuración de cuantización y la velocidad de respuesta requerida. Un agente de programación que espera con frecuencia a un compilador o a una API externa puede estar limitado por la sobrecarga de software y orquestación más que por el rendimiento bruto del acelerador.

Por qué el resultado importa para creadores y compradores de IA

Para los operadores de infraestructura de IA, el rendimiento por vatio se está convirtiendo en una métrica de capacidad y de economía unitaria, no solo en una medida ambiental. Si las ganancias informadas se mantienen en pruebas independientes, un operador de centro de datos podría atender más sesiones simultáneas de agentes dentro de una asignación fija de energía, o proporcionar la misma capacidad con menos aceleradores y menor costo operativo.

Eso podría afectar la forma en que las empresas diseñan fábricas de IA para asistentes de programación, agentes de investigación, sistemas de atención al cliente y automatización interna. Los equipos pueden necesitar optimizar todo el flujo de trabajo: caché de contexto, programación de prefill y decode, enrutamiento del modelo, latencia de llamadas a herramientas y manejo del tráfico de subagentes. Elegir una GPU más rápida sin cambiar esos sistemas circundantes podría dejar sin materializar una parte sustancial del beneficio reclamado.

Los resultados también elevan el listón competitivo para los proveedores de infraestructura. Las pruebas fijas de entrada 8K y salida 1K siguen siendo útiles para comparaciones controladas, pero pueden decir menos sobre el tráfico de agentes con estado. Los compradores que evalúan una plataforma de IA deberían preguntar si sus benchmarks preservan el crecimiento del contexto, las pausas por herramientas, la reutilización de caché y objetivos realistas de experiencia de usuario.

Para los desarrolladores de modelos, el énfasis en el serving de contexto largo y la ejecución mixture-of-experts podría hacer más importante un diseño consciente de la infraestructura. La cuantización y la caché pueden reducir costos, pero también introducen compromisos de calidad, gestión de memoria y operación que deben probarse en el flujo de trabajo real del agente y no inferirse a partir de una sola cifra de rendimiento.

Qué vigilar a continuación

La señal más inmediata es la revisión de SemiAnalysis de los resultados AgentX de Vera Rubin NVL72. La publicación independiente de la configuración de prueba, la contabilidad de energía, los ajustes del modelo y las mediciones de interactividad ayudará a determinar cuán reproducible es la cifra de 30x.

También serán importantes los resultados de benchmark en modelos adicionales. NVIDIA destaca DeepSeek V4 Pro y Kimi K3 de forma prominente, pero las cargas de trabajo de agentes difieren considerablemente en crecimiento del contexto, enrutamiento de expertos y uso de herramientas. Los resultados en otros modelos de programación, investigación y empresa podrían mostrar si la ventaja de Rubin es amplia o está concentrada en patrones de serving particulares.

La evidencia de despliegue será otra prueba. Las afirmaciones de NVIDIA se refieren a mediciones preliminares, no a resultados de producción de clientes revelados. Los compradores deberían buscar costo validado por millón de tokens, rendimiento sostenido bajo presión de caché y latencia completa extremo a extremo que incluya llamadas a herramientas y orquestación del lado de la CPU.

Perspectiva de Creati.ai

El anuncio de NVIDIA es más significativo por replantear la competencia de infraestructura en torno al trabajo útil de agentes por unidad de energía. La afirmación titular de 30x aún no es evidencia independiente, pero la metodología AgentX aborda una debilidad real de los benchmarks de inferencia antiguos: a menudo modelan una sola solicitud en lugar del flujo de trabajo creciente e interrumpido que produce un agente de IA.

Para los creadores y los compradores empresariales, la lección práctica es evaluar todo el sistema de serving, no solo las especificaciones del acelerador. La ventaja informada de Rubin solo importará si la caché, la programación, la ejecución del modelo y la orquestación de herramientas pueden traducirla en menor latencia o menor costo por token en producción. Hasta que llegue la revisión del benchmark y se desplieguen implementaciones más amplias, las cifras de NVIDIA deben tratarse como una afirmación importante del proveedor y como una señal de hacia dónde se dirige la competencia en infraestructura de IA.

Anuncios