
NVIDIA dice que su próxima plataforma Vera Rubin NVL72 puede ofrecer hasta 30 veces más rendimiento de IA agentiva por megavatio que su sistema GB300 NVL72, basándose en mediciones tempranas de una carga de trabajo diseñada para imitar agentes de codificación en producción. La afirmación sitúa la eficiencia energética —y no solo los tokens por segundo máximos— como un campo de batalla central para la próxima generación de infraestructura de IA.
La compañía publicó los resultados en dos entradas del blog de NVIDIA, describiéndolos como datos preliminares medidos con el benchmark SemiAnalysis AgentX. Las mediciones aún no han sido revisadas de forma independiente por SemiAnalysis, lo que hace que los resultados sean importantes pero todavía reportados por el proveedor. Para los creadores de IA y los operadores de infraestructura, la comparación importa porque los agentes de varios pasos consumen sustancialmente más contexto y llamadas al modelo que las interacciones de chat convencionales, aumentando tanto la demanda de cómputo como los costes energéticos.
Los benchmarks tradicionales de inferencia suelen usar longitudes fijas de prompt y salida. NVIDIA argumenta que esas pruebas representan mal a un agente que razona repetidamente, llama a herramientas, delega trabajo a subagentes y lleva un contexto en expansión de un paso al siguiente.
La compañía cita datos de OpenRouter que indican que las solicitudes agentivas usan alrededor de 15 veces más tokens que las solicitudes de chat ordinarias. En un ejemplo proporcionado por NVIDIA, un agente de investigación de inversiones podría consultar bases de datos financieras, buscar registros y noticias, pedir a otro modelo que compare competidores, ejecutar análisis de valoración y luego elaborar una recomendación. Cada paso puede añadir información que se convierte en entrada para pasos posteriores.
Ese patrón crea varias presiones de rendimiento al mismo tiempo. Los sistemas deben procesar prompts largos, preservar y reutilizar cachés key-value, manejar longitudes de salida variables y tolerar pausas mientras se ejecutan herramientas. También deben mantener una velocidad de respuesta aceptable para múltiples usuarios, en lugar de simplemente maximizar el rendimiento agregado bajo una carga sintética fija.
Los resultados de NVIDIA se centran en DeepSeek V4 Pro y otros modelos grandes, incluidos Kimi K3, MiniMax M3, GLM5.3 y Qwen3.5. La comparación principal es entre Vera Rubin NVL72 y GB300 NVL72, dos sistemas a escala de rack construidos alrededor de un dominio de ampliación de 72 GPU.
NVIDIA dice que Vera Rubin NVL72 alcanzó hasta 30 veces más rendimiento de fábrica de IA por megavatio que GB300 NVL72 en SemiAnalysis AgentX. La publicación orientada a desarrolladores especifica que la comparación llegó a este resultado a 160 tokens por segundo por usuario en la carga de trabajo AgentX DeepSeek V4 Pro. NVIDIA también dice que el resultado representa rendimiento dentro del mismo presupuesto de energía mientras mantiene el objetivo de servicio interactivo indicado.
El benchmark AgentX se describe como un componente de código abierto de la suite InferenceX de SemiAnalysis. Reproduce sesiones registradas de Claude Code paso a paso, preservando el crecimiento del contexto, las longitudes de entrada y salida, los intervalos de razonamiento y los retrasos en las llamadas a herramientas. El benchmark también varía la concurrencia e informa el rendimiento por megavatio junto con medidas de latencia e interactividad como el tiempo hasta el primer token.
Esos detalles hacen que AgentX sea más relevante para el servicio de agentes en producción que una prueba única de longitud fija, pero no convierten la cifra de 30x en un estándar industrial validado de forma independiente. NVIDIA dice que las mediciones de Vera Rubin están pendientes de revisión por SemiAnalysis. La compañía también señala que los datos iniciales no incluyen el rendimiento de Vera CPU para llamadas a herramientas, lo que podría afectar a los resultados del sistema completo.
NVIDIA informa otras comparaciones generacionales a partir de la misma carga de trabajo. Dice que GB300 NVL72 ofrece hasta 15 veces el rendimiento por megavatio de H200 NVL8 para DeepSeek V4 Pro, y hasta 80 veces el rendimiento por megavatio para el modelo mucho mayor Kimi K3 2.8T. Además, afirma que Vera Rubin puede reducir el coste por millón de tokens hasta 35 veces en comparación con GB300 NVL72. Estas cifras son mediciones de NVIDIA y deben tratarse como afirmaciones de rendimiento hasta que se reproduzcan de forma independiente.
NVIDIA atribuye las mejoras a cambios coordinados en hardware, red y software de serving, y no solo a la GPU. El diseño NVL72 conecta 72 GPU mediante la estructura NVLink de NVIDIA, permitiendo que la plataforma distribuya el cálculo de mixture-of-experts y comparta contexto en caché a través del dominio a escala de rack.
La compañía dice que NVLink de sexta generación y sus switches proporcionan tasas de paquetes más altas y menor latencia que las alternativas Ethernet comerciales. Esa conectividad está pensada para soportar paralelismo experto a gran escala, caché key-value distribuida y el enrutamiento de solicitudes hacia GPU que ya contienen contexto relevante.
En el plano del software, NVIDIA señala el serving desacoplado, en el que prefill y decode se ejecutan en grupos escalados por separado. Su stack de serving NVIDIA Dynamo está diseñado para coordinar esas etapas, usar información de sesión y enrutar solicitudes en parte según el solapamiento de caché. Estas capacidades son especialmente relevantes para los agentes, porque la misma tarea puede generar muchas llamadas al modelo relacionadas durante una sesión prolongada.
NVIDIA también cita TensorRT-LLM, vLLM y SGLang como partes del ecosistema de serving más amplio, junto con kernels basados en DeepGEMM, ejecución fusionada de mixture-of-experts y formatos de menor precisión. El material de origen menciona tanto NVFP4 como técnicas MXFP4/MXFP8 en distintas descripciones de la plataforma. Estos métodos pueden reducir el uso de memoria y aumentar el rendimiento aritmético, aunque los compromisos prácticos de calidad y compatibilidad dependen del modelo y de la configuración de despliegue.
La compañía también dice por separado que su tecnología de gestión de energía DSX MaxLPS puede provisionar hasta un 40% más de GPU dentro del mismo presupuesto de megavatios. Esa es otra capacidad reportada por NVIDIA, no un resultado establecido por la comparación AgentX en sí.
Si las cifras principales superan pruebas independientes, el efecto comercial podría ser significativo. Las fábricas de IA se enfrentan cada vez más a límites de disponibilidad eléctrica, capacidad de refrigeración y coste de servir sesiones prolongadas. Más trabajo agentivo por megavatio podría permitir a un operador atender a más clientes con una asignación eléctrica existente, o reducir la infraestructura necesaria para un nivel fijo de uso.
El impacto variará según la carga de trabajo. Un asistente conversacional breve puede no beneficiarse tanto como un agente de codificación, investigación o atención al cliente que invoca herramientas repetidamente y acumula contexto. La arquitectura del modelo también importa: las comparaciones más fuertes de NVIDIA implican grandes sistemas mixture-of-experts, donde la comunicación entre GPU y la gestión de caché pueden dominar el rendimiento del serving.
Para los equipos de producto, las cifras refuerzan la necesidad de medir flujos completos de agentes en lugar de llamadas aisladas al modelo. La evaluación debe incluir latencia de herramientas, reutilización de caché, concurrencia, interactividad para el usuario y coste por tarea completada. Una plataforma que produce tokens a bajo coste pero se detiene entre llamadas a herramientas puede no ofrecer una mejor experiencia de aplicación.
Las afirmaciones también aumentan la presión competitiva sobre fabricantes de aceleradores y proveedores de nube para publicar datos de eficiencia específicos por carga de trabajo. “Tokens por segundo” por sí solo dice poco sobre la economía de un agente con estado. Los creadores necesitarán mediciones comparables entre modelos, stacks de serving y presupuestos de energía antes de comprometerse con una generación de hardware.
La primera señal será la revisión de SemiAnalysis de las mediciones de AgentX. La confirmación independiente, incluidas las configuraciones exactas del sistema, las versiones de software, los checkpoints del modelo y la metodología de contabilidad de energía, determinará cuán amplia puede interpretarse la comparación de 30x.
Los compradores también deberían vigilar resultados que incluyan la ejecución de herramientas en la CPU, ya que NVIDIA dice que los datos actuales de Vera Rubin no la incluyen. Pruebas adicionales con agentes no orientados a código, distintas longitudes de contexto y marcos de serving alternativos mostrarían si la ventaja se extiende más allá de las sesiones registradas de Claude Code.
La disponibilidad, el precio y el acceso en la nube serán igualmente importantes. La afirmación de eficiencia puede mejorar el coste teórico por millón de tokens, pero la economía real del cliente también dependerá de los costes de adquisición del sistema, la utilización, la red, la refrigeración y las licencias de software. La evidencia de los primeros despliegues revelará si la ventaja del benchmark se traduce en precios más bajos o márgenes más altos para los operadores.
El anuncio de NVIDIA se entiende mejor como un cambio en la forma en que se enmarca el rendimiento de la infraestructura de IA. A medida que los agentes generan cargas de trabajo más largas y con más estado, el rendimiento normalizado por energía y el coste por tarea completada se convierten en métricas más útiles que la velocidad convencional de una sola solicitud.
La cifra de 30x llama mucho la atención, pero sigue siendo una medición temprana de NVIDIA pendiente de revisión independiente. La lección duradera para los creadores es más estrecha y accionable: evaluar todo el bucle del agente, incluyendo reutilización de contexto, herramientas, concurrencia y latencia, antes de tratar cualquier comparación de aceleradores como una conclusión de producción.
NVIDIA dice que Vera Rubin NVL72 ofrece hasta 30x más rendimiento agentivo por megavatio que GB300, reconfigurando la economía de inferencia para los creadores de IA.