NVIDIA dice que Vera Rubin NVL72 puede ofrecer hasta 30 veces más rendimiento de inferencia agentiva por megavatio que GB300, a la espera de una revisión independiente del benchmark.

NVIDIA dice que su próxima plataforma Vera Rubin NVL72 puede ofrecer hasta 30 veces más rendimiento de IA agentiva por megavatio que el sistema GB300 NVL72 de la compañía. La afirmación proviene de resultados preliminares en SemiAnalysis AgentX, un benchmark diseñado para reproducir sesiones de agentes de programación al estilo de producción en lugar de prompts de chatbot de longitud fija.
El resultado importa porque los agentes de IA consumen mucha más capacidad de inferencia que el chat ordinario. Las fuentes de NVIDIA citan datos de OpenRouter que muestran que una sola solicitud agentiva usa aproximadamente 15 veces más tokens que una solicitud de chat simple, ya que los agentes razonan repetidamente, llaman herramientas, delegan trabajo a subagentes y transportan un contexto en expansión a lo largo de una tarea.
La comparación de Vera Rubin aún no es un resultado validado de forma independiente. NVIDIA midió las cifras usando la carga de trabajo SemiAnalysis AgentX y dice que los resultados están pendientes de revisión por SemiAnalysis. Eso convierte el anuncio en una señal temprana de rendimiento informada por el proveedor, no en un benchmark industrial confirmado.
AgentX forma parte de la suite de benchmarks InferenceX de SemiAnalysis. Según el NVIDIA Developer Blog, reproduce sesiones grabadas de Claude Code a través del cliente AIPerf, preservando la secuencia de llamadas al modelo, intervalos de razonamiento, uso de herramientas, crecimiento del contexto y latencia de llamadas a herramientas capturados en las trayectorias originales.
Ese diseño intenta abordar una debilidad de las pruebas convencionales de inferencia. Las pruebas estáticas suelen usar longitudes de entrada y salida predeterminadas, como un prompt de 8.000 tokens seguido de una respuesta de 1.000 tokens. Los agentes de programación reales generan tráfico irregular: una tarea puede alternar entre razonamiento del modelo, operaciones con archivos, búsquedas, salida del compilador y más llamadas al modelo, mientras el contexto acumulado se vuelve mucho más grande con el tiempo.
AgentX mide tokens por megavatio junto con indicadores de experiencia de usuario como tiempo hasta el primer token, latencia de extremo a extremo e interactividad. El resultado principal de Vera Rubin fue medido en 160 tokens por segundo por usuario en la carga de trabajo AgentX DeepSeek V4 Pro. La compañía dice que Vera Rubin NVL72 alcanzó hasta 30 veces el rendimiento de la fábrica de IA por megavatio de GB300 NVL72 en ese punto de operación.
El benchmark también informa ganancias sustanciales para la generación Blackwell actual. NVIDIA dice que GB300 NVL72 ofrece hasta 15 veces el rendimiento por megavatio de H200 NVL8 en DeepSeek V4 Pro 1.6T, y hasta 80 veces el resultado en Kimi K3 2.8T. Esas cifras también se presentan a través del informe de NVIDIA sobre los resultados de AgentX y deben tratarse en consecuencia.
NVIDIA atribuye las mejoras proyectadas de eficiencia a una combinación de escala de hardware y optimización de software, no solo a la GPU Rubin. El diseño NVL72 conecta 72 GPU en un dominio de scale-up, lo que permite que las cargas de trabajo distribuyan expertos del modelo y mantengan el contexto en todo el sistema con interconexiones de alto ancho de banda.
Eso importa para agentes de larga duración porque el contexto procesado previamente a menudo puede reutilizarse en lugar de recalcularse. NVIDIA describe un diseño de servicio que separa el prefill, donde el sistema procesa el contexto entrante, del decode, donde genera la salida. La coincidencia de tasas entre esas etapas pretende evitar que un lado quede ocioso mientras el otro se convierte en un cuello de botella.
La compañía también señala el almacenamiento en caché distribuido de clave-valor, el enrutamiento de solicitudes con conciencia de KV y la descarga de caché a memoria de host o almacenamiento. Estas técnicas están diseñadas para mantener disponibles partes relevantes de una sesión de agente en crecimiento a lo largo de múltiples solicitudes. NVIDIA dice que la tecnología NVLink y NVLink Switch de sexta generación ofrece mayores tasas de paquetes y menor latencia que las alternativas Ethernet convencionales para esta comunicación de scale-up.
La capa de software incluye NVIDIA TensorRT-LLM, NVIDIA Dynamo y kernels CUDA optimizados para modelos Mixture-of-Experts. El informe orientado a desarrolladores también menciona SGLang y vLLM como runtimes de servicio utilizados en la pila de optimización más amplia, junto con kernels DeepGEMM y formatos de menor precisión como MXFP4 y MXFP8. NVIDIA dice que la cuantización NVFP4 en Rubin está pensada para reducir el uso de memoria y aumentar el rendimiento al tiempo que preserva la calidad de salida, aunque la evidencia proporcionada no ofrece una evaluación independiente de calidad.
NVIDIA añade además que sus tecnologías DSX MaxLPS pueden gestionar la energía a nivel de GPU, rack y carga de trabajo, permitiendo potencialmente hasta un 40% más de GPU dentro del mismo presupuesto de megavatios. Eso es una afirmación de planificación de capacidad de NVIDIA, no un resultado demostrado únicamente por las cifras de AgentX.
Para los equipos que construyen asistentes de programación, agentes de investigación o automatización de servicio al cliente, la métrica relevante ya no es simplemente qué tan rápido un prompt produce una respuesta. Un agente de producción puede mantener activas varias llamadas al modelo, conservar un contexto grande y pausarse mientras herramientas externas devuelven datos. La infraestructura que funciona bien en solicitudes cortas e aisladas puede, por tanto, desperdiciar energía o perder capacidad de respuesta en flujos de trabajo reales.
El anuncio de Vera Rubin presenta la eficiencia energética tanto como una restricción de despliegue como una cuestión de precio. NVIDIA dice que Vera Rubin NVL72 puede reducir el coste por millón de tokens hasta 35 veces en relación con GB300 NVL72 en la carga de trabajo citada. Su blog para desarrolladores informa por separado que GB300 puede ofrecer hasta 10 veces menor coste por token que H200 NVL8. Estos cálculos dependen de la configuración del benchmark, los supuestos energéticos y los niveles de utilización, por lo que los compradores empresariales tendrán que probarlos contra sus propios modelos y patrones de servicio.
El resultado podría ser especialmente relevante para operadores que atienden grandes modelos Mixture-of-Experts o agentes con sesiones inusualmente largas. En esos entornos, el movimiento de memoria, la reutilización de caché y el comportamiento de interconexión pueden importar tanto como la aritmética bruta del acelerador. Sin embargo, los equipos más pequeños pueden no ver la misma economía si usan modelos de contexto corto, baja concurrencia o APIs alojadas que ocultan el hardware subyacente.
También existe una cuestión de fiabilidad. Un caché más agresivo, el servicio desagregado y la orquestación de herramientas pueden mejorar la utilización, pero añaden complejidad de programación y gestión de estado. Los constructores tendrán que evaluar la recuperación ante fallos, la invalidación de caché, la latencia de cola y el aislamiento de cargas de trabajo en lugar de confiar en cifras máximas de tokens por segundo.
La primera señal será la revisión de SemiAnalysis de los resultados de Vera Rubin AgentX. La publicación independiente de la configuración de prueba, las mediciones de energía, los ajustes del modelo y los objetivos de interactividad determinará cuán comparable es la afirmación de 30x entre sistemas.
Los compradores también deberían vigilar resultados que incluyan el papel de la Vera CPU en las llamadas a herramientas. NVIDIA dice explícitamente que las primeras cifras aún no reflejan el rendimiento de la Vera CPU para esa parte del flujo de trabajo. Dado que los agentes pasan tiempo fuera de la generación del modelo, las mediciones de extremo a extremo podrían diferir del rendimiento exclusivo del acelerador.
Otros seguimientos útiles incluyen disponibilidad y precios de Vera Rubin NVL72, rendimiento en modelos más allá de DeepSeek V4 Pro y resultados de operadores que ejecuten sus propios trazados en lugar de sesiones grabadas. Los cambios en la pila de software de NVIDIA también podrían afectar la comparación, ya que la compañía dice que tanto el rendimiento de Rubin como el de GB300 mejorarán mediante una optimización continua.
El anuncio de NVIDIA es importante menos porque establezca un estándar industrial final de 30x que porque destaca una definición cambiante del rendimiento de inferencia. Las cargas de trabajo de agentes exponen cuellos de botella que las pruebas con prompts fijos pueden pasar por alto: reutilización de contexto, vacíos en las llamadas a herramientas, capacidad de caché, concurrencia y entrega de energía.
La conclusión práctica para los creadores de IA es medir trayectorias completas de agentes antes de comprometerse con una infraestructura. Los resultados tempranos de NVIDIA sugieren que el hardware fuertemente integrado y el software de servicio pueden cambiar de forma material la economía de los agentes de larga duración, pero la magnitud de esa ventaja sigue sin confirmarse hasta que las mediciones subyacentes de AgentX se revisen y reproduzcan de forma independiente.