NVIDIA говорит, что Vera Rubin NVL72 может обеспечить до 30 раз больший агентный ИИ-пропускной способности на мегаватт, чем GB300, меняя экономику инференса.

NVIDIA заявляет, что ее будущая платформа Vera Rubin NVL72 может обеспечить до 30 раз более высокий агентный ИИ-пропускной способности на мегаватт, чем ее предшественник GB300 NVL72. Это утверждение основано на ранних результатах SemiAnalysis AgentX — бенчмарка, созданного для воспроизведения производственных сессий кодирующих агентов, а не фиксированных по длине чат-ботовых запросов.
Этот результат важен, потому что ИИ-агенты генерируют гораздо больше инференс-трафика, чем обычный чат. NVIDIA приводит данные OpenRouter, показывающие, что агентный запрос потребляет примерно в 15 раз больше токенов, чем простое чат-взаимодействие. Агенты многократно рассуждают, вызывают инструменты, делегируют задачи субагентам и несут расширяющийся контекст через каждый шаг, создавая нагрузку как на вычислительные ресурсы, так и на энергетический бюджет.
Результаты NVIDIA предоставлены самим вендором и пока ожидают проверки SemiAnalysis. Поэтому они отражают целевую производительность компании для Rubin, а не независимо подтвержденный отраслевой рейтинг. Тем не менее выбор бенчмарка указывает на более широкий сдвиг в том, как поставщикам инфраструктуры, возможно, придется измерять ИИ-системы по мере перехода многошаговых нагрузок в производство.
Нагрузка AgentX, часть набора бенчмарков InferenceX от SemiAnalysis, воспроизводит записанные сессии Claude Code с перемежающимися рассуждениями модели и использованием инструментов. Согласно материалам NVIDIA Developer Blog, сохраняются исходные длины последовательностей, рост контекста, интервалы рассуждений и задержки вызовов инструментов.
Такой подход отличается от традиционных тестов инференса, построенных вокруг фиксированного размера входа и выхода. В сессии агента запрос может разрастаться от тысяч токенов до сотен тысяч, пока система накапливает исследования, код, результаты инструментов и делегированную работу. Ранее обработанный контекст также может повторно использоваться через key-value cache, тогда как выполнение инструментов создает паузы между вызовами модели.
AgentX варьирует степень параллелизма и оценивает пропускную способность по показателям интерактивности, таким как время до первого токена, сквозная задержка и количество токенов в секунду на пользователя. NVIDIA говорит, что главный результат Rubin был измерен на уровне 160 токенов в секунду на пользователя на нагрузке AgentX DeepSeek V4 Pro. На этой рабочей точке компания сообщает о пропускной способности до 30 раз выше на мегаватт, чем у GB300 NVL72.
Это сравнение не является общим утверждением обо всех моделях или развертываниях. Указанный результат привязан к конкретной конфигурации платформы, нагрузке и целевому уровню интерактивности. NVIDIA также говорит, что измерение пока не включает производительность процессора Vera для вызовов инструментов, оставляя часть сквозной агентной системы за пределами сообщаемой цифры.
NVIDIA объясняет результат сочетанием аппаратного обеспечения, сетевой архитектуры и программного обеспечения, а не только GPU Rubin. Конструкция NVL72 создает большой домен scale-up, в котором GPU обмениваются высокополосной и низколатентной связью через системы NVLink шестого поколения и NVLink Switch.
Эта топология поддерживает техники, нацеленные на длинный контекст и mixture-of-experts нагрузки. NVIDIA выделяет распределенный KV-кеш, который сохраняет ранее обработанный контекст доступным между GPU, и KV-aware routing, который может направлять запрос к оборудованию, уже содержащему релевантные данные кеша. Disaggregated serving разделяет prefill, где обрабатывается контекст, и decode, где генерируются ответы, позволяя каждой стадии масштабироваться независимо.
Программный слой включает NVIDIA TensorRT-LLM, NVIDIA Dynamo и CUDA-ядра, разработанные для совмещения вычислений с меж-GPU коммуникацией. Компания также указывает на квантование NVFP4 и более новые возможности Tensor Cores и Transformer Engine как способы снизить использование памяти и повысить пропускную способность по токенам.
Технология управления питанием DSX MaxLPS от NVIDIA представляется еще одним рычагом. Компания говорит, что может разместить до 40% больше GPU в рамках того же мегаваттного бюджета за счет управления питанием на уровнях GPU, стойки и нагрузки. NVIDIA отдельно утверждает, что Rubin может снизить стоимость за миллион токенов до 35 раз по сравнению с GB300 NVL72 на указанной нагрузке.
Те же данные AgentX дают более постепенную картину поколенческих улучшений NVIDIA. NVIDIA сообщает, что GB300 NVL72 обеспечивает до 15 раз более высокую пропускную способность на мегаватт, чем H200 NVL8, для DeepSeek V4 Pro 1.6T, и до 80 раз — для более крупной модели Kimi K3 2.8T. Компания также утверждает, что GB300 обеспечивает до 10 раз более низкую стоимость за миллион токенов, чем H200, в указанном сравнении.
Эти цифры NVIDIA тоже представляет, используя нагрузку SemiAnalysis. Базовый бенчмарк призван сделать сравнения более реалистичными за счет воспроизведения идентичного трафика, но измерения Rubin пока не прошли независимую проверку, о которой говорится в публикациях NVIDIA. Поэтому читателям следует различать методологию бенчмарка и сообщаемые на его основе показатели производительности.
Эти заявления также не доказывают, что каждая агентная нагрузка увидит рост в 30 раз. Результаты могут варьироваться в зависимости от архитектуры модели, длины контекста, повторного использования кеша, параллелизма, задержки инструментов, параметров квантования и требуемой скорости ответа. Кодирующий агент, который часто ждет компилятор или внешний API, может ограничиваться программными и оркестрационными накладными расходами, а не чистой пропускной способностью ускорителя.
Для операторов ИИ-инфраструктуры производительность на ватт становится не просто экологическим показателем, а метрикой емкости и unit economics. Если сообщаемые выигрыши подтвердятся независимыми тестами, оператор ЦОД сможет обслуживать больше одновременных агентных сессий в рамках фиксированного энергобюджета или обеспечить ту же емкость с меньшим числом ускорителей и более низкими операционными затратами.
Это может повлиять на то, как компании проектируют ИИ-фабрики для кодирующих ассистентов, исследовательских агентов, систем обслуживания клиентов и внутренней автоматизации. Командам, возможно, придется оптимизировать весь рабочий процесс: кеширование контекста, планирование prefill и decode, маршрутизацию моделей, задержку вызовов инструментов и обработку трафика субагентов. Выбор более быстрого GPU без изменения этих окружающих систем может оставить значительную часть заявленной выгоды нереализованной.
Результаты также повышают планку для поставщиков инфраструктуры. Тесты с фиксированными 8K входа и 1K выхода остаются полезными для контролируемых сравнений, но они могут меньше говорить о stateful-агентном трафике. Покупателям, оценивающим ИИ-платформу, следует спрашивать, сохраняют ли ее бенчмарки рост контекста, паузы на инструменты, повторное использование кеша и реалистичные цели пользовательского опыта.
Для разработчиков моделей акцент на long-context serving и выполнении mixture-of-experts может сделать более важным проектирование с учетом инфраструктуры. Квантование и кеширование могут снизить стоимость, но они также вносят компромиссы в качество, управление памятью и эксплуатацию, которые нужно тестировать на реальном агентном рабочем процессе, а не выводить из одного показателя пропускной способности.
Самый ближайший сигнал — обзор SemiAnalysis результатов Vera Rubin NVL72 AgentX. Независимая публикация конфигурации теста, учета энергопотребления, настроек модели и измерений интерактивности поможет понять, насколько воспроизводима цифра 30x.
Также будут важны результаты бенчмарков на дополнительных моделях. NVIDIA особенно выделяет DeepSeek V4 Pro и Kimi K3, но агентные нагрузки существенно различаются по росту контекста, маршрутизации экспертов и использованию инструментов. Результаты на других кодирующих, исследовательских и корпоративных моделях могут показать, является ли преимущество Rubin широким или сосредоточенным в определенных сценариях serving.
Еще одной проверкой станет подтверждение на практике. Заявления NVIDIA относятся к предварительным измерениям, а не к раскрытым результатам клиентского производства. Покупателям следует искать подтвержденную стоимость за миллион токенов, устойчивую производительность под давлением кеша и полную сквозную задержку, включающую вызовы инструментов и оркестрацию на стороне CPU.
Объявление NVIDIA наиболее важно тем, что оно переосмысливает конкуренцию в инфраструктуре вокруг полезной агентной работы на единицу энергии. Заголовочное заявление о 30x пока не является независимым доказательством, но методология AgentX устраняет реальную слабость старых бенчмарков инференса: они часто моделируют один запрос вместо расширяющегося и прерываемого рабочего процесса, который создаёт ИИ-агент.
Для разработчиков и корпоративных покупателей практический вывод таков: нужно оценивать всю систему serving, а не только характеристики ускорителя. Заявленное преимущество Rubin будет иметь значение только если кеширование, планирование, выполнение модели и оркестрация инструментов смогут превратить его в меньшую задержку или меньшую стоимость токена в реальном производстве. Пока не появятся обзор бенчмарка и более широкие развертывания, цифры NVIDIA следует рассматривать как важное заявление поставщика и как сигнал о направлении конкуренции в ИИ-инфраструктуре.