NVIDIA заявляет, что Vera Rubin NVL72 может обеспечивать до 30 раз больший агентный inference throughput на мегаватт, чем GB300, в ожидании независимой проверки бенчмарка.

NVIDIA заявляет, что ее будущая платформа Vera Rubin NVL72 способна обеспечивать до 30 раз больший agentic-AI throughput на мегаватт, чем система компании GB300 NVL72. Это утверждение основано на предварительных результатах SemiAnalysis AgentX — бенчмарка, созданного для воспроизведения сессий coding-агентов в стиле production, а не чат-ботных промптов фиксированной длины.
Этот результат важен, потому что ИИ-агенты потребляют значительно больше inference-мощности, чем обычный чат. Источники NVIDIA ссылаются на данные OpenRouter, показывающие, что один агентный запрос использует примерно в 15 раз больше токенов, чем простой чат-запрос, поскольку агенты многократно рассуждают, вызывают инструменты, делегируют работу субагентам и переносят расширяющийся контекст через задачу.
Сравнение Vera Rubin пока не является независимо подтвержденным результатом. NVIDIA измерила показатели с использованием нагрузки SemiAnalysis AgentX и говорит, что результаты ожидают проверки SemiAnalysis. Это делает объявление ранним показателем производительности от поставщика, а не подтвержденным отраслевым бенчмарком.
AgentX входит в состав бенчмарк-пакета InferenceX от SemiAnalysis. По данным NVIDIA Developer Blog, он воспроизводит заранее записанные сессии Claude Code через клиент AIPerf, сохраняя последовательность вызовов модели, интервалы рассуждений, использование инструментов, рост контекста и задержки вызовов инструментов, зафиксированные в исходных траекториях.
Такой дизайн пытается устранить слабое место традиционного тестирования inference. Статические тесты часто используют заранее заданные длины входа и выхода, например промпт на 8 000 токенов, за которым следует ответ на 1 000 токенов. Реальные coding-агенты создают неравномерный трафик: задача может чередовать модельное рассуждение, операции с файлами, поиск, вывод компилятора и дополнительные вызовы модели, а накопленный контекст со временем становится намного больше.
AgentX измеряет токены на мегаватт вместе с индикаторами пользовательского опыта, включая время до первого токена, end-to-end latency и интерактивность. Главный результат Vera Rubin был измерен на уровне 160 токенов в секунду на пользователя на нагрузке AgentX DeepSeek V4 Pro. Компания говорит, что Vera Rubin NVL72 достигла до 30 раз большего AI-factory throughput на мегаватт, чем GB300 NVL72, на этом рабочем режиме.
Бенчмарк также сообщает о значительном росте для текущего поколения Blackwell. NVIDIA утверждает, что GB300 NVL72 обеспечивает до 15 раз больший throughput на мегаватт, чем H200 NVL8, на DeepSeek V4 Pro 1.6T, и до 80 раз больший результат на Kimi K3 2.8T. Эти цифры также представлены через отчетность NVIDIA по результатам AgentX и должны восприниматься соответственно.
NVIDIA объясняет ожидаемый рост эффективности сочетанием масштаба аппаратной части и оптимизации программного обеспечения, а не только GPU Rubin. Дизайн NVL72 соединяет 72 GPU в scale-up domain, позволяя нагрузкам распределять экспертов модели и сохранять контекст по всей системе с помощью высокополосных межсоединений.
Это важно для длительно работающих агентов, поскольку ранее обработанный контекст часто можно переиспользовать вместо повторного вычисления. NVIDIA описывает serving-дизайн, который разделяет prefill, где система обрабатывает входящий контекст, и decode, где она генерирует вывод. Согласование скоростей между этими этапами должно предотвращать ситуацию, когда одна сторона простаивает, а другая становится узким местом.
Компания также указывает на распределенное key-value caching, KV-aware маршрутизацию запросов и выгрузку кэша в host memory или storage. Эти техники предназначены для того, чтобы важные части растущей агентной сессии оставались доступными в течение нескольких запросов. NVIDIA говорит, что NVLink шестого поколения и технология NVLink Switch обеспечивают более высокую скорость пакетов и меньшую задержку, чем обычные Ethernet-альтернативы, для этой scale-up-коммуникации.
Программный слой включает NVIDIA TensorRT-LLM, NVIDIA Dynamo и CUDA kernels, оптимизированные для Mixture-of-Experts моделей. В ориентированном на разработчиков описании также упоминаются SGLang и vLLM как serving runtimes, используемые в более широком оптимизационном стеке, а также DeepGEMM kernels и форматы пониженной точности, такие как MXFP4 и MXFP8. NVIDIA заявляет, что NVFP4-квантование на Rubin предназначено для сокращения использования памяти и увеличения throughput при сохранении качества вывода, хотя предоставленные материалы не содержат независимой оценки качества.
NVIDIA также утверждает, что ее технологии DSX MaxLPS могут управлять питанием на уровнях GPU, стойки и рабочей нагрузки, потенциально позволяя разместить до 40% больше GPU в том же мегаваттном бюджете. Это утверждение о планировании мощности от NVIDIA, а не результат, доказанный только цифрами AgentX.
Для команд, создающих coding-assistants, research-агентов или автоматизацию customer service, релевантная метрика уже не сводится к тому, насколько быстро один промпт дает ответ. Production-агент может держать активными несколько вызовов модели, сохранять большой контекст и делать паузу, пока внешние инструменты возвращают данные. Инфраструктура, которая хорошо работает на коротких, изолированных запросах, может тратить энергию впустую или терять отзывчивость в реальных рабочих процессах.
Объявление Vera Rubin подает энергоэффективность и как ограничение при развертывании, и как вопрос цены. NVIDIA говорит, что Vera Rubin NVL72 может снизить стоимость за миллион токенов до 35 раз по сравнению с GB300 NVL72 на указанной нагрузке. В своем developer blog компания отдельно сообщает, что GB300 может обеспечивать до 10 раз меньшую стоимость токена, чем H200 NVL8. Эти расчеты зависят от конфигурации бенчмарка, энергетических допущений и уровней загрузки, поэтому корпоративным покупателям придется проверять их на своих моделях и сценариях serving.
Результат может быть особенно важен для операторов, обслуживающих большие Mixture-of-Experts модели или агентов с необычно длинными сессиями. В таких средах перемещение памяти, повторное использование кэша и поведение interconnect могут быть столь же важны, как и чистая арифметика ускорителя. Однако небольшие команды могут не увидеть такую же экономику, если используют модели с коротким контекстом, низкую конкуренцию или hosted APIs, скрывающие лежащее в основе оборудование.
Есть и вопрос надежности. Более агрессивное кэширование, disaggregated serving и orchestration инструментов могут повысить utilization, но добавляют сложность планирования и управления состоянием. Разработчикам придется оценивать восстановление после сбоев, invalidation кэша, tail latency и изоляцию нагрузок, а не полагаться только на пиковые цифры tokens per second.
Первым сигналом станет review результатов Vera Rubin AgentX со стороны SemiAnalysis. Независимая публикация конфигурации теста, измерений мощности, настроек модели и целей интерактивности покажет, насколько сопоставимо утверждение о 30x между системами.
Покупателям также следует следить за результатами, включающими роль Vera CPU в tool calling. NVIDIA прямо говорит, что ранние цифры пока не отражают производительность Vera CPU для этой части workflow. Поскольку агенты проводят время вне генерации модели, end-to-end измерения могут отличаться от throughput только ускорителя.
Другие полезные последующие данные включают доступность и цены Vera Rubin NVL72, производительность на моделях помимо DeepSeek V4 Pro и результаты операторов, запускающих собственные traces вместо предварительно записанных сессий. Изменения в software stack NVIDIA также могут повлиять на сравнение, поскольку компания говорит, что производительность Rubin и GB300 будет повышаться за счет постоянной оптимизации.
Объявление NVIDIA важно не столько тем, что оно устанавливает окончательный отраслевой стандарт в 30x, сколько тем, что подчеркивает меняющееся определение производительности inference. Агентные нагрузки выявляют узкие места, которые фиксированные тесты с промптами могут не заметить: переиспользование контекста, паузы в tool calls, емкость кэша, concurrency и подачу питания.
Практический вывод для AI-разработчиков — бенчмаркать полные траектории агентов до выбора инфраструктуры. Ранние результаты NVIDIA показывают, что тесно интегрированное оборудование и serving software могут существенно изменить экономику длительно работающих агентов, но масштаб этого преимущества остается неподтвержденным, пока базовые измерения AgentX не будут независимо проверены и воспроизведены.