NVIDIA говорит, что Vera Rubin NVL72 может обеспечить до 30 раз больший агентный AI throughput на мегаватт, чем GB300, нацеливаясь на стоимость инференса с длинным контекстом.

NVIDIA заявляет, что ее будущая платформа Vera Rubin NVL72 может обеспечить до 30 раз больший агентный AI throughput на мегаватт, чем системы GB300 NVL72 компании, предлагая потенциальный выигрыш в эффективности для дата-центров, выполняющих все более длинные AI-рабочие процессы с использованием инструментов.
Это утверждение основано на ранних измерениях NVIDIA с использованием нагрузки SemiAnalysis AgentX, которая сохраняет записанные сессии кодирования, расширяя контекст, вызовы инструментов и активность субагентов. NVIDIA говорит, что результаты особенно актуальны по мере того, как AI-агенты выходят за рамки одноразового чата и начинают выполнять многошаговые задачи исследований, кодирования, клиентского обслуживания и поддержки принятия решений.
Цифры предоставлены вендором и пока не были независимо валидированы. NVIDIA сообщает, что результаты Vera Rubin ожидают проверки SemiAnalysis, а тесты не включают производительность Vera CPU для вызовов инструментов.
Сравнение NVIDIA фокусируется на throughput на мегаватт, а не на пиковых токенах в секунду от изолированного инференс-запроса. Это различие важно для агентных систем, где модель может многократно читать накопленный контекст, вызывать внешние инструменты, делегировать подзадачи и синтезировать результаты.
По словам NVIDIA, AgentX представляет такое поведение через реальные траектории агентного кодинга. Компания говорит, что бенчмарк включает модели Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 и DeepSeek V4 Pro, что позволяет оценивать производительность на разных архитектурах моделей и нагрузках.
Для DeepSeek V4 Pro NVIDIA сообщает, что GB300 NVL72 обеспечивает до 15 раз больший throughput на мегаватт, чем архитектура Hopper. Затем утверждается, что Vera Rubin повышает этот показатель еще до 30 раз относительно GB300 NVL72. Это максимальные результаты на указанной нагрузке и модели, а не гарантия того, что каждое внедрение увидит такой же прирост.
NVIDIA также сообщает о стоимости до 35 раз ниже за миллион токенов по сравнению с GB300 NVL72. Компания связывает этот показатель с экономикой AI factories, где мощность по электричеству ограничивает число работающих GPU, а стоимость токена влияет на маржу инференс-сервисов.
Обычный чат-запрос может включать относительно короткие вход и выход. NVIDIA описывает типичные последовательности для чата или суммаризации документов как находящиеся примерно в диапазоне от 1 000 до 8 000 токенов. Агентные сессии могут накапливать сотни тысяч входных токенов, поскольку предыдущие шаги, результаты инструментов и выходы субагентов остаются доступными для более поздних стадий.
Это создает другую системную проблему. Инфраструктура должна обрабатывать большие объемы контекста, сохраняя скорость ответа при множестве нерегулярных запросов. Рабочая нагрузка также может чередовать обработку контекста, известную как prefill, и генерацию ответа, или decode. Если относиться к обеим стадиям одинаково, часть GPU может простаивать, тогда как другие станут узким местом.
Ответ NVIDIA сочетает аппаратные и программные методы. Disaggregated serving позволяет масштабировать ресурсы prefill и decode отдельно, а rate matching пытается синхронизировать эти две стадии. Распределенные KV-cache системы сохраняют ранее обработанный контекст доступным по всему GPU domain, а KV-aware routing может направлять запрос на оборудование, уже хранящее релевантные кэшированные данные.
Платформа также опирается на крупномасштабный expert parallelism для mixture-of-experts моделей, CUDA kernels, предназначенные для объединения вычислений и коммуникации, а также NVFP4-квантование для снижения объема памяти, необходимой для весов модели. NVIDIA говорит, что Tensor Cores пятого поколения и ее Transformer Engine поддерживают обе основные фазы инференса.
Самые сильные заявления о производительности в этой истории исходят из собственных инфраструктурных и developer-блогов NVIDIA, а не из независимого отчета бенчмарка. Компания связывает дизайн нагрузки с SemiAnalysis AgentX, но говорит, что результаты Vera Rubin все еще ожидают проверки SemiAnalysis. Это делает цифры ранним ориентиром целевой производительности NVIDIA, а не окончательным отраслевым сравнением.
Сравнение также ограничено несколькими факторами. NVIDIA сообщает о максимальном выигрыше, поэтому результаты могут зависеть от выбора модели, длины контекста, смеси запросов, batching, версий ПО и настроек управления питанием. Указанные измерения Vera Rubin не включают работу CPU для вызовов инструментов, что является важной частью production-агентов. Реальные приложения также могут тратить значительное время на ожидание баз данных, API или корпоративных систем, а не на генерацию токенов.
NVIDIA говорит, что ее технология DSX MaxLPS может управлять энергией на уровне GPU, стойки и рабочей нагрузки и размещать до 40% больше GPU в том же мегаваттном бюджете. Это еще одно утверждение компании, и его практическая ценность будет зависеть от охлаждения, конструкции стоек, утилизации и поведения развернутых нагрузок.
Экономика архитектуры связана с более широким программным стеком NVIDIA, включая TensorRT LLM и NVIDIA Dynamo. Компания утверждает, что NVL72 scale-up domain и технологии NVLink шестого поколения обеспечивают необходимую пропускную способность для распределенного кэширования и expert parallelism. Эти решения могут улучшить производительность, но также усиливают зависимость от аппаратной, сетевой и программной экосистемы NVIDIA.
Для команд ИИ-приложений объявление подчеркивает, что стоимость агентов нельзя оценивать, измеряя только цену одного ответа модели. Исследовательский агент, который многократно повторно использует растущий контекст, может создавать гораздо больше инференс-работы, чем чат-ассистент, даже если пользователь видит только один итоговый ответ.
Поэтому инфраструктурным командам нужно отслеживать такие метрики, как стоимость на завершенную задачу, энергия на рабочий процесс и throughput при реалистичном росте контекста. Платформа, хорошо работающая на коротких промптах, может быть неэффективной, когда агенты вызывают инструменты, создают субагентов или возвращаются к длинной истории.
Для корпоративных покупателей непосредственный вопрос не только в том, быстрее ли Vera Rubin, чем GB300. Важно, есть ли у организации достаточно устойчивого агентного трафика, чтобы оправдать новую платформу, и могут ли ее приложения использовать такие функции, как caching, разделение prefill-decode и квантование модели. Команды со скромными или непредсказуемыми нагрузками по-прежнему могут предпочитать общую облачную инференс-инфраструктуру, тогда как крупные AI-провайдеры и дата-центры с ограничением по мощности имеют более сильные стимулы оптимизировать работу на мегаватт.
Это объявление также поднимает вопрос переносимости ПО. Сообщаемые NVIDIA преимущества зависят от co-design между GPU, NVLink, CUDA, TensorRT LLM и NVIDIA Dynamo. Создатели, использующие этот стек, могут получить больше оптимизаций, но могут столкнуться с дополнительной работой по миграции, если позже перенесут модели или serving-нагрузки на другие платформы ускорителей.
Первым сигналом станет независимая проверка результатов SemiAnalysis AgentX. Она должна прояснить, как были настроены тесты, какие измерения дали наибольший выигрыш и как Vera Rubin сравнивается с GB300 по моделям и длинам контекста.
Покупателям также следует следить за доступностью в продакшене, системными измерениями энергопотребления и результатами, включающими CPU-based orchestration инструментов. Эти детали помогут отличить эффективность генерации токенов от end-to-end эффективности агента.
Наконец, рынку понадобятся доказательства развертываний. Наиболее значимые сравнения будут измерять завершенные агентные задачи, задержку, надежность, утилизацию и общую стоимость эксплуатации на реальных нагрузках, а не только headline throughput.
Объявление NVIDIA указывает на реальное узкое место в развертывании агентов: длинный контекст и многошаговый инференс могут увеличивать вычислительный спрос быстрее, чем предполагает число видимых пользователю запросов. Поэтому измерение работы на мегаватт более релевантно для крупномасштабных агентов, чем опора на обычные чат-бенчмарки.
Но цифру 30x следует рассматривать как раннее, контролируемое вендором заявление о производительности. Ее значимость будет зависеть от независимого воспроизведения и от того, выдержит ли улучшение сложные части production-агентов — задержки инструментов, оркестрацию, неудачные вызовы, неравномерный трафик и полную стоимость end-to-end. Для создателей практический вывод таков: сейчас нужно бенчмаркать полные рабочие процессы, прежде чем выбирать инфраструктуру, опираясь только на краткоконтекстные токеновые показатели.