NVIDIA утверждает, что Vera Rubin NVL72 обеспечивает до 30 раз больше агентной работы на ватт

NVIDIA заявляет, что Vera Rubin NVL72 может обеспечивать до 30 раз больший агентный inference throughput на мегаватт, чем GB300, в ожидании независимой проверки бенчмарка.

AI News

NVIDIA заявляет, что ее будущая платформа Vera Rubin NVL72 способна обеспечивать до 30 раз больший agentic-AI throughput на мегаватт, чем система компании GB300 NVL72. Это утверждение основано на предварительных результатах SemiAnalysis AgentX — бенчмарка, созданного для воспроизведения сессий coding-агентов в стиле production, а не чат-ботных промптов фиксированной длины.

Этот результат важен, потому что ИИ-агенты потребляют значительно больше inference-мощности, чем обычный чат. Источники NVIDIA ссылаются на данные OpenRouter, показывающие, что один агентный запрос использует примерно в 15 раз больше токенов, чем простой чат-запрос, поскольку агенты многократно рассуждают, вызывают инструменты, делегируют работу субагентам и переносят расширяющийся контекст через задачу.

Сравнение Vera Rubin пока не является независимо подтвержденным результатом. NVIDIA измерила показатели с использованием нагрузки SemiAnalysis AgentX и говорит, что результаты ожидают проверки SemiAnalysis. Это делает объявление ранним показателем производительности от поставщика, а не подтвержденным отраслевым бенчмарком.

Бенчмарк, построенный вокруг агентных нагрузок

AgentX входит в состав бенчмарк-пакета InferenceX от SemiAnalysis. По данным NVIDIA Developer Blog, он воспроизводит заранее записанные сессии Claude Code через клиент AIPerf, сохраняя последовательность вызовов модели, интервалы рассуждений, использование инструментов, рост контекста и задержки вызовов инструментов, зафиксированные в исходных траекториях.

Такой дизайн пытается устранить слабое место традиционного тестирования inference. Статические тесты часто используют заранее заданные длины входа и выхода, например промпт на 8 000 токенов, за которым следует ответ на 1 000 токенов. Реальные coding-агенты создают неравномерный трафик: задача может чередовать модельное рассуждение, операции с файлами, поиск, вывод компилятора и дополнительные вызовы модели, а накопленный контекст со временем становится намного больше.

AgentX измеряет токены на мегаватт вместе с индикаторами пользовательского опыта, включая время до первого токена, end-to-end latency и интерактивность. Главный результат Vera Rubin был измерен на уровне 160 токенов в секунду на пользователя на нагрузке AgentX DeepSeek V4 Pro. Компания говорит, что Vera Rubin NVL72 достигла до 30 раз большего AI-factory throughput на мегаватт, чем GB300 NVL72, на этом рабочем режиме.

Бенчмарк также сообщает о значительном росте для текущего поколения Blackwell. NVIDIA утверждает, что GB300 NVL72 обеспечивает до 15 раз больший throughput на мегаватт, чем H200 NVL8, на DeepSeek V4 Pro 1.6T, и до 80 раз больший результат на Kimi K3 2.8T. Эти цифры также представлены через отчетность NVIDIA по результатам AgentX и должны восприниматься соответственно.

Инфраструктура, стоящая за заявлением

NVIDIA объясняет ожидаемый рост эффективности сочетанием масштаба аппаратной части и оптимизации программного обеспечения, а не только GPU Rubin. Дизайн NVL72 соединяет 72 GPU в scale-up domain, позволяя нагрузкам распределять экспертов модели и сохранять контекст по всей системе с помощью высокополосных межсоединений.

Это важно для длительно работающих агентов, поскольку ранее обработанный контекст часто можно переиспользовать вместо повторного вычисления. NVIDIA описывает serving-дизайн, который разделяет prefill, где система обрабатывает входящий контекст, и decode, где она генерирует вывод. Согласование скоростей между этими этапами должно предотвращать ситуацию, когда одна сторона простаивает, а другая становится узким местом.

Компания также указывает на распределенное key-value caching, KV-aware маршрутизацию запросов и выгрузку кэша в host memory или storage. Эти техники предназначены для того, чтобы важные части растущей агентной сессии оставались доступными в течение нескольких запросов. NVIDIA говорит, что NVLink шестого поколения и технология NVLink Switch обеспечивают более высокую скорость пакетов и меньшую задержку, чем обычные Ethernet-альтернативы, для этой scale-up-коммуникации.

Программный слой включает NVIDIA TensorRT-LLM, NVIDIA Dynamo и CUDA kernels, оптимизированные для Mixture-of-Experts моделей. В ориентированном на разработчиков описании также упоминаются SGLang и vLLM как serving runtimes, используемые в более широком оптимизационном стеке, а также DeepGEMM kernels и форматы пониженной точности, такие как MXFP4 и MXFP8. NVIDIA заявляет, что NVFP4-квантование на Rubin предназначено для сокращения использования памяти и увеличения throughput при сохранении качества вывода, хотя предоставленные материалы не содержат независимой оценки качества.

NVIDIA также утверждает, что ее технологии DSX MaxLPS могут управлять питанием на уровнях GPU, стойки и рабочей нагрузки, потенциально позволяя разместить до 40% больше GPU в том же мегаваттном бюджете. Это утверждение о планировании мощности от NVIDIA, а не результат, доказанный только цифрами AgentX.

Почему это важно для разработчиков и операторов ИИ

Для команд, создающих coding-assistants, research-агентов или автоматизацию customer service, релевантная метрика уже не сводится к тому, насколько быстро один промпт дает ответ. Production-агент может держать активными несколько вызовов модели, сохранять большой контекст и делать паузу, пока внешние инструменты возвращают данные. Инфраструктура, которая хорошо работает на коротких, изолированных запросах, может тратить энергию впустую или терять отзывчивость в реальных рабочих процессах.

Объявление Vera Rubin подает энергоэффективность и как ограничение при развертывании, и как вопрос цены. NVIDIA говорит, что Vera Rubin NVL72 может снизить стоимость за миллион токенов до 35 раз по сравнению с GB300 NVL72 на указанной нагрузке. В своем developer blog компания отдельно сообщает, что GB300 может обеспечивать до 10 раз меньшую стоимость токена, чем H200 NVL8. Эти расчеты зависят от конфигурации бенчмарка, энергетических допущений и уровней загрузки, поэтому корпоративным покупателям придется проверять их на своих моделях и сценариях serving.

Результат может быть особенно важен для операторов, обслуживающих большие Mixture-of-Experts модели или агентов с необычно длинными сессиями. В таких средах перемещение памяти, повторное использование кэша и поведение interconnect могут быть столь же важны, как и чистая арифметика ускорителя. Однако небольшие команды могут не увидеть такую же экономику, если используют модели с коротким контекстом, низкую конкуренцию или hosted APIs, скрывающие лежащее в основе оборудование.

Есть и вопрос надежности. Более агрессивное кэширование, disaggregated serving и orchestration инструментов могут повысить utilization, но добавляют сложность планирования и управления состоянием. Разработчикам придется оценивать восстановление после сбоев, invalidation кэша, tail latency и изоляцию нагрузок, а не полагаться только на пиковые цифры tokens per second.

Что дальше отслеживать

Первым сигналом станет review результатов Vera Rubin AgentX со стороны SemiAnalysis. Независимая публикация конфигурации теста, измерений мощности, настроек модели и целей интерактивности покажет, насколько сопоставимо утверждение о 30x между системами.

Покупателям также следует следить за результатами, включающими роль Vera CPU в tool calling. NVIDIA прямо говорит, что ранние цифры пока не отражают производительность Vera CPU для этой части workflow. Поскольку агенты проводят время вне генерации модели, end-to-end измерения могут отличаться от throughput только ускорителя.

Другие полезные последующие данные включают доступность и цены Vera Rubin NVL72, производительность на моделях помимо DeepSeek V4 Pro и результаты операторов, запускающих собственные traces вместо предварительно записанных сессий. Изменения в software stack NVIDIA также могут повлиять на сравнение, поскольку компания говорит, что производительность Rubin и GB300 будет повышаться за счет постоянной оптимизации.

Взгляд Creati.ai

Объявление NVIDIA важно не столько тем, что оно устанавливает окончательный отраслевой стандарт в 30x, сколько тем, что подчеркивает меняющееся определение производительности inference. Агентные нагрузки выявляют узкие места, которые фиксированные тесты с промптами могут не заметить: переиспользование контекста, паузы в tool calls, емкость кэша, concurrency и подачу питания.

Практический вывод для AI-разработчиков — бенчмаркать полные траектории агентов до выбора инфраструктуры. Ранние результаты NVIDIA показывают, что тесно интегрированное оборудование и serving software могут существенно изменить экономику длительно работающих агентов, но масштаб этого преимущества остается неподтвержденным, пока базовые измерения AgentX не будут независимо проверены и воспроизведены.

Реклама