AI News

NVIDIA утверждает, что её будущая платформа Vera Rubin NVL72 способна обеспечить до 30 раз больший агентный AI-throughput на мегаватт, чем система GB300 NVL72, согласно ранним измерениям на рабочей нагрузке, созданной для имитации производственных coding-агентов. Это заявление делает энергоэффективность — а не только пик токенов в секунду — центральным полем борьбы для следующего поколения ИИ-инфраструктуры.

Компания опубликовала результаты в двух постах блога NVIDIA, описав их как предварительные данные, измеренные с использованием бенчмарка SemiAnalysis AgentX. Измерения ещё не были независимо проверены SemiAnalysis, поэтому результаты важны, но по-прежнему являются данными, предоставленными вендором. Для создателей ИИ и операторов инфраструктуры сравнение имеет значение, потому что многошаговые агенты потребляют существенно больше контекста и вызовов модели, чем обычные чат-взаимодействия, увеличивая и вычислительную нагрузку, и затраты на электроэнергию.

Почему агентные рабочие нагрузки меняют уравнение инфраструктуры

Традиционные бенчмарки инференса часто используют фиксированную длину промпта и выхода. NVIDIA утверждает, что такие тесты плохо отражают агента, который многократно рассуждает, вызывает инструменты, делегирует работу субагентам и переносит расширяющийся контекст от шага к шагу.

Компания ссылается на данные OpenRouter, согласно которым агентные запросы используют примерно в 15 раз больше токенов, чем обычные чат-запросы. В примере, приведённом NVIDIA, инвестиционно-исследовательский агент может запрашивать финансовые базы данных, искать отчёты и новости, просить другую модель сравнить компании-аналогии, проводить оценочный анализ, а затем формировать рекомендацию. Каждый шаг может добавлять информацию, которая становится входом для следующих шагов.

Такой паттерн одновременно создаёт несколько нагрузок на производительность. Системы должны обрабатывать длинные промпты, сохранять и переиспользовать key-value-кэши, работать с переменной длиной вывода и выдерживать паузы, пока выполняются инструменты. Им также нужно поддерживать приемлемую скорость ответа для нескольких пользователей, а не просто максимизировать суммарный throughput при фиксированной синтетической нагрузке.

Результаты NVIDIA сосредоточены на DeepSeek V4 Pro и других больших моделях, включая Kimi K3, MiniMax M3, GLM5.3 и Qwen3.5. Главный сравнительный показатель — между Vera Rubin NVL72 и GB300 NVL72, двумя rack-scale-системами, построенными вокруг домена масштабирования на 72 GPU.

Что измерила NVIDIA — и что остаётся непроверенным

NVIDIA сообщает, что Vera Rubin NVL72 достигла до 30 раз более высокого throughput AI-factory на мегаватт, чем GB300 NVL72, на SemiAnalysis AgentX. В публикации для разработчиков указано, что сравнение дало такой результат при 160 токенах в секунду на пользователя на рабочей нагрузке AgentX DeepSeek V4 Pro. NVIDIA также заявляет, что результат отражает throughput в рамках того же энергетического бюджета при сохранении заявленной цели интерактивного обслуживания.

Бенчмарк AgentX описывается как open-source-компонент набора InferenceX от SemiAnalysis. Он пошагово воспроизводит записанные сессии Claude Code, сохраняя рост контекста, длины входа и выхода, интервалы рассуждения и задержки вызовов инструментов. Бенчмарк также варьирует уровень concurrency и сообщает throughput на мегаватт вместе с показателями задержки и интерактивности, такими как время до первого токена.

Эти детали делают AgentX более релевантным для production-обслуживания агентов, чем одиночный тест с фиксированной длиной запроса, но они не превращают показатель 30x в независимый отраслевой стандарт. NVIDIA говорит, что измерения Vera Rubin ещё ожидают проверки SemiAnalysis. Компания также отмечает, что ранние данные не включают производительность Vera CPU для вызовов инструментов, что может повлиять на результаты всей системы.

NVIDIA также сообщает о других поколенческих сравнениях на той же рабочей нагрузке. По её словам, GB300 NVL72 обеспечивает до 15 раз больший throughput на мегаватт, чем H200 NVL8, для DeepSeek V4 Pro, и до 80 раз больший throughput на мегаватт для значительно более крупной модели Kimi K3 2.8T. Кроме того, компания утверждает, что Vera Rubin может сократить стоимость на миллион токенов до 35 раз по сравнению с GB300 NVL72. Эти цифры являются измерениями NVIDIA и должны рассматриваться как заявления о производительности до их независимого воспроизведения.

Системный дизайн, лежащий в основе заявлений об эффективности

NVIDIA объясняет выигрыш не только GPU, а согласованными изменениями в аппаратной части, сети и serving-софте. Дизайн NVL72 соединяет 72 GPU через фабрик NVLink от NVIDIA, позволяя платформе распределять вычисления mixture-of-experts и делиться кэшированным контекстом внутри rack-scale-домена.

Компания говорит, что шестое поколение NVLink и его коммутаторы обеспечивают более высокую скорость передачи пакетов и меньшую задержку, чем готовые Ethernet-альтернативы. Эта связность предназначена для поддержки крупномасштабного expert parallelism, распределённого key-value-кэширования и маршрутизации запросов к GPU, уже содержащим релевантный контекст.

На программном уровне NVIDIA указывает на disaggregated serving, при котором prefill и decode работают в отдельно масштабируемых пулах. Её стек NVIDIA Dynamo предназначен для координации этих стадий, использования информации о сессии и частичной маршрутизации запросов на основе перекрытия кэша. Такие функции особенно важны для агентов, потому что одна и та же задача может порождать множество связанных вызовов модели в течение длительной сессии.

NVIDIA также называет TensorRT-LLM, vLLM и SGLang частью более широкой serving-экосистемы, а также ядра на базе DeepGEMM, fused mixture-of-experts execution и форматы с более низкой точностью. В исходном материале в разных описаниях платформы упоминаются как NVFP4, так и техники MXFP4/MXFP8. Эти методы могут снижать использование памяти и повышать арифметический throughput, хотя практические компромиссы в качестве и совместимости зависят от модели и конфигурации развертывания.

Компания отдельно заявляет, что её технология управления питанием DSX MaxLPS может обеспечить до 40% больше GPU в рамках того же мегаваттного бюджета. Это ещё одна заявленная NVIDIA возможность, а не результат, установленный самим сравнением AgentX.

Что означает результат для операторов ИИ

Если заголовочные цифры выдержат независимое тестирование, коммерческий эффект может быть значительным. AI-factory всё чаще сталкиваются с ограничениями по доступности электричества, мощности охлаждения и стоимости обслуживания длительных сессий. Больше агентной работы на мегаватт может позволить оператору обслуживать больше клиентов в рамках существующей энергетической квоты или сократить инфраструктуру, необходимую для фиксированного уровня использования.

Влияние будет зависеть от рабочей нагрузки. Короткий разговорный ассистент может не выиграть так сильно, как coding-, research- или customer-service-агент, который многократно вызывает инструменты и накапливает контекст. Важна и архитектура модели: самые сильные сравнения NVIDIA относятся к большим системам mixture-of-experts, где меж-GPU-коммуникации и управление кэшем могут определять производительность serving.

Для продуктовых команд эти цифры подчёркивают необходимость измерять полный агентный workflow, а не отдельные вызовы модели. Оценка должна включать задержку инструментов, повторное использование кэша, concurrency, пользовательскую интерактивность и стоимость за завершённую задачу. Платформа, которая дешево генерирует токены, но зависает между вызовами инструментов, может не дать лучшего пользовательского опыта.

Эти заявления также усиливают конкурентное давление на производителей ускорителей и облачных провайдеров, чтобы они публиковали данные об эффективности по конкретным рабочим нагрузкам. Одних «токенов в секунду» недостаточно, чтобы понять экономику stateful-агента. Создателям нужны сопоставимые измерения по моделям, serving-стекам и энергетическим бюджетам, прежде чем делать ставку на поколение железа.

На что смотреть дальше

Первым сигналом будет проверка AgentX-измерений SemiAnalysis. Независимое подтверждение, включая точные конфигурации системы, версии ПО, checkpoints модели и методологию учёта энергии, определит, насколько широко можно интерпретировать сравнение 30x.

Покупателям также стоит следить за результатами, включающими выполнение инструментов на CPU-стороне, поскольку NVIDIA говорит, что текущие данные Vera Rubin этого не содержат. Дополнительные тесты на не-кодинговых агентах, с разной длиной контекста и альтернативными serving-фреймворками, покажут, распространяется ли преимущество за пределы записанных сессий Claude Code.

Доступность, цена и облачный доступ будут столь же важны. Заявление об эффективности может снизить теоретическую стоимость на миллион токенов, но реальная экономика для клиентов также будет зависеть от стоимости системы, загрузки, сети, охлаждения и лицензирования ПО. Данные ранних внедрений покажут, превратится ли преимущество бенчмарка в более низкие цены или более высокую маржу для операторов.

Взгляд Creati.ai

Объявление NVIDIA лучше всего понимать как сдвиг в том, как измеряется производительность ИИ-инфраструктуры. По мере того как агенты создают более длинные и stateful-рабочие нагрузки, throughput, нормированный на мощность, и стоимость за завершённую задачу становятся более полезными метриками, чем традиционная скорость одного запроса.

Показатель 30x привлекает внимание, но это всё ещё раннее измерение NVIDIA, ожидающее независимой проверки. Долговременный урок для разработчиков более узкий и прикладной: измеряйте весь агентный цикл, включая повторное использование контекста, инструменты, concurrency и задержку, прежде чем считать любое сравнение ускорителей окончательным выводом для продакшена.

Рекомендуемые

NVIDIA заявляет, что Vera Rubin NVL72 обеспечивает в 30 раз больше агентной работы на ватт, чем GB300

NVIDIA утверждает, что Vera Rubin NVL72 обеспечивает до 30 раз больший агентный throughput на мегаватт, чем GB300, меняя экономику инференса для создателей ИИ.