NVIDIAは、Vera Rubin NVL72がGB300比で1メガワットあたり最大30倍のエージェンティックAIスループットを提供でき、長文脈推論のコストを狙うと述べている。

NVIDIAは、近日投入予定のVera Rubin NVL72プラットフォームが、同社のGB300 NVL72システムと比べて1メガワットあたり最大30倍のエージェンティックAIスループットを提供できると述べており、長く、ツールを使うAIワークフローをますます実行するデータセンターにとって、効率向上の可能性を示しています。
この主張は、記録されたコーディングセッション、拡張されたコンテキスト、ツール呼び出し、サブエージェントの活動を保持するSemiAnalysis AgentXワークロードを用いたNVIDIAの初期測定に基づいています。NVIDIAは、AIエージェントが単発のチャットを超えて、複数ステップの調査、コーディング、カスタマーサービス、意思決定支援タスクを実行し始めているため、この結果は特に重要だと述べています。
数値はベンダー報告であり、まだ独立検証はされていません。NVIDIAによると、Vera Rubinの結果はSemiAnalysisのレビュー待ちであり、テストにはツール呼び出しのためのVera CPU性能は含まれていません。
NVIDIAの比較は、孤立した推論リクエストのピーク時の1秒あたりトークン数ではなく、1メガワットあたりのスループットに焦点を当てています。この違いは、モデルが蓄積されたコンテキストを繰り返し読み取り、外部ツールを呼び出し、サブタスクを委任し、結果を統合するようなエージェンティックシステムでは重要です。
NVIDIAによると、AgentXは実世界のエージェンティックなコーディングの軌跡を通じて、そうした挙動を表しています。同社は、このベンチマークにKimi K3、MiniMax M3、GLM5.3、Qwen3.5、DeepSeek V4 Proなどのモデルが含まれており、さまざまなモデルアーキテクチャとワークロードで性能を評価できると述べています。
DeepSeek V4 Proでは、GB300 NVL72がHopperアーキテクチャ比で1メガワットあたり最大15倍のスループットを提供するとNVIDIAは報告しています。そのうえでVera Rubinは、GB300 NVL72に対してさらに最大30倍までその数値を引き上げると主張されています。これらは言及されたワークロードとモデルにおける最大値であり、すべての導入で同じ改善が得られることを保証するものではありません。
NVIDIAはまた、GB300 NVL72と比べて100万トークンあたりのコストが最大35倍低いとも報告しています。同社はこの指標をAIファクトリーの経済性に結び付けており、電力容量が稼働できるGPU数を制限し、トークンコストが推論サービスの利益率に影響すると説明しています。
従来のチャット要求は、比較的短い入力と出力で済む場合があります。NVIDIAは、チャットや文書要約の典型的なシーケンスをおよそ1,000〜8,000トークンと説明しています。エージェントセッションでは、以前のステップ、ツール結果、サブエージェントの出力が後続ステージで利用可能なままであるため、入力トークンが数十万に達することがあります。
これは別のシステム課題を生みます。インフラは、大量のコンテキストを処理しながら、多数の不規則なリクエストに対して応答速度を維持しなければなりません。ワークロードは、プレフィルとして知られるコンテキスト処理と、デコードとも呼ばれる応答生成の間を行き来することもあります。両段階を同一に扱うと、一部のGPUが遊休化する一方、別のGPUがボトルネックになる可能性があります。
NVIDIAの答えは、ハードウェアとソフトウェア技術の組み合わせです。分離型サービングによりプレフィルとデコードのリソースを個別に拡張でき、レートマッチングは両段階の同期を試みます。分散KVキャッシュシステムは、以前処理したコンテキストをGPUドメイン全体で利用可能にし、KV対応ルーティングは、関連するキャッシュデータを既に保持しているハードウェアへリクエストを送ることができます。
このプラットフォームはまた、Mixture-of-Expertsモデル向けの大規模な専門家並列化、計算と通信を組み合わせるよう設計されたCUDAカーネル、モデル重みのメモリを削減するNVFP4量子化にも依存しています。NVIDIAは、第5世代Tensor CoresとTransformer Engineが推論の両主要段階を支えると述べています。
この話で最も強い性能主張は、独立したベンチマーク報告ではなく、NVIDIA自身のインフラおよび開発者ブログに由来します。同社はワークロード設計をSemiAnalysis AgentXに帰していますが、Vera Rubinの結果はまだSemiAnalysisのレビュー待ちだと述べています。そのため、これらの数値はNVIDIAの目標性能の早期 संकेतに過ぎず、業界で確定した比較ではありません。
比較にはいくつかの制限もあります。NVIDIAは最大値の改善を報告しているため、結果はモデル選択、コンテキスト長、リクエストの混在、バッチ処理、ソフトウェアバージョン、電力管理設定に左右される可能性があります。引用されたVera Rubinの測定には、実運用エージェントの重要な一部であるツール呼び出しのCPU作業が含まれていません。実際のアプリケーションでは、トークン生成よりもデータベース、API、企業システムの応答待ちに多くの時間を費やすこともあります。
NVIDIAは、DSX MaxLPS技術がGPU、ラック、ワークロードの各レベルで電力を管理し、同じメガワット予算内で最大40%多くのGPUを配備できると述べています。これも同社の主張であり、実際の価値は冷却、ラック設計、利用率、配備されたワークロードの挙動に左右されます。
このアーキテクチャの経済性は、TensorRT LLMやNVIDIA Dynamoを含むNVIDIAの広範なソフトウェアスタックと結び付いています。同社は、NVL72のスケールアップ領域と第6世代NVLink技術が、分散キャッシュと専門家並列化に必要な通信帯域幅を提供すると主張しています。これらの設計は性能向上につながる可能性がありますが、同時にNVIDIAのハードウェア、ネットワーク、ソフトウェアのエコシステムへの依存も強めます。
AIアプリケーションチームにとって、この発表は、エージェントのコストを単一のモデル応答の価格だけで評価できないことを改めて示しています。増大するコンテキストを繰り返し再利用するリサーチエージェントは、ユーザーが最終回答を1つ見るだけでも、チャットアシスタントよりはるかに多くの推論作業を生み出す可能性があります。
そのため、インフラチームは、完了タスクあたりのコスト、ワークフローあたりのエネルギー、現実的なコンテキスト増加下でのスループットといった指標を追跡する必要があります。短いプロンプトではうまく動くプラットフォームでも、エージェントがツールを呼び出し、サブエージェントを起動し、長い履歴を再訪する場合には効率的とは限りません。
企業の購入者にとって、当面の問いは単にVera RubinがGB300より速いかどうかではありません。組織に新しいプラットフォームを正当化できるだけの持続的なエージェントトラフィックがあるか、そしてアプリケーションがキャッシュ、プレフィル/デコード分離、モデル量子化といった機能を活用できるかどうかです。中程度または予測しにくいワークロードのチームは、引き続き共有クラウド推論を好むかもしれません。一方、大規模なAIサービス提供者や電力制約のあるデータセンターは、1メガワットあたりの作業を最適化する強い動機があります。
この発表はまた、ソフトウェアの可搬性という問題も提起します。NVIDIAが報告する成果は、GPU、NVLink、CUDA、TensorRT LLM、NVIDIA Dynamoの共同設計に依存しています。このスタックを使う開発者はより多くの最適化にアクセスできる一方、後にモデルやサービングワークロードを他のアクセラレータプラットフォームへ移す場合には、追加の移行作業に直面する可能性があります。
最初のシグナルは、SemiAnalysis AgentX結果の独立レビューです。これにより、テストの設定方法、どの測定が最大の改善を生んだか、モデルやコンテキスト長をまたいだVera RubinとGB300の比較が明らかになるはずです。
購入者は、実運用での提供開始時期、システム全体の電力測定、CPUベースのツールオーケストレーションを含む結果にも注目すべきです。これらの詳細は、トークン生成効率とエンドツーエンドのエージェント効率を区別する助けになります。
最後に、市場には導入事例の証拠が必要です。最も意味のある比較は、見出しのスループットだけでなく、実ワークロードにおける完了したエージェントタスク、レイテンシ、信頼性、利用率、総運用コストを測定するものになるでしょう。
NVIDIAの発表は、エージェント展開における実在のボトルネック、すなわち長いコンテキストと多段階推論が、ユーザー向けリクエスト数の見た目以上に計算需要を増幅し得る点を示しています。したがって、1メガワットあたりの作業を測定することは、従来のチャットベンチマークに頼るよりも、大規模エージェントにとって重要です。
しかし30倍という数字は、ベンダー管理の初期性能主張として扱うべきです。その重要性は、独立した再現性と、改善が実運用エージェントの厄介な部分——ツール遅延、オーケストレーション、失敗した呼び出し、不均一なトラフィック、エンドツーエンドのコスト——を乗り越えられるかどうかに左右されます。開発者にとっての実践的な教訓は、短いコンテキストのトークン率だけでインフラを選ぶ前に、今すぐ完全なワークフローをベンチマークすることです。