NVIDIAは、Vera Rubin NVL72がGB300よりメガワットあたり最大30倍のエージェントAIスループットを実現でき、推論経済を変えると述べています。

NVIDIAは、次期プラットフォーム Vera Rubin NVL72 が、前世代の GB300 NVL72 と比べてメガワットあたり最大30倍のエージェントAIスループットを実現できると述べています。この主張は、固定長のチャットボット向けプロンプトではなく、実運用に近いコーディングエージェントのセッションを再現するよう設計されたベンチマーク SemiAnalysis AgentX の初期結果に基づいています。
この結果が重要なのは、AIエージェントが従来のチャットよりはるかに多くの推論トラフィックを生み出すからです。NVIDIAは OpenRouter のデータを引用し、エージェント型のリクエストは単純なチャット対話の約15倍のトークンを消費するとしています。エージェントは繰り返し推論し、ツールを呼び出し、サブエージェントにタスクを委任し、各ステップで拡大するコンテキストを引き継ぐため、計算能力と電力予算の両方に圧力がかかります。
NVIDIA の結果はベンダー発表であり、SemiAnalysis によるレビューはまだ保留中です。そのため、これらは Rubin に対する同社の性能目標を示すものであり、独立に確認された業界ランキングではありません。それでも、このベンチマークの選択は、マルチステップのワークロードが本番環境に入る中で、インフラ提供者がAIシステムをどのように測定すべきかという、より広い変化を示しています。
SemiAnalysis の InferenceX ベンチマーク群の一部である AgentX ワークロードは、記録された Claude Code のセッションを、モデルの推論とツール利用が交互に現れる形で再生します。NVIDIA Developer Blog の資料によれば、元のシーケンス長、コンテキストの増加、推論間隔、ツール呼び出しの遅延が保持されます。
この設計は、固定された入力・出力サイズを前提にした従来の推論テストとは異なります。エージェントのセッションでは、システムが調査結果、コード、ツール結果、委任された作業を蓄積するにつれて、プロンプトは数千トークンから数十万トークンへと拡大し得ます。以前に処理されたコンテキストはキー・バリュー・キャッシュを通じて再利用されることもあり、ツール実行はモデル呼び出しの間に空白を生みます。
AgentX は並列度を変化させ、最初のトークンまでの時間、エンドツーエンドのレイテンシ、ユーザーあたりの毎秒トークン数といったインタラクティビティ指標に対してスループットを評価します。NVIDIA によると、Rubin の注目結果は AgentX DeepSeek V4 Pro ワークロードでユーザーあたり毎秒160トークンで測定されました。この動作点では、GB300 NVL72 と比べてメガワットあたり最大30倍のスループットが報告されています。
この比較は、あらゆるモデルや導入形態に対する一般的な主張ではありません。引用された結果は、特定のプラットフォーム構成、ワークロード、インタラクティブ性の目標に結びついています。NVIDIA はまた、この測定にはツール呼び出し用の Vera CPU の性能がまだ含まれていないとも述べており、エンドツーエンドのエージェントシステムの一部が報告値の外に残っています。
NVIDIA は、この結果を Rubin GPU 単体ではなく、ハードウェア、ネットワーキング、ソフトウェアの組み合わせによるものだとしています。NVL72 設計は、6世代目の NVLink および NVLink Switch システムを介して GPU が高帯域・低遅延の通信を共有する大規模スケールアップ領域を作り出します。
このトポロジーは、長文脈および mixture-of-experts のワークロード向け技術を支えます。NVIDIA は、以前処理されたコンテキストを GPU 間で利用可能に保つ分散 KV キャッシュと、関連するキャッシュデータを既に保持しているハードウェアへリクエストを誘導できる KV-aware routing を強調しています。分離型サービングは、コンテキストを処理する prefill と、応答を生成する decode を分け、それぞれを独立してスケール可能にします。
ソフトウェア層には、NVIDIA TensorRT-LLM、NVIDIA Dynamo、そして GPU 間通信と計算を組み合わせるよう設計された CUDA カーネルが含まれます。同社はさらに、NVFP4 量子化や、より新しい Tensor Cores と Transformer Engine の機能を、メモリ使用量を減らしトークンスループットを高める手段として挙げています。
NVIDIA の DSX MaxLPS 電力管理技術も、別のレバーとして提示されています。同社は、GPU、ラック、ワークロードの各レベルで電力を管理することで、同じメガワット予算内で最大40%多くの GPU を搭載できると述べています。NVIDIA は別途、Rubin が今回のワークロードで GB300 NVL72 に対し、100万トークンあたりのコストを最大35倍削減できるとも主張しています。
同じ AgentX データは、NVIDIA の世代的な改善をより段階的に示しています。NVIDIA は、GB300 NVL72 が DeepSeek V4 Pro 1.6T に対して H200 NVL8 のメガワットあたりスループットの最大15倍を提供し、より大きい Kimi K3 2.8T モデルでは最大80倍に達すると報告しています。また、GB300 は引用された比較において、H200 より100万トークンあたりのコストを最大10倍低くできるとも主張しています。
これらの数値も、NVIDIA は SemiAnalysis のワークロードを用いて提示しています。基礎となるベンチマークは、同一トラフィックを再生することで比較をより現実的にすることを意図していますが、Rubin の測定は、NVIDIA の投稿で言及された独立レビューをまだ受けていません。したがって、読者はベンチマーク手法と、それに基づいて報告された性能数値を区別すべきです。
また、これらの主張は、すべてのエージェントワークロードが30倍向上することを示すものでもありません。結果は、モデルアーキテクチャ、コンテキスト長、キャッシュ再利用、並列度、ツールの遅延、量子化設定、必要な応答速度によって変動し得ます。コンパイラや外部 API を頻繁に待つコーディングエージェントは、純粋なアクセラレータのスループットよりも、ソフトウェアやオーケストレーションのオーバーヘッドに制約される可能性があります。
AIインフラ運用者にとって、ワットあたり性能は、単なる環境指標ではなく、容量とユニットエコノミクスの指標になりつつあります。報告された改善が独立テストで裏付けられれば、データセンター運用者は固定された電力割り当ての中でより多くの同時エージェントセッションを処理でき、あるいはより少ないアクセラレータと低い運用コストで同じ容量を提供できるでしょう。
それは、企業がコーディング支援、調査エージェント、カスタマーサービスシステム、社内自動化のためのAIファクトリーをどのように設計するかに影響する可能性があります。チームは、コンテキストキャッシュ、prefill と decode のスケジューリング、モデルルーティング、ツール呼び出しの遅延、サブエージェントトラフィックの処理まで、全体のワークフローを最適化する必要があるかもしれません。こうした周辺システムを変更せずにより高速なGPUを選んでも、主張される利点のかなりの部分は実現されない可能性があります。
この結果は、インフラベンダーに対する競争基準も引き上げます。固定された 8K 入力・1K 出力のテストは、制御された比較には有用ですが、状態を持つエージェントトラフィックについてはあまり多くを語らないかもしれません。AIプラットフォームを評価する購入者は、そのベンチマークがコンテキストの増加、ツールによる中断、キャッシュ再利用、現実的なユーザー体験目標を保持しているかを確認すべきです。
モデル開発者にとっては、長文脈サービングと mixture-of-experts 実行への注目により、インフラを意識した設計の重要性が増すかもしれません。量子化とキャッシュはコストを下げられますが、一方で品質、メモリ管理、運用面のトレードオフも生みます。これらは単一のスループット数値から推測するのではなく、実際のエージェントワークフローでテストする必要があります。
最も即時のシグナルは、SemiAnalysis による Vera Rubin NVL72 AgentX 結果のレビューです。テスト構成、電力計上、モデル設定、インタラクティビティ測定が独立に公開されれば、30x の数字がどれほど再現可能かを判断する助けになります。
追加モデルにわたるベンチマーク結果も重要です。NVIDIA は DeepSeek V4 Pro と Kimi K3 を目立たせていますが、エージェントのワークロードはコンテキストの増加、エキスパートのルーティング、ツール利用の点で大きく異なります。ほかのコーディング、調査、企業向けモデルでの結果は、Rubin の優位性が広範なのか、特定のサービングパターンに集中しているのかを示すかもしれません。
導入の証拠もまた別の試金石になります。NVIDIA の主張は、公開された顧客の本番結果ではなく、プレビュー測定に関するものです。購入者は、100万トークンあたりの検証済みコスト、キャッシュ圧力下での持続性能、ツール呼び出しとCPU側オーケストレーションを含む完全なエンドツーエンドのレイテンシを確認すべきです。
NVIDIA の発表が最も重要なのは、インフラ競争の焦点を、電力単位あたりの有用なエージェント作業へと再定義している点です。見出しの30x主張はまだ独立証拠ではありませんが、AgentX の方法論は古い推論ベンチマークの実際の弱点に対応しています。従来のベンチマークは、AIエージェントが生み出す、拡大し中断されるワークフローではなく、単一のリクエストをモデル化しがちだからです。
ビルダーや企業の購入者にとっての実務的な教訓は、アクセラレータの仕様だけでなく、サービングシステム全体を評価することです。Rubin の報告された優位性が意味を持つのは、キャッシュ、スケジューリング、モデル実行、ツールオーケストレーションがそれを本番で低レイテンシまたは低トークンコストに変換できる場合に限られます。ベンチマークレビューとより広範な導入が到来するまでは、NVIDIA の数値は重要なベンダー主張として、また AI インフラ競争が向かう方向のシグナルとして扱うべきです。