
NVIDIAは、まもなく登場するVera Rubin NVL72プラットフォームが、実運用のコーディングエージェントを模したワークロードを使った初期測定に基づき、GB300 NVL72システムの1メガワット当たり最大30倍のエージェントAIスループットを提供できると述べている。この主張は、次世代AIインフラの主戦場が単なるピークのトークン数/秒ではなく、電力効率であることを示している。
同社はこの結果を2本のNVIDIAブログ投稿で公表し、SemiAnalysisのAgentXベンチマークで測定した予備データだと説明した。測定結果はまだSemiAnalysisによる独立レビューを受けていないため、重要ではあるもののベンダー報告のままである。AI開発者やインフラ運用者にとってこの比較が重要なのは、複数ステップのエージェントが従来のチャット対話よりもはるかに多くのコンテキストとモデル呼び出しを消費し、計算需要と電力コストの両方を押し上げるからだ。
従来の推論ベンチマークは、しばしば固定長のプロンプトと出力を用いる。NVIDIAは、そうしたテストは、繰り返し推論し、ツールを呼び出し、サブエージェントに作業を委任し、ステップごとに拡張するコンテキストを引き継ぐエージェントを適切に表現できないと主張する。
同社はOpenRouterのデータを引用し、エージェント的なリクエストは通常のチャットリクエストの約15倍のトークンを使うと指摘する。NVIDIAが示した例では、投資調査エージェントが財務データベースを問い合わせ、提出資料やニュースを検索し、別のモデルに同業他社の比較を依頼し、バリュエーション分析を行い、最後に提案をまとめるかもしれない。各ステップは、後続ステップの入力となる情報を追加し得る。
このパターンは同時に複数の性能圧力を生む。システムは長いプロンプトを処理し、キー・バリューキャッシュを保持・再利用し、可変長の出力を扱い、ツール実行中の一時停止にも耐えなければならない。さらに、固定された合成負荷の下で総スループットを最大化するだけでなく、複数ユーザーに対して許容できる応答速度を維持する必要がある。
NVIDIAの結果はDeepSeek V4 Proや、Kimi K3、MiniMax M3、GLM5.3、Qwen3.5など他の大型モデルに焦点を当てている。ヘッドライン比較は、72 GPUのスケールアップ領域を中心に構築されたラック規模システムであるVera Rubin NVL72とGB300 NVL72の間で行われた。
NVIDIAによると、Vera Rubin NVL72はSemiAnalysis AgentXでGB300 NVL72の最大30倍のAIファクトリー・スループット/メガワットを達成した。開発者向け投稿では、この比較がAgentX DeepSeek V4 Proワークロードにおいて、1ユーザーあたり秒間160トークンでこの結果に達したと明記している。NVIDIAはまた、この結果が同じ電力予算内で、指定された対話型サービス目標を維持しながらのスループットを示しているとも述べている。
AgentXベンチマークは、SemiAnalysisのInferenceXスイートのオープンソースコンポーネントとして説明されている。これは記録済みのClaude Codeセッションを1ステップずつ再生し、コンテキストの増加、入出力長、推論間隔、ツール呼び出しの遅延を保持する。ベンチマークは同時実行数も変化させ、レイテンシや最初のトークンまでの時間といった対話性指標とともに、1メガワット当たりのスループットを報告する。
こうした詳細により、AgentXは単一の固定長リクエストテストよりも本番のエージェント提供に近いが、30倍という数値を独立検証済みの業界標準にするものではない。NVIDIAはVera Rubinの測定がまだSemiAnalysisのレビュー待ちだと述べている。同社はまた、初期データにはツール呼び出しのためのVera CPU性能が含まれておらず、これがシステム全体の結果に影響し得ると指摘している。
NVIDIAは同じワークロードから他の世代比較も報告している。GB300 NVL72はDeepSeek V4 Proに対してH200 NVL8の最大15倍の1メガワット当たりスループットを提供し、さらに大規模なKimi K3 2.8Tモデルに対しては最大80倍の1メガワット当たりスループットを提供するとしている。加えて、Vera RubinはGB300 NVL72と比べて100万トークン当たりコストを最大35分の1にできると主張している。これらはNVIDIAによる測定値であり、独立して再現されるまでは性能主張として扱うべきだ。
NVIDIAは、GPU単体ではなく、ハードウェア、ネットワーキング、サービングソフトウェアを横断した協調的な変更が性能向上を生んだと説明する。NVL72設計は72 GPUをNVIDIAのNVLinkファブリックで接続し、プラットフォームがMixture-of-Experts計算を分散し、ラック規模ドメイン全体でキャッシュされたコンテキストを共有できるようにする。
同社によれば、第6世代NVLinkとそのスイッチは、市販のEthernet代替より高いパケットレートと低レイテンシを提供する。この接続性は、大規模な専門家並列、分散キー・バリューキャッシング、そして既に関連コンテキストを持つGPUへのリクエスト振り分けを支えることを意図している。
ソフトウェア面では、NVIDIAはprefillとdecodeを別々にスケールしたプールで実行するdisaggregated servingを挙げている。NVIDIA Dynamoサービングスタックは、これらの段階を調整し、セッション情報を利用し、部分的にキャッシュの重なりに基づいてリクエストをルーティングするよう設計されている。こうした機能は、同じタスクが長いセッションの中で多数の関連モデル呼び出しを生み出し得るため、特にエージェントにとって重要である。
NVIDIAはさらに、TensorRT-LLM、vLLM、SGLangを広範なサービングエコシステムの一部として挙げ、DeepGEMMベースのカーネル、融合されたMixture-of-Experts実行、低精度フォーマットにも言及している。元資料は、プラットフォームの異なる説明の中でNVFP4とMXFP4/MXFP8技術の両方を参照している。これらの手法はメモリ使用量を減らし、演算スループットを高められるが、実際の品質や互換性のトレードオフはモデルと展開構成に依存する。
同社は別途、DSX MaxLPS電力管理技術により、同じメガワット予算内で最大40%多くのGPUを配備できるとも述べている。これもNVIDIAが報告する能力であり、AgentX比較そのものが示した結果ではない。
もし見出しの数字が独立テストを通過すれば、商業的な影響は大きい可能性がある。AIファクトリーは、電力供給、冷却能力、長時間セッションの提供コストという制約にますます直面している。1メガワット当たりのエージェント業務が増えれば、運用者は既存の電力配分でより多くの顧客に対応できるようになるか、一定の利用水準に必要なインフラを削減できるかもしれない。
影響はワークロードによって異なる。短い会話アシスタントは、ツールを繰り返し呼び出してコンテキストを蓄積するコーディング、リサーチ、カスタマーサービスのエージェントほど恩恵を受けないかもしれない。モデルアーキテクチャも重要だ。NVIDIAの最も強い比較は大規模なMixture-of-Expertsシステムに関するもので、GPU間通信とキャッシュ管理がサービング性能を左右し得る。
製品チームにとって、これらの数値は、単独のモデル呼び出しではなく、エージェント全体のワークフローを測定する必要性を強調している。評価には、ツール遅延、キャッシュ再利用、同時実行性、ユーザー向けの対話性、完了タスクあたりのコストを含めるべきだ。トークンを安く生成できても、ツール呼び出しの合間に停止するプラットフォームは、より良いアプリ体験を提供しないかもしれない。
この主張はまた、アクセラレータベンダーやクラウド事業者に対し、ワークロード別の効率データを公表するよう競争圧力を高める。状態を持つエージェントの経済性は、「秒間トークン数」だけではほとんど分からない。開発者は、ハードウェア世代を決める前に、モデル、サービングスタック、電力予算をまたいだ比較可能な測定を必要とする。
最初のシグナルは、SemiAnalysisによるAgentX測定のレビューだ。正確なシステム構成、ソフトウェア版、モデルチェックポイント、電力計測方法を含む独立確認が、30倍比較をどこまで広く解釈できるかを決める。
購入者は、CPU側でのツール実行を含む結果にも注目すべきだ。NVIDIAによれば、現在のVera Rubinデータにはそれが含まれていない。非コーディング系エージェント、異なるコンテキスト長、代替サービングフレームワークでの追加テストは、利点が記録済みのClaude Codeセッションを超えて広がるかを示すだろう。
可用性、価格、クラウドアクセスも同様に重要だ。効率性の主張は100万トークン当たりの理論コストを改善できるが、実際の顧客経済は、システム取得費、稼働率、ネットワーク、冷却、ソフトウェアライセンスにも左右される。早期導入からの証拠が、ベンチマーク上の優位性が運用者の低価格化や利益率向上につながるかを示すだろう。
NVIDIAの発表は、AIインフラ性能の捉え方が変わることを示すものとして理解するのが最も適切だ。エージェントがより長く状態を持つワークロードを生むにつれ、電力正規化されたスループットと完了タスク当たりコストは、従来の単一リクエスト速度より有用な指標になる。
30倍という数字は目を引くが、独立レビュー待ちのNVIDIA初期測定にすぎない。開発者にとっての永続的な教訓は、より狭く実用的だ。どのアクセラレータ比較も本番の結論とみなす前に、コンテキスト再利用、ツール、同時実行性、レイテンシを含むエージェント全体のループをベンチマークすることだ。
NVIDIAは、Vera Rubin NVL72がGB300比でメガワット当たり最大30倍のエージェントAIスループットを実現し、AI構築者にとって推論経済を塗り替えると述べている。