NVIDIA、Vera Rubin NVL72はワット当たり最大30倍のエージェント業務を実現すると主張

NVIDIAは、Vera Rubin NVL72がGB300比でメガワット当たり最大30倍のエージェント推論スループットを提供できるとし、独立したベンチマーク審査を待っていると述べています。

AI News

NVIDIAは、近日登場予定のVera Rubin NVL72プラットフォームが、自社のGB300 NVL72システムと比べて、メガワット当たり最大30倍のエージェントAIスループットを実現できると述べています。この主張は、固定長のチャットボット向けプロンプトではなく、実運用に近いコーディングエージェントのセッションを再生するよう設計されたベンチマーク、SemiAnalysis AgentX の予備結果に基づくものです。

この結果が重要なのは、AIエージェントが通常のチャットよりもはるかに多くの推論容量を消費するためです。NVIDIAの情報源はOpenRouterのデータを引用し、単一のエージェント要求は単純なチャット要求のおよそ15倍のトークンを使用するとしています。エージェントは繰り返し推論し、ツールを呼び出し、サブエージェントに作業を委任し、タスクを通じて拡大していくコンテキストを保持するためです。

Vera Rubin の比較は、まだ独立して検証された結果ではありません。NVIDIAはSemiAnalysis AgentX のワークロードを用いて数値を測定したとし、その結果はSemiAnalysisのレビュー待ちだと述べています。したがって、この発表はベンダー報告による初期性能シグナルであり、確定した業界ベンチマークではありません。

エージェントのワークロードを中心に構築されたベンチマーク

AgentXはSemiAnalysisのInferenceXベンチマークスイートの一部です。NVIDIA Developer Blogによると、これはAIPerfクライアントを通じて録画済みのClaude Codeセッションを再生し、元の軌跡で記録されたモデル呼び出し、推論間隔、ツール使用、コンテキスト増加、ツール呼び出し遅延の順序を保持します。

この設計は、従来の推論テストの弱点に対処しようとするものです。静的テストでは、例えば8,000トークンのプロンプトに続いて1,000トークンの応答、というように、入力と出力の長さがあらかじめ決められていることがよくあります。実際のコーディングエージェントは不均一なトラフィックを生成します。タスクは、モデルの推論、ファイル操作、検索、コンパイラ出力、さらなるモデル呼び出しの間を行き来し、蓄積されたコンテキストは時間とともに大きくなります。

AgentXは、最初のトークンまでの時間、エンドツーエンド遅延、対話性といったユーザー体験指標に加えて、メガワット当たりのトークン数を測定します。NVIDIAのVera Rubinの注目結果は、AgentX DeepSeek V4 Pro ワークロードで、ユーザー1人当たり毎秒160トークンとして測定されました。同社は、Vera Rubin NVL72 がその動作点で GB300 NVL72 のメガワット当たりAIファクトリースループットの最大30倍に達したと述べています。

このベンチマークは、現在のBlackwell世代にも大きな向上があると報告しています。NVIDIAは、GB300 NVL72 が DeepSeek V4 Pro 1.6T で H200 NVL8 のメガワット当たりスループットの最大15倍を提供し、Kimi K3 2.8T では最大80倍の結果を示したと述べています。これらの数値もNVIDIAによるAgentX結果の報告として提示されており、そのように扱うべきです。

主張を支えるインフラ

NVIDIAは、見込まれる効率向上はRubin GPU単体ではなく、ハードウェア規模とソフトウェア最適化の組み合わせによるものだとしています。NVL72設計は72基のGPUをscale-upドメインで接続し、高帯域の相互接続によりワークロードがモデルの専門家を分散させつつ、システム全体でコンテキストを維持できるようにします。

これは長時間稼働するエージェントにとって重要です。というのも、以前処理したコンテキストは再計算せずに再利用できることが多いからです。NVIDIAは、入力コンテキストを処理するprefillと、出力を生成するdecodeを分離したサービング設計を説明しています。これらの段階間で処理速度を合わせることで、片方がアイドル状態になり、もう片方がボトルネックになることを防ぐ狙いがあります。

同社はさらに、分散キー・バリューキャッシュ、KV認識型リクエストルーティング、ホストメモリやストレージへのキャッシュオフロードも挙げています。これらの技術は、拡大するエージェントセッションの関連部分を複数のリクエストにわたって利用可能に保つために設計されています。NVIDIAは、第6世代NVLinkとNVLink Switch技術が、このscale-up通信において従来のEthernet代替案よりも高いパケットレートと低遅延を提供すると述べています。

ソフトウェア層には、NVIDIA TensorRT-LLM、NVIDIA Dynamo、そしてMixture-of-Expertsモデル向けに最適化されたCUDAカーネルが含まれます。開発者向けの説明では、広範な最適化スタックで使われるサービングランタイムとしてSGLangとvLLMも名指しされており、DeepGEMMカーネルやMXFP4、MXFP8のような低精度フォーマットも含まれます。NVIDIAは、Rubin上のNVFP4量子化は、出力品質を保ちながらメモリ使用量を減らしスループットを高めることを意図していると述べていますが、提示された証拠には独立した品質評価は含まれていません。

さらにNVIDIAは、DSX MaxLPS技術によりGPU、ラック、ワークロードの各レベルで電力を管理でき、同じメガワット予算内で最大40%多くのGPUを収容できる可能性があると述べています。これはNVIDIAによる容量計画上の主張であり、AgentXの数値だけで実証された結果ではありません。

AIビルダーと運用担当者が注目すべき理由

コーディングアシスタント、リサーチエージェント、顧客対応自動化を構築するチームにとって、重要な指標はもはや単に1つのプロンプトがどれだけ速く応答を返すかではありません。本番のエージェントは、複数のモデル呼び出しを同時に維持し、大きなコンテキストを保持し、外部ツールがデータを返すまで一時停止することがあります。したがって、短く孤立した要求では高性能に見えるインフラでも、実際のワークフローでは電力を浪費したり応答性を損なったりする可能性があります。

Vera Rubin の発表は、電力効率を導入制約であると同時に価格の問題として位置づけています。NVIDIAは、Vera Rubin NVL72 が該当ワークロードでGB300 NVL72に比べて100万トークン当たりのコストを最大35倍削減できると述べています。別途、同社のDeveloper Blogでは、GB300がH200 NVL8よりもトークンコストを最大10倍低くできると報告しています。これらの計算は、ベンチマーク設定、エネルギー仮定、利用率に依存するため、企業購入者は自社のモデルやサービングパターンで検証する必要があります。

この結果は、特に大規模なMixture-of-Expertsモデルや、非常に長いセッションを持つエージェントを提供する運用者にとって重要かもしれません。そのような環境では、メモリ移動、キャッシュ再利用、相互接続の挙動が、アクセラレータの純粋な演算性能と同じくらい重要になることがあります。一方で、短いコンテキストのモデル、低並列性、あるいは基盤ハードウェアを隠すホスト型APIを使う小規模チームでは、同じ経済性は得られないかもしれません。

信頼性の問題もあります。より積極的なキャッシュ、分離型サービング、ツールオーケストレーションは利用率を向上させますが、スケジューリングと状態管理の複雑さを増します。ビルダーは、ピーク時のトークン毎秒に頼るのではなく、障害回復、キャッシュ無効化、テールレイテンシ、ワークロード分離を評価する必要があります。

今後注目すべき点

最初のシグナルは、SemiAnalysisによるVera Rubin AgentX結果のレビューです。テスト構成、消費電力測定、モデル設定、対話性ターゲットが独立して公開されれば、30xの主張がシステム間でどれほど比較可能かが分かります。

購入者は、ツール呼び出しにおけるVera CPUの役割を含む結果にも注目すべきです。NVIDIAは明確に、初期の数値はそのワークフロー部分におけるVera CPUの性能をまだ反映していないと述べています。エージェントはモデル生成の外側でも時間を使うため、エンドツーエンド測定はアクセラレータ単独のスループットとは異なる可能性があります。

他にも有用な続報として、Vera Rubin NVL72の提供時期と価格、DeepSeek V4 Pro以外のモデルでの性能、録画済みセッションではなく自分たちのトレースを実行する運用者からの結果などがあります。NVIDIAのソフトウェアスタックの変更も比較に影響する可能性があり、同社はRubinとGB300の両方の性能が継続的な最適化によって向上すると述べています。

Creati.aiの視点

NVIDIAの発表が重要なのは、30xという最終的な業界標準を確立するからというより、推論性能の定義が変わりつつあることを示しているからです。エージェントのワークロードは、固定プロンプトのテストでは見落とされがちなボトルネック、つまりコンテキスト再利用、ツール呼び出しの隙間、キャッシュ容量、同時実行性、電力供給を露わにします。

AIビルダーにとっての実践的な教訓は、インフラに投資する前にエージェントの完全な軌跡をベンチマークすることです。NVIDIAの初期結果は、高度に統合されたハードウェアとサービングソフトウェアが長時間稼働するエージェントの経済性を大きく変える可能性を示していますが、その優位性の大きさは、基礎となるAgentX測定が独立してレビューされ再現されるまで未確認のままです。

広告