NVIDIA 表示,Vera Rubin NVL72 每兆瓦可提供的代理式 AI 吞吐量最高可達 GB300 的 30 倍,正在重塑推理經濟。

NVIDIA 表示,即將推出的 Vera Rubin NVL72 平台,每兆瓦可提供的代理式 AI 吞吐量最高可達其前代 GB300 NVL72 的 30 倍。這項說法來自 SemiAnalysis AgentX 的早期結果;這是一個設計來重現生產環境風格的程式編碼代理工作階段,而非固定長度聊天機器人提示詞的基準測試。
這個結果之所以重要,是因為 AI 代理產生的推理流量遠比傳統聊天更多。NVIDIA 引述 OpenRouter 的資料指出,一次代理式請求消耗的 token 約為單純聊天互動的 15 倍。代理會反覆推理、呼叫工具、將任務委派給子代理,並在每個步驟中帶著不斷擴張的上下文前進,對算力與電力預算都造成壓力。
NVIDIA 的結果屬於供應商回報,仍待 SemiAnalysis 審查。因此,這些數據反映的是公司對 Rubin 的效能目標,而非經過獨立確認的業界排名。不過,這個基準測試的選擇,仍指向一個更大的變化:當多步驟工作負載進入生產環境時,基礎設施供應商可能需要以不同方式衡量 AI 系統。
AgentX 工作負載是 SemiAnalysis 的 InferenceX 基準套件的一部分,它會重播已記錄的 Claude Code 工作階段,讓模型推理與工具使用交錯進行。根據 NVIDIA Developer Blog 的資料,它保留了原始序列長度、上下文成長、推理間隔與工具呼叫延遲。
這種設計不同於以固定輸入與輸出大小為基礎的傳統推理測試。在代理工作階段中,隨著系統累積研究內容、程式碼、工具結果與委派工作,提示詞可能從數千個 token 擴張到數十萬個 token。先前處理過的上下文也可透過 key-value 快取重複使用,而工具執行會在模型呼叫之間產生空檔。
AgentX 會變動並行度,並以互動性指標評估吞吐量,例如首個 token 的時間、端到端延遲,以及每位使用者每秒 token 數。NVIDIA 表示,Rubin 的重點結果是在 AgentX DeepSeek V4 Pro 工作負載上,以每位使用者每秒 160 個 token 測得。在該運作點上,公司稱其每兆瓦吞吐量最高可達 GB300 NVL72 的 30 倍。
這個比較並不是針對所有模型或部署情境的普遍結論。所引用的結果與特定的平台配置、工作負載與互動性目標有關。NVIDIA 也表示,這項測量目前尚未納入用於工具呼叫的 Vera CPU 效能,因此部分端到端代理系統仍未包含在報告數字中。
NVIDIA 將這項成果歸因於硬體、網路與軟體的組合,而不僅僅是 Rubin GPU 本身。NVL72 設計建立了一個大型 scale-up 領域,讓 GPU 透過第六代 NVLink 與 NVLink Switch 系統共享高頻寬、低延遲通訊。
這種拓撲支援針對長上下文與 mixture-of-experts 工作負載的技術。NVIDIA 強調分散式 KV 快取,可讓先前處理過的上下文在多個 GPU 之間保持可用;還有 KV-aware routing,能把請求導向已持有相關快取資料的硬體。Disaggregated serving 則將處理上下文的 prefill 與產生回應的 decode 分開,使每個階段都能獨立擴展。
軟體層包含 NVIDIA TensorRT-LLM、NVIDIA Dynamo,以及旨在結合運算與 GPU 間通訊的 CUDA kernels。公司也指出 NVFP4 量化,以及更新版 Tensor Cores 和 Transformer Engine 的能力,作為降低記憶體使用量並提高 token 吞吐量的方法。
NVIDIA 的 DSX MaxLPS 電源管理技術也被視為另一個槓桿。公司表示,透過在 GPU、機櫃與工作負載層級管理電力,可在相同的兆瓦預算內部署最多 40% 更多 GPU。NVIDIA 另稱,Rubin 在所引用的工作負載上,與 GB300 NVL72 相比,每百萬 token 成本最高可降低 35 倍。
相同的 AgentX 資料也呈現出 NVIDIA 世代提升的較漸進圖像。NVIDIA 報告指出,GB300 NVL72 在 DeepSeek V4 Pro 1.6T 上,每兆瓦吞吐量最高可達 H200 NVL8 的 15 倍,而在更大的 Kimi K3 2.8T 模型上則最高可達 80 倍。公司也聲稱,在所引用的比較中,GB300 的每百萬 token 成本可比 H200 低 10 倍。
這些數字同樣是 NVIDIA 使用 SemiAnalysis 工作負載所提出。底層基準的目的,是透過重播相同流量讓比較更貼近真實,但 Rubin 的測量尚未接受 NVIDIA 貼文中提到的獨立審查。因此,讀者應該區分基準方法與由此報告出的效能數字。
這些說法也不代表每一種代理工作負載都會看到 30 倍的提升。結果會因模型架構、上下文長度、快取重用、並行度、工具延遲、量化設定以及所需回應速度而異。一個經常等待編譯器或外部 API 的程式編碼代理,可能受到軟體與協調開銷的限制,而不是原始加速器吞吐量。
對 AI 基礎設施營運商而言,每瓦效能正逐漸成為容量與單位經濟的重要指標,而不只是環境面向的衡量。若這些報告中的提升經獨立測試後仍成立,資料中心營運商就能在固定電力配額內服務更多並行代理工作階段,或用更少加速器與更低營運成本提供相同容量。
這可能會影響企業如何為程式編碼助理、研究代理、客服系統與內部自動化設計 AI 工廠。團隊可能需要優化整個工作流程:上下文快取、prefill 與 decode 排程、模型路由、工具呼叫延遲,以及子代理流量處理。若只選擇更快的 GPU,卻不改變周邊系統,這些宣稱的效益可能有相當部分無法實現。
這些結果也提高了基礎設施供應商的競爭門檻。固定的 8K 輸入與 1K 輸出測試仍對受控比較有用,但對有狀態的代理流量可能說明有限。評估 AI 平台的買家,應詢問其基準測試是否保留上下文成長、工具暫停、快取重用與符合實際情境的使用者體驗目標。
對模型開發者而言,強調長上下文服務與 mixture-of-experts 執行,可能讓「理解基礎設施」的設計更重要。量化與快取能降低成本,但也會帶來品質、記憶體管理與營運上的取捨,這些都必須在真實代理工作流程中測試,而不能只從單一吞吐量數字推論。
最直接的訊號,是 SemiAnalysis 對 Vera Rubin NVL72 AgentX 結果的審查。若能獨立公開測試設定、電力計算、模型參數與互動性測量,將有助於判斷 30 倍數字的可重現程度。
其他模型的基準結果也很重要。NVIDIA 特別提到 DeepSeek V4 Pro 與 Kimi K3,但代理工作負載在上下文成長、專家路由與工具使用方面差異很大。若在其他程式編碼、研究與企業模型上也有結果,將可顯示 Rubin 的優勢是廣泛存在,還是集中於特定服務模式。
部署證據也將是另一項考驗。NVIDIA 的說法指的是預覽測量,而非已披露的客戶生產結果。買家應尋找經驗證的每百萬 token 成本、在快取壓力下仍能維持的效能,以及包含工具呼叫與 CPU 端協調的完整端到端延遲。
NVIDIA 的發表最重要之處,在於它將基礎設施競賽重新聚焦到「每單位電力能做多少有用的代理工作」。標題中的 30 倍說法目前還不是獨立證據,但 AgentX 方法論確實回應了舊有推理基準的一個真實弱點:它們往往只模擬單一請求,而不是 AI 代理所產生的、會不斷擴張且中斷的工作流程。
對建構者與企業買家來說,實際啟示是:應該評估整個 serving 系統,而不只是加速器規格。Rubin 被報告的優勢,只有在快取、排程、模型執行與工具協調能把它轉化為更低延遲或更低 token 成本時才有意義。在基準審查與更廣泛部署出現之前,NVIDIA 的數字應被視為重要的供應商主張,也是 AI 基礎設施競爭走向的訊號。