NVIDIA 表示,Vera Rubin NVL72 每兆瓦可提供高達 GB300 30 倍的代理式 AI 吞吐量,目標是長上下文推論成本。

NVIDIA 表示,其即將推出的 Vera Rubin NVL72 平台,每兆瓦可提供高達公司 GB300 NVL72 系統 30 倍的代理式 AI 吞吐量,為執行越來越長、需要工具的 AI 工作流程的資料中心提供潛在的效率提升。
這項主張來自 NVIDIA 早期使用 SemiAnalysis AgentX 工作負載所做的測量;該工作負載會保留已記錄的程式設計 جلس,並擴充上下文、工具呼叫與子代理活動。NVIDIA 表示,隨著 AI 代理從單輪聊天邁向多步驟的研究、程式設計、客服與決策支援任務,這些結果尤其具有相關性。
這些數據為供應商報告,尚未經獨立驗證。NVIDIA 表示,Vera Rubin 的結果仍待 SemiAnalysis 審查,而且測試不包含 Vera CPU 在工具呼叫上的效能。
NVIDIA 的比較重點在於每兆瓦吞吐量,而不是單一推論請求的峰值每秒 token 數。這個差異對代理式系統很重要,因為模型可能反覆讀取累積的上下文、呼叫外部工具、委派子任務並綜合結果。
根據 NVIDIA,AgentX 透過真實世界的代理式程式設計軌跡來呈現這些行為。該公司表示,這個基準包含 Kimi K3、MiniMax M3、GLM5.3、Qwen3.5 和 DeepSeek V4 Pro 等模型,因此可在不同模型架構與工作負載之間評估效能。
在 DeepSeek V4 Pro 上,NVIDIA 報告 GB300 NVL72 相較其 Hopper 架構,每兆瓦可提供高達 15 倍的吞吐量。接著,Vera Rubin 被宣稱可在 GB300 NVL72 的基礎上再提升高達 30 倍。這些都是在所引用工作負載與模型下的最高結果,並不保證每個部署都會看到相同的改善。
NVIDIA 也報告,相較於 GB300 NVL72,每百萬 token 的成本最多可低 35 倍。該公司將這項指標連結到 AI 工廠的經濟性:電力容量限制了可運作的 GPU 數量,而 token 成本則影響推論服務的利潤率。
傳統聊天請求可能只涉及相對短的輸入與輸出。NVIDIA 將聊天或文件摘要的典型序列描述為大約 1,000 到 8,000 個 token。代理會話則可能累積數十萬個輸入 token,因為先前步驟、工具結果與子代理輸出會持續供後續階段使用。
這會造成不同的系統問題。基礎設施必須在維持許多不規則請求的回應速度下,處理大量上下文。工作負載也可能在上下文處理(稱為 prefill)與回應生成(或 decode)之間交替。若將兩個階段視為相同,部分 GPU 可能閒置,而其他 GPU 則成為瓶頸。
NVIDIA 的解法結合了硬體與軟體技術。分離式服務(disaggregated serving)可讓 prefill 與 decode 資源分別擴展,而 rate matching 則嘗試讓兩個階段同步。分散式 KV 快取系統讓已處理過的上下文能跨 GPU domain 保持可用,而具 KV 意識的路由則可將請求送往已持有相關快取資料的硬體。
該平台也依賴大規模專家平行化來支援 mixture-of-experts 模型、設計用於結合運算與通訊的 CUDA kernels,以及 NVFP4 量化來降低模型權重所需的記憶體。NVIDIA 表示,第五代 Tensor Cores 與其 Transformer Engine 支援推論的兩個主要階段。
本篇中最強的效能主張來自 NVIDIA 自身的基礎設施與開發者部落格,而非獨立的基準報告。公司將工作負載設計歸因於 SemiAnalysis AgentX,但表示 Vera Rubin 的結果仍在等待 SemiAnalysis 審查。這使得這些數據只能算是 NVIDIA 目標效能的早期 संकेत,而不是已定論的產業比較。
這項比較也有多項限制。NVIDIA 報告的是最大收益,因此結果可能取決於模型選擇、上下文長度、請求組合、批次處理、軟體版本與電源管理設定。所引用的 Vera Rubin 測量不包含工具呼叫所需的 CPU 工作,這是生產型代理的重要部分。實際應用也可能花大量時間等待資料庫、API 或企業系統,而不是產生 token。
NVIDIA 表示,其 DSX MaxLPS 技術可在 GPU、機架與工作負載層級管理電力,並在相同兆瓦預算內部署高達 40% 更多的 GPU。這同樣是公司的主張,其實際價值取決於散熱、機架設計、利用率與部署後工作負載的行為。
該架構的經濟性與 NVIDIA 更廣泛的軟體堆疊相關,包括 TensorRT LLM 與 NVIDIA Dynamo。公司認為,NVL72 scale-up domain 與第六代 NVLink 技術提供分散式快取與專家平行化所需的通訊頻寬。這些設計選擇可能改善效能,但也進一步加深對 NVIDIA 硬體、網路與軟體生態系的依賴。
對 AI 應用團隊而言,這項公告強調代理成本不能只靠衡量單次模型回應的價格來評估。一個會反覆重用不斷增長上下文的研究代理,可能產生遠多於聊天助理的推論工作,即使使用者只看到一個最終答案。
因此,基礎設施團隊需要追蹤完成任務成本、每個工作流程的能源消耗,以及在真實上下文成長下的吞吐量等指標。即使某平台在短提示下表現良好,當代理呼叫工具、產生子代理或回溯長歷史時,也未必有效率。
對企業採購者來說,立即的問題不只是 Vera Rubin 是否比 GB300 更快,而是組織是否擁有足夠持續的代理流量來證明新平台的合理性,以及其應用是否能利用快取、prefill-decode 分離與模型量化等功能。負載中等或不可預測的團隊,可能仍偏好共享雲端推論;而大型 AI 服務供應商與受電力限制的資料中心,則更有動機去最佳化每兆瓦工作量。
這項公告也帶來軟體可攜性問題。NVIDIA 所宣稱的收益仰賴 GPU、NVLink、CUDA、TensorRT LLM 與 NVIDIA Dynamo 的共同設計。使用這套堆疊的開發者可能獲得更多最佳化,但若日後將模型或服務工作負載移往其他加速器平台,可能面臨額外的遷移工作。
第一個訊號將是 SemiAnalysis AgentX 結果的獨立審查。這應能釐清測試如何設定、哪些測量產生最高收益,以及 Vera Rubin 與 GB300 在不同模型與上下文長度上的比較。
採購者也應關注正式上線可用性、系統層級的電力測量,以及包含 CPU 基礎工具協調的結果。這些細節有助於區分 token 生成效率與端到端代理效率。
最後,市場還需要實際部署證據。最有意義的比較,應衡量完成的代理任務、延遲、可靠性、利用率與整體營運成本,而不只是標題式的吞吐量。
NVIDIA 的公告指出了代理部署中的一個真實瓶頸:長上下文、多步驟推論可能比使用者看到的請求數量更快放大運算需求。因此,對大規模代理而言,按每兆瓦衡量工作量,比依賴傳統聊天基準更有意義。
但 30 倍這個數字應被視為供應商控制下的早期效能主張。其重要性將取決於獨立重現,以及這項提升是否能經得起生產代理的複雜部分——工具延遲、協調、失敗呼叫、流量不均與端到端成本。對開發者而言,實務上的教訓是:在只根據短上下文 token 速率選擇基礎設施之前,現在就應先對完整工作流程做基準測試。