
NVIDIA 表示,其即將推出的 Vera Rubin NVL72 平台,根據使用一種旨在模擬生產環境編碼代理的工作負載所做的初步測量,每兆瓦可提供高達其 GB300 NVL72 系統 30 倍的代理式 AI 吞吐量。這項說法把電力效率——而不只是每秒最高 token 數——推到了下一代 AI 基礎設施競賽的核心位置。
該公司在兩篇 NVIDIA 部落格文章中公布了結果,並將其描述為使用 SemiAnalysis AgentX 基準測得的預覽資料。這些測量尚未經 SemiAnalysis 獨立審查,因此結果雖然重要,但仍屬於供應商報告。對 AI 建構者與基礎設施營運商而言,這項比較很重要,因為多步驟代理所消耗的上下文與模型呼叫遠高於一般聊天互動,進而同時提高運算需求與電力成本。
傳統推論基準通常使用固定的提示與輸出長度。NVIDIA 認為,這類測試無法真實反映一個會反覆推理、呼叫工具、把工作委派給子代理,並在每一步之間持續擴展上下文的代理。
該公司引用 OpenRouter 數據指出,代理式請求使用的 token 數量大約是一般聊天請求的 15 倍。NVIDIA 提供的範例中,一個投資研究代理可能會查詢財務資料庫、搜尋申報文件與新聞、要求另一個模型比較同業、執行估值分析,然後整理出建議。每一步都可能加入後續步驟的輸入資訊。
這種模式同時帶來多重效能壓力。系統必須處理長提示、保留並重用 key-value 快取、應對可變長度輸出,並在工具執行時容忍暫停。它們也必須對多個使用者維持可接受的回應速度,而不只是單純在固定的合成工作負載下最大化總吞吐量。
NVIDIA 的結果聚焦於 DeepSeek V4 Pro 與其他大型模型,包括 Kimi K3、MiniMax M3、GLM5.3 和 Qwen3.5。頭條比較是在 Vera Rubin NVL72 與 GB300 NVL72 之間進行,這兩者都是圍繞 72 GPU 擴充域所建構的機架級系統。
NVIDIA 表示,Vera Rubin NVL72 在 SemiAnalysis AgentX 上的每兆瓦 AI 工廠吞吐量最高可達 GB300 NVL72 的 30 倍。面向開發者的文章指出,在 AgentX DeepSeek V4 Pro 工作負載上,該比較於每位使用者每秒 160 個 token 時達到此結果。NVIDIA 也表示,這個結果代表在相同電力預算下的吞吐量,同時維持所宣稱的互動式服務目標。
AgentX 基準被描述為 SemiAnalysis InferenceX 套件中的開源元件。它會逐步重放已記錄的 Claude Code 會話,保留上下文增長、輸入與輸出長度、推理間隔以及工具呼叫延遲。該基準還會變動並發數,並同時報告每兆瓦吞吐量、延遲與互動性指標,例如首 token 時間。
這些細節使 AgentX 比單一固定長度請求測試更貼近生產環境中的代理服務,但它們並未使 30 倍的數字成為經過獨立驗證的業界標準。NVIDIA 表示,Vera Rubin 的測量仍待 SemiAnalysis 審查。該公司也指出,早期資料未包含用於工具呼叫的 Vera CPU 效能,這可能影響整體系統結果。
NVIDIA 也回報了同一工作負載下的其他世代比較。該公司稱,GB300 NVL72 在 DeepSeek V4 Pro 上每兆瓦可提供高達 H200 NVL8 15 倍的吞吐量,而在更大型的 Kimi K3 2.8T 模型上則可達 80 倍。它還主張,相較於 GB300 NVL72,Vera Rubin 的每百萬 token 成本最多可降低 35 倍。這些數字都是 NVIDIA 的測量結果,在未經獨立重現之前,應視為效能主張。
NVIDIA 將這些提升歸因於硬體、網路與服務軟體的協同變革,而不只是 GPU 本身。NVL72 設計透過 NVIDIA 的 NVLink fabric 將 72 顆 GPU 連結起來,使平台能夠分散 mixture-of-experts 運算,並在機架級域中共享已快取的上下文。
該公司表示,第六代 NVLink 及其交換器相較於市售 Ethernet 替代方案,提供更高的封包速率與更低延遲。這種連接性旨在支援大規模專家並行、分散式 key-value 快取,以及將請求路由到已包含相關上下文的 GPU。
在軟體層面,NVIDIA 指出 disaggregated serving,即 prefill 與 decode 會在分別擴充的池中執行。其 NVIDIA Dynamo serving 堆疊旨在協調這些階段、使用 session 資訊,並部分根據快取重疊來路由請求。這些功能對代理特別重要,因為同一項任務可能在長時間 session 中產生大量相關模型呼叫。
NVIDIA 也將 TensorRT-LLM、vLLM 與 SGLang 列為更廣泛 serving 生態系的一部分,並提及基於 DeepGEMM 的 kernel、融合式 mixture-of-experts 執行,以及較低精度格式。原始資料在不同的平台描述中分別提到 NVFP4 與 MXFP4/MXFP8 技術。這些方法可以降低記憶體使用並提高算術吞吐量,但實際的品質與相容性取捨取決於模型與部署配置。
該公司另外表示,其 DSX MaxLPS 電源管理技術可在相同兆瓦預算內配置最多 40% 更多 GPU。這同樣是 NVIDIA 報告的能力,而不是 AgentX 比較本身所建立的結果。
如果頭條數字經得起獨立測試,商業影響可能相當可觀。AI 工廠正日益受到電力供應、散熱能力與長時間 session 服務成本的限制。每兆瓦可執行更多代理式工作,可能讓營運商在既有電力配額下服務更多客戶,或降低固定使用量所需的基礎設施。
影響會因工作負載而異。簡短的對話式助理未必能像會反覆呼叫工具並累積上下文的編碼、研究或客服代理那樣受益。模型架構也很重要:NVIDIA 最強的比較涉及大型 mixture-of-experts 系統,在這類系統中,GPU 間通訊與快取管理可能主導 serving 效能。
對產品團隊而言,這些數字強化了測量完整代理工作流程,而非孤立模型呼叫的必要性。評估應包括工具延遲、快取重用、並發性、對使用者的互動性,以及每完成一項任務的成本。一個能便宜產生 token、但在工具呼叫之間停頓的平台,未必能帶來更好的應用體驗。
這些主張也提高了加速器供應商與雲端業者發布特定工作負載效率數據的競爭壓力。單看「每秒 token 數」無法說明有狀態代理的經濟性。建構者在決定採用哪一代硬體前,將需要跨模型、serving 堆疊與電力預算的可比較測量。
第一個訊號會是 SemiAnalysis 對 AgentX 測量的審查。若能獲得獨立確認,包括精確的系統配置、軟體版本、模型 checkpoint 與電力計量方法,將決定 30 倍比較可被如何廣泛解讀。
買家也應關注包含 CPU 端工具執行的結果,因為 NVIDIA 表示目前的 Vera Rubin 資料並未包含這部分。針對非編碼代理、不同上下文長度與替代 serving 架構的額外測試,將顯示這項優勢是否能延伸到已記錄的 Claude Code 會話之外。
可用性、定價與雲端存取同樣重要。效率主張可以改善每百萬 token 的理論成本,但真實客戶經濟性也取決於系統採購成本、利用率、網路、散熱與軟體授權。早期部署的證據將揭示基準優勢是否會轉化為更低價格或更高營運商利潤。
NVIDIA 的公告最適合被理解為 AI 基礎設施效能衡量方式的轉變。隨著代理產生更長、且更具狀態的工作負載,以電力正規化的吞吐量與每完成任務成本,會比傳統單次請求速度更有用。
30 倍的數字雖然吸睛,但仍只是等待獨立審查的 NVIDIA 早期測量。對建構者而言,更持久且更可執行的教訓是:在把任何加速器比較視為生產結論之前,先對整個代理迴圈進行基準測試,包括上下文重用、工具、並發性與延遲。
NVIDIA 表示,Vera Rubin NVL72 每兆瓦可提供高達比 GB300 多 30 倍的代理式吞吐量,正在重塑 AI 建構者的推論經濟。