NVIDIA 已將 Groq 3 LPX 與 Vera Rubin 一同推向全面量產,目標是為代理與 AI 雲端供應商提供更快、長上下文的推論能力。

NVIDIA 表示,其 Groq 3 LPX 推論系統已進入全面量產,並正與 Vera Rubin NVL72 機架級平台整合。這項組合旨在加速代理式應用的 token 生成,這類應用中模型會反覆推理、呼叫工具,並處理越來越長的對話或任務歷史。
這項公告將 NVIDIA 的 Vera Rubin 策略從通用加速運算進一步延伸。公司正將 Rubin GPU 定位於大規模上下文處理,而 Groq 3 LPX 則負責對延遲敏感的解碼,也就是模型一次生成一個 token 輸出的階段。這種分工目標是 AI 雲端供應商與企業,希望在不犧牲大規模部署吞吐量的前提下,獲得更具回應性的代理。
根據 NVIDIA 的說法,Groq 3 LPX 是一款互動式 AI 推論加速器,設計上是與 Vera Rubin NVL72 協同運作,而不是取而代之。該公司將此平台描述為 GPU 與 LPU(local processing units,本地處理單元)的組合,每個元件被分配到它最擅長的工作負載。
之所以需要這種分離,源自代理式工作負載的行為。代理可能先生成答案、使用外部工具、接收新資訊,然後開始另一輪推論。每一輪都會為會話增加上下文,最終使系統在仍需快速回應的同時,必須處理數萬甚至數十萬個 token。
NVIDIA 表示,Rubin GPU 可處理龐大的上下文處理工作,而 Groq 3 LPX 則針對解碼效能進行最佳化。系統也可配置為 prefill-decode disaggregation、attention-FFN disaggregation,以及 external-drafter speculative decoding。這些都是將模型服務任務拆分,或利用預測 token 來提升回應速度的基礎架構技術。
NVIDIA 指出,機架級部署可包含 256 個 LP30 加速器,並透過直接晶片對晶片連結相互連接。該公司的開發者文件描述了這些晶片合計 128 GB 的 SRAM,以及一個在執行前規劃運算與通訊的編譯器。這種決定性方法旨在降低協調開銷,而當模型以小批次提供服務時,這種開銷可能變得相當顯著。
NVIDIA 最強的效能主張來自 Artificial Analysis 基準測試,這代表它引用的是供應商所引用的第三方量測,而非對廣泛量產效能的獨立證據。根據 NVIDIA 的開發者部落格,在 Gemma 4 31B 模型、100,000 token 上下文下,Artificial Analysis 測得 Groq 3 LPX 的中位數輸出速度為每秒 3,431 個輸出 token。
NVIDIA 的公司公告將該數字四捨五入為每秒 3,400 個輸出 token,並稱結果比最接近的替代平台快 4 倍。原始資料在公告中並未指出該競爭平台,因此無法根據現有證據獨立評估此比較。
第二項結果來自 SPEED-Bench,一個使用 Gemma 4 的程式碼基準測試。NVIDIA 報告中位數為每秒 4,767 個輸出 token,且第 80 百分位結果為每秒 5,520 個 token。這些數字描述的是特定的模型、上下文與測試方法;不應被視為跨模型、批次大小、上下文長度或生產流量模式的通用效能衡量標準。
NVIDIA 提供的技術解釋是,Groq 3 LPX 使用由編譯器排程的晶片間通訊,並將資料移動與運算重疊。在傳統平行推論中,將工作分散到多個處理器可能引入同步與集體通訊成本。NVIDIA 主張,事先規劃傳輸可消除部分即時仲裁需求,尤其是在與高度互動式服務相關的小批次大小下。
兩份來源都沒有提供客戶部署量、定價、耗電、一般開發者可用性的時間表,或經獨立驗證的實際生產利用率。這些證據證實了 NVIDIA 的產品與架構主張,但尚未說明該系統在廣泛商業工作負載下的經濟表現。
NVIDIA 列出三個與 Vera Rubin 擴展相關的合作夥伴。Nebius 被描述為第一家採用 Groq 3 LPX 的 AI 雲端。NVIDIA 表示,這些硬體將被加入該公司的 Token Factory,讓開發者能夠大規模建構互動式代理、程式碼系統與其他即時應用。
與此同時,NVIDIA 表示 CoreWeave 已將 Spectrum-X Multiplane 於生產環境中部署。該網路系統透過多個平行交換器連接 Vera Rubin 機架,目標是為 AI 雲端基礎架構提供高頻寬且無損的通訊。
NVIDIA 也表示,SpaceXAI 計畫在其下一代 代理式 AI 架構中使用 Vera CPUs。公司將這些 CPU 與編排、工具使用、程式碼執行、資料處理與模擬連結起來,涵蓋地面資料中心與軌道衛星的基礎設施。這是已宣示的計畫,並非證明該部署已經在大規模運作。
這些合作夥伴引用顯示,NVIDIA 正將 Vera Rubin 作為一套完整的 AI 工廠堆疊來銷售:CPU 負責編排與通用工作,GPU 負責上下文與模型運算,Groq 加速器負責快速解碼,網路則用來連接各元件。其商業意義將取決於客戶是否能比針對不同服務階段最佳化的獨立加速器叢集,更有效率地部署這套堆疊。
對於程式碼助理、研究代理與客戶服務系統的建置者而言,解碼延遲會直接被使用者感受到。更快的首次回應或更快的中間輸出,能讓多步驟工作流程更像是即時互動,尤其當代理必須執行多次連續呼叫時。
長上下文也改變了基礎架構方程式。即使模型本身並不特別大,一個反覆重處理歷史紀錄的會話仍可能消耗大量記憶體與運算資源。NVIDIA 的設計正是針對這種大 key-value cache、小批次推論與處理器間頻繁通訊的組合。
對企業來說,實際問題較少是每秒峰值 token 數,而是實際流量下的服務層級效能。買家需要評估不同並行程度、上下文大小與模型架構下的延遲,以及維持專用推論容量使用率的成本。若某個系統在基準工作負載下極快,但需求波動大,或應用需要尚未針對平台最佳化的模型與軟體,那它可能就沒那麼有吸引力。
這項公告也加劇了圍繞推論專精化的競爭。NVIDIA 正利用其更廣的 platform reach,將專用低延遲加速器與即將推出的 GPU、CPU 與網路產品搭配。這對打造差異化推論服務的雲端供應商可能具吸引力,但與單一加速器架構相比,也增加了軟體與營運的複雜度。
最明確的後續訊號將是 Nebius 是否向開發者開放 Groq 3 LPX 支援的服務,並公布生產效能、定價或容量資訊。這些細節有助於區分硬體公告與可廣泛使用的服務選項。
客戶也應留意 Gemma 4 31B 與已報告的程式碼基準之外的獨立結果。更大與更小模型、不同上下文長度、並行使用者以及完整代理工作流程的結果,將為評估該平台提供更強的基礎。
來自 CoreWeave 與 SpaceXAI 的部署證據也將是另一個重要指標。NVIDIA 已確認 CoreWeave 的生產網路部署,並描述 SpaceXAI 的 Vera CPU 計畫,但來源並未提供規模、工作負載或使用率資料。能源效率、軟體支援以及與主流推論框架的相容性,同樣將決定這項架構是否能在 NVIDIA 所提名的合作夥伴之外獲得採用。
NVIDIA 的消息最適合被理解為一個生產與系統整合的里程碑,而不只是另一顆推論晶片的發表。公司正在回應一個特定的服務問題:代理在攜帶大量上下文的同時生成長串 token,因此解碼延遲與互連開銷在商業上都變得至關重要。
目前公布的結果雖然令人期待,但仍受限於供應商選定的基準測試與有限的公開部署證據。對 AI 團隊而言,真正重要的測試會是 Groq 3 LPX 與 Vera Rubin 是否能在他們自己的代理式工作負載上提供可預測的延遲與可接受的經濟性。若能做到,NVIDIA 整合式的「token factory」方法有機會成為高互動服務的重要選項;若做不到,即使峰值數據很強,專用元件仍可能難以證明其價值。