
NVIDIA says its Groq 3 LPX inference accelerator has entered full production as part of the Vera Rubin platform, giving cloud providers and enterprise infrastructure teams a specialized option for generating tokens quickly in long-context, agent-driven workloads.
The announcement positions Groq 3 LPX as a companion to NVIDIA’s Vera Rubin NVL72 rather than a replacement for its general-purpose GPUs. Rubin GPUs are intended to handle context processing, while the LPX system focuses on the latency-sensitive decode phase in which models produce responses one token at a time. That distinction matters as AI applications move from single-turn answers toward agents that repeatedly reason, call tools, exchange information with other systems and maintain large working contexts.
NVIDIA 將 Groq 3 LPX 描述為一款互動式推論加速器,專為其 Vera Rubin 架構中最高回應性的服務層級而設計。根據 NVIDIA 的開發者文件,一個機櫃級部署可包含 256 個 LP30 加速器,透過晶片對晶片的直接連接串接,並配備 128 GB 的 SRAM 基礎整合記憶體。
該系統採用決定論、由編譯器排程的執行模型。它不會那麼依賴即時仲裁來決定資料何時在處理器之間移動,而是由編譯器在工作負載開始前就規劃運算與通訊。NVIDIA 表示,這能降低協調開銷,而這種開銷在極小批次大小時會讓張量平行化變得不那麼有用。
這種設計鎖定了 代理式 AI 服務中的特定弱點。某個代理可能需要在單一任務中產生許多短輸出,而每次回應都會觸發另一個工具呼叫、模型輪次或資料庫操作。Token 生成中的微小延遲,會在這些步驟中累積。長時間的 session 也會不斷把擴大的上下文重新送回模型,讓即使底層模型能力很強,也難以維持回應性。
NVIDIA 的架構將工作分配到整個平台。Vera Rubin NVL72 負責大規模上下文處理,而 Groq 3 LPX 負責加速 token 生成。公司表示,這兩套系統也可支援 prefill-decode 分離、attention-FFN 分離,以及搭配外部 drafter 的 speculative decoding 等配置。
NVIDIA 表示,將 Groq 3 LPX 與 Vera Rubin NVL72 結合的系統,在使用 Gemma 4 31B 的 Artificial Analysis 100K-context 基準測試中,達到每秒 3,431 個輸出 token。另一則 NVIDIA 公告則將結果四捨五入為每秒 3,400 個 token,並稱其速度比最接近的替代平台快 4 倍。
這些是現有證據中最強的效能主張,但需要加上註解。該基準結果是 NVIDIA 轉引 Artificial Analysis 所報告,至於比較中的「快 4 倍」說法也同樣來自 NVIDIA。開發者文章稱這是 Groq 3 LPX 系統的首個第三方基準測試,但所提供的來源並未給出完整測試配置、競爭平台或可獨立重現的結果。
NVIDIA 也引用 SPEED-Bench 的中位數結果:在一般代理式與程式碼工作負載上,每秒 4,767 個輸出 token。這個數字同樣出現在 NVIDIA 的開發者資料中。它不應被視為通用的服務速率:實際效能將取決於模型架構、上下文長度、並行度、排程、精度、網路,以及周邊軟體堆疊。
不過,這個基準焦點仍然很重要。傳統加速器比較通常強調總吞吐量或訓練速度。NVIDIA 則改為強調在 100,000 token 上下文與低批次大小下的輸出速率,這些條件比大量離線推論更接近互動式代理。對產品團隊而言,當使用者正在等待代理完成一連串動作時,這可能是更有相關性的衡量方式。
NVIDIA 指出,Nebius 是第一家採用 Groq 3 LPX 的 AI 雲端服務商。公司表示,Nebius 會把這款加速器加入其 Token Factory 服務,讓開發者能大規模建立互動式代理、程式碼系統與其他即時應用。不過,現有證據並未說明 Nebius 部署的規模、商業上線日期或客戶承諾。
NVIDIA 也表示,CoreWeave 已將 Spectrum-X Multiplane 投入生產,用以透過多個平行交換器連接 Vera Rubin 機櫃。這項公告說的是平台周邊的網路層,並不能證明 CoreWeave 本身已部署 Groq 3 LPX。
第三個採用訊號來自 SpaceXAI;NVIDIA 表示,該公司計畫在其下一代代理式 AI 架構中使用 Vera CPU。所列出的用途包括編排、工具使用、程式碼執行、資料處理與模擬,部署範圍涵蓋資料中心與軌道衛星。這是 NVIDIA 所轉述的公司計畫,並非已完成生產部署的證據。
由於目前可得報導多半來自 NVIDIA 自身的部落格與開發者資料,因此這些採用狀況應被視為已宣布的生態系活動,而非經獨立驗證的市場動能。SiliconANGLE 的來源條目可確認新聞方向,但在所提供的證據中並未附帶更多文章內容或報導細節。
對 AI 應用開發者而言,最直接的問題不是 Groq 3 LPX 是否擁有很高的峰值 token 速率,而是當代理在多輪與大型上下文視窗中運作時,平台能否提供可預測的延遲。
這可能讓系統對程式設計助理、研究代理、客服工作流程與編排系統更有價值,因為在這些場景中,使用者會感受到每一次中間模型回應的延遲。更快的解碼可以提升感知上的回應性,而若效能對資源爭用與小批次協調成本較不敏感,決定論式排程也可能讓容量規劃更容易。
代價是架構上的複雜度。Groq 3 LPX 被定位為 Vera Rubin NVL72 的延伸,而不是一個可獨立於主機平台、互連、編譯器與模型服務軟體之外評估的即插即用加速器。買家必須評估整個系統:長上下文所需的記憶體容量、網路拓撲、模型相容性、在預期流量下的利用率,以及在 prefill 與 decode 資源之間搬移工作負載的成本。
NVIDIA 的論點也反映了基礎架構經濟的更大變化。隨著代理生成更多 token 並執行更多推論輪次,服務成本與延遲可能比初始模型訓練費用更成為限制因素。專用的解碼引擎可提升互動式工作負載的利用率,但是否能降低總成本,取決於服務商能否持續讓 Rubin GPU 與 LPX 加速器都保持高利用率。
下一批有用的訊號將來自獨立測試,這些測試會公開完整配置、競爭系統、模型版本、精度設定、上下文長度與並行等級。多種批次大小的結果將有助於判斷 Groq 3 LPX 的優勢是否能超越高度互動式的小批次服務。
開發者也應留意是否透過 Nebius Token Factory 出現生產可用性的證據,包括支援的模型、定價、服務等級保證,以及客戶是否能在不採用更廣泛 Vera Rubin 堆疊的情況下使用該系統。CoreWeave 或其他雲端業者若有確認的部署,將更能清楚顯示商業採用動能。
最後,市場還需要看到 NVIDIA 如何將編譯器、網路與服務軟體整合進常見的代理框架。技術承諾不只是加速單一解碼步驟,而是要協調模型執行、KV 快取管理、工具呼叫與多代理流量。
Groq 3 LPX 值得注意,因為 NVIDIA 正在針對一個只有當模型被放進延展的代理迴圈中才會顯現的瓶頸:在保留大上下文的同時,生成許多序列化 token 所累積的延遲。這項公告與其說是單顆晶片上市,不如說是 NVIDIA 在機櫃級系統中把推論拆分成專門階段。
對於服務互動式代理的供應商而言,機會相當可觀,但目前的證據仍主要由供應商掌控。在獨立基準測試與客戶部署釐清總成本、軟體需求與真實工作負載下的持續效能之前,Groq 3 LPX 應被視為一項技術導向的量產產品,具有前景,但市場影響尚未完全被驗證。
NVIDIA 表示,Groq 3 LPX 已隨 Vera Rubin 進入全面量產,目標是為 AI 代理與多輪工作負載提供更快的長上下文推論。