
NVIDIA says its Groq 3 LPX inference accelerator has entered full production as part of the Vera Rubin platform, giving cloud providers and enterprise infrastructure teams a specialized option for generating tokens quickly in long-context, agent-driven workloads.
The announcement positions Groq 3 LPX as a companion to NVIDIA’s Vera Rubin NVL72 rather than a replacement for its general-purpose GPUs. Rubin GPUs are intended to handle context processing, while the LPX system focuses on the latency-sensitive decode phase in which models produce responses one token at a time. That distinction matters as AI applications move from single-turn answers toward agents that repeatedly reason, call tools, exchange information with other systems and maintain large working contexts.
NVIDIA は Groq 3 LPX を、Vera Rubin アーキテクチャの中でも最も応答性の高い提供層向けに設計された対話型推論アクセラレータだと説明している。NVIDIA の開発者向けドキュメントによると、ラック規模の導入では、チップ間の直接リンクで接続された 256 台の LP30 アクセラレータと、合計 128 GB の SRAM ベースメモリを含めることができる。
このシステムは、決定論的でコンパイラがスケジュールする実行モデルを採用している。データをプロセッサ間でいつ移動させるかをリアルタイム仲裁に大きく依存するのではなく、コンパイラがワークロード開始前に計算と通信を計画できる。NVIDIA はこれにより、非常に小さなバッチサイズではテンソル並列があまり有効でなくなる原因となり得る調整オーバーヘッドを削減できるとしている。
この設計は、エージェント型AI の提供における特定の弱点を狙っている。1 回のタスク中に多数の短い出力を生成する必要があるエージェントでは、各応答が別のツール呼び出し、モデルターン、あるいはデータベース操作を引き起こすことがある。トークン生成のわずかな遅延は、これらのステップ全体で積み重なる可能性がある。長いセッションでは、拡張し続けるコンテキストが繰り返しモデルに戻されるため、基盤モデルが高性能であっても応答性を維持するのが難しくなる。
NVIDIA のアーキテクチャは、プラットフォーム全体で作業を分担する。Vera Rubin NVL72 が大規模なコンテキスト処理を担い、Groq 3 LPX がトークン生成を加速する。同社によると、両システムは prefill-decode 分離、attention-FFN 分離、外部ドラフターを用いた speculative decoding などの構成もサポートできる。
NVIDIA は、Groq 3 LPX と Vera Rubin NVL72 を組み合わせたシステムが、Gemma 4 31B を用いた Artificial Analysis の 100K-context ベンチマークで、毎秒 3,431 の出力トークンを達成したと報告している。別の NVIDIA 発表ではこの結果を毎秒 3,400 トークンと丸め、最も近い代替プラットフォームより 4 倍高速だったとしている。
これらは入手可能な証拠の中で最も強い性能主張だが、注意が必要だ。ベンチマーク結果は NVIDIA が Artificial Analysis を引用して報告しているもので、比較の「4 倍高速」という主張も NVIDIA 由来である。開発者向け投稿では Groq 3 LPX システムの初の第三者ベンチマークとされているが、提供された資料には完全なテスト構成、競合プラットフォーム、独立再現結果は示されていない。
NVIDIA はさらに、一般的なエージェント型およびコーディング系ワークロードにおける SPEED-Bench で、中央値 4,767 出力トークン/秒という結果も挙げている。この数値も NVIDIA の開発者向け資料に掲載されている。これは普遍的な提供速度として受け取るべきではない。実際の性能は、モデルのアーキテクチャ、コンテキスト長、並列実行数、スケジューリング、精度、ネットワーク、周辺ソフトウェアスタックに左右される。
それでも、このベンチマークの焦点は重要だ。従来のアクセラレータ比較は、総スループットや学習速度を重視しがちだった。NVIDIA は代わりに、100,000 トークンのコンテキストと低バッチサイズでの出力速度を強調している。これは大量のオフライン推論よりも対話型エージェントに近い条件だ。プロダクトチームにとって、ユーザーがエージェントの一連の操作完了を待つ場面では、より関連性の高い指標になり得る。
NVIDIA は Nebius を、Groq 3 LPX を採用する最初の AI クラウドプロバイダーとして挙げている。同社によると、Nebius はこのアクセラレータを Token Factory サービスに追加し、開発者が対話型エージェント、コーディングシステム、その他のリアルタイムアプリケーションを大規模に構築できるようにするという。ただし、Nebius の導入規模、商用提供開始日、顧客契約については示されていない。
NVIDIA はまた、CoreWeave が複数の並列スイッチを通じて Vera Rubin ラックを接続するために Spectrum-X Multiplane を本番導入したとも述べている。この発表はプラットフォーム周辺のネットワーク層に関するものであり、CoreWeave が Groq 3 LPX 自体を導入した証拠ではない。
3 つ目の採用シグナルは SpaceXAI だ。NVIDIA によれば、同社は次世代のエージェント型AIアーキテクチャで Vera CPU を使用する計画だという。想定用途には、オーケストレーション、ツール利用、コード実行、データ処理、シミュレーションが含まれ、データセンターと軌道上衛星にまたがる展開が想定されている。これは NVIDIA が報告した企業計画であり、完了した本番展開の証拠ではない。
入手可能な報道の大半が NVIDIA 自身のブログと開発者資料に依存しているため、採用は独立検証済みの市場浸透ではなく、発表済みのエコシステム活動として見るべきだ。SiliconANGLE のソース項目はニュースの方向性を確認しているが、提供された証拠には追加の記事本文や詳細な報道内容はない。
AIアプリケーション開発者にとって、まず気になるのは Groq 3 LPX のピークのトークン生成速度が高いかどうかではない。エージェントが多数のターンと大きなコンテキストウィンドウを跨いで動作する際に、予測可能なレイテンシを提供できるかどうかである。
それが実現すれば、このシステムはコーディングアシスタント、リサーチエージェント、カスタマーサービスのワークフロー、そしてユーザーが各中間応答の遅延を体感するオーケストレーションシステムにとって有用になり得る。デコードの高速化は体感応答性を向上させ、決定論的スケジューリングは、競合や小バッチ調整コストへの感度が低ければ、キャパシティ計画を容易にする可能性がある。
ただし代償として、アーキテクチャの複雑さがある。Groq 3 LPX は Vera Rubin NVL72 の拡張として提示されており、ホストプラットフォーム、相互接続、コンパイラ、モデルサービングソフトウェアから切り離して評価できるドロップインアクセラレータではない。購入者は、長文コンテキスト向けのメモリ容量、ネットワークトポロジー、モデル互換性、想定トラフィック下での利用率、prefill と decode のリソース間でワークロードを移すコストを含む、システム全体を評価する必要がある。
NVIDIA の主張は、インフラ経済のより広い変化も反映している。エージェントがより多くのトークンを生成し、より多くの推論ターンを実行するにつれて、提供コストとレイテンシは、初期のモデル学習費用よりも大きな制約になり得る。専用のデコードエンジンは対話型ワークロードの利用効率を改善し得るが、総コストを下げられるかどうかは、プロバイダーが Rubin GPU と LPX アクセラレータの両方をどれだけ一貫して稼働させられるかに左右される。
次に有用なシグナルは、完全な構成、競合システム、モデルバージョン、精度設定、コンテキスト長、並列性のレベルを公開する独立テストから得られるだろう。複数のバッチサイズでの結果は、Groq 3 LPX の優位性が高度に対話的な低バッチ提供を超えて広がるのかを判断する助けになる。
開発者はまた、Nebius Token Factory を通じた本番提供の証拠、具体的には対応モデル、価格、サービスレベル保証、そしてより広範な Vera Rubin スタックを採用せずにシステムへアクセスできるかどうかにも注目すべきだ。CoreWeave や他のクラウドプロバイダーで確認された導入は、商業的な勢いをより明確に示す。
最後に、市場は NVIDIA がコンパイラ、ネットワーク、サービングソフトウェアを一般的なエージェントフレームワークとどのように統合するかを見る必要がある。技術的な約束は、単に個別のデコードステップを高速化するだけでなく、モデル実行、KVキャッシュ管理、ツール呼び出し、マルチエージェントトラフィックを調整することにかかっている。
Groq 3 LPX が注目されるのは、NVIDIA が、モデルが長いエージェントループの中に置かれたときに初めて顕在化するボトルネック、つまり大きなコンテキストを保持しながら多数の連続トークンを生成する際に蓄積される遅延を狙っているからだ。この発表は、単独チップの投入というより、ラック規模システム全体で推論を特殊化された段階に分割することに関するものだ。
対話型エージェントを提供する事業者にとって機会は大きいが、証拠は依然として主にベンダー管理下にある。独立したベンチマークと顧客導入が、総コスト、ソフトウェア要件、実運用での持続性能を明らかにするまでは、Groq 3 LPX は、有望ではあるが市場での有効性がまだ完全には検証されていない、技術的に焦点を絞った本番向け製品として見るべきだ。
NVIDIAは、Groq 3 LPXがVera Rubinで本格量産に入り、AIエージェントやマルチターン処理向けの長文コンテキスト推論の高速化を狙うと述べている。