NVIDIA は、Groq 3 LPX を Vera Rubin と並行して本格量産化し、エージェントや AI クラウド事業者向けの高速・長文脈推論を狙っています。

NVIDIA は、同社の推論システム Groq 3 LPX が量産段階に入り、ラックスケール・プラットフォーム Vera Rubin NVL72 と統合されつつあると発表した。この組み合わせは、モデルが繰り返し推論し、ツールを呼び出し、ますます長くなる会話やタスク履歴を処理するエージェント型アプリケーションにおいて、トークン生成を高速化することを目的としている。
今回の発表により、NVIDIA の Vera Rubin 戦略は汎用的なアクセラレーテッド・コンピューティングを超えて拡張される。同社は、Rubin GPU を大規模なコンテキスト処理に割り当て、Groq 3 LPX はレイテンシに敏感なデコード、つまりモデルが 1 トークンずつ出力を生成する段階を担う位置づけにしている。この役割分担は、大規模展開におけるスループットを犠牲にせず、より応答性の高いエージェントを求める AI クラウド事業者や企業を対象としている。
NVIDIA によれば、Groq 3 LPX は Vera Rubin NVL72 を置き換えるのではなく、これと並行して動作するよう設計された対話型 AI 推論アクセラレータである。同社はこのプラットフォームを GPU と LPU(local processing units)の組み合わせとして説明しており、それぞれのコンポーネントを最も効果的なワークロードに割り当てている。
この分離が必要になるのは、エージェント型ワークロードの挙動によるものだ。エージェントは回答を生成し、外部ツールを使い、新しい情報を受け取り、別の推論ターンを開始することがある。各ターンはセッションのコンテキストを増やし、最終的には数万から数十万トークンを処理しながら、迅速に応答を返す必要が生じる。
NVIDIA は、Rubin GPU が大規模なコンテキスト処理負荷を管理でき、Groq 3 LPX はデコード性能に最適化されていると述べている。さらに、このシステムは prefill-decode disaggregation、attention-FFN disaggregation、external-drafter speculative decoding にも構成可能だ。これらは、モデル提供のタスクを分割したり、予測トークンを使って応答速度を改善したりするインフラ技術である。
NVIDIA によると、ラックスケール展開には、直接のチップ間リンクで接続された 256 個の LP30 アクセラレータを含めることができる。同社の開発者向けドキュメントでは、これらのチップ全体で 128 GB の SRAM を共有し、実行前に計算と通信を計画するコンパイラについて説明している。この決定論的なアプローチは、特に小さなバッチサイズでモデルを提供する際に大きくなりがちな調整オーバーヘッドを減らすことを狙っている。
NVIDIA の最も強い性能主張は Artificial Analysis のベンチマークに基づいており、これはベンダーが引用する第三者測定であって、幅広い本番性能を示す独立証拠ではない。Gemma 4 31B モデルで 100,000 トークンのコンテキストを用いた場合、Artificial Analysis は Groq 3 LPX で 1 秒あたり平均 3,431 出力トークンを測定したと NVIDIA の開発者ブログは述べている。
NVIDIA の企業発表ではこの数値を 1 秒あたり 3,400 出力トークンに丸め、結果は最も近い代替プラットフォームの 4 倍速かったと主張している。ただし、元資料ではその競合プラットフォームは特定されておらず、利用可能な証拠だけではこの比較を独立に検証できない。
2 つ目の結果は、Gemma 4 を使ったコーディング・ベンチマーク SPEED-Bench から得られている。NVIDIA は中央値で 1 秒あたり 4,767 出力トークン、80 パーセンタイルで 5,520 トークンの結果を報告している。これらの数値は特定のモデル、コンテキスト、テスト手法を表すものであり、モデル、バッチサイズ、コンテキスト長、実運用のトラフィックパターン全般にわたる普遍的な性能指標として扱うべきではない。
NVIDIA の技術説明によれば、Groq 3 LPX はコンパイラが計画したチップ間通信を使い、データ移動と計算を重ね合わせる。従来の並列推論では、処理をプロセッサに分散すると同期や集団通信のコストが発生しうる。NVIDIA は、特に対話性の高いサービスで用いられる小さなバッチサイズにおいて、事前に転送を計画することでリアルタイムの調停の一部を不要にできると主張している。
どちらの情報源も、顧客の導入規模、価格、消費電力、一般開発者向けの提供時期、独立に検証された本番利用状況を示していない。これらの証拠は NVIDIA の製品・アーキテクチャ上の主張を裏づけるが、広範な商用ワークロードで経済的にどのように機能するかはまだ示していない。
NVIDIA は Vera Rubin の拡張に関連する 3 つのパートナーを挙げている。Nebius は Groq 3 LPX を採用する最初の AI クラウドとされる。NVIDIA は、このハードウェアが同社の Token Factory に追加され、開発者が対話型エージェント、コーディングシステム、その他のリアルタイムアプリケーションを大規模に構築できるようになると述べている。
一方、CoreWeave は NVIDIA によれば Spectrum-X Multiplane を本番環境に展開済みだ。ネットワークシステムは複数の並列スイッチを通じて Vera Rubin ラックを接続し、AI クラウド基盤全体にわたって高帯域幅かつロスレスな通信を提供することを目的としている。
NVIDIA はまた、SpaceXAI が次世代の エージェント型 AI アーキテクチャで Vera CPU を使う計画だとも述べている。同社はこれらの CPU を、オーケストレーション、ツール利用、コード実行、データ処理、シミュレーションに結び付けており、そのインフラは地上データセンターと軌道上衛星にまたがるとしている。これは公表された計画であり、そのような展開がすでに大規模に稼働していることの証拠ではない。
これらのパートナー言及は、NVIDIA が Vera Rubin を完全な AI ファクトリー・スタックとして販売していることを示している。すなわち、オーケストレーションと汎用作業向けの CPU、コンテキストとモデル計算向けの GPU、高速デコード向けの Groq アクセラレータ、そしてそれらを接続するネットワークである。商業的な重要性は、顧客が異なる提供段階向けに最適化された別々のアクセラレータ群よりも、このスタックを効率的に展開できるかどうかにかかっている。
コーディングアシスタント、リサーチエージェント、顧客対応システムを構築する人々にとって、デコード遅延はユーザーに直接体感される。初回応答が速い、あるいは途中出力が速いだけでも、特にエージェントが多くの逐次呼び出しを行う場合、複数段階のワークフローがより対話的に感じられる。
長いコンテキストもインフラの前提を変える。セッションが履歴を繰り返し再処理すると、モデル自体が特別に大きくなくても、相当なメモリと計算資源を消費しうる。NVIDIA の設計は、大きな key-value キャッシュ、小バッチ推論、プロセッサ間の頻繁な通信という組み合わせを狙っている。
企業にとっての実際の論点は、1 秒あたりのピークトークン数よりも、実トラフィック下でのサービスレベル性能になる。購入者は、同時実行レベル、コンテキストサイズ、モデルアーキテクチャの違いごとのレイテンシに加え、専用推論 क्षमताを使い続けるコストを評価する必要がある。ベンチマーク負荷では非常に高速なシステムでも、需要が変動したり、アプリケーションがまだプラットフォーム向けに最適化されていないモデルやソフトウェアを必要としたりする場合には、魅力が下がる可能性がある。
今回の発表は、推論の特化を巡る競争も激化させる。NVIDIA は自社の広いプラットフォーム展開を活かし、専用の低レイテンシアクセラレータを今後の GPU、CPU、ネットワーク製品と組み合わせている。これは差別化された推論サービスを構築するクラウド事業者にとって魅力的かもしれないが、単一のアクセラレータアーキテクチャと比べてソフトウェアと運用の複雑さは増す。
最も明確な次のシグナルは、Nebius が Groq 3 LPX ベースのサービスを開発者に公開し、本番性能、価格、容量情報を開示するかどうかだ。そうした詳細があれば、ハードウェア発表と、一般に利用可能なサービス提供オプションを区別しやすくなる。
顧客はまた、Gemma 4 31B と報告されたコーディングベンチマーク以外の独立した結果にも注目すべきだ。より大きい/小さいモデル、さまざまなコンテキスト長、同時利用者数、完全なエージェントワークフローでの結果があれば、このプラットフォームを評価するためのより強い基準になる。
CoreWeave と SpaceXAI の展開実績も重要な指標となる。NVIDIA は CoreWeave の本番ネットワーク展開を確認し、SpaceXAI の Vera CPU 計画を説明したが、ソースには規模、ワークロード、利用率のデータがない。電力効率、ソフトウェアサポート、一般的な推論フレームワークとの互換性も、NVIDIA が名指ししたパートナー以外でこのアーキテクチャが採用されるかどうかを左右する。
NVIDIA の今回のニュースは、単なる新しい推論チップの発表ではなく、本番導入とシステム統合の節目として理解するのが最適だ。同社は特定のサービス課題に対応している。すなわち、エージェントは大きなコンテキストを保持しながら長いトークン列を生成するため、デコード遅延とインターコネクトのオーバーヘッドの両方が商業的に重要になる。
報告された結果は有望だが、ベンダー選定のベンチマークと限られた公開導入証拠によって制約されている。AI チームにとって意味のある試験は、Groq 3 LPX と Vera Rubin が自社のエージェントワークロードで予測可能なレイテンシと受け入れ可能な経済性を提供できるかどうかだ。もしそうなら、NVIDIA の統合された「トークンファクトリー」アプローチは、高い対話性が求められるサービスにとって有力な選択肢になりうる。そうでなければ、優れたピーク性能があっても、専用コンポーネントの正当化は依然として難しいかもしれない。