NVIDIA hat Groq 3 LPX zusammen mit Vera Rubin in die volle Produktion überführt und zielt dabei auf schnellere Inferenz mit langem Kontext für Agents und KI-Cloud-Anbieter ab.

NVIDIA sagt, dass sein Inferenzsystem Groq 3 LPX in die volle Produktion eingetreten ist und zusammen mit der Rack-Scale-Plattform Vera Rubin NVL72 integriert wird. Die Kombination soll die Token-Generierung für agentische Anwendungen beschleunigen, bei denen Modelle wiederholt Schlussfolgerungen ziehen, Werkzeuge aufrufen und immer längere Gesprächs- oder Aufgabenverläufe verarbeiten.
Die Ankündigung erweitert NVIDIAs Vera-Rubin-Strategie über allgemein beschleunigtes Computing hinaus. Das Unternehmen positioniert Rubin-GPUs für die Verarbeitung großer Kontexte, während Groq 3 LPX die latenzempfindliche Dekodierung übernimmt, also die Phase, in der ein Modell die Ausgabe ein Token nach dem anderen erzeugt. Diese Aufgabenteilung zielt auf KI-Cloud-Anbieter und Unternehmen ab, die reaktionsschnellere Agents wünschen, ohne bei großen Bereitstellungen auf Durchsatz zu verzichten.
Laut NVIDIA ist Groq 3 LPX ein interaktiver KI-Inferenzbeschleuniger, der gemeinsam mit Vera Rubin NVL72 arbeiten und diese nicht ersetzen soll. Das Unternehmen beschreibt die Plattform als Kombination aus GPUs und LPUs, also lokalen Verarbeitungseinheiten, wobei jeder Komponente die Workloads zugewiesen werden, für die sie am effektivsten ist.
Die Notwendigkeit dieser Trennung ergibt sich aus dem Verhalten agentischer Workloads. Ein Agent kann eine Antwort erzeugen, ein externes Tool verwenden, neue Informationen erhalten und einen weiteren Inferenzschritt beginnen. Jeder Schritt kann den Kontext der Sitzung erweitern und das System schließlich dazu zwingen, Zehntausende oder Hunderttausende von Tokens zu verarbeiten, während es dennoch schnell eine Antwort liefert.
NVIDIA sagt, Rubin-GPUs könnten die große Kontextverarbeitungs-Last bewältigen, während Groq 3 LPX für die Decode-Leistung optimiert sei. Das System kann außerdem für Prefill-Decode-Disaggregation, Attention-FFN-Disaggregation und externe-Drafter-speculative Decoding konfiguriert werden. Dabei handelt es sich um Infrastrukturtechniken, die Modellbereitstellungsaufgaben aufteilen oder vorhergesagte Tokens nutzen, um die Antwortgeschwindigkeit zu verbessern.
Eine Bereitstellung auf Rack-Scale-Ebene kann laut NVIDIA 256 LP30-Beschleuniger umfassen, die über direkte Chip-zu-Chip-Verbindungen verbunden sind. Die Entwicklerdokumentation des Unternehmens beschreibt 128 GB kombinierten SRAM über diese Chips hinweg sowie einen Compiler, der Berechnung und Kommunikation vor der Ausführung plant. Dieser deterministische Ansatz soll den Koordinationsaufwand reduzieren, der bei der Bereitstellung von Modellen mit kleinen Batch-Größen erheblich werden kann.
NVIDIAs stärkste Leistungsbehauptungen stammen aus einem Benchmark von Artificial Analysis, also von Messungen eines Dritten, die vom Anbieter zitiert werden, nicht aus einem unabhängigen Beleg für eine breite Produktionsleistung. Beim Modell Gemma 4 31B mit einem Kontext von 100.000 Tokens maß Artificial Analysis laut NVIDIAs Entwicklerblog eine mediane Geschwindigkeit von 3.431 Output-Tokens pro Sekunde auf Groq 3 LPX.
NVIDIAs Unternehmensankündigung rundet diesen Wert auf 3.400 Output-Tokens pro Sekunde und sagt, das Ergebnis sei viermal schneller gewesen als die nächstgelegene alternative Plattform. Das Quellenmaterial nennt diese konkurrierende Plattform in der Ankündigung nicht, sodass der Vergleich anhand der verfügbaren Belege nicht unabhängig beurteilt werden kann.
Ein zweites Ergebnis stammt aus SPEED-Bench, einem Coding-Benchmark mit Gemma 4. NVIDIA berichtet von einer medianen Geschwindigkeit von 4.767 Output-Tokens pro Sekunde und einem Ergebnis am 80. Perzentil von 5.520 Tokens pro Sekunde. Diese Zahlen beschreiben ein bestimmtes Modell, einen bestimmten Kontext und eine bestimmte Testmethodik; sie sollten nicht als universelles Maß für die Leistung über Modelle, Batch-Größen, Kontextlängen oder Produktions-Traffic-Muster hinweg verstanden werden.
Die technische Erklärung von NVIDIA lautet, dass Groq 3 LPX compiler-geplante Chip-zu-Chip-Kommunikation nutzt und Datenbewegung mit Berechnung überlappt. Bei konventioneller paralleler Inferenz kann die Verteilung der Arbeit auf Prozessoren Synchronisations- und kollektive Kommunikationskosten verursachen. NVIDIA argumentiert, dass die Vorausplanung von Übertragungen die Notwendigkeit einiger Echtzeit-Schlichtungen beseitigen kann, insbesondere bei kleinen Batch-Größen, die mit hochinteraktiven Bereitstellungen verbunden sind.
Keine der Quellen nennt Kunden-Deployments in Stückzahlen, Preisgestaltung, Energieverbrauch, Zeitpläne für die allgemeine Verfügbarkeit für Entwickler oder unabhängig verifizierte Produktionsauslastung. Die Belege stützen NVIDIAs Produkt- und Architekturbehauptungen, zeigen aber noch nicht, wie sich das System wirtschaftlich über eine breite Palette kommerzieller Workloads hinweg verhält.
NVIDIA nennt drei Partner, die mit der Vera-Rubin-Erweiterung verbunden sind. Nebius wird als erste KI-Cloud beschrieben, die Groq 3 LPX einführt. NVIDIA sagt, die Hardware werde der Token Factory des Unternehmens hinzugefügt, damit Entwickler interaktive Agents, Coding-Systeme und andere Echtzeitanwendungen in großem Maßstab aufbauen können.
CoreWeave hat laut NVIDIA meanwhile Spectrum-X Multiplane in Produktion eingesetzt. Das Netzwerksystem verbindet Vera-Rubin-Racks über mehrere parallele Switches mit dem erklärten Ziel, eine bandbreitenstarke und verlustfreie Kommunikation über die gesamte KI-Cloud-Infrastruktur hinweg bereitzustellen.
NVIDIA sagt außerdem, dass SpaceXAI plant, Vera-CPUs in seiner nächsten Generation der agentischen KI-Architektur zu verwenden. Das Unternehmen verknüpft diese CPUs mit Orchestrierung, Tool-Nutzung, Codeausführung, Datenverarbeitung und Simulation, einschließlich einer Infrastruktur über terrestrische Rechenzentren und Orbitalsatelliten hinweg. Dies ist ein angekündigter Plan, kein Beleg dafür, dass eine solche Bereitstellung bereits in großem Maßstab läuft.
Diese Partnerhinweise deuten darauf hin, dass NVIDIA Vera Rubin als vollständigen KI-Fabrik-Stack verkauft: CPUs für Orchestrierung und allgemeine Aufgaben, GPUs für Kontext- und Modellberechnungen, Groq-Beschleuniger für schnelles Dekodieren und Netzwerke zum Verbinden der Komponenten. Die kommerzielle Bedeutung wird davon abhängen, ob Kunden diesen Stack effizienter einsetzen können als getrennte Beschleunigerpools, die für unterschiedliche Bereitstellungsphasen optimiert sind.
Für Entwickler von Coding-Assistenten, Forschungs-Agents und Kundendienstsystemen wird Decode-Latenz direkt von den Nutzern erlebt. Eine schnellere erste Antwort oder schnellere Zwischenausgabe kann einen mehrstufigen Workflow interaktiver wirken lassen, insbesondere wenn ein Agent viele aufeinanderfolgende Aufrufe durchführen muss.
Auch langer Kontext verändert die Infrastrukturgleichung. Eine Sitzung, die ihre Historie wiederholt neu verarbeitet, kann erhebliche Speicher- und Rechenressourcen verbrauchen, selbst wenn das Modell selbst nicht außergewöhnlich groß ist. NVIDIAs Design zielt auf diese Kombination aus großen Key-Value-Caches, Inferenz mit kleinen Batches und häufiger Kommunikation zwischen Prozessoren ab.
Die praktische Frage für Unternehmen wird weniger die maximale Anzahl an Tokens pro Sekunde sein als vielmehr die Service-Level-Leistung unter realem Traffic. Käufer müssen die Latenz bei unterschiedlichen Parallelitätsstufen, Kontextgrößen und Modellarchitekturen bewerten sowie die Kosten für die Auslastung spezialisierter Inferenzkapazitäten. Ein System, das für eine Benchmark-Last außergewöhnlich schnell ist, kann weniger attraktiv sein, wenn die Nachfrage schwankt oder Anwendungen Modelle und Software benötigen, die noch nicht für die Plattform optimiert sind.
Die Ankündigung verschärft auch den Wettbewerb rund um Inferenz-Spezialisierung. NVIDIA nutzt seine breitere Plattformreichweite, um einen dedizierten Low-Latency-Beschleuniger mit seinen kommenden GPU-, CPU- und Netzwerkprodukten zu kombinieren. Das könnte Cloud-Anbieter ansprechen, die differenzierte Inferenzdienste aufbauen, erhöht aber auch die Software- und Betriebskomplexität im Vergleich zu einer einzelnen Beschleunigerarchitektur.
Das klarste Folgesignal wird sein, ob Nebius Groq-3-LPX-basierte Dienste für Entwickler bereitstellt und Produktionsleistung, Preise oder Kapazitätsinformationen veröffentlicht. Diese Details würden helfen, eine Hardware-Ankündigung von einer allgemein zugänglichen Bereitstellungsoption zu unterscheiden.
Kunden sollten auch nach unabhängigen Ergebnissen jenseits von Gemma 4 31B und dem gemeldeten Coding-Benchmark Ausschau halten. Ergebnisse über größere und kleinere Modelle, unterschiedliche Kontextlängen, parallele Nutzer und vollständige Agent-Workflows hinweg würden eine bessere Grundlage für die Bewertung der Plattform bieten.
Bereitstellungsnachweise von CoreWeave und SpaceXAI werden ebenfalls ein wichtiger Indikator sein. NVIDIA hat CoreWeaves Produktions-Netzwerkbereitstellung bestätigt und die Vera-CPU-Pläne von SpaceXAI beschrieben, doch die Quellen liefern keine Daten zu Umfang, Workload oder Auslastung. Energieeffizienz, Softwareunterstützung und Kompatibilität mit gängigen Inferenz-Frameworks werden ebenfalls darüber entscheiden, ob die Architektur außerhalb von NVIDIAs genannten Partnern Verbreitung findet.
NVIDIAs Nachricht ist am besten als Meilenstein in Produktion und Systemintegration zu verstehen, nicht einfach als Einführung eines weiteren Inferenzchips. Das Unternehmen reagiert auf ein spezifisches Serving-Problem: Agents erzeugen lange Token-Ketten und tragen dabei großen Kontext mit sich, wodurch sowohl Decode-Latenz als auch Interconnect-Overhead kommerziell wichtig werden.
Die gemeldeten Ergebnisse sind vielversprechend, bleiben aber durch vom Anbieter ausgewählte Benchmarks und begrenzte öffentliche Bereitstellungsnachweise eingegrenzt. Für KI-Teams wird der entscheidende Test sein, ob Groq 3 LPX und Vera Rubin vorhersehbare Latenz und akzeptable Wirtschaftlichkeit bei ihren eigenen Agenten-Workloads liefern. Wenn das gelingt, könnte NVIDIAs integrierter „Token-Factory“-Ansatz zu einer ernsthaften Option für hochinteraktive Dienste werden; wenn nicht, könnten spezialisierte Komponenten trotz starker Spitzenwerte schwer zu rechtfertigen bleiben.