NVIDIA behauptet, Vera Rubin NVL72 liefere bis zu 30x mehr agentische KI-Arbeit pro Watt

NVIDIA sagt, Vera Rubin NVL72 könne bis zu 30x mehr agentische KI-Durchsatzleistung pro Megawatt als GB300 liefern und damit die Inferenzökonomie neu gestalten.

AI News

NVIDIA sagt, seine kommende Vera Rubin NVL72-Plattform könne pro Megawatt bis zu 30-mal so hohen agentischen KI-Durchsatz wie ihr Vorgänger GB300 NVL72 liefern. Die Behauptung basiert auf ersten Ergebnissen von SemiAnalysis AgentX, einem Benchmark, der Produktions-ähnliche Coding-Agent-Sitzungen statt Chatbot-Prompts mit fester Länge nachbilden soll.

Das Ergebnis ist bedeutsam, weil KI-Agenten deutlich mehr Inferenzverkehr erzeugen als herkömmliche Chats. NVIDIA verweist auf Daten von OpenRouter, denen zufolge eine agentische Anfrage ungefähr 15-mal so viele Tokens verbraucht wie eine einfache Chat-Interaktion. Agenten denken wiederholt nach, rufen Werkzeuge auf, delegieren Aufgaben an Unteragenten und tragen einen wachsenden Kontext durch jeden Schritt, was sowohl die Rechenkapazität als auch das Energiebudget unter Druck setzt.

NVIDIAs Ergebnisse sind vom Anbieter berichtet und stehen noch unter Vorbehalt der Prüfung durch SemiAnalysis. Sie markieren daher das Leistungsziel des Unternehmens für Rubin, nicht ein unabhängig bestätigtes Branchenranking. Dennoch deutet die Wahl des Benchmarks auf einen breiteren Wandel hin, wie Infrastrukturanbieter KI-Systeme messen müssen, wenn mehrstufige Workloads in die Produktion übergehen.

Ein Benchmark, der sich an realem Agentenverhalten orientiert

Die AgentX-Workload, Teil der InferenceX-Benchmark-Suite von SemiAnalysis, spielt aufgezeichnete Claude Code-Sitzungen mit ineinander verschränktem Modellnachdenken und Werkzeugnutzung nach. Laut Material aus dem NVIDIA Developer Blog werden die ursprünglichen Sequenzlängen, das Kontextwachstum, die Denkintervalle und die Verzögerungen bei Tool-Aufrufen beibehalten.

Dieses Design unterscheidet sich von traditionellen Inferenztests, die auf einer festen Eingabe- und Ausgabengröße beruhen. In einer Agentensitzung kann der Prompt von Tausenden Tokens auf Hunderttausende anwachsen, während das System Forschung, Code, Tool-Ergebnisse und delegierte Arbeit ansammelt. Bereits verarbeiteter Kontext kann außerdem über einen Key-Value-Cache wiederverwendet werden, während die Ausführung von Werkzeugen Lücken zwischen Modellaufrufen erzeugt.

AgentX variiert die Parallelität und bewertet den Durchsatz anhand von Interaktivitätsmetriken wie Zeit bis zum ersten Token, End-to-End-Latenz und Tokens pro Sekunde pro Nutzer. NVIDIA sagt, das Rubin-Hauptergebnis sei bei 160 Tokens pro Sekunde pro Nutzer auf der AgentX-DeepSeek-V4-Pro-Workload gemessen worden. Bei diesem Betriebspunkt meldet das Unternehmen bis zu 30-mal höheren Durchsatz pro Megawatt als bei GB300 NVL72.

Der Vergleich ist keine allgemeine Aussage über jedes Modell oder jede Bereitstellung. Das zitierte Ergebnis ist an eine bestimmte Plattformkonfiguration, Workload und Interaktivitätszielgröße gebunden. NVIDIA sagt außerdem, dass die Messung die Vera-CPU-Leistung für Tool-Aufrufe noch nicht einschließe, sodass ein Teil des End-to-End-Agentensystems in der berichteten Zahl nicht enthalten sei.

Was NVIDIA im Inferenz-Stack verändert

NVIDIA schreibt das Ergebnis einer Kombination aus Hardware, Netzwerk und Software zu und nicht allein der Rubin-GPU. Das NVL72-Design schafft eine große Scale-up-Domäne, in der GPUs über Systeme der sechsten Generation von NVLink und NVLink Switch eine breitbandige, latenzarme Kommunikation teilen.

Diese Topologie unterstützt Techniken für Long-Context- und Mixture-of-Experts-Workloads. NVIDIA hebt verteiltes KV-Caching hervor, das bereits verarbeiteten Kontext über GPUs hinweg verfügbar hält, sowie KV-bewusstes Routing, das eine Anfrage zu Hardware lenken kann, auf der bereits relevante Cache-Daten liegen. Disaggregated Serving trennt Prefill, bei dem Kontext verarbeitet wird, von Decode, bei dem Antworten generiert werden, sodass jede Phase unabhängig skaliert werden kann.

Die Softwareebene umfasst NVIDIA TensorRT-LLM, NVIDIA Dynamo und CUDA-Kernels, die Rechenarbeit mit Inter-GPU-Kommunikation verbinden sollen. Das Unternehmen verweist außerdem auf NVFP4-Quantisierung sowie neuere Fähigkeiten von Tensor Cores und der Transformer Engine als Wege, den Speicherbedarf zu senken und den Token-Durchsatz zu steigern.

NVIDIAs DSX-MaxLPS-Energiemanagement-Technologie wird als weiterer Hebel dargestellt. Das Unternehmen sagt, es könne innerhalb desselben Megawatt-Budgets bis zu 40% mehr GPUs bereitstellen, indem es die Leistung auf GPU-, Rack- und Workload-Ebene steuert. NVIDIA behauptet außerdem separat, Rubin könne die Kosten pro Million Tokens auf der zitierten Workload um bis zu 35-mal gegenüber GB300 NVL72 senken.

Belege, Vergleiche und Grenzen

Dieselben AgentX-Daten zeichnen ein schrittweiseres Bild von NVIDIAs Generationensprüngen. NVIDIA berichtet, dass GB300 NVL72 beim DeepSeek V4 Pro 1.6T bis zu 15-mal den Durchsatz pro Megawatt von H200 NVL8 liefert und beim größeren Modell Kimi K3 2.8T bis zu 80-mal. Außerdem behauptet das Unternehmen, GB300 biete in dem zitierten Vergleich bis zu 10-mal niedrigere Kosten pro Million Tokens als H200.

Auch diese Zahlen werden von NVIDIA unter Verwendung der SemiAnalysis-Workload dargestellt. Der zugrunde liegende Benchmark soll Vergleiche realistischer machen, indem identischer Traffic nachgespielt wird, doch die Rubin-Messungen haben die in NVIDIAs Beiträgen genannte unabhängige Prüfung noch nicht durchlaufen. Leser sollten daher zwischen der Benchmark-Methodik und den daraus berichteten Leistungszahlen unterscheiden.

Die Behauptungen belegen auch nicht, dass jede Agenten-Workload einen 30-fachen Gewinn sehen wird. Die Ergebnisse können je nach Modellarchitektur, Kontextlänge, Cache-Wiederverwendung, Parallelität, Tool-Latenz, Quantisierungsparametern und erforderlicher Antwortgeschwindigkeit variieren. Ein Coding-Agent, der häufig auf einen Compiler oder eine externe API wartet, kann eher durch Software- und Orchestrierungs-Overhead als durch den reinen Beschleuniger-Durchsatz begrenzt sein.

Warum das Ergebnis für KI-Entwickler und Käufer wichtig ist

Für Betreiber von KI-Infrastruktur wird die Leistung pro Watt zunehmend zu einer Kapazitäts- und Stückkostenkennzahl, nicht nur zu einer Umweltgröße. Sollten sich die gemeldeten Gewinne in unabhängigen Tests bestätigen, könnte ein Rechenzentrumsbetreiber mehr gleichzeitige Agentensitzungen innerhalb eines festen Strombudgets bedienen oder dieselbe Kapazität mit weniger Beschleunigern und niedrigeren Betriebskosten bereitstellen.

Das könnte beeinflussen, wie Unternehmen KI-Fabriken für Coding-Assistenten, Forschungsagenten, Kundenservicesysteme und interne Automatisierung gestalten. Teams müssen möglicherweise den gesamten Workflow optimieren: Kontext-Caching, Prefill- und Decode-Scheduling, Modell-Routing, Latenz von Tool-Aufrufen und die Behandlung von Subagenten-Traffic. Die Auswahl einer schnelleren GPU ohne Anpassung dieser umliegenden Systeme könnte einen erheblichen Teil des behaupteten Nutzens ungenutzt lassen.

Die Ergebnisse erhöhen auch die Messlatte für Infrastrukturanbieter. Feste Tests mit 8K-Eingabe und 1K-Ausgabe bleiben für kontrollierte Vergleiche nützlich, sagen aber möglicherweise weniger über zustandsbehafteten Agenten-Traffic aus. Käufer, die eine KI-Plattform bewerten, sollten fragen, ob ihre Benchmarks Kontextwachstum, Tool-Pausen, Cache-Wiederverwendung und realistische Ziele für die Nutzererfahrung beibehalten.

Für Modellentwickler könnte die Betonung von Long-Context-Serving und Mixture-of-Experts-Ausführung ein infrastrukturbewussteres Design wichtiger machen. Quantisierung und Caching können die Kosten senken, bringen aber auch Kompromisse bei Qualität, Speicherverwaltung und Betrieb mit sich, die am tatsächlichen Agenten-Workflow und nicht aus einer einzelnen Durchsatzzahl abgeleitet getestet werden müssen.

Worauf man als Nächstes achten sollte

Das unmittelbarste Signal ist die Prüfung der Vera-Rubin-NVL72-AgentX-Ergebnisse durch SemiAnalysis. Eine unabhängige Veröffentlichung der Testkonfiguration, der Energieabrechnung, der Modelleinstellungen und der Interaktivitätsmessungen wird helfen zu bestimmen, wie reproduzierbar die 30x-Zahl ist.

Auch Benchmark-Ergebnisse über weitere Modelle hinweg werden wichtig sein. NVIDIA hebt DeepSeek V4 Pro und Kimi K3 besonders hervor, doch Agenten-Workloads unterscheiden sich stark hinsichtlich Kontextwachstum, Expert-Routing und Werkzeugnutzung. Ergebnisse bei anderen Coding-, Forschungs- und Unternehmensmodellen könnten zeigen, ob Rubins Vorteil breit oder auf bestimmte Bereitstellungsmuster konzentriert ist.

Auch Nachweise aus dem Einsatz werden ein weiterer Test sein. NVIDIAs Behauptungen beziehen sich auf Vorabmessungen und nicht auf offengelegte Produktionsresultate von Kunden. Käufer sollten nach validierten Kosten pro Million Tokens, anhaltender Leistung unter Cache-Druck und vollständiger End-to-End-Latenz suchen, die Tool-Aufrufe und CPU-seitige Orchestrierung einschließt.

Creati.ai-Perspektive

NVIDIAs Ankündigung ist vor allem deshalb wichtig, weil sie den Infrastrukturwettbewerb auf nützliche Agentenarbeit pro Energieeinheit neu rahmt. Die 30x-Behauptung im Titel ist noch kein unabhängiger Beleg, aber die AgentX-Methodik adressiert eine reale Schwäche älterer Inferenz-Benchmarks: Sie modellieren oft eine einzelne Anfrage statt des sich ausdehnenden, unterbrochenen Workflows, den ein KI-Agent erzeugt.

Für Entwickler und Unternehmenskäufer lautet die praktische Lehre, das gesamte Serving-System zu bewerten, nicht nur die Beschleuniger-Spezifikationen. Rubins berichteter Vorteil zählt nur dann, wenn Caching, Scheduling, Modellausführung und Tool-Orchestrierung ihn in geringere Latenz oder niedrigere Tokenkosten in der Produktion umsetzen können. Bis die Benchmark-Prüfung und breitere Einsätze vorliegen, sollten NVIDIAs Zahlen als wichtige Anbieterbehauptung und als Signal für die Richtung des Wettbewerbs bei der KI-Infrastruktur betrachtet werden.

Anzeigen