NVIDIA behauptet, Vera Rubin NVL72 liefere bis zu 30-mal mehr Agentic Work pro Watt

NVIDIA sagt, Vera Rubin NVL72 könne pro Megawatt bis zu 30-mal mehr agentische Inferenz-Durchsatzleistung als GB300 liefern, vorbehaltlich einer unabhängigen Überprüfung des Benchmarks.

AI News

NVIDIA sagt, seine kommende Vera Rubin NVL72-Plattform könne pro Megawatt bis zu 30-mal mehr Agentic-AI-Durchsatz liefern als das GB300 NVL72-System des Unternehmens. Die Behauptung basiert auf Vorabergebnissen aus SemiAnalysis AgentX, einem Benchmark, der produktionsähnliche Coding-Agent-Sitzungen statt fest definierter Chatbot-Prompts nachbilden soll.

Das Ergebnis ist wichtig, weil KI-Agenten erheblich mehr Inferenzkapazität verbrauchen als gewöhnliche Chats. NVIDIAs Quellen verweisen auf OpenRouter-Daten, denen zufolge eine einzelne agentische Anfrage etwa 15-mal so viele Tokens wie eine einfache Chat-Anfrage nutzt, da Agenten wiederholt nachdenken, Werkzeuge aufrufen, Arbeit an Sub-Agenten delegieren und einen wachsenden Kontext durch eine Aufgabe tragen.

Der Vergleich für Vera Rubin ist noch kein unabhängig validiertes Ergebnis. NVIDIA hat die Zahlen mit dem SemiAnalysis-AgentX-Workload gemessen und sagt, die Resultate stünden noch unter SemiAnalysis-Prüfung. Damit ist die Ankündigung ein frühes, vom Anbieter gemeldetes Leistungssignal, kein bestätigter Branchen-Benchmark.

Ein Benchmark für Agenten-Workloads

AgentX ist Teil der InferenceX-Benchmark-Suite von SemiAnalysis. Laut dem NVIDIA Developer Blog werden aufgezeichnete Claude Code-Sitzungen über den AIPerf-Client erneut abgespielt, wobei die Abfolge von Modellaufrufen, Denkintervallen, Werkzeugnutzung, Kontextwachstum und Werkzeugaufruf-Latenz aus den ursprünglichen Trajektorien erhalten bleibt.

Dieses Design versucht, eine Schwäche konventioneller Inferenztests zu beheben. Statische Tests verwenden oft vorab festgelegte Eingabe- und Ausgabelängen, etwa einen Prompt mit 8.000 Tokens gefolgt von einer Antwort mit 1.000 Tokens. Reale Coding-Agenten erzeugen ungleichmäßigen Datenverkehr: Eine Aufgabe kann zwischen Modellüberlegungen, Dateioperationen, Suchen, Compiler-Ausgaben und weiteren Modellaufrufen wechseln, während der angesammelte Kontext mit der Zeit deutlich größer wird.

AgentX misst Tokens pro Megawatt zusammen mit Nutzererlebnis-Indikatoren wie Zeit bis zum ersten Token, End-to-End-Latenz und Interaktivität. NVIDIAs wichtigste Vera-Rubin-Zahl wurde mit 160 Tokens pro Sekunde pro Nutzer auf dem AgentX-DeepSeek-V4-Pro-Workload gemessen. Das Unternehmen sagt, Vera Rubin NVL72 habe an diesem Betriebspunkt bis zu 30-mal den KI-Fabrik-Durchsatz pro Megawatt von GB300 NVL72 erreicht.

Der Benchmark weist auch deutliche Gewinne für die aktuelle Blackwell-Generation aus. NVIDIA sagt, GB300 NVL72 liefere auf DeepSeek V4 Pro 1.6T bis zu 15-mal den Durchsatz pro Megawatt von H200 NVL8 und auf Kimi K3 2.8T bis zu 80-mal das Ergebnis. Diese Zahlen werden ebenfalls über NVIDIAs Berichterstattung zu den AgentX-Ergebnissen präsentiert und sollten entsprechend behandelt werden.

Die Infrastruktur hinter der Behauptung

NVIDIA führt die prognostizierten Effizienzgewinne auf eine Kombination aus Hardware-Scale und Software-Optimierung zurück, nicht allein auf die Rubin-GPU. Das NVL72-Design verbindet 72 GPUs in einem Scale-up-Domain-Verbund, sodass Workloads Modell-Experten verteilen und Kontext mit Hochbandbreiten-Verbindungen systemweit erhalten können.

Das ist für langlaufende Agenten wichtig, weil zuvor verarbeiteter Kontext oft wiederverwendet statt neu berechnet werden kann. NVIDIA beschreibt ein Serving-Design, das Prefill – also die Verarbeitung des eingehenden Kontexts – von Decode trennt, also von der Ausgabeerzeugung. Eine Angleichung der Raten zwischen diesen Phasen soll verhindern, dass eine Seite untätig bleibt, während die andere zum Engpass wird.

Das Unternehmen verweist außerdem auf verteiltes Key-Value-Caching, KV-bewusstes Request-Routing und Cache-Offloading in Host-Speicher oder Storage. Diese Techniken sollen relevante Teile einer wachsenden Agenten-Sitzung über mehrere Anfragen hinweg verfügbar halten. NVIDIA sagt, die NVLink-Technologie der sechsten Generation und NVLink Switch biete höhere Paketraten und geringere Latenz als herkömmliche Ethernet-Alternativen für diese Scale-up-Kommunikation.

Die Softwareschicht umfasst NVIDIA TensorRT-LLM, NVIDIA Dynamo und CUDA-Kerne, die für Mixture-of-Experts-Modelle optimiert sind. Der entwicklerorientierte Bericht nennt außerdem SGLang und vLLM als Serving-Runtimes, die im breiteren Optimierungsstack verwendet werden, sowie DeepGEMM-Kerne und Niedrigpräzisionsformate wie MXFP4 und MXFP8. NVIDIA sagt, NVFP4-Quantisierung auf Rubin sei darauf ausgelegt, den Speicherbedarf zu senken und den Durchsatz zu erhöhen, während die Ausgabequalität erhalten bleibe, auch wenn die vorgelegten Belege keine unabhängige Qualitätsbewertung liefern.

NVIDIA sagt ferner, seine DSX-MaxLPS-Technologien könnten den Stromverbrauch auf GPU-, Rack- und Workload-Ebene steuern und dadurch potenziell bis zu 40 % mehr GPUs innerhalb desselben Megawatt-Budgets ermöglichen. Das ist eine Kapazitätsplanungsbehauptung von NVIDIA, kein durch die AgentX-Zahlen allein bestätigtes Ergebnis.

Warum Builder und KI-Betreiber das beachten sollten

Für Teams, die Coding-Assistenten, Forschungsagenten oder Kundenservice-Automation entwickeln, lautet die relevante Kennzahl nicht mehr nur, wie schnell ein einzelner Prompt eine Antwort erzeugt. Ein Produktionsagent kann mehrere Modellaufrufe parallel aktiv halten, einen großen Kontext bewahren und pausieren, während externe Werkzeuge Daten zurückliefern. Infrastruktur, die bei kurzen, isolierten Anfragen gut abschneidet, kann daher in realen Workflows Energie verschwenden oder an Reaktionsfähigkeit verlieren.

Die Vera-Rubin-Ankündigung stellt Energieeffizienz zugleich als Einsatzgrenze und als Preisfrage dar. NVIDIA sagt, Vera Rubin NVL72 könne die Kosten pro Million Tokens im zitierten Workload gegenüber GB300 NVL72 um bis zu 35-mal senken. Der Developer Blog berichtet separat, dass GB300 im Vergleich zu H200 NVL8 Tokenkosten von bis zu 10-mal geringer liefern könne. Diese Berechnungen hängen von der Benchmark-Konfiguration, Energieannahmen und Auslastungsgraden ab, sodass Unternehmenskunden sie gegen ihre eigenen Modelle und Serving-Muster testen müssen.

Das Ergebnis könnte vor allem für Betreiber relevant sein, die große Mixture-of-Experts-Modelle oder Agenten mit ungewöhnlich langen Sitzungen bedienen. In solchen Umgebungen können Speicherbewegung, Cache-Wiederverwendung und Interconnect-Verhalten ebenso wichtig sein wie die reine Rechenleistung des Beschleunigers. Kleinere Teams sehen jedoch möglicherweise nicht dieselbe Wirtschaftlichkeit, wenn sie Modelle mit kurzem Kontext, geringe Parallelität oder gehostete APIs nutzen, die die zugrunde liegende Hardware verbergen.

Es gibt auch eine Zuverlässigkeitsfrage. Aggressiveres Caching, disaggregiertes Serving und Werkzeug-Orchestrierung können die Auslastung verbessern, erhöhen aber die Komplexität von Planung und Zustandsverwaltung. Builder müssen Fehlerbehebung, Cache-Invalidierung, Tail-Latenz und Workload-Isolation bewerten, statt sich auf Spitzenwerte bei Tokens pro Sekunde zu verlassen.

Worauf man als Nächstes achten sollte

Das erste Signal wird die Prüfung der Vera-Rubin-AgentX-Ergebnisse durch SemiAnalysis sein. Eine unabhängige Veröffentlichung der Testkonfiguration, Leistungsaufnahmen, Modellparameter und Interaktivitätsziele wird bestimmen, wie vergleichbar die 30x-Behauptung über Systeme hinweg ist.

Käufer sollten außerdem auf Ergebnisse achten, die die Rolle der Vera-CPU beim Tool-Calling enthalten. NVIDIA sagt ausdrücklich, dass die frühen Zahlen die Leistung der Vera-CPU für diesen Teil des Workflows noch nicht widerspiegeln. Da Agenten Zeit außerhalb der Modellgenerierung verbringen, können End-to-End-Messungen von Accelerator-only-Durchsatz abweichen.

Weitere nützliche Folgeinformationen sind Verfügbarkeit und Preisgestaltung für Vera Rubin NVL72, Leistung bei Modellen jenseits von DeepSeek V4 Pro sowie Ergebnisse von Betreibern, die ihre eigenen Traces statt aufgezeichneter Sitzungen ausführen. Änderungen am Software-Stack von NVIDIA könnten den Vergleich ebenfalls beeinflussen, da das Unternehmen sagt, dass sich sowohl Rubin- als auch GB300-Leistung durch fortlaufende Optimierung verbessern werden.

Creati.ai-Perspektive

Die Ankündigung von NVIDIA ist weniger deshalb wichtig, weil sie einen endgültigen 30x-Industrie-Standard festschreibt, sondern weil sie eine sich wandelnde Definition von Inferenzleistung hervorhebt. Agent-Workloads legen Engpässe offen, die feste Prompt-Tests übersehen können: Kontextwiederverwendung, Lücken bei Werkzeugaufrufen, Cache-Kapazität, Parallelität und Stromversorgung.

Die praktische Lehre für KI-Bauer ist, komplette Agenten-Verläufe zu benchmarken, bevor sie sich auf eine Infrastruktur festlegen. NVIDIAs frühe Ergebnisse deuten darauf hin, dass eng integrierte Hardware und Serving-Software die Wirtschaftlichkeit langlaufender Agenten erheblich verändern können, doch das Ausmaß dieses Vorteils bleibt unbestätigt, bis die zugrunde liegenden AgentX-Messungen unabhängig geprüft und reproduziert wurden.

Anzeigen