NVIDIA behauptet, dass Vera Rubin NVL72 bis zu 30-mal mehr Agentenarbeit pro Megawatt liefert

NVIDIA sagt, Vera Rubin NVL72 könne im Vergleich zu GB300 bis zu 30-mal mehr agentische KI-Durchsatzleistung pro Megawatt liefern und ziele damit auf die Kosten von Inferenz mit langem Kontext.

AI News

NVIDIA sagt, dass seine kommende Vera Rubin NVL72-Plattform bis zu 30-mal mehr agentische KI-Durchsatzleistung pro Megawatt liefern kann als die GB300 NVL72-Systeme des Unternehmens und damit einen möglichen Effizienzgewinn für Rechenzentren bietet, die zunehmend lange, werkzeugnutzende KI-Workflows ausführen.

Die Behauptung stammt aus frühen NVIDIA-Messungen mit der SemiAnalysis-Workload AgentX, die aufgezeichnete Coding-Sitzungen, erweiterten Kontext, Tool-Aufrufe und Sub-Agent-Aktivität beibehält. NVIDIA sagt, die Ergebnisse seien besonders relevant, da KI-Agenten sich von Einzeldialogen entfernen und beginnen, mehrstufige Forschungs-, Coding-, Kundenservice- und Entscheidungsunterstützungsaufgaben auszuführen.

Die Zahlen werden vom Anbieter berichtet und wurden bislang nicht unabhängig validiert. NVIDIA sagt, die Vera-Rubin-Ergebnisse warteten noch auf die Prüfung durch SemiAnalysis, und dass die Tests die Vera-CPU-Leistung für Tool-Aufrufe nicht einschließen.

Der Benchmark hinter NVIDIAs Behauptung

NVIDIAs Vergleich konzentriert sich auf Durchsatz pro Megawatt statt auf maximale Tokens pro Sekunde aus einer isolierten Inferenzanfrage. Dieser Unterschied ist wichtig für agentische Systeme, bei denen ein Modell wiederholt angesammelten Kontext lesen, externe Tools aufrufen, Teilaufgaben delegieren und die Ergebnisse zusammenführen kann.

Laut NVIDIA stellt AgentX diese Verhaltensweisen durch reale agentische Coding-Verläufe dar. Das Unternehmen sagt, der Benchmark enthalte Modelle wie Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 und DeepSeek V4 Pro, sodass die Leistung über verschiedene Modellarchitekturen und Workloads hinweg bewertet werden könne.

Bei DeepSeek V4 Pro berichtet NVIDIA, dass GB300 NVL72 bis zu 15-mal den Durchsatz pro Megawatt seiner Hopper-Architektur liefert. Vera Rubin soll diese Zahl dann im Vergleich zu GB300 NVL72 um bis zu weitere 30-mal erhöhen. Dies sind Maximalwerte für den genannten Workload und das genannte Modell, keine Garantie dafür, dass jede Bereitstellung denselben Zugewinn sehen wird.

NVIDIA berichtet außerdem von bis zu 35-mal niedrigeren Kosten pro Million Tokens im Vergleich zu GB300 NVL72. Das Unternehmen verknüpft diese Kennzahl mit der Ökonomie von KI-Fabriken, in denen die Stromkapazität begrenzt, wie viele GPUs betrieben werden können, und die Token-Kosten die Marge von Inferenzdiensten beeinflussen.

Warum Agenten-Workloads die Infrastrukturgleichung verändern

Eine herkömmliche Chat-Anfrage kann relativ kurze Ein- und Ausgaben umfassen. NVIDIA beschreibt typische Abläufe für Chat oder Dokumentenzusammenfassungen als etwa 1.000 bis 8.000 Tokens. Agentensitzungen können Hunderttausende von Eingabe-Tokens ansammeln, wenn frühere Schritte, Tool-Ergebnisse und Sub-Agent-Ausgaben für spätere Phasen verfügbar bleiben.

Das schafft ein anderes Systemproblem. Die Infrastruktur muss große Mengen an Kontext verarbeiten und dabei die Antwortgeschwindigkeit über viele unregelmäßige Anfragen hinweg aufrechterhalten. Ein Workload kann zudem zwischen Kontextverarbeitung, bekannt als Prefill, und Antwortgenerierung, oder Decode, wechseln. Werden beide Phasen identisch behandelt, können einige GPUs ungenutzt bleiben, während andere zum Engpass werden.

NVIDIAs Antwort kombiniert Hardware- und Softwaretechniken. Disaggregiertes Serving erlaubt es, Prefill- und Decode-Ressourcen getrennt zu skalieren, während Rate Matching versucht, die beiden Phasen zu synchronisieren. Verteilte KV-Cache-Systeme halten zuvor verarbeiteten Kontext über die GPU-Domäne hinweg verfügbar, und KV-bewusstes Routing kann eine Anfrage an Hardware senden, die bereits relevante zwischengespeicherte Daten hält.

Die Plattform setzt außerdem auf großskalige Expert Parallelism für Mixture-of-Experts-Modelle, CUDA-Kerne, die Rechen- und Kommunikationsvorgänge zusammenführen sollen, sowie NVFP4-Quantisierung, um den für Modellgewichte benötigten Speicher zu reduzieren. NVIDIA sagt, Tensor Cores der fünften Generation und seine Transformer Engine unterstützen beide Hauptphasen der Inferenz.

Belege, Vorbehalte und was bestätigt ist

Die stärksten Leistungsbehauptungen in dieser Geschichte stammen aus NVIDIAs eigenen Infrastruktur- und Entwickler-Blogs, nicht aus einem unabhängigen Benchmark-Bericht. Das Unternehmen führt das Workload-Design auf SemiAnalysis AgentX zurück, sagt aber, dass die Vera-Rubin-Ergebnisse noch auf die Prüfung durch SemiAnalysis warten. Das macht die Zahlen zu einem frühen Hinweis auf NVIDIAs Zielleistung, nicht zu einem abschließenden Branchenvergleich.

Der Vergleich ist auch in mehreren Punkten eingeschränkt. NVIDIA berichtet Maximalgewinne, daher können die Ergebnisse von Modellwahl, Kontextlänge, Anfrage-Mix, Batching, Softwareversionen und Energiemanagement-Einstellungen abhängen. Die genannten Vera-Rubin-Messungen schließen CPU-Arbeit für Tool-Aufrufe aus, einen wichtigen Teil produktiver Agenten. Reale Anwendungen können zudem beträchtliche Zeit damit verbringen, auf Datenbanken, APIs oder Unternehmenssysteme zu warten, statt Tokens zu erzeugen.

NVIDIA sagt, dass seine DSX MaxLPS-Technologie den Stromverbrauch auf GPU-, Rack- und Workload-Ebene steuern und bis zu 40 % mehr GPUs innerhalb desselben Megawatt-Budgets bereitstellen kann. Auch das ist eine Unternehmensbehauptung, und ihr praktischer Nutzen hängt von Kühlung, Rack-Design, Auslastung und dem Verhalten der eingesetzten Workloads ab.

Die Ökonomie der Architektur ist mit NVIDIAs breiterem Software-Stack verbunden, einschließlich TensorRT LLM und NVIDIA Dynamo. Das Unternehmen argumentiert, dass die NVL72-Scale-up-Domäne und die NVLink-Technologien der sechsten Generation die Kommunikationsbandbreite liefern, die für verteiltes Caching und Expert Parallelism nötig ist. Diese Designentscheidungen könnten die Leistung verbessern, verstärken aber auch die Abhängigkeit vom Hardware-, Netzwerk- und Software-Ökosystem von NVIDIA.

Was das Ergebnis für KI-Entwickler und Käufer bedeutet

Für KI-Anwendungsteams unterstreicht die Ankündigung, dass Agentenkosten nicht nur anhand des Preises einer einzelnen Modellantwort bewertet werden können. Ein Forschungsagent, der einen wachsenden Kontext wiederholt erneut nutzt, kann viel mehr Inferenzarbeit erzeugen als ein Chat-Assistent, selbst wenn der Nutzer nur eine einzige Endantwort sieht.

Infrastrukturteams müssen daher Kennzahlen wie Kosten pro abgeschlossener Aufgabe, Energie pro Workflow und Durchsatz unter realistischem Kontextwachstum verfolgen. Eine Plattform, die bei kurzen Prompts gut abschneidet, muss nicht effizient sein, wenn Agenten Tools aufrufen, Sub-Agenten starten oder lange Verläufe erneut durchsuchen.

Für Unternehmenskäufer ist die unmittelbare Frage nicht einfach, ob Vera Rubin schneller ist als GB300. Entscheidend ist, ob eine Organisation genug kontinuierlichen Agentenverkehr hat, um eine neue Plattform zu rechtfertigen, und ob ihre Anwendungen Funktionen wie Caching, Prefill-Decode-Trennung und Modellquantisierung nutzen können. Teams mit moderaten oder unvorhersehbaren Workloads könnten weiterhin gemeinsame Cloud-Inferenz bevorzugen, während große KI-Dienstanbieter und strombeschränkte Rechenzentren stärkere Anreize haben, Arbeit pro Megawatt zu optimieren.

Die Ankündigung wirft außerdem ein Problem der Software-Portabilität auf. NVIDIAs berichtete Gewinne hängen vom Co-Design über GPUs, NVLink, CUDA, TensorRT LLM und NVIDIA Dynamo ab. Entwickler, die diesen Stack nutzen, können mehr Optimierung erhalten, müssen aber möglicherweise zusätzliche Migrationsarbeit leisten, wenn sie Modelle oder Serving-Workloads später auf andere Beschleunigerplattformen verlagern.

Worauf als Nächstes zu achten ist

Das erste Signal wird die unabhängige Prüfung der SemiAnalysis-AgentX-Ergebnisse sein. Sie sollte klären, wie die Tests konfiguriert waren, welche Messungen die höchsten Gewinne lieferten und wie Vera Rubin sich über Modelle und Kontextlängen hinweg mit GB300 vergleicht.

Käufer sollten außerdem die Produktionsverfügbarkeit, systemweite Strommessungen und Ergebnisse beobachten, die CPU-basierte Tool-Orchestrierung einbeziehen. Diese Details helfen, die Token-Generierungseffizienz von der End-to-End-Agenteneffizienz zu unterscheiden.

Schließlich wird der Markt Deployments als Belege benötigen. Die aussagekräftigsten Vergleiche messen abgeschlossene Agentenaufgaben, Latenz, Zuverlässigkeit, Auslastung und die gesamten Betriebskosten über reale Workloads hinweg, statt sich nur auf den reinen Durchsatz zu stützen.

Creati.ai-Perspektive

NVIDIAs Ankündigung benennt einen realen Engpass bei der Bereitstellung von Agenten: Inferenz mit langem Kontext und mehreren Schritten kann den Rechenbedarf schneller vervielfachen, als es die sichtbare Zahl der Nutzeranfragen vermuten lässt. Arbeit pro Megawatt zu messen ist daher für groß angelegte Agenten relevanter als herkömmliche Chat-Benchmarks.

Aber die 30x-Zahl sollte als frühe, vom Anbieter kontrollierte Leistungsbehauptung betrachtet werden. Ihre Bedeutung wird von unabhängiger Replikation abhängen und davon, ob die Verbesserung die schwierigen Teile produktiver Agenten übersteht – Tool-Latenz, Orchestrierung, fehlgeschlagene Aufrufe, ungleichmäßiger Traffic und End-to-End-Kosten. Für Entwickler lautet die praktische Lehre, komplette Workflows jetzt zu benchmarken, bevor Infrastruktur allein auf Basis kurzer Kontext-Token-Raten gewählt wird.

Anzeigen