AWS benchmarkt 30B-MoE-Modelle auf SageMaker AI über G5, G6, G6e und G7 und zeigt, wie Blackwell Inferenzkosten und Latenz verbessern könnte.

Amazon Web Services verwendet zwei Mixture-of-Experts-Modelle mit 30 Milliarden Parametern, um GPU-Generationen für die produktive Inferenz auf Amazon SageMaker AI zu vergleichen. Der Benchmark des Unternehmens untersucht G5-, G6-, G6e- und neue G7-Konfigurationen hinsichtlich Durchsatz, Latenz und Kosten pro Token, wobei AWS berichtet, dass von NVIDIA Blackwell angetriebene G7-Instanzen für ausgewählte Workloads ein besseres Preis-Leistungs-Verhältnis liefern können.
Der Benchmark ist deshalb wichtig, weil die Modellgröße allein nicht die Ökonomie des Servings bestimmt. Quantisierung, Speicherbandbreite, Expert-Routing und der Serving-Software-Stack können alle beeinflussen, welche Instanz die praktischste Wahl ist. Die von AWS in seinem Machine Learning Blog veröffentlichten Ergebnisse sollten daher eher als Bereitstellungsstudie denn als universelles Ranking von GPU-Familien gelesen werden.
AWS testete Qwen3-Coder-30B-A3B-Instruct-FP8 für Coding-Anwendungsfälle, darunter Codegenerierung, Debugging, Refactoring und Developer-Copilots. Dieses Experiment vergleicht ml.g5.12xlarge-Instanzen mit NVIDIA A10G GPUs, ml.g6.12xlarge-Instanzen mit NVIDIA L4 GPUs und ml.g7.12xlarge-Instanzen mit RTX PRO 4500 Blackwell GPUs. Der Test verwendet den SageMaker AI DJL Large Model Inference Container.
Das zweite Szenario des Unternehmens nutzt NVIDIA Nemotron-3-Nano-30B-A3B-NVFP4 für Reasoning, Fragebeantwortung, Zusammenfassungen und agentische Workloads. Statt nur feste Endpunkte bereitzustellen, verwendet AWS SageMaker AI Generative AI Inference Recommendations mit vLLM, um G6-, G6e- und G7-Optionen zu bewerten und anhand eines ausgewählten Optimierungsziels eine Konfiguration zu bestimmen.
Dieser Unterschied ist wichtig. Der Test mit Qwen3-Coder-30B stellt einen direkten Vergleich bereitgestellter Endpunkte unter einer erwarteten Coding-Workload dar. Der Versuch mit Nemotron-3-Nano-30B repräsentiert einen automatisierten Empfehlungsvorgang, bei dem SageMaker AI Kandidatenkonfigurationen bewertet und sie anhand von Metriken wie Kosten, Latenz und Durchsatz einordnet.
Die Konfigurationen enthalten keine gleich großen Mengen an GPU-Speicher. Beim Vergleich mit Qwen3-Coder-30B verwenden die G5- und G6-Instanzen jeweils vier GPUs mit insgesamt 96 GB GPU-Speicher, während die G7-Konfiguration zwei GPUs mit 64 GB nutzt. AWS stellt dieses Ungleichgewicht als Teil des Tests dar: Die neuere Instanz wird trotz weniger Beschleuniger und weniger Gesamtspeicher bewertet.
Der zweite Vergleich ist ebenfalls unausgewogen. Das G6-Setup hat vier L4-GPUs und 96 GB Gesamtspeicher, G6e hat vier L40S-GPUs und 192 GB, und G7 hat zwei GPUs mit 64 GB. Damit nähert sich der Versuch eher einem Produktionsauswahlproblem als einem einfachen Generation-über-Generation-Benchmark. Eine Konfiguration, die bei Preis-Leistung gewinnt, kann dennoch ungeeignet sein, wenn das Modell, die Gewichte oder der Laufzeitstatus nicht in den verfügbaren Speicher passen.
AWS verweist auf zwei Hardwareeigenschaften hinter dem möglichen G7-Vorteil. Erstens verwendet G7 NVIDIA Blackwell GPUs, die native Unterstützung für Niedrigpräzisionsformate einschließlich NVFP4 bieten. Zweitens bietet die Architektur Speicher- und Rechenfähigkeiten, die die Token-Generierung verbessern sollen. AWS sagt, dass die anderen getesteten Generationen NVFP4-Gewichte ausführen können, jedoch ohne die gleiche Hardwarebeschleunigung.
Für MoE-Modelle argumentiert AWS, dass Speicherbandbreite besonders während des Decodings relevant ist, da pro Token nur ein Teil der Experten aktiviert wird. Dadurch können Datenbewegung und Inter-Token-Latenz wichtiger werden als die bloße Parameternummer des Modells. Das praktische Ergebnis hängt vom Workload ab: Ein Modell, das von Niedrigpräzisionsbeschleunigung profitiert, kann eine andere Instanzpräferenz zeigen als eines, das durch Speicherkapazität oder ein bestimmtes Serving-Framework begrenzt ist.
Die verfügbare Evidenz stammt aus AWS’ eigenem technischen Beitrag und den begleitenden Walkthroughs. AWS gibt an, dass die G7-Tests messbare Verbesserungen bei Durchsatz, Latenz und Kosten pro Token zeigen und beschreibt G7 als potenziellen Preis-Leistungs-Führer für die getesteten Anwendungsfälle. Das sind vom Anbieter berichtete Ergebnisse, keine unabhängige Bewertung und kein Benchmark über mehrere Cloud-Anbieter hinweg.
Das bereitgestellte Quellmaterial enthält keine zugrunde liegenden numerischen Ergebnisse, keine Testdauer, keine Verteilung der Anfragen, keine Parallelitätsstufen, keine regionalen Preise und keine detaillierten Tabellen zu Kosten pro Token. Daher lässt sich nicht feststellen, wie groß die Gewinne sind, wie konsistent sie auftreten oder ob dasselbe Ergebnis auch für andere Modelle und Verkehrsmuster gelten würde.
Die Ergebnisse werden außerdem durch die gewählte Software geprägt. Qwen3-Coder-30B wird über den DJL Large Model Inference Container bewertet, während der Workflow für Nemotron-3-Nano-30B vLLM und das Empfehlungstool von SageMaker AI nutzt. Änderungen bei Batching, Scheduling, Quantisierung, Kontextlänge oder Anfrageparallelität könnten das Ergebnis verändern. Käufer sollten den Test mit ihren eigenen Prompts und Service-Level-Zielen reproduzieren, bevor sie die Empfehlung von AWS als Produktionsentscheidung behandeln.
AWS sagt, dass die Empfehlungsfunktion Kandidatenkonfigurationen auf realer GPU-Infrastruktur ausführt und validierte, einsatzbereite Vorschläge auf Grundlage der gemessenen Leistung zurückgibt. Dennoch bezieht sich „validiert“ in diesem Zusammenhang auf den Benchmark-Workflow des Dienstes, nicht auf eine unabhängige Zertifizierung der Modellqualität, Sicherheit oder geschäftlichen Eignung.
Für Entwickler ist die unmittelbare Lehre, die komplette Serving-Konfiguration zu benchmarken, statt Hardware nur anhand eines GPU-Datenblatts auszuwählen. Ein Team, das einen Coding-Assistenten bereitstellt, sollte Zeit bis zum ersten Token, Inter-Token-Latenz, nachhaltigen Durchsatz und Kosten unter realistischer Parallelität messen. Ein Team, das eine agentische Anwendung baut, muss kurze Prompts und stoßweisen Verkehr möglicherweise anders gewichten als einen Batch-Zusammenfassungsdienst.
Der Empfehlungspfad von SageMaker AI könnte die manuelle Arbeit reduzieren, die mit dem Testen mehrerer Instanzfamilien verbunden ist, insbesondere für Teams, die bereits Endpunkte auf AWS verwalten. Er ersetzt jedoch nicht die Notwendigkeit, den Workload präzise zu definieren. Ein falsches Verkehrsprofil oder Optimierungsziel kann eine technisch gültige, aber für die Produktion schlecht passende Empfehlung erzeugen.
Speicher bleibt eine Bereitstellungsgrenze. Der geringere Gesamtspeicher von G7 in den Beispielen kann es für Modelle attraktiv machen, die effizient über FP8 oder NVFP4 passen, aber weniger geeignet für Deployments sein, die größere Kontextfenster, umfangreiche Key-Value-Caches oder zusätzliche Modellkomponenten erfordern. Der größere Speicherbedarf von G6e kann bevorzugt bleiben, wenn Kapazität wichtiger ist als reine Token-Ökonomie.
Für Unternehmenskunden zeigt der Vergleich außerdem ein Portabilitätsrisiko. Der Wert der NVIDIA-Blackwell-Beschleunigung hängt von unterstützten Formaten, Modellimplementierungen und der Reife der Laufzeitumgebung ab. Teams, die ein Modell standardisieren, sollten prüfen, ob ihr bevorzugter Quantisierungspfad und Inferenz-Engine die Hardware effektiv nutzen, statt anzunehmen, dass eine neuere GPU automatisch die gesamten Serving-Kosten senkt.
Am nützlichsten wäre es, wenn AWS die vollständigen Benchmark-Tabellen veröffentlicht, einschließlich Durchsatz, Zeit bis zum ersten Token, Inter-Token-Latenz, Parallelität, regionaler Preise und Kosten pro Token für jede Konfiguration. Diese Zahlen würden zeigen, ob der Vorteil von G7 breit angelegt oder auf bestimmte Workload-Formen konzentriert ist.
Teams sollten auch die Verfügbarkeit von G7 beobachten. AWS weist darauf hin, dass G7 in der beschriebenen Konfiguration allgemein in US East (Ohio) und US West (Oregon) verfügbar ist, wodurch regionale Kapazität und Anforderungen an die Datenresidenz Teil der Kaufentscheidung werden.
Weitere Vergleiche sollten längere Kontexte, unterschiedliche Batchgrößen, zusätzliche Quantisierungsformate und Modelle außerhalb der zwei ausgewählten 30B-MoE-Beispiele testen. Eine unabhängige Replikation über mehrere Clouds hinweg würde eine stärkere Grundlage dafür bieten, zu beurteilen, ob der Vorteil von Blackwell verschiedene Preis- und Softwareumgebungen übersteht.
AWS kündigt kein neues Modell und keinen universellen Ersatz für G5 und G6 an. Das Unternehmen formuliert vielmehr einen engeren, aber wichtigen Infrastrukturpunkt: Neuere Beschleuniger können die Ökonomie des Servings kleiner und mittelgroßer LLMs verändern, wenn Modell und Laufzeitumgebung die richtigen Niedrigpräzisions- und Speicherbandbreiten-Vorteile freisetzen.
Das stärkste Signal für KI-Teams ist die Verschiebung hin zu workload-spezifischer, automatisierter Instanzauswahl. Da die veröffentlichten Belege jedoch von AWS kontrolliert werden und in dem bereitgestellten Material die numerischen Benchmark-Details fehlen, sollten Käufer die gemeldeten G7-Gewinne als Ausgangshypothese behandeln. Der Produktionssieger hängt von Modellanpassung, Latenzzielen, Verkehrsmuster, regionaler Verfügbarkeit und den Kosten für den Betrieb des gesamten Inferenz-Stacks ab.