AWS-Benchmarkdaten deuten darauf hin, dass OpenAI-Modelle auf Amazon Bedrock die Kosten für korrekte Antworten senken können, wenn Teams Qualität, Anzahl der Durchläufe und Nacharbeit messen.

Amazon Web Services fordert Teams auf, ihre Auswahl von OpenAI-Modellen auf Amazon Bedrock neu zu überdenken, und argumentiert, dass der niedrigste Preis pro Million Tokens nicht unbedingt die niedrigsten Produktionskosten erzeugt. In einem neuen Beitrag im AWS Machine Learning Blog veröffentlichte das Unternehmen ein Open-Source-Benchmarking-Framework, das Modellgenauigkeit, die Anzahl der Agenten-Durchläufe und die Kosten akzeptabler Arbeit vergleicht.
Die Analyse umfasst drei OpenAI-Modelle, die über Amazon Bedrock verfügbar sind — gpt-5.6-luna, gpt-5.6-terra und gpt-5.6-sol — und vergleicht sie mit gpt-5.4-mini und gpt-5.4-nano über die OpenAI API. AWS sagt, das Ziel sei es, die Kosten für eine richtige Antwort, ein bestandenes Forschungsergebnis oder ein akzeptables professionelles Deliverable zu berechnen, statt die Token-Preise als zentrale Kaufmetrik zu behandeln.
Die Ergebnisse stammen vom Anbieter und aus dem eigenen Test-Framework von AWS. Es handelt sich außerdem nicht um einen vollständig kontrollierten Vergleich: AWS sagt, die Bedrock-Modelle liefen mit deaktiviertem Reasoning, während die API-Baselines ihre Standardkonfiguration verwendeten. Das Unternehmen rät Kunden, die Tests mit ihren eigenen Workloads zu reproduzieren, bevor sie eine Modellentscheidung treffen.
Das Argument von AWS ist einfach: Produktionsanwendungen zahlen für Ergebnisse, nicht für Tokens. Ein Modell, das pro Anfrage günstiger ist, kann teurer werden, wenn es falsche Antworten liefert, Wiederholungen erfordert oder einen Menschen zwingt, seine Ausgabe zu korrigieren.
Um diese Idee zu testen, führte AWS denselben OpenAI-Responses API-Codepfad über fünf Modelle aus und hielt dabei die Bewertungslogik konstant. Der Benchmark umfasste AIME-Mathematik, GPQA Diamond auf Graduiertenniveau und MMLU-Pro. AWS teilte die gesamten Modellkosten — einschließlich fehlgeschlagener Versuche — durch die Zahl der richtigen Antworten, um die beobachteten Kosten pro korrekter Antwort zu schätzen.
In einem Beispiel des Unternehmens erreichte gpt-5.6-sol 75 % Genauigkeit bei AIME, verglichen mit 37 % für gpt-5.4-mini. Es führte auch die gemeldeten Ergebnisse bei GPQA Diamond und MMLU-Pro an. AWS warnt jedoch, dass dies Beispielergebnisse und keine universelle Rangliste sind und dass kleine Unterschiede als richtungsweisend behandelt werden sollten, sofern keine Unsicherheitsabschätzungen vorliegen.
Die Preisbewertung änderte sich nach dem von AWS genannten Preisnachlass vom 30. Juli 2026 für GPT-5.6 Luna und Terra auf Amazon Bedrock. AWS meldete Kosten von 0,0021 US-Dollar pro korrekter AIME-Antwort für gpt-5.6-luna gegenüber 0,0139 US-Dollar für gpt-5.4-mini unter den Annahmen in seinen Ergebnisdateien. Der Beitrag sagt, dass die beobachteten Kosten pro korrekter Antwort bei Luna niedriger waren als bei den getesteten Alternativen, einschließlich gpt-5.4-nano.
Diese Zahlen sollten nicht als aktuelle allgemeingültige Preise gelesen werden. AWS weist Leser ausdrücklich darauf hin, die jeweilige Amazon-Bedrock-Region und Inferenzstufe mit der Live-Preisseite abzugleichen. Der Beitrag merkt außerdem an, dass Aktualisierungen der Preisseite nicht sofort mit einer Ankündigung übereinstimmen müssen.
Der wichtigere Teil der Analyse betrifft KI-Agenten, bei denen jeder Modellaufruf einen wachsenden Gesprächsverlauf mit sich bringen kann. AWS testete eine Stichprobe von 50 Fragen aus DeepSearchQA mit den Live-Tools web_search und fetch_page. Der Agent verwaltete seinen eigenen Verlauf, während Speicher deaktiviert war, was bedeutet, dass Systemprompt, frühere Tool-Ergebnisse und Gesprächskontext bei jedem Durchlauf erneut gesendet wurden.
Dieses Design macht die Anzahl der Durchläufe zu einem direkten Kosten- und Latenzfaktor. AWS sagt, dass die kumulative Eingabe ungefähr quadratisch wachsen kann, wenn ein Agent weiter Kontext hinzufügt. In der Stichprobe benötigte gpt-5.4-mini im Schnitt 7,6 Durchläufe pro Frage, größtenteils wegen wiederholter Suchschleifen. Sein Eingabevolumen erreichte 114.000 Tokens pro Frage, verglichen mit 50.000 bei gpt-5.6-terra.
AWS berichtete, dass Terra im Test 0,31 US-Dollar pro bestandener Antwort kostete, verglichen mit 0,40 US-Dollar für mini, und dabei einen höheren mittleren F1-Score erzielte. Für gpt-5.6-luna meldete das Unternehmen sogar nur 0,05 US-Dollar pro bestandener Antwort, gegenüber 0,40 US-Dollar für mini. Nano hatte zwar einen niedrigeren nominalen Tokenpreis, bestand jedoch nur 18 % der Fragen, was zu beobachteten Kosten von 0,07 US-Dollar pro bestandener Antwort führte.
Die Stichprobe umfasste nur 50 Fragen, daher sind die Vergleiche nicht abschließend. Dennoch verdeutlicht das Ergebnis eine Kostenvariable, die auf einer normalen Preisseite nicht erscheint: wie effizient ein Modell einen Workflow mit Werkzeugnutzung abschließt.
AWS testete außerdem GDPval, einen Benchmark, der auf beruflichen Deliverables statt auf Kurzantworten basiert. Die Stichprobe mit 48 Aufgaben umfasste Dokumente wie Compliance-Briefings, Finanzpläne und Pflegeprotokolle, wobei jede Ausgabe anhand eines von Fachleuten verfassten Rubrikschemas bewertet wurde.
Das Unternehmen berichtete, dass alle drei gpt-5.6-Konfigurationen höhere Werte erzielten als die getesteten mini- und nano-Konfigurationen, wenn Reasoning deaktiviert war. Luna bestand 27 von 48 Aufgaben, verglichen mit 20 bei mini. Nach der gemeldeten Preissenkung berechnete AWS Lunas Kosten pro bestandenem Deliverable mit 0,010 US-Dollar, verglichen mit 0,030 US-Dollar für mini und 0,012 US-Dollar für nano.
Das Ergebnis ist kein sauberer Maßstab für die allgemeine Modellqualität. AWS sagt, die beruflichen Kategorien hätten kleine Stichproben gehabt, und das Ausgabelimit von 8.192 Tokens verkürzte sechs Luna-, neun Terra-, sieben Sol-, null mini- und ein nano-Deliverable. Ein höheres Ausgabelimit könnte sowohl Qualität als auch Kosten verändern.
Für Unternehmenskäufer weist der Test jedoch auf eine praktische Frage hin: Wie viel ist eine höhere Bestehensquote wert, wenn die Alternative Prüfung, Nacharbeit oder Eskalation erfordert? Ein teureres Modell kann wirtschaftlich sein, wenn es diese Folgekosten senkt, während ein günstigeres Modell für risikoarme Klassifizierungs- oder Entwurfsaufgaben weiterhin vorzuziehen sein kann.
Das von AWS im Beitrag als openai-on-aws/benchmarks-openai bezeichnete Benchmarking-Framework gibt Engineering-Teams die Möglichkeit, die Modellwahl anhand ihrer eigenen Prompts und Akzeptanzkriterien zu bewerten. Das ist wichtig, weil das beste Modell für einen Forschungsagenten nicht unbedingt das beste Modell für eine Pipeline mit hohem Extraktionsvolumen ist und ein Benchmark-Score möglicherweise nicht die Fehlertoleranz eines Unternehmens widerspiegelt.
Teams, die KI-Agenten bauen, sollten neben den Token-Kosten auch Durchläufe, Tool-Aufrufe, Eingabewachstum, Latenz und die Kosten erfolgreicher Aufgaben verfolgen. Sie sollten außerdem entscheiden, ob ihre Anwendung gespeicherten Kontext wiederverwenden, Suchschleifen begrenzen, Tool-Ergebnisse zusammenfassen oder schwierige Fälle an ein stärkeres Modell weiterleiten kann. Diese Maßnahmen können die Wirtschaftlichkeit unabhängig vom zugrunde liegenden Modellpreis verändern.
Für Produktteams könnte die nützlichere Einheit die Kosten pro freigegebenem Dokument, gelöstem Ticket oder abgeschlossenem Workflow sein. Das erfordert ein stabiles Bewertungsschema und eine Dokumentation fehlgeschlagener Ausgaben, menschlicher Bearbeitungen, Wiederholungen und Eskalationsraten. AWS’ Einsatz deterministischer Prüfungen und eines LLM-Judges zeigt einen Ansatz, doch die eigenen Vorbehalte des Unternehmens machen deutlich, warum Evaluationsdesign Teil des Bereitstellungsproblems bleibt.
Das unmittelbare Signal ist, ob sich die Preisänderungen vom 30. Juli von AWS konsistent in allen Amazon-Bedrock-Regionen und Inferenzstufen widerspiegeln. Käufer sollten außerdem beobachten, ob das Open-Source-Framework unabhängige Reproduktionen mit aktiviertem Reasoning, angepassten Modellkonfigurationen, größeren Stichproben und produktionsähnlichen Strategien zur Kontextverwaltung erhält.
Weitere Bewertungen sollten Zuverlässigkeit über wiederholte Läufe, Sicherheit bei der Werkzeugnutzung, Widerstand gegen Prompt-Injection, Latenz, Ausgabetrunkierung und die Kosten menschlicher Überprüfung testen. Diese Messgrößen könnten den von AWS berichteten Vorteil für gpt-5.6-luna und die anderen gpt-5.6-Modelle verringern — oder vergrößern.
AWS korrigiert hier eine verbreitete Beschaffungsgewohnheit sinnvoll: Der Token-Preis ist sichtbar, während Ausfall- und Nacharbeitskosten über die Anwendung verteilt anfallen. Die berichteten Ergebnisse sprechen dafür, die Modellwahl auf Workflow-Ebene zu messen, insbesondere bei Agenten, die wiederholt Tools aufrufen und angesammelten Kontext erneut senden.
Die Belege bleiben jedoch von AWS kontrolliert und konfigurationsspezifisch. Die stärkste Erkenntnis ist nicht, dass ein bestimmtes OpenAI-Modell universell am günstigsten ist. Vielmehr sollten Entwickler die Kosten eines erfolgreichen, akzeptablen Ergebnisses auf ihrem eigenen Workload testen, bevor eine Preistabelle über die Architektur entscheidet.