AWS、OpenAIモデルのBedrock上での比較はトークン価格ではなく成果で行うべきだと購入者に促す

AWSのベンチマークデータは、チームが品質、ターン数、手戻りを測定すれば、Amazon Bedrock上のOpenAIモデルが正答コストを下げられる可能性を示している。

AI News

Amazon Web Servicesは、Amazon Bedrock上でOpenAIモデルを選ぶ際の考え方を見直すようチームに求めており、100万トークンあたりの最安価格が必ずしも最も低い本番運用コストにつながるとは限らないと主張している。AWS Machine Learning Blogの新しい投稿で、同社はモデル精度、エージェントのターン回数、許容可能な作業のコストを比較するオープンソースのベンチマーク用ハーネスを公開した。

この分析は、Amazon Bedrock経由で利用可能な3つのOpenAIモデル——gpt-5.6-luna、gpt-5.6-terra、gpt-5.6-sol——を対象に、OpenAI API経由のgpt-5.4-miniとgpt-5.4-nanoと比較している。AWSによれば、目的はトークン価格を主な購入指標として扱うのではなく、正しい回答、合格した調査結果、または許容可能な専門業務成果物のコストを算出することだという。

この結果はベンダー報告であり、AWS独自のテストハーネスに基づいている。また、完全に統制された比較ではない。AWSは、Bedrockのモデルは推論を無効にして実行された一方、APIのベースラインはデフォルト設定を使用していたと説明している。同社は、モデルを決定する前に自社のワークロードでテストを再現するよう顧客に勧めている。

AWSがモデル選定の計算を再定義

AWSの主張は単純だ。実運用アプリケーションが支払うのはトークンではなく成果である。リクエスト単価が安いモデルでも、誤答したり、再試行が必要になったり、人間による修正を強いられたりすれば、結果として高くつく可能性がある。

この考えを検証するため、AWSは評価ロジックを一定に保ったまま、OpenAIのResponses APIの同じコードパスを5つのモデルで実行した。ベンチマークには、AIMEの数学、大学院レベルの科学問題であるGPQA Diamond、MMLU-Proが含まれている。AWSは、失敗した試行を含む総モデル費用を正答数で割り、観測された正答1件あたりのコストを推定した。

同社のサンプルでは、gpt-5.6-solがAIMEで75%の精度を達成し、gpt-5.4-miniの37%を上回った。また、報告されたGPQA DiamondとMMLU-Proの結果でも首位だった。AWSは、これらはサンプル結果であり普遍的な順位ではなく、信頼区間の推定がない限り小さな差は方向性の目安として扱うべきだと注意している。

価格面の結論は、AWSがAmazon Bedrock上のGPT-5.6 LunaとTerraについて2026年7月30日の値下げを引用した後に変わった。AWSは、結果ファイルの前提条件の下で、gpt-5.6-lunaのAIME正答1件あたりのコストを0.0021ドル、gpt-5.4-miniを0.0139ドルと報告した。投稿では、Lunaの観測上の正答1件あたりコストは、gpt-5.4-nanoを含むテスト対象の代替モデルより低かったとしている。

これらの数値を現在の普遍的な価格として読むべきではない。AWSは、適用されるAmazon Bedrockのリージョンと推論ティアをライブの価格ページで確認するよう明確に案内している。また、価格ページの更新が告知とすぐ一致しない場合があるとも記している。

エージェントの経路は表示価格を上回ることがある

分析のより重要な部分はAIエージェントに関するもので、ここでは各モデル呼び出しが増え続ける会話履歴を伴う可能性がある。AWSは、DeepSearchQAの50問サンプルを、実際のweb_searchとfetch_pageツールを使ってテストした。エージェントは保存を無効にしたまま自身の履歴を管理しており、これはシステムプロンプト、以前のツール結果、会話コンテキストが各ターンごとに再送されていたことを意味する。

この設計により、ターン数は直接のコスト要因かつ遅延要因になる。AWSによれば、エージェントがコンテキストを追加し続けると、累積入力は概ね二次的に増加しうる。同社のサンプルでは、gpt-5.4-miniは1問あたり平均7.6ターンで、主に繰り返しの検索ループが原因だった。入力量は1問あたり114,000トークンに達し、gpt-5.6-terraの50,000トークンを上回った。

AWSは、テストにおいてTerraの合格回答1件あたりのコストが0.31ドルで、miniの0.40ドルより低く、平均F1スコアも高かったと報告した。gpt-5.6-lunaについては、miniの0.40ドルに対して、合格回答1件あたり0.05ドルというさらに低いコストを報告している。Nanoは名目上のトークン価格は低かったが、質問の18%しか合格せず、観測された合格回答1件あたりコストは0.07ドルとなった。

このサンプルは50問しかないため、比較は決定的ではない。それでも、この結果は標準的な価格ページには載らないコスト変数、つまりモデルがツール使用ワークフローをどれだけ効率的に完了するかを浮き彫りにしている。

品質が専門業務の経済性を変える

AWSはまた、短答式ではなく職務上の成果物に基づくベンチマークであるGDPvalもテストした。48タスクのサンプルには、コンプライアンス向けブリーフ、財務計画、ケア手順書などの文書が含まれ、各出力は専門家が作成したルーブリックに従って採点された。

同社によると、推論を無効にした場合、3つのgpt-5.6構成はすべて、テストしたminiおよびnano構成より高いスコアを記録した。Lunaは48タスク中27件に合格し、miniの20件を上回った。報告された値下げ後、AWSはLunaの合格成果物1件あたりのコストを0.010ドルと算出し、miniは0.030ドル、nanoは0.012ドルだった。

この結果は、一般的なモデル品質のきれいな指標ではない。AWSによれば、職種カテゴリのサンプルは小さく、8,192トークンの出力上限によってLunaの成果物6件、Terraの9件、Solの7件、miniの0件、nanoの1件が途中で切り捨てられた。より高い出力上限なら、品質とコストの両方が変わる可能性がある。

とはいえ、企業の購入者にとって、このテストは実践的な問いを示している。代替案にレビュー、手戻り、またはエスカレーションが必要な場合、より高い合格率にどれだけの価値があるのか。より高価なモデルでも、下流コストを削減できれば経済的でありうる一方、低リスクの分類や下書き作業では、より安価なモデルが依然として望ましい場合もある。

結果がビルダーと企業に意味すること

投稿内でopenai-on-aws/benchmarks-openaiとして示されているAWSのベンチマークハーネスは、エンジニアリングチームが自分たちのプロンプトと受け入れ基準でモデル選択を評価する手段を提供する。これは、調査エージェントに最適なモデルが大量抽出パイプラインに最適とは限らず、ベンチマークスコアが企業のエラー許容度を反映しない可能性があるため重要だ。

AIエージェントを構築するチームは、トークン支出に加えて、ターン数、ツール呼び出し、入力増加、遅延、成功タスクのコストを追跡すべきだ。また、アプリケーションが保存済みコンテキストを再利用できるか、検索ループを制限できるか、ツール結果を要約できるか、難しいケースをより強力なモデルに振り分けられるかも判断すべきである。こうした制御は、基盤となるモデル価格とは独立に経済性を変えることができる。

製品チームにとって、より有用な単位は、承認済み文書、解決済みチケット、完了したワークフローあたりのコストかもしれない。そのためには、安定したルーブリックと、失敗出力、人手による編集、再試行、エスカレーション率の記録が必要だ。AWSによる決定論的チェックとLLMジャッジの利用は一つのアプローチを示しているが、同社自身の注意書きが示すように、評価設計は依然として導入問題の一部である。

今後注目すべき点

当面の焦点は、AWSの7月30日の価格変更がAmazon Bedrockの各リージョンと推論ティアで一貫して反映されるかどうかだ。購入者はまた、オープンソースのハーネスが、推論を有効にした状態、整合したモデル構成、より大きなサンプル、そして本番に近いコンテキスト管理戦略を用いた独立再現を得るかどうかにも注目すべきである。

追加の評価では、繰り返し実行時の信頼性、ツール使用の安全性、プロンプトインジェクション耐性、レイテンシ、出力切り捨て、人手レビューのコストを検証すべきだ。これらの指標によって、AWSがgpt-5.6-lunaと他のgpt-5.6モデルに対して報告した優位性は縮小するか、あるいは拡大する可能性がある。

Creati.aiの見解

AWSは、よくある調達の慣行に対して有用な修正を加えている。トークン価格は見える一方、失敗と手戻りのコストはアプリケーション全体に分散しているからだ。報告された結果は、特にツールを繰り返し呼び出し、蓄積されたコンテキストを再送するエージェントにおいて、ワークフロー単位でモデル選択を測ることの重要性を支持している。

ただし、証拠はなおAWS管理下であり、構成に特化している。最も強い教訓は、あるOpenAIモデルが普遍的に最安だということではない。むしろ、価格表にアーキテクチャを決めさせる前に、自分たちのワークロードで成功し、許容可能な結果のコストを検証すべきだということだ。

広告