AWS 的基準資料顯示,當團隊衡量品質、回合數與重工成本時,Amazon Bedrock 上的 OpenAI 模型可降低正確答案的成本。

Amazon Web Services 要求團隊重新思考如何在 Amazon Bedrock 上選擇 OpenAI 模型,並主張每百萬 token 的最低價格未必能帶來最低的生產成本。在 AWS Machine Learning Blog 的一篇新文章中,該公司發布了一個開源基準測試工具,用來比較模型準確度、代理回合數,以及可接受工作的成本。
這項分析涵蓋透過 Amazon Bedrock 提供的三個 OpenAI 模型——gpt-5.6-luna、gpt-5.6-terra 與 gpt-5.6-sol——並透過 OpenAI API 與 gpt-5.4-mini 和 gpt-5.4-nano 比較。AWS 表示,目標是計算正確答案、通過的研究結果,或可接受的專業交付成果的成本,而不是把 token 定價視為主要採購指標。
這些結果由供應商回報,來自 AWS 自家的測試工具。這也不是一個完全受控的比較:AWS 表示 Bedrock 模型是在關閉 reasoning 的情況下執行,而 API 基準則使用其預設設定。該公司建議客戶在做出模型決策前,先以自己的工作負載重現測試。
AWS 的論點很直接:生產環境應用支付的是成果,而不是 token。若某個模型每次請求較便宜,但會答錯、需要重試,或迫使人工修正輸出,總成本就可能更高。
為了驗證這個想法,AWS 在五個模型上執行相同的 OpenAI Responses API 程式路徑,並保持其評估邏輯不變。基準測試包含 AIME 數學、研究所程度的 GPQA Diamond 科學題,以及 MMLU-Pro。AWS 以總模型支出(包含失敗嘗試)除以正確答案數,來估算觀察到的每個正確答案成本。
在該公司的樣本中,gpt-5.6-sol 在 AIME 上達到 75% 準確率,而 gpt-5.4-mini 為 37%。它也在 GPQA Diamond 與 MMLU-Pro 的報告結果中居首。AWS 提醒,這些只是樣本結果,並非普遍排名;若沒有不確定性估計,微小差異應視為方向性指標。
在 AWS 提到 2026 年 7 月 30 日 Amazon Bedrock 上 GPT-5.6 Luna 與 Terra 的降價後,價格結論也隨之改變。AWS 在其結果檔案的假設下,報告 gpt-5.6-luna 的 AIME 正確答案成本為 0.0021 美元,而 gpt-5.4-mini 為 0.0139 美元。文章指出,Luna 的觀察到每個正確答案成本低於受測替代方案,包括 gpt-5.4-nano。
這些數字不應被視為當前的普遍價格。AWS 明確提醒讀者,應對照即時價格頁確認適用的 Amazon Bedrock 區域與推論層級。文章也指出,價格頁更新未必會立即與公告同步。
分析中更關鍵的部分是 AI 代理,在這裡每一次模型呼叫都可能帶著不斷增長的對話歷史。AWS 使用實際的 web_search 與 fetch_page 工具,測試了來自 DeepSearchQA 的 50 題樣本。該代理在關閉儲存的情況下管理自己的歷史,這表示系統提示、先前的工具結果,以及對話上下文,都會在每一回合重新送出。
這種設計使回合數成為直接的成本與延遲因素。AWS 表示,隨著代理不斷加入上下文,累積輸入量可能近似二次成長。在其樣本中,gpt-5.4-mini 每題平均 7.6 回合,主要是因為重複的搜尋迴圈。其輸入量每題達到 114,000 token,相較之下 gpt-5.6-terra 為 50,000 token。
AWS 報告指出,Terra 在測試中每個通過答案成本為 0.31 美元,而 mini 為 0.40 美元,同時平均 F1 分數更高。gpt-5.6-luna 的每個通過答案成本甚至更低,為 0.05 美元,而 mini 為 0.40 美元。Nano 的名目 token 價格較低,但只通過了 18% 的題目,因此觀察到的每個通過答案成本為 0.07 美元。
由於樣本只有 50 題,這些比較並不具決定性。不過,結果凸顯了一個標準價格頁上看不到的成本變數:模型完成一個使用工具的工作流程有多有效率。
AWS 也測試了 GDPval,這是一個圍繞職業交付成果而非簡答題所建立的基準。其 48 個任務樣本涵蓋合規簡報、財務計畫與照護流程等文件,每個輸出都依照由專業人士撰寫的評分標準進行評分。
該公司表示,在關閉 reasoning 的情況下,三種 gpt-5.6 組態的分數都高於受測的 mini 與 nano 組態。Luna 在 48 個任務中通過 27 個,高於 mini 的 20 個。在報告的降價之後,AWS 計算 Luna 每個通過交付成果的成本為 0.010 美元,而 mini 為 0.030 美元、nano 為 0.012 美元。
這個結果並不能乾淨地衡量整體模型品質。AWS 表示,職業類別的樣本很小,而且 8,192 token 的輸出上限使 Luna、Terra、Sol、mini、nano 的交付成果分別有 6、9、7、0、1 件被截斷。更高的輸出上限可能同時改變品質與成本。
不過,對企業買家而言,這項測試指出了一個實際問題:當替代方案需要審查、重工或升級處理時,更高的通過率值多少錢?若能降低下游成本,較昂貴的模型仍可能經濟划算;而對低風險的分類或草稿工作來說,較便宜的模型也可能依然更適合。
AWS 在文章中標示為 openai-on-aws/benchmarks-openai 的基準測試工具,讓工程團隊能用自己的提示詞與接受標準來評估模型選擇。這很重要,因為研究型代理的最佳模型,未必也是高吞吐量擷取管線的最佳模型,而基準分數也未必反映企業對錯誤的容忍度。
打造 AI 代理的團隊,除了 token 支出之外,還應追蹤回合數、工具呼叫、輸入增長、延遲,以及成功任務的成本。他們也應決定應用程式是否能重用儲存的上下文、限制搜尋迴圈、摘要工具結果,或將困難案例路由到更強的模型。這些控制可在不依賴底層模型價格的情況下改變經濟性。
對產品團隊來說,更有用的單位可能是每份核准文件、每個已解決工單或每個完成工作流程的成本。這需要穩定的評分標準,以及對失敗輸出、人工作業修改、重試與升級率的記錄。AWS 使用確定性檢查與 LLM 裁判展示了一種做法,但該公司自身的警告也顯示,評估設計仍是部署問題的一部分。
當前最直接的訊號是,AWS 於 7 月 30 日的價格變動是否會在 Amazon Bedrock 各區域與推論層級中一致反映。買家也應觀察開源工具是否能在啟用 reasoning、匹配模型組態、更大樣本,以及接近生產環境的上下文管理策略下,獲得獨立重現。
後續評估還應測試重複執行的可靠性、工具使用安全性、對 prompt injection 的抵抗力、延遲、輸出截斷,以及人工審查的成本。這些指標可能縮小——或擴大——AWS 對 gpt-5.6-luna 及其他 gpt-5.6 模型所報告的優勢。
AWS 對常見採購習慣做出了有益修正:token 價格看得見,而失敗與重工成本則分散在整個應用程式中。報告結果支持在工作流程層級衡量模型選擇,尤其是對會重複呼叫工具並重送累積上下文的代理而言。
但這些證據仍由 AWS 控制,且與特定設定有關。最強的結論不是某一個 OpenAI 模型普遍最便宜,而是建構者應先在自己的工作負載上測試成功且可接受結果的成本,再讓價格表決定架構。