AWS 呼籲買家以成果而非 token 價格衡量 Bedrock 上的 OpenAI 模型

AWS 的基準資料顯示,當團隊衡量品質、回合數與重工成本時,Amazon Bedrock 上的 OpenAI 模型可降低正確答案的成本。

AI News

Amazon Web Services 要求團隊重新思考如何在 Amazon Bedrock 上選擇 OpenAI 模型,並主張每百萬 token 的最低價格未必能帶來最低的生產成本。在 AWS Machine Learning Blog 的一篇新文章中,該公司發布了一個開源基準測試工具,用來比較模型準確度、代理回合數,以及可接受工作的成本。

這項分析涵蓋透過 Amazon Bedrock 提供的三個 OpenAI 模型——gpt-5.6-luna、gpt-5.6-terra 與 gpt-5.6-sol——並透過 OpenAI API 與 gpt-5.4-mini 和 gpt-5.4-nano 比較。AWS 表示,目標是計算正確答案、通過的研究結果,或可接受的專業交付成果的成本,而不是把 token 定價視為主要採購指標。

這些結果由供應商回報,來自 AWS 自家的測試工具。這也不是一個完全受控的比較:AWS 表示 Bedrock 模型是在關閉 reasoning 的情況下執行,而 API 基準則使用其預設設定。該公司建議客戶在做出模型決策前,先以自己的工作負載重現測試。

AWS 重新框定模型選擇的計算方式

AWS 的論點很直接:生產環境應用支付的是成果,而不是 token。若某個模型每次請求較便宜,但會答錯、需要重試,或迫使人工修正輸出,總成本就可能更高。

為了驗證這個想法,AWS 在五個模型上執行相同的 OpenAI Responses API 程式路徑,並保持其評估邏輯不變。基準測試包含 AIME 數學、研究所程度的 GPQA Diamond 科學題,以及 MMLU-Pro。AWS 以總模型支出(包含失敗嘗試)除以正確答案數,來估算觀察到的每個正確答案成本。

在該公司的樣本中,gpt-5.6-sol 在 AIME 上達到 75% 準確率,而 gpt-5.4-mini 為 37%。它也在 GPQA Diamond 與 MMLU-Pro 的報告結果中居首。AWS 提醒,這些只是樣本結果,並非普遍排名;若沒有不確定性估計,微小差異應視為方向性指標。

在 AWS 提到 2026 年 7 月 30 日 Amazon Bedrock 上 GPT-5.6 Luna 與 Terra 的降價後,價格結論也隨之改變。AWS 在其結果檔案的假設下,報告 gpt-5.6-luna 的 AIME 正確答案成本為 0.0021 美元,而 gpt-5.4-mini 為 0.0139 美元。文章指出,Luna 的觀察到每個正確答案成本低於受測替代方案,包括 gpt-5.4-nano。

這些數字不應被視為當前的普遍價格。AWS 明確提醒讀者,應對照即時價格頁確認適用的 Amazon Bedrock 區域與推論層級。文章也指出,價格頁更新未必會立即與公告同步。

代理軌跡可能壓過標價

分析中更關鍵的部分是 AI 代理,在這裡每一次模型呼叫都可能帶著不斷增長的對話歷史。AWS 使用實際的 web_search 與 fetch_page 工具,測試了來自 DeepSearchQA 的 50 題樣本。該代理在關閉儲存的情況下管理自己的歷史,這表示系統提示、先前的工具結果,以及對話上下文,都會在每一回合重新送出。

這種設計使回合數成為直接的成本與延遲因素。AWS 表示,隨著代理不斷加入上下文,累積輸入量可能近似二次成長。在其樣本中,gpt-5.4-mini 每題平均 7.6 回合,主要是因為重複的搜尋迴圈。其輸入量每題達到 114,000 token,相較之下 gpt-5.6-terra 為 50,000 token。

AWS 報告指出,Terra 在測試中每個通過答案成本為 0.31 美元,而 mini 為 0.40 美元,同時平均 F1 分數更高。gpt-5.6-luna 的每個通過答案成本甚至更低,為 0.05 美元,而 mini 為 0.40 美元。Nano 的名目 token 價格較低,但只通過了 18% 的題目,因此觀察到的每個通過答案成本為 0.07 美元。

由於樣本只有 50 題,這些比較並不具決定性。不過,結果凸顯了一個標準價格頁上看不到的成本變數:模型完成一個使用工具的工作流程有多有效率。

品質會改變專業工作的經濟性

AWS 也測試了 GDPval,這是一個圍繞職業交付成果而非簡答題所建立的基準。其 48 個任務樣本涵蓋合規簡報、財務計畫與照護流程等文件,每個輸出都依照由專業人士撰寫的評分標準進行評分。

該公司表示,在關閉 reasoning 的情況下,三種 gpt-5.6 組態的分數都高於受測的 mini 與 nano 組態。Luna 在 48 個任務中通過 27 個,高於 mini 的 20 個。在報告的降價之後,AWS 計算 Luna 每個通過交付成果的成本為 0.010 美元,而 mini 為 0.030 美元、nano 為 0.012 美元。

這個結果並不能乾淨地衡量整體模型品質。AWS 表示,職業類別的樣本很小,而且 8,192 token 的輸出上限使 Luna、Terra、Sol、mini、nano 的交付成果分別有 6、9、7、0、1 件被截斷。更高的輸出上限可能同時改變品質與成本。

不過,對企業買家而言,這項測試指出了一個實際問題:當替代方案需要審查、重工或升級處理時,更高的通過率值多少錢?若能降低下游成本,較昂貴的模型仍可能經濟划算;而對低風險的分類或草稿工作來說,較便宜的模型也可能依然更適合。

這些結果對建構者與企業代表什麼

AWS 在文章中標示為 openai-on-aws/benchmarks-openai 的基準測試工具,讓工程團隊能用自己的提示詞與接受標準來評估模型選擇。這很重要,因為研究型代理的最佳模型,未必也是高吞吐量擷取管線的最佳模型,而基準分數也未必反映企業對錯誤的容忍度。

打造 AI 代理的團隊,除了 token 支出之外,還應追蹤回合數、工具呼叫、輸入增長、延遲,以及成功任務的成本。他們也應決定應用程式是否能重用儲存的上下文、限制搜尋迴圈、摘要工具結果,或將困難案例路由到更強的模型。這些控制可在不依賴底層模型價格的情況下改變經濟性。

對產品團隊來說,更有用的單位可能是每份核准文件、每個已解決工單或每個完成工作流程的成本。這需要穩定的評分標準,以及對失敗輸出、人工作業修改、重試與升級率的記錄。AWS 使用確定性檢查與 LLM 裁判展示了一種做法,但該公司自身的警告也顯示,評估設計仍是部署問題的一部分。

接下來要關注什麼

當前最直接的訊號是,AWS 於 7 月 30 日的價格變動是否會在 Amazon Bedrock 各區域與推論層級中一致反映。買家也應觀察開源工具是否能在啟用 reasoning、匹配模型組態、更大樣本,以及接近生產環境的上下文管理策略下,獲得獨立重現。

後續評估還應測試重複執行的可靠性、工具使用安全性、對 prompt injection 的抵抗力、延遲、輸出截斷,以及人工審查的成本。這些指標可能縮小——或擴大——AWS 對 gpt-5.6-luna 及其他 gpt-5.6 模型所報告的優勢。

Creati.ai 觀點

AWS 對常見採購習慣做出了有益修正:token 價格看得見,而失敗與重工成本則分散在整個應用程式中。報告結果支持在工作流程層級衡量模型選擇,尤其是對會重複呼叫工具並重送累積上下文的代理而言。

但這些證據仍由 AWS 控制,且與特定設定有關。最強的結論不是某一個 OpenAI 模型普遍最便宜,而是建構者應先在自己的工作負載上測試成功且可接受結果的成本,再讓價格表決定架構。

廣告