
OpenAI 表示,透過啟用兩項 API 設定,而非修改底層模型權重,實質改善了 GPT-5.6 在 ARC-AGI-3 基準上的表現;這一結果讓人們重新關注推理時的設定作為主要效能槓桿。
根據 OpenAI 以「How enabling two settings tripled our scores on the ARC-AGI-3 benchmark」為題的貼文,retained reasoning 與 compaction 的組合同時提升了 GPT-5.6 在 ARC-AGI-3 上的分數與效率。這樣的說法很重要,因為基準測試的討論往往聚焦於模型發布與訓練規模;而在這裡,OpenAI 主張,API 內部的部署選項可以顯著改變實際測得的能力。
OpenAI 的官方說明將這次提升歸因於兩項設定:retained reasoning 與 compaction。依公司摘要所述,OpenAI 表示這些變更讓其在 ARC-AGI-3 上的分數翻了三倍,同時也提升了效率。由於可取得的來源材料並未包含貼文全文,因此仍有一些實作細節不明,例如 OpenAI 在生產環境中如何 دقیق 定義各項設定、對照的是哪一個基準設定,以及結果究竟反映單次最佳執行,還是較廣泛的評估配置。
即便有這些限制,這件事仍值得注意,原因很簡單:它把一部分效能討論從模型訓練轉向執行期編排。如果模型被允許保留更多中間推理狀態,並且更有效地壓縮該狀態,基準分數就能明顯變動,那麼實際競爭的單位就不再只是基礎模型,而是基礎模型加上推理政策。
這個區別對於在 OpenAI API 上開發的團隊尤其重要。開發者常把模型選擇視為主要變數,而保留預設設定不變。OpenAI 的說法暗示,至少對於獎勵多步推理或自適應解題的任務來說,這樣的假設可能已經過於簡化。
ARC-AGI-3 屬於與 ARC 風格評估相關的抽象與推理測試家族。這類基準受到密切關注,因為它們旨在測試泛化與模式推理,而不是單純的記憶或針對特定任務的微調。實務上,這意味著它們經常能揭示在標準程式、寫作或檢索任務上看起來相似的模型之間的差異。
對 OpenAI 來說,強調 ARC-AGI-3 的結果有兩個目的。第一,它支持公司主張 GPT-5.6 在服務堆疊保留更多內部推理流程時,能夠表現更好。第二,它讓 OpenAI 能夠在不宣布新的 foundation model 的情況下談論效能提升。
這在模型發布成本高昂、而且頻繁的基準更新很容易淹沒在噪音中的市場,可能相當重要。如果供應商能透過推理設定釋放可衡量的增益,他們改善實際工作負載的速度,或許會比等待下一輪大規模訓練更快。
不過,基準的重要性取決於可重現性與範圍。這裡提供的來源並未包含 ARC-AGI-3 的精確方法、通過標準,或更廣泛的比較集合。這表示外部讀者應避免把單一基準主張過度推廣到所有企業工作流程。
OpenAI 貼文最強烈的啟示,可能不只是分數本身,而是推理控制正變成一級產品功能。換句話說,模型只是其中一層;保留先前推理步驟的記憶、壓縮這些推理,以及其他執行期控制,都可能實質改變結果。
這會直接影響人們評估 GPT-5.6 的方式。若某團隊正在測試用於 AI 代理 工作流程、程式助理,或複雜的內部決策支援工具的模型,那麼現在可能需要比較多種服務配置,而不是只看一個預設端點。同一系列模型在成本、延遲與品質上,可能會因為是否啟用 retained reasoning、以及 compaction 的應用方式而有不同表現。
對 企業級 AI 的採購者而言,這可以從兩個方向來看。正面來說,更好的設定可能在不遷移模型、無需完整微調、也不必過度工程化提示詞的情況下,帶來更強的結果。較困難的一面是,採購與平台團隊必須以營運透明度來比較供應商,而不只是看排行榜截圖。如果某供應商的最佳表現依賴隱藏或特殊的執行期設定,買家會想知道這些設定是否普遍可用、成本多少,以及在生產流量下是否穩定。
這也是對競爭平台的一個訊號。Anthropic、Google 和 Microsoft 這類公司,早已用不同方式談論上下文處理、推理行為與 agentic 工作流程。OpenAI 對 retained reasoning 與 compaction 的強調,為這場競賽增加了另一個維度:誰能提供最有用的推理控制,又不讓部署變得過於複雜。
這篇報導的核心主張來自供應商本身。詳細說明來自 OpenAI News,而更廣泛的新聞摘要也回到同樣的 OpenAI 說法。這裡提供的證據中沒有獨立第三方評測,而且可取得的材料並未包含原始分數表、測試條件或外部重現結果。
可以確定說明的內容有限,但很明確:OpenAI 表示,在啟用 retained reasoning 與 compaction 之後,GPT-5.6 在 ARC-AGI-3 上表現更好,並將這項變化描述為分數翻三倍,同時效率也提升。
而無法根據現有證據確認的內容同樣重要。這裡還無法驗證絕對分數、先前基準、各次執行的結果分布,或新設定在計入 compaction 收益前需要多少額外延遲或算力預算。也不清楚這些設定是否能在 OpenAI API 中廣泛使用,還是只在某些特定配置下提供。
這不會否定結果,但會影響該如何解讀它。最好把這看作 OpenAI 的產品與工程訊號,而不是已定案的整體市場排名。對研究人員與平台團隊而言,下一步是重現。對客戶而言,下一步是測試自家工作負載是否也出現相同模式。
對使用 OpenAI API 的開發者來說,直接的啟示是要重新檢視評估方式。如果 retained reasoning 與 compaction 會實質影響 GPT-5.6 在 ARC-AGI-3 上的表現,那麼一次性的模型比較,可能會忽略更實際的問題:哪一種配置能針對特定工作提供最高的每美元品質?
這對於有長思維鏈、反覆使用工具,或需要結構化搜尋替代方案的工作負載尤其重要。會在多步驟中規劃的 AI 代理、會修正多個候選解法的 程式助理,或比較政策、法律、營運情境的企業 AI 系統,可能比單純聊天或抽取流程更能受惠於 retained reasoning。
這也牽涉到成本紀律。OpenAI 表示,這些設定提升的不只是原始分數,也包括效率。如果這一點能在更廣泛的使用中成立,compaction 可能會對希望控制 token 成長或多步驟任務執行開銷的團隊變得重要。但企業不應假設基準效率就會自動轉化為生產節省。內部測試仍需衡量端到端延遲、預算上限、故障復原,以及在真實流量下的一致性。
對產品主管來說,這也是另一個提醒:評估堆疊必須成熟。現在已經不只是選 GPT-5.6 或其他模型而已。團隊可能需要版本化的設定檔、與業務任務綁定的基準套件,以及可觀測性來判斷額外推理何時有幫助、何時只是增加成本。
下一個有用的訊號會是 OpenAI 是否公布關於 ARC-AGI-3 更完整的技術細節,包括基準條件、分數拆解,以及 retained reasoning 與 compaction 的運作機制。沒有這些,這項說法仍然具有資訊性,但不完整。
同樣重要的是,這些設定是否會在 OpenAI API 中清楚公開,並提供穩定的定價與文件。若容易採用,這可能會影響團隊在企業 AI 部署上如何將 OpenAI 與 Anthropic、Google 和 Microsoft 進行比較。
另一個後續問題是可移植性。開發者會想知道,在 ARC-AGI-3 上看到的提升,是否也會延伸到相鄰的使用情境,例如 AI 代理、程式助理工作流程,以及其他重推理任務。如果效果範圍狹窄,這就是一篇基準故事;如果效果範圍廣泛,它就會變成平台故事。
最後,請留意獨立重現。第三方實驗室、基準維護者與客戶工程團隊,很可能會測試 GPT-5.6 是否在 OpenAI 自身報告之外也呈現類似改善。這將決定 retained reasoning 與 compaction 是否成為企業 AI 的標準評估旋鈕。
OpenAI 的公告與其說是在談單一基準,不如說是在顯示競爭正往哪裡移動。模型效能的重心,正在從靜態權重轉向受管理的推理行為。對 AI 建構者而言,這意味著產品優勢越來越可能來自模型如何跨步思考、保留哪些狀態,以及如何高效率地壓縮與重用那些狀態。
實際意涵很直接:企業應該停止把模型基準當成單一固定數字。到了 GPT-5.6、ARC-AGI-3、retained reasoning 與 compaction 的時代,效能正在變成依設定而定。真正的贏家,將是能評估整個服務堆疊的團隊,而不只是 OpenAI API 裡那個標題上的模型名稱。
OpenAI 表示,兩項 API 設定讓 GPT-5.6 在 ARC-AGI-3 上的分數翻了三倍,凸顯推理設定如何重塑模型效能。