
OpenAI 正將其 GPT-5.6 模型家族定位為一種方式,讓新創公司能以更低的推論成本、且在每個步驟不那麼依賴最大型模型,來打造可長時間運作的 AI 代理人。在一份新的建構者指南中,該公司將這些模型與 Responses API 的新控制功能連結起來,其中包括保留推理、原生多代理人協調,以及程式化工具呼叫。
這項公告的重要性,與其說在於單一模型升級,不如說在於 OpenAI 期待開發者如何組裝代理人系統的方式改變。指南主張,模型選擇、推理強度、上下文管理與工作流程設計,如今對成本與可靠性的影響,可能與選擇旗艦模型一樣大。然而,文件中最強烈的效能、節省成本與新創採用主張都來自 OpenAI 本身,且在所提供的報導中並未經過獨立驗證。
OpenAI 表示,GPT-5.6 延續了該公司以更少 token 處理更長期任務的努力。這個家族包含高階與較小的模型,在指南中分別標示為 Sol、Luna 與 Terra。較小的模型被視為適合高容量處理、對延遲敏感的互動,以及代理人工作流程中的重複性階段。
這項建議改變了複雜應用的傳統架構。團隊不必將每項任務都送往前沿模型,而可以使用 Terra 或 Luna 來擷取資訊、分類文件,或準備結構化輸入,然後再把更困難的判斷交給更有能力的模型。OpenAI 特別舉了一個法律科技工作流程的例子:先解析手寫備忘錄,再把結果送入代理式分析。
該公司也表示,增加推理強度可以讓較小的模型與較早的旗艦系統競爭。根據 OpenAI 的說法,當給予更多測試時運算量時,Luna 與 Terra 有時能接近 GPT-5.4 和 GPT-5.5 的表現,同時保持較低成本。這是供應商的描述,而非經過獨立建立的市場結果。
GPT-5.6 的發布搭配了 Responses API 中的三種工作流程機制。首先,開發者可以在模型輪次之間保留推理,並使用原生壓縮來壓縮延伸對話。其預期好處是連續性:代理人可以重新開始工作,而不必重建整個歷史,也不必帶著每個中間 token 往前走。
其次,原生多代理人協調允許主要代理人將不同工作流委派給子代理人。這些代理人可以平行運作,之後再回傳結果進行綜合。OpenAI 表示,這種行為是可調整的,因此開發者可以指定何時建立額外代理人,並將額外 token 支出限制在平行工作很可能改善結果的情況。
第三,程式化工具呼叫可讓模型撰寫 JavaScript 來協調工具、平行執行呼叫,以及在模型的上下文視窗之外過濾或彙總結果。這是為了應對那些否則模型必須檢視大量中介資料的工作流程。以 OpenAI 的例子來說,審查申報文件的代理人可以擷取多份文件、按日期過濾,並在程式碼中挑出相關交易,之後再套用模型判斷。
指南也描述了整個模型家族更長的提示快取存續時間。OpenAI 表示,提示快取的最低 TTL 現在為 30 分鐘,且開發者可以決定性地設定快取斷點。使用適當的 prompt_cache_key 也能提高相同前綴的請求由同一個推論引擎處理的機率,進而可能改善快取重用與延遲。
OpenAI 以內部生產測試與基準比較來支持其主張。在 Agents’ Last Exam 上,該公司表示,當周邊的 harness 不變時,低推理強度的 GPT-5.6 Sol 表現優於高推理強度的 GPT-5.5。OpenAI 也報告稱,新創公司透過將推理強度從先前的預設值降低,觀察到明顯的成本下降。
第二項比較涉及以搜尋為導向的基準 BrowseComp。OpenAI 表示,GPT-5.5 在 Extra High 設定下取得 84.36%,報告的總成本為 33.27 美元;而 GPT-5.6 Luna 在同一設定下,於推出時取得 84.04%,成本為 1.33 美元。該公司補充說,價格之後已下降。這些數字有助於說明 OpenAI 的定價論點,但指南並未獨立證明這些成本如何計算、納入了多少次嘗試,或該比較是否反映典型的生產工作負載。
OpenAI 也報告,在修改的是 harness 而非模型後,ARC-AGI-3 出現大幅變化。GPT-5.6 Sol 的分數從標準 harness 下的 13.3% 提升到啟用保留推理與壓縮後的 38.3%,同時輸出 token 使用量約下降了六倍。這項結果凸顯系統設計的重要性,但不應被解讀為純粹的模型對模型改進:實驗改變了模型的使用方式。
所提供的來源組合包含 OpenAI 的官方指南,以及一則不提供額外文章內容的通訊社式清單。因此,這裡並沒有對基準結果、價格比較或新創公司報告的獨立確認。
對 AI 建構者而言,實務訊息是要對整個代理人 harness 做基準測試,而不是只測模型本身。較小的模型可能足以負責擷取與路由,而更有能力的模型則保留給模糊決策。調整推理強度也可能成為一種成本控制機制,只要團隊能衡量較低強度是否會損害準確性、工具選擇,或錯誤復原能力。
Responses API 的功能帶來第二個設計選擇:是要讓工作留在模型上下文內,還是移到程式碼與協調層中。程式化工具呼叫可以降低上下文成長與延遲,但也引入軟體失敗模式,包括格式不良的程式碼、不完整的工具結果,以及模型決策與外部系統之間難以除錯的互動。
多代理人協調可以縮短某些平行工作負載,但並不會自動提升可靠性。企業需要針對委派、權限、資料隔離、重試與最終答案驗證建立控制。若生成行為沒有被嚴格管理,更多代理人也可能增加可觀測性需求,並使總成本更難預測。
對於具有重複指令或穩定文件前綴的應用,提示快取可能帶來相對直接的效率提升。然而,快取經濟性取決於請求模式、提示設計,以及團隊是否能維持一致的鍵與斷點。買家應把 OpenAI 的節省主張視為測試這些機制的理由,而不是保證自家帳單一定降低。
接下來有用的訊號,將是對 GPT-5.6、Luna 與 Terra 在類似生產環境的代理人任務上的獨立評估,特別是工具失敗與長對話很重要的情境。開發者也應關注更清楚的定價細節,以及 BrowseComp 比較背後的測量方法。
OpenAI 的文件與發布說明將顯示,保留推理、壓縮、多代理人協調與程式化工具呼叫在實務上如何暴露給使用者。若新創公司發布導入前後的成本、延遲、錯誤率,以及分派到各模型的工作比例,將更容易評估採用情況。
對企業團隊而言,關鍵測試是新控制功能是否能改善已完成任務的成本與可靠性,而不只是基準分數或 token 數量。隨著這些模式進入受監管的工作流程,針對委派代理人與以程式碼驅動的工具執行所提供的安全指引也同樣重要。
OpenAI 的 GPT-5.6 指南將代理人經濟學視為一個架構問題。最具影響力的轉變,可能是鼓勵在不同階段使用不同模型、保留有用的推理,以及把機械式資料處理移到程式碼中。這種方法比把每個請求都送到旗艦模型更需要操作層面的投入,但也為建構者提供更多控制成本與延遲的槓桿。
這些證據仍主要來自供應商自身,而且最大的基準提升部分取決於 harness 的變更。因此,團隊在重新設計生產系統之前,應先用自己的任務重現這些主張。GPT-5.6 的重要性不僅在於模型分數,也在於 OpenAI 正把協調、快取與上下文管理置於產品敘事的核心。
OpenAI 的 GPT-5.6 指南詳述了透過較小模型、保留推理、平行代理人、工具呼叫與提示快取來降低代理人建構成本。