
OpenAI 正在更新 ChatGPT 中的 GPT-5.6 Sol,帶來更聚焦的回覆、宣稱的準確度提升,以及可調整推理投入的控制項。與此同時,該公司正將免費與 Go 訂閱者轉向較小的 GPT-5.6 Luna 作為預設模型,擴大日常聊天的使用範圍,同時保留 Sol 給付費使用者。
這些變更讓 ChatGPT 的存取依訂閱層級更清楚地分開。OpenAI 表示,免費使用者將可與 Luna 進行無限文字對話,接著在下週推出新的 Think 按鈕,讓較小的模型能為困難問題花更多時間。根據 The Decoder 審閱的發佈資訊,免費帳號上的檔案上傳、影像生成與其他工具仍將維持限制。
對 AI 開發者與企業採購者而言,這次更新說明了一項日益明顯的產品取捨:供應商一方面試圖讓低成本模型足以應付日常工作,另一方面則透過付費存取與控制項,讓更強的推理系統形成區隔。
OpenAI 表示,GPT-5.6 Sol 現在會減少不必要的細節與過度格式化。簡單問題應該得到直接且具備足夠背景脈絡的答案;較複雜的請求則應產生更完整的回覆,同時不把主要建議埋沒。
此次更新也為付費 ChatGPT 使用者新增了推理滑桿。較低設定適合一般問題,而較高設定則針對規劃、研究與程式編寫。此控制項可在網頁、行動版與桌面應用程式中使用。The Decoder 報導,類似的滑桿先前已可在 ChatGPT Work 中使用。
OpenAI 宣稱的目標,是讓快速回覆與深度推理像是同一模型的不同操作模式,而不是風格明顯不同的獨立模型。這可能減少使用者必須手動在速度與審慎之間做選擇的需求,不過也會新增另一個使用者必須理解的產品控制項。
這項變更只適用於 ChatGPT,而非 OpenAI 的所有產品。根據 The Decoder 對此次推出的描述,GPT-5.6 Sol 在 ChatGPT Work 與 Codex 中維持不變。
OpenAI 計畫在本週稍晚讓 GPT-5.6 Luna 成為 Free 與 Go 使用者的預設模型。該公司表示,這些使用者將獲得無限文字聊天,並在下週推出 Think 按鈕,以應付需要更多投入的問題。
從某種意義上說,這是存取範圍的擴大:免費使用者將能進行更多日常文字對話,而不會碰到相同的聊天限制。但同時,這項變更也移除了免費體驗中最強的推理選項。可以要求 Luna 花更久時間推理,但這並不代表它擁有與 Sol 相同的底層能力。
The Decoder 將 Luna 形容為在其尺寸下相當能用,但也警告,較小的模型一般更容易出現錯誤與可靠性問題。它引用了一起先前事件:某個較早的 Instant 模型相較於更大的推理對手,產出了明顯錯誤的資料分析。這個例子無法說明 GPT-5.6 Luna 的表現,但它凸顯了把額外推理時間當作更強模型替代品的實務風險。
對於做一般草稿或查詢事實的使用者而言,Luna 可能已足夠。但在財務分析、法律研究、醫療資訊、程式編寫及其他任務中,若出現看似自信的錯誤,就可能帶來後續成本,這時差異就更為重要。
OpenAI 的官方公告將 GPT-5.6 Sol 描述為更準確且一致,而 The Decoder 則報導了來自內部評估的數據,涵蓋財務、醫療與法律提示詞。根據 OpenAI,相較於 GPT-5.5 Instant,GPT-5.6 Sol 中至少含有一項事實錯誤的回覆下降了約 68%,GPT-5.6 Luna 則下降了 62%。
在目前可得的證據中,這些結果並未經過獨立驗證。這項比較也留下許多重要問題未被回答,包括評估的樣本數、任務設計、錯誤定義,以及提示詞是否反映真實客戶工作流程。因此,這些數字應被視為 OpenAI 的基準主張,而非已被確立的可靠性衡量。
同樣的保留態度也適用於更廣泛的承諾:滑桿會改善使用者結果。推理控制項可能有助於有經驗的使用者將更多算力分配給困難任務,但若有人為需要謹慎分析的工作選擇低設定,也可能產生新的失敗模式。The Decoder 也報導,使用者大多忽略了 ChatGPT 的模型切換器,這顯示新增控制項不會自動帶來更好的模型選擇。
此次推出會立即影響圍繞 ChatGPT 建構的團隊。免費層級使用者將越來越常遇到較小的預設模型,因此以較強模型行為為基礎所設計的工作流程,可能需要重新驗證。開發者應測試的不只是回答品質,還包括 Luna 的 Think 模式何時被觸發、多久會悄悄失敗一次,以及使用者是否能辨識出答案需要複查的時機。
對新創與產品團隊而言,這種分流可能讓成本與品質調校更為明確。分類、草稿撰寫與客服等例行任務可能適合較小模型,而高價值推理、程式編寫或分析則可能足以正當化使用 Sol 或其他更強系統。這能降低推論成本,但前提是路由規則與品質檢查可靠。
企業採購者也應區分 ChatGPT 的消費者版推出,與 OpenAI 其他產品的行為。由於 Sol 的更新並未延伸到 ChatGPT Work 與 Codex,組織不能假設所有部署中都能使用相同的模型行為或推理控制項。
關鍵的營運問題不是 Luna 能否推理更久,而是使用者接受免費預設後,該模型是否仍對特定工作流程足夠準確。團隊應測量錯誤嚴重性、升級率、延遲與工具限制,而不是依賴對模型智慧的泛泛說法。
第一個訊號將是 Luna 預設與 Think 按鈕多快會推送到 Free 與 Go 帳號,以及 OpenAI 是否為新模式文件化獨立限制。針對程式編寫、研究與資料分析任務,對 Luna 與 Sol 的獨立測試將比公司內部比較更有參考價值。
使用者與開發者也應注意 OpenAI 是否把推理滑桿擴展到消費版 ChatGPT 之外、是否改變付費方案邊界,或是否讓 Sol 在 ChatGPT、ChatGPT Work 與 Codex 之間維持不同表現。若免費使用者將 Luna 用於影響重大的工作,自信但錯誤的回覆報告將特別重要。
最後,新控制項的採用情況將揭示使用者是否想要可調整的推理,或偏好自動模型選擇。如果滑桿很少被使用,OpenAI 或許需要把更多複雜度藏在具任務感知的路由背後,而不是直接暴露更多設定。
OpenAI 的更新與其說是單一模型升級,不如說是對 ChatGPT 階梯結構的重新設計。Sol 正成為更可配置的付費能力,而 Luna 則被定位為廣泛可用的主力工作模型。這種架構可以改善經濟性並讓日常使用更容易,但也提高了清楚傳達模型限制的重要性。
對 AI 團隊而言,實際教訓是要測試使用者真正拿到的預設模型,而不是產品公告中展示的最強模型。GPT-5.6 Luna 的真實價值將取決於獨立的可靠性結果與工作流程層級的表現,而 Sol 的推理滑桿只有在能帶來可衡量的改善、且不增加令人困惑的選項時,才會真正重要。
OpenAI 正在為付費 ChatGPT 使用者更新 GPT-5.6 Sol,並將 GPT-5.6 Luna 設為免費預設,改變 ChatGPT 中進階推理的使用方式。