OpenAI 推出 GPT-6 Astra,用於商業工作流程、電腦操作與程式撰寫

OpenAI 表示,GPT-6 Astra 將電腦操作、程式撰寫與企業控制帶入 ChatGPT Work、Codex 與其 API,但相關上市說法仍未經驗證。

AI News

OpenAI 表示已推出 GPT-6 Astra,這是一款以商務為導向的模型,旨在於既有的工作場所應用程式內處理電腦操作、軟體工程、瀏覽以及其他專業任務。該模型可透過 ChatGPT Work、Codex 與 OpenAI API 使用,但在上市初期,企業存取預設為關閉。

這項公告將 Astra 定位為一款旨在降低企業部署 AI 前通常所需準備工作的模型。根據 OpenAI 的說法,它可以操作不提供 API 的應用程式,讓團隊得以沿用既有工作流程,而不必先以自訂整合重新打造。這一承諾使該產品直接與專注於自動化、程式撰寫與代理式軟體使用的企業 AI平台競爭。

OpenAI 認為 Astra 會改變什麼

OpenAI 將 GPT-6 Astra 描述為其最能勝任商務工作的模型,在推理、寫作、設計判斷,以及透過電腦介面與軟體互動的能力上都有提升。公司表示,在 ChatGPT Work 與 Codex 中,Astra 能撰寫程式碼並操作員工已在使用的相同應用程式,包括那些缺乏傳統 API 存取的工具。

公司也表示,Astra 在遵循組織語氣、範本與設計標準方面表現更好。這對產品與行銷團隊可能很重要,因為他們目前往往需要花大量時間修改 AI 生成的簡報、文件與其他品牌素材,才能真正拿來使用。

OpenAI 提供了幾個來自未具名客戶的早期範例,包括 GPU 最佳化、找出財務報表差異,以及製作更符合品牌要求的簡報。這些範例是 OpenAI 提供的客戶使用說法;公告中並未提供獨立驗證、客戶名稱、部署規模或可量化的商業成果。

該模型也可在OpenAI API中使用,根據公司說法,價格從每百萬輸入 token 10 美元、每百萬輸出 token 50 美元起。企業管理員可在既有費率與合約下啟用 Astra,而符合資格的 API 客戶在經核准後,可於支援的端點獲得 Zero Data Retention。

性能說法背後的證據

公告中最強的性能說法來自供應商本身。OpenAI 表示,Astra 在電腦操作、瀏覽、專業工作、軟體工程、資安與科學方面達到最新最佳結果,但所提供的材料並未公布完整的評估結果集。

OpenAI 在描述專業工作與程式撰寫評測中的成本效率時,特別引用了 Terminal Bench 4.0 與 Artificial Analysis Intelligence Index。公司表示,Astra 經訓練可用更少的 token 與更少的重試次數完成任務,可能減少返工與單項任務成本。這些說法在獨立測試顯示該模型在可比工作負載上的表現之前,應視為由 OpenAI 挑選並詮釋的基準測試。

公司也描述了一個內部工程案例。OpenAI 表示,其團隊使用 Astra 在測試環境中找出影響 Codex 工作階段的記憶體配置瓶頸。更換記憶體配置器後,團隊回報單次回合延遲降低 25 倍,而峰值記憶體使用量約增加 30%。這是內部案例研究,不是證據,證明客戶部署也會出現相同改善。

OpenAI 表示,他們也在一個內部電腦操作安全基準上測試 Astra,情境包括洩露機密資訊、廣泛分享儀表板或刪除資料等。公司稱,Astra 產生非預期結果的頻率比 GPT-5.6 Sol 低 89%,比 Claude Fable 5.1 低 74.7%。由於這個基準是內部的,且所提供的公告未說明完整方法,因此僅憑這則發布無法獨立評估這些比較。

本篇報導的來源基礎也相當狹窄。可取得的 wire 內容沒有文章正文,而詳細說明來自 OpenAI News。因此,採用率、可靠性與競爭表現的說法,主要仍是公司自己的敘述,而非獨立報導的結論。

企業部署的控制措施

電腦操作能讓 AI 系統更有用,但也讓錯誤有機會進入商業系統。OpenAI 表示,Astra 具備更強的對人類意圖與授權的遵循能力,並搭配旨在限制模型可存取與可執行內容的控制措施。

新的管理員設定可限制對已核准網站與桌面應用程式的存取、管理上傳與下載,以及控制瀏覽紀錄。ChatGPT Work 與 Codex 也支援確認政策,要求在執行重大行動前先獲得人工核准。OpenAI 表示,自動審查可以檢查可能不安全或未經授權的工具呼叫。

這些控制有助於分階段部署:組織可以先從有限的一組應用程式、受限權限與核准要求開始,再逐步擴大存取。對企業 AI 採購者來說,這比一開始就賦予代理無限制的瀏覽器或桌面存取權更實際,但公告並未證明這些防護在真實世界的攻擊或故障情境下表現如何。

OpenAI 也正在 ChatGPT Desktop 中為 Oracle Analytics、Power BI、Navan 與 Avalara 推出企業外掛程式。公司表示,這些外掛使用其最新的 browser-use 能力,將使用者連接到熟悉的企業應用程式。這項納入顯示,OpenAI 同時在推進廣泛的電腦互動,以及與特定商業系統更受控的連結。

Astra 被描述為 OpenAI Preparedness Framework 中首個達到 Critical 網路安全能力門檻的模型。OpenAI 表示,它已強化對濫用、未授權行為與繞過防護措施企圖的保護。該框架的定級意味著公司認為這個模型具備實質更強的資安相關工作能力,但也凸顯部署控制與監測的重要性。

這次上市對開發者與採購者的意義

對產品團隊來說,這次發布最關鍵的部分不只是更高的基準測試分數,而是 GPT-6 Astra 可在不需要 API 整合的情況下操作既有軟體的主張。若此能力可靠,可能會縮短從內部實驗到財務、營運、行銷或工程自動化工作流程的路徑。

代價是,以電腦為基礎的互動比嚴格定義的 API 呼叫更不可預測。畫面變化、權限、含糊指令與意外的應用程式狀態,都可能造成難以重現的失敗模式。在允許 Astra 執行重大工作之前,建構者需要稽核日誌、核准關卡、復原路徑,以及對資料移動的明確限制。

價格也需要在工作負載層級分析。較少的 token 使用與更少的重試可能降低單項任務成本,但電腦操作工作流程可能花費更多時間,並涉及額外審查或工具呼叫。企業應比較完整的完成成本,包括人工核准、監控與失敗操作,而不只是依賴 token 費率。

對軟體團隊而言,Codex 存取與所報告的內部延遲結果,可能讓 Astra 對除錯、程式碼生成與工程支援更具吸引力。然而,買家仍應以自己的程式庫、安全政策與部署環境來驗證其表現。OpenAI 所報告的結果並不能證明該模型會改善所有開發工作流程。

接下來該關注什麼

接下來最有價值的訊號,將來自針對電腦操作、程式碼品質、安全性與總任務成本的獨立評測。客戶披露也同樣重要:具名部署、正式上線規模、失敗率與可量化的時間節省,會比 OpenAI 公告中的早期案例更有說服力。

企業買家應觀察存取是否仍限制在已核准的應用程式、確認政策多久會打斷工作流程,以及管理員是否能充分掌握工具呼叫與資料傳輸。研究人員則應尋找內部安全基準與對 GPT-5.6 Sol、Claude Fable 5.1 比較背後的方法論與可重現性細節。

市場也會顯示,電腦操作究竟會成為 API 的實用補充,還是缺少整合時的一種脆弱替代方案。OpenAI API、ChatGPT Work 與 Codex 在生產環境中的採用,會比上市當天的能力描述更能清楚驗證 Astra 的價值。

Creati.ai 觀點

GPT-6 Astra 之所以重要,是因為 OpenAI 將電腦操作呈現為企業 AI 的部署捷徑,而不只是另一項模型能力。如果系統能在尊重權限的前提下,穩定地在既有應用程式中運作,它可能減少小型團隊的整合工作,並加速自動化專案。

但目前證據還不足以證實這個結果。詳細說法來自 OpenAI 本身,而可取得的來源材料缺乏獨立基準、具名客戶成果與生產環境可靠性資料。就目前而言,Astra 看起來像是一項重要測試:AI 代理是否能從展示走向受治理的職場執行。

廣告