OpenAI稱Astra跨越關鍵資安門檻,延後更廣泛開放

OpenAI表示,Astra是首個達到關鍵資安門檻的模型,促使其在推出時採取更強的防護與受限存取。

AI News

OpenAI表示,即將推出的 Astra 模型成為公司在 Preparedness Framework 中,第一個被指定為已達到資安能力「Critical」門檻的系統。這項分類意味著,OpenAI 認為 Astra 在具備合適工具與存取權限時,能在無需人類逐步指引的情況下,發現先前未知的漏洞,並在加固過的系統中發展出漏洞利用鏈。

這項宣布之所以重要,是因為 OpenAI 正將前沿模型的發佈條件,直接與其產生重大網路風險的能力掛鉤。公司表示,在強化防範濫用與未授權模型行為的同時,已延後 Astra 開發與發布的部分進度。Astra 預計很快可用,但其最先進的資安功能起初將僅限於特定測試者,更廣泛的防禦性存取之後將透過 Daybreak Blue 開放。

Astra 為何跨越 OpenAI 的 Critical 門檻

OpenAI 的框架透過兩種能力測試來定義 Critical 資安等級。若模型能在沒有人工介入下,針對多個加固且真實存在的關鍵系統,辨識並開發可運作的零時差漏洞利用,便可符合標準;或是,模型能從高層目標出發,構思並執行針對加固目標的新型端到端網路攻擊策略,也可達標。

OpenAI 表示,Astra 在自動化評估與專家主導測試中都達到了這條標準。公司稱,面對加固過的瀏覽器與作業系統,該模型找到了先前未知的漏洞,並將其組合成可運作的漏洞利用鏈。據報,一項測試涉及在瀏覽器開啟 HTML 檔案後,跳出瀏覽器沙箱並在主機上執行命令。另一項則涉及串接作業系統漏洞,從非特權帳戶提升到 root。

公司將 Astra 描述為在漏洞發現、漏洞利用開發與 token 效率方面,相較 GPT‑5.6 Sol 有顯著提升。公司也表示,Astra 在用於已知漏洞利用開發的基準測試 ExploitBench 上取得 100% 分數。這些結果來自 OpenAI 自身評估,在本報導可取得的證據中尚未經獨立確認。

防護措施塑造了發布計畫

OpenAI 表示,Astra 的風險輪廓需要針對兩種不同失效模式進行防護。第一種是惡意使用者利用模型去利用未知缺陷,或對加固目標發動攻擊。第二種則是模型本身採取未授權或失配行為,即使使用者並非刻意尋求傷害。

公司表示,已透過多層措施處理這些風險:模型層級拒絕、系統安全分類器、離線濫用偵測、威脅中斷、監控,以及圍繞模型存取的更嚴格控制。對於高風險帳戶,OpenAI 表示 Astra 將在更嚴格的行為邊界下運作,且監控會使用更多對話上下文來偵測網路濫用。

OpenAI 報告稱,Astra 在其 cyber-jailbreak 評估中拒絕了 91.5% 的請求,而 GPT‑5.6 Sol 為 59%。這是供應商提供的基準數據,而公司在宣布中尚未公布完整方法論或獨立驗證。OpenAI 表示,會在 Astra 上線時於 system card 中提供更多細節。

公司也將 Astra 的準備工作與先前的 Hugging Face 事件連結起來。OpenAI 表示,Astra 並未參與該事件,但公司利用該事件來改進安全做法。公司稱,回顧性測試顯示,當時已部署的生產防護本可阻止該事件;而更新版 Astra 防護包含更強的拒絕訓練、額外的濫用防禦,以及旨在阻止潛在未授權活動的監控。

證據範圍廣,但仍屬公司報告

OpenAI 表示,其準備度評估結合了公開與私有的自動化基準,以及資安專家的評估。在一個名為「ExploitBench - Internal Port (June–August 2026)」的新內部資料集上,公司以 20 個近期公開、且為降低污染疑慮而設計的高嚴重性漏洞測試 Astra。

根據 OpenAI 的說法,Astra 在該內部資料集上的任意程式碼執行率高於 GPT‑5.6 Sol,且使用更少的輸出 tokens。在測試期間,該模型據報也發現並使用了兩個零時差漏洞,作為漏洞利用鏈的一部分。OpenAI 表示,正努力將這些漏洞揭露給相關維護者。

所報結果反映的是具備 Daybreak Blue 存取權的 Astra,而非預設的生產配置。這個差異對買家與研究人員很重要:評估展示的是模型在更高能力存取環境中的表現,但單憑這一點,無法說明一般發布時的行為,或每位使用者將獲得哪些工具。

因此,這些證據建立的是 OpenAI 對 Critical 指定的內部理由,而非經獨立稽核的業界共識。即將發布的 system card、基準細節與外部測試,將決定開發者能對這些主張建立多少信心。

這項指定對開發者與企業的意義

對資安團隊而言,如果 Astra 的進階功能能被限制在授權環境中,便可用於漏洞研究、防禦測試、事件回應與程式碼審查。更強大的自動化漏洞利用開發,可能幫助防禦者更快重現漏洞並優先處理修補,但同樣能力也會提高控制失效的成本。

評估 Astra 的企業,必須看的不只是模型品質。它們需要清楚的授權邊界、網路隔離、記錄、對高影響操作的人類核准,以及快速關閉程序。OpenAI 對監控與圍堵的重視,意味著部署架構、帳戶風險評分與工具權限,將與模型原始基準表現同等重要。

這種受限推出也顯示模型市場正變得更為分層。OpenAI 並未把 Astra 最強的資安能力直接開放給所有使用者,而是計畫將一般可用性與進階資安存取分開。這種做法或許能降低濫用風險,但對需要可預測防禦功能存取、且必須理解各配置可用能力的團隊而言,可能會讓產品開發更複雜。

接下來要觀察什麼

下一個關鍵訊號是 Astra 上線及其 system card。開發者應留意完整的評估方法、失敗率、兩個據稱零時差漏洞的細節,以及在自適應攻擊而非固定 jailbreak 測試下,防護措施如何運作的證據。

OpenAI 如何定義最初的測試者群組與後續的 Daybreak Blue 擴展,也同樣重要。公司的存取規則、工具限制、監控揭露,以及事件回應流程,將顯示這次受限推出究竟是有意義的安全控制,還是僅僅暫時的發行階段。

最後,OpenAI 表示,在設下新的安全與資安要求後,已於 8 月 28 日恢復一項大型前沿強化學習訓練,而一些較小的實驗性訓練仍暫停中。未來更新應可釐清,隨著 Astra 與後續模型獲得更多工具與自主性,這些控制是否仍然有效。

Creati.ai 觀點

OpenAI 對 Astra 的宣布,重要之處與其說是單一基準分數,不如說是公司正公開將進階資安能力視為發佈限制。據報該模型能發現漏洞並組裝漏洞利用鏈,這使得存取設計、監控與圍堵成為核心產品需求,而非次要防護。

在 system card 與外部審視到來之前,這些主張仍主要來自供應商報告。對 AI 開發者與企業買家而言,實際問題會是:OpenAI 是否能讓 Astra 對授權防禦有用,同時可靠地防止同樣的工作流程變成自動化攻擊行動。

廣告