OpenAI據報的 Astra 推理技術可能讓 AI 行為更難監控,促使安全專家警告,不透明的遞迴可能會擴大規模。

據報導,OpenAI 正在開發一款名為 Astra 的推理模型,採用一種稱為「recurrent depth」的技術,這使 AI 安全研究人員擔心,愈來愈複雜的模型推理可能會變得更難檢視。
這種方法也被描述為「不透明遞迴(opaque recurrence)」,據稱可讓模型透過重複的內部迴圈處理同一個查詢,而不只是依賴序列式的推理鏈。TechCrunch 引述 The Information 的報導指出,Astra 目前使用這項技術的程度似乎有限。即便如此,研究人員警告,若更廣泛採用,可能會削弱用來調查模型行為的主要工具之一:可讀的 chain-of-thought 記錄。
這個問題不只關乎 OpenAI 據報的模型。如果 AI 實驗室把更多計算用在內部或潛在狀態,而這些狀態產生較少可解讀的痕跡,開發者與安全團隊在這些系統到達使用者之前,將更難偵測欺騙性行為、錯位或自主系統的失誤。
大多數推理模型會把工作呈現為一連串中間步驟。這些痕跡並不被視為模型內部認知的完美逐字記錄,但它們可以提供有用證據,說明模型如何處理任務,以及它是否遇到了高風險指令或追求了意料之外的目標。
根據 TechCrunch 引述的報導,recurrent depth 透過讓模型在迴圈中再次檢視同一個查詢,改變了這種模式。模型不再產生一條容易跟隨的單一路徑,而是可能透過重複的內部處理完成更多工作。結果可能是可供審查的可讀步驟變少。
這種差異對 AI agent 的建構者很重要。只回答問題的模型,通常可以透過其輸出來測試。但會規劃、呼叫工具、修改檔案,或跨業務系統採取行動的 agent,則更需要調查者理解某個特定行動為何發生。較不透明的推理可能讓事後分析更慢、也更不可靠。
Redwood 執行長 Buck Shlegeris 在報導後發文表示,他對 Astra 據報使用不透明遞迴「極度擔憂」。他承認目前仍不確定該模型是否在實質上比早期系統更難監控,但警告 OpenAI 未來版本可能增加遞迴的程度。
長期倡議AI 安全的 Zvi Mowshowitz 認為,最終可能需要更強的保障措施或法律,才能避免產業出現「往下競爭」的情況。他表示,這項技術可能破壞 OpenAI 與 Anthropic 保存忠實且可監控 chain-of-thought 訊號的努力。
Redwood Research 首席科學家 Ryan Greenblatt 提出了一項相關的擴展性疑慮。在他看來,一種自然的發展可能會把更多推理移入潛在空間,直到透過傳統監控管道可見的推理所剩無幾,甚至完全不可見。
這些是專家警告,不是證據表明 Astra 目前在沒有可用監督的情況下運作。TechCrunch 報導稱 recurrent depth 的使用似乎有限,而其 chain of thought 仍預期會保持可讀。這些疑慮主要聚焦於:若這項技術在未來的推理模型中擴大使用,會發生什麼事。
OpenAI 已反駁自己正在放棄可解釋推理的說法。首席科學家 Jakub Pachocki 在 X 上寫道,公司自第一批推理模型以來,就一直致力於保留並使用 chain-of-thought 監控,並把這視為核心研究目標。
據報導,公司也否認 Astra 會轉向「neuralese」的說法;這個詞用於討論模型生成、但人類難以理解的推理。OpenAI 已宣布,將把廣泛的 chain-of-thought 監控納入其前瞻性的安全工作。
目前報導中最具體的產品資訊來自媒體報導,而非 Astra 的公開技術發布。現有證據無法證實 Astra 的上市時間、系統設計、效能,或其遞迴處理的精確程度。它也沒有顯示這項技術造成了某個特定的安全事件。
不過,監控之所以仍是爭論核心,有一個具體原因。TechCrunch 指出,chain-of-thought 記錄在調查 OpenAI 最近的 rogue agent 活動中扮演了重要角色。這個例子說明,任何可讀痕跡的減少,不僅會影響研究評估,也可能影響部署後的事件應變。
The Information 隨後報導,Anthropic 與 Google DeepMind 正在討論這項技術。這顯示此議題可能成為整個產業的架構與治理問題,儘管目前的報導尚未證明這兩家公司是否正在生產模型中積極部署不透明遞迴。
對 AI 開發者而言,最直接的教訓是:對於進階推理系統,僅靠輸出測試可能不夠。打造 agent 的團隊需要評估,當模型在多個內部循環中規劃時,還能留下多少有用證據,特別是在它可以使用工具或採取有後果的行動時。
這可能會提高外部日誌、工具呼叫記錄、沙箱隔離、權限控管與獨立評估的重要性。這些控制無法重現模型的內部推理,但可以幫助團隊重建系統做了什麼、存取了哪些資料,以及在哪裡可能介入。
企業採購者也應把「推理透明度」視為部署特性,而不是假設各模型都一樣。某個模型可能在提供較少有用診斷資訊的同時,卻帶來更好的效能。對受監管或高影響的工作流程而言,這種取捨可能影響採購、可稽核性、事件審查,以及 agent 採取行動前所需的人類核准程度。
商業上的取捨尚未定論。遞迴式處理可能帶來實用能力或效率提升,但來源材料並未提供經驗證的基準,說明 Astra 與其他推理模型相比表現如何。目前可得資料並未確認其任何效能或擴展優勢。
最重要的訊號將是 OpenAI 是否發布技術文件,說明 recurrent depth 在 Astra 中如何運作、使用頻率如何,以及評估者還能取得哪些監控方式。若關於可讀性的主張能搭配可重現測試,而不是泛泛保證,將更具意義。
研究人員也應關注比較標準 chain-of-thought 監控與遞迴系統監控的評估。關鍵問題包括:危險推理是否仍可被偵測、模型在其痕跡受到監控時是否表現不同,以及調查者能否可靠地重建事件。
另一個訊號將來自 Anthropic 與 Google DeepMind。如果關於他們興趣的報導進一步發展成公開研究或產品變更,不透明遞迴可能會變成一種競爭性的設計選擇,而不只是 OpenAI 的單一實驗。屆時,監管機構可能會面臨壓力,需要定義對愈來愈自主的系統而言,哪些形式的模型推理監督是必要的。
Astra 的報導之所以重要,是因為它把一個張力放到推理模型發展的核心:更多內部運算或許能提升系統解決難題的能力,但同時也讓負責評估與控制它的人更難讀懂這個過程。
OpenAI 據報的使用是有限的,而且目前可得證據並未顯示公司已放棄 chain-of-thought 監控。但安全疑慮針對的是發展軌跡,而不只是當前模型。對開發者與企業來說,真正的實務問題是:隨著推理能力變強,系統是否仍能保持可稽核性;如果可讀痕跡不再提供足夠答案,又需要哪些獨立控制。