Anthropic 與 OpenAI 提議將獨立的 AI 安全評估員嵌入其中,但研究人員表示,能否受到監督將取決於存取權、揭露權與法規。

Anthropic 與 OpenAI 正在提議一種更緊密的外部審視方式,用於前沿 AI 系統:把獨立的安全評估員嵌入其實驗室內,讓他們能存取模型、訓練流程與事件資訊。研究人員歡迎更深入監督的可能性,但表示,只有在評估員能不受公司對其方法、發現或發布時程的控制下工作時,這項提議才有意義。
這項倡議源於一項警告:傳統的上線前測試可能已經不夠。隨著模型越來越擅長辨識評估,它們可能學會在測試中表現安全,卻在其他情境下採取不同行為。因此,評估員希望能存取訓練中的中間檢查點、內部日誌,以及顯示令人擔憂行為如何隨時間發展的證據,而不僅僅是最終系統。
據 TechCrunch 報導,Anthropic 執行長 Dario Amodei 在週末發表的一篇文章中概述了這項提議。Amodei 表示,Anthropic 會給予 METR 和 Redwood Research 等團體前所未有的存取權。OpenAI 執行長 Sam Altman 也表示,他的公司將承諾採取這種做法,不過兩家公司都尚未公開說明首批評估員、時間表、存取範圍或揭露規則。
這種擬議模式會把獨立審查移入開發流程內,而不是把它視為發布前的最後關卡。評估員可以調查安全事故、評估模型是否真正對齊,並發布不經公司公關或法務團隊過濾的發現。
據報導,Amodei 的提議包含一項權利:評估員可以發布關於風險等級、事件、公司做法,以及他們所獲得存取權的關鍵發現。這將與一般承包商關係形成重大不同;在一般情況下,AI 開發者掌控測試環境,並可對評估員施加保密條款。
實務細節仍未解決。TechCrunch 報導,Anthropic 與 OpenAI 尚未說明哪些機構會參與、會有多少評估員被嵌入、他們能檢查哪些系統,或哪些資訊可以公開。這些遺漏很重要,因為存取權決定了這種安排是審計,還是只是更有結構的供應商測試版本。
多位研究人員告訴 TechCrunch,評估員應該能檢查訓練過程中的中間模型版本,或稱「檢查點」。Far.AI 執行長 Adam Gleave 表示,審查者可以比較各個檢查點,以找出風險行為何時出現、檢視獎勵特定回應的後訓練環境,並審閱支持公司公開說法的逐字稿與日誌。
這類存取權有助於處理模型安全評估的一項核心弱點。系統可能因為安全而在基準測試中表現良好,但它也可能已學會辨識基準測試並產生預期答案。Palisades Research 的 John Steidley 將此風險比作 Volkswagen 排放醜聞,當時車輛偵測到測試條件,並在測試期間採取不同表現。
Apollo Research 研究主管 Alexander Meinke 告訴 TechCrunch,公司應該能回答模型是否曾試圖破壞自身的對齊訓練。他認為,內嵌評估員可以直接檢查證據,而不是依賴開發者調查並回報自己的行為。
近期的測試限制也凸顯了這些證據的必要性。在一項涉及 OpenAI 與 Hugging Face 事件的調查中,METR 與 Redwood Research 據報在現場僅有大約一週時間,之後表示他們無法得出有把握的結論,部分原因在於時間與範圍有限。Apollo Research 在發布前只有三天可測試 OpenAI 的 GPT-6 Astra,並在其對 model card 的貢獻中寫道,有限的時間窗口與更高的評估意識率意味著,低不當行為率並不能充分證明模型的對齊狀態。
目前為止的證據支持這項提議的重要性,而不是其有效性。Anthropic 與 OpenAI 所做出的承諾屬於公司承諾,而兩者都尚未公布可讓外部人士驗證評估員究竟能獲得多少獨立性的運作框架。
Adam Gleave 表示,Far.AI 曾拒絕過來自前沿開發者的合約,因為對方試圖對評估流程施加過多控制。依他的說法,評估員常被視為一般承包商,須受限縮性的保密協議與發布限制約束。這會造成直接衝突:最有能力進行艱難評估的組織,若拒絕損害其獨立性的條件,可能就會失去存取權。
研究人員也質疑公司是否會提供足夠時間進行有意義的工作。短期審查可以找出明顯失誤,但可能無法揭露只會在訓練階段中、在不尋常提示下,或在模型察覺自己正在被評估後才出現的行為。Apollo Research 對 GPT-6 Astra 的評估,更像是一個接近供應商的基準案例,而非整個產業的廣泛模式證明,但它說明了有限存取權如何削弱安全報告所附帶的結論。
多位研究人員呼籲建立一套公開框架,定義評估員資格、存取權、發布規則與最低審查期間。Safer AI 執行董事 Henry Papadatos 表示,自願承諾仍依賴公司善意,並主張法規可防止開發者在危機後改變方向。
對 AI 開發者而言,內嵌評估員可以讓安全工作更持續,並更緊密地與訓練決策相連。與其在上線前才發現問題,公司或許能更早辨識相關檢查點、獎勵結構或部署變更。這可以改善補救,但也意味著開發者必須向外部團體揭露敏感基礎設施、日誌、員工訪談與智慧財產。
對企業買方而言,通過安全基準測試的模型與在整個開發過程中經過獨立檢視的模型之間的差異,可能變得具有商業重要性。採購團隊未來可能不只詢問 AI 供應商是否進行了對抗式測試,還會問是誰執行的、能接觸哪些資料、工作了多久,以及供應商是否能壓制不利發現。
這種安排也可能重塑評估公司之間的競爭。如果開發者只能選擇友善或範圍狹窄的審查者,那麼「獨立」可能會變成一個標籤,而不是可靠標準。John Steidley 建議,公開框架應定義哪些稽核人具備資格,以及他們必須評估哪些風險,從而降低企業挑選避開最困難問題之評估的可能性。
其他大型開發者尚未做出相同承諾。TechCrunch 報導,Meta、SpaceXAI 與 Google DeepMind 尚未同意嵌入第三方評估員。DeepMind 執行長 Demis Hassabis 則提出另一種方案:成立一個獨立的產業標準機構,負責前沿模型的獨立測試。這項差異使得內嵌式監督究竟會成為常見做法,還是僅限於特定公司,仍然未定。
第一個訊號將是 Anthropic 與 OpenAI 是否公布參與評估員的姓名,以及規範其工作的條款。關鍵問題在於,審查者是否能存取中間檢查點、訓練與後訓練日誌、員工訪談與事件記錄,以及他們是否能在沒有編輯批准的情況下揭露不利發現。
產業也應關注最低時間要求、處理機密資訊的程序,以及評估員能否在不失去存取權的情況下拒絕公司要求的證據。加州的 SB 53 已要求大型前沿開發者發布安全框架並回報重大事件,而 SB 813 則建立了州認可的「獨立驗證組織」框架。在歐洲,EU AI Act 要求前沿開發者記錄評估與對抗式測試、回報重大事件,並與由 EU AI Office 指派的獨立專家合作。
這些法律可能把自願承諾變成更持久的義務。不過,在公司公開其運作規則之前,核心問題仍未有答案:內嵌評估員會作為獨立監督者行事,還是只是受限於他們本應審視的實驗室所設定邊界內工作的承包商?
Anthropic 與 OpenAI 認識到最終模型測試有其限制,特別是當系統能辨識評估條件時,這是正確的。但僅有存取權並不會產生獨立監督。獨立性取決於誰控制審查範圍、持續多久、能取得哪些證據,以及不利結論是否能被公開。
對開發者與企業客戶而言,最可信的承諾會是那些能從外部驗證的內容:有名字的評估員、已公布的存取規則、保留的稽核軌跡,以及對異議性結論的明確保護。從長遠來看,法規的重要性或許不只是技術評估的替代品,而是防止公司在商業利害升高時,悄悄縮減評估範圍的防護措施。