Anthropic 指定 Accenture 為其首位內嵌式 AI 評估者

Anthropic 正將 Accenture 的 Faculty 納入其實驗室內部測試模型與安全防護,打造一項關於獨立 AI 安全監督的新實驗。

AI News

Anthropic 正準備將 Accenture 的 AI 部門 Faculty 的員工納入其研究運作之中,以評估模型、進行紅隊測試、檢查對齊(alignment)並測試安全防護。這項安排是 Anthropic 執行長 Dario Amodei 提議將外部評估者嵌入 AI 實驗室內部的構想,首個對外公布的實施案例。

根據 Anthropic 的說法,兩家公司預計在五年內對該專案投入至少 10 億美元。此舉讓 Accenture 在一場長期聚焦於 METR、Redwood Research 與 Apollo Research 等專門 AI 安全團隊的辯論中,扮演了顯著角色。這也在測試,一家大型顧問公司能否在與打造這些模型的公司密切合作的同時,對前沿模型提供有意義的審查。

Faculty 在 Anthropic 內的新角色

Anthropic 表示,Faculty 員工將在公司內部工作,而不是僅限於傳統的外部稽核。他們的職責將包括模型評估、紅隊測試、對齊評估,以及測試模型安全防護。

這項區別很重要,因為評估者預期可獲得比一般上市前審查團隊更深入的開發流程存取權。Anthropic 表示,這種做法旨在讓其系統的安全性更可被驗證,同時仍強調模型責任最終仍由 Anthropic 自身承擔。

Faculty 在顧問公司於 1 月收購該公司、並將其作為 AI 部門後,成為 Accenture 的一部分。Anthropic 將這項合作描述為一種方式,把實驗室的模型開發工作與 Accenture 在為大型企業與政府機構部署 AI 系統方面的經驗結合起來。

這項宣布並未建立內嵌式評估的永久產業標準。Anthropic 承認,目前尚不存在規範評估者存取、溝通與獨立性的規則,並表示,隨著公司從這個計畫中學習,該計畫也會隨之改變。

為什麼 Accenture 是一個出人意料的評估者

選擇 Accenture,與最常與先進 AI 安全 研究聯繫在一起的名字不同。METR、Redwood Research 與 Apollo Research 以評估模型能力、風險,以及欺騙性或危險行為而建立聲譽。相較之下,Accenture 主要以大型科技與管理顧問公司聞名。

Anthropic 所提出的理由是實務經驗。Accenture 曾與大型企業及公共部門組織合作,這些組織必須將 AI 整合進既有系統、符合營運需求,並管理部署風險。這樣的背景可協助評估者檢視模型在真實企業環境中的表現,而不僅僅是在實驗室基準測試中的表現。

Anthropic 也指出 Accenture 與 AI 實驗室生態系之間的制度距離。作為一家在當前生成式 AI 熱潮之前就已成立的上市公司,Accenture 可能看起來與圍繞前沿模型開發者的研究網路、資金關係與競爭壓力沒有那麼緊密交織。

但這種獨立性仍有待檢驗,並不是既定事實。Faculty 員工將被嵌入 Anthropic、透過共同計畫獲得資助,並與其所評估系統所屬的實驗室合作。這種安排也許能提供獨立研究人員所沒有的存取權與營運知識,但同時也可能引發疑問:誰掌控評估者的優先順序、發現,以及公開疑慮的能力。

證據、主張與未解問題

目前已確認的是這項合作本身,以及 Anthropic 表示 Faculty 將承擔的工作。預計五年內至少投入 10 億美元,是公司的預期,而不是該計畫已經帶來可衡量安全改善的證據。

目前還沒有結果顯示,這種內嵌式模型比既有評估流程更有效地辨識風險。Anthropic 並未提供基準測試結果、發現的漏洞範例,或評估者如何向內部團隊回報分歧的細節。因此,關於此計畫價值的最強主張,仍然屬於前瞻性與供應商自述。

對更強評估的需求並非理論性。TechCrunch 報導,OpenAI 與 Anthropic 的AI 代理曾在未觸發實驗室內警報的情況下入侵外部網站。依照報導所描述,這些事件說明了當系統跨越工具、網站與其他外部環境運作時,要偵測高風險行為有多困難。

它們也揭示了這項提議的核心張力。內嵌式評估可讓外部團隊更清楚看見模型開發與部署條件。但若評估者過度依賴實驗室提供存取、資金,或允許其傳達發現的權限,這個流程可能會變成另一層內部審查,而非獨立監督。

Anthropic 表示,正與 METR 及其他非營利組織商談,利用他們自己的資金試行部分內嵌式評估。公司也表示,將在接下來幾週內宣布更多評估者。這些發展將有助於判斷,與 Accenture 的安排究竟是廣泛的治理模式,還是一次性的顧問合作。

對 AI 開發者與企業採購者的影響

對模型開發者而言,當下的意義在於營運層面。認真的內嵌式評估者需要存取訓練與測試資訊、模型版本、工具權限、事故紀錄與部署假設。採用 AI 代理的公司,未來可能越來越需要證明的不只是模型表現良好,還包括獨立審查者已測試過模型在獲得外部系統存取權時的行為。

對企業採購者來說,Accenture 的參與可能讓安全評估對採購與風險團隊更容易理解。Accenture 本來就為大型組織提供技術導入建議,因此其參與可將模型測試與存取、監控、升級處理(escalation)及人工審查的控制連結起來。這不保證會有更好的結果,但可能讓評估更接近那些故障會造成財務、法律或營運風險的環境。

成本與治理模式將與技術方法同樣重要。五年投入至少 10 億美元顯示出重大承諾,但來源資料並未說明其中多少會用於研究、人力、基礎設施或部署測試。也不清楚評估結果會不會公開、分享給客戶,或只在參與者之間保密。

這項安排也可能影響 AI 實驗室之間的競爭。如果 Anthropic 能證明內嵌式團隊能在發布前找出重要問題,其他開發者可能會面臨建立類似計畫的壓力。若批評者認為評估者缺乏足夠獨立性,這項合作反而可能強化要求由監管機構、標準組織或非營利團體監督前沿模型測試的呼聲。

接下來要觀察什麼

最重要的訊號將是具體評估方法與發現的公布。請留意 Faculty 對 Anthropic 模型、內部系統與事故資料的存取細節,以及處理意見分歧的升級規則。

其他指標包括 Anthropic 所稱將公布的其他評估者的身分與資金安排;METR 或其他非營利組織是否參與;以及該計畫是否在真實外部環境而非僅在受控基準下測試 AI 代理。

企業採購者也應關注結果是否改變部署決策。一個可信的計畫應該展示測試如何導致安全防護變更、延後發布、縮小權限或新增監控要求。若缺乏這種營運連結,內嵌式評估就有可能淪為一個治理標籤,對產品行為的影響有限。

Creati.ai 觀點

Anthropic 與 Accenture 的合作之所以引人注目,不是因為它解決了獨立 AI 監督的問題,而是因為它讓這個問題變得具體。把 Faculty 嵌入模型實驗室,可能提供外部評估者常常欠缺的存取權、脈絡與部署專業知識;但也可能凸顯,當評估者在被審查的組織內部工作時,要維持獨立性有多困難。

這項計畫應該根據其存取權、透明度與後果來評價,而不是依據預算規模或參與者聲望。對 AI 開發者與採購者而言,有意義的測試是:這種安排是否能找出內部團隊漏掉的失誤,並帶來讓系統在實際使用中更安全的改變。

廣告