
Anthropic 正在對 AI 代理提出一項具重大意義的資安主張:根據 The Decoder 引述 Anthropic 的 system card 報導,Claude Opus 5 搭配該公司的 Auto Mode,在 129 個測試情境中,將瀏覽器型提示注入攻擊的成功率降到了 0%。如果這個結果在 Anthropic 自身的評估環境之外也站得住腳,那將代表對代理安全中最棘手問題之一的顯著進展。
這則消息之所以重要,是因為提示注入已成為部署會瀏覽網頁、閱讀文件並代表使用者採取行動的 AI 代理時的核心障礙。在這類攻擊中,惡意指令會被藏在網頁或其他外部內容之中,而模型會依照攻擊者的指示行事,而不是開發者或使用者的意圖。The Decoder 引述 OpenAI 在 12 月所說的話,指出提示注入也許永遠無法被完全解決。在這樣的背景下,Anthropic 的報告結果不再只是一次例行的模型升級,而更像是對分層防禦是否能讓瀏覽器自動化真正更安全的一次測試。
根據 The Decoder 對 Anthropic system card 的報導,當 Claude Opus 5 與 Auto Mode 一起用於 Anthropic 的產品,如 Claude Cowork 時,瀏覽器攻擊成功率 0% 的紀錄便出現了。這項報告中的評估涵蓋了 129 個瀏覽器代理測試情境。
模型本身與完整產品配置之間的區別,是這個故事的核心。The Decoder 報導指出,Claude Opus 5 單獨使用時並沒有達到零;如果沒有 Auto Mode 的額外保護層,瀏覽器提示注入仍有 3.7% 的成功率。同一份報告也說,在較狹窄的衡量標準下,Sonnet 5 的表現比 Opus 5 更好,為 0.93%。換句話說,Anthropic 並不是在宣稱基礎模型單獨解決了問題。更強的主張是,模型加上執行階段保護措施的組合做到了。
這對買家與建構者如何理解這項公告很重要。AI 代理的安全性,越來越像是系統問題,而不只是模型問題。瀏覽器代理要面對不受信任的內容、多步驟任務,以及行動權限。模型也許更擅長忽略惡意文字,但如果包裹它的產品太容易執行危險命令,系統仍然暴露在風險中。
提示注入常被形容為 LLM 版的不受信任輸入攻擊,但瀏覽器代理讓問題更嚴重,因為它們運作於即時網頁,而網頁可能包含任意文字、隱藏元素,或為了操控模型而設計的指令。如果代理能點擊、複製、提交表單、存取連接器或處理敏感資料,一次成功的提示注入就不只是答錯而已,還可能導致資料外洩或不想要的操作。
因此,如果這個結果可以重現,它對 企業 AI 與 AI 代理都有更廣泛的意義。許多最具吸引力的自動化用途,都涉及在 SaaS 工具、內部入口網站、支援控制台與公開網站之間導覽。那些環境正是隱藏或對抗性指令最可能出現的地方。
The Decoder 將瀏覽器型提示注入視為懸在 AI 代理頭上的最大安全缺陷,而這一評估反映了當前市場的擔憂。打造代理產品的創業者與評估它們的企業資安團隊,已不得不對任何自主瀏覽器行為保持謹慎。問題不在於模型是否有用,而在於它們能否在對抗性內容周圍保持可信。
報告中的零成功率結果依賴 Auto Mode;The Decoder 稱,Auto Mode 在 Claude Opus 5 之上加入了兩道獨立防線。第一道會在模型處理內容之前,掃描進來的內容是否含有隱藏指令。第二道則在執行前封鎖危險動作。照此描述,攻擊者必須分別擊破這兩道防護。
這種架構很重要,因為它符合資安團隊通常緩解高影響威脅的做法:隔離高風險輸入、分類可疑內容、並為執行設門。實務上,這表示 Anthropic 似乎把提示注入看得不只是推理失誤,而是端到端的產品資安問題。
對建構者來說,這有直接的含意。推出瀏覽器自動化的團隊不應假設只靠更強的前沿模型就夠了。他們可能需要前處理過濾器、政策引擎、行動核准層,以及更嚴格的工作流程沙箱。Anthropic 的報告結果顯示,防禦堆疊在整體效果上可能明顯優於單獨的模型。
提到 Claude Cowork 也暗示了 Anthropic 認為這件事在商業上重要的地方。那些代表知識工作者行動的產品,尤其是在瀏覽器內運作的產品,需要的不只是基準測試上的智慧,還需要讓企業相信系統不會遵從來自隨機網頁的隱藏文字的控制機制。
這裡最強的主張都來自供應商,應該這樣來讀。The Decoder 把主要數字歸因於 Anthropic 自家的 system card。因此,129 個瀏覽器代理情境中 0% 的成功率,是供應商報告的評估結果,而不是第三方的獨立認證。
The Decoder 也引述資安公司 Gray Swan 的另一項一般提示注入測試。在那項測試中,經過 15 次攻擊嘗試後,報告中的成功率從 Opus 4.8 的 5.5% 降到 Claude Opus 5 的 2.0%。這個 Gray Swan 數字有幫助,因為它顯示改善不只侷限於特定的瀏覽器代理設定,但它仍然只是一個基準測試,並不能完整證明模型的韌性。
同樣重要的是,文章本身的細節限制了更廣泛的結論。報告中的零成功率只適用於啟用 Auto Mode 的瀏覽器代理,而不是 Claude Opus 5 的所有用途。沒有這些保護時,The Decoder 表示攻擊成功率是 3.7%。這比許多觀察者可能預期的好得多,但它並不是零。這也代表模型之間的比較比標題看起來更複雜:據報導,在沒有 Auto Mode 的瀏覽器衡量中,Sonnet 5 的表現優於 Opus 5,儘管標題聚焦的是 Opus 5。
缺少的部分是外部驗證。來源材料沒有提供在開放式紅隊環境、客戶部署,或長時間實際瀏覽情境中的獨立重現結果。它也沒有明確說明 129 個情境的具體組成、攻擊多樣性,或成功的定義是狹義還是廣義。這些缺口並不會使結果無效,但意味著買家應把它視為有希望的證據,而不是已經塵埃落定的事實。
對於打造程式碼助理產品、工作自動化工具,或內部 AI 代理的團隊來說,實務上的教訓是:部署架構可能和模型選擇一樣重要。Anthropic 報告的數字顯示,把模型包上一層內容檢查與行動門控,可以大幅降低瀏覽器任務中的利用成功率。
這對企業 AI 買家也有採購上的含意。販售瀏覽器型代理的供應商,未來不只要說明自己使用哪個 LLM,還要說明他們如何檢查網頁、如何隔離 system prompts、如何限制工具,以及如何封鎖高風險動作。比較 Claude Opus 5、Sonnet 5 或 OpenAI 的競品時,買家需要的是產品層級的安全答案,而不只是基準圖表。
這也改變了競爭框架。如果 Anthropic 能在更廣泛的獨立測試中證明 Claude Opus 5 與 Auto Mode 依然穩健,那麼它在重視可靠性與封鎖風險、勝過華麗展示的敏感企業 AI 部署中,將更具說服力。AI 代理市場正從「它能完成任務嗎?」轉向「它能否在混亂、對抗性的輸入下安全完成任務?」
下一個值得觀察的訊號,是獨立測試。如果 Gray Swan 之外的資安公司能在真實瀏覽器環境中,對 Claude Opus 5、Auto Mode 與 Claude Cowork 提供可重現的評估,那將比任何單一供應商的 system card 更有說服力。
第二個訊號是產品範圍。Anthropic 報告的結果針對的是瀏覽器代理情境。買家應該觀察類似防禦是否也擴展到文件匯入、電子郵件、API 連接工具,以及多代理工作流程,因為提示注入也可能透過不同管道進入。
第三,值得追蹤競爭者是否直接回應。OpenAI 已公開承認提示注入問題的嚴重性,而其他代理平台也面臨同樣壓力。如果 Anthropic 的方法證明具持久性,分層防禦可能會成為 AI 代理的基本期待,而不再只是差異化賣點。
最後,最重要的是 Anthropic 是否會分享更多測試設計細節:攻擊分類、失敗定義、過濾器的誤判,以及 Auto Mode 的可用性取捨。能阻擋攻擊、但也讓自動化變慢或限制過多的安全控制,商業上仍然不容易部署。
這個故事最有趣的部分不是標題數字,而是背後的架構。Anthropic 似乎在展示:對 AI 代理的提示注入防禦,即使在純模型層仍未解決,也可以作為產品層的紀律來達成。這對市場來說是更現實的路徑。企業不會為了瀏覽器自動化去買一個裸模型;他們買的是系統。
不過,這還不是一個已經解決的問題。這裡可用的證據有限,而最強的結果來自 Anthropic 自身。但對 AI 代理與企業 AI 平台的建構者而言,結論非常直接:不要再把提示注入當成抽象研究問題,而應開始用層疊控制、受監督的動作與明確的信任邊界來設計。若 Claude Opus 5 與 Auto Mode 經得起外部審視,它們也許會成為一個分水嶺:讓安全的瀏覽器自動化從實驗性風險,變成營運上可行的方案。
Anthropic 表示,Claude Opus 5 與 Auto Mode 在內部測試中將瀏覽器提示注入成功率降為零,這對 AI 代理來說是一項值得注意的主張。