AI News

英國的 AI Security Institute(AISI)表示,領先的開放權重模型已將與頂尖專有 AI 系統之間的網路攻防能力差距縮小到約四到七個月,這比 2025 年初更短,也對那些仰賴時間來調整的資安團隊提出了明顯警訊。依 AISI 的評估,像 GLM-5.2 和 DeepSeek V4-Pro 這類模型,現在已能達到某些封閉式系統幾個月前才達到的表現水準,而且運行成本低得多。

這種組合的意義不僅限於基準測試。根據 AISI 的分析,具備可下載權重的低成本開放模型,降低了擴大攻擊性網路工作流程的實務門檻,同時也讓供應商層級的安全控管更難落實。對開發者與企業買家而言,這份報告進一步凸顯了開放模型辯論中的核心張力:讓開放權重系統在私有部署與客製化上如此吸引人的特性,也可能讓濫用更難被限制。

AISI 測了什麼

AISI 表示,這是它首次公開評估頂尖開放權重模型在網路相關任務上,與領先封閉模型之間到底差多遠。研究所使用了兩種評估方法。

第一種稱為 Narrow Cyber Tasks,共涵蓋 70 個任務,分為四個難度等級。根據 The Decoder 對結果的報導,這些任務涵蓋漏洞研究、逆向工程、網頁滲透利用與密碼學。在這個基準上,AISI 發現 2026 年 6 月發布的 GLM-5.2,表現大約相當於 2026 年 2 月的 Opus 4.6,意味著約四個月的差距。另一方面,DeepSeek V4-Pro 的表現據稱大約相當於 Opus 4.5,而 AISI 將其時間點定在 2025 年 11 月。

第二種方法 Cyber Ranges,則是在模擬網路中測試更自主的行為,而不是單一獨立任務。其中一個情境「The Last Ones」,模擬對一個企業網路發動多步驟攻擊,該網路包含四個子網路與約 20 台主機。AISI 估計,人類專家完成這項演練大約需要 20 小時。

在該項測試中,開放模型的表現沒那麼理想,但仍顯示出快速追趕的趨勢。AISI 表示,在模擬環境中,GLM-5.2 的表現幾乎與 Opus 4.5 相當,而 DeepSeek V4-Pro 則低於 Sonnet 4.5。研究所指出,Cyber Ranges 的證據力弱於 Narrow Cyber Tasks 的結果,因為它依賴較少的情境,且可能反映的是長程規劃能力的限制,而非純粹的網路知識。

這個區分很重要。對資安買家而言,實際風險不只是模型能不能解出逆向工程提示詞,而是它能否在嘈雜環境中持續執行複雜的一連串動作。AISI 似乎是在說,這兩種能力都重要,而開放與封閉模型之間的差距,可能取決於所衡量的是哪一種工作。

為什麼成本差距會改變局勢

AISI 公布的成本數字,或許是這次發布中最具 عملی意義的部分。根據研究所說,一次 1 億 token 的 Cyber Ranges 測試,使用 Opus 4.5 或 Opus 4.6 的成本約為 85 美元,使用 GLM-5.2 約為 46 美元,而 DeepSeek V4-Pro 則只有 1.19 美元。

它也公布了每個任務的成本估算,針對可穩定解決的任務。Opus 4.6 約為每題 15 美元,GLM-5.2 約為 6 美元,Opus 4.5 約為 12.50 美元,DeepSeek V4-Pro 則約為 0.28 美元。

這些數字不等於真實世界的攻擊成本,AISI 也沒有這麼主張。但它們確實顯示,「夠好用」的網路攻防能力,可能正變得便宜許多,尤其當它與開放式部署選項結合時。對防守方而言,威脅不只是開放模型是否精確追上當前前沿;如果較舊或稍弱的能力能以極低成本、大量運行,它們仍可能改變攻擊者的經濟模型。

這也是這份報告不只與資安研究有關,也與企業 AI息息相關的原因之一。許多評估開放權重模型的組織,著重於隱私、主權與較低的推論成本。AISI 的發現提醒他們還必須思考雙重用途暴露:一個對內部寫程式、自動化或紅隊支援很有吸引力的模型,可能在安全特性上與 API 型封閉替代方案截然不同。

可下載模型的安全護欄看起來很弱

AISI 最嚴厲的結論,關於的是控管,而不是原始表現。研究所表示,受測的開放模型其安全措施大多無效。The Decoder 引述的一個例子中,DeepSeek V4-Pro 有時會拒絕逆向工程請求,但重新嘗試一次就足以繞過限制。

這種弱點並不是被描述成某一個模型獨有的缺陷。AISI 更大的觀點是結構性的:監控、分類器、節流與使用者限制等保護措施,都仰賴能夠控制系統存取。一旦權重被釋出,這種控制就會減弱或消失。複本可以在私下執行、被修改,或在原始開發者無法觸及的地方分享。

AISI 據報把這描述為「持續且不可逆的濫用風險」。這比一般 model card 的警語更強烈,也說明了為什麼研究所將差距縮小視為政策與防禦時程問題,而不只是排行榜更新。

同時,這份報告並未完全否定開放模型。AISI 也承認開放權重部署的實際優勢:私有託管、更低的供應商依賴、可客製化,以及降低供應商變更存取條件或關閉服務的風險。對許多公司來說,這些都是真實優點。政策上的挑戰在於,正是讓開放模型對買家有吸引力的去中心化,也削弱了對有害使用的集中控管。

證據、限制,以及仍未證明的部分

這篇報導的核心發現,來自 The Decoder 所轉述的 AISI 評估;第二個來源 Tech Times 似乎只是重述了相同的底層評估,並未增加實質細節。這表示,這裡主要的證據基礎是機構分析的專業媒體報導,而不是在來源集中完整重現的公開論文。

有幾個限制很重要。第一,AISI 表示 Cyber Ranges 的結果屬於較弱證據,因為它來自較少的測試案例。第二,研究所也指出,評估可能會稍微低估開放模型的最佳表現,因為這些系統並未特別為測試微調。第三,模擬網路環境不包含實際防守者,也沒有真實組織的全部混亂與雜訊。

這些限制朝不同方向作用。開放模型支持者可能會主張,如果更好的提示設計或微調能改善結果,那麼報導中的差距就高估了封閉系統的領先。另一方面,資安實務者可能會指出,模擬低估了攻擊者在真實世界中遇到的阻力,因為生產環境是有防禦、被監控且不一致的。

在這些標題之下,還有一個基準設計問題。某個在 Narrow Cyber Tasks 表現良好的模型,到了真正的多階段滲透時,仍可能因為失去計畫脈絡、誤用工具或錯誤累積而失敗。反過來說,在長時間自主演練中表現吃力的模型,對於把工作拆成更小步驟的人類操作員仍可能非常有用。AISI 的論述本身似乎也承認了這個差別。

這對開發者與企業買家意味著什麼

對 AI 開發者來說,這份報告指向一個正在變動的基準。若像 GLM-5.2 與 DeepSeek V4-Pro 這類開放權重系統,能以大幅更低的成本接近近期封閉模型的網路攻防表現,那麼正在打造程式碼助理、資安自動化或 AI agent 工作流的產品團隊,將擁有更多部署選項——但也得對如何限制、觀測與分段這些系統負起更多責任。

對企業而言,實際重點不是「避免開放模型」,而是「把成本決策和風險決策分開」。在受控的內部環境中運行開放模型仍然可能合理,尤其是在資料駐留與私有推論很重要的情況下。但資安團隊可能需要比託管 API 更強的本地控管、更窄的工具存取、更多細節的稽核日誌,以及更明確的內部使用政策。

對網路攻防市場而言,AISI 的時間框架或許是最重要的策略信號。研究所把封閉與開放模型之間的差距,看成是一段暫時的準備窗口,讓使用較強系統的防守方能在同等能力廣泛可下載之前先行調整。如果這個窗口現在是四到七個月,而不是六到十個月,那麼偵測工程、紅隊演練與濫用監控的路線圖可能就得加快。

這份報告也發生在模型市場高端快速變動之際。AISI 表示,包括 Mythos Preview 和 GPT-5.5 在內的封閉模型,自其開始測試以來,在 AI 網路攻防能力上帶來了最大幅度的一些提升。英國的 National Cyber Security Centre 也另外警告,網路威脅環境正在快速變化。即使開放模型不會立刻複製每一次前沿跳躍,擴散速度看起來仍在加快。

接下來要看什麼

一個即時訊號,是 AISI 預計將測試 Kimi-K3;The Decoder 稱它預計會在 7 月底釋出開放權重。據報導,AISI 認為目前的程式碼基準顯示,Kimi-K3 可能更接近今天的前沿模型,但成本也可能高於其他開放模型。

除了這次單一發布之外,還有三件事很重要。第一,未來的 Cyber Ranges 評估是否顯示開放模型在長程自主性上有所進步,而不只是狹窄任務能力。第二,企業是否會為開放權重部署採用更強的本地治理模式,而不是假設供應商時代的安全習慣仍然適用。第三,封閉模型供應商能否維持在網路攻防表現上的顯著領先,或是前沿能力仍會在數個月內擴散到可下載系統。

Creati.ai 觀點

這次 AISI 發現值得注意的地方,不只是開放模型正在進步,而是落後幅度似乎在縮小,同時推論經濟性還在更快改善。實際上,這意味著市場未必需要開放模型與前沿完全平價,就足以讓它們在網路工作流程中變得具有戰略重要性。「夠接近、夠便宜、又夠難以控制」本身就是一個嚴肅門檻。

對產品團隊與買家而言,教訓是把開放權重採用視為一項基礎架構與治理決策,而不只是模型品質決策。推動企業 AI 自主性的因素——私有託管、更低成本、擺脫供應商綁定——同時也削弱了既有的安全假設。隨著 GLM-5.2、DeepSeek V4-Pro,以及可能的 Kimi-K3 繼續縮小差距,真正的差異化,或許會從原始能力轉向:誰能在工具、資料與濫用控制上,以可靠機制部署它們。

精選

AISI 指出,開放權重 AI 網路攻防模型正更快逼近前沿系統,而且成本遠低

AISI 表示,開放權重模型如今與頂級封閉式 AI 網路攻防系統的差距只剩 4-7 個月,隨著成本大幅下降,防守方的領先優勢也在縮小。