AI News

NVIDIA 正透過其 AI Red Team 的一篇新文章,提出一個更廣泛的企業 AI 部署觀點:如果企業想讓 AI 代理人直接面對真實工具、程式碼庫與內部資料,就需要在模型本身之外設置基礎架構控制。

在 NVIDIA Developer Blog 發布的指南中,團隊表示,在過去六個月評估企業代理人時,他們反覆發現相同的可被利用模式。根據 NVIDIA,反覆出現的問題包括薄弱的存取控制、不安全的命令執行、缺乏網路對外流量限制,以及代理人環境中的明文秘密資訊。重點不在於這些是全新的資安概念,而在於 NVIDIA 認為,現行的代理人技術堆疊在這些方面仍經常失敗到一個程度,以至於不應將基於提示詞的防護與審查模型視為主要防線。

NVIDIA 的警告關於代理人架構,而非提示詞調校

這篇標題為「Four Ways to Deploy More Secure AI Agents」的文章來自 NVIDIA AI Red Team,重點在於大型語言模型透過代理人外殼(agent harness)連接到即時系統時會發生什麼事。NVIDIA 以企業實務角度來描述這個問題:一位能夠審查 bug 報告、進行修復、執行測試並提交修補程式的數位同事,確實能提升生產力,但同樣的設定也可能產生具備高權限、且攻擊面廣泛又不易理解的軟體。

這樣的框架很重要,因為這份建議的對象與其說是模型研究人員,不如說是圍繞 AI 代理人打造生產系統的團隊。NVIDIA 表示,他們觀察到的失敗模式出現在多種類型的代理人中,從互動式程式編寫助理到始終在線的自主助理都有,而且並不侷限於單一框架。

該公司的核心論點是,模型控制平面內部的防禦,在對抗性壓力下不夠可靠。根據文章,基於提示詞的防護與「LLM-as-a-judge」模式,一直都容易受到社交工程、逐步累積式的「煮青蛙」操控,以及隱藏在看似合法工作流程中的攻擊。NVIDIA 的立場是,必須採用在模型外部強制執行的決定性控制。

NVIDIA 認為企業應優先採用的四項控制

首先,NVIDIA 表示應將存取控制視為第一道防線。在評估中,團隊發現有些代理人使用個別使用者的憑證,卻可被內部網路上的任何已授權使用者存取。根據 NVIDIA,這不僅讓代理人的合法權限容易被濫用,某些情況下也建立了蒐集憑證並在預期的代理人脈絡之外使用它們的路徑。實務建議很直接:限制每個代理人只能由明確核准的使用者使用,並在最小權限原則下,讓代理人的權限與呼叫它的使用者一致。

第二,NVIDIA 警告,命令執行仍然是可被存取代理人中衝擊最大的風險。許多代理人框架會提供 shell,因為它很有彈性,能減少對專用工具的需求。但如果模型輸出可以觸發命令執行,那麼提示詞注入或惡意使用者輸入就可能把一般開發者命令變成任意程式碼執行的途徑。NVIDIA 指出,軟體工作流程中常見的命令,包括套件安裝與測試執行,可能看起來無害到足以通過審查模型,但仍可能導致遭入侵。

該公司建議使用像 Docker 或 NVIDIA OpenShell 這類的沙箱化執行環境、阻止在非可執行工作區之外寫入的作業系統層級限制,以及在命令列存取不可避免時,對可執行命令使用非常狹窄的允許清單。它也強調一個較隱晦的風險:即使沒有 shell,檔案讀寫工具仍可能讓代理人取得權限升級,因為它可以修改啟動檔、設定檔,或其他之後會被另一個程序執行的位置。

第三,NVIDIA 表示,對外連線應搭配預設拒絕(default-deny)的網路 egress 政策來封鎖。根據 Red Team 的說法,沒有任何限制的外連會簡化資料外洩,也能讓反向 shell 或其他直接操作者存取代理人的執行環境。NVIDIA 報告指出,當 egress 控制被正確落實時,攻擊會變得更慢、可靠性更差,也更難維持,因為互動必須持續透過代理人,而不是走直接的外部通道。對建置者而言,這意味著一條具體的部署原則:只允許代理人任務所需的最少外部端點。

第四,文章指出,持久性秘密資訊應盡可能不要放在代理人環境中。NVIDIA 文章中擷取的證據指向明文秘密資訊暴露是反覆出現的失敗模式。其更廣泛的建議是嚴格的秘密資訊管理、謹慎驗證套件來源,以及嚴密控制工具權限。核心原則就是降低攻擊者在代理人遭操控時可竊取或重複利用的內容。

為何這對程式編寫工具與企業 AI 現在特別重要

NVIDIA 的建議發布時,正值越來越多企業從聊天機器人試點,轉向在工程、IT、客服與後勤辦公流程中使用工具型代理人。聊天助理與實際運作代理人之間的差距很大:一旦系統能執行腳本、安裝相依套件、建立工單、查詢內部系統或接觸儲存庫,風險輪廓就開始更像傳統軟體安全與端點強化,而不只是模型安全。

這讓這份指南對部署 程式編寫助理 或其他自主工作流程工具的團隊尤其相關。以程式碼為主的代理人通常需要執行測試、檢查檔案、安裝套件,並連接版本控制系統。NVIDIA 認為,正是這些能力在安全控制主要依賴模型判斷時,可能變得不安全。文中提到 git 設定檔與 model context protocol 設定檔,也指向正在形成的代理人工具生態系,彈性整合可能悄悄創造出新的持久化路徑。

對於 企業 AI 買家來說,實際結論是:展示任務完成率很高的供應商 Demo 並不夠。買家需要詢問執行發生在哪裡、執行環境是否隔離、允許哪些網路目的地、使用者身分如何傳遞,以及長期存在的憑證是否會留在代理人環境中。這些問題對可靠性與治理的影響,和純粹的資安同樣重大。

證據、主張,以及尚未被驗證的部分

這則報導幾乎完全建立在 NVIDIA 透過 NVIDIA Developer Blog 發布的自家內容上,而第二個來源只是把同一篇內容反映在 Google News feed 中。這表示核心發現應被視為供應商回報的紅隊觀察,而非獨立的產業測量。

即便如此,NVIDIA 仍提供了有用的具體細節。它表示,AI Red Team 在過去六個月評估了多個代理人,並在不同框架與 harness 中發現可重複利用的模式。它也舉出具體的危險行為例子,包括使用 shell 執行套件安裝或腳本、寫入 shell 啟動檔,以及利用不受限制的對外流量進行外洩或遠端存取。

然而,文章並未量化測試了多少代理人、涉及哪些供應商或開源堆疊、各種失敗模式出現的頻率,以及生產環境中發生了多少事件。它也沒有提供比較型的 benchmark 數據,證明某一組控制措施相對於另一組的效果。因此,這份指南最好被理解為來自具備直接測試經驗的 Red Team 的實務架構建議,而不是全面的市場調查。

對提示詞過濾與 LLM-as-a-judge 設定可靠性的批評,也是 NVIDIA 的評估。許多資安團隊大概會同意其大方向,但在所提供的證據中,文章並未包含外部驗證的測試結果。這並不代表警告不重要;這只表示讀者應把一般性教訓,與「所有代理人產品都會以相同方式失敗」這種假設區分開來。

對建置者與平台團隊的影響

對建置者而言,最明顯的轉變是從應用層安全,移向系統層安全。如果 AI 代理人可以接觸到接近 production 的資源,那麼部署設計就比巧妙的提示詞更重要。沙箱邊界、身分傳遞、端點允許清單與秘密資訊隔離,都會成為核心產品決策。

這也帶來成本與工作流程上的影響。沙箱化可能讓執行變慢,或讓開發環境更複雜。預設拒絕的 egress 政策要求團隊詳細盤點相依性。逐一對應使用者權限,可能迫使企業更深入整合身分系統。但若企業希望 AI 代理人從實驗階段走向核准的企業工作流程,這些限制可能是必要的。

這份指南也暗示了對 工作場所自動化 更成熟的定義。與其問代理人是否能端到端完成工作流程,不如問它是否能在嚴格受限的爆炸半徑內完成。這會影響企業 AI 平台的架構選擇,包括曝光哪些工具、在哪裡執行,以及可接受多少自主性。

接下來要觀察什麼

一個有用的訊號是,主要的代理人框架與企業平台是否開始預設提供這些控制,而不是把它們當作可選的強化步驟。特別值得觀察的是更強的沙箱整合、更細緻的身分與授權模型、更容易管理的網路 egress 政策,以及避免持久性憑證的秘密資訊設計。

第二個訊號是,是否有更多供應商會發布對抗性測試資料,而不是泛泛的安全聲明。NVIDIA 的文章提出了可信的疑慮,但市場仍缺乏一致的第三方證據,來說明這些代理人失敗模式在各產品間有多普遍。

最後,值得追蹤 secure-by-default 模式是否會成為 AI 代理人採購的一部分,尤其是在受監管產業中。如果買家開始要求隔離與最小權限落實的證明,安全架構就可能變成競爭差異化優勢,而不只是後台清單項目。

Creati.ai 觀點

NVIDIA 的訊息與其說是在談一個新漏洞,不如說是在談市場修正。第一波 AI 代理人常常以自主性與便利性來評分。這份指南則主張,企業應該把它們當作具特權的軟體操作員來評估。對這個類別而言,這是一個健康的轉變。

對創辦人與產品團隊來說,策略教訓很簡單:在企業 AI 中勝出的 AI 代理人,不會只是能完成任務的那些,而是能證明自己在哪裡執行、能接觸到什麼、以及不能外洩什麼的那些。模型品質依然重要,但部署架構正迅速成為 AI 代理人、工作場所自動化,以及任何嚴肅程式編寫助理的真正信任層。

精選

NVIDIA Red Team 提出保護企業 AI 代理人的四項架構控制

NVIDIA 的 AI Red Team 表示,企業 AI 代理人需要更嚴格的存取、沙箱化、網路控制與秘密資訊處理,因為模型層級的防禦正在失效。