AI News

AI agents 從可重複使用的「skills」中獲得更多好處,因為這些指令建立了可靠的工作流程,而不是因為它們大幅擴展了模型的事實知識,這是普林斯頓大學、UC San Diego 及其他機構研究人員的一項研究結論。

這項由 The Decoder 報導的研究,基於 8,135 次受控測試執行,比較了有無任務特定 skills 的 agents。它也指出了正在建置 agent 系統的團隊面臨的一項嚴重限制:隨著 skill 資料庫變大,agent 更不容易檢索到正確指令。報告中的測試顯示,當 skill 數量為五個時,檢索精準率為 29.6%;當增至 100 個時,則降至 3.3%。

這些發現之所以重要,是因為開發者愈來愈常使用儲存的指令、playbooks 與工具流程,在不重新訓練底層模型的情況下提升 AI agents。它們暗示,核心工程問題不只是如何累積更多 skills,而是如何可靠地選取並套用它們。

為什麼 skills 能改善執行

在這項研究的定義中,skill 是一組精簡的指令,用來完成特定任務。它可以描述 agent 應該採取的動作順序、應使用的工具、應執行的檢查,以及應避免的錯誤。

這使 skills 與傳統知識庫不同。它不是提供一個新事實,而是給 agent 一條完成任務的程序路徑。它可以告訴系統如何準備環境、以正確順序呼叫工具、驗證中間結果,或格式化最終輸出。

研究發現,這種程序性基礎解釋了 65.7% 的案例,也就是有 skill 的 agent 表現優於沒有 skill 的 agent。相較之下,直接提供額外知識,只解釋了受測案例中 4.5% 的改善,根據 The Decoder 對該研究的說明。

對建置者而言,這項區別很重要。模型可能已經知道相關概念,但仍可能因為跳過設定步驟、錯誤呼叫工具,或產生無法使用的輸出而失敗。設計良好的 skill 可以把開放式請求轉化為可重複的工作流程,從而減少這些執行錯誤。

這個結果也有助於解釋,為什麼 skills 會成為模型重訓的吸引人替代方案。團隊可以更新流程、加入驗證步驟,或編碼常見例外,而不必改變模型權重。這讓 agent 的行為更容易隨產品與內部流程變動而調整。

研究證據與限制

研究團隊在 8,000 多次執行中,比較了相同任務在有無相關 skill 下的 agent 行為。這種受控設計比 agent 完成任務的軼事式展示更有力,因為它聚焦於 skill 本身的貢獻。

不過,這些證據應被視為研究結果,而非對所有 agent 架構或工作負載的保證。現有報導並未說明實驗中使用的所有模型、基準任務或檢索系統。因此,65.7% 與 4.5% 這兩個數字描述的是研究測試條件,而非程序性與事實性優勢的普遍分割。

skills 也帶來了新的失敗模式。約有 10% 的案例中,據報 agent 機械式地套用了有用的 playbook,或在不適合的情境下使用它。換句話說,skill 可能減少一類錯誤,卻同時產生另一類錯誤:agent 過於字面地遵循指令,而沒有意識到任務需要不同方法。

研究也指出,並不一定需要精確相符的 skill。相關 skill 可能已足以提供結構來幫助 agent。這種彈性在實務上有用,但也讓評估更複雜。團隊不僅要測試正確的 skill 是否可用,也要測試相似或部分相關的 skills 是否會導致不當行為。

隨著資料庫擴大,檢索瓶頸愈來愈明顯

最強烈的警告來自檢索。當受測資料庫從 5 筆增加到 100 筆時,報告中的命中率從 29.6% 降到 3.3%。The Decoder 表示,尤其是名稱相近的選項讓選擇更困難。

這對 AI agents 形成了擴展性問題。小型資料庫可以透過相對簡單的比對來管理,但生產系統可能會累積數百或數千個 skills,涵蓋不同團隊、軟體工具、權限與邊緣情況。當 agent 無法區分相關指令與鄰近替代方案時,覆蓋越多,系統反而可能越不可靠。

問題不只在搜尋品質。skill 名稱、描述與中繼資料都會影響檢索是否成功。界線不清的流程,對模型與傳統搜尋系統都可能難以區分。大型資料庫也可能包含過時或彼此重疊的指令,增加 agent 選到技術上可行、但實際上錯誤的工作流程的機率。

這使 skills 管理成為生命週期問題。建立流程只是第一步。團隊還需要機制來測試、版本控管、排序、退役與檢索 skills。依照研究報導的結論,更好的自我學習 agents 將需要更可靠的方法來建立、找到並應用儲存的經驗,而不只是更龐大的收藏。

這些發現對建置者與企業意味著什麼

對產品團隊而言,最直接的啟示是把 skills 視為可執行的營運流程,而不是一般的 prompt 附加物。實用的 skill 應明確列出前提條件、工具順序、檢查點,以及 agent 應停止或尋求協助的情況。

評估應測量整條鏈路。agent 可能檢索到相關 skill,卻仍然用錯;也可能只是因為基準測試剛好包含極其清楚的匹配而完成任務。測試應分別追蹤檢索準確率、程序遵循、不當 skill 套用,以及在沒有合適 skill 時的恢復能力。

企業部署還面臨額外的治理問題。skills 可能編碼存取流程、客服政策、財務工作流程或內部資料處理規則。如果 agent 檢索到錯誤的 skill,失敗可能不只是回覆不佳,還可能觸發錯誤動作或把資訊暴露到錯誤流程中。隨著資料庫擴大,版本控制、擁有權與稽核記錄都會成為實際需求。

這些發現也支持精選型資料庫,而不是不加篩選地累積。把每一次成功互動都加入長期記憶,可能提高表面能力,卻讓檢索更糟。產品團隊若能整併重複的 skills、拉清流程邊界,並加入明確的否定條件說明何時不該使用某個 skill,或許能得到更好的結果。

對模型供應商與 agent 平台開發者而言,這項研究指向能理解任務脈絡、工具狀態與程序相似性的檢索系統。它也提高了 fallback 行為的重要性:當信心不足或多個 skills 看起來很相似時,agent 應該暫停、提出澄清問題,或進行更窄的搜尋,而不是機械式地選擇。

接下來要觀察什麼

下一個值得關注的訊號,是後續研究是否會在受控任務之外測試更大、更異質的 skill 資料庫。若能看到客服、程式撰寫、研究與企業營運等領域的結果,就能判斷報告中的檢索下降究竟適用多廣。

開發者也應觀察 agent 框架是否會加入專用 skill 登錄、版本管理、評估套件,以及具備信心意識的檢索。這些功能代表市場正在把 skills 視為受管理的軟體元件,而不是靜態 prompt 檔案。

另一個測試是系統是否能學會拒絕「幾乎相關」的 skill。報告中的機械式套用案例,使得拒絕、澄清與升級處理,和檢索本身一樣重要。可靠的 agents 不僅需要知道該用哪個流程,也要知道何時沒有任何已儲存流程是安全可用的。

Creati.ai 觀點

這項研究對「agent 能力只要增加記憶就會線性成長」的假設,提供了有用的修正。skills 看來最有價值的時候,是它們讓執行變得明確;但當資料庫變大,這項優勢可能會變成選擇問題。對 AI 建置者來說,檢索品質與程序邊界,可能和模型本身的推理能力一樣重要。

從證據推導出的實務架構是:精選且可測試——小而明確的 skill 集合、明確的前提條件與停止條件、持續評估檢索與誤用,以及在指令衝突或不適用時的安全 fallback。在 agents 能可靠地處理這些取捨之前,增加更多 skills 也許能擴大覆蓋範圍,卻會悄悄降低一致性。

精選

研究解釋 AI agents 為何受益於 skills,以及何時會失敗

普林斯頓與 UC San Diego 的研究發現,AI agents 的 skills 比知識更能提升執行表現,但隨著資料庫擴大,檢索能力會崩潰。