Google 研究人員提出 RRSI,以抑制自我改進 AI 代理記憶測試,在提升未見基準測試分數的同時,降低執行時的 token 使用量。

Google 研究人員提出了一種改進 AI 代理的方法,同時避免代理對用於最佳化的任務過度擬合。這種方法稱為 Regularized Recursive Self-Improvement of Agent Harnesses,簡稱 RRSI,針對的是一個日益嚴重的問題:系統會自動重寫自己的提示、工作流程、工具和記憶邏輯。
根據 The Decoder 介紹的一篇研究論文,RRSI 讓代理在先前未見過的基準測試中取得最高 4.7 分的提升,且執行時使用的 token 約比未正則化的最佳化方法少 30%。據報導,這些提升來自修改圍繞凍結模型運作的代理 harness,而不是更新模型權重。
許多生產環境中的 AI 代理 都由固定的語言模型和代理 harness 組成。提示、工具呼叫、工作流程規則、記憶系統、復原行為和輸出處理共同決定模型如何運作。Harness 可以決定代理是否在編輯檔案前先檢查檔案、錯誤後是否重試,以及如何組織最終回覆。
Google Cloud AI Research 的研究人員及大學合作夥伴正在研究如何自動化改善這一層。在典型的遞迴式自我改進迴圈中,語言模型會提出 harness 的修改方案,根據一組任務進行評估,再利用結果產生進一步的修改。
風險在於,針對少量測試反覆最佳化,可能讓代理更擅長那些特定測試,卻沒有整體提升能力。系統可能學會基準測試專屬的模式,選擇碰巧成功的修改,或累積不必要的複雜性,在提高測量分數的同時增加成本與脆弱性。
這個問題很重要,因為 AI 代理通常是根據有限的任務集合評估,而它們預計部署的環境則遠不如測試環境可預測。一個在熟悉工作流程中表現良好的 harness,可能在檔案結構、指令、工具或使用者目標改變時失效。
RRSI 在最佳化過程的兩個階段加入控制。在產生候選修訂方案時,它限制單一提案可以綁定的獨立編輯數量。允許的編輯數會隨時間減少,使流程從廣泛重新設計逐步轉向更具針對性的修改。
系統也會記錄先前的嘗試,協助避免反覆探索已經失敗的修改。當進展停滯時,它會將實驗導向尚未檢查的 harness 部分。
一個獨立的批評器會在修改正式生效前評估提案。如果修訂方案看起來將任務名稱、解法或其他基準測試專屬行為硬編碼其中,批評器就會拒絕。RRSI 也要求在接受會增加計算成本的修改前,必須看到可觀察的效能收益,並移除不再有貢獻的元件。
這些規則旨在優先採用較小、可解釋且能轉移到新任務的改進,而不是追求最大化狹窄測試分數的激進修改。這種方法仍讓 harness 可以編輯,但限制它重寫自身的速度與自由度。
研究人員在涵蓋程式設計、辦公室導向的代理工作和工程設計的八個基準測試上測試 RRSI。報告中確認為 Claude Opus 4.8 的底層模型保持凍結。比較包括未修改的基準 harness,以及另外四種最佳化方法。
研究人員報告的結果顯示存在取捨。RRSI 在最佳化期間使用的任務上最多提升 14.1 分,但更重要的是它在五個未見基準測試上的表現,最高提升達到 4.7 分。根據 The Decoder 報導的論文,RRSI harness 在任何一項未見評估中都沒有低於基準線。
據報導,其他方法在訓練任務上表現強勁,但轉移到新任務時效果較差。其中兩種方法在新任務上低於基準線。在測試的各種方案中,RRSI 在訓練集上的提升幅度最小;研究人員將此解讀為它犧牲基準測試專門化,以換取更廣泛的泛化能力。
Token 結果對大規模運作代理的團隊也很重要。最佳化後的 RRSI 系統比未正則化版本少使用約 30% 的 token,在最佳化 harness 中也需要較少步驟。不過,原始基準線仍然更節省,因此正則化並沒有讓整個系統比所有替代方案都便宜。
這些是研究結果,而不是獨立的生產環境基準測試。效能數據是研究人員評估中的主張,現有證據也無法說明這種方法在更大規模的任務分布、不同模型或即時企業工作負載中會如何運作。
對建構者而言,這項工作表示改進代理不應只追求開發基準測試的最高分。評估集合必須包含最佳化過程從未見過的任務,否則自我改進系統可能會因學會測試而獎勵自己,而不是改善底層工作流程。
RRSI 的設計也指出了遞迴式自我改進所需的營運控制。團隊可以限制同時進行的修改數量,保留失敗實驗的歷史,要求較昂貴工作流程提出成本理由,並阻擋看似與特定測試案例相關的編輯。這些控制可讓自動化 harness 最佳化更容易稽核和回復。
這種方法可能尤其適用於企業 AI,因為 token 成本、可預測的行為,以及在多種內部流程中的可靠性,和基準測試的最高分同樣重要。一個能泛化到陌生文件或程序的 harness,可能比一個在固定示範集合中取得更高分數的 harness 更有用。
這項工作並未解決代理修改自身運作邏輯所帶來的更廣泛安全與治理問題。RRSI 限制 harness 的變更,但現有證據沒有顯示其批評器是否能可靠偵測隱藏的基準測試專屬行為。它也沒有處理最佳化期間模型權重會改變的系統。
不過,報告中的模型間轉移結果仍值得注意。據報導,利用 Gemini 3.5 Flash 找到的程式設計 harness,在不修改 Gemini 3.1 Flash Lite 的情況下,將較弱模型的準確率從 11.2 分提高到 14.6 分。這項發現表示,某些工作流程改進可能能在不同能力的模型之間移植,但它來自同一份研究報告,仍需要更廣泛的驗證。
第一個訊號將是 RRSI 在更多模型和任務類別上的獨立複現。結果應在保留任務上比較,而這些任務必須同時對 harness 最佳化器及其批評器隱藏。
研究人員和產品團隊也應測試:部署後工具、提示、記憶體儲存和資料分布發生變化時,這種方法是否仍然有效。成本測量同樣重要:報告中的 30% token 減少是相對於未正則化的最佳化系統,而不一定是相對於精心設計的基準線。
另一個未解決的問題是,類似的控制是否能管理更新模型權重的代理,而不只是管理周圍的 harness。目前的研究涵蓋凍結模型,因此更具影響力的自我改進形式仍在研究範圍之外。
RRSI 處理了當前代理競賽中的一項實際弱點:團隊可以比判斷工作流程是否能泛化更快地自動搜尋更好的工作流程。因此,它最重要的貢獻是方法論上的。它把未見任務上的效能與計算成本視為首要限制,而不是依賴單一最佳化分數。
這項研究並未證明遞迴式自我改進已準備好接受無人監督的部署。但它為建構者提供了更清楚的設計原則:代理必須透過在促成修改的測試之外展示可靠收益,來證明自己有資格變得更複雜。