Google DeepMind 的 Dream-RSI 讓 AI 代理重用過去的搜尋執行來調整探索,在不改變底層模型的情況下減少昂貴的嘗試。

Google DeepMind 研究人員開發了 Dream-RSI,一種讓 AI 代理透過重播先前嘗試,而不是重新執行每次實驗,來改善尋找解決方案方式的方法。這個方法鎖定自主解題中的一項核心成本:決定哪些可能性值得探索、哪些該放棄,以及每條路徑要投入多少運算資源。
根據 The Decoder 報導的測試,Dream-RSI 在程式設計、數學最佳化與 GPU kernel 任務上,改善或追平了現有結果。在某些實驗中,它在不改變底層 Gemini 模型的情況下,將嘗試次數減少了一半以上。這項工作之所以重要,是因為它把自我改進從重新訓練模型,轉向優化指揮搜尋的過程。
AI 代理在處理困難問題時,通常會遵循反覆迭代的循環。它們先產生候選解、加以評估,並根據結果決定下一步該嘗試什麼。隨著可能路徑增加,探索可能消耗大量運算資源,尤其是在每次嘗試都需要產生程式碼、執行,或進行其他昂貴評估時。
固定的搜尋策略可能一再追逐沒有產出的方向。自適應策略可以根據結果做出回應,但要學會哪種策略有效,本身也可能需要大量實地嘗試。Dream-RSI 透過將代理過去的嘗試與其結果記錄在可搜尋的歷史中,來處理這個取捨。
接著,這個方法會用那些儲存的結果測試替代決策。系統不必重新生成並評估每個候選解,而是可以模擬如果它選了不同分支、提早放棄死路,或把更多努力分配到有前景的路徑,可能會發生什麼。研究人員把這種回顧式過程稱為「dreaming」。
所得出的策略會用在後續的實際搜尋中。那次執行之後,可以再次分析新的搜尋歷史,形成一個循環,使代理的探索策略隨時間改善。Dream-RSI 改變的是搜尋策略,而不是產生候選解的模型權重或能力。
The Decoder 報導,研究人員使用 Gemini 3.1 Pro 與 Gemini 3.7 Flash,在涵蓋三個領域的八項任務上評估了 Dream-RSI。比較採用相同的起始條件,但將 Dream-RSI 與使用固定搜尋策略的基線做對照。
其中一項任務是為生物資訊學與金融領域使用的統計計算撰寫快速程式。在報導的測試中,Dream-RSI 產生的程式在六個資料集上的執行速度都比既有的 sklearn 與 glmnet 套件更快。使用 Gemini 3.1 Pro 時,平均執行時間從 3,587 毫秒降到 2,931 毫秒,而嘗試次數則從 550 次降到 317 次。
文章也報導了與 SimpleTES 的比較:在該任務上,SimpleTES 需要 51,200 次執行,而 Dream-RSI 只需要 317 次嘗試。與數學最佳化和 GPU kernels 相關的其他測試顯示,在更低搜尋成本下,結果相當或更好。在兩項 GPU 任務中,Dream-RSI 在維持表現的同時,將執行次數最多減少到原本的 2.43 倍以下。在另外兩項任務中,它在相同運算預算下達到最高 2.09 倍的表現。
這些數字是透過 The Decoder 報導的研究結果,並非經獨立驗證的生產環境基準。現有證據無法證明 Dream-RSI 在更廣泛的工作負載、不同模型或變動的評估環境中表現如何。它也無法顯示,在記錄的搜尋歷史很小或不具代表性時,這個方法是否能穩定產生更好的最終解。
後續分析揭露了另一項限制。研究人員測試是否能把搜尋歷史濃縮成明確指令,告訴代理應該往哪裡找。在一項 GPU 任務上,這種基於指令的版本表現比重播式系統更差。研究人員推測,過於具體的指引可能會縮小探索範圍,阻止代理找到不那麼明顯的替代方案。
對於打造 AI 代理的團隊來說,Dream-RSI 指向一種可能實用的方法:在不立即微調或重新訓練基礎模型的情況下,降低推論與評估成本。程式碼代理、最佳化系統或科學發現工具都可以保留先前工作的詳細軌跡,並用來改善未來搜尋努力的分配。
這在候選解測試成本高昂的工作流程中特別有用。GPU kernel 生成就是一個例子:編譯並測試每個變體,可能比在已評估的分支中做選擇花費更多時間。類似的經濟性也可能出現在程式碼最佳化、設計搜尋與自動化實驗中。
這個方法也凸顯了一個重要的系統邊界。改進可能來自更好的協調,而不是更強的基礎模型。因此,團隊可以把搜尋策略、重播系統與運算分配,和模型升級分開評估。原則上,這會讓進展更容易衡量:建構者可以在同一模型下比較嘗試次數、評估成本與最終品質。
也存在營運風險。搜尋歷史可能包含誤導性的評估、因暫時條件造成的失敗,或是探索空間中的缺口。重播這段歷史,可能讓代理更擅長沿著狹窄地圖前進,而不是更好地解決底層問題。研究人員報告的指令實驗也強化了一點:必須保留探索空間,而不是把成功的過去行為變成僵化規則。
Dream-RSI 屬於更廣泛的研究方向之一。Google DeepMind 的 AlphaEvolve 使用模型生成的程式碼與演化式選擇來搜尋更好的程式,而 Dream-RSI 則在更上一層,調整這種搜尋是如何進行的。其他系統,包括把失敗儲存為可重用指令的方法,也對累積經驗做出類似押注,但可能更直接地限制探索。
下一個重要訊號,是 Dream-RSI 是否會在報導的八項任務與 Gemini 設定之外接受測試。獨立評估應檢視不同基礎模型、含噪或變動的基準,以及搜尋空間會在執行之間改變的工作負載。
研究人員與產品團隊也需要更清楚地核算總成本。即使嘗試次數變少,若記錄、重播、儲存與評估搜尋歷史帶來可觀額外負擔,也不一定代表費用下降。可靠性衡量同樣重要:一種雖然節省運算、卻會錯失罕見高品質解答的策略,未必適用於安全關鍵或研究型應用。
另一個未解問題是 Dream-RSI 如何處理遷移。一種在某類最佳化問題上學到的策略,可能對另一類問題沒用;而能改善程式碼搜尋的歷史,對數學推理來說可能是糟糕的指南。若有證據顯示此方法能在不過度限制探索的情況下泛化,就能判斷它是可重用的平台技術,還是主要針對特定任務的最佳化。
Dream-RSI 值得注意的地方,不在於它宣稱代理可以獨立重新設計自己,而在於它展示了短期效率提升可能來自何處。模型本身保持固定;系統則更擅長決定如何花費搜尋預算。對 AI 建構者而言,這條路徑比假設每項改進都需要更大或新訓練的模型,更具體也更容易測試。
核心但書是:重播的價值,取決於被重播的經驗有多有價值。如果搜尋歷史狹窄、帶有偏差,或維護成本高昂,代理可能會變得高效,卻不一定變得更有廣泛能力。下一個最有力的步驟,應是透明且獨立的測試,衡量品質、可靠性與總成本,而不只是省下了多少次嘗試。