Googleの研究者が、自律的に改善するAIエージェントによるテストの暗記を抑え、未知のベンチマークのスコアを高めながら実行時のトークン使用量を削減するRRSIを提案した。

Googleの研究者は、最適化に使われたタスクへの過適合を許さずにAIエージェントを改善する手法を提案した。Regularized Recursive Self-Improvement of Agent Harnesses、略してRRSIと呼ばれるこのアプローチは、システムが自らのプロンプト、ワークフロー、ツール、メモリーロジックを書き換えるようになるほど深刻になる問題を対象にしている。
The Decoderが紹介した研究論文によると、RRSIは未知のベンチマークでの結果を最大4.7ポイント改善し、正則化されていない最適化手法と比べて実行時のトークン使用量を約30%削減した。報告された改善は、モデルの重みを更新するのではなく、凍結したモデルを取り巻くエージェント・ハーネスを変更することで得られた。
多くの本番用AIエージェントは、固定された言語モデルと、それを取り巻くエージェント・ハーネスで構成される。プロンプト、ツール呼び出し、ワークフロー規則、メモリーシステム、復旧動作、出力処理が、モデルの動作を決める。ハーネスは、編集前にファイルを確認するか、エラー後に再試行するか、最終回答をどのように構成するかを決めることがある。
Google Cloud AI Researchの研究者と大学の共同研究者は、この層の改善を自動化する方法を研究している。一般的な再帰的自己改善ループでは、言語モデルがハーネスへの変更を提案し、タスク群で評価し、その結果を使ってさらなる変更を生成する。
リスクは、小規模なテスト集合に対する最適化を繰り返すことで、エージェントがそのテストだけでは上達しても、全般的な能力は向上しない可能性があることだ。システムはベンチマーク固有のパターンを学習したり、偶然成功する変更を選んだり、測定スコアを高める一方でコストと脆弱性を増す不要な複雑性を蓄積したりする。
この問題が重要なのは、AIエージェントが限られたタスク群で評価される一方、実際の導入環境ははるかに予測しにくいからだ。見慣れたワークフローでは高い性能を示すハーネスも、ファイル構造、指示、ツール、ユーザーの目的が変わると失敗する可能性がある。
RRSIは最適化プロセスの2つの段階で制御を適用する。候補となる改訂を生成する際、1つの提案にまとめられる独立した編集の数を制限する。許可される編集数は時間とともに減少し、広範な再設計から、より対象を絞った変更へとプロセスを移行させる。
また、過去の試行を記録し、すでに失敗した変更を何度も調べることを避ける。進展が止まると、まだ検討されていないハーネスの部分に実験を向ける。
別の批評役が、提案された変更を恒久化する前に評価する。タスク名、解答、その他のベンチマーク固有の挙動をハードコードしているように見える改訂は却下する。RRSIは、計算コストを増やす変更を受け入れる前に、観測可能な性能向上も要求し、貢献しなくなったコンポーネントを削除する。
これらの規則は、狭いテストスコアを最大化する積極的な変更ではなく、新しいタスクに転移する小さく説明可能な改善を優先することを意図している。この手法ではハーネスを編集可能なままにするが、どれほど速く自由に自己書き換えできるかには制限を設ける。
研究者は、コーディング、オフィス業務向けエージェント、エンジニアリング設計を対象とする8つのベンチマークでRRSIをテストした。基盤モデルは報告書でClaude Opus 4.8と特定され、凍結されたままだった。比較には、変更していないベースライン・ハーネスと、4つの別の最適化手法が含まれた。
研究者が報告した結果は、トレードオフを示している。RRSIは最適化に使ったタスクで最大14.1ポイントの向上を生んだが、より重要なのは5つの未知のベンチマークでの性能で、最大改善幅は4.7ポイントに達した。The Decoderが報じた論文によれば、RRSIのハーネスは未知の評価のいずれでもベースラインを下回らなかった。
他の手法は訓練タスクでは高い性能を示したものの、新しいタスクへの転移は弱かったとされる。2つの手法は新規タスクでベースラインを下回った。RRSIは検証した方式の中で訓練集合の改善幅が最小だった。研究者はこれを、ベンチマークへの特化を犠牲にして、より広い汎化を実現した証拠と解釈している。
トークンに関する結果も、エージェントを大規模に運用するチームには関係する。最適化されたRRSIシステムは、正則化されていない版より約30%少ないトークンを使い、最適化されたハーネスの中でも必要なステップ数が少なかった。ただし元のベースラインの方が経済的であり、正則化によってシステム全体がすべての代替案より安くなったわけではない。
これらは研究結果であり、独立した本番ベンチマークではない。性能の数値は研究者による評価上の主張であり、利用可能な証拠からは、より大きなタスク分布、異なるモデル、実際の企業ワークロードでこの手法がどう動くかは分からない。
開発者にとって、この研究はエージェントの改善において開発用ベンチマークの最大化だけでは不十分だと示唆する。評価セットには最適化プロセスが一度も見ないタスクを含める必要がある。そうしなければ、自己改善システムは基盤となるワークフローを改善するのではなく、テストを学習したことに報酬を与えてしまう。
RRSIの設計は、再帰的自己改善に対する運用上の制御も示している。チームは同時に行える変更数を制限し、失敗した実験の履歴を保持し、より高価なワークフローにはコストの正当化を求め、特定のテストケースに結び付いているように見える編集を阻止できる。こうした制御により、自動化されたハーネス最適化の監査とロールバックが容易になる可能性がある。
このアプローチは、エンタープライズAIに特に関係する可能性がある。そこでは、トークンコスト、予測可能な挙動、さまざまな社内プロセスでの信頼性が、ベンチマークの最高スコアと同じくらい重要だ。見慣れない文書や手順に汎化するハーネスは、固定されたデモ集合でより高いスコアを取るハーネスより有用かもしれない。
この研究は、自らの動作ロジックを変更するエージェントをめぐる、より広範な安全性とガバナンスの問題を解決してはいない。RRSIはハーネスの変更を制約するが、批評役が隠れたベンチマーク固有の挙動をあらゆる形で確実に検出できるかは、証拠からは分からない。また、最適化中にモデルの重みが変化するシステムも対象外だ。
それでも、モデル間での転移に関する報告は注目に値する。Gemini 3.5 Flashで発見したコーディング・ハーネスにより、弱いモデルであるGemini 3.1 Flash Liteの精度が、後者を変更せずに11.2ポイントから14.6ポイントへ上がったとされる。この発見は、一部のワークフロー改善が異なる能力のモデル間で移植可能かもしれないことを示すが、同じ研究報告に基づくものであり、より広い検証が必要だ。
最初の指標は、追加のモデルとタスク群を用いたRRSIの独立した再現になる。結果は、ハーネスの最適化器と批評役の双方から隠された保留タスクで比較すべきだ。
研究者と製品チームは、導入後にツール、プロンプト、メモリーストア、データ分布が変わっても手法が有効かどうかも検証する必要がある。コスト測定も重要になる。報告された30%のトークン削減は、正則化されていない最適化システムに対するものであり、慎重に設計したベースラインに対するものとは限らない。
もう1つの未解決問題は、周囲のハーネスだけでなくモデルの重みを更新するエージェントも、同様の制御で統治できるかどうかだ。今回の研究は凍結モデルを扱っており、より重大なこの形の自己改善は対象外に残されている。
RRSIは、現在のエージェント競争における実際的な弱点に取り組む。チームはより良いワークフローの探索を自動化することはできても、そのワークフローが汎化するかを判断する速度はそれに追いついていない。したがって最大の貢献は方法論にある。単一の最適化スコアに頼るのではなく、未知のタスクでの性能と計算コストを中核的な制約として扱っている。
この研究は、再帰的自己改善が監督なしの導入に備わったことを証明するものではない。しかし開発者に、より明確な設計原則を与える。エージェントは、変更を生み出したテストを超えて信頼できる改善を示すことで、より複雑になる権利を獲得すべきだ。