Google-Forscher schlagen RRSI vor, um das Auswendiglernen von Tests durch selbstverbessernde KI-Agenten einzudämmen, die Ergebnisse bei unbekannten Benchmarks zu verbessern und gleichzeitig den Token-Verbrauch zur Laufzeit zu senken.

Google-Forscher haben eine Methode vorgeschlagen, um KI-Agenten zu verbessern, ohne ihnen zu erlauben, sich an die Aufgaben zu überanpassen, die für ihre Optimierung verwendet werden. Der Ansatz heißt „Regularized Recursive Self-Improvement of Agent Harnesses“, kurz RRSI, und zielt auf ein Problem ab, das mit der automatischen Neugestaltung eigener Prompts, Workflows, Tools und Speicherlogik durch Systeme immer ernster wird.
Laut einer von The Decoder beschriebenen Forschungsarbeit verbesserte RRSI die Ergebnisse bei zuvor unbekannten Benchmarks um bis zu 4,7 Punkte und verwendete etwa 30 % weniger Tokens zur Laufzeit als ein nicht regularisierter Optimierungsansatz. Die gemeldeten Verbesserungen entstehen dadurch, dass das Agenten-Harness um ein eingefrorenes Modell herum verändert wird, anstatt die Modellgewichte zu aktualisieren.
Viele produktive KI-Agenten bestehen aus einem festen Sprachmodell, das von einem Agenten-Harness umgeben ist: Prompts, Tool-Aufrufe, Workflow-Regeln, Speichersysteme, Wiederherstellungsverhalten und Ausgabeverarbeitung bestimmen, wie das Modell arbeitet. Das Harness kann entscheiden, ob ein Agent vor einer Bearbeitung eine Datei prüft, nach einem Fehler einen weiteren Versuch unternimmt oder seine endgültige Antwort strukturiert.
Forscher von Google Cloud AI Research und universitären Partnern untersuchen Möglichkeiten, Verbesserungen dieser Ebene zu automatisieren. In einer typischen Schleife rekursiver Selbstverbesserung schlägt ein Sprachmodell Änderungen am Harness vor, bewertet sie anhand einer Reihe von Aufgaben und nutzt die Ergebnisse, um weitere Änderungen zu erzeugen.
Das Risiko besteht darin, dass wiederholte Optimierung auf einer kleinen Testsammlung einen Agenten bei genau diesen Tests besser machen kann, ohne seine allgemeinen Fähigkeiten zu verbessern. Das System kann benchmark-spezifische Muster lernen, zufällig erfolgreiche Änderungen auswählen oder unnötige Komplexität anhäufen, die den gemessenen Wert erhöht, aber Kosten und Anfälligkeit steigert.
Das ist relevant, weil KI-Agenten oft anhand begrenzter Aufgabensammlungen bewertet werden, während ihre vorgesehenen Einsatzumgebungen viel weniger vorhersehbar sind. Ein Harness, das bei vertrauten Workflows gut funktioniert, kann scheitern, wenn sich Dateistrukturen, Anweisungen, Tools oder Nutzerziele ändern.
RRSI setzt an zwei Punkten des Optimierungsprozesses Kontrollen ein. Bei der Erzeugung von Kandidatenrevisionen begrenzt es, wie viele unabhängige Änderungen in einem Vorschlag gebündelt werden dürfen. Die zulässige Zahl der Änderungen wird mit der Zeit kleiner, sodass sich der Prozess von umfassenden Neugestaltungen hin zu gezielteren Modifikationen bewegt.
Das System zeichnet außerdem frühere Versuche auf und hilft dadurch, Änderungen, die bereits gescheitert sind, nicht wiederholt zu untersuchen. Wenn der Fortschritt ausbleibt, lenkt es die Experimente auf Teile des Harnesses, die noch nicht geprüft wurden.
Ein separater Kritiker bewertet vorgeschlagene Änderungen, bevor sie dauerhaft übernommen werden. Er weist Revisionen zurück, die offenbar Aufgabennamen, Lösungen oder anderes benchmark-spezifisches Verhalten fest einprogrammieren. RRSI verlangt außerdem einen beobachtbaren Leistungsvorteil, bevor Änderungen akzeptiert werden, die den Rechenaufwand erhöhen, und entfernt Komponenten, die keinen Beitrag mehr leisten.
Zusammen sollen diese Regeln kleinere, erklärbare Verbesserungen fördern, die auf neue Aufgaben übertragbar sind, statt aggressive Änderungen zu begünstigen, die einen engen Testwert maximieren. Das Verfahren lässt das Harness editierbar, setzt aber Grenzen dafür, wie schnell und frei es sich selbst umschreiben kann.
Die Forscher testeten RRSI auf acht Benchmarks aus den Bereichen Programmierung, büroorientierte Agentenarbeit und technisches Design. Das zugrunde liegende Modell, im Bericht als Claude Opus 4.8 bezeichnet, blieb eingefroren. Der Vergleich umfasste ein unverändertes Baseline-Harness und vier weitere Optimierungsmethoden.
Die von den Forschern gemeldeten Ergebnisse zeigen einen Zielkonflikt. RRSI erzielte bei den während der Optimierung verwendeten Aufgaben Verbesserungen von bis zu 14,1 Punkten. Wichtiger war jedoch die Leistung bei fünf unbekannten Benchmarks, bei denen die maximale Verbesserung 4,7 Punkte erreichte. Laut der von The Decoder wiedergegebenen Arbeit lag das RRSI-Harness bei keiner dieser unbekannten Bewertungen unter der Baseline.
Andere Ansätze schnitten Berichten zufolge bei ihren Trainingsaufgaben stark ab, übertrugen sich aber weniger effektiv. Zwei Methoden lagen bei neuen Aufgaben unter der Baseline. RRSI erzielte unter den getesteten Varianten die geringste Verbesserung auf dem Trainingsdatensatz. Die Forscher werten dies als Hinweis darauf, dass die Methode Benchmark-Spezialisierung zugunsten einer breiteren Generalisierung opferte.
Auch das Token-Ergebnis ist für Teams relevant, die Agenten im großen Maßstab betreiben. Das optimierte RRSI-System verwendete etwa 30 % weniger Tokens als die nicht regularisierte Version und benötigte unter den optimierten Harnesses weniger Schritte. Die ursprüngliche Baseline blieb jedoch kostengünstiger, sodass die Regularisierung nicht das gesamte System günstiger als jede Alternative machte.
Dies sind Forschungsergebnisse und keine unabhängigen Produktionsbenchmarks. Die Leistungszahlen sind Angaben aus der Bewertung der Forscher; die vorliegenden Belege zeigen nicht, wie sich die Methode bei größeren Aufgabenverteilungen, anderen Modellen oder realen Unternehmens-Workloads verhalten würde.
Für Entwickler deutet die Arbeit darauf hin, dass die Verbesserung eines Agenten mehr umfassen sollte als die Maximierung eines Entwicklungsbenchmarks. Bewertungssets müssen Aufgaben enthalten, die der Optimierungsprozess nicht sieht. Andernfalls kann ein selbstverbesserndes System sich dafür belohnen, den Test zu lernen, statt seinen zugrunde liegenden Workflow zu verbessern.
Das Design von RRSI weist außerdem auf operative Kontrollen für rekursive Selbstverbesserung hin. Teams könnten die Zahl gleichzeitiger Änderungen begrenzen, eine Historie fehlgeschlagener Experimente führen, für teurere Workflows eine Kostenbegründung verlangen und Änderungen blockieren, die an bestimmte Testfälle gebunden erscheinen. Solche Kontrollen könnten die automatisierte Harness-Optimierung leichter prüfbar und rückgängig zu machen machen.
Der Ansatz könnte besonders für Unternehmens-KI relevant sein, bei der Tokenkosten, vorhersehbares Verhalten und Zuverlässigkeit über unterschiedliche interne Prozesse hinweg ebenso wichtig sind wie Spitzenwerte in Benchmarks. Ein Harness, das sich auf unbekannte Dokumente oder Verfahren überträgt, kann nützlicher sein als eines, das bei einer festen Demonstrationssammlung einen höheren Wert erzielt.
Die Arbeit löst die umfassenderen Sicherheits- und Governance-Fragen rund um Agenten, die ihre eigene Betriebslogik verändern, nicht. RRSI begrenzt Harness-Änderungen, aber die Belege zeigen nicht, ob seine Kritiker jede Form verborgenen benchmark-spezifischen Verhaltens zuverlässig erkennen können. Ebenso behandelt die Methode keine Systeme, bei denen sich die Modellgewichte während der Optimierung ändern.
Die gemeldete Übertragung zwischen Modellen ist dennoch bemerkenswert. Ein mit Gemini 3.5 Flash entdecktes Coding-Harness soll die Genauigkeit des schwächeren Gemini 3.1 Flash Lite von 11,2 auf 14,6 Punkte erhöht haben, ohne das zweite Modell zu verändern. Der Befund deutet darauf hin, dass manche Workflow-Verbesserungen über unterschiedliche Modellfähigkeiten hinweg übertragbar sein könnten, stammt jedoch aus demselben Forschungsbericht und muss breiter validiert werden.
Das erste Signal wird eine unabhängige Replikation von RRSI mit zusätzlichen Modellen und Aufgabenfamilien sein. Die Ergebnisse sollten anhand zurückgehaltener Aufgaben verglichen werden, die sowohl dem Harness-Optimierer als auch seinem Kritiker verborgen bleiben.
Forscher und Produktteams sollten außerdem prüfen, ob die Methode wirksam bleibt, wenn sich Tools, Prompts, Speicher und Datenverteilungen nach der Bereitstellung ändern. Auch Kostenmessungen werden wichtig sein: Die gemeldete Token-Reduktion von 30 % bezieht sich auf ein nicht regularisiertes optimiertes System, nicht unbedingt auf eine sorgfältig entwickelte Baseline.
Eine weitere offene Frage ist, ob ähnliche Kontrollen Agenten steuern können, die Modellgewichte aktualisieren und nicht nur das umgebende Harness. Die aktuelle Studie behandelt eingefrorene Modelle und lässt diese folgenreichere Form der Selbstverbesserung außerhalb ihres Umfangs.
RRSI behandelt eine praktische Schwäche des aktuellen Agenten-Wettlaufs: Teams können die Suche nach besseren Workflows schneller automatisieren, als sie feststellen können, ob diese Workflows generalisieren. Der wichtigste Beitrag ist daher methodischer Natur. Unbekannte Aufgaben und Rechenkosten werden als zentrale Einschränkungen behandelt, statt sich auf einen einzigen Optimierungswert zu verlassen.
Die Forschung beweist nicht, dass rekursive Selbstverbesserung für einen unbeaufsichtigten Einsatz bereit ist. Sie liefert Entwicklern jedoch ein klareres Designprinzip: Ein Agent sollte sich das Recht auf größere Komplexität verdienen, indem er verlässliche Verbesserungen über die Tests hinaus nachweist, die die Änderung hervorgebracht haben.