Google DeepMinds Dream-RSI ermöglicht es KI-Agenten, frühere Suchläufe wiederzuverwenden, um die Exploration zu optimieren und teure Versuche zu reduzieren, ohne das zugrunde liegende Modell zu verändern.

Google-DeepMind-Forscher haben Dream-RSI entwickelt, eine Methode, die es KI-Agenten ermöglicht, ihre Suche nach Lösungen zu verbessern, indem frühere Versuche erneut abgespielt werden, statt jedes Experiment neu zu starten. Der Ansatz zielt auf einen zentralen Kostenfaktor beim autonomen Problemlösen ab: zu entscheiden, welche Möglichkeiten erkundet, welche aufgegeben und wie viel Rechenleistung für jeden Pfad aufgewendet werden soll.
Laut Tests, über die The Decoder berichtet, verbesserte oder erreichte Dream-RSI bestehende Ergebnisse in den Bereichen Programmierung, mathematische Optimierung und GPU-Kernel-Aufgaben. In einigen Experimenten verringerte es die Zahl der Versuche um mehr als die Hälfte, während das zugrunde liegende Gemini-Modell unverändert blieb. Die Arbeit ist wichtig, weil sie Selbstverbesserung weg vom erneuten Training eines Modells und hin zur Optimierung des Prozesses verlagert, der dessen Suche steuert.
KI-Agenten, die an schwierigen Problemen arbeiten, folgen oft einer iterativen Schleife. Sie erzeugen eine Kandidatenlösung, bewerten sie und nutzen das Ergebnis, um zu entscheiden, was als Nächstes ausprobiert wird. Mit wachsender Zahl möglicher Pfade kann Exploration viel Rechenleistung verbrauchen, insbesondere wenn jeder Versuch Codegenerierung, Ausführung oder eine andere teure Bewertung erfordert.
Eine feste Suchstrategie kann wiederholt unproduktive Richtungen verfolgen. Eine adaptive Strategie kann auf Ergebnisse reagieren, aber zu lernen, welche Strategie funktioniert, kann selbst viele Live-Versuche erfordern. Dream-RSI adressiert diesen Zielkonflikt, indem es die früheren Versuche des Agenten und deren Ergebnisse in einer durchsuchbaren Historie festhält.
Die Methode testet dann alternative Entscheidungen gegen diese gespeicherten Ergebnisse. Anstatt jeden Kandidaten erneut zu erzeugen und zu bewerten, kann das System simulieren, was passiert wäre, wenn es einen anderen Zweig gewählt, einen Irrweg früher aufgegeben oder einem vielversprechenden Pfad mehr Aufwand zugewiesen hätte. Die Forscher bezeichnen diesen rückblickenden Prozess als „Träumen“.
Die so entstehende Strategie wird in einer nachfolgenden Live-Suche eingesetzt. Nach diesem Lauf kann die neue Suchhistorie erneut analysiert werden, wodurch ein Zyklus entsteht, in dem sich die Explorationspolitik des Agenten mit der Zeit verbessert. Dream-RSI verändert die Suchstrategie, nicht die Gewichte oder Fähigkeiten des Modells, das die Kandidatenlösungen erzeugt.
The Decoder berichtet, dass die Forscher Dream-RSI mit Gemini 3.1 Pro und Gemini 3.7 Flash in acht Aufgaben über drei Bereiche hinweg evaluiert haben. Die Vergleiche nutzten dieselben Ausgangsbedingungen, stellten Dream-RSI jedoch einem Baseline-Ansatz mit fester Suchstrategie gegenüber.
Eine Aufgabe bestand darin, ein schnelles Programm für eine statistische Berechnung zu schreiben, die in der Genomik und Finanzwelt verwendet wird. In den berichteten Tests erzeugte Dream-RSI Programme, die über sechs Datensätze schneller liefen als die etablierten Bibliotheken sklearn und glmnet. Mit Gemini 3.1 Pro sank die durchschnittliche Laufzeit von 3.587 Millisekunden auf 2.931 Millisekunden, während die Zahl der Versuche von 550 auf 317 zurückging.
Der Artikel berichtet außerdem einen Vergleich mit SimpleTES, das für diese Aufgabe 51.200 Durchläufe benötigte, gegenüber 317 Versuchen für Dream-RSI. Zusätzliche Tests zu mathematischer Optimierung und GPU-Kernels zeigten entweder vergleichbare oder bessere Ergebnisse bei geringeren Suchkosten. Bei zwei GPU-Aufgaben erreichte Dream-RSI die gleiche Leistung und reduzierte die Zahl der Durchläufe um bis zu den Faktor 2,43. Bei zwei anderen erzielte es bei gleichem Rechenbudget eine bis zu 2,09-fach bessere Leistung.
Diese Zahlen sind Forschungsergebnisse, die über The Decoder berichtet wurden, keine unabhängig verifizierten Produktions-Benchmarks. Die verfügbare Evidenz zeigt nicht, wie Dream-RSI bei breiteren Workloads, anderen Modellen oder sich verändernden Evaluierungsumgebungen abschneidet. Sie zeigt auch nicht, ob die Methode durchgehend bessere Endlösungen erzeugt, wenn die aufgezeichnete Suchhistorie klein oder nicht repräsentativ ist.
Eine nachfolgende Analyse legte eine weitere Einschränkung offen. Die Forscher testeten, ob sich Suchhistorien in explizite Anweisungen verdichten lassen, die dem Agenten sagen, wohin er schauen soll. Bei einer GPU-Aufgabe schnitt diese anweisungsbasierte Version schlechter ab als das auf Wiederholung basierende System. Die Forscher deuteten an, dass allzu spezifische Vorgaben die Exploration einengen und den Agenten daran hindern können, weniger offensichtliche Alternativen zu finden.
Für Teams, die KI-Agenten bauen, weist Dream-RSI auf eine möglicherweise praktische Möglichkeit hin, Inferenz- und Evaluierungskosten zu senken, ohne sofort ein Basismodell feinzujustieren oder neu zu trainieren. Ein Coding-Agent, ein Optimierungssystem oder ein Werkzeug für wissenschaftliche Entdeckung könnte detaillierte Spuren früherer Arbeit bewahren und sie nutzen, um die Verteilung künftiger Suchanstrengungen zu verbessern.
Das könnte in Workflows nützlich sein, in denen Kandidatenlösungen teuer zu testen sind. Die Generierung von GPU-Kernels ist ein Beispiel: Das Kompilieren und Benchmarking jeder Variante kann deutlich mehr Zeit kosten als die Auswahl zwischen zuvor bewerteten Zweigen. Ähnliche Ökonomien könnten für Codeoptimierung, Designsuche und automatisierte Experimente gelten.
Der Ansatz macht auch eine wichtige Systemgrenze deutlich. Verbesserungen können eher aus besserer Orchestrierung als aus einem leistungsfähigeren Basismodell entstehen. Teams könnten daher Suchpolitiken, Replay-Systeme und Rechenzuweisung getrennt von Modell-Upgrades bewerten. Im Prinzip macht das Fortschritt leichter messbar: Entwickler können Anzahl der Versuche, Bewertungskosten und Endqualität unter demselben Modell vergleichen.
Es gibt betriebliche Risiken. Eine Suchhistorie kann irreführende Bewertungen, durch temporäre Bedingungen verursachte Fehler oder Lücken im erforschten Raum enthalten. Das Wiedergeben dieser Historie kann einen Agenten effizienter darin machen, einer engen Karte zu folgen, statt das zugrunde liegende Problem besser zu lösen. Das von den Forschern berichtete Instruktions-Experiment unterstreicht die Notwendigkeit, Raum für Exploration zu bewahren, statt erfolgreiches Verhalten der Vergangenheit in starre Regeln zu verwandeln.
Dream-RSI steht innerhalb einer breiteren Forschungsrichtung. Google DeepMinds AlphaEvolve nutzt vom Modell erzeugten Code und evolutionäre Selektion, um nach verbesserten Programmen zu suchen, während Dream-RSI eine Ebene darüber arbeitet, indem es die Durchführung dieser Suche abstimmt. Andere Systeme, darunter Ansätze, die Fehler als wiederverwendbare Anweisungen speichern, setzen ähnlich auf angesammelte Erfahrung, können die Exploration jedoch direkter einschränken.
Das nächste wichtige Signal wird sein, ob Dream-RSI über die berichteten acht Aufgaben und Gemini-Konfigurationen hinaus getestet wird. Unabhängige Evaluierungen sollten verschiedene Basismodelle, verrauschte oder sich verschiebende Benchmarks und Workloads untersuchen, bei denen sich der Suchraum zwischen Läufen verändert.
Forschende und Produktteams werden außerdem eine klarere Kostenrechnung benötigen. Weniger Versuche bedeuten nicht automatisch geringere Kosten, wenn das Aufzeichnen, Wiedergeben, Speichern und Bewerten von Suchhistorien beträchtlichen Mehraufwand verursacht. Auch Zuverlässigkeitsmessungen sind wichtig: Eine Strategie, die Rechenleistung spart, aber seltene hochwertige Lösungen übersieht, eignet sich möglicherweise nicht für sicherheitskritische oder wissenschaftliche Anwendungen.
Eine weitere offene Frage ist, wie Dream-RSI mit Transfer umgeht. Eine auf eine Problemklasse der Optimierung gelernte Strategie kann für eine andere nutzlos sein, und eine Historie, die die Codesuche verbessert, kann für mathematisches Schlussfolgern ein schlechter Leitfaden sein. Hinweise darauf, dass die Methode verallgemeinern kann, ohne die Exploration zu stark einzuschränken, würden entscheiden, ob es sich um eine wiederverwendbare Plattformtechnik oder eher um eine aufgabenspezifische Optimierung handelt.
An Dream-RSI ist weniger die Behauptung bemerkenswert, dass Agenten sich unabhängig neu entwerfen können, als vielmehr das Beispiel dafür, wo kurzfristige Effizienzgewinne entstehen könnten. Das Modell bleibt fest; das System wird besser darin, zu entscheiden, wie es sein Suchbudget einsetzt. Für KI-Entwickler ist das ein konkreterer und besser testbarer Weg, als anzunehmen, dass jede Verbesserung ein größeres oder neu trainiertes Modell erfordert.
Die zentrale Einschränkung ist, dass Wiederholung nur so wertvoll ist wie die Erfahrung, die wiederholt wird. Wenn Suchhistorien eng, verzerrt oder teuer zu pflegen sind, kann der Agent effizient werden, ohne breit leistungsfähig zu werden. Der stärkste nächste Schritt wären transparente, unabhängige Tests, die Qualität, Zuverlässigkeit und Gesamtkosten messen – nicht nur die eingesparte Zahl an Versuchen.