Dream-RSI de Google DeepMind permet aux agents IA de réutiliser d’anciennes exécutions de recherche pour ajuster l’exploration, réduisant les essais coûteux sans modifier le modèle sous-jacent.

Les chercheurs de Google DeepMind ont développé Dream-RSI, une méthode qui permet aux agents IA d’améliorer leur façon de rechercher des solutions en rejouant des tentatives antérieures plutôt qu’en relançant chaque expérience. L’approche vise un coût central de la résolution autonome de problèmes : décider quelles possibilités explorer, lesquelles abandonner et combien de calcul consacrer à chaque voie.
Selon des tests rapportés par The Decoder, Dream-RSI a amélioré ou égalé les résultats existants dans les tâches de programmation, d’optimisation mathématique et de kernels GPU. Dans certaines expériences, il a réduit le nombre de tentatives de plus de moitié tout en laissant le modèle Gemini sous-jacent inchangé. Ce travail est important car il déplace l’auto-amélioration de la réentraînement d’un modèle vers l’optimisation du processus qui guide sa recherche.
Les agents IA qui travaillent sur des problèmes difficiles suivent souvent une boucle itérative. Ils génèrent une solution candidate, l’évaluent, puis utilisent le résultat pour décider de la suite. À mesure que le nombre de voies possibles augmente, l’exploration peut consommer beaucoup de calcul, en particulier lorsque chaque tentative nécessite de la génération de code, de l’exécution ou une autre évaluation coûteuse.
Une stratégie de recherche fixe peut poursuivre à répétition des directions peu productives. Une stratégie adaptative peut réagir aux résultats, mais apprendre quelle stratégie fonctionne peut lui-même nécessiter de nombreux essais en conditions réelles. Dream-RSI traite ce compromis en enregistrant les tentatives précédentes de l’agent et leurs résultats dans un historique consultable.
La méthode teste ensuite des décisions alternatives à partir de ces résultats enregistrés. Plutôt que de générer et d’évaluer à nouveau chaque candidat, le système peut simuler ce qui se serait passé s’il avait choisi une autre branche, abandonné plus tôt une impasse ou alloué davantage d’efforts à une voie prometteuse. Les chercheurs décrivent ce processus rétrospectif comme un « rêve ».
La stratégie qui en résulte est utilisée dans une recherche en direct ultérieure. Après cette exécution, le nouvel historique de recherche peut être analysé à nouveau, créant un cycle dans lequel la politique d’exploration de l’agent s’améliore au fil du temps. Dream-RSI modifie la stratégie de recherche, pas les poids ni les capacités du modèle qui produit les solutions candidates.
The Decoder rapporte que les chercheurs ont évalué Dream-RSI avec Gemini 3.1 Pro et Gemini 3.7 Flash sur huit tâches couvrant trois domaines. Les comparaisons utilisaient les mêmes conditions de départ, mais opposaient Dream-RSI à une base de référence utilisant une stratégie de recherche fixe.
Une tâche consistait à écrire un programme rapide pour un calcul statistique utilisé en génomique et en finance. Dans les tests rapportés, Dream-RSI a produit des programmes s’exécutant plus rapidement que les bibliothèques établies sklearn et glmnet sur six jeux de données. Avec Gemini 3.1 Pro, le temps moyen d’exécution est passé de 3 587 millisecondes à 2 931 millisecondes, tandis que le nombre de tentatives est tombé de 550 à 317.
L’article rapporte également une comparaison avec SimpleTES, qui nécessitait 51 200 exécutions pour cette tâche, contre 317 tentatives pour Dream-RSI. D’autres tests portant sur l’optimisation mathématique et les kernels GPU ont montré des résultats comparables ou meilleurs avec un coût de recherche plus faible. Sur deux tâches GPU, Dream-RSI a égalé les performances tout en réduisant le nombre d’exécutions jusqu’à un facteur de 2,43. Sur deux autres, il a obtenu jusqu’à 2,09 fois de meilleures performances pour le même budget de calcul.
Ces chiffres sont des résultats de recherche rapportés par The Decoder, et non des benchmarks de production vérifiés de manière indépendante. Les éléments disponibles ne permettent pas de savoir comment Dream-RSI se comporte sur des charges de travail plus larges, d’autres modèles ou des environnements d’évaluation changeants. Ils ne montrent pas non plus si la méthode produit systématiquement de meilleures solutions finales lorsque l’historique de recherche enregistré est petit ou peu représentatif.
Une analyse de suivi a révélé une autre limite. Les chercheurs ont testé si les historiques de recherche pouvaient être condensés en instructions explicites indiquant à l’agent où chercher. Sur une tâche GPU, cette version fondée sur des instructions a moins bien fonctionné que le système basé sur le replay. Les chercheurs ont suggéré qu’un guidage trop spécifique peut restreindre l’exploration et empêcher l’agent de trouver des alternatives moins évidentes.
Pour les équipes qui développent des agents IA, Dream-RSI indique une manière potentiellement pratique de réduire les coûts d’inférence et d’évaluation sans ajuster immédiatement ni réentraîner un modèle de fondation. Un agent de codage, un système d’optimisation ou un outil de découverte scientifique pourrait conserver des traces détaillées du travail antérieur et les utiliser pour améliorer l’allocation des efforts de recherche futurs.
Cela pourrait être utile dans des flux de travail où les solutions candidates sont coûteuses à tester. La génération de kernels GPU en est un exemple : compiler et benchmarker chaque variante peut prendre beaucoup plus de temps que de choisir entre des branches déjà évaluées. Des économies similaires peuvent s’appliquer à l’optimisation de code, à la recherche de conception et à l’expérimentation automatisée.
L’approche met aussi en évidence une frontière importante du système. Les améliorations peuvent venir d’une meilleure orchestration plutôt que d’un modèle de base plus performant. Les équipes peuvent donc évaluer séparément les politiques de recherche, les systèmes de replay et l’allocation de calcul, indépendamment des mises à niveau du modèle. En principe, cela rend les progrès plus faciles à mesurer : les constructeurs peuvent comparer le nombre de tentatives, le coût d’évaluation et la qualité finale sous le même modèle.
Il existe des risques opérationnels. Un historique de recherche peut contenir des évaluations trompeuses, des échecs causés par des conditions temporaires ou des lacunes dans l’espace exploré. Rejouer cet historique peut rendre un agent plus efficace pour suivre une carte étroite plutôt que pour mieux résoudre le problème sous-jacent. L’expérience sur les instructions rapportée par les chercheurs renforce la nécessité de préserver une marge d’exploration au lieu de transformer un comportement passé réussi en règles rigides.
Dream-RSI s’inscrit dans une direction de recherche plus large. AlphaEvolve de Google DeepMind utilise du code généré par le modèle et une sélection évolutionnaire pour rechercher des programmes améliorés, tandis que Dream-RSI opère un niveau au-dessus en ajustant la manière dont cette recherche est menée. D’autres systèmes, y compris des approches qui stockent les échecs sous forme d’instructions réutilisables, font un pari similaire sur l’expérience accumulée, mais peuvent restreindre plus directement l’exploration.
Le prochain signal important sera de savoir si Dream-RSI est testé au-delà des huit tâches et configurations Gemini rapportées. Les évaluations indépendantes devraient examiner différents modèles de fondation, des benchmarks bruités ou changeants, et des charges de travail où l’espace de recherche évolue entre les exécutions.
Les chercheurs et les équipes produit devront aussi établir une comptabilité plus claire du coût total. Moins de tentatives ne signifie pas automatiquement moins de dépenses si l’enregistrement, le replay, le stockage et l’évaluation des historiques de recherche ajoutent une surcharge importante. Les mesures de fiabilité seront également importantes : une stratégie qui économise du calcul mais manque des solutions rares de haute qualité peut ne pas convenir à des applications critiques pour la sécurité ou la recherche.
Une autre question ouverte concerne la manière dont Dream-RSI gère le transfert. Une stratégie apprise sur une classe de problèmes d’optimisation peut ne pas être utile pour une autre, et un historique qui améliore la recherche de code peut être un mauvais guide pour le raisonnement mathématique. Des preuves montrant que la méthode peut généraliser sans trop contraindre l’exploration détermineraient s’il s’agit d’une technique de plateforme réutilisable ou surtout d’une optimisation spécifique à une tâche.
Dream-RSI est remarquable moins comme une affirmation selon laquelle les agents peuvent se redessiner de manière autonome que comme un exemple d’où pourraient venir les gains d’efficacité à court terme. Le modèle reste fixe ; le système devient meilleur pour décider comment dépenser son budget de recherche. Pour les développeurs IA, c’est une voie plus concrète et testable que de supposer que toute amélioration nécessite un modèle plus grand ou nouvellement entraîné.
La réserve centrale est que le replay n’a de valeur que celle de l’expérience rejouée. Si les historiques de recherche sont étroits, biaisés ou coûteux à maintenir, l’agent peut devenir efficace sans devenir largement capable. La meilleure prochaine étape serait un test transparent et indépendant mesurant la qualité, la fiabilité et le coût total — et pas seulement le nombre de tentatives économisées.