O Dream-RSI da Google DeepMind permite que agentes de IA reutilizem execuções de busca anteriores para ajustar a exploração, reduzindo tentativas caras sem alterar o modelo subjacente.

Pesquisadores da Google DeepMind desenvolveram o Dream-RSI, um método que permite a agentes de IA melhorar a forma como buscam soluções ao reproduzir tentativas anteriores em vez de executar novamente todos os experimentos. A abordagem mira um custo central na resolução autônoma de problemas: decidir quais possibilidades explorar, quais abandonar e quanto computar gastar em cada caminho.
Segundo testes relatados pelo The Decoder, o Dream-RSI melhorou ou igualou resultados existentes em tarefas de programação, otimização matemática e kernels de GPU. Em alguns experimentos, ele reduziu o número de tentativas em mais da metade sem alterar o modelo Gemini subjacente. O trabalho importa porque desloca o autoaperfeiçoamento do retreinamento de um modelo para a otimização do processo que direciona sua busca.
Agentes de IA que trabalham em problemas difíceis costumam seguir um ciclo iterativo. Eles geram uma solução candidata, avaliam-na e usam o resultado para decidir o que tentar em seguida. À medida que o número de caminhos possíveis cresce, a exploração pode consumir grandes quantidades de computação, especialmente quando cada tentativa exige geração de código, execução ou outra avaliação cara.
Uma estratégia de busca fixa pode perseguir repetidamente direções improdutivas. Uma estratégia adaptativa pode responder aos resultados, mas aprender qual estratégia funciona pode, por si só, exigir muitos testes em tempo real. O Dream-RSI enfrenta esse trade-off registrando as tentativas anteriores do agente e seus resultados em um histórico pesquisável.
O método então testa decisões alternativas contra esses resultados armazenados. Em vez de gerar e avaliar todos os candidatos novamente, o sistema pode simular o que teria acontecido se tivesse escolhido um ramo diferente, desistido mais cedo de um beco sem saída ou alocado mais esforço a um caminho promissor. Os pesquisadores descrevem esse processo retrospectivo como "sonhar".
A estratégia resultante é usada em uma busca ao vivo subsequente. Depois dessa execução, o novo histórico de busca pode ser analisado novamente, criando um ciclo no qual a política de exploração do agente melhora ao longo do tempo. O Dream-RSI altera a estratégia de busca, não os pesos nem as capacidades do modelo que produz as soluções candidatas.
O The Decoder relata que os pesquisadores avaliaram o Dream-RSI com Gemini 3.1 Pro e Gemini 3.7 Flash em oito tarefas abrangendo três áreas. As comparações usaram as mesmas condições iniciais, mas colocaram o Dream-RSI contra uma linha de base com estratégia de busca fixa.
Uma tarefa envolvia escrever um programa rápido para um cálculo estatístico usado em genômica e finanças. Nos testes relatados, o Dream-RSI produziu programas que rodaram mais rápido do que as bibliotecas estabelecidas sklearn e glmnet em seis conjuntos de dados. Com o Gemini 3.1 Pro, o tempo médio de execução caiu de 3.587 milissegundos para 2.931 milissegundos, enquanto o número de tentativas diminuiu de 550 para 317.
O artigo também relata uma comparação com o SimpleTES, que exigiu 51.200 execuções naquela tarefa, contra 317 tentativas do Dream-RSI. Testes adicionais envolvendo otimização matemática e kernels de GPU mostraram resultados comparáveis ou melhores com menor custo de busca. Em duas tarefas de GPU, o Dream-RSI igualou o desempenho enquanto reduzia o número de execuções em até um fator de 2,43. Em outras duas, alcançou até 2,09 vezes o desempenho dentro do mesmo orçamento de computação.
Esses números são resultados de pesquisa relatados pelo The Decoder, não benchmarks de produção verificados de forma independente. As evidências disponíveis não estabelecem como o Dream-RSI se comporta em cargas de trabalho mais amplas, modelos diferentes ou ambientes de avaliação em mudança. Também não mostram se o método produz consistentemente soluções finais melhores quando o histórico de busca registrado é pequeno ou pouco representativo.
Uma análise de acompanhamento revelou outra limitação. Os pesquisadores testaram se os históricos de busca poderiam ser condensados em instruções explícitas dizendo ao agente onde procurar. Em uma tarefa de GPU, essa versão baseada em instruções teve desempenho pior do que o sistema baseado em reprodução. Os pesquisadores sugeriram que orientações excessivamente específicas podem restringir a exploração e impedir que o agente encontre alternativas menos óbvias.
Para equipes que constroem agentes de IA, o Dream-RSI aponta para uma forma potencialmente prática de reduzir custos de inferência e avaliação sem imediatamente ajustar ou retreinar um modelo de base. Um agente de programação, um sistema de otimização ou uma ferramenta de descoberta científica poderia preservar rastros detalhados de trabalhos anteriores e usá-los para melhorar a alocação de esforços futuros de busca.
Isso pode ser útil em fluxos de trabalho em que soluções candidatas são caras de testar. A geração de kernels de GPU é um exemplo: compilar e fazer benchmarking de cada variante pode levar bem mais tempo do que selecionar entre ramos já avaliados. Economias semelhantes podem valer para otimização de código, busca de design e experimentação automatizada.
A abordagem também destaca uma importante fronteira do sistema. Melhorias podem vir de uma orquestração melhor, em vez de um modelo base mais capaz. Assim, equipes podem avaliar políticas de busca, sistemas de reprodução e alocação de computação separadamente de upgrades do modelo. Em princípio, isso torna o progresso mais fácil de medir: os construtores podem comparar número de tentativas, custo de avaliação e qualidade final sob o mesmo modelo.
Há riscos operacionais. Um histórico de busca pode conter avaliações enganosas, falhas causadas por condições temporárias ou lacunas no espaço explorado. Reproduzir esse histórico pode tornar um agente mais eficiente em seguir um mapa estreito do que em resolver melhor o problema subjacente. O experimento com instruções relatado pelos pesquisadores reforça a necessidade de preservar espaço para exploração, em vez de transformar comportamentos bem-sucedidos do passado em regras rígidas.
O Dream-RSI se insere em uma direção de pesquisa mais ampla. O AlphaEvolve da Google DeepMind usa código gerado pelo modelo e seleção evolutiva para buscar programas melhores, enquanto o Dream-RSI opera um nível acima ao ajustar como essa busca é conduzida. Outros sistemas, incluindo abordagens que armazenam falhas como instruções reutilizáveis, fazem uma aposta semelhante na experiência acumulada, mas podem restringir a exploração de forma mais direta.
O próximo sinal importante será saber se o Dream-RSI é testado além das oito tarefas e configurações Gemini relatadas. Avaliações independentes devem examinar diferentes modelos de base, benchmarks ruidosos ou em mudança e cargas de trabalho em que o espaço de busca muda entre execuções.
Pesquisadores e equipes de produto também precisarão de uma contabilidade mais clara do custo total. Menos tentativas não significa automaticamente menor despesa se registrar, reproduzir, armazenar e avaliar históricos de busca adicionar uma sobrecarga substancial. Medidas de confiabilidade também serão importantes: uma estratégia que economiza computação mas perde soluções raras e de alta qualidade pode não servir para aplicações críticas de segurança ou pesquisa.
Outra questão em aberto é como o Dream-RSI lida com transferência. Uma estratégia aprendida em uma classe de problemas de otimização pode não ser útil em outra, e um histórico que melhora a busca por código pode ser um guia ruim para raciocínio matemático. Evidências de que o método consegue generalizar sem restringir demais a exploração determinariam se ele é uma técnica de plataforma reutilizável ou principalmente uma otimização específica da tarefa.
O Dream-RSI é notável menos como uma afirmação de que agentes podem se redesenhar de forma independente e mais como um exemplo de onde podem vir ganhos de eficiência de curto prazo. O modelo permanece fixo; o sistema fica melhor em decidir como gastar seu orçamento de busca. Para construtores de IA, isso é um caminho mais concreto e testável do que assumir que toda melhoria exige um modelo maior ou recém-treinado.
A ressalva central é que a reprodução só vale tanto quanto a experiência reproduzida. Se os históricos de busca forem estreitos, enviesados ou caros de manter, o agente pode se tornar eficiente sem se tornar amplamente capaz. O próximo passo mais forte seria um teste transparente e independente que meça qualidade, confiabilidade e custo total — não apenas o número de tentativas economizadas.