Google DeepMind의 Dream-RSI는 AI 에이전트가 과거 검색 실행을 재사용해 탐색을 조정하도록 하며, 기반 모델을 바꾸지 않고도 비용이 큰 시도를 줄여준다.

Google DeepMind 연구진은 각 실험을 다시 실행하는 대신 이전 시도를 재생해 AI 에이전트가 해법을 찾는 방식을 개선할 수 있게 하는 방법인 Dream-RSI를 개발했다. 이 접근법은 자율적 문제 해결에서 핵심적인 비용, 즉 어떤 가능성을 탐색할지, 어떤 것을 포기할지, 각 경로에 얼마나 많은 연산을 쓸지를 결정하는 문제를 겨냥한다.
The Decoder가 보도한 테스트에 따르면, Dream-RSI는 프로그래밍, 수학적 최적화, GPU 커널 작업 전반에서 기존 결과를 개선하거나 맞췄다. 일부 실험에서는 기반 Gemini 모델을 바꾸지 않은 채 시도 횟수를 절반 이상 줄였다. 이 연구가 중요한 이유는 자기개선을 모델 재학습에서 벗어나 검색을 이끄는 과정을 최적화하는 쪽으로 옮기기 때문이다.
AI 에이전트는 어려운 문제를 다룰 때 흔히 반복 루프를 따른다. 후보 해법을 생성하고, 이를 평가한 뒤, 그 결과를 바탕으로 다음에 무엇을 시도할지 결정한다. 가능한 경로가 늘어날수록 탐색은 많은 연산 자원을 소모할 수 있으며, 특히 각 시도마다 코드 생성, 실행 또는 다른 고비용 평가가 필요할 때 그렇다.
고정된 검색 전략은 비생산적인 방향을 반복해서 추적할 수 있다. 적응형 전략은 결과에 반응할 수 있지만, 어떤 전략이 효과적인지 배우는 데에도 많은 실전 시도가 필요할 수 있다. Dream-RSI는 에이전트의 이전 시도와 그 결과를 검색 가능한 기록으로 남겨 이 트레이드오프를 해결한다.
그다음 이 방법은 저장된 결과에 대해 대안적 결정을 시험한다. 모든 후보를 다시 생성하고 평가하는 대신, 다른 분기를 선택했더라면, 막다른 길을 더 일찍 포기했더라면, 유망한 경로에 더 많은 노력을 배정했더라면 어떻게 됐을지를 시뮬레이션할 수 있다. 연구진은 이 회고적 과정을 “꿈꾸기”라고 설명한다.
이렇게 나온 전략은 이후의 실제 검색에 사용된다. 그 실행이 끝나면 새 검색 기록을 다시 분석할 수 있어, 에이전트의 탐색 정책이 시간이 지남에 따라 개선되는 순환이 만들어진다. Dream-RSI는 후보 해법을 만드는 모델의 가중치나 능력이 아니라 검색 전략을 바꾼다.
The Decoder는 연구진이 Gemini 3.1 Pro와 Gemini 3.7 Flash를 사용해 세 영역에 걸친 8개 과제에서 Dream-RSI를 평가했다고 전했다. 비교는 동일한 시작 조건을 사용했지만, 고정 검색 전략을 쓰는 기준선과 Dream-RSI를 대조했다.
한 과제는 유전체학과 금융에서 쓰이는 통계 계산을 위한 빠른 프로그램을 작성하는 것이었다. 보고된 테스트에서 Dream-RSI는 6개 데이터셋에서 기존 sklearn과 glmnet 라이브러리보다 더 빠르게 실행되는 프로그램을 생성했다. Gemini 3.1 Pro를 사용했을 때 평균 실행 시간은 3,587밀리초에서 2,931밀리초로 줄었고, 시도 횟수는 550회에서 317회로 감소했다.
기사에는 또 다른 비교로 SimpleTES가 소개되는데, 이 과제에서 SimpleTES는 51,200회 실행이 필요했던 반면 Dream-RSI는 317회 시도만으로 끝났다. 수학적 최적화와 GPU 커널에 대한 추가 테스트에서는 더 낮은 탐색 비용으로 비슷하거나 더 나은 결과가 나왔다. 두 개의 GPU 과제에서는 Dream-RSI가 성능을 유지하면서 실행 횟수를 최대 2.43배 줄였다. 다른 두 과제에서는 같은 연산 예산 안에서 최대 2.09배의 성능을 달성했다.
이 수치는 The Decoder를 통해 보도된 연구 결과이며, 독립적으로 검증된 생산용 벤치마크는 아니다. 공개된 증거만으로는 Dream-RSI가 더 넓은 워크로드, 다른 모델, 변화하는 평가 환경에서 어떻게 동작하는지 알 수 없다. 또한 기록된 검색 이력이 작거나 대표성이 부족할 때 이 방법이 일관되게 더 나은 최종 해법을 만들어 내는지도 보여주지 않는다.
후속 분석은 또 다른 한계를 드러냈다. 연구진은 검색 기록을 에이전트에게 어디를 찾아야 하는지 알려주는 명시적 지시문으로 압축할 수 있는지 시험했다. 한 GPU 과제에서, 지시문 기반 버전은 재생 기반 시스템보다 성능이 떨어졌다. 연구진은 지나치게 구체적인 지침이 탐색을 좁혀 에이전트가 덜 분명한 대안을 찾지 못하게 할 수 있다고 지적했다.
AI 에이전트를 만드는 팀에게 Dream-RSI는 기반 모델을 즉시 미세조정하거나 재학습하지 않고도 추론과 평가 비용을 줄일 수 있는 잠재적으로 실용적인 방법을 제시한다. 코딩 에이전트, 최적화 시스템, 과학적 발견 도구는 이전 작업의 상세한 흔적을 보존하고 이를 이용해 미래의 탐색 노력을 더 잘 배분할 수 있다.
이는 후보 해법을 시험하는 비용이 큰 워크플로에서 유용할 수 있다. GPU 커널 생성이 한 예다. 각 변형을 컴파일하고 벤치마킹하는 데는 이미 평가된 분기들 중에서 고르는 것보다 훨씬 더 많은 시간이 걸릴 수 있다. 비슷한 경제성은 코드 최적화, 설계 탐색, 자동 실험에도 적용될 수 있다.
이 접근법은 중요한 시스템 경계도 보여준다. 개선은 더 강력한 기반 모델이 아니라 더 나은 오케스트레이션에서 나올 수 있다. 따라서 팀은 검색 정책, 재생 시스템, 연산 할당을 모델 업그레이드와 별도로 평가할 수 있다. 원칙적으로 이는 진전을 더 쉽게 측정하게 한다. 제작자는 같은 모델 아래에서 시도 횟수, 평가 비용, 최종 품질을 비교할 수 있다.
운영상의 위험도 있다. 검색 기록에는 오해를 부르는 평가, 일시적 조건으로 인한 실패, 탐색 공간의 공백이 들어 있을 수 있다. 그 기록을 재생하면 에이전트가 근본 문제를 더 잘 푸는 대신 좁은 지도를 따라가는 데 더 능숙해질 수 있다. 연구진이 보고한 지시문 실험은 과거의 성공적 행동을 경직된 규칙으로 바꾸는 대신 탐색의 여지를 남겨야 한다는 필요성을 강조한다.
Dream-RSI는 더 넓은 연구 방향 속에 있다. Google DeepMind의 AlphaEvolve는 모델 생성 코드와 진화적 선택을 사용해 개선된 프로그램을 탐색하는 반면, Dream-RSI는 그 탐색이 어떻게 수행되는지를 조정하는 한 단계 위에서 작동한다. 실패를 재사용 가능한 지시문으로 저장하는 접근법을 포함한 다른 시스템들도 축적된 경험에 비슷한 베팅을 하지만, 탐색을 더 직접적으로 제한할 수 있다.
다음의 중요한 신호는 Dream-RSI가 보고된 8개 과제와 Gemini 구성 이상으로 테스트되는지 여부다. 독립 평가는 서로 다른 기반 모델, 노이즈가 있거나 변동하는 벤치마크, 실행 간 탐색 공간이 달라지는 워크로드를 살펴봐야 한다.
연구자와 제품 팀은 총비용에 대한 더 명확한 계산도 필요하다. 검색 기록의 기록, 재생, 저장, 평가에 상당한 오버헤드가 더해진다면 시도 횟수가 줄어든다고 해서 자동으로 비용이 낮아지는 것은 아니다. 신뢰성 측정도 중요하다. 연산을 아끼지만 드물고 고품질인 해법을 놓치는 전략은 안전이 중요한 응용이나 연구용에는 맞지 않을 수 있다.
또 다른 미해결 질문은 Dream-RSI가 전이를 어떻게 다루는가이다. 한 종류의 최적화 문제에서 배운 전략이 다른 문제에는 유용하지 않을 수 있고, 코드 탐색을 개선하는 기록이 수학적 추론에는 나쁜 지침이 될 수 있다. 이 방법이 탐색을 과도하게 제한하지 않으면서 일반화할 수 있다는 증거가 있어야 그것이 재사용 가능한 플랫폼 기술인지, 아니면 주로 과제 특화 최적화인지 판단할 수 있다.
Dream-RSI는 에이전트가 독립적으로 자신을 재설계할 수 있다는 주장이라기보다, 단기 효율 향상이 어디서 올 수 있는지를 보여 주는 사례로서 더 눈에 띈다. 모델은 고정되어 있고, 시스템은 검색 예산을 어떻게 쓸지 더 잘 결정하게 된다. AI 제작자에게 이는 모든 개선에 더 크거나 새로 학습된 모델이 필요하다고 가정하는 것보다 훨씬 더 구체적이고 검증 가능한 경로다.
핵심 주의점은 재생의 가치는 재생되는 경험의 가치에 달려 있다는 것이다. 검색 기록이 좁거나 편향되어 있거나 유지 비용이 크다면, 에이전트는 효율적이 될 수는 있어도 폭넓게 유능해지지는 않을 수 있다. 가장 강력한 다음 단계는 절약된 시도 횟수만이 아니라 품질, 신뢰성, 총비용을 측정하는 투명하고 독립적인 테스트일 것이다.