Dream-RSI от Google DeepMind позволяет ИИ-агентам улучшаться, воспроизводя прошлые поиски

Dream-RSI от Google DeepMind позволяет ИИ-агентам повторно использовать прошлые поисковые запуски для настройки исследования, сокращая дорогие попытки без изменения базовой модели.

AI News

Исследователи Google DeepMind разработали Dream-RSI — метод, который позволяет ИИ-агентам улучшать поиск решений, воспроизводя более ранние попытки вместо повторного запуска каждого эксперимента. Подход нацелен на одну из ключевых статей затрат в автономном решении задач: определять, какие варианты исследовать, какие оставлять, и сколько вычислений тратить на каждый путь.

Согласно тестам, о которых сообщает The Decoder, Dream-RSI улучшил или повторил существующие результаты в задачах программирования, математической оптимизации и GPU-ядрах. В некоторых экспериментах он сократил число попыток более чем наполовину, при этом базовая модель Gemini осталась неизменной. Работа важна тем, что переносит самоулучшение от дообучения модели к оптимизации процесса, который направляет её поиск.

Как Dream-RSI повторно использует прошлые попытки

ИИ-агенты, работающие над сложными задачами, часто следуют итеративному циклу. Они генерируют кандидатное решение, оценивают его и используют результат, чтобы решить, что пробовать дальше. По мере роста числа возможных путей исследование может потреблять большие объёмы вычислений, особенно когда каждая попытка требует генерации кода, выполнения или другой дорогостоящей оценки.

Фиксированная стратегия поиска может снова и снова вести в бесплодные направления. Адаптивная стратегия может реагировать на результаты, но само обучение тому, какая стратегия работает, может требовать множества живых проб. Dream-RSI решает этот компромисс, записывая предыдущие попытки агента и их исходы в доступную для поиска историю.

Затем метод тестирует альтернативные решения на основе этих сохранённых результатов. Вместо того чтобы заново генерировать и оценивать каждый кандидат, система может симулировать, что произошло бы, если бы был выбран другой ветвящийся путь, если бы тупик был оставлен раньше или если бы перспективному пути было выделено больше усилий. Исследователи называют этот ретроспективный процесс «сном».

Полученная стратегия используется в последующем живом поиске. После этого прогона новую историю поиска можно проанализировать снова, создавая цикл, в котором политика исследования агента со временем улучшается. Dream-RSI меняет стратегию поиска, а не веса или возможности модели, создающей кандидатные решения.

Что показывают отчётные тесты

The Decoder сообщает, что исследователи оценивали Dream-RSI с Gemini 3.1 Pro и Gemini 3.7 Flash на восьми задачах в трёх областях. Сравнения использовали одни и те же стартовые условия, но противопоставляли Dream-RSI базовой версии с фиксированной стратегией поиска.

Одна задача заключалась в написании быстрой программы для статистического расчёта, используемого в геномике и финансах. В отчётных тестах Dream-RSI создавал программы, работавшие быстрее признанных библиотек sklearn и glmnet на шести наборах данных. С Gemini 3.1 Pro среднее время выполнения снизилось с 3 587 миллисекунд до 2 931 миллисекунды, а число попыток уменьшилось с 550 до 317.

В статье также приводится сравнение с SimpleTES, которому на этой задаче потребовалось 51 200 запусков, против 317 попыток у Dream-RSI. Дополнительные тесты, связанные с математической оптимизацией и GPU-ядрами, показали либо сопоставимые, либо лучшие результаты при меньших затратах на поиск. На двух GPU-задачах Dream-RSI сохранил производительность, сократив число запусков до 2,43 раза. На ещё двух он достиг до 2,09-кратной производительности в рамках того же вычислительного бюджета.

Эти цифры — исследовательские результаты, опубликованные через The Decoder, а не независимо проверенные производственные бенчмарки. Доступные данные не показывают, как Dream-RSI ведёт себя на более широких нагрузках, других моделях или в меняющихся средах оценки. Они также не доказывают, что метод стабильно выдаёт лучшие конечные решения, если зафиксированная история поиска мала или нерепрезентативна.

Последующий анализ выявил ещё одно ограничение. Исследователи проверили, можно ли сжать историю поиска в явные инструкции, подсказывающие агенту, где искать. На одной GPU-задаче такая версия на основе инструкций показала худший результат, чем система на основе replay. Исследователи предположили, что слишком специфические указания могут сузить исследование и помешать агенту находить менее очевидные альтернативы.

Почему это различие важно для разработчиков

Для команд, создающих ИИ-агентов, Dream-RSI указывает на потенциально практичный способ снизить затраты на инференс и оценку без немедленной донастройки или переобучения базовой модели. Кодирующий агент, система оптимизации или инструмент научного открытия могли бы сохранять подробные следы предыдущей работы и использовать их для улучшения распределения будущих поисковых усилий.

Это может быть полезно в рабочих процессах, где кандидатные решения дорого тестировать. Генерация GPU-ядер — один из примеров: компиляция и бенчмаркинг каждой версии могут занимать значительно больше времени, чем выбор между уже оценёнными ветвями. Похожая экономика может применяться к оптимизации кода, поиску дизайна и автоматизированным экспериментам.

Подход также подчёркивает важную системную границу. Улучшения могут приходить от лучшей оркестрации, а не от более мощной базовой модели. Поэтому команды могут оценивать политики поиска, системы replay и распределение вычислений отдельно от апгрейдов модели. В принципе это делает прогресс легче измеримым: разработчики могут сравнивать число попыток, стоимость оценки и конечное качество под одной и той же моделью.

Есть и операционные риски. История поиска может содержать вводящие в заблуждение оценки, сбои, вызванные временными условиями, или пробелы в исследованном пространстве. Повтор такого исторического опыта может сделать агента более эффективным в следовании узкой карте, а не в лучшем решении исходной задачи. Эксперимент с инструкциями, о котором сообщили исследователи, подчёркивает необходимость сохранять пространство для исследования, а не превращать успешное прошлое поведение в жёсткие правила.

Dream-RSI вписывается в более широкое направление исследований. AlphaEvolve от Google DeepMind использует сгенерированный моделью код и эволюционный отбор для поиска улучшенных программ, тогда как Dream-RSI работает на уровне выше, настраивая сам способ проведения этого поиска. Другие системы, включая подходы, сохраняющие неудачи как повторно используемые инструкции, делают похожую ставку на накопленный опыт, но могут ограничивать исследование более напрямую.

За чем следить дальше

Следующим важным сигналом станет то, будет ли Dream-RSI протестирован за пределами восьми задач и конфигураций Gemini, о которых сообщалось. Независимые оценки должны проверить разные базовые модели, шумные или меняющиеся бенчмарки и нагрузки, в которых пространство поиска меняется между запусками.

Исследователям и продуктовым командам также понадобится более чёткий учёт общей стоимости. Меньшее число попыток не означает автоматически меньшие расходы, если запись, replay, хранение и оценка истории поиска добавляют значительные накладные расходы. Важны будут и показатели надёжности: стратегия, экономящая вычисления, но пропускающая редкие высококачественные решения, может не подойти для критичных к безопасности или исследовательских применений.

Ещё один открытый вопрос — как Dream-RSI работает с переносом. Стратегия, выученная на одном классе задач оптимизации, может быть бесполезна для другого, а история, улучшающая поиск кода, может оказаться плохим ориентиром для математического рассуждения. Доказательства того, что метод может обобщаться, не чрезмерно ограничивая исследование, покажут, является ли он переиспользуемой платформенной техникой или в основном оптимизацией, специфичной для задачи.

Взгляд Creati.ai

Dream-RSI примечателен не столько как утверждение, что агенты могут самостоятельно себя перепроектировать, сколько как пример того, откуда могут прийти краткосрочные выигрыши в эффективности. Модель остаётся фиксированной; система становится лучше в том, как расходовать свой поисковый бюджет. Для AI-разработчиков это более конкретный и проверяемый путь, чем предположение, что любое улучшение требует более крупной или недавно обученной модели.

Главная оговорка в том, что replay настолько ценен, насколько ценен воспроизводимый опыт. Если истории поиска узкие, смещённые или дорогие в поддержании, агент может стать эффективным, но не стать по-настоящему универсально способным. Самым сильным следующим шагом были бы прозрачные независимые тесты, измеряющие качество, надёжность и общую стоимость — а не только число сэкономленных попыток.

Реклама