
ИИ-агенты могут зафиксировать неудачную команду или критически важное требование и всё равно позже повторить ту же ошибку. Исследователи Meta предлагают вторую агентную систему для решения этой проблемы: «коуч памяти», который следит за ходом задачи, ведёт структурированные записи и выборочно напоминает основному агенту о том, что важно.
Подход, описанный в новой научной статье и освещённый The Decoder, предназначен для длительных задач в среде командной строки и в сценариях обслуживания клиентов, использующих инструменты. В отчётных тестах Meta зафиксировала прирост до 8,3 процентного пункта на двух бенчмарках, но результаты также указывают на нерешённые вопросы о частоте вмешательства, калибровке модели, операционных издержках и о том, насколько автономной должна быть система памяти.
Исследователи называют базовый сбой «behavioral state decay». По мере роста истории задач агента ограничения, диагностика и предыдущие попытки могут оказаться погребены в окне контекста. Информация технически всё ещё доступна, но уже не оказывает надёжного влияния на следующее решение.
Система Meta отделяет эту проблему от обычного хранения памяти. Немодифицированный агент действий выполняет задачу, а отдельный агент памяти через фиксированные интервалы просматривает недавние шаги. Агент памяти обновляет структурированный банк памяти и решает, нужен ли следующему вызову к агенту действий короткий напоминатель — или не нужен вообще.
Способность оставаться в тишине — центральная часть дизайна. Постоянная отправка всего банка памяти обратно агенту действий может увеличить расход токенов, задержку и отвлекающий шум. Вместо этого система Meta рассматривает вмешательство как отдельное решение.
Банк памяти состоит из трёх компонентов. Приватное поле статуса отслеживает прогресс и нерешённые риски, но не показывается агенту действий. Knowledge Memory хранит относительно стабильную информацию, такую как требования, пути к файлам и конфигурации. Procedural Memory фиксирует действия и результаты, включая неудачные команды, успешные исправления и отклонённые объяснения.
Агент памяти изменяет эти записи через заранее определённые вызовы инструментов, а не свободно переписывает банк. Затем он может реактивировать сохранённое состояние, сформировав точечное напоминание. Meta описывает модуль как совместимый с существующими агентами и harness-окружениями, а не как замену основной модели или универсального стратегического советника.
Система оценивалась на Terminal-Bench 2.0, который тестирует автономных агентов на реалистичных задачах в командной строке, и на tau2-Bench, который измеряет разговорное использование инструментов в авиасекторе, рознице и телекоммуникациях.
В описанной конфигурации Claude Sonnet 4.5 выступал в роли агента действий, а Claude Opus 4.6 — в роли агента памяти. Совместная система выполнила 46% задач Terminal-Bench с первой попытки по сравнению с 38% у базовой линии. На tau2-Bench взвешенное по задачам среднее выросло с 55% до 62%.
Результаты были неоднородными. Показатели в авиации и рознице выросли примерно на 10 процентных пунктов, тогда как телеком улучшился примерно на 3 пункта. Исследователи трактуют эту вариативность как доказательство того, что ценность вмешательства зависит от задачи, а не следует универсальной частоте напоминаний.
Заявленный прирост сохранялся и при использовании более сильной модели Opus 4.6 в качестве агента действий, хотя он был меньше: 2,4 процентного пункта на Terminal-Bench и 2,5 пункта на tau2-Bench. Этот результат указывает на то, что слой памяти не просто компенсирует более слабую основную модель.
Это исследовательские результаты, сообщённые авторами Meta, а не независимая валидация и не доказательство внедрения в продуктивной среде. В статье также отмечается, что агент памяти иногда воспринимал предположительные выводы как более достоверные, чем они того заслуживали. Поэтому оставшиеся ошибки часто касались калибровки, а не просто того, была ли нужная информация сохранена.
Для разработчиков ИИ предложение Meta устраняет практическую слабость агентных рабочих процессов: история задачи — это не то же самое, что надёжное состояние задачи. Более длинный контекст может сохранять больше текста, но не гарантирует, что модель использует раннее предупреждение, если позднее решение ему противоречит.
Это различие важно для кодирующих агентов, автоматизации поддержки и других систем, которые многократно вызывают инструменты. Неудачная shell-команда должна влиять на следующую попытку. Проверенная запись клиента должна иметь больший вес, чем неподтверждённое утверждение. Жёсткое требование должно оставаться активным, даже если агент переключил внимание на отладку или другую подзадачу.
Аblation-тесты Meta поддерживают именно такое узкое толкование. Если на каждом шаге давать агенту действий полный банк памяти, производительность снижалась по сравнению с селективными напоминаниями. Удаление опции молчания тоже приводило к менее согласованным результатам между доменами. Система в стиле советника без постоянного банка памяти помогала в одних областях, но вредила в других.
В представленном сравнении дизайн также превзошёл Mem0. По описанию исследования, это различие не ограничивалось качеством извлечения. Агент памяти Meta решал, должен ли сохранённый статус попасть в цикл агента и как именно его следует выразить в виде напоминания.
Это может сделать архитектуру полезной там, где надёжность важнее максимальной разговорной памяти. Однако это также добавляет ещё один вызов модели, ещё один источник задержки и ещё одно место, где ошибочные суждения могут повлиять на рабочий процесс. Командам нужно будет сопоставлять стоимость напоминаний со стоимостью повторных действий, неудачных вызовов инструментов и ручного восстановления.
Основная версия не требует специально обученной модели; она использует prompting и обновления, ограниченные инструментами. Meta также тестировала меньшую модель Qwen3.5-27B в качестве агента памяти, оставив гораздо более крупную модель действий неизменной. Без дополнительного обучения меньшая модель снижала производительность. Обучение с учителем восстановило потери, а затем обучение с подкреплением улучшило её решения о том, когда следует вспоминать сохранённое состояние.
Этот результат усложняет идею о том, что память можно просто добавить как плагин. Слой памяти на основе prompting может работать с сильными моделями, но более дешёвые развёртывания могут нуждаться в обучении, специфичном для задачи, чтобы надёжно принимать решения о вмешательстве. Фиксированный график проверки системы — ещё одно операционное ограничение: будущая версия может вызывать память по мере необходимости, а не проверять её через заранее заданные интервалы.
Meta также указывает на нерешённые вопросы о том, что лучше работает — буквальные записи или более абстрактные сводки задачи, и должны ли агент памяти и агент действий обучаться совместно. Эти решения могут повлиять на аудируемость, переносимость между моделями и способность диагностировать, почему агент среагировал на конкретное воспоминание — или проигнорировал его.
Самый важный следующий шаг — независимое тестирование на дополнительных агентных задачах. Текущие данные основаны на двух бенчмарках и исследовательской оценке, поэтому пока неясно, насколько последовательно метод переносится на разработку ПО, корпоративные операции или долгие браузерные сценарии.
Разработчикам также следует следить не только за успешностью задачи, но и за стоимостью и задержкой. Коуч памяти, который повышает процент завершения, но добавляет частые вызовы модели, может быть привлекателен для дорогих сбоев, но непрактичен для высоконагруженной автоматизации.
Дополнительные сигналы — адаптивный вызов вместо проверки через фиксированные интервалы, более сильная калибровка уверенности и сравнения с другими системами памяти. Открытые реализации или воспроизводимые оценки позволили бы лучше понять, обусловлены ли улучшения двухагентной структурой, политикой селективных напоминаний, парой моделей или задачно-специфичным prompting.
Предложение Meta рассматривает память агента как задачу управления, а не просто как проблему хранения. Ценная способность — решать, когда предыдущее состояние должно изменить следующее действие, избегая при этом потока напоминаний, который снижает эффективность основного агента.
Это полезное направление для команд, создающих надёжных ИИ-агентов, но улучшения на бенчмарках следует воспринимать как ранний исследовательский сигнал. Практическая проверка покажет, снижает ли селективная память реальные операционные сбои после учёта дополнительных затрат на инференс, ошибочных напоминаний и сложности аудита политики вмешательства второго агента.
Исследователи Meta предлагают агент избирательной памяти для длительных ИИ-задач, сообщая о более высоких результатах на бенчмарках и одновременно указывая на издержки, калибровку и открытые вопросы дизайна.