Агенты ИИ расширяют работу по разработке моделей, но ключевые решения по-прежнему принимают люди

Связанное с Фудань исследование показывает, что агенты ИИ предлагают большую часть работы по разработке моделей, тогда как люди сохраняют окончательный контроль — это раскрывает границы автономности на практике.

AI News

Агенты ИИ берут на себя все большую часть работы, связанной с созданием моделей ИИ, но новый анализ показывает, что их влияние значительно ниже, когда исследователи решают, что именно делать и как действовать дальше.

Исследовательская группа с участием Университета Фудань в Китае изучила 769 журналов задач из проекта по разработке модели с участием 56 человек и использованных ими агентов. Исследование показало, что ИИ обеспечивал до 55,4% предложений по методам и параметрам, тогда как люди принимали 85,5% окончательных решений в этих областях. Люди также выбирали цели и масштаб проекта в 93,4% случаев.

Полученные результаты дают более взвешенную картину автономности агентов, чем можно было бы предположить по сырым показателям активности. Агенты выполняли работу, генерировали варианты и вносили исправления, но человеческое суждение оставалось главным точкой контроля — особенно когда проект сталкивался с неоднозначностью, сбоями или стратегическими выборами.

Atria Dawn Preview как тестовый пример

В центре проекта находился Atria Dawn Preview — агентный языковой модель на архитектуре mixture-of-experts с 744 миллиардами параметров. Команда разработала его для исследовательских и инженерных задач, используя рабочий процесс, в котором каждая задача была связана со средой выполнения. Агенты могли вызывать инструменты, получать промежуточные результаты и получать обратную связь от тестов, метрик или исходных свидетельств.

Исследователи сообщили, что ИИ использовался в 96,5% рассмотренных задач. За четыре недели медианное соотношение действий агентов к человеческим вводам выросло с 11 до 28,5. Этот рост может создать впечатление, что агенты становятся более самостоятельными, но авторы утверждают, что он в основном отражает иной паттерн: одно человеческое решение часто запускало более длинную цепочку действий агентов.

Согласно отчету, модель лидировала в пяти из 16 бенчмарков, включая веб-поиск и кибербезопасность. Источник не указывает, что Atria Dawn Preview в целом опередила конкурирующие системы, поэтому результаты бенчмарков следует рассматривать как ограниченное заявление о производительности, а не как доказательство широкой превосходящей эффективности.

Агенты предлагали варианты; люди выбирали направление

Наиболее распространенный паттерн принятия решений был «ИИ предлагает, человек выбирает» и составлял 55,4% решений по методам и параметрам. В той же категории ИИ принимал 9,2% окончательных решений против 85,5% у людей. Доля предложений ИИ варьировалась в зависимости от типа решения от 17% до 55%, но его роль в финальном выборе оставалась на однозначном уровне.

Человеческий контроль был еще сильнее на уровне проекта. Исследователи принимали окончательное решение по целям и масштабу в 93,4% случаев. Среди 151 задачи, которые участники считали невыполнимыми без ИИ, люди все равно выбирали цель в 95,4% случаев.

Это различие важно для разработки моделей. Агент может исследовать большое пространство возможных реализаций или проводить сложный эксперимент, не решая при этом, стоит ли его запускать. Данные исследования указывают на то, что современные системы более эффективны как операторы исследований и генераторы предложений, чем как владельцы исследовательской повестки.

ИИ сделал возможным больше работы, а не только более быструю

Исследование также указывает на менее очевидный эффект агентов ИИ. Из 455 завершенных задач с помощью ИИ участники сочли 151 — примерно треть — невыполнимой без ИИ при том же масштабе и качестве. Эти задачи были распределены среди 27 из 56 участников, а не сосредоточены только у нескольких продвинутых пользователей.

Этот результат говорит о том, что агенты могут расширять набор работ, которые команды вообще могут попытаться выполнить, а не просто ускорять существующие рабочие процессы. Для создателей ИИ это может означать больше экспериментов, оценок и инженерных изменений, попадающих в проектный конвейер. Это также может означать большую нагрузку на контроль, поскольку число действий, требующих проверки, растет вместе с объемом предпринимаемой работы.

Когда задачи становились сложными, вмешательство человека обычно было способом двигаться дальше. В наборе из 588 задач с зафиксированной сложностью 76% продвигались благодаря помощи человека, тогда как агенты решали 23% без вмешательства. Наиболее распространенными формами помощи были предоставление контекста или уточнение требований — 35,2%, а также диагностика проблем или изменение методов — 34,7%.

Люди редко брали исполнение на себя напрямую. Частичные правки составляли 3,2% вмешательств, а полные перехваты — 0,7%. После предоставления обратной связи агенты самостоятельно выполняли доработки в 75,4% случаев. На практике человеческим узким местом обычно были суждение и информация, а не ручное выполнение задачи.

Проблема надзора растет вместе с активностью агентов

Полученные данные не исключают более автономную разработку моделей. Напротив, они выявляют проблему контроля, которая становится острее по мере удлинения цепочек агентов. Если ни один человек не может проверять каждое промежуточное действие, человеческая проверка может деградировать до утверждения сводок или финальных результатов вместо полноценного надзора.

Исследователи также отметили, что участники часто использовали автономные режимы, чтобы не прерывать долгие процессы. По всей видимости, этот режим выбирался из соображений удобства, а не потому, что команды формально решили, сколько полномочий следует дать агентам. Для корпоративных команд ИИ это предупреждение: операционные настройки могут незаметно становиться решениями в области управления.

Исследование помещает текущие системы между двумя этапами развития: ИИ уже вышел за рамки простого объекта исследования или узкого инструмента для одной задачи, но еще не стал явно независимым научным руководителем. Авторы описывают возможный следующий этап как рекурсивное самосовершенствование, при котором более сильные системы помогают создавать своих преемников, подчеркивая при этом, что путь от лучшей эффективности на учебных задачах к лучшему дизайну моделей остается нерешенным.

На что обратить внимание дальше

Самым важным последующим вопросом будет то, появятся ли похожие паттерны принятия решений в других организациях и проектах по разработке моделей. Это исследование рассматривало работу одной команды, поэтому его наблюдения не следует считать универсальной мерой автономности ИИ.

Исследователям и покупателям следует следить за тремя сигналами. Во-первых, будущие оценки должны отделять действия агентов от решений о целях, методах и распределении ресурсов. Во-вторых, платформам разработки могут понадобиться журналы аудита, показывающие, как окончательная рекомендация возникла из длинной цепочки агентов. В-третьих, компании, заявляющие об автоматизированных исследованиях ИИ, должны раскрывать, как часто люди ставят цели, отклоняют предложения, меняют методы или вмешиваются после сбоев.

Дискуссия о рекурсивном самосовершенствовании также будет зависеть от доказательств, касающихся исследовательского суждения, а не только от скорости кодирования или пропускной способности экспериментов. Заявления компаний вроде Anthropic о все более автоматизированном управлении исследованиями остаются отдельной категорией доказательств по сравнению с этим независимо описанным проектом и не должны рассматриваться как напрямую сопоставимые без общих метрик.

Позиция Creati.ai

Главный вывод этого исследования носит операционный характер: больше активности агентов не обязательно означает больше их полномочий. Агенты ИИ могут умножать количество экспериментов и инженерных задач, которые команда может выполнять, но именно люди по-прежнему определяют, какие вопросы важны и оправдывают ли результаты смену направления.

Для разработчиков и корпоративных команд немедленный приоритет — не просто максимизировать автономные запуски. Важно проектировать системы, сохраняющие происхождение решений, выявляющие неопределенность и позволяющие проверять выбор, скрытый в длинных цепочках работы агентов. Пока агенты не смогут надежно оценивать исследовательские цели до появления результатов, человеческое суждение остается дефицитным ресурсом в разработке моделей.

Реклама