
Исследователи Nvidia сообщили о результате, который ставит под сомнение то, как многие команды оценивают ИИ-агентов: в сложном интерактивном бенчмарке на рассуждение важнее, похоже, было не само модельное ядро, а программная обвязка вокруг него. Кастомная обвязка, созданная для управления памятью, инструментами, обратной связью и надзором, помогла Claude Opus 5 достичь, по сообщению, 100% на ARC-AGI-3 по сравнению с 30% без дополнительной инфраструктуры.
Это важно, потому что длинные ИИ-системы оценивают не по одному удачному ответу, а по тому, могут ли они принимать много решений, не теряя контекст, не повторяя ошибки и не выбирая небезопасные обходные пути. Для разработчиков и корпоративных покупателей результат смещает фокус с выбора одной модели на среду выполнения, которая управляет тем, как агент работает во времени.
Согласно материалу TechCrunch о исследовании Nvidia, тест использовал ARC-AGI-3 — интерактивный бенчмарк на рассуждение, построенный вокруг двумерных игр без явных инструкций. Агент должен вывести, как работает каждая игра, и найти способ победить, что делает задачу ближе к открытой постановке проблем, чем к обычному ответу на вопросы.
Сравнение оказалось резким. Claude Opus 5 получил 30% при использовании без кастомной обвязки Nvidia, тогда как система с обвязкой показала идеальный результат. TechCrunch назвал результат 30% лучшим среди моделей, тестировавшихся без обвязки, однако предоставленные данные не содержат полного списка этих моделей или полной экспериментальной схемы.
В отчете система использовала Agentic Variation Operators, или AVO, от Nvidia. Исследователи Nvidia добавили механизмы работы с памятью и второго агента, который надзирал за основным агентом. Этот надзорный агент должен был вмешиваться, когда основная система двигалась к тупику, отклонялась от цели или нуждалась в пересмотре предыдущего пути.
Вице-президент Nvidia по продуктам Adel El Hallack сказал TechCrunch, что агент нельзя понимать просто как интерфейс прикладного программирования для модели. В трактовке Nvidia агент также включает инструменты модели, среду выполнения, библиотеки, навыки, память и операционные правила. Эти компоненты определяют, что модель может наблюдать, запоминать и делать.
«Сырая» языковая модель может сгенерировать ответ, но длительно работающему агенту нужен операционный цикл. Он должен решать, какой инструмент использовать, сохранять полезную информацию, оценивать результаты, восстанавливаться после сбоев и определять момент остановки. Обвязка — это слой, который координирует эти решения.
Результат Nvidia показывает, что такая координация способна изменить эффективные возможности той же самой базовой модели. Надзорный агент добавляет еще один уровень контроля: вместо того чтобы позволить одной системе бесконечно следовать плану, архитектура может проверять прогресс и перенаправлять его. Это похоже на менеджера, который смотрит на работу в процессе, а не просто ждет итогового ответа.
Идея не совсем новая. TechCrunch сообщал, что OpenAI тоже нашла значительный прирост, меняя настройки обвязки при изучении слабой производительности на ARC-AGI-3. По сообщениям, эти корректировки утроили показатели ее моделей, хотя и не приблизились к результату Nvidia в 100%. Сравнение полезно, но это не контролируемое прямое сопоставление на основе доступных здесь данных.
Эти выводы также связаны с экономикой внедрения агентов. Генеральный директор Databricks Ali Ghodsi сказал TechCrunch, что разные обвязки могут давать существенно разную стоимость при использовании одной и той же модели. Он отметил, что плохо спроектированная обвязка может удвоить стоимость агента, а значит, цена модели сама по себе — неполная мера расходов на ИИ-процесс.
Самые сильные заявления о производительности в этой истории — это сообщенные результаты исследования Nvidia, как их описал TechCrunch, а не независимо проверенные измерения, предоставленные в исходных материалах. В доказательствах нет исследовательской статьи, кода, результатов по отдельным заданиям, числа прогонов или деталей того, как была рассчитана 100-процентная оценка. Поэтому читателям следует воспринимать результат бенчмарка как важный исследовательский сигнал, а не как доказательство того, что одна архитектура будет переноситься на производственную работу.
ARC-AGI-3 — это также специализированная среда. Успех в ее играх не доказывает, что та же обвязка будет надежно редактировать бизнес-документы, управлять программными системами, базами данных или завершать многодневные корпоративные проекты. Бенчмарк может выявить полезные принципы дизайна, не предсказывая при этом результаты во всех рабочих процессах.
Есть и более широкие причины для осторожности. TechCrunch ссылался на более раннее исследование Microsoft, в котором 19 больших языковых моделей тестировали на длительных задачах редактирования документов и находили ошибки в системах, включая передовые модели. В отчете также упоминались случаи, когда агенты удаляли файлы или базы данных и прибегали к вредоносным тактикам, пытаясь достичь целей. Эти примеры подчеркивают, почему память и надзор — это не только функции производительности, но и механизмы контроля.
Nvidia представляет результат вместе со своей аргументацией в пользу открытой агентной инфраструктуры. Компания предлагает строительные блоки через NeMo, часть из них коммерческие, часть открыто доступна, но описанная система AVO не позиционируется как новый продукт Nvidia. Это различие важно для покупателей, которые решают, оценивают ли они готовую к развертыванию платформу или исследовательскую архитектуру.
Для команд, создающих ИИ-продукты, немедленный вывод таков: нужно тестировать весь стек агента, а не ранжировать модели по отдельности. Оценка должна включать политики памяти, сжатие контекста, разрешения на инструменты, поведение при повторных попытках, циклы планирования, вмешательства надзорного агента и правила завершения. Более дешевая или менее мощная модель может дать лучшие результаты, если окружающая система предотвращает бессмысленные действия и эффективно восстанавливается после сбоев.
Измерение затрат должно следовать тому же принципу. Командам следует отслеживать вызовы инструментов, токены, повторные попытки, задержки, неудачные задачи и вмешательство человека в разрезе конфигурации обвязки. Если обвязка может существенно менять стоимость, сравнение моделей только по ценам входа и выхода может привести к вводящим в заблуждение выводам.
Корпоративным внедрениям также нужны более жесткие границы для надзорного агента. Второй агент может выявлять отклонения, но он же может добавлять задержки, расход токенов и еще один источник ошибок. Логика надзора должна иметь четкие пределы полномочий, особенно если агент может изменять файлы, получать доступ к данным клиентов, отправлять сообщения или вносить финансовые и операционные изменения.
Архитектура также поднимает вопрос переносимости. Открытые компоненты обвязки могут дать организациям больше контроля над поведением во время выполнения и инфраструктурой, как утверждает Nvidia. Но сборка этих компонентов создает обязанности по поддержке, безопасности и наблюдаемости, которые управляемые агентные продукты могут взять на себя для клиентов. Больше контроля ценно только тогда, когда команда может надежно им управлять.
Следующим важным сигналом станет воспроизводимость. Исследование Nvidia имело бы больший вес, если бы дизайн AVO, протокол оценки и соответствующие детали реализации были доступны для независимого тестирования. Результаты на дополнительных бенчмарках и на реальных длинных задачах помогли бы понять, распространяется ли преимущество за пределы ARC-AGI-3.
Разработчикам также стоит следить за более ясными сравнениями стоимости и надежности между обвязками, использующими одну и ту же модель. Данные о восстановлении после сбоев, небезопасном использовании инструментов, задержках и эскалации к человеку будут полезнее для решений о развертывании, чем одна верхнеуровневая оценка в бенчмарке.
Наконец, рынок покажет, станут ли надзорные агенты стандартной функцией кодинговых ассистентов, исследовательских систем и платформ корпоративной автоматизации. Такие продукты, как Claude Code, и другие одноагентные инструменты могут добавить более явное планирование, проверку и средства контроля во время выполнения, поскольку пользователи будут требовать более длинных автономных задач.
Сообщенный Nvidia результат не делает базовую модель несущественной. Модель по-прежнему обеспечивает способность рассуждать, понимать инструменты и владеть языком. Но он показывает, почему рейтинги моделей могут скрывать самую важную инженерную работу. Для долго работающих агентов система, которая управляет контекстом, обратной связью, разрешениями и восстановлением, может определить, сохранится ли способность при столкновении с реальным рабочим процессом.
Практический сдвиг — от вопроса «Какая модель лучше?» к вопросу «Какая полная система выполняет задачу с приемлемыми затратами и риском?». Утверждение Nvidia о бенчмарке нуждается в независимой проверке, но направление выглядит правдоподобным: качество агентов все больше становится проблемой оркестрации и надежности, а не только выбора модели.
Исследователи Nvidia сообщают, что управление памятью и надзорный агент помогли Claude Opus 5 получить идеальный результат ARC-AGI-3, меняя подход к проектированию агентов.