
NVIDIA заявляет, что её система Agentic Variation Operators, или NVIDIA AVO, получила идеальный результат в публичном наборе ARC-AGI-3, пройдя все 183 уровня в 25 интерактивных средах. Этот результат значим, поскольку он рассматривает долгосрочную производительность агента как системную проблему, а не как простой показатель базовой языковой модели.
Это утверждение содержится в публикации NVIDIA Developer Blog, где AVO описывается как универсальная архитектура для продолжительной автономной работы. Компания заявляет, что та же система также оптимизировала GPU-ядра в ходе семидневного запуска, что указывает на возможность переноса её дизайна между рабочими процессами разработки ПО и незнакомыми интерактивными задачами рассуждения. Однако показатели производительности сообщены самой NVIDIA, а доступные материалы не содержат независимой валидации или рецензируемой оценки.
NVIDIA сообщает, что AVO получил оценку RHAE 100,00 в публичном наборе ARC-AGI-3. Компания утверждает, что агент завершил каждый уровень в 25 средах бенчмарка и использовал на 12% меньше действий в среде, чем VISTA, сравнительная система, упомянутая в публикации компании.
ARC-AGI-3 построен вокруг незнакомых интерактивных сред, в которых агентам необходимо понять, как работают действия, и выяснить, чего от них ожидают. В отличие от обычного теста вопросов и ответов, бенчмарк требует от агента сохранять прогресс на протяжении нескольких шагов, обучаясь на обратной связи.
Главный аргумент NVIDIA состоит в том, что такой тип оценки измеряет нечто большее, чем интеллект модели. Агент должен решать, что наблюдать, какие инструменты использовать, как сохранять полезное состояние и как восстанавливаться, когда подход не срабатывает. По описанию компании, окружающий harness определяет, насколько эффективно возможности модели превращаются в устойчивое автономное поведение.
В публикации также говорится, что система, построенная вокруг Claude Opus 5, повысила производительность с 30%-й базовой линии модели до заявленного результата 100% после включения в полную архитектуру AVO. NVIDIA представляет это сравнение как доказательство того, что дизайн системы может существенно менять результаты бенчмарка. Его не следует рассматривать как независимый рейтинг ни Claude Opus 5, ни AVO без дополнительных деталей о настройке оценки.
AVO описывается как система для программирования и выполнения задач, которая может просматривать и редактировать код, запускать команды, обращаться к документации и проверять изменения через выполнение. По словам NVIDIA, её определяющая особенность — не один инструмент, а способность продолжать работу через длинные последовательности экспериментов.
Особое внимание уделяется двум механизмам: постоянной памяти и надзору. Постоянная память хранит предыдущие реализации, результаты тестов, вывод компилятора и профилировщика, а также накопленные рассуждения. Это позволяет агенту продолжать работу с текущего состояния, а не перестраивать понимание после каждого окна контекста.
Компонент надзора следит за более общей траекторией. Когда основной агент застревает или повторяет непродуктивные циклы, надзор может перенаправить его к другой стратегии. Основной агент по-прежнему отвечает за то, что осматривать, изменять, тестировать и коммитить, тогда как надзор контролирует прогресс на более длинном промежутке работы.
Для ARC-AGI-3 NVIDIA говорит, что подключила тот же базовый агент к другому интерфейсу, изменив доступные инструменты среды и процесс оценки, но сохранив ядро архитектуры. Эта переносимость — более существенное утверждение для разработчиков ИИ: система предназначена для адаптации к новым циклам обратной связи без перепроектирования всего агента с нуля.
Сначала NVIDIA описывает AVO через эксперимент по оптимизации GPU-ядра. В этой работе система автономно исследовала более 500 направлений оптимизации в течение семи дней и зафиксировала 40 версий ядра, по словам компании.
На системах NVIDIA DGX B200, как сообщает NVIDIA, получившиеся ядра multihead attention показали производительность до 3,5% выше, чем cuDNN, и до 10,5% выше, чем FlashAttention-4, в проверенных конфигурациях. Компания также говорит, что AVO адаптировал эволюционировавшее ядро под grouped-query attention примерно за 30 дополнительных минут автономной работы.
Эти цифры иллюстрируют тип рабочего процесса, для которого AVO создан: внести изменение, запустить аппаратно-ориентированный тест, интерпретировать результат и решить, что пробовать дальше. Они не доказывают, что система даст те же выгоды на других ядрах, конфигурациях оборудования или в производственных кодовых базах. Сообщённые сравнения являются вендорскими бенчмарками, а публикация не даёт достаточно деталей в предоставленных материалах, чтобы независимо оценить полную методологию тестирования.
У результата ARC-AGI-3 есть похожая оговорка. Идеальный результат в публичном наборе — сильный сигнал внутри этого бенчмарка, но сам по себе он не доказывает универсальную надёжность в корпоративных средах. Реальные внедрения включают затраты, права доступа, сбои инструментов, конфиденциальные данные, неоднозначные цели и требования к аудиту, которые публичный бенчмарк может не учитывать.
Для продуктовых команд непосредственный вывод архитектурный. Повышение возможностей базовой модели может улучшить отдельные ответы, но длительные рабочие процессы также требуют управления состоянием, контролируемого доступа к инструментам, обратной связи от выполнения, чекпоинтов и логики восстановления.
Это важно для ассистентов программирования, исследовательских систем, инструментов анализа данных и других ИИ-агентов, которые не могут добиться успеха с помощью одного ответа модели. Агент, оптимизирующий код, должен сохранять историю тестов и различать реальное улучшение и шумный результат. Корпоративному рабочему процессу нужны похожие механизмы, чтобы предотвращать повторяющиеся действия, сдерживать сбои и объяснять, почему система выбрала тот или иной путь.
Дизайн AVO также показывает компромисс при внедрении. Постоянные эксперименты могут улучшить результаты, но они расходуют вычислительные ресурсы и могут увеличивать задержку. Семидневный автономный оптимизационный запуск подходит для некоторых инженерных поисков, но не для каждой задачи, ориентированной на клиента. Разработчикам понадобятся политики, определяющие, когда агент может продолжать самостоятельно, когда должен запрашивать одобрение и какой бюджет он может расходовать.
Архитектура также может усилить конкуренцию между поставщиками моделей и инфраструктурными провайдерами. Если производительность агентов всё больше зависит от harness вокруг модели, одних лишь бенчмарков моделей становится недостаточно для прогнозирования продуктовой производительности. Компании могут конкурировать не только обучением моделей, но и системами памяти, оценщиками, надзором, оркестрацией инструментов и средами выполнения.
Первый сигнал, за которым стоит наблюдать, — независимое воспроизведение результата ARC-AGI-3, включая точную модель, промпты, инструменты, бюджет действий и конфигурацию надзора. Эти детали покажут, какая часть прироста связана с общей архитектурой AVO, а какая — со специфической для задачи инженерией.
Второй — доказательства вне демонстраций, контролируемых NVIDIA. Полезные данные включали бы результаты на дополнительных интерактивных бенчмарках, частоту сбоев при длинных запусках, вычислительные ресурсы, затрачиваемые на одну завершённую задачу, и сравнения с другими agent harness.
Для корпоративных покупателей важнее будет доказательство внедрения, чем одна оценка в бенчмарке. Следите за информацией о контроле разрешений, журналах аудита, изоляции в sandbox, восстановлении после ошибок инструментов, изоляции данных и частоте, с которой требуется вмешательство человека.
Наконец, работа с GPU-ядрами даёт практическую проверку того, может ли автономная оптимизация приносить повторяемые улучшения на разных нагрузках и оборудовании. Результаты за пределами заявленных конфигураций сделали бы инженерное утверждение более устойчивым.
Объявление NVIDIA лучше понимать как отчёт об архитектуре агента, а не как доказательство того, что одна модель внезапно стала универсально способной. Заявленный результат ARC-AGI-3 примечателен тем, что AVO объединяет память, надзор, инструменты и обратную связь в систему, предназначенную продолжать работу после неудачи первого ответа.
Для разработчиков ИИ главный вывод в том, что надёжность на длинной дистанции может зависеть от окружающего контура управления не меньше, чем от самой модели. NVIDIA представила интересный вендорский бенчмарк; следующий вопрос — смогут ли независимые команды воспроизвести результат экономично, безопасно и на задачах, которые важны вне бенчмарка.
NVIDIA заявляет, что её агент AVO получил идеальный результат в ARC-AGI-3, подчёркивая, как память, надзор и инструменты могут расширять возможности модели.