AI News

NVIDIA는 자사의 Agentic Variation Operators 시스템, 즉 NVIDIA AVO가 ARC-AGI-3의 공개 세트에서 만점을 획득해 25개의 인터랙티브 환경에 걸친 183개 레벨을 모두 완료했다고 밝혔다. 이 결과가 중요한 이유는, 장기적인 에이전트 성능을 단순히 기반 언어 모델의 능력으로 보기보다 시스템 문제로 규정하기 때문이다.

이 주장은 AVO를 지속적인 자율 작업을 위한 범용 아키텍처라고 설명한 NVIDIA Developer Blog 게시물에서 나왔다. 회사는 같은 시스템이 7일간의 실행 동안 GPU 커널도 최적화했다고 밝히며, 이 설계가 소프트웨어 엔지니어링 워크플로와 낯선 인터랙티브 추론 작업 사이를 넘나들 수 있음을 시사한다. 다만 성능 수치는 NVIDIA가 보고한 것이며, 이용 가능한 증거에는 독립 검증이나 동료 검토 평가가 포함되어 있지 않다.

더 넓은 에이전트 시스템에서 나온 ARC-AGI-3 만점 결과

NVIDIA는 AVO가 ARC-AGI-3 공개 세트에서 100.00 RHAE 점수를 기록했다고 보고했다. 회사는 이 에이전트가 벤치마크의 25개 환경에서 모든 레벨을 완료했으며, 회사 게시물에서 언급된 비교 시스템인 VISTA보다 환경 액션을 12% 적게 사용했다고 밝혔다.

ARC-AGI-3는 에이전트가 행동이 어떻게 작동하는지 추론하고 무엇을 달성해야 하는지 찾아내야 하는 낯선 인터랙티브 환경을 중심으로 설계되었다. 전통적인 질의응답 테스트와 달리, 이 벤치마크는 에이전트가 피드백으로부터 학습하면서 여러 단계에 걸쳐 진전을 유지할 것을 요구한다.

NVIDIA의 핵심 주장은 이런 평가가 단순한 모델 지능 이상을 측정한다는 것이다. 에이전트는 무엇을 관찰할지, 어떤 도구를 사용할지, 유용한 상태를 어떻게 보존할지, 그리고 접근이 실패했을 때 어떻게 복구할지를 결정해야 한다. 회사의 설명에 따르면, 주변 하네스가 모델의 능력을 얼마나 효과적으로 지속적인 자율 행동으로 바꾸는지를 좌우한다.

또한 게시물은 Claude Opus 5를 기반으로 한 시스템이 완전한 AVO 아키텍처에 포함되었을 때 30% 모델 베이스라인에서 보고된 100% 결과로 성능을 끌어올렸다고 말한다. NVIDIA는 이 비교를 시스템 설계가 벤치마크 결과를 실질적으로 바꿀 수 있다는 증거로 제시한다. 그러나 평가 설정에 대한 더 많은 세부 정보 없이는 Claude Opus 5나 AVO 어느 쪽도 독립적인 순위로 읽어서는 안 된다.

Agentic Variation Operators의 작동 방식

AVO는 코드를 검사하고 편집하며, 명령을 실행하고, 문서를 참고하고, 실행을 통해 변경 사항을 검증할 수 있는 코딩 및 작업 실행 시스템으로 설명된다. NVIDIA에 따르면, 그 핵심 특징은 단일 도구가 아니라 긴 실험 연속을 통해 작업을 계속할 수 있는 능력이다.

특히 두 가지 메커니즘이 강조된다. 지속 메모리와 감독이다. 지속 메모리는 이전 구현, 테스트 결과, 컴파일러 및 프로파일러 출력, 축적된 추론을 저장한다. 이를 통해 에이전트는 각 컨텍스트 윈도우마다 이해를 다시 구축하는 대신 현재 상태에서 재개할 수 있다.

감독 구성 요소는 더 넓은 궤적을 관찰한다. 주 에이전트가 막히거나 비생산적인 순환을 반복하면 감독자는 다른 전략으로 방향을 돌릴 수 있다. 주 에이전트는 무엇을 검사하고, 수정하고, 테스트하고, 커밋할지 선택할 책임을 유지하며, 감독자는 더 긴 실행 전반의 진행 상황을 모니터링한다.

ARC-AGI-3에 대해 NVIDIA는 같은 기반 에이전트를 다른 인터페이스에 연결해 사용 가능한 환경 도구와 평가 과정을 바꾸되 핵심 아키텍처는 유지했다고 밝혔다. 이러한 이식성이 AI 제작자에게 더 중요한 주장이다. 즉, 전체 에이전트를 처음부터 다시 설계하지 않고도 새로운 피드백 루프에 적응하도록 의도된 시스템이라는 뜻이다.

GPU 커널 최적화에서 얻은 증거와 그 한계

NVIDIA는 먼저 GPU 커널 최적화 실험을 통해 AVO를 설명한다. 회사에 따르면, 이 작업에서 시스템은 7일 동안 500개 이상의 최적화 방향을 자율적으로 탐색하고 40개의 커널 버전을 커밋했다.

NVIDIA DGX B200 시스템에서, NVIDIA는 평가한 구성들에서 결과적으로 나온 멀티헤드 어텐션 커널이 cuDNN보다 최대 3.5% 더 좋았고 FlashAttention-4보다 최대 10.5% 더 좋은 성능을 보였다고 보고한다. 회사는 또한 AVO가 진화한 커널을 그룹 쿼리 어텐션에 맞추는 데 자율 작업 약 30분을 추가로 들였다고 밝혔다.

이 수치는 AVO가 처리하도록 만들어진 워크플로 유형을 보여준다. 즉, 변경을 가하고, 하드웨어 기반 테스트를 실행하고, 결과를 해석하고, 다음에 무엇을 시도할지 결정하는 흐름이다. 그러나 다른 커널, 하드웨어 구성, 또는 프로덕션 코드베이스에서도 같은 성과를 낼 것임을 입증하지는 않는다. 보고된 비교는 벤더 벤치마크이며, 제공된 증거만으로는 전체 테스트 방법론을 독립적으로 평가하기에 충분한 세부 정보가 없다.

ARC-AGI-3 결과에도 비슷한 단서가 붙는다. 공개 세트에서의 만점은 이 벤치마크 안에서는 강한 신호지만, 그것만으로 기업 환경에서의 범용 신뢰성을 증명하지는 못한다. 실제 배포에는 비용, 권한, 도구 실패, 민감한 데이터, 모호한 목표, 감사 가능성에 대한 요구 등이 들어가며, 공개 벤치마크가 이를 포착하지 못할 수 있다.

이 결과가 빌더와 기업에 의미하는 것

제품 팀에게 즉각적인 교훈은 아키텍처에 있다. 기반 모델의 능력을 높이면 개별 응답은 개선될 수 있지만, 장기 실행 워크플로에는 상태 관리, 제어된 도구 접근, 실행 피드백, 체크포인트, 복구 로직도 필요하다.

이는 한 번의 모델 응답만으로는 성공할 수 없는 코딩 보조 도구, 연구 시스템, 데이터 분석 도구, 기타 AI 에이전트에 중요하다. 코드를 최적화하는 에이전트는 테스트 이력을 보존하고 실제 개선과 노이즈가 섞인 결과를 구분해야 한다. 기업 워크플로 역시 반복 행동을 막고, 실패를 통제하며, 시스템이 왜 특정 경로를 택했는지 설명하기 위해 유사한 제어가 필요하다.

AVO의 설계는 배포상의 트레이드오프도 보여준다. 지속적인 실험은 결과를 개선할 수 있지만, 연산 자원을 소모하고 지연 시간을 늘릴 수 있다. 7일간의 자율 최적화 실행은 일부 엔지니어링 탐색에는 적합하지만 모든 고객 대상 작업에 적합한 것은 아니다. 빌더는 에이전트가 독립적으로 계속해도 되는 경우, 승인을 받아야 하는 경우, 그리고 얼마만큼의 예산을 사용할 수 있는지에 대한 정책이 필요할 것이다.

이 아키텍처는 모델 벤더와 인프라 제공자 간 경쟁도 더 날카롭게 만들 수 있다. 에이전트 성능이 점점 모델 주변의 하네스에 의존한다면, 모델 벤치마크만으로는 제품 성능을 덜 예측하게 된다. 기업들은 모델 학습만큼이나 메모리 시스템, 평가자, 감독자, 도구 오케스트레이션, 실행 환경으로도 경쟁하게 될 수 있다.

다음에 주목할 점

가장 먼저 볼 신호는 ARC-AGI-3 결과의 독립 재현이다. 여기에는 정확한 모델, 프롬프트, 도구, 액션 예산, 감독 구성까지 포함된다. 이런 세부 정보가 AVO의 일반 아키텍처에서 나온 향상인지, 과제 특화 엔지니어링에서 나온 향상인지 결정한다.

두 번째는 NVIDIA가 통제하지 않는 데모 밖의 증거다. 유용한 후속 데이터에는 추가 인터랙티브 벤치마크 성능, 장기 실행 실패율, 완료된 작업당 소모된 연산량, 다른 에이전트 하네스와의 비교가 포함된다.

기업 구매자에게는 단일 벤치마크 점수보다 배포 증거가 더 중요하다. 권한 제어, 감사 로그, 샌드박싱, 도구 오류 복구, 데이터 분리, 그리고 사람의 개입이 얼마나 자주 필요한지에 대한 정보를 주의 깊게 봐야 한다.

마지막으로 GPU 커널 작업은 자율 최적화가 서로 다른 워크로드와 하드웨어 전반에서 반복 가능한 성과를 낼 수 있는지에 대한 실용적 시험을 제공한다. 보고된 구성 외의 결과가 나오면 엔지니어링 주장은 더 견고해질 것이다.

Creati.ai 관점

NVIDIA의 발표는 한 모델이 갑자기 보편적으로 유능해졌다는 증거라기보다, 에이전트 아키텍처에 대한 보고로 이해하는 것이 가장 좋다. 보고된 ARC-AGI-3 점수가 주목할 만한 이유는 AVO가 메모리, 감독, 도구, 피드백을 첫 번째 응답이 실패한 뒤에도 계속 작동하도록 설계된 시스템에 결합했기 때문이다.

AI 빌더에게 남는 교훈은 장기 신뢰성이 모델 자체만큼이나 주변 제어 루프에 의존할 수 있다는 점이다. NVIDIA는 흥미로운 벤더 벤치마크를 제시했다. 다음 질문은 독립적인 팀이 그 결과를 경제적으로, 안전하게, 그리고 벤치마크 밖에서 중요한 작업들에 걸쳐 재현할 수 있는지다.

추천

NVIDIA, AVO 에이전트가 ARC-AGI-3에서 만점을 받았다고 발표

NVIDIA는 자사의 AVO 에이전트가 ARC-AGI-3에서 만점을 받았다고 밝히며, 메모리·감독·도구가 모델 성능을 어떻게 확장할 수 있는지 강조했다.