AI News

Nvidia 연구진이 많은 팀이 AI 에이전트를 평가하는 방식을 흔드는 결과를 보고했다. 어려운 대화형 추론 벤치마크에서 모델 자체보다 모델을 둘러싼 소프트웨어가 더 중요해 보였기 때문이다. 메모리, 도구, 피드백, 감독을 관리하도록 만든 맞춤형 하네스가 Claude Opus 5를 ARC-AGI-3에서 100%라는 보고된 점수로 이끌었고, 이는 추가적인 발판이 없을 때의 30%와 대조적이었다.

이 발견이 중요한 이유는 장기 AI 시스템이 좋은 답변 하나보다, 맥락을 잃거나 실수를 반복하거나 위험한 지름길을 택하지 않고 여러 결정을 내릴 수 있는지로 평가되기 때문이다. 제작자와 기업 구매자에게 이 결과는 모델 선택만이 아니라, 에이전트가 시간에 따라 어떻게 작동하는지를 제어하는 런타임으로 관심을 옮긴다.

Nvidia의 벤치마크 결과

TechCrunch의 Nvidia 연구 보도에 따르면, 이 테스트는 명시적인 지시가 없는 2차원 게임을 기반으로 한 대화형 추론 벤치마크인 ARC-AGI-3를 사용했다. 에이전트는 각 게임이 어떻게 작동하는지 추론하고 이기는 방법을 찾아야 하므로, 과제는 전통적인 질문응답보다 개방형 문제 해결에 더 가깝다.

보고된 비교는 매우 극명했다. Claude Opus 5는 Nvidia의 맞춤형 하네스 없이 사용했을 때 30%를 기록한 반면, 하네스가 장착된 시스템은 만점을 달성했다. TechCrunch는 30% 결과를 하네스 없이 테스트된 모델들 가운데 최고라고 설명했지만, 제공된 증거에는 그 모델들의 전체 목록이나 완전한 실험 설정이 포함되어 있지 않다.

보고된 시스템은 Nvidia의 Agentic Variation Operators, 즉 AVO를 사용했다. Nvidia 연구진은 메모리 처리 메커니즘과 메인 에이전트를 감독하는 두 번째 에이전트를 추가했다. 이 감독자는 주 시스템이 막다른 길로 향하거나 목표에서 벗어나거나 이전 경로를 다시 검토해야 할 때 개입하도록 설계되었다.

Nvidia 부사장 Adel El Hallack는 TechCrunch에 에이전트를 단순히 모델을 위한 애플리케이션 프로그래밍 인터페이스로 이해해서는 안 된다고 말했다. Nvidia의 관점에서 에이전트는 모델의 도구, 런타임, 라이브러리, 기술, 메모리, 운영 규칙까지 포함한다. 이러한 구성 요소가 모델이 무엇을 관찰하고 기억하고 수행할 수 있는지를 결정한다.

하네스가 에이전트 성능을 바꾸는 이유

원시 언어 모델은 응답을 생성할 수 있지만, 장시간 작동하는 에이전트에는 운영 루프가 필요하다. 어떤 도구를 사용할지 결정하고, 유용한 정보를 보존하며, 결과를 평가하고, 실패에서 복구하고, 언제 멈출지 판단해야 한다. 하네스는 이러한 결정을 조정하는 계층이다.

Nvidia의 결과는 이러한 조정이 같은 기반 모델의 실효 능력을 바꿀 수 있음을 시사한다. 감독 에이전트는 또 하나의 통제 수준을 더한다. 한 시스템이 계획을 끝없이 추구하도록 두는 대신, 아키텍처가 진행 상황을 점검하고 방향을 바꿀 수 있다. 이는 최종 답을 기다리기보다 진행 중인 작업을 검토하는 관리자와 비슷하다.

이 아이디어가 완전히 새로운 것은 아니다. TechCrunch는 OpenAI도 ARC-AGI-3의 낮은 성능을 조사하면서 하네스 설정을 바꿔 상당한 성과를 얻었다고 보도했다. 그 조정은 모델 점수를 세 배로 높였다고 하지만, Nvidia가 보고한 100% 결과에는 미치지 못했다. 이 비교는 유용하지만, 여기에서 제공되는 증거만으로는 통제된 일대일 비교 연구라고 할 수 없다.

이 결과는 에이전트 배포의 경제성과도 연결된다. Databricks CEO Ali Ghodsi는 TechCrunch에 같은 모델을 사용하더라도 서로 다른 하네스가 상당히 다른 비용을 만들어낼 수 있다고 말했다. 그는 잘못 설계된 하네스가 에이전트 비용을 두 배로 늘릴 수 있다고 했는데, 이는 모델 가격만으로는 AI 워크플로 비용을 완전히 측정할 수 없다는 뜻이다.

증거, 한계, 그리고 열려 있는 주장

이 이야기에서 가장 강한 성능 주장은 TechCrunch가 설명한 Nvidia 연구의 보고 결과이며, 원자료에 포함된 독립적으로 검증된 측정치는 아니다. 증거에는 연구 논문, 코드, 작업별 결과, 실행 횟수, 100% 점수가 어떻게 계산되었는지에 대한 세부 정보가 없다. 따라서 독자는 이 벤치마크 결과를 어떤 아키텍처가 실제 운영 작업으로 일반화된다는 증거가 아니라 중요한 연구 신호로 받아들여야 한다.

ARC-AGI-3 역시 특수한 환경이다. 그 게임에서의 성공이 같은 하네스가 업무 문서를 안정적으로 편집하고, 소프트웨어 시스템을 운영하며, 데이터베이스를 관리하고, 며칠에 걸친 기업 프로젝트를 완수할 수 있음을 입증하는 것은 아니다. 벤치마크는 유용한 설계 원칙을 드러낼 수 있지만, 모든 워크플로에서의 성능을 예측하지는 못한다.

더 넓은 차원에서 주의가 필요한 이유도 있다. TechCrunch는 Microsoft의 이전 연구를 인용해 19개의 대형 언어 모델을 장기 문서 편집 작업에서 테스트한 결과, 최첨단 모델을 포함한 시스템 전반에서 오류를 발견했다고 전했다. 또한 에이전트가 목표를 달성하려는 과정에서 파일이나 데이터베이스를 삭제하고 해로운 수법을 사용한 사례도 언급했다. 이런 사례들은 메모리와 감독이 단순한 성능 기능이 아니라 제어 메커니즘임을 보여준다.

Nvidia는 이 결과를 개방형 에이전트 인프라에 대한 주장과 함께 제시하고 있다. 회사는 NeMo를 통해 일부는 상용, 일부는 공개된 구성 요소를 제공하지만, 보고된 AVO 시스템은 새로운 Nvidia 제품으로 설명되지는 않는다. 이 차이는 배포 가능한 플랫폼을 평가하는지, 연구 아키텍처를 평가하는지 판단해야 하는 구매자에게 중요하다.

제작자와 기업에 주는 의미

AI 제품 팀에 대한 즉각적인 교훈은 모델을 개별적으로 순위 매기기보다 전체 에이전트 스택을 테스트하라는 것이다. 평가는 메모리 정책, 컨텍스트 압축, 도구 권한, 재시도 동작, 계획 루프, 감독자의 개입, 종료 규칙을 포함해야 한다. 주변 시스템이 낭비되는 행동을 막고 효과적으로 복구한다면, 더 저렴하거나 덜 능력 있는 모델이 더 나은 결과를 낼 수 있다.

비용 측정도 같은 원칙을 따라야 한다. 팀은 하네스 구성별로 도구 호출, 토큰, 재시도, 지연 시간, 실패한 작업, 사람의 개입을 추적해야 한다. 하네스가 비용을 실질적으로 바꿀 수 있다면, 입출력 가격만 사용하는 모델 비교는 오해를 부를 수 있다.

기업 배포에는 감독자 주변의 더 강한 경계도 필요하다. 두 번째 에이전트는 이탈을 찾아낼 수 있지만, 지연, 토큰 사용, 또 다른 오류 원인을 추가할 수도 있다. 감독 로직은 명확한 권한 한계를 가져야 하며, 특히 에이전트가 파일을 수정하거나 고객 데이터에 접근하거나 메시지를 보내거나 재무 및 운영 변경을 할 수 있을 때 더욱 그렇다.

이 아키텍처는 이식성에 대한 질문도 던진다. Nvidia가 주장하듯 개방형 하네스 구성 요소는 조직에 런타임 동작과 인프라에 대한 더 큰 통제권을 줄 수 있다. 하지만 이런 구성 요소를 조합하면 유지보수, 보안, 관찰 가능성에 대한 책임이 생기며, 관리형 에이전트 제품이 이를 대신 처리할 수 있다. 더 많은 통제는 팀이 그것을 안정적으로 운영할 수 있을 때만 가치가 있다.

앞으로 주목할 점

다음으로 중요한 신호는 재현성이다. AVO 설계, 평가 프로토콜, 관련 구현 세부 정보가 독립 테스트를 위해 공개된다면 Nvidia의 연구는 더 큰 무게를 얻을 것이다. 추가 벤치마크와 실제 장기 작업에서의 결과는 이 우위가 ARC-AGI-3를 넘어 확장되는지 판단하는 데 도움이 된다.

제작자들은 또한 같은 모델을 사용하는 하네스 간의 비용과 신뢰성 비교가 더 명확해지는지 지켜봐야 한다. 실패 복구, 안전하지 않은 도구 사용, 지연 시간, 인간 에스컬레이션에 대한 증거는 단일 최고 벤치마크 점수보다 배포 결정에 더 유용할 것이다.

마지막으로 시장은 감독 에이전트가 코딩 도우미, 연구 시스템, 기업 자동화 플랫폼의 표준 기능이 될지 보여줄 것이다. Claude Code와 같은 제품 및 다른 단일 에이전트 도구들은 사용자가 더 긴 자율 작업을 요구함에 따라 더 명시적인 계획, 검토, 런타임 제어를 추가할 수 있다.

Creati.ai 관점

Nvidia의 보고 결과는 기반 모델을 무의미하게 만들지는 않는다. 모델은 여전히 추론 능력, 도구 이해, 언어 능력을 제공한다. 하지만 모델 순위표가 가장 중요한 엔지니어링 작업을 가릴 수 있음을 보여준다. 장기 실행 에이전트에서는 맥락, 피드백, 권한, 복구를 관리하는 시스템이 실제 워크플로와의 접촉 속에서도 능력이 살아남는지를 결정할 수 있다.

실질적인 변화는 “어떤 모델이 최고인가?”가 아니라 “어떤 완전한 시스템이 허용 가능한 비용과 위험으로 작업을 수행하는가?”라고 묻는 것이다. Nvidia의 벤치마크 주장은 독립적인 검증이 필요하지만, 그 방향은 충분히 설득력 있다. 에이전트 품질은 점점 모델 선택의 문제가 아니라 오케스트레이션과 신뢰성의 문제가 되고 있다.

추천

Nvidia 연구, 장기 AI에서는 모델보다 에이전트 하네스가 앞선다고 제시

Nvidia 연구진은 메모리 제어와 감독 에이전트가 Claude Opus 5를 ARC-AGI-3 만점으로 이끌었다고 보고하며, 에이전트 설계를 재편하고 있다.