
Anthropic의 Claude Opus 5가 ARC-AGI-3에서 지금까지 보고된 최고 자리를 차지했다. ARC-AGI-3는 학습 데이터의 패턴을 회상하는 것이 아니라, AI 시스템이 낯선 대화형 문제를 얼마나 잘 다루는지를 시험하기 위해 만들어진 벤치마크다. The Decoder가 ARC Prize 결과를 인용해 보도한 바에 따르면, Claude Opus 5는 ARC-AGI-3에서 30.2%를 기록했으며, 이는 OpenAI의 GPT-5.6 Sol (Max)가 보고한 이전 최고치 7.8%를 크게 웃도는 수치다.
이 격차는 단순한 순위표 논란을 넘어서는 의미가 있다. AI 빌더와 기업 팀에게 ARC-AGI-3는 프런티어 모델이 새로운 환경에서 계획, 적응, 다단계 문제 해결 능력을 더 잘 갖춰가고 있는지를 보여주는 대리 지표로 주목받고 있다. 만약 이 결과가 좁은 최적화가 아니라 더 넓은 역량 향상을 반영한다면, Anthropic이 AI 에이전트, 코딩 시스템, 워크플로 도구에 필요한 추론 능력, 즉 손으로 만든 보조 장치 없이 실수에서 복구하는 능력을 개선하고 있다는 뜻이 된다.
이 보고된 결과는 ARC-AGI 벤치마크 계열을 개발하고 유지하는 ARC Prize 팀에서 나온 것이다. 새로운 ARC-AGI-3 벤치마크는 게임 같은 상호작용형 테스트로 설계되어 있다. 모델은 숨겨진 규칙을 추론하고, 행동을 선택하고, 이를 단계별로 실행해야 한다. 그래서 암기한 형식이나 피상적인 패턴 매칭에 보상을 주기 쉬운 많은 정적 벤치마크와 다르다.
The Decoder의 보도에 따르면, Claude Opus 5는 이전에 풀리지 않았던 ARC-AGI-3 환경 5개를 해결했다. 그중 4개는 인간 수준 이상으로 해결된 것으로 전해졌다. ARC Prize는 또한 공개 데모 환경 25개 중 6개가 지금까지 총 해결되었으며, 공개 결과, 리플레이, 코드가 제공되고 있다고 밝혔다.
기사에서는 Claude Opus 5가 Anthropic의 자체 “Fable-class” 모델도 능가했다고 전한다. ARC Prize는 이 모델들을 ARC-AGI-3에서 약 20% 수준으로 보고 있다고 알려졌다. 이는 이번 도약이 GPT-5.6 Sol뿐 아니라 Anthropic의 최근 모델 라인업 내부에서도 주목할 만하다는 뜻이다.
벤치마크 계열의 이전 버전에서는 향상이 덜 극적으로 보인다. The Decoder에 따르면, Claude Opus 5는 ARC-AGI-2에서 90.4%, ARC-AGI-1에서 97.5%를 기록했으며, ARC Prize의 분석 기준으로는 약간 더 높은 비용을 치르고도 이전 최고 점수와 맞먹었다. 다시 말해, 헤드라인급 개선은 가장 최신이자 아마도 가장 어려운 버전에 집중되어 있다.
이 결과의 가장 강한 해석은 Anthropic이 아니라 ARC Prize 연구진에게서 나온다. The Decoder가 인용·요약한 바에 따르면, 벤치마크 팀은 이번 선두를 더 강한 논리적 추론 덕분이라고 보고 있으며, 이는 낯선 환경에서 더 자율적인 탐색, 계획, 실행을 가능하게 한다.
가장 눈에 띄는 부분은 수치보다 정성적이다. 테스트 중 Claude Opus 5는 과제를 대수 표기법으로 번역하고, 스스로 “reflection equations”를 만들었다고 한다. ARC Prize 연구진은 같은 상황에서 다른 모델이 이런 행동을 보인 적이 없다고 말했다. 이 설명이 더 넓은 검증을 견딘다면, 모델이 단지 더 많은 행동을 시도하는 것이 아니라 문제를 더 명시적인 내부 표현으로 구축하고 있다는 뜻이 된다.
이는 Claude Opus 5 같은 시스템의 핵심 약속이 단순히 더 나은 채팅 품질이 아니기 때문이다. 새 환경을 살펴보고, 규칙을 발견하고, 실패한 전략을 수정한 뒤 계속 진행할 수 있는 모델이라는 가능성이다. 이것이야말로 소프트웨어 개발, 데이터 작업, 리서치 보조, 백오피스 자동화에서 신뢰할 수 있는 AI 에이전트에 필요한 특성이다.
다만 이 벤치마크 자체는 결과 해석에 영향을 주는 철학을 갖고 있다. ARC Prize는 언어 모델의 순수한 능력과 외부 하네스로 강화된 성능을 구분한다. 일부 시스템은 추가 오케스트레이션 소프트웨어가 있으면 이런 작업을 더 잘할 수 있지만, 공식 ARC-AGI 점수는 모델 자체의 성능을 강조한다. The Decoder는 ARC Prize가 향후 AGI 유사 시스템은 진정으로 새로운 과제에서 외부 도움 없이 동작해야 한다고 주장한다고 전했다.
이번 결과는 인상적이지만, 프런티어 모델이 전반적으로 더 똑똑해지고 있는지, 아니면 특정 테스트에 더 잘 맞춰지고 있는지를 둘러싼 오랜 질문을 해결하지는 못한다.
The Decoder는 Anthropic이 이 향상의 원인을 공개적으로 설명하지 않았다고 보도했다. 가능한 메커니즘으로는 표적화된 데이터 라벨링, 강화학습, 그리고 Claude Opus 5가 ARC-AGI-3 이후에 개발되었고 그 형식이 공개되었다는 점이 제시된다. 이 타이밍은 중요하다. 벤치마크 형식이 알려지면, 모델 개발자들은 실제 보류된 과제 자체를 학습하지 않더라도 그 벤치마크가 보상하는 추상화, 상호작용 루프, 퍼즐 구조에 맞춰 학습할 수 있다.
그렇다고 결과가 무효가 되는 것은 아니지만, 여기서 결론내릴 수 있는 범위는 좁아진다. ARC-AGI-3에서의 더 나은 성능은 탐색과 규칙 추론 능력의 실제 향상을 반영할 수 있다. 동시에, 이제 보이는 특정 유형의 과제에 대한 집중적인 최적화일 수도 있다. 이 두 설명은 서로 배타적이지 않다.
이 긴장은 The Decoder가 인용한 두 번째 테스트에서 더 분명해진다. 연구자 Guanghan Ning의 비공개 인터랙티브 퍼즐 게임 벤치마크인 Witness다. Witness에서 Claude Opus 5는 43.4점을 기록해 Kimi K3와 Fable 5와 통계적으로 동률을 이뤘다고 한다. 여기서 Opus 4.8 대비 개선폭은 ARC-AGI-3보다 훨씬 작았고, 적어도 한 게임에서는 Opus 5가 더 낯선 메커니즘 때문에 Opus 4.8보다 뒤처졌다고 전해진다.
Ning은 The Decoder에 이 패턴이 장르 특화 데이터로 학습한 결과일 수 있다고 말했으며, 이후에는 Claude Opus 5가 Witness에도 일반화하긴 했지만 ARC-AGI-3만큼 강하지는 않았다고 덧붙였다. The Decoder가 ARC-AGI-3의 배후 연구자 중 한 명으로 소개한 Greg Kamradt는 약한 단일 결과가 더 넓은 개선을 상쇄하지는 못하며, Witness의 설계가 ARC-AGI-3 스타일 퍼즐과 겹치는 부분은 진정한 전이의 증거일 수 있다고 주장했다.
현재로서는 Claude Opus 5가 לפחות 하나의 중요한 인터랙티브 추론 벤치마크에서 상당히 강해졌다는 점은 분명해 보이지만, 그 향상이 서로 무관한 과제 전반으로 얼마나 넓게 퍼지는지는 아직 열린 질문이다.
이 사안의 증거 기반은 헤드라인이 암시하는 것보다 좁다. 전체 흐름은 ARC Prize의 벤치마크 결과를 다룬 The Decoder의 보도에 의존한다. 제공된 근거에는 모델 변경, 학습 방식, 평가 조건을 설명하는 Anthropic의 직접적인 기술 포스트가 없다.
보도상 비교적 확실해 보이는 사실은 몇 가지다. Claude Opus 5가 ARC-AGI-3에서 30.2%를 기록했다는 점, GPT-5.6 Sol (Max)의 이전 최고 보고치는 7.8%였다는 점, 그리고 ARC Prize가 공개 결과, 리플레이, 벤치마킹 코드를 공개했다는 점이다. 이는 The Decoder가 전한 벤치마크 보고 사실이다.
다른 중요한 포인트들은 확정된 원인이 아니라 해석이다. 이번 선두가 “진짜 더 나은 추론”을 반영한다는 생각은 ARC Prize의 판단이다. 표적화된 데이터 라벨링이나 강화학습이 향상을 설명한다는 주장은 가능한 원인에 대한 The Decoder의 분석이지, Anthropic의 확인된 공개는 아니다. 마찬가지로 공개 벤치마크 형식이 과제 특화 최적화를 유도할 수 있다는 우려는 타당한 방법론적 주의사항이지만, 과적합이나 오염의 증거는 아니다.
구매자와 빌더는 벤치마크 승리가 실제 배포 성능으로 곧바로 이어지지 않는다는 점도 기억해야 한다. 어떤 모델은 ARC-AGI-3에서 선두를 차지하더라도, 운영 환경에서 중요한 지연 시간, 비용, 도구 사용, 제어 가능성, 통합 제약에서는 떨어질 수 있다. The Decoder는 Claude Opus 5가 ARC-AGI-1과 ARC-AGI-2에서 과거 최고와 맞먹는 성과를 냈지만 비용은 다소 더 높았다고 지적하는데, 이는 능력과 효율이 항상 함께 개선되는 것은 아니라는 점을 보여준다.
AI 에이전트를 만드는 팀에게 Claude Opus 5의 결과는 낯선 워크플로에서의 자율적 복구 능력을 보여주는 신호로 가장 중요하다. 모델이 숨겨진 규칙을 더 잘 추론하고 전략을 진행 중에 조정할 수 있다면, 코딩 보조 제품, 브라우저 자동화, 데이터 추출, 깨지기 쉬운 인터페이스를 다뤄야 하는 기업용 AI 시스템의 성능이 개선될 수 있다.
Anthropic과 OpenAI를 비교하는 제품팀에게는 GPT-5.6 Sol과의 직접적인 벤치마크 격차가 모델 선택에 대한 질문을 더 날카롭게 만든다. 하지만 올바른 교훈은 단일 점수만 보고 공급업체를 바꾸는 것이 아니다. 팀은 긴 호흡의 작업, 모호한 지시, 도구 오류, 새로운 엣지 케이스 등 자신들의 실패 양상에 대해 Claude Opus 5, GPT-5.6 Sol, 그리고 Kimi K3 같은 대안들을 테스트해야 한다.
기업용 AI 구매자에게도 하네스 논쟁은 중요하다. 많은 상용 배포는 오케스트레이션 계층, 검색, 외부 메모리, 도구 래퍼에 의존한다. ARC-AGI-3가 원시 모델 능력에 초점을 맞추는 것은 모델 자체를 분리해 볼 수 있다는 점에서 유용하지만, 실제 운영 시스템은 그런 방식으로 작동하는 경우가 드물다. 높은 원시 점수는 시스템 설계를 쉽게 만들 수는 있어도, 안전장치, 모니터링, 워크플로 특화 평가의 필요성을 없애지는 못한다.
또 다른 전략적 의미는 경쟁 구도다. Anthropic이 단순한 대화 품질이 아니라 인터랙티브 추론에서도 반복적으로 성과를 보여준다면, 코딩, 에이전트형 워크플로, 높은 신뢰가 필요한 기업 업무에서 회사의 입지가 강화된다. 절대 점수가 아직 완벽과 거리가 있어도, 바로 그런 지점에서 벤치마크 리더십은 플랫폼 의사결정에 영향을 줄 수 있다.
다음으로 주목할 신호는 독립적인 재현이다. 연구자들은 공개 리플레이와 코드가 Claude Opus 5가 규칙을 실질적으로 다른 방식으로 발견하고 있다는 주장, 즉 단순히 더 나은 탐색 단계를 밟는 것이 아니라는 점을 뒷받침하는지 확인하고 싶어할 것이다.
둘째, 더 넓은 전이를 살펴봐야 한다. Witness와 다른 비공개 혹은 계속 갱신되는 벤치마크의 결과는 ARC-AGI-3 한 번 더 돌린 것보다 더 중요할 것이다. Claude Opus 5가 서로 다른 메커니즘의 과제에서도 비슷한 향상을 보인다면, 실제 추론 개선이라는 주장은 더 강해진다.
셋째, Anthropic의 추가 공개를 주시해야 한다. 학습 변경, 강화학습 설정, 데이터 큐레이션에 대한 기술적 세부사항이 있다면, 이번 도약이 일반 능력 향상에서 비롯된 것인지, 벤치마크 중심 준비에서 비롯된 것인지 시장이 판단하는 데 도움이 될 것이다.
마지막으로 경쟁사의 반응도 봐야 한다. 프런티어 랩들이 알려진 벤치마크 형식에 더 빠르게 적응함에 따라, OpenAI, ARC Prize, 그리고 독립 평가자들은 더 어렵고 역동적인 테스트를 공개해야 한다는 압박을 더 크게 받을 가능성이 높다.
Claude Opus 5의 ARC-AGI-3 점수가 중요한 이유는 업계가 명확하게 측정하기 어려워했던 능력 범주, 즉 낯선 인터랙티브 문제에 대한 적응에서 진전이 있음을 보여주기 때문이다. 이는 포화된 텍스트 벤치마크보다 실제 제품에 더 관련이 크다. 하지만 이 결과는 “진짜 지능”이 해결되었다는 판정이 아니라, 강한 데이터 포인트로 읽어야 한다.
더 깊은 교훈은 평가에 관한 것이다. ARC-AGI 같은 벤치마크가 중요한 목표가 될수록, 프런티어 랩들은 이를 최적화하게 된다. 그렇기 때문에 투명한 보고, 새로운 테스트 설계, 벤치마크 간 교차 검증이 필수적이다. 창업자와 기업 팀에게 실무적으로 필요한 행동은 단순하다. Claude Opus 5를 에이전트형 작업에 새롭게 신뢰할 만한 모델로 보되, 벤치마크의 도약을 실제 운영의 진실로 받아들이기 전에 자신의 환경에서 검증하라는 것이다.
Anthropic의 Claude Opus 5가 ARC-AGI-3에서 새로운 최고 점수를 기록하며, 실제 추론 능력 향상인지 벤치마크 대응인지에 대한 질문이 다시 불거졌다.