
The Decoder가 인용한 벤치마크 보도에 따르면 Anthropic의 Claude Opus 5가 널리 주목받는 제3자 모델 순위 한 곳에서 정상에 올랐다. 그리고 평가된 여러 작업 부하에서는 Claude Fable 5보다 낮은 보고 비용으로 이를 달성한 것으로 보인다. 이 결과가 중요한 이유는 현재의 최전선 모델 경쟁이 더 이상 단순한 벤치마크 승리만의 문제가 아니기 때문이다. 구매자와 개발자들은 이제 각 작업의 비용, 결과를 얻기 위해 필요한 추론 수준, 그리고 더 강하게 밀어붙였을 때 모델이 얼마나 안정적으로 유지되는지를 점점 더 중요하게 본다.
가장 눈에 띄는 수치는 Artificial Analysis에서 나왔다. Claude Opus 5에 Intelligence Index 점수 61을 부여해 Claude Fable 5의 60, GPT-5.6 Sol의 59를 근소하게 앞섰다. 겉으로 보면 매우 근소한 차이로, 큰 격차는 아니다. 하지만 The Decoder의 보도는 더 중요한 변화가 경제성이라고 시사한다. 평균 Intelligence Index 작업에서 Claude Opus 5는 $2.03으로, fallback이 포함된 Claude Fable 5의 $2.75보다 낮다고 보고되었으며, 더 높은 추론 설정에서는 Anthropic의 이전 Claude Opus 4.8과 Sonnet 5보다도 우수한 성과를 보였다.
The Decoder가 전한 최신 테스트에 따르면 Claude Opus 5는 분석 품질, 오피스형 지식 작업, 코딩 중심 작업에서 특히 강하다. Artificial Analysis는 Intelligence Index가 지식 작업, 코딩, 과학적 추론, 사실 정확성을 포괄하는 9개 테스트를 결합한 것이라고 밝혔다. 이 종합 지표에서 Claude Opus 5는 1위를 차지했지만, Claude Fable 5보다 단 1점 앞섰을 뿐이다.
이처럼 작은 격차는 중요한 맥락이다. 최상위 모델들이 명확한 능력 차이로 갈라져 있는 것이 아니라, 서로 매우 촘촘하게 몰려 있음을 보여준다. 같은 출처는 Kimi K3를 57, Claude Opus 4.8을 56으로 두고 있으며, GPT-5.6 Sol도 여러 개별 벤치마크에서 여전히 매우 경쟁력이 높다. 기업 구매자에게 이는 단일 리더보드보다, 자신들의 정확한 워크플로에서 더 싸고, 더 빠르거나, 더 믿을 만한 모델인지가 선택의 핵심이 될 수 있음을 뜻한다.
보도에서 가장 강한 비용 논리는 토큰 가격만이 아니라 작업 단위의 경제성이다. The Decoder는 평균 Intelligence Index 작업 비용이 Claude Opus 5에서 Claude Fable 5보다 낮다고 전했으며, AA-Briefcase 벤치마크에서는 더 높은 성능의 Claude Opus 5 추론 티어가 Claude Fable 5를 이기면서도 훨씬 적은 비용이 든다고 밝혔다. 이 수치들이 실제 배포에서도 유지된다면 Anthropic은 유용한 서사를 얻게 된다. 즉, 모든 워크플로에서 최상위급 지출 없이도 최상급 성능을 제공한다는 것이다.
벤치마크 그림은 혼재되어 있지만, 전체적으로는 Anthropic에 유리하다. 코딩 분야에서 The Decoder는 Claude Opus 5를 “xhigh” 설정으로 Claude Code와 함께 사용했을 때 Artificial Analysis Coding Index에서 공동 1위를 차지했다고 전한다. 터미널 환경에서의 자율 소프트웨어 엔지니어링을 겨냥한 Terminal-Bench 2.1에서는 Claude Opus 5가 “max”에서 89%를 기록해 GPT-5.6 Sol과 같았다.
과학적 추론에서는 이 모델이 Humanity’s Last Exam에서 53%를 기록해 Claude Fable 5와 동률이었다고 한다. The Decoder가 언급한 Argonne National Laboratory와 UIUC의 물리 벤치마크 CritPt에서도 Claude Opus 5는 다시 Claude Fable 5와 같았지만, GPT-5.6 Sol, GPT-5.5 Pro, GPT-5.6 Terra에는 뒤졌다.
실용적인 오피스 자동화에 특히 중요한 결과 중 하나는 AA-Briefcase에서 나왔다. 이 벤치마크는 큰 입력 집합을 바탕으로 한 연구 보고서, 프레젠테이션, 스프레드시트 분석 같은 작업에 초점을 맞춘다. 최대 추론에서 Claude Opus 5는 Elo 1720에 도달해 Claude Fable 5의 1574를 크게 앞섰다고 보고됐다. The Decoder에 따르면 이 벤치마크의 상위 3개 자리는 모두 Claude Opus 5 추론 티어가 차지했고, 상위 10위권의 다수도 Anthropic 모델이 차지했다.
문서가 많은 코파일럿이나 내부 분석 도구를 만드는 제품 팀에게는 이런 결과가 추상적인 추론 대결보다 더 중요하다. 여러 파일을 다루는 오피스 업무와 유사한 벤치마크는 수학만, 코딩만 하는 평가보다 기업 사용 사례에 더 직접적으로 대응하는 경우가 많다.
같은 보도는 큰 한계도 지적한다. Artificial Analysis에 따르면 Claude Opus 5는 불확실할 때도 더 자주 답하며, hallucination rate는 50%까지 상승한다. The Decoder는 이것이 Claude Opus 4.8보다 14포인트 높다고 전했는데, 새 모델이 지식 주장 정확성을 측정하는 AA-Omniscience에서는 개선됐음에도 그렇다.
이 트레이드오프가 이 이야기의 핵심 경고다. 모델은 광범위한 능력 테스트에서 더 강하게 보이면서도, 자신만만하지만 근거 없는 답을 더 잘 내놓는다면 고위험 워크플로에서는 오히려 더 위험해질 수 있다. 법률 검토, 의료 지원, 금융, 컴플라이언스 민감 업무에 AI를 배포하는 팀에게는 작업당 비용이 낮아져도, 사람 검토가 더 많이 필요해지면 전체 시스템 비용이 자동으로 줄어들지 않는다.
여기서도 벤치마크 선두는 오해를 부를 수 있다. 종합 지표는 총체적 역량을 보상하지만, 실제 운영 시스템은 생생한 분석 출력보다 신뢰성, 감사 가능성, 또는 거부 행동에서 실패하는 경우가 많다. Claude Opus 5가 정말로 조심스럽게 유보하거나 응답을 삼가야 할 때도 답변하는 경향이 더 강하다면, 사실 정확성이 추론의 폭보다 중요한 영역에서는 사용이 제한될 수 있다.
The Decoder 보도에서 또 하나 주목할 점은, 더 많은 추론이 항상 더 나은 실사용 성능을 뜻하지는 않는다는 것이다. 매체가 인용한 Vals.ai는 Vibe Code Bench에서 Claude Opus 5를 추론 티어별로 테스트했다. 점수는 low에서 high로 개선됐지만, 비용이 훨씬 더 높음에도 “xhigh”와 “max”에서는 오히려 떨어졌다.
같은 패턴이 Terminal-Bench 2.1에서도 나타났는데, 보고에 따르면 “high” 티어가 “max”보다 더 좋았다. 최대 설정에서는 모델이 한 번의 시도에 더 많은 시간을 써서 벤치마크의 시간 제한 내에서 가능한 시도 횟수가 줄었기 때문이다. 이는 The Decoder에 따르면 Anthropic의 자체 제품 가이드와도 일치하는데, API와 Claude Code 모두에서 “high”가 기본 티어라고 한다.
구매자에게 이는 모델 선택이 이제 조달 문제인 동시에 라우팅 문제라는 점을 상기시킨다. 팀은 하나의 범용 설정을 원하지 않을 수 있다. 일상 작업에는 더 저렴한 기본값, 코딩과 분석에는 “high”, 지연 시간을 감수할 수 있고 워크플로가 실제로 이득을 볼 때만 “max”로 올리는 방식을 원할 수 있다.
보고된 토큰 가격은 명확하다. 입력 100만 토큰당 $5, 출력 100만 토큰당 $25이며, 캐시 쓰기와 캐시 적중에는 추가 가격이 붙는다. 하지만 토큰 가격만으로는 작업 단위 결과를 알 수 없다. 특히 공급업체가 하나의 모델 가족 안에 여러 추론 모드를 제공할수록 더욱 그렇다.
이 이야기의 근거는 주로 Artificial Analysis, Epoch AI, Vals.ai 같은 제3자 평가자들의 벤치마크 보고서를 The Decoder가 취합한 것이다. 이는 순수한 벤더 발표보다 더 독립적이지만, 관측된 결과와 확정된 사실은 구분해야 한다.
첫째, The Decoder에 따르면 Artificial Analysis는 공개 출시 전에 Anthropic과 함께 Claude Opus 5를 테스트했다. 이것이 결과를 무효로 하지는 않지만, 모델이 언제 어떻게 평가되었는지를 이해하는 데 중요한 맥락이다. 둘째, 선두권 비교는 매우 접전이다. Claude Opus 5는 Artificial Analysis Intelligence Index에서 Claude Fable 5를 1점 앞서지만, Epoch AI는 전체 Epoch Capability Index에서 Claude Opus 5를 159 대 161로 Claude Fable 5보다 약간 뒤에 둔다고 보도된다. 소프트웨어 엔지니어링만 보면 Epoch AI는 둘을 161로 동률로 본다.
셋째, 비용 주장 중 상당수는 벤치마크별로 다르다. Claude Fable 5에 대한 보고된 우위는 벤치마크, 추론 티어, fallback 시스템 사용 여부에 따라 달라진다. 이를 Claude Opus 5가 항상 생산 환경에서 더 싸다는 식으로 일반화해서는 안 된다. 실제 비용은 프롬프트 크기, 도구 사용, 재시도, 지연 시간 제한, 그리고 사람이 얼마나 자주 실수를 고쳐야 하는지에 달려 있다.
그럼에도 증거는 한 방향을 가리킨다. Anthropic은 자사 상위 라인업의 가격 대비 성능 균형을 개선한 것으로 보인다. 다만 가까운 경쟁자와의 차이는 여전히 작고, 신뢰성 우려는 아직 해결되지 않았다.
AI 빌더에게 Claude Opus 5의 이야기는 극적인 지능 도약이라기보다 운영 튜닝에 가깝다. 이 모델이 코딩과 오피스 작업에서 Claude Fable 5 수준 또는 그 이상을 더 낮은 실질 작업 비용으로 제공할 수 있다면, 개발자들은 에이전트형 워크플로, 다단계 분석, 더 큰 컨텍스트 중심 작업을 이전 최상위 티어의 완전한 프리미엄 없이 실험할 여지를 더 많이 얻는다.
기업 AI 구매자에게는 교훈이 더 미묘하다. 벤치마크는 Claude Opus 5가 AI 에이전트, 코딩 어시스턴트 사용 사례, 문서·스프레드시트·보고서 생성이 포함된 기업 워크로드에 강하다는 점을 시사한다. 그러나 보고된 50%의 hallucination rate는 거버넌스 팀에 신중함을 요구한다. 많은 배포에서는 Claude Opus 5를 요약과 생성에 사용하고, 더 엄격한 검색·검증·인간 승인 계층을 결합하는 구성이 최선일 수 있다.
더 넓은 시장 의미는 경쟁 압박이다. Anthropic이 Claude Fable 5 같은 근접 경쟁자를 주요 작업 부하에서 밑지면서도 미세한 품질 우위를 유지할 수 있다면, 경쟁사들은 신뢰성, 지연 시간, 또는 패키징 중 하나로 응답해야 한다. 이는 특히 GPT-5.6 Sol과 GPT-5.6 Terra 같은 OpenAI 모델에 해당하며, 이들은 일부 전문 테스트에서 여전히 선두이거나 근접한 위치를 유지하고 있다.
앞으로 볼 신호는 새로운 리더보드 업데이트만이 아니다. 첫째, 독립 평가자들이 AA-Briefcase와 Intelligence Index를 넘어 더 실제적인 기업 작업에서도 Claude Opus 5의 비용 우위를 재현하는지 지켜봐야 한다. 둘째, Anthropic이 모델 업데이트, 시스템 프롬프트, 제품 기본값을 통해 hallucination 트레이드오프를 해결하는지 보아야 한다.
셋째, 추론 티어 간 라우팅 패턴을 주시할 필요가 있다. 실용적인 코딩 벤치마크에서 “high”가 더 비싼 설정보다 계속 뛰어난 성과를 낸다면, 최전선 모델 예산 편성 방식이 바뀔 수 있다. 마지막으로 GPT-5.6 Sol, GPT-5.6 Terra, Kimi K3의 경쟁 반응도 주목해야 한다. 특히 소프트웨어 엔지니어링과 사실성 벤치마크에서는 상위권 경쟁이 여전히 매우 촘촘하기 때문이다.
이번 전개에서 가장 중요한 것은 Claude Opus 5가 종합 순위에서 Claude Fable 5보다 1점 앞선다는 사실이 아니다. 최전선 모델 경쟁이 점점 원시적 역량이 아니라 비용을 반영한 워크플로 성능으로 결정되고 있다는 점이다. 이는 시장에 더 건강한 시각이다. 실제로 제품이 어떻게 구매되고 배포되는지를 더 잘 반영하기 때문이다.
하지만 이 이야기는 리더보드 승리를 배포 준비 완료로 착각해서는 안 된다는 점도 보여준다. Claude Opus 5는 Claude Code, 문서 중심 자동화, 고급 분석에 매력적으로 보인다. 그러나 보고된 hallucination 행동은 심각한 제약이다. 대부분의 팀에게 실질적인 질문은 Claude Opus 5가 “가장 좋은 모델”인지가 아니라, 적절한 안전장치가 갖춰진 명확히 정의된 작업에 가장 적합한 모델인지다.
Anthropic의 Claude Opus 5가 Fable 5보다 낮다고 보고된 작업 비용으로 제3자 AI 순위 정상에 올라, 최전선 모델의 가격 대비 성능 압박을 강화하고 있다.