Anthropic, 더 낮은 가격과 Fable급 성능을 내세운 Opus 5.5 출시

Anthropic은 더 낮은 토큰 가격, 더 빠른 출력, 그리고 Fable급 결과를 내세운 Opus 5.5를 출시하며 효율적인 엔터프라이즈 AI의 기준을 높였다.

AI News

Anthropic은 Claude Opus 5.5를 공개했다. 회사는 이 새 플래그십 모델이 더 강력한 Fable 5.1 시스템과 여러 작업에서 비슷하거나 더 나은 성과를 내면서도 운영 비용은 더 적게 든다고 설명한다. 이번 출시는 AI 구매자들이 성능과 추론 비용을 저울질하는 시점에, 개발자들에게 더 빠르고 더 저렴한 최상위 모델 접근성을 제공한다.

Opus 5.5는 Anthropic의 서비스와 주요 클라우드 플랫폼을 통해 즉시 이용할 수 있다. 회사는 또한 모델의 글쓰기 스타일을 개선해 전문 용어를 줄이고 중요한 정보를 답변 앞부분에 배치했다고 밝힌다. 이러한 변화는 이전 Claude 모델에서 반복적으로 제기된, 지나치게 틀에 박히거나 과도하게 장황한 출력에 대한 불만을 겨냥한다.

더 낮은 가격, 더 빠른 출력

Anthropic는 Opus 5.5의 가격을 입력 토큰 100만 개당 4달러, 출력 토큰 100만 개당 20달러로 책정했다. 이는 Opus 5의 5달러와 25달러에서 내려간 것이다. 회사는 캐시 읽기 비용도 60퍼센트 하락했다고 말한다. TechCrunch는 출력 가격을 100만 토큰당 25달러에서 20달러로 낮아진 것으로 보도했고, 새 모델이 서비스를 제공하는 데 더 적은 컴퓨팅 자원을 필요로 한다고 지적했다.

Anthropic은 토큰 사용량을 포함할 경우 총 운영 비용이 Opus 5보다 약 40퍼센트 낮아질 것으로 추정한다. 이 더 넓은 추정치는 모델이 더 적은 토큰을 사용할 수 있다는 주장과, 30퍼센트 이상 더 빠르게 출력한다는 점을 반영한다. 이 차이는 운영 팀에게 중요하다. 어려운 작업에서 모델이 훨씬 더 많은 토큰을 사용한다면, 표시 가격이 낮아져도 자동으로 청구서가 더 낮아지는 것은 아니다.

The Decoder가 Anthropic 발표를 전한 내용에 따르면, 구독자의 5시간 사용 한도는 20퍼센트 늘어난다. Anthropic은 더 높은 한도와 낮은 사용 비용의 조합이 실질적 처리 능력을 약 25퍼센트 확장할 것이라고 말한다.

이 모델은 모델 ID claude-opus-5-5로 Claude Platform에서 제공되며, Amazon Web Services, Google Cloud, Microsoft Azure를 통해서도 이용할 수 있다. 이러한 배포는 엔터프라이즈 팀이 기존의 클라우드, 규정 준수, 조달 시스템에 모델을 통합할 수 있는 선택지를 넓혀 준다.

성능 주장에는 맥락이 필요하다

Anthropic은 Opus 5.5를 자사 최고 성능 모델로 설명하며, 대부분의 작업에서 Claude Fable 5.1과 맞먹는다고 말한다. 또 다른 비교에서는 낮은 표시 가격에도 불구하고 여러 평가에서 OpenAI의 GPT-6 Astra보다 앞선다고 주장한다. 이는 공급업체가 제시한 주장으로, 일반적 우위를 독립적으로 입증한 것으로 받아들여서는 안 된다.

The Decoder는 Anthropic의 코딩 비교를 더 자세히 보도했다. FrontierCode에서 회사는 Opus 5.5가 작업당 비용의 약 20퍼센트 수준으로 GPT-6 Astra를 앞선다고 말한다. Terminal-Bench 4.0에서는 Astra 비용의 40퍼센트 수준에서 비슷한 성능을 주장하며, CursorBench에서는 비용의 3분의 1로 GPT-5.6 Sol보다 11점 앞선다고 보고한다.

이 모델의 벤치마크 위치에는 외부의 일부 지지도 있다. The Decoder가 인용한 독립 플랫폼 Artificial Analysis는 최대 노력 기준 Intelligence Index에서 Opus 5.5에 58점을 부여했는데, 이는 당시 해당 지표에서 기록된 최고 점수였다. 또한 Humanity’s Last Exam과 SciCode를 포함해 10개 평가 중 6개에서 선도적인 결과를 보였다고 보고했다.

그러나 같은 분석은 효율성의 트레이드오프도 지적했다. 최대 노력 시 Opus 5.5는 작업당 약 119,000개의 출력 토큰을 생성한 것으로 전해졌으며, 이는 Opus 5의 73,000개, Fable 5.1의 78,000개, GPT-6 Astra의 27,000개와 비교된다. 토큰 가격이 낮으면 일부 워크로드에서는 이런 사용량을 상쇄할 수 있지만, 모든 개별 작업에서 반드시 더 저렴한 것은 아니다.

커뮤니케이션과 안전성 변화

Anthropic은 Opus 5.5가 전문 용어를 덜 사용하고, 가장 중요한 정보부터 제시하며, 글쓰기 지시를 더 잘 따른다고 말한다. The Decoder가 소개한 초기 테스터들은 출력이 더 명확해졌다고 평가했지만, 이러한 인상은 제한적이며 실제 워크플로 전반에 대한 통제된 평가를 대체할 수는 없다.

이번 공개는 Anthropic의 최고 역량 모델에 적용되는 안전 통제도 확대한다. Opus 5.5는 사이버 보안, 생물학, 최첨단 AI 개발 분야에서 Fable 5.1에 준하는 안전장치를 받는다. Anthropic은 이러한 통제를 유발하는 요청이 다른 모델로 라우팅될 수 있다고 말한다. 표시된 사이버 보안 작업의 대부분은 Opus 4.8로 보내지며, 일부 생물학 및 최첨단 개발 요청은 Opus 5로 향한다고 한다.

검증된 조직은 Anthropic의 Life Sciences Verification Program을 통해 생물학 연구 접근을 신청할 수 있다. 회사는 Cyber Verification Program을 Opus 5.5로 확장할 계획이다. 이 모델에는 API 사용자가 추론을 추출하기 위해 이전 맥락을 편집하는 것을 제한하는 “Preserved Thinking”과, EU AI Act 준수를 지원하는 것으로 설명되는 워터마킹 조치도 포함된다.

Anthropic은 Opus 5.5가 출시 전 METR과 Frontier Design의 평가를 거쳤다고 말한다. 또한 강화학습 환경에 대한 더 엄격한 선별, 더 강력한 모니터링, 자동화된 안전 훈련 시나리오를 준비 중이다. 이러한 계획은 중요하지만, 진행 중인 작업을 설명할 뿐 모든 정렬 문제나 오용 위험이 해결되었다는 증거는 아니다.

이번 출시는 빌더들에게 무엇을 의미하나

소프트웨어 팀에게 핵심 기회는 단순히 더 높은 벤치마크 점수에 접근하는 데 있지 않다. 코딩과 지식 작업에서 강한 성능에 낮은 공개 가격을 결합한 모델은, 특히 코드 리뷰, 디버깅, 문서화, 리서치, 내부 분석에서 장시간 실행되는 AI 에이전트를 더 실용적으로 만들 수 있다.

비용은 에포트 설정, 프롬프트 설계, 컨텍스트 재사용, 출력 길이에 크게 좌우된다. Artificial Analysis 수치는 최대 노력의 Opus 5.5가 경쟁 시스템보다 훨씬 더 많은 토큰을 소비할 수 있음을 시사한다. 따라서 팀은 토큰 가격만 비교할 것이 아니라 완료된 워크플로당 비용을 테스트해야 한다.

엔터프라이즈 구매자에게는 Claude Platform, Amazon Web Services, Google Cloud, Microsoft Azure에서의 제공이 배포 마찰을 줄일 수 있다. 그러나 구매자는 여전히 지연 시간, 데이터 보존 옵션, 안전장치가 작동할 때의 라우팅 동작, 그리고 자체 문서와 도구에서의 모델 신뢰성을 검증해야 한다. Anthropic의 더 명확한 글쓰기 주장도 긴 세션에서는 중요할 수 있지만, 기존 모델과 비교해 측정해야지 당연한 것으로 받아들여서는 안 된다.

Anthropic의 출시는 프리미엄 모델 경쟁도 더욱 심화시킨다. 회사는 Opus 5.5를 Fable 5.1과 GPT-6 Astra에 맞서 포지셔닝하는 동시에, The Decoder가 훨씬 낮은 가격에 더 낮은 성능을 제공한다고 설명한 중국 모델을 포함한 저가 대안에도 대응하고 있다. 다음 경쟁 국면은 헤드라인을 장식하는 벤치마크 선두보다 성공한 작업당 비용과 배포 통제에 의해 더 좌우될 수 있다.

다음에 주목할 점

가장 먼저 볼 신호는 독립 평가가 코딩, 에이전트 작업, 비즈니스 업무에서 Anthropic이 보고한 향상을 재현하는지 여부다. 실제 고객 비용도 또 하나의 중요한 시험이 될 것이며, 특히 큰 출력을 생성하는 최대 노력 워크로드에서 더 그렇다.

Anthropic은 Sonnet 5.5와 Haiku 5.5도 향후 몇 주 안에 성능, 효율성, 안전성에서 비슷한 개선과 함께 출시될 것이라고 말한다. 이들의 가격과 기능은 Opus의 변화가 더 광범위한 제품군 재설계인지, 아니면 주로 플래그십 업그레이드인지 보여줄 것이다.

개발자들은 또한 Cyber Verification Program의 전개, 안전 통제 아래에서의 모델 라우팅 변화, 그리고 Anthropic의 모니터링 및 반-증류 조치에 대한 추가 세부사항을 지켜봐야 한다. 이러한 정책은 어떤 연구 및 보안 워크플로를 Opus 5.5에서 직접 실행할 수 있는지에 영향을 줄 수 있다.

Creati.ai 관점

Opus 5.5가 중요한 이유는 Anthropic이 효율성을 성능의 일부로 판매하고 있기 때문이다. 회사의 보고 결과는 프리미엄 AI 제품이 더 실용적인 지표, 즉 전체 워크플로를 완료하는 데 드는 비용과 신뢰성으로 이동하고 있음을 시사한다.

증거는 유망하지만, 여전히 Anthropic 자체 벤치마크와 테스트 선택에 크게 좌우된다. 빌더와 구매자에게 합리적인 대응은 표적화된 평가다. 즉, 대표 작업에서 성공적인 완료, 토큰 소비, 지연 시간, 안전 라우팅, 인간 수정 필요성을 측정한 뒤에야 주장된 운영 비용 40퍼센트 절감을 실제 운영 사실로 받아들여야 한다.

광고