Meta의 Muse Spark 1.3, 가격 공세로 경쟁사와의 성능 격차를 좁히다

Meta의 Muse Spark 1.3은 에이전트형 작업과 코딩 점수를 개선했지만, 아직 완성되지 않은 최전선 과제보다 낮은 작업당 비용이 더 중요할 수 있다.

AI News

Meta가 Muse Spark 1.3을 출시하며, 빠르게 확장 중인 시리즈의 최신 모델을 Anthropic과 OpenAI의 제품에 더 가까운 경쟁자로 포지셔닝했다. 이 모델의 가장 큰 향상은 에이전트형 작업, 코딩, 전문 업무 벤치마크에서 나타나며, 가장 강력한 버전이 널리 제공되지 않더라도 낮은 가격은 개발자들이 이 모델을 고려할 이유가 된다.

이번 출시는 두 개의 성능 티어로 나뉜다. The Decoder가 Artificial Analysis를 인용해 보도한 바에 따르면, xhigh 버전은 Muse Code와 Meta Model API를 통해 이용할 수 있고, 더 강력한 max 버전은 추가 안전성 테스트가 끝날 때까지 제한된 파트너 프리뷰 상태로 남아 있다. Meta는 또한 오픈 웨이트 버전이 나올 것이라고 밝혔지만, 현재 제시된 증거에는 출시일, 라이선스 조건, 또는 프리뷰 모델과 동일한지 여부는 명시돼 있지 않다.

이 가용성의 격차가 핵심이다. Meta의 최고 벤치마크 결과는 max에서 나오지만, 현재 대부분의 개발자는 xhigh만 이용할 수 있다. 따라서 이 모델의 경쟁력은 시험 점수뿐 아니라 고객이 어떤 티어를 배포할 수 있는지, max 버전의 가격이 얼마인지, 그리고 안전성 평가가 접근성을 넓히는지에 달려 있다.

빠르게 움직이는 모델 시리즈, 1.3 버전에 도달하다

Muse Spark 1.3은 5개월 만에 나온 시리즈의 네 번째 모델이다. The Decoder에 따르면 이 시리즈는 4월에 시작됐고, 7월에 1.1, 8월에 1.2가 뒤따랐다. 이 짧은 출시 주기는 주요 모델 제공업체들이 추론, 도구 사용, 소프트웨어 개발 성능을 얼마나 빠르게 개선하고 있는지를 보여준다.

보도에 따르면 Meta는 표준 토큰 가격을 입력 100만 토큰당 1.25달러, 출력 100만 토큰당 4.25달러로 그대로 유지했다. 그러나 The Decoder가 인용한 비교에 따르면, 이 모델은 Muse Spark 1.2보다 사용 비용이 더 비싸다. 1.2 버전은 작업당 0.40달러였고, 1.3 버전은 같은 지수 기반 추정에서 작업당 0.55달러다.

이 수치는 이번 출시의 가장 분명한 상업적 차별점이다. Artificial Analysis는 Intelligence Index에서 59점 이상을 받은 어떤 모델도 Muse Spark 1.3보다 저렴하지 않았다고 밝혔다. 보도에 따르면 이 성능대의 경쟁 모델들은 작업당 0.94달러에서 1.23달러 사이였다.

이 비교를 보편적인 운영 비용으로 받아들여서는 안 된다. 작업당 경제성은 프롬프트 길이, 출력 길이, 도구 호출, 재시도, 컨텍스트 윈도, 애플리케이션 아키텍처에 따라 달라진다. 그럼에도 불구하고, 고용량 코딩 에이전트나 워크플로 자동화를 운영하는 팀에게는 추론 비용이 기반 소프트웨어 비용을 빠르게 넘어설 수 있으므로 가격 격차가 의미 있을 수 있다.

에이전트형 벤치마크에서 가장 큰 개선

Artificial Analysis는 Muse Spark 1.3에 대해 Intelligence Index에서 max 62점, xhigh 61점을 부여했으며, 이는 1.2 버전의 57점과 1.1 버전의 53점에서 상승한 것이다. 이 상승의 일부는 지수의 가중치로 설명된다. GDPval-AA v2가 점수의 20%, Terminal-Bench 2.1이 16%, τ³-Bench Banking이 14%를 차지한다.

이 영역들이야말로 Meta의 최신 모델이 가장 크게 개선된 부분이기도 하다. 모의 은행 환경에서 에이전트가 도구를 사용할 수 있는 능력을 측정하는 τ³-Bench Banking에서 max는 52%를 기록해 비교 결과 중 가장 높은 수치를 보였다. 이용 가능한 xhigh 티어는 47%로, Claude Fable 5.1의 max 구성과 GLM-5.3-Flash와 동률이었고 이를 앞서지는 못했다.

이 모델은 터미널을 통한 코딩을 평가하는 Terminal-Bench 2.1에서도 개선됐다. xhigh는 1.2 버전의 80%에서 85%로 상승했고, max는 86%에 도달했다. 인용된 Artificial Analysis 결과에 따르면 Claude Fable 5.1은 max 91.4%, xhigh 91.0%, high 89.9%로 여전히 앞섰다.

220개의 전문 업무를 다루고 인간 전문가 기준 점수 1,000을 사용하는 GDPval-AA v2에서는 Muse Spark 1.3이 xhigh 1,615에서 1,709로, max는 1,754로 상승했다. Claude Fable 5.1 max는 1,853점을 기록했다. 또한 보도는 max가 xhigh보다 62% 더 많은 추론 토큰을 사용했다고 지적했는데, 이는 그 우위의 일부가 전반적인 능력 향상이라기보다 추가 추론 연산에서 비롯됐음을 시사한다.

증거는 유망하지만, 깔끔한 최전선 승리는 아니다

현재의 증거는 Muse Spark 1.3이 Anthropic과 OpenAI를 따라잡거나 대등하다는 Meta의 주장보다 더 신중한 결론을 뒷받침한다. 여러 테스트에서 상당한 진전이 보이지만, 보고된 평가 전반에서 이 모델이 일관되게 선두를 차지하는 것은 아니다.

전문가 수준의 과학 벤치마크인 GPQA Diamond에서 Muse Spark는 90%에서 94%로 상승했다. 이는 상위 그룹에 가까운 위치였지만, Gemini 3.8 Flash high의 95.3%와 Grok 4.6 high의 94.9%에는 못 미쳤다. 연구 물리학 테스트인 CritPt에서는 18%에서 26%로 개선됐지만, GPT-5.6 Sol max는 32.3%, Claude Fable 5.1 xhigh는 31.1%였다.

보고된 두 가지 지표는 하락했다. AA-LCR은 83%에서 79%로 떨어졌고, AA-Omniscience의 사실 정확성도 최대 3포인트 감소했다. The Decoder는 이러한 하락이 모델이 불확실할 때 더 자주 거절했기 때문이라고 설명했다. 기업 배포에서는 이 트레이드오프가 중요하다. 근거 없는 답변을 피하는 모델은 일부 위험을 줄일 수 있지만, 과도한 거절은 유용한 에스컬레이션이나 명확화가 필요한 워크플로를 방해할 수도 있다.

이는 Artificial Analysis가 보고한 독립적인 벤치마크 결과이지, 실제 세계에서의 우월성을 증명하는 것은 아니다. Muse Spark 1.3이 선도적인 Anthropic과 OpenAI 모델과 경쟁한다는 더 큰 주장은 Meta에서 나온 것이며, Yahoo Finance Canada, Digital Trends, SiliconANGLE, VentureBeat의 보도에서도 언급됐다. VentureBeat의 헤드라인은 가장 강한 결과가 아직 개발자들이 널리 사용할 수 없는 모델에 의존한다고도 강조했다. 여기 제시된 증거 범위에서 Meta와 Artificial Analysis는 max 티어의 가격을 공개하지 않았다.

이번 출시가 빌더와 구매자에게 의미하는 것

AI 제품 팀에게 Muse Spark 1.3은 모든 지식·추론 테스트에서의 절대적 선두보다는 도구 사용과 비용 통제가 더 중요한 영역에서 가장 관련성이 커 보인다. 코딩 어시스턴트, 터미널 기반 에이전트, 구조화된 비즈니스 워크플로는 Terminal-Bench와 τ³-Bench Banking에서 보고된 개선의 혜택을 받을 수 있으며, 특히 xhigh가 Meta의 API에서 제시된 토큰 요금으로 제공된다면 더욱 그렇다.

실무 평가 부담은 여전히 크다. 팀은 단순한 종합 벤치마크 점수만이 아니라 과제 완수, 도구 오류 복구, 거절 행동, 지연 시간, 소비된 추론 토큰 수를 테스트해야 한다. max와 xhigh 사이의 62% 연산 차이는, 제공업체가 별도 가격을 공개하기 전에도 더 강력한 티어가 단위 경제성을 바꿀 수 있음을 상기시킨다.

예정된 오픈 웨이트 출시는, 특히 개인 배포나 데이터 및 추론 인프라에 대한 더 엄격한 통제가 필요한 조직에 대해 이 모델의 영향력을 넓힐 수 있다. 그러나 시점, 가중치, 라이선스, 하드웨어 요구 사항, 호스팅 모델과의 동등성에 대한 세부 정보가 없으므로, 구매자는 이를 현재의 배포 경로가 아니라 미래의 가능성으로 봐야 한다.

경쟁사에게 가격은 전략적으로 중요하다. Meta는 아직 논란의 여지 없는 리더십을 보여주고 있지는 않지만, 많은 에이전트형 워크로드에 충분히 잘 작동하는 모델의 비용을 낮추고 있을 수 있다. 이는 제공업체들이 벤치마크 기록뿐 아니라 추론 경제성에서도 경쟁하도록 압박할 수 있다.

앞으로 주목할 점

첫 번째 신호는 안전성 테스트 이후 Meta가 Muse Spark 1.3 max를 파트너 프리뷰에서 일반 공개로 전환하는지 여부다. 최종 API 가격은 보고된 작업당 0.55달러의 이점이 현재 비교 밖에서도 유지되는지를 결정할 것이다.

개발자들은 또한 오픈 웨이트 발표에서 라이선스와 모델 동등성에 주목해야 한다. 실제 생산 작업에서의 독립 평가는 Intelligence Index 자체보다 더 중요할 것이며, 특히 사실 신뢰성, 도구 사용 후 복구, 거절률에서 그렇다.

마지막으로, 다음 버전은 Meta가 신뢰성을 희생하지 않고 이 빠른 출시 속도를 유지할 수 있는지 보여줄 것이다. AA-LCR과 AA-Omniscience에서 보고된 하락은 또 하나의 단일 헤드라인 벤치마크보다 그 균형을 더 중요한 지표로 만든다.

Creati.ai 관점

Muse Spark 1.3은 최전선 모델 시장을 확실히 장악한 사례라기보다, 강력한 가성비 도전으로 이해하는 것이 가장 적절하다. Meta는 에이전트형 및 코딩 평가에서 의미 있게 개선했지만, 최고 구성은 여전히 제한돼 있고 가격은 알려지지 않았으며, 여러 선도 모델이 중요한 테스트에서 여전히 앞서 있다.

그럼에도 빌더에게는 이번 출시가 중요할 수 있다. xhigh가 Meta가 제시한 요금으로 안정적인 도구 사용을 제공한다면, 비용에 민감한 팀은 더 비싼 모델의 신뢰할 만한 대안을 가질 수 있다. 결정적인 증거는 접근 가능한 max 배포, 독립적인 생산 테스트, 그리고 약속된 오픈 웨이트 출시에서 나올 것이며, Meta의 포지셔닝만으로는 충분하지 않다.

광고