샤오미의 MiMo-V2.6, 오픈 모델 순위 선두… 앤스로픽은 Claude 증류를 주장

샤오미의 MiMo-V2.6-Pro는 비용과 성능에서 오픈 모델 순위를 선도하는 반면, 앤스로픽은 Claude 데이터가 모델 학습에 사용됐다고 주장한다.

AI News

샤오미는 자사의 새 MiMo-V2.6-Pro가 현재 순위에서 가장 강력한 공개 AI 모델이 되었으며, 보고된 Intelligence Index 점수 46과 이례적으로 낮은 추론 비용을 결합했다고 말한다. 이번 출시는 샤오미를 커지는 오픈 모델 경쟁의 중심에 놓지만, 동시에 중국 기업이 Claude가 생성한 대화를 활용해 자사 모델을 개선했다는 Anthropic의 주장 속에서 나오기도 했다.

모델의 보고된 성능에는 입력 토큰 100만 개당 0.435달러, 출력 토큰 100만 개당 0.87달러라는 가격이 붙어 있다. The Decoder가 인용한 분석에 따르면, 이는 단일 벤치마크 작업 기준 약 0.13달러에 해당하며, 코딩, 에이전트, 기타 대규모 워크로드용으로 성능 좋은 모델을 평가하는 개발자에게 중요한 수치다.

MiMo-V2.6, 오픈 모델 비용 최전선을 겨냥하다

더 큰 MiMo-V2.6-Pro는 총 1.02조 개의 파라미터를 가진 mixture-of-experts 모델로 설명되지만, 개별 요청에서는 약 420억 개만 활성화된다. 샤오미는 더 효율적인 선택지를 제공하기 위한 소형 모델 MiMo-V2.6-Flash와, 표준 버전보다 최대 20배 빠른 출력이 가능하다고 회사가 밝힌 Pro-UltraSpeed 변형도 공개하고 있다.

The Decoder는 MiMo-V2.6-Pro가 공개 시스템 비교에서 Kimi K3와 Qwen을 앞섰다고 Artificial Analysis를 인용해 보도했다. 별도의 Unite.AI 헤드라인도 오픈 웨이트 모델들 가운데 점수 46을 해당 모델의 선두 결과로 지목했으며, The Next Web은 이용 가능한 원문 자료에서 추가 기술 세부 정보 없이 그 순위 이정표를 보도했다.

이 결과가 중요한 이유는 샤오미가 MiMo-V2.6를 단순한 연구용 공개로만 포지셔닝하지 않기 때문이다. 저렴한 토큰 가격은 코딩 도우미, 검색 시스템, 워크플로 자동화, AI 에이전트처럼 모델 호출이 빈번한 제품의 경제성을 바꿀 수 있다. 또한 이 모델의 mixture-of-experts 설계는 샤오미가 모든 파라미터를 매 요청마다 활성화하는 데 드는 완전한 계산 비용을 치르지 않고도 큰 역량을 내세울 수 있게 할 수 있다.

강화학습이 보고된 성능 향상을 이끌었다

샤오미는 개선의 원인을 대폭 확장된 강화학습 단계에 돌린다. 회사는 학습의 각 단계에서 처리하는 데이터 양을 늘리고, 작업 환경의 범위를 넓혔으며, 모델 출력을 평가하는 데 더 많은 컴퓨팅 자원을 투입했다고 말한다.

The Decoder가 보도한 수치에 따르면, 강화학습 실행은 6일도 걸리지 않았고 MiMo-V2.6-Pro에는 약 262만 달러, MiMo-V2.6-Flash에는 85만 달러가 들었다. DeepSWE 코딩 평가에서 샤오미는 Pro가 58.4에서 72.6으로 개선되었고, Flash는 48.8에서 65.7로 상승했다고 밝혔다.

회사는 학습을 안정적으로 유지하기 위한 조치도 설명했다. 샤오미는 모델의 내부 분포 메커니즘을 고정하고, 모델이 의도된 과제를 실제로 완수하지 않으면서 평가 신호만 극대화하는 reward hacking에 대한 보호 장치를 추가했다.

샤오미가 공개하는 것은 모델 가중치만이 아니다. 패키지에는 기술 보고서, 강화학습 프레임워크, 추가 학습용 소형 모델, 그리고 자동 채점기가 포함된 약 7,000개의 과제가 들어 있다. 과제는 소프트웨어 개발, 사이버 보안, 사무 작업, 웹 디자인을 아우르며, 약 1,000개의 추가 과제는 음악 작곡에 초점을 맞춘다.

보고된 과제 출처는 혼합되어 있다. 일부 코딩 예시는 직원의 GitHub pull request와 사용자 질의에서 나왔고, 다른 설명은 언어 모델이 생성했다. 사이버 보안 과제는 실제 소프트웨어 취약점 모음인 OSS-Fuzz를 기반으로 하며, 사무 환경은 합성적으로 재구성되었다. 빌더 입장에서는 학습 프레임워크와 채점기에 대한 접근이 모델 자체에 대한 접근만큼 중요할 수 있는데, 이는 샤오미의 접근법을 재현하거나 확장할 출발점을 제공하기 때문이다.

강한 벤치마크 주장과 심각한 데이터 사용 분쟁

헤드라인을 장식한 성능 및 비용 수치는 모델 전체 품질에 대한 독립적 판정이 아니라 보고된 주장으로 다뤄야 한다. 샤오미는 학습 비용, 강화학습, 개선 수치를 제공했고, Artificial Analysis는 The Decoder가 설명한 대로 인용된 Intelligence Index 비교를 제공했다. 이용 가능한 원문 자료는 순위의 완전한 방법론, 광범위한 독립 평가 집합, 모델의 안전성 및 신뢰성 행동에 대한 완전한 분석을 제공하지 않는다.

더 심각한 불확실성은 샤오미가 학습 데이터를 어떻게 구성했는지에 있다. Anthropic의 위협 인텔리전스 보고서는 2025년 12월부터 2026년 8월까지의 Claude 남용 사례를 다루며, 샤오미를 Claude에서 능력을 추출하려는 캠페인에 연루됐다고 주장된 7개의 중국 AI 연구소 중 하나로 지목했다. Anthropic은 이 행위를 불법적 증류(illegal distillation)라고 표현했다. 다른 지목된 회사는 Alibaba, Moonshot AI, DeepSeek, Zhipu, MiniMax, SenseTime이었다.

GTG-16008로 식별된 사례에서 Anthropic은 2026년 3월과 4월에 걸친 20일 동안 40만 건 이상의 상호작용을 관찰했다고 말했다. 보고서는 샤오미가 MiMo 모델의 대화와 코딩 세션을 OpenClaw와 OpenCode를 통해 Claude로 라우팅했으며, 이는 후속 모델을 위한 학습 데이터를 생성하려는 목적이었다고 주장했다.

이것들은 Anthropic의 주장일 뿐, 이 기사에 제공된 자료에서 독립적으로 입증된 사실은 아니다. The Decoder는 Anthropic이 내부 증류 과정에서 사용된 이전 teacher-model 데이터의 출처에 대해 제한된 문서만 제공했다고 보도했다. 샤오미가 강화학습 도구를 공개했다고 해서 개발 파이프라인의 다른 부분에서 사용된 데이터의 출처에 대한 의문이 저절로 해소되는 것은 아니다.

MiMo-V2.6이 빌더와 기업에 의미하는 것

보고된 가격과 순위가 독립 테스트에서도 유지된다면, MiMo-V2.6-Pro는 비슷한 코딩이나 추론 작업에 대해 훨씬 더 비싸게 청구하는 모델 공급업체에 압박을 가할 수 있다. 스타트업은 이 가격을 활용해 더 큰 평가 세트, 더 잦은 에이전트 루프, 또는 더 높은 처리량의 고객 워크플로를 운영할 수 있다. 기업 팀은 호스팅 API에 전적으로 의존하기보다, 오픈 공개성과 학습 툴킷을 시스템을 맞춤화할 기회로 볼 수 있다.

하지만 낮은 추론 비용이 자동으로 낮은 배포 위험을 뜻하는 것은 아니다. 구매자는 여전히 자신들의 업무에서 라이선스 조건, 데이터 거버넌스, 지연 시간, 가동 시간, 보안 동작, 문맥 처리, 출력 신뢰성을 직접 평가해야 한다. Claude 유래 데이터에 대한 주장들은 또 하나의 층을 더한다. MiMo-V2.6을 운영 환경에 도입하려는 기업은 민감한 워크플로에 통합하기 전에 학습 데이터 출처에 대한 명확한 문서와 법적 보장을 원할 수 있다.

연구자들에게도 샤오미의 공개는 오픈 모델 개발의 실질적 변화를 보여준다. 경쟁 우위는 사전학습 규모만이 아니라 강화학습 환경, 채점기, 과제 설계에서 점점 더 나오고 있다. 오픈 도구는 진전을 가속할 수 있지만, 그 가치는 과제가 유용한 행동을 측정하는지, 보상 체계가 지름길에 견디는지에 달려 있다.

앞으로 주목할 점

첫 번째 신호는 Intelligence Index 결과와 보고된 DeepSWE 향상을 독립적으로 재현할 수 있는지다. 개발자들은 단일 리더보드에 의존하기보다 동일한 프롬프트, 가격, 하드웨어, 지연 조건에서 MiMo-V2.6-Pro를 Kimi K3와 Qwen에 비교해야 한다.

두 번째 신호는 학습 데이터와 모델 개발 관행에 대한 샤오미의 문서화다. Anthropic의 주장은 추가 증거, 샤오미의 대응, 또는 오픈 모델 기업이 증류와 teacher-model 사용을 공개하는 방식의 변화를 이끌 수 있다.

마지막으로 시장은 샤오미의 툴킷이 자체 인프라 밖에서도 쓸 수 있는지 보여줄 것이다. 연구자와 제품 팀의 채택, 자동 채점기의 품질, 코딩, 사이버 보안, 사무 자동화, 에이전트 워크플로에서의 실제 성능은 MiMo-V2.6이 단순한 강력한 벤치마크 공개 이상인지 보여줄 것이다.

Creati.ai 시각

MiMo-V2.6가 주목받는 이유는 오픈 모델 시장을 형성하는 세 가지 압력, 즉 벤치마크 성능, 추론 경제성, 접근 가능한 강화학습 인프라를 연결하기 때문이다. 샤오미의 보고된 결과는 모델이 폐쇄형 시스템의 가장 높은 가격을 맞추지 않고도 오픈 순위 상위권에서 경쟁할 수 있음을 시사한다.

하지만 Claude 관련 주장은 출처 문제를 부차적 각주가 아닌 제품 서사의 일부로 만든다. 따라서 AI 빌더와 기업 구매자에게 실질적인 시험은 두 가지다. MiMo-V2.6가 실제 워크로드에서 신뢰할 만한 가치를 제공하는지, 그리고 샤오미가 조직이 무엇을 배포하고 있으며 어떻게 학습되었는지 이해할 수 있을 만큼의 투명성을 제공할 수 있는지다.

광고