XiaomiのMiMo-V2.6-Proはコストと性能でオープンモデルランキングをリードする一方、AnthropicはClaudeのデータがモデル学習に使われたと主張している。

Xiaomiは、新しいMiMo-V2.6-Proが現在のランキングで最も強力な公開AIモデルになったとし、報告上のIntelligence Indexスコア46と、異例に低い推論コストを組み合わせていると述べている。このリリースによりXiaomiは拡大するオープンモデル競争の中心に立つことになるが、同時に、同社がClaude生成のやり取りを使って自社モデルを改良したとするAnthropicの疑惑の中で登場した。
このモデルの報告性能に加えて、入力トークン100万件あたり0.435ドル、出力トークン100万件あたり0.87ドルという価格が示されている。The Decoderが引用した分析によれば、これは単一のベンチマークタスクあたり約0.13ドルに相当し、コーディング、エージェント、その他の大量処理ワークロード向けの高性能モデルを評価する開発者にとって重要な数字だ。
より大規模なMiMo-V2.6-Proは、総パラメータ数1.02兆のMixture-of-Expertsモデルと説明されているが、個々のリクエストで実際に有効になるのは約420億にすぎない。Xiaomiはまた、より効率的な選択肢として意図された小型モデルMiMo-V2.6-Flashと、標準版の最大20倍の速度で出力できると同社が述べるPro-UltraSpeed版も公開している。
The Decoderは、MiMo-V2.6-ProがArtificial Analysisによる公開システム比較でKimi K3やQwenを上回ったと報じた。別のUnite.AIの見出しでも、オープンウェイトモデルの中でスコア46をトップ結果として示していた。一方、The Next Webは、入手可能なソース資料に追加の技術的詳細を示さずに、このランキング上の節目を報じた。
これらの結果が重要なのは、XiaomiがMiMo-V2.6を単なる研究公開として位置づけていないからだ。低いトークン価格は、コーディングアシスタント、検索システム、ワークフロー自動化、AIエージェントなど、モデル呼び出しが頻繁な製品の経済性を変えうる。さらに、このモデルのMixture-of-Experts設計により、各リクエストで全パラメータを有効化する完全な計算コストを払わずに、大きな能力範囲をうたうことが可能になるかもしれない。
Xiaomiは、この改善を大幅に拡大した強化学習段階に起因するとしている。同社は、訓練の各ステップで処理するデータ量を増やし、タスク環境の範囲を広げ、モデル出力の採点により多くの計算資源を割り当てたという。
The Decoderが報じた数値によれば、強化学習の実行は6日未満で、MiMo-V2.6-Proには約262万ドル、MiMo-V2.6-Flashには85万ドルのコストがかかった。DeepSWEのコーディング評価では、XiaomiはProが58.4から72.6へ向上し、Flashが48.8から65.7へ上昇したと報告した。
同社は、学習の安定性を保つための措置についても説明している。Xiaomiはモデルの内部分布メカニズムを固定し、報酬ハッキング、つまり本来のタスクを真に完了せずに評価シグナルだけを最大化する行為に対する保護を追加した。
Xiaomiが公開するのはモデル重みだけではない。パッケージには技術報告書、強化学習フレームワーク、追加学習用の小型モデル、そして自動採点器付きの約7,000タスクが含まれる。タスクはソフトウェア開発、サイバーセキュリティ、事務作業、ウェブデザインをカバーし、さらに約1,000タスクが音楽作曲に焦点を当てている。
報告されているタスクの出典は混在している。コーディング例の一部は従業員のGitHubプルリクエストやユーザー問い合わせから来ており、別の説明は言語モデルによって生成された。サイバーセキュリティのタスクは実際のソフトウェア脆弱性の集積であるOSS-Fuzzを利用し、オフィス環境は合成的に再構築された。開発者にとっては、訓練フレームワークや採点器へのアクセスは、モデル自体へのアクセスと同じくらい重要かもしれない。なぜなら、それがXiaomiのアプローチを再現または拡張する出発点になるからだ。
見出しを飾る性能とコストの数値は、モデル全体の品質に対する独立した判断ではなく、あくまで報告された主張として扱うべきだ。Xiaomiは訓練コスト、強化学習、改善の数値を提供し、Artificial AnalysisはThe Decoderの説明によれば引用されたIntelligence Index比較を提供した。入手可能なソース資料には、ランキングの完全な方法論、広範な独立評価セット、モデルの安全性と信頼性の挙動に関する完全な内訳は示されていない。
より深刻な不確実性は、Xiaomiがどのように学習データを集めたかに関するものだ。Anthropicの脅威インテリジェンス報告は、2025年12月から2026年8月までのClaude悪用事例を対象としており、XiaomiをClaudeから能力を引き出すキャンペーンに関与したとされる7つの中国AIラボの一つとして名指しした。Anthropicはこの手法を違法な蒸留と表現した。ほかの名指しされた企業は、Alibaba、Moonshot AI、DeepSeek、Zhipu、MiniMax、SenseTimeだった。
GTG-16008と特定されたケースでは、Anthropicは2026年3月と4月に20日間で40万件以上のやり取りを観測したと述べた。報告書は、XiaomiがMiMoモデルからの会話やコーディングセッションをOpenClawとOpenCodeを通じてClaudeにルーティングし、後続モデル向けの学習データを生成することを目的としていたと主張した。
これらはAnthropicの主張であり、この報道で利用可能な資料内で独立に確立された事実ではない。The Decoderは、Anthropicが内部蒸留プロセスで使用された以前のteacher-modelデータの出所について限られた文書しか提供していないと報じた。Xiaomiが強化学習ツールを公開したこと自体では、開発パイプラインの他の部分で使われたデータの来歴に関する疑問は解消されない。
報告された価格とランキングが独立テストで維持されるなら、MiMo-V2.6-Proは、同等のコーディングや推論ワークロードに対してかなり高い料金を課すモデル提供者に圧力をかける可能性がある。スタートアップはその価格を使って、より大規模な評価スイート、より頻繁なエージェントループ、またはより大規模な顧客ワークフローを動かせる。企業チームは、ホスト型APIに全面的に依存するのではなく、オープンな利用可能性と訓練ツールキットをシステムをカスタマイズする機会とみなすかもしれない。
一方で、推論コストが低いからといって、導入リスクが自動的に低いわけではない。購入者は依然として、自身のタスクにおけるライセンス条件、データガバナンス、遅延、稼働率、セキュリティ挙動、文脈の扱い、出力の信頼性を自ら評価する必要がある。Claude由来データをめぐる疑惑はさらに一層の層を加える。MiMo-V2.6を本番利用に検討する企業は、機密性の高いワークフローに組み込む前に、学習データの来歴に関する明確な文書化と法的保証を求めるかもしれない。
研究者にとっても、Xiaomiの公開はオープンモデル開発における実務的な変化を示している。競争優位は、事前学習の規模だけでなく、強化学習環境、採点器、タスク設計からますます生まれる可能性がある。オープンツールは進歩を加速できるが、その価値は、タスクが有用な振る舞いを測れているか、報酬システムが抜け道に耐えられるかにかかっている。
最初のシグナルは、Intelligence Indexの結果と報告されたDeepSWEの改善を独立に再現できるかどうかだ。開発者はまた、単一のランキングに頼るのではなく、同一のプロンプト、価格、ハードウェア、遅延条件の下でMiMo-V2.6-ProをKimi K3やQwenと比較すべきだ。
2つ目のシグナルは、Xiaomiによる学習データとモデル開発手法の文書化だ。Anthropicの疑惑は、さらなる証拠、Xiaomiの反論、あるいはオープンモデル企業が蒸留やteacher modelの使用をどのように開示するかの変更につながる可能性がある。
最後に、市場はXiaomiのツールキットが自社インフラの外で使えるのかを示すことになる。研究者や製品チームによる採用、自動採点器の品質、コーディング、サイバーセキュリティ、オフィス自動化、エージェントワークフローでの実世界性能が、MiMo-V2.6が単なる強いベンチマーク公開以上のものかどうかを示すだろう。
MiMo-V2.6が注目されるのは、オープンモデル市場を形作る3つの圧力、すなわちベンチマーク性能、推論経済性、アクセス可能な強化学習インフラを結びつけているからだ。Xiaomiの報告結果は、モデルがプロプライエタリシステムの最高価格に並ばなくても、オープンランキングの上位付近で競争できることを示唆している。
しかしClaudeをめぐる疑惑は、来歴を単なる脚注ではなく製品ストーリーの一部にしている。したがって、AI開発者と企業の買い手にとっての実務的な試験は二重だ。MiMo-V2.6が実際のワークロードで信頼できる価値を提供するかどうか、そしてXiaomiが組織に対して、何を導入しているのか、どのように訓練されたのかを理解するのに十分な透明性を提供できるかどうかである。