小米 MiMo-V2.6-Pro 在成本與效能上領先開放模型排行榜,而 Anthropic 則指稱 Claude 資料協助訓練了該模型。

小米表示,其新款 MiMo-V2.6-Pro 已成為目前排行榜中最強的公開可用 AI 模型,結合了據稱 46 分的 Intelligence Index 分數與異常低的推理成本。這次發布使小米站上日益激烈的開放模型競賽核心,但同時也伴隨 Anthropic 的指控:這家中國公司使用了 Claude 生成的對話來改進自家模型。
該模型的報告效能同時搭配每百萬輸入 token 0.435 美元、每百萬輸出 token 0.87 美元的價格。根據 The Decoder 引述的分析,這大約相當於單一基準測試任務 0.13 美元,對於評估可用於程式撰寫、代理程式及其他高用量工作負載的模型開發者而言,這是一個重要數字。
較大型的 MiMo-V2.6-Pro 被描述為一個 mixture-of-experts 模型,總參數達 1.02 兆,但在單次請求中只有約 420 億個參數會被啟用。小米也推出 MiMo-V2.6-Flash,這是一個更小型、旨在提供更高效率選項的模型;以及 Pro-UltraSpeed 版本,該公司表示其輸出速度最高可達標準版的 20 倍。
The Decoder 報導,MiMo-V2.6-Pro 在 Artificial Analysis 對公開可用系統的比較中,排名領先 Kimi K3 與 Qwen 等模型。另一篇 Unite.AI 標題也將 46 分認定為該模型在 open-weight 模型中的領先結果,而 The Next Web 則在可取得的來源材料中報導了這項排名里程碑,但未提供額外技術細節。
這些結果之所以重要,是因為小米不只是將 MiMo-V2.6 定位為研究發布。低 token 價格可改變頻繁呼叫模型的產品經濟,例如程式撰寫助理、檢索系統、工作流程自動化,以及 AI 代理。該模型的 mixture-of-experts 設計也可能讓小米在不必為每次請求啟用所有參數而支付完整算力成本的情況下,仍能宣稱具備大型能力範圍。
小米將這項改進歸因於大幅擴充的強化學習階段。公司表示,它增加了每個訓練步驟處理的資料量,擴大了任務環境範圍,並投入更多運算資源來評分模型輸出。
根據 The Decoder 報導的數據,這次強化學習運行耗時不到六天,MiMo-V2.6-Pro 約花費 262 萬美元,而 MiMo-V2.6-Flash 約花費 85 萬美元。在 DeepSWE 程式撰寫評測中,小米表示 Pro 從 58.4 提升至 72.6,而 Flash 則從 48.8 升至 65.7。
公司也描述了維持訓練穩定的措施。小米凍結了模型的內部分布機制,並加入防護以避免 reward hacking,也就是模型在未真正完成預定任務的情況下,最大化評分訊號。
小米發布的不只是模型權重。其套件還包含技術報告、強化學習框架、一個用於進一步訓練的較小模型,以及約 7,000 項配有自動評分器的任務。這些任務涵蓋軟體開發、資安、辦公工作與網頁設計,其中約 1,000 項額外任務聚焦於音樂作曲。
報導中的任務來源是混合的。部分程式碼範例來自員工的 GitHub pull request 與使用者查詢,另一些描述則由語言模型生成。資安任務取材自 OSS-Fuzz,也就是一組真實軟體漏洞集合,而辦公環境則是以合成方式重建。對於開發者而言,取得訓練框架與評分器的意義可能與取得模型本身同等重要,因為這提供了重現或延伸小米方法的起點。
這些被放大的效能與成本數據,應視為報導中的主張,而非對模型整體品質的獨立裁決。小米提供了訓練成本、強化學習與改進數據,而 Artificial Analysis 則提供了 The Decoder 所引述的 Intelligence Index 比較。現有來源材料並未提供完整的排名方法論、廣泛的獨立評測集合,或對模型安全性與可靠性行為的完整拆解。
更嚴重的不確定性,來自小米如何蒐集訓練資料。Anthropic 的威脅情報報告涵蓋 2025 年 12 月至 2026 年 8 月的 Claude 濫用案例,其中將小米列為七家據稱參與從 Claude 擷取能力行動的中國 AI 實驗室之一。Anthropic 將此做法稱為非法蒸餾。其他被點名的公司包括 Alibaba、Moonshot AI、DeepSeek、Zhipu、MiniMax 與 SenseTime。
在被識別為 GTG-16008 的案例中,Anthropic 表示其在 2026 年 3 月與 4 月的 20 天內觀察到超過 40 萬次對話。報告聲稱,小米透過 OpenClaw 與 OpenCode 將其 MiMo 模型的對話與程式撰寫會話導向 Claude,目的在於為後續模型生成訓練資料。
這些是 Anthropic 的指控,而非本報導所能取得材料中獨立證實的事實。The Decoder 報導指出,Anthropic 對於內部蒸餾流程中所使用、較早期 teacher-model 資料的來源,只提供了有限文件。小米公開發布強化學習工具,並不能單憑這點解答其開發管線其他部分所使用資料的來源問題。
如果報導中的價格與排名在獨立測試中維持不變,MiMo-V2.6-Pro 可能會對那些針對相近的程式撰寫或推理工作負擔、卻收費明顯更高的模型供應商造成壓力。新創公司可利用這個價格跑更大型的評估套件、更頻繁的代理迴圈,或更高量的客戶工作流程。企業團隊則可能把這種開放可得性與訓練工具包,視為客製化系統的機會,而不是完全依賴託管 API。
但代價是,低推理成本不代表部署風險也低。買家仍需要自行評估授權條款、資料治理、延遲、正常運作時間、安全行為、上下文處理,以及在自身任務上的輸出可靠性。關於 Claude 衍生資料的指控又加了一層:考慮在生產環境使用 MiMo-V2.6 的公司,可能會希望在將其嵌入敏感工作流程之前,先取得清楚的訓練資料來源文件與法律保證。
對研究者來說,小米的發布也突顯了開放模型開發的一項實際轉變。競爭優勢愈來愈可能來自強化學習環境、評分器與任務設計,而不僅僅是預訓練規模。開放工具可以加速進展,但其價值取決於任務是否真正衡量有用行為,以及獎勵系統是否能抵抗走捷徑。
第一個訊號將是 Intelligence Index 結果與報告中的 DeepSWE 成果能否被獨立重現。開發者也應在相同提示、價格、硬體與延遲條件下,比較 MiMo-V2.6-Pro 與 Kimi K3、Qwen,而不是只看單一排行榜。
第二個訊號是小米對訓練資料與模型開發實務的文件化。Anthropic 的指控可能導致更多證據、小米的回應,或開放模型公司在揭露蒸餾與 teacher-model 使用方式上的改變。
最後,市場會揭示小米的工具包是否能在其自身基礎設施之外使用。研究者與產品團隊的採用情況、自動評分器品質,以及在程式撰寫、資安、辦公自動化與代理工作流程上的真實世界表現,將顯示 MiMo-V2.6 是否不只是一次強勢的基準發布。
MiMo-V2.6 值得注意,因為它連結了三種正在塑造開放模型市場的壓力:基準效能、推理經濟性,以及可取得的強化學習基礎設施。小米報告的結果顯示,一個模型可以在不匹配專有系統最高價格的情況下,接近開放排名頂端競爭。
但 Claude 的指控讓來源問題成為產品故事的一部分,而不只是註腳。對 AI 開發者與企業買家而言,實際測試因此有兩層:MiMo-V2.6 是否能在真實工作負載上提供可靠價值,以及小米是否能提供足夠透明度,讓組織理解自己部署了什麼、以及它是如何訓練出來的。