Meta 的 Muse Spark 1.3 提升了代理式與程式碼能力分數,但它每項任務的低成本,可能比它尚未完成的前沿挑戰更重要。

Meta 已發布 Muse Spark 1.3,將這個快速擴張系列中的最新模型,定位為更接近 Anthropic 與 OpenAI 產品的競爭者。這個模型最強的進步出現在代理式工作、程式設計與專業任務基準測試上,而其定價也讓開發者有理由考慮採用,即使最強版本尚未廣泛提供。
這次發布分為兩個效能等級。根據 The Decoder 引述 Artificial Analysis 的報導,xhigh 版本可透過 Muse Code 與 Meta Model API 使用,而更強大的 max 版本則仍處於有限的合作夥伴預覽階段,等待進一步的安全性測試。Meta 也表示,之後會推出開放權重版本,但目前的證據並未說明發布日期、授權條款,或是否會與預覽模型相同。
這個可用性落差是故事核心。Meta 最好的基準測試結果來自 max,但目前大多數開發者只能存取 xhigh。因此,這個模型的競爭地位不僅取決於測試分數,也取決於客戶能部署哪一個等級、max 版本會收多少費,以及安全性評估是否會擴大可用性。
Muse Spark 1.3 是這個系列在五個月內推出的第四個模型。根據 The Decoder,這個系列於 4 月推出,接著在 7 月推出 1.1 版、8 月推出 1.2 版。如此短的發布週期,反映出領先模型供應商在推理、工具使用與軟體開發效能上的迭代速度有多快。
根據報導,Meta 維持標準 token 價格不變,每百萬輸入 token 1.25 美元、每百萬輸出 token 4.25 美元。不過,與 Muse Spark 1.2 相比,這個模型的使用成本更高;在 The Decoder 引述的比較中,1.2 版每項任務成本為 0.40 美元。1.3 版在同一個以指數為基礎的估算中,每項任務為 0.55 美元。
這個數字是此次發布最明顯的商業差異化因素。Artificial Analysis 發現,在其 Intelligence Index 中拿到 59 分以上的模型,沒有任何一個比 Muse Spark 1.3 更便宜。報告指出,同等性能區間的競爭模型,每項任務成本介於 0.94 美元至 1.23 美元之間。
這種比較不應被視為通用的生產成本。每項任務的經濟性會因提示長度、輸出長度、工具呼叫、重試、上下文窗口與應用架構而異。即便如此,對於執行大量程式設計代理或工作流程自動化的團隊來說,價格差距可能很有意義,因為推理成本很快就可能超過底層軟體的成本。
Artificial Analysis 在其 Intelligence Index 中給 Muse Spark 1.3 的分數為 max 62 分、xhigh 61 分,較 1.2 版的 57 分與 1.1 版的 53 分有所提升。這項上升部分可由指數權重解釋:GDPval-AA v2 佔總分 20%,Terminal-Bench 2.1 佔 16%,τ³-Bench Banking 佔 14%。
這些也正是 Meta 最新模型進步最多的領域。在模擬銀行環境中衡量代理體操作工具能力的 τ³-Bench Banking 中,max 取得 52%,是比較中公布的最高結果。可用的 xhigh 等級取得 47%,與 Claude Fable 5.1 的 max 設定以及 GLM-5.3-Flash 打平,而不是領先它們。
這個模型在 Terminal-Bench 2.1 上也有所提升,這是一項透過終端機進行程式碼能力的測試。xhigh 從 1.2 版的 80% 上升到 85%,而 max 則達到 86%。根據引用的 Artificial Analysis 結果,Claude Fable 5.1 仍以 max 91.4%、xhigh 91.0%、high 89.9% 領先。
在涵蓋 220 項專業任務、並以人類專家參考分數 1,000 為基準的 GDPval-AA v2 中,Muse Spark 1.3 的 xhigh 從 1,615 提升到 1,709,max 則提升到 1,754。Claude Fable 5.1 max 得分為 1,853。報告還指出,max 使用的推理 token 比 xhigh 多 62%,這表示它的部分優勢可能來自額外的推理運算,而非整體能力全面提升。
目前可見的證據,比 Meta 宣稱 Muse Spark 1.3 能與 Anthropic 和 OpenAI 競爭或追上它們,提供了更審慎的結論。幾項測試顯示出顯著進步,但在所報告的整體評估中,這個模型並沒有穩定地領先。
在專家等級科學基準 GPQA Diamond 中,Muse Spark 從 90% 提升到 94%。這讓它接近領先群,但仍低於 Gemini 3.8 Flash high 的 95.3% 與 Grok 4.6 high 的 94.9%。在研究物理測試 CritPt 中,模型從 18% 進步到 26%,而 GPT-5.6 Sol max 得分 32.3%,Claude Fable 5.1 xhigh 則為 31.1%。
有兩項報告指標倒退。AA-LCR 從 83% 降到 79%,而 AA-Omniscience 的事實正確性最多下降了三分。The Decoder 將這項下滑歸因於模型在不確定時更常拒絕回答。對企業部署而言,這種取捨很重要:避免不可靠回答的模型可降低部分風險,但過多拒答也可能干擾需要有效升級處理或澄清的工作流程。
這些都是 Artificial Analysis 所報告的獨立基準結果,並不能證明真實世界中的優越性。Muse Spark 1.3 可與 Anthropic 和 OpenAI 領先模型競爭的更大說法來自 Meta,並被 Yahoo Finance Canada、Digital Trends、SiliconANGLE 與 VentureBeat 的報導轉述。VentureBeat 的標題也強調,最強結果依賴於一個開發者尚無法廣泛使用的模型。就目前可見證據而言,Meta 與 Artificial Analysis 都尚未公布 max 等級的價格。
對 AI 產品團隊來說,Muse Spark 1.3 最相關的場景,是工具使用與成本控制比在每一項知識或推理測試上絕對領先更重要的地方。程式設計助理、以終端機為基礎的代理體,以及結構化的商業工作流程,都可能受惠於 Terminal-Bench 與 τ³-Bench Banking 的改善,特別是如果 xhigh 能以 Meta 公布的 token 費率透過其 API 使用。
實務上的評估負擔仍然很高。團隊應該測試任務完成率、工具錯誤後的恢復能力、拒答行為、延遲,以及消耗的推理 token 數量,而不只是看一個綜合基準分數。max 與 xhigh 之間 62% 的運算差距提醒我們,即使供應商尚未公布另一個獨立價格,更高能力的等級也可能改變單位經濟。
即將推出的開放權重版本,可能會擴大這個模型的影響力,特別是對於需要私有部署或更嚴格掌控資料與推理基礎設施的組織。不過,在沒有時程、權重、授權、硬體需求,以及與託管模型一致性的細節之前,買家應將這個選項視為未來可能性,而不是現在就能部署的方案。
對競爭者而言,價格在戰略上非常重要。Meta 目前尚未展現無可爭議的領先地位,但它可能正在降低一個足以滿足許多代理式工作負載需求的模型成本。這會對供應商形成壓力,迫使他們不只在基準分數上競爭,也要在推理經濟性上競爭。
第一個訊號會是,Meta 是否會在安全性測試後,將 Muse Spark 1.3 max 從合作夥伴預覽推向一般可用。它最終的 API 價格將決定目前所報導的每項任務 0.55 美元優勢,是否能在此比較之外依然成立。
開發者也應關注開放權重公告中的授權與模型一致性。針對真實生產任務的獨立評估,會比單看 Intelligence Index 更重要,尤其是在事實可靠性、工具使用後的恢復,以及拒答率方面。
最後,下一個版本將顯示 Meta 是否能在不犧牲可靠性的情況下維持快速發布節奏。AA-LCR 與 AA-Omniscience 的下滑,讓這種平衡比另一個單一頭條基準更值得重視。
Muse Spark 1.3 最好被理解為一個強勁的價值挑戰者,而不是對前沿模型市場的徹底接管。Meta 在代理式與程式設計評估上有了明顯進步,但最高配置仍受限制、價格未知,而且多個領先模型在重要測試中仍保持優勢。
對開發者來說,這次發布仍可能具有影響力。如果 xhigh 真的能以 Meta 公布的費率提供可靠的工具使用,那麼重視成本的團隊就可能擁有一個可與更昂貴模型匹敵的替代方案。真正關鍵的證據將來自可取得的 max 部署、獨立的生產環境測試,以及承諾中的開放權重版本,而不只是 Meta 的市場定位。