MetaのMuse Spark 1.3は性能差を縮めつつ、価格で競合に攻勢をかける

MetaのMuse Spark 1.3はエージェント系とコーディングのスコアを改善したが、まだ未完成の最前線課題よりも、タスクあたりの低コストのほうが重要かもしれない。

AI News

MetaはMuse Spark 1.3を公開し、急速に拡大するシリーズの最新モデルをAnthropicやOpenAIの提供物により近い競合として位置づけた。モデルの最も大きな改善は、エージェント的作業、コーディング、専門業務ベンチマークで見られる一方、価格設定は、最も高性能な版が広く利用できないにもかかわらず、開発者が採用を検討する理由になる。

このリリースは2つの性能ティアに分かれている。xhigh版はMuse CodeとMeta Model APIから利用できる一方、より強力なmax版は、Artificial Analysisを引用したThe Decoderの報道によれば、追加の安全性テストが完了するまで限定的なパートナープレビューのままだという。Metaはまた、オープンウェイト版が登場すると述べているが、提示されている証拠には公開日、ライセンス条件、あるいはプレビュー版と同等かどうかは示されていない。

この利用可能性の差は、今回の話の中心だ。Metaの最高ベンチマーク結果はmaxによるものだが、現在ほとんどの開発者がアクセスできるのはxhighのみである。そのため、このモデルの競争力は、テストスコアだけでなく、顧客がどのティアを展開できるか、max版の価格、そして安全性評価がアクセス拡大につながるかにも左右される。

動きの速いモデル系列が1.3版に到達

Muse Spark 1.3は、5か月でシリーズ4つ目のモデルだ。The Decoderによると、シリーズは4月に始まり、その後7月に1.1、8月に1.2が続いた。この短いリリースサイクルは、主要モデル提供者が推論、ツール利用、ソフトウェア開発性能をどれほど速く改善しているかを示している。

報道によれば、Metaは標準トークン価格を、入力100万トークンあたり1.25ドル、出力100万トークンあたり4.25ドルのまま据え置いた。ただし、The Decoderが引用した比較ではMuse Spark 1.2が1タスクあたり0.40ドルだったのに対し、このモデルの利用コストはそれより高い。1.3版は同じインデックスベースの推定で1タスクあたり0.55ドルとなる。

この数字が、今回のリリースで最も明確な商業上の差別化要素だ。Artificial Analysisによると、Intelligence Indexで59点以上を獲得したモデルの中で、Muse Spark 1.3より安いものはなかった。報道では、この性能帯の競合は1タスクあたり0.94ドルから1.23ドルの範囲だったという。

この比較は、普遍的な本番コストとして受け取るべきではない。1タスクあたりの経済性は、プロンプトの長さ、出力の長さ、ツール呼び出し、再試行、コンテキストウィンドウ、アプリケーションアーキテクチャによって変わる。それでも、コーディングエージェントやワークフロー自動化を高頻度で回すチームにとっては、推論コストが基盤ソフトウェアのコストをすぐに上回りうるため、この価格差は意味を持つ可能性がある。

エージェント系ベンチマークで最大の伸び

Artificial Analysisは、Muse Spark 1.3にIntelligence Indexでmaxに62点、xhighに61点を与え、1.2版の57点、1.1版の53点から上昇した。上昇の一因は、この指数の重みづけにある。GDPval-AA v2がスコアの20%、Terminal-Bench 2.1が16%、τ³-Bench Bankingが14%を占める。

これらは、Metaの最新モデルが最も改善した領域でもある。模擬銀行環境でエージェントがツールを操作する能力を測るτ³-Bench Bankingでは、maxが52%を記録し、比較で報告された中で最高だった。利用可能なxhighティアは47%で、Claude Fable 5.1のmax構成およびGLM-5.3-Flashと並んだが、それらを上回ることはなかった。

このモデルは、ターミナル経由のコーディングを測るTerminal-Bench 2.1でも改善した。xhighは1.2版の80%から85%へ上昇し、maxは86%に達した。引用されたArtificial Analysisの結果によれば、Claude Fable 5.1はmaxで91.4%、xhighで91.0%、highで89.9%と依然として先行していた。

220の専門業務をカバーし、人間専門家の基準スコア1,000を用いるGDPval-AA v2では、Muse Spark 1.3はxhighで1,615から1,709へ、maxで1,754へ伸びた。Claude Fable 5.1 maxは1,853だった。また報道は、maxがxhighより62%多く推論トークンを使用したと指摘しており、その優位性の一部は全般的な能力向上ではなく、追加の推論計算に由来する可能性を示唆している。

証拠は有望だが、きれいなフロンティア勝利ではない

利用可能な証拠は、Muse Spark 1.3がAnthropicやOpenAIに匹敵する、あるいは追いついたというMetaの主張よりも、より控えめな結論を支持している。いくつかのテストでは大きな進歩が示されているが、報告された評価全体で一貫して先頭に立っているわけではない。

専門家レベルの科学ベンチマークであるGPQA Diamondでは、Muse Sparkは90%から94%に上昇した。これは上位 समूहに近い位置だったが、Gemini 3.8 Flash highの95.3%やGrok 4.6 highの94.9%を下回った。研究物理のテストであるCritPtでは、モデルは18%から26%へ改善したが、GPT-5.6 Sol maxは32.3%、Claude Fable 5.1 xhighは31.1%だった。

報告された2つの指標は悪化した。AA-LCRは83%から79%に低下し、AA-Omniscienceでの事実正確性も最大3ポイント落ちた。The Decoderは、この低下を、モデルが不確かなときにより頻繁に拒否したことに起因するとした。企業導入では、このトレードオフは重要だ。根拠のない回答を避けるモデルは一部のリスクを減らせるが、過剰な拒否は、有用なエスカレーションや明確化を必要とするワークフローを妨げることもある。

これらはArtificial Analysisが報告した独立したベンチマーク結果であり、実世界での優位性の証明ではない。Muse Spark 1.3がAnthropicやOpenAIの主要モデルと競合するという広い主張はMetaに由来し、Yahoo Finance Canada、Digital Trends、SiliconANGLE、VentureBeatの報道でも取り上げられた。VentureBeatの見出しも、最も強い結果が、開発者がまだ広く使えないモデルに依存している点を強調していた。ここで示された証拠の範囲では、MetaもArtificial Analysisもmaxティアの価格を公開していない。

このリリースがビルダーと購入者に意味すること

AIプロダクトチームにとって、Muse Spark 1.3は、あらゆる知識・推論テストでの絶対的な首位よりも、ツール利用とコスト管理が重要な場面で最も有用に見える。コーディングアシスタント、ターミナルベースのエージェント、構造化された業務ワークフローは、Terminal-Benchとτ³-Bench Bankingで報告された改善の恩恵を受ける可能性があり、特にxhighがMetaのAPIを通じて提示されたトークン価格で利用できるならなおさらだ。

実運用での評価負担は依然として大きい。チームは、単なる総合ベンチマークスコアだけでなく、タスク完了、ツールエラーからの回復、拒否動作、レイテンシ、消費された推論トークン数を検証すべきだ。maxとxhighの間の62%の計算差は、提供者が別価格を公開する前でも、より高性能なティアが単位経済性を変えうることを思い出させる。

今後予定されているオープンウェイト版のリリースは、特にプライベート展開やデータ・推論インフラのより厳格な管理を必要とする組織にとって、このモデルの影響力を広げる可能性がある。しかし、時期、重み、ライセンス、ハードウェア要件、ホスト版との同等性についての詳細がない以上、購入者はそれを現在の導入経路ではなく将来の可能性として扱うべきだ。

競合にとって、価格は戦略的に重要だ。Metaはまだ無条件のリーダーシップを示してはいないが、多くのエージェント系ワークロードには十分な性能を持つモデルのコストを引き下げている可能性がある。それは、ベンチマーク記録だけでなく推論コストでも競争するよう、提供者に圧力をかけることになる。

次に注目すべき点

最初のシグナルは、安全性テスト後にMetaがMuse Spark 1.3 maxをパートナープレビューから一般提供へ移すかどうかだ。最終的なAPI価格によって、報告された1タスクあたり0.55ドルの優位性が現在の比較の外でも維持されるかが決まる。

開発者はまた、オープンウェイト発表でのライセンスとモデル同等性にも注目すべきだ。実際の本番タスクでの独立評価は、Intelligence Index単体よりも重要になる。特に、事実の信頼性、ツール利用後の復帰、拒否率においてはそうだ。

最後に、次のバージョンは、Metaが信頼性を犠牲にせずにこの速いリリースペースを維持できるかを示すだろう。AA-LCRとAA-Omniscienceで報告された低下は、そのバランスを、もう一つの単独の見出しベンチマークよりも重要な指標にしている。

Creati.aiの見解

Muse Spark 1.3は、フロンティアモデル市場を決定的に奪うものというより、強力なコストパフォーマンス挑戦として理解するのが最も適切だ。Metaはエージェント系とコーディングの評価で有意に改善したが、最上位構成はなお制限され、価格は不明で、複数の有力モデルが重要なテストで依然として先行している。

それでも、ビルダーにとってこのリリースは重要になりうる。xhighがMetaの提示価格で信頼できるツール利用を提供するなら、コスト重視のチームにとって、より高価なモデルに代わる有力な選択肢となるかもしれない。決定的な証拠は、アクセス可能なmax展開、独立した本番テスト、そして約束されたオープンウェイト版から得られるものであり、Metaの位置づけだけではない。

広告