Muse Spark 1.3 de Meta améliore les scores en agentique et en code, mais son faible coût par tâche pourrait compter davantage que son défi encore inachevé au front de la frontière.

Meta a publié Muse Spark 1.3, positionnant le dernier modèle de sa série en forte expansion comme un concurrent plus proche des offres d’Anthropic et d’OpenAI. Les plus forts gains du modèle apparaissent dans le travail agentique, le code et les benchmarks de tâches professionnelles, tandis que sa tarification donne aux développeurs une raison de l’envisager, même si la version la plus capable n’est pas largement disponible.
Le lancement est réparti entre deux niveaux de performance. La version xhigh est disponible via Muse Code et la Meta Model API, tandis que la version max, plus puissante, reste en aperçu partenaire limité dans l’attente de tests de sécurité supplémentaires, selon le rapport de The Decoder citant Artificial Analysis. Meta a également indiqué qu’une version à poids ouverts arrivera, même si les éléments disponibles ne précisent ni date de sortie, ni conditions de licence, ni si elle correspondra au modèle en aperçu.
Cet écart de disponibilité est central dans l’histoire. Les meilleurs résultats de benchmark de Meta proviennent de max, mais la plupart des développeurs ne peuvent actuellement accéder qu’à xhigh. Par conséquent, la position concurrentielle du modèle dépend non seulement des scores de test, mais aussi du niveau que les clients peuvent déployer, du coût de la version max et de l’éventuelle extension d’accès liée à son évaluation de sécurité.
Muse Spark 1.3 est le quatrième modèle de la série en cinq mois. La série a été lancée en avril, suivie des versions 1.1 en juillet et 1.2 en août, selon The Decoder. Ce cycle de publication court reflète la vitesse à laquelle les principaux fournisseurs de modèles itèrent sur le raisonnement, l’usage d’outils et les performances en développement logiciel.
Meta a maintenu inchangés les prix standards des tokens à 1,25 $ par million de tokens d’entrée et 4,25 $ par million de tokens de sortie, selon le rapport. Toutefois, le modèle est plus coûteux à l’usage que Muse Spark 1.2, qui coûtait 0,40 $ par tâche dans la comparaison citée par The Decoder. La version 1.3 s’établit à 0,55 $ par tâche selon la même estimation fondée sur un indice.
Ce chiffre est le différenciateur commercial le plus clair du lancement. Artificial Analysis a constaté qu’aucun modèle obtenant 59 points ou plus sur son Intelligence Index n’était moins cher que Muse Spark 1.3. Des rivaux comparables dans cette plage de performance coûtaient entre 0,94 $ et 1,23 $ par tâche, selon le rapport.
Cette comparaison ne doit pas être considérée comme un coût de production universel. L’économie par tâche varie selon la longueur du prompt, la longueur de la sortie, les appels d’outils, les relances, les fenêtres de contexte et l’architecture de l’application. Malgré cela, l’écart de prix pourrait être significatif pour les équipes exécutant des agents de code à fort volume ou de l’automatisation de flux de travail, où les coûts d’inférence peuvent rapidement dépasser le coût du logiciel sous-jacent.
Artificial Analysis a attribué à Muse Spark 1.3 un score de 62 pour max et de 61 pour xhigh sur son Intelligence Index, contre 57 pour la version 1.2 et 53 pour la version 1.1. Cette hausse s’explique en partie par la pondération de l’indice : GDPval-AA v2 compte pour 20 % du score, Terminal-Bench 2.1 pour 16 % et τ³-Bench Banking pour 14 %.
Ce sont aussi les domaines dans lesquels le dernier modèle de Meta a le plus progressé. Dans τ³-Bench Banking, qui mesure la capacité d’un agent à utiliser des outils dans un environnement bancaire simulé, max a obtenu 52 %, le meilleur résultat rapporté dans la comparaison. Le niveau xhigh disponible a obtenu 47 %, à égalité avec Claude Fable 5.1 dans sa configuration max et GLM-5.3-Flash, sans les dépasser.
Le modèle a également progressé sur Terminal-Bench 2.1, un test de code via un terminal. Xhigh est passé de 80 % avec la version 1.2 à 85 %, tandis que max a atteint 86 %. Claude Fable 5.1 restait en tête avec 91,4 % en max, 91,0 % en xhigh et 89,9 % en high, selon les résultats cités d’Artificial Analysis.
Sur GDPval-AA v2, qui couvre 220 tâches professionnelles et utilise un score de référence d’expert humain de 1 000, Muse Spark 1.3 est passé de 1 615 à 1 709 pour xhigh et à 1 754 pour max. Claude Fable 5.1 max a obtenu 1 853. Le rapport a également noté que max utilisait 62 % de tokens de raisonnement en plus que xhigh, ce qui suggère qu’une partie de son avantage vient d’un calcul d’inférence supplémentaire plutôt que d’un changement global de capacité.
Les éléments disponibles appuient une conclusion plus mesurée que l’affirmation de Meta selon laquelle Muse Spark 1.3 rivalise avec Anthropic et OpenAI ou les rattrape. Plusieurs tests montrent des progrès substantiels, mais le modèle ne domine pas de manière constante l’ensemble des évaluations rapportées.
Sur GPQA Diamond, un benchmark scientifique de niveau expert, Muse Spark est passé de 90 % à 94 %. Cela le plaçait près du groupe de tête, mais derrière Gemini 3.8 Flash high à 95,3 % et Grok 4.6 high à 94,9 %. Sur CritPt, un test de physique de recherche, le modèle est passé de 18 % à 26 %, tandis que GPT-5.6 Sol max a obtenu 32,3 % et Claude Fable 5.1 xhigh 31,1 %.
Deux mesures rapportées ont reculé. AA-LCR est passé de 83 % à 79 %, tandis que l’exactitude factuelle sur AA-Omniscience a baissé d’au plus trois points. The Decoder a attribué ce recul à des refus plus fréquents lorsque le modèle était incertain. Pour les déploiements en entreprise, cet arbitrage compte : un modèle qui évite les réponses non étayées peut réduire certains risques, mais des refus excessifs peuvent aussi perturber des workflows nécessitant une remontée utile ou une clarification.
Il s’agit de résultats de benchmark indépendants rapportés par Artificial Analysis, et non d’une preuve de supériorité dans le monde réel. Les affirmations plus larges selon lesquelles Muse Spark 1.3 concurrence les modèles leaders d’Anthropic et d’OpenAI viennent de Meta et ont été reprises par Yahoo Finance Canada, Digital Trends, SiliconANGLE et VentureBeat. Le titre de VentureBeat a également souligné que les résultats les plus forts reposent sur un modèle que les développeurs ne peuvent pas encore utiliser largement. Ni Meta ni Artificial Analysis n’ont publié ici de prix pour le niveau max.
Pour les équipes produit IA, Muse Spark 1.3 semble surtout pertinent là où l’usage d’outils et la maîtrise des coûts comptent davantage que le leadership absolu sur chaque test de connaissances ou de raisonnement. Les assistants de code, les agents basés sur terminal et les workflows métiers structurés pourraient bénéficier des gains rapportés sur Terminal-Bench et τ³-Bench Banking, en particulier si xhigh est disponible via l’API de Meta aux tarifs de tokens indiqués.
La charge d’évaluation pratique reste élevée. Les équipes devraient tester l’achèvement des tâches, la récupération après erreurs d’outils, le comportement de refus, la latence et le nombre de tokens de raisonnement consommés — pas seulement un score agrégé de benchmark. L’écart de calcul de 62 % entre max et xhigh rappelle qu’un niveau plus capable peut modifier l’économie unitaire avant même qu’un fournisseur publie un prix distinct.
La prochaine version à poids ouverts pourrait élargir l’impact du modèle, surtout pour les organisations qui ont besoin d’un déploiement privé ou d’un contrôle plus strict des données et de l’infrastructure d’inférence. Mais sans détails sur le calendrier, les poids, la licence, les exigences matérielles et la parité avec le modèle hébergé, les acheteurs devraient considérer cette option comme une possibilité future plutôt que comme une voie de déploiement actuelle.
Pour les rivaux, la tarification est stratégiquement importante. Meta ne démontre pas encore une position dominante incontestée, mais peut réduire le coût d’un modèle suffisamment performant pour de nombreuses charges agentiques. Cela peut pousser les fournisseurs à concurrencer sur l’économie de l’inférence, et pas seulement sur les classements de benchmark.
Le premier signal sera de savoir si Meta fait passer Muse Spark 1.3 max de l’aperçu partenaire à la disponibilité générale après les tests de sécurité. Son prix API final déterminera si l’avantage rapporté de 0,55 $ par tâche tient au-delà de la comparaison actuelle.
Les développeurs devraient aussi surveiller l’annonce des poids ouverts pour la licence et la parité du modèle. Les évaluations indépendantes sur de vraies tâches de production compteront davantage que l’Intelligence Index à lui seul, en particulier pour la fiabilité factuelle, la reprise après usage d’outils et les taux de refus.
Enfin, la prochaine version dira si Meta peut maintenir son rythme de publication rapide sans sacrifier la fiabilité. Les régressions rapportées sur AA-LCR et AA-Omniscience font de cet équilibre une mesure plus importante qu’un autre benchmark phare unique.
Muse Spark 1.3 doit surtout être compris comme un solide défi de valeur, et non comme une prise de contrôle définitive du marché des modèles de frontière. Meta a nettement progressé dans les évaluations agentiques et de code, mais la configuration la plus performante reste restreinte, son prix est inconnu et plusieurs modèles leaders gardent l’avantage sur des tests importants.
Pour les créateurs, le lancement pourrait néanmoins être déterminant. Si xhigh offre un usage fiable des outils aux tarifs indiqués par Meta, les équipes sensibles aux coûts pourraient disposer d’une alternative crédible à des modèles plus chers. Les preuves décisives viendront d’un déploiement max accessible, de tests indépendants en production et de la version à poids ouverts promise — pas de la seule position de Meta.