Meta’s Muse Spark 1.3 verbessert Agenten- und Coding-Werte, doch die niedrigen Kosten pro Aufgabe könnten wichtiger sein als die noch nicht abgeschlossene Frontier-Herausforderung.

Meta hat Muse Spark 1.3 veröffentlicht und positioniert das neueste Modell der schnell wachsenden Serie als näheren Konkurrenten zu Angeboten von Anthropic und OpenAI. Die stärksten Zuwächse zeigt das Modell bei agentischer Arbeit, Coding und professionellen Aufgaben-Benchmarks, während die Preisgestaltung Entwicklern einen Grund gibt, es in Betracht zu ziehen, obwohl die leistungsfähigste Version nicht breit verfügbar ist.
Die Veröffentlichung ist in zwei Leistungsklassen aufgeteilt. Die xhigh-Version ist über Muse Code und die Meta Model API verfügbar, während die leistungsstärkere max-Version laut The Decoder unter Berufung auf Artificial Analysis vorerst in einer begrenzten Partner-Vorschau bleibt, bis zusätzliche Sicherheitstests abgeschlossen sind. Meta hat zudem gesagt, dass eine Version mit offenen Gewichten kommen wird, auch wenn die vorliegenden Belege weder ein Veröffentlichungsdatum noch Lizenzbedingungen nennen oder bestätigen, ob sie dem Preview-Modell entsprechen wird.
Diese Verfügbarkeitslücke ist zentral für die Geschichte. Metas beste Benchmark-Ergebnisse stammen von max, doch die meisten Entwickler können derzeit nur xhigh nutzen. Daher hängt die Wettbewerbsposition des Modells nicht nur von den Testergebnissen ab, sondern auch davon, welche Stufe Kunden einsetzen können, was die max-Version kosten wird und ob ihre Sicherheitsprüfung den Zugang erweitert.
Muse Spark 1.3 ist das vierte Modell der Serie innerhalb von fünf Monaten. Die Reihe startete im April, gefolgt von Version 1.1 im Juli und 1.2 im August, so The Decoder. Der kurze Veröffentlichungszyklus zeigt, wie schnell führende Modellanbieter bei Reasoning, Tool-Nutzung und Softwareentwicklungsleistung iterieren.
Meta hat die Standard-Tokenpreise laut Bericht unverändert bei 1,25 US-Dollar pro Million Input-Token und 4,25 US-Dollar pro Million Output-Token belassen. Allerdings ist die Nutzung des Modells teurer als bei Muse Spark 1.2, das in dem von The Decoder zitierten Vergleich 0,40 US-Dollar pro Aufgabe kostete. Version 1.3 liegt in derselben indexbasierten Schätzung bei 0,55 US-Dollar pro Aufgabe.
Diese Zahl ist der klarste kommerzielle Unterschied der Veröffentlichung. Artificial Analysis fand, dass kein Modell mit 59 Punkten oder mehr im Intelligence Index günstiger war als Muse Spark 1.3. Vergleichbare Rivalen in diesem Leistungsbereich kosteten laut Bericht zwischen 0,94 und 1,23 US-Dollar pro Aufgabe.
Dieser Vergleich sollte nicht als universelle Produktionskosten verstanden werden. Die Kosten pro Aufgabe variieren je nach Prompt-Länge, Ausgabelänge, Tool-Aufrufen, Wiederholungen, Kontextfenstern und Anwendungsarchitektur. Dennoch könnte die Preislücke für Teams mit hohem Aufkommen an Coding-Agenten oder Workflow-Automatisierung bedeutsam sein, wo Inferenzkosten die Kosten der zugrunde liegenden Software schnell übersteigen können.
Artificial Analysis vergab für Muse Spark 1.3 einen Score von 62 für max und 61 für xhigh im Intelligence Index, gegenüber 57 für Version 1.2 und 53 für Version 1.1. Der Anstieg erklärt sich teilweise durch die Gewichtung des Index: GDPval-AA v2 macht 20 % der Punktzahl aus, Terminal-Bench 2.1 16 % und τ³-Bench Banking 14 %.
Genau in diesen Bereichen hat sich Metas neuestes Modell auch am stärksten verbessert. In τ³-Bench Banking, das die Fähigkeit eines Agents misst, Werkzeuge in einer simulierten Bankenumgebung zu bedienen, erreichte max 52 % und damit das höchste Ergebnis im Vergleich. Die verfügbare xhigh-Stufe kam auf 47 % und lag damit gleichauf mit Claude Fable 5.1 in seiner max-Konfiguration und GLM-5.3-Flash, statt sie zu übertreffen.
Das Modell verbesserte sich auch in Terminal-Bench 2.1, einem Test für Coding über ein Terminal. Xhigh stieg von 80 % mit Version 1.2 auf 85 %, während max 86 % erreichte. Claude Fable 5.1 lag weiterhin vorne mit 91,4 % in max, 91,0 % in xhigh und 89,9 % in high, so die zitierten Ergebnisse von Artificial Analysis.
Bei GDPval-AA v2, das 220 berufliche Aufgaben abdeckt und einen Referenzwert von 1.000 durch menschliche Experten verwendet, stieg Muse Spark 1.3 von 1.615 auf 1.709 für xhigh und auf 1.754 für max. Claude Fable 5.1 max erreichte 1.853. Der Bericht merkte außerdem an, dass max 62 % mehr Reasoning-Token nutzte als xhigh, was darauf hindeutet, dass ein Teil seines Vorteils eher aus zusätzlicher Inferenz-Computing-Leistung als aus einer durchgängig höheren Fähigkeit stammt.
Die verfügbaren Belege sprechen für ein vorsichtigeres Fazit als Metas Behauptung, Muse Spark 1.3 könne Anthropic und OpenAI gleichziehen oder einholen. Mehrere Tests zeigen deutliche Fortschritte, doch das Modell führt in der berichteten Gesamtheit der Evaluierungen nicht konsistent.
Bei GPQA Diamond, einem Wissenschafts-Benchmark auf Expertenniveau, stieg Muse Spark von 90 % auf 94 %. Das platzierte es in der Spitzengruppe, aber hinter Gemini 3.8 Flash high mit 95,3 % und Grok 4.6 high mit 94,9 %. Bei CritPt, einem Physik-Test für Forschung, verbesserte sich das Modell von 18 % auf 26 %, während GPT-5.6 Sol max 32,3 % und Claude Fable 5.1 xhigh 31,1 % erreichten.
Zwei berichtete Messwerte gingen zurück. AA-LCR fiel von 83 % auf 79 %, während die faktische Genauigkeit bei AA-Omniscience um bis zu drei Punkte sank. The Decoder führte diesen Rückgang auf häufigere Ablehnungen zurück, wenn das Modell unsicher war. Für Unternehmenseinsätze ist dieser Kompromiss wichtig: Ein Modell, das unbegründete Antworten vermeidet, kann manche Risiken verringern, doch zu viele Ablehnungen können auch Arbeitsabläufe stören, die nützliche Eskalation oder Klarstellung erfordern.
Dies sind unabhängige Benchmark-Ergebnisse von Artificial Analysis und kein Beweis für eine Überlegenheit in der Praxis. Die weitergehenden Behauptungen, Muse Spark 1.3 könne mit führenden Modellen von Anthropic und OpenAI konkurrieren, stammen von Meta und wurden in Berichten von Yahoo Finance Canada, Digital Trends, SiliconANGLE und VentureBeat aufgegriffen. Auch die Überschrift von VentureBeat betonte, dass die stärksten Ergebnisse auf einem Modell beruhen, das Entwickler noch nicht breit nutzen können. Weder Meta noch Artificial Analysis haben hier einen Preis für die max-Stufe veröffentlicht.
Für KI-Produktteams ist Muse Spark 1.3 vor allem dort relevant, wo Tool-Nutzung und Kostenkontrolle wichtiger sind als absolute Führungspositionen in jedem Wissens- oder Reasoning-Test. Coding-Assistenten, terminalbasierte Agents und strukturierte Geschäftsabläufe könnten von den berichteten Verbesserungen in Terminal-Bench und τ³-Bench Banking profitieren, besonders wenn xhigh über Metas API zu den genannten Token-Preisen verfügbar ist.
Der praktische Evaluationsaufwand bleibt hoch. Teams sollten Aufgabenerfüllung, Fehlerbehebung bei Tool-Fehlern, Ablehnungsverhalten, Latenz und die verbrauchten Reasoning-Token testen – nicht nur einen aggregierten Benchmark-Score. Der 62-%-Unterschied im Rechenaufwand zwischen max und xhigh erinnert daran, dass eine leistungsfähigere Stufe die Stückkosten verändern kann, noch bevor ein Anbieter einen separaten Preis veröffentlicht.
Die kommende Veröffentlichung mit offenen Gewichten könnte die Wirkung des Modells erweitern, insbesondere für Organisationen, die eine private Bereitstellung oder strengere Kontrolle über Daten- und Inferenzinfrastruktur benötigen. Doch ohne Details zu Zeitpunkt, Gewichten, Lizenz, Hardware-Anforderungen und Parität mit dem gehosteten Modell sollten Käufer diese Option als zukünftige Möglichkeit und nicht als aktuellen Bereitstellungsweg behandeln.
Für Rivalen ist die Preisgestaltung strategisch wichtig. Meta zeigt zwar noch keine unangefochtene Führung, senkt aber möglicherweise die Kosten eines Modells, das für viele agentische Workloads gut genug ist. Das kann Anbieter unter Druck setzen, nicht nur bei Benchmarks, sondern auch bei den Inferenzkosten zu konkurrieren.
Das erste Signal wird sein, ob Meta Muse Spark 1.3 max nach den Sicherheitstests von der Partner-Vorschau in die allgemeine Verfügbarkeit überführt. Der spätere API-Preis wird bestimmen, ob der berichtete Vorteil von 0,55 US-Dollar pro Aufgabe außerhalb des aktuellen Vergleichs bestehen bleibt.
Entwickler sollten außerdem die Ankündigung zu offenen Gewichten im Blick behalten, insbesondere Lizenzierung und Modellparität. Unabhängige Bewertungen auf realen Produktionsaufgaben werden wichtiger sein als der Intelligence Index allein, vor allem bei faktischer Zuverlässigkeit, der Wiederherstellung nach Tool-Nutzung und den Ablehnungsraten.
Schließlich wird die nächste Version zeigen, ob Meta seinen schnellen Veröffentlichungsrhythmus ohne Einbußen bei der Zuverlässigkeit aufrechterhalten kann. Die berichteten Rückgänge bei AA-LCR und AA-Omniscience machen dieses Gleichgewicht zu einem wichtigeren Maßstab als einen weiteren einzelnen Schlagzeilen-Benchmark.
Muse Spark 1.3 ist am besten als starke Preis-Leistungs-Herausforderung zu verstehen, nicht als endgültige Übernahme des Frontier-Modellmarkts. Meta hat sich bei agentischen und Coding-Bewertungen spürbar verbessert, doch die Top-Konfiguration ist weiterhin eingeschränkt, ihr Preis unbekannt, und mehrere führende Modelle liegen bei wichtigen Tests weiterhin vorne.
Für Builder könnte die Veröffentlichung dennoch folgenreich sein. Wenn xhigh zuverlässige Tool-Nutzung zu Metas genannten Preisen liefert, könnten kostensensitive Teams eine glaubwürdige Alternative zu teureren Modellen erhalten. Die entscheidenden Belege werden aus der zugänglichen max-Bereitstellung, unabhängigen Produktionstests und der versprochenen Veröffentlichung mit offenen Gewichten kommen – nicht allein aus Metas Positionierung.