Muse Spark 1.3 de Meta reduce la brecha de rendimiento mientras ataca a sus rivales en precio

Muse Spark 1.3 de Meta mejora las puntuaciones de agentes y programación, pero su bajo coste por tarea puede importar más que su todavía incompleto desafío en la frontera.

AI News

Meta ha lanzado Muse Spark 1.3, situando el modelo más reciente de su serie de rápida expansión como un competidor más cercano de las ofertas de Anthropic y OpenAI. Las mayores mejoras del modelo aparecen en trabajos agentivos, programación y benchmarks de tareas profesionales, mientras que su precio da a los desarrolladores un motivo para considerarlo, aunque la versión más capaz no esté disponible de forma general.

El lanzamiento se divide en dos niveles de rendimiento. La versión xhigh está disponible a través de Muse Code y la Meta Model API, mientras que la versión max, más potente, sigue en una vista previa limitada para socios a la espera de pruebas de seguridad adicionales, según el informe de The Decoder que cita a Artificial Analysis. Meta también ha dicho que llegará una versión con pesos abiertos, aunque la evidencia no especifica una fecha de lanzamiento, los términos de licencia ni si coincidirá con el modelo de vista previa.

Esa brecha de disponibilidad es central en la historia. Los mejores resultados de benchmark de Meta provienen de max, pero la mayoría de los desarrolladores solo puede acceder actualmente a xhigh. Como resultado, la posición competitiva del modelo depende no solo de las puntuaciones de prueba, sino también de qué nivel pueden desplegar los clientes, de cuánto costará la versión max y de si su evaluación de seguridad amplía el acceso.

Una serie de modelos de rápido movimiento llega a la versión 1.3

Muse Spark 1.3 es el cuarto modelo de la serie en cinco meses. La serie se lanzó en abril, seguida por las versiones 1.1 en julio y 1.2 en agosto, según The Decoder. El corto ciclo de lanzamiento refleja lo rápido que los principales proveedores de modelos están iterando en razonamiento, uso de herramientas y rendimiento en desarrollo de software.

Meta ha mantenido sin cambios los precios estándar por tokens en 1,25 dólares por millón de tokens de entrada y 4,25 dólares por millón de tokens de salida, según el informe. Sin embargo, el modelo es más caro de usar que Muse Spark 1.2, que costaba 0,40 dólares por tarea en la comparación citada por The Decoder. La versión 1.3 se sitúa en 0,55 dólares por tarea con la misma estimación basada en índice.

Esa cifra es el diferenciador comercial más claro del lanzamiento. Artificial Analysis encontró que ningún modelo con 59 puntos o más en su Intelligence Index era más barato que Muse Spark 1.3. Los rivales comparables en ese rango de rendimiento costaban entre 0,94 y 1,23 dólares por tarea, según el informe.

La comparación no debe tomarse como un coste universal de producción. La economía por tarea varía con la longitud del prompt, la longitud de la salida, las llamadas a herramientas, los reintentos, las ventanas de contexto y la arquitectura de la aplicación. Aun así, la brecha de precios podría ser significativa para equipos que ejecutan agentes de programación o automatización de flujos de trabajo a gran escala, donde los costes de inferencia pueden superar rápidamente el coste del software subyacente.

Los benchmarks agentivos muestran las mayores mejoras

Artificial Analysis otorgó a Muse Spark 1.3 una puntuación de 62 para max y 61 para xhigh en su Intelligence Index, frente a 57 para la versión 1.2 y 53 para la versión 1.1. El aumento se explica en parte por la ponderación del índice: GDPval-AA v2 representa el 20% de la puntuación, Terminal-Bench 2.1 el 16% y τ³-Bench Banking el 14%.

Esas son también las áreas en las que el último modelo de Meta mejoró más. En τ³-Bench Banking, que mide la capacidad de un agente para operar herramientas en un entorno bancario simulado, max obtuvo 52%, el resultado más alto informado en la comparación. El nivel xhigh disponible obtuvo 47%, empatando con Claude Fable 5.1 en su configuración max y GLM-5.3-Flash en lugar de superarlos.

El modelo también mejoró en Terminal-Bench 2.1, una prueba de programación a través de un terminal. Xhigh subió del 80% con la versión 1.2 al 85%, mientras que max alcanzó el 86%. Claude Fable 5.1 siguió por delante con 91,4% en max, 91,0% en xhigh y 89,9% en high, según los resultados citados de Artificial Analysis.

En GDPval-AA v2, que cubre 220 tareas profesionales y usa una puntuación de referencia de expertos humanos de 1.000, Muse Spark 1.3 pasó de 1.615 a 1.709 para xhigh y a 1.754 para max. Claude Fable 5.1 max obtuvo 1.853. El informe también señaló que max utilizó un 62% más de tokens de razonamiento que xhigh, lo que sugiere que parte de su ventaja proviene de más cómputo de inferencia y no de un cambio generalizado de capacidad.

Las pruebas son prometedoras, pero no una victoria frontal limpia

La evidencia disponible respalda una conclusión más moderada que la afirmación de Meta de que Muse Spark 1.3 rivaliza o alcanza a Anthropic y OpenAI. Varias pruebas muestran avances sustanciales, pero el modelo no lidera de forma consistente en todo el conjunto de evaluaciones informado.

En GPQA Diamond, un benchmark científico de nivel experto, Muse Spark subió del 90% al 94%. Eso lo situó cerca del grupo de cabeza, pero por debajo de Gemini 3.8 Flash high con 95,3% y Grok 4.6 high con 94,9%. En CritPt, una prueba de física de investigación, el modelo mejoró del 18% al 26%, mientras que GPT-5.6 Sol max obtuvo 32,3% y Claude Fable 5.1 xhigh 31,1%.

Dos medidas informadas retrocedieron. AA-LCR cayó del 83% al 79%, mientras que la exactitud factual en AA-Omniscience descendió hasta tres puntos. The Decoder atribuyó ese descenso a rechazos más frecuentes cuando el modelo no estaba seguro. Para los despliegues empresariales, ese intercambio importa: un modelo que evita respuestas no fundamentadas puede reducir algunos riesgos, pero demasiados rechazos también pueden interrumpir flujos de trabajo que requieren escalado o aclaración útiles.

Estos son resultados de benchmark independientes informados por Artificial Analysis, no una prueba de superioridad en el mundo real. Las afirmaciones más amplias de que Muse Spark 1.3 compite con los modelos líderes de Anthropic y OpenAI provienen de Meta y fueron recogidas en coberturas de Yahoo Finance Canada, Digital Trends, SiliconANGLE y VentureBeat. El titular de VentureBeat también destacó que los resultados más fuertes dependen de un modelo que los desarrolladores aún no pueden usar de forma general. Ni Meta ni Artificial Analysis han publicado aquí un precio para el nivel max.

Lo que el lanzamiento significa para constructores y compradores

Para los equipos de producto de IA, Muse Spark 1.3 parece más relevante donde el uso de herramientas y el control de costes importan más que el liderazgo absoluto en cada prueba de conocimiento o razonamiento. Los asistentes de programación, los agentes basados en terminal y los flujos de trabajo empresariales estructurados podrían beneficiarse de las mejoras informadas en Terminal-Bench y τ³-Bench Banking, especialmente si xhigh está disponible a través de la API de Meta a las tarifas de tokens indicadas.

La carga práctica de evaluación sigue siendo alta. Los equipos deberían probar la finalización de tareas, la recuperación de errores de herramientas, el comportamiento de rechazo, la latencia y el número de tokens de razonamiento consumidos, no solo una puntuación agregada de benchmark. La diferencia de cómputo del 62% entre max y xhigh recuerda que un nivel más capaz puede cambiar la economía unitaria incluso antes de que un proveedor publique un precio separado.

El próximo lanzamiento de pesos abiertos podría ampliar el impacto del modelo, especialmente para organizaciones que necesitan un despliegue privado o un control más estricto sobre los datos y la infraestructura de inferencia. Pero sin detalles sobre calendario, pesos, licencia, requisitos de hardware y paridad con el modelo alojado, los compradores deberían tratar esa opción como una posibilidad futura y no como una vía de despliegue actual.

Para los rivales, el precio es estratégicamente importante. Meta aún no está demostrando un liderazgo indiscutible, pero puede estar reduciendo el coste de un modelo que funciona lo suficientemente bien para muchas cargas de trabajo agentivas. Eso puede presionar a los proveedores para competir en economía de inferencia, no solo en resultados de benchmark.

Qué vigilar a continuación

La primera señal será si Meta lleva Muse Spark 1.3 max de la vista previa para socios a disponibilidad general después de las pruebas de seguridad. Su precio final de API determinará si la ventaja informada de 0,55 dólares por tarea se mantiene fuera de la comparación actual.

Los desarrolladores también deberían vigilar el anuncio de pesos abiertos por su licencia y la paridad del modelo. Las evaluaciones independientes en tareas reales de producción importarán más que el Intelligence Index por sí solo, especialmente en fiabilidad factual, recuperación tras el uso de herramientas y tasas de rechazo.

Por último, la siguiente versión mostrará si Meta puede sostener su rápido ritmo de lanzamientos sin sacrificar fiabilidad. Las regresiones informadas en AA-LCR y AA-Omniscience hacen que ese equilibrio sea una medida más importante que otro benchmark único de titulares.

Perspectiva de Creati.ai

Muse Spark 1.3 se entiende mejor como un fuerte reto de valor, no como una toma definitiva del mercado de modelos de frontera. Meta ha mejorado de forma notable en evaluaciones agentivas y de programación, pero la configuración superior sigue restringida, su precio es desconocido y varios modelos líderes siguen por delante en pruebas importantes.

Para los constructores, el lanzamiento aún podría ser relevante. Si xhigh ofrece un uso fiable de herramientas a las tarifas indicadas por Meta, los equipos sensibles al coste podrían tener una alternativa creíble a modelos más caros. La evidencia decisiva vendrá del despliegue max accesible, las pruebas independientes en producción y el prometido lanzamiento de pesos abiertos, no solo del posicionamiento de Meta.

Anuncios