Muse Spark 1.3 от Meta сокращает разрыв в производительности, одновременно атакуя конкурентов ценой

Muse Spark 1.3 от Meta улучшает показатели в агентных задачах и программировании, но низкая стоимость за задачу может оказаться важнее, чем его все еще незавершенный вызов на переднем крае.

AI News

Meta выпустила Muse Spark 1.3, позиционируя новейшую модель в своей быстро расширяющейся серии как более близкого конкурента предложениям Anthropic и OpenAI. Наиболее заметный рост модель показывает в агентной работе, программировании и бенчмарках профессиональных задач, а ее цена дает разработчикам повод рассмотреть ее, даже несмотря на то, что самая мощная версия широко недоступна.

Релиз разделен на два уровня производительности. Версия xhigh доступна через Muse Code и Meta Model API, тогда как более мощная версия max остается в ограниченном партнерском превью до завершения дополнительных проверок безопасности, согласно сообщению The Decoder со ссылкой на Artificial Analysis. Meta также заявила, что версия с открытыми весами появится позже, хотя имеющиеся данные не указывают ни дату выпуска, ни условия лицензии, ни то, будет ли она соответствовать превью-модели.

Этот разрыв в доступности — центральная часть истории. Лучшие результаты Meta в бенчмарках дает max, но большинство разработчиков пока могут использовать только xhigh. Поэтому конкурентная позиция модели зависит не только от тестовых баллов, но и от того, какой уровень смогут развернуть клиенты, сколько будет стоить версия max и расширит ли ее проверка безопасности доступ.

Быстро развивающаяся серия моделей достигает версии 1.3

Muse Spark 1.3 — это четвертая модель серии за пять месяцев. Серия стартовала в апреле, затем в июле вышла версия 1.1, а в августе — 1.2, сообщает The Decoder. Короткий цикл релизов отражает, как быстро ведущие поставщики моделей итеративно улучшают рассуждение, использование инструментов и производительность в разработке ПО.

Meta сохранила стандартные цены на токены на уровне 1,25 доллара за миллион входных токенов и 4,25 доллара за миллион выходных токенов, говорится в отчете. Однако пользоваться моделью дороже, чем Muse Spark 1.2, которая в сравнении, на которое ссылается The Decoder, стоила 0,40 доллара за задачу. Версия 1.3 по той же индексной оценке обходится в 0,55 доллара за задачу.

Эта цифра — самый очевидный коммерческий отличительный признак релиза. Artificial Analysis установила, что ни одна модель, набирающая 59 баллов и выше в ее Intelligence Index, не была дешевле Muse Spark 1.3. Сопоставимые конкуренты в этом диапазоне производительности стоили от 0,94 до 1,23 доллара за задачу, говорится в отчете.

Это сравнение не следует воспринимать как универсальную стоимость производства. Экономика на уровне одной задачи зависит от длины промпта, длины ответа, вызовов инструментов, повторных попыток, окон контекста и архитектуры приложения. Тем не менее ценовой разрыв может быть значимым для команд, запускающих высоконагруженные кодирующие агенты или автоматизацию рабочих процессов, где затраты на инференс могут быстро превысить стоимость самого ПО.

Агентные бенчмарки показывают наибольший рост

Artificial Analysis присвоила Muse Spark 1.3 62 балла для max и 61 для xhigh в Intelligence Index, тогда как у версии 1.2 было 57, а у версии 1.1 — 53. Рост частично объясняется весами индекса: на GDPval-AA v2 приходится 20% оценки, на Terminal-Bench 2.1 — 16%, а на τ³-Bench Banking — 14%.

Именно в этих областях новейшая модель Meta и улучшилась сильнее всего. В τ³-Bench Banking, который измеряет способность агента работать с инструментами в симулированной банковской среде, max набрала 52% — лучший результат в сравнении. Доступный уровень xhigh получил 47%, сравнявшись с Claude Fable 5.1 в конфигурации max и GLM-5.3-Flash, но не опередив их.

Модель также улучшилась в Terminal-Bench 2.1 — тесте кодирования через терминал. Показатель xhigh вырос с 80% у версии 1.2 до 85%, а max достигла 86%. Claude Fable 5.1 по-прежнему опережала ее с 91,4% в max, 91,0% в xhigh и 89,9% в high, согласно приведенным результатам Artificial Analysis.

В GDPval-AA v2, который охватывает 220 профессиональных задач и использует эталонную оценку человеческих экспертов в 1 000, Muse Spark 1.3 выросла с 1 615 до 1 709 для xhigh и до 1 754 для max. Claude Fable 5.1 max набрала 1 853. В отчете также отмечено, что max использовала на 62% больше токенов рассуждения, чем xhigh, что говорит о том, что часть преимущества связана с дополнительными вычислениями инференса, а не с равномерным ростом способностей.

Данные многообещающие, но это не чистая победа на переднем крае

Имеющиеся данные позволяют сделать более сдержанный вывод, чем утверждение Meta о том, что Muse Spark 1.3 соперничает с Anthropic и OpenAI или догоняет их. Несколько тестов показывают существенный прогресс, но модель не лидирует последовательно по всему набору опубликованных оценок.

В GPQA Diamond, экспертном научном бенчмарке, Muse Spark поднялась с 90% до 94%. Это вывело ее вблизи группы лидеров, но ниже Gemini 3.8 Flash high с 95,3% и Grok 4.6 high с 94,9%. В CritPt, тесте по исследовательской физике, модель улучшилась с 18% до 26%, тогда как GPT-5.6 Sol max показала 32,3%, а Claude Fable 5.1 xhigh — 31,1%.

Две метрики, о которых сообщалось, снизились. AA-LCR упал с 83% до 79%, а фактическая точность в AA-Omniscience снизилась максимум на три пункта. The Decoder объяснил это увеличение числа отказов, когда модель была неуверена. Для корпоративных внедрений такой компромисс важен: модель, избегающая необоснованных ответов, может снизить некоторые риски, но чрезмерные отказы также могут нарушать рабочие процессы, где требуется полезная эскалация или уточнение.

Это независимые результаты бенчмарков, опубликованные Artificial Analysis, а не доказательство превосходства в реальном мире. Более широкие заявления о том, что Muse Spark 1.3 конкурирует с ведущими моделями Anthropic и OpenAI, исходят от Meta и были отражены в материалах Yahoo Finance Canada, Digital Trends, SiliconANGLE и VentureBeat. Заголовок VentureBeat также подчеркивал, что самые сильные результаты зависят от модели, которую разработчики пока не могут широко использовать. Ни Meta, ни Artificial Analysis не опубликовали здесь цену для уровня max.

Что релиз означает для разработчиков и покупателей

Для команд по продуктам ИИ Muse Spark 1.3 выглядит наиболее уместной там, где использование инструментов и контроль затрат важнее абсолютного лидерства по каждому тесту знаний или рассуждения. Ассистенты программирования, агенты на основе терминала и структурированные бизнес-процессы могут выиграть от улучшений в Terminal-Bench и τ³-Bench Banking, особенно если xhigh доступна через API Meta по указанным ставкам токенов.

Практическая нагрузка по оценке по-прежнему высока. Командам следует тестировать завершение задач, восстановление после ошибок инструментов, поведение отказов, задержку и число потребленных токенов рассуждения — а не только совокупный бенчмарк-скор. Разница в вычислениях между max и xhigh в 62% напоминает, что более мощный уровень может изменить unit economics еще до публикации отдельной цены провайдером.

Предстоящий релиз open-weights может расширить влияние модели, особенно для организаций, которым нужен частный деплой или более жесткий контроль над данными и инфраструктурой инференса. Но без подробностей о сроках, весах, лицензии, требованиях к оборудованию и паритете с хостируемой моделью покупателям следует рассматривать этот вариант как будущую возможность, а не как текущий путь развертывания.

Для конкурентов цена стратегически важна. Meta пока не демонстрирует бесспорное лидерство, но может снижать стоимость модели, которая достаточно хороша для многих агентных сценариев. Это может заставить провайдеров конкурировать не только по бенчмаркам, но и по экономике инференса.

На что смотреть дальше

Первый сигнал будет в том, переведет ли Meta Muse Spark 1.3 max из партнерского превью в общедоступный релиз после тестов безопасности. Итоговая цена API определит, сохранится ли заявленное преимущество в 0,55 доллара за задачу за пределами нынешнего сравнения.

Разработчикам также следует следить за объявлением open-weights в части лицензии и паритета модели. Независимые оценки на реальных производственных задачах будут важнее самого Intelligence Index, особенно в вопросах фактической надежности, восстановления после использования инструментов и частоты отказов.

Наконец, следующая версия покажет, сможет ли Meta сохранить быстрый темп релизов без потери надежности. Сообщенные регрессии по AA-LCR и AA-Omniscience делают этот баланс более важным показателем, чем еще один отдельный заголовочный бенчмарк.

Мнение Creati.ai

Muse Spark 1.3 лучше всего понимать как сильный ценностный вызов, а не как окончательный захват рынка frontier-моделей. Meta заметно улучшила показатели в агентных и кодинговых оценках, но топовая конфигурация по-прежнему ограничена, ее цена неизвестна, а несколько ведущих моделей по-прежнему опережают ее в важных тестах.

Для разработчиков релиз все же может оказаться значимым. Если xhigh обеспечит надежное использование инструментов по заявленным Meta тарифам, чувствительные к стоимости команды могут получить убедительную альтернативу более дорогим моделям. Решающие доказательства придут от доступного развертывания max, независимого тестирования в продакшене и обещанного релиза open-weights — а не только от позиционирования Meta.

Реклама