AI News

Команда Qwen от Alibaba представляет предварительный взгляд на следующую архитектуру модели с помощью Qwen3.8-Flash-Next — мультимодальной системы mixture-of-experts, созданной для обеспечения производительности уровня больших моделей при существенно меньших вычислительных требованиях. Этот релиз важен, потому что он ставит эффективность затрат в центр конкуренции между поставщиками моделей, особенно для агентов программирования, офисной автоматизации и других высоконагруженных сценариев.

Согласно материалу The Decoder, Qwen3.8-Flash-Next содержит 125 миллиардов параметров в сумме, но активирует только 6 миллиардов на каждый токен. Модель представлена как ранний взгляд на архитектуру, запланированную для Qwen4, а не просто как ещё один инкрементальный релиз в существующей линейке Qwen3.

Команда Qwen утверждает, что модель показывает более сильные результаты, чем Qwen3.7-Plus, примерно при одной девятой стоимости обучения. Эти цифры, а также заявленная цена производственной версии Qwen3.8-Flash, являются заявлениями поставщика и не должны рассматриваться как независимо подтверждённые бенчмарки производительности или стоимости.

Разреженная архитектура, нацеленная на снижение затрат

Qwen3.8-Flash-Next использует дизайн mixture-of-experts. Для любого конкретного токена используется лишь небольшая подмножество его параметров, что позволяет Alibaba рекламировать модель с большой общей ёмкостью, не оплачивая полную вычислительную стоимость на каждый запрос.

Архитектура также включает N-gram embedding-слой на 51 миллиард параметров. The Decoder описывает этот компонент как своего рода словарь фраз, который хранит часто встречающиеся группы слов как отдельные записи. Qwen говорит, что слой может работать в обычной системной RAM, не требуя, чтобы вся эта память оставалась на GPU, что потенциально снижает аппаратную нагрузку при сравнительно низкой дополнительной стоимости.

Модель нативно поддерживает контекстное окно в 262 144 токена и, как сообщается, может расширять его до одного миллиона токенов с помощью YaRN. Такая ёмкость может быть важна для программных репозиториев, длинных деловых документов и многошаговых агентных рабочих процессов, хотя одна лишь поддержка большого контекстного окна не доказывает, что модель может надёжно рассуждать по каждому принятому токену.

Технический отчёт доступен на GitHub, а веса модели размещены на Hugging Face и ModelScope. Alibaba также готовит Qwen3.8-Flash для QwenCloud. Сообщаемая цена составляет 0,16 доллара за миллион входных токенов и 0,47 доллара за миллион выходных токенов, при этом API, как ожидается, скоро будет запущен, по словам команды Qwen.

Заявления о бенчмарках по-прежнему являются доказательной базой Alibaba

Опубликованные Alibaba сравнения противопоставляют Qwen3.8-Flash-Next DeepSeek-V4-Flash и Claude Opus 4.6 от Anthropic, которые в исходных материалах описаны как имеющие существенно более крупные или более дорогие конфигурации. Сообщается, что модель Qwen лидировала в большинстве тестируемых задач.

Наиболее сильные результаты, по сообщениям, получены в агентном кодинге и офисной продуктивности. По сравнению Alibaba, Qwen3.8-Flash-Next набрал 58,7 на DeepSWE и 62,5 на SWE-bench Pro. Эти бенчмарки предназначены для оценки того, может ли ИИ-система самостоятельно анализировать и исправлять программные проекты. В продуктивностных оценках он получил 73,9 на CoWorkBench против 45,1 у DeepSeek-V4-Flash и 55,7 на JobBench против 27,6 у Qwen3.7-Plus.

Сообщаемые результаты ближе друг к другу в научном рассуждении и соревновательном программировании: 91,7 на GPQA Diamond и 91,9 на LiveCodeBench v6. Claude Opus 4.6, как сообщается, сохранил преимущество на Humanity’s Last Exam — тесте, сфокусированном на сложных междисциплинарных вопросах.

Эти сравнения исходят от Alibaba, а не от независимого оценщика. Тем не менее они могут дать полезные ориентиры о задачах, под которые оптимизировался Qwen3.8-Flash-Next, но на результаты влияют и дизайн бенчмарка, и промптинг, и настройки модели, и реализация. Реальная производительность в продакшене будет зависеть от задержки, использования инструментов, восстановления после сбоев и качества окружающей системы команды внедрения.

Что означает релиз для разработчиков и покупателей

Для разработчиков основная возможность — не просто доступ к ещё одной модели. Это шанс использовать сравнительно недорогую модель для задач, где объём токенов и повторные вызовы доминируют в бюджете. Ассистенты кодинга, анализ репозиториев, обработка документов, автоматизация поддержки клиентов и внутренние рабочие инструменты могут генерировать тысячи или миллионы запросов к модели, делая цену за токен и эффективность вывода ключевыми ограничениями дизайна.

Сообщаемая цена QwenCloud также создаёт более чёткую точку сравнения для команд, выбирающих между хостинговыми API и самостоятельным развёртыванием. Веса Qwen3.8-Flash-Next на Hugging Face и ModelScope могут дать организациям больший контроль над инфраструктурой и обработкой данных, но запуск модели с 125 миллиардами параметров остаётся серьёзной операционной задачей, даже когда активно лишь 6 миллиардов параметров на токен. Разреженная активация может снизить вычисления, но не устраняет проблемы памяти, сети, обслуживания и надёжности.

Очевидный акцент модели на программных и офисных задачах может также влиять на то, как команды её оценивают. Модель, хорошо показывающая себя в бенчмарках кодинговых агентов, может быть ценной для исправления ошибок и навигации по репозиториям, но покупателям в продакшене нужно будет тестировать её поведение на проприетарном коде, границах прав доступа, вызовах инструментов и процедурах отката. Для корпоративного ИИ более низкий счёт за токены полезен только если уровень ошибок системы и требования к надзору не съедают экономию.

Релиз усиливает давление на рынок, уже движущийся к более низким ценам. The Decoder сообщает, что Qwen3.8-Flash-Next уступает флагману Alibaba Qwen3.8-Max, но стоит примерно в двенадцать раз меньше. Если этот разрыв сохранится в практических сценариях, поставщики моделей могут всё чаще разделять премиальные системы рассуждения и более дешёвые модели с высокой пропускной способностью, а не ожидать, что одна модель покроет все случаи использования.

На что смотреть дальше

Первым сигналом станет то, станет ли Qwen3.8-Flash широко доступен через QwenCloud по заявленным ценам и будет ли фактическая задержка соответствовать экономической модели. Разработчикам также стоит следить за независимыми оценками кодинга, офисной автоматизации, длинного контекстного поиска и надёжности использования инструментов.

Дорожная карта Qwen4 — ещё один важный следующий пункт. Qwen3.8-Flash-Next описан как предварительный взгляд на архитектуру, поэтому будущие релизы покажут, станут ли N-gram embedding-слой и другие методы разреженных моделей стабильной частью основных моделей Alibaba. Результаты обслуживания модели будут важны не меньше, чем оценки в бенчмарках: использование памяти GPU, требования к системной RAM, пропускная способность и поведение при масштабировании определят, будет ли архитектура экономичной вне собственной инфраструктуры Alibaba.

Наконец, корпоративным покупателям следует отслеживать лицензирование, контроль данных, региональную доступность и условия поддержки как для хостинговых, так и для загружаемых версий. Эти детали решат, сможет ли модель перейти от экспериментов к регулируемым или критически важным для бизнеса рабочим процессам.

Взгляд Creati.ai

Qwen3.8-Flash-Next важен не столько потому, что Alibaba заявляет о превосходстве над всеми соперниками, сколько потому, что делает саму эффективность частью истории продукта. Разреженная, более дешёвая модель, ориентированная на кодинг и офисную работу, может позволить командам выполнять больше агентных шагов, более широкие оценки и более частую автоматизацию, не переключаясь по умолчанию на самые дорогие frontier-системы.

Заявления всё ещё требуют внешней валидации, и низкое число активированных параметров не означает автоматически низкую общую стоимость внедрения. Но если архитектура Qwen обеспечит сопоставимую надёжность в реальных рабочих процессах, конкурентное преимущество может сместиться от простого числа параметров к тому, насколько дёшево и последовательно модель способна выполнять полезную работу.

Рекомендуемые

Alibaba анонсирует архитектуру Qwen4 с недорогой Qwen3.8-Flash-Next

Команда Qwen от Alibaba представляет Qwen4 с разреженной моделью, призванной сократить затраты на обучение и инференс, ориентируясь на рабочие процессы кодинга и офисной работы.