AI News

L’équipe Qwen d’Alibaba présente en avant-première la prochaine architecture de modèle avec Qwen3.8-Flash-Next, un système multimodal de mélange d’experts conçu pour offrir des performances de grand modèle avec des besoins en calcul nettement inférieurs. Cette sortie est importante parce qu’elle place l’efficacité des coûts au centre de la concurrence entre fournisseurs de modèles, en particulier pour les agents de codage, l’automatisation de bureau et d’autres charges de travail à grand volume.

Selon un reportage de The Decoder, Qwen3.8-Flash-Next contient 125 milliards de paramètres au total mais n’en active que 6 milliards pour chaque token. Le modèle est présenté comme un premier aperçu de l’architecture prévue pour Qwen4, et non simplement comme une autre version incrémentale de la gamme Qwen3 existante.

L’équipe Qwen indique que le modèle obtient de meilleurs résultats que Qwen3.7-Plus pour environ un neuvième du coût d’entraînement. Ces chiffres, ainsi que la tarification signalée pour la version Qwen3.8-Flash orientée production, sont des affirmations du fournisseur et ne doivent pas être considérés comme des benchmarks de performance ou de coût vérifiés indépendamment.

Une architecture sparse visant des coûts plus bas

Qwen3.8-Flash-Next utilise une conception de mélange d’experts. Seule une petite sous-partie de ses paramètres est utilisée pour un token donné, ce qui permet à Alibaba de présenter un modèle doté d’une grande capacité globale sans payer le coût computationnel complet à chaque requête.

L’architecture comprend également une couche d’embeddings N-gram de 51 milliards de paramètres. The Decoder décrit ce composant comme une sorte de dictionnaire de phrases qui stocke les groupes de mots fréquemment rencontrés sous forme d’entrées distinctes. Qwen affirme que la couche peut fonctionner dans la RAM système normale plutôt que de nécessiter que toute cette mémoire reste sur les GPU, ce qui pourrait réduire la pression matérielle à un coût supplémentaire relativement faible.

Le modèle prend en charge nativement une fenêtre de contexte de 262 144 tokens et peut, selon les rapports, étendre cette fenêtre à un million de tokens avec YaRN. Cette capacité pourrait être pertinente pour les dépôts logiciels, les longs documents professionnels et les flux de travail d’agents en plusieurs étapes, même si la prise en charge d’une fenêtre de contexte seule ne prouve pas qu’un modèle peut raisonner de manière fiable sur chaque token qu’il accepte.

Un rapport technique est disponible sur GitHub, tandis que les poids du modèle sont listés sur Hugging Face et ModelScope. Alibaba prépare également Qwen3.8-Flash pour QwenCloud. Le prix signalé est de 0,16 dollar par million de tokens d’entrée et de 0,47 dollar par million de tokens de sortie, l’API devant être mise en service sous peu selon l’équipe Qwen.

Les affirmations de benchmark restent l’argumentaire d’Alibaba

Les comparaisons publiées par Alibaba placent Qwen3.8-Flash-Next face à DeepSeek-V4-Flash et Claude Opus 4.6 d’Anthropic, tous deux décrits dans les sources comme ayant des configurations nettement plus grandes ou plus coûteuses. Le modèle Qwen aurait dominé la plupart des tâches testées.

Les meilleurs résultats rapportés concernent le codage agentique et la productivité au travail. Qwen3.8-Flash-Next a obtenu 58,7 sur DeepSWE et 62,5 sur SWE-bench Pro, selon la comparaison d’Alibaba. Ces benchmarks visent à mesurer si un système d’IA peut inspecter et corriger des projets logiciels de manière autonome. Sur les évaluations orientées productivité, il a obtenu 73,9 sur CoWorkBench, contre 45,1 pour DeepSeek-V4-Flash, et 55,7 sur JobBench, contre 27,6 pour Qwen3.7-Plus.

Les scores rapportés sont plus proches en raisonnement scientifique et en programmation compétitive : 91,7 sur GPQA Diamond et 91,9 sur LiveCodeBench v6. Claude Opus 4.6 aurait conservé un avantage sur Humanity’s Last Exam, un test axé sur des questions multidisciplinaires difficiles.

Ces comparaisons proviennent d’Alibaba et non d’un évaluateur indépendant. Elles peuvent néanmoins fournir des indices utiles sur les tâches pour lesquelles Qwen3.8-Flash-Next a été optimisé, mais la conception des benchmarks, le prompting, les réglages du modèle et l’implémentation peuvent tous influencer les résultats. Les performances réelles en production dépendront de la latence, de l’usage des outils, de la récupération après échec et de la qualité du système environnant de l’équipe de déploiement.

Ce que la sortie signifie pour les développeurs et les acheteurs

Pour les développeurs, l’opportunité principale n’est pas simplement l’accès à un autre modèle. C’est la possibilité d’utiliser un modèle relativement peu coûteux pour des charges de travail où le volume de tokens et les appels répétés dominent le budget. Les assistants de codage, l’analyse de dépôts, le traitement de documents, l’automatisation du support client et les outils internes de bureau peuvent générer des milliers ou des millions de requêtes au modèle, faisant du prix par token et de l’efficacité de sortie des contraintes de conception centrales.

Le prix QwenCloud signalé crée également un point de comparaison plus net pour les équipes qui choisissent entre des API hébergées et un déploiement autogéré. Les poids de Qwen3.8-Flash-Next sur Hugging Face et ModelScope pourraient donner aux organisations davantage de contrôle sur l’infrastructure et la gestion des données, mais faire fonctionner un modèle de 125 milliards de paramètres reste un effort opérationnel considérable, même lorsque seuls 6 milliards de paramètres sont actifs par token. L’activation sparse peut réduire le calcul sans éliminer les défis liés à la mémoire, au réseau, à la diffusion et à la fiabilité.

L’accent apparent du modèle sur les tâches logicielles et de bureau peut aussi influencer la manière dont les équipes l’évaluent. Un modèle performant sur les benchmarks d’agents de codage peut être précieux pour la correction de bugs et la navigation dans les dépôts, mais les acheteurs en production devront tester son comportement avec du code propriétaire, des limites d’autorisation, des appels d’outils et des procédures de rollback. Pour l’IA d’entreprise, une facture de tokens plus faible n’est utile que si le taux d’erreur du système et les besoins de supervision n’annulent pas les économies.

Cette sortie accroît la pression sur un marché déjà orienté vers des prix plus bas. The Decoder rapporte que Qwen3.8-Flash-Next se situe en dessous du fleuron Qwen3.8-Max d’Alibaba tout en coûtant environ un douzième du prix. Si cet écart se maintient dans les charges de travail réelles, les fournisseurs de modèles pourraient séparer de plus en plus les systèmes de raisonnement premium des modèles à débit élevé et moins chers, plutôt que de s’attendre à ce qu’un seul modèle couvre tous les cas d’usage.

Ce qu’il faut surveiller ensuite

Le premier signal sera de savoir si Qwen3.8-Flash devient largement accessible via QwenCloud aux prix indiqués et si la latence réelle correspond à la proposition de coût. Les développeurs devraient aussi suivre les évaluations indépendantes du codage, de l’automatisation de bureau, de la récupération à long contexte et de la fiabilité d’usage des outils.

La feuille de route Qwen4 est un autre point de suivi important. Qwen3.8-Flash-Next est décrit comme un aperçu d’architecture, donc les futures versions montreront si la couche d’embeddings N-gram et d’autres techniques de modèles sparse deviennent des éléments stables des modèles principaux d’Alibaba. Les résultats de service du modèle compteront autant que les scores de benchmark : l’utilisation de la mémoire GPU, les besoins en RAM système, le débit et le comportement de mise à l’échelle détermineront si l’architecture est économique en dehors de l’infrastructure propre à Alibaba.

Enfin, les acheteurs d’entreprise devraient suivre les licences, les contrôles de données, la disponibilité régionale et les conditions de support pour les versions hébergées comme téléchargeables. Ces détails décideront si le modèle peut passer de l’expérimentation à des flux de travail réglementés ou critiques pour l’activité.

Perspective Creati.ai

Qwen3.8-Flash-Next est important moins parce qu’Alibaba affirme avoir dépassé tous ses rivaux que parce qu’il fait de l’efficacité elle-même l’histoire du produit. Un modèle sparse, à moindre coût, destiné au codage et au travail de bureau pourrait permettre aux équipes d’exécuter davantage d’étapes d’agent, des évaluations plus larges et une automatisation plus fréquente sans se rabattre par défaut sur les systèmes de pointe les plus coûteux.

Les affirmations demandent encore une validation extérieure, et un faible nombre d’activations ne se traduit pas automatiquement par un faible coût total de déploiement. Mais si l’architecture de Qwen fournit une fiabilité comparable dans des flux de travail réels, l’avantage concurrentiel pourrait passer du simple nombre de paramètres à la capacité d’un modèle à accomplir un travail utile de manière économique et constante.

Vedettes

Alibaba présente l’architecture Qwen4 avec la Qwen3.8-Flash-Next à faible coût

L’équipe Qwen d’Alibaba présente Qwen4 avec un modèle sparse conçu pour réduire les coûts d’entraînement et d’inférence tout en ciblant les flux de travail de codage et de bureau.