Qwen3.8-Omni-Flash vise Gemini Flash avec des coûts API multimodaux plus bas

Qwen3.8-Omni-Flash d’Alibaba associe traitement audio-vidéo et outils d’agent à des prix bien inférieurs à ceux de Gemini Flash, intensifiant la concurrence des modèles multimodaux.

AI News

L’équipe Qwen d’Alibaba a présenté Qwen3.8-Omni-Flash, un modèle multimodal destiné aux agents d’IA, capable de traiter conjointement l’audio et la vidéo, d’utiliser des outils et de gérer de longs contextes. Ce lancement place directement le modèle face à Gemini 3.8 Flash de Google, à la fois sur les capacités et sur le prix, Qwen annonçant des résultats comparables sur certains benchmarks audio-vidéo avec des tarifs API nettement plus bas.

L’écart de prix est l’élément commercial immédiat. The Decoder rapporte que Qwen3.8-Omni-Flash coûte 0,15 $ par million de jetons d’entrée et 0,47 $ par million de jetons de sortie, contre des tarifs de lancement de Gemini 3.8 Flash de 0,75 $ et 3,75 $ respectivement. Le modèle est disponible via Qwen Studio, Qwen Cloud et une API, offrant aux développeurs plusieurs points d’entrée pour les tests et le déploiement.

La comparaison repose principalement sur les propres affirmations de performance de Qwen, tandis que la deuxième source du groupe ne fournit pas le texte intégral de l’article pour une vérification indépendante. Cela rend la disponibilité du produit et son prix publiés plus clairs que l’affirmation selon laquelle il égalerait le modèle de Google sur des charges de travail multimodales.

Un modèle multimodal conçu pour les flux de travail d’agent

Qwen décrit Qwen3.8-Omni-Flash comme son premier modèle multimodal conçu spécifiquement pour les agents d’IA. Au lieu de traiter l’audio et la vidéo comme des entrées séparées, le modèle est censé les interpréter ensemble, tirer des conclusions à partir de signaux combinés et invoquer des outils pour accomplir des tâches.

Parmi les exemples cités dans les articles figurent le montage de vlogs, la traduction de courtes vidéos et le résumé de films. Il s’agit d’applications au niveau du flux de travail plutôt que de simples questions-réponses. Un système peut devoir identifier la parole, comprendre les événements visuels, préserver le timing ou le contexte du locuteur, puis appeler un outil externe pour produire une sortie éditée ou annotée.

Le modèle prend également en charge une fenêtre de contexte d’un million de jetons, selon The Decoder. Cette capacité pourrait être importante pour de longs enregistrements, de grandes collections de notes vidéo ou des applications combinant des médias sources avec des instructions et documents de référence volumineux. Une grande fenêtre de contexte ne garantit toutefois pas à elle seule un raisonnement fiable sur de longues vidéos ; les développeurs devront toujours tester eux-mêmes la qualité de récupération, la latence et la cohérence des sorties sur leurs propres médias.

Qwen associe le modèle à Qwen-MM-Plugins, un ensemble open source de composants pour des tâches telles que le montage vidéo, la reconnaissance des locuteurs et les notes vidéo en PDF. Les plugins sont présentés comme utilisables avec Claude Code, Gemini CLI et Qwen Code. Qwen-Live Harness est destiné à prendre en charge l’interaction en temps réel via une caméra et un microphone.

Le défi tarifaire lancé à Gemini Flash

Les tarifs API rapportés créent une différence significative pour les applications qui traitent de grands volumes de médias. Qwen estime le coût de l’audio en entrée à moins de 0,01 $ par heure. Il estime qu’une vidéo 720p avec audio, échantillonnée à une image par seconde, coûte environ 0,20 $, hors frais de réponse.

En comparaison, The Decoder rapporte des prix de lancement de Gemini 3.8 Flash à 0,75 $ par million de jetons d’entrée et 3,75 $ par million de jetons de sortie. Il indique également que les tarifs de Google doivent doubler le 1er janvier 2027. L’article ne fournit pas de modèle de coût complet pour une charge de travail audio ou vidéo équivalente ; la comparaison des prix au jeton ne doit donc pas être considérée comme une estimation universelle du coût total de l’application.

Les factures réelles dépendront de facteurs tels que la durée des médias, l’échantillonnage des images, la représentation audio, la longueur des sorties, le contexte répété, les appels d’outils, le stockage et le post-traitement. Néanmoins, l’écart entre les tarifs de jetons annoncés pourrait influencer le choix du modèle pour les produits très gourmands en médias, en particulier lorsque l’application doit analyser de nombreuses heures d’enregistrements ou de vastes bibliothèques vidéo.

Le prix plus bas donne aussi à Qwen une marge pour la concurrence expérimentale. Les startups et les équipes de recherche peuvent utiliser une inférence moins coûteuse pour tester des fonctionnalités multimodales avant de s’engager dans une architecture de production plus importante. Pour les acheteurs en entreprise, la question pertinente sera de savoir si les économies survivent au flux de travail complet, y compris la modération, l’observabilité, les réessais et toute revue humaine nécessaire en cas d’erreur.

Ce que montrent — et ne montrent pas — les preuves de benchmark

The Decoder affirme que Qwen3.8-Omni-Flash se rapproche de Gemini 3.8 Flash sur les tâches audio-vidéo. Les éléments disponibles n’indiquent pas les tableaux complets de benchmark, les invites de test, les dates d’évaluation ni la configuration exacte de Gemini utilisée. En conséquence, la comparaison doit être considérée comme une affirmation de performance rapportée par le fournisseur ou les médias, et non comme un classement global établi de manière indépendante.

L’équivalence sur les benchmarks peut aussi varier fortement selon la tâche. Un modèle performant sur des questions à partir de courtes vidéos peut être moins fiable pour identifier des locuteurs sur de longs enregistrements, maintenir l’ordre temporel, suivre des instructions de montage ou utiliser des outils sans supervision. Les développeurs évaluant le modèle devraient reproduire les tests sur des entrées représentatives et mesurer les taux d’échec, la latence, le coût par tâche accomplie et la quantité de corrections manuelles nécessaires.

Le titre de Startup Fortune présente le lancement comme incluant une réduction de 98 % des prix audio et la publication de poids ouverts. Le texte intégral de l’article n’était pas disponible dans les éléments fournis, de sorte que ces détails ne peuvent pas être vérifiés indépendamment ici. Les informations disponibles confirment toutefois que Qwen propose le modèle via ses canaux cloud et API, et qu’il a publié Qwen-MM-Plugins sous une étiquette open source. Elles ne fournissent pas assez de détails pour confirmer l’étendue, la licence ou les exigences de déploiement d’une éventuelle publication des poids du modèle.

Pourquoi les bâtisseurs et les entreprises devraient s’y intéresser

Pour les équipes produit, Qwen3.8-Omni-Flash élargit l’ensemble des modèles capables de combiner perception et action dans un seul flux de travail. Un produit de support vidéo, par exemple, pourrait transcrire un appel, identifier le contexte visuel, résumer les moments clés et déclencher un traitement en aval sans maintenir des modèles totalement séparés pour chaque étape.

Cette consolidation peut simplifier l’orchestration, mais elle concentre aussi les risques. Si le même modèle entend mal un locuteur, manque un événement visuel puis agit sur cette mauvaise interprétation, l’erreur peut se propager rapidement dans le flux de travail. Les équipes auront besoin d’autorisations claires pour les outils, d’une validation humaine pour les actions lourdes de conséquences et de journaux conservant les preuves audio-vidéo derrière chaque décision.

La disponibilité via Qwen Studio et Qwen Cloud abaisse la barrière à l’évaluation. L’écosystème de plugins peut également réduire le travail d’intégration pour les développeurs utilisant déjà des agents de codage comme Claude Code, Gemini CLI ou Qwen Code. L’adoption en entreprise dépendra d’autres facteurs non couverts par la couverture fournie, notamment la résidence des données, les politiques de conservation, les engagements de niveau de service, les revues de sécurité et le support commercial.

Pour Google, cette annonce ajoute une pression sur les prix de Gemini Flash dans une catégorie où l’économie de l’inférence peut déterminer quelles fonctionnalités médias sont viables. Pour Qwen, des tarifs plus bas ne suffiront pas à eux seuls : les développeurs compareront la fiabilité, les outils, la documentation, la capacité et la prévisibilité opérationnelle en plus des scores de benchmark.

Ce qu’il faut surveiller ensuite

Les prochains signaux utiles seront des évaluations indépendantes publiant les définitions des tâches, les tailles des médias, les méthodes d’échantillonnage et les calculs complets des coûts pour Qwen3.8-Omni-Flash et Gemini 3.8 Flash. Ces tests devraient inclure la vidéo longue durée, l’audio bruité, la parole multilingue, l’attribution des locuteurs, l’exécution d’outils et la récupération d’erreurs.

Les développeurs devraient également surveiller les détails formels de licence et de déploiement du modèle, surtout si les « poids ouverts » deviennent un élément central du positionnement de Qwen. Les quotas API, la disponibilité régionale, la latence sous charge et les changements de tarification introductive de Google détermineront si l’avantage affiché persiste en production.

Les signaux d’adoption seront plus significatifs lorsqu’ils montreront des flux de travail complets plutôt que de simples appels au modèle. Les intégrations démontrant un montage vidéo fiable, une analyse de réunions, une interaction en direct avec caméra ou une recherche média liée à des documents indiqueront si l’orientation agentique de Qwen se traduit en produits utilisables.

Point de vue Creati.ai

Qwen3.8-Omni-Flash compte moins pour sa prétention à gagner un benchmark unique que pour sa combinaison d’entrées multimodales, d’utilisation d’outils et de tarification agressive dans une seule offre pour développeurs. Cette combinaison pourrait rendre économiquement viables des fonctionnalités audio-vidéo plus riches pour des équipes qui les limitaient auparavant à de petits pilotes.

Le cas le plus solide en faveur de l’adoption dépendra d’éléments de preuve au-delà des tarifs mis en avant. Les acheteurs devraient valider la qualité de bout en bout des tâches et les exigences de gouvernance avant de changer de charge de travail, tandis que les bâtisseurs devraient considérer le modèle comme un candidat prometteur pour des expérimentations contrôlées plutôt que supposer qu’une baisse des coûts d’inférence entraîne automatiquement une baisse du coût total d’exploitation.

Publicités