Qwen-Drive 1.0 d’Alibaba combine perception, planification et assistance en cabine, mais les tests montrent que ses explications peuvent ne pas refléter sa manœuvre réelle.

La division de recherche d’Alibaba a publié Qwen-Drive 1.0, un modèle de conduite conçu pour combiner la perception de l’environnement, la réponse aux questions sur la circulation et la planification d’itinéraire dans un seul système. Le modèle est destiné à soutenir à la fois les fonctions de conduite du véhicule et son cockpit conversationnel, reflétant l’évolution du secteur vers des plateformes de calcul partagées dans les voitures.
Les recherches soulignent également une limitation importante : Qwen-Drive 1.0 peut fournir une raison plausible de freiner ou de tourner sans que cette explication identifie de manière fiable l’événement qui a réellement déclenché sa décision. Dans des tests simulés, le réentraînement a amélioré le taux auquel le véhicule restait sur la route, mais l’écart entre le raisonnement et le comportement est resté présent.
Qwen-Drive 1.0 est basé sur Qwen3.5-4B et ajoute deux composants axés sur la conduite. L’un est un module de perception qui crée une représentation en vue plongeante de l’environnement du véhicule. Il identifie les objets dans l’espace tridimensionnel, marque les zones occupées et reconstruit la configuration de la route.
Le second est un Planning Expert qui utilise les informations internes au modèle pour déterminer les prochains mouvements du véhicule. Ensemble, ces ajouts visent à permettre à un seul système d’interpréter une scène, d’y répondre par des questions et de choisir un itinéraire, plutôt que de répartir ces responsabilités entre plusieurs modèles distincts.
Cette conception unifiée répond à un changement pratique dans le calcul embarqué des véhicules. Selon l’équipe de recherche, les charges de travail d’infodivertissement et de conduite automatisée sont de plus en plus regroupées sur un matériel commun. Un modèle optimisé uniquement pour la conduite pourrait donc créer un second problème : le véhicule aurait toujours besoin d’un autre modèle pour la conversation, les questions générales et les fonctions de cockpit.
Le processus d’entraînement de l’équipe s’est déroulé par étapes. Elle a d’abord entraîné le module de perception, puis a combiné la perception avec la réponse aux questions, et enfin a ajouté la planification d’itinéraire et l’apprentissage par renforcement. Les données d’entraînement comprenaient 24 jeux de données de scènes de circulation disponibles publiquement. Comme ces jeux utilisaient des formats différents et contenaient certaines erreurs, les chercheurs ont utilisé un autre système d’IA pour standardiser les questions et les réponses à partir des données d’origine.
Les chercheurs ont également créé des exemples reliant une action de conduite à une cause déclarée, comme l’identification de l’objet devant déclencher le freinage. Ces données visaient à rendre les décisions du modèle plus compréhensibles, et pas seulement plus précises sur les questions liées à la circulation.
Selon l’article décrit par The Decoder, Qwen-Drive 1.0 a obtenu des résultats nettement meilleurs que le Qwen3.5-4B non modifié sur les questions concernant des scènes de circulation. L’amélioration la plus importante concernait les questions impliquant des relations de cause à effet, notamment pourquoi un véhicule devrait freiner ou tourner.
La recherche suggère aussi que la compréhension spatiale n’émerge pas automatiquement de la description d’images. Lorsque les chercheurs n’ont entraîné que le composant de conduite nouvellement ajouté en laissant le modèle vision-langage sous-jacent inchangé, la précision spatiale est restée faible. Les performances ne se sont améliorées qu’après l’entraînement du modèle de base lui-même sur des tâches spatiales.
L’équipe a utilisé son benchmark HopChain pour examiner ce problème. Le benchmark a montré que les modèles vision-langage pouvaient bien réussir sur des évaluations classiques image-texte tout en continuant à mal classer des objets ou à confondre des relations telles que la distance, la position et l’espace libre. Pour la conduite autonome, ces distinctions sont opérationnellement importantes : un feu tricolore lointain et un enfant entrant dans la voie exigent des timings et des réponses différents.
L’apprentissage par renforcement a amélioré le comportement du modèle dans un simulateur. Les chercheurs ont indiqué que le taux de sortie de route est passé de 24 % à 12 % après le réentraînement basé sur la récompense. Cependant, le modèle réentraîné conduisait aussi plus prudemment et parcourait moins de distance. Ce compromis rend le résultat utile comme signal de recherche, mais n’indique pas comment le modèle se comporterait dans le trafic réel.
Le problème des explications est plus grave qu’une simple question de formulation. Le modèle peut mentionner un feu rouge alors qu’un autre usager de la route était la raison la plus immédiate du freinage, ou produire un raisonnement qui ne correspond pas à la manœuvre choisie par le système de planification. En d’autres termes, l’explication générée ne peut pas encore être considérée comme une preuve du processus causal interne du modèle.
Les métriques rapportées doivent aussi être lues avec prudence. Certaines évaluations reposaient sur des procédures ou des environnements de test créés ou reconstruits par les auteurs, et les preuves disponibles n’incluent pas d’essais indépendants sur route. Les chiffres de performance constituent donc des résultats de l’équipe de recherche et non des preuves de sécurité vérifiées de manière externe.
Pour les créateurs d’IA, Qwen-Drive 1.0 plaide en faveur d’un entraînement direct des représentations spatiales plutôt que de supposer qu’un modèle vision-langage performant acquerra une compréhension 3D fiable à partir de données de questions-réponses sur le trafic. Les équipes produit qui travaillent sur des agents d’IA dans des environnements physiques font face à un problème similaire : décrire une scène n’est pas la même chose que prédire comment des actions la modifieront.
Le modèle illustre également la tension entre spécialisation et capacité générale. Le réglage fin axé sur la conduite peut améliorer les performances en circulation tout en provoquant un oubli catastrophique des connaissances acquises lors du préentraînement général. Cette perte est importante dans des situations inhabituelles, où un véhicule peut avoir besoin d’un raisonnement général plutôt que d’un schéma de circulation familier.
Un modèle unique pourrait réduire les doublons entre le cockpit et la pile de conduite, mais il concentre aussi le risque. Si la conversation, la perception, la planification et le contrôle dépendent de composants étroitement liés, les défaillances dans un domaine peuvent en affecter un autre. Les acheteurs industriels et automobiles auraient besoin de preuves non seulement de précision sur les tâches, mais aussi d’isolation entre les fonctions, d’un comportement de repli prévisible et de la capacité d’auditer la raison d’une manœuvre.
L’écart entre les explications et les actions a des implications en matière de sécurité. Les explications peuvent aider les ingénieurs à déboguer un système et améliorer la compréhension par un conducteur d’une décision automatisée, mais elles ne devraient pas servir de substitut à une validation causale. Un modèle qui semble assuré tout en citant le mauvais déclencheur pourrait compliquer l’enquête sur un incident.
Il existe aussi une dimension adversariale. Le contexte de recherche cité par The Decoder inclut des travaux antérieurs montrant que des panneaux visuels placés dans le champ de vision d’une caméra peuvent manipuler le comportement d’un système de conduite, même lorsque ce système détecte correctement les piétons. La combinaison du langage, de la perception et de l’action crée des voies d’entrée supplémentaires que des attaquants pourraient exploiter.
Qwen-Drive 1.0 est mis à disposition pour la recherche via Hugging Face, ModelScope et GitHub. Cet accès devrait permettre aux chercheurs extérieurs d’inspecter l’architecture et de reproduire certaines évaluations, même si la disponibilité ouverte ne constitue pas à elle seule une preuve d’aptitude à la route.
Le suivi le plus important est un test indépendant en dehors du simulateur des auteurs. Les chercheurs et les équipes automobiles devraient examiner si la réduction annoncée des sorties de route se maintient dans des environnements inconnus, des conditions météorologiques variées, différents agencements routiers et des séquences plus longues où de petites erreurs s’accumulent.
Un autre signal sera de savoir si les versions futures améliorent le lien entre la planification interne et les explications générées. Des évaluations utiles compareraient la cause citée avec l’objet réel, la position et le moment qui ont modifié la trajectoire du véhicule, plutôt que de noter les explications uniquement sur leur plausibilité linguistique.
La communauté de recherche surveillera aussi l’équilibre entre prudence et progrès. Qwen-Drive 1.0 est resté plus souvent sur la route après l’apprentissage par renforcement, mais a parcouru moins de distance. Les futurs systèmes devront montrer comment ils gèrent ce compromis sans devenir simplement excessivement conservateurs.
Enfin, des travaux externes devraient tester si l’approche unifiée cockpit-conduite peut préserver les connaissances générales tout en respectant des exigences strictes de latence, de fiabilité et de sécurité. La publication pourrait être surtout utile comme plateforme pour cette investigation, et non comme preuve que le problème est résolu.
Qwen-Drive 1.0 est remarquable moins parce qu’il regroupe plusieurs fonctions automobiles dans un seul modèle que parce qu’il met en lumière le coût d’ingénierie de cette approche. Le travail montre que la compétence spatiale doit être entraînée délibérément, tandis que les connaissances généralistes doivent être protégées d’une spécialisation excessive.
Son écart d’explication est l’avertissement le plus clair. Pour l’IA critique pour la sécurité, un récit convaincant d’une décision n’est utile que lorsqu’il reflète les causes réelles de cette décision. Tant que cette relation n’aura pas été démontrée indépendamment, Qwen-Drive 1.0 doit être considéré comme une publication de recherche importante et une cible d’évaluation ouverte, et non comme un système de conduite autonome validé.