O Qwen-Drive 1.0 da Alibaba combina percepção, planejamento e assistência de cabine, mas testes mostram que suas explicações podem não refletir sua manobra real.

A divisão de pesquisa da Alibaba lançou o Qwen-Drive 1.0, um modelo de direção projetado para combinar percepção ambiental, respostas a perguntas sobre trânsito e planejamento de rotas em um único sistema. O modelo foi criado para dar suporte tanto às funções de condução do veículo quanto à sua cabine conversacional, refletindo a mudança da indústria em direção a plataformas de computação compartilhadas dentro dos carros.
A pesquisa também destaca uma limitação importante: o Qwen-Drive 1.0 pode fornecer uma razão plausível para frear ou virar sem que essa explicação identifique de forma confiável o evento que realmente levou à sua decisão. Em testes simulados, o retreinamento melhorou a taxa com que o veículo permanecia na estrada, mas a lacuna entre raciocínio e comportamento permaneceu.
O Qwen-Drive 1.0 é baseado no Qwen3.5-4B e adiciona dois componentes focados em direção. Um é um módulo de percepção que cria uma representação em vista aérea do entorno do veículo. Ele identifica objetos no espaço tridimensional, marca áreas ocupadas e reconstrói o traçado da via.
O segundo é um Planning Expert que usa informações dentro do modelo para determinar os próximos movimentos do veículo. Juntas, essas adições têm o objetivo de permitir que um único sistema interprete uma cena, responda perguntas sobre ela e selecione uma rota, em vez de distribuir essas responsabilidades entre modelos separados.
Esse design unificado responde a uma mudança prática na computação veicular. Segundo a equipe de pesquisa, as cargas de trabalho de infoentretenimento e direção automatizada estão sendo cada vez mais reunidas em hardware comum. Um modelo otimizado apenas para direção pode, portanto, criar um segundo problema: o veículo ainda precisaria de outro modelo para conversação, perguntas gerais e funções de cabine.
O processo de treinamento da equipe ocorreu em etapas. Primeiro, treinou o módulo de percepção, depois combinou percepção com resposta a perguntas e, por fim, adicionou planejamento de rotas e aprendizado por reforço. Os dados de treinamento incluíram 24 conjuntos de dados de cenas de trânsito disponíveis publicamente. Como esses conjuntos usavam formatos diferentes e continham alguns erros, os pesquisadores usaram outro sistema de IA para padronizar perguntas e respostas com base nos dados originais.
Os pesquisadores também criaram exemplos que conectam uma ação de direção a uma causa declarada, como identificar o objeto que deve acionar a frenagem. Esses dados tinham como objetivo tornar as decisões do modelo mais compreensíveis, e não apenas mais precisas em perguntas relacionadas ao trânsito.
De acordo com o artigo descrito pelo The Decoder, o Qwen-Drive 1.0 teve desempenho substancialmente melhor do que o Qwen3.5-4B sem modificações em perguntas sobre cenas de trânsito. A maior melhoria apareceu em questões envolvendo causa e efeito, incluindo por que um veículo deveria frear ou virar.
A pesquisa também sugere que a compreensão espacial não surge automaticamente da descrição de imagens. Quando os pesquisadores treinaram apenas o componente de direção recém-adicionado e deixaram o modelo visão-linguagem subjacente inalterado, a precisão espacial permaneceu fraca. O desempenho só melhorou depois que o próprio modelo base foi treinado em tarefas espaciais.
A equipe usou seu benchmark HopChain para examinar esse problema. O benchmark mostrou que modelos visão-linguagem podem ter bom desempenho em avaliações convencionais de imagem e texto e, ainda assim, classificar incorretamente objetos ou confundir relações como distância, posição e espaço livre. Para a direção autônoma, essas distinções são operacionalmente importantes: um semáforo distante e uma criança entrando na faixa exigem tempos e respostas diferentes.
O aprendizado por reforço melhorou o comportamento do modelo em um simulador. Os pesquisadores relataram que a taxa de saída da pista caiu de 24% para 12% após o retreinamento baseado em recompensa. No entanto, o modelo retreinado também dirigia com mais cautela e percorria menos distância. Essa compensação torna o resultado útil como sinal de pesquisa, mas não estabelece como o modelo se comportaria no trânsito real.
O problema das explicações é mais sério do que uma questão de redação. O modelo pode mencionar um semáforo vermelho quando outro usuário da via era a razão mais imediata para frear, ou produzir um raciocínio que não corresponde à manobra escolhida pelo sistema de planejamento. Em outras palavras, a explicação gerada ainda não pode ser tratada como prova do processo causal interno do modelo.
As métricas relatadas também precisam ser lidas com cautela. Algumas avaliações dependeram de procedimentos ou ambientes de teste criados ou reconstruídos pelos autores, e as evidências disponíveis não incluem testes independentes em vias públicas. As cifras de desempenho, portanto, são resultados da equipe de pesquisa e não evidências de segurança verificadas externamente.
Para os desenvolvedores de IA, o Qwen-Drive 1.0 mostra que vale a pena treinar representações espaciais diretamente, em vez de presumir que um modelo visão-linguagem competente adquirirá compreensão 3D confiável a partir de dados de perguntas e respostas sobre trânsito. As equipes de produto que trabalham com agentes de IA em ambientes físicos enfrentam um problema semelhante: descrever uma cena não é o mesmo que prever como as ações a mudarão.
O modelo também ilustra a tensão entre especialização e capacidade geral. O ajuste fino focado em direção pode melhorar o desempenho no trânsito enquanto causa esquecimento catastrófico do conhecimento adquirido durante o pré-treinamento amplo. Essa perda importa em situações incomuns, nas quais um veículo pode precisar de raciocínio geral em vez de um padrão de trânsito familiar.
Um único modelo pode reduzir a duplicação entre a cabine e a pilha de direção, mas também concentra o risco. Se conversação, percepção, planejamento e controle dependem de componentes fortemente conectados, falhas em uma área podem afetar outra. Compradores empresariais e automotivos precisariam de evidências não apenas de precisão nas tarefas, mas também de isolamento entre funções, comportamento de fallback previsível e capacidade de auditar por que uma manobra ocorreu.
A discrepância entre explicações e ações tem implicações de segurança. Explicações podem ajudar engenheiros a depurar um sistema e podem melhorar a compreensão de um motorista sobre uma decisão automatizada, mas não devem ser usadas como substituto para validação causal. Um modelo que soa confiante enquanto cita o gatilho errado pode dificultar a investigação de incidentes.
Há também uma dimensão adversarial. O contexto de pesquisa citado pelo The Decoder inclui trabalhos anteriores mostrando que sinais visuais colocados no campo de visão de uma câmera podem manipular o comportamento de um sistema de direção, mesmo quando o sistema detecta pedestres corretamente. Combinar linguagem, percepção e ação cria caminhos de entrada adicionais que invasores podem explorar.
O Qwen-Drive 1.0 está sendo disponibilizado para pesquisa via Hugging Face, ModelScope e GitHub. Esse acesso deve permitir que pesquisadores externos inspecionem a arquitetura e reproduzam algumas das avaliações, embora a disponibilidade aberta por si só não constitua evidência de aptidão para rodar nas ruas.
O acompanhamento mais importante é o teste independente fora do simulador dos autores. Pesquisadores e equipes automotivas devem examinar se a redução relatada nas saídas de pista se mantém em ambientes não vistos, condições meteorológicas, layouts de estrada e sequências mais longas nas quais pequenos erros se acumulam.
Outro sinal será se futuras versões melhorarem a ligação entre o planejamento interno e as explicações geradas. Avaliações úteis comparariam a causa citada com o objeto real, a posição e o momento que alteraram a trajetória do veículo, em vez de pontuar as explicações apenas pela plausibilidade linguística.
A comunidade de pesquisa também observará o equilíbrio entre cautela e progresso. O Qwen-Drive 1.0 permaneceu mais tempo na estrada após o aprendizado por reforço, mas percorreu menos distância. Sistemas futuros precisarão mostrar como administram essa compensação sem simplesmente se tornarem excessivamente conservadores.
Por fim, trabalhos externos devem testar se a abordagem unificada de cabine e direção consegue preservar conhecimento geral enquanto atende a requisitos rigorosos de latência, confiabilidade e segurança. O lançamento pode ser mais valioso como plataforma para essa investigação do que como prova de que o problema foi resolvido.
O Qwen-Drive 1.0 chama atenção menos por colocar várias funções automotivas em um único modelo e mais por expor o custo de engenharia de fazer isso. O trabalho mostra que a competência espacial precisa ser treinada deliberadamente, enquanto o conhecimento de uso geral precisa ser protegido da especialização excessiva.
Sua lacuna de explicação é o alerta mais claro. Para IA crítica para a segurança, um relato convincente de uma decisão só é útil quando acompanha as causas reais dessa decisão. Até que essa relação seja demonstrada de forma independente, o Qwen-Drive 1.0 deve ser visto como um importante lançamento de pesquisa e um alvo aberto de avaliação — não como um sistema de direção autônoma validado.