Qwen-Drive 1.0은 운전 결정을 설명과 연결하지만, 둘은 여전히 어긋날 수 있다

Alibaba의 Qwen-Drive 1.0은 인지, 계획, 콕핏 지원을 결합하지만, 테스트 결과 설명이 실제 조작을 반영하지 않을 수 있음이 드러났다.

AI News

Alibaba의 연구 부문은 환경 인지, 교통 질문 응답, 경로 계획을 하나의 시스템으로 결합하도록 설계된 주행 모델 Qwen-Drive 1.0을 공개했다. 이 모델은 차량의 주행 기능과 대화형 콕핏을 모두 지원하는 것을 목표로 하며, 차량 내부에서 공유 컴퓨팅 플랫폼으로 이동하는 업계의 흐름을 반영한다.

이번 연구는 중요한 한계도 보여준다. Qwen-Drive 1.0은 제동이나 회전의 그럴듯한 이유를 제시할 수 있지만, 그 설명이 실제로 어떤 사건이 결정을 유발했는지를 신뢰성 있게 특정하지는 못할 수 있다. 시뮬레이션 테스트에서 재학습은 차량이 도로 위에 머무는 비율을 개선했지만, 추론과 행동 사이의 간극은 여전히 남아 있었다.

Qwen-Drive의 구성 방식

Qwen-Drive 1.0은 Qwen3.5-4B를 기반으로 하며, 주행 중심의 두 구성 요소를 추가한다. 하나는 차량 주변 환경을 조감도 형태로 표현하는 인지 모듈이다. 이 모듈은 3차원 공간의 객체를 식별하고, 점유 영역을 표시하며, 도로 구조를 재구성한다.

두 번째는 Planning Expert로, 모델 내부의 정보를 사용해 차량의 다음 움직임을 결정한다. 이 추가 요소들은 하나의 시스템이 장면을 해석하고, 그에 대한 질문에 답하며, 경로를 선택하도록 하려는 것으로, 이런 역할을 별도의 모델들 사이에 넘기는 방식을 줄이려는 목적이다.

이러한 통합 설계는 차량 컴퓨팅의 실용적 변화에 대응한다. 연구팀에 따르면 인포테인먼트와 자동주행 작업은 점점 더 공통 하드웨어에서 함께 처리되고 있다. 따라서 주행에만 최적화된 모델은 또 다른 문제를 만들 수 있다. 차량은 여전히 대화, 일반 질문, 콕핏 기능을 위한 다른 모델이 필요하게 되기 때문이다.

팀의 학습 과정은 단계적으로 진행됐다. 먼저 인지 모듈을 학습시키고, 그다음 인지와 질문 응답을 결합했으며, 마지막으로 경로 계획과 강화학습을 추가했다. 학습 데이터에는 공개된 24개의 교통 장면 데이터셋이 포함됐다. 이 데이터셋들은 형식이 서로 달랐고 일부 오류도 있었기 때문에, 연구자들은 다른 AI 시스템을 사용해 원본 데이터에 맞춰 질문과 답변을 표준화했다.

연구자들은 또한 제동을 유발해야 하는 객체를 식별하는 것처럼, 운전 행동과 명시된 원인을 연결하는 예시도 만들었다. 이 데이터는 교통 관련 질문에서의 정확도뿐 아니라 모델의 결정을 더 이해하기 쉽게 만들기 위한 것이었다.

증거가 보여주는 것

The Decoder가 소개한 논문에 따르면, Qwen-Drive 1.0은 수정되지 않은 Qwen3.5-4B보다 교통 장면 질문에서 훨씬 더 좋은 성능을 보였다. 가장 큰 개선은 차량이 왜 제동하거나 회전해야 하는지와 같은 인과관계 질문에서 나타났다.

이 연구는 또한 공간 이해가 이미지 설명만으로 자동으로 생기지는 않는다는 점을 시사한다. 연구자들이 새로 추가된 주행 구성 요소만 학습시키고 기반이 되는 비전-언어 모델은 그대로 두었을 때, 공간 정확도는 여전히 낮았다. 기본 모델 자체를 공간 과제에 대해 학습시킨 뒤에야 성능이 향상됐다.

팀은 이 문제를 검토하기 위해 HopChain 벤치마크를 사용했다. 이 벤치마크는 비전-언어 모델이 전통적인 이미지-텍스트 평가에서는 좋은 성능을 내면서도 객체를 잘못 분류하거나 거리, 위치, 빈 공간 같은 관계를 혼동할 수 있음을 보여줬다. 자율주행에서는 이런 구분이 운영상 매우 중요하다. 멀리 앞에 있는 신호등과 차선으로 들어오는 아이는 서로 다른 타이밍과 반응을 요구하기 때문이다.

강화학습은 시뮬레이터에서 모델의 행동을 개선했다. 연구자들은 보상 기반 재학습 후 차량이 도로를 벗어나는 비율이 24%에서 12%로 줄었다고 보고했다. 그러나 재학습된 모델은 더 조심스럽게 운전했고 이동 거리도 더 짧았다. 이런 상충 관계는 연구 신호로는 유용하지만, 실제 교통 상황에서의 성능을 보여주지는 않는다.

설명 문제는 단순한 표현상의 문제가 아니다. 모델은 다른 도로 이용자가 더 직접적인 제동 이유였는데도 빨간 신호등을 언급할 수 있고, 계획 시스템이 선택한 조작과 일치하지 않는 추론을 생성할 수도 있다. 다시 말해, 생성된 설명은 아직 모델 내부의 인과 과정을 증명하는 것으로 볼 수 없다.

보고된 지표도 신중하게 읽어야 한다. 일부 평가는 저자들이 만들거나 재구성한 절차나 테스트 환경에 의존했으며, 제공된 증거에는 독립적인 도로 주행 시험이 포함되어 있지 않다. 따라서 성능 수치는 외부에서 검증된 안전성 증거가 아니라 연구팀의 결과다.

개발자와 차량 제조사에 대한 시사점

AI 개발자에게 Qwen-Drive 1.0은, 성능이 좋은 비전-언어 모델이 교통 질문응답 데이터만으로 신뢰할 수 있는 3D 이해를 저절로 습득할 것이라고 가정하기보다 공간 표현을 직접 학습시켜야 한다는 점을 보여준다. 물리적 환경에서 AI 에이전트를 개발하는 제품팀도 비슷한 문제에 직면한다. 장면을 묘사하는 것과 행동이 그 장면을 어떻게 바꾸는지를 예측하는 것은 같은 일이 아니다.

이 모델은 특화와 일반 능력 사이의 긴장도 보여준다. 주행 중심의 파인튜닝은 교통 성능을 높일 수 있지만, 광범위한 사전학습 중 습득한 지식을 치명적으로 잊게 만들 수 있다. 이런 손실은 차량이 익숙한 교통 패턴이 아니라 일반적 추론을 필요로 하는 특수 상황에서 중요하다.

하나의 모델은 콕핏과 주행 스택의 중복을 줄일 수 있지만, 동시에 위험을 집중시킨다. 대화, 인지, 계획, 제어가 밀접하게 연결된 구성 요소에 의존한다면 한 영역의 실패가 다른 영역에 영향을 줄 수 있다. 기업과 자동차 구매자에게는 작업 정확도뿐 아니라 기능 간 분리, 예측 가능한 대체 동작, 그리고 왜 그 조작이 발생했는지 감사할 수 있는 능력에 대한 증거가 필요하다.

설명과 행동의 불일치는 안전에 영향을 미친다. 설명은 엔지니어가 시스템을 디버깅하는 데 도움을 주고 운전자가 자동화된 결정을 이해하는 데도 도움이 될 수 있지만, 인과 검증을 대체해서는 안 된다. 잘못된 유발 요인을 언급하면서도 확신에 차 보이는 모델은 사고 조사를 더 어렵게 만들 수 있다.

적대적 측면도 있다. The Decoder가 인용한 연구 맥락에는, 카메라 시야 안에 놓인 시각 표지가 시스템이 보행자를 올바르게 감지하더라도 주행 시스템의 행동을 조작할 수 있음을 보여준 선행 연구가 포함된다. 언어, 인지, 행동을 결합하면 공격자가 악용할 수 있는 추가 입력 경로가 생긴다.

Qwen-Drive 1.0은 Hugging Face, ModelScope, GitHub를 통해 연구용으로 제공되고 있다. 이 접근성은 외부 연구자들이 아키텍처를 살펴보고 일부 평가를 재현하는 데 도움이 되겠지만, 공개 제공만으로 도로 주행 적합성이 증명되는 것은 아니다.

앞으로 주목할 점

가장 중요한 후속 단계는 저자들의 시뮬레이터 밖에서의 독립적인 테스트다. 연구자와 자동차 팀은 보고된 도로 이탈 감소가 미지의 환경, 날씨 조건, 도로 배치, 그리고 작은 오류가 누적되는 더 긴 시퀀스에서도 유지되는지 검토해야 한다.

또 다른 신호는 향후 버전이 내부 계획과 생성된 설명의 연결을 개선하는지 여부다. 유용한 평가는 설명의 언어적 그럴듯함만이 아니라, 언급된 원인과 차량의 궤적을 바꾼 실제 객체, 위치, 시점을 비교해야 한다.

연구 커뮤니티는 신중함과 진보 사이의 균형도 지켜볼 것이다. Qwen-Drive 1.0은 강화학습 후 도로 위에 더 자주 머물렀지만, 이동 거리는 더 짧아졌다. 미래 시스템은 단순히 지나치게 보수적으로 변하지 않으면서 이 상충 관계를 어떻게 관리하는지 보여줘야 한다.

마지막으로, 외부 연구는 통합된 콕핏-주행 접근이 일반 지식을 유지하면서도 엄격한 지연, 신뢰성, 보안 요구사항을 충족할 수 있는지 시험해야 한다. 이번 공개는 문제가 해결됐다는 증거라기보다, 그 검증을 위한 플랫폼으로서 더 가치가 있을 수 있다.

Creati.ai 관점

Qwen-Drive 1.0이 눈에 띄는 이유는 여러 자동차 기능을 하나의 모델에 넣었기 때문이라기보다, 그렇게 할 때의 엔지니어링 비용을 드러내기 때문이다. 이 작업은 공간 능력은 의도적으로 학습되어야 하며, 범용 지식은 과도한 특화로부터 보호되어야 함을 보여준다.

설명의 간극은 가장 분명한 경고다. 안전이 중요한 AI에서는 설득력 있는 결정 설명이 실제 결정 원인을 따라갈 때만 유용하다. 그 관계가 독립적으로 입증되기 전까지 Qwen-Drive 1.0은 검증된 자율주행 시스템이 아니라 중요한 연구 공개물이자 열린 평가 대상로 봐야 한다.

광고