Qwen-Drive 1.0 將駕駛決策連結到解釋——但兩者仍可能分歧

Alibaba 的 Qwen-Drive 1.0 結合了感知、規劃與座艙協助,但測試顯示其解釋未必反映實際動作。

AI News

Alibaba 的研究部門發布了 Qwen-Drive 1.0,這是一個旨在將環境感知、交通問答與路線規劃整合於單一系統中的駕駛模型。該模型的目標是同時支援車輛的駕駛功能與對話式座艙,反映出產業正朝向車內共用運算平台發展。

研究也凸顯了一項重大限制:Qwen-Drive 1.0 可以為煞車或轉向提供看似合理的理由,但這些解釋不一定能可靠指出真正觸發決策的事件。在模擬測試中,再訓練提升了車輛留在道路上的比例,但推理與行為之間的落差依然存在。

Qwen-Drive 如何構成

Qwen-Drive 1.0 以 Qwen3.5-4B 為基礎,並新增兩個以駕駛為核心的元件。其中一個是感知模組,可建立車輛周遭環境的鳥瞰表示。它能辨識三維空間中的物體、標記被占用區域,並重建道路佈局。

第二個是 Planning Expert,會利用模型內部資訊來決定車輛的下一步動作。這些新增功能的目的,是讓單一系統能解讀場景、回答相關問題並選擇路線,而不是把這些責任在不同模型之間來回傳遞。

這種整合式設計回應了車載運算的一項實際變化。研究團隊指出,資訊娛樂與自動駕駛的工作負載正越來越多地被整合到共用硬體上。因此,若模型只針對駕駛最佳化,反而可能產生第二個問題:車輛仍需要另一個模型來處理對話、一般提問與座艙功能。

團隊的訓練流程分階段進行。首先訓練感知模組,接著將感知與問答結合,最後加入路線規劃與強化學習。訓練資料包含 24 個公開的交通場景資料集。由於這些資料集格式不同且含有一些錯誤,研究人員使用另一個 AI 系統,根據原始資料標準化問題與答案。

研究人員也建立了將駕駛行為與所述原因連結起來的範例,例如辨識應觸發煞車的物體。這些資料的目的在於讓模型的決策更容易理解,而不只是提升交通相關問題的準確率。

證據顯示了什麼

根據 The Decoder 所描述的論文,Qwen-Drive 1.0 在交通場景問題上的表現明顯優於未改動的 Qwen3.5-4B。最大的進步出現在涉及因果關係的問題上,包括車輛為何應該煞車或轉彎。

研究也指出,空間理解不會僅從影像描述中自動浮現。當研究人員只訓練新加入的駕駛元件、而維持底層視覺語言模型不變時,空間準確度仍然偏弱。只有在基礎模型本身也接受空間任務訓練後,表現才有所改善。

團隊使用 HopChain 基準來檢驗這個問題。該基準顯示,視覺語言模型在傳統的影像文字評估中可以表現良好,但仍可能誤分類物體,或混淆距離、位置與空間等關係。對自動駕駛而言,這些差異在 عملی上非常重要:遠方的紅綠燈與一名進入車道的孩童,需要不同的時機與反應。

強化學習改善了模型在模擬器中的行為。研究人員表示,在以獎勵為基礎的再訓練後,車輛偏離道路的比例從 24% 降至 12%。然而,再訓練後的模型也駕駛得更保守,行駛距離較短。這樣的取捨使結果成為有價值的研究訊號,但無法說明模型在真實交通中的表現。

解釋問題比單純措辭不精更嚴重。模型可能會提到紅燈,但真正更直接的煞車原因其實是另一位道路使用者;也可能產生與規劃系統所選動作不一致的推理。換句話說,生成的解釋目前還不能被視為模型內部因果過程的證明。

報告中的指標也必須審慎解讀。有些評估依賴作者建立或重建的程序或測試環境,而現有證據並不包含獨立的道路實測。因此,這些效能數據是研究團隊的結果,而非外部驗證過的安全證據。

對開發者與車廠的意義

對 AI 開發者而言,Qwen-Drive 1.0 說明應直接訓練空間表示,而不是假設一個能力出色的視覺語言模型會僅從交通問答資料中自然學到可靠的 3D 理解。從事實體環境 AI agent 的產品團隊面臨類似問題:描述一個場景,與預測行動會如何改變它,並不是同一件事。

這個模型也呈現出專精與通用能力之間的張力。以駕駛為重點的微調可以提升交通表現,卻可能造成在廣泛預訓練期間習得知識的災難性遺忘。這種損失在特殊情況中特別重要,因為車輛可能需要的是一般推理,而不是熟悉的交通模式。

單一模型可減少座艙與駕駛堆疊的重複,但也會集中風險。若對話、感知、規劃與控制都仰賴彼此緊密連動的元件,一處失敗就可能波及其他部分。企業與車廠買家不僅需要任務準確率的證據,也需要功能隔離、可預期的備援行為,以及能稽核某個動作為何發生的能力。

解釋與行動不一致對安全有直接影響。解釋可以幫助工程師除錯,也能增進駕駛對自動化決策的理解,但不應取代因果驗證。若模型說得信心十足,卻指向錯誤觸發原因,將使事故調查更困難。

還存在對抗性層面。The Decoder 引述的研究背景包含先前工作,顯示放置在攝影機視野中的視覺標誌,即使系統正確偵測到行人,也能操縱駕駛系統的行為。語言、感知與行動的結合,開啟了攻擊者可能利用的額外輸入路徑。

Qwen-Drive 1.0 正透過 Hugging Face、ModelScope 與 GitHub 提供研究使用。這些開放性應可讓外部研究者檢視其架構並重現部分評估,但單靠公開可得,並不足以證明其適合上路。

下一步值得關注什麼

最重要的後續,是在作者的模擬器之外進行獨立測試。研究人員與車廠團隊應檢驗,報告中的偏離道路比例下降,是否也能在未見過的環境、天候、道路配置,以及錯誤會逐步累積的更長序列中維持。

另一個觀察指標,是未來版本是否能改善內部規劃與生成解釋之間的連結。更有價值的評估,應比較所宣稱的原因與實際改變車輛軌跡的物體、位置與時間,而不是只依語言上的合理性來評分解釋。

研究社群也會關注保守與進展之間的平衡。Qwen-Drive 1.0 在強化學習後更常留在道路上,但行駛距離較短。未來系統必須說明如何管理這種取捨,而不是單純變得過度保守。

最後,外部工作也應測試統一的座艙與駕駛架構,是否能在滿足嚴格延遲、可靠性與安全要求的同時,保留通用知識。這次發布最有價值之處,或許是作為後續研究的平台,而不是已經解決問題的證明。

Creati.ai 觀點

Qwen-Drive 1.0 的重要性,不在於它把多項汽車功能放進單一模型,而在於它揭示了這樣做的工程成本。這項工作顯示,空間能力必須刻意訓練,而通用知識則必須避免過度專精而受損。

其中最明確的警訊,就是解釋上的落差。對安全關鍵 AI 而言,一個看似有說服力的決策說明,只有在能對應到該決策的真實原因時才有用。在這種關係被獨立證明之前,Qwen-Drive 1.0 應被視為一項重要的研究發布與公開評估目標,而不是一套已驗證的自動駕駛系統。

廣告