Alibabas Qwen-Drive 1.0 vereint Wahrnehmung, Planung und Cockpit-Unterstützung, doch Tests zeigen, dass seine Erklärungen nicht unbedingt seinem tatsächlichen Manöver entsprechen.

Alibabas Forschungsabteilung hat Qwen-Drive 1.0 veröffentlicht, ein Fahrmodell, das Umweltwahrnehmung, Beantwortung von Verkehrsfragen und Routenplanung in einem System vereinen soll. Das Modell ist darauf ausgelegt, sowohl die Fahrfunktionen des Fahrzeugs als auch das konversationsfähige Cockpit zu unterstützen und spiegelt damit den Branchentrend hin zu gemeinsamen Rechenplattformen im Auto wider.
Die Forschung weist auch auf eine wichtige Einschränkung hin: Qwen-Drive 1.0 kann einen plausiblen Grund für Bremsen oder Abbiegen liefern, ohne dass diese Erklärung zuverlässig das Ereignis identifiziert, das tatsächlich die Entscheidung ausgelöst hat. In simulierten Tests verbesserte ein erneutes Training die Rate, mit der das Fahrzeug auf der Fahrbahn blieb, doch die Lücke zwischen Schlussfolgerung und Verhalten blieb bestehen.
Qwen-Drive 1.0 basiert auf Qwen3.5-4B und ergänzt zwei fahrbezogene Komponenten. Die erste ist ein Wahrnehmungsmodul, das eine Draufsicht auf die Umgebung des Fahrzeugs erzeugt. Es identifiziert Objekte im dreidimensionalen Raum, markiert belegte Bereiche und rekonstruiert den Straßenverlauf.
Die zweite ist ein Planning Expert, der mithilfe von Informationen innerhalb des Modells die nächsten Bewegungen des Fahrzeugs bestimmt. Zusammen sollen diese Ergänzungen es einem System ermöglichen, eine Szene zu interpretieren, Fragen dazu zu beantworten und eine Route auszuwählen, statt diese Aufgaben zwischen separaten Modellen zu übergeben.
Dieses einheitliche Design reagiert auf eine praktische Veränderung in der Fahrzeugrechenarchitektur. Laut dem Forschungsteam werden Infotainment- und automatisierte Fahrlasten zunehmend auf gemeinsamer Hardware zusammengeführt. Ein nur für das Fahren optimiertes Modell könnte daher ein zweites Problem schaffen: Das Fahrzeug bräuchte weiterhin ein weiteres Modell für Konversation, allgemeine Fragen und Cockpit-Funktionen.
Der Trainingsprozess des Teams verlief in Stufen. Zuerst wurde das Wahrnehmungsmodul trainiert, dann Wahrnehmung mit Fragenbeantwortung kombiniert und schließlich Routenplanung und Reinforcement Learning hinzugefügt. Die Trainingsdaten umfassten 24 öffentlich verfügbare Verkehrsdatensätze. Da diese Datensätze unterschiedliche Formate verwendeten und einige Fehler enthielten, nutzten die Forscher ein weiteres KI-System, um Fragen und Antworten anhand der Originaldaten zu standardisieren.
Die Forscher erstellten außerdem Beispiele, die eine Fahrhandlung mit einer genannten Ursache verknüpfen, etwa durch die Identifizierung des Objekts, das Bremsen auslösen sollte. Diese Daten sollten die Entscheidungen des Modells verständlicher machen, nicht lediglich die Genauigkeit bei verkehrsbezogenen Fragen erhöhen.
Laut der von The Decoder beschriebenen Arbeit schnitt Qwen-Drive 1.0 bei Fragen zu Verkehrsszenen deutlich besser ab als das unveränderte Qwen3.5-4B. Die größte Verbesserung zeigte sich bei Fragen zu Ursache und Wirkung, darunter warum ein Fahrzeug bremsen oder abbiegen sollte.
Die Forschung legt zudem nahe, dass räumliches Verständnis nicht automatisch aus Bildbeschreibungen entsteht. Als die Forscher nur die neu hinzugefügte Fahrkomponente trainierten und das zugrunde liegende Vision-Language-Modell unverändert ließen, blieb die räumliche Genauigkeit schwach. Erst nachdem das Basismodell selbst auf räumlichen Aufgaben trainiert wurde, verbesserte sich die Leistung.
Das Team nutzte seinen HopChain-Benchmark, um dieses Problem zu untersuchen. Der Benchmark zeigte, dass Vision-Language-Modelle bei herkömmlichen Bild-Text-Evaluierungen gut abschneiden können und dennoch Objekte falsch klassifizieren oder Beziehungen wie Entfernung, Position und freien Raum verwechseln. Für das autonome Fahren sind diese Unterschiede betrieblich wichtig: Eine weit vorausliegende Ampel und ein Kind, das auf die Spur tritt, erfordern unterschiedliche Zeitpunkte und Reaktionen.
Reinforcement Learning verbesserte das Verhalten des Modells im Simulator. Die Forscher berichteten, dass die Rate, mit der das Auto die Fahrbahn verließ, nach dem belohnungsbasierten Retraining von 24 Prozent auf 12 Prozent sank. Allerdings fuhr das nachtrainierte Modell auch vorsichtiger und legte weniger Strecke zurück. Dieser Kompromiss macht das Ergebnis als Forschungssignal nützlich, sagt aber nichts darüber aus, wie das Modell im realen Verkehr abschneiden würde.
Das Erklärungsproblem ist ernster als eine Frage der Formulierung. Das Modell kann eine rote Ampel nennen, obwohl ein anderer Verkehrsteilnehmer der unmittelbarere Grund für das Bremsen war, oder eine Begründung liefern, die nicht mit dem vom Planungssystem gewählten Manöver übereinstimmt. Mit anderen Worten: Die generierte Erklärung kann derzeit nicht als Beweis für den internen kausalen Prozess des Modells gelten.
Auch die berichteten Kennzahlen müssen vorsichtig gelesen werden. Einige Bewertungen stützten sich auf Verfahren oder Testumgebungen, die von den Autoren erstellt oder rekonstruiert wurden, und die verfügbaren Belege enthalten keine unabhängigen Fahrversuche auf der Straße. Die Leistungszahlen sind daher Ergebnisse des Forschungsteams und keine extern verifizierten Sicherheitsnachweise.
Für KI-Entwickler zeigt Qwen-Drive 1.0, dass räumliche Repräsentationen direkt trainiert werden sollten, statt anzunehmen, dass ein leistungsfähiges Vision-Language-Modell aus Verkehrs-Frage-Antwort-Daten zuverlässig ein 3D-Verständnis erlernt. Produktteams, die an KI-Agenten in physischen Umgebungen arbeiten, stehen vor einem ähnlichen Problem: Eine Szene zu beschreiben ist nicht dasselbe wie vorherzusagen, wie Handlungen sie verändern werden.
Das Modell veranschaulicht auch die Spannung zwischen Spezialisierung und allgemeiner Leistungsfähigkeit. Fahrbezogenes Fine-Tuning kann die Verkehrsleistung verbessern und zugleich zu katastrophalem Vergessen von Wissen führen, das während des breiten Vortrainings erworben wurde. Dieser Verlust ist in ungewöhnlichen Situationen relevant, in denen ein Fahrzeug eher allgemeines Schlussfolgern als ein vertrautes Verkehrsmuster benötigt.
Ein einziges Modell könnte Redundanz zwischen Cockpit- und Fahr-Stack verringern, bündelt aber auch Risiken. Wenn Konversation, Wahrnehmung, Planung und Steuerung von eng verbundenen Komponenten abhängen, können Fehler in einem Bereich andere beeinflussen. Unternehmen und Automobilkäufer bräuchten nicht nur Belege für Aufgabengenauigkeit, sondern auch für die Trennung zwischen Funktionen, vorhersehbares Fallback-Verhalten und die Möglichkeit, nachzuvollziehen, warum ein Manöver ausgeführt wurde.
Die Diskrepanz zwischen Erklärungen und Handlungen hat sicherheitsrelevante Folgen. Erklärungen können Ingenieuren helfen, ein System zu debuggen, und das Verständnis eines Fahrers für eine automatisierte Entscheidung verbessern, sollten aber nicht als Ersatz für eine kausale Validierung dienen. Ein Modell, das überzeugend klingt, aber den falschen Auslöser nennt, könnte die Unfallanalyse erschweren.
Es gibt auch eine adversarielle Dimension. Der von The Decoder zitierte Forschungskontext umfasst frühere Arbeiten, die zeigen, dass visuelle Schilder im Blickfeld einer Kamera das Verhalten eines Fahrsystems manipulieren können, selbst wenn das System Fußgänger korrekt erkennt. Die Kombination von Sprache, Wahrnehmung und Handlung schafft zusätzliche Eingabepfade, die Angreifer ausnutzen könnten.
Qwen-Drive 1.0 wird für die Forschung über Hugging Face, ModelScope und GitHub verfügbar gemacht. Dieser Zugang sollte externen Forschern ermöglichen, die Architektur zu prüfen und einige der Bewertungen zu reproduzieren, auch wenn die offene Verfügbarkeit allein kein Beleg für die Verkehrstauglichkeit ist.
Der wichtigste nächste Schritt ist unabhängiges Testen außerhalb des Simulators der Autoren. Forscher und Automobilteams sollten untersuchen, ob die gemeldete Verringerung von Fahrbahnverlassen auch in unbekannten Umgebungen, Wetterbedingungen, Straßenlayouts und längeren Sequenzen gilt, in denen sich kleine Fehler aufsummieren.
Ein weiteres Signal wird sein, ob künftige Versionen die Verbindung zwischen interner Planung und generierten Erklärungen verbessern. Nützliche Evaluierungen würden die genannte Ursache mit dem tatsächlichen Objekt, der Position und dem Zeitpunkt vergleichen, die die Trajektorie des Fahrzeugs verändert haben, statt Erklärungen nur auf sprachliche Plausibilität zu bewerten.
Die Forschungsgemeinschaft wird auch das Gleichgewicht zwischen Vorsicht und Fortschritt beobachten. Qwen-Drive 1.0 blieb nach dem Reinforcement Learning häufiger auf der Straße, legte aber weniger Strecke zurück. Zukünftige Systeme müssen zeigen, wie sie diesen Kompromiss handhaben, ohne einfach übermäßig konservativ zu werden.
Schließlich sollte externe Arbeit testen, ob der einheitliche Cockpit-und-Fahr-Ansatz allgemeines Wissen bewahren und zugleich strenge Anforderungen an Latenz, Zuverlässigkeit und Sicherheit erfüllen kann. Die Veröffentlichung ist womöglich vor allem als Plattform für diese Untersuchung wertvoll – nicht als Beweis dafür, dass das Problem gelöst ist.
Qwen-Drive 1.0 ist weniger deshalb bemerkenswert, weil es mehrere Fahrzeugfunktionen in ein Modell packt, sondern weil es die technischen Kosten dieses Ansatzes offenlegt. Die Arbeit zeigt, dass räumliche Kompetenz bewusst trainiert werden muss, während allgemeines Wissen vor übermäßiger Spezialisierung geschützt werden muss.
Die Lücke bei den Erklärungen ist die deutlichste Warnung. Bei sicherheitskritischer KI ist ein überzeugender Entscheidungsbericht nur dann nützlich, wenn er die tatsächlichen Ursachen der Entscheidung widerspiegelt. Solange diese Beziehung nicht unabhängig nachgewiesen ist, sollte Qwen-Drive 1.0 als wichtige Forschungsfreigabe und offenes Evaluationsziel betrachtet werden – nicht als validiertes autonomes Fahrsystem.