Qwen-Drive 1.0 от Alibaba объединяет восприятие, планирование и помощь в салоне, но тесты показывают, что его объяснения могут не соответствовать реальному маневру.

Исследовательское подразделение Alibaba представило Qwen-Drive 1.0 — модель для вождения, предназначенную для объединения восприятия окружающей среды, ответов на вопросы о дорожной обстановке и планирования маршрута в одной системе. Модель призвана поддерживать как функции управления автомобилем, так и его разговорный кокпит, отражая отраслевой переход к общим вычислительным платформам внутри автомобилей.
Исследование также подчеркивает важное ограничение: Qwen-Drive 1.0 может дать правдоподобную причину торможения или поворота, при этом это объяснение не обязательно надежно укажет на событие, которое фактически вызвало решение. В симулированных тестах дообучение улучшило долю случаев, когда автомобиль оставался на дороге, но разрыв между рассуждением и поведением сохранился.
Qwen-Drive 1.0 основан на Qwen3.5-4B и дополнен двумя компонентами, ориентированными на вождение. Первый — модуль восприятия, который создает представление окружения автомобиля с высоты птичьего полета. Он определяет объекты в трехмерном пространстве, отмечает занятые области и восстанавливает структуру дороги.
Второй — Planning Expert, который использует информацию внутри модели для определения следующих движений автомобиля. Вместе эти дополнения должны позволить одной системе интерпретировать сцену, отвечать на вопросы о ней и выбирать маршрут, а не передавать эти обязанности между отдельными моделями.
Такой единый дизайн отвечает практическому изменению в вычислениях внутри автомобиля. По словам исследовательской группы, рабочие нагрузки инфотейнмента и автоматизированного вождения все чаще объединяются на общем оборудовании. Поэтому модель, оптимизированная только для вождения, может создать вторую проблему: автомобилю все равно понадобится другая модель для разговоров, общих вопросов и функций кокпита.
Процесс обучения команды проходил поэтапно. Сначала обучили модуль восприятия, затем объединили восприятие с ответами на вопросы и, наконец, добавили планирование маршрута и обучение с подкреплением. Обучающие данные включали 24 общедоступных набора данных о дорожных сценах. Поскольку эти наборы использовали разные форматы и содержали ошибки, исследователи использовали другую ИИ-систему для стандартизации вопросов и ответов по исходным данным.
Исследователи также создали примеры, связывающие действие за рулем с заявленной причиной, например определение объекта, который должен вызвать торможение. Эти данные предназначались для того, чтобы сделать решения модели более понятными, а не просто более точными в вопросах, связанных с дорожным движением.
Согласно статье, описанной The Decoder, Qwen-Drive 1.0 показала существенно лучшие результаты, чем неизмененная Qwen3.5-4B, в вопросах о дорожных сценах. Наибольшее улучшение наблюдалось в вопросах о причине и следствии, включая то, почему автомобиль должен тормозить или поворачивать.
Исследование также указывает, что пространственное понимание не возникает автоматически из описания изображений. Когда исследователи обучали только недавно добавленный компонент вождения и оставляли базовую vision-language-модель без изменений, пространственная точность оставалась слабой. Производительность улучшилась только после того, как саму базовую модель обучили на пространственных задачах.
Команда использовала свой бенчмарк HopChain для изучения этой проблемы. Бенчмарк показал, что vision-language-модели могут хорошо справляться с обычными оценками изображения и текста, но при этом неправильно классифицировать объекты или путать отношения, такие как расстояние, положение и свободное пространство. Для автономного вождения эти различия критически важны: далекий впереди светофор и ребенок, выходящий на полосу, требуют разного времени реакции и разных действий.
Обучение с подкреплением улучшило поведение модели в симуляторе. Исследователи сообщили, что доля случаев, когда машина съезжала с дороги, снизилась с 24% до 12% после дообучения на основе вознаграждения. Однако дообученная модель также стала ездить осторожнее и проезжать меньшее расстояние. Такой компромисс делает результат полезным как исследовательский сигнал, но не говорит о том, как модель поведет себя в реальном дорожном движении.
Проблема объяснений серьезнее, чем просто вопрос формулировки. Модель может упомянуть красный сигнал светофора, когда более непосредственной причиной торможения был другой участник движения, или выдать рассуждение, не соответствующее маневру, выбранному системой планирования. Иными словами, сгенерированное объяснение пока нельзя считать доказательством внутреннего причинного процесса модели.
Сообщенные метрики также следует читать осторожно. Некоторые оценки опирались на процедуры или тестовые среды, созданные или реконструированные авторами, а доступные данные не включают независимых дорожных испытаний. Следовательно, показатели производительности — это результаты исследовательской группы, а не внешне подтвержденные данные о безопасности.
Для разработчиков ИИ Qwen-Drive 1.0 показывает, что пространственные представления нужно обучать напрямую, а не предполагать, что способная vision-language-модель надежно освоит 3D-понимание из данных вопросов и ответов о дорожной обстановке. Команды, создающие ИИ-агентов в физических средах, сталкиваются с похожей проблемой: описать сцену — не то же самое, что предсказать, как действия ее изменят.
Модель также иллюстрирует напряжение между специализацией и общей способностью. Дообучение, ориентированное на вождение, может улучшить результаты в дорожной среде, одновременно вызывая катастрофическое забывание знаний, полученных на широком предобучении. Такая потеря важна в необычных ситуациях, когда автомобилю требуется общее рассуждение, а не знакомый дорожный шаблон.
Одна модель может сократить дублирование между кокпитом и стеком вождения, но она также концентрирует риски. Если разговор, восприятие, планирование и управление зависят от тесно связанных компонентов, сбой в одной области может повлиять на другую. Корпоративным и автомобильным заказчикам нужны были бы доказательства не только точности выполнения задач, но и изоляции функций, предсказуемого поведения при отказе и возможности проверять, почему был выполнен тот или иной маневр.
Несоответствие между объяснениями и действиями имеет последствия для безопасности. Объяснения могут помогать инженерам отлаживать систему и улучшать понимание автоматизированного решения водителем, но они не должны служить заменой причинной валидации. Модель, звучащая уверенно, но указывающая неверный триггер, может усложнить расследование инцидента.
Есть и adversarial-аспект. В исследовательском контексте, на который ссылается The Decoder, упоминаются предыдущие работы, показывающие, что визуальные знаки, размещенные в поле зрения камеры, могут манипулировать поведением системы вождения, даже если система корректно распознает пешеходов. Объединение языка, восприятия и действий создает дополнительные пути ввода, которые могут быть использованы злоумышленниками.
Qwen-Drive 1.0 становится доступной для исследований через Hugging Face, ModelScope и GitHub. Такой доступ должен позволить внешним исследователям изучить архитектуру и воспроизвести некоторые оценки, хотя одна лишь открытая доступность не является доказательством пригодности для дорог.
Самое важное последующее действие — независимое тестирование вне симулятора авторов. Исследователям и автомобильным командам следует проверить, сохраняется ли заявленное снижение выездов с дороги в невиденных средах, погодных условиях, дорожных конфигурациях и более длинных последовательностях, где мелкие ошибки накапливаются.
Еще одним сигналом будет то, улучшат ли будущие версии связь между внутренним планированием и сгенерированными объяснениями. Полезные оценки должны сравнивать указанную причину с реальным объектом, положением и моментом, которые изменили траекторию автомобиля, а не оценивать объяснения только по языковой правдоподобности.
Научное сообщество также будет следить за балансом между осторожностью и прогрессом. Qwen-Drive 1.0 после обучения с подкреплением чаще оставалась на дороге, но проезжала меньшую дистанцию. Будущим системам придется показать, как они управляют этим компромиссом, не становясь просто чрезмерно консервативными.
Наконец, внешние работы должны проверить, может ли единый подход к кокпиту и вождению сохранять общие знания при соблюдении жестких требований к задержке, надежности и безопасности. Этот релиз, возможно, наиболее ценен как платформа для такого исследования, а не как доказательство того, что проблема уже решена.
Qwen-Drive 1.0 примечателен не столько тем, что объединяет несколько автомобильных функций в одной модели, сколько тем, что показывает инженерную цену такого решения. Работа демонстрирует, что пространственные способности нужно обучать сознательно, а общие знания — защищать от чрезмерной специализации.
Разрыв в объяснениях — самое явное предупреждение. Для критически важного для безопасности ИИ убедительное объяснение решения полезно только тогда, когда оно действительно отражает причины этого решения. Пока эта связь не будет независимо доказана, Qwen-Drive 1.0 следует рассматривать как важный исследовательский релиз и открытую цель для оценки, а не как проверенную систему автономного вождения.