Qwen-Drive 1.0: Alibaba объединила зрение, диалог и навигацию в одной модели для вождения — но объяснения решений ещё не точны
Исследовательское подразделение Alibaba (Qwen Team) выпустило Qwen-Drive 1.0 — модель, объединяющую три ключевые задачи автономного вождения: восприятие окружения, ответы на вопросы о дорожной ситуации и планирование маршрута. Это попытка создать универсальную систему, которая может как объяснять свои действия, так и управлять автомобилем.
Ключевое открытие работы: современные мультимодальные модели (текст + изображение) не умеют автоматически понимать трёхмерное пространство. Пространственное восприятие нужно тренировать отдельно, иначе модель может давать неверные объяснения своим манёврам. Например, она может сказать, что тормозит из-за пешехода, хотя на самом деле причина — в другом.
Конечная цель разработки — построить единую модель, которая одновременно работает в салоне (общение с водителем, голосовой ассистент) и управляет движением. Это снизит сложность системы и улучшит согласованность между тем, что говорит ИИ, и тем, что делает автомобиль. Пока, однако, объяснения модели не всегда совпадают с реальными действиями.