阿里千问开源首款自动驾驶视觉语言模型Qwen-Drive-1.0-4B
SmartHey9月7日消息,阿里千问本周正式开源Qwen-Drive-1.0-4B——一款基于Qwen3.5-4B研发的专用自动驾驶视觉语言模型(VLM)。

官方介绍称,Qwen-Drive-1.0是业界首个面向自动驾驶任务设计的视觉语言基础模型。其在预训练阶段创新性地统一建模3D环境感知与视觉问答能力,并进一步延伸至端到端运动规划任务,同时完整继承并兼容原始视觉语言模型(VLM)的架构设计,确保通用能力不被削弱。

该模型采用分阶段协同训练策略,有机融合驾驶领域监督数据与大规模通用视觉语言数据,在强化专业驾驶理解能力的同时,持续保持对复杂图像理解、多轮指令响应等通用能力的支持。Qwen-Drive-1.0-4B同步发布SFT(监督微调)与RL(强化学习)两个运动规划专家模块,官方评测覆盖3D感知精度、驾驶场景语义理解、通用视觉语言交互能力,以及开环预测、伪闭环仿真和真实闭环控制三大规划层级。
值得注意的是,Qwen-Drive-1.0全部规划训练样本均来自公开数据集,团队统一了多源轨迹数据的表示格式,并构建了从开环位移预测到闭环安全驾驶的全链条评估体系。基准测试显示,SFT版本已在多项指标上达到领先水平;经强化学习优化后,模型在人类偏好对齐度与闭环行驶安全性方面实现显著提升,仅带来可忽略的开环位移误差增长。
