ITCOW牛新网 9月6日消息,阿里千问开源Qwen‑Drive‑1.0‑4B,该模型基于Qwen3.5‑4B打造,也是业内首个面向自动驾驶场景的视觉语言基础模型。

模型预训练阶段统一处理3D感知、视觉问答任务,还拓展至运动规划能力,完整保留原有视觉语言模型架构。它采用分阶段训练方式,融合驾驶监督数据与通用多模态数据,在掌握自动驾驶相关能力的同时,依旧保有通用视觉理解、指令跟随能力。该版本同时提供SFT、RL两套规划专家,评测维度包含3D感知、驾驶场景理解、通用视觉语言能力以及开环、伪闭环、闭环运动规划。

整套规划样本全部取自公开数据源,统一各类数据集轨迹格式,完成从开环预测到闭环驾驶的完整评估。SFT版本在各项基准测试已经具备不错竞争力;经过强化学习优化后,仅小幅增加开环位移误差,就显著提升人类偏好对齐水平与闭环行驶安全性。
开发者能够在GitHub、Hugging Face、ModelScope平台获取该模型相关资源。