阿里千问开源自动驾驶视觉语言模型Qwen-Drive

AI 驱动中国 陈默 57 次阅读
分享 Q

驱动中国9月6日消息,阿里千问本周正式开源Qwen-Drive-1.0-4B,这是基于Qwen3.5-4B构建的自动驾驶视觉语言模型。官方称其为首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了3D感知与视觉问答,并进一步扩展至运动规划,同时完全保留了预训练VLM的原始架构。这一开源动作标志着大模型技术在自动驾驶垂直领域的落地迈出关键一步。

从技术架构来看,Qwen-Drive-1.0采用分阶段训练方案,将驾驶监督与通用视觉语言数据相结合。这种设计让模型在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力,意味着模型不仅能处理驾驶场景中的复杂感知任务,还能保持对通用视觉语言任务的响应能力,避免因垂直化训练而丧失基础能力。

模型提供SFT和RL两个规划专家版本。官方评测覆盖3D感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划等多个维度。其中,SFT模型在所有基准上已具备竞争力,而经过强化学习后的RL版本,以微小的开环位移误差为代价,换来了在人类偏好对齐和闭环安全性方面的全面提升。这种权衡策略显示出模型在安全性与精确性之间的精细平衡。

在数据层面,Qwen-Drive-1.0仅使用公开来源构建规划样本,统一了各数据集的轨迹格式,并从开环预测到闭环驾驶进行全面评估。这一做法降低了数据获取门槛,也为行业提供了一种可复现的自动驾驶模型训练路径。统一轨迹格式的意义在于,不同数据集之间的差异被消除,模型可以更高效地学习通用的驾驶行为模式。

自动驾驶视觉语言模型的价值在于,它让车辆不仅能“看见”道路,还能“理解”场景。传统自动驾驶系统依赖规则或专用模型处理感知与规划,而视觉语言模型能够将图像、文本与运动规划统一在一个框架内,使车辆具备更强的场景理解能力和人机交互潜力。Qwen-Drive-1.0的发布,为这一方向提供了开源基础。

此次开源延续了阿里千问在大模型领域的开放策略。此前,千问系列模型已在多个行业落地,而面向自动驾驶的专用模型开源,有望吸引更多研究机构和企业基于该模型进行二次开发,推动自动驾驶技术从实验室走向规模化应用。同时,开源也意味着行业可以共同验证和改进模型,加速技术迭代。

从行业角度看,自动驾驶正从感知驱动向认知驱动演进。视觉语言模型作为连接视觉感知与语言理解的桥梁,能够帮助自动驾驶系统更好地处理长尾场景和复杂交互。Qwen-Drive-1.0的开源,为这一演进提供了新的技术选项,也为国内自动驾驶产业链注入了新的变量。

目前,Qwen-Drive-1.0-4B已在GitHub、Hugging Face和ModelScope等平台同步开放,开发者可获取模型权重与相关代码。随着更多开发者参与测试与优化,该模型在真实驾驶场景中的表现值得持续关注。

版权声明:本文由驱动中国整理发布,转载需注明出处与原文链接。如有疑问请联系 editor@qudong.com
本文价值 成为第一个评分的人
登录后为本文打分
网友评论0 条评论
正在回复 的评论取消
评论加载中…
🔐

登录后参与互动

评论、点赞均可赚积分
连续签到、邀请好友也有奖励 🎁

电脑端: 微信扫码登录 微信内: 一键登录

微信扫一扫

打开微信「扫一扫」,分享本文到朋友圈或好友