Qwen-Drive-1.0-4B 是阿里千问团队联合华中科技大学推出的自动驾驶视觉语言基础模型,参数规模 4B,基于 Qwen3.5-4B 原生多模态底座构建,代码与权重以 Apache 2.0 协议完全开源。模型在统一框架内整合 3D 感知、视觉问答与运动规划三类能力,预训练阶段没有改动通用视觉语言模型的原始架构,在获得驾驶专项能力的同时,保留了通用多模态模型的基础能力。

Qwen-Drive-1.0-4B特点
通用视觉语言能力保留度超过 98%,模型既能处理驾驶场景的感知与规划任务,也能完成普通图文问答、指令遵循类工作,同一套底座兼顾专业场景与通用场景需求。
采用模块化拼接结构,主干视觉语言模型保持完整,外接 BEV 感知头与规划专家两个独立模块。模块输出接口可检视,开发者可以针对性调整与二次开发,不用重构主干网络。
提供 SFT 与 RL 两个规划专家版本。SFT 版本基于监督微调训练,在各项基准测试中具备竞争力。RL 版本加入强化学习优化,以微小的开环位移误差为代价,提升闭环驾驶的安全性与人类偏好匹配度。
全部训练数据来自公开来源,团队统一了不同数据集的轨迹格式,评估覆盖开环、伪闭环到闭环全场景,验证维度覆盖 3D 感知、驾驶场景理解、通用视觉语言等多个方向。
开源门槛低,开发者可以直接基于通用 VLM 的生态与工具链做适配,快速搭建定制化的自动驾驶方案,减少从零研发的投入。
Qwen-Drive-1.0-4B技术原理
主干沿用 Qwen3.5-4B 原生多模态视觉语言模型,原始 LLM 解码器结构不做改动,作为共享的特征提取与语义理解底座,同时承载通用视觉问答与驾驶场景问答两类任务。
新增 BEV 感知头模块,作为 3D 信息探测单元,基于共享的视觉语义特征,同步完成 3D 目标检测、语义占用预测、BEV 地图分割三类任务,输出可直接检视的 3D 场景结构信息。
新增规划专家模块,基于 VLM 输出的共享表征,通过流匹配算法生成自车未来行驶轨迹。两种训练路径对应不同需求,监督微调路径输出稳定的基础规划能力,强化学习路径优化闭环场景的交互表现。
采用分阶段训练策略,将驾驶场景专项监督数据与通用视觉语言数据结合训练。先夯实通用多模态理解能力,再逐步注入驾驶感知、规划专项能力,保证新增驾驶能力的同时不丢失通用模型的基础能力。
Qwen-Drive-1.0-4B功能
3D 环境感知,识别道路范围内的车辆、行人、障碍物,输出语义占用信息与 BEV 鸟瞰地图,还原道路场景的三维结构与元素分布。
驾驶场景问答,针对路况、交通标识、场景信息回答对应问题,支持自然语言交互查询各类驾驶相关信息。
运动轨迹规划,生成自车未来行驶路径,适配不同复杂程度的道路场景,支持开环预测与闭环动态调整。
通用视觉语言处理,完成普通图像识别、图文问答、指令遵循任务,覆盖非驾驶场景的多模态需求。
多维度效果验证,支持在不同数据集、不同仿真环境下完成多场景测试,输出感知精度、轨迹误差、问答准确率等对应指标。
Qwen-Drive-1.0-4B应用场景
自动驾驶研发,车企与科技公司基于开源模型快速搭建智驾原型方案,降低前期研发投入,专注上层功能定制与场景适配。
科研与教学,高校与研究机构开展多模态大模型落地自动驾驶方向的研究,验证统一架构的技术路线,支撑相关课题与教学实验。
仿真测试训练,对接驾驶仿真平台,完成场景感知、路径规划的闭环测试,补充实车测试之前的验证环节,减少实车测试成本。
低速封闭场景落地,园区、矿区、港口等低速封闭场景的自动驾驶方案,快速适配特定场景的感知与规划需求,落地小型自动驾驶作业车辆。
智能座舱交互,结合座舱视觉系统,实现路况问答、驾驶提示、自然语言交互,提升座舱内的智能交互体验。
Qwen-Drive-1.0-4B同类产品
表格
| 对比维度 | Qwen‑Drive‑1.0‑4B | MiMo‑Embodied‑7B |
|---|---|---|
| 研发主体 | 阿里通义千问团队 | 开源多模态具身智能项目 |
| 模型定位 | 开源自动驾驶视觉语言模型,统一 3D 感知、驾驶问答、轨迹规划一体化,4B 轻量化底座GitHub | 具身多模态模型,面向机器人、自动驾驶场景,侧重环境理解与决策输出,7B 参数规模 |
| 核心特色 | 保留原生 VLM 通用能力,外置 BEV 感知头 + 规划专家模块,支持 3D 检测、占用预测、轨迹生成,提供 SFT、RL 两种权重,适合端侧部署研究 | 侧重端到端具身推理,多传感器输入适配,强调环境交互理解,模块耦合度更高,通用图文能力相对弱化 |
| 适用场景 | 自动驾驶算法研究、仿真闭环测试、车载轻量化原型、驾驶场景 VQA 科研实验 | 机器人导航、具身智能仿真、自动驾驶决策原型,偏向通用具身交互任务 |
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



