HyWorldVLA – 比亚迪发表的首篇学术论文中提出的混合世界模型

HyWorldVLA 是比亚迪汽车新技术研究院人工智能团队发表的首篇学术论文中提出的混合世界模型,全称为”A Vision-Language-Action Model with Hybrid World Modeling for Autonomous Driving”。该模型采用视觉-语言-动作(VLA)架构,创新性地将像素级世界模型与潜在空间(隐空间)世界模型融合为统一的混合世界建模框架,用于端到端自动驾驶决策。在自动驾驶公开基准测试NAVSIM v1中,HyWorldVLA以90.59的PDMS综合评分刷新了历史最佳成绩,在NAVSIM v2上同样以89.71分保持领先,标志着比亚迪首次从”0到1″在自动驾驶基础模型领域展现出前沿研发能力。

HyWorldVLA - 比亚迪发表的首篇学术论文中提出的混合世界模型

HyWorldVLA核心特点

  • 混合世界模型架构:首创将像素级世界模型与潜在空间世界模型在训练阶段深度融合,兼具像素级模型的精细时空推理能力和潜在空间模型的场景噪声鲁棒性,实现”两条腿走路”的互补优势。
  • VLA端到端决策:采用视觉-语言-动作统一架构,将视觉感知、语义理解和动作生成整合在单一模型中,直接从传感器输入端到端输出驾驶轨迹,避免传统模块化方案中感知-规划-控制链路的级联误差。
  • 训练与推理阶段解耦:训练阶段同时使用像素级和潜在空间两条路径互相监督校准;实际推理时仅使用轻量的潜在空间模型,兼顾精度与效率。
  • 极端天气鲁棒性突出:在655个雨雾噪声场景测试中得分86.87,比同期最强基线高出19分以上,展现出远超竞品的抗视觉干扰能力。
  • 自研芯片+算法闭环:配合比亚迪2026年5月发布的自研4nm车规级智驾芯片”璇玑A3″(单颗算力约700TOPS,三芯并联可达2100TOPS),形成从算法到芯片的完整技术闭环。
  • 目前仍处于论文阶段:尚未装车量产,何时装车暂无官方时间表。

HyWorldVLA技术原理

  • 视频VAE压缩编码:首先训练一个文本引导的视频变分自编码器(Video VAE),将连续视频帧压缩为紧凑的隐特征表示。编码过程中引入文本信息作为语义指引,辅助模型区分重要结构信息与可忽略细节,显著改善重构画面的清晰度,为后续世界模型提供高质量的隐空间表征基础。
  • 预训练阶段:像素级+潜在空间双路径并行:将图像、动作、语言和隐特征全部转换为统一的离散Token,拼成长序列进行自回归训练。模型同时执行两个预测任务——预测未来视频帧的像素级Token和预测未来隐特征。像素级预测充当”看门狗”角色,强制隐空间保留足够的环境细节信息,防止表征退化为空洞的统计规律;隐空间的抽象分析则帮助像素级模型抵抗雨雾、光照波动等外部干扰,避免画面预测跑偏。
  • 联合微调阶段:隐空间主导+动作生成:在预训练完成后进入联合微调(co-fine-tuning)阶段,模型仅使用潜在空间路径进行预测,将历史序列信息与隐查询特征输入视觉语言模型获取全局上下文,再通过联合注意力机制传递给动作专家模块生成驾驶轨迹。这一阶段丢弃了计算昂贵的像素级预测,仅保留轻量的隐空间推理,大幅提升实际运行效率。
  • 可学习隐查询聚合机制:引入可学习的隐查询(Latent Query)用于聚合多源信息并预测未来隐状态,增强模型对时序动态的建模能力。
  • VLA语义驱动:通过视觉语言模型(VLM)将自然语言指令(如导航目标)与视觉感知融合,使模型不仅能”看见”环境,还能”理解”语义意图并生成对应的驾驶动作。
消融实验验证了双路径缺一不可:移除像素级预测,PDMS从90.59跌至87.50;移除潜在空间处理,则降至89.91。

HyWorldVLA主要功能

  • 端到端驾驶轨迹生成:直接从多路摄像头输入和导航指令生成未来驾驶轨迹,无需传统的感知-规划-控制模块化流水线,消除级联误差。
  • 未来场景预测:通过混合世界模型预测未来道路状态和交通参与者的行为变化,为决策提供前瞻性的因果推理能力,而非仅依赖历史数据的模式匹配。
  • 恶劣环境鲁棒驾驶:在雨雾、光照波动、传感器脏污等视觉噪声干扰下仍能保持稳定驾驶决策,解决像素级世界模型在复杂天气下容易失效的核心痛点。
  • 多模态语义理解:结合视觉感知与语言理解能力,可解析导航指令、交通标识、场景描述等语义信息,实现更智能的驾驶决策。
  • 安全合规保障:PDMS指标综合考察责任碰撞、可行驶区域合规、安全距离、目标完成度和运动舒适性,模型在安全性与效率之间取得平衡,不会靠”慢慢开”刷分。

HyWorldVLA应用场景

  • L3级自动驾驶技术储备:HyWorldVLA被视为比亚迪面向L3级自动驾驶的关键技术储备,配合自研璇玑A3芯片,构建从算法到硬件的完整智驾闭环。
  • 城市复杂道路自动驾驶:城市道路中行人、非机动车、复杂路口等长尾场景频发,HyWorldVLA的世界模型预测能力可提前预判交通参与者行为,提升城市NOA的安全性和通行效率。
  • 恶劣天气安全驾驶:在雨雾、逆光、夜间等视觉条件恶劣的场景中,混合世界模型的抗噪声能力可显著降低因传感器退化导致的误判风险,提升全天候驾驶安全性。
  • 高速公路领航辅助:高速场景中需要精准预判前车变道、急刹等行为,世界模型的未来状态预测能力可支撑更安全、更舒适的跟车和变道决策。
  • 自动驾驶仿真与数据闭环:世界模型可作为场景生成器,合成大量高保真驾驶场景用于模型训练和测试验证,加速数据闭环迭代。
  • 智能驾驶供应链自主可控:比亚迪通过自研算法+自研芯片的垂直整合策略,摆脱对英伟达等外部供应商的依赖,在智驾领域建立成本优势和快速迭代能力。

当前状态与行业定位

表格

维度说明
发布方比亚迪汽车新技术研究院AI团队
论文发表时间2026年7月29日
当前阶段论文阶段,尚未装车量产
NAVSIM v1 PDMS90.59(历史最佳)
NAVSIM v2 PDMS89.71(领先第二名近1分)
雨雾噪声场景86.87(比最强基线高19+分)
配套芯片璇玑A3(4nm,单颗700TOPS,三芯并联2100TOPS)
战略意义比亚迪首篇自动驾驶基础模型论文,证明从0到1的AI研发能力

HyWorldVLA的发布标志着比亚迪从”智驾跟随者”向”智驾技术引领者”的转型。结合其年销数百万辆带来的海量真实驾驶数据优势,一旦算法与芯片闭环跑通,比亚迪在智驾领域的迭代速度和成本优势将极具竞争力。不过,仿真基准的领先不等于量产体验的优秀,从论文到上车仍有较长的工程化路径需要跨越。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...