比亚迪首发多模态基础模型 HyWorldVLA,自动驾驶公开基准登顶 SOTA
比亚迪汽车新技术研究院发布论文 HyWorldVLA,提出 VLA + 混合世界模型架构,在 NAVSIM v1 上取得…
比亚迪汽车新技术研究院近日公开发表论文 HyWorldVLA,首次向外界系统展示了其在自动驾驶多模态基础模型方向的研究成果。这篇论文瞄准 Vision-Language-Action(VLA)与 World Model(世界模型)的结合,在公开基准 NAVSIM v1 上取得 PDMS 90.59 的成绩,达到当前公开结果中的领先水平。
值得注意的是,这是比亚迪首篇多模态基础模型论文,由其汽车新技术研究院独立完成,未与外部高校或研究机构合作署名,这在车企 AI 论文中并不常见。
核心思路:混合世界模型 + VLA
当前自动驾驶世界模型面临一个核心矛盾:像素级世界模型能精细建模环境细节,但计算开销大、易受视觉噪声干扰;隐空间世界模型推理效率高,却容易丢失真实世界的细节信息。
HyWorldVLA 提出的解法是「混合世界模型」(Hybrid World Modeling):同时保留像素级模型对环境细节的建模能力,以及隐空间模型的高效推理能力。在此基础上引入 VLA 架构,让系统结合语义信息生成驾驶动作,从而形成「看见环境—理解环境—预测未来—采取行动」的端到端流程。
这一路线与 Tesla FSD、Waymo、NVIDIA Cosmos 等玩家正在探索的方向同属一个技术趋势,但选择了 VLA 与混合世界模型结合的差异化路径。
训练流程与关键实验数据
论文将训练拆分为三个阶段:
- 第一阶段:训练视频压缩器。用视频 VAE 把连续帧压缩为紧凑隐特征,并引入文本描述作为语义指引,提升重构画面清晰度。
- 第二阶段:预训练。把图像、动作、语言和隐特征统一为离散 token,让模型以自回归方式预测下一 token;模型同时预测未来画面 token 和未来隐特征,使隐空间保留足够信息。
- 第三阶段:联合微调。模型停止预测画面,只输出隐特征;动作生成模块融合隐特征与历史信息产出最终轨迹。
在 NAVSIM v1 的综合指标 PDMS 上,HyWorldVLA 达到 90.59。消融实验显示,去掉画面预测后成绩从 90.59 跌至 87.50,去掉隐空间则跌至 89.91,证明两条路线缺一不可。隐特征监督权重 λ₃ 取 0.1 时取得最优,继续加大反而掉到 89.75。
噪声鲁棒性是隐空间方案带来的额外红利:在 655 个雨雾场景测试中,纯像素方法 WoTE 仅得 60.65,DriveVLA-W0 为 61.18,HyWorldVLA 则达到 86.87,差距悬殊。
比亚迪 AI 团队首次曝光:鲜明的哈工大基因
顺着 HyWorldVLA 的署名信息向外检索,可以拼出比亚迪 AI 团队更完整的画像。
HyWorldVLA 并非比亚迪第一篇 AI 论文,此前已有 EMoE-Planner(基于混合专家的自动驾驶规划模型,2025 年)以及赛车轨迹优化、胎噪判断地形等方向的论文。但 HyWorldVLA 是其首次在多模态基础模型方向亮相。
通讯作者 Liulong Ma 此前研究方向涵盖自动驾驶规划、机器人导航、多模态感知与世界模型,出身哈工大机器人技术与系统国家重点实验室及机电系;EMoE-Planner 第一作者 Hongbiao Zhu 的履历同样关联哈工大与 CMU。这意味着比亚迪新技术研究院的 AI 团队并非传统汽车电子背景,而是一支由顶尖院校计算机与机器人人才组成的「机器人 AI 派」,组织逻辑更接近 Tesla AI 把机器人和自动驾驶一体化的思路。
公开信息显示,比亚迪自研机器人项目即将亮相,而 HyWorldVLA 所代表的 VLA + 世界模型路线,本质上正是机器人领域「感知—推理—行动」闭环在自动驾驶场景中的复用,技术栈与人才基因高度共享。
行业意义与局限
比亚迪销量长期位居全球新能源车市场前列,但过去外界对其智能化能力的认知主要停留在「天神之眼」、供应链整合与规模化落地层面,AI 基础研究并不显性。HyWorldVLA 的意义在于:它让外界第一次直观看到这家车企在物理 AI 基础模型上的真实投入与技术储备。
不过仍需客观看待:基准领先不等于完成量产自动驾驶。HyWorldVLA 与 Tesla、Waymo 等第一梯队玩家之间的真实差距,还需要真实数据闭环、车端算力约束、长尾场景覆盖等工程化能力的检验。比亚迪是否已经进入物理 AI 第一梯队,仍有待后续观察。
