桃子桃子快讯
返回首页
研究论文

任少卿回归自动驾驶研究,联合蔚来发布 MM-Future 多模式世界-动作模型

ResNet 作者任少卿与蔚来团队提出 MM-Future 模型,通过多组场景-动作联合假设提升自动驾驶规划性能。

2026.09.24 · 周四6 分钟阅读

任少卿上一次以通讯作者身份出现在自动驾驶研究论文里,已经是很久以前的事了。这位 ResNet 共同作者、前百度 Apollo 首席架构师,如今同时担任中科大讲席教授与蔚来 AGI 研究负责人。最近,他与蔚来团队联合发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,把自动驾驶规划从「一条轨迹 + 一个未来」推进到「多组动作 + 多组未来」的联合建模。

研究动机:单一轨迹与单一未来不够用

端到端自动驾驶通常将传感器观测直接映射为自车轨迹;World–Action Model 在此基础上加入未来场景预测,让规划参考动作可能带来的后果。但现有方案存在两类局限:

  • 级联式方案(如 DriveFuture)先生成候选轨迹,再分别预测各自未来,信息单向传递,后生成的场景无法回头修正前面的动作决策;
  • 联合式方案把场景与动作放在同一生成过程中实现双向交互,但通常只输出单组场景-动作结果。

MM-Future 试图同时解决两件事:在一次前向中生成多组(paired scene–action hypothesis)配对假设,并让每组内部的场景和动作继续共同演化,使多种可能未来真正进入规划过程。

核心设计:多样性的三道门槛

论文把多模式联合建模的难点拆成多样性来源、计算成本、候选筛选三项,逐一给出方案。

  • 多样性来源:动作端基于训练轨迹分布构建 Gaussian Mixture Noise,场景端使用独立噪声,二者两两组合形成不同的驾驶起点;训练时引入 Best-of-Many 监督,先找到与真实轨迹最接近的一组候选,再用同一赢家索引同时监督动作流与场景流,避免所有候选被拉向相似结果。
  • 计算成本:作者提出 MM-Tokens,将多摄像头、多时间帧的视觉特征压缩为面向规划的紧凑表征,不承担 RGB 重建也不恢复完整 BEV。注意力可视化显示,Token 主要关注道路结构、路口、前车与周围交通参与者。
  • 共同演化与筛选:使用 modality-aware Transformer 同时处理动作流与场景流,共享注意力实现两类信息交互,模态专属分支保留各自统计特征;Future-Conditioned Proposal Scorer 为每条轨迹读取专属的未来场景打分,候选之间不能借用彼此的未来,轨迹与未来 Token 使用 stop-gradient 防止评分器改变生成分布。

基准结果与消融

论文使用 NAVSIM 与 HUGSIM 两套基准进行测试:

  • NAVSIM-v1 navtest(trainval):MM-Future 取得 94.0 PDMS,高于同表中的 WAM 方案 DriveFuture(90.7)与端到端方案 DrivoR(93.7)。
  • NAVSIM-v2:MM-Future 取得 91.5 EPDMS,高于 UniTeD(90.1)与 DriveFuture(89.9)。
  • 消融实验:仅生成动作、保留单模式时 PDMS 为 84.1;动作候选扩到 32 种提升至 92.3;加入场景-动作联合生成后单模式 85.1、32 模式 92.9;最后让评分器读取配对未来,PDMS 进一步提升到 93.3。其中 TTC 指标改善最明显,作者认为配对未来主要帮助模型排除交互风险较高的轨迹。
  • 训练效率:16 模式与 32 模式达到 0.80 验证 PDM 分数约需 3.8k steps,单模式则需 17.5k steps。

论文也给出算力参考:主模型一次采样 64 组场景-动作候选,在单张 H800、batch size 为 1、bf16 条件下端到端前向延迟约 233 ms;16 候选延迟与单模式接近,扩到 32 候选后延迟明显上升,覆盖范围与计算成本之间仍需权衡。

闭环测试局限与可解释性

MM-Future 没有针对 HUGSIM 微调,在 436 个场景上取得 32.3 平均 HD-Score,高于论文列出的 Latent-WAM(28.9)与 UniAD(28.6);平均 Route Completion 为 44.5,略低于 Latent-WAM 的 45.9;Extreme 难度下 HD-Score 仅 8.6,而 Latent-WAM 为 18.1。作者也指出 MM-Tokens 属于隐式表征,模型究竟保留了哪些规划信息较难直接观察,后续计划加入辅助感知模块以提升透明度与故障诊断能力。

团队背景与产业位置

论文第一作者 Shuai Liu 同时署名蔚来与中山大学计算机学院,曾以第一作者发表 GaussianFusion 并被 NeurIPS 2025 接收;其余作者 Hechangle Gong、Hechangle Gong、Hao Jiang、Runlin He、Junxiang Zhan、Sheng Yang、Kai Huang 等分别来自蔚来、北航与中山大学。任少卿担任通讯作者,同时署名蔚来与中国科学技术大学 AGI 研究院。

把 MM-Future 放进蔚来近几年的技术演进看,可以串起一条线索:2024 年发布 NIO WorldModel 与 NADArch 2.0,将智驾架构转向世界模型驱动的端到端体系;2025 年加入全闭环强化学习;2026 年初 NWM 最新版本开始大规模推送,蔚来披露截至今年 9 月该系统已部署到超过 95 万辆车。从 NWM 到 MM-Future,路线是先让模型预测未来,再让未来进入规划;从生成多条轨迹,走向同时生成多组动作与对应的场景结果。

信源