共计 1322 个字符,预计需要花费 4 分钟才能阅读完成。
时隔十年,任少卿再次以通讯作者身份出现在学术论文中。这一次, 方向从计算机视觉转向了自动驾驶规划。论文第一机构为 NIO, 多位作者来自蔚来, 研究主题直指世界模型与规划的结合。
📌 从一条轨迹到多组未来
端到端自动驾驶通常把传感器观测直接映射为轨迹或控制指令,而 World–Action Model 会额外建模未来场景。现有路线大致分两类: 级联式方案先生成候选轨迹再预测未来, 信息单向传递, 后续结果难以回头修正前面的决策; 联合式方案让场景与动作相互影响, 但往往只生成一组结果。
MM-Future 的思路是 一次生成多组“配对场景—动作假设”, 每一组内部的场景与动作继续共同演化, 最后再筛选。简单说, 车辆不仅看清周围, 还能同时预演多种可能的未来。
🔍 三道门槛与三项设计
论文把多模式联合建模的难点拆成三件事: 多样性从哪来、计算成本如何控制、多个候选怎么筛。
- 多样性: 真实数据只记录一种已发生结果。团队在动作端引入 Gaussian Mixture Noise, 场景端使用独立噪声, 并配合 Best-of-Many 监督, 避免所有候选被同一条真值轨迹拉向相似结果。
- 计算成本: 提出 MM-Tokens, 把多摄像头、多时间帧特征压缩为面向规划的紧凑表示, 无需为每种候选生成完整高清未来视频。
- 筛选机制:Future-Conditioned Proposal Scorer 只读取候选自己配对的未来, 不能借用其他模式的场景结果, 从而评估每条轨迹的交互风险。
💡 指标提升与代价
在 NAVSIM-v1 navtest 上,MM-Future 取得 94.0 PDMS;NAVSIM-v2 上为 91.5 EPDMS。消融实验显示, 动作候选从单模式增至 32 种,PDMS 由 84.1 升至 92.3; 加入场景—动作联合生成后达到 92.9; 评分器读取配对未来后进一步提升至 93.3。多模式训练还表现出更快收敛,32 模式达到 0.80 验证 PDM 分数约需 3.8k steps, 单模式则需 17.5k steps。
多组未来假设并非没有代价: 主模型一次采样 64 组候选, 在单张 H800、batch size 为 1、bf16 条件下, 端到端前向延迟约 233ms。候选覆盖范围与计算成本之间仍需平衡。
📊 观察: 世界模型正更深进入规划
这项工作的价值更适合放在方法层面理解。以往多模式规划主要回答“可以走哪几条轨迹”,MM-Future 把问题扩展到“采取不同轨迹后, 环境分别可能怎样变化”。世界模型开始承担动作后果建模的一部分功能。
不过,MM-Tokens 属于隐式场景表征,模型究竟保留了哪些规划信息仍难直接观察。闭环测试中,MM-Future 在 HUGSIM 上平均 HD-Score 为 32.3, 但平均 Route Completion 为 44.5, 略低于 Latent-WAM 的 45.9, 极端难度下也有差距。作者计划增加辅助感知模块提升透明度。
🚀 总结
从 NWM 到 MM-Future,蔚来的世界模型路线呈现出一条清晰线索: 先让模型预测未来, 再让未来进入规划; 从生成多条轨迹, 走向同时生成多组动作与未来。这条路线仍处于公开数据集和仿真验证阶段, 计算开销、隐式表征与极端场景稳定性都需要继续验证。