☰
任少卿时隔十年再出手:MM-Future让自动驾驶“走一步想十步”
2026/9/30 7:22:59 网站建设 项目流程

「多模式联合世界‑动作模型」

目录

01 自动驾驶世界‑动作模型现存两难矛盾

1.1 三类主流WAM范式的固有短板

02 MM‑Future完整技术链路

2.1 面向规划的MM‑Tokens压缩表征

2.2 多模式联合世界‑动作条件流生成

2.3 未来条件提案打分器

03 NAVSIM、HUGSIM仿真基准实验

04 写在最后


作为ResNet、Faster R‑CNN的核心作者,任少卿在计算机视觉基础模型留下了里程碑级成果。

时隔十年,他以通讯作者身份带来自动驾驶世界‑动作模型MM‑Future,直面智驾交互规划的现实痛点:路口、环岛等复杂场景下,同一组传感器观测会衍生出多种合理驾驶可能性。

01 自动驾驶世界‑动作模型现存两难矛盾

1.1 三类主流WAM范式的固有短板

当下自动驾驶世界‑动作模型(WAM)主要分为解耦、串联、联合生成三类路线,很难同时兼顾多候选输出和场景‑动作双向协同演化两大诉求。

  1. 串联式WAM分为场景优先、动作优先两条分支。场景优先先预测未来画面再输出规划轨迹;动作优先先输出多条候选轨迹,再逐条推演对应的未来场景。 优势是能够产出多条候选假设。但信息流单向传递,自车的加减速、变道动作无法反过来修改推演出来的周边环境状态。真实道路交互中,自车行为会直接诱发其他交通参与者改变运动,串联架构捕捉不到这种双向耦合关系。
  2. 联合生成WAM在同一个生成流程内,让未来场景和自车轨迹互相作用、协同演化,可以模拟交互双向影响。 短板在于绝大多数现有方案只能输出单一组场景‑动作结果。面对无信号路口、环岛这类具备多种合理结局的交互场景,只输出单一假设,很容易漏掉可行备选行为。
  3. 端到端多模式规划(无世界模型)依靠扩散模型直接生成多条自车轨迹,完全不去建模周边环境的未来变化。仅依靠轨迹几何形态做筛选,缺少对不同轨迹诱发的环境交互风险的判断依据,复杂路口交互场景可靠性不足。

MM‑Future核心取舍:生成多组独立的{自车轨迹+专属未来场景}配对假设。每一组假设内部,场景与动作双向协同演化;依靠MM‑Tokens压缩表征抑制算力膨胀,最后打分器结合配套推演未来完成候选筛选。

图 | 三类WAM范式对比示意图

02 MM‑Future完整技术链路

整套框架由三部分构成:MM‑Encoder编码器产出面向规划的MM‑Tokens;模态感知条件流Transformer完成多组场景‑动作联合生成;未来条件式提案打分器完成候选轨迹排序。整套推理流程不需要重建原始图像、BEV稠密网格。

2.1 面向规划的MM‑Tokens压缩表征

多模式推演存在一个现实工程痛点:如果每一条候选模式,都完整推演多视图图像token或者BEV网格,算力开销会随模式数量、预测时长成倍膨胀。 MM‑Encoder处理多相机时序图像序列,将时间切分为多个时间块,使用可学习的块级Query,借助注意力聚合多相机、多帧特征,压缩得到少量MM‑Tokens。

关键设计:损失函数不约束MM‑Tokens还原RGB画面,交由整套多模式世界‑动作建模目标引导表征学习。让token只保留和规划、未来演化强相关的道路、障碍物、可行驶区域线索。对比稠密patch token,单时间块token数量大幅下降,让一次性并行生成几十组未来假设具备可行性。

图 | MM‑Encoder编码流程示意图

2.2 多模式联合世界‑动作条件流生成

真实训练样本只记录现实发生的那一条交互结局,其他可行的未来没有观测样本。论文采用高斯混合噪声GMN生成多组初始化源:一组动作噪声 + 一组独立场景噪声,一一配对形成M个模式的初始条件。

模态感知Transformer区分动作流、场景流双分支;共享跨模态注意力实现双向影响,AdaLN、独立前馈网络保留两个模态各自统计特性;非对称块掩码保证历史观测固定,未来动作、场景token可以互相看见、互相改变。 训练采用BoM(Best‑of‑Many)多中选优监督。

图 | 单模式与多模式训练收敛曲线

指标边界提示:BoM监督只能保证至少存在一条高质量样本,不保证全部M个模式都具备物理合理性;生成集合中会混杂部分不合理候选,打分器是必不可少的后置过滤环节。

2.3 未来条件提案打分器

多条候选轨迹,不能只依靠轨迹本身的几何平滑度做评判。完全相同的一条轨迹,搭配推演出来的未来场景不一样,交互风险完全不同。 打分器输入历史MM‑Tokens,同时将每一条候选轨迹和它专属配对的预测未来MM‑Tokens作为输入;模式之间做块对角掩码,某条候选只能读取自己对应的未来推演,不能挪用其他模式的推演结果。输出PDMS相关多维度打分,筛选最终执行轨迹。

图 |MM‑Token 注意力可视化

打分器跳出单纯评判曲率、加速度的思路,把“这条轨迹会诱发怎样的周边演化”纳入评判依据。

03 NAVSIM、HUGSIM仿真基准实验

评测数据集采用NAVSIM、HUGSIM;核心指标PDMS、EPDMS衡量规划综合安全性、舒适性;HUGSIM执行零样本闭环评测HD‑Score。基线覆盖端到端规划、VLA驱动规划、传统世界‑动作模型三类方案。

表|NAVSIM‑v1 navtest数据集定量对比表

MM‑Future(trainval)在NAVSIM‑v1取得PDMS94.0,对比同类别WAM基线GraphWorld(90.1)、DriveFuture(90.7)具备明显提升。

表|NAVSIM‑v2 navtest 测试集定量实验结果

在NAVSIM‑v2拓展评测EPDMS达到91.5;迁移到HUGSIM仿真做零样本闭环,HD‑Score达到32.3,整套模型没有在HUGSIM数据集做任何微调。

指标边界解读:PDMS/EPDMS均为仿真内部评测指标,代表仿真环境下的交互规划表现;仿真内部交通参与者行为模型固定,指标优势不能直接等价于真实道路实车表现。零样本HUGSIM仅做域迁移,域gap依旧客观存在。

表|模型关键组件消融实验统计表

消融实验验证三个核心模块的必要性:去掉多模式配对联合生成,指标大幅跌落;替换MM‑Tokens变回稠密patch token,显存与计算开销暴涨;移除未来条件打分器,仅靠轨迹本身筛选,高危交互场景通过率显著下滑。

04 写在最后

时隔多年,任少卿把研究视角从传统2D视觉转向自动驾驶世界‑动作建模。MM‑Future直面现有WAM范式的经典矛盾:多候选输出 和 场景‑动作双向耦合演化,过去两者很难同时拿到。

通过高斯混合噪声初始化多组配对假设,模态感知条件流Transformer完成组内双向协同生成,依靠面向规划的MM‑Tokens压缩表征抑制算力膨胀,再利用未来条件打分器结合专属推演未来做候选筛选。在NAVSIM仿真数据集上相比同类型WAM基线取得提升,HUGSIM零样本闭环仿真也拿到可观分数。

但要客观看待,目前整套工作依旧处在仿真验证阶段。BoM监督带来的模式质量参差不齐、缺少实车验证,都是后续走向工程落地必须跨过的坎。它给交互类世界‑动作规划,提供了一套新的范式参考。

Ref:

论文标题:MM‑Future: Multi‑Mode Joint World–Action Modeling for Autonomous Driving

论文链接:https://arxiv.org/pdf/2609.20377

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询