☰
卓驭ZYT-World技术拆解:开环只能给分数,闭环才给教训
2026/9/29 10:18:32 网站建设 项目流程

「开环只能给分数,闭环才能学后果」

目录

01 研究背景:开环只能给分数,闭环才能学后果

02 方法:生成负责想象,记忆负责认路

1. 真实:多目异构,原生同时生成

2. 有记忆:行业首创的记忆回溯模块

3. 可控交互:三层变量干预

​编辑

4. 反应快,推理长:实时生成,长程稳定不崩溃

03 实现路径:40步压到1步,画质保持九成以上

04 落地验证:每次发版20万场景闭环用例

05 总结


端到端驾驶模型正越来越多地依赖"世界模型生成数据—回炉训练"的自进化闭环来提升能力。

但这一闭环长期存在一个瓶颈:世界模型能把画面渲染得足够真实,却不会对驾驶模型的决定作出响应,模型因此从未承担过自己动作的后果。

近日,卓驭科技首次解密其世界模型 ZYT-World。区别于行业普遍采用的开环仿真,它面向闭环强化学习构建:通过"生成负责想象、记忆负责认路"的组合,使同一场景可被反复驶入并对决定作出真实响应,让模型在平行世界中承担后果、积累分寸。

该能力已进入卓驭量产模型的发版链路,每次发版贡献超 20 万场景闭环用例。

01 研究背景:开环只能给分数,闭环才能学后果

理论上,世界模型生成得越多,驾驶模型的数据供给就越充分,二者相互驱动、螺旋上升。

然而,这条闭环的真正瓶颈,并不在画面的清晰度或真实度,而在于世界不会因为模型的决定而改变。

具体表现为两个层面的问题:

  • 响应缺失:合成场景中,自车做出动作后,世界仍按原有剧本推进。模型说"我会打左",却永远等不到打左之后的画面。训练停留在对人类驾驶动作的模仿,而不是对自身决定的经验积累。
  • 不可重复:即便世界能够自由生成,同一路段重新驶入时往往被重新编造一遍。同一场景无法在只更换自车决定的前提下重来一次,动作与后果之间的对应关系因此无法建立。

其后果是,模型学到的是别人的选择,而非自己的教训。而最需要被反复体会的强交互工况——盲区窜出的电瓶车、恶意加塞、路口抢行——恰恰是真实路采中最难获得、也最不可能重复的部分。

这两个问题,恰好对应了现有两条技术路线各自的缺口:

  • 重建路线(NeRF、3D Gaussian Splatting 等)忠实还原采集过的场景,重新驶入同一路段时,路牌与路边停放的车辆仍在原位——回得去,但想不出。它只能复现已发生的事件,无法生成"若对向车抢行"这类从未出现过的交互。
  • 生成路线(视频世界模型)能够外推未见过的场景——想得出,却回不去。沿另一条轨迹重新驶入旧路段时,多数情况下会重新编造一个路口。

强化学习不给标准答案,只给奖惩。它最依赖的资源不是算力,而是环境。一个会对每个动作作出反应并允许同一件事重来一次的地方。只有在其余条件一致、仅更换自车决定的情况下,两次结果的差异才等于这个决定本身的代价。

02 方法:生成负责想象,记忆负责认路

ZYT-World 的整体思路是:不让世界模型"自由发挥",而是在生成能力之上插入一个记忆插件,使推演既能外推长尾反事实场景,又不会"想过头"。

1. 真实:多目异构,原生同时生成

实车的传感器不止一种布局:既有视场角超 180° 的鱼眼,也有针孔,画幅从 5:1 到 5:4 五花八门。现有方案要么只采用一种相机配置,要么将原生配置映射为标准镜头再生成,结果是像,但不像你车上那组眼睛。

ZYT-World 原生同时生成量产 rig 上的所有视角,鱼眼是鱼眼、针孔是针孔,并严格对齐同一物理时刻:前视里那辆白车,侧鱼眼里也在该在的位置。每路约 720P,2 张 GPU 跑到 4 帧/秒,每帧只需 1 步去噪。

2. 有记忆:行业首创的记忆回溯模块

当车辆沿另一条轨迹重新驶入去过的路段,记忆模块会翻出历史观测,把路牌、路边停着的车这些不该变的东西重现回来,而不是随机再编一个、或者直接跳过。同一场景下两条独立轨迹的生成因此完全对齐,这正是奖惩信号能与动作一一对应的前提。

该模块为零初始化插件,接入时对基座几乎无影响,不接入时整层跳过;其训练数据由端到端模型在真实场景生成替代轨迹并重建渲染,已积累近百万对。

3. 可控交互:三层变量干预

  • 控自车:同一起点,掉头和刹停是两个世界;
  • 控他车:前车急刹、旁车加塞、电瓶车从盲区窜出;
  • 控道路环境:直路改岔路、绿灯提前变红。

一次只动一个变量,AI 司机哪里不行,一测就知道。相机参数同样可控:同一段乘用车数据,换一套相机位置重新生成,就成了商用重卡、物流车的视角数据。

图注:记忆回溯对比
上为实车录像,中为无记忆生成,下为有记忆生成;右侧红色是实车轨迹,绿色是本次生成的目标轨迹。

4. 反应快,推理长:实时生成,长程稳定不崩溃

强化学习要的是一个跑得动的环境。世界模型若一帧要等几秒,rollout 就无从谈起。

实时,只要两张卡。每路约 720P 的多目异构画面一次同时生成,每帧只需 1 步去噪,2 张 GPU 跑到 4 帧/秒。

支持分钟级连续输出。训练只见过 8 秒片段,却能连贯跑 1 分钟以上不崩,车道、建筑与光照效果维持稳定。

至此,闭环强化学习所需的四个前提:世界看起来像你的车、回得去同一个地方、能被精确干预、还跑得动,第一次同时成立。

03 实现路径:40步压到1步,画质保持九成以上

底座为逐帧自回归生成:每步仅生成一个时刻的多视角画面,写入 KV-cache 后推进下一步;两路 Plücker adapter 分别编码鱼眼与针孔的射线几何,自车运动、他车与车道布局逐帧注入。

40 步压缩为 1 步由四个阶段完成:

阶段解决的问题
因果化训练时仅允许看过去,与部署一致
一致性蒸馏将去噪切分为 48 个小台阶
自回滚 w DMDstudent 连续推演 20 个时刻,teacher 纠正累积漂移
RigCritic处理"鱼眼说左、针孔说右"的跨相机失效

叠加 19M 参数 TinyVAE、W8A8 低比特矩阵乘与硬件感知优化,生成器比 40 步 teacher 快 107.7 倍,解码器快 59.8 倍、显存省约 27 倍,最终画质保持 teacher 的 90% 以上。

有界 KV-cache 机制控制显存占用不随时间递增;尽管训练数据仅覆盖 8 秒时序片段,仍能完成分钟级连续 rollout,车道、建筑与光照效果维持稳定。

04 落地验证:每次发版20万场景闭环用例

ZYT-World 已落在卓驭三条技术线上:

  • 往下:为量产的原生多模态基础模型提供强化学习与仿真评测,每次发版贡献超 20 万场景闭环用例;
  • 往上:作为实时训练场,让模型在多模态环境中推演"若换一种开法"的结果;
  • 往外:凭借相机控制能力,将已有数据拓展至商用重卡、物流车等多种构型平台。

20 万闭环用例是其中信号最强的一项——它表明这些经历并非演示素材,而是每次发版前模型实际经受的考验。

需要说明的是,目前公开的成果集中于世界模型侧的能力验证:多目异构一致性、记忆回溯对齐、实时性与长程稳定性。至于经历这些场景之后,量产模型在具体基准上的提升幅度,尚无公开对照数据。这一环补齐后,闭环的价值方能被完整量化。

05 总结

ZYT-World 的核心贡献,在于重新定位了自进化闭环的瓶颈:问题不在画面真实度,而在世界能否对决定作出响应、并允许同一场景被重复经历。

围绕这一判断,卓驭以多目异构原生生成解决"真实",以行业首创的记忆回溯模块解决"可重复",以四阶段蒸馏与推理栈将 40 步压至 1 步解决"实时",使闭环强化学习第一次具备可用前提。

现实不会给出第二次机会,但经验的形成恰恰依赖重复。对于正在构建"数据生成—回炉训练"闭环的自动驾驶研究与工程团队而言,把最昂贵、也最危险的那部分经历移入平行世界反复完成,是一条颇具参考价值的技术路径。

参考论文:

论文标题:ZYT-World: A Real-Time Controllable World Model for Closed-Loop Autonomous-Driving Simulation

论文链接:https://arxiv.org/pdf/2609.21712

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询