【免费下载链接】Awesome-WAM
A curated collection of papers, explainers, and resources on World Action Models for embodied AI
Awesome-WAM 是专注于 World Action Models(WAM,世界动作模型)的论文资源仓库,收录了100+ 篇精选 WAM 论文、66 篇中文精读报告以及一个VLA 基准 Leaderboard,是具身智能(Embodied AI)方向新手检索 WAM 论文、理解架构分类、对比模型性能的一站式工具。
🧭 一分钟认识:Awesome-WAM 里有什么
在开始实操之前,先花 30 秒了解仓库的核心组成:
| 模块 | 路径 | 用途 |
|---|---|---|
| 论文总索引 | README.md | 按分类组织的 100+ 篇论文列表,含标签(Tag)与链接 |
| 中文精读报告 | report/ | 每篇代表论文一个目录,含结构化中文解读页 |
| 基准排行榜 | leaderboard/index.html | 交互式 Leaderboard,聚合多基准模型成绩 |
| 排行榜数据 | leaderboard/data/leaderboard.json | 结构化成绩数据(模型、分数、出处) |
1. 第一步:一键克隆仓库,打开论文地图
git clone https://gitcode.com/gh_mirrors/aw/Awesome-WAM cd Awesome-WAM克隆完成后,直接打开 README.md 就是你面对的第一张"论文地图"。它按以下章节组织,目录结构一目了然:
- World Action Model:Cascaded WAM 与 Joint WAM(自回归生成 / 扩散生成)
- World Model for VLA:面向模仿学习、强化学习与评估的世界模型
- Training Data:机器人数据集、UMI、仿真、人类第一视角视频四大类
- Evaluation:视觉保真度、物理常识、动作合理性、策略基准等评测方法
每条论文都附带标签徽章(如Explicit、Geometric、Unified-DiT等)和 Paper / Webpage / Code / Model / Blog 链接。例如经典工作 UniPi 的条目如下格式:
UniPi: "Learning Universal Policies via Text-Guided Video Generation", NeurIPS 2023. [Paper][Webpage][Blog]
标签图例(Tag Legend)在 README 开头,帮你快速按"表示方式 + 动作提取方式"定位论文,例如想找"用视频生成显式规划、再通过几何方式提取动作"的工作,就筛选Explicit+Geometric两个标签即可。
2. 第二步:看懂两大架构路线,建立分类直觉
读懂 WAM 论文,最关键是先分清Cascaded(级联)与Joint(联合)两条架构路线——这也是仓库分类的骨架。
2.1 Cascaded WAM:先"想象",再"执行"
级联式 WAM 把流程拆成两步:先由视频生成模型预测未来画面,再通过逆动力学或学习式模块提取动作。以 ARDuP 为例,它先用视频生成"想象"任务执行过程,再解码出动作序列:
对应仓库中的代表工作包括 UniPi、VLP、Gen2Act、VideoPolicy 等,均标注了Explicit(显式生成未来)或Implicit(隐式潜变量规划)标签。
2.2 Joint WAM(自回归):一个模型同时"看世界"和"做动作"
Joint WAM 将未来帧与动作统一为一串 token,用自回归方式联合生成。GR-1 是该路线的开山之作——先在大规模视频上预训练,再微调出可部署的机器人策略:
同类工作还有 GR-2、CoT-VLA、WorldVLA、RynnVLA-002 等,标签区分了Explicit-Decoupled(显式解耦)与Unified-Discrete(统一离散表示)。
2.3 Joint WAM(扩散):视频与动作联合去噪
扩散路线用 DiT 架构对图像、动作等多模态噪声联合去噪,是目前最活跃的分支。PAD 的框架展示了"预测 + 动作"在潜空间中如何共享一个扩散过程:
UWM 则进一步用单个 Diffusion Transformer 同时支撑正向动力学、策略、视频预测等多个头,展示了统一世界模型的潜力:
这一分支下有 PAD、VideoVLA、Cosmos Policy、DreamZero、Motus 等 20 余篇工作,标签按Unified-DiT(统一流)与Multi-Dit(多流耦合)进一步细分。
3. 第三步:用 66 篇中文精读报告代替通读原文
仓库最有价值的部分在 report/ 目录:66 篇代表论文各有一个中文精读报告页面(index.html为中文版,index.en.html为英文版),目录名就是 arXiv 编号,例如:
- report/2302.00111/index.html:UniPi 精读
- report/2312.13139/index.html:GR-1 精读
- report/2411.18179/index.html:PAD 精读
每篇报告都遵循统一的 8 章结构,帮你用 20 分钟掌握一篇论文:
- 论文速览:核心贡献清单
- 动机:要解决什么问题、已有方法卡在哪里
- 相关工作脉络
- 问题形式化
- 方法详解
- 实验与结果
- 分析、局限与边界
- 可复现性审计:数据、超参数、复现建议
💡 小技巧:每篇报告目录下的figures/还存有论文原图,阅读时可与正文对照。
4. 第四步:用 Leaderboard 对比各模型真实水平
打开 leaderboard/index.html(克隆后可直接用浏览器访问),这是一个基于本地 JSON 数据渲染的交互式排行榜,数据源自 AllenAI VLA Evaluation Harness。你可以:
- 按基准筛选:如 CALVIN(平均完成子任务数,满分 5)、Kinetix(成功率 %)等
- 按指标与日期过滤:用 From/To 月份框聚焦最新进展
- 搜索与排序:支持按模型名搜索、按分数高低或论文时间排序
- First-party only:只看论文作者自报的成绩,保证可比性
页面顶部的趋势图会画出各基准的性能演进曲线,一眼看清"当前 SOTA 走到哪了"。想二次处理数据时,直接读 leaderboard/data/leaderboard.json 即可,每条记录都包含模型名、基准、总分、分项分数、出处表格和备注。
5. 新手推荐阅读路径:从 3 篇论文切入
面对 100+ 篇论文,建议按下面的顺序"由浅入深":
- 先读综述:仓库配套的 WAM 综述论文(arXiv 2605.12090)定义了 WAM 的形式化表达,index.html 中的在线版本配有 Definition、Architecture、Training Data、Evaluation 等章节导读
- 理解级联范式:读 UniPi 报告(report/2302.00111/index.html),搞清"视频生成 → 动作提取"的基本闭环
- 理解联合范式:读 GR-1 与 PAD 报告,对比自回归与扩散两种统一建模思路
- 按需深入:想做强化学方向看 World Model for RL 章节(Dreamer 系列、World4RL 等);想做评测看 Evaluation 章节;找数据看 Training Data 表格
- 验证选型:最后到 Leaderboard 上按你的目标基准查一下各模型成绩,形成自己的判断
小结
Awesome-WAM 把"找论文、读论文、比模型"三件事整合在一个仓库里:README 负责检索,report 目录负责精读,leaderboard 负责选型。建议先克隆仓库通读 README 的分类体系,再挑 3 篇精读报告建立直觉,最后用 Leaderboard 校准对 SOTA 的认知——这就是上手 WAM 文献最高效的路径 🚀
【免费下载链接】Awesome-WAM
A curated collection of papers, explainers, and resources on World Action Models for embodied AI
相关推荐
什么是World Action Model?Awesome-WAM:读懂首份系统性WAM综述的完整指南
什么是World Action Model?Awesome WAM:读懂首份系统性WAM综述的完整指南 本文面向初学者,系统讲解 World Action Mo
如何快速上手 ClaudePrism:从下载到 10 分钟写出第一篇论文的新手教程
如何快速上手 ClaudePrism:从下载到 10 分钟写出第一篇论文的新手教程 ClaudePrism 是一款由 Claude 驱动的 离线优先科学写作工作
如何快速上手TachiyomiJ2K:从安装到首次阅读的完整教程
如何快速上手TachiyomiJ2K:从安装到首次阅读的完整教程 TachiyomiJ2K是一款完全免费开源的安卓漫画阅读器,让你轻松享受海量漫画资源。这款应用
移动开发
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考