26年7月来自北京大学、南洋理工、香港科技大学、新加坡国立、香港中文大学、香港大学、杜克大学、加州伯克利分校、乔治城大学、南京大学和上海交通大学的论文“Data Pyramid for Embodied Manipulation: A Survey”。
这篇综述的主要价值,是把具身操作的数据来源、采集方式、监督信号和模型用途放进同一个框架。它提供了一张较完整的数据地图,但尚未给出经过充分验证的“最优数据配方”。
1.论文围绕一个核心问题展开:训练具身基础模型,究竟需要什么数据?
机器人需要把感知与物理执行连接起来:理解当前状态、选择动作、预测动作后果,并根据实际反馈调整行为。因此,仅有图像识别、语言理解或视频预测能力,仍不足以支持可靠操作。
论文的组织逻辑是:
数据从哪里来 → 能提供什么监督 → 如何转换和对齐 → 支持什么模型能力。
全文主要分为三部分:如图 1 所示
第 2—6 节:五类数据的来源、采集流程、表示方式、规模与局限。
第 7 节:这些数据如何支持具身大脑、视觉—语言—动作模型和世界—动作模型。
第 8 节:触觉、失败恢复、规模化采集、跨本体对齐、灵巧操作和数据配比六个研究方向。
这里的“本体”指机器人的身体与控制配置,例如机械臂结构、手指自由度、传感器和执行器。
2.数据金字塔的核心,是规模化能力与机器人对齐程度之间的权衡。(第 3—6 页)
论文用两个主要维度组织金字塔:数据规模化的演化如图 2 所示
可扩展性:增加数据时,需要付出多少硬件、人力、环境复位、维护和安全监督成本。
机器人对齐程度:数据中的观测、表示和监督信号,能在多大程度上直接支持真实机器人的学习与执行。
另外四个维度用于补充判断:质量、多样性、可复用性、物理保真度。它们分别关注数据是否可靠且有信息量、覆盖范围是否足够广、能否跨任务和平台迁移,以及是否真实反映接触、摩擦、柔顺性和控制延迟等物理因素。
金字塔从顶部到底部依次为:
这个层次不能直接当作数据质量排名。 作者明确说明,排序是多个维度的综合概括,并非每项属性都严格单调。例如,仿真能够提供明确的机器人动作,而普通人类视频通常不能;但人类视频中的交互发生在真实物理世界。
如图 3 所示数据使用的演化:
![]()
3.五层数据分别解决不同问题,也各自保留了难以替代的作用。
真实机器人数据提供完整的实际执行经验。(第 7—14 页)
其核心优势在于,观测、动作和物理后果来自同一个真实系统,包含实际的传感噪声、控制延迟、摩擦和硬件限制。
论文梳理了三类采集方式:
自动采集:规则脚本、轨迹回放、自主策略执行。
人工示范:拖动示教、主从遥操作、VR/手机控制、视觉动作映射、穿戴设备。
人在回路中的纠正:机器人自主执行,操作者在出错时介入,形成针对性的恢复数据。
发展趋势包括从单臂走向双臂、移动操作、人形机器人和灵巧手,以及从视觉和关节状态扩展到触觉、力/力矩、音频等模态。
按论文表 1 的口径,DROID 约有 7.6 万条轨迹、350 小时数据;AgiBot World Beta 达到约 100 万条轨迹、2,976 小时。这体现了规模增长,但论文也强调,重复同一种任务的轨迹并不等价于更广的能力覆盖。
这一层最重要的启示是:真实数据的价值既来自准确的成功示范,也来自部署时实际遇到的偏差、失败与纠正。
UMI 把数据采集与目标机器人解耦,同时保留较明确的动作结构。(第 14—16 页)
UMI,即 Universal Manipulation Interface,通常让人直接操作便携式夹爪或灵巧接口,同步记录相机观测、末端位姿、夹爪开合,部分系统还记录触觉和力。
其典型流程是:
人操作采集装置 → 恢复末端运动轨迹 → 表示为相对位姿和夹爪命令 → 映射到目标机器人的控制接口。
这里的关键设计是末端中心的相对动作表示:记录工具如何移动,减少对某一种机械臂关节结构的依赖。FastUMI-100K 等工作体现了这一范式的规模化潜力。
但“采集时不需要机器人”不意味着“部署时无需适配”。人的活动范围、工具形状、相机位置以及接触方式,仍可能与目标机器人不同;追踪误差和同步误差也会污染动作标签。UMI 通常还缺少目标机器人的关节状态与执行器动力学。
因此,它适合扩大真实场景下的动作示范覆盖,仍需真实机器人数据验证和校准。
第一/第三人称人类数据提供最丰富的人类交互经验,但需要把视频加工成有效监督。(第 16—22 页)
第一人称视频贴近操作者视角,能记录日常操作;第三人称视角补充被遮挡的手、身体和环境信息。
论文把监督构建分为四类:
代表性资源包括 Ego4D、Ego-Exo4D、HOT3D、EgoDex 等。例如,论文表 3 将 EgoDex 的规模列为约 829 小时。
这里需要区分两个事实:交互本身发生在真实世界;从视频恢复出的手部姿态、接触和机器人动作,却可能有误差。 遮挡、运动模糊、尺度不确定性和人机结构差异,会沿着处理流程累积。
论文因此倾向于将人类视频视为任务意图、抓取选择、接触顺序和工具使用策略的来源,再用机器人数据落实具体执行。
如图 4 所示这些数据的动作-轨迹多样性:
如图 5 所示 UMI 数据和真实机器人数据的概述:
如图 6 所示以自我为中心和以环境为中心的数据采集基础设施与监督表征概览。
仿真数据提供可控、可重复、可并行生成的交互经验。(第 22—29 页)
论文把仿真体系拆成三个相互关联的部分:
机器人及其传感器、执行器、控制接口。
物体、材质和场景资产。
物理引擎与渲染系统。
数据生成方法包括人工示范、规则与运动规划、种子轨迹扩增、强化学习策略执行,以及语言模型辅助的任务和环境生成。
MimicGen 一类方法从少量示范扩展出更多轨迹;RoboTwin、RoboCasa、ManiSkill 等代表不同的任务与仿真生态。仿真还可以直接提供物体位姿、分割、接触状态、奖励和成功标签等难以在现实中获得的信息。
如图 7 所示仿真基础设施和数据采集流水线:
论文对仿真差距的划分很有用:
观测差距:纹理、光照、深度噪声、遮挡和传感器响应不同。
运动学差距:关节限制、坐标系、控制接口与标定不同。
动力学差距:摩擦、柔顺性、延迟、形变、惯性等不匹配。
此外,论文将世界模型作为“学习得到的模拟器”讨论,用于训练、评估和合成交互数据。但它明确提醒:生成视频看起来合理,并不能保证动作后果真实、轨迹可执行或策略评估可靠。
通用数据为操作建立感知和认知基础。(第 29—35 页)
如图 8 所示通用数据类别概述:
这一层覆盖的内容远超普通图文问答:
视觉语言数据:物体、功能、指令和常识理解。
分割、定位与可供性数据:找到可抓取区域、把手、按钮和放置位置。
三维数据:深度、方向、距离、空间关系和可达性。
规划数据:将目标分解为步骤和子目标。
时序数据:定位事件、追踪状态变化、利用历史观测。
物理与失败推理数据:预测结果、解释失败、提出恢复方案。
抓取数据:提供抓取姿态、接触位置和质量等监督。
例如,执行“打开抽屉”需要识别抽屉、定位把手、估计空间关系、理解动作顺序,再把这些信息转成控制命令。不同通用数据分别补足其中的前置能力。
不过,这一层的定义较宽,部分内容已经包含直接的操作监督;这也是后面需要讨论的分类问题。
4.论文进一步说明,同一种数据进入不同模型后,会承担不同角色。(第 35—43 页)
这是功能上的侧重划分,具体模型之间存在交叉。
论文关于数据利用的两个技术要点尤其值得保留。
第一,没有动作标签的视频,仍然可以参与策略训练。
一种方法学习“潜在动作”,即从前后观测中提取紧凑的变化表示;另一种方法恢复可解释的几何信息,例如点轨迹、物体运动场、手部或腕部运动。
这些表示可以扩大预训练规模,但仍需要动作解码、重定向或机器人示范,把它们连接到真实控制。视频中发生了什么,与机器人应当执行什么,之间仍有距离。
第二,跨机器人训练需要同时解决动作语义和几何坐标问题。
论文归纳了三种动作接口:
本体专用适配器或动作头:保留各机器人的原生接口,共享中间表示。
统一维度并补零:方便联合训练,但相同位置未必具有相同物理含义。
语义动作槽位:预先规定各部分表示机械臂、末端、夹爪或手指,缺失部分使用掩码。
此外,还要统一或明确机器人基座、相机、手腕等参考系,以及单位、旋转表示、绝对/增量动作和工具中心点。
把数据文件整理成同一种格式,只解决了存储问题;监督是否兼容,还取决于这些物理语义。
5.这篇综述最值得记住的要点,可以归纳为六条。
数据源之间存在互补关系。 通用数据支持理解,人类数据扩展交互先验,UMI 提供结构化示范,仿真提供可控经验,真机数据落实实际执行。
数据规模必须结合有效覆盖来看。 更多小时、帧数或轨迹,不一定增加新的任务、状态、接触方式和恢复策略。
动作对齐是跨数据源学习的核心瓶颈。 坐标、控制语义、机器人结构和接触差异都可能形成冲突监督。
人类视频正在成为重要的预训练来源。 它的价值取决于能否提取可迁移的信息,并控制姿态恢复和动作映射的误差。
世界模型同时是数据使用者和数据生成者。 它可以形成“学习—生成—再训练”的循环,但需要真实交互约束生成误差。
多源混合的优势尚不能一概而论。 作者在第 36 页和第 45 页明确承认,现有证据不足以证明数据来源越多越好,也没有确定普适的最佳比例。
最后一点限定了整篇论文结论的强度:它解释了为什么各种数据可能有用,但没有证明某个组合在所有条件下最优。
6.作者指出的领域问题,集中在“采什么、怎么采、怎么用”。(第 43—45 页)
其中,“失败数据”尤其容易被误解。论文主张保留并结构化利用失败经验,而失败检测、原因诊断、价值判断和恢复策略学习,需要不同的标签与训练目标。
7.综述本身,以下问题最值得指出。
第一,五层分类混合了采集来源、采集接口和训练用途,边界不够统一。
真实机器人和仿真主要按来源划分;UMI 按采集接口划分;第一/第三人称数据带有视角与主体属性;通用数据则很大程度上按监督用途划分。
具体表现是:
RoboNet 同时出现在真实机器人数据表 1 和通用数据表 6。
DexGraspNet 2.0 同时出现在仿真数据表 5 和通用数据表 6。
通用数据还包含机器人视频、抓取姿态及动作相关标签。
同一数据集支持多种用途完全合理,但这意味着五层不能直接作为互斥的统计分类。更清楚的方式是分别标注采集来源、监督形式、机器人对齐程度、训练用途,并说明跨层复用关系。
第二,金字塔直观,但不足以支持严格的数据优先级判断。
作者已经承认排序并非严格单调,这一点是审慎的。然而,六个评价维度没有统一度量,也没有给出聚合权重。
实际价值还取决于任务:针对特定机器人和任务的仿真数据,可能比一般人类视频更直接;高噪声、覆盖狭窄的真机数据,也未必具有更高训练价值。
因此,金字塔适合帮助读者认识数据生态,不能直接推出采购、采集或训练预算的分配顺序。
第三,对“规模”的整理比对“有效信息量”的分析充分。
图 2 使用示范数、视频小时数和问答对数量等不同单位;作者说明了口径差异,但缺少进一步标准化。
还需要区分:
独立采集的经验与重复、重叠片段。
完整操作轨迹与单个抓取候选。
原始数据与经过扩增、重定向的派生数据。
名义数据量与通过质量检查的可用数据量。
这些数量都能描述规模,却不能直接换算为学习价值。综述若增加有效样本量、独立场景覆盖、接触事件覆盖以及单位成本收益,会更有指导性。
第四,图 4 对轨迹多样性的展示只能提供有限证据。
图 4 用关键帧的三维空间分布作为轨迹多样性的代理。图注说明使用了启发式关键帧提取和可比初始配置,但展示任务包括货架整理、折衣服、放锅、倒酒等,任务本身就不同。
因此,空间分布的差异可能来自任务需求、工作空间和身体结构。更分散的点云,无法单独证明策略更多样、接触模式更丰富或泛化效果更好。
这张图适合作为现象展示;若要支撑类别比较,还需要控制任务、坐标尺度和样本量,并结合行为与接触层面的指标。
第五,模型数据表能说明“用了什么”,尚不能充分说明“为什么有效”。
表 7 主要通过图标标注数据来源,缺少统一整理的:
采样比例、损失权重和数据质量筛选方法。
各来源进入预训练、联合训练或后训练的阶段。
总训练预算与各来源带来的边际收益。
骨干模型已经继承的通用预训练数据。
尤其需要谨慎理解“仅使用机器人数据”:它可能描述某个具身训练阶段,而模型骨干仍继承了通用图文或视频预训练能力。
论文已承认缺少严格消融;作为综述,可以进一步建立证据矩阵,区分哪些结论来自受控比较,哪些仅来自不同系统的报告。
第六,文献覆盖广,但检索与证据分级不够可复现。
正文没有明确呈现系统性的检索来源、关键词、纳入/排除标准和筛选流程,也没有统一区分独立验证结果、作者报告结果及开放可复现程度。
这不影响其作为叙述性综述的价值,但读者难以判断覆盖是否完整,哪些判断证据较强,哪些主要反映研究趋势。
第七,尚缺少贯穿五层数据的统一评估与数据管理框架。
论文分别讨论了各层局限,也讨论了世界模型评估,但没有形成一套统一协议,回答:
数据改善了同分布成功率,还是陌生物体、场景、任务和机器人上的泛化?
对长时任务、错误恢复和接触稳定性有何影响?
相同采集成本和训练预算下,哪一类数据的收益更大?
跨数据集是否存在重复、训练测试泄漏或共同来源?
人类视频与派生数据的来源、使用权限和处理过程是否清晰可追溯?
若要把这篇综述进一步发展成可操作的方法论,最需要补上的,是按任务和机器人条件设计的等预算实验,以及从数据来源、转换过程到真实部署收益的可追溯记录。这样才能把“各层可能有用”推进到“在什么条件下、用多少、通过什么方式有用”。