摘要
本文解读 ICLR 2026 论文《Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation》。该论文提出动作感知动态剪枝 ADP,通过融合文本驱动的视觉 token 相关性排序、末端轨迹门控与多视角配额分配,让 VLA 模型只在粗操作阶段剪枝、在精细操作阶段恢复全视野,其特别之处在于训练无关、即插即用,全程不需要任何权重更新。实验表明,在 LIBERO 四套件上保留 30%–70% 的 token 仍能维持94.4%–96.3%的平均成功率,LLM 侧加速1.13–1.35 倍;真机 Kinova Jaco2 上延迟从 76.9 ms 降到51.8 ms(1.49×),成功率反而从 85.8% 提升到88.3%,为 VLA 的实时部署提供了重要借鉴。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 视觉 token 为什么成了 VLA 推理的主要开销
- 已有方法的两条路线与各自的盲点
- 被忽略的那条线索:冗余度是动作的函数
- 研究主线:从问题到结论
- 基准/方法设计
- 机制一:文本驱动的预期式剪枝(剪哪些)
- 机制二:动作感知门控(何时剪)
- 多视角配额与防塌缩保护
- 分类全景
- 方法细节
- 文本驱动的预期式剪枝
- 动作感知的动态门控
- 复杂度收益从哪来
- 附录里的算法全流程
- 实验设计与结果
- 评测协议
- LIBERO 仿真结果
- 真机结果
- 消融:动态门控在承重
- 为什么随机剪枝会崩
- 结果对比总结
- 关键发现
- 局限性
- 论文自述与可观察到的边界
- 阅读时需要注意的表述问题
- 常见问题(FAQ)
- ADP 需要重新训练 VLA 模型吗?
- ADP 和 VLA-Cache 有什么区别?
- ADP 的判断依据为什么用末端轨迹而不是注意力分数?
- 保留率应该设成多少?
- 为什么打分层选第 0 层而不是更深的层?
- 连续剪枝 3 次就强制恢复全视觉,这个规则重要吗?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Action-aware Dynamic Pruning for Efficient Vision-Language-Action Manipulation |
| 标题(中文) | ADP:让剪枝跟着机器人动作走的 VLA 推理加速框架 |
| 作者 | Xiaohuan Pei(共同一作)、Yuxing Chen(共同一作)、Siyu Xu、Yunke Wang、Yuheng Shi、Chang Xu |
| 机构 | 悉尼大学 计算机科学学院(The University of Sydney) |
| 会议 | ICLR 2026 |
| arXiv | https://arxiv.org/abs/2509.22093 |
| 项目网站 | 论文标注vla-adp.github.io(当前 404);可用 arXiv 版 https://arxiv.org/html/2509.22093v1 |
背景与动机
视觉 token 为什么成了 VLA 推理的主要开销
主流的 Vision-Language-Action 流水线是「视觉编码器 → 投影层 → LLM」:一路场景相机加一路腕部相机的图像被编码成大量 visual token,与文本指令、本体感知一起拼成一条很长的多模态序列,再送入 LLM 自回归或并行解码出 7 维动作。问题在于,这条序列里视觉 token 占了绝大部分长度,而长程操作任务每一步都要完整前向一次,于是计算量、显存占用与延迟都被视觉 token 主导。更麻烦的是,大量视觉 patch 与当前指令只有很弱的关联,它们不仅不提供信息,还会稀释注意力。
已有方法的两条路线与各自的盲点
现有工作大致分两派。训练期路线改造架构或压缩参数:RoboMamba 用轻量状态空间骨干替代部分注意力,DeeR-VLA 做结构化剪枝与动态重参数化,Mole-VLA 按任务难度条件化地激活部分层。这类方法收益明显,但需要重新训练或微调。
推理期免训练路线则完全不碰权重:VLA-Cache 在相邻步之间复用信息量低的 token 的 key 与 value;EfficientVLA 与 SparseVLM 用注意力分数做 token 选择;FlashVLA 与 SP-VLA 走「先压缩再行动」或调度与剪枝联合优化。ADP 属于这一派。
与 ADP 最直接可比的是FastV(+OFT):它同样按文本到视觉的注意力给 token 排序,同样在 OpenVLA-OFT 上做了复现,但它采用一个固定的保留比例,对所有操作阶段一视同仁。代价在数字上非常直观——FastV 把 FLOPs 从 7.91 降到 6.37、加速 1.24 倍,可是 LIBERO 平均成功率从 97.1% 掉到86.8%,长程套件(Long)更是从 94.8% 掉到73.0%。
被忽略的那条线索:冗余度是动作的函数
ADP 的出发点是一条简单但此前未被系统利用的观察:机器人操作不同阶段的视觉冗余程度差别很大,而且与动作动力学强相关。搬运、接近这类粗操作阶段以全局运动为主,相邻 patch 高度重复,冗余高;抓取、对准、插入这类精细阶段依赖局部几何与接触细节,冗余低。
把这条线索与「固定剪枝率」对照,就能看出既有方法的系统性缺陷:统一的剪枝率要么在粗操作阶段剪得太少(省不下计算),要么在精细阶段剪得太多(掉成功率),文中的表述是 "prune too little (limited savings) or prune too much (accuracy loss)"。ADP 要做的,就是把「剪多少」从一个静态超参,变成由机器人自身运动状态实时决定的状态量。
研究主线:从问题到结论
图 1:ADP 研究主线:VLA 视觉 token 开销 → 冗余随阶段变化 → 双机制设计 → LIBERO 与真机验证 → 1.35–1.49× 加速。(Mermaid 流程图)
基准/方法设计
ADP 的设计可以概括成两个正交的子问题:剪哪些 token与这一步要不要剪。前者由文本指令决定,后者由机器人自己的动作轨迹决定。
机制一:文本驱动的预期式剪枝(剪哪些)
在进入 LLM 之前,用文本到视觉的交叉注意力给每个视觉 patch 打一个相关性分数,只保留分数最高的 Top-K 个 patch。这里的关键选择是在哪一层打分——ADP 选择第 0 层,理由来自层间统计(见下文实验部分):浅层注意力分布平坦,Top-K 排序稳健;深层注意力塌缩到少数 token,排序容易被局部噪声左右。
机制二:动作感知门控(何时剪)
用正运动学把刚解码出的动作块积分成末端执行器轨迹,计算窗口内的累计弧长作为运动幅度指标,再与历史统计比较,输出一个二元状态:运动幅度大(粗操作)就开启剪枝,运动幅度小(精细操作)就关闭剪枝、恢复全视觉。
多视角配额与防塌缩保护
多相机场景下,保留配额还要按权重向量分到各视角(实验取场景 : 腕部 = 4 : 6),避免任何一路视角被整片剪掉。此外还有两条工程保护:前两个窗口强制全视觉作为冷启动;如果连续 3 个窗口都在剪枝,下一个窗口强制恢复全视觉,防止误差累积。
图 2:动作感知动态剪枝 vs. 静态剪枝——五个过去观测窗口驱动当前窗口的剪枝决策。p1、p3、p5 处于粗操作阶段,门控开启剪枝以抑制冗余 token;p2、p4 为精细阶段,剪枝关闭、恢复全视野。曲线为驱动力门控规则的机器人运动量。
分类全景
图 3:ADP 的剪枝决策可拆成四个子问题:剪哪些(文本 Top-K 相关性)、何时剪(末端轨迹门控)、剪多少(保留率与多视角配额)、何时不剪(冷启动与连续 3 窗复位)。(Mermaid 流程图)
方法细节
文本驱动的预期式剪枝
设某一层的隐状态为 H,把它拆成视觉子集与文本子集,分别乘上 query 与 key 投影矩阵得到 Q 与 K,再算缩放点积相似度矩阵。对注意力头与文本查询取平均,就得到每个视觉 token 的全局重要度分数 $\Phi$:
- 逐层打分:$\Phi(v) = \frac{1}{N_h L_{txt}} \sum_h \sum_t A_{h,t,v}$
- 保留配额:$k = \lfloor \rho \cdot L_{vis} \rfloor$,其中 $\rho$ 是保留率
- 多视角分配:第 c 路视角分到 $k_c = \lfloor \alpha_c \cdot k \rfloor$,$\alpha$ 是视角权重且各分量之和为 1
直观上,这一步等价于用文本指令当「检索 query」,在视觉 patch 里做一次 Top-K 检索,然后把检索结果重新拼回多模态序列。整个过程复用已有的投影权重,不引入任何新的可学习参数。
动作感知的动态门控
门控的输入是刚解码出的动作块,每一步包含三个平移增量、三个旋转增量以及夹爪指令。ADP 用正运动学把这些增量按时间顺序积分成末端执行器的位姿序列,取其平移分量得到轨迹点,再用窗口内的累计弧长量化这一个窗口的运动幅度:
- 轨迹距离:$\delta_i = \sum_t \lVert p_{t+1} - p_t \rVert_2$
- 历史均值规则:$s_{i+1} = 1$ 当且仅当 $\delta_i \ge \bar{\delta}_i$,其中 $\bar{\delta}_i$ 是历史窗口的均值
- 相邻极值规则(实验采用):与最近 $\tau$ 个窗口的最大值 U 和最小值 V 比较,大于等于 U 则剪枝、小于等于 V 则全视觉、介于两者之间则保持上一状态
均值规则平滑但对突变反应慢;相邻极值规则能快速响应局部运动变化,因此更适合捕捉粗操作与精细操作之间的切换。
复杂度收益从哪来
论文给出了显式的复杂度分析。单层 Transformer 的 FLOPs 近似为 $2S^2D + 4SD^2 + 6SDM$,其中 $S$ 是序列长度、$D$ 是隐维度、$M$ 是前馈中间维度。ADP 的打分开销只涉及两次投影和一个相似度矩阵,记为 $F_{score}$;剪枝后序列长度从 $S$ 降到 $S'$,H 层全部在更短的序列上运行,于是总开销是 $F_{score} + H \cdot F(S')$。
关键点在于剪枝发生在嵌入阶段、只做一次,而收益由所有 H 层共享。设任务执行中共有 T 次前向、其中比例 $\gamma$ 走剪枝路径,整个 episode 的期望节省量就是 $T \gamma$ 乘以单次前向的节省量——这也解释了为什么保留率越低、加速比越高。
附录里的算法全流程
论文附录给出了完整算法。主循环中:先用正运动学算窗口运动幅度,再更新门控状态;连续剪枝达到 3 次则强制复位;状态为 1 时在第 0 层计算重要度并按视角配额做 Top-K,重组序列后前向;否则直接走全视觉路径。冷启动、连续剪枝上限、多视角配额三个超参在仿真与真机设置中保持一致。
图 4:ADP 总览——(a) 动作感知门控由最近的末端轨迹(三个平移量、三个旋转量与夹爪状态)决定是否剪枝;(b) 预期式剪枝在进入 VLA 主干前按注意力相关性保留任务相关视觉 token、丢弃冗余 patch。
图 5:文本驱动的预期式剪枝——Step 1 从第 l 层取出预训练的 query / key 投影矩阵计算文本与视觉 patch 的相关性;Step 2 以文本为引导按排名剪掉视觉 token,只把高相关 patch 送入后续融合层。
实验设计与结果
评测协议
仿真使用 LIBERO 基准的四个套件:Spatial(空间理解)、Object(物体识别)、Goal(目标导向)、Long(长程规划),全部设置跟随 OpenVLA-OFT 的公开脚本,FastV 由作者在同一环境下复现。窗口大小取 OpenVLA-OFT 的 chunk size 8,前两个窗口冷启动全视觉,连续 3 窗剪枝后强制复位,多视角保留比例场景 : 腕部 = 4 : 6。
真机平台是 Kinova Jaco2 六自由度机械臂配平行夹爪,10 Hz 笛卡尔速度控制,单目索尼 AX53 相机以 640×480、30 FPS 采集,运行在 Ubuntu 20.04 加一张 RTX 4090 上。四个任务覆盖拾取、放置与擦拭:把橙色锅放进绿盘、把蓝色方块放到盘上、把胡萝卜放进蓝锅、擦桌子。每个任务用游戏手柄遥操作采集 100–150 条轨迹单独微调 OpenVLA-OFT,评测时每任务重复30 次并随机化物体初始位姿,物体完全落入目标容器记成功(擦桌任务以擦除面积 > 80% 为准),延迟取 100 次前向的平均值。
LIBERO 仿真结果
| 方法(OpenVLA-OFT 7B / 并行解码) | 平均成功率 | Long 成功率 | FLOPs | 加速比 |
|---|---|---|---|---|
| OpenVLA-OFT(全视觉基线) | 97.1% | 94.8% | 7.91 | 1.00× |
| FastV(+OFT) | 86.8% | 73.0% | 6.37 | 1.24× |
| VLA-ADP(保留率 30%) | 94.4% | 84.2% | 5.85 | 1.35× |
| VLA-ADP(保留率 50%) | 96.3% | 91.2% | 6.43 | 1.23× |
保留率 50%–70% 时,平均成功率只比全视觉基线低 0.8–0.9 个百分点,却已经拿到 1.13–1.23 倍加速;把保留率压到 30%–40%,平均成功率仍有 94.4%–94.8%,加速进一步提升到 1.29–1.35 倍。Spatial 套件上 ADP 甚至拿到99.4%,超过全视觉基线——这与「简单任务视觉冗余最高」的判断一致。
真机结果
| 方法 | Task1 | Task2 | Task3 | Task4 | 平均成功率 | 延迟 (ms) | 加速比 |
|---|---|---|---|---|---|---|---|
| OpenVLA-OFT(基线) | 83.3% | 93.3% | 86.7% | 80.0% | 85.8% | 76.9 | 1.00 |
| VLA-ADP | 90.0% | 90.0% | 90.0% | 83.3% | 88.3% | 51.8 | 1.49× |
真机上 ADP 在 Task1、Task3、Task4 上均超过基线,Task2 仅低 3.3 个百分点,而延迟从 76.9 ms 降到 51.8 ms。这是最值得注意的一点:加速的同时成功率反而提高了 2.5 个百分点——说明按阶段剪枝不只是省算力,还过滤掉了干扰注意力的冗余 patch。
消融:动态门控在承重
| 动态策略 | Spatial | Object | 平均成功率 | FLOPs |
|---|---|---|---|---|
| ADP(相邻极值门控) | 99.4% | 98.0% | 96.3% | 6.43 |
| 去掉门控(w/o D) | 98.2% | 88.0% | 93.45% | 6.23 |
| 去掉门控 + 周期切换(w/o D + PS) | 95.0% | 81.4% | 89.9% | 4.55 |
把门控换成固定周期切换后,Object 从 98.0% 掉到 81.4%,整整损失 16.6 个百分点,Spatial 也掉了 4.4 个百分点——固定节奏必然会撞上精细操作阶段。相对完全去掉门控的版本,ADP 只多花 0.20 个 FLOPs 就换回 2.85 个百分点的平均成功率。
打分层方面,第 0 层表现最好(96.3%,6.43 FLOPs),第 1 层 95.5%(6.57),第 4 层 95.8%(6.89)——越深的层不仅更贵,排序也更不稳定。
为什么随机剪枝会崩
随机丢弃 50% 的 token 在 Spatial 与 Goal 上还能撑住,但在 Object 上只有73.0%、Long 上只有76.2%。论文给出了解释:当目标物体横跨大量 patch 时,随机丢弃仍有较大概率保留到关键 patch;而当目标物体只占少数 patch 时,随机丢弃很容易直接把关键 patch 剪掉,导致物体识别错误并沿时间步累积成任务失败。
图 6:真机实验平台——Kinova Jaco2 六自由度机械臂配平行夹爪,单目索尼 AX53 相机固定于桌前覆盖整个工作区,所有观测均来自该固定视角。
图 7:LIBERO 四类任务的剪枝可视化——蓝色掩码标出被剪掉的视觉 token。保留的 token 持续聚焦任务相关物体,验证了文本驱动剪枝的有效性;在初始化、抓取、放置等关键阶段全视野被恢复,体现动作感知动态策略的作用。
图 8:层间参与度 PR——浅层数值较高,说明大量视觉 token 均衡参与、空间覆盖广;随层数加深迅速下降并趋于平稳,注意力塌缩到少数 token 上。
图 9:层间熵 H——浅层熵值高、分布平坦,Top-K 选择对离群点不敏感;深层分布尖锐化并拖出长尾,排序容易被局部噪声左右。两张图共同给出了「用第 0 层打分」的定量依据。
结果对比总结
图 10:结果对比:FastV 用固定保留率把平均成功率压到 86.8%、Long 仅 73.0%;ADP 保留率 50% 时 96.3%/1.23×,保留率 30% 时 94.4%/1.35×,真机做到 1.49× 且成功率 85.8%→88.3%。(Mermaid 流程图)
关键发现
- 训练无关即可拿到 1.35 倍加速:保留率 30% 时 LIBERO 平均成功率 94.4%、FLOPs 从 7.91 降到 5.85、LLM 侧加速 1.35 倍,全程没有任何权重更新。
- 门控单独贡献 2.85 个百分点:去掉动态门控后平均成功率从 96.3% 降到 93.45%,而计算量只多花 0.20 FLOPs;换成固定周期切换则进一步掉到 89.9%。
- 固定节奏在精细阶段代价巨大:周期切换让 Object 套件从 98.0% 掉到 81.4%(−16.6 个百分点),说明「什么时候剪」比「剪多少」更关键。
- 随机剪枝在目标物体小的时候失效:随机丢弃 50% 在 Object 与 Long 上只有 73.0% 与 76.2%,与 ADP 的 98.0% / 91.2% 形成鲜明对照。
- 真机同时拿到速度与成功率:延迟 76.9 → 51.8 ms(1.49×),平均成功率 85.8% → 88.3%,四个任务中三个超过基线。
- 打分层越浅越稳:第 0 层的平均成功率 96.3%、FLOPs 6.43,优于第 1 层(95.5%,6.57)与第 4 层(95.8%,6.89)——参与度与熵的层间塌缩为这一选择提供了机制解释。
从创新模式的角度看,ADP 命中三条清晰的结构性套路:把「剪多少」重述为由运动状态驱动的可判定规则(重新表述为可解对象)、以最近动作为条件变量而非重新训练(通过条件化适配)、先刻画静态与随机剪枝的失效边界再针对边界设计机制(刻画极限然后超越)。三条都落在「机制被切开验证过」这一类,而不是单纯的性能数字堆叠。
局限性
论文自述与可观察到的边界
- 真机平台单薄:只在 Kinova Jaco2 加单目固定视角上验证,没有装腕部相机,因此仿真里那套「场景 : 腕部 = 4 : 6」的多视角配额策略在真机上并未被检验。
- 门控依赖动作表示的具体约定:轨迹距离由动作块经正运动学积分得到,隐含了 $R_xR_yR_z$ 的旋转顺序与右乘组合约定;换一套机器人或换一种欧拉序都需要相应调整。
- 关键超参仍是手工设定:保留率 $\rho$、冷启动窗口数、连续剪枝上限 3 都是人工设定,论文没有给出自适应选取方案。
- 任务覆盖面有限:四个真机任务都是桌面拾取、放置与擦拭,未涉及接触密集的插装、双臂协作或可变形物体。
- 没有给出自回归设置的完整对照:摘要提到 "25.8% improvements with OpenVLA",但正文的 LIBERO 主表只有 OpenVLA-OFT(并行解码)变体,找不到与之对应的行。
阅读时需要注意的表述问题
- 摘要主张缺表支撑:摘要中的 "25.8% improvements with OpenVLA" 在正文表格中没有对应数据行,读者无法复核这个数字的来源。
- 项目链接失效:论文给出的项目页
vla-adp.github.io当前返回 404,且摘要里的显示文本写作 "ADP.com",与真实地址不一致。 - 若干笔误:摘要中 "correlated with the action dynamic" 应为 dynamics;预备部分 "inputs for actions positions" 语序不当;方法部分的 "The remain visual tokens ... is" 应为 remaining ... are;仿真表格的 LaTeX 标签写作
fig:SIMULATION EXPERIMENTS,但被当作 table 引用。
常见问题(FAQ)
ADP 需要重新训练 VLA 模型吗?
不需要。ADP 是训练无关的推理期方法,只使用已有的 query / key 投影权重做相关性打分,不引入任何新的可学习参数,直接插到 OpenVLA 或 OpenVLA-OFT 上即可使用。
ADP 和 VLA-Cache 有什么区别?
VLA-Cache 复用相邻时间步之间信息量低的 token 的 key 与 value,减少的是注意力计算;ADP 则直接缩短进入 LLM 的输入序列长度,收益由所有层共享。两者是同一课题组在同一方向上的互补工作。
ADP 的判断依据为什么用末端轨迹而不是注意力分数?
注意力分数只反映「文本与视觉的相关性」,无法表达操作的物理阶段。末端轨迹幅度是一个可直接观测的物理量:搬运、接近时幅度大、冗余高;抓取、对准、插入时幅度小、细节关键。用轨迹做门控,等于引入了注意力之外的第二个信息源。
保留率应该设成多少?
论文给出的经验区间是 50%–70% 优先:此时平均成功率只损失 0.8–0.9 个百分点,加速 1.13–1.23 倍;如果更看重速度,压到 30%–40% 仍有 94.4%–94.8% 的平均成功率与 1.29–1.35 倍加速。具体取值取决于任务对精细操作的敏感程度。
为什么打分层选第 0 层而不是更深的层?
浅层注意力分布平坦、参与度高、熵高,Top-K 排序对个别离群点不敏感;深层注意力塌缩到少数 token、分布尖锐并拖出长尾,排序容易被局部噪声左右。而且层越深,需要前向的层数越多、FLOPs 越高,因此第 0 层在精度与开销上同时占优。
连续剪枝 3 次就强制恢复全视觉,这个规则重要吗?
重要。它把剪枝从「可能持续累积误差」的操作变成有界的时序决策,与两窗冷启动一起构成安全边界。消融显示去掉门控(等价于丧失阶段自适应能力)会直接损失 2.85 个百分点,说明这类保护与门控本身共同承担了稳定性。
参考链接
- 论文 arXiv 摘要页:https://arxiv.org/abs/2509.22093
- 论文 HTML 全文(arXiv):https://arxiv.org/html/2509.22093v1
- 项目网站:论文标注为
https://vla-adp.github.io/,当前返回 404,暂不可访问 - OpenVLA-OFT(本文主线基线):https://arxiv.org/abs/2502.19645
- FastV(最接近的免训练剪枝基线,ECCV 2024):https://arxiv.org/abs/2403.06764
- VLA-Cache(同课题组跨步复用方案):https://arxiv.org/abs/2502.02175
- LIBERO 评测基准(NeurIPS 2023):https://arxiv.org/abs/2306.03310
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)