摘要
本文解读 RSS 2025 论文《GeoDEx: A Unified Geometric Framework for Tactile Dexterous and Extrinsic Manipulation under Force Uncertainty》。该论文提出用平面、锥、椭球三类几何原语统一触觉操作的力估计、力规划与力控制,通过融合力平衡超平面(FE-plane)、测量锥(M-Cone)与信任测量椭球,让机器人在触觉力读数有界不确定的前提下依然能规划出可行的接触力,其特别之处在于不去修正传感器,而是把不确定性写进问题的几何结构。实验表明三指抓取扳手的成功率从直接使用原始读数的 20% 提升到 80%,四指抓取圆柱从 0% 提升到 60%,力误差压到 0.09±0.04 N,规划速度比二阶锥规划(SOCP)快约 14 倍(100 步规划 4.81 s 降到 0.31 s),并在立方体与螺丝刀两项外延操作上把角度误差控制在 5° 与 7° 以内,为触觉驱动的灵巧操作提供了可直接复用的表示与诊断框架。
视频讲解:点击观看 B 站视频
- 摘要
- 论文基本信息
- 背景与动机
- 研究主线:从问题到结论
- 基准/方法设计
- 分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- GeoDEx 解决的核心问题是什么?
- 为什么不能直接用触觉读数做反馈?
- 14 倍加速是怎么来的?
- GeoDEx 能处理没有触觉的位置吗?
- 方法的边界在哪里?
- 这篇论文在叙事与措辞上有什么可借鉴之处?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | GeoDEx: A Unified Geometric Framework for Tactile Dexterous and Extrinsic Manipulation under Force Uncertainty |
| 标题(中文) | 力不确定下的灵巧抓取与外延操作统一几何框架 |
| 作者 | Sirui Chen, Sergio Aguilera Marinovic, Soshi Iba, Rana Soltani Zarrin |
| 机构 | 斯坦福大学计算机科学系 · 本田研究院美国(Honda Research Institute USA) |
| 会议 | RSS 2025(Robotics: Science and Systems XXI,洛杉矶,2025 年 6 月,DOI 10.15607/RSS.2025.XXI.057) |
| arXiv | arXiv:2505.00647 |
| 论文主页 | RSS XXI 官方论文页(含 PDF 与 BibTeX) |
背景与动机
触觉传感这条技术线已经走过了十几个年头。综述工作(Kappasov 等,2015)早就指出,接触力是评判抓取质量最直接的物理证据;随后 Xela 之类的商用阵列、光学触觉传感器与电子皮肤(Nature 2019 的可拉伸触觉手套、Science 2023 的低压电子皮肤)不断把分辨率与覆盖面积推上去。到了 2023—2024 年,视觉与触觉结合的在位物体旋转(CoRL 2023)、视觉触觉协同的灵巧操作(ICRA 2024)、双臂多指触觉技能学习相继出现,触觉终于进入了闭环控制。
问题出在力的精度上。以本文使用的 Touchlab 触觉指尖为例,每个指尖有 42 个压电 taxel,量程 0.1–20 N,但存在四类系统性误差:激活阈值在 0.1–0.5 N 之间(新 taxel 接触时读数出现阶跃)、迟滞在 0–0.2 N 之间(已脱离接触的 taxel 仍输出小值)、力误差在 0.1–0.5 N 之间(部分接触或受力偏离 taxel 法线)、稳态噪声 0.01–0.03 N。单个 taxel 的误差在 0.1–1 N,累积到指尖合力级别后更大。
这个误差量级恰好落在多指抓取的力平衡尺度上。三指抓取扳手时,拇指需要加大力才能达标,而食指与中指需要减小力——但三根手指必须同时增力或同时减力才可能维持力平衡,于是控制目标彼此冲突,多指力平衡在数学上无解。先行工作因此普遍选择从读数中只提取显著信息:二值接触、3 bit 的力方向、滑移判别,用绕开噪声换取鲁棒,代价是彻底放弃力的大小。另一类做法是用额外的力/力矩传感器或更复杂的机构去做标定与补偿,代价是硬件成本与配置复杂度。
GeoDEx 的取舍是第三条路:不假设读数够准,而是假设「力读数有界不确定、接触位置与法线可信」——前者用椭球膨胀成可行域,后者用平面投影给出满足力平衡的最小幅值估计。这样既保留了力的大小信息,又不再需要力学标定的精度。
研究主线:从问题到结论
图 9(Mermaid 流程图):GeoDEx 研究主线——问题、动机、几何设计、方法、实验与结论。
基准/方法设计
系统由三个组件构成,全部建立在准静态与重力的假设之上。力规划器利用接触位置与法线、物体质量、质心与摩擦,通过牛顿—欧拉方程解出能维持力平衡的期望接触力,并把传感器误差界考虑进去,得到对本轮噪声鲁棒的力计划。力估计器把带噪读数投影到力平衡超平面上,给出保证力闭合、但不等于真值的力估计 $f_{\mathrm{est}}$。导纳控制器以关节位置为输入、以接触力误差为反馈,把六维力误差转换成期望关节位移,由手内的低层 PD 环执行。
实验平台是 Franka FR3 机械臂配合 Allegro Hand V4(4 指 × 4 DoF),指尖改装为 Touchlab 触觉指尖;位姿真值来自 OptiTrack 动捕,精度 0.4 mm 与 0.05°。
图 1:实验硬件。Franka FR3 臂 + Allegro Hand V4(4 指 × 4 DoF),指尖为 Touchlab 触觉指尖(每指 42 个压电 taxel);3D 打印的球、扳手与圆柱罐用于灵巧抓取,3D 打印立方体与真实螺丝刀用于外延操作。
评测协议是同一套控制器只换反馈信号:每个物体做 20 次抓取(10 次用 $f_{\mathrm{est}}$、10 次用 $f_{\mathrm{raw}}$),成功定义为物体姿态变化不超过 1°;两项外延操作各做 14 次(7 对 7),报告角度轨迹的均值与标准差。仿真侧使用 MuJoCo,并按上面标定出的四类误差注入 0.5 N 噪声,保证仿真结论可迁移到硬件。
分类全景
图 10(Mermaid 分类图):四类几何原语及其对应能力——等式约束变平面、约束保持线性、区分可测与不可辨识、把噪声膨胀成鲁棒计划。
方法细节
第一,力平衡超平面。把所有接触力($n_i$ 个内在接触 + $n_e$ 个外在接触)堆成一个向量 $f$,能抵消重力扳量的力集合构成力空间中的一张超平面,满足 $A_{fe}^{\top}f=-g$,其维度为 $d_{fe}=3(n_i+n_e)-\mathrm{rank}(A_{fe})$。这一步把「力平衡」从一组等式约束变成了一张平面。
第二,平面上的坐标系。在该平面上取一组正交基 $B_{fe}$,任意平面内的力可以写成基向量的加权和,坐标记为 $x_{fe}=P_{fe}(f-f_0)$。关键在于:摩擦力锥与最小力约束在这个坐标下仍然是线性不等式,于是规划问题退化为一个小规模二次规划,不需要 SOCP。这是 14 倍加速的结构性来源。
第三,测量锥。可测量集合是各接触法线的非负加权和,恒过原点。只有内在接触时可以测到锥面上的一个点;一旦存在无触觉的外在接触,读数只能张成锥内的一个子空间锥,真值不再可辨识,估计器只能退化为最小化「到子锥距离 + 到原点距离」。
第四,信任测量椭球与传播。把每个接触的法向力误差建模为高斯 $\epsilon_i\sim\mathcal{N}(\sigma_i,0)$,取一倍标准差为可信域,得到测量锥上的椭球 $m^{\top}Dm\leq 1$;再用投影矩阵把它传播到力平衡平面,得到 $M=(E^{\dagger})^{\top}DE^{\dagger}$。误差由此变成规划空间里可解析的可行域边界。外在接触的方差置为无穷,椭球沿该轴无限拉长——「无触觉」这件事在数学上就是方差无穷大。
图 2:系统框图。上方为力规划器(含传感器误差界)与力估计器(从触觉读数 + 机器人状态 + 物体位姿反解所有接触力),下方为导纳控制器闭环,控制量为期望关节位置。
图 3:FE-plane、M-Cone 与约束凸集的相对位置。可测集合是锥、可行集合是凸集,两者的交集是否非空,决定了本次抓取能否被规划出来。
传感器误差模型的取值依据来自一次专门的标定:仿真按激活阈值、迟滞、力误差与稳态噪声四类特性注入误差,并与 ATI Nano17 力/扭矩传感器的真值以及硬件实测触觉读数做对照。结论是仿真能够复现真实读数的误差形态,主要差距在于仿真对全部指尖使用统一刻画,而真实误差随接触位置与接触面积变化、个体 taxel 之间也不同。这层标定同时为信任椭球的 $\sigma_i$ 提供了物理上可解释的取值。
实验设计与结果
抓取实验分三个层次。二指抓取 82 g 的球作为最小例子——两指力必须等大反向,用来看清读数误差如何破坏平衡。三指抓取 3D 打印的 300 g 扳手:先收敛、保持 20 s、抬起放下,再在第 40 s 切换到原始读数。四指抓取 360 g、直径 0.11 m 的圆柱:接触点分布迫使控制器在四个方向同时平衡。外延操作有两项:立方体绕桌面棱边做 58° → 30° 的偏航旋转,以及 300 g 螺丝刀绕刀尖的翻转(摩擦系数约 0.6)。
图 4:五类接触配置下的成功抓取。全部场景共用同一套规划器与估计器,区别只在于接触集合里是否包含无触觉的外在接触。
主结果如下表。控制器、物体与抓取构型全部不变,唯一变量是反馈信号:
| 物体 | 反馈信号 | 成功率 | 成功时力误差 | 失败时力误差 |
|---|---|---|---|---|
| 扳手(三指) | $f_{\mathrm{est}}$ | 80% | 0.09±0.04 N | 0.73±0.26 N |
| 扳手(三指) | $f_{\mathrm{raw}}$ | 20% | 0.19±0.16 N | 0.83±0.57 N |
| 圆柱(四指) | $f_{\mathrm{est}}$ | 60% | 0.35±0.17 N | 0.57±0.31 N |
| 圆柱(四指) | $f_{\mathrm{raw}}$ | 0% | — | 0.82±0.45 N |
图 5:三指抓取扳手的代表性时序。0–27 s 用估计力闭环(5 s 内收敛到 0.09±0.04 N,保持 20 s 姿态静止),27 s 抬起、33 s 放回;40 s 起切到原始读数,食指误差冲到 0.5–0.9 N,物体倾斜并最终掉抓。
失败案例可以逐一归因。十次扳手实验中有 2 次失败源于触觉响应饱和——用力增加而读数不再变化,误差超出建模噪声范围,造成过压;理论上可以调大模型噪声,但那同时要求更大的抓取力,代价转移到物体上。圆柱的 60% 低于扳手的 80%,因为它迫使控制器在四个方向同时平衡:3 次失败其实只出现约 3° 倾斜且仍被握住,1 次是食指多个 taxel 的迟滞制造了「很大的力」的假象,食指退开后圆柱已经移位。原始读数下偶尔也能成功,那几次恰好各指误差同号且接近估计值——成功来自运气而不是控制,且多半在暗中过压。
| 实验 | 次数 | 成功率 | 主要失效模式 |
|---|---|---|---|
| 扳手抓取 $f_{\mathrm{est}}$ | 10 | 80% | 触觉响应饱和 2 次(读数不随力增长) |
| 扳手抓取 $f_{\mathrm{raw}}$ | 10 | 20% | 各指误差不同号,力平衡被拆散 |
| 圆柱抓取 $f_{\mathrm{est}}$ | 10 | 60% | 3 次仅约 3° 倾斜仍抓住;1 次 taxel 迟滞 |
| 圆柱抓取 $f_{\mathrm{raw}}$ | 10 | 0% | 力误差约 1 N,倾斜或抬起时丢抓 |
| 立方体 pivoting | 7 对 7 | 误差 <5° | 超过 30° 后摩擦不足、滑移丢接触 |
| 螺丝刀 pivoting | 7 对 7 | 误差 <7° | 原始组 2 次抬起刀尖并掉落 |
外延操作改变了问题的结构:物体与桌面之间存在无触觉的外在接触,其接触力不可测量,只能通过最大程度抵消重力与内在力来隐式求解。立方体从 58° 转到 30°,实验中机械臂只走完约 2/3 的期望轨迹,其余旋转由手指的力控制完成,这证明旋转不是靠机械臂拖着走;超过 30° 后立方体与桌面的摩擦开始不足以支撑,会滑移并丢失接触,因此分析止于 30°。螺丝刀任务中,估计组全程保持抓取且刀尖始终贴合桌面,终点角度误差小于 7°;原始读数组无法收敛到期望力,工具绕纵轴扭转,其中 2 次指尖把刀尖抬离桌面并最终掉落。
图 6:立方体外延操作的 yaw 角轨迹(实线均值、浅色带标准差)。估计组跟踪期角度误差保持在 5° 以内;原始组整体偏差落在 5°–10°,且臂停止后手指无法再把物体推回目标角。
图 7:螺丝刀绕刀尖 pivoting 的角度轨迹。估计组全程收敛到规划力并保持刀尖接触桌面;原始读数组出现大幅偏移,其中两条轨迹在刀尖被抬离桌面后发生突然掉角。
效率对账是本方法的另一个必要证据。导纳控制的闭环需要在每个控制周期重算力计划,通用凸优化在这个尺度上无法闭合:
| 方法 | 100 步 | 300 步 | 单步加速 |
|---|---|---|---|
| 直接求解 SOCP | 4.81 s | 13.36 s | — |
| 几何框架(本文) | 0.31 s | 0.97 s | 约 14 倍 |
加速有三个来源:用 12 面金字塔近似摩擦锥,配合坐标变换把约束保持在平面坐标的线性不等式形式;先在低维平面坐标里求解再映射回力空间,把估计问题退化为到原点距离与到子锥距离的二次目标;以及在存在无触觉外在接触、矩阵低秩时用伪逆替代求逆。4.81 s 无法闭合、0.31 s 可以闭合——这 14 倍是方法可用性的前提,而不是锦上添花。
图 8:测量子空间锥(附录补充)。只有一个内在接触和一个外在接触时,内置触觉只能测到内在接触的法向力,可行读数不再覆盖整条测量锥,而只张开为一个子空间锥(橙色射线);估计器要在此约束下同时最小化到原点与到子锥的距离。
结果对比总结
图 11(Mermaid 流程图):结果对比总结——成功率 20%→80%、0%→60%,力误差 0.09±0.04 N,规划 4.81 s→0.31 s,外延操作 5°/7° 以内。
关键发现
- 反馈信号的选择直接决定力平衡是否可解。同一控制器、同一物体,从原始读数换到估计力,扳手成功率 20% → 80%,圆柱 0% → 60%,成功样本的力误差压到 0.09±0.04 N。
- 失败可以归因,而不是含糊的「泛化不足」。所有估计力失败都可回溯到读数超出建模噪声界:2/10 次扳手失败是触觉响应饱和,1/10 次圆柱失败是 taxel 迟滞制造的假大力。
- 几何重构换来的是实时性。把等式约束换成坐标系之后,100 步规划从 4.81 s 降到 0.31 s(约 14 倍),300 步从 13.36 s 降到 0.97 s。
- 内在接触与外在接触是同构的。把无触觉的外在接触当作「方差无穷大的测量」,同一个估计器与规划器就同时解决了 2/3/4 指抓取与两项 pivoting,立方体与螺丝刀的角度误差分别控制在 5° 与 7° 以内。
- 从创新模式看,这篇论文同时命中了三种模式。一是「重新表述为可解对象」(重述暴露了原形式下不可见的线性结构);二是「审计并扭转负载假设」(实测证明原始读数不能直接作闭环反馈);三是「统一异构输入到同一空间」(有无触觉的接触被统一表达在同一平面上)。它既有结构性洞察,又提供了可复用的表示与诊断方法,因此在程序委员会与社区两个维度上的评价都为正。
局限性
- 接触位置与法线被当作准确已知。实际上它们由各 taxel 读数的加权质心与加权法线算出,本身带有误差,这些误差会直接进入力平衡约束矩阵 $A_{fe}$,却没有被纳入不确定性建模。
- 噪声模型不完整。仿真的触觉模型对全部指尖使用统一的误差刻画,没有建模脉冲噪声与通道串扰,也没有考虑误差随接触位置与接触面积变化;硬件上表现出对这些因素的鲁棒性,但没有系统量化。
- 仅限准静态与静态抓取。整条推导建立在力平衡假设上,动态运动以及需要主动施加外力的场景(例如用扳手拧螺栓要施加力矩)不在覆盖范围内。
- 评测规模有限。每个条件只有 7–10 次,且传感器饱和这一主要失效模式并没有进入误差模型,失败案例的解释是事后归因。
- 作者给出的方向是:把接触位置与法线的不确定性一起传播进力平衡椭球;在仿真中补上脉冲噪声与串扰;从准静态走向动态操作与主动施力任务。
常见问题(FAQ)
GeoDEx 解决的核心问题是什么?
核心问题是触觉传感器的力读数不够准,而多指抓取的力平衡又要求足够准。GeoDEx 的答案是:不要求读数准,只要求「误差有界」——把误差界写成椭球、把力平衡写成平面,然后在两者的交集里找可行点。
为什么不能直接用触觉读数做反馈?
因为各指的误差方向不同。三指抓取时拇指要加力、食指与中指要减力,而三指必须同时增力或同时减力才能维持力平衡,控制目标彼此冲突,平衡在数学上不可达。实测结果是扳手成功率 20%、圆柱 0%。
14 倍加速是怎么来的?
来自把力平衡从「等式约束」变成「坐标系」。在力平衡平面坐标下,摩擦锥与最小力约束保持线性,规划退化为小规模二次规划,不再需要求解二阶锥规划。100 步规划由 4.81 s 降到 0.31 s。
GeoDEx 能处理没有触觉的位置吗?
能。物体与环境的接触(外在接触)没有触觉读数,GeoDEx 把它建模为「方差无穷大的测量」,椭球沿该轴无限拉长,估计器退化为最小化到子锥距离与到原点距离。这正是立方体与螺丝刀两项外延操作的基础。
方法的边界在哪里?
四条:接触位置与法线被假定准确;噪声模型未覆盖脉冲噪声与串扰;只适用于准静态与静态抓取;每个条件的评测只有 7–10 次。作者点名的下一个目标是用扳手拧螺栓这类需要主动施加力矩的任务。
这篇论文在叙事与措辞上有什么可借鉴之处?
叙事上它用感官隐喻开场(“Sense of touch ... enables them to perform challenging tasks such as grasping fragile objects or using tools.”),接着用落差转折指出「测得的力的精度与力传感器并不相称」,最后用一句统一承诺收束,并在摘要里用 14 倍加速兑现。措辞上证据框架是正面的、数字被前置,新颖性立场是断言式的(一个动词把估计、规划、控制三件事收进一个框架),范围框架则是主动收窄的。值得注意的是原文仍留有若干小瑕疵:正文中 con sider 一词内部多了空格、扳手质量写作 300 gr 而单位应为克、效率表里 0.97 缺了单位秒。
参考链接
- 论文 arXiv 摘要页:arXiv:2505.00647
- RSS XXI 官方论文页(PDF + BibTeX,DOI 10.15607/RSS.2025.XXI.057):roboticsproceedings.org/rss21/p057
- 触觉传感与灵巧手综述:Kappasov, Corrales, Perdereau,Tactile Sensing in Dexterous Robot Hands — Review, Robotics and Autonomous Systems, 2015
- 视觉触觉结合的在位物体旋转:Qi 等,General In-hand Object Rotation with Vision and Touch, CoRL 2023
- 视觉触觉协同的灵巧操作:Yuan 等,Robot Synesthesia: In-hand Manipulation with Visuotactile Sensing, ICRA 2024
- 外接触模式控制(外延操作):Oller, Berenson, Fazeli,Tactile-driven Non-prehensile Object Manipulation via Extrinsic Contact Mode Control, arXiv:2405.18214
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟复旦大学 FudanNLP 团队自研 切问学术
官网:qiewenpaper.com
覆盖3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)