“foundation model” 热潮终于轮到触觉了?
——不是跟风,是被‘逼’的
目录
01 传感器能换,数据不能跟着“清零”
02 数据能留下,模型也开始不想每个任务都从头学
03 会“摸懂”还不够,触觉开始真正改变动作
04 再往前一步:机器人开始预测“下一次会摸到什么”
05 为什么偏偏是现在?
06 但触觉离“视觉的今天”,其实还很远
07 换掉的不是传感器,而是问题本身
如果把机器人触觉的发展拉长到几十年,一个最直观的变化,是机器人终于越来越“摸得清楚”了。
早期的力传感器告诉机器人“有没有受力”;柔性电子皮肤开始把接触铺到更大的表面;GelSight、DIGIT 这类视觉触觉传感器,则进一步把硅胶表面的细微形变直接变成图像。
很长一段时间里,触觉研究最基础的问题都可以概括成一句话:怎么把一次接触,变成足够丰富、足够稳定、足够精细的信号。
当然,这个问题今天依然没有结束。
但若把视线收窄到 2024—2026 这三年,会发现研究重心正在“后移”:
不再只问“怎么把触觉测出来”,而是问“拿到触觉之后,机器人到底该学到什么”。
于是,问题变成了:
“
换一块传感器,模型还能不能用?
不同任务,能否不再反复采标注、重训,而是共享一套通用触觉表示?
触觉进入 VLA 后,能否让“摸到什么”直接改变“下一步怎么做”?
更进一步,机器人能否在接触发生前就预测:下一步动作之后,我应该“摸到”什么?
当我们把这些问题放在一起看,会发现已经不再是“再训一个模型”能解决的了。它们要的是一套通用、可迁移、能进入策略和预测的触觉能力。
而这,也恰好触及了 foundation model 在视觉和语言领域试图回答的核心问题之一。
所以,“foundation model”热潮终于轮到触觉了?
与其说“跟风”,不如说触觉自己走到了一个相似的关口。
因为我们把 2024 到 2026 这三年的一批工作放在一起仔细研究后,发现了一条很清楚的变化路径:
触觉,从传感器,到表示;从表示,到策略;再从策略,走向了对未来接触的预测。
01 传感器能换,数据不能跟着“清零”
触觉研究有一个长期存在、但可能很少被注意到的问题:
同一套算法,换一块传感器,可能就不好用了。
原因并不难理解。
触觉传感器和普通相机很不一样。尤其对视觉触觉传感器来说,硅胶的软硬、表面纹理、内部照明、marker 的位置,甚至使用一段时间之后的磨损,都可能改变最终看到的信号。
于是模型学到的,可能不只是“这个接触代表什么”,还顺手记住了:“我现在用的是这一块具体的传感器。”
在实验室里,传感器坏了,重新标定,再采一遍数据,也还能继续做实验。
但一旦机器人真的要长期运行,它就会变得很现实。
皮肤会磨损,手指会更换,机器人也不可能永远使用同一块触觉模块。如果每换一次皮肤,都要重新采数据、重新训练策略,那么触觉再灵敏,也很难像相机一样变成一个可以规模化部署的基础部件。
- 2024 年的 AnySkin是这一阶段很有代表性的一项工作。
它关注的重点并不是“把分辨率再提高多少”,而是三个很工程、却非常关键的问题:
能不能方便替换?
能不能装到不同机器人上?
以及换了一块 skin 以后,过去的数据和策略还能不能继续用?
▲图1 | 触觉走向长期使用后,第一个问题不是“能不能测”,而是“换了还能不能用”。AnySkin 将感知表面做成可替换部件,并适配 Franka、Dobb-E stick、LEAP Hand 等不同末端。对机器人学习更重要的是,硬件实例变化后,已经采集的数据和训练好的策略仍有机会继续复用。只有数据不再随着一块皮肤的磨损而一起“报废”,触觉才可能真正积累出规模。
这种思路意味着,触觉研究第一次很明确地碰到了一个视觉领域早就经历过的问题:
硬件可以换,模型最好别跟着从头来。
而当“数据能不能留下来”开始成为问题以后,下一步几乎是顺理成章的。
既然数据终于有机会被复用,那我们还要不要继续为每一个触觉任务,单独训练一个模型?
02 数据能留下,模型也开始不想每个任务都从头学
过去很长一段时间,触觉学习的方式都非常直接。
想检测滑移,就收一批 slip 数据,训练一个 detector;
想估计接触力,就收一批带力标签的数据,训练 force estimator;
想识别材质,再换一个 texture classifier;
想做插入,再重新采插入任务的数据,训练一套 policy。
每个任务都能做,但每多一个任务,就几乎要重新来一遍。
更麻烦的是,不同传感器还长得不一样。DIGIT、GelSight、GelSight Mini 的成像方式、marker、视场都有差异。在某一类传感器上学到的特征,换到另一类设备上,不一定还能直接复用。
这让触觉在很长一段时间里呈现出一种“碎片化”状态:
传感器是碎的,任务是碎的,模型也是碎的。
而视觉领域已经走过另一条路。
今天很少有人会为了每一个新视觉任务,都从随机初始化开始训练一个完整 encoder。更常见的做法,是先用海量数据学一个通用 representation,再用少量下游数据解决检测、分割、深度估计等具体问题。
触觉能不能也这么做?
- 2024 年的Sparsh,很系统地把这个问题摆到了台前。
它没有先挑“滑移检测”或“力估计”作为唯一目标,而是整合了超过 46 万张用于自监督预训练的触觉图像,用 MAE、DINO、I-JEPA 等方法先学习通用触觉表示,再把同一套表示拿去解决六类不同问题。
▲图2 | 当触觉数据开始能够积累,问题就从“每个任务训一个模型”转向“能不能先学一个通用底座”。Sparsh 左侧覆盖 DIGIT、GelSight、GelSight Mini 等不同传感器,右侧则把力估计、滑移、姿态、抓取稳定性、材料识别和机器人操作放进同一套表示里。真正的变化不是多做了几个任务,而是研究者开始寻找一种能够跨传感器、跨任务复用的“接触知识”。
此外,研究还专门构建了 TacBench,把力估计、slip detection、姿态估计、抓取稳定性、纺织物识别和机器人操作放到同一套评估中。
在标注数据有限的设置下,自监督预训练表示整体明显优于从头训练的 task-specific、sensor-specific 模型。据实验数据,在 TacBench 的有限标注设置下,SSL 预训练平均比对应的端到端训练高 95.1%。
但这个数字本身并不是这项工作的重点。
更重要的是,触觉开始拥有了一个过去主要属于视觉和语言的问题:有没有一种 representation 本身就理解“接触”这件事?
这和“识别当前有没有滑”已经不是同一个尺度的问题了。
前者解决一个任务;后者想建立一个以后可以被不同任务反复调用的“触觉底座”。
到这里,触觉已经第一次有了点“基础模型”的味道。
但 representation 再通用,如果最后只是停在“识别滑移”“估计力”这些感知任务上,它仍然没有真正进入机器人最核心的闭环。
于是问题继续往后移动:如果模型已经学会“理解触觉”,这些理解什么时候才会真正变成机器人的行为?
03 会“摸懂”还不够,触觉开始真正改变动作
这是 2025 年之后非常明显的一次变化。
过去的 tactile model 很多时候仍然像一个外围感知模块。
它可以告诉机器人:“现在正在滑”、“当前接触力偏大”、“物体可能比较软”
这些信息当然有用。
但机器人最终真正要解决的问题不是“判断对不对”,而是:知道这些以后,下一步动作怎么改?
这正好碰上了 VLA 的快速发展。
可真正进入接触之后,视觉和语言往往只能把机器人送到“差不多正确的位置”。
最后几毫米怎么办,力度多大,是否打滑,是否卡住,这些信息仍然藏在物理接触里。
- 于是一批工作开始尝试把触觉从外围模块,真正接入机器人 policy,其中Tactile-VLA 是一个很直观的代表。
它关心的已经不是让模型单独预测某个力值,而是让语言里的物理语义真正落到执行上。
▲图3 | 触觉进入 VLA 之后,角色从“状态检测器”变成了动作决策的一部分。左侧把“轻一点 / 重一点”这样的语言要求落实成不同作用力;中间利用物体重量、脆弱程度等常识调整抓取;右侧则在擦拭失败后根据接触反馈改变动作。也就是说,模型不再只是知道“现在力太小”,而要进一步决定“下一步应该多压多少”。
这件事看上去只是“VLA 多了一个模态”。实际上,它把触觉推到了一个更难的问题上:
模型到底应该从触觉里学什么?
因为视觉-触觉传感器首先输出的是一张图,如果沿用视觉基础模型的思路,很自然会把 tactile image 当作另一种视觉输入,或者让它和 RGB 图像在 latent space 里做对齐。
可机器人真正关心的,并不是这两张图片长得像不像。
机器人更关心的是:这块硅胶为什么这样变形?这意味着多大的力、剪切方向在哪里、接触是不是已经接近打滑?
于是到 2026 年,研究开始进一步从“触觉进入 VLA”推进到“触觉应该被什么物理量约束”。
- TaF-VLA就提出了一个很有代表性的变化:与其只做 tactile-vision alignment,不如直接做 tactile-force alignment。
▲图4 | 当触觉真正进入决策后,新的问题变成“这套表示到底理解了什么”。TaF-VLA 不再只把触觉图像当成另一种视觉纹理,而是先同步采集视觉触觉、六轴力/力矩和矩阵压力,让 tactile representation 直接对齐真实 interaction force,再接入 VLA。这里的关键转向是从“图像像不像”走向“这次形变究竟对应什么物理作用”。
这项工作建立了超过千万级同步 tactile-force frame 的数据,并收集超过一万条真实操作 episode,覆盖 20 多类 force-aware manipulation task。
从这里开始,“通用触觉表示”内部也出现了一种很有意思的分工。
- 有的工作更强调 semantic alignment,让触觉和视觉、语言拥有统一语义;
- 另一些则更关心 physical grounding,希望表示里真正留下力、滑移、形变和接触动态。
这两条路线不一定互相排斥,相反,它们共同说明了一件事:
触觉正在从一种传感器输出,变成基础模型内部的一种物理表示。
但只做到这里,机器人依然主要是在“读现在”:动作发生了,触觉变化了,模型再做调整。
而过去一年里更明显的新变化,是研究者开始追问下一件事:机器人能不能提前知道,下一步应该摸到什么?
04 再往前一步:机器人开始预测“下一次会摸到什么”
传统触觉的工作方式,本质上是反馈式的。
机器人先动 → 接触发生 → 传感器看到形变、压力或者滑移 → 控制器再调整动作。
这套逻辑没有问题,也非常重要。
但它天然发生在“事情已经发生之后”。
如果机器人在插头真正推入接口之前,就能预测正确接触应该如何演化,知道接下来几百毫秒的压力和剪切应该是什么样——
那么当真实触觉突然偏离预测时,机器人就可以立刻意识到:动作正在偏离预期。
这时,触觉就不再只是 observation;而是开始成为 prediction target。
- 2026 年的 OmniVTA 是这条路线中非常典型的一项工作。
背后首先是数据规模的变化。配套数据集 OmniViTac 包含超过 2.1 万条 visuo-tactile-action trajectory,覆盖 86 个任务、100 多种物体和六类接触模式。
但真正值得注意的是模型结构:
它已经不只是“当前视觉 + 当前触觉 → 下一步动作”,而是引入 visuo-tactile world model,对短期未来的视觉与接触状态进行建模,再把这种预测交给慢速 policy 生成较长的动作段;
与此同时,另一条 60 Hz 的触觉回路持续读取真实接触,对偏差进行快速纠正。
▲图5 | 触觉走进 world model 后,机器人不再只等“碰到了再反应”。OmniVTA 左侧的慢速策略先预测未来视觉和触觉,再生成一段主体动作;右侧 60 Hz 的快速回路持续读取真实触觉,对“实际摸到的”和“预计应该摸到的”之间的偏差进行修正。触觉由此同时成为未来预测目标和实时反馈信号。
这时候,世界模型真正的作用,是让机器人知道:如果当前动作是对的,接触状态应该往哪里发展。
这也让触觉能够覆盖比插孔对准更复杂的过程。
▲图6 | 擦拭、削皮、切割、装配、抓取和调整看起来是六种任务,本质上都要求机器人持续维持和修正接触。它们说明触觉研究的对象正在从“某一帧有没有接触”,扩展为“几秒钟内接触状态如何随动作演化”。当研究对象变成一段动态过程,预测未来触觉也就从附加能力变成了控制本身的一部分。
- 几个月后的TouchWorld 又把这种“预测 + 反应”的分工进一步拆得更明确。
它把高层视觉语言规划、触觉世界模型、正常动作生成和高频触觉修正放在不同时间尺度上。
▲图7 | TouchWorld 把“预测未来”和“实时反应”进一步拆到不同时间尺度:1 Hz 的高层负责子任务与未来 tactile subgoal,10 Hz 的策略据此生成主体动作,30 Hz 的触觉 refinement 则处理接触后的快速偏差。这里最值得注意的是,同一种触觉同时承担两种职责:它既是“未来应该达到什么状态”的目标,也是判断“现在有没有偏离”的反馈。
如果说前几年触觉更多是在帮助机器人回答:“我现在碰到了什么?”
那么到了这里,问题已经明显变成:如果我接下来这么做,我应该碰到什么?
从“识别现在”到“预测未来”,看起来只是多预测了几帧触觉,实际却改变了触觉在机器人系统里的位置。
它不再只是动作执行后的反馈,而开始成为动作执行前就存在的一种物理预期。
这一步,才真正让触觉开始进入机器人的内部世界模型。
05 为什么偏偏是现在?
为什么这些变化偏偏集中发生在最近三年?
如果只看论文名字,很容易把它简单理解成:“foundation model 热潮终于也轮到触觉了。”
但事情也没有这么简单,它背后其实是几个条件同时成熟。
- 第一,触觉硬件终于变得更容易获得。
GelSight Mini、DIGIT、AnySkin,以及大量新的视觉触觉、磁性触觉和电子皮肤,让触觉不再只能依赖少数昂贵、难集成的实验平台。
- 第二,视觉触觉把“接触”变成了现代模型熟悉的数据形态。
传统力传感器可能只有几个通道。
一张 tactile image 却可以同时包含接触区域、几何、剪切、形变、纹理等复杂线索。
对于 ViT、Transformer、diffusion model 和今天的 VLA 来说,这意味着触觉终于可以直接借用视觉领域已经非常成熟的工具链。
- 第三,也是最重要的,机器人学习本身换了目标。
过去很多机器人策略只需要解决一个固定任务。
在这种情况下,一个任务训练一个 tactile model,虽然麻烦,但并非不能接受。
今天大家想做的却是 generalist policy、VLA、world model。
模型一旦要跨物体、跨任务、跨场景运行,“每个任务重新做一套触觉”就会立刻成为瓶颈。
于是前面那些原本分散的问题,开始连成一条链:
“
传感器能不能更换,决定数据能不能积累;
数据能不能积累,决定能不能预训练;
有了可迁移表示,触觉才有机会进入统一 policy;
进入 policy 以后,机器人又会自然需要预测未来接触,并用真实反馈做闭环纠偏。
在 2026 年 8 月的一篇新的视觉触觉综述中,已经不再把 hardware、perception、policy、dataset 和 foundation model 当成彼此割裂的几个方向,而是把它们放在一条完整的 sensing-and-learning pipeline 里。
▲图8 | 《Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation》如果把过去三年的变化压缩成一张地图,就是从底部的 raw tactile image / event stream 一路向上走:先学习信号表示,再理解力与接触动力学、几何和属性,随后进入多模态融合与任务策略,最终来到 generalizable tactile learning / foundation policies。传感器并没有变得不重要,只是“把接触测出来”从终点变成了整条触觉智能链条的起点。
06 但触觉离“视觉的今天”,其实还很远
这些条件解释了为什么触觉能够在最近几年一路从传感器走到 foundation policy 和 world model。
但“开始走到这里”,和“已经成熟”,是两件完全不同的事。
如果因此得出一个结论:触觉 foundation model 的时代已经来了
——或许还为时尚早。
- 首先是数据。
一张互联网图片几乎是免费的;一段高质量触觉数据却意味着机器人真的要伸出手、接触物体、控制力度,还要保证传感器没有损坏、机器人没有把东西碰飞。
如果还需要同步六轴力、压力分布、机器人动作和语言描述,采集成本会继续上升。
- 第二个问题是传感器异构。
相机型号虽然很多,但最终大多还是 RGB 图像。
触觉却不是。
有的是视觉触觉图像,有的是磁场,有的是 taxel,有的是六维力矩,还有的是覆盖整只手的电子皮肤。
不同传感器看到的“触觉世界”,甚至很难说天然存在于同一个坐标系。
这也是为什么过去三年,“cross-sensor”“semantic alignment”“force alignment”会频繁出现。
它们都在从不同角度追问同一个问题:触觉究竟有没有一种足够稳定的公共语言?
- 第三个问题是时间尺度。
语言可以慢慢理解,视觉可以几 Hz 到几十 Hz 更新,但 slip、碰撞和接触破坏可能在几十毫秒里发生。
这意味着未来成熟的触觉机器人,很可能不是一个“大模型”把所有模态一次性吞进去,然后统一频率输出动作。
它更可能是一个分层系统:慢的部分理解任务和环境;中间层预测接触会怎样发展;快的部分像反射一样,根据最新触觉把动作拉回正确轨道。
07 换掉的不是传感器,而是问题本身
如果一定要把过去三年触觉的变化压缩成一句话,我想大概是:
怎么把一次接触,可靠地变成信号 → 怎么把这些信号,变成可以复用、迁移、决策和预测的知识。
“
最开始的问题,是换一块皮肤以后,数据和策略能不能留下来;
再往后,是不是可以不为每个任务重新训练,而是先学出一套通用 representation;
然后,触觉开始进入 VLA,真正影响动作;
接下来,触觉表示又开始从“像不像视觉”转向“有没有真实的物理 grounding”;
到了最近,机器人甚至开始预测未来触觉,把“下一刻应该摸到什么”变成内部世界模型的一部分。
所以这三年的变化,并不是触觉传感器突然不重要了。
恰恰是因为机器人越来越能“摸到”,研究者才终于有机会把问题继续往后推:
让机器人拥有触觉 → 让机器人理解触觉 → 让机器人利用触觉去预测并改变未来。
触觉真正开始进入的,已经不只是机器人的手,而是机器人的模型。
但触觉进入模型,不等于模型就会正确使用触觉 ➡️ 下一篇,我们就来拆开这个反直觉的问题:为什么给机器人加上触觉,反而可能更差?
依次回答四个问题:什么时候该听触觉的、触觉应该以什么形式进入模型、模型里谁真正需要触觉,以及触觉究竟应该有多大的话语权……
Ref
1. AnySkin: Plug-and-play Skin Sensing for Robotic Touch, 2024 / ICRA 2025.
2. Sparsh: Self-supervised Touch Representations for Vision-Based Tactile Sensing, CoRL 2024.
3. Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization, 2025.
4. OmniVTLA: Vision-Tactile-Language-Action Model with Semantic-Aligned Tactile Sensing, 2025.
5. ForceVLA: Enhancing VLA Models with a Force-Aware MoE for Contact-Rich Manipulation, NeurIPS 2025.
6. TaF-VLA: Tactile-Force Alignment in Vision-Language-Action Models for Force-aware Manipulation, 2026.
7. TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation, 2026.
8. ViTacWorld: Scaling Visuo-Tactile World Models for Contact-Rich Robot Manipulation, 2026.
9. Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation, 2026.