Sparsh: Self-supervised Touch Representations
这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,术语第一次出现必定义 + 类比。
一句话讲什么(TL;DR)
以前每个触觉任务都得从零标注、从零训练。Sparsh 先让模型在 46 万张以上无标签触觉图上自学一遍"触觉词汇",之后做任何具体触觉任务只要少量例子就能追平甚至超过专门训练的模型——平均超出 95.1%。
所以这一节是想说:Sparsh 把"先大量自学、再小量微调"这套在视觉和语言里已经验证过的基础模型范式,第一次系统地搬到了长期缺数据、缺标注的触觉模态上。
这是个什么场景
想象你闭着眼睛在书包里摸钥匙。你怎么知道"这是钥匙不是口香糖"?不是有人事先告诉你"钥匙的触感叫钥匙",而是你从小摸过水、毛巾、玻璃、橡皮、硬币几千次,大脑自动攒下了一套"触觉词汇"——滑/糙、软/硬、棱角/圆润、凉/温。这套词汇本身不对应任何具体任务,但你之后所有靠手摸完成的事(系鞋带、找钥匙、握杯子不让它滑掉)都建立在它之上。
机器人现在做不到这一点。它的触觉靠视触觉传感器——本质是"一块软胶 + 一个朝里看的微型摄像头"。物体压上来,软胶变形,摄像头拍下这块胶的形变图像。代表产品有 DIGIT(Meta 开源)、GelSight 系列。这种传感器每秒能拍很多张形变图,信息量很大,但传统做法有个死结:
想让机器人"看懂"这些触觉图,就得为某个具体任务(比如"检测物体有没有在手里打滑")人工标注几千张图,再训一个小 CNN。换个任务(比如"估计手指受了多大力")就得从零再标、再训一遍。
这套做法又贵又主观。贵在标注要人一张张看;主观在很多触觉判断根本说不清——"这一帧到底算不算打滑?"两个标注员可能给出相反答案。结果就是触觉数据其实有一大堆(传感器拍图很容易),但没人标得动、也标不准。
Sparsh 想做的,就是把婴儿那段"没人教、纯靠摸"的成长过程搬给机器人:先让模型大量看无标签触觉图、自己学出"触觉词汇"(表示),再拿这套词汇去做各种下游任务。名字 "Sparsh" 是梵语"触摸"的意思。
所以这一节是想说:Sparsh 面对的场景是"触觉数据多但标注贵又主观",它的思路是把人学触觉那种"先大量无监督地摸、再学具体技能"的过程复制给机器人。

之前的人怎么做的,为什么不够好
方案 A:任务专用 CNN(task-specific) 类比:每换一门考试就重新请一个只会这门课的家教。每个触觉任务(滑动检测、力估计、物体识别)单独标注、单独训一个小网络。换传感器或换任务都要从头再来,成本线性叠加,规模上不去。
方案 B:多任务监督学习 类比:把几门课凑一起补,但每门课还是要有答案册。把几个触觉任务合起来多任务训练,能省一点,但仍然依赖人工标注,规模天花板还在。
方案 C:跨模态对齐(vision-touch contrastive) 类比:靠"看着图猜手感"来学,而不是直接研究手感本身。把触觉图和 RGB 图对齐(CLIP 思路,参见
touch-vision-cross-modal.md),但要求成对的"触觉图 + 视觉图"数据,且学习目标锚定在视觉语义上,不是触觉本身的结构。方案 D:手工特征 类比:用尺子量胶垫变形了多少。早期工作直接从 GelSight 图像提光流、接触面积变化等规则化特征。可解释但不可扩展,换个传感器规则就失效。
方案 E:仿真预训练 类比:在电脑里捏橡皮泥练手感,再上真胶垫。用仿真触觉数据(如 TACTO)预训练,但触觉的仿真到真实鸿沟比视觉更严重——软胶形变的物理仿真本身就不准。
共同瓶颈:真实触觉数据有,但没人标;标注又贵又主观。触觉这条线因此长期停留在"一任务一模型"的作坊阶段,没有一个通用的"触觉基础模型"当地基。
所以这一节是想说:以前的方法要么靠人工标注(贵、主观、不可扩展),要么绕道视觉或仿真(引入新的鸿沟),始终没人做出一个直接从无标签真实触觉数据学出来的通用表示。
这篇论文的新想法
类比:视觉领域已经有成熟的"先大量自学、再做具体任务"的菜谱(MAE、DINO、I-JEPA 那一套自监督预训练)。Sparsh 做的事,就是把这本菜谱端进触觉的厨房,并针对触觉的特点做适配。核心信念和做法有三条:
1. 不要标签,用"代理任务"从原始图里抠结构。 用遮挡补全、自蒸馏这类代理任务(pretext task,意思是"装出来给模型练手的假任务"——它本身没用,但逼模型学到有用的内部表示)从原始触觉图像里学结构,彻底绕开人工标注这个死结。
2. 跨传感器统一。 DIGIT、GelSight、GelSight Mini 等传感器拍出来的图看起来不一样(打光不同、胶垫上的标记点不同、分辨率不同),但底层物理是共通的——都是"软胶形变 + 内部光学成像"。预训练时混着喂多种传感器的数据,学到的骨干(backbone)就是"传感器无关"的通用触觉表示。
3. 下游只接一个小头。 预训练完成后,把骨干冻住或轻微微调,下游任务(滑动检测、力估计……)只需少量标注 + 一个轻量的头(线性层或小 MLP)就能做,甚至超过为它从头专门训的模型。
底层判断:触觉长期被"数据少 + 标不动"卡住,而自监督学习(SSL)的核心红利恰恰是"消化无标注数据"。按这个逻辑,触觉理应比视觉更吃 SSL 的红利——因为触觉的标注比视觉更贵更主观。Sparsh 就是来验证这个判断的,答案是:确实如此。
所以这一节是想说:Sparsh 的新想法不是发明新 SSL 算法,而是判断"触觉是最该用 SSL 的模态",然后用一个跨传感器、无标签的大规模预训练 + 标准化基准,把这个判断做实。
它分几步做的(方法)
Sparsh 的方法可拆成五块:数据、预训练目标(三套 SSL 范式)、骨干架构、跨传感器统一、以及下游评测协议 TacBench。下面逐块展开,每块按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。
先看整体流程图:
阶段一:自监督预训练(无标签)
┌──────────────────────────────────────────────┐
│ 46 万+ 张触觉图(DIGIT / GelSight / ...混合) │
│ │ │
│ ▼ │
│ 代理任务(三选一或对比) │
│ ├─ MAE:遮住大半 → 补像素 │
│ ├─ DINO:自蒸馏 → 学"同一东西" │
│ └─ (I-)JEPA:在表示空间预测被遮部分 │
│ │ │
│ ▼ │
│ ViT 骨干 backbone → 通用触觉表示 │
└──────────────────────────────────────────────┘
│ 冻结 / 轻微微调
▼
阶段二:下游任务(少量标注)
┌──────────────────────────────────────────────┐
│ TacBench 6 个任务:力估计 / 滑动检测 / │
│ 姿态估计 / 抓取稳定 / 材质属性 / 操作规划 │
│ 骨干(冻结) + 轻量 head(linear/MLP) → 预测 │
└──────────────────────────────────────────────┘
5.1 数据层:先囤 46 万张无标签触觉图
类比:开餐厅前先把食材库塞满,而且什么食材都要有。
机制(输入→处理→输出):
- 输入:多种视触觉传感器(DIGIT、GelSight 系列等)拍下的真实交互图像——机器人和人手去压、抓、滑各种物体时的形变图。
- 处理:汇总成一个规模超过 46 万张(460k+)触觉图的预训练集,跨任务、跨物体、跨操作者、跨传感器。全程不带任何任务标签,只是原始记录。
- 输出:一个大而杂、无标注的触觉图像池,专供自监督预训练消化。
为什么有用:SSL 的威力和数据规模强相关。触觉数据"采集容易、标注难",正好适合 SSL——你只需要"多",不需要"标好"。46 万张这个量级,是触觉领域此前少见的规模。
5.2 预训练目标:三套 SSL 范式的擂台
类比:给学生出三种不同的填空题练手,看哪种练法最能提升真实考试成绩。
等等,先慢一拍——这三种代理任务分别在干什么?
- MAE(Masked Autoencoder,掩码自编码器):把触觉图切成小块(patch),遮掉一大半(视觉里常遮 75%),让模型补出被遮的像素。像做挖空填空。属于"在像素空间重建"。
- DINO(自蒸馏,self-distillation):让同一张图的两种不同裁剪/增强版本在表示空间里靠近,不同图推远,且用一个"教师网络"指导"学生网络",不需要负样本。像让模型学会"什么算同一个东西"。属于"在表示空间学不变性"。
- (I-)JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构):不去补像素,而是在表示空间里预测被遮区域的特征。像"理解趋势"而不是"画画"。也属于"在表示空间学结构"。
三种代理任务的差别可以画成一张对照图:
同一张触觉图(含大量传感器噪声:光斑/标记点/纹理)
│
┌────┼─────────────────┬─────────────────┐
▼ ▼ ▼ ▼
┌──────────┐ ┌──────────────┐ ┌──────────────┐
│ MAE │ │ DINO │ │ (I-)JEPA │
│ 遮75% │ │ 两视角自蒸馏 │ │ 表示空间预测 │
│ 补"像素" │ │ 学"同一物" │ │ 被遮区"特征" │
└────┬─────┘ └──────┬───────┘ └──────┬───────┘
│ 在像素空间 │ 在表示空间 │ 在表示空间
▼ ▼ ▼
被噪声带偏 抗噪、更强 ◄──── 论文结论:latent > pixel
机制:论文用同一批数据、同一种骨干,分别用这三套目标训出三个版本的 Sparsh,再在下游 TacBench 上横向比谁强。
关键结果:Sparsh (DINO) 和 Sparsh (I-JEPA) 是最有竞争力的两个版本,明显强于像素重建的 MAE 版本。这说明——对触觉图像而言,在表示空间(latent space)学习比在像素空间逐点重建更划算。为什么?因为触觉图里有大量与任务无关的传感器噪声(打光斑点、胶垫标记点、随机纹理),逼模型逐像素重建这些噪声是浪费;在表示空间预测则允许模型忽略像素级噪声、只抓语义结构。
为什么有用:这个"latent 优于 pixel"的结论,给后续所有做触觉 SSL 的人省掉一轮试错——直接从 DINO / JEPA 这类表示空间方法起步。
5.3 骨干架构:ViT 当"专看触觉图的眼睛"
类比:一台专门用来看触觉形变图的通用相机 + 大脑。
机制(输入→处理→输出):
- 输入:一张触觉图像,或一小段时间窗口内的多帧触觉图(触觉常常需要时序——"正在打滑"是靠连续几帧的变化判断的,单帧看不出)。
- 处理:用 ViT(Vision Transformer,视觉 Transformer)当骨干。选 ViT 是因为它和 MAE / DINO / JEPA 这套 SSL 范式配套最成熟,切 patch、做掩码都天然契合。
- 输出:一组 token 表示——把触觉图压成一串"触觉词向量",供下游任务使用。
为什么有用:统一用 ViT + 输出 token,让 Sparsh 的表示能像积木一样插进各种下游模型(线性探针、MLP 头,甚至未来的机器人策略网络)。
5.4 跨传感器统一:一套骨干通吃多种胶垫
类比:一个会摸东西的人,换用手套、义肢或戴顶针,仍然能靠底层手感判断软硬滑糙——因为"触觉常识"是设备无关的。
机制:预训练时把多种传感器的数据混在一起喂。DIGIT 和 GelSight 的图在表面上差别很大(不同打光、不同标记点、不同视角),但共享"软胶形变 + 光学成像"的底层物理。混训逼骨干学到跨设备通用的结构,而不是某一款传感器的表面特征。
为什么有用:这是判断"通用触觉表示"是否真通用的关键。如果在 DIGIT 上预训练的骨干迁到 GelSight 上还能用,就说明学到的是触觉本质而非设备指纹。这直接决定了别人能不能拿 Sparsh 当现成零件用,而不必为自己的传感器重训。
5.5 下游评测:TacBench 六项全能考试
类比:翻译完手册后给学生安排一场覆盖多科目的统考,而且规定考试方式——不许临时抱佛脚(冻结骨干只训小头)。
机制(输入→处理→输出):
- 输入:Sparsh 预训练好的骨干 + 每个下游任务的少量标注数据。
- 处理:论文搭建了 TacBench 基准,包含 6 个任务,从"理解触觉属性"到"支撑物理感知与操作规划"——涵盖力估计(force estimation)、滑动检测(slip detection)、姿态估计(pose estimation)、抓取稳定性、材质/物体属性识别、以及面向操作规划的任务。评测时通常冻住骨干、只训一个轻量头(linear probe 或小 MLP),或用少量数据微调。
- 输出:三方对比——Sparsh vs 任务专用从头训模型 vs 其他基线,在低数据设置下尤其看差距。
核心结果:在 TacBench 上,SSL 预训练的触觉表示平均超过任务专用的端到端从头训练 95.1%。这个数字是全文的招牌——它不是"某个任务上略胜",而是六项任务平均近乎翻倍的优势,尤其在标注数据稀少时优势最大。
为什么有用:TacBench 本身也是贡献——它给触觉领域提供了一把标准化的尺子,让"跨传感器、跨模型"的公平比较第一次成为可能。此前每篇触觉论文各测各的,没法横向比。
所以这一节是想说:Sparsh 的方法 = 46 万张无标签图 + 三套 SSL 范式擂台(结论是 latent 优于 pixel)+ ViT 骨干 + 跨传感器混训 + TacBench 标准化评测,五块合起来把触觉从"一任务一模型"推向"一个基础模型 + 多个小头"。

关键数字(What works)
数字本身不重要,重要的是它们告诉你"SSL 在触觉上到底值不值、哪种范式最好"。以下数字来自原文摘要与正文;未报告的一律标"原文未报告"。
数字 1:平均超过任务专用训练 95.1%
| 维度 | 数据 |
|---|---|
| 对比 | Sparsh(SSL 预训练)vs 任务专用端到端从头训 |
| 覆盖 | TacBench 全部 6 个任务的平均 |
| 提升 | 平均 +95.1% |
| 关键含义 | 不是单任务小胜,而是六项平均近翻倍——SSL 红利在触觉上兑现 |
数字 2:预训练规模 46 万+ 张触觉图
| 维度 | 数据 |
|---|---|
| 数据量 | 460,000+ 张触觉图像 |
| 标注 | 无(全部无标签) |
| 覆盖 | 跨任务、跨物体、跨操作者、跨传感器 |
| 训练方式 | 掩码 + 自蒸馏,在像素与表示空间 |
| 关键含义 | 触觉领域少见的大规模,SSL 威力的燃料 |
数字 3:DINO / I-JEPA > MAE(latent 优于 pixel)
| 维度 | 数据 |
|---|---|
| 最强版本 | Sparsh (DINO)、Sparsh (I-JEPA) |
| 较弱版本 | Sparsh (MAE,像素重建) |
| 结论 | 表示空间学习更适合触觉图像 |
| 原因 | 触觉图含大量传感器噪声,逐像素重建是浪费 |
| 关键含义 | 给后续触觉 SSL 定了方向:优先用 latent-space 方法 |
数字 4:TacBench 覆盖 6 个任务
| 维度 | 数据 |
|---|---|
| 任务数 | 6 |
| 谱系 | 从触觉属性理解 → 物理感知 → 操作规划 |
| 举例 | 力估计、滑动检测、姿态估计、抓取稳定、材质识别、操作规划 |
| 评测协议 | 冻结骨干 + 轻量头(linear probe)或少量微调 |
| 关键含义 | 触觉领域第一把标准化尺子 |
数字 5:具体每任务的绝对精度
| 维度 | 数据 |
|---|---|
| 各任务绝对指标(如力估计误差、滑动检测 AUC 等) | 原文未报告(本笔记只保留可核实的摘要级结论) |
所以这一节是想说:最硬的三个数字是"平均 +95.1%、46 万张无标签图、latent 优于 pixel"——它们共同证明触觉确实是最该用自监督的模态。
实验结果说明了什么
上一节列数字,这一节回答实验背后的科学问题。
问题一:SSL 预训练在触觉上真的有用吗?还是视觉那套搬过来会水土不服? 有用,而且优势巨大。TacBench 六任务平均超过任务专用训练 95.1%,说明"先大量自学、再小量微调"这条路在触觉上不仅走得通,红利甚至比视觉更大——因为触觉标注更贵更主观,SSL 绕开标注的价值更突出。低数据设置下差距最大,恰好印证了 SSL 的核心卖点是"省标注"。
问题二:三种 SSL 范式,哪种最适合触觉? 答案是表示空间方法(DINO、I-JEPA)胜过像素重建方法(MAE)。这是一个有指导意义的经验结论:触觉图像和自然图像不同,含有大量与任务无关的传感器伪影(打光、胶垫标记点),逼模型逐像素还原这些伪影是浪费算力;在表示空间预测则能自动忽略像素噪声、聚焦语义结构。
问题三:一个传感器上学的表示,能迁到另一个传感器吗? 这是"通用触觉表示"成立的命门。Sparsh 通过混合多种传感器数据预训练,让骨干学到设备无关的触觉结构,从而支持跨传感器使用。这一点决定了 Sparsh 能否被社区当作现成零件复用,而不是又一个绑定某款硬件的专用模型。
问题四:这套东西对下游机器人操作有什么用? TacBench 的任务谱系从"理解触觉属性"一路延伸到"操作规划",说明 Sparsh 的表示不止停留在感知层,而是能支撑真实的抓取稳定性判断、操作决策。它是未来"视觉-语言-动作 + 触觉"这类多模态机器人策略里一个可插拔的触觉前端候选。
一个诚实的定位:Sparsh 是表征学习论文,不是端到端策略论文。它本身不会让机器人立刻"更会抓",而是给"让机器人更会抓"的下游工作提供一块更好的零件。它的价值最终要看被下游多少工作采用,而不是看它自己的 demo 多炫。
所以这一节是想说:实验回答了四个问题——SSL 在触觉上红利更大、latent 范式最优、跨传感器可迁移、且能支撑到操作规划层——共同确立了 Sparsh 作为"触觉基础模型"的地位与边界。
你应该懂的几个新词
视触觉传感器(vision-based tactile sensor):核心结构是"一块软胶 + 朝里看的微型摄像头"。物体压上来,胶变形,摄像头记录形变图像。代表:DIGIT(Meta 开源)、GelSight 系列。优点是空间分辨率高、便宜、易量产;缺点是有延迟、易磨损。
自监督学习(SSL, Self-Supervised Learning):不用人工标签,从数据自身构造预测任务来学表示。例:遮住一部分让模型补(MAE)、把同一物体两个视角拉近(对比/自蒸馏)。
代理任务 / 前置任务(pretext task):为了逼模型学到有用表示而人为设计的"假任务"。任务本身没用,学到的表示才是目的。
MAE(Masked Autoencoder,掩码自编码器):何恺明团队 2021 提出。遮住图像大部分 patch,让模型重建被遮的像素。像素空间重建的代表。
DINO(自蒸馏):用教师-学生网络做自蒸馏的 SSL,学生预测教师输出,无需负样本。表示空间学不变性的代表。
I-JEPA / JEPA(Joint Embedding Predictive Architecture):LeCun 力推的范式。不在像素空间预测,而在表示空间预测被遮区域的特征,更接近"理解"而非"生成"。
骨干网络(backbone):模型里负责把原始输入编码成通用特征的主体部分。预训练学的就是一个好骨干,下游任务在它上面接小头。
线性探针(linear probe):评测表示质量的常用做法——冻住骨干,只在最后接一个线性层训练。若线性层就能拿高分,说明表示已经把任务相关结构编码得很干净。
下游任务(downstream task):预训练完成后用预训练模型去解决的具体应用任务。例:滑动检测、力估计。
TacBench:本文提出的标准化触觉评测基准,含 6 个任务,用于跨传感器、跨模型的公平比较。
所以这一节是想说:掌握这十个词,你就能读懂几乎所有"触觉 + 自监督 + 基础模型"方向的论文。
它有什么搞不定的
Sparsh 不是万能的,几个局限值得注意:
它只是零件,不是整机:Sparsh 是表征学习工作,本身不完成任何机器人任务。它需要下游接一个策略或分类头才能干活。它的价值高度依赖后续被采用的广度——如果没人拿去用,再好的表示也只是躺在权重文件里。
像素重建版本(MAE)明显偏弱:说明"把视觉 SSL 直接照搬"并非处处成立,触觉图像的噪声特性要求换用表示空间方法。这提醒使用者:迁移成熟范式时不能无脑复制,得针对模态特性挑选目标。
跨传感器不等于零成本通用:混训能让骨干跨传感器可用,但面对与预训练分布差异极大的全新传感器(不同胶垫材料、不同光路),仍可能需要微调。论文验证的是已见过或相近的传感器家族,对完全陌生的形态泛化到什么程度,需要更多验证。
触觉的时序与多模态尚浅:触觉很多判断(打滑、力的变化趋势)本质是时序的,还常需和视觉、本体感知配合。Sparsh 主要聚焦触觉单模态表示,如何与视觉/动作深度融合仍是开放问题。
绝对性能的天花板未知:论文强调的是"相对任务专用训练的提升",各任务的绝对精度、以及在真实机器人闭环里的端到端收益,原文未系统给出。相对提升大,不等于绝对精度已达实用。
所以这一节是想说:Sparsh 漂亮地证明了"触觉该用 SSL",但它是一块零件而非整机,且在陌生传感器泛化、时序/多模态融合、绝对性能上仍留有明显空白。
它和别的几篇是什么关系
对照:触觉-视觉跨模态对齐,参见
touch-vision-cross-modal.md。那篇是 CLIP 风格的触觉-视觉对齐,需要成对数据、学习目标锚定视觉语义;Sparsh 是纯触觉单模态 SSL,不需要配对,直接学触觉本身的结构。两者互补:一个学"触觉与视觉的语义桥",一个学"触觉内部的结构"。范式来源:视觉 SSL(MAE / DINO / I-JEPA)。Sparsh 把视觉自监督的成功方案搬到触觉。技术上不是发明新方法,价值在于"证明这条路在触觉上也走得通 + 提供数据集和基准"。
下游接口:机器人策略大模型,参见
octo.md、openvla.md、pi0.md。这些策略大模型输入多是 RGB + 本体感知,几乎不用触觉。Sparsh 提供了一个可以接到这类策略上的触觉编码器——未来"VLA + 触觉"方向上,Sparsh 是一个现成的插件候选。同方向后续:Sparsh-X,参见
sparsh-x.md。同一条线的延伸,把触觉表示进一步扩展(多传感/多模态)。相关触觉动作工作,参见
tactile-vla.md、tla-tactile-language-action.md。这些是把触觉接进动作/语言的工作,Sparsh 这类编码器正是它们的上游零件候选。历史脉络:视觉先有 ImageNet 监督预训练 → 再有 SimCLR/MoCo/MAE/DINO 自监督预训练;触觉这条线滞后约 5 年,Sparsh 可视为触觉版的"MAE 时刻"——第一个规模化的无标签预训练 + 通用表示。
所以这一节是想说:Sparsh 在触觉里的定位,相当于 MAE/DINO 在视觉里的定位——一个把基础模型范式引入本模态的奠基性工作,上游借视觉 SSL,下游接机器人策略。
和本导读的关系
本笔记对应导读 Ch18: 多模态生态——ImageBind / AnyMAL / 3DShape2VecSet。
导读 Ch18 关心的是"把更多通道(图、文、音、触、IMU)塞进同一个嵌入空间"这件事——它不直接做机器人,而是提供关键基础设施:跨模态预训练、感知融合、大规模数据。Sparsh 在这张多模态拼图里补的是触觉这一长期缺位的角。视觉、语言、本体感知都已经有各自的基础模型,触觉此前还停留在作坊阶段,Sparsh 是把它拉进"基础模型时代"的代表作。
建议阅读顺序:先读导读 Ch18 建立"多模态为什么要统一嵌入空间"的整体图景,理解 ImageBind 那种"用一个锚点模态联通多模态"的思路;再读本笔记看触觉如何靠自监督获得自己的通用表示;然后对照 touch-vision-cross-modal.md 看"触觉-视觉对齐"这条互补路线。三者连起来,你会看到触觉进入多模态生态的两种路径:一种靠与视觉对齐借力,一种靠自身 SSL 自立。
从知识图谱角度,本笔记向下连接 Ch12/Ch13 的 VLA 与扩散策略——未来的机器人策略几乎一定会接触觉,Sparsh 这类编码器就是那个接口。
所以这一节是想说:本笔记是导读 Ch18 里"触觉进入多模态基础模型时代"的关键案例,读完能理解触觉如何从缺位补齐成多模态生态的一块正式拼图。
思考题
以下问题检验你是否真正理解论文逻辑,而非记住"+95.1%"。每题附折叠提示,先自己想 30 秒再展开。
Q1:为什么说触觉比视觉"更该"用自监督学习?
提示
关键在标注成本与主观性。视觉标注虽贵但相对客观(这是猫还是狗,大家答案一致);触觉标注既贵又主观——"这一帧算不算打滑""这个力有多大"两个标注员可能给相反答案,且需要专门传感器同步采集真值。SSL 的核心红利是"绕开标注、消化无标签数据",而触觉恰恰是标注最难的模态,所以 SSL 的相对价值在触觉上更大。
Q2:Sparsh (DINO/I-JEPA) 打败了 Sparsh (MAE)。为什么在表示空间学习比逐像素重建更适合触觉图?
提示
触觉图里有大量与任务无关的传感器伪影:胶垫上的标记点、打光斑点、随机纹理。MAE 逼模型逐像素重建这些内容,等于花大量算力去还原噪声。表示空间方法(DINO/I-JEPA)在特征层面预测,允许模型忽略像素级噪声、只保留"软硬/滑糙/接触形状"这类语义结构。对信噪比低的模态,表示空间目标更抗噪。
Q3:如果预训练时只用 DIGIT 一种传感器,Sparsh 还能声称自己是"通用触觉表示"吗?为什么要混多种传感器?
提示
不能。只用一种传感器,骨干很可能学到该款传感器的"设备指纹"(特定打光、特定标记点布局),换个传感器就失效。混合多种传感器数据预训练,逼骨干学到跨设备共享的底层物理结构(软胶形变 + 光学成像),过滤掉设备特有的表面特征。这样学到的才是"触觉本质"而非"某款硬件的样子",才谈得上通用。
Q4:TacBench 评测时通常"冻结骨干、只训一个线性头"。这个协议设计想说明什么?
提示
线性探针(linear probe)是检验表示质量的严格方式:如果冻住骨干、只加一个线性层就能把下游任务做好,说明骨干学到的表示已经把任务相关信息编码得足够"线性可分",质量很高。如果必须大改骨干才能work,说明表示本身不够好。这个协议排除了"靠下游微调硬凑"的可能,直接考验预训练表示的内在质量。
Q5:Sparsh 是"表征学习"论文而非"策略"论文。这个定位对判断它的价值意味着什么?
提示
意味着不能用"它能不能让机器人立刻更会抓"来评判它——它本身不完成任务,只提供一块更好的零件。它的真实价值体现在下游:有多少策略/感知工作愿意把 Sparsh 当触觉前端用、用了之后端到端提升多少。判断这类基础模型工作要看"被采用的广度和下游收益",而不是它自己的 demo。这也是很多基础设施型工作的共同评判标准。
Q6:假设你手里有一款全新的、和 DIGIT/GelSight 都不太一样的触觉传感器,你会怎么用 Sparsh?可能遇到什么问题?
提示
先直接用 Sparsh 骨干冻结 + 少量本传感器标注数据训一个小头试试(零迁移基线)。如果新传感器的光路/胶垫材料与预训练分布差异大,可能需要用少量本传感器数据对骨干做轻微微调。风险在于:论文验证的多是相近传感器家族,对分布差异极大的全新形态,跨传感器泛化能到什么程度尚未充分验证,可能需要更多本地数据。
Q7:视觉 SSL 领域"latent 优于 pixel"其实也有争论(MAE 在很多视觉任务上很强)。为什么在触觉上这个结论更明确?
提示
因为信噪比不同。自然图像的像素大多是有意义的(物体、纹理、场景),MAE 重建像素同时也在学有用结构。触觉图的像素里很大比例是设备伪影(标记点、光斑),有效信号被噪声稀释,像素重建被噪声"带偏"的程度更严重。所以模态的噪声结构决定了"pixel vs latent"孰优——不能把视觉的结论无脑照搬,这正是 Sparsh 做三范式擂台的意义。
所以这一节是想说:能回答这 7 个问题,你就真正理解了 Sparsh 的方法选择与定位,而非只记住"平均提升 95.1%"。
一些好奇心问答(FAQ)
Q1:视触觉传感器到底怎么"看"到触觉?
它本质是个反过来用的摄像头:一块透明软胶朝外贴着物体,摄像头从软胶内部朝外拍。物体压上来软胶变形,摄像头就拍到形变的高分辨率图像。所以"触觉"在这里被转化成了"图像",也因此可以用视觉模型来处理。
Q2:为什么不用力/压力传感器阵列,非要用摄像头?
视触觉传感器的空间分辨率远高于传统压力阵列——它能看到接触面的细密纹理、微小滑移,而且便宜、易量产。代价是有延迟、胶垫会磨损。Sparsh 正是为这一类"图像化触觉"设计的。
Q3:46 万张图很多吗?
在触觉领域算相当大了——触觉数据此前普遍是"几千到几万张、且带任务标注"的小规模。Sparsh 的规模优势正来自它不需要标注,采集门槛低,才能堆到几十万量级。相比视觉动辄上亿张仍小,但对触觉是量级突破。
Q4:Sparsh 能直接让机器人抓得更稳吗?
不能直接。它提供的是触觉表示,要接一个下游头(比如抓取稳定性分类器)才能用于决策。但 TacBench 里就有抓取稳定性、操作规划这类任务,证明它的表示能支撑到这一层。
Q5:MAE、DINO、JEPA 我该用哪个?
按论文结论,触觉优先选表示空间方法(DINO、I-JEPA),它们最有竞争力;MAE 这种像素重建版本在触觉上偏弱。如果是全新模态,建议也像论文一样做个小擂台再定。
Q6:Meta 开源了什么?
Meta(FAIR)此前开源了 DIGIT 触觉传感器,Sparsh 有项目主页(sparsh-ssl.github.io)。开源硬件 + 预训练模型 + 基准,让触觉研究的入门门槛显著降低。
Q7:读完接下来看什么?
想看互补路线看 touch-vision-cross-modal.md;想看延伸看 sparsh-x.md;想看触觉如何接进动作看 tactile-vla.md;想理解 SSL 范式本身可回顾视觉的 MAE/DINO 原文。
所以这一节是想说:关于传感器原理、数据规模、范式选择、开源资源这些实操疑问,论文和项目页都已给出清晰答案,Sparsh 的用法门槛正在快速降低。
如果你想再深入
按"范式源头 → 互补路线 → 延伸 → 下游"排序:
- 范式源头:MAE / DINO / I-JEPA — 视觉自监督的三大代表。读它们才知道 Sparsh 的三套预训练目标各自在干什么、为什么 latent 方法更抗噪。
- 互补路线:Touch-Vision Cross-Modal — CLIP 风格的触觉-视觉对齐,和 Sparsh 的纯触觉 SSL 形成对照。见
touch-vision-cross-modal.md。 - 延伸:Sparsh-X — 同线后续,把触觉表示进一步扩展。见
sparsh-x.md。 - 下游:Octo / OpenVLA / π0 — 机器人策略大模型,Sparsh 是它们接入触觉的候选接口。见
octo.md、openvla.md、pi0.md。 - 触觉+动作:Tactile-VLA / TLA — 把触觉接进语言与动作的工作。见
tactile-vla.md、tla-tactile-language-action.md。
所以这一节是想说:把视觉 SSL 三范式 + Sparsh + 触觉-视觉对齐这几篇连起来读,就能看清触觉如何在 2024 年前后完成自己的"基础模型化"。
原文信息
BibTeX
@inproceedings{higuera2024sparsh,
title = {Sparsh: Self-supervised Touch Representations for Vision-based Tactile Sensing},
author = {Higuera, Carolina and Sharma, Akash and Bodduluri, Chaithanya Krishna and Fan, Taosha and Lancaster, Patrick and Kalakrishnan, Mrinal and Kaess, Michael and Boots, Byron and Lambeta, Mike and Wu, Tingfan and Mukadam, Mustafa},
booktitle = {Conference on Robot Learning (CoRL)},
year = {2024}
}
链接
- arXiv:arxiv.org/abs/2410.24090
- 项目主页:sparsh-ssl.github.io
- 团队:Meta AI (FAIR) 与合作高校
- 相关硬件:DIGIT(Meta 开源视触觉传感器)
所以这一节是想说:这是 Higuera 等人 2024 年发表在 CoRL 的工作,出自 Meta FAIR,提出了触觉的自监督基础模型 Sparsh 与标准化基准 TacBench,是触觉表征学习方向的奠基性论文。
◼
引用本笔记 / Cite this note
@online{eai_sparsh_2026,
title = {(readable note) Sparsh: Self-supervised Touch Representations},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/sparsh/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?