Tactile-VLA
这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式和术语全部翻译成人话。
一句话讲什么(TL;DR)
给已经会看、会听、会动的机器人补上"手感"这一课:不仅让它摸得到接触的力,还让它听懂"轻轻插"和"用力插"的区别——而且这份"手感常识"很大一部分是从大模型脑子里唤醒出来的,不是从零训出来的。
所以这一节是想说:Tactile-VLA 把"触觉 + 力控制 + 语言"接进了 VLA 大模型,关键卖点是"少量演示就能激活模型本来就有的物理常识"。
这是个什么场景
想象你早上起床,要做两件小事:把 U 盘插进电脑、把充电器插进插座。
你几乎不用看,全靠手感:U 盘插歪了,指尖会感到"顶住了、进不去",于是你微微转一下角度再推;充电器两脚对上插孔的一瞬间,你能感到"卡进去了"那一下,就松力。这套"边摸边调"的动作,你每天做几十次,从来不觉得难。
现在把这两件事交给机器人。今天最强的一类机器人大脑叫 VLA(Vision-Language-Action,视觉-语言-动作模型)——输入是摄像头画面 + 一句话指令,输出是机械臂该怎么动。它在"抓一个杯子""把方块推到左边"这种不太讲究接触力的活上已经很在行。但一到插拔、拧、擦这种力觉关键的活,它就抓瞎了:
它只能"看起来对准了就往里怼"。看不到自己用了多大力,也感觉不到"卡住了"这个信号——于是要么插不进(力太小),要么怼坏(力太大)。
更麻烦的是第二层。你跟同事说"帮我轻轻关下门"和"帮我使劲关下门",同事听得懂这两个副词。但普通 VLA 根本没有"力"这个输出通道——你对它说"轻轻插",它照样用同样的蛮力怼进去,因为它压根不知道"轻""重"对应到动作上是什么。
Tactile-VLA 想补上的就是这两件事:(1) 让机器人真的摸得到接触力;(2) 让它把语言里的力度词(轻、重、温柔、坚定)翻译成真实的接触力。 而且它发现了一个很妙的现象——做到这两点,其实不需要海量数据从头教,因为大模型的语言部分早就"隐约知道"「玻璃杯要轻拿、U 盘插进去要卡一下」这类物理常识,只是以前没有"手"去把这份知识落地而已。
所以这一节是想说:VLA 缺的不是"看"和"想",而是"摸"和"用多大力";Tactile-VLA 就是来给它接上这两根神经,并唤醒模型里沉睡的物理常识。

之前的人怎么做的,为什么不够好
方案 A:纯视觉 VLA(RT-2、OpenVLA、π0 等)。 输入图像 + 语言,输出动作。类比:一个戴着厚劳保手套干活的人——看得见东西在哪,但手上一点感觉都没有。在接触不敏感的任务上够用,一到"插进去要感到卡一下"就盲操作。
方案 B:给 VLA 加一个"末端六维力"通道。 在机械臂手腕装一个力传感器,把整只手感到的合力(一个 6 维的粗糙数字)塞进模型。类比:你只知道"整只手大概被顶了多大劲",但分不清是指尖顶到硬物、还是手掌蹭到桌面。信息太糙。
方案 C:专门的触觉操作策略。 针对单个任务(比如插电缆、叠布)单独训一个小触觉模型,效果不错。类比:一个只会插电缆的老师傅,换个任务就得从头学,而且完全听不懂人话——没有语言泛化能力。
方案 D:视觉-触觉表征对齐工作(如 Touch-Vision-Language、Sparsh)。 研究"怎么让触觉信号和视觉/语言在同一个空间里对齐"。类比:先把"摸感"和"看到的样子"配好对。但这类工作大多停在"学表征"这一层,没接到能跟随指令、能干活的 VLA 框架里,也不做力度语言的落地。
核心缺口:把高分辨率触觉 + 语言里的力度词 + 精确的力控制三件事一起塞进同一个大模型,并且能零样本(没针对性训练过就直接会)跟随"轻轻拧"这类触觉指令——这条路一直没人系统走通。更重要的是,没人指出"大模型本来就藏着物理常识,只需少量演示去激活"。
所以这一节是想说:以前要么没手感、要么手感太糙、要么会摸不会听人话;Tactile-VLA 要做的是"高分辨率手感 + 听懂力度词 + 精确用力"三合一,还要用得起(少量演示)。
这篇论文的新想法
一句类比:以前的 VLA 是"一个博学但没长手的大脑"——它读过无数说明书,知道"玻璃杯易碎""U 盘要对准了轻轻卡进去",但从没真正用手做过,所以这些知识一直是"纸上谈兵"。Tactile-VLA 做的事,是给这个大脑接上一双有感觉的手,然后惊讶地发现:只要示范几次,它就能把纸上的物理常识变成手上的真功夫。
这个想法拆成三个具体主张:
把触觉当成一等公民塞进模型,而不是附属品。 论文用"token 级融合"——视觉、语言、触觉、本体感觉(机械臂自己关节的位置)全部切成 token(模型能消化的小块),一起丢进同一个预训练 VLM 里让它们自由互相关注(cross-attend)。触觉不是外挂,而是和图像、文字平起平坐的一路输入。
输出不只是"往哪动",还有"用多大力"。 论文给模型接了一个"触觉感知动作专家(tactile-aware action expert)",它同时吐出两样东西:目标位置和目标力。然后交给一个 混合位置-力控制器(hybrid position-force controller) 去执行——在需要精确定位的方向上控位置,在需要控接触力的方向上控力。这样"轻轻插"就能真的变成"用小力插"。
物理常识是"唤醒"出来的,不是"灌"进去的。 这是论文最反直觉、也最有价值的发现:VLM 的语言部分早就隐含了"softly 对应小力、hard 对应大力"的语义。只要用少量演示把这份语义连线到真实的触觉传感器和力输出上,模型就能零样本泛化——在没见过的充电器任务上、用没学过的力度词("gently""firmly"),依然能做出正确的力度区分。
所以这一节是想说:三招——触觉平权融合、位置+力双输出、少量演示激活大模型的物理常识——合起来让"看图做事"升级成"边摸边用合适的力做事"。
它分几步做的(方法)
这一节最详细。Tactile-VLA 的系统可以拆成五个环节:触觉编码、多模态 token 级融合、动作专家的双输出、混合位置-力控制器、以及链式推理(CoT)恢复。每个环节都按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。
先给一张整体数据流的示意图,帮你建立全局印象:
[头部/手腕相机] [一句话指令] [双指高分辨率触觉] [机械臂关节角]
│ │ │ │
视觉token 语言token 触觉token 本体token
└──────────┬─────────┴──────────┬─────────┴──────────┬───────┘
▼
┌───────────────────────────────────────────────┐
│ 预训练 VLM 主干(π0 系):所有 token 自由互相关注 │
└───────────────────────────────────────────────┘
▼
┌───────────────────────────────┐
│ 触觉感知动作专家 action expert │
└───────────────────────────────┘
│ │
目标位置(x,y,z,姿态) 目标力 (F)
│ │
▼ ▼
┌───────────────────────────────────────────┐
│ 混合位置-力控制器:定位方向控位置,接触方向控力 │
└───────────────────────────────────────────┘
▼
机械臂真实动作(边摸边调力)
1. 触觉编码:把"摸感"变成模型能读的小块
类比:你拍一张菜的照片发朋友圈,得先把照片压成手机能存的格式。触觉这里也一样。
机制(输入→处理→输出):
- 输入:机器人两根手指上各装一个高分辨率触觉传感器。这类传感器(如 GelSight 家族)本质是"一块半透明凝胶罩在小摄像头前"——凝胶被物体压变形时,摄像头就拍下表面的纹路花纹。所以每一帧触觉数据本质是一张小图。
- 处理:用视觉编码器把这张"凝胶纹路图"压成一串 token(数字身份证)。左右两指各编一份。
- 输出:一串触觉 token,形态和视觉 token 一致,可以和它们混在一起读。
等等,先慢一拍——为什么触觉可以"伪装成"图像? 因为高分辨率触觉传感器的物理原理就是"用相机拍凝胶变形"。既然 VLA 已经很会处理图像,触觉图就可以直接走同一条管道,不用为它单独造一套架构。这是整个方法能"低成本接入"的关键前提。
为什么有用:高分辨率触觉图保留了"接触发生在指尖哪个位置、压得多深、有没有打滑"这类细节,比六维力那种"一整只手一个合力数字"信息量高好几个数量级。
2. 多模态 token 级融合:让四种信号在同一张桌子上讨论
类比:厨师同时看菜谱(语言)、看锅里(视觉)、感受锅铲传来的阻力(触觉)、知道自己手在哪(本体感觉),这四路信息在脑子里同时汇合,而不是排队一个个处理。
机制(输入→处理→输出):
- 输入:视觉 token + 语言 token + 触觉 token + 本体感觉 token(机械臂关节位置)。
- 处理:全部拼成一长串,送进预训练 VLM 主干(论文的基座是 π0 系)。关键设计是"token 级融合"——所有模态的 token 在注意力层里自由互相关注,没有谁附属于谁。这样模型能学到"语言里的『轻』要对应触觉上的小压强""视觉看到玻璃杯要对应触觉上的轻握"这类跨模态关联。
- 输出:融合后的特征,交给下游动作专家。
为什么有用:只有让触觉和语言在同一个注意力空间里"平权对话",模型才能把"softly"这个词和"0.5N 左右的接触力"挂上钩。如果触觉只是外挂一个通道、不和语言充分交互,就学不出这种语言→力度的映射。这也是为什么论文强调用预训练 VLM当基座——它的语言部分已经隐含了物理常识,token 级融合是把这份常识"接线到手"的桥。
3. 动作专家的双输出:既说"去哪",也说"用多大力"
类比:老司机不只决定"方向盘打多少度"(位置),还决定"油门踩多深"(力度)。缺一个都开不好车。
机制(输入→处理→输出):
- 输入:融合后的多模态特征。
- 处理:一个"触觉感知动作专家"网络。它区别于普通 VLA 动作头的地方是——普通动作头只预测"下一步机械臂到哪个位姿",而它额外预测一个目标力。
- 输出:两样东西——目标位置(末端要到的 x/y/z + 姿态)和目标力(在接触方向上希望施加多大的力)。
为什么有用:有了"目标力"这个显式输出,"轻轻插"和"用力插"才有了落脚点。同一个"把充电器插进去"的位置目标,配一个小目标力就是温柔插、配大目标力就是硬插。这一步把抽象的语言力度词变成了可执行的数字。
4. 混合位置-力控制器:定位靠位置,接触靠力
类比:你拿粉笔在黑板上写字。手往哪个字的位置移动,靠的是"位置控制"(眼睛对准);但笔尖压黑板的力度,靠的是"力控制"(手感)——你不会用"把手压到黑板里 2 毫米"这种位置指令去控制笔压,因为黑板硬度会变,那样要么写不出字要么把粉笔戳断。
机制(输入→处理→输出):
- 输入:动作专家给的目标位置 + 目标力。
- 处理:混合位置-力控制是机器人学几十年的经典思想——把空间分成两类方向。在需要精确定位的方向(比如把笔尖移到某个字上方)用位置控制;在需要维持接触的方向(比如笔尖压黑板的法向)用力控制。控制器实时读取触觉/力反馈,把实际力往目标力上调。
- 输出:机械臂的真实力矩指令,让它一边走位一边维持想要的接触力。
为什么有用:纯位置控制在接触任务上是灾难——你说"往里 2mm",但物体硬度稍有偏差,2mm 可能意味着"没接触"或者"怼坏"。力控制直接盯着"我想要多大力",天然适配"轻/重"这种语义。位置和力各管一半方向,是既能对准又能控力的关键工程选择。
5. 链式推理(CoT):失败了会"想一想"再加力
类比:你擦白板,一擦没擦干净——你会想"哦力度不够",然后主动加大力再擦一遍。你不会傻站着重复同样的失败动作。
机制(输入→处理→输出):
- 输入:一次尝试后的触觉/视觉反馈(比如"擦了但没擦干净")。
- 处理:Tactile-VLA-CoT 变体让模型显式地对触觉反馈做一步语言推理——"力不够 → 该增大力",再重新规划动作。
- 输出:调整后的动作(更大的目标力),直到成功。
为什么有用:这让模型能从没见过的场景里恢复。白板换成黑板(黑板需要更大的擦拭力),没有推理的基线直接崩(0% 成功),而 CoT 版能"分析→加力→成功",把泛化能力从"记住的动作"升级成"临场推理"。
所以这一节是想说:五个环节——触觉伪装成图像、四模态平权融合、动作专家吐出位置+力、混合控制器分方向执行、CoT 失败恢复——把"看图做事"改造成"边摸边用合适的力、失败还会自己想办法"的系统。核心工程巧思是"触觉走图像管道"(低成本接入)和"位置/力分方向控制"(既准又能控力)。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【Tactile-VLA · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
数字来自论文项目主页公布的实验表。数字本身不重要,重要的是它们指出了"触觉 + 力控制"到底带来了什么。
数字 1:插充电器成功率 90% vs 基线 40%/25%
| 模型 | USB 插拔成功率 | 充电器插拔成功率 |
|---|---|---|
| π0-base(纯视觉基线) | 5% | 40% |
| π0-fast(纯视觉基线) | 0% | 25% |
| Tactile-VLA | 35% | 90% |
含义:在接触敏感的插拔任务上,没有触觉反馈的纯视觉 VLA 几乎做不动(USB 上 0–5%),加了触觉 + 力控制后 USB 涨到 35%、充电器涨到 90%。这直接证明"手感"是这类任务的瓶颈。
数字 2:力度语言的落地——真的能"轻"和"重"
论文测"给模型不同的力度词,它实际施加的接触力(牛顿 N)是多少"。训练时只教过 USB 任务的 'softly' 和 'hard'。
| 模型 | 'softly' | 'hard' | 'gently' | 'firmly' | 零样本'softly' | 零样本'hard' |
|---|---|---|---|---|---|---|
| π0-base | 2.41 | 2.68 | 2.35 | 2.72 | 6.61 | 5.69 |
| π0-fast | 2.61 | 2.33 | 2.79 | 2.45 | 7.37 | 6.42 |
| Tactile-VLA | 0.51 | 2.57 | 0.75 | 1.98 | 4.68 | 9.13 |
含义:基线模型无论你说"轻"还是"重",施加的力几乎一样(2.3–2.8N 挤在一起,说明它根本没把语言和力挂钩)。Tactile-VLA 则清晰区分——"softly" 0.51N vs "hard" 2.57N;连没训练过的近义词 'gently'(0.75N)/'firmly'(1.98N)也对得上;甚至在没学过的充电器任务上零样本区分出 4.68N(轻)vs 9.13N(重)。这就是"唤醒大模型物理常识"的直接证据。
数字 3:链式推理让"白板→黑板"零样本迁移
| 模型 | 白板(域内)成功率 | 黑板(域外)成功率 |
|---|---|---|
| π0-base | 40% | 0% |
| π0-fast | 45% | 0% |
| Tactile-VLA | 80% | 15% |
| Tactile-VLA-CoT | 75% | 80% |
含义:黑板需要比白板更大的擦拭力。基线在域外黑板上完全崩溃(0%)。普通 Tactile-VLA 域外也只有 15%。而带链式推理的 CoT 版把域外成功率拉到 80%,基本追平自己的域内水平——说明"失败后推理加力"这条路能让模型应对没见过的表面。
数字 4:数据采集靠 UMI + 双触觉
| 维度 | 数据 |
|---|---|
| 采集设备 | UMI 手持夹爪(低成本便携数据采集器)+ 双高分辨率触觉传感器 + GoPro 相机 |
| 演示量 | 少量演示即可激活(论文强调 "only a few demonstrations",具体条数原文未在公开摘要/主页中给出精确数字) |
| 基座模型 | π0 系 VLA |
含义:这套方法不追求海量数据,卖点正是"少量演示 + 大模型先验"。采集用 UMI 这种便携夹爪,成本相对可控。
所以这一节是想说:数据说明三件事——触觉让接触任务从"几乎不行"到"能用"(90%);语言力度词真的能落地成不同的牛顿数;CoT 让模型能对没见过的表面临场加力。
实验结果说明了什么
上一节列了数字,这一节换个角度:这些实验回答了哪些科学问题?论文自己把贡献总结成三种能力,对应三个问题。
问题一:触觉到底是不是接触任务的瓶颈?
USB/充电器插拔的对比给了干脆的回答。同一个基座(π0),去掉触觉就是纯视觉基线,USB 成功率 0–5%;加上触觉 + 力控制,USB 到 35%、充电器到 90%。这说明在插拔这类"进不进得去全看那一下卡不卡到位"的任务上,没有触觉反馈,再强的视觉大脑也是睁眼瞎。这是"tactile-aware instruction following(触觉感知的指令跟随)"这条能力线的核心证据。
问题二:语言里的力度词,是模型"背下来的"还是"理解的"?
力控制泛化实验回答了这个。如果模型只是"背下来" softly=某个力,那它换个任务、换个近义词就该失效。但实验显示:训练只见过 USB 任务的 softly/hard,模型却能在没见过的充电器任务上、用没训练过的力度词(gently/firmly)做出合理区分,甚至零样本下把"轻"压到 4.68N、"重"提到 9.13N。基线则完全没有这种语言-力的相关性。这支撑了论文最重要的论点——"utilizing tactile-relevant commonsense(调用触觉相关常识)":这份"轻重"知识本来就藏在 VLM 的语言先验里,Tactile-VLA 只是用少量演示把它连到了手上。
问题三:面对没见过的物体表面,模型会不会死板地重复失败?
白板→黑板实验回答了。黑板要更大的力才擦得动。没有推理的模型(包括普通 Tactile-VLA)在黑板上基本失败(0–15%)。而 Tactile-VLA-CoT 会"读触觉反馈→发现力不够→加大力→重试",把域外成功率拉到 80%。这对应第三条能力——"adaptive tactile-involved reasoning(自适应的触觉参与推理)":从"执行记住的动作"升级到"根据手感临场调整策略"。
一个贯穿全文的洞见:论文反复强调的不是"我们训了个更大的触觉模型",而是"VLM 的先验知识里本就有物理交互的语义理解,连上触觉传感器 + 少量演示就能激活它"。这把研究重心从"堆数据"转向"如何唤醒既有能力",是方法论上的一次视角转换。
所以这一节是想说:实验系统地证明了三件事——触觉是接触任务的瓶颈、力度语言能被真正落地而非死记、CoT 让模型能对陌生表面临场加力;三者共同支撑"大模型的物理常识可被少量演示激活"这个核心主张。
你应该懂的几个新词
VLA(Vision-Language-Action,视觉-语言-动作模型):把"看图 + 读指令 + 输出动作"统一进一个大模型的范式,代表作 RT-2、OpenVLA、π0。本文是给 VLA 补上触觉与力控制的扩展。
触觉传感器(高分辨率,如 GelSight 家族):一块半透明凝胶罩在小摄像头前,凝胶被压变形时摄像头拍下纹路图。本质是"用相机当力觉皮肤",所以输出是图像——这正是它能走视觉管道的原因。
接触力 / 法向力(Contact Force):两个物体接触时相互挤压的力,单位牛顿(N)。本文的目标力就是它,"轻轻"约 0.5N、"用力"约 2.5N。
混合位置-力控制(Hybrid Position-Force Control):机器人学经典思想——把空间方向分两类,定位方向控位置、接触方向控力。本文用它把"目标位置 + 目标力"变成真实动作。
token 级融合(Token-level Fusion):把不同模态(图、字、触觉图、关节角)都切成同一空间的 token,让它们在注意力层里自由互相关注,谁也不附属于谁。
本体感觉(Proprioception):机器人对自己身体状态的感知,这里主要指机械臂各关节的位置/角度。人闭着眼也知道手在哪,就是本体感觉。
零样本泛化(Zero-shot Generalization):没针对某个具体情况训练过,就能直接做对。本文里体现为"没学过的力度词/没见过的任务上依然能区分力度"。
链式推理(Chain-of-Thought, CoT):让模型显式地一步步"想"再行动,而不是一步到位。本文的 CoT 版会先分析触觉反馈"力不够",再决定加力。
UMI(Universal Manipulation Interface):一种手持式低成本机器人数据采集夹爪,人手拿着它做示范就能录数据。本文给它加了双触觉传感器来采集触觉演示。
所以这一节是想说:这几个词以后看任何"触觉 + 大模型"的机器人论文都会反复出现,先把它们和生活类比挂钩。
它有什么搞不定的
Tactile-VLA 是一次很漂亮的整合,但也有明确的边界(部分为论文明说,部分为基于公开信息的合理推断,已标注):
绝对成功率还不算高(论文数据):USB 插拔只有 35%,充电器 90% 已是亮点但离"可靠部署"仍有距离。触觉 + 力控制显著优于基线,但"能用"和"好用"之间还有工程差距。
依赖高分辨率触觉硬件(论文设定 + 推断):方法的前提是有"能出图像的触觉传感器"装在指尖,还要双指同步。这类传感器易磨损、需标定、装配也麻烦,且对硬件形态有要求——不是任意机械臂插上就能用。
"少量演示"的精确条件不透明(公开信息局限):论文强调 few demonstrations 就能激活先验,但公开摘要/主页未给出精确的演示条数、任务覆盖范围。到底"少"到什么程度、换个更陌生的任务族还灵不灵,需读全文和复现验证。
物理常识的天花板取决于基座 VLM(推断):核心卖点是"唤醒 VLM 里的物理常识"。这意味着模型知道的"轻重"边界,被基座语言模型的先验锁死——遇到语言先验里没有的、非常专业的力觉概念(比如"扭矩刚好到打滑临界"),可能就唤不出来。
CoT 恢复依赖可读的失败信号(推断):白板→黑板能成,是因为"没擦干净"是一个视觉/触觉上可观测的清晰失败。若失败信号模糊或延迟(比如内部裂纹、慢性打滑),"分析→加力"的推理链条可能给不出正确判断。
所以这一节是想说:Tactile-VLA 解了"没手感、听不懂力度词、不会临场加力"这几件事,但没解"高成功率、硬件普适、常识天花板、模糊失败信号"这些更硬的问题。
它和别的几篇是什么关系
承接 π0 / OpenVLA / RT-2(VLA 主干路线):Tactile-VLA 的基座是 π0,思路是"拿成熟 VLA 当骨架,加触觉输入 + 力输出两个分支"。它对比的基线也正是 π0-base 和 π0-fast——相当于在同一个大脑上做"加不加手感"的对照实验。
承接触觉表征工作(Sparsh、Sparsh-X、Touch-Vision-Cross-Modal / TVL):这些论文研究"怎么让触觉和视觉/语言在同一空间对齐",给 Tactile-VLA 提供了"触觉可以当 token 融进大模型"的表征基础。Tactile-VLA 把它们从"学表征"推进到"能干活 + 听力度词"。
和 TLA(Tactile-Language-Action)在同一主题家族:都是 2024–2025 年前后把触觉接进语言-动作框架的尝试。可对照两者在"力控制"和"语言力度落地"上的不同侧重。
和 DexVLA / TinyVLA 平行:都是给 VLA 做特化扩展(灵巧手 / 小参数 / 触觉),共同推动 VLA 从"能动"走向"能精细操作"。
方法论上呼应"激活先验"这条大线:和 LLaVA/RT-2 那种"借大模型已有能力"的思路一脉相承——Tactile-VLA 把这个思路推到了物理力觉这一层,主张"物理常识本就在语言模型里,缺的是落地的手"。
所以这一节是想说:Tactile-VLA 站在 π0 的肩膀上,吸收了触觉表征工作的地基,是"VLA + 触觉 + 力控制"这条支线里比较系统的一次整合。
和本导读的关系
本笔记对应导读 Ch18: 多模态融合。
Ch18 讲的是"如何把视觉之外的模态(音频、触觉、3D)接进已有的大模型骨架",核心机制是"用 projector / token 化把新模态对齐到 LLM 的输入空间"。Tactile-VLA 正是这条线在触觉 + 动作方向上的一个前沿样本:它用 token 级融合把触觉接进 VLM,和 Ch18 里 ImageBind、AnyMAL、Sparsh 讲的"新模态接入"是同一套方法论,只是落到了"力控制"这个最讲物理落地的场景。
读完本笔记,建议按导读 Ch18 的路线继续:先看 Sparsh / Sparsh-X(触觉表征怎么学,是本文触觉 token 的地基),再看 Touch-Vision-Cross-Modal / TLA(触觉如何和视觉、语言对齐并接入动作框架)。三篇连起来,就能看清"触觉从表征学习 → 跨模态对齐 → 接入 VLA 做力控制"这条完整演进。
从知识图谱角度,本笔记往上连接 Ch12(OpenVLA / VLAS / MLA)和 Ch13(Diffusion Policy / π0)——那两章讲的是本文的基座 VLA 从哪来;往下连接 Ch14(模仿学习基础),因为 Tactile-VLA 本质仍是"从演示里模仿",只是演示里多了触觉和力这两维信号。
所以这一节是想说:本笔记是导读 Ch18"多模态融合"在触觉-力控制方向上的一块前沿拼图,读完可沿 Sparsh → TLA 继续,把触觉接入大模型的路线看全。
思考题
以下问题用来检验你是否真正理解了论文的核心思路。每题附折叠提示,建议先自己想 30 秒再展开。
Q1:为什么高分辨率触觉传感器能"伪装成"图像,直接走 VLA 的视觉管道?这个设计为整个方法省了什么?
提示
因为这类传感器的物理原理就是"用小摄像头拍凝胶被压后的变形纹路",每一帧本质是一张小图。既然 VLA 已经很会处理图像 token,触觉图就能复用同一个编码器和同一套注意力,不用为触觉单独设计架构。这省的是"接入成本"——低成本地把新模态塞进成熟大模型,也让触觉和视觉能在同一空间里被公平对比。
Q2:基线 π0 无论你说"轻"还是"重"施加的力都挤在 2.3–2.8N,而 Tactile-VLA 能区分 0.51N vs 2.57N。差别的根源是什么?
提示
根源在两点:(1) 输出通道——基线没有"目标力"这个显式输出,也没有力控制器,语言里的"轻/重"根本无处落地;Tactile-VLA 的动作专家显式吐出目标力,再由混合控制器执行。(2) token 级融合让语言和触觉在注意力里充分交互,模型才能把"softly"这个词和"小接触力"挂钩。缺任一条,语言力度词都会变成空话。
Q3:论文最反直觉的主张是"物理常识是唤醒出来的,不是灌进去的"。哪个实验结果最能支撑这个主张?为什么它比"域内成功率高"更有说服力?
提示
最有力的是力控制的零样本泛化:只在 USB 任务上教过 softly/hard,模型却能在没见过的充电器任务上、用没训练过的近义词 gently/firmly 做出合理力度区分(4.68N vs 9.13N)。"域内成功率高"可能只是死记硬背;而"换任务换词都还对"只能解释为——这份"轻重"语义本就存在于 VLM 的语言先验里,演示只是把它连到了手上。
Q4:为什么插拔任务要用"混合位置-力控制"而不能用纯位置控制?举一个纯位置控制会翻车的具体情形。
提示
纯位置控制是"往里 2mm"这种绝对指令。但物体硬度、对齐误差会变:如果目标物比预期硬一点,2mm 可能意味着"还没接触"(插不进);如果软一点或对歪了,2mm 可能意味着"怼进去过深"(把插头或插座怼坏)。力控制直接盯"我想要多大接触力",不管位移多少,天然适配"插到卡住就停"这种接触逻辑,也才能实现"轻/重"。
Q5:Tactile-VLA-CoT 能把黑板(域外)成功率从 15% 拉到 80%。这种"临场恢复"能力来自模型变聪明了吗?它依赖什么前提?
提示
不是模型"更聪明",而是多了一步"读触觉反馈→显式推理→重规划"的循环。前提是失败信号必须可观测且可读——"没擦干净"是视觉/触觉上清晰的信号,模型据此推理出"力不够→加力"。如果失败信号模糊、延迟或不可见,这条推理链就会失效。所以它是"结构化的失败恢复机制",不是凭空的智能。
Q6:如果你要把 Tactile-VLA 迁移到"拧螺丝到刚好不滑丝"这种更精细的力觉任务,你预计会遇到什么障碍?
提示
至少三个:(1) 语言先验的天花板——"刚好不滑丝的扭矩"可能不在 VLM 的常识里,唤不出来,得靠更多针对性演示。(2) 触觉硬件——拧螺丝涉及旋转和扭矩,指尖触觉能否可靠捕捉"临界打滑"信号是问号。(3) 失败信号——滑丝往往是不可逆且难观测的,CoT 恢复可能来不及。这些正好对应论文局限里的"常识天花板 + 硬件 + 模糊失败信号"。
Q7:论文用 π0 当基座并直接和 π0-base/π0-fast 对比。这种"同基座、加/不加触觉"的实验设计有什么好处?
提示
它是一个干净的控制变量实验:基座大脑完全相同,唯一的差别就是"有没有触觉输入 + 力输出"。所以成功率的差距可以干净地归因到"触觉 + 力控制"这一个因素,而不是"换了个更强的模型"。这让"触觉是接触任务瓶颈"的结论更可信——否则你分不清是触觉的功劳还是别的改动。
所以这一节是想说:能回答这 7 题,说明你真正抓住了 Tactile-VLA 的设计逻辑——触觉平权融合、位置+力双输出、以及"唤醒而非灌输"的核心哲学。
一些好奇心问答(FAQ)
Q1:触觉传感器不就是个力传感器吗?和手腕的六维力有什么区别?
区别很大。手腕六维力测的是"整只手受到的一个合力",是一个粗糙的低维数字。高分辨率触觉传感器测的是"指尖接触面上每个点的压强分布",是一张图——能看出接触在哪、压多深、有没有打滑。信息量差好几个数量级,这正是插拔、拧这类活需要的。
Q2:为什么强调"少量演示"?多训点不好吗?
论文的卖点恰恰是"不用多训"。因为大模型的语言部分本就隐含物理常识(轻/重、易碎/结实),只需少量演示把这份常识连到触觉和力输出上。多训当然可能更好,但那样就退回"堆数据"的老路,也说明不了"先验被激活"这个更有价值的现象。
Q3:"轻轻"到底对应多少牛顿?模型怎么知道?
论文实测里 softly ≈ 0.51N、hard ≈ 2.57N。模型不是被硬编码这个数字,而是从少量演示 + 语言先验里学到"softly 这类词该对应小力",再由力控制器执行成具体牛顿数。神奇之处是它对没学过的近义词和新任务也能给出合理数值。
Q4:它和 π0 是什么关系?是全新模型吗?
不是全新从头训。Tactile-VLA 以 π0 系 VLA 为基座,在上面加触觉 token 输入、动作专家的力输出、混合位置-力控制器和 CoT。对比实验里的 π0-base/π0-fast 就是"去掉这些改动"的同基座版本。
Q5:黑板比白板难在哪,为什么需要推理?
黑板需要更大的擦拭力才擦得干净。模型在白板上学的力度到黑板上不够用,一擦发现没干净。普通模型不会调整(重复失败),CoT 版会"读到没擦干净→推理出力不够→加力重试",所以能零样本迁移到黑板。
Q6:这套方法能上量产机器人吗?
短期还早。绝对成功率(USB 35%)、对高分辨率触觉硬件的依赖、以及硬件磨损标定问题,都让它更像"研究原型 + 方向验证"。但它验证的"触觉 + 力控制 + 语言力度落地"是精细操作的必经之路,方向意义大于当下的可部署性。
Q7:之后该看什么?
想理解触觉表征,看 Sparsh / Sparsh-X;想看触觉如何接入语言-动作框架,看 TLA(Tactile-Language-Action) 和 Touch-Vision-Cross-Modal;想理解本文的基座,看 π0 和 OpenVLA 笔记。
所以这一节是想说:实操层面的关键问题(触觉 vs 六维力、少量演示、力度落地、和 π0 的关系)作者都想到了,但可部署性还需时间。
如果你想再深入
按"基座 → 触觉地基 → 同题对手 → 延伸"排序:
- 基座:π0(2024) — Tactile-VLA 的骨架和对比基线。读它才知道"没有触觉的 VLA 长什么样、能做什么"。本仓库有 π0 笔记。
- 基座旁支:OpenVLA / RT-2 — 理解 VLA 这条主线的动作生成范式,本文的触觉分支正是嫁接在这套范式上。
- 触觉地基:Sparsh / Sparsh-X — 触觉表征怎么自监督地学出来,是本文"触觉当 token"的前提。
- 同题对手:TLA(Tactile-Language-Action)、Touch-Vision-Cross-Modal — 同样把触觉接进语言-动作框架,对照能看出不同的融合与力控制取舍。
- 控制学基础:混合位置-力控制(Raibert & Craig 等经典) — 理解"定位方向控位置、接触方向控力"这个几十年老思想,本文的控制器就建在它上面。
所以这一节是想说:把 π0 + Sparsh + Tactile-VLA 三篇连起来读,就能看到"从 VLA 骨架 → 触觉表征 → 触觉+力控制落地"的完整脉络。
原文信息
BibTeX
@article{Huang2025TactileVLA,
author = {Huang, Jialei and Wang, Shuo and Lin, Fanqi and Hu, Yihang and Wen, Chuan and Gao, Yang},
title = {Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization},
journal = {arXiv preprint arXiv:2507.09160},
year = {2025}
}
链接
- arXiv:arxiv.org/abs/2507.09160
- 项目主页:jialeihuang.github.io/tactileVLA.github.io
- 关键数字来源:论文项目主页公布的定量实验表(USB/Charger、力控制泛化、白板/黑板推理)
所以这一节是想说:这是 Huang et al. 2025 年的工作(CoRL 方向),基座为 π0,代码与数据主页标注 "Coming Soon",实验数字取自项目主页公布表格。
最后一个画面
想象实验室里一只机械臂捏着一支粉笔,要把黑板擦干净。它擦了一下——没干净。
如果是普通 VLA,它会一遍遍重复同样力度的无效动作,像个卡住的循环。但这只手停顿了一下,"读"到指尖传来的触觉反馈:力不够。于是它自己加大了力,再擦一遍,干净了。
这一刻,机器人不再只是"照着演示比划",而是摸着手感、听着你说的"轻一点"、失败了还会自己想办法加力。从"看图做事"到"边摸边用合适的力做事",机器人操作又迈上了一个台阶。
所以最后一节是想说:Tactile-VLA 的价值不只在于成功率数字——它让机器人第一次把"人类嘴里的力度词"和"指尖真实的接触力"接上了线,并证明这份物理常识大模型本就有,只差一双有感觉的手。
◼
引用本笔记 / Cite this note
@online{eai_tactile_vla_2026,
title = {(readable note) Tactile-VLA},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2025 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/tactile-vla/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?