Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 73

Tactile-VLA

27 min read · 9385 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式和术语全部翻译成人话。

一句话讲什么(TL;DR)

给已经会看、会听、会动的机器人补上"手感"这一课:不仅让它摸得到接触的力,还让它听懂"轻轻插"和"用力插"的区别——而且这份"手感常识"很大一部分是从大模型脑子里唤醒出来的,不是从零训出来的。

所以这一节是想说:Tactile-VLA 把"触觉 + 力控制 + 语言"接进了 VLA 大模型,关键卖点是"少量演示就能激活模型本来就有的物理常识"。


这是个什么场景

想象你早上起床,要做两件小事:把 U 盘插进电脑、把充电器插进插座。

你几乎不用看,全靠手感:U 盘插歪了,指尖会感到"顶住了、进不去",于是你微微转一下角度再推;充电器两脚对上插孔的一瞬间,你能感到"卡进去了"那一下,就松力。这套"边摸边调"的动作,你每天做几十次,从来不觉得难。

现在把这两件事交给机器人。今天最强的一类机器人大脑叫 VLA(Vision-Language-Action,视觉-语言-动作模型)——输入是摄像头画面 + 一句话指令,输出是机械臂该怎么动。它在"抓一个杯子""把方块推到左边"这种不太讲究接触力的活上已经很在行。但一到插拔、拧、擦这种力觉关键的活,它就抓瞎了:

它只能"看起来对准了就往里怼"。看不到自己用了多大力,也感觉不到"卡住了"这个信号——于是要么插不进(力太小),要么怼坏(力太大)。

更麻烦的是第二层。你跟同事说"帮我轻轻关下门"和"帮我使劲关下门",同事听得懂这两个副词。但普通 VLA 根本没有"力"这个输出通道——你对它说"轻轻插",它照样用同样的蛮力怼进去,因为它压根不知道"轻""重"对应到动作上是什么。

Tactile-VLA 想补上的就是这两件事:(1) 让机器人真的摸得到接触力;(2) 让它把语言里的力度词(轻、重、温柔、坚定)翻译成真实的接触力。 而且它发现了一个很妙的现象——做到这两点,其实不需要海量数据从头教,因为大模型的语言部分早就"隐约知道"「玻璃杯要轻拿、U 盘插进去要卡一下」这类物理常识,只是以前没有"手"去把这份知识落地而已。

所以这一节是想说:VLA 缺的不是"看"和"想",而是"摸"和"用多大力";Tactile-VLA 就是来给它接上这两根神经,并唤醒模型里沉睡的物理常识。


Tactile-VLA — 场景示意:这论文要解决的现实问题
Plate Nº ITactile-VLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:纯视觉 VLA(RT-2、OpenVLA、π0 等)。 输入图像 + 语言,输出动作。类比:一个戴着厚劳保手套干活的人——看得见东西在哪,但手上一点感觉都没有。在接触不敏感的任务上够用,一到"插进去要感到卡一下"就盲操作。

  • 方案 B:给 VLA 加一个"末端六维力"通道。 在机械臂手腕装一个力传感器,把整只手感到的合力(一个 6 维的粗糙数字)塞进模型。类比:你只知道"整只手大概被顶了多大劲",但分不清是指尖顶到硬物、还是手掌蹭到桌面。信息太糙。

  • 方案 C:专门的触觉操作策略。 针对单个任务(比如插电缆、叠布)单独训一个小触觉模型,效果不错。类比:一个只会插电缆的老师傅,换个任务就得从头学,而且完全听不懂人话——没有语言泛化能力。

  • 方案 D:视觉-触觉表征对齐工作(如 Touch-Vision-Language、Sparsh)。 研究"怎么让触觉信号和视觉/语言在同一个空间里对齐"。类比:先把"摸感"和"看到的样子"配好对。但这类工作大多停在"学表征"这一层,没接到能跟随指令、能干活的 VLA 框架里,也不做力度语言的落地。

  • 核心缺口:把高分辨率触觉 + 语言里的力度词 + 精确的力控制三件事一起塞进同一个大模型,并且能零样本(没针对性训练过就直接会)跟随"轻轻拧"这类触觉指令——这条路一直没人系统走通。更重要的是,没人指出"大模型本来就藏着物理常识,只需少量演示去激活"。

所以这一节是想说:以前要么没手感、要么手感太糙、要么会摸不会听人话;Tactile-VLA 要做的是"高分辨率手感 + 听懂力度词 + 精确用力"三合一,还要用得起(少量演示)。


这篇论文的新想法

一句类比:以前的 VLA 是"一个博学但没长手的大脑"——它读过无数说明书,知道"玻璃杯易碎""U 盘要对准了轻轻卡进去",但从没真正用手做过,所以这些知识一直是"纸上谈兵"。Tactile-VLA 做的事,是给这个大脑接上一双有感觉的手,然后惊讶地发现:只要示范几次,它就能把纸上的物理常识变成手上的真功夫。

这个想法拆成三个具体主张:

  1. 把触觉当成一等公民塞进模型,而不是附属品。 论文用"token 级融合"——视觉、语言、触觉、本体感觉(机械臂自己关节的位置)全部切成 token(模型能消化的小块),一起丢进同一个预训练 VLM 里让它们自由互相关注(cross-attend)。触觉不是外挂,而是和图像、文字平起平坐的一路输入。

  2. 输出不只是"往哪动",还有"用多大力"。 论文给模型接了一个"触觉感知动作专家(tactile-aware action expert)",它同时吐出两样东西:目标位置目标力。然后交给一个 混合位置-力控制器(hybrid position-force controller) 去执行——在需要精确定位的方向上控位置,在需要控接触力的方向上控力。这样"轻轻插"就能真的变成"用小力插"。

  3. 物理常识是"唤醒"出来的,不是"灌"进去的。 这是论文最反直觉、也最有价值的发现:VLM 的语言部分早就隐含了"softly 对应小力、hard 对应大力"的语义。只要用少量演示把这份语义连线到真实的触觉传感器和力输出上,模型就能零样本泛化——在没见过的充电器任务上、用没学过的力度词("gently""firmly"),依然能做出正确的力度区分。

所以这一节是想说:三招——触觉平权融合、位置+力双输出、少量演示激活大模型的物理常识——合起来让"看图做事"升级成"边摸边用合适的力做事"。


它分几步做的(方法)

这一节最详细。Tactile-VLA 的系统可以拆成五个环节:触觉编码、多模态 token 级融合、动作专家的双输出、混合位置-力控制器、以及链式推理(CoT)恢复。每个环节都按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。

先给一张整体数据流的示意图,帮你建立全局印象:

   [头部/手腕相机]        [一句话指令]        [双指高分辨率触觉]     [机械臂关节角]
        │                    │                    │                    │
     视觉token            语言token             触觉token           本体token
        └──────────┬─────────┴──────────┬─────────┴──────────┬───────┘
                   ▼                                          
        ┌───────────────────────────────────────────────┐
        │   预训练 VLM 主干(π0 系):所有 token 自由互相关注   │
        └───────────────────────────────────────────────┘
                   ▼
        ┌───────────────────────────────┐
        │  触觉感知动作专家 action expert  │
        └───────────────────────────────┘
              │                    │
         目标位置(x,y,z,姿态)     目标力 (F)
              │                    │
              ▼                    ▼
        ┌───────────────────────────────────────────┐
        │   混合位置-力控制器:定位方向控位置,接触方向控力    │
        └───────────────────────────────────────────┘
                   ▼
              机械臂真实动作(边摸边调力)

1. 触觉编码:把"摸感"变成模型能读的小块

类比:你拍一张菜的照片发朋友圈,得先把照片压成手机能存的格式。触觉这里也一样。

机制(输入→处理→输出)

  • 输入:机器人两根手指上各装一个高分辨率触觉传感器。这类传感器(如 GelSight 家族)本质是"一块半透明凝胶罩在小摄像头前"——凝胶被物体压变形时,摄像头就拍下表面的纹路花纹。所以每一帧触觉数据本质是一张小图。
  • 处理:用视觉编码器把这张"凝胶纹路图"压成一串 token(数字身份证)。左右两指各编一份。
  • 输出:一串触觉 token,形态和视觉 token 一致,可以和它们混在一起读。

等等,先慢一拍——为什么触觉可以"伪装成"图像? 因为高分辨率触觉传感器的物理原理就是"用相机拍凝胶变形"。既然 VLA 已经很会处理图像,触觉图就可以直接走同一条管道,不用为它单独造一套架构。这是整个方法能"低成本接入"的关键前提。

为什么有用:高分辨率触觉图保留了"接触发生在指尖哪个位置、压得多深、有没有打滑"这类细节,比六维力那种"一整只手一个合力数字"信息量高好几个数量级。

2. 多模态 token 级融合:让四种信号在同一张桌子上讨论

类比:厨师同时看菜谱(语言)、看锅里(视觉)、感受锅铲传来的阻力(触觉)、知道自己手在哪(本体感觉),这四路信息在脑子里同时汇合,而不是排队一个个处理。

机制(输入→处理→输出)

  • 输入:视觉 token + 语言 token + 触觉 token + 本体感觉 token(机械臂关节位置)。
  • 处理:全部拼成一长串,送进预训练 VLM 主干(论文的基座是 π0 系)。关键设计是"token 级融合"——所有模态的 token 在注意力层里自由互相关注,没有谁附属于谁。这样模型能学到"语言里的『轻』要对应触觉上的小压强""视觉看到玻璃杯要对应触觉上的轻握"这类跨模态关联
  • 输出:融合后的特征,交给下游动作专家。

为什么有用:只有让触觉和语言在同一个注意力空间里"平权对话",模型才能把"softly"这个词和"0.5N 左右的接触力"挂上钩。如果触觉只是外挂一个通道、不和语言充分交互,就学不出这种语言→力度的映射。这也是为什么论文强调用预训练 VLM当基座——它的语言部分已经隐含了物理常识,token 级融合是把这份常识"接线到手"的桥。

3. 动作专家的双输出:既说"去哪",也说"用多大力"

类比:老司机不只决定"方向盘打多少度"(位置),还决定"油门踩多深"(力度)。缺一个都开不好车。

机制(输入→处理→输出)

  • 输入:融合后的多模态特征。
  • 处理:一个"触觉感知动作专家"网络。它区别于普通 VLA 动作头的地方是——普通动作头只预测"下一步机械臂到哪个位姿",而它额外预测一个目标力
  • 输出:两样东西——目标位置(末端要到的 x/y/z + 姿态)和目标力(在接触方向上希望施加多大的力)。

为什么有用:有了"目标力"这个显式输出,"轻轻插"和"用力插"才有了落脚点。同一个"把充电器插进去"的位置目标,配一个小目标力就是温柔插、配大目标力就是硬插。这一步把抽象的语言力度词变成了可执行的数字。

4. 混合位置-力控制器:定位靠位置,接触靠力

类比:你拿粉笔在黑板上写字。手往哪个字的位置移动,靠的是"位置控制"(眼睛对准);但笔尖压黑板的力度,靠的是"力控制"(手感)——你不会用"把手压到黑板里 2 毫米"这种位置指令去控制笔压,因为黑板硬度会变,那样要么写不出字要么把粉笔戳断。

机制(输入→处理→输出)

  • 输入:动作专家给的目标位置 + 目标力。
  • 处理:混合位置-力控制是机器人学几十年的经典思想——把空间分成两类方向。在需要精确定位的方向(比如把笔尖移到某个字上方)用位置控制;在需要维持接触的方向(比如笔尖压黑板的法向)用力控制。控制器实时读取触觉/力反馈,把实际力往目标力上调。
  • 输出:机械臂的真实力矩指令,让它一边走位一边维持想要的接触力。

为什么有用:纯位置控制在接触任务上是灾难——你说"往里 2mm",但物体硬度稍有偏差,2mm 可能意味着"没接触"或者"怼坏"。力控制直接盯着"我想要多大力",天然适配"轻/重"这种语义。位置和力各管一半方向,是既能对准又能控力的关键工程选择。

5. 链式推理(CoT):失败了会"想一想"再加力

类比:你擦白板,一擦没擦干净——你会想"哦力度不够",然后主动加大力再擦一遍。你不会傻站着重复同样的失败动作。

机制(输入→处理→输出)

  • 输入:一次尝试后的触觉/视觉反馈(比如"擦了但没擦干净")。
  • 处理:Tactile-VLA-CoT 变体让模型显式地对触觉反馈做一步语言推理——"力不够 → 该增大力",再重新规划动作。
  • 输出:调整后的动作(更大的目标力),直到成功。

为什么有用:这让模型能从没见过的场景里恢复。白板换成黑板(黑板需要更大的擦拭力),没有推理的基线直接崩(0% 成功),而 CoT 版能"分析→加力→成功",把泛化能力从"记住的动作"升级成"临场推理"。

所以这一节是想说:五个环节——触觉伪装成图像、四模态平权融合、动作专家吐出位置+力、混合控制器分方向执行、CoT 失败恢复——把"看图做事"改造成"边摸边用合适的力、失败还会自己想办法"的系统。核心工程巧思是"触觉走图像管道"(低成本接入)和"位置/力分方向控制"(既准又能控力)。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Tactile-VLA · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Tactile-VLA — 方法示意:核心 pipeline
Plate Nº IITactile-VLA — 方法示意:核心 pipeline

关键数字(What works)

数字来自论文项目主页公布的实验表。数字本身不重要,重要的是它们指出了"触觉 + 力控制"到底带来了什么。

数字 1:插充电器成功率 90% vs 基线 40%/25%

模型 USB 插拔成功率 充电器插拔成功率
π0-base(纯视觉基线) 5% 40%
π0-fast(纯视觉基线) 0% 25%
Tactile-VLA 35% 90%

含义:在接触敏感的插拔任务上,没有触觉反馈的纯视觉 VLA 几乎做不动(USB 上 0–5%),加了触觉 + 力控制后 USB 涨到 35%、充电器涨到 90%。这直接证明"手感"是这类任务的瓶颈。

数字 2:力度语言的落地——真的能"轻"和"重"

论文测"给模型不同的力度词,它实际施加的接触力(牛顿 N)是多少"。训练时只教过 USB 任务的 'softly' 和 'hard'。

模型 'softly' 'hard' 'gently' 'firmly' 零样本'softly' 零样本'hard'
π0-base 2.41 2.68 2.35 2.72 6.61 5.69
π0-fast 2.61 2.33 2.79 2.45 7.37 6.42
Tactile-VLA 0.51 2.57 0.75 1.98 4.68 9.13

含义:基线模型无论你说"轻"还是"重",施加的力几乎一样(2.3–2.8N 挤在一起,说明它根本没把语言和力挂钩)。Tactile-VLA 则清晰区分——"softly" 0.51N vs "hard" 2.57N;连没训练过的近义词 'gently'(0.75N)/'firmly'(1.98N)也对得上;甚至在没学过的充电器任务上零样本区分出 4.68N(轻)vs 9.13N(重)。这就是"唤醒大模型物理常识"的直接证据。

数字 3:链式推理让"白板→黑板"零样本迁移

模型 白板(域内)成功率 黑板(域外)成功率
π0-base 40% 0%
π0-fast 45% 0%
Tactile-VLA 80% 15%
Tactile-VLA-CoT 75% 80%

含义:黑板需要比白板更大的擦拭力。基线在域外黑板上完全崩溃(0%)。普通 Tactile-VLA 域外也只有 15%。而带链式推理的 CoT 版把域外成功率拉到 80%,基本追平自己的域内水平——说明"失败后推理加力"这条路能让模型应对没见过的表面。

数字 4:数据采集靠 UMI + 双触觉

维度 数据
采集设备 UMI 手持夹爪(低成本便携数据采集器)+ 双高分辨率触觉传感器 + GoPro 相机
演示量 少量演示即可激活(论文强调 "only a few demonstrations",具体条数原文未在公开摘要/主页中给出精确数字)
基座模型 π0 系 VLA

含义:这套方法不追求海量数据,卖点正是"少量演示 + 大模型先验"。采集用 UMI 这种便携夹爪,成本相对可控。

所以这一节是想说:数据说明三件事——触觉让接触任务从"几乎不行"到"能用"(90%);语言力度词真的能落地成不同的牛顿数;CoT 让模型能对没见过的表面临场加力。


实验结果说明了什么

上一节列了数字,这一节换个角度:这些实验回答了哪些科学问题?论文自己把贡献总结成三种能力,对应三个问题。

问题一:触觉到底是不是接触任务的瓶颈?

USB/充电器插拔的对比给了干脆的回答。同一个基座(π0),去掉触觉就是纯视觉基线,USB 成功率 0–5%;加上触觉 + 力控制,USB 到 35%、充电器到 90%。这说明在插拔这类"进不进得去全看那一下卡不卡到位"的任务上,没有触觉反馈,再强的视觉大脑也是睁眼瞎。这是"tactile-aware instruction following(触觉感知的指令跟随)"这条能力线的核心证据。

问题二:语言里的力度词,是模型"背下来的"还是"理解的"?

力控制泛化实验回答了这个。如果模型只是"背下来" softly=某个力,那它换个任务、换个近义词就该失效。但实验显示:训练只见过 USB 任务的 softly/hard,模型却能在没见过的充电器任务上、用没训练过的力度词(gently/firmly)做出合理区分,甚至零样本下把"轻"压到 4.68N、"重"提到 9.13N。基线则完全没有这种语言-力的相关性。这支撑了论文最重要的论点——"utilizing tactile-relevant commonsense(调用触觉相关常识)":这份"轻重"知识本来就藏在 VLM 的语言先验里,Tactile-VLA 只是用少量演示把它连到了手上。

问题三:面对没见过的物体表面,模型会不会死板地重复失败?

白板→黑板实验回答了。黑板要更大的力才擦得动。没有推理的模型(包括普通 Tactile-VLA)在黑板上基本失败(0–15%)。而 Tactile-VLA-CoT 会"读触觉反馈→发现力不够→加大力→重试",把域外成功率拉到 80%。这对应第三条能力——"adaptive tactile-involved reasoning(自适应的触觉参与推理)":从"执行记住的动作"升级到"根据手感临场调整策略"。

一个贯穿全文的洞见:论文反复强调的不是"我们训了个更大的触觉模型",而是"VLM 的先验知识里本就有物理交互的语义理解,连上触觉传感器 + 少量演示就能激活它"。这把研究重心从"堆数据"转向"如何唤醒既有能力",是方法论上的一次视角转换。

所以这一节是想说:实验系统地证明了三件事——触觉是接触任务的瓶颈、力度语言能被真正落地而非死记、CoT 让模型能对陌生表面临场加力;三者共同支撑"大模型的物理常识可被少量演示激活"这个核心主张。


你应该懂的几个新词

VLA(Vision-Language-Action,视觉-语言-动作模型):把"看图 + 读指令 + 输出动作"统一进一个大模型的范式,代表作 RT-2、OpenVLA、π0。本文是给 VLA 补上触觉与力控制的扩展。

触觉传感器(高分辨率,如 GelSight 家族):一块半透明凝胶罩在小摄像头前,凝胶被压变形时摄像头拍下纹路图。本质是"用相机当力觉皮肤",所以输出是图像——这正是它能走视觉管道的原因。

接触力 / 法向力(Contact Force):两个物体接触时相互挤压的力,单位牛顿(N)。本文的目标力就是它,"轻轻"约 0.5N、"用力"约 2.5N。

混合位置-力控制(Hybrid Position-Force Control):机器人学经典思想——把空间方向分两类,定位方向控位置、接触方向控力。本文用它把"目标位置 + 目标力"变成真实动作。

token 级融合(Token-level Fusion):把不同模态(图、字、触觉图、关节角)都切成同一空间的 token,让它们在注意力层里自由互相关注,谁也不附属于谁。

本体感觉(Proprioception):机器人对自己身体状态的感知,这里主要指机械臂各关节的位置/角度。人闭着眼也知道手在哪,就是本体感觉。

零样本泛化(Zero-shot Generalization):没针对某个具体情况训练过,就能直接做对。本文里体现为"没学过的力度词/没见过的任务上依然能区分力度"。

链式推理(Chain-of-Thought, CoT):让模型显式地一步步"想"再行动,而不是一步到位。本文的 CoT 版会先分析触觉反馈"力不够",再决定加力。

UMI(Universal Manipulation Interface):一种手持式低成本机器人数据采集夹爪,人手拿着它做示范就能录数据。本文给它加了双触觉传感器来采集触觉演示。

所以这一节是想说:这几个词以后看任何"触觉 + 大模型"的机器人论文都会反复出现,先把它们和生活类比挂钩。


它有什么搞不定的

Tactile-VLA 是一次很漂亮的整合,但也有明确的边界(部分为论文明说,部分为基于公开信息的合理推断,已标注):

  • 绝对成功率还不算高(论文数据):USB 插拔只有 35%,充电器 90% 已是亮点但离"可靠部署"仍有距离。触觉 + 力控制显著优于基线,但"能用"和"好用"之间还有工程差距。

  • 依赖高分辨率触觉硬件(论文设定 + 推断):方法的前提是有"能出图像的触觉传感器"装在指尖,还要双指同步。这类传感器易磨损、需标定、装配也麻烦,且对硬件形态有要求——不是任意机械臂插上就能用。

  • "少量演示"的精确条件不透明(公开信息局限):论文强调 few demonstrations 就能激活先验,但公开摘要/主页未给出精确的演示条数、任务覆盖范围。到底"少"到什么程度、换个更陌生的任务族还灵不灵,需读全文和复现验证。

  • 物理常识的天花板取决于基座 VLM(推断):核心卖点是"唤醒 VLM 里的物理常识"。这意味着模型知道的"轻重"边界,被基座语言模型的先验锁死——遇到语言先验里没有的、非常专业的力觉概念(比如"扭矩刚好到打滑临界"),可能就唤不出来。

  • CoT 恢复依赖可读的失败信号(推断):白板→黑板能成,是因为"没擦干净"是一个视觉/触觉上可观测的清晰失败。若失败信号模糊或延迟(比如内部裂纹、慢性打滑),"分析→加力"的推理链条可能给不出正确判断。

所以这一节是想说:Tactile-VLA 解了"没手感、听不懂力度词、不会临场加力"这几件事,但没解"高成功率、硬件普适、常识天花板、模糊失败信号"这些更硬的问题。


它和别的几篇是什么关系

  • 承接 π0 / OpenVLA / RT-2(VLA 主干路线):Tactile-VLA 的基座是 π0,思路是"拿成熟 VLA 当骨架,加触觉输入 + 力输出两个分支"。它对比的基线也正是 π0-base 和 π0-fast——相当于在同一个大脑上做"加不加手感"的对照实验。

  • 承接触觉表征工作(Sparsh、Sparsh-X、Touch-Vision-Cross-Modal / TVL):这些论文研究"怎么让触觉和视觉/语言在同一空间对齐",给 Tactile-VLA 提供了"触觉可以当 token 融进大模型"的表征基础。Tactile-VLA 把它们从"学表征"推进到"能干活 + 听力度词"。

  • 和 TLA(Tactile-Language-Action)在同一主题家族:都是 2024–2025 年前后把触觉接进语言-动作框架的尝试。可对照两者在"力控制"和"语言力度落地"上的不同侧重。

  • 和 DexVLA / TinyVLA 平行:都是给 VLA 做特化扩展(灵巧手 / 小参数 / 触觉),共同推动 VLA 从"能动"走向"能精细操作"。

  • 方法论上呼应"激活先验"这条大线:和 LLaVA/RT-2 那种"借大模型已有能力"的思路一脉相承——Tactile-VLA 把这个思路推到了物理力觉这一层,主张"物理常识本就在语言模型里,缺的是落地的手"。

所以这一节是想说:Tactile-VLA 站在 π0 的肩膀上,吸收了触觉表征工作的地基,是"VLA + 触觉 + 力控制"这条支线里比较系统的一次整合。


和本导读的关系

本笔记对应导读 Ch18: 多模态融合

Ch18 讲的是"如何把视觉之外的模态(音频、触觉、3D)接进已有的大模型骨架",核心机制是"用 projector / token 化把新模态对齐到 LLM 的输入空间"。Tactile-VLA 正是这条线在触觉 + 动作方向上的一个前沿样本:它用 token 级融合把触觉接进 VLM,和 Ch18 里 ImageBind、AnyMAL、Sparsh 讲的"新模态接入"是同一套方法论,只是落到了"力控制"这个最讲物理落地的场景。

读完本笔记,建议按导读 Ch18 的路线继续:先看 Sparsh / Sparsh-X(触觉表征怎么学,是本文触觉 token 的地基),再看 Touch-Vision-Cross-Modal / TLA(触觉如何和视觉、语言对齐并接入动作框架)。三篇连起来,就能看清"触觉从表征学习 → 跨模态对齐 → 接入 VLA 做力控制"这条完整演进。

从知识图谱角度,本笔记往上连接 Ch12(OpenVLA / VLAS / MLA)和 Ch13(Diffusion Policy / π0)——那两章讲的是本文的基座 VLA 从哪来;往下连接 Ch14(模仿学习基础),因为 Tactile-VLA 本质仍是"从演示里模仿",只是演示里多了触觉和力这两维信号。

所以这一节是想说:本笔记是导读 Ch18"多模态融合"在触觉-力控制方向上的一块前沿拼图,读完可沿 Sparsh → TLA 继续,把触觉接入大模型的路线看全。


思考题

以下问题用来检验你是否真正理解了论文的核心思路。每题附折叠提示,建议先自己想 30 秒再展开。

Q1:为什么高分辨率触觉传感器能"伪装成"图像,直接走 VLA 的视觉管道?这个设计为整个方法省了什么?

提示

因为这类传感器的物理原理就是"用小摄像头拍凝胶被压后的变形纹路",每一帧本质是一张小图。既然 VLA 已经很会处理图像 token,触觉图就能复用同一个编码器和同一套注意力,不用为触觉单独设计架构。这省的是"接入成本"——低成本地把新模态塞进成熟大模型,也让触觉和视觉能在同一空间里被公平对比。

Q2:基线 π0 无论你说"轻"还是"重"施加的力都挤在 2.3–2.8N,而 Tactile-VLA 能区分 0.51N vs 2.57N。差别的根源是什么?

提示

根源在两点:(1) 输出通道——基线没有"目标力"这个显式输出,也没有力控制器,语言里的"轻/重"根本无处落地;Tactile-VLA 的动作专家显式吐出目标力,再由混合控制器执行。(2) token 级融合让语言和触觉在注意力里充分交互,模型才能把"softly"这个词和"小接触力"挂钩。缺任一条,语言力度词都会变成空话。

Q3:论文最反直觉的主张是"物理常识是唤醒出来的,不是灌进去的"。哪个实验结果最能支撑这个主张?为什么它比"域内成功率高"更有说服力?

提示

最有力的是力控制的零样本泛化:只在 USB 任务上教过 softly/hard,模型却能在没见过的充电器任务上、用没训练过的近义词 gently/firmly 做出合理力度区分(4.68N vs 9.13N)。"域内成功率高"可能只是死记硬背;而"换任务换词都还对"只能解释为——这份"轻重"语义本就存在于 VLM 的语言先验里,演示只是把它连到了手上。

Q4:为什么插拔任务要用"混合位置-力控制"而不能用纯位置控制?举一个纯位置控制会翻车的具体情形。

提示

纯位置控制是"往里 2mm"这种绝对指令。但物体硬度、对齐误差会变:如果目标物比预期硬一点,2mm 可能意味着"还没接触"(插不进);如果软一点或对歪了,2mm 可能意味着"怼进去过深"(把插头或插座怼坏)。力控制直接盯"我想要多大接触力",不管位移多少,天然适配"插到卡住就停"这种接触逻辑,也才能实现"轻/重"。

Q5:Tactile-VLA-CoT 能把黑板(域外)成功率从 15% 拉到 80%。这种"临场恢复"能力来自模型变聪明了吗?它依赖什么前提?

提示

不是模型"更聪明",而是多了一步"读触觉反馈→显式推理→重规划"的循环。前提是失败信号必须可观测且可读——"没擦干净"是视觉/触觉上清晰的信号,模型据此推理出"力不够→加力"。如果失败信号模糊、延迟或不可见,这条推理链就会失效。所以它是"结构化的失败恢复机制",不是凭空的智能。

Q6:如果你要把 Tactile-VLA 迁移到"拧螺丝到刚好不滑丝"这种更精细的力觉任务,你预计会遇到什么障碍?

提示

至少三个:(1) 语言先验的天花板——"刚好不滑丝的扭矩"可能不在 VLM 的常识里,唤不出来,得靠更多针对性演示。(2) 触觉硬件——拧螺丝涉及旋转和扭矩,指尖触觉能否可靠捕捉"临界打滑"信号是问号。(3) 失败信号——滑丝往往是不可逆且难观测的,CoT 恢复可能来不及。这些正好对应论文局限里的"常识天花板 + 硬件 + 模糊失败信号"。

Q7:论文用 π0 当基座并直接和 π0-base/π0-fast 对比。这种"同基座、加/不加触觉"的实验设计有什么好处?

提示

它是一个干净的控制变量实验:基座大脑完全相同,唯一的差别就是"有没有触觉输入 + 力输出"。所以成功率的差距可以干净地归因到"触觉 + 力控制"这一个因素,而不是"换了个更强的模型"。这让"触觉是接触任务瓶颈"的结论更可信——否则你分不清是触觉的功劳还是别的改动。

所以这一节是想说:能回答这 7 题,说明你真正抓住了 Tactile-VLA 的设计逻辑——触觉平权融合、位置+力双输出、以及"唤醒而非灌输"的核心哲学。


一些好奇心问答(FAQ)

Q1:触觉传感器不就是个力传感器吗?和手腕的六维力有什么区别?

区别很大。手腕六维力测的是"整只手受到的一个合力",是一个粗糙的低维数字。高分辨率触觉传感器测的是"指尖接触面上每个点的压强分布",是一张图——能看出接触在哪、压多深、有没有打滑。信息量差好几个数量级,这正是插拔、拧这类活需要的。

Q2:为什么强调"少量演示"?多训点不好吗?

论文的卖点恰恰是"不用多训"。因为大模型的语言部分本就隐含物理常识(轻/重、易碎/结实),只需少量演示把这份常识连到触觉和力输出上。多训当然可能更好,但那样就退回"堆数据"的老路,也说明不了"先验被激活"这个更有价值的现象。

Q3:"轻轻"到底对应多少牛顿?模型怎么知道?

论文实测里 softly ≈ 0.51N、hard ≈ 2.57N。模型不是被硬编码这个数字,而是从少量演示 + 语言先验里学到"softly 这类词该对应小力",再由力控制器执行成具体牛顿数。神奇之处是它对没学过的近义词和新任务也能给出合理数值。

Q4:它和 π0 是什么关系?是全新模型吗?

不是全新从头训。Tactile-VLA 以 π0 系 VLA 为基座,在上面加触觉 token 输入、动作专家的力输出、混合位置-力控制器和 CoT。对比实验里的 π0-base/π0-fast 就是"去掉这些改动"的同基座版本。

Q5:黑板比白板难在哪,为什么需要推理?

黑板需要更大的擦拭力才擦得干净。模型在白板上学的力度到黑板上不够用,一擦发现没干净。普通模型不会调整(重复失败),CoT 版会"读到没擦干净→推理出力不够→加力重试",所以能零样本迁移到黑板。

Q6:这套方法能上量产机器人吗?

短期还早。绝对成功率(USB 35%)、对高分辨率触觉硬件的依赖、以及硬件磨损标定问题,都让它更像"研究原型 + 方向验证"。但它验证的"触觉 + 力控制 + 语言力度落地"是精细操作的必经之路,方向意义大于当下的可部署性。

Q7:之后该看什么?

想理解触觉表征,看 Sparsh / Sparsh-X;想看触觉如何接入语言-动作框架,看 TLA(Tactile-Language-Action)Touch-Vision-Cross-Modal;想理解本文的基座,看 π0OpenVLA 笔记。

所以这一节是想说:实操层面的关键问题(触觉 vs 六维力、少量演示、力度落地、和 π0 的关系)作者都想到了,但可部署性还需时间。


如果你想再深入

按"基座 → 触觉地基 → 同题对手 → 延伸"排序:

  1. 基座:π0(2024) — Tactile-VLA 的骨架和对比基线。读它才知道"没有触觉的 VLA 长什么样、能做什么"。本仓库有 π0 笔记。
  2. 基座旁支:OpenVLA / RT-2 — 理解 VLA 这条主线的动作生成范式,本文的触觉分支正是嫁接在这套范式上。
  3. 触觉地基:Sparsh / Sparsh-X — 触觉表征怎么自监督地学出来,是本文"触觉当 token"的前提。
  4. 同题对手:TLA(Tactile-Language-Action)、Touch-Vision-Cross-Modal — 同样把触觉接进语言-动作框架,对照能看出不同的融合与力控制取舍。
  5. 控制学基础:混合位置-力控制(Raibert & Craig 等经典) — 理解"定位方向控位置、接触方向控力"这个几十年老思想,本文的控制器就建在它上面。

所以这一节是想说:把 π0 + Sparsh + Tactile-VLA 三篇连起来读,就能看到"从 VLA 骨架 → 触觉表征 → 触觉+力控制落地"的完整脉络。


原文信息

BibTeX

@article{Huang2025TactileVLA,
  author  = {Huang, Jialei and Wang, Shuo and Lin, Fanqi and Hu, Yihang and Wen, Chuan and Gao, Yang},
  title   = {Tactile-VLA: Unlocking Vision-Language-Action Model's Physical Knowledge for Tactile Generalization},
  journal = {arXiv preprint arXiv:2507.09160},
  year    = {2025}
}

链接

所以这一节是想说:这是 Huang et al. 2025 年的工作(CoRL 方向),基座为 π0,代码与数据主页标注 "Coming Soon",实验数字取自项目主页公布表格。


最后一个画面

想象实验室里一只机械臂捏着一支粉笔,要把黑板擦干净。它擦了一下——没干净。

如果是普通 VLA,它会一遍遍重复同样力度的无效动作,像个卡住的循环。但这只手停顿了一下,"读"到指尖传来的触觉反馈:力不够。于是它自己加大了力,再擦一遍,干净了。

这一刻,机器人不再只是"照着演示比划",而是摸着手感、听着你说的"轻一点"、失败了还会自己想办法加力。从"看图做事"到"边摸边用合适的力做事",机器人操作又迈上了一个台阶。

所以最后一节是想说:Tactile-VLA 的价值不只在于成功率数字——它让机器人第一次把"人类嘴里的力度词"和"指尖真实的接触力"接上了线,并证明这份物理常识大模型本就有,只差一双有感觉的手。

引用本笔记 / Cite this note
BibTeX
@online{eai_tactile_vla_2026,
  title       = {(readable note) Tactile-VLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/tactile-vla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?