Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 71

Tactile Beyond Pixels (Sparsh-X)

13 min read · 4612 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

让机器人的手指不止"看"接触画面,还能听响声、感力度、察打滑——四路信号一起自监督学习,摸东西才像人。学出来的是一个通用"手感"编码器,下游任务贴一顶小帽子就能用。

所以这一节是想说:Sparsh-X 把"触觉"当成内部就有四种信号的一个感官,用自监督把它们对齐成通用触觉表征。


这是个什么场景

伸手到背包里摸钥匙,不用看也能找到。你怎么做到的?指尖摸到金属凉凉的齿、感觉到钥匙串那点重量、稍微一推它就滑、碰到拉链还会"叮"一声——眼睛全程没参与。

机器人现在的"触觉"大多只有一招:在指尖装一个小相机,对着一块软胶拍。胶被按变形,相机记下变形画面,等于给手指装了"眼睛"。但光看一帧画面,分不清你按到的是塑料还是金属,也猜不出捏多紧物体才不会掉。

Sparsh-X 想给机器人手指补全感官:除了看(接触画面),再加上听(接触瞬间的轻响)、感(按下去多用力)、动(手指有没有在滑)。四种信号一起喂给模型,机器人才有机会像你摸钥匙那样靠"手感"判断东西。

视觉触觉传感器(vision-based tactile sensor):像 DIGIT、GelSight 这种,原理是一块软胶 + 一个小相机,胶被压变形后相机拍下形变图,把"摸"变成"看"。是目前机器人触觉最主流的形态。

所以这一节是想说:Sparsh-X 面对的问题是"现有机器人触觉基本只有图像一路,丢了声音、力、运动这些人类摸东西时并用的信息"。


Tactile Beyond Pixels (Sparsh-X) — 场景示意:这论文要解决的现实问题
Plate Nº ITactile Beyond Pixels (Sparsh-X) — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Sparsh(前身,Meta FAIR):对视觉触觉传感器(DIGIT、GelSight)做自监督预训练,但只用图像一种模态
  • Touch-Vision-Language(TVL):把触觉图像和 RGB + 文本对齐做跨模态,但触觉端仍是单模态图像。
  • 传统触觉 ML:每个任务一个小 CNN,标几百到几千条数据训出来,迁移性差,换传感器/任务就要重训。
  • 力/振动单独建模:机器人圈一直有人用力矩传感器或 IMU 做滑动检测,但和视觉触觉是两条独立管线,没融合。
  • 多模态自监督(CLIP / ImageBind):证明了跨模态对齐能学到强表征,但 ImageBind 没碰触觉这一支。

Sparsh-X 的缺口:触觉本身就是天然多模态的物理过程,前人要么只用图像,要么把其他信号当后处理特征,没人把"触觉这一个感官"内部的多模态结构系统地学一遍。

所以这一节是想说:以前要么只用触觉图像、要么把力/声当外挂特征,没人把触觉内部的四路信号当成一个整体去自监督对齐。


这篇论文的新想法

一句话:把"触觉"当成一个内部就有四模态的感官,用自监督同时对齐这四路信号。

三层关键洞察:

  1. 物理同源性:图像/声音/运动/压力都是同一次接触事件的不同投影。一次按压同时产生:传感器表面形变(图像)、空气压缩振动(声音)、传感器加速度(运动)、法向力变化(压力)。它们时间上严格同步、物理上强相关,是天然的对齐对。
  2. 互补而非冗余:图像擅长几何,声音擅长材质/事件,运动擅长动力学,压力擅长接触强度。下游任务对四者的依赖度不同——抓握稳定性偏压力 + 运动,材质识别偏声音 + 图像。预训练时全要,下游任务自己挑。
  3. 共享 latent + 模态专用编码器:每个模态有自己的编码器(处理不同输入维度),但都投到一个共享的向量空间,用对比学习 + 重建的混合自监督目标对齐。

所以这一节是想说:Sparsh-X 的新意在于把跨模态自监督这套思路,从"不同感官之间"下沉到"触觉这一个感官内部"。


它分几步做的(方法)

这一节是全篇核心,拆成"数据采集、四路编码器、自监督目标、下游评估"四块。

整体架构 ASCII 示意:

   图像(DIGIT)  ─► ViT/CNN 编码器 ┐
   声音(麦克风) ─► 音频 Transformer├─► 共享 embedding 空间 ─(对比+掩码重建)─► 通用触觉表征
   运动(IMU)    ─► 1D conv/小 TF ─┤                                         │
   压力(力传感)  ─► MLP ───────────┘                              下游: 线性 probe 贴帽子

第 1 步:数据采集——同一场接触架四个"机位"

输入:需要"同一次摸"的四路同步信号。

处理:像在同一场演唱会架四个机位(相机、麦克、加速度计、测力片)同时录——硬件是 DIGIT(视觉触觉)+ 麦克风 + IMU(惯性测量单元,测加速度/角速度)+ 力传感器。让机器人或人手对各种物体做按、滑、捏、敲,攒一份大规模无标注的"触觉四路"数据集。

输出:海量四路同步、时间对齐的接触片段。具体规模需查原文。

第 2 步:四路编码器——四个翻译把不同信号翻成同一种"通用语"

输入:四路原始信号,各自维度和形式完全不同。

处理

  • 图像端:ViT 或 CNN(沿用前作 Sparsh)。
  • 声音端:把短音频切成 mel-spectrogram(梅尔频谱图,把声音变成"图"),过音频 Transformer。
  • 运动端:IMU 时间序列过 1D 卷积或小 Transformer。
  • 压力端:标量/低维力信号过 MLP(多层感知机)。

输出:四路各自压成一段 embedding 向量,投到同一个共享空间。

embedding(嵌入向量):把一段信号压成一串数字,使得"含义相近的东西"数字也接近,方便算距离、做匹配。

等等,先慢一拍——"对齐"到底在对齐什么?

意思是:让模型学到"同一次接触"产生的四路数字串互相靠近,而"不同次接触"的拉开距离。这样四种信号就住进了同一个空间,能互相理解、互相检索——你只有声音,也能大致"想起"对应的形变画面。

第 3 步:自监督目标——同时玩"完形填空"和"找朋友"

输入:四路对齐好的 embedding。

处理:让模型同时做两个游戏——

  • 完形填空(掩码建模,masked modeling):遮掉某一路信号,让其他路把它猜回来。逼模型学会跨模态推断。
  • 找朋友(对比学习,contrastive learning):把同一次接触的四路认作一伙、不同接触的拆开。

输出:一个训练好的通用触觉编码器。这样训出来的模型,部署时哪怕缺一路传感器(机器人没装麦克风)也还能凑合干活——因为它学过"用其他路补"。

第 4 步:下游评估——冻住主干,贴线性 probe

输入:预训练好的编码器 + 少量下游标注数据。

处理:把编码器冻住,只在它输出上贴一个线性 probe(线性探针,一顶只有一层的小帽子),用几条标注就学会具体任务。然后对比"只用图像自监督(Sparsh)"和"四模态自监督(Sparsh-X)"差几个点。

输出:各下游任务(抓握稳定性、滑动检测、材质识别等)的表现。

线性 probe(linear probe):评估表征质量的标准手法——冻结主干,只训一个线性层。如果小小的线性层就能做好任务,说明主干学到的表征本身就很有信息量。

所以这一节是想说:Sparsh-X 的方法 = 四机位同步采数据 + 四路专用编码器投到共享空间 + 对比与掩码混合自监督 + 线性 probe 下游评估,四步缺一不可。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Tactile Beyond Pixels (Sparsh-X) · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Tactile Beyond Pixels (Sparsh-X) — 方法示意:核心 pipeline
Plate Nº IITactile Beyond Pixels (Sparsh-X) — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体点数请查原文,此处不编造。

维度 说明
模态数 4(图像 / 声音 / 运动 / 压力)
硬件 DIGIT + 麦克风 + IMU + 力传感器
预训练方式 自监督(对比 + 掩码重建),无需标注
下游评估 线性 probe(冻结主干)
对照 单模态图像自监督(Sparsh)
关键优势区间 少标注(few-shot)时提升最大
鲁棒性 部署时缺某一路传感器仍可用

关键定性结论:四模态自监督在少标注区间的优势最大——这符合自监督工作的普遍规律(数据越少,好表征越值钱),也说明"多摸几种信号"确实学到了单看图像学不到的东西。

所以这一节是想说:数字告诉我们,加上声音/力/运动这三路后,触觉表征在少标注、跨任务上明显更强。


实验结果说明了什么

论文主要回答这几个问题:

  1. 四模态 vs 单模态图像:同样下游标注量下 Sparsh-X 涨多少?
  2. 模态消融:拿掉声音/压力/运动各损失多少?哪个任务最依赖哪个模态?
  3. 少样本能力:下游只给 10/50/100 条标注时,多模态优势是放大还是缩小?(通常放大)
  4. 跨硬件泛化:预训练用一种传感器,下游换另一种还能用吗?
  5. 真机操作:靠触觉判断该不该收紧抓握,成功率是否比基线高?

下游任务清单大概率包含:抓握稳定性、滑动检测、材质分类、纹理识别、接触状态估计这五类经典触觉基准。

所以这一节是想说:实验共同证明"触觉内部多模态自监督"不是花架子,它在少标注、跨任务、真机操作上都拿到了单模态拿不到的增益。


你应该懂的几个新词

  • 视觉触觉传感器:软胶 + 小相机,把接触形变拍成图(DIGIT、GelSight)。
  • 模态(modality):信号的种类,这里指图像/声音/运动/压力四路。
  • 自监督学习(SSL):不用人工标签,用数据自身结构当监督(遮一部分预测另一部分)来预训练。
  • 对比学习:把该相似的样本对拉近、不相似的推远。
  • 掩码建模(masked modeling):随机遮住输入一部分让模型重建,BERT/MAE 是代表。
  • 触觉表征(tactile representation):一段触觉信号被压成的向量,好表征让小模型 + 少数据就能学会复杂触觉任务。
  • 线性 probe:冻结主干只训一个线性层,用来衡量表征本身的质量。

所以这一节是想说:这几个词是理解"多模态自监督 + 表征评估"的通用语。


它有什么搞不定的

  • 硬件门槛高:要同时装四种传感器(相机 + 麦克 + IMU + 力),采数据和部署都比只装相机复杂贵。
  • 数据采集成本大:四路同步、时间对齐的接触数据难采,规模上不去表征质量就打折。
  • 传感器多样性:不同厂家、不同型号的触觉传感器差异大,跨硬件泛化仍是挑战。
  • 声音路噪声敏感:接触声很轻,容易被环境噪声淹没,实际部署对麦克风布置和降噪要求高。
  • 仍是编码器不是策略:它给的是通用触觉表征,怎么接进完整操作策略(如 VLA)还需要额外工作。

所以这一节是想说:Sparsh-X 的短板集中在硬件复杂度、数据采集成本和传感器泛化上——多摸几种信号是有代价的。


它和别的几篇是什么关系

  • 直接前身Sparsh(同组单模态触觉自监督),Sparsh-X 是它的"加模态"扩展版。
  • 方法论近邻ImageBind(六模态对齐)、CLIP(图文对齐)。Sparsh-X 把这套跨模态自监督思路下沉到"触觉内部"。
  • 任务领域近邻Touch-Vision-Cross-Modal(把触觉和视觉/语言对齐)——区别是它跨"感官"对齐,Sparsh-X 在"触觉这一个感官内部"做多模态对齐,互补而非替代。
  • 下游使用方:未来的 pi0 / OpenVLA 类策略,若想加触觉输入,Sparsh-X 这种通用触觉编码器是首选插件。
  • 应用衔接:灵巧操作系列(DexCapDexMV)目前主要靠视觉 + 本体,触觉一直是短板,Sparsh-X 这类编码器是补短板的关键基础设施。

所以这一节是想说:Sparsh-X 是"给触觉造 foundation model"这条线的第一梯队,是 ImageBind/CLIP 思路在触觉内部的落地。


和本导读的关系

本篇对应导读 Ch18: 多模态生态——ImageBind / AnyMAL / 3DShape2VecSet。Ch18 讲的是"把不同模态对齐到同一空间"这个现代多模态的核心思想。Sparsh-X 是这个思想在触觉领域最新、最细的落地——它证明了对齐不只能发生在"感官之间",也能发生在"一个感官内部"。读完本篇,配合同章的 imagebind(多感官对齐)、sparsh(单模态触觉前身),能理解"触觉 foundation model"的来龙去脉。

所以这一节是想说:把 Sparsh-X 放进 Ch18 的多模态对齐主线里读,它是"对齐下沉到感官内部"的代表。


思考题

Q1:为什么说图像/声音/运动/压力是"同一次接触的不同投影"?这个物理同源性对自监督有什么用?

提示

一次按压同时产生形变、振动、加速度、力变化,它们时间同步、物理相关。这意味着它们天然是"意思相同的一组",不需要人工标注就能当作对比学习里的正样本对。

Q2:为什么 Sparsh-X 在"少标注"区间相对单模态的优势最大?

提示

自监督的价值就是用无标注数据先学好通用表征。标注越少,"表征本身好不好"越决定成败;标注多到一定程度,从头训也能学好,多模态预训练的边际收益就缩小。

Q3:部署时如果机器人没装麦克风,Sparsh-X 为什么还能工作?

提示

掩码建模训练时就练过"遮掉某一路让其他路补"。模型学到了模态间的相关性,缺一路时能用其他路推断,性能下降但不崩溃。

Q4:如果做模态消融发现"去掉声音几乎不掉分",你会怎么解读?

提示

说明在测的这些下游任务上,声音携带的信息大多能被其他三路覆盖(冗余),或者这些任务本就不依赖材质/事件线索。这会直接影响你部署时"要不要装麦克风"的决策。

Q5:把"感官内部对齐"(Sparsh-X)和"感官之间对齐"(TVL/ImageBind)结合,会得到什么?

提示

一个既懂触觉内部四路、又能和视觉/语言对齐的表征——理论上能支持"用语言描述一种手感并检索/生成对应触觉",是更完整的具身多模态基础。

Q6:这套"感官内部多模态"的方法论,还能迁移到哪些别的感官?

提示

视觉内部:RGB + 深度 + 事件相机 + 热成像;听觉内部:波形 + 频谱 + 多麦克风阵列。凡是"一个感官能被多种物理量同时测量"的场景都适用。

所以这一节是想说:这几个问题带你把"物理同源、自监督、缺模态鲁棒、消融解读、方法论迁移"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:Sparsh-X 是一个能直接用的模型吗?

它给的是一个预训练好的通用触觉编码器。你需要在自己的下游任务上贴一个 probe 或小头微调才能用来做具体任务。它是"零件",不是"整机"。

Q2:一定要凑齐四种传感器才能用吗?

预训练需要四路数据才学得到跨模态相关性。但部署时得益于掩码训练,缺某一路仍可工作,只是性能会打折。

Q3:它和 GelSight 那些传统触觉工作有什么本质区别?

传统工作多是"一个任务训一个小模型"。Sparsh-X 是"先自监督学通用表征,再用少标注适配多个任务",是 foundation model 的思路。

Q4:声音信息真的有用吗?听起来很玄。

接触声携带材质和事件信息——敲金属和敲塑料声音不同,打滑常伴随特定摩擦声。人类也用它(想想指甲刮黑板)。有没有用要看具体任务,消融实验会告诉你。

Q5:难度为什么是四星?

需要先有自监督(CLIP/MAE)和触觉传感的基本概念。但只要这两块 OK,它的核心 idea 是干净的,不烧脑。

Q6:读完 Sparsh-X 接下来看什么?

先补 Sparsh 理解单模态前身;再看 ImageBind 理解多模态对齐的通用范式;想接进策略看 pi0

所以这一节是想说:是零件还是整机、要不要凑齐传感器、声音有没有用——这些实操问题都有明确答案。


如果你想再深入

按"前身 → 方法论 → 下游"排序:

  1. 前身:Sparsh —— 单模态触觉自监督,理解 Sparsh-X 加了什么。
  2. 方法论:ImageBind / CLIP —— 跨模态对齐的通用范式来源。
  3. 邻居:Touch-Vision-Cross-Modal —— "感官之间对齐"的对照。
  4. 下游:pi0 / DexCap —— 触觉表征怎么接进灵巧操作。

所以这一节是想说:把 Sparsh + ImageBind + Sparsh-X 连起来读,就能看懂"触觉 foundation model"的技术血脉。


原文信息

  • 标题:Tactile Beyond Pixels: Multisensory Touch Representations for Robot Manipulation(Sparsh-X)
  • arXiv:https://arxiv.org/abs/2506.14754
  • 会议:CoRL 2025
  • 年份:2025

BibTeX:

@inproceedings{sparshx2025,
  title     = {Tactile Beyond Pixels: Multisensory Touch Representations for Robot Manipulation},
  author    = {{Meta FAIR} and others},
  booktitle = {Conference on Robot Learning (CoRL)},
  year      = {2025},
  url       = {https://arxiv.org/abs/2506.14754}
}

所以整篇是想说:Sparsh-X 把"触觉"从一张形变照片,升级成图像 + 声音 + 运动 + 压力四路合奏的通用表征——它让机器人的手指第一次有机会像人一样,靠综合手感而不是单看一眼来判断东西。

引用本笔记 / Cite this note
BibTeX
@online{eai_sparsh_x_2026,
  title       = {(readable note) Tactile Beyond Pixels (Sparsh-X)},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/sparsh-x/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?