Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 74

TLA: Tactile-Language-Action

13 min read · 4506 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

让机器人像你闭眼摸钥匙那样——靠"一段持续变化的触感"加上一句话指令,自己决定下一步该怎么用手。关键是把触觉当成带时间的模态,而不是一张压力快照。

所以这一节是想说:TLA 把 VLA 里的"视觉"换成/扩展为"时序触觉",教大模型听懂"手感曲线"这门方言。


这是个什么场景

早上你在背包侧袋里掏钥匙,眼睛还盯着手机。

手指伸进去那两秒,发生了一连串事:先碰到软的纸巾(不是)、滑过塑料壳(耳机盒)、最后摸到一串凉凉的、有齿的金属——是它。整个过程你没看,靠的是一段连续变化的手感:从软到硬、从光滑到带齿、从晃到稳。

机器人之前没法做这件事。要么靠摄像头看(书包里全黑啥也看不见),要么靠传感器"按一下记一张压力图"——相当于只允许你用指尖戳一下不准滑动,自然分不清耳机盒和钥匙串。TLA 想让机器人也能"摸着摸着就知道是哪个",并且当你嘴上说"把软的那个递给我"时,它知道软的是哪种触感曲线,伸手去拿对的那个。

VLA(Vision-Language-Action):把视觉、语言、动作联合训进一个模型的范式(RT-2、OpenVLA 是代表)。TLA 是把"视觉(V)"换成"触觉(T)"的版本。

所以这一节是想说:TLA 面对的是"接触瞬间摄像头看不见、单帧触觉又丢了时间信息"这个精细操作的死角。


TLA — 场景示意:这论文要解决的现实问题
Plate Nº ITLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • VLA 路线(RT-2、OpenVLA 等):视觉 + 语言 → 动作。但摄像头看不到接触瞬间发生了什么,比如东西滑了没、捏到没。
  • 单帧触觉(TacGNN、各类 GelSight 工作):把触觉读数当一张图片,识别接触面形状或物体类别。问题:丢了时间维度,捏苹果和捏鸡蛋的"渐进施力差异"看不出来。
  • 触觉 + 强化学习:用触觉当 reward 或 state 训 policy,但不接语言、泛化差,换任务就要重训。
  • 多模态融合早期尝试:把触觉特征和视觉特征拼接,但没有大语言模型那种"指令理解"能力,做不到"把熟的桃子递给我"这种语义级任务。
  • 少有工作把触觉时序当成"模态"和 LLM 对齐——这是 TLA 切入的缝。

所以这一节是想说:以前要么触觉没接语言、要么触觉只是单帧快照,没人把"带时间的触感"当成大模型能读的一门方言。


这篇论文的新想法

一句话:把触觉当成大模型听得懂的另一门"方言",而且是带时间的方言。

打个比方。大模型已经会听人说话(语言)、看图(视觉)。现在再教它一门新语言——触觉。但不是教它"指尖压力 = 5 牛"这种死数字(那相当于教单词),而是教它**"接触瞬间这条压力上升曲线长什么样"**——更像教它听一段语调,而不是孤立的字。

具体步骤:

  1. 触觉传感器输出的不是一张图,而是连续 T 帧的时序信号(类似一小段视频)。
  2. 一个编码器把这段信号压成一串 token,相当于把"手感片段"翻译成大模型能读的"词"。
  3. 这些"触觉词"和你说的话(文本 token)、要做的动作(动作 token)混在一起,喂给一个 Transformer/LLM 主干。
  4. 训练目标:看完这段触感 + 听完这句话 → 输出下一步该怎么动手。

精神跟 VLA 一样,只是把"看"换成或加上"摸",而且强调时间序列——不是单帧压力贴图,是一整段手感曲线。这让模型能区分"刚碰到时力在变" vs "已经握稳了力不变"这种只有时间维度才看得出的差别。

所以这一节是想说:TLA 的新意是把"时序触觉"作为一等模态和语言、动作对齐,让机器人靠手感曲线 + 指令做精细操作。


它分几步做的(方法)

这一节是全篇核心,拆成"触觉编码、跨模态对齐、动作解码、数据"四块。

整体数据流 ASCII 示意:

   触觉 T 帧序列 ─► 时序触觉编码器 ─► 触觉 token ┐
   指令 ─► 文本 token ──────────────────────────├─► Transformer/LLM 主干 ─► action head ─► 动作序列
   (可选)视觉 ─► 视觉 token ─────────────────────┘

第 1 步:触觉编码——把一段"手感视频"剪成摘要喂给 LLM

输入:触觉传感器输出的连续 T 帧时序信号(一小段"手感视频")。

处理:像把一段 30 秒的视频剪成几个关键画面再写成字幕——给 LLM 看的不是原始流,而是"摘要"。用某种序列编码器(可能是 1D 卷积 + Transformer,或 ViT 风格处理时序)把多帧触觉信号转成一段嵌入向量。

输出:一串"触觉 token",可以和文本、动作 token 混在一起。具体编码器结构和帧数需查原文。

等等,先慢一拍——嵌入向量(embedding) 是什么?就是把一段东西压成一串数字,使得"长得像的东西"数字也接近,这样机器能算距离、做匹配。

第 2 步:跨模态对齐——让"硬"这个词和"硬的手感"指向同一个意思

输入:触觉 embedding + 语言 embedding。

处理:像翻译官的工作——让"硬"这个中文词、"hard"这个英文词、还有手摸到硬东西的触感曲线,三种来源的嵌入都指向同一个意思。常见做法是对比学习(contrastive,类似 CLIP,让配对的样本靠近、不配对的远离)。

输出:语言和触觉能互相检索、互相条件化——你说"凉的",模型能想起对应的触感长什么样。

第 3 步:动作解码——看完指令、捏过食材后决定下刀

输入:对齐后的语言 + 触觉(+ 可能的视觉)表示。

处理:像厨师看完菜单(语言)、捏过食材(触觉)后决定下刀角度——接一个 action head(可能是扩散策略或自回归 token 输出),联合预测末端执行器的动作序列。这部分基本沿用 VLA 范式。

输出:下一步的动作序列,交给机器人执行。

第 4 步:数据——最难的一关

输入:需要"触觉时序 + 语言标注"的成对数据。

处理:触觉数据像稀有食材——必须有装触觉传感器的真机械臂去一次次摸真实物体,还得给每段触感配上"我现在摸的是 XX"这种语言标注。论文构造或借助某个 tactile-language 配对数据集,可能也做 sim-to-real(仿真训、真机用)或合成数据扩量。具体规模和采集方式需查原文。

输出:一份能训练"触觉-语言-动作"对齐的数据集。

等等,先慢一拍——为什么"时序"触觉这么关键,单帧不行?

想象你闭着眼睛去分辨手里捏的是熟透的番茄还是生土豆。只看某一瞬间的压力分布(单帧),你只知道"接触面大概这么大、压力这么强",很难区分——因为静态那一刻两者可能长得很像。但如果你允许自己捏一下、松一下,感受压力随时间怎么变化:番茄会随力度慢慢陷下去、有回弹和形变,土豆几乎纹丝不动。这种"力—形变随时间演化"的模式,恰恰藏在时序里,单帧根本看不到。机器人也一样:滑动、打滑、材质软硬、接触是否稳定,都是时间维度上的动态特征。TLA 把连续触觉当成一段"语言"来编码,正是为了抓住这些只有在时间轴上才显现的信息,这也是它相比只用单帧触觉图的方法最本质的优势来源。

所以这一节是想说:TLA 的方法 = 时序触觉编码成 token + 与语言对比对齐 + VLA 式动作解码 + 触觉-语言配对数据,四块里数据是最硬的骨头,而"用时序而非单帧"是它能读懂软硬、打滑等动态触感的关键。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【TLA: Tactile-Language-Action · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

TLA — 方法示意:核心 pipeline
Plate Nº IITLA — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体成功率请查原文,此处不编造。

维度 说明
核心模态 时序触觉(连续 T 帧),非单帧
对齐方式 触觉-语言跨模态对齐(对比学习)
动作输出 VLA 式 action head
关键消融 序列触觉 vs 单帧触觉
数据瓶颈 触觉-语言配对数据稀缺
目标任务 分辨软硬、判断滑动、精确插入、抓易碎物

关键看点:论文必须证明"序列性比单帧贡献大"——否则标题里的"时序"就名不副实。如果去掉时间维度(只用单帧)掉分明显,说明"手感曲线"真的带来了单帧看不到的信息。

所以这一节是想说:数字里最该盯的是"序列 vs 单帧"这条消融,它决定 TLA 的核心主张成不成立。


实验结果说明了什么

典型实验维度(具体数字需查原文):

  • 下游任务:精细操作类——分辨软硬、判断滑动、精确插入、抓易碎物。
  • 基线对比:仅视觉 VLA、仅触觉 policy、单帧触觉 + 语言,看 TLA 的"序列触觉 + 语言"差多少。
  • 消融:去掉时序(只用单帧)、去掉语言、换不同触觉窗口长度,各掉多少。
  • 泛化:训练没见过的物体形状/材质,能否用语言描述零样本迁移。
  • 真机部署:是否有真实机械臂的成功率,而不只是仿真。

读论文重点看消融——能证明"序列性 > 单帧"才对得起标题。

所以这一节是想说:实验的意义是证明"把触觉当带时间的方言"确实带来精细操作能力,而不只是换了个说法。


你应该懂的几个新词

  • VLA(Vision-Language-Action):视觉/语言/动作联合的模型范式;TLA 是把 V 换成 T(触觉)。
  • GelSight / 视触觉传感器:软胶 + 摄像头记录胶面形变,输出像图像但描述的是接触压力分布。
  • 时序触觉(sequential tactile):不是单帧压力图,而是一段时间内连续的触觉读数。类比视频 vs 图片。
  • 跨模态对齐(cross-modal alignment):让不同模态的向量住进同一空间,用对比学习实现。CLIP 是经典案例。
  • action token / action head:把动作离散化成 token 或用小网络解码动作向量,VLA 标准做法。
  • sim-to-real:仿真里训、真机上用。触觉 sim-to-real 比视觉更难,因为接触物理仿真不准。

所以这一节是想说:这几个词是理解"把新模态接进 VLA"这类工作的通用语。


它有什么搞不定的

  • 数据是硬约束:触觉-语言配对数据极难大规模采集,直接限制模型规模和泛化。
  • 触觉传感器多样:不同传感器输出差异大,跨硬件迁移难。
  • 触觉 sim-to-real 差:接触物理仿真不准,靠仿真扩量效果打折。
  • 单一触觉信息有限:只有触觉时对全局场景理解弱,很多任务还是得配视觉。
  • 工程细节难复现:数据、硬件、标注都不易复刻,方法本身的可复现性受限。

所以这一节是想说:TLA 的短板几乎都绕着"数据和传感器"——这也是整个触觉领域的共同瓶颈。


它和别的几篇是什么关系

  • OpenVLA / RT-2:TLA 是同一家族的"换模态版本"。理解了 VLA 怎么把图像 token 化喂大模型,TLA 就懂了一半。
  • 3D-VLA / PointLLM:都是给 VLA 加新模态。3D-VLA 加点云,TLA 加触觉,思路并列。
  • Diffusion Policy / 3D Diffusion Policy:动作解码端的工作,TLA 的 action head 可能借鉴。
  • 触觉表示学习(SparshSparsh-XTouch-Vision-Cross-Modal:做触觉自监督预训练,可能是 TLA 触觉编码器的前置或对比。
  • 多模态 LLM(LLaVA 系列):TLA 是把"触觉"加进多模态 LLM 大盘子里的一个具体落地。

所以这一节是想说:TLA 是"给 VLA 加触觉模态"的代表,和加点云的 3D-VLA、做触觉表征的 Sparsh 系列互补。


和本导读的关系

本篇对应导读 Ch18: 多模态生态——ImageBind / AnyMAL / 3DShape2VecSet。Ch18 讲"把不同模态对齐到同一空间"这个多模态核心思想。TLA 是这个思想在"触觉 + 语言 + 动作"上的落地,且特别强调时间维度。读完本篇,配合同章的 sparsh-x(触觉内部多模态)、imagebind(多感官对齐),能理解"触觉怎么进大模型"这条支线。

所以这一节是想说:把 TLA 放进 Ch18 的多模态对齐主线里读,它是"时序触觉 + 语言"落地的代表。


思考题

Q1:为什么"单帧压力图"分不清捏苹果和捏鸡蛋,而"时序触觉"可以?

提示

单帧只看某一瞬间的压力分布。捏苹果和捏鸡蛋的差别在于"施力随时间怎么变"(鸡蛋要更小心、力的上升更缓)。这种动态差异只有时间序列才看得出。

Q2:为什么要让触觉和语言做跨模态对齐,而不是各管各的?

提示

对齐后你说"软的那个",模型能想起对应的触感曲线,实现"用语言指挥触觉任务"。不对齐就没法做"把熟的桃子递给我"这种语义级操作。

Q3:触觉-语言配对数据为什么这么难采?这对方法有什么连锁影响?

提示

需要真机械臂 + 触觉传感器去摸真实物体,还要人给每段触感配语言标注,慢且贵。数据少 → 模型规模和泛化都受限,这是 TLA 最大的天花板。

Q4:如果 TLA 的"序列 vs 单帧"消融显示序列只涨了一点点,你会怎么评价这篇工作?

提示

那标题里的"时序"卖点就打折了——说明在测的任务上时间信息没那么关键。反之如果序列涨很多,才证明"把触觉当带时间的方言"是真有价值的 framing。

Q5:TLA 加触觉、3D-VLA 加点云,都是给 VLA 加模态。加模态的通用套路是什么?

提示

用一个专用编码器把新模态压成 token → 和语言/动作 token 拼一起 → 喂进共享 Transformer → 用对齐/预测目标训练。套路和把图像 token 化喂 LLM 一模一样。

Q6:触觉 sim-to-real 比视觉更难,为什么?这对"用仿真扩量数据"意味着什么?

提示

接触物理(摩擦、形变、软体)仿真极难准确,仿真触觉和真实触觉差距大。这意味着靠仿真扩量效果有限,真机数据仍不可替代。

所以这一节是想说:这几个问题带你把"时间维度、跨模态对齐、数据瓶颈、加模态套路、sim-to-real"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:TLA 完全不用视觉吗?

不一定。它强调触觉,但很多设置里视觉可以作为可选输入一起进来。触觉解决的是"接触瞬间"这个视觉盲区,两者互补而非互斥。

Q2:它用的是哪种触觉传感器?

多为视触觉传感器(GelSight/DIGIT 类)输出的时序信号。具体型号看论文。

Q3:为什么强调"时序"这么重要?

因为精细操作的关键信息(力怎么变、有没有打滑、握稳了没)都藏在时间维度里。单帧丢了这些,等于闭眼只戳一下。

Q4:TLA 和 Sparsh-X 有什么区别?

Sparsh-X 做的是"触觉内部多模态自监督表征"(图像+声+力+运动),是造编码器;TLA 做的是"把时序触觉接进 LLM 做语言条件的动作",是造策略。前者是零件,后者是应用,可以配合。

Q5:数据这么难,这工作能复现吗?

方法思路可借鉴,但数据/硬件/标注不易复刻,完整复现门槛高。它更大的价值在 framing(把触觉当带时间的模态)。

Q6:读完 TLA 接下来看什么?

想理解 VLA 基本盘看 OpenVLA;想看触觉表征看 Sparsh-X;想看加别的模态看 3D-VLA

所以这一节是想说:用不用视觉、什么传感器、能不能复现——这些实操问题都有明确答案。


如果你想再深入

按"范式基础 → 触觉表征 → 并列模态"排序:

  1. 范式基础:OpenVLA —— 理解 VLA 怎么把模态 token 化喂大模型。
  2. 触觉表征:Sparsh-X / Sparsh —— TLA 触觉编码器的前置知识。
  3. 并列模态:3D-VLA —— 加点云的对照,看"加模态"的通用套路。
  4. 动作端:Diffusion Policy —— action head 的可能来源。

所以这一节是想说:把 OpenVLA + Sparsh-X + TLA + 3D-VLA 连起来读,就能看懂"给 VLA 加新模态"这条线。


原文信息

BibTeX:

@inproceedings{hao2025tla,
  title     = {TLA: Tactile-Language-Action Model for Contact-Rich Manipulation},
  author    = {Hao, Peng and others},
  booktitle = {IEEE International Conference on Robotics and Automation (ICRA)},
  year      = {2025},
  url       = {https://arxiv.org/abs/2503.08548}
}

所以整篇是想说:TLA 把 VLA 里的"看"换成"摸",还特别强调触感是带时间的——它让机器人第一次能像你闭眼掏钥匙那样,靠一段手感曲线加一句话,摸对该拿的那个东西。

引用本笔记 / Cite this note
BibTeX
@online{eai_tla_tactile_language_action_2026,
  title       = {(readable note) TLA: Tactile-Language-Action},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/tla-tactile-language-action/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?