Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Datasets & Benchmarks · Plate Nº 32

RH20T

14 min read · 4810 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过机器人数据集"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么现在机器人只会推推捡捡这种简单活、而 RH20T 通过采集 11 万条带力觉/声音的复杂操作数据,想让机器人学会切、插、倒、折这种需要手感的活"。

一句话讲什么(TL;DR)

一个在真实世界采集的超大机器人操作数据集:11 万多条接触丰富(要用力、要手感)的操作序列,覆盖约 150 种技能、多种机器人、多种视角,每条都同时录了画面、力觉、声音、动作四种信息,还配了对应的人类示范视频语言描述——目标是让机器人不只会推捡,而是学会切、插、倒、折这种需要视觉 + 触觉的复杂技能,并具备"看一次示范就会"的一次性模仿能力。

所以这一节是想说:这篇论文交出的是一个"多技能、多模态、含触觉、真实世界"的机器人操作大数据集。


这是个什么场景

人类学新技能常常"看一遍就会个大概":看别人切一次菜、插一次插头、倒一次水,自己就能上手。机器人研究也梦想这种能力——一次性模仿学习(one-shot imitation):给机器人看一段某任务的示范,它就能做这个新任务。加上现在"机器人基础模型"(像 GPT 那样在海量数据上预训练、然后泛化到各种任务的大模型)的兴起,大家更需要海量、多样的真实机器人数据来喂。

但现实很骨感:现在的机器人研究大多只演示最简单的活——推、捡、放(pick-and-place),而且只靠视觉。为什么?因为缺数据。真正复杂的技能(切、插、倒、折、拧)有两个额外难点:

  • 它们是"接触丰富(contact-rich)"的:需要力觉/触觉——切菜要感觉刀切到没切到,插插头要感觉对没对准。生理学也发现,人如果手指没了触觉,光靠眼睛很多日常操作都做不好。可现有数据集大多只有视觉、没有力觉
  • 采集这种数据极难:用 3D 鼠标、键盘、VR 手柄遥控机器人做精细接触操作,又不直观、又不精确、又危险(没有力反馈,一用力就可能撞坏)。

RH20T 要解决的就是:造一个又大、又多样、又带触觉/声音、还配人类示范和语言的真实数据集,把机器人从"只会推捡"推向"会做复杂接触操作"。

所以这一节是想说:目标是提供海量多样的真实"接触丰富"操作数据,让机器人学会需要手感的复杂技能并支持一次性模仿。


RH20T — 场景示意:这论文要解决的现实问题
Plate Nº IRH20T — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 只有视觉的数据集:大多数机器人操作数据只录画面,没有力觉。做不了"需要手感"的接触操作。
  • 任务太简单:多数集中在推、捡、放,缺乏切、插、倒、折这种复杂接触技能。
  • 遥操作接口难用:3D 鼠标/键盘/VR 手柄控制不直观、易漂移、无力反馈,采精细接触数据既慢又易出错、还危险。
  • 规模和多样性不足:机器人数据采集门槛高(配机器人平台、造环境、采轨迹都费劲),导致数据既少又单一。
  • 共同短板:缺一个"大规模 + 多技能 + 多模态(含力觉)+ 多机器人 + 配人类示范/语言"的真实数据集。

所以这一节是想说:以前的数据只有视觉、任务简单、采集难、规模小,撑不起复杂接触技能和基础模型。


这篇论文的关键想法

RH20T 的贡献是"把数据这件苦活做到极致",关键有三点:

第一,用带力反馈的触觉遥操作设备采集,从源头解决"接触操作难采"。 作者给机器人装了力-力矩传感器(force-torque sensor),并用一个带**力渲染(force rendering,把机器人感受到的力实时反馈到操作者手上)**的触觉设备(haptic device)来遥控。操作者能"感觉到"机器人碰到了什么、用了多大力——这让采集切、插、倒这种精细接触操作变得又准又高效又安全。

第二,采多模态 + 配人类示范 + 语言描述。 每条机器人序列同时录视觉、力觉、声音、本体感觉(proprioception,即机器人自己的关节/位姿状态);并为每条机器人序列录一段对应的人类示范视频,还写一句语言描述。这套"机器人多模态 + 人类示范 + 语言"的组合,专为一次性模仿和多模态学习设计。

第三,做大做杂。150 种技能(很多来自 RLBench、MetaWorld 或作者自提,且很多是接触丰富的),用多台常见机器人臂采集,多种环境、多种相机视角,最终得到 11 万多条机器人序列 + 11 万条人类示范视频,超过 4000 万帧机器人图像 + 1000 万帧人类示范。规模和多样性都拉满。

所以这一节是想说:核心是"力反馈遥操采接触数据 + 多模态/人类示范/语言 + 大规模多样",把机器人数据做全做大。


RH20T — 方法示意:核心 pipeline
Plate Nº IIRH20T — 方法示意:核心 pipeline

它分几步做的(方法)

RH20T 的"方法"就是这套数据采集与组织的工程。分四块:遥操作系统、多模态传感、任务与规模、数据组织与对齐。逐块按"输入 → 处理 → 输出"讲。

1. 力反馈遥操作系统:让人能"手把手"教机器人做接触活

输入。 操作者的手部动作 + 机器人碰到环境时产生的力。

处理。 机器人末端装力-力矩传感器感知接触力;操作者用一个带力渲染的触觉设备遥控——机器人感受到的力被实时"渲染"回操作者手上,形成力反馈闭环。这样操作者能感知"刀有没有切进去、插头有没有对准",做精细接触操作时又准又稳,还避免了无力反馈时一用力就撞坏的风险。

力-力矩传感器 / 触觉设备:前者测机器人受到的力和扭矩;后者是能把力"回放"给人手的操作杆,让人"隔空也有手感"。

输出。 高质量的接触丰富操作轨迹(人通过有手感的遥操作示范出来的)。

所以这一节是想说:力反馈遥操作是采集"接触丰富"数据的关键工具,让人能带着手感手把手教机器人。

2. 多模态传感:一次录齐画面、力、声、状态

输入。 一次操作过程中的各路传感器读数。

处理。 同步录制多种模态:视觉(多相机、多视角)、力觉/触觉(力-力矩)、音频(操作时的声音,比如切开、扣合的声响也含信息)、本体感觉(机器人自身位姿/关节)。多视角和多模态让数据能支撑各种下游学习方法。

输出。 每条序列都是"多模态对齐"的丰富记录,而不只是一段视频。

所以这一节是想说:一次采集就录齐视/力/声/状态四种模态,让数据能喂给多模态学习。

3. 任务与规模:约 150 技能、多机器人、11 万序列

输入。 一批精心选择的技能 + 多台机器人 + 多种环境。

处理。 收集约 150 种技能(含大量接触丰富的:切、插、倒、折、拧、剪等),部分选自 RLBench / MetaWorld、部分自提。用多台实验室常见机器人臂采集(不同机器人有助于泛化到其它机器人),跨多种环境和相机视角。最终得到约 11 万条机器人序列。

输出。 一个大规模、多技能、多机器人、多视角的操作数据集。

所以这一节是想说:约 150 技能 × 多机器人 × 多视角 × 11 万序列,把规模和多样性都做满。

4. 数据组织与对齐:机器人 + 人类示范 + 语言

输入。 机器人序列 + 对应人类示范 + 传感器标定。

处理。 为每条机器人序列配一段人类做同一任务的示范视频(支持"看人做→机器人学"的一次性模仿研究),并写一句语言描述(支持语言条件学习)。作者投入大量精力做传感器标定(相机、力觉等对齐),保证数据质量。

输出。 一个"机器人多模态 + 人类示范 + 语言"三位一体、且标定良好的高质量数据集。

下面用 ASCII 图把数据的组成画出来:

   一条 RH20T 序列 =
     ┌───────────── 机器人执行 ─────────────┐   ┌── 人类示范 ──┐   ┌─ 语言 ─┐
     视觉(多视角) + 力觉 + 音频 + 本体感觉         同任务示范视频      "把黄瓜切片"
     └──────────────────────────────────────┘   └──────────────┘   └────────┘

   采集方式: 力反馈触觉遥操作(操作者手上能感到机器人受的力)
   规模: ~150 技能 · 多机器人 · 多视角 · ~11万序列 · >4000万机器人帧 + >1000万人类帧

再用一张 ASCII 图对比"简单视觉数据 vs RH20T":

   旧数据:  [画面]                任务: pick / place (无手感)
   RH20T:   [画面+力+声+状态]     任务: 切/插/倒/折/拧 (要手感) + 人示范 + 语言

所以这一整节是想说:RH20T = 力反馈遥操 + 多模态传感 + 大规模多技能多机器人 + 机器人/人类/语言三位一体,把机器人操作数据做全做大。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【RH20T · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

关键数字(What works)

数字来自论文(arXiv:2307.00595);下游 benchmark 上的具体成功率属后续实验,标注"需读原文"。

项目 数值 说明
机器人操作序列 11 万+(约 110,000) 真实世界采集
人类示范视频 约 110,000 段 一一对应
技能数 约 150 种 大量接触丰富
机器人帧数 超过 4000 万帧 图像
人类示范帧数 超过 1000 万帧 图像
每条模态 视觉 + 力觉 + 音频 + 本体感觉 多模态
附加 语言描述 + 人类示范 支持一次性模仿/语言条件
采集方式 力反馈触觉遥操作 力-力矩传感 + 力渲染

三个要点:第一,11 万序列 + 4000 万帧这个规模,在真实机器人数据里非常可观(真机数据比仿真贵得多),是它成为重要数据基座的底气;第二,每条都带力觉是它区别于绝大多数"只有视觉"数据集的核心——这才让"需要手感"的接触技能有了训练素材;第三,机器人序列 + 人类示范 + 语言三位一体,专门为一次性模仿和多模态/语言条件学习铺路。

所以这一节是想说:真机大规模 + 全模态含力觉 + 人类示范/语言,是 RH20T 的三个硬核卖点。


实验结果说明了什么

RH20T 首先是一个数据集贡献,它"说明了什么"更多体现在它使能了什么:

  • 让接触丰富技能可学:因为提供了力觉/触觉数据,机器人第一次有素材去学"切、插、倒"这种靠手感的技能——填补了"只有视觉"数据的空白。
  • 支持一次性模仿研究:机器人序列配人类示范,让"看一次示范就学会"的研究有了大规模真实数据。
  • 支持基础模型/多模态学习:规模、多样性、多模态、语言描述,正是训练"机器人基础模型"所需要的原料。
  • 多机器人助泛化:用多台不同机器人采集,有助于研究跨机器人泛化(同一技能在不同机器人上都有数据)。
  • 具体在下游 benchmark 上的性能数字需读原文/后续工作。

所以这一节是想说:它的价值在"使能"——让接触技能、一次性模仿、多模态基础模型这些方向有了真实大数据。


你应该懂的几个新词

  • 模仿学习 / 一次性模仿(imitation / one-shot imitation):让机器人从示范里学;一次性即"看一次示范就会做新任务"。
  • 接触丰富(contact-rich):需要用力、有明显物理接触的操作,如切、插、倒,靠手感。
  • 力觉/触觉(force / tactile):机器人感知接触力的能力;力-力矩传感器负责测量。
  • 触觉遥操作 + 力渲染(haptic teleoperation + force rendering):人遥控机器人时,机器人受的力被实时反馈到人手,让人"有手感"地操作。
  • 本体感觉(proprioception):机器人对自身位姿/关节状态的感知。
  • 多模态(multimodal):同时含视觉、力、声、状态等多种信息。
  • 机器人基础模型(robot foundation model):在海量机器人数据上预训练、可泛化到多任务的大模型。
  • 传感器标定(calibration):让不同传感器的数据在时间和空间上对齐。

所以这一节是想说:接触丰富、力觉、触觉遥操作、一次性模仿是理解本篇的关键词。


它有什么搞不定的

  • 采集成本极高:真机 + 力反馈遥操作 + 多机器人 + 大规模,采集耗费巨大,难以被小团队复制或持续扩大。
  • 数据集不等于会做:有了数据不代表算法就能学会;如何用好力觉这类模态仍是开放问题。
  • 技能虽多但仍有边界:约 150 技能覆盖广,但离"任意家务"的长尾仍远,且多为相对短程的操作。
  • 标定与同步的工程负担:多模态多传感器的精确标定和同步很难,任何偏差都会污染数据质量。
  • 真实世界噪声:真机数据含各种现实噪声(磨损、光照、机器人个体差异),对算法鲁棒性提出高要求。

所以这一节是想说:它把数据做全做大,但采集成本、标定负担、技能边界,以及"数据≠能力"仍是现实约束。


它和别的几篇是什么关系

  • 同类真机数据集:Open X-Embodiment、DROID、BridgeData V2 是"真机操作数据"的代表;RH20T 的差异是强调力觉/触觉、配人类示范和语言
  • 仿真派对照:ManiSkill、RoboCasa、CALVIN 是"模拟器派"数据/benchmark;RH20T 是真机派,两者互补。
  • 技能来源:部分技能选自 RLBench、MetaWorld。
  • 下游用户:训练 VLA、机器人基础模型、一次性模仿、多模态(含触觉)策略的工作都可用它。
  • 同团队/领域:上海交大 Cewu Lu 组的一系列操作/抓取工作(GraspNet 等)是相关背景。

所以这一节是想说:RH20T 是真机操作数据这条线里"多模态含触觉 + 人类示范 + 语言"的代表,与仿真派互补。


和本导读的关系

本笔记对应导读 Ch21: 数据集与评测。Ch21 讲的是"机器人学习的数据从哪来、怎么评测",其中真机数据的规模与多样性是训练强策略的前提。RH20T 在这条线里代表"真机、多模态、含触觉"的数据基座——它提醒我们,除了视觉,力觉/触觉对"需要手感的操作"至关重要。读完本篇再看同章的 open-x-embodiment/droid/bridgedata-v2(真机数据)、maniskill/robocasa(仿真数据),能理解"真机 vs 仿真""视觉 vs 多模态"这两组数据取舍。

所以这一节是想说:把 RH20T 放进 Ch21,它代表"真机多模态含触觉"的数据供给,与仿真数据形成互补。


思考题

Q1:为什么"只有视觉的数据"学不了切菜、插插头这种技能?

提示

这些是接触丰富任务,靠手感(力觉)判断切没切进、对没对准。没有力觉数据,模型学不到这部分关键信息。想想没触觉的人做精细操作有多难。

Q2:力反馈遥操作相比 3D 鼠标/VR 手柄,为什么更适合采接触数据?

提示

操作者能感到机器人受的力,做精细接触更准、更稳、更安全(不会盲目用力撞坏)。想想"有手感"和"隔空盲操"的差别。

Q3:为什么要给每条机器人序列配一段人类示范视频?

提示

支持一次性模仿研究(看人做→机器人学),也提供跨形态学习的素材。想想"人示范"和"机器人执行"配对的价值。

Q4:真机数据比仿真贵得多,RH20T 为什么还坚持采真机?

提示

真机数据含真实的接触物理、噪声、力觉,仿真难以完全复现(尤其接触和触觉)。想想 sim-to-real gap。

Q5:用多台不同机器人采集,对研究有什么额外价值?

提示

同一技能在不同机器人上都有数据,能研究跨机器人泛化(cross-embodiment)。想想 Open X-Embodiment 的思路。

Q6:"有了大数据集不等于机器人就会做",你觉得瓶颈从数据转移到了哪里?

提示

转移到算法:如何有效利用多模态(尤其力觉)、如何从示范高效学习、如何泛化。想想数据和算法的分工。

Q7:音频也被录进来了,你能想到声音在操作里能提供什么信息吗?

提示

扣合的"咔哒"、切开的声响、倒水的声音都能指示"动作成没成"。想想声音作为接触事件的信号。


一些好奇心问答(FAQ)

Q:RH20T 里的 "20T" 是什么意思?

大致指数据规模量级(数据体量很大)。核心记住它是"真机、多模态、约 150 技能、11 万序列"的大数据集即可。

Q:它和 Open X-Embodiment 谁更好?

不是谁更好,而是互补。Open X-Embodiment 聚合了很多机构的多机器人数据;RH20T 的特色是自采、强调力觉/触觉、配人类示范和语言。

Q:我能直接拿它训一个 VLA 吗?

可以作为训练/预训练数据之一。它的多模态和语言描述特别适合多模态策略;具体用法看官方数据格式。

Q:为什么力觉这么重要,之前大家却忽略它?

因为采力觉数据难(需要力反馈遥操作设备),大多数团队图省事只录视觉。RH20T 正是补上了这块。

所以这一节是想说:把 RH20T 理解成"补上力觉这块短板的真机大数据集",定位就清楚了。


如果你想再深入

  1. 同类真机:Open X-Embodiment / DROID / BridgeData V2 — 理解真机数据这条线。
  2. 仿真对照:ManiSkill / RoboCasa — 理解仿真数据/benchmark 的取舍。
  3. 一次性模仿:One-Shot Imitation Learning 经典 — 理解"看一次就会"的目标。
  4. 触觉学习:Sparsh / 触觉相关工作 — 理解力觉/触觉如何被用于策略。
  5. 同章:Ch21 数据集综述 — 建立"真机 vs 仿真、视觉 vs 多模态"的全景。

所以这一节是想说:把 RH20T 与 Open X-Embodiment、ManiSkill、触觉工作一起读,能看清机器人数据的多个维度。


原文信息

  • 标题:RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot
  • 作者:Hao-Shu Fang, Hongjie Fang, Zhenyu Tang, Jirong Liu, Chenxi Wang, Junbo Wang, Haoyi Zhu, Cewu Lu
  • 发表:RSS 2023 Workshop(上海交通大学)
  • arXiv:https://arxiv.org/abs/2307.00595
@inproceedings{fang2023rh20t,
  title     = {RH20T: A Comprehensive Robotic Dataset for Learning Diverse Skills in One-Shot},
  author    = {Fang, Hao-Shu and Fang, Hongjie and Tang, Zhenyu and Liu, Jirong and Wang, Chenxi and Wang, Junbo and Zhu, Haoyi and Lu, Cewu},
  booktitle = {RSS Workshop},
  year      = {2023},
  url       = {https://arxiv.org/abs/2307.00595}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_rh20t_2026,
  title       = {(readable note) RH20T},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rh20t/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?