Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Datasets & Benchmarks · Plate Nº 33

What Matters in Learning from Offline Human Demonstrations for Robot Manipulation

15 min read · 5115 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语第一次出现一定配类比,公式翻译成人话。

一句话讲什么(TL;DR)

这篇论文不发明新算法,而是把"机器人看录像学操作"这件事里的每个变量——算法、数据质量、看什么、要不要记忆——挨个换一遍,然后老实告诉你:哪些真有用,哪些是白忙。它顺手还开源了一整套仿真环境、数据集和代码,成了后来所有操作模仿学习论文的"默认评测台"。

所以这一节是想说:RoboMimic 是一篇"把变量控制到极致、看清什么才真正 matter"的实证研究,外加一套人人能用的基础设施。


这是个什么场景

设想你要教一个新厨师做菜,但有个硬约束:只能让他看录像学,不能进厨房自己试。

这时候你会纠结一堆问题:

  • 录像得拍多清楚?只录手部特写(低维状态),还是整个厨房俯拍(图像)?
  • 找一个米其林大厨录 20 段,还是找 10 个不同水平的家厨各录两段?(质量 vs 多样性)
  • 新厨师要不要边看边记前几步做了什么?(要不要给他"记忆")
  • 用哪种学法——直接照抄动作,还是先理解"哪些动作不该做"?

这就是**离线模仿学习(offline imitation learning)**的现实:你手里只有一批预先录好的演示,机器人必须光看这批录像就学会干活,不能在真环境里边试边学。

模仿学习(imitation learning):让机器人观看人类演示,学着模仿的训练范式。最朴素的版本就是把"看到的画面"当输入、"人当时做的动作"当标准答案,做监督学习。

离线(offline):训练时只能用现成的固定数据,不能在环境里继续探索采新数据。和"在线(online)"相对。

机器人模仿学习圈以前的尴尬是:每家研究组自己挑环境、自己找演示、自己打分,最后都说"我家方法最好",彼此却没法比。RoboMimic 干的事,就是把厨房(仿真环境)、师傅(演示数据)、评分(成功率协议)全部标准化,然后一次只换一个变量,看到底哪几件事真的决定新厨师能不能学会。

所以这一节是想说:RoboMimic 面对的是"操作模仿学习结果彼此不可比、大家不知道该优化什么"的乱局。


What Matters in Learning from Offline Human Demonstrations for Robot Manipulation — 场景示意:这论文要解决的现实问题
Plate Nº IWhat Matters in Learning from Offline Human Demonstrations for Robot Manipulation — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 各家自己造数据、自己定任务:结果互相不可比(fragmented benchmarks),一篇论文说自己 SOTA,换个环境可能就垮。
  • 算法五花八门却没在同一台秤上称过:常见三类——行为克隆 BC(把画面-动作当监督学习)、BC-RNN(带时序记忆的 BC)、离线强化学习 BCQ/CQL(从离线数据里学一个"哪些动作值钱"的价值函数)。谁强谁弱,此前没有公平对照。
  • 演示数据来源混乱:有的来自专家遥操作,有的来自脚本策略,有的多人混合,质量参差却被混为一谈。
  • 评估不严谨:跑几十次取均值、随机种子敏感、方差大,换个种子结论可能翻转,难复现。
  • 观测空间一般固定:要么纯图像、要么纯本体感知,很少有人系统比较"到底该给策略喂什么"。

所以这一节是想说:以前的操作模仿学习既缺公平的对照,也缺对"数据和输入"这些非算法变量的系统研究——RoboMimic 就是来补这个洞的。


这篇论文的新想法

核心命题:在离线模仿学习里,"用什么算法"远不是唯一变量;数据本身的性质(多样性、是否多人混合、是否含次优轨迹)和策略的输入(图像 vs 低维状态、要不要历史记忆)往往比换算法的影响更大。

所以这篇论文不发明新算法,而是搭一个控制变量的实验台

  • 固定一组任务(从简单的 lift 抬物体,到需要多步的 NutAssemblySquare 拧螺母)。
  • 固定一组数据集(三档质量:熟练单人、多人混合、机器生成)。
  • 系统替换:算法 × 观测模态 × 历史长度 × 演示数量 × 数据混合比例。
  • 用统一的成功率 + 多随机种子报告结果。

输出是一份"什么真的 matter"的经验表,外加一个别人能接着做的开源代码库 + 数据集。

所以这一节是想说:RoboMimic 的新意不是新模型,而是"用严格的控制变量实验,把领域里的直觉变成可验证的结论"。


它分几步做的(方法)

这篇的"方法"其实是"实验设计",是全文最有含金量的部分。它把四个维度独立开来,让你能看清每个变量单独的贡献。

整体结构的 ASCII 示意:

       ┌── 任务阶梯: lift → can → square → transport → tool-hang(最难)
       │
实验台 ├── 数据三档: PH(专家单人) / MH(多人混合) / MG(机器生成次优)
       │
       ├── 算法组:   BC / BC-RNN / HBC / IRIS / BCQ / CQL
       │
       └── 观测:     低维状态 vs 图像 ;带历史 vs 不带历史

第 1 步:任务与仿真环境——搭一个难度阶梯

输入:需要一组从简单到困难、能拉开算法差距的操作任务。

处理:底层用 robosuite(基于 MuJoCo 物理引擎的机械臂仿真),定义 lift(抬起方块)、can(把罐子放进指定格)、square(把方形螺母套上柱子)、transport(双臂搬运)、tool-hang(把工具挂上支架,最难)等一组任务,再加一个真机 NutAssembly 子集。

输出:一个难度阶梯。好处是——所有算法在简单任务上都能做到接近满分,只有到难任务才拉开差距,这样你才看得清谁真强。

第 2 步:数据来源分三档——测算法对数据质量的鲁棒性

输入:需要覆盖"从好到差"的演示数据。

处理:分三档采集——

  • PH(Proficient-Human,熟练单人):一个熟练操作员遥操作出的高质量演示。
  • MH(Multi-Human,多人混合):多个不同水平操作员的混合演示,反映真实标注场景。
  • MG(Machine-Generated,机器生成):用一个预训练 RL 策略生成的次优数据。

输出:三档分别测,就能看出"算法在数据变脏时掉多少"。

遥操作(teleoperation):人通过操纵杆、VR 手柄等设备远程控制机械臂,把人的动作录成演示数据。是采集高质量操作演示的主流方式。

等等,先慢一拍——为什么"多人混合"数据反而更难学?

直觉上,多人数据更多样,应该更好才对。但这里有个坑:同一个任务,不同人有不同的做法——A 从左边绕,B 从右边绕,都对。这叫多模态(multi-modal):同一个画面对应多个都合理的动作。

如果你用最朴素的均方误差(MSE)去拟合,模型会把"从左绕"和"从右绕"平均成"直直撞上去"——一个谁也不像的四不像动作。所以多人混合数据里的多模态,恰恰是模仿学习的老大难。这个观察后来被 Diffusion Policy、VQ-BeT 等一票工作反复引用。

第 3 步:算法对照组——统一秤上称重

输入:一批代表性算法。

处理:覆盖 BC、BC-RNN(加 LSTM 记忆)、HBC(分层 BC)、IRIS(潜变量 + 目标条件)、BCQ、CQL(两种离线 RL)。关键是统一超参搜索网格 + 统一评估协议:每个 checkpoint 跑固定次数 rollout(试跑),多个随机种子取统计。

输出:一张终于"可比"的成绩单。这一步看起来是工程活,但前人做不出可比结论,恰恰栽在这里。

BC-RNN:在行为克隆里塞一个循环网络(RNN),让策略能记住前几步看到什么。处理"部分可观测"和"长程任务"的标配。

离线 RL(BCQ / CQL):从离线数据里学一个价值函数,理论上能利用次优数据里"哪些动作不该选"的信息,而不只是照抄。

第 4 步:观测变量——回答"该给策略喂什么"

输入:同一个算法。

处理:分别喂两种输入——"低维状态向量"(物体位姿 + 机器人本体感知)和"图像 + 本体";再叠加"要不要给一段历史窗口"。

输出:能回答"图像策略是不是普遍更弱""记忆是不是必需"这些一直在争的问题。

所以这一节是想说:RoboMimic 的方法就是把"任务难度、数据质量、算法、观测输入"四个维度拆开、各自单独变化,从而第一次把这些变量的贡献分离量化。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【What Matters in Learning from Offli… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

What Matters in Learning from Offline Human Demonstrations for Robot Manipulation — 方法示意:核心 pipeline
Plate Nº IIWhat Matters in Learning from Offline Human Demonstrations for Robot Manipulation — 方法示意:核心 pipeline

关键数字(What works)

RoboMimic 的核心产出是"定性结论"而非某个 SOTA 数字。下表把论文最重要的几条经验结论整理出来;具体每个任务的精确百分比请查原文的大表,此处不编造。

研究的变量 主要结论
算法之间的差距 在干净 PH 数据上 BC-RNN 已经很强;离线 RL(BCQ/CQL)没有显著超越 BC,某些任务甚至更差
观测模态 图像策略普遍比低维状态难训,但演示够多 + 加历史后可接近低维水平
数据质量 vs 数量 高质量少量演示 > 低质量大量演示;多人混合数据比单人专家更难学
记忆(历史) BC-RNN 在长程任务上明显优于无记忆 BC
最难任务 tool-hang 这类长程任务所有方法成功率都很低,是后续工作的发力点

有一个反直觉的结论值得单独强调:在 NLP/游戏里"离线 RL 通常打得过纯模仿"的经验,在机器人操作上不成立——干净演示下,朴素的 BC-RNN 反而更稳。这直接改变了很多人"应该重点优化什么"的判断。

所以这一节是想说:数字告诉我们,决定成败的常常是"数据干不干净、要不要记忆、喂什么输入",而不是"用了多高级的算法"。


实验结果说明了什么

把上面的结论串起来,RoboMimic 给整个领域立了几根桩:

  1. 别迷信离线 RL:在有干净人类演示的操作任务上,简单的 BC-RNN 是极强的基线,先把它调好再谈复杂算法。
  2. 数据质量比数量金贵:与其堆一堆次优演示,不如少量高质量演示。
  3. 记忆很重要:长程任务几乎都需要时序记忆,无记忆 BC 会吃亏。
  4. 多模态是天花板:多人混合数据学不好,暴露了 MSE 回归的根本缺陷——这正是后来 Diffusion Policy 和 VQ-BeT 存在的理由。
  5. 难任务还没解决:tool-hang 这种长程任务成功率普遍很低,指明了后续研究方向。

所以这一节是想说:这些实验共同给出了一张"当前能做什么、卡在哪"的地图,后来两三年的操作学习工作基本都在这张地图上找路。


你应该懂的几个新词

  • 离线模仿学习(offline imitation learning):只用预收集的演示训练,不能在环境里继续探索。
  • 行为克隆(BC):最朴素的模仿——把(观测, 动作)当(X, y)做监督学习。
  • BC-RNN:BC 加循环网络记忆,处理部分可观测和长程任务的标配。
  • 离线 RL(BCQ / CQL):从离线数据学价值函数,理论上能利用次优数据里的负面信息。
  • 分布偏移(distribution shift):策略一旦偏离演示分布,下一步观测就更不像训练分布,错误滚雪球。模仿学习的根本痛点。
  • 多模态行为(multi-modal behavior):同一状态有多个都合理的动作,直接用 MSE 拟合会被"平均"成四不像。
  • rollout:让策略在环境里实际跑一遍看它成不成功,是评估成功率的基本操作。

所以这一节是想说:这几个词是"操作模仿学习"这条线的通用语,看 Diffusion Policy、VQ-BeT、ACT 时会反复出现。


它有什么搞不定的

  • 只在仿真 + 少量真机上验证:结论主要来自 robosuite 仿真,真机结论有限,sim-to-real 的差异没完全覆盖。
  • 不解决多模态本身:它揭示了 MSE 学不好多人数据这个问题,但没给解法——解法要等 Diffusion Policy、VQ-BeT。
  • 长程任务仍是短板:tool-hang 这类任务它自己也做不好,只是把问题摆出来。
  • 算法覆盖有时间局限:2021 年的对照组不含后来的扩散策略、Transformer 大策略,今天读要意识到这是"那个时间点的快照"。
  • 结论依赖它的任务集:换一批任务分布,某些结论(比如离线 RL 不如 BC)不保证仍然成立。

所以这一节是想说:RoboMimic 强在"把问题看清楚",但它本身不提供解决多模态和长程任务的新武器。


它和别的几篇是什么关系

  • 数据集/平台:基于 robosuite(同组工作),后来扩展成 RoboCasa、MimicGen 系列。
  • 承上:把 BC、BCQ、CQL、IRIS 等已有方法搬到统一基准对照,类似"操作版的 D4RL"。
  • 启下
    • Diffusion Policy 直接用 RoboMimic 的任务 + 数据做评测,结论是"BC-RNN 的多模态拟合不够,扩散可以补上"。
    • VQ-BeT 也以 RoboMimic 为标准跑分台,专门攻多模态。
    • ACT / ALOHA 解决长程任务用的"动作分块",某种程度是对 RoboMimic 失败案例的回应。
  • 同期对手路线:BridgeData、RT-1、Open-X-Embodiment 走"加大数据"的路,RoboMimic 走"控制变量看清楚"的路,二者互补。

所以这一节是想说:RoboMimic 是操作模仿学习的"体检报告",后来的 Diffusion Policy / VQ-BeT / ACT 都是针对它查出的病灶开的药。


和本导读的关系

本篇对应导读 Ch14: 模仿学习。Ch14 的核心论点之一是:模仿学习的成败越来越取决于数据的质量、规模、一致性和输入设计,而不只是算法本身。RoboMimic 正是这个论点的实证支柱——它用严格实验证明了"数据比算法更 matter""多模态是天花板""记忆很关键"。读完本篇,再回看同章的 diffusion-policy(解多模态)、act-aloha(解长程)、vq-bet(另一条多模态解法),你会发现它们都在回答 RoboMimic 提出的问题。

所以这一节是想说:把 RoboMimic 当成 Ch14 的"问题清单",后面的方法论文都是对这份清单的作答。


思考题

Q1:为什么在干净的人类演示上,离线 RL(BCQ/CQL)没有打过朴素的 BC-RNN?这和游戏/NLP 领域的经验为什么不同?

提示

离线 RL 的优势在于能利用"次优数据里的负面信息"。但当演示本身就很好(PH 数据),几乎没有"坏动作"可供学习,离线 RL 的价值函数估计反而引入额外误差和不稳定。数据越干净,模仿越占优。

Q2:多人混合数据(MH)比单人专家数据(PH)更难学,根本原因是什么?用一句话解释给外行听。

提示

不同人做同一件事有不同做法(多模态)。用 MSE 拟合会把这些做法平均成一个谁也不像的动作。数据"更多样"反而让"平均"这件事错得更离谱。

Q3:如果你要在自己的机械臂上做操作模仿学习,RoboMimic 的结论建议你优先在哪些方面投入?

提示

优先保证演示数据干净、一致(宁可少而精);给策略加时序记忆(BC-RNN 起步);先把 BC-RNN 这个强基线调好再谈高级算法。别一上来就堆离线 RL。

Q4:图像策略比低维状态策略更难训,可能有哪些原因?加历史窗口为什么能缩小差距?

提示

图像维度高、含无关信息多、需要从像素里自己"悟"出物体状态。历史窗口提供了时间上下文,帮策略推断被遮挡或瞬时不可见的状态信息,部分弥补了单帧图像的不足。

Q5:为什么统一的评估协议(多 seed、固定 rollout 次数)对"结论可比"这么关键?

提示

模仿学习成功率方差大,单次或单种子跑出来的数字可能纯靠运气。不统一评估,A 论文和 B 论文的数字根本不在一个尺度上,"谁更好"就无从谈起。

Q6:tool-hang 这种长程任务所有方法都做不好,你觉得后续工作从哪个方向突破最有希望?

提示

长程任务的两大痛点是"误差累积"和"多模态"。动作分块(ACT)缓解累积,扩散/离散 latent(Diffusion Policy / VQ-BeT)缓解多模态。历史事实证明这两条线都有效。

所以这一节是想说:这几个问题带你把"数据 vs 算法、多模态、记忆、评估严谨性"这些核心权衡自己推一遍。


一些好奇心问答(FAQ)

Q1:RoboMimic 是一个算法还是一个数据集?

都不是"单一"的。它是一篇实证研究论文 + 一套开源基础设施(仿真任务 + 三档数据集 + 多算法实现 + 统一评估)。今天人们说"在 robomimic 上跑分",指的就是用它这套标准环境和数据。

Q2:我想入门操作模仿学习,从这里开始合适吗?

非常合适。它的代码库 + 数据 + 权重全开源,门槛低。从 fork 这个 repo、跑通 BC-RNN 基线开始,比从零搭快得多。

Q3:既然离线 RL 没赢,那它是不是没用了?

不是。结论是"在有干净人类演示的操作任务上"离线 RL 没优势。在演示很差、或没有演示只有次优交互数据的场景,离线 RL 依然有它的位置。要看数据长什么样。

Q4:为什么它选 robosuite/MuJoCo 而不是真机做主战场?

真机实验昂贵、慢、难复现,无法支撑"控制变量把所有组合跑一遍"的规模。仿真让它能系统扫描几十上百种配置组合。代价是结论要谨慎迁移到真机。

Q5:这篇 2021 年的论文今天还值得读吗?

值得。它揭示的"数据 > 算法""多模态是天花板""记忆很关键"这些结论,是理解 2022-2025 年所有主流操作学习工作的前提。你可以把它当"为什么后来会有 Diffusion Policy"的答案书。

所以这一节是想说:实操问题(是什么、怎么上手、结论还成不成立)作者和社区都有答案,这篇的复现门槛在整个领域里算最低的。


如果你想再深入

按"基础设施 → 问题的解法 → 对照路线"排序:

  1. 基础设施:robosuite —— RoboMimic 的仿真底座,想自己加任务就得懂它。
  2. 解法一:Diffusion Policy —— 针对 RoboMimic 揭示的"多模态学不好"给出的经典解法。
  3. 解法二:VQ-BeT —— 另一条多模态解法,用离散 latent + 单步推理,和扩散形成对照。
  4. 解法三:ACT / ALOHA —— 用动作分块攻长程任务,回应 tool-hang 的失败。
  5. 对照路线:Open-X-Embodiment / RT-1 —— "加大数据"这条路,和 RoboMimic 的"控制变量"路互补。

所以这一节是想说:把 RoboMimic + Diffusion Policy + VQ-BeT + ACT 连起来读,就能看懂"操作模仿学习的问题与解法"这条完整线。


原文信息

  • 标题:What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  • arXiv:https://arxiv.org/abs/2108.03298
  • 会议:CoRL 2021
  • 年份:2021
  • 项目主页:robomimic.github.io

BibTeX:

@inproceedings{mandlekar2021matters,
  title     = {What Matters in Learning from Offline Human Demonstrations for Robot Manipulation},
  author    = {Mandlekar, Ajay and Xu, Danfei and Wong, Josiah and others},
  booktitle = {Conference on Robot Learning (CoRL)},
  year      = {2021},
  url       = {https://arxiv.org/abs/2108.03298}
}

所以整篇是想说:RoboMimic 不发明新算法,却用一场严谨到极致的控制变量实验,为整个操作模仿学习领域画好了地图——它告诉你哪里是坦途、哪里是天花板,也交给你一套人人能用的铲子。

引用本笔记 / Cite this note
BibTeX
@online{eai_robomimic_2026,
  title       = {(readable note) What Matters in Learning from Offline Human Demonstrations for Robot Manipulation},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2021 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/robomimic/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?