What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语第一次出现一定配类比,公式翻译成人话。
一句话讲什么(TL;DR)
这篇论文不发明新算法,而是把"机器人看录像学操作"这件事里的每个变量——算法、数据质量、看什么、要不要记忆——挨个换一遍,然后老实告诉你:哪些真有用,哪些是白忙。它顺手还开源了一整套仿真环境、数据集和代码,成了后来所有操作模仿学习论文的"默认评测台"。
所以这一节是想说:RoboMimic 是一篇"把变量控制到极致、看清什么才真正 matter"的实证研究,外加一套人人能用的基础设施。
这是个什么场景
设想你要教一个新厨师做菜,但有个硬约束:只能让他看录像学,不能进厨房自己试。
这时候你会纠结一堆问题:
- 录像得拍多清楚?只录手部特写(低维状态),还是整个厨房俯拍(图像)?
- 找一个米其林大厨录 20 段,还是找 10 个不同水平的家厨各录两段?(质量 vs 多样性)
- 新厨师要不要边看边记前几步做了什么?(要不要给他"记忆")
- 用哪种学法——直接照抄动作,还是先理解"哪些动作不该做"?
这就是**离线模仿学习(offline imitation learning)**的现实:你手里只有一批预先录好的演示,机器人必须光看这批录像就学会干活,不能在真环境里边试边学。
模仿学习(imitation learning):让机器人观看人类演示,学着模仿的训练范式。最朴素的版本就是把"看到的画面"当输入、"人当时做的动作"当标准答案,做监督学习。
离线(offline):训练时只能用现成的固定数据,不能在环境里继续探索采新数据。和"在线(online)"相对。
机器人模仿学习圈以前的尴尬是:每家研究组自己挑环境、自己找演示、自己打分,最后都说"我家方法最好",彼此却没法比。RoboMimic 干的事,就是把厨房(仿真环境)、师傅(演示数据)、评分(成功率协议)全部标准化,然后一次只换一个变量,看到底哪几件事真的决定新厨师能不能学会。
所以这一节是想说:RoboMimic 面对的是"操作模仿学习结果彼此不可比、大家不知道该优化什么"的乱局。

之前的人怎么做的,为什么不够好
- 各家自己造数据、自己定任务:结果互相不可比(fragmented benchmarks),一篇论文说自己 SOTA,换个环境可能就垮。
- 算法五花八门却没在同一台秤上称过:常见三类——行为克隆 BC(把画面-动作当监督学习)、BC-RNN(带时序记忆的 BC)、离线强化学习 BCQ/CQL(从离线数据里学一个"哪些动作值钱"的价值函数)。谁强谁弱,此前没有公平对照。
- 演示数据来源混乱:有的来自专家遥操作,有的来自脚本策略,有的多人混合,质量参差却被混为一谈。
- 评估不严谨:跑几十次取均值、随机种子敏感、方差大,换个种子结论可能翻转,难复现。
- 观测空间一般固定:要么纯图像、要么纯本体感知,很少有人系统比较"到底该给策略喂什么"。
所以这一节是想说:以前的操作模仿学习既缺公平的对照,也缺对"数据和输入"这些非算法变量的系统研究——RoboMimic 就是来补这个洞的。
这篇论文的新想法
核心命题:在离线模仿学习里,"用什么算法"远不是唯一变量;数据本身的性质(多样性、是否多人混合、是否含次优轨迹)和策略的输入(图像 vs 低维状态、要不要历史记忆)往往比换算法的影响更大。
所以这篇论文不发明新算法,而是搭一个控制变量的实验台:
- 固定一组任务(从简单的 lift 抬物体,到需要多步的 NutAssemblySquare 拧螺母)。
- 固定一组数据集(三档质量:熟练单人、多人混合、机器生成)。
- 系统替换:算法 × 观测模态 × 历史长度 × 演示数量 × 数据混合比例。
- 用统一的成功率 + 多随机种子报告结果。
输出是一份"什么真的 matter"的经验表,外加一个别人能接着做的开源代码库 + 数据集。
所以这一节是想说:RoboMimic 的新意不是新模型,而是"用严格的控制变量实验,把领域里的直觉变成可验证的结论"。
它分几步做的(方法)
这篇的"方法"其实是"实验设计",是全文最有含金量的部分。它把四个维度独立开来,让你能看清每个变量单独的贡献。
整体结构的 ASCII 示意:
┌── 任务阶梯: lift → can → square → transport → tool-hang(最难)
│
实验台 ├── 数据三档: PH(专家单人) / MH(多人混合) / MG(机器生成次优)
│
├── 算法组: BC / BC-RNN / HBC / IRIS / BCQ / CQL
│
└── 观测: 低维状态 vs 图像 ;带历史 vs 不带历史
第 1 步:任务与仿真环境——搭一个难度阶梯
输入:需要一组从简单到困难、能拉开算法差距的操作任务。
处理:底层用 robosuite(基于 MuJoCo 物理引擎的机械臂仿真),定义 lift(抬起方块)、can(把罐子放进指定格)、square(把方形螺母套上柱子)、transport(双臂搬运)、tool-hang(把工具挂上支架,最难)等一组任务,再加一个真机 NutAssembly 子集。
输出:一个难度阶梯。好处是——所有算法在简单任务上都能做到接近满分,只有到难任务才拉开差距,这样你才看得清谁真强。
第 2 步:数据来源分三档——测算法对数据质量的鲁棒性
输入:需要覆盖"从好到差"的演示数据。
处理:分三档采集——
- PH(Proficient-Human,熟练单人):一个熟练操作员遥操作出的高质量演示。
- MH(Multi-Human,多人混合):多个不同水平操作员的混合演示,反映真实标注场景。
- MG(Machine-Generated,机器生成):用一个预训练 RL 策略生成的次优数据。
输出:三档分别测,就能看出"算法在数据变脏时掉多少"。
遥操作(teleoperation):人通过操纵杆、VR 手柄等设备远程控制机械臂,把人的动作录成演示数据。是采集高质量操作演示的主流方式。
等等,先慢一拍——为什么"多人混合"数据反而更难学?
直觉上,多人数据更多样,应该更好才对。但这里有个坑:同一个任务,不同人有不同的做法——A 从左边绕,B 从右边绕,都对。这叫多模态(multi-modal):同一个画面对应多个都合理的动作。
如果你用最朴素的均方误差(MSE)去拟合,模型会把"从左绕"和"从右绕"平均成"直直撞上去"——一个谁也不像的四不像动作。所以多人混合数据里的多模态,恰恰是模仿学习的老大难。这个观察后来被 Diffusion Policy、VQ-BeT 等一票工作反复引用。
第 3 步:算法对照组——统一秤上称重
输入:一批代表性算法。
处理:覆盖 BC、BC-RNN(加 LSTM 记忆)、HBC(分层 BC)、IRIS(潜变量 + 目标条件)、BCQ、CQL(两种离线 RL)。关键是统一超参搜索网格 + 统一评估协议:每个 checkpoint 跑固定次数 rollout(试跑),多个随机种子取统计。
输出:一张终于"可比"的成绩单。这一步看起来是工程活,但前人做不出可比结论,恰恰栽在这里。
BC-RNN:在行为克隆里塞一个循环网络(RNN),让策略能记住前几步看到什么。处理"部分可观测"和"长程任务"的标配。
离线 RL(BCQ / CQL):从离线数据里学一个价值函数,理论上能利用次优数据里"哪些动作不该选"的信息,而不只是照抄。
第 4 步:观测变量——回答"该给策略喂什么"
输入:同一个算法。
处理:分别喂两种输入——"低维状态向量"(物体位姿 + 机器人本体感知)和"图像 + 本体";再叠加"要不要给一段历史窗口"。
输出:能回答"图像策略是不是普遍更弱""记忆是不是必需"这些一直在争的问题。
所以这一节是想说:RoboMimic 的方法就是把"任务难度、数据质量、算法、观测输入"四个维度拆开、各自单独变化,从而第一次把这些变量的贡献分离量化。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【What Matters in Learning from Offli… · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
RoboMimic 的核心产出是"定性结论"而非某个 SOTA 数字。下表把论文最重要的几条经验结论整理出来;具体每个任务的精确百分比请查原文的大表,此处不编造。
| 研究的变量 | 主要结论 |
|---|---|
| 算法之间的差距 | 在干净 PH 数据上 BC-RNN 已经很强;离线 RL(BCQ/CQL)没有显著超越 BC,某些任务甚至更差 |
| 观测模态 | 图像策略普遍比低维状态难训,但演示够多 + 加历史后可接近低维水平 |
| 数据质量 vs 数量 | 高质量少量演示 > 低质量大量演示;多人混合数据比单人专家更难学 |
| 记忆(历史) | BC-RNN 在长程任务上明显优于无记忆 BC |
| 最难任务 | tool-hang 这类长程任务所有方法成功率都很低,是后续工作的发力点 |
有一个反直觉的结论值得单独强调:在 NLP/游戏里"离线 RL 通常打得过纯模仿"的经验,在机器人操作上不成立——干净演示下,朴素的 BC-RNN 反而更稳。这直接改变了很多人"应该重点优化什么"的判断。
所以这一节是想说:数字告诉我们,决定成败的常常是"数据干不干净、要不要记忆、喂什么输入",而不是"用了多高级的算法"。
实验结果说明了什么
把上面的结论串起来,RoboMimic 给整个领域立了几根桩:
- 别迷信离线 RL:在有干净人类演示的操作任务上,简单的 BC-RNN 是极强的基线,先把它调好再谈复杂算法。
- 数据质量比数量金贵:与其堆一堆次优演示,不如少量高质量演示。
- 记忆很重要:长程任务几乎都需要时序记忆,无记忆 BC 会吃亏。
- 多模态是天花板:多人混合数据学不好,暴露了 MSE 回归的根本缺陷——这正是后来 Diffusion Policy 和 VQ-BeT 存在的理由。
- 难任务还没解决:tool-hang 这种长程任务成功率普遍很低,指明了后续研究方向。
所以这一节是想说:这些实验共同给出了一张"当前能做什么、卡在哪"的地图,后来两三年的操作学习工作基本都在这张地图上找路。
你应该懂的几个新词
- 离线模仿学习(offline imitation learning):只用预收集的演示训练,不能在环境里继续探索。
- 行为克隆(BC):最朴素的模仿——把(观测, 动作)当(X, y)做监督学习。
- BC-RNN:BC 加循环网络记忆,处理部分可观测和长程任务的标配。
- 离线 RL(BCQ / CQL):从离线数据学价值函数,理论上能利用次优数据里的负面信息。
- 分布偏移(distribution shift):策略一旦偏离演示分布,下一步观测就更不像训练分布,错误滚雪球。模仿学习的根本痛点。
- 多模态行为(multi-modal behavior):同一状态有多个都合理的动作,直接用 MSE 拟合会被"平均"成四不像。
- rollout:让策略在环境里实际跑一遍看它成不成功,是评估成功率的基本操作。
所以这一节是想说:这几个词是"操作模仿学习"这条线的通用语,看 Diffusion Policy、VQ-BeT、ACT 时会反复出现。
它有什么搞不定的
- 只在仿真 + 少量真机上验证:结论主要来自 robosuite 仿真,真机结论有限,sim-to-real 的差异没完全覆盖。
- 不解决多模态本身:它揭示了 MSE 学不好多人数据这个问题,但没给解法——解法要等 Diffusion Policy、VQ-BeT。
- 长程任务仍是短板:tool-hang 这类任务它自己也做不好,只是把问题摆出来。
- 算法覆盖有时间局限:2021 年的对照组不含后来的扩散策略、Transformer 大策略,今天读要意识到这是"那个时间点的快照"。
- 结论依赖它的任务集:换一批任务分布,某些结论(比如离线 RL 不如 BC)不保证仍然成立。
所以这一节是想说:RoboMimic 强在"把问题看清楚",但它本身不提供解决多模态和长程任务的新武器。
它和别的几篇是什么关系
- 数据集/平台:基于 robosuite(同组工作),后来扩展成 RoboCasa、MimicGen 系列。
- 承上:把 BC、BCQ、CQL、IRIS 等已有方法搬到统一基准对照,类似"操作版的 D4RL"。
- 启下:
- Diffusion Policy 直接用 RoboMimic 的任务 + 数据做评测,结论是"BC-RNN 的多模态拟合不够,扩散可以补上"。
- VQ-BeT 也以 RoboMimic 为标准跑分台,专门攻多模态。
- ACT / ALOHA 解决长程任务用的"动作分块",某种程度是对 RoboMimic 失败案例的回应。
- 同期对手路线:BridgeData、RT-1、Open-X-Embodiment 走"加大数据"的路,RoboMimic 走"控制变量看清楚"的路,二者互补。
所以这一节是想说:RoboMimic 是操作模仿学习的"体检报告",后来的 Diffusion Policy / VQ-BeT / ACT 都是针对它查出的病灶开的药。
和本导读的关系
本篇对应导读 Ch14: 模仿学习。Ch14 的核心论点之一是:模仿学习的成败越来越取决于数据的质量、规模、一致性和输入设计,而不只是算法本身。RoboMimic 正是这个论点的实证支柱——它用严格实验证明了"数据比算法更 matter""多模态是天花板""记忆很关键"。读完本篇,再回看同章的 diffusion-policy(解多模态)、act-aloha(解长程)、vq-bet(另一条多模态解法),你会发现它们都在回答 RoboMimic 提出的问题。
所以这一节是想说:把 RoboMimic 当成 Ch14 的"问题清单",后面的方法论文都是对这份清单的作答。
思考题
Q1:为什么在干净的人类演示上,离线 RL(BCQ/CQL)没有打过朴素的 BC-RNN?这和游戏/NLP 领域的经验为什么不同?
提示
离线 RL 的优势在于能利用"次优数据里的负面信息"。但当演示本身就很好(PH 数据),几乎没有"坏动作"可供学习,离线 RL 的价值函数估计反而引入额外误差和不稳定。数据越干净,模仿越占优。
Q2:多人混合数据(MH)比单人专家数据(PH)更难学,根本原因是什么?用一句话解释给外行听。
提示
不同人做同一件事有不同做法(多模态)。用 MSE 拟合会把这些做法平均成一个谁也不像的动作。数据"更多样"反而让"平均"这件事错得更离谱。
Q3:如果你要在自己的机械臂上做操作模仿学习,RoboMimic 的结论建议你优先在哪些方面投入?
提示
优先保证演示数据干净、一致(宁可少而精);给策略加时序记忆(BC-RNN 起步);先把 BC-RNN 这个强基线调好再谈高级算法。别一上来就堆离线 RL。
Q4:图像策略比低维状态策略更难训,可能有哪些原因?加历史窗口为什么能缩小差距?
提示
图像维度高、含无关信息多、需要从像素里自己"悟"出物体状态。历史窗口提供了时间上下文,帮策略推断被遮挡或瞬时不可见的状态信息,部分弥补了单帧图像的不足。
Q5:为什么统一的评估协议(多 seed、固定 rollout 次数)对"结论可比"这么关键?
提示
模仿学习成功率方差大,单次或单种子跑出来的数字可能纯靠运气。不统一评估,A 论文和 B 论文的数字根本不在一个尺度上,"谁更好"就无从谈起。
Q6:tool-hang 这种长程任务所有方法都做不好,你觉得后续工作从哪个方向突破最有希望?
提示
长程任务的两大痛点是"误差累积"和"多模态"。动作分块(ACT)缓解累积,扩散/离散 latent(Diffusion Policy / VQ-BeT)缓解多模态。历史事实证明这两条线都有效。
所以这一节是想说:这几个问题带你把"数据 vs 算法、多模态、记忆、评估严谨性"这些核心权衡自己推一遍。
一些好奇心问答(FAQ)
Q1:RoboMimic 是一个算法还是一个数据集?
都不是"单一"的。它是一篇实证研究论文 + 一套开源基础设施(仿真任务 + 三档数据集 + 多算法实现 + 统一评估)。今天人们说"在 robomimic 上跑分",指的就是用它这套标准环境和数据。
Q2:我想入门操作模仿学习,从这里开始合适吗?
非常合适。它的代码库 + 数据 + 权重全开源,门槛低。从 fork 这个 repo、跑通 BC-RNN 基线开始,比从零搭快得多。
Q3:既然离线 RL 没赢,那它是不是没用了?
不是。结论是"在有干净人类演示的操作任务上"离线 RL 没优势。在演示很差、或没有演示只有次优交互数据的场景,离线 RL 依然有它的位置。要看数据长什么样。
Q4:为什么它选 robosuite/MuJoCo 而不是真机做主战场?
真机实验昂贵、慢、难复现,无法支撑"控制变量把所有组合跑一遍"的规模。仿真让它能系统扫描几十上百种配置组合。代价是结论要谨慎迁移到真机。
Q5:这篇 2021 年的论文今天还值得读吗?
值得。它揭示的"数据 > 算法""多模态是天花板""记忆很关键"这些结论,是理解 2022-2025 年所有主流操作学习工作的前提。你可以把它当"为什么后来会有 Diffusion Policy"的答案书。
所以这一节是想说:实操问题(是什么、怎么上手、结论还成不成立)作者和社区都有答案,这篇的复现门槛在整个领域里算最低的。
如果你想再深入
按"基础设施 → 问题的解法 → 对照路线"排序:
- 基础设施:robosuite —— RoboMimic 的仿真底座,想自己加任务就得懂它。
- 解法一:Diffusion Policy —— 针对 RoboMimic 揭示的"多模态学不好"给出的经典解法。
- 解法二:VQ-BeT —— 另一条多模态解法,用离散 latent + 单步推理,和扩散形成对照。
- 解法三:ACT / ALOHA —— 用动作分块攻长程任务,回应 tool-hang 的失败。
- 对照路线:Open-X-Embodiment / RT-1 —— "加大数据"这条路,和 RoboMimic 的"控制变量"路互补。
所以这一节是想说:把 RoboMimic + Diffusion Policy + VQ-BeT + ACT 连起来读,就能看懂"操作模仿学习的问题与解法"这条完整线。
原文信息
- 标题:What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- arXiv:https://arxiv.org/abs/2108.03298
- 会议:CoRL 2021
- 年份:2021
- 项目主页:robomimic.github.io
BibTeX:
@inproceedings{mandlekar2021matters,
title = {What Matters in Learning from Offline Human Demonstrations for Robot Manipulation},
author = {Mandlekar, Ajay and Xu, Danfei and Wong, Josiah and others},
booktitle = {Conference on Robot Learning (CoRL)},
year = {2021},
url = {https://arxiv.org/abs/2108.03298}
}
所以整篇是想说:RoboMimic 不发明新算法,却用一场严谨到极致的控制变量实验,为整个操作模仿学习领域画好了地图——它告诉你哪里是坦途、哪里是天花板,也交给你一套人人能用的铲子。
◼
引用本笔记 / Cite this note
@online{eai_robomimic_2026,
title = {(readable note) What Matters in Learning from Offline Human Demonstrations for Robot Manipulation},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2021 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/robomimic/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?