Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 59

Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)

16 min read · 5519 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

让人形机器人用"自己眼睛"的视角看世界(而不是死记房间地图),换间屋子也照样干活,不用重学。

所以这一节是想说:iDP3 靠"换一个坐标系"这个看似简单的改动,让小数据学到的策略能跨场景使用。


这是个什么场景

想一下你在新同事家做客,他让你"去厨房拿瓶水"。

  • 笨办法:他告诉你"从大门进来往北走 4 米,左转 2 米,那个柜子第三格"。下次换他朋友家,这套话直接作废。
  • 聪明办法:他说"你低头看见的那个台面右边就是冰箱"。换谁家都成立——只要冰箱还在你眼前。

机器人现在面临同样的事。家用人形机器人不可能每搬一次家就让你重新教一遍"杯子放在房间东北角"。可原版 3D Diffusion Policy(DP3)干的就是笨办法:它记的是世界系坐标——"在这个房间里,点云长这样、机械臂要伸到这个绝对位置"。换个房间,点云的绝对坐标全变了,策略当场懵。

iDP3 改成聪明办法:点云全部表达在机器人自己头部相机的视角下(叫 自我中心坐标,egocentric)。世界变了,但"我面前 30 厘米有个杯子"这句话的说法没变,策略还能认。

坐标系(coordinate frame):描述"位置从哪算起"的参照系。世界系以房间某个固定点为原点;自我中心系以机器人自己(头/相机)为原点,跟着机器人走。

所以这一节是想说:场景是"人形机器人换场景还要能干活",iDP3 用自我中心坐标解决"换房间就失效"的老问题。


Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3) — 场景示意:这论文要解决的现实问题
Plate Nº IGeneralizable Humanoid Manipulation with 3D Diffusion Policies (iDP3) — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 2D 模仿学习(Diffusion Policy / ACT / Mobile ALOHA):用 RGB 图像 + 扩散/Transformer 拟合人类示范。数据好采(摄像头便宜),但对 3D 几何不敏感、距离感差、跨视角脆弱。
  • 3D Diffusion Policy(DP3,原版):把 RGB-D 转成点云,用稀疏点云编码器 + 扩散策略。仿真和单工作台真机上显著好于 2D,但点云用世界系/工作台系坐标,默认你不换桌子
  • 大规模 VLA 模型(RT-2 / OpenVLA):靠堆数据和大模型获得泛化,但对人形(移动 + 双臂 + 高自由度)这种数据稀缺场景,性价比未必高。
  • 传统 SLAM + 运动规划:先建图再规划,鲁棒但对柔性/接触丰富的操作(叠衣、倒水)很笨拙。
  • Sim-to-real:仿真训、真机迁,但对接触动力学复杂的人形操作,sim2real gap 还是大坑。

iDP3 想问的问题:能不能不堆数据、不靠仿真,只通过改变"输入怎么表达",就让小数据真机模仿学习到的策略跨场景用?

所以这一节是想说:以前要么数据贵、要么坐标系写死、要么靠大模型堆数据,iDP3 想用最省的"改输入表示"来换泛化。


这篇论文的新想法

核心一句话:坐标系选错了,泛化就死了

具体三点:

  1. 从世界系换到自我中心系:像把"门牌号导航"换成"跟着我的视线走"。所有点云都表达在机器人头部相机坐标下,这样换房间、换桌高,策略看到的"输入分布"几乎不变。
  2. 改进的视觉编码器:原版 DP3 的稀疏点云编码器在真实人形采到的噪声点云上效果不好,iDP3 据公开资料换/改成更鲁棒的视觉表示(具体细节需读原文)。
  3. 更大的预测视野 + 更长的动作 chunk:人形操作动作链条长,短视野容易抖。具体数字需读原文。

落到工程上:人形机器人 → 头部 RGB-D → 自我中心点云 → 扩散策略 → 双臂动作序列

所以这一节是想说:新想法 = 把点云换成自我中心坐标 + 换更鲁棒的编码器 + 拉长动作视野,核心是"改表示"。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 输入侧:像戴 GoPro 拍 vlog

输入:人形机器人头部一个 RGB-D 相机(RealSense / ZED 这种)的实时画面——彩色 + 每个像素的深度。

处理:深度图反投影成点云后,关键的偷懒动作是:保留相机自己看到的视角,不去做坐标变换。听起来工程上就是"少做一步矩阵乘法",但意义巨大——策略从此不再需要知道"我现在在客厅还是厨房"。

输出:一团表达在头部相机坐标系下的自我中心点云。

等等,先慢一拍——点云是什么?想象你拿激光笔扫房间,每扫到一个表面就记一个 (x, y, z) 点,最后得到一团飘在空中的小点儿,那就是点云。RGB-D 相机相当于一次性扫几万个点。

2. 表征侧:像翻译把外语压成意思

输入:自我中心点云。

处理:点云经过一个视觉编码器变成一组潜在向量(latent token,可理解成"把这堆乱点压缩出的语义摘要")。原版 DP3 用稀疏 3D 卷积,但真机点云有噪声、有遮挡、还稀疏,原编码器扛不住,iDP3 换/改了编码器(具体架构需读原文)。

输出:一组稳定的场景语义特征。

这一步如果输出抖,下游策略会被带偏,所以编码器的鲁棒性是真机能不能跑起来的关键。

3. 策略侧:像厨师按菜谱出连贯动作

输入:上一步的场景特征 + 机器人当前的本体状态(proprioception,各关节当前角度)。

处理:沿用 Diffusion Policy 的套路——把这些一起喂给一个扩散模型,让它一次性"画"出未来一小段连续动作(action chunk)。扩散模型的好处是同一场景下人类可能有好几种合理做法,它能同时容纳,不会硬选一个卡在中间。

输出:一段未来若干步的双臂动作序列。

本体感(proprioception):机器人对自己关节角度、速度、力的内部感知,作为策略的条件输入之一。

Action chunking(动作分块):策略一次输出未来 N 步动作,而不是只出下一步,减少高频抖动、提高时序一致性。

4. 训练 + 部署:像抄作业,但只抄几十份

输入:人类用遥操作(teleop,戴 VR/外骨骼远程操控机器人)录的示范,量级是几十到几百条轨迹(具体数字需读原文),属于典型"小数据"。

处理:用这些示范做模仿学习训练扩散策略。部署时换新场景不用再补采数据

输出:一个能跨场景直接用的人形操作策略——这就是论文最想卖的卖点。

遥操作(teleoperation):人通过外骨骼/VR/操纵杆控制机器人完成任务,同时记录"机器人看到什么 + 做了什么"作为训练数据。

ASCII 总览:

头部RGB-D ──►[反投影,保留相机视角]──► 自我中心点云
                                          │
                          [鲁棒点云编码器]──► 场景特征
                                          │
本体状态(关节角) ─────────────────────────┤
                                          ▼
                          [扩散策略]──► 双臂动作chunk
                                          │
   换房间/换桌高 ══► 输入分布几乎不变 ══► 策略照样能用

5. "自我中心 + 不做坐标变换"为什么是全篇的题眼

这个看似偷懒的决定,是 iDP3 能跨场景的真正原因,值得掰开讲。

输入:机器人头部相机拍到的深度画面。

处理:原版 DP3 这类方法通常会把点云从相机坐标系变换到一个固定的"世界坐标系"(比如以桌子某个角为原点)。这一步看着标准,却埋了个大雷:要做这个变换,你必须知道"机器人此刻在世界里的精确位置和朝向",也就是要标定、要定位。一旦机器人走到新房间、桌子高度变了、站的位置偏了,这个世界坐标系就对不上,策略输入的分布立刻漂移,策略就懵了。iDP3 反其道而行——干脆不变换,就用相机自己看到的视角(自我中心坐标系)。这样一来,不管机器人在客厅还是厨房,只要"手和物体相对于头部相机的几何关系"差不多,策略看到的输入分布就基本一致。它把"我在哪"这个最难保证的信息,从输入里彻底抹掉了。

输出:一个对"机器人身处何地"免疫的输入表示——这正是跨场景泛化的地基。

打个比方:与其每到一个新房间都重新量一遍"我离墙多远、朝哪个方向"(一步错步步错),不如永远只关心"我眼前这只手和这个杯子的相对位置",走到哪都成立。

6. 为什么坚持用 3D 点云而不是 2D 图像

输入:同一个头部相机(RGB-D)。

处理:2D 图像有两个跨场景的硬伤:一是没有真实的深度和尺度,同一个动作在不同距离/视角下像素上差别巨大;二是它把背景、光照、墙面颜色这些和任务无关的东西一股脑塞进输入,换个房间背景一变策略就容易被干扰。3D 点云直接给出物体的几何位置,几何是相对稳定、跨场景更通用的信息,背景杂讯也更容易被剔除。所以 iDP3 押注 3D。但 3D 也有代价——真机 RGB-D 点云又稀疏、又带噪声、还常被遮挡,远不如仿真里那么干净,这就把压力全压到了下一步的编码器上。

输出:一个几何上更稳、但对编码器鲁棒性要求更高的输入选择。

所以这一节是想说:3D 点云换来了跨场景更通用的几何表示,但真机点云的脏乱差把难题推给了编码器。

7. "Improved"到底改进了什么

输入:真机上又脏又稀的自我中心点云。

处理:iDP3 名字里的 "improved" 主要就体现在把原版 DP3 那套在仿真里好用、到真机就扛不住的表征管线做实。原版常用的稀疏 3D 卷积面对真机点云的噪声和稀疏时表现不稳。iDP3 对视觉编码器做了改造(具体架构以原文为准),核心目标是让特征在点云抖动、部分缺失时仍然稳定输出——因为一旦特征抖,扩散策略就会被带偏,动作跟着抖。除此之外还配套调整了点云的采样/规模、动作分块的长度等一系列让真机人形能真正跑起来的工程细节。可以说,iDP3 的贡献很大一部分是"把一个仿真里的好想法,工程上做到真机能用"。

输出:一套在真实、含噪点云上仍稳定的表征 + 策略管线。

8. 为什么几十条示范就能跨场景

输入:几十到几百条遥操作示范(典型小数据)。

处理:把前面几点串起来就是完整的因果链。因为输入用的是"自我中心 + 3D 几何"的表示,它对场景变化(位置、背景、桌高)天生不敏感——在模型眼里,不同房间里的"同一个操作"看起来就是同一件事。于是模型不需要为每个新场景各采一批数据去"见过"它,同一批小数据覆盖的有效情形被这种不变性放大了。这跟"堆大数据、堆大模型"是完全不同的省数据路线:别人靠见得多来泛化,iDP3 靠"让不同场景在输入端就长得一样"来泛化。对昂贵的人形遥操作数据来说,这个思路极其实用。

输出:一个用小数据训练、却能直接搬到新房间用的人形操作策略——这正是论文最想卖的点。换句话说,iDP3 把"泛化"这个难题的解法从"多采数据"挪到了"设计一个天生跨场景不变的输入表示"上,这对采集成本高得离谱的人形机器人尤其划算。

所以这一节是想说:头部相机出自我中心点云、坚持用 3D 几何、配一个抗噪的改进编码器、再接扩散策略和本体状态出动作;核心题眼是"不做坐标变换",它把"我在哪"从输入里抹掉,从而让几十条小数据也能跨场景直接用。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Generalizable Humanoid Manipulation… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3) — 方法示意:核心 pipeline
Plate Nº IIGeneralizable Humanoid Manipulation with 3D Diffusion Policies (iDP3) — 方法示意:核心 pipeline

关键数字(What works)

iDP3 是 RSS 2025 论文,成功率、演示条数、任务清单等精确数值需以原文为准,本笔记不编造。下表说明它"测什么、和谁比"。

关注点 对比对象 结果方向(原文为准) 具体数值
跨场景成功率 原版 DP3、2D 基线 iDP3 gap 更小、更能迁移 原文未在本笔记转录
训练数据量 大模型/大数据路线 几十到几百条(小数据) 具体需读原文
消融:自我中心 vs 世界系 —— 自我中心解释大部分提升 见原文消融
编码器/动作视野消融 —— 各有贡献 见原文

提醒:任何百分比与条数请以 arXiv 原文(2410.10803)为准。最该盯的两张图:跨场景成功率柱状图、自我中心 vs 世界系点云分布对比图。

所以这一节是想说:核心看"跨场景 gap 是否变小 + 是否主要由自我中心坐标带来",具体值回原文。


实验结果说明了什么

  • 坐标系选择是泛化的命门:消融显示"自我中心 vs 世界系"这一改动解释了大部分跨场景提升。这印证了"先想清楚输入怎么表达,再考虑模型多大"的思路。
  • 小数据也能跨场景:只用几十到几百条真机示范,配合正确的表示,就能在没见过的场景直接用——不必堆数据或靠仿真。
  • 编码器鲁棒性决定真机可用性:原版编码器在噪声点云上扛不住,换/改后才在真实人形上跑起来,说明"真机点云脏"是必须专门处理的现实问题。
  • 人形操作确实需要更长视野:动作链条长,拉长预测视野和动作 chunk 有助于减少抖动。

所以这一节是想说:实验证明"改坐标系 + 鲁棒编码器 + 长视野"三件事让小数据人形策略真正跨场景可用。


你应该懂的几个新词

自我中心坐标(egocentric coordinate frame):以观察者(机器人自己的头/相机)为原点的坐标系,换场景时跟着机器人走,所以"前方 30cm 的杯子"描述不变。对立概念是 allocentric / world frame(世界系)。

3D Diffusion Policy(DP3):iDP3 的前身,把扩散策略输入从 2D 图换成 3D 点云,对几何更敏感。

Action chunking(动作分块):一次输出未来 N 步动作,减少抖动、提高一致性。

遥操作(teleoperation):人远程操控机器人并记录数据,作为模仿学习来源。

本体感(proprioception):机器人对自身关节状态的内部感知。

Sim-to-real gap:仿真训练迁移真机时的性能下降。iDP3 选择"直接真机数据 + 不动仿真"来绕开它。

所以这一节是想说:抓住"自我中心坐标、DP3、动作分块、遥操作、本体感"这几个词,就抓住了 iDP3。


它有什么搞不定的

  • 只解决"几何视角"泛化:自我中心坐标应对换房间/换桌高很好,但对光照、纹理、物体类别的语义泛化不直接负责。
  • 依赖点云质量:头部相机的噪声、遮挡、稀疏仍会拖累,编码器再鲁棒也有极限。
  • 小数据的能力上限:几十条示范能跨场景,但任务复杂度和多样性受限,见得太少的技能仍学不会。
  • 人形硬件门槛高:需要真实人形机器人 + 头部 RGB-D + 遥操作设备,复现成本不低。
  • 长程任务仍需上层:iDP3 是"局部操作技能",长任务的拆解调度要靠更高层(如 LLM/VLA)。

所以这一节是想说:iDP3 主打几何视角泛化,但语义泛化、点云质量、小数据上限、硬件门槛仍是边界。


它和别的几篇是什么关系

  • 直接前作3D Diffusion Policy (DP3)(2024)。iDP3 = DP3 + 自我中心 + 真机人形 + 跨场景泛化。读 iDP3 前强烈建议先读 DP3。
  • 方法学祖师Diffusion Policy(Chi et al., 2023)。整个扩散策略范式的源头。
  • 同时期人形竞品:Mobile ALOHA(2D + 双臂 + 移动底盘)、HumanPlus(人形全身控制)。iDP3 的差异是 3D 输入 + 跨场景。
  • 泛化路线对比RT-2 / OpenVLA 走"大模型 + 大数据";iDP3 走"小数据 + 表示工程"。两条路都还活着。
  • 相关加速/几何线FlowPolicy(点云 + 一步推理)、EquiBot(点云 + 等变几何泛化)在同一表征家族里各有侧重。

所以这一节是想说:iDP3 是 DP3 家族里"主打自我中心跨场景泛化"的真机人形分支。


和本导读的关系

  • 主线章节:Ch14 模仿学习。iDP3 是小数据模仿学习 + 跨场景泛化的代表。
  • 扩散策略:Ch13 扩散策略。它的动作生成沿用扩散策略范式。
  • 泛化与部署:Ch17 Sim-to-Real。iDP3 用"直接真机 + 改表示"绕开 sim-to-real。

所以这一节是想说:iDP3 落在 Ch14(模仿学习)、Ch13(扩散策略)、Ch17(泛化)的交叉处。


思考题

Q1:为什么"换成自我中心坐标"能带来跨场景泛化?用一句话说清机制。

提示

因为在自我中心系下,"我面前有个杯子"的输入表示不随房间变化,策略看到的分布几乎不变,就不用重学。

Q2:原版 DP3 为什么换个房间就失效?

提示

它用世界系/工作台系坐标,换房间后点云的绝对坐标全变,策略见到的输入分布与训练时完全不同。

Q3:为什么真机点云需要"换/改编码器",而仿真点云可能不用?

提示

真机点云有噪声、遮挡、稀疏,原稀疏编码器扛不住;仿真点云更干净,问题不突出。

Q4:iDP3 走"小数据 + 表示工程",RT-2 走"大数据 + 大模型",各自适合什么情况?

提示

数据稀缺、硬件特殊(如人形)时表示工程性价比高;有海量数据和算力时大模型泛化更广。

Q5:自我中心坐标对"光照变化""换了完全不同的杯子"这类泛化有帮助吗?

提示

基本没有。它只解决几何视角问题,语义/外观泛化要靠别的手段(数据多样性、更强视觉先验)。

Q6:为什么人形操作要用更长的动作 chunk 和预测视野?

提示

人形动作链条长、自由度高,短视野下高频决策容易抖,拉长能提高时序一致性和稳定性。

Q7:如果把 iDP3 当作"低层技能",上面接一个 LLM 调度,会带来什么?

提示

LLM 负责长任务拆解和调度,iDP3 负责执行局部操作,形成"高层规划 + 低层技能"的分层系统。

所以这一节是想说:想清楚这些题,你就理解了"坐标系为何决定泛化""真机点云的现实困难""两条泛化路线的取舍"这几件核心事。


一些好奇心问答(FAQ)

Q:iDP3 是开源的吗?

它有项目主页和代码发布。具体开放程度需查官方。

Q:它用什么人形机器人?

在真实人形机器人上验证,配头部 RGB-D 相机。具体型号需读原文。

Q:几十条示范真的够跨场景?

在"改对了输入表示"的前提下够——这正是论文核心主张。任务越复杂需要的示范越多。

Q:为什么不直接用大模型 VLA?

人形数据稀缺、硬件特殊,大模型路线性价比未必高;iDP3 证明小数据 + 表示工程在这种场景仍能打。

Q:它和 FlowPolicy 都用点云,区别是什么?

FlowPolicy 主打"一步推理加速",iDP3 主打"自我中心跨场景泛化",侧重不同但都属点云策略家族。

所以这一节是想说:iDP3 对资源有限的研究者友好,核心思想(改坐标系)简单却有效,适合建立"表示优先"的直觉。


如果你想再深入

  1. 前置:Diffusion Policy + DP3 —— 先懂扩散策略和点云输入,才看得出 iDP3 改了什么。
  2. 第一遍只读 abstract + intro + 跨场景图 —— 回答"自我中心带来多大泛化"。
  3. 第二遍读方法 —— 重点看编码器和点云预处理,这决定真机能不能跑。
  4. 第三遍看消融 —— 验证是不是"自我中心"这一改动解释了大部分提升。
  5. 横向:EquiBot / FlowPolicy —— 看同为点云策略的不同侧重(等变 / 加速)。

所以这一节是想说:先补 DP3,重点读跨场景实验和编码器细节,再横向对比同族点云策略。


原文信息

@inproceedings{ze2025idp3,
  title  = {Generalizable Humanoid Manipulation with Improved 3D Diffusion Policies},
  author = {Ze, Yanjie and others},
  booktitle = {Robotics: Science and Systems (RSS)},
  year   = {2025},
  note   = {arXiv:2410.10803}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_idp3_2026,
  title       = {(readable note) Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/idp3/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?