Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 41

EquiBot: SIM(3)-Equivariant Diffusion Policy

17 min read · 5939 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。每个术语第一次出现都会先用生活类比解释,公式一律翻译成人话。

一句话讲什么(TL;DR)

教机器人几次就够了。物体挪个位置、转个方向、换个大小都不用重学——因为"这件事和位置朝向大小无关"这个常识被直接焊进了网络结构里,而不是靠堆数据让它慢慢悟。

所以这一节是想说:EquiBot 用"结构对称性"换掉了"海量数据",让机器人少学几遍就能泛化。


这是个什么场景

想象你教刚上幼儿园的小孩"把杯子放到盘子上"。

  • 普通学法:你得在客厅、厨房、卧室各演一次,桌子高的矮的都要演,杯子转个角度又得演——演了两百次小孩还经常翻车。
  • 聪明学法:小孩看一次就会了。因为他知道"杯子放盘子上"这件事和杯子摆在哪、朝哪、是马克杯还是儿童小杯根本没关系——只要最后那个相对位置对了就行。

机器人的模仿学习长期是前者:换个位置、换个朝向、换个大小,就得重新喂数据。EquiBot 想做后者。

它用到一个数学名字:SIM(3)。这是数学家给"平移 + 旋转 + 等比缩放"这一整套变换起的名字。简单说:把整个场景挪一挪、转一转、放大缩小,但物体之间的相对关系不变。

群(group):数学里"一堆能组合起来的变换"的集合。SIM(3) 就是三维空间里"平移、旋转、缩放"这些变换合在一起的群。你不用记数学定义,记住"它描述的是一整类几何变形"就够。

所以这一节是想说:EquiBot 面对的场景是"同一个操作换了位置/朝向/大小",它希望机器人自动跟着变而不用重学。


EquiBot — 场景示意:这论文要解决的现实问题
Plate Nº IEquiBot — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Diffusion Policy(Chi et al., 2023):用扩散模型生成动作轨迹,效果好但对场景的位置/朝向/尺度敏感,要大量演示才能泛化。
  • 数据增强(data augmentation):把演示数据人工旋转、平移、缩放后再训练,靠"见得更多"换泛化。治标不治本,还让扩散策略训练成本翻倍。
  • SE(3) 等变策略(如 Equivariant Descriptor Fields, EDF):在抓取/放置上把三维旋转平移焊进网络,但只覆盖刚体位姿,不处理"尺度"这一维。
  • VN-DGCNN 等 SO(3) 等变骨干:等变特征提取器已经很成熟,但和扩散去噪器怎么对接、怎么处理时间序列动作,没人系统做过。

SE(3) vs SO(3) vs SIM(3):SO(3) 只有旋转;SE(3) = 旋转 + 平移;SIM(3) = 旋转 + 平移 + 等比缩放。EquiBot 覆盖的是最全的 SIM(3)。

所以这一节是想说:以前要么靠数据增强硬凑泛化,要么只覆盖了部分几何变换,没人把"完整几何对称性"和"扩散策略"干净地结合。


这篇论文的新想法

像装修一栋房子——骨架不动,只把两个核心房间换装。EquiBot 把 Diffusion Policy 里的两个关键模块——点云编码器动作去噪器——都换成 SIM(3) 等变版本,其他保持不变。

直觉上分两步:

  1. 观测端等变:场景点云经过等变编码器后,如果你把整个场景转 90°,编码出来的特征也会自动跟着转 90°——而不是变成一组毫不相关的数字。
  2. 动作端等变:去噪器输出动作(手去哪、朝哪、夹子开多大)时也守规矩——你转输入,它就转输出,转的角度还完全一致。

这样训练时只需少量演示。测试时把整个场景旋转 90°、平移 1 米、缩小一半,策略输出会自动跟着变,不用重训,也不用数据增强。

核心区别:等变是架构级硬约束(焊在结构里,物理上做不到违反),不是 loss 软约束(只是惩罚违反,还是可能违反)。一旦网络写对,泛化是"白送"的。

等变(equivariance):函数 f 满足"输入做变换 T,输出就用对应方式跟着变",写成 f(T·x) = T·f(x)。区别于"不变(invariance)"——不变是怎么变输出都一样。机器人手该去的位置,确实应该跟着场景一起转,所以要的是等变。

所以这一节是想说:EquiBot 只换掉两个模块,把"几何对称性"从数据里的软偏好升级成结构里的硬保证。


它分几步做的(方法)

这是全篇最核心部分。我们按"输入 → 编码 → 去噪 → 训练"四块讲,每块交代清楚"进什么、做什么、出什么"。

1. 输入表示:用点云而不是照片

输入:相机(RGB-D,即彩色 + 深度)扫出来的场景。

处理:不把画面当成 2D 照片,而是转成 3D 点云——一堆带 (x, y, z) 坐标的小点。机器人要输出的动作是末端执行器(机械臂最末端那只"手")的位置 + 朝向 + 夹子开合。

输出:一团 3D 点 + 一个动作表示。

为什么用点云?因为你转一下整个场景,所有点的坐标会"工工整整"地一起转,做几何变换比 2D 图像干净得多。2D 照片转一下,像素之间的关系会乱成一团。

点云(point cloud):一组三维坐标点 {(x, y, z)},相机或激光雷达直接输出的几何表示。你可以想成"用激光笔把房间表面扫一遍,每扫到一点记一个坐标"。

末端执行器(end-effector):机械臂最前端干活的部分,通常是夹爪。它的"位置 + 朝向 + 开合"就是机器人要输出的动作。

2. 等变编码器:让特征跟着场景一起转

输入:上一步的点云。

处理:好比一个忠实的翻译——你把原文倒过来念,他译文也倒过来念,一一对应。EquiBot 用 Vector Neuron(VN,向量神经元) 系列骨干来做这件事。

Vector Neuron(VN):普通神经元每个位置存一个数字(标量),VN 每个位置存一个 3D 向量(带方向)。这样输入点云一转,向量激活也跟着同步转——旋转等变就天然成立了。

再加一层尺度归一化,处理 SIM(3) 里"放大缩小"那一维(具体怎么把尺度从形状里解耦出来需读原文)。

输出:一组"会跟着场景转、跟着场景缩放"的等变特征。

等等,先慢一拍——"等变"再强调一次:f(转 90° 的杯子) = 转 90° 的 f(杯子)。EquiBot 要的就是这个,因为手该去的位置确实要跟着场景一起转。

3. 等变去噪器:连"擦噪声"也守规矩

输入:一个被加了噪声的候选动作 + 上一步的等变观测特征 + 去噪时间步。

处理:扩散策略的去噪器(denoiser)就像一个橡皮擦——你给它一个被涂花的动作,它一点点把噪声擦掉、还原出干净动作。原本这个橡皮擦是 1D 卷积或 Transformer。EquiBot 把它也换成等变版本:动作里的位置和旋转分量要和观测特征"对得上号"地融合,保证整个去噪过程满足 SIM(3) 等变。每一层怎么设计需读原文。

输出:预测出的噪声(或等价的干净动作方向),一步步把动作还原出来。

去噪器(denoiser):扩散模型的核心网络,输入"加了噪声的样本 + 时间步",预测"加了什么噪声",从而反推干净样本。

4. 训练目标:等变靠结构,不靠 loss

输入:少量专家演示(点云 + 对应动作)。

处理:用和标准 Diffusion Policy 一样的去噪损失(denoising score matching,让网络学会"这次加了什么噪声"),不加额外正则。

输出:一个训练好的、天生就等变的扩散策略。

核心姿态:等变性是靠网络结构本身保证的,不是靠 loss 惩罚出来的。这跟数据增强路线是根本区别——数据增强只是让模型"见过很多变换后的样子",EquiBot 是"物理上不可能不等变"。

一张 ASCII 图串起来:

场景 ──RGB-D──► 点云 ──► [VN 等变编码器 + 尺度归一化] ──► 等变特征
                                                            │
   加噪动作 ───────────────────────────────────────────────┤
                                                            ▼
                                            [等变去噪器] ──► 干净动作
                                                            │
   把整个场景 转/移/缩放  ═══► 输出动作 自动 转/移/缩放(白送的泛化)

5. SIM(3) 拆成四件事,每件单独收拾

SIM(3) 听起来吓人,其实就是"三维空间里不改变物体形状的四类变换":平移、旋转、镜像(论文主要处理平移+旋转+缩放,即相似变换)、以及整体放大缩小。EquiBot 的巧劲是把这四类分开、各用一招对付,而不是指望网络自己从数据里悟出来。

输入:一团原始点云,坐标系是相机随手定的,原点和尺度都很随意。

处理

  • 平移(translation):先把整团点云的重心算出来,再把所有点减去重心,等于把坐标原点搬到物体中心。这样"整体挪一段距离"这件事就被彻底消掉了——不管物体在桌上哪个位置,减完重心后长得一模一样。动作里的位置分量最后再把重心加回去。
  • 旋转(rotation):交给 Vector Neuron。因为 VN 里每个特征都是 3D 向量,输入一转,这些向量同步转,旋转等变是结构自带的,不用学。
  • 缩放(scale):把点云到重心的平均距离(或类似的尺度统计量)算出来,用它把整团点云归一化到"标准大小",动作的尺度相关分量也按同一个因子缩放,最后再乘回去。这样"整体放大两倍"也被解耦掉了。
  • 组合:四件事按"先去平移、再归一化尺度、再过等变旋转网络"的顺序串起来,任何一个 SIM(3) 变换作用在输入上,都能被拆成这几步各自吸收,最终输出动作会跟着做同一个变换。

输出:一套对"物体在哪、朝哪、多大"都免疫的表示,网络只需要专注学"这个形状该怎么操作"。

打个比方:这就像做菜前先把食材摆正、切成标准大小、朝向统一,厨师(网络)就只用记一套刀法,不用为"土豆歪着放/大一圈"各背一套。

6. 标量和向量两种特征怎么在一个网络里共处

输入:等变的 3D 向量特征。

处理:只有向量还不够——网络有时需要"和方向无关"的量(比如"两个点离多远""夹角多大"),这些叫不变量(invariant)。Vector Neuron 提供了一整套配件:

  • VN 线性层:对一堆 3D 向量做线性组合,组合完还是向量、还是等变。
  • VN 非线性层:普通 ReLU 会破坏等变,VN 用"沿着某个学出来的方向做投影再截断"的方式实现非线性,既有表达力又保住等变。
  • 不变量提取:把两个向量做内积(点乘),方向信息就被约掉了,得到的标量在旋转下不变。网络用这招把"需要不变"的信息(如置信度、开合程度)安全地抽出来。
  • 池化:对所有点的向量特征做均值/最大池化得到全局特征,这个操作也保持等变。

输出:一组"向量特征(管方向)+ 标量特征(管大小/关系)"并存、且整体满足 SIM(3) 规则的表示。

所以这一节是想说:VN 不是一个层,而是一整套"等变版乐高",让网络既能处理方向,又能安全地抽取与方向无关的信息。

7. 动作怎么表示,旋转这一维尤其讲究

输入:去噪器要吐出的机器人动作。

处理:动作被拆成三块——位置(3 维)、旋转(朝向)、夹爪开合(1 维标量)。位置直接用等变向量表示;夹爪开合是不变标量;最麻烦的是旋转。旋转不能用欧拉角(会有万向锁、不连续),EquiBot 用几个正交的 3D 向量(等价于旋转矩阵的列)来表达朝向,这样朝向本身就是"会跟着场景转"的等变量,去噪时也能规规矩矩地被处理。去噪器每一步预测的"要擦掉的噪声"也拆成这三块,各自按等变/不变规则融合观测特征。

输出:一个从纯噪声一步步还原出来、且天然带 SIM(3) 结构的完整动作。

8. 为什么"结构等变"能换来"少样本泛化"

输入:只有几十条演示的小数据集。

处理:想清楚这条因果链——普通策略要泛化到"物体转了/挪了/大了"的新情况,只能靠在数据里见过足够多这类样子(数据增强就是人为造这些样子)。但演示很贵,见得再多也有限。EquiBot 把"变换不变"这件事焊死在网络结构里:对它来说,一个转了 37 度的杯子和原始杯子在内部表示上是同一个东西,根本不算"没见过"。于是同样几十条演示,覆盖的有效情形被几何变换群"免费放大"了无数倍。

输出:在演示数量固定时,显著更强的对新位置/新朝向/新尺度的泛化——这就是等变策略最核心的卖点,也是它特别适合真机(数据永远不够)的原因。

所以这一节是想说:EquiBot 用点云做输入、VN 做等变编码、等变去噪器出动作,全程用"分而治之的 SIM(3) 处理 + 等变乐高 + 讲究的旋转表示"把不变性焊进结构,训练照旧只用去噪损失,却白赚了少样本泛化。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【EquiBot: SIM(3)-Equivariant Diffusi… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

EquiBot — 方法示意:核心 pipeline
Plate Nº IIEquiBot — 方法示意:核心 pipeline

关键数字(What works)

EquiBot 是 CoRL 2024 论文,绝对成功率、任务清单、演示条数等需以原文表格为准,本笔记不编造。下面这张表说明它"测什么、怎么比"。

关注点 对比对象 结果方向(原文为准) 具体数值
几何变换下成功率(转/移/缩放) Diffusion Policy、数据增强基线 EquiBot 明显更稳 原文未在本笔记转录
少样本学习(演示砍到 5/10/20 条) 非等变基线 EquiBot 保持、基线崩 原文未在本笔记转录
sim-to-real 真机任务 基线 掉点更少 原文未在本笔记转录
消融:去掉等变编码器 / 去噪器 完整 EquiBot 各贡献一部分 具体见原文消融表

提醒:任何百分比请以 arXiv 原文(2407.01479)实验表格为准。

所以这一节是想说:EquiBot 的卖点是"少样本 + 几何变换下不掉点",精确数字要回原文核对。


实验结果说明了什么

  • 架构级等变确实能省数据:在演示很少、且测试场景做了几何变换的设定下,EquiBot 相对非等变基线优势最大。这印证了"把常识焊进结构比堆数据更高效"的核心主张。
  • 两个等变模块都重要:消融显示只等变编码器或只等变去噪器都不如两个都等变。说明观测端和动作端要"配套"才能全程保持对称。
  • 能迁到真机:sim-to-real 掉点更少,说明几何鲁棒性不只是仿真里的玩具性质。
  • 代价是实现复杂:等变层比普通层难写、难调,这是"白送泛化"的隐性成本。

所以这一节是想说:实验说明等变不是花架子——它在"数据少 + 场景变"这个机器人最痛的地方,实打实地帮上了忙。


你应该懂的几个新词

SIM(3) 群:三维空间里"平移 + 旋转 + 等比缩放"组成的变换群,比 SE(3)(只有平移 + 旋转)多一个尺度自由度。

等变(equivariance):输入做变换 T,输出用对应方式跟着变,f(T·x) = T·f(x)。区别于"不变(invariance)",后者输出不随变换改变。

Vector Neuron(VN):把神经元的标量激活换成 3D 向量激活的模块,天然对旋转等变,是 EquiBot 的等变骨干基础。

去噪器(denoiser):扩散模型核心网络,输入加噪样本预测噪声。

点云(point cloud):一组三维坐标点,做几何变换比 2D 图像干净。

架构级约束 vs loss 级约束:前者把性质焊进结构(如等变层),物理上做不到违反;后者靠损失惩罚违反,仍可能违反。

所以这一节是想说:抓住"SIM(3)、等变、Vector Neuron、架构级约束"这四个词,就抓住了 EquiBot 的全部。


它有什么搞不定的

  • 只覆盖几何对称性:EquiBot 处理的是位置/朝向/尺度这类几何变换。对光照变化、遮挡、纹理差异、语义泛化(换个完全不同的物体类别)它并不直接负责。
  • 依赖点云质量:真实相机的点云有噪声、有缺失、有遮挡。点云脏了,等变的好处会打折。
  • 等变层实现门槛高:VN 系列层比普通网络难写难调,工程成本是隐性代价,也限制了模型能做多大。
  • 尺度处理是弱点:把"缩放"这一维干净解耦本身不容易,SIM(3) 里的尺度部分比旋转平移更 tricky(细节需读原文)。
  • 不是所有任务都需要 SIM(3):如果任务里物体位姿变化本来就小,等变带来的收益有限,反而白白增加复杂度。

所以这一节是想说:EquiBot 只保证几何对称这一类泛化,点云脏、任务不含几何变化、或要处理语义泛化时,它就不再是最优解。


它和别的几篇是什么关系

  • 直接前作 Diffusion Policy:骨架完全继承,只把编码器和去噪器换成等变版本。
  • SE(3) 等变策略(EDF / Neural Descriptor Fields 等):思想同源(把对称性焊进网络),但 EquiBot 扩到 SIM(3),且首次和扩散策略结合。
  • 点云策略 3D Diffusion Policy / iDP3:都走"点云 + 扩散"路线,但不强等变;EquiBot 在同一路线上加了对称性约束。
  • RL 微调线 DPPO:DPPO 关心"扩散策略怎么用 RL 变强",EquiBot 关心"扩散策略怎么天生泛化",两者正交,可以叠加。
  • 下游影响:之后做"少样本 + 几何泛化"的策略学习论文很多会拿 EquiBot 当基线。

所以这一节是想说:EquiBot 是 Diffusion Policy 家族里"主打几何泛化"的分支,和主打 RL 微调、主打 3D 表征的分支互补。


和本导读的关系

  • 主线章节:Ch13 扩散策略。EquiBot 是扩散策略在"泛化"维度上的重要变体。
  • 泛化与迁移:Ch17 Sim-to-Real。几何鲁棒性是缩小 sim-to-real 差距的一条路径。
  • 表征基础:如果对"点云 / 3D 表征"陌生,可参考 Ch18 多模态生态 里对 3D 表征的介绍。

所以这一节是想说:EquiBot 处在 Ch13(扩散策略)与 Ch17(sim-to-real 泛化)的交汇点。


思考题

Q1:为什么 EquiBot 要"等变"而不是"不变"?举一个如果用错会出问题的例子。

提示

机器人手该去的位置要跟着场景转(等变)。如果用不变,转了场景手却不动,就会去到错误的绝对位置。

Q2:数据增强也能让模型"见过很多旋转版本",为什么说架构级等变更优雅?

提示

数据增强只是让模型近似学会,仍可能在没见过的角度出错,且训练成本翻倍;架构级等变是数学上保证,任何角度都成立,还不增数据。

Q3:为什么 EquiBot 选点云而不是 RGB 图像做输入?

提示

点云的坐标在几何变换下"工整地一起变",等变容易实现;2D 像素在旋转平移下关系混乱,难做干净的等变。

Q4:SIM(3) 比 SE(3) 多了"缩放"。为什么缩放这一维对机器人有用,又为什么它更难处理?

提示

同一操作可能面对不同大小的物体(大杯/小杯),缩放等变能免于重学;难点在于要把"尺度"从"形状"里干净解耦出来。

Q5:如果相机点云非常脏(大量噪声和缺失),EquiBot 的等变优势还剩多少?

提示

等变仍然成立,但脏点云会让编码特征本身不可靠,泛化收益打折——这也是它的一条局限。

Q6:能不能把 EquiBot 的等变思路搬到 ACT 或 VLA 这类非扩散策略上?

提示

原则上可以——等变是对编码器和输出头的结构要求,与"用扩散还是别的生成方式"正交。工程上要重写对应的等变层。

Q7:消融里"只等变编码器"和"只等变去噪器"都不如两个都等变,这说明了什么设计原则?

提示

观测端和动作端要配套等变,整条链路才闭合;只等变一端,另一端会破坏对称性,泛化链断掉。

所以这一节是想说:想清楚这些题,你就理解了"等变 vs 不变""结构 vs 数据增强""为什么要两端配套"这三件核心事。


一些好奇心问答(FAQ)

Q:EquiBot 和 Diffusion Policy 的代码差别大吗?

主要差在两个模块(编码器、去噪器)换成等变实现,训练流程和损失基本沿用。但等变层本身比普通层难写。

Q:它需要多少条演示?

论文卖点就是"少样本",具体条数(如 5/10/20)需以原文为准,这里不编造具体数字。

Q:等变会不会限制模型的表达能力?

会有一点——加了硬约束的网络假设空间更小。但在"任务本身确实有对称性"时,这个约束是帮忙而不是添乱。

Q:SIM(3) 里的尺度是任意缩放还是等比缩放?

是等比缩放(各方向同比例),不是任意拉伸。任意拉伸会破坏物体形状,不属于 SIM(3)。

Q:为什么发在 CoRL 而不是纯机器学习会议?

CoRL 是机器人学习顶会,EquiBot 强调真机与操作任务,定位在"机器人 + 学习"的交叉,非常契合。

所以这一节是想说:EquiBot 的门槛主要在等变层的实现细节,思路本身对初学者很好理解。


如果你想再深入

  1. 前置:Diffusion Policy —— 先懂扩散策略骨架,再看 EquiBot 换了哪两块。
  2. 补 Vector Neurons 入门 —— 花 30 分钟看一篇 VN 博客,理解"标量神经元 → 向量神经元"这个升级。
  3. 对照 SE(3) 等变工作(EDF) —— 看清 EquiBot 从 SE(3) 到 SIM(3) 多做了什么。
  4. 横向看 3D-DP / iDP3 —— 同为点云 + 扩散,但不强等变,对比能突出 EquiBot 的取舍。
  5. 几何深度学习教材 —— 若想系统理解等变,Bronstein 等人的 Geometric Deep Learning 综述是好起点。

所以这一节是想说:先补 Diffusion Policy 和 Vector Neurons,再把 EquiBot 当"给扩散策略加几何护栏"来读。


原文信息

  • 标题:EquiBot: SIM(3)-Equivariant Diffusion Policy for Generalizable and Data-Efficient Learning
  • arXiv:https://arxiv.org/abs/2407.01479
  • 会议:CoRL 2024
  • 年份:2024
@inproceedings{yang2024equibot,
  title  = {EquiBot: SIM(3)-Equivariant Diffusion Policy for Generalizable and Data-Efficient Learning},
  author = {Yang, Jingyun and others},
  booktitle = {Conference on Robot Learning (CoRL)},
  year   = {2024},
  note   = {arXiv:2407.01479}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_equibot_2026,
  title       = {(readable note) EquiBot: SIM(3)-Equivariant Diffusion Policy},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/equibot/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?