Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 45

FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching

16 min read · 5626 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

让机器人不再"在脑子里画 100 张草稿才动手",而是看一眼立体世界就一步给出动作——又快又稳,真机能跑得动。

所以这一节是想说:FlowPolicy 把"3D 点云感知"和"一步就出动作"合到一起,解决扩散策略太慢的老毛病。


这是个什么场景

想象你让朋友"把桌上的杯子放到杯垫上"。这事对人简单到不用想——但对机器人,每一帧(每秒 10–50 次)都要重新决定"手往哪挪、张多大"。决策慢一拍,杯子就摔了。

老一代 Diffusion Policy 干这事像一个"过度纠结的画家":每要动一下手,先在脑子里打 100 张草稿,从最模糊一点点修到最清晰,看到第 100 张才真动手。画得稳,但太慢——真放到机械臂上,控制频率根本跟不上。

控制频率:机器人每秒要出几次动作指令。操作任务常要 10–50 Hz。如果生成一个动作要几百毫秒,就达不到,手会"卡顿"。

后来有人提出 Consistency Models(一致性模型),思路是:"别画 100 张了,能不能学个本事——看一眼模糊草稿直接跳到最终清晰图?"于是 100 步压成 1 步。

FlowPolicy 再往前一步:连"画草稿"这个比喻都嫌啰嗦。它用流匹配(Flow Matching)——想象从一团乱码到正确动作之间有一条最短直线路径,模型直接学怎么沿这条路走;再加一个一致性约束,保证从路上任何一点跳到终点都给同一答案。所以机器人能"一步直达"。

而它看世界的方式也升级了:不是 RGB 摄像头拍的平面照片,而是 3D 点云——像戴 AR 眼镜看到的"立体世界",杯子在哪、手该伸向哪,几何关系一目了然。

所以这一节是想说:场景是"高频实时控制",FlowPolicy 要在这个场景里做到"3D 感知 + 一步出动作"。


FlowPolicy — 场景示意:这论文要解决的现实问题
Plate Nº IFlowPolicy — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Diffusion Policy(Chi et al., 2023):用 DDPM 把动作序列当噪声去噪,质量好、能处理多模态,但推理要 10–100 步去噪,实时性是瓶颈。
  • 3D Diffusion Policy / DP3(Ze et al., 2024):把条件从 2D 图换成 3D 点云,几何感知更强、少样本更好;但仍受限于扩散推理慢。
  • Consistency Policy(Prasad et al., 2024):用一致性模型蒸馏 Diffusion Policy,把多步压成 1–2 步,但依赖一个已训好的 teacher 扩散模型——两阶段训练,复杂。
  • iDP3(Improved 3D Diffusion Policy):在 3D 输入上做了点云编码、相机位姿等改进,但底层还是多步扩散。
  • Flow Matching 类方法(Lipman et al., 2023):把生成重述成学速度场,比扩散更直接、训练更稳,但默认仍需 ODE 多步求解。

蒸馏(distillation):先训一个能力强但慢的"老师"模型,再让一个"学生"模型模仿老师,换取更快的推理。两阶段是它的代价。

FlowPolicy 想同时拿走"3D 点云的几何感知"(来自 DP3)+"一致性的一步推理"(来自 Consistency Models)+"流匹配的训练简洁",三件好事合一,还不要 teacher。

所以这一节是想说:前人要么快但两阶段复杂,要么单阶段但慢,FlowPolicy 想要"单阶段 + 一步 + 3D"全都要。


这篇论文的新想法

两步走。

第一步:换底座——从"擦黑板"换成"导航"。 老的扩散像反复擦黑板:先涂满噪声,再一笔笔擦回正确动作。流匹配换思路——像导航:直接学一张"速度地图" v(x, t),告诉你站在中间任何位置、任何时刻,下一步该朝哪个方向走多远。沿着这张地图走(数学上叫"解 ODE")就能从乱码走到动作。训练损失是简单回归(预测方向和真实方向求差),不用搞复杂噪声调度。

第二步:套上"一致性"约束——让一步直接到终点。

等等,先慢一拍——什么叫"一致性"?打个比方:导航地图原本要你一格一格走,每格查一次。一致性约束相当于强行要求——不管你现在在路上哪一点(刚出发还是快到了),都得能"瞬移"到同一个终点。Consistency Flow Matching(CFM,一致性流匹配) 就是把这条规矩写进训练目标:从 t=0.1 跳和从 t=0.9 跳,模型必须给出同一最终动作。学会后,推理一步就能搞定。

把两步组合,再把"条件输入"接上 3D 点云编码器(沿用 DP3 设计),就得到 FlowPolicy:3D 点云进,一步生成的动作序列出,质量接近多步扩散。

直觉上,这是把 Consistency Policy 的"两阶段蒸馏"(先训 teacher 再让 student 抄)改成了"端到端单阶段训练"——不需要 teacher 了,CFM 本身就把一致性写进 loss,工程更清爽。

所以这一节是想说:新想法 = 流匹配换底座 + 一致性约束保证一步直达 + 单阶段端到端,去掉 teacher。


它分几步做的(方法)

这是全篇最核心部分,分四块讲清楚"进什么、做什么、出什么"。

1. 3D 观测编码

输入:机器人当前帧的彩色点云(来自单个或多个 RGB-D 相机),通常做体素降采样到几百到几千个点。

处理:用一个轻量点云编码器(DP3 用的是简化版 PointNet)把点云编成一个条件向量(condition embedding)。这部分基本沿用 DP3 / iDP3 的工程实践,不是本文主要创新,但 3D 输入是它优于纯图像方法的来源。

输出:一个浓缩了"当前立体场景"的条件向量 c。

点云编码器(point cloud encoder):把几百上千个 3D 点压成一个固定长度向量的网络。PointNet 是最经典的一种。

2. 动作表示与噪声化

输入:一段未来 H 步(比如 H=8 或 16)的末端位姿/关节序列,记作 a₀(真实动作)。

处理:按流匹配标准做法,在 t∈[0,1] 上采样一个时间,把噪声 ε 和真实动作线性混合: x_t = (1 − t)·ε + t·a₀,并定义这条直线流的速度场 v* = a₀ − ε

输出:一批"中间点 x_t + 目标速度 v*"的训练对。

公式人话:x_t 是噪声和真实动作之间的一个混合点;v* = a₀ − ε 是"从噪声直指真实动作"的方向。模型要学会在任意混合点上说出这个方向。

3. 一致性流匹配训练

输入:中间状态 x_t、时间步 t、点云条件 c。

处理:模型 f_θ(x_t, t, c) 接收这三样,训练损失含两部分——

  • Flow Matching 损失:让 f_θ 预测的"终点动作"在所有 t 上都尽量接近 a₀(或等价地让速度场接近 v*)。
  • Consistency 损失:对相邻两个时间步 t₁ < t₂,模型从 x_{t₁} 和 x_{t₂} 出发预测的终点应该一致——一般用 EMA target network 实现这个自一致约束。

输出:一个既学会了速度场、又满足"任意点都能一步到终点"的网络。

EMA target network(指数滑动平均目标网络):训练时额外维护一份模型参数的"慢速平均副本",用它产生稳定的监督目标。是一致性类训练的关键技巧,避免模型自己追自己追崩。

具体的损失权重、时间采样策略、EMA 衰减率等超参需读原文,本笔记不编造。

4. 推理

输入:当前观测点云 c + 一个采样的噪声 x₁ ~ N(0, I)。

处理:调用 f_θ(x₁, t=1, c) 一次,直接得到预测动作 a₀。可选地做 1–2 步迭代细化以提升质量。然后按 Diffusion Policy 的滚动时域范式,执行前几步动作,下一帧再重新预测。

输出:一段可执行的动作序列,延迟极低。

ASCII 总览:

点云 ──► [PointNet 编码] ──► 条件 c
                                │
噪声 x1 ~ N(0,I) ───────────────┤
                                ▼
              [f_θ(x, t, c)]  一次前向
              训练时: FlowMatching损失 + Consistency损失(EMA)
                                │
                                ▼
                        动作序列 a0(一步生成)
                                │ 滚动时域执行
                                ▼
                        下一帧重新预测

5. "一致性"到底约束了什么

这是 FlowPolicy 的灵魂,值得慢慢拆。

输入:同一条从噪声到动作的直线路径上的任意两点。

处理:普通流匹配学的是"每一点的速度方向",推理时你得沿着这些方向一小步一小步积分,走很多步才到终点。一致性(consistency)加了一条更强的要求:这条路径上的任何一点,直接问网络"终点在哪",答案都必须是同一个终点。用大白话说——不管你现在站在路的开头、中间还是快到终点,网络都得一口报出同一个目的地。数学上还有个边界条件:当 t 正好在终点时,网络的输出就是它自己(恒等映射),这给整条"任意点→终点"的映射钉了一个锚。

一旦这个性质学成了,推理就不用积分了:随便丢一个噪声点进去,一次前向就直接跳到终点动作。这就是"一步生成"的来源。

输出:一个把"多步 ODE 积分"压成"一次函数调用"的映射。

打个比方:普通流匹配像沿着地图一格一格走到目的地;一致性像给每个格子都装了传送门,站在任何格子上都能一步传到终点。

6. 为什么一步生成对机器人是"刚需"而非"锦上添花"

输入:一个真实的闭环控制循环。

处理:机器人控制讲究频率——手要根据最新画面不断调整,理想是几十赫兹。扩散策略推理要走几十步去噪(即使用 DDIM 加速也要 5–10 步),每一步都是一次网络前向,叠起来延迟就上去了,控制频率被拖低,动作显得"迟钝"。FlowPolicy 一次前向出结果,延迟基本等于跑一次网络,能把控制频率顶上去。对动态任务(跟随移动目标、需要及时纠错的插拔)这直接决定成败。

输出:一个延迟低到能支撑高频闭环的策略——这也是它相较 DP3/扩散策略最实际的卖点。

所以这一节是想说:一步生成不是为了刷 benchmark,而是为了让控制回路跑得够快。

7. 训练怎么才不"追自己追崩"

输入:一致性训练特有的自监督目标。

处理:一致性训练有个天生的风险——网络的监督目标部分来自它自己(要求相邻点预测一致),如果直接让模型追自己,很容易一起滑向平凡解(比如所有输出都塌成一个点)。论文用几招稳住:

  • EMA 目标网络:用一份"慢速平均副本"产生目标,主网络追这个慢副本而不是追瞬时的自己,避免正反馈失控。
  • 相邻两点采样:每次取路径上靠得很近的两点做一致性约束,差异小、梯度稳。
  • 流匹配损失兜底:一致性损失负责"一步直达",流匹配损失负责"方向别学歪",两者相加,前者压不垮后者,保证生成质量不塌。

输出:一个既能一步生成、又不塌陷、动作质量还在线的稳定训练过程。

8. 把一次训练/推理走一遍

# 训练
for batch (点云 P, 真实动作 a0):
    c = pointnet(P)
    eps ~ N(0,I);  采样两个相邻时间 t1<t2
    x_t1 = (1-t1)*eps + t1*a0;  x_t2 = (1-t2)*eps + t2*a0
    L_fm  = || f_theta(x_t, t, c) 还原的终点 - a0 ||^2   # 方向学对
    L_con = || f_theta(x_t2,t2,c) - f_ema(x_t1,t1,c) ||^2 # 两点终点一致
    更新 theta;  EMA 更新 f_ema

# 推理(每个控制周期)
c = pointnet(当前点云)
x1 ~ N(0,I)
a0 = f_theta(x1, t=1, c)     # 一次前向直达
(可选) 再迭代 1-2 步细化
执行 a0 前几步,然后重新观测

读这段抓两点:训练端是"流匹配损失 + 一致性损失 + EMA"三件套;推理端只有一行真正的前向调用。复杂度全压在训练里,换来推理时的极简与极快。

输出:一个训练稍复杂、但部署起来又快又简单的 3D 策略。

9. 一步生成会不会牺牲质量,怎么补

输入:一步直达得到的动作 a₀。

处理:天下没有免费的午餐——把多步压成一步,理论上会损失一点精度,因为一致性映射毕竟是对"多步 ODE 精确解"的近似。FlowPolicy 对此的态度是"可调":默认一步出结果追求极致速度,但如果任务对精度更敏感,可以再做 1–2 步迭代细化(把一步的输出重新加噪到某个中间时间、再跳一次),用极小的额外延迟换更高的动作质量。这给了部署时一个"速度 ↔ 精度"的旋钮,而不是一刀切。相比之下,扩散策略几乎没有这种"想快就一步、想准就多步"的平滑取舍,它要么慢要么明显掉质量。

另外值得强调,3D 点云输入本身也在帮忙——比起 2D 图像策略,点云自带的几何与深度信息让"一步预测"要拟合的动作分布更规整、更好一步命中,两者是互补的:3D 让问题更好学,一致性让它学得更快。也就是说,这篇工作的两个卖点不是各自独立的,而是彼此加成:正因为选了更好学的 3D 表示,把生成压成一步的激进目标才更容易达成而不至于明显掉质量。

输出:一个默认极快、必要时可花小代价换精度的灵活策略。

所以这一节是想说:一步生成的精度代价可以用可选的迭代细化补回来,而 3D 输入让"一步命中"这件事本身更容易。

所以整块方法是想说:3D 编码给条件,流匹配学速度场,一致性损失把多步 ODE 压成一步直达,EMA 保训练不崩,推理只需一次前向——每一块都服务于"低延迟高频控制"这个目标。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【FlowPolicy: 3D Flow-based Policy vi… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

FlowPolicy — 方法示意:核心 pipeline
Plate Nº IIFlowPolicy — 方法示意:核心 pipeline

关键数字(What works)

本文是 AAAI 2025 论文,成功率、推理毫秒数、benchmark 清单等需以原文为准,本笔记不编造。下表说明它"测什么、和谁比"。

关注点 对比对象 结果方向(原文为准) 具体数值
成功率 Diffusion Policy(多步)、DP3、Consistency Policy 一步 FlowPolicy 追平/接近多步 原文未在本笔记转录
推理步数/延迟 扩散类多步 降一个数量级 原文未在本笔记转录
训练成本 Consistency Policy(两阶段蒸馏) 单阶段更省 原文未在本笔记转录
真机任务 基线 低延迟下可用 具体见原文

提醒:任何百分比与延迟数请以 arXiv 原文(2412.04987)为准。判断本文是否成立的关键定性问题是:"一步推理是否几乎没掉点?"

所以这一节是想说:核心看"一步是否没掉点 + 延迟降多少",具体值回原文核对。


实验结果说明了什么

  • 一步生成可以不掉点(或掉得很少):如果一步 FlowPolicy 的成功率追平多步 Diffusion Policy,而延迟降一个数量级,本文论点就成立——这是它最关键的实验主张。
  • 单阶段能替代两阶段蒸馏:相比 Consistency Policy 需要先训 teacher,FlowPolicy 端到端一次训好,说明"一致性可以直接写进流匹配训练",工程更省。
  • 3D 输入的价值延续:沿用 DP3 的点云条件,说明几何感知的收益在流匹配框架下依然成立。
  • 低延迟是产业刚需:控制频率常要 10–50 Hz,多步扩散在低端 GPU 上很难达标,一步推理直接命中落地痛点。

所以这一节是想说:实验的灵魂是证明"又快又不掉点",以及"不用 teacher 也能一致"。


你应该懂的几个新词

Flow Matching(流匹配):用"学速度场"代替"学去噪"的生成建模。训练是回归速度,推理是解 ODE,比扩散更直接。

Consistency Models(一致性模型):让模型在生成轨迹上"任何一点都能直达终点",从而 1–2 步采样。原是图像生成领域的工作。

Consistency Flow Matching (CFM):把一致性思路套到流匹配上——一致性约束 + 速度场预测的合体,训练更简洁。

3D Diffusion Policy (DP3):把扩散策略的图像观测换成 3D 点云;FlowPolicy 在条件输入上沿用它。

Receding horizon control(滚动时域控制):预测 H 步、只执行前 k 步、下一帧重新预测的闭环范式。

EMA target network:模型参数的滑动平均副本,用于产生稳定的自一致监督目标。

所以这一节是想说:抓住"流匹配、一致性、CFM、3D 点云、EMA"这五个词,就抓住了 FlowPolicy 的全部。


它有什么搞不定的

  • 一步生成的精度上限:一步很快,但对特别复杂或高精度的轨迹,一步可能不如多步细修;论文常留 1–2 步细化的余地就说明这一点。
  • 依赖点云质量:3D 输入的好处建立在点云干净的前提上,真机相机噪声、遮挡会打折。
  • 一致性训练更难调:EMA 目标网络、损失权重、时间采样都是敏感超参,训练稳定性比纯流匹配更棘手。
  • 多模态是否完整保留存疑:一步生成在保留"多种合理做法"上是否和多步扩散一样好,需要看原文的定性分析。
  • 仍是策略层,不含高层规划:它解决"低层动作怎么快速生成",不负责"任务怎么拆解",长程任务仍需上层。

所以这一节是想说:一步换来了速度,代价是精度上限、训练稳定性和对点云质量的依赖。


它和别的几篇是什么关系

  • 直接继承3D Diffusion Policy(点云条件)+ Consistency Models(一步生成)+ Flow Matching(训练目标)。
  • 直接对比Diffusion Policy(图像 + 多步)、Consistency Policy(图像 + 蒸馏一步)、iDP3(点云 + 多步)。
  • 同族流匹配flow-matching-manipulation(affordance + 流匹配)、π0(大模型 + 流匹配)。
  • RL 微调线DPPO 关心"扩散策略怎么用 RL 变强",与本文"怎么加速推理"正交。
  • 技术线串联:BC → ACT → Diffusion Policy → DP3/iDP3 → Consistency Policy → FlowPolicy → π0 → Cosmos Policy。

所以这一节是想说:FlowPolicy 是"3D 表征 + 高效推理"两条升级线的交汇点,处在扩散策略演化史的中段。


和本导读的关系

所以这一节是想说:FlowPolicy 位于 Ch13(扩散策略)与 Ch17(实时部署)的交叉带。


思考题

Q1:为什么扩散策略推理慢,而流匹配 + 一致性能一步出结果?

提示

扩散要一步步去噪(多步);流匹配学速度场本可一步积分近似,一致性约束进一步保证"任意点直达终点",于是一步就够。

Q2:Consistency Policy 需要 teacher,FlowPolicy 不需要,差别的根源在哪?

提示

Consistency Policy 是"蒸馏"已训好的扩散 teacher;FlowPolicy 把一致性直接写进流匹配训练损失,端到端一次训好,无需 teacher。

Q3:EMA target network 在一致性训练里起什么作用?去掉会怎样?

提示

它提供稳定的自一致监督目标。去掉后模型自己追自己,目标不断漂移,容易训练不稳定甚至发散。

Q4:一步生成如果掉了 2% 成功率但延迟降 10 倍,你会采用吗?取决于什么?

提示

取决于任务对精度 vs 实时性的敏感度。高频动态任务值得;高精度装配任务可能宁愿多走几步。

Q5:为什么 3D 点云比 2D 图像更适合做操作策略的输入?

提示

点云直接给出物体的三维几何和距离,手该伸多远一目了然;2D 图像缺深度,距离感要靠推断。

Q6:FlowPolicy 的"一致性"和 DPPO 的"去噪步 MDP"都在处理多步生成,思路有何不同?

提示

FlowPolicy 想"压掉"多步(一步直达);DPPO 想"利用"多步(把每步当可训练动作做 RL)。一个求快,一个求可训练性。

所以这一节是想说:想清楚这些题,你就理解了"为什么能一步""为什么不用 teacher""EMA 的作用"这三件核心事。


一些好奇心问答(FAQ)

Q:FlowPolicy 一定比 DP3 好吗?

在"速度"上明显更好。成功率上目标是追平,不一定超过。它的价值主要是"同等质量下快很多"。

Q:一步推理为什么还常留 1–2 步细化?

因为一步是近似,留少量细化步能在几乎不增延迟的前提下补回一点精度,是稳妥的工程选择。

Q:它需要多相机吗?

单个或多个 RGB-D 都可以,取决于任务对遮挡的敏感度。具体设置需读原文。

Q:和 π0 的流匹配是一回事吗?

数学同源。区别在规模和定位——FlowPolicy 是专注低延迟的 3D 策略,π0 是大规模 VLA 的动作头。

Q:CFM 能用到别的领域吗?

能。"流匹配 + 一致性端到端训练"是通用范式,图像、音频、其它动作生成都可借用。

所以这一节是想说:FlowPolicy 门槛在理解"一致性 + 流匹配"的组合,思路一旦通了,工程上比两阶段蒸馏更简单。


如果你想再深入

  1. 前置:Diffusion Policy + DP3 —— 先懂点云编码、滚动时域、噪声预测目标。
  2. 补 Flow Matching —— 看 Lipman 2023,掌握"学速度场 vs 学噪声"的差异。
  3. 补 Consistency Models —— 看 Song et al. 2023,理解"任意点直达终点"的思想。
  4. 横向:flow-matching-manipulation —— 另一条流匹配路线(affordance 条件),对比看。
  5. 想复现 —— 直接看原文的 CFM 损失公式和 EMA 设置,比正文更实用。

所以这一节是想说:先补 DP3、流匹配、一致性模型三块基础,再把 FlowPolicy 当它们的"三合一成品"来读。


原文信息

  • 标题:FlowPolicy: Enabling Fast and Robust 3D Flow-based Policy via Consistency Flow Matching for Robot Manipulation
  • arXiv:https://arxiv.org/abs/2412.04987
  • 会议:AAAI 2025
  • 年份:2025
@inproceedings{zhang2025flowpolicy,
  title  = {FlowPolicy: Enabling Fast and Robust 3D Flow-based Policy via Consistency Flow Matching for Robot Manipulation},
  author = {Zhang, Qinglun and others},
  booktitle = {AAAI Conference on Artificial Intelligence},
  year   = {2025},
  note   = {arXiv:2412.04987}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_flow_policy_2026,
  title       = {(readable note) FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/flow-policy/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?