Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 44

Affordance-based Robot Manipulation with Flow Matching

16 min read · 5576 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给生活类比,公式一律翻成人话。

一句话讲什么(TL;DR)

教机器人做事时,先让它看懂"物体能怎么用",再用一种"画直线"式的方法直接生成动作——比扩散模型更快、训练更简单。

所以这一节是想说:这篇把"看懂物体用途(affordance)"和"用流匹配画动作"缝到一起,做出一个又快又好训的操作策略。


这是个什么场景

想象你第一次进朋友家厨房帮忙做饭。朋友递给你一个削皮器——你看一眼就知道这玩意儿"应该握住把手、刀片对着萝卜削",不会拿反,也不会去戳碗。这种"一看物体就知道它能怎么用"的能力,机器人学界叫 affordance(可供性):物体本身在告诉你它能被怎么操作。

affordance(可供性):物体"提供给使用者的可能动作"。门把手的 affordance 是"被握住并旋转",杯子把手的 affordance 是"被手指勾住"。在视觉里通常表现为关键点、热力图或可操作区域的 mask。

但光知道"能怎么用"还不够,你还得真把手伸过去、调整角度、来回削。机器人面对的也是这个问题:从一个随便摆出来的起手姿势,怎么一点点调整成一条干净利落的动作轨迹?

过去主流答案是扩散模型(Diffusion)——像"先把一张照片打成一团雪花,再一帧帧擦干净",要走几十步去噪。这篇论文换成流匹配(Flow Matching):更像"在起点和终点之间画一条直线,让模型学这条直线往哪走"。一样能从乱七八糟的起点走到目标动作,但步数少得多,也更直。

所以这一节是想说:场景是"看懂物体用途后生成一条动作轨迹",本文用更快的流匹配替代了慢的扩散。


Affordance-based Robot Manipulation with Flow Matching — 场景示意:这论文要解决的现实问题
Plate Nº IAffordance-based Robot Manipulation with Flow Matching — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 行为克隆(Behavior Cloning, BC):直接学专家示范的"状态 → 动作"映射。问题是多模态动作(同一状态有多种合理做法)会被平均,结果谁都不像。
  • Diffusion Policy(2023):把动作生成当扩散去噪过程,能很好处理多模态。但训练目标是噪声预测,推理要多步迭代,速度受限。
  • 基于 affordance 的两阶段方法:先用视觉模型预测"可操作区域/抓取点/接触关键点",再接一个独立轨迹规划器。问题是 affordance 和 action 分两阶段,误差会累积。
  • 隐式策略(Implicit Policy):用能量函数表达动作分布,能处理多模态但训练不稳定。
  • 强化学习方法:reward 难设计、样本效率低、真机迁移代价高。

多模态动作:同一情况下有几种都对的做法。BC 会取平均导致失败,扩散和流匹配都能保留多种可能。

所以这一节是想说:以前要么把多模态压平,要么两阶段误差累积,要么慢/不稳,本文想同时解决"多模态 + 快 + 有语义先验"。


这篇论文的新想法

像把"看菜谱"和"动手做"两个能力缝进一台机器:

  1. 用 affordance 做条件输入——像菜谱上的高亮提示。视觉编码器不再是端到端黑盒(进图出动作、中间不可解释),而是先显式说出"物体在画面哪里、能被怎么操作",把这个语义先验当信号喂给动作生成器。
  2. 用 flow matching 做动作生成——像导航 App 给你箭头。不走扩散那种"加噪—去噪"的多步路线,而是直接学一个速度场(vector field,一张到处是箭头的地图):你站在哪一点,箭头告诉你下一步往哪走。数学上等价于学一个常微分方程(ODE) 的右边那一项。

速度场(vector field):在每个位置和时刻定义一个方向箭头。想象一片湖面,每个点画一个箭头告诉漂在那的小船往哪漂。模型学的就是这张箭头地图。

ODE(常微分方程):描述"位置随时间怎么变"的方程。流匹配的推理就是解一个 ODE:给起点,按速度场积分,得到终点。

合起来的好处:affordance 提供"做什么"的语义锚点,flow matching 提供"怎么平滑走过去"的动力学。训练比扩散简单(一个回归损失就行),推理比扩散快(ODE 步数远少于扩散步数)。

所以这一节是想说:新想法 = affordance 当条件 + flow matching 当生成器,一个管语义、一个管平滑高效。


它分几步做的(方法)

这是全篇最核心部分,按四步走,每步交代"进什么、做什么、出什么"。

1. 视觉编码 + affordance 预测

输入:RGB 图像(可能还有 depth 深度,具体需读原文)。

处理:像装修师傅先看墙——不会上来就钻孔,会先盯着墙看一会儿,标记"这里能挂、那里有水管不能动"。模型先提取图像特征,再预测一组 affordance 表征——可能是关键点、热力图,或接触点的概率分布。

输出:一份"目标区域指引",告诉后续生成器"手大概该往哪个区域去、以什么方式接触"。

这一步把"物体能怎么用"从模型内部的黑盒变成一个显式的中间产物,既可解释,又能给动作生成当强先验。

2. 构造流匹配的训练对

输入:专家轨迹 x₁(标准范本)+ 一团随机起点 x₀(高斯噪声或随机路径点)。

处理:像练字描红——老师给你标准范本,你随便画一团乱线当起点,然后在两者之间画一条直线: x_t = (1 - t)·x₀ + t·x₁,t 从 0 到 1。 让你练习"在直线上任意一点,下一笔往哪个方向描"。训练目标是让网络预测的速度场 v_θ(x_t, t, c) 逼近真实速度 x₁ − x₀,其中 c 是 affordance + 视觉条件。损失就是一个均方误差(MSE)。

输出:一个学会了"任意中间点该往哪走"的速度场网络。

公式人话翻译:x_t = (1−t)x₀ + t x₁ 意思是"在起点和终点之间按比例 t 取一个中间点";目标速度 x₁ − x₀ 意思是"从起点直直指向终点的那个方向"。模型要学会:站在直线上任何位置,都能说出这个指向终点的方向。

3. 推理时的 ODE 积分

输入:一个随机起点 x₀ + 当前观测和 affordance 条件 c。

处理:像跟着导航走。从 x₀ 出发,按箭头地图一步步往前挪: x_{t+Δt} = x_t + v_θ(x_t, t, c)·Δt。 这就是欧拉积分——初中物理"速度 × 时间 = 位移"的连续版。走若干步(步数一般比扩散的几十步少很多,具体需读原文),得到目标动作轨迹 x₁。

输出:一条未来 N 步的动作轨迹。

4. 闭环执行

输入:生成的未来 N 步动作。

处理:机器人不会一次走完,而是只执行前几步,再重新看一眼环境、重新生成下一段——这是典型的 receding horizon 控制(滚动时域控制),和 Diffusion Policy 一致。

输出:机器人在真实/仿真环境里连续、闭环地完成任务。

receding horizon control(滚动时域控制):每次预测未来一段,只执行开头几步,然后重新观测、重新预测。好处是能不断纠错,不会"一条道走到黑"。

ASCII 总览:

图像 ──► [视觉编码] ──► affordance(关键点/热力图)= 条件 c
                                          │
随机起点 x0 ──────────────────────────────┤
                                          ▼
                        [速度场网络 v_θ(x_t,t,c)]
                                          │  沿 ODE 积分若干步
                                          ▼
                              动作轨迹 x1(未来 N 步)
                                          │ 只执行前 k 步
                                          ▼
                              重新观测 → 再生成(滚动时域)

5. 流匹配为什么比扩散省步数

这一节把"流匹配(flow matching)到底比扩散强在哪"讲透,因为这是这条技术路线的地基。

输入:同一个生成问题——"从随机噪声变成一条合理的动作轨迹"。

处理:扩散模型学的是"如何一点点把噪声擦掉",它背后对应的路径是弯弯绕绕的(由一个复杂的噪声调度决定),所以推理时往往要走几十步小步子才能稳稳到终点。流匹配换了个思路:干脆规定起点到终点走一条直线x_t = (1−t)x₀ + t x₁),网络只需要学"直线上每一点的速度方向"。直线是最好走的路——理论上一步就能到,实际因为条件不同、多条直线会交叉,需要几步修正,但仍远少于扩散。

输出:一个推理只需少数几步积分、还不用调复杂噪声调度的生成器。对机器人尤其重要,因为控制要求高频率、低延迟,省下来的步数直接变成"手更快、更跟得上"。

打个比方:扩散像走一条盘山公路慢慢下山,流匹配像坐缆车直线滑下去。

6. affordance 到底怎么"喂"给速度场

输入:第 1 步预测出的 affordance(关键点/热力图/接触点概率)+ 视觉特征,合起来记作条件 c。

处理:条件 c 不是摆设,它要真正影响每一步的速度预测。常见注入方式有三种,论文按其设计选用其一或组合:

  • 拼接(concatenation):把 c 编码成一个向量,直接接到网络输入上,让每一层都能看到"目标区域在哪"。
  • 交叉注意力(cross-attention):让动作 token 去"查询"affordance 特征,动态决定这一步该重点参考哪个接触点。
  • FiLM 调制:用 c 生成一组缩放和平移系数,去调节网络中间层的激活——相当于用 affordance 给网络"设定语气"。

不管哪种,核心目的一样:让速度场 v_θ(x_t, t, c) 里的 c 把"手该往哪个接触区域去"这件事牢牢钉住,避免生成器凭空乱画。

输出:一个"被 affordance 牵着走"的速度场——它生成的轨迹天然朝着可操作区域收敛。

所以这一节是想说:affordance 不只是可解释的中间量,它是流匹配的强条件,决定了轨迹往哪收。

7. 动作表示、时域与骨架

输入:观测 + 条件 c。

处理

  • 动作分块(action chunking):一次生成未来 N 步而不是单步,能保证轨迹平滑、减少高频抖动,也让滚动执行有富余量。
  • 动作表示:末端执行器的位置/朝向/夹爪状态,朝向同样避免用易跳变的欧拉角。
  • 骨架:速度场网络常用 1D 卷积 UNet 或 Transformer 处理"时间步 × 动作维度"这张小图,视觉编码器用 CNN 或 ViT,具体配置需读原文。

输出:一条既平滑又贴合任务几何约束的动作序列。

8. 把训练和推理连成一条线

一次完整流程(伪代码,示意):

# 训练
for 每个 batch (图像 I, 专家轨迹 x1):
    c = affordance_head(encode(I))       # 预测接触区域当条件
    x0 ~ 高斯噪声;  t ~ U(0,1)
    x_t = (1-t)*x0 + t*x1                 # 直线上取一点
    v_pred = v_theta(x_t, t, c)
    loss = MSE(v_pred, x1 - x0)           # 学"指向终点的方向"
    更新 theta(affordance 头可联合或分开训练)

# 推理(每个控制周期)
c = affordance_head(encode(当前图像))
x = 高斯噪声
for 少数几步:  x = x + v_theta(x, t, c) * dt   # 欧拉积分
执行 x 的前 k 步,然后重新观测、重跑

读这段要抓两点:训练端只是一个 MSE,没有对抗、没有复杂调度,稳且好训;推理端就是几步"速度×时间"的加法,快。这正是流匹配吸引机器人领域的两大理由。

输出:一个从图像直达高频动作、训练简单、推理快速的操作策略。

9. 为什么要"先 affordance 再轨迹"而不是端到端

输入:同一个"图像 → 动作"的映射需求。

处理:最省事的做法是端到端——图像直接喂进速度场,让它自己悟出该去哪。但这样有两个隐患:一是没有可解释的中间产物,出错了你不知道是"看错了地方"还是"动作画歪了";二是接触区域这种强几何先验被埋进黑盒,数据不够时很难学准。这篇论文把它拆成两阶段:affordance 头专门回答"哪里能操作、怎么接触",速度场专门回答"给定目标区域,手怎么走过去"。两者分工后,affordance 头可以用带接触标注的数据单独训得很准,速度场则在这个可靠先验上生成轨迹,等于把一个难问题拆成两个都更好学的子问题。

这也带来一个工程好处:affordance 是显式的,可以拿出来可视化、调试,甚至人工纠正后再喂回生成器——黑盒端到端做不到这点。

输出:一个更可解释、更省数据、更好调试的两阶段管线。

再补一个关键取舍:两阶段的代价是 affordance 头一旦预测错,错误会传导给速度场(误差累积)。所以论文通常让 affordance 表示成"概率分布/热力图"而非单点,把不确定性也传下去,让速度场对模糊的接触区域也能生成合理轨迹,而不是被一个错误的硬标签带偏。

所以这一节是想说:分阶段不是为了好看,而是把"看哪里"和"怎么走"解耦成两个更好学的子问题,同时换来可解释性。

所以整块方法是想说:先预测 affordance 当条件,再用流匹配学速度场,推理时沿直线积分出轨迹,最后滚动执行——四步各司其职,且每一步都为"快""稳""可解释"服务。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Affordance-based Robot Manipulation… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Affordance-based Robot Manipulation with Flow Matching — 方法示意:核心 pipeline
Plate Nº IIAffordance-based Robot Manipulation with Flow Matching — 方法示意:核心 pipeline

关键数字(What works)

本文是 IROS 2024 论文,成功率、推理耗时、任务清单等需以原文为准,本笔记不编造。下表说明它"测什么、和谁比"。

关注点 对比对象 结果方向(原文为准) 具体数值
任务成功率 Diffusion Policy、BC flow matching + affordance 更高 原文未在本笔记转录
推理速度(每条轨迹耗时) Diffusion Policy 多步去噪 flow matching 步数更少、更快 原文未在本笔记转录
去掉 affordance 的消融 完整模型 掉分幅度反映 affordance 价值 见原文消融表
推理步数—精度权衡 —— 步数越少越快但可能掉精度 具体曲线见原文

提醒:任何百分比与耗时请以 arXiv 原文(2409.01083)为准。

所以这一节是想说:核心看两组数——成功率是否提升、比扩散快多少,具体值回原文核对。


实验结果说明了什么

  • flow matching 在操作任务上是可行的扩散替代:只要能追平或超过 Diffusion Policy 的成功率,同时推理更快,这个替换就成立。这是本文最想证明的事。
  • affordance 作为显式条件有价值:去掉 affordance 的消融掉分越多,越说明"给模型一个可解释的语义先验"确实帮到了动作生成,而不只是锦上添花。
  • 推理步数可调:流匹配允许你在"快"和"准"之间滑动——赶时间就少走几步,要精度就多走几步。这对真机部署很实用。
  • 训练更省心:一个 MSE 损失 vs 扩散那套噪声调度,工程上更简单,复现门槛更低。

所以这一节是想说:实验要回答的核心是"flow matching 是不是比 diffusion 更划算",以及"affordance 这个加法值不值"。


你应该懂的几个新词

Flow Matching(流匹配):一种生成模型训练范式。学一个速度场,让"噪声分布"沿这个场流动到"数据分布"。和扩散是表亲,但训练目标更简洁(直接回归速度,不用学 score)。

Affordance(可供性):物体提供的可能动作,视觉里表现为关键点/热力图/mask。

Vector Field(速度场):每个位置和时刻上的方向箭头,像风向图。

ODE(常微分方程):描述位置随时间变化的方程,流匹配推理就是解 ODE。

Receding Horizon Control(滚动时域控制):预测一段、只执行开头、再重新预测的闭环控制方式。

Behavior Cloning(行为克隆):最朴素的模仿学习,直接监督学"状态 → 动作"。

所以这一节是想说:抓住"流匹配、affordance、速度场、ODE"四个词,就抓住了本文骨架。


它有什么搞不定的

  • affordance 预测本身会错:如果第一步把可操作区域标错了,动作生成就被带偏。语义先验是双刃剑。
  • affordance 表征需要标注或先验:关键点/热力图从哪来?要么额外标注,要么依赖预训练视觉模型,这本身有成本。
  • flow matching 步数太少会掉精度:一步或极少步推理虽快,但复杂轨迹可能画不准,快慢要权衡。
  • 接触丰富的任务仍难:像插拔、拧螺丝这类需要精细力控的任务,纯视觉 affordance + 轨迹生成未必够。
  • 泛化范围有限:affordance 依赖训练见过的物体类型,遇到全新形态的物体,"看一眼就知道怎么用"可能失灵。

所以这一节是想说:affordance 错了会连累全局、步数太少会掉精度、精细力控和全新物体仍是硬骨头。


它和别的几篇是什么关系

  • 上游:Flow Matching for Generative Modeling(Lipman et al., ICLR 2023)——本文用的生成框架来源,理解流匹配数学去翻这篇。
  • 主要对手:Diffusion Policy(Chi et al., RSS 2023)——同解多模态动作生成,但生成范式不同,是本文要超越的基线。
  • 同走流匹配路线:FlowPolicy——把流匹配 + 一致性 + 3D 点云结合,是本文的近亲进阶版。
  • affordance 家族:CLIPort、VRB、Where2Act 等把 affordance 当视觉先验,但通常配规划器;本文配的是流匹配。
  • VLA 大模型π0 等也用流匹配做 action head,本文是这条趋势在小模型上的早期落地。

所以这一节是想说:本文是"扩散 → 流匹配"迁移潮里的一员,往上接流匹配理论,往下通 FlowPolicy 和 π0。


和本导读的关系

  • 主线章节:Ch13 扩散策略。本文是"扩散策略之后,流匹配崛起"这条线的入门案例。
  • 规划/语义:affordance 的"先理解再动作"思路,可对照 Ch10 高层规划 里"先想再做"的哲学。
  • 若你要做真机操作 demo,Ch14 模仿学习 里的示范采集与闭环执行是配套背景。

所以这一节是想说:本文位于 Ch13(扩散/流匹配)与 Ch10(语义先验)的交叉带。


思考题

Q1:flow matching 和 diffusion 都能从噪声生成动作,最大的区别是什么?

提示

diffusion 学"如何一步步去噪"(学 score/噪声),推理多步;flow matching 学"速度场"(直接回归方向),推理是解 ODE,步数通常更少、训练目标更简单。

Q2:为什么把 affordance 做成显式的中间产物,而不是让模型端到端隐式学?

提示

显式 affordance 可解释、可当强先验、可单独评估,数据稀缺时提供语义锚点;端到端隐式则黑盒、难解释、更吃数据。

Q3:训练目标里的"真实速度 x₁ − x₀"为什么是从起点直指终点的方向?

提示

因为训练对是起终点之间的直线插值,直线上任意点的方向都恒为 x₁ − x₀,模型学会这个方向就能沿直线走到终点。

Q4:如果 affordance 预测错了(比如把杯口标成了杯底),后果是什么?怎么缓解?

提示

动作会被引向错误区域导致失败。缓解可用更强的视觉预训练、多假设 affordance、或让下游生成对错误先验更鲁棒。

Q5:推理时把 ODE 步数从 20 减到 1,会发生什么?什么时候值得这么做?

提示

更快但精度可能下降。控制频率要求高、轨迹相对简单时值得;精细任务则要多走几步保精度。

Q6:为什么要用滚动时域执行,而不是一次生成一整条轨迹走到底?

提示

环境会变、有误差,只执行开头几步再重新观测能持续纠错,避免"一条道走到黑"。

所以这一节是想说:想清楚这些题,你就理解了"流匹配 vs 扩散""显式 affordance 的价值""步数—精度权衡"这三件核心事。


一些好奇心问答(FAQ)

Q:flow matching 一定比 diffusion 好吗?

不一定。它训练更简单、推理更快,但在极复杂分布上,扩散的多步细修有时更稳。本文的贡献是证明在操作任务上流匹配够用且更快。

Q:affordance 一定要人工标注吗?

不一定。可以来自预训练视觉模型或自监督信号,具体本文怎么获得 affordance 需读原文。

Q:这套方法能上真机吗?

IROS 论文通常有真机验证。具体平台(UR5 / Franka / xArm 等)需以原文为准。

Q:和 π0 那种大模型用的 flow matching 是一回事吗?

底层数学是同一套流匹配。区别在规模和用途——本文是小模型 + affordance 条件,π0 是大规模 VLA 的动作头。

Q:一个 MSE 损失真的够训练动作生成?

够。流匹配的精髓就是把生成问题化简成"回归速度",所以损失可以很简单。

所以这一节是想说:本文门槛不高,核心是接受"流匹配 = 学速度场"这个视角,再理解 affordance 怎么当条件。


如果你想再深入

  1. 前置:Diffusion Policy —— 先懂扩散策略,才 get 本文"更快更简单"的卖点。
  2. 补流匹配数学 —— 看 Lipman 2023 前 3 节,掌握"速度场—插值路径—回归损失"三件套。
  3. 横向:FlowPolicy —— 看流匹配 + 一致性 + 3D 的进阶组合。
  4. affordance 家族 —— 读 Where2Act / VRB,理解可供性在机器人里的传统用法。
  5. VLA 里的流匹配 —— 读 π0,看流匹配在大模型动作头里的样子。

所以这一节是想说:先补 Diffusion Policy 和流匹配基础,再把本文当"流匹配 + affordance 的工程范例"。


原文信息

@inproceedings{zhang2024affordanceflow,
  title  = {Affordance-based Robot Manipulation with Flow Matching},
  author = {Zhang, Fan and Gienger, Michael},
  booktitle = {IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)},
  year   = {2024},
  note   = {arXiv:2409.01083}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_flow_matching_manipulation_2026,
  title       = {(readable note) Affordance-based Robot Manipulation with Flow Matching},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/flow-matching-manipulation/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?