Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 108

DexMV

25 min read · 8839 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过灵巧操作和模仿学习"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

DexMV 搭了一套"人手视频 → 机器人示范"的转换流水线:用普通 RGB-D 相机录人手做家务(倒水、放东西、搬运),估计出 3D 手和物体姿态,再通过一套"动作重定向 + 动作反推"的方法,把人手轨迹翻译成 30 自由度机械手能执行的示范,最后用模仿学习训策略。结果:在纯强化学习学不会的复杂任务上,DexMV 大幅提升成功率(Relocate 最高从 6% 涨到 93%),还能泛化到没见过的物体。

所以这一节是想说:DexMV 的核心就是"用录人手视频这种便宜方式,给多指机械手造大量示范",从而攻克强化学习单打独斗搞不定的灵巧操作。


这是个什么场景

想象你要教一只五指机械手(不是那种只会开合的两指夹爪,而是像人手一样有很多关节的灵巧手)去"把杯子里的水倒进碗里"。这种任务对机器人极难:机械手有 30 个自由度(每根手指、每个关节都能动),控制空间巨大,纯靠强化学习去试错,需要海量的训练数据,而且学出来的动作往往很别扭、不像人。

那能不能让机器人"看着人怎么做"来学?这就是模仿学习(imitation learning)——给机器人一批"专家示范"(人是怎么一步步操作的),让它照着学。问题来了:怎么采集这些示范?

之前的做法是让人戴上 VR 头盔 + 动捕手套去遥操作机器人。但这套设备贵、不好用、采集慢——之前有个经典工作每个任务只采了 25 条示范。数据这么少,任务复杂度也上不去。

DexMV 要解的题:能不能用最便宜的方式(一个普通 RGB-D 相机 + 人直接用手做)大规模采集示范,然后自动翻译成机械手能用的训练数据? 一句话,把"人手视频"变成"机器人老师"。

所以这一节是想说:灵巧手自由度高、纯 RL 学不动,而遥操作采示范又贵又慢,DexMV 想用"录人手视频"这条廉价路子来批量造示范。


DexMV — 场景示意:这论文要解决的现实问题
Plate Nº IDexMV — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:纯强化学习(RL) 让机械手自己在仿真里试错。类比:让一个人蒙着眼睛乱试上百万次。问题:30 自由度控制空间太大,样本效率极低;很多复杂任务(如倒水、放进容器)RL 几乎学不会;学出的动作不自然。

  • 方案 B:VR + 动捕手套遥操作采示范 人戴设备远程操控机械手,录下轨迹当示范(如 Rajeswaran 等人的工作)。问题:(1) 设备贵、门槛高;(2) 采集慢、难扩展,一个任务只有 25 条示范;(3) 任务复杂度受限——后续研究发现,在这些简单任务上 RL 加不加示范差别不大,说明示范太少没发挥价值。

  • 方案 C:从视频学,但只用两指夹爪 之前有从人类视频学的工作,但任务都很简单(推方块),且用的是 2 自由度夹爪。问题:夹爪和五指灵巧手完全不是一回事,那套方法迁移不到高自由度灵巧操作。

  • 方案 D:"跟随"单条人类轨迹 训练策略去复刻某一条人手轨迹。问题:只能重复那一条轨迹,换个目标位置、换个物体摆放就不行了,不能泛化。

  • 核心难题:怎么用便宜、可扩展的方式采集大规模灵巧操作示范,并把"人手(45 自由度、几何和机器人不同)"的动作准确翻译成"机械手(30 自由度)"能执行、能学的示范?

所以这一节是想说:RL 学不动、VR 采集贵、夹爪方法迁不过来、跟随单轨迹不泛化——缺一条"便宜采集 + 准确翻译 + 能泛化"的灵巧示范路子。


这篇论文的新想法

类比:DexMV 就像一个"人手动作翻译官 + 配套练习场"。你在摄像头前用手比划一遍"怎么倒水",翻译官把你的手部动作翻译成机械手的语言(关节角 + 电机指令),然后机械手在仿真练习场里照着学。

DexMV 的核心判断:人手视频里藏着丰富的操作经验,只要能准确提取 3D 手-物姿态,并解决"人手和机器手结构不同"这个翻译难题,就能廉价造出大量高质量示范。

它由两大件组成:

  1. DexMV 平台(platform):一套配对的系统——

    • 计算机视觉系统:一个立方框架 + 两个 RealSense D435 RGB-D 相机,录人手做操作的视频(约 100 条示范/小时,非常快)。
    • 仿真系统:基于 MuJoCo + Adroit 灵巧手(30 自由度),设计了和人手任务一一对应的机器人任务。
  2. DexMV 流水线(pipeline):三步走——

    • 姿态估计:从视频里估计出 3D 手姿态(MANO 模型)和物体 6D 姿态。
    • 示范翻译(核心创新):把人手轨迹翻译成机器人示范,分两步——"手部动作重定向"(对齐不同自由度/几何的两只手)+ "机器人动作反推"(从姿态倒推出电机指令)。
    • 模仿学习:用翻译好的示范去训练策略(把示范融入 RL)。

关键洞察:BC(行为克隆)不适合,要把示范融入 RL。 因为视频示范不完美(有噪声、不是最优),直接照抄(行为克隆)学不好;但把示范当作"引导 RL 探索的先验",既利用了人的经验、又靠 RL 的试错弥补示范的不完美——这是最合适的用法。

【人手视频 → 机械手示范 → 融入 RL】

  人在两个 RealSense D435 前徒手比划(~100 条/小时, 便宜快)
    │ ①姿态估计:3D 手姿态(MANO) + 物体 6D 姿态
    ▼
  ②示范翻译(核心创新):
     手部动作重定向(对齐 人手45-DoF ↔ Adroit手30-DoF)
     + 机器人动作反推(姿态 → 电机指令)
    ▼
  ③模仿学习:示范"融入 RL"当探索先验(而非行为克隆照抄不完美示范)
    ▼
  MuJoCo + Adroit 灵巧手里学会 倒水 / 放进容器 等任务

所以这一节是想说:DexMV = 便宜的人手视频采集平台 + "姿态估计→示范翻译→模仿学习"三步流水线,其中"示范翻译"是把人手动作变成机械手示范的核心创新。


它分几步做的(方法)

DexMV 的完整数据流:

人手操作视频(2个RGB-D相机, ~30Hz)
   │
   ▼ 【姿态估计】
   ├─ 物体: PVN3D 估计 6-DoF 姿态 (T∈R³, R∈SO(3))
   └─ 人手: MANO 模型 (15关节×3=45 DoF) + 深度优化
   │
   ▼ 【示范翻译】(核心创新)
   ├─ 步骤1: 手部动作重定向 (Task Space Vectors 优化)
   │        人手45DoF → Adroit机械手30DoF 关节角 q_t
   └─ 步骤2: 机器人动作反推 (逆动力学 + 最小jerk轨迹)
   │        关节角序列 q_t → 电机力矩/指令 τ(t)
   │
   ▼ 【模仿学习】(示范融入RL, 非纯行为克隆)
   ├─ 状态-动作: DAPG / GAIL+
   └─ 仅状态:   SOIL
   │
   ▼ 灵巧操作策略 (Relocate / Pour / Place Inside)

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 平台第一步:用两个相机采集人手视频

类比:搭一个"透明盒子摄影棚",人把手伸进去干活,两个角度同时拍。

输入:人要做的操作任务(如"把糖盒搬到目标点")。

处理:搭一个 35 立方英寸的立方框架,在顶部正前方和顶部左侧各装一个 RealSense D435 RGB-D 相机(同时拿到彩色图和深度图)。人在框内做操作,两个相机从正面和侧面同时录——用两个视角是为了应对遮挡(一只手挡住的部分,另一个角度能看到)。采集速度约 100 条示范/小时,比 VR 快得多也便宜得多。

输出:配对的双视角 RGB-D 视频(约 30Hz)。

小结:双 RGB-D 相机的透明框架摄影棚,让采集人手示范又快又便宜,双视角解决遮挡。

5.2 姿态估计:从视频提取 3D 手-物姿态

类比:把视频里"平面的手和物体"还原成"立体的手和物体在空间哪个位置、什么朝向"。

输入:双视角 RGB-D 视频的每一帧。

处理

  • 物体姿态:用 PVN3D 模型(在 YCB 数据集上训练)估计物体的 6-DoF 姿态——包括平移 T(3D 位置)和旋转 R(朝向)。它先做实例分割,再在点云上做密集投票预测 3D 关键点,最后用 PnP 匹配优化出 6-DoF 姿态。
  • 人手姿态:用 MANO 模型表示人手——15 个关节的 3D 旋转参数 θ、根节点全局姿态 r、形状参数 β。先用皮肤分割 + 手检测拿到手部掩码,再用现成的手姿态估计模型预测 2D 手关节和 MANO 参数,然后把它建成一个优化问题:最小化"3D 关节投影到 2D 的重投影误差" + "深度图对齐误差"(权重 λ=0.001)。双相机时把多个视角的目标一起优化,还加了帧间平滑后处理。

输出:每帧的 3D 手姿态(MANO 参数)+ 物体 6-DoF 姿态序列。

小结:PVN3D 管物体 6D 姿态、MANO + 深度优化管人手 3D 姿态,把视频还原成立体的手-物运动轨迹。

5.3 示范翻译·步骤一:手部动作重定向

类比:人手和机械手就像两种不同"字体"写的同一句话——重定向就是把人手这套"字体"转写成机械手能读的"字体",还要保证意思(手指和物体的接触关系)不变。

输入:人手 3D 姿态序列 {(θ, β, r)}。

处理:难点在于人手(45 自由度、15 球关节)和 Adroit 机械手(30 自由度、24 转动关节 + 1 自由关节)结构不同、指节长度也不同。DexMV 把重定向建成一个优化问题,核心是匹配任务空间向量(Task Space Vectors, TSV)

  • 光匹配"指尖到手掌"的向量(fingertip mapping)不够——指尖位置对了,但手指弯曲信息丢了,会导致机械手穿模(手指扎进物体)。
  • DexMV 额外加上"手掌到中指节"的向量一起匹配,保住手指弯曲姿态。
  • 目标函数 = "两只手的 TSV 差距" + "相邻帧关节角变化的 L2 平滑项"(权重 α=8e-3)。
  • 用 NLopt 里的序列最小二乘二次规划(SLSQP)求解,每帧用上一帧的结果初始化,保证时间连续平滑。人手 TSV 先过低通滤波再优化。

输出:机械手关节角序列 {q_t}。

小结:用"多组任务空间向量 + 平滑约束"的优化,把人手动作准确重定向成机械手关节角,避免穿模、保证平滑。

5.4 示范翻译·步骤二:机器人动作反推

类比:重定向给了你机械手每一时刻"摆成什么姿势"(关节角),但模仿学习还需要知道"用多大的力去摆"(电机指令)。这一步就是从"姿势序列"倒推"发力序列"。

输入:机械手关节角序列 {q_t}。

处理

  • 模仿学习需要"状态-动作对",动作指电机力矩/控制指令,但视频里没有力的信息。机器人里,力矩可用逆动力学函数 τ = f_inv(q, q', q'') 算出——需要关节角的一阶、二阶导数。
  • 先把离散关节角拟合成连续轨迹函数 q(t),再求导得 q'(t)、q''(t),代入逆动力学算力矩 τ(t)。
  • 最小 jerk(最小加加速度)约束:要求轨迹的三阶导(jerk)尽量小。原因有二:(1) 生理学研究表明人手运动本身就是最小 jerk 轨迹(最省力),这样机器人动作更像人、更自然;(2) 最小 jerk 能降低电机位置误差、减少机械磨损。
  • 时间对齐:视频约 30Hz,仿真跑 120Hz,用仿真频率对连续函数 q(t) 重采样,算出对应动作。

输出:可供模仿学习使用的"状态-动作"示范序列。

小结:用逆动力学 + 最小 jerk 轨迹拟合,从关节角倒推出自然、省力、低磨损的电机指令,补全示范里缺的动作信息。

5.5 模仿学习:把示范融入强化学习

类比:不是让机械手死记硬背人的每一步(那是行为克隆,遇到没背过的情况就懵),而是把人的示范当作"划重点的参考答案",一边参考、一边自己在仿真里练,练出真正能用的策略。

输入:翻译好的机器人示范 + 仿真环境的奖励函数。

处理:不用纯行为克隆,而是把示范融入 RL(底座是 TRPO)。分两类设定:

  • 状态-动作模仿(示范里有状态也有动作):
    • DAPG(Demo Augmented Policy Gradient):在策略梯度里额外加一项"向示范动作靠拢"的梯度,权重随训练迭代衰减(λ₀·λ₁ᵏ)——早期多靠示范引导,后期多靠自己探索。
    • GAIL+:用生成对抗的思路,让一个判别器区分"策略产生的状态-动作"和"示范的状态-动作",策略去骗过判别器(即模仿示范分布),再叠加奖励函数。
  • 仅状态模仿(只用示范的状态,不用动作):
    • SOIL(State-Only Imitation Learning):在跑策略时在线学一个逆模型 h_φ 来预测示范里缺失的动作,再像 DAPG 那样训练,策略和逆模型同时优化。

输出:能完成 Relocate / Pour / Place Inside 且能泛化到新物体的灵巧操作策略。

小结:DexMV 把示范当"探索先验"融入 RL,用 DAPG/GAIL+(状态-动作)和 SOIL(仅状态)三种算法benchmark,靠示范引导 + RL 试错学出灵巧策略。

5.6 为什么"翻译 + 融入 RL"是关键

  • 翻译解决"跨形态"鸿沟:人手和机械手自由度、几何都不同,直接照抄不可能。TSV 重定向 + 逆动力学反推,把人的经验准确搬到机械手上。
  • 融入 RL 而非行为克隆:视频示范有噪声、不最优,纯行为克隆会放大误差;当作 RL 先验则能扬长避短——用示范加速探索、用 RL 修正不完美。
  • 平台让数据可扩展:100 条/小时的采集速度,让"大规模示范"从不可能变可能,而规模正是灵巧操作学习的关键瓶颈。

所以这一节是想说:DexMV 的方法五步(采集→物体姿态→手姿态→重定向→动作反推→模仿学习),核心创新是"示范翻译"这道跨形态翻译题,加上"融入 RL"这个正确的用法。


DexMV — 方法示意:核心 pipeline
Plate Nº IIDexMV — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"看人手视频学"到底值多少。

数字 1:Relocate 五物体成功率(%)

方法 Mustard Sugar Box Tomato Can Clamp Mug
SOIL 33±42 67±47 98±2 89±15 71±35
GAIL+ 6±1 0±0 66±47 52±39 53±37
DAPG 93±5 0±0 100±0 100±0 100±0
RL(纯强化) 6±1 0±0 67±47 51±37 49±36

关键含义:模仿学习全面碾压纯 RL。芥末瓶(Mustard)上 RL 只有 6%,DAPG 到 93%;番茄罐/夹子/杯子上 DAPG 到 100%。糖盒又高又薄最难,只有 SOIL 学得会(67%,因为它在线学逆模型能给出更准动作)。

数字 2:示范数量的影响(Tomato Can,SOIL,800 迭代成功率 %)

示范数 400 迭代 600 迭代 800 迭代
SOIL (100) 36±13 70±25 100±0
SOIL (50) 19±23 40±43 59±39
SOIL (10) 4±5 17±11 36±21
RL (0) 0±0 0±0 13±19

关键含义:示范越多越好。100 条示范能到 100%,10 条只到 36%,0 条(纯 RL)几乎不动。这正说明"能快速采集大规模示范"的平台价值。

数字 3:手姿态估计质量 vs 策略成功率(Tomato Can)

设置 MPJPE(越小越好) 成功率(%)
1 相机 41.7 66.7±57.7
1 相机 + 后处理 36.2 69.7±33.3
2 相机 36.6 84.7±25.7
2 相机 + 后处理 32.5 93.3±11.5

关键含义:手姿态估计越准,策略越好。双相机 + 后处理最好(MPJPE 32.5,成功率 93.3%)。双相机比单相机好,因为能提供更平滑的轨迹。

数字 4:Pour(倒水)与 Place Inside(放入容器)

方法 Pour 成功率(%) Place Inside 得分
SOIL 3.5±3.3 27.9±26.5
GAIL+ 3.4±2.5 16.0±14.2
DAPG 27.2±18.4 31.3±30.0
RL 1.3±0.7 3.2±5.6

关键含义:这两个更难的序列任务上,DAPG(状态-动作)明显胜出。倒水任务里 SOIL 学不好,因为水粒子让在线逆模型难学,而 DAPG 用解析逆动力学仍能给出合理动作。

数字 5:泛化到未见物体(Relocate 成功率 %)

迁移 SOIL GAIL+ DAPG RL
番茄罐→can 类(同类新物体) 62.0 30.7 83.6 15.9
芥末瓶→bottle 类 0.0 0.0 68.5 0.0
杯→mug 类 51.4 33.8 79.4 27.7
番茄罐→相机(跨类别) 27.1 5.9 47.2 3.8
芥末瓶→相机(跨类别) 2.6 0.0 49.9 0.1
杯→相机(跨类别) 25.8 17.3 33.4 7.5

关键含义:DAPG 泛化最强。同类新物体上能保持高成功率(83.6%),甚至跨类别(迁到 ShapeNet 相机)也有 47-50%。说明用单个物体的人手示范也能迁移到新物体。

所以这一节是想说:数据证明四件事——模仿学习远胜纯 RL、示范越多越好、姿态越准越好、DAPG 在复杂任务和泛化上最强。


实验结果说明了什么

问题一:人手视频示范真的比纯 RL 有用吗? 非常有用。在多个任务上纯 RL 几乎学不会(芥末瓶 Relocate 6%、Pour 1.3%、Place Inside 3.2 分),而加了示范的模仿学习动辄翻好几倍甚至到 100%。这直接反驳了"之前工作里 RL 加不加示范差不多"的结论——原因是之前示范太少(25 条)且任务太简单,DexMV 用大规模示范 + 更难任务,让示范的价值真正显现。

问题二:示范的数量和质量各有多重要? 两者都关键。数量上,100 条示范能到 100%、10 条只到 36%——所以"能快采集"的平台是核心竞争力。质量上,手姿态估计越准(MPJPE 越小)策略越好,双相机 + 后处理比单相机好一大截(93.3% vs 66.7%)。这说明整条流水线"采集→估计→翻译"每一环的质量都会传导到最终策略。

问题三:什么时候用状态-动作(DAPG),什么时候用仅状态(SOIL)? 复杂序列任务(倒水、放入容器)用 DAPG 更好,因为它用解析逆动力学算动作,稳定可靠;而 SOIL 要在线学逆模型,遇到水粒子这种复杂动力学就学不准。但在糖盒 Relocate 上 SOIL 反而最好——因为糖盒又高又薄、掉了难再抓,在线学逆模型能给出更精准的动作。所以两者各有适用场景。

问题四:学到的策略能泛化吗? 能,尤其 DAPG。用单个物体的人手示范训练,能迁移到同类别的新物体(83.6%),甚至跨类别(迁到相机 47-50%)。倒水和放入容器任务迁到 ShapeNet 新物体,性能和原物体接近。这说明流水线学到的是"如何操作这类形状"的通用技能,而非死记某个物体。

问题五:环境变化下鲁棒吗? 鲁棒。用同一批示范,把物体缩放(×0.75 到 ×1.125)、改摩擦系数(×0.8 到 ×1.2),策略仍能学好,且都远超纯 RL。这说明示范能跨越"仿真环境"和"真实人手示范"之间的差异(sim-to-real gap 的一种)。

所以这一节是想说:实验系统回答了五个问题——示范远胜纯 RL、数量质量都关键、DAPG/SOIL 各有所长、能泛化到新物体、对环境变化鲁棒。


你应该懂的几个新词

灵巧操作(dexterous manipulation):用多指机械手(如 30 自由度的 Adroit 手)做精细操作,区别于两指夹爪的简单抓放。

模仿学习(imitation learning):让机器人从"专家示范"里学"观测→动作"的映射,本文特指把示范融入 RL 而非纯照抄。

行为克隆(behavior cloning, BC):模仿学习里最简单的一种,直接监督学习"看到这个状态就输出这个动作"。示范不完美时会出问题,所以 DexMV 不用它。

MANO 模型:一个参数化的人手模型,用少量参数(15 关节旋转 θ、形状 β、根姿态 r)就能表示各种手势。

6-DoF 姿态:物体的完整位置 + 朝向——3 个平移(xyz)+ 3 个旋转,共 6 个自由度。

动作重定向(motion retargeting):把一个骨架的动作转到另一个结构不同的骨架上,这里是人手→机械手。

任务空间向量(Task Space Vectors, TSV):定义在指尖-手掌、手掌-中指节之间的向量,重定向时匹配它们来保住手的姿态。

逆动力学(inverse dynamics):已知关节的位置、速度、加速度,反推需要多大的关节力矩,τ=f_inv(q,q',q'')。

最小 jerk(minimum jerk):jerk 是加速度的变化率(三阶导),最小 jerk 轨迹最平滑省力,人手运动天然如此。

DAPG / SOIL / GAIL+:三种把示范融入 RL 的算法——DAPG 加示范梯度、SOIL 在线学逆模型补动作、GAIL+ 用对抗判别器匹配示范分布。

所以这一节是想说:这十个词是读任何"从人类视频/示范学灵巧操作"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 依赖姿态估计质量:整条流水线的上游是手-物姿态估计。相机不准、遮挡严重、透明/反光物体,姿态就错,翻译和策略都会被拖累。实验也证明 MPJPE 越大成功率越低。
  • 仍需仿真环境和奖励函数:DexMV 把示范融入 RL,而 RL 需要仿真器和精心设计的奖励——所以它不是纯从视频端到端学,真机部署还需 sim-to-real 迁移。
  • 重定向依赖手工设计的 TSV 和约束:任务空间向量、平滑权重、最小 jerk 这些都是人工设计的启发式,换个差异很大的机械手可能要重新调。
  • 仅在仿真中评测策略:论文的策略评测主要在 MuJoCo 仿真里,真机上直接跑的验证有限。
  • 物体和任务仍受限:任务是 Relocate/Pour/Place Inside 三类、用 YCB 物体,离"任意日常灵巧操作"还有距离。
  • 视频示范不最优:人手视频本身有噪声、非最优,所以只能当 RL 先验用,不能直接行为克隆——这既是设计选择也是局限。

所以这一节是想说:DexMV 把"廉价采集大规模灵巧示范"这条路走通了,但姿态估计质量、依赖仿真/奖励、手工设计的重定向、真机验证有限这些问题仍在,后续工作(如 DexCap、更强的姿态估计)继续发力。


它和别的论文是什么关系

  • 上游(被它借用)
    • MANO 手模型:人手姿态的参数化表示基础。
    • PVN3D:物体 6-DoF 姿态估计的现成模型。
    • DAPG(Rajeswaran et al.):把示范融入策略梯度的方法,DexMV 直接用;也正是 DexMV 想超越的"VR 采集 25 示范"那条线的作者。
    • Adroit 灵巧手 + MuJoCo:仿真平台和机械手模型。
  • 对比关系
    • VR/动捕遥操作采示范:DexMV 用普通相机录人手,便宜且可扩展(100 条/小时),是对遥操作的替代。
    • 两指夹爪从视频学:DexMV 处理的是 30 自由度灵巧手,难度和意义都大得多。
    • 跟随单条人类轨迹:DexMV 学的是能泛化到新目标/新物体的策略,不是复刻一条轨迹。
  • 下游 / 同族:DexMV 开创了"从人手视频学灵巧操作"这条线,本仓库的 DexCap(用手套 + 相机采数据)、DP3(3D 扩散策略做灵巧操作)等都在这条脉络上。DexMV 是"廉价采集 + 跨形态翻译"的早期奠基工作。

所以这一节是想说:DexMV 站在 MANO + PVN3D + DAPG 的肩膀上,第一次系统性地把"人手视频"变成"灵巧手示范",是"从人类视频学灵巧操作"这条研究线的开山之作。


和本导读的关系

本笔记对应导读中"灵巧操作与数据采集"这条线的早期节点。

在灵巧操作的技术演进里,最大的瓶颈一直是示范数据从哪来。DexMV 给出的答案是——从人手视频里来,并解决了"人手和机器手结构不同"这个跨形态翻译难题。理解了 DexMV,你就理解了后续一系列工作(DexCap 用手套 + 相机、各种从人类视频学的方法)为什么都在琢磨"怎么更便宜、更准地把人的操作搬给机器人"。

读完本笔记,建议:先看 DexCap 笔记(它用可穿戴手套 + 相机进一步提升采集的便捷性和数据质量),再看 DP3 笔记(它用 3D 扩散策略做灵巧操作,代表了动作生成骨干的升级)。三篇连起来,就能看清"灵巧操作 = 好的数据采集(DexMV/DexCap)+ 好的策略学习(DP3)"这条完整脉络。

对应导读章节:Ch14:模仿学习——DAgger / ACT-ALOHA / UMI

所以这一节是想说:本笔记是"从人类数据学灵巧操作"这条线的起点,读它后接 DexCap(更好的采集)和 DP3(更好的策略)。


思考题

以下问题检验你是否真正理解了 DexMV 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:DexMV 为什么坚持"把示范融入 RL",而不用最简单的行为克隆(直接照抄人手动作)?

提示

因为人手视频示范是"不完美、非最优"的:姿态估计有噪声、人做的也不是最优轨迹、翻译过程还有误差。行为克隆是纯监督学习,会把这些误差原样学进去,而且遇到训练中没见过的状态(分布漂移)就无法纠正,误差会累积。把示范当作 RL 的"探索先验"则能扬长避短——用示范引导 RL 快速找到有希望的方向(解决 RL 样本效率低的问题),同时靠 RL 的试错和奖励信号来修正示范的不完美、探索出比示范更好的动作。这就是为什么 DexMV 用 DAPG/SOIL/GAIL+ 而不是 BC。

Q2:手部动作重定向时,为什么只匹配"指尖到手掌"的向量不够,还要加"手掌到中指节"的向量?

提示

因为只匹配指尖位置会丢失手指的"弯曲姿态"信息。想象你的手指可以有很多种弯法,但让所有弯法的指尖都落在同一个点——指尖对了,但手指是伸直的还是蜷曲的完全不同。在操作中,手指的弯曲决定了它怎么包裹、接触物体。如果只对齐指尖,机械手可能用一个错误的弯曲姿态去够那个指尖位置,结果手指扎进物体里(穿模),尤其在接近机械手奇异位形时更严重。加上"手掌到中指节"这第二组向量,就约束了手指中段的位置,从而保住整个手指的弯曲形态,避免穿模、让接触更真实。

Q3:动作反推为什么要求轨迹是"最小 jerk"?这个约束带来什么好处?

提示

jerk 是加速度的变化率(位置的三阶导),最小 jerk 意味着运动尽量平滑、没有急促的抖动。好处有两方面:(1) 生理学上,人手的自然运动本身就是最小 jerk 轨迹(这是人体最省力的运动方式),所以让机器人轨迹也满足最小 jerk,能让机械手动作更像人、更自然;(2) 工程上,平滑轨迹能降低电机的位置跟踪误差、减少对物理机械的冲击和磨损。此外,从数据角度,平滑的示范也更容易被模仿学习算法学习,抖动的示范会引入噪声。所以最小 jerk 既让动作自然、又保护硬件、又利于学习,一举多得。

Q4:实验发现"手姿态估计越准(MPJPE 越小),策略成功率越高"。这对整条流水线的设计有什么启示?

提示

启示是:DexMV 是一条"串联的流水线",误差会逐级传导放大。姿态估计在最上游,如果这里估错了手的位置和姿态,后面的重定向就会把错误的动作翻译给机械手,最终策略自然学不好。所以整条流水线的质量取决于最薄弱的那一环,而上游的感知质量尤其关键。这也解释了为什么 DexMV 要用双相机(应对遮挡、提供更平滑轨迹)+ 后处理(帧间平滑)——都是为了提升上游姿态估计质量。对后续研究的启示是:想提升灵巧操作学习,投资更好的手-物姿态估计(更好的相机、更强的模型、多视角融合)是高回报的方向。这也是 DexCap 等后续工作用手套直接获取更精确手部数据的动机。

Q5:论文说之前的工作发现"RL 加不加示范差不多",但 DexMV 却证明示范极其有用。这个矛盾怎么解释?它说明了什么方法论问题?

提示

矛盾的根源在实验设定不同。之前的结论建立在"任务简单 + 示范极少(25 条)"的基础上——任务简单到 RL 自己也能学会,示范少到发挥不了作用,自然显得"加不加差不多"。DexMV 改变了两个条件:任务更复杂(倒水、放入容器这些 RL 根本学不会的任务)+ 示范大规模(靠平台能采几百条)。在这种设定下,示范的价值就凸显出来了(纯 RL 几乎 0%,加示范到 100%)。方法论启示:一个"结论"往往强烈依赖它的实验设定,把设定推到新的规模/难度,结论可能反转。所以读论文时不能只记结论,要记"在什么条件下的结论";做研究时,改变关键设定(数据规模、任务难度)常能发现新东西。这也正是 DexMV 的核心贡献——它不是发明新算法,而是通过"可扩展的采集平台"改变了游戏规则。

Q6:DAPG(状态-动作)和 SOIL(仅状态)在不同任务上各有胜负——倒水任务 DAPG 好,糖盒 Relocate SOIL 好。为什么?

提示

关键在于"动作从哪来"以及任务的动力学复杂度。DAPG 用示范里已有的动作(由解析逆动力学离线算出),这个动作稳定可靠。SOIL 只用示范的状态,动作要靠在线学一个逆模型来预测。倒水任务里有水粒子这种复杂、难建模的动力学,SOIL 在线学的逆模型学不准,所以表现差;而 DAPG 的解析逆动力学不受水粒子影响,仍能给出合理动作,所以胜出。反过来,糖盒 Relocate 里糖盒又高又薄、掉了很难再抓,需要非常精准的动作,SOIL 在线学的逆模型能根据实际交互不断修正、给出更贴合的动作,反而比离线算的更准,所以 SOIL 好。总结:动力学越复杂/难建模,用解析动作的 DAPG 越稳;越需要根据实际交互精调动作,在线学逆模型的 SOIL 越有优势。

Q7:DexMV 用普通 RGB-D 相机录人手,成本低、可扩展。但如果要把它扩展到"任意日常物体、任意灵巧任务",你觉得最大的瓶颈会在哪?

提示

瓶颈会出现在几个地方:(1) 物体姿态估计的泛化——PVN3D 需要在特定物体(YCB)上训练,换成任意日常物体(尤其是没有 3D 模型的、透明的、可变形的),6D 姿态估计会失败,而整条流水线依赖它。(2) 重定向的手工设计——TSV、权重等是为特定机械手手工调的,任意任务/任意手可能需要重调,不够自动化。(3) 仿真和奖励的可扩展性——DexMV 依赖仿真环境和精心设计的奖励,为"任意任务"逐一搭仿真、写奖励函数不现实。(4) 接触丰富、可变形物体——倒水已经很难,衣物折叠、揉面团这类可变形物体的姿态估计和仿真都是开放难题。改进方向:用更通用的类别级/无模型姿态估计、自动化的重定向、减少对奖励设计的依赖(如结合大模型或直接从视频学奖励)、以及用手套等设备直接获取精确手部数据(这正是 DexCap 的思路)。

所以这一节是想说:能回答这 7 题,你就真正理解了 DexMV 为什么融入 RL 而非行为克隆、为什么用多组 TSV、为什么要最小 jerk,以及它的方法论贡献和扩展瓶颈。


一些好奇心问答(FAQ)

Q1:DexMV 到底是数据集、算法还是平台? 主要是"平台 + 流水线",不是新算法。它提供了配对的视觉采集系统和仿真系统(平台),以及"姿态估计→示范翻译→模仿学习"的流水线,其中"示范翻译"是核心技术创新。模仿学习部分用的是现成算法(DAPG/SOIL/GAIL+)做 benchmark。

Q2:为什么用两个相机而不是一个? 主要为应对遮挡——操作时手会挡住自己的一部分,两个角度(正面 + 侧面)能互补看到更多。实验也证明双相机策略成功率明显更高(84.7% vs 66.7%),且能提供更平滑的轨迹。

Q3:机械手是哪个?多少自由度? 用的是 Adroit Robotic Hand,30 个自由度(24 个转动关节 + 1 个 6 自由度自由关节)。对比人手 MANO 模型是 45 自由度(15 球关节 ×3)——两者结构不同,正是重定向要解决的难题。

Q4:有哪些任务? 三类:Relocate(把物体搬到目标点,用 5 种 YCB 物体)、Pour(把杯里的粒子倒进容器)、Place Inside(把物体放进容器)。后两个是需要多步骤的序列任务,更难。

Q5:采集一条示范要多久? 很快,约 100 条/小时。这是 DexMV 相比 VR 遥操作的核心优势——便宜、快、可扩展,从而能采集大规模示范。

Q6:策略是在真机上跑的吗? 论文的策略评测主要在 MuJoCo 仿真里。视觉采集是真实人手视频,但策略学习和评测在仿真中,真机部署需要额外的 sim-to-real 迁移。

所以这一节是想说:DexMV 的实操问题(是平台不是算法、双相机原因、机械手规格、任务类型、采集速度、评测环境)都有明确答案,核心就是"廉价采集 + 跨形态翻译"这一招。


如果你想再深入

按"必读前置 → 方法来源 → 同族 → 后续"排序:

  1. 方法来源:DAPG(Rajeswaran et al. 2018) — DexMV 用的核心模仿学习算法,理解"如何把示范融入策略梯度"。
  2. 手模型基础:MANO(Romero et al. 2017) — 人手参数化表示的地基,理解姿态估计的输出。
  3. 物体姿态:PVN3D — 6-DoF 物体姿态估计,理解 DexMV 感知上游。
  4. 同族采集:DexCap — 本仓库有笔记,用手套 + 相机进一步提升采集精度和便捷性,是 DexMV 的精神续作。
  5. 后续策略:DP3(3D Diffusion Policy) — 本仓库有深读笔记,用 3D 扩散策略做灵巧操作,代表动作生成骨干的升级。

所以这一节是想说:把 DAPG + MANO + DexMV + DexCap + DP3 连起来读,就能看清"从人类数据学灵巧操作"从采集到策略的完整技术脉络。


原文信息

BibTeX

@inproceedings{qin2022dexmv,
  title     = {DexMV: Imitation Learning for Dexterous Manipulation from Human Videos},
  author    = {Qin, Yuzhe and Wu, Yueh-Hua and Liu, Shaowei and Jiang, Hanwen and Yang, Ruihan and Fu, Yang and Wang, Xiaolong},
  booktitle = {Proceedings of the European Conference on Computer Vision (ECCV)},
  year      = {2022}
}

链接

所以这一节是想说:这是 Qin et al. 2022 年发表在 ECCV 的工作,用"人手视频采集 + 跨形态示范翻译 + 融入 RL 的模仿学习",第一次系统性地让机械手从人手视频里学会复杂灵巧操作。

引用本笔记 / Cite this note
BibTeX
@online{eai_dexmv_2026,
  title       = {(readable note) DexMV},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dexmv/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?