Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 109

DexCap

24 min read · 8418 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过动捕和灵巧操作"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 dexmv 深读笔记再看本篇。

一句话讲什么(TL;DR)

DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数据翻译成机器人动作、用点云扩散策略学习,还能在机器人执行时人工实时纠错。结果:仅用 30 分钟人手数据,双臂灵巧机器人在剪刀剪纸、泡茶这类超难任务上都能做出来,采集速度是传统遥操作的 3 倍。

所以这一节是想说:DexCap 的核心就是"穿着走、抗遮挡、带 3D 点云的便携动捕 + 直接学灵巧策略",把采集灵巧操作数据从实验室搬到了真实世界。


这是个什么场景

想象你要教一台双臂灵巧机器人(两条 Franka 机械臂 + 两只 16 关节的 LEAP 灵巧手)做"泡茶":拧开茶叶罐盖、用镊子夹茶叶、倒进壶里。这种任务需要极其精细的手指配合。

要教它,就得给它大量"人是怎么做的"示范。问题是采集示范太难:

  • 遥操作:人远程操控真机器人来采数据。慢(机器人动得慢)、贵(要有真机器人)、难扩展。
  • 单相机视觉追踪人手:便宜,但手一遮挡(操作时手指经常互相遮挡、被物体挡住)就追丢;而且 2D 相机估不准 3D 手部位置。

DexMV(本仓库有笔记)用人手视频开了个头,但它依赖视觉姿态估计(受遮挡影响)、且要额外在仿真里训练。能不能有一套设备,让人徒手在真实世界里干活,就直接、准确、抗遮挡地录下训练机器人所需的一切(精确 3D 手部运动 + 环境观测)?

DexCap 要解的题就是这个:做一套便携、抗遮挡、带 3D 观测的动捕系统,让灵巧操作数据能像拍视频一样在野外大规模采集,并能直接训出机器人策略。

所以这一节是想说:灵巧操作卡在"数据从哪来",遥操作贵、视觉追踪怕遮挡,DexCap 想用可穿戴动捕在真实世界里徒手采集高质量 3D 数据。


DexCap — 场景示意:这论文要解决的现实问题
Plate Nº IDexCap — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:遥操作真机器人采数据 人用 VR/手套远程操控机器人做任务。类比:隔着手套教徒弟,还得徒弟(机器人)在场。问题:慢、贵、必须有真机器人硬件,难以大规模扩展。

  • 方案 B:单视角视觉追踪人手 用一个相机拍人手、估计姿态。类比:只用一个摄像头看厨师的手。问题:(1) 手-物交互时遮挡频繁,一遮就追丢;(2) 2D 方法估不准 3D 手部位置(依赖假设的固定相机内参),而 3D 精度对机器人策略至关重要。

  • 方案 C:电磁手套(EMF glove) 用电磁传感器追踪手指,抗遮挡。问题:只测手指,测不了手腕在世界坐标系里的 6 自由度位姿——而末端执行器的位姿对机器人策略学习又极其关键。

  • 方案 D:IMU 全身动捕套装 可穿戴、能测手腕位置。问题:主要做全身、缺细粒度手指动作;且 IMU 长时间用会漂移

  • 方案 E:从人类视频学(DexMV、DexVIP、VideoDex) 从 2D 视频学运动先验。问题:数据在 2D 图像空间,无法直接训 3D 里的 6 自由度策略,通常还需额外遥操作数据来补。

  • 核心难题:怎么做一套便携 + 抗遮挡 + 细粒度手指 + 世界系 6-DoF 手腕 + 3D 环境观测五合一的采集系统,让数据能直接训低层控制策略?

所以这一节是想说:遥操作贵、视觉怕遮挡、电磁手套缺手腕、IMU 会漂移、视频是 2D——没有一套能同时满足"便携 + 抗遮挡 + 精确 3D + 带环境观测"的系统,DexCap 来补这个空。


这篇论文的新想法

类比:DexCap 就像给数据采集者穿上一套"动捕外骨骼摄影背心"——你穿着它随便去哪、徒手干活,它就悄悄把你的每一个手指动作、手腕轨迹、和眼前的立体场景全录下来,回头直接喂给机器人学。

DexCap 的核心判断:从人手学灵巧操作,最缺的是"精确的 3D 手部信息(6-DoF 手腕位姿 + 3D 指尖位置)"——这正是之前系统给不了的,而 DexCap 用巧妙的工程设计把它补齐了。

它由两部分组成:

  1. DexCap(硬件系统):四大目标——细粒度手指追踪、精确 6-DoF 手腕位姿、与手对齐的 3D 观测、极致便携。实现方式:

    • **电磁手套(Rokoko)**测手指——抗遮挡(不靠视觉)。
    • 每只手背上一个 Realsense T265 相机,用 SLAM 追踪手腕 6-DoF 位姿——便携、能自纠漂移、还给出手腕朝向。
    • 胸前一个 Realsense L515 RGB-D LiDAR 相机录 3D 环境。
    • 一个 3D 打印相机架做秒级标定:先把所有追踪相机放架子里(固定相对变换),再取下装到手上,从而把手部追踪结果统一到胸前相机坐标系。整套装在背包里(Intel NUC + 电池),约 40 分钟续航、3.96 磅、成本控制在 4000 美元内。
  2. DexIL(学习算法):三步——

    • 数据重定向:用逆运动学(IK)把人手指尖对齐到机械手指尖,6-DoF 手腕位姿初始化 IK;RGB-D 转成统一世界系点云。
    • 点云扩散策略:用基于点云的 Diffusion Policy 学动作(输出未来目标位姿序列)。
    • 人在环纠错(可选):机器人执行时,人穿着 DexCap 实时给残差修正或直接遥操作,纠错数据再用来微调策略。
【DexCap 五合一硬件 → DexIL 三步学习】

穿在身上、徒手采集:
  电磁手套(Rokoko) ───── 手指(抗遮挡, 不靠视觉)
  左右手背 T265 相机 ─── SLAM 追踪手腕 6-DoF 位姿(可自纠漂移)
  胸前 L515 RGB-D LiDAR ─ 3D 环境点云
  3D打印相机架 ───────── 秒级标定, 统一到胸前相机坐标系
  (背包: Intel NUC + 电池; ~3.96磅; <$4000; ~40分钟续航)
        │
        ▼  DexIL 三步
  ①重定向(IK: 人指尖→机械指尖; RGB-D→世界系点云)
  ②点云 Diffusion Policy(输出未来目标位姿序列)
  ③人在环残差纠错(可选, 数据回灌微调)
        │
        ▼
  可直接部署的灵巧操作策略

所以这一节是想说:DexCap = 五合一便携动捕硬件(补齐精确 3D 手部信息)+ DexIL 三步算法(重定向 → 点云扩散策略 → 人在环纠错)。


它分几步做的(方法)

DexCap + DexIL 的完整数据流:

人穿 DexCap 徒手干活
   │
   ├─ Rokoko 电磁手套 ──▶ 手指 3D 关节位置 (抗遮挡)
   ├─ 手背 T265 ×2 + SLAM ──▶ 手腕 6-DoF 位姿 (自纠漂移)
   └─ 胸前 L515 LiDAR ──▶ RGB-D 环境
   │
   ▼ 【标定】3D打印相机架, ~10秒, 统一到胸相机坐标系
   │
   ▼ 【DexIL 步骤1: 数据重定向】
   ├─ 指尖 IK: 人手指尖 → LEAP手(16关节,去小指)指尖对齐
   ├─ 手腕6-DoF初始化 IK
   └─ RGB-D → 统一世界系点云 (去掉躯干移动、去掉桌面)
   │
   ▼ 【DexIL 步骤2: 点云扩散策略】
   点云 o_t (K点×6) + 本体状态 s_t → 扩散生成动作序列 a_t..a_{t+d}
   │
   ▼ 【DexIL 步骤3: 人在环纠错(可选)】
   残差修正 / 脚踏板切遥操作 → 纠错数据 → 微调策略
   │
   ▼ 双臂灵巧机器人 (2×Franka + 2×LEAP手, 20Hz)

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 硬件·手指追踪:电磁手套

类比:不用眼睛看手指(会被挡),而是让每根指尖自带一个"电磁小信标",随时报告自己在哪。

输入:人手做操作。

处理:用 Rokoko 电磁手套——每根指尖嵌一个微型磁传感器,手背有信号接收枢纽,测出指尖相对枢纽的 3D 位移。因为不靠视觉,所以手-物交互中频繁的遮挡完全不影响它(对比视觉方法 HaMeR 一遮挡就失败)。

输出:细粒度手指 3D 关节位置。

小结:电磁手套让手指追踪抗遮挡、精确,解决了视觉方法最大的痛点。

5.2 硬件·手腕追踪:手背相机 + SLAM

类比:给每只手背装一个"会自己画地图、认路"的小相机,随时知道手在房间里的准确位置和朝向。

输入:人手在环境中移动。

处理:每只手背装一个 Intel Realsense T265 相机,融合双鱼眼图像 + IMU,用 SLAM 建图并追踪手腕的 6-DoF 位姿。三大好处:(1) 便携——不需要第三视角相机看到手;(2) SLAM 能用建好的地图自纠位置漂移(解决 IMU 漂移问题),适合长时间采集;(3) IMU 提供手腕朝向信息,对机器人策略很关键。

输出:世界坐标系下的手腕 6-DoF 位姿轨迹。

小结:SLAM 手腕追踪同时解决了"便携""抗漂移""带朝向"三个问题,补上了电磁手套缺的手腕位姿。

5.3 硬件·3D 观测与秒级标定

类比:胸口挂一个"立体摄像头"记录你眼前的场景,再用一个巧妙的卡槽设计,10 秒就把手和场景的坐标对齐。

输入:采集时的环境 + 各相机。

处理:胸前装 Realsense L515 RGB-D LiDAR 相机录 3D 环境。关键是标定:设计一个 3D 打印相机架,开始时把所有追踪相机插在架子的槽里(保证相机间变换恒定),再取下装到手套上——这样就能用这个恒定的初始变换,把手部追踪结果转到胸前相机的观测坐标系。整个标定约 10 秒。另在 LiDAR 下方装一个鱼眼追踪相机做更稳的 SLAM,它的初始位姿定义为所有数据流的世界坐标系。

输出:与手部运动对齐、在统一世界系下的彩色点云观测。

小结:胸前 LiDAR + 卡槽式秒级标定,让"手部运动"和"3D 环境"在同一坐标系里对齐,这是数据能用来训策略的前提。

5.4 DexIL 步骤一:数据重定向

类比:人手和 LEAP 手大小不同(LEAP 大约 50%),得把人的动作"换算"成机械手能做的动作,还要让画面看起来也像机器人在做。

输入:DexCap 采集的人手 6-DoF 手腕位姿 + 手指位置 + RGB-D。

处理

  • 动作重定向:研究发现指尖是手接触物体最频繁的部位,所以用逆运动学(IK)匹配指尖位置,算出 LEAP 手的 16 维关节位置(LEAP 是四指,去掉小指信息);6-DoF 手腕位姿当 IK 的初始参考。机器人本体状态 s_t = (手腕位姿 p_t, 手指关节 J_t),动作标签就是下一时刻状态 a_t = s_{t+1}(位置控制)。
  • 观测后处理:把 RGB-D 转成点云,并转到统一世界坐标系——这样能去掉采集时人躯干移动带来的相机运动,得到稳定观测;点云还便于编辑对齐到机器人可达空间、去掉桌面等无关点。此外用前向运动学把机器人模型的连杆点云并入观测,弥合人手/机器手的视觉差异。

输出:机器人本体状态 s_t、动作 a_t、点云观测 o_t。

小结:指尖 IK 解决"人手→机械手"的动作换算,点云转世界系解决"移动相机→稳定观测",是让野外数据能训策略的关键两步。

5.5 DexIL 步骤二:点云扩散策略

类比:双臂灵巧机器人的动作维度极高(两条 7 自由度臂 + 两只 16 关节手),像要一次画出一整张高清图——扩散模型正擅长这种"高维复杂分布"的生成。

输入:点云观测 o_t(N 点下采样到 K 点,拼上 RGB 颜色成 K×6)+ 本体状态 s_t。

处理:把控制问题当成轨迹生成——策略 π 处理点云 + 本体状态,生成未来动作序列 (a_t, ..., a_{t+d})。用 Diffusion Policy 当动作解码器(实测优于 MLP 的 BC-RNN)。点云编码器用 Perceiver(实测优于 PointNet,双手多物体任务上高 20%)。训练时对点云和轨迹做随机 2D 平移增强。

输出:机器人动作序列(双臂 + 双手的目标位姿)。

小结:点云扩散策略专治"高维双臂灵巧动作",Perceiver 编码器 + 数据增强让它在复杂任务上更强。

5.6 DexIL 步骤三:人在环纠错

类比:机器人先自己学个大概,遇到搞不定的细节(比如剪刀要把手指插进握把深处),人穿着 DexCap 实时"手把手"纠一下,机器人再从纠错里学。

输入:训好的初始策略 + 执行时的人工修正。

处理:因为简单重定向没法填平所有人-机差异(如手指长度比例不同导致对剪刀施力不同),提供两种纠错模式:

  • 残差修正:人手相对初始状态的位移 (Δp, ΔJ) 当残差动作,按系数 α、β 加到策略动作上(β 建议 <0.1,避免手指动太快)。
  • 遥操作:踩脚踏板切换,直接用人手腕位移驱动机器人手腕、指尖跟随人指尖。 纠错通常只发生在小段轨迹里,省人力。纠错数据存进新数据集 D′,和原数据 D 等概率采样一起微调策略。

输出:微调后、能做超难任务的策略。

小结:人在环纠错用少量实时修正补上重定向填不平的人-机差异,是攻克剪刀、泡茶这类超难任务的关键。

5.7 为什么"便携动捕 + 点云 + 人在环"是关键

  • 便携动捕补齐精确 3D:抗遮挡手指 + SLAM 手腕 + LiDAR 环境,一次给全低层控制所需的精确 3D 信息。
  • 点云统一世界系解决移动相机:野外采集躯干会动,转成世界系点云才能得到稳定可学的观测(图像方法在野外数据上几乎归零)。
  • 人在环纠错填平残余差异:IK 重定向 + 少量人工纠错,攻克力控/精细任务。

所以这一节是想说:DexCap 的方法七步(手指→手腕→观测标定→重定向→点云扩散→人在环→整体),核心是"用便携动捕拿到精确 3D + 用点云世界系稳定观测 + 用人在环补差异"。


DexCap — 方法示意:核心 pipeline
Plate Nº IIDexCap — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"便携动捕 + 点云扩散"到底值多少。

数字 1:仅用 DexCap 数据的成功率(%,3 个基础任务)

方法 Sponge picking Ball collecting Plate wiping 平均
BC-RNN-img(图像) 0 0 0 0
BC-RNN-img-mask 25 10 10 15
BC-RNN-point 45 30 25 33
DP-img(图像) 0 0 0 0
DP-img-mask 55 40 30 42
DP-point-raw 70 70 40 60
DP-point 75 65 50 63
Ours (DP-perc) 85 60 70 72

关键含义:仅 30 分钟人手数据,DexIL(DP-perc)平均 72%。图像输入直接归零(人手/机器手视觉差异太大),点云输入无需 mask 就 >60%,Perceiver 比 PointNet 强(尤其双手任务)。

数字 2:Packaging(野外数据 + 30 次纠错,成功率 %)

方法 野外-Subtask 野外-All 野外-Unseen +纠错-Subtask +纠错-All +纠错-Unseen
BC-RNN-img-mask 0 0 0 23 7 0
BC-RNN-point 33 23 16 40 27 22
DP-img-mask 17 0 0 47 33 0
Ours 70 47 40 83 57 42

关键含义:野外数据下图像方法几乎归零(相机随躯干动),DexIL 转世界系点云稳定,达 70% subtask、40% 泛化到未见物体;加 30 次纠错再涨到 83%/57%。

数字 3:超难任务(成功率 %)

任务 仅数据-Subtask 仅数据-All +纠错-Subtask +纠错-All
Scissor cutting(剪刀剪纸) 0 0 45 20
Tea preparing(泡茶/拧盖) 30 0 65 25

关键含义:剪刀、泡茶这类需要精细力控的超难任务,光靠数据几乎做不了整任务,但加 30 次人在环纠错就能做到 20-25% 全任务成功、45-65% 子任务成功。

数字 4:系统与采集效率

维度 数据
追踪频率 60Hz(后降采样到 20Hz 匹配机器人)
采集速度 传统遥操作的 3 倍(接近人自然动作速度)
续航 / 重量 / 成本 ~40 分钟 / 3.96 磅 / <4000 美元
标定时间 <10 秒
机器人 2×Franka 臂 + 2×LEAP 手(16 关节),20Hz

关键含义:便携、便宜、快——这正是"能大规模采集"的前提。

所以这一节是想说:数据证明四件事——仅 30 分钟数据就 72%、野外数据靠点云世界系才能用、人在环纠错攻克超难任务、系统便携高效可扩展。


实验结果说明了什么

问题一:DexCap 数据质量到底怎么样? 高。可视化显示它能在所有视角下把人手动作和物体点云精确对齐,重定向后的机器人手也在同一 3D 空间精确对齐。对比 SOTA 视觉方法 HaMeR:视觉方法在自遮挡时要么检测不到手、要么估错指尖,而 DexCap 电磁手套 + SLAM 抗遮挡、且能给出准确 3D 位置(视觉方法受限于 2D 投影损失和假设的相机内参)。

问题二:不用任何真机数据,能直接训出灵巧策略吗? 能。仅 30 分钟 DexCap 人手数据,单手抓放和双手协调任务平均 72% 成功率。这是核心贡献——第一次证明"纯人手动捕数据(零真机数据)"就能训出真机灵巧策略。

问题三:哪些架构选择最关键? 三点:(1) 图像输入完全失败(人手/机器手视觉差异太大),点云输入无需 mask 就能 >60%——点云是弥合视觉差异的关键;(2) 扩散策略比 MLP 的 BC-RNN 平均高 25%——生成式策略更适合高维灵巧动作;(3) Perceiver 编码器比 PointNet 高(双手多物体任务高 20%)。

问题四:野外采集的数据能用吗? 能,但必须转世界系点云。野外采集时人躯干会动导致相机视角变化,图像方法在野外数据上几乎归零;DexIL 把点云转到统一世界系、隔离躯干运动,得到稳定观测,70% subtask、还能泛化到未见物体(40%)。

问题五:数据不够时人在环纠错帮多大忙? 帮很大,尤其对精细/力控任务。仅 30 次纠错,Packaging 全任务从 47% 涨到 57%,剪刀从 0 到 20%,泡茶从 0 到 25%。因为纠错数据补上了 IK 重定向填不平的人-机差异(如手指长度导致的施力差异)。但对未见物体提升有限(纠错数据太少)。

所以这一节是想说:实验系统回答了五个问题——数据质量高且抗遮挡、零真机数据可训、点云+扩散+Perceiver 三选择关键、野外数据靠世界系点云、人在环纠错攻坚。


你应该懂的几个新词

动作捕捉(mocap):记录人体/手部运动的技术,DexCap 是一套便携的手部 mocap 系统。

电磁手套(EMF glove):用电磁场传感器测手指位置的手套,抗视觉遮挡,是 DexCap 手指追踪的核心。

SLAM(同时定位与建图):相机边走边建环境地图、边定位自己,DexCap 用它追踪手腕 6-DoF 位姿并自纠漂移。

6-DoF 位姿:完整的位置(xyz)+ 朝向(三个旋转),手腕/末端执行器需要它。

逆运动学(IK):已知指尖要到的目标位置,反解出各关节角度,用于把人手指尖对齐到机械手指尖。

点云(point cloud):一堆 3D 点表示场景,DexCap 的策略观测输入,能弥合人手/机器手的视觉差异。

Diffusion Policy(扩散策略):用扩散模型从噪声生成动作序列的策略,擅长高维动作,DexIL 的动作解码器。

Perceiver 编码器:一种能处理大规模输入的注意力编码器,DexIL 用它编码点云,效果优于 PointNet。

人在环纠错(human-in-the-loop correction):机器人执行时人实时给残差修正或遥操作,纠错数据用来微调策略。

重定向(retargeting):把人手动作换算到结构/大小不同的机械手上(LEAP 手比人手大 ~50%)。

所以这一节是想说:这十个词是读任何"可穿戴动捕 + 从人手学灵巧操作"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 续航受限:电池只够约 40 分钟连续采集,长时间采集受限(论文明确列为局限)。
  • 人-机手尺寸差异:指尖 IK 重定向无法完全填平人手和机械手的尺寸/比例差异(有些机器手指更粗),像弹钢琴这种任务很难做。
  • 缺力觉信息:DexCap 只录 3D 观测和运动,没有力/触觉传感——导致稳定盒子、精细施力等任务受限(论文计划用共形触觉织物补)。
  • 依赖人在环纠错攻难关:剪刀、泡茶等超难任务光靠数据几乎做不了整任务,必须靠人工纠错才能到 20-25%——说明纯自主学习还不够。
  • 纠错对未见物体帮助有限:纠错数据量少(30 次),对泛化到新物体提升不明显。
  • 图像输入几乎无用:人手/机器手视觉差异 + 野外移动相机,让图像方法几乎归零,必须依赖点云——限制了可用的观测形式。

所以这一节是想说:DexCap 把"野外便携采集灵巧数据"这条路走通了,但续航、尺寸差异、缺力觉、依赖人工纠错这些问题仍在,后续工作(更省电、更好手设计、加触觉)继续发力。


它和别的论文是什么关系

  • 上游(被它借用)
    • Diffusion Policy(Chi et al. 2023):DexIL 的动作解码器,本仓库有深读笔记。
    • DP3 / 点云策略:点云输入的思路来源,本仓库有 DP3 笔记。
    • LEAP Hand:用的开源灵巧手(16 关节四指)。
    • IWR:纠错数据和原数据混合采样微调的思路来源。
  • 对比关系
    • DexMV(Qin et al. 2022):都从人手学灵巧操作,但 DexMV 用视觉视频(受遮挡、需仿真训练),DexCap 用便携动捕(抗遮挡、直接训真机、带 3D 点云)——是 DexMV 的精神续作和硬件升级。
    • 遥操作系统(DexPilot 等):DexCap 无需真机、采集快 3 倍。
    • 手持夹爪采集器(UMI 等):那些是两指夹爪,DexCap 面向多指灵巧手。
  • 下游 / 同族:DexCap 推进了"用便携设备大规模采集灵巧数据"这条线,和本仓库的 dexmv、dp3 同属"从人类数据学灵巧操作"脉络。它是"把采集搬到野外"的关键一步。

所以这一节是想说:DexCap 站在 Diffusion Policy + DP3 + DexMV 的肩膀上,用便携动捕硬件解决了"野外采集精确 3D 灵巧数据"的难题,是灵巧操作数据采集的里程碑。


和本导读的关系

本笔记对应导读中"灵巧操作与数据采集"这条线的进阶节点。

灵巧操作的最大瓶颈始终是数据从哪来。DexMV(前作)用人手视频开了头,但受遮挡、需仿真。DexCap 给出了更成熟的答案——一套便携、抗遮挡、带 3D 点云的可穿戴动捕系统,让数据采集从实验室走进真实世界。理解了 DexCap,你就理解了灵巧操作数据采集的演进方向:更便携、更精确、更可扩展。

读完本笔记,建议:先回看 DexMV 笔记(理解"从人手学灵巧操作"这条线的起点和它的局限),再看 DP3 / Diffusion Policy 笔记(理解 DexIL 用的点云扩散策略这个动作生成骨干)。三篇连起来,就能看清"灵巧操作 = 好的数据采集(DexMV→DexCap)+ 好的策略学习(Diffusion Policy/DP3)"这条完整脉络。

对应导读章节:Ch14:模仿学习——DAgger / ACT-ALOHA / UMI

所以这一节是想说:本笔记是"从人类数据学灵巧操作"这条线的进阶节点,读它前先懂 DexMV,读它时结合 Diffusion Policy/DP3。


思考题

以下问题检验你是否真正理解了 DexCap 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:DexCap 为什么用电磁手套测手指,而不用视觉方法(如 HaMeR)?

提示

核心是抗遮挡 + 3D 精度。手-物交互时遮挡极其频繁:手指互相遮挡、被操作的物体遮挡。视觉方法(如 HaMeR)一遇到遮挡就崩——要么检测不到手,要么估错指尖位置。而电磁手套用电磁场传感器测指尖位置,完全不依赖视觉,遮挡对它毫无影响。此外,视觉方法大多基于 2D 图像投影损失训练,依赖假设的固定相机内参,估不准真实的 3D 手部位置;而机器人策略学习恰恰需要精确的 3D 信息。所以电磁手套在"抗遮挡"和"3D 精度"两方面都胜出,这正是灵巧操作数据采集最看重的。

Q2:手腕追踪为什么用 SLAM 相机,而不用更简单的 IMU?

提示

因为 IMU 有漂移问题。IMU 通过积分加速度来估计位置,误差会随时间累积(积分漂移),长时间采集后位置越来越不准。而机器人策略需要准确的手腕 6-DoF 位姿(末端执行器位置对操作至关重要),漂移会毁掉数据质量。SLAM 相机(T265)通过持续建图和视觉定位,能用建好的地图自动纠正漂移,适合长时间采集。同时它还便携(不需要第三视角相机看到手),并且融合了 IMU 提供手腕朝向信息。所以 SLAM 兼顾了"准确、抗漂移、便携、带朝向",是比纯 IMU 更好的选择。

Q3:DexIL 为什么把 RGB-D 转成"统一世界坐标系"的点云,而不直接用 RGB-D 图像?

提示

关键在于野外采集时相机在动。DexCap 允许人躯干自然移动(这才能野外采集),但这导致胸前相机的视角不断变化。如果直接用 RGB-D 图像,策略就得同时处理"任务本身"和"相机在动"两件事,非常难学——实验显示图像方法在野外数据上几乎归零。而把点云转到一个统一的世界坐标系(定义为 SLAM 主相机初始位姿),就能隔离并去掉躯干移动,得到稳定的观测。此外点云还便于编辑:可以把野外采集中超出机器人可达范围的运动调整到可行范围、去掉桌面等无关点、还能把机器人连杆点云并进来弥合视觉差异。所以点云世界系是让"野外移动相机数据"变得可学的关键转换。

Q4:实验发现图像输入的策略几乎完全失败,而点云输入无需 mask 就能工作。为什么点云能弥合"人手/机器手"的视觉差异?

提示

因为训练数据里画面中是**人手(戴手套)在操作,但评测时是机器手(LEAP 手)**在操作,两者外观差异巨大。图像策略会强烈依赖"看到人手长什么样",换成机器手就完全懵(所以直接归零)。一个补救是把手用白圈 mask 掉,但这会丢失手部细节(在需要精细手指动作的任务如擦盘子上表现差)。点云则不同:(1) 点云下采样过程本身就淡化了人手套和机器手的外观差异;(2) 更重要的是,DexIL 用前向运动学把机器人模型的连杆点云并入观测——训练时就让画面里出现机器手的几何,从而在几何层面对齐人手数据和机器手评测。所以点云能在不 mask、不丢细节的情况下弥合视觉差异,这也是它比图像输入好一大截的原因。

Q5:DexCap 提供了"残差修正"和"遥操作"两种人在环纠错模式。为什么需要两种,它们各适合什么情况?

提示

因为纠正的幅度不同。残差修正:把人手相对初始状态的小位移当作残差加到策略动作上(且手指的 β 系数设得很小 <0.1)。它适合小幅精细调整——策略大方向对、只需微调,人的小动作叠加上去,不会打断策略、能保持精细控制。遥操作(踩脚踏板切换):完全忽略策略、直接用人手驱动机器人。它适合大幅度纠正——当策略彻底跑偏、需要把机器人手大幅移到别处时,残差修正太慢太小,直接接管更高效。设计两种模式让人能根据"错多少"灵活选择:小错用残差(保精细)、大错用遥操作(求效率),纠完再切回。这种灵活性让纠错既高效又省力(纠错通常只发生在小段轨迹)。

Q6:DexCap 目前缺少力觉/触觉信息。这在哪些任务上会成为瓶颈?为什么加了力觉会有帮助?

提示

在需要控制接触力的任务上会成瓶颈。论文举了两个例子:(1) Packaging 中右手要稳住盒子让左手关盖,但没有力信息,机器人不知道该用多大力压住,容易失败;(2) 剪刀任务需要把手指深插进握把并施加合适的力,光靠指尖位置匹配(IK 重定向)无法保证施力正确——因为人手和机器手指长比例不同,同样的指尖位置对应的握力可能完全不同。这类"力敏感"任务上,纯位置/视觉信息不足以判断操作是否成功。加了力觉(如论文计划的共形触觉织物)后,数据里就带上了"接触时用了多大力",策略能学会调节施力,从而更好地稳定物体、精细操作工具。这也是为什么很多灵巧操作后续工作都在往触觉方向发展。

Q7:DexCap 主打"野外可扩展采集",但它仍需人穿戴设备、且需人在环纠错攻难关。你觉得离"真正大规模、低成本"还差什么?

提示

还差几点:(1) 续航——40 分钟就得换电池,大规模连续采集受限,需要更省电的设计;(2) 对人在环纠错的依赖——最难的任务(剪刀、泡茶)光靠采集的数据做不了整任务,必须人工实时纠错才到 20-25%,这本身又需要真机和人力,削弱了"纯采集即可"的可扩展性;(3) 缺力觉导致一大类接触丰富任务受限;(4) 重定向的手工性——指尖 IK 对特定机械手(LEAP)设计,换手要调,且填不平尺寸差异;(5) 数据到策略的效率——目前每个任务仍需专门采集几十到上百条示范。改进方向:更省电硬件、加触觉、更自动/通用的重定向、减少对人在环的依赖(如更强的模仿/自监督算法)、以及跨任务数据复用(让采集的数据能训多任务而非一任务一采)。核心矛盾是"采集便捷性"和"数据能直接用出高性能"之间的平衡。

所以这一节是想说:能回答这 7 题,你就真正理解了 DexCap 为什么用电磁手套、SLAM、世界系点云、两种纠错模式,以及它的力觉缺失和可扩展性瓶颈。


一些好奇心问答(FAQ)

Q1:DexCap 到底是硬件还是算法? 两者都有。DexCap 是便携动捕硬件系统,DexIL 是配套的学习算法(重定向 + 点云扩散策略 + 人在环纠错)。硬件负责采集精确 3D 数据,算法负责把数据变成机器人策略。

Q2:一套 DexCap 多少钱?多重? 成本控制在 4000 美元内,背包总重 3.96 磅,续航约 40 分钟。设计模块化、不限相机/手套/迷你 PC 品牌,且会开源。

Q3:机器人是什么配置? 双臂:两条 Franka Emika 机械臂,各配一只 LEAP 灵巧手(四指、16 关节)。控制频率 20Hz,臂用末端位置控制、手用关节位置控制。评测时把胸前 LiDAR 相机拆下装到机器人之间的支架上,复用同一个观测相机。

Q4:为什么去掉小指? 因为 LEAP 手是四指手,没有小指对应的自由度。所以 IK 重定向时排除人手小指信息。

Q5:采集有多快? 比传统遥操作快 3 倍,接近人自然动作速度。数据先按 60Hz 录,再降采样到 20Hz 匹配机器人控制频率。

Q6:能泛化到没见过的物体吗? 能一定程度。Packaging 任务用多物体野外数据训练后,对未见物体有约 40% 成功率。但人在环纠错对未见物体帮助有限(纠错数据太少)。

所以这一节是想说:DexCap 的实操问题(硬件+算法、成本重量、机器人配置、去小指、采集速度、泛化)都有明确答案,核心就是"便携动捕采集 + 直接学策略"这一招。


如果你想再深入

按"必读前置 → 动作骨干 → 同族 → 后续"排序:

  1. 必读前置:DexMV(Qin et al. 2022) — 本仓库有深读笔记,"从人手学灵巧操作"的起点,理解 DexCap 在解决它的什么局限。
  2. 动作骨干:Diffusion Policy(Chi et al. 2023) — DexIL 的动作解码器,本仓库有深读笔记。
  3. 点云策略:DP3(3D Diffusion Policy) — 本仓库有深读笔记,理解点云 + 扩散做灵巧操作。
  4. 硬件同族:UMI / 手持夹爪采集器 — 便携采集的另一路线(两指夹爪),对照理解 DexCap 的多指定位。
  5. 触觉方向:Dexterity from Touch 等 — 理解 DexCap 缺力觉的后续补法。

所以这一节是想说:把 DexMV + Diffusion Policy + DP3 + DexCap 连起来读,就能看清"从人类数据学灵巧操作"从采集到策略的完整技术脉络。


原文信息

BibTeX

@inproceedings{wang2024dexcap,
  title     = {DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation},
  author    = {Wang, Chen and Shi, Haochen and Wang, Weizhuo and Zhang, Ruohan and Fei-Fei, Li and Liu, C. Karen},
  booktitle = {Proceedings of Robotics: Science and Systems (RSS)},
  year      = {2024}
}

链接

所以这一节是想说:这是 Wang et al. 2024 年发表在 RSS 的工作,用"便携抗遮挡动捕 + 点云扩散策略 + 人在环纠错",让灵巧操作数据能在真实世界大规模采集并直接训出机器人策略。

引用本笔记 / Cite this note
BibTeX
@online{eai_dexcap_2026,
  title       = {(readable note) DexCap},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dexcap/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?