DexCap
这是一份写给"没接触过动捕和灵巧操作"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 dexmv 深读笔记再看本篇。
一句话讲什么(TL;DR)
DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数据翻译成机器人动作、用点云扩散策略学习,还能在机器人执行时人工实时纠错。结果:仅用 30 分钟人手数据,双臂灵巧机器人在剪刀剪纸、泡茶这类超难任务上都能做出来,采集速度是传统遥操作的 3 倍。
所以这一节是想说:DexCap 的核心就是"穿着走、抗遮挡、带 3D 点云的便携动捕 + 直接学灵巧策略",把采集灵巧操作数据从实验室搬到了真实世界。
这是个什么场景
想象你要教一台双臂灵巧机器人(两条 Franka 机械臂 + 两只 16 关节的 LEAP 灵巧手)做"泡茶":拧开茶叶罐盖、用镊子夹茶叶、倒进壶里。这种任务需要极其精细的手指配合。
要教它,就得给它大量"人是怎么做的"示范。问题是采集示范太难:
- 遥操作:人远程操控真机器人来采数据。慢(机器人动得慢)、贵(要有真机器人)、难扩展。
- 单相机视觉追踪人手:便宜,但手一遮挡(操作时手指经常互相遮挡、被物体挡住)就追丢;而且 2D 相机估不准 3D 手部位置。
DexMV(本仓库有笔记)用人手视频开了个头,但它依赖视觉姿态估计(受遮挡影响)、且要额外在仿真里训练。能不能有一套设备,让人徒手在真实世界里干活,就直接、准确、抗遮挡地录下训练机器人所需的一切(精确 3D 手部运动 + 环境观测)?
DexCap 要解的题就是这个:做一套便携、抗遮挡、带 3D 观测的动捕系统,让灵巧操作数据能像拍视频一样在野外大规模采集,并能直接训出机器人策略。
所以这一节是想说:灵巧操作卡在"数据从哪来",遥操作贵、视觉追踪怕遮挡,DexCap 想用可穿戴动捕在真实世界里徒手采集高质量 3D 数据。

之前的人怎么做的,为什么不够好
方案 A:遥操作真机器人采数据 人用 VR/手套远程操控机器人做任务。类比:隔着手套教徒弟,还得徒弟(机器人)在场。问题:慢、贵、必须有真机器人硬件,难以大规模扩展。
方案 B:单视角视觉追踪人手 用一个相机拍人手、估计姿态。类比:只用一个摄像头看厨师的手。问题:(1) 手-物交互时遮挡频繁,一遮就追丢;(2) 2D 方法估不准 3D 手部位置(依赖假设的固定相机内参),而 3D 精度对机器人策略至关重要。
方案 C:电磁手套(EMF glove) 用电磁传感器追踪手指,抗遮挡。问题:只测手指,测不了手腕在世界坐标系里的 6 自由度位姿——而末端执行器的位姿对机器人策略学习又极其关键。
方案 D:IMU 全身动捕套装 可穿戴、能测手腕位置。问题:主要做全身、缺细粒度手指动作;且 IMU 长时间用会漂移。
方案 E:从人类视频学(DexMV、DexVIP、VideoDex) 从 2D 视频学运动先验。问题:数据在 2D 图像空间,无法直接训 3D 里的 6 自由度策略,通常还需额外遥操作数据来补。
核心难题:怎么做一套便携 + 抗遮挡 + 细粒度手指 + 世界系 6-DoF 手腕 + 3D 环境观测五合一的采集系统,让数据能直接训低层控制策略?
所以这一节是想说:遥操作贵、视觉怕遮挡、电磁手套缺手腕、IMU 会漂移、视频是 2D——没有一套能同时满足"便携 + 抗遮挡 + 精确 3D + 带环境观测"的系统,DexCap 来补这个空。
这篇论文的新想法
类比:DexCap 就像给数据采集者穿上一套"动捕外骨骼摄影背心"——你穿着它随便去哪、徒手干活,它就悄悄把你的每一个手指动作、手腕轨迹、和眼前的立体场景全录下来,回头直接喂给机器人学。
DexCap 的核心判断:从人手学灵巧操作,最缺的是"精确的 3D 手部信息(6-DoF 手腕位姿 + 3D 指尖位置)"——这正是之前系统给不了的,而 DexCap 用巧妙的工程设计把它补齐了。
它由两部分组成:
DexCap(硬件系统):四大目标——细粒度手指追踪、精确 6-DoF 手腕位姿、与手对齐的 3D 观测、极致便携。实现方式:
- **电磁手套(Rokoko)**测手指——抗遮挡(不靠视觉)。
- 每只手背上一个 Realsense T265 相机,用 SLAM 追踪手腕 6-DoF 位姿——便携、能自纠漂移、还给出手腕朝向。
- 胸前一个 Realsense L515 RGB-D LiDAR 相机录 3D 环境。
- 一个 3D 打印相机架做秒级标定:先把所有追踪相机放架子里(固定相对变换),再取下装到手上,从而把手部追踪结果统一到胸前相机坐标系。整套装在背包里(Intel NUC + 电池),约 40 分钟续航、3.96 磅、成本控制在 4000 美元内。
DexIL(学习算法):三步——
- 数据重定向:用逆运动学(IK)把人手指尖对齐到机械手指尖,6-DoF 手腕位姿初始化 IK;RGB-D 转成统一世界系点云。
- 点云扩散策略:用基于点云的 Diffusion Policy 学动作(输出未来目标位姿序列)。
- 人在环纠错(可选):机器人执行时,人穿着 DexCap 实时给残差修正或直接遥操作,纠错数据再用来微调策略。
【DexCap 五合一硬件 → DexIL 三步学习】
穿在身上、徒手采集:
电磁手套(Rokoko) ───── 手指(抗遮挡, 不靠视觉)
左右手背 T265 相机 ─── SLAM 追踪手腕 6-DoF 位姿(可自纠漂移)
胸前 L515 RGB-D LiDAR ─ 3D 环境点云
3D打印相机架 ───────── 秒级标定, 统一到胸前相机坐标系
(背包: Intel NUC + 电池; ~3.96磅; <$4000; ~40分钟续航)
│
▼ DexIL 三步
①重定向(IK: 人指尖→机械指尖; RGB-D→世界系点云)
②点云 Diffusion Policy(输出未来目标位姿序列)
③人在环残差纠错(可选, 数据回灌微调)
│
▼
可直接部署的灵巧操作策略
所以这一节是想说:DexCap = 五合一便携动捕硬件(补齐精确 3D 手部信息)+ DexIL 三步算法(重定向 → 点云扩散策略 → 人在环纠错)。
它分几步做的(方法)
DexCap + DexIL 的完整数据流:
人穿 DexCap 徒手干活
│
├─ Rokoko 电磁手套 ──▶ 手指 3D 关节位置 (抗遮挡)
├─ 手背 T265 ×2 + SLAM ──▶ 手腕 6-DoF 位姿 (自纠漂移)
└─ 胸前 L515 LiDAR ──▶ RGB-D 环境
│
▼ 【标定】3D打印相机架, ~10秒, 统一到胸相机坐标系
│
▼ 【DexIL 步骤1: 数据重定向】
├─ 指尖 IK: 人手指尖 → LEAP手(16关节,去小指)指尖对齐
├─ 手腕6-DoF初始化 IK
└─ RGB-D → 统一世界系点云 (去掉躯干移动、去掉桌面)
│
▼ 【DexIL 步骤2: 点云扩散策略】
点云 o_t (K点×6) + 本体状态 s_t → 扩散生成动作序列 a_t..a_{t+d}
│
▼ 【DexIL 步骤3: 人在环纠错(可选)】
残差修正 / 脚踏板切遥操作 → 纠错数据 → 微调策略
│
▼ 双臂灵巧机器人 (2×Franka + 2×LEAP手, 20Hz)
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 硬件·手指追踪:电磁手套
类比:不用眼睛看手指(会被挡),而是让每根指尖自带一个"电磁小信标",随时报告自己在哪。
输入:人手做操作。
处理:用 Rokoko 电磁手套——每根指尖嵌一个微型磁传感器,手背有信号接收枢纽,测出指尖相对枢纽的 3D 位移。因为不靠视觉,所以手-物交互中频繁的遮挡完全不影响它(对比视觉方法 HaMeR 一遮挡就失败)。
输出:细粒度手指 3D 关节位置。
小结:电磁手套让手指追踪抗遮挡、精确,解决了视觉方法最大的痛点。
5.2 硬件·手腕追踪:手背相机 + SLAM
类比:给每只手背装一个"会自己画地图、认路"的小相机,随时知道手在房间里的准确位置和朝向。
输入:人手在环境中移动。
处理:每只手背装一个 Intel Realsense T265 相机,融合双鱼眼图像 + IMU,用 SLAM 建图并追踪手腕的 6-DoF 位姿。三大好处:(1) 便携——不需要第三视角相机看到手;(2) SLAM 能用建好的地图自纠位置漂移(解决 IMU 漂移问题),适合长时间采集;(3) IMU 提供手腕朝向信息,对机器人策略很关键。
输出:世界坐标系下的手腕 6-DoF 位姿轨迹。
小结:SLAM 手腕追踪同时解决了"便携""抗漂移""带朝向"三个问题,补上了电磁手套缺的手腕位姿。
5.3 硬件·3D 观测与秒级标定
类比:胸口挂一个"立体摄像头"记录你眼前的场景,再用一个巧妙的卡槽设计,10 秒就把手和场景的坐标对齐。
输入:采集时的环境 + 各相机。
处理:胸前装 Realsense L515 RGB-D LiDAR 相机录 3D 环境。关键是标定:设计一个 3D 打印相机架,开始时把所有追踪相机插在架子的槽里(保证相机间变换恒定),再取下装到手套上——这样就能用这个恒定的初始变换,把手部追踪结果转到胸前相机的观测坐标系。整个标定约 10 秒。另在 LiDAR 下方装一个鱼眼追踪相机做更稳的 SLAM,它的初始位姿定义为所有数据流的世界坐标系。
输出:与手部运动对齐、在统一世界系下的彩色点云观测。
小结:胸前 LiDAR + 卡槽式秒级标定,让"手部运动"和"3D 环境"在同一坐标系里对齐,这是数据能用来训策略的前提。
5.4 DexIL 步骤一:数据重定向
类比:人手和 LEAP 手大小不同(LEAP 大约 50%),得把人的动作"换算"成机械手能做的动作,还要让画面看起来也像机器人在做。
输入:DexCap 采集的人手 6-DoF 手腕位姿 + 手指位置 + RGB-D。
处理:
- 动作重定向:研究发现指尖是手接触物体最频繁的部位,所以用逆运动学(IK)匹配指尖位置,算出 LEAP 手的 16 维关节位置(LEAP 是四指,去掉小指信息);6-DoF 手腕位姿当 IK 的初始参考。机器人本体状态 s_t = (手腕位姿 p_t, 手指关节 J_t),动作标签就是下一时刻状态 a_t = s_{t+1}(位置控制)。
- 观测后处理:把 RGB-D 转成点云,并转到统一世界坐标系——这样能去掉采集时人躯干移动带来的相机运动,得到稳定观测;点云还便于编辑对齐到机器人可达空间、去掉桌面等无关点。此外用前向运动学把机器人模型的连杆点云并入观测,弥合人手/机器手的视觉差异。
输出:机器人本体状态 s_t、动作 a_t、点云观测 o_t。
小结:指尖 IK 解决"人手→机械手"的动作换算,点云转世界系解决"移动相机→稳定观测",是让野外数据能训策略的关键两步。
5.5 DexIL 步骤二:点云扩散策略
类比:双臂灵巧机器人的动作维度极高(两条 7 自由度臂 + 两只 16 关节手),像要一次画出一整张高清图——扩散模型正擅长这种"高维复杂分布"的生成。
输入:点云观测 o_t(N 点下采样到 K 点,拼上 RGB 颜色成 K×6)+ 本体状态 s_t。
处理:把控制问题当成轨迹生成——策略 π 处理点云 + 本体状态,生成未来动作序列 (a_t, ..., a_{t+d})。用 Diffusion Policy 当动作解码器(实测优于 MLP 的 BC-RNN)。点云编码器用 Perceiver(实测优于 PointNet,双手多物体任务上高 20%)。训练时对点云和轨迹做随机 2D 平移增强。
输出:机器人动作序列(双臂 + 双手的目标位姿)。
小结:点云扩散策略专治"高维双臂灵巧动作",Perceiver 编码器 + 数据增强让它在复杂任务上更强。
5.6 DexIL 步骤三:人在环纠错
类比:机器人先自己学个大概,遇到搞不定的细节(比如剪刀要把手指插进握把深处),人穿着 DexCap 实时"手把手"纠一下,机器人再从纠错里学。
输入:训好的初始策略 + 执行时的人工修正。
处理:因为简单重定向没法填平所有人-机差异(如手指长度比例不同导致对剪刀施力不同),提供两种纠错模式:
- 残差修正:人手相对初始状态的位移 (Δp, ΔJ) 当残差动作,按系数 α、β 加到策略动作上(β 建议 <0.1,避免手指动太快)。
- 遥操作:踩脚踏板切换,直接用人手腕位移驱动机器人手腕、指尖跟随人指尖。 纠错通常只发生在小段轨迹里,省人力。纠错数据存进新数据集 D′,和原数据 D 等概率采样一起微调策略。
输出:微调后、能做超难任务的策略。
小结:人在环纠错用少量实时修正补上重定向填不平的人-机差异,是攻克剪刀、泡茶这类超难任务的关键。
5.7 为什么"便携动捕 + 点云 + 人在环"是关键
- 便携动捕补齐精确 3D:抗遮挡手指 + SLAM 手腕 + LiDAR 环境,一次给全低层控制所需的精确 3D 信息。
- 点云统一世界系解决移动相机:野外采集躯干会动,转成世界系点云才能得到稳定可学的观测(图像方法在野外数据上几乎归零)。
- 人在环纠错填平残余差异:IK 重定向 + 少量人工纠错,攻克力控/精细任务。
所以这一节是想说:DexCap 的方法七步(手指→手腕→观测标定→重定向→点云扩散→人在环→整体),核心是"用便携动捕拿到精确 3D + 用点云世界系稳定观测 + 用人在环补差异"。

关键数字(What works)
数字本身不重要,重要的是它们说明"便携动捕 + 点云扩散"到底值多少。
数字 1:仅用 DexCap 数据的成功率(%,3 个基础任务)
| 方法 | Sponge picking | Ball collecting | Plate wiping | 平均 |
|---|---|---|---|---|
| BC-RNN-img(图像) | 0 | 0 | 0 | 0 |
| BC-RNN-img-mask | 25 | 10 | 10 | 15 |
| BC-RNN-point | 45 | 30 | 25 | 33 |
| DP-img(图像) | 0 | 0 | 0 | 0 |
| DP-img-mask | 55 | 40 | 30 | 42 |
| DP-point-raw | 70 | 70 | 40 | 60 |
| DP-point | 75 | 65 | 50 | 63 |
| Ours (DP-perc) | 85 | 60 | 70 | 72 |
关键含义:仅 30 分钟人手数据,DexIL(DP-perc)平均 72%。图像输入直接归零(人手/机器手视觉差异太大),点云输入无需 mask 就 >60%,Perceiver 比 PointNet 强(尤其双手任务)。
数字 2:Packaging(野外数据 + 30 次纠错,成功率 %)
| 方法 | 野外-Subtask | 野外-All | 野外-Unseen | +纠错-Subtask | +纠错-All | +纠错-Unseen |
|---|---|---|---|---|---|---|
| BC-RNN-img-mask | 0 | 0 | 0 | 23 | 7 | 0 |
| BC-RNN-point | 33 | 23 | 16 | 40 | 27 | 22 |
| DP-img-mask | 17 | 0 | 0 | 47 | 33 | 0 |
| Ours | 70 | 47 | 40 | 83 | 57 | 42 |
关键含义:野外数据下图像方法几乎归零(相机随躯干动),DexIL 转世界系点云稳定,达 70% subtask、40% 泛化到未见物体;加 30 次纠错再涨到 83%/57%。
数字 3:超难任务(成功率 %)
| 任务 | 仅数据-Subtask | 仅数据-All | +纠错-Subtask | +纠错-All |
|---|---|---|---|---|
| Scissor cutting(剪刀剪纸) | 0 | 0 | 45 | 20 |
| Tea preparing(泡茶/拧盖) | 30 | 0 | 65 | 25 |
关键含义:剪刀、泡茶这类需要精细力控的超难任务,光靠数据几乎做不了整任务,但加 30 次人在环纠错就能做到 20-25% 全任务成功、45-65% 子任务成功。
数字 4:系统与采集效率
| 维度 | 数据 |
|---|---|
| 追踪频率 | 60Hz(后降采样到 20Hz 匹配机器人) |
| 采集速度 | 传统遥操作的 3 倍(接近人自然动作速度) |
| 续航 / 重量 / 成本 | ~40 分钟 / 3.96 磅 / <4000 美元 |
| 标定时间 | <10 秒 |
| 机器人 | 2×Franka 臂 + 2×LEAP 手(16 关节),20Hz |
关键含义:便携、便宜、快——这正是"能大规模采集"的前提。
所以这一节是想说:数据证明四件事——仅 30 分钟数据就 72%、野外数据靠点云世界系才能用、人在环纠错攻克超难任务、系统便携高效可扩展。
实验结果说明了什么
问题一:DexCap 数据质量到底怎么样? 高。可视化显示它能在所有视角下把人手动作和物体点云精确对齐,重定向后的机器人手也在同一 3D 空间精确对齐。对比 SOTA 视觉方法 HaMeR:视觉方法在自遮挡时要么检测不到手、要么估错指尖,而 DexCap 电磁手套 + SLAM 抗遮挡、且能给出准确 3D 位置(视觉方法受限于 2D 投影损失和假设的相机内参)。
问题二:不用任何真机数据,能直接训出灵巧策略吗? 能。仅 30 分钟 DexCap 人手数据,单手抓放和双手协调任务平均 72% 成功率。这是核心贡献——第一次证明"纯人手动捕数据(零真机数据)"就能训出真机灵巧策略。
问题三:哪些架构选择最关键? 三点:(1) 图像输入完全失败(人手/机器手视觉差异太大),点云输入无需 mask 就能 >60%——点云是弥合视觉差异的关键;(2) 扩散策略比 MLP 的 BC-RNN 平均高 25%——生成式策略更适合高维灵巧动作;(3) Perceiver 编码器比 PointNet 高(双手多物体任务高 20%)。
问题四:野外采集的数据能用吗? 能,但必须转世界系点云。野外采集时人躯干会动导致相机视角变化,图像方法在野外数据上几乎归零;DexIL 把点云转到统一世界系、隔离躯干运动,得到稳定观测,70% subtask、还能泛化到未见物体(40%)。
问题五:数据不够时人在环纠错帮多大忙? 帮很大,尤其对精细/力控任务。仅 30 次纠错,Packaging 全任务从 47% 涨到 57%,剪刀从 0 到 20%,泡茶从 0 到 25%。因为纠错数据补上了 IK 重定向填不平的人-机差异(如手指长度导致的施力差异)。但对未见物体提升有限(纠错数据太少)。
所以这一节是想说:实验系统回答了五个问题——数据质量高且抗遮挡、零真机数据可训、点云+扩散+Perceiver 三选择关键、野外数据靠世界系点云、人在环纠错攻坚。
你应该懂的几个新词
动作捕捉(mocap):记录人体/手部运动的技术,DexCap 是一套便携的手部 mocap 系统。
电磁手套(EMF glove):用电磁场传感器测手指位置的手套,抗视觉遮挡,是 DexCap 手指追踪的核心。
SLAM(同时定位与建图):相机边走边建环境地图、边定位自己,DexCap 用它追踪手腕 6-DoF 位姿并自纠漂移。
6-DoF 位姿:完整的位置(xyz)+ 朝向(三个旋转),手腕/末端执行器需要它。
逆运动学(IK):已知指尖要到的目标位置,反解出各关节角度,用于把人手指尖对齐到机械手指尖。
点云(point cloud):一堆 3D 点表示场景,DexCap 的策略观测输入,能弥合人手/机器手的视觉差异。
Diffusion Policy(扩散策略):用扩散模型从噪声生成动作序列的策略,擅长高维动作,DexIL 的动作解码器。
Perceiver 编码器:一种能处理大规模输入的注意力编码器,DexIL 用它编码点云,效果优于 PointNet。
人在环纠错(human-in-the-loop correction):机器人执行时人实时给残差修正或遥操作,纠错数据用来微调策略。
重定向(retargeting):把人手动作换算到结构/大小不同的机械手上(LEAP 手比人手大 ~50%)。
所以这一节是想说:这十个词是读任何"可穿戴动捕 + 从人手学灵巧操作"论文都会反复出现的基础词汇。
它有什么搞不定的
- 续航受限:电池只够约 40 分钟连续采集,长时间采集受限(论文明确列为局限)。
- 人-机手尺寸差异:指尖 IK 重定向无法完全填平人手和机械手的尺寸/比例差异(有些机器手指更粗),像弹钢琴这种任务很难做。
- 缺力觉信息:DexCap 只录 3D 观测和运动,没有力/触觉传感——导致稳定盒子、精细施力等任务受限(论文计划用共形触觉织物补)。
- 依赖人在环纠错攻难关:剪刀、泡茶等超难任务光靠数据几乎做不了整任务,必须靠人工纠错才能到 20-25%——说明纯自主学习还不够。
- 纠错对未见物体帮助有限:纠错数据量少(30 次),对泛化到新物体提升不明显。
- 图像输入几乎无用:人手/机器手视觉差异 + 野外移动相机,让图像方法几乎归零,必须依赖点云——限制了可用的观测形式。
所以这一节是想说:DexCap 把"野外便携采集灵巧数据"这条路走通了,但续航、尺寸差异、缺力觉、依赖人工纠错这些问题仍在,后续工作(更省电、更好手设计、加触觉)继续发力。
它和别的论文是什么关系
- 上游(被它借用):
- Diffusion Policy(Chi et al. 2023):DexIL 的动作解码器,本仓库有深读笔记。
- DP3 / 点云策略:点云输入的思路来源,本仓库有 DP3 笔记。
- LEAP Hand:用的开源灵巧手(16 关节四指)。
- IWR:纠错数据和原数据混合采样微调的思路来源。
- 对比关系:
- 和 DexMV(Qin et al. 2022):都从人手学灵巧操作,但 DexMV 用视觉视频(受遮挡、需仿真训练),DexCap 用便携动捕(抗遮挡、直接训真机、带 3D 点云)——是 DexMV 的精神续作和硬件升级。
- 和 遥操作系统(DexPilot 等):DexCap 无需真机、采集快 3 倍。
- 和 手持夹爪采集器(UMI 等):那些是两指夹爪,DexCap 面向多指灵巧手。
- 下游 / 同族:DexCap 推进了"用便携设备大规模采集灵巧数据"这条线,和本仓库的 dexmv、dp3 同属"从人类数据学灵巧操作"脉络。它是"把采集搬到野外"的关键一步。
所以这一节是想说:DexCap 站在 Diffusion Policy + DP3 + DexMV 的肩膀上,用便携动捕硬件解决了"野外采集精确 3D 灵巧数据"的难题,是灵巧操作数据采集的里程碑。
和本导读的关系
本笔记对应导读中"灵巧操作与数据采集"这条线的进阶节点。
灵巧操作的最大瓶颈始终是数据从哪来。DexMV(前作)用人手视频开了头,但受遮挡、需仿真。DexCap 给出了更成熟的答案——一套便携、抗遮挡、带 3D 点云的可穿戴动捕系统,让数据采集从实验室走进真实世界。理解了 DexCap,你就理解了灵巧操作数据采集的演进方向:更便携、更精确、更可扩展。
读完本笔记,建议:先回看 DexMV 笔记(理解"从人手学灵巧操作"这条线的起点和它的局限),再看 DP3 / Diffusion Policy 笔记(理解 DexIL 用的点云扩散策略这个动作生成骨干)。三篇连起来,就能看清"灵巧操作 = 好的数据采集(DexMV→DexCap)+ 好的策略学习(Diffusion Policy/DP3)"这条完整脉络。
对应导读章节:Ch14:模仿学习——DAgger / ACT-ALOHA / UMI。
所以这一节是想说:本笔记是"从人类数据学灵巧操作"这条线的进阶节点,读它前先懂 DexMV,读它时结合 Diffusion Policy/DP3。
思考题
以下问题检验你是否真正理解了 DexCap 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:DexCap 为什么用电磁手套测手指,而不用视觉方法(如 HaMeR)?
提示
核心是抗遮挡 + 3D 精度。手-物交互时遮挡极其频繁:手指互相遮挡、被操作的物体遮挡。视觉方法(如 HaMeR)一遇到遮挡就崩——要么检测不到手,要么估错指尖位置。而电磁手套用电磁场传感器测指尖位置,完全不依赖视觉,遮挡对它毫无影响。此外,视觉方法大多基于 2D 图像投影损失训练,依赖假设的固定相机内参,估不准真实的 3D 手部位置;而机器人策略学习恰恰需要精确的 3D 信息。所以电磁手套在"抗遮挡"和"3D 精度"两方面都胜出,这正是灵巧操作数据采集最看重的。
Q2:手腕追踪为什么用 SLAM 相机,而不用更简单的 IMU?
提示
因为 IMU 有漂移问题。IMU 通过积分加速度来估计位置,误差会随时间累积(积分漂移),长时间采集后位置越来越不准。而机器人策略需要准确的手腕 6-DoF 位姿(末端执行器位置对操作至关重要),漂移会毁掉数据质量。SLAM 相机(T265)通过持续建图和视觉定位,能用建好的地图自动纠正漂移,适合长时间采集。同时它还便携(不需要第三视角相机看到手),并且融合了 IMU 提供手腕朝向信息。所以 SLAM 兼顾了"准确、抗漂移、便携、带朝向",是比纯 IMU 更好的选择。
Q3:DexIL 为什么把 RGB-D 转成"统一世界坐标系"的点云,而不直接用 RGB-D 图像?
提示
关键在于野外采集时相机在动。DexCap 允许人躯干自然移动(这才能野外采集),但这导致胸前相机的视角不断变化。如果直接用 RGB-D 图像,策略就得同时处理"任务本身"和"相机在动"两件事,非常难学——实验显示图像方法在野外数据上几乎归零。而把点云转到一个统一的世界坐标系(定义为 SLAM 主相机初始位姿),就能隔离并去掉躯干移动,得到稳定的观测。此外点云还便于编辑:可以把野外采集中超出机器人可达范围的运动调整到可行范围、去掉桌面等无关点、还能把机器人连杆点云并进来弥合视觉差异。所以点云世界系是让"野外移动相机数据"变得可学的关键转换。
Q4:实验发现图像输入的策略几乎完全失败,而点云输入无需 mask 就能工作。为什么点云能弥合"人手/机器手"的视觉差异?
提示
因为训练数据里画面中是**人手(戴手套)在操作,但评测时是机器手(LEAP 手)**在操作,两者外观差异巨大。图像策略会强烈依赖"看到人手长什么样",换成机器手就完全懵(所以直接归零)。一个补救是把手用白圈 mask 掉,但这会丢失手部细节(在需要精细手指动作的任务如擦盘子上表现差)。点云则不同:(1) 点云下采样过程本身就淡化了人手套和机器手的外观差异;(2) 更重要的是,DexIL 用前向运动学把机器人模型的连杆点云并入观测——训练时就让画面里出现机器手的几何,从而在几何层面对齐人手数据和机器手评测。所以点云能在不 mask、不丢细节的情况下弥合视觉差异,这也是它比图像输入好一大截的原因。
Q5:DexCap 提供了"残差修正"和"遥操作"两种人在环纠错模式。为什么需要两种,它们各适合什么情况?
提示
因为纠正的幅度不同。残差修正:把人手相对初始状态的小位移当作残差加到策略动作上(且手指的 β 系数设得很小 <0.1)。它适合小幅精细调整——策略大方向对、只需微调,人的小动作叠加上去,不会打断策略、能保持精细控制。遥操作(踩脚踏板切换):完全忽略策略、直接用人手驱动机器人。它适合大幅度纠正——当策略彻底跑偏、需要把机器人手大幅移到别处时,残差修正太慢太小,直接接管更高效。设计两种模式让人能根据"错多少"灵活选择:小错用残差(保精细)、大错用遥操作(求效率),纠完再切回。这种灵活性让纠错既高效又省力(纠错通常只发生在小段轨迹)。
Q6:DexCap 目前缺少力觉/触觉信息。这在哪些任务上会成为瓶颈?为什么加了力觉会有帮助?
提示
在需要控制接触力的任务上会成瓶颈。论文举了两个例子:(1) Packaging 中右手要稳住盒子让左手关盖,但没有力信息,机器人不知道该用多大力压住,容易失败;(2) 剪刀任务需要把手指深插进握把并施加合适的力,光靠指尖位置匹配(IK 重定向)无法保证施力正确——因为人手和机器手指长比例不同,同样的指尖位置对应的握力可能完全不同。这类"力敏感"任务上,纯位置/视觉信息不足以判断操作是否成功。加了力觉(如论文计划的共形触觉织物)后,数据里就带上了"接触时用了多大力",策略能学会调节施力,从而更好地稳定物体、精细操作工具。这也是为什么很多灵巧操作后续工作都在往触觉方向发展。
Q7:DexCap 主打"野外可扩展采集",但它仍需人穿戴设备、且需人在环纠错攻难关。你觉得离"真正大规模、低成本"还差什么?
提示
还差几点:(1) 续航——40 分钟就得换电池,大规模连续采集受限,需要更省电的设计;(2) 对人在环纠错的依赖——最难的任务(剪刀、泡茶)光靠采集的数据做不了整任务,必须人工实时纠错才到 20-25%,这本身又需要真机和人力,削弱了"纯采集即可"的可扩展性;(3) 缺力觉导致一大类接触丰富任务受限;(4) 重定向的手工性——指尖 IK 对特定机械手(LEAP)设计,换手要调,且填不平尺寸差异;(5) 数据到策略的效率——目前每个任务仍需专门采集几十到上百条示范。改进方向:更省电硬件、加触觉、更自动/通用的重定向、减少对人在环的依赖(如更强的模仿/自监督算法)、以及跨任务数据复用(让采集的数据能训多任务而非一任务一采)。核心矛盾是"采集便捷性"和"数据能直接用出高性能"之间的平衡。
所以这一节是想说:能回答这 7 题,你就真正理解了 DexCap 为什么用电磁手套、SLAM、世界系点云、两种纠错模式,以及它的力觉缺失和可扩展性瓶颈。
一些好奇心问答(FAQ)
Q1:DexCap 到底是硬件还是算法? 两者都有。DexCap 是便携动捕硬件系统,DexIL 是配套的学习算法(重定向 + 点云扩散策略 + 人在环纠错)。硬件负责采集精确 3D 数据,算法负责把数据变成机器人策略。
Q2:一套 DexCap 多少钱?多重? 成本控制在 4000 美元内,背包总重 3.96 磅,续航约 40 分钟。设计模块化、不限相机/手套/迷你 PC 品牌,且会开源。
Q3:机器人是什么配置? 双臂:两条 Franka Emika 机械臂,各配一只 LEAP 灵巧手(四指、16 关节)。控制频率 20Hz,臂用末端位置控制、手用关节位置控制。评测时把胸前 LiDAR 相机拆下装到机器人之间的支架上,复用同一个观测相机。
Q4:为什么去掉小指? 因为 LEAP 手是四指手,没有小指对应的自由度。所以 IK 重定向时排除人手小指信息。
Q5:采集有多快? 比传统遥操作快 3 倍,接近人自然动作速度。数据先按 60Hz 录,再降采样到 20Hz 匹配机器人控制频率。
Q6:能泛化到没见过的物体吗? 能一定程度。Packaging 任务用多物体野外数据训练后,对未见物体有约 40% 成功率。但人在环纠错对未见物体帮助有限(纠错数据太少)。
所以这一节是想说:DexCap 的实操问题(硬件+算法、成本重量、机器人配置、去小指、采集速度、泛化)都有明确答案,核心就是"便携动捕采集 + 直接学策略"这一招。
如果你想再深入
按"必读前置 → 动作骨干 → 同族 → 后续"排序:
- 必读前置:DexMV(Qin et al. 2022) — 本仓库有深读笔记,"从人手学灵巧操作"的起点,理解 DexCap 在解决它的什么局限。
- 动作骨干:Diffusion Policy(Chi et al. 2023) — DexIL 的动作解码器,本仓库有深读笔记。
- 点云策略:DP3(3D Diffusion Policy) — 本仓库有深读笔记,理解点云 + 扩散做灵巧操作。
- 硬件同族:UMI / 手持夹爪采集器 — 便携采集的另一路线(两指夹爪),对照理解 DexCap 的多指定位。
- 触觉方向:Dexterity from Touch 等 — 理解 DexCap 缺力觉的后续补法。
所以这一节是想说:把 DexMV + Diffusion Policy + DP3 + DexCap 连起来读,就能看清"从人类数据学灵巧操作"从采集到策略的完整技术脉络。
原文信息
BibTeX
@inproceedings{wang2024dexcap,
title = {DexCap: Scalable and Portable Mocap Data Collection System for Dexterous Manipulation},
author = {Wang, Chen and Shi, Haochen and Wang, Weizhuo and Zhang, Ruohan and Fei-Fei, Li and Liu, C. Karen},
booktitle = {Proceedings of Robotics: Science and Systems (RSS)},
year = {2024}
}
链接
- arXiv:arxiv.org/abs/2403.07788
- 项目主页:dex-cap.github.io
所以这一节是想说:这是 Wang et al. 2024 年发表在 RSS 的工作,用"便携抗遮挡动捕 + 点云扩散策略 + 人在环纠错",让灵巧操作数据能在真实世界大规模采集并直接训出机器人策略。
◼
引用本笔记 / Cite this note
@online{eai_dexcap_2026,
title = {(readable note) DexCap},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dexcap/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?