Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 110

3D Diffusion Policy (DP3)

21 min read · 7404 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过扩散策略和点云"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 diffusion-policy 深读笔记再看本篇。

一句话讲什么(TL;DR)

Diffusion Policy 用 2D 图像当"眼睛",需要上百个示范才学得会。DP3 把眼睛换成"稀疏点云 + 一个极简 MLP 编码器"——只用 10 个示范就能搞定大多数任务,72 个仿真任务平均比 Diffusion Policy 相对提升 24.2%,真机 4 个任务成功率 85%。

所以这一节是想说:DP3 的核心就一句话——给扩散策略换上 3D 眼睛,数据效率和泛化能力都大涨。


这是个什么场景

想象你要教机器人包饺子。你握着机械手亲手演示一遍——这叫一条"示范"。问题是:现在最强的视觉模仿学习方法 Diffusion Policy 每个真机任务要 100 到 200 条示范。包饺子这种长程、易失败的任务,采集几百条示范可能要花好几天,中途还老出错。

为什么要这么多示范?因为 Diffusion Policy 用的是 2D 图像当输入。2D 图像有个先天缺陷:它把三维世界拍平成了平面,丢失了深度和空间几何信息。机器人得从大量图像里"猜"出物体在 3D 空间的真实位置——这需要海量数据。

而且 2D 策略泛化性差:换个视角、换个物体位置、换个外观,模型就容易懵——因为它记的是"像素长什么样",而不是"物体在空间哪里"。

DP3 要解的题:能不能让(离线)模仿学习用尽可能少的示范,学出既鲁棒又能泛化的技能? 它的答案是——把"眼睛"从 2D 图像换成 3D 点云。

所以这一节是想说:2D 图像丢了空间信息导致模仿学习吃数据、泛化差,DP3 用 3D 点云来解这道"少示范、强泛化"的题。


3D Diffusion Policy (DP3) — 场景示意:这论文要解决的现实问题
Plate Nº I3D Diffusion Policy (DP3) — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:2D 图像 Diffusion Policy 用 RGB 图像 + ResNet 编码,扩散生成动作。类比:只看照片猜物体在哪。问题:丢失深度,需 100–200 示范/任务,泛化差(换视角/位置就崩)。

  • 方案 B:关键帧姿态 + 规划的 3D 策略(PerAct、GNFactor、RVT、Act3D) 把模仿学习转成"预测关键帧姿态 + 运动规划"。类比:只标几个关键落点,中间交给规划器连线。问题:(1) 设定不实用——只适合低维、可分解成关键帧的任务,做不了高维密集控制(如灵巧手连续操作);(2) 推理慢——PerAct 只有 2.23 FPS,3D Diffuser Actor 1.67 FPS,跟不上动态任务需要的密集指令。

  • 方案 C:复杂 3D 表示(体素、隐函数、NeRF) 用体素网格或神经隐式场表示 3D 场景。问题:体素内存立方爆炸、NeRF 计算重,推理慢,不适合实时控制。

  • 方案 D:在线学习 / 强化学习 边交互边学。问题:真机在线学有安全隐患、需自动复位、要人干预、硬件成本高。

  • 核心难题:怎么把 3D 空间理解的好处,用又快又简单的方式塞进扩散策略,让它既能做高维密集控制、又能少示范、又能实时推理?

所以这一节是想说:2D 策略吃数据、关键帧 3D 策略慢且设定窄、复杂 3D 表示重,缺一个又快又简单又通用的 3D 扩散策略。


这篇论文的新想法

类比:Diffusion Policy 是个"看照片做事"的人,DP3 给他换上了"深度感知的立体视觉"——但用的不是昂贵复杂的设备,而是一副极简的"3D 眼镜"(稀疏点云 + 一个三层 MLP)。

DP3 的核心判断:扩散策略的动作生成能力已经很强,缺的是好的空间感知条件。与其换更强的动作生成器,不如换更好的眼睛。

具体做法极简:

用单个相机的深度图转成稀疏点云(几百个点),用一个极简三层 MLP 编码器把它压成一个只有 64 维的紧凑 3D 特征向量;然后把这个特征 + 机器人姿态当条件,喂给标准的 Diffusion Policy 去噪生成动作。

关键洞察有三:

  1. 稀疏点云比 RGB-D/体素/深度图都好(消融验证)——它直接表达 3D 几何,又轻。
  2. 极简 MLP 编码器比预训练大编码器(PointNeXt、Point Transformer)还好——控制任务需要的是"物体精确位置",不是 ImageNet 式语义,小编码器端到端训更贴合。
  3. 不用颜色——去掉 RGB 通道反而让外观泛化更好(不被物体颜色误导)。
【换眼睛,不换脑子】

Diffusion Policy(2D):RGB 图 + ResNet ─▶ 扩散生成动作
                      (丢深度; 需 100-200 示范; 换视角/位置就崩)

DP3(3D):单相机深度图 ─▶ 稀疏点云(几百点, 去掉颜色)
                         │ 极简三层 MLP 编码器
                         ▼ 64 维紧凑 3D 特征
   3D特征 + 机器人姿态 ──条件──▶ 标准 Diffusion Policy 去噪生成动作
   (动作生成器完全不变, 只把"眼睛"从 2D 换成轻量 3D)

所以这一节是想说:DP3 不改动作生成器,只把 2D 眼睛换成"稀疏点云 + 极简 MLP"的 3D 眼睛——简单到令人意外,但数据效率和泛化都大涨。


它分几步做的(方法)

DP3 = 感知(Perception)+ 决策(Decision)两部分:

单相机深度图(84×84)
   │
   ▼ 转点云(相机内外参) + 去掉颜色
   │
   ▼ 裁剪(bounding box去掉桌面地面) + FPS下采样到512/1024点
   │
   ▼ DP3 Encoder: 三层MLP(3→64→128→256) + MaxPool + 投影(256→64)
   │
   ▼ 64维紧凑3D特征 v  ─┐
                        ├──▶ Diffusion Policy去噪 (条件: v + 机器人姿态q)
   机器人姿态 q  ────────┘         │
                                  ▼ 动作序列 a

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 感知第一步:用点云表示 3D 场景

类比:不拍平面照片,而是记录物体表面在空间里的一堆采样点。

输入单个相机(不是多相机环绕,为真机实用性)的深度图,尺寸 84×84

处理:用相机内外参把深度图转成点云。不用颜色通道——只保留几何坐标 (x,y,z),这样换个颜色的物体也不会懵(外观泛化更好)。

输出:一朵原始点云。

小结:单相机深度图转成无颜色点云,直接拿到 3D 几何,又不被外观干扰。

5.2 感知第二步:裁剪 + FPS 下采样

类比:只保留"物体所在的那块空间",扔掉桌面地面这些废点,再均匀挑一把代表点。

输入:原始点云(含大量冗余点,如桌面、地面)。

处理:先用一个包围盒(bounding box)裁剪,只留下感兴趣区域的点;再用 最远点采样(FPS, Farthest Point Sampling) 下采样。FPS 相比均匀采样能更好地覆盖 3D 空间、减少采样随机性。实测下采样到 512 或 1024 个点就足够所有任务(仿真和真机)。

输出:一朵稀疏点云(几百个点)。

小结:裁剪去废点、FPS 稀疏化,让点云又轻又能均匀覆盖关键空间。

5.3 感知第三步:DP3 Encoder 压成 64 维紧凑特征

类比:一个极简的"3D 眼镜镜片"——把几百个点压成一个 64 个数字的小向量。

输入:稀疏点云(512/1024 点 × 3 坐标)。

处理DP3 Encoder 概念上极简——

  • 三层 MLP(通道 3→64→128→256),配 ReLU;
  • 最大池化(max-pooling)——这是"顺序无关"操作,因为点云无序,池化后打乱点顺序结果不变;
  • 一个投影头把特征投到紧凑向量(256→64);
  • 中间插 LayerNorm 稳定训练。

最终 3D 特征 v 只有 64 维。消融证明:这个极简编码器甚至超过预训练的 PointNeXt——印证了"控制任务里,精心设计的小编码器好过预训练大编码器"。

输出:64 维紧凑 3D 特征向量 v

小结:三层 MLP + 最大池化 + 投影,把点云压成 64 维,简单却比预训练大编码器更好。

5.4 决策:条件扩散生成动作

类比:和 Diffusion Policy 一模一样的"从雪花里擦出动作",只是这次擦的时候旁边放着一张 3D 空间提示图。

输入:3D 特征 v + 机器人姿态 q(当条件),以及一团高斯噪声 a_K

处理:用标准的卷积版 Diffusion Policy 当动作生成骨干。去噪网络 ε_θ 从噪声 a_K 出发,迭代 K 次逐步去噪成干净动作 a_0

  • 去噪公式(人话):"新一轮动作 = 旧一轮动作 - 网络在 3D 特征和姿态条件下猜出的噪声 + 一点随机扰动"。
  • 训练目标:随机加噪到真动作上,让网络预测加进去的噪声(MSE 损失),条件是 vq
  • 实现细节:用 DDIM 采样器,用 sample prediction(预测样本)而非 epsilon prediction(对高维动作生成更好),训练 100 步、推理 10 步。MetaWorld 训 1000 epoch、其他训 3000 epoch,batch size 128。感知和决策端到端一起训

输出:动作序列 a

小结:把 3D 特征当条件塞进标准扩散策略,端到端训练,DDIM 10 步推理保证实时。

5.5 为什么"简单 3D 表示 + 扩散"是关键

  • 点云直接表达几何:不像 2D 图像要从像素猜空间,点云本身就是 3D 坐标,模型不用浪费数据学"如何从平面还原立体",所以少示范就够。
  • 3D 特征天然泛化:换视角、换位置、换外观、换实例,物体的 3D 几何关系相对稳定,2D 像素则天差地别。
  • 极简编码器 + 稀疏点云 = 快:不像关键帧 3D 策略慢(PerAct 2.23 FPS),DP3 稀疏点云 + 64 维特征让推理速度甚至略快于 2D Diffusion Policy——打破了"3D 策略必然慢"的成见。
  • 消融证明是"设计"而非"3D 本身":给 BCRNN/IBC 也加 3D 表示,提升远不如 DP3——说明成功来自"点云 + 极简编码器 + 扩散"的整体设计,不只是用了 3D。

小结:点云管几何、3D 特征管泛化、稀疏+极简管速度、整体设计管效果——四者叠起来才是 DP3。

5.6 从"预测一段"到"执行一步":滚动时域控制

类比:不是想好一整套动作就闷头做完,而是"看几眼当下 → 规划出未来一小段 → 只执行前几步 → 再看再规划",像开车时不断根据路况微调,而不是一次把方向盘打死。

输入:最近若干帧的观测(点云特征 v + 机器人姿态 q)。

处理:DP3 沿用 Diffusion Policy 的滚动时域(receding-horizon)执行范式——每次条件化在最近的观测上,一次性去噪生成未来一段动作序列(动作分块,action chunk),但只执行其中前面一小段,然后拿新观测重新规划下一段。这样做有两个好处:(1) 生成一整段动作让运动更连贯、减少抖动;(2) 只执行前几步再重规划,让策略能对环境变化(物体被碰动、抓取打滑)及时反应,不会一条道走到黑。因为用了 DDIM 只需 10 步去噪、3D 特征又只有 64 维,这套"预测一段、执行一步、不断重规划"的循环能跑得足够快,满足真机的实时控制需求。

输出:一连串实际下发给机器人的控制指令。

小结:DP3 用"预测一段动作、只执行前几步、拿新观测重规划"的滚动时域控制,兼顾动作连贯性和对变化的响应速度。

5.7 为什么坚持"单相机、无颜色"

类比:越简单的装备越好带、越好复现——用一个便宜相机、连颜色都不要,反而让系统更皮实。

输入:一个部署上的现实约束——真机要好搭、好迁移。

处理:很多 3D 方法要多相机环绕标定,装配和标定成本高、换环境就得重来。DP3 刻意只用单个相机的深度图,牺牲一点视野换来"随便一台带深度的相机就能跑"的实用性。再进一步丢掉颜色通道:颜色会把"这个杯子是红的"这种和任务无关的外观信息也塞进特征,导致换个颜色/材质的物体就失灵;只留几何坐标 (x,y,z),模型学到的是"形状和空间关系",于是换颜色、换实例、换光照都更稳。这两个"做减法"的设计,正是 DP3 数据效率高、泛化好、又容易在真机复现的重要原因。

输出:一套单相机、无颜色、易复现且泛化强的感知前端。

小结:单相机降低部署门槛、去颜色提升外观泛化——两个"做减法"让 DP3 又实用又皮实。


3D Diffusion Policy (DP3) — 方法示意:核心 pipeline
Plate Nº II3D Diffusion Policy (DP3) — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"换 3D 眼睛"到底值多少。

数字 1:72 个仿真任务平均(成功率 %)

域(任务数) DP3 Diffusion Policy
Adroit (3) 68.3 31.7
Bi-DexHands (6) 70.2 61.3
DexArt (4) 68.5 49.0
DexDeform (6) 87.8 90.5
DexMV (2) 99.5 95.0
HORA (1) 71.0 49.0
MetaWorld Easy (28) 90.9 83.6
MetaWorld Medium (11) 61.6 31.1
MetaWorld Hard (6) 31.7 9.0
MetaWorld Very Hard (5) 49.0 26.6
平均 (72) 74.4 ± 29.9 59.8 ± 35.9

关键含义:72 任务平均 相对提升 24.2%,且方差更小(更稳)。越难的任务差距越大(MetaWorld Hard 31.7 vs 9.0)。大多数任务只用 10 个示范

数字 2:与更多基线对比(10 任务平均,成功率 %)

方法 平均
DP3 74.4
Diffusion Policy 44.0
BCRNN 9.8
BCRNN+3D 14.5
IBC 5.0
IBC+3D 10.4

关键含义:给 BCRNN/IBC 加上 DP3 的 3D 编码器(+3D 变体)确实有提升(9.8→14.5,5.0→10.4),但远不如 DP3——证明成功是整体设计而非仅靠 3D

数字 3:3D 空间泛化(MetaWorld Reach,5 示范,1000 次评估成功数)

方法 成功次数(/1000)
BC-RNN 0
IBC 285
Diffusion Policy 327
DP3 415

关键含义:只给 5 个示范,DP3 能泛化到整个 3D 空间(415 成功),2D 方法只在一个平面区域成功(327/285),BC-RNN 直接崩(0)。

数字 4:真机 4 任务

维度 数据
任务 Roll-Up、Dumpling、Drill(Allegro 灵巧手,22 维动作)、Pour(夹爪,7 维)
示范数 每任务仅 40 个
平均成功率 85%
安全性 DP3 极少发出危险指令;基线常发危险指令需人工干预

关键含义:真机灵巧手做可变形物体操作(包卷、包饺子),只要 40 个示范就到 85%,且安全——这是 3D 空间理解带来的意外好处。

数字 5:效率

维度 数据
收敛速度 DP3 约 500 epoch 收敛,Diffusion Policy 慢得多或收敛到次优
推理速度 DP3 略快于 2D Diffusion Policy;远快于 PerAct(2.23 FPS)、3D Diffuser Actor(1.67 FPS)
点数 512 或 1024 点足够所有任务
3D 特征维度 仅 64 维

所以这一节是想说:数据证明四件事——少示范、强泛化、真机安全、还不慢。


实验结果说明了什么

问题一:3D 表示真的比 2D 省数据吗? 是。72 任务平均相对提升 24.2%,且大多只用 10 个示范(vs Diffusion Policy 真机要 100–200)。MetaWorld Reach 的可视化最直观:5 个示范下 DP3 泛化到整个 3D 空间(415/1000),2D 方法只覆盖一个平面(327/1000)。因为点云直接给了几何,模型不用花数据学"从平面还原立体"。

问题二:是"用了 3D"就够了,还是"怎么用 3D"更重要? "怎么用"更重要。给 BCRNN、IBC 也套上 DP3 的 3D 编码器,它们确实涨了(9.8→14.5、5.0→10.4),但远不及 DP3(74.4)。而且消融显示:点云 > RGB-D/深度/体素,极简 MLP 编码器 > PointNeXt/Point Transformer。所以是"稀疏点云 + 极简编码器 + 扩散骨干"这套设计的合力。

问题三:3D 策略一定慢吗? 不一定。这是一个反直觉的发现。人们以为 3D 策略慢(PerAct 2.23 FPS、3D Diffuser Actor 1.67 FPS),但 DP3 用稀疏点云 + 64 维紧凑特征,推理速度甚至略快于 2D Diffusion Policy。关键在于"稀疏 + 紧凑"——不用稠密体素或注意力语言 token。

问题四:真机上有什么意外收获? 安全性。DP3 在真机上极少发出危险/错乱指令,而基线经常发,需要人工干预防止损坏硬件。原因是 3D 空间理解让它对"手该在哪、不该撞哪"有更准的把握,不会像 2D 策略那样因为空间估计错误而乱挥。

所以这一节是想说:实验系统回答了四个问题——3D 确实省数据、设计比 3D 本身更重要、3D 不必慢、还带来真机安全性。


你应该懂的几个新词

模仿学习 / 视觉模仿学习:从示范学"观测→动作",视觉版用图像/深度当观测。

Diffusion Policy(扩散策略):用扩散模型"从噪声去噪出动作序列"的策略。DP3 的动作生成骨干,本仓库有深读笔记。

点云(point cloud):用一堆 3D 点表示场景/物体,直接携带几何信息。DP3 的核心输入。

FPS(最远点采样):一种点云下采样方法,每次挑离已选点最远的点,能均匀覆盖空间,比均匀随机采样更稳。

最大池化(max-pooling)作为顺序无关操作:点云无序,用最大池化聚合特征,打乱点顺序结果不变。

DDIM:扩散模型的快速采样器,训练 100 步、推理 10 步,保证实时。

sample prediction vs epsilon prediction:扩散网络可以预测"去噪后的样本"或"加的噪声",DP3 用前者,对高维动作更好。

紧凑 3D 表示(compact 3D representation):把点云压成低维向量(DP3 是 64 维),当扩散的条件。

泛化维度:空间/视角/外观/实例:换位置、换相机角度、换物体颜色、换具体物体——DP3 在这四方面都能泛化。

灵巧手(dexterous hand):多指机械手(如 Allegro、Shadow),能做精细操作,动作维度高(22–52 维)。

所以这一节是想说:这十个词是读任何"3D + 机器人策略"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 依赖深度传感器质量:DP3 吃深度图转的点云。深度相机在反光、透明、远距离物体上噪声大,点云质量差会直接拖累策略。透明物体(玻璃杯)几乎无解。
  • 单视角有遮挡盲区:为实用只用单相机,被遮挡的部分没有点。复杂堆叠场景里,看不到的物体面无法建模。
  • 仍是行为克隆,OOD 脆弱:和所有 BC 方法一样,观测漂出训练分布就失败。DP3 泛化更好但没根治。
  • 点云预处理需要调:裁剪包围盒、点数(512/1024)是需要按任务设的超参。换场景可能要重调裁剪范围。
  • 没有语言接口:DP3 只吃点云 + 姿态,不能理解语言指令。多任务语言条件设定下,还需接注意力语言 token(那会变慢,就像 3D Diffuser Actor)。
  • 示范仍需人采:40 个真机示范虽少,但仍需人握着灵巧手采集——比 2D 省一个量级,但没到"零示范"。

所以这一节是想说:DP3 大幅提升了数据效率和泛化,但依赖深度质量、单视角遮挡、无语言接口这些问题仍在——后续工作(如接 VLM、多视角、更好传感器)继续发力。


它和别的论文是什么关系

  • 上游(被它借用)
    • Diffusion Policy(Chi et al. 2023):DP3 的动作生成骨干,本仓库有深读笔记。DP3 = Diffusion Policy 换 3D 眼睛。
    • PointNet 系:点云编码的思想源头(顺序无关的最大池化)。DP3 Encoder 是它的极简版。
    • DDPM / DDIM:扩散模型的数学基础和快速采样。
  • 对比关系
    • PerAct / GNFactor / RVT / Act3D:那些用关键帧姿态 + 规划,慢且设定窄;DP3 做密集控制、快、通用。
    • 3D Diffuser Actor:都是 3D 扩散策略,但 3D Diffuser Actor 用注意力接语言 token(更慢),DP3 更轻更快(但无语言)。
    • 给基线加 3D(BCRNN+3D、IBC+3D):证明 DP3 的优势来自整体设计,不只是 3D。
  • 下游 / 同族:DP3 证明了"简单 3D 表示 + 扩散"的威力,影响了后续一批 3D 机器人策略工作。它和本仓库的 dexmv、dexcap 等灵巧操作工作同属"少数据学灵巧技能"这条线。

所以这一节是想说:DP3 站在 Diffusion Policy + PointNet + DDIM 的肩膀上,用"极简 3D 表示"把扩散策略的数据效率和泛化推上新台阶,是 2D→3D 策略演进的关键一步。


和本导读的关系

本笔记对应导读 Ch13:扩散策略——Diffusion Policy / 3D-DP / π0 的第二个模型。

导读 Ch13 讲了扩散策略的演进线:Diffusion Policy(2023,学术原型,2D 图像)→ 3D Diffusion Policy(2024,加入三维感知) → π0(2024,产业级基础模型)。本笔记深入的正是中间这个节点——DP3 如何把 2D 图像输入升级为 3D 点云,解决深度信息缺失、数据效率低、泛化差的问题。

读完本笔记,建议:先回看 diffusion-policy 深读笔记(理解扩散去噪、滚动时域、视觉条件这套地基,DP3 的动作生成完全沿用它),再看 π0 笔记(理解如何用 Flow Matching 加速 + 接 VLM 做跨机体基础模型)。三篇连起来,就是导读 Ch13 "从方法验证(2D)到感知升级(3D)到规模化部署(VLA)"的完整演进。DP3 的贡献是证明了"换更好的感知(3D)比换更强的生成器更划算"这个重要判断。

所以这一节是想说:本笔记是导读 Ch13 "感知升级"这一格的深度展开,读它前先懂 Diffusion Policy,读它后接 π0。


思考题

以下问题检验你是否真正理解了 DP3 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么把 2D 图像换成 3D 点云,就能用少得多的示范学会技能?数据效率的提升来自哪里?

提示

来自"减少了模型需要学习的东西"。2D 图像把三维世界拍平了,模型要从像素里隐式地学"如何从平面还原出物体的 3D 空间位置"——这是一个困难的、需要大量数据的额外任务。点云直接给出了 (x,y,z) 坐标,几何信息是现成的,模型不用浪费示范去学"看图猜空间",可以把有限的数据全用在"学动作"上。换句话说,3D 表示提供了更好的归纳偏置,把感知负担从数据转移到了表示上。

Q2:消融显示极简三层 MLP 编码器竟然超过预训练的 PointNeXt/Point Transformer。这和"预训练大模型更强"的直觉矛盾,怎么解释?

提示

因为控制任务需要的特征和预训练学到的特征不同。PointNeXt/Point Transformer 常在分类/分割任务上预训练,学的是"这是什么物体"的语义特征。但机器人控制需要的是"物体在空间的精确位置和几何关系"——这更简单、更几何。大编码器的语义特征反而可能丢失精确坐标信息,且参数多、少示范下易过拟合。极简 MLP 端到端和策略一起训,直接学"对控制有用的几何特征",更贴合、更省数据。这和 Diffusion Policy 原论文"端到端训小编码器好过冻结大编码器"的观察一致。

Q3:DP3 去掉了点云的颜色通道(只用 xyz)。为什么去掉颜色反而让泛化更好?

提示

因为颜色是"外观"信息,会让模型对特定颜色产生依赖。如果训练时红色杯子总在某位置,模型可能学成"看到红色就抓",换个蓝色杯子就懵。去掉颜色只留几何,模型被迫学"这个形状/位置该怎么操作",与物体颜色无关——所以换外观、换实例时泛化更好。代价是丢失了颜色可能携带的有用信息(如区分同形状不同颜色的物体),但对大多数操作任务,几何比颜色更本质。

Q4:DP3 用最大池化聚合点云特征。为什么必须用"顺序无关"的操作,而不能像处理图像那样直接用卷积或全连接?

提示

因为点云是无序集合——同样一朵点云,你把点的排列顺序打乱,它表示的还是同一个物体。如果用普通全连接/卷积(对输入顺序敏感),同一朵点云换个点序就会得到不同特征,这显然不对。最大池化(或求和/平均)是"置换不变"的——不管点以什么顺序输入,池化结果都一样。所以点云网络必须用这类顺序无关的聚合操作,这也是 PointNet 的核心思想。

Q5:论文发现给 BCRNN、IBC 加上 3D 编码器(+3D 变体)也有提升,但远不如 DP3。这说明了什么?如果只把"用了 3D"当成 DP3 成功的原因,会犯什么错?

提示

说明成功来自"整体设计的合力",而非单一因素"3D"。BCRNN+3D 从 9.8 涨到 14.5、IBC+3D 从 5.0 涨到 10.4,确实 3D 有帮助,但都远不及 DP3 的 74.4。差距来自动作生成骨干——扩散策略的表达力远强于 RNN 回归和能量模型。如果只把"用了 3D"当原因,就会误以为随便什么策略加 3D 都能到 DP3 水平,忽略了"扩散骨干 + 稀疏点云 + 极简编码器 + 端到端训练"这套设计的协同。这是控制变量法的重要教训。

Q6:DP3 在真机上"极少发出危险指令",而基线经常发。为什么 3D 空间理解会带来安全性?

提示

因为 3D 表示让模型对"物体和机器人在空间的真实位置"有准确把握,从而生成的动作在空间上更合理、更少越界。2D 策略因为要从像素猜空间,空间估计一旦出错(比如把远处物体判成近处),就可能生成把手臂猛地伸向错误位置的指令,可能撞到桌子/自己/物体。3D 策略直接看到几何,不容易犯这种"空间幻觉"错误,所以动作更平稳安全。这是数据效率之外一个实际部署很关键的隐性好处。

Q7:DP3 用单视角相机以求实用,但这带来遮挡盲区。如果一个任务需要操作被遮挡的物体,DP3 会遇到什么问题?你会怎么改?

提示

问题:单视角相机看不到被遮挡的部分,那里没有点云,模型对遮挡区域"盲",无法准确操作被遮挡物体。改进方向:加多视角相机融合点云(代价是标定复杂、可能变慢,且失去单相机的实用简洁);用时序信息,让机器人在运动中从不同角度看到更多(利用历史点云补全);用点云补全/生成模型脑补被遮挡部分(引入不确定性);或结合触觉传感在接触时补充信息。核心权衡是"感知完整性 vs 系统简洁性"。

所以这一节是想说:能回答这 7 题,你就真正理解了 DP3 为什么用点云、极简编码器、去颜色、顺序无关聚合,以及 3D 带来的数据效率、泛化和安全性。


一些好奇心问答(FAQ)

Q1:DP3 和 Diffusion Policy 到底差在哪? 只差"眼睛"。动作生成骨干(扩散去噪)几乎完全一样,DP3 把输入从 2D 图像 + ResNet 换成了稀疏点云 + 极简 MLP。就这一处改动,带来 24.2% 的相对提升和大幅的数据效率、泛化提升。

Q2:只要 512 个点够吗?会不会太粗糙? 够。论文实测 512 或 1024 点就足够所有仿真和真机任务。因为控制需要的是"物体大致在哪、几何关系如何",不需要稠密细节。稀疏点云反而让推理更快。

Q3:为什么推理不慢?3D 不是通常更重吗? 因为 DP3 用的是稀疏点云(几百点)+ 64 维紧凑特征 + 极简 MLP,不是稠密体素或注意力语言 token。加上 DDIM 只用 10 步去噪。所以速度甚至略快于 2D Diffusion Policy,打破了"3D 必然慢"的成见。

Q4:需要多少示范? 仿真大多数任务只要 10 个;真机 4 个任务每个 40 个。对比 Diffusion Policy 真机要 100–200 个——省一个量级。

Q5:能做灵巧手操作吗? 能,而且是亮点。真机用 Allegro 灵巧手(22 维动作)做可变形物体操作(包卷、包饺子),只要 40 示范就到 85%。仿真里还有 Shadow 手的高维任务(52 维)。

Q6:为什么用 sample prediction 而不是 epsilon prediction? 论文发现对高维动作生成,让网络直接预测"去噪后的样本"比预测"加的噪声"效果更好。这是个工程经验选择,高维动作空间下 sample prediction 更稳。

所以这一节是想说:DP3 的实操问题(与 DP 的区别、点数、速度、示范量、灵巧手、预测方式)都有明确答案,核心就是"换 3D 眼睛这一招"。


如果你想再深入

按"必读前置 → 编码器来源 → 对比 → 后续"排序:

  1. 必读前置:Diffusion Policy(Chi et al. 2023) — DP3 的动作生成骨干,本仓库有深读笔记,不懂它读不懂 DP3。
  2. 编码器来源:PointNet(Qi et al. 2017) — 点云网络的地基,理解"顺序无关的最大池化"。
  3. 对比:PerAct / 3D Diffuser Actor — 另一类 3D 策略(关键帧/注意力),对照能看出 DP3 "密集控制 + 快"的取舍。
  4. 加速方向:Consistency Policy / Flow Matching(π0) — 进一步压缩扩散步数,本仓库有相关笔记。
  5. 灵巧操作同族:DexMV / DexCap — 本仓库有笔记,理解"少数据学灵巧技能"这条线。

所以这一节是想说:把 Diffusion Policy + PointNet + DP3 连起来读,就能看清"2D 扩散策略 → 3D 扩散策略"的完整技术脉络。


原文信息

BibTeX

@inproceedings{ze2024dp3,
  title     = {3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations},
  author    = {Ze, Yanjie and Zhang, Gu and Zhang, Kangning and Hu, Chenyuan and Wang, Muhan and Xu, Huazhe},
  booktitle = {Proceedings of Robotics: Science and Systems (RSS)},
  year      = {2024}
}

链接

所以这一节是想说:这是 Ze et al. 2024 年发表在 RSS 的工作,用"稀疏点云 + 极简编码器 + 扩散策略"证明了 3D 表示对机器人学习的关键价值——少示范、强泛化、真机安全。

引用本笔记 / Cite this note
BibTeX
@online{eai_dp3_2026,
  title       = {(readable note) 3D Diffusion Policy (DP3)},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dp3/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?