3D Diffusion Policy (DP3)
这是一份写给"没接触过扩散策略和点云"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 diffusion-policy 深读笔记再看本篇。
一句话讲什么(TL;DR)
Diffusion Policy 用 2D 图像当"眼睛",需要上百个示范才学得会。DP3 把眼睛换成"稀疏点云 + 一个极简 MLP 编码器"——只用 10 个示范就能搞定大多数任务,72 个仿真任务平均比 Diffusion Policy 相对提升 24.2%,真机 4 个任务成功率 85%。
所以这一节是想说:DP3 的核心就一句话——给扩散策略换上 3D 眼睛,数据效率和泛化能力都大涨。
这是个什么场景
想象你要教机器人包饺子。你握着机械手亲手演示一遍——这叫一条"示范"。问题是:现在最强的视觉模仿学习方法 Diffusion Policy 每个真机任务要 100 到 200 条示范。包饺子这种长程、易失败的任务,采集几百条示范可能要花好几天,中途还老出错。
为什么要这么多示范?因为 Diffusion Policy 用的是 2D 图像当输入。2D 图像有个先天缺陷:它把三维世界拍平成了平面,丢失了深度和空间几何信息。机器人得从大量图像里"猜"出物体在 3D 空间的真实位置——这需要海量数据。
而且 2D 策略泛化性差:换个视角、换个物体位置、换个外观,模型就容易懵——因为它记的是"像素长什么样",而不是"物体在空间哪里"。
DP3 要解的题:能不能让(离线)模仿学习用尽可能少的示范,学出既鲁棒又能泛化的技能? 它的答案是——把"眼睛"从 2D 图像换成 3D 点云。
所以这一节是想说:2D 图像丢了空间信息导致模仿学习吃数据、泛化差,DP3 用 3D 点云来解这道"少示范、强泛化"的题。

之前的人怎么做的,为什么不够好
方案 A:2D 图像 Diffusion Policy 用 RGB 图像 + ResNet 编码,扩散生成动作。类比:只看照片猜物体在哪。问题:丢失深度,需 100–200 示范/任务,泛化差(换视角/位置就崩)。
方案 B:关键帧姿态 + 规划的 3D 策略(PerAct、GNFactor、RVT、Act3D) 把模仿学习转成"预测关键帧姿态 + 运动规划"。类比:只标几个关键落点,中间交给规划器连线。问题:(1) 设定不实用——只适合低维、可分解成关键帧的任务,做不了高维密集控制(如灵巧手连续操作);(2) 推理慢——PerAct 只有 2.23 FPS,3D Diffuser Actor 1.67 FPS,跟不上动态任务需要的密集指令。
方案 C:复杂 3D 表示(体素、隐函数、NeRF) 用体素网格或神经隐式场表示 3D 场景。问题:体素内存立方爆炸、NeRF 计算重,推理慢,不适合实时控制。
方案 D:在线学习 / 强化学习 边交互边学。问题:真机在线学有安全隐患、需自动复位、要人干预、硬件成本高。
核心难题:怎么把 3D 空间理解的好处,用又快又简单的方式塞进扩散策略,让它既能做高维密集控制、又能少示范、又能实时推理?
所以这一节是想说:2D 策略吃数据、关键帧 3D 策略慢且设定窄、复杂 3D 表示重,缺一个又快又简单又通用的 3D 扩散策略。
这篇论文的新想法
类比:Diffusion Policy 是个"看照片做事"的人,DP3 给他换上了"深度感知的立体视觉"——但用的不是昂贵复杂的设备,而是一副极简的"3D 眼镜"(稀疏点云 + 一个三层 MLP)。
DP3 的核心判断:扩散策略的动作生成能力已经很强,缺的是好的空间感知条件。与其换更强的动作生成器,不如换更好的眼睛。
具体做法极简:
用单个相机的深度图转成稀疏点云(几百个点),用一个极简三层 MLP 编码器把它压成一个只有 64 维的紧凑 3D 特征向量;然后把这个特征 + 机器人姿态当条件,喂给标准的 Diffusion Policy 去噪生成动作。
关键洞察有三:
- 稀疏点云比 RGB-D/体素/深度图都好(消融验证)——它直接表达 3D 几何,又轻。
- 极简 MLP 编码器比预训练大编码器(PointNeXt、Point Transformer)还好——控制任务需要的是"物体精确位置",不是 ImageNet 式语义,小编码器端到端训更贴合。
- 不用颜色——去掉 RGB 通道反而让外观泛化更好(不被物体颜色误导)。
【换眼睛,不换脑子】
Diffusion Policy(2D):RGB 图 + ResNet ─▶ 扩散生成动作
(丢深度; 需 100-200 示范; 换视角/位置就崩)
DP3(3D):单相机深度图 ─▶ 稀疏点云(几百点, 去掉颜色)
│ 极简三层 MLP 编码器
▼ 64 维紧凑 3D 特征
3D特征 + 机器人姿态 ──条件──▶ 标准 Diffusion Policy 去噪生成动作
(动作生成器完全不变, 只把"眼睛"从 2D 换成轻量 3D)
所以这一节是想说:DP3 不改动作生成器,只把 2D 眼睛换成"稀疏点云 + 极简 MLP"的 3D 眼睛——简单到令人意外,但数据效率和泛化都大涨。
它分几步做的(方法)
DP3 = 感知(Perception)+ 决策(Decision)两部分:
单相机深度图(84×84)
│
▼ 转点云(相机内外参) + 去掉颜色
│
▼ 裁剪(bounding box去掉桌面地面) + FPS下采样到512/1024点
│
▼ DP3 Encoder: 三层MLP(3→64→128→256) + MaxPool + 投影(256→64)
│
▼ 64维紧凑3D特征 v ─┐
├──▶ Diffusion Policy去噪 (条件: v + 机器人姿态q)
机器人姿态 q ────────┘ │
▼ 动作序列 a
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 感知第一步:用点云表示 3D 场景
类比:不拍平面照片,而是记录物体表面在空间里的一堆采样点。
输入:单个相机(不是多相机环绕,为真机实用性)的深度图,尺寸 84×84。
处理:用相机内外参把深度图转成点云。不用颜色通道——只保留几何坐标 (x,y,z),这样换个颜色的物体也不会懵(外观泛化更好)。
输出:一朵原始点云。
小结:单相机深度图转成无颜色点云,直接拿到 3D 几何,又不被外观干扰。
5.2 感知第二步:裁剪 + FPS 下采样
类比:只保留"物体所在的那块空间",扔掉桌面地面这些废点,再均匀挑一把代表点。
输入:原始点云(含大量冗余点,如桌面、地面)。
处理:先用一个包围盒(bounding box)裁剪,只留下感兴趣区域的点;再用 最远点采样(FPS, Farthest Point Sampling) 下采样。FPS 相比均匀采样能更好地覆盖 3D 空间、减少采样随机性。实测下采样到 512 或 1024 个点就足够所有任务(仿真和真机)。
输出:一朵稀疏点云(几百个点)。
小结:裁剪去废点、FPS 稀疏化,让点云又轻又能均匀覆盖关键空间。
5.3 感知第三步:DP3 Encoder 压成 64 维紧凑特征
类比:一个极简的"3D 眼镜镜片"——把几百个点压成一个 64 个数字的小向量。
输入:稀疏点云(512/1024 点 × 3 坐标)。
处理:DP3 Encoder 概念上极简——
- 三层 MLP(通道 3→64→128→256),配 ReLU;
- 最大池化(max-pooling)——这是"顺序无关"操作,因为点云无序,池化后打乱点顺序结果不变;
- 一个投影头把特征投到紧凑向量(256→64);
- 中间插 LayerNorm 稳定训练。
最终 3D 特征 v 只有 64 维。消融证明:这个极简编码器甚至超过预训练的 PointNeXt——印证了"控制任务里,精心设计的小编码器好过预训练大编码器"。
输出:64 维紧凑 3D 特征向量 v。
小结:三层 MLP + 最大池化 + 投影,把点云压成 64 维,简单却比预训练大编码器更好。
5.4 决策:条件扩散生成动作
类比:和 Diffusion Policy 一模一样的"从雪花里擦出动作",只是这次擦的时候旁边放着一张 3D 空间提示图。
输入:3D 特征 v + 机器人姿态 q(当条件),以及一团高斯噪声 a_K。
处理:用标准的卷积版 Diffusion Policy 当动作生成骨干。去噪网络 ε_θ 从噪声 a_K 出发,迭代 K 次逐步去噪成干净动作 a_0:
- 去噪公式(人话):"新一轮动作 = 旧一轮动作 - 网络在 3D 特征和姿态条件下猜出的噪声 + 一点随机扰动"。
- 训练目标:随机加噪到真动作上,让网络预测加进去的噪声(MSE 损失),条件是
v和q。 - 实现细节:用 DDIM 采样器,用 sample prediction(预测样本)而非 epsilon prediction(对高维动作生成更好),训练 100 步、推理 10 步。MetaWorld 训 1000 epoch、其他训 3000 epoch,batch size 128。感知和决策端到端一起训。
输出:动作序列 a。
小结:把 3D 特征当条件塞进标准扩散策略,端到端训练,DDIM 10 步推理保证实时。
5.5 为什么"简单 3D 表示 + 扩散"是关键
- 点云直接表达几何:不像 2D 图像要从像素猜空间,点云本身就是 3D 坐标,模型不用浪费数据学"如何从平面还原立体",所以少示范就够。
- 3D 特征天然泛化:换视角、换位置、换外观、换实例,物体的 3D 几何关系相对稳定,2D 像素则天差地别。
- 极简编码器 + 稀疏点云 = 快:不像关键帧 3D 策略慢(PerAct 2.23 FPS),DP3 稀疏点云 + 64 维特征让推理速度甚至略快于 2D Diffusion Policy——打破了"3D 策略必然慢"的成见。
- 消融证明是"设计"而非"3D 本身":给 BCRNN/IBC 也加 3D 表示,提升远不如 DP3——说明成功来自"点云 + 极简编码器 + 扩散"的整体设计,不只是用了 3D。
小结:点云管几何、3D 特征管泛化、稀疏+极简管速度、整体设计管效果——四者叠起来才是 DP3。
5.6 从"预测一段"到"执行一步":滚动时域控制
类比:不是想好一整套动作就闷头做完,而是"看几眼当下 → 规划出未来一小段 → 只执行前几步 → 再看再规划",像开车时不断根据路况微调,而不是一次把方向盘打死。
输入:最近若干帧的观测(点云特征 v + 机器人姿态 q)。
处理:DP3 沿用 Diffusion Policy 的滚动时域(receding-horizon)执行范式——每次条件化在最近的观测上,一次性去噪生成未来一段动作序列(动作分块,action chunk),但只执行其中前面一小段,然后拿新观测重新规划下一段。这样做有两个好处:(1) 生成一整段动作让运动更连贯、减少抖动;(2) 只执行前几步再重规划,让策略能对环境变化(物体被碰动、抓取打滑)及时反应,不会一条道走到黑。因为用了 DDIM 只需 10 步去噪、3D 特征又只有 64 维,这套"预测一段、执行一步、不断重规划"的循环能跑得足够快,满足真机的实时控制需求。
输出:一连串实际下发给机器人的控制指令。
小结:DP3 用"预测一段动作、只执行前几步、拿新观测重规划"的滚动时域控制,兼顾动作连贯性和对变化的响应速度。
5.7 为什么坚持"单相机、无颜色"
类比:越简单的装备越好带、越好复现——用一个便宜相机、连颜色都不要,反而让系统更皮实。
输入:一个部署上的现实约束——真机要好搭、好迁移。
处理:很多 3D 方法要多相机环绕标定,装配和标定成本高、换环境就得重来。DP3 刻意只用单个相机的深度图,牺牲一点视野换来"随便一台带深度的相机就能跑"的实用性。再进一步丢掉颜色通道:颜色会把"这个杯子是红的"这种和任务无关的外观信息也塞进特征,导致换个颜色/材质的物体就失灵;只留几何坐标 (x,y,z),模型学到的是"形状和空间关系",于是换颜色、换实例、换光照都更稳。这两个"做减法"的设计,正是 DP3 数据效率高、泛化好、又容易在真机复现的重要原因。
输出:一套单相机、无颜色、易复现且泛化强的感知前端。
小结:单相机降低部署门槛、去颜色提升外观泛化——两个"做减法"让 DP3 又实用又皮实。

关键数字(What works)
数字本身不重要,重要的是它们说明"换 3D 眼睛"到底值多少。
数字 1:72 个仿真任务平均(成功率 %)
| 域(任务数) | DP3 | Diffusion Policy |
|---|---|---|
| Adroit (3) | 68.3 | 31.7 |
| Bi-DexHands (6) | 70.2 | 61.3 |
| DexArt (4) | 68.5 | 49.0 |
| DexDeform (6) | 87.8 | 90.5 |
| DexMV (2) | 99.5 | 95.0 |
| HORA (1) | 71.0 | 49.0 |
| MetaWorld Easy (28) | 90.9 | 83.6 |
| MetaWorld Medium (11) | 61.6 | 31.1 |
| MetaWorld Hard (6) | 31.7 | 9.0 |
| MetaWorld Very Hard (5) | 49.0 | 26.6 |
| 平均 (72) | 74.4 ± 29.9 | 59.8 ± 35.9 |
关键含义:72 任务平均 相对提升 24.2%,且方差更小(更稳)。越难的任务差距越大(MetaWorld Hard 31.7 vs 9.0)。大多数任务只用 10 个示范。
数字 2:与更多基线对比(10 任务平均,成功率 %)
| 方法 | 平均 |
|---|---|
| DP3 | 74.4 |
| Diffusion Policy | 44.0 |
| BCRNN | 9.8 |
| BCRNN+3D | 14.5 |
| IBC | 5.0 |
| IBC+3D | 10.4 |
关键含义:给 BCRNN/IBC 加上 DP3 的 3D 编码器(+3D 变体)确实有提升(9.8→14.5,5.0→10.4),但远不如 DP3——证明成功是整体设计而非仅靠 3D。
数字 3:3D 空间泛化(MetaWorld Reach,5 示范,1000 次评估成功数)
| 方法 | 成功次数(/1000) |
|---|---|
| BC-RNN | 0 |
| IBC | 285 |
| Diffusion Policy | 327 |
| DP3 | 415 |
关键含义:只给 5 个示范,DP3 能泛化到整个 3D 空间(415 成功),2D 方法只在一个平面区域成功(327/285),BC-RNN 直接崩(0)。
数字 4:真机 4 任务
| 维度 | 数据 |
|---|---|
| 任务 | Roll-Up、Dumpling、Drill(Allegro 灵巧手,22 维动作)、Pour(夹爪,7 维) |
| 示范数 | 每任务仅 40 个 |
| 平均成功率 | 85% |
| 安全性 | DP3 极少发出危险指令;基线常发危险指令需人工干预 |
关键含义:真机灵巧手做可变形物体操作(包卷、包饺子),只要 40 个示范就到 85%,且安全——这是 3D 空间理解带来的意外好处。
数字 5:效率
| 维度 | 数据 |
|---|---|
| 收敛速度 | DP3 约 500 epoch 收敛,Diffusion Policy 慢得多或收敛到次优 |
| 推理速度 | DP3 略快于 2D Diffusion Policy;远快于 PerAct(2.23 FPS)、3D Diffuser Actor(1.67 FPS) |
| 点数 | 512 或 1024 点足够所有任务 |
| 3D 特征维度 | 仅 64 维 |
所以这一节是想说:数据证明四件事——少示范、强泛化、真机安全、还不慢。
实验结果说明了什么
问题一:3D 表示真的比 2D 省数据吗? 是。72 任务平均相对提升 24.2%,且大多只用 10 个示范(vs Diffusion Policy 真机要 100–200)。MetaWorld Reach 的可视化最直观:5 个示范下 DP3 泛化到整个 3D 空间(415/1000),2D 方法只覆盖一个平面(327/1000)。因为点云直接给了几何,模型不用花数据学"从平面还原立体"。
问题二:是"用了 3D"就够了,还是"怎么用 3D"更重要? "怎么用"更重要。给 BCRNN、IBC 也套上 DP3 的 3D 编码器,它们确实涨了(9.8→14.5、5.0→10.4),但远不及 DP3(74.4)。而且消融显示:点云 > RGB-D/深度/体素,极简 MLP 编码器 > PointNeXt/Point Transformer。所以是"稀疏点云 + 极简编码器 + 扩散骨干"这套设计的合力。
问题三:3D 策略一定慢吗? 不一定。这是一个反直觉的发现。人们以为 3D 策略慢(PerAct 2.23 FPS、3D Diffuser Actor 1.67 FPS),但 DP3 用稀疏点云 + 64 维紧凑特征,推理速度甚至略快于 2D Diffusion Policy。关键在于"稀疏 + 紧凑"——不用稠密体素或注意力语言 token。
问题四:真机上有什么意外收获? 安全性。DP3 在真机上极少发出危险/错乱指令,而基线经常发,需要人工干预防止损坏硬件。原因是 3D 空间理解让它对"手该在哪、不该撞哪"有更准的把握,不会像 2D 策略那样因为空间估计错误而乱挥。
所以这一节是想说:实验系统回答了四个问题——3D 确实省数据、设计比 3D 本身更重要、3D 不必慢、还带来真机安全性。
你应该懂的几个新词
模仿学习 / 视觉模仿学习:从示范学"观测→动作",视觉版用图像/深度当观测。
Diffusion Policy(扩散策略):用扩散模型"从噪声去噪出动作序列"的策略。DP3 的动作生成骨干,本仓库有深读笔记。
点云(point cloud):用一堆 3D 点表示场景/物体,直接携带几何信息。DP3 的核心输入。
FPS(最远点采样):一种点云下采样方法,每次挑离已选点最远的点,能均匀覆盖空间,比均匀随机采样更稳。
最大池化(max-pooling)作为顺序无关操作:点云无序,用最大池化聚合特征,打乱点顺序结果不变。
DDIM:扩散模型的快速采样器,训练 100 步、推理 10 步,保证实时。
sample prediction vs epsilon prediction:扩散网络可以预测"去噪后的样本"或"加的噪声",DP3 用前者,对高维动作更好。
紧凑 3D 表示(compact 3D representation):把点云压成低维向量(DP3 是 64 维),当扩散的条件。
泛化维度:空间/视角/外观/实例:换位置、换相机角度、换物体颜色、换具体物体——DP3 在这四方面都能泛化。
灵巧手(dexterous hand):多指机械手(如 Allegro、Shadow),能做精细操作,动作维度高(22–52 维)。
所以这一节是想说:这十个词是读任何"3D + 机器人策略"论文都会反复出现的基础词汇。
它有什么搞不定的
- 依赖深度传感器质量:DP3 吃深度图转的点云。深度相机在反光、透明、远距离物体上噪声大,点云质量差会直接拖累策略。透明物体(玻璃杯)几乎无解。
- 单视角有遮挡盲区:为实用只用单相机,被遮挡的部分没有点。复杂堆叠场景里,看不到的物体面无法建模。
- 仍是行为克隆,OOD 脆弱:和所有 BC 方法一样,观测漂出训练分布就失败。DP3 泛化更好但没根治。
- 点云预处理需要调:裁剪包围盒、点数(512/1024)是需要按任务设的超参。换场景可能要重调裁剪范围。
- 没有语言接口:DP3 只吃点云 + 姿态,不能理解语言指令。多任务语言条件设定下,还需接注意力语言 token(那会变慢,就像 3D Diffuser Actor)。
- 示范仍需人采:40 个真机示范虽少,但仍需人握着灵巧手采集——比 2D 省一个量级,但没到"零示范"。
所以这一节是想说:DP3 大幅提升了数据效率和泛化,但依赖深度质量、单视角遮挡、无语言接口这些问题仍在——后续工作(如接 VLM、多视角、更好传感器)继续发力。
它和别的论文是什么关系
- 上游(被它借用):
- Diffusion Policy(Chi et al. 2023):DP3 的动作生成骨干,本仓库有深读笔记。DP3 = Diffusion Policy 换 3D 眼睛。
- PointNet 系:点云编码的思想源头(顺序无关的最大池化)。DP3 Encoder 是它的极简版。
- DDPM / DDIM:扩散模型的数学基础和快速采样。
- 对比关系:
- 和 PerAct / GNFactor / RVT / Act3D:那些用关键帧姿态 + 规划,慢且设定窄;DP3 做密集控制、快、通用。
- 和 3D Diffuser Actor:都是 3D 扩散策略,但 3D Diffuser Actor 用注意力接语言 token(更慢),DP3 更轻更快(但无语言)。
- 和 给基线加 3D(BCRNN+3D、IBC+3D):证明 DP3 的优势来自整体设计,不只是 3D。
- 下游 / 同族:DP3 证明了"简单 3D 表示 + 扩散"的威力,影响了后续一批 3D 机器人策略工作。它和本仓库的 dexmv、dexcap 等灵巧操作工作同属"少数据学灵巧技能"这条线。
所以这一节是想说:DP3 站在 Diffusion Policy + PointNet + DDIM 的肩膀上,用"极简 3D 表示"把扩散策略的数据效率和泛化推上新台阶,是 2D→3D 策略演进的关键一步。
和本导读的关系
本笔记对应导读 Ch13:扩散策略——Diffusion Policy / 3D-DP / π0 的第二个模型。
导读 Ch13 讲了扩散策略的演进线:Diffusion Policy(2023,学术原型,2D 图像)→ 3D Diffusion Policy(2024,加入三维感知) → π0(2024,产业级基础模型)。本笔记深入的正是中间这个节点——DP3 如何把 2D 图像输入升级为 3D 点云,解决深度信息缺失、数据效率低、泛化差的问题。
读完本笔记,建议:先回看 diffusion-policy 深读笔记(理解扩散去噪、滚动时域、视觉条件这套地基,DP3 的动作生成完全沿用它),再看 π0 笔记(理解如何用 Flow Matching 加速 + 接 VLM 做跨机体基础模型)。三篇连起来,就是导读 Ch13 "从方法验证(2D)到感知升级(3D)到规模化部署(VLA)"的完整演进。DP3 的贡献是证明了"换更好的感知(3D)比换更强的生成器更划算"这个重要判断。
所以这一节是想说:本笔记是导读 Ch13 "感知升级"这一格的深度展开,读它前先懂 Diffusion Policy,读它后接 π0。
思考题
以下问题检验你是否真正理解了 DP3 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:为什么把 2D 图像换成 3D 点云,就能用少得多的示范学会技能?数据效率的提升来自哪里?
提示
来自"减少了模型需要学习的东西"。2D 图像把三维世界拍平了,模型要从像素里隐式地学"如何从平面还原出物体的 3D 空间位置"——这是一个困难的、需要大量数据的额外任务。点云直接给出了 (x,y,z) 坐标,几何信息是现成的,模型不用浪费示范去学"看图猜空间",可以把有限的数据全用在"学动作"上。换句话说,3D 表示提供了更好的归纳偏置,把感知负担从数据转移到了表示上。
Q2:消融显示极简三层 MLP 编码器竟然超过预训练的 PointNeXt/Point Transformer。这和"预训练大模型更强"的直觉矛盾,怎么解释?
提示
因为控制任务需要的特征和预训练学到的特征不同。PointNeXt/Point Transformer 常在分类/分割任务上预训练,学的是"这是什么物体"的语义特征。但机器人控制需要的是"物体在空间的精确位置和几何关系"——这更简单、更几何。大编码器的语义特征反而可能丢失精确坐标信息,且参数多、少示范下易过拟合。极简 MLP 端到端和策略一起训,直接学"对控制有用的几何特征",更贴合、更省数据。这和 Diffusion Policy 原论文"端到端训小编码器好过冻结大编码器"的观察一致。
Q3:DP3 去掉了点云的颜色通道(只用 xyz)。为什么去掉颜色反而让泛化更好?
提示
因为颜色是"外观"信息,会让模型对特定颜色产生依赖。如果训练时红色杯子总在某位置,模型可能学成"看到红色就抓",换个蓝色杯子就懵。去掉颜色只留几何,模型被迫学"这个形状/位置该怎么操作",与物体颜色无关——所以换外观、换实例时泛化更好。代价是丢失了颜色可能携带的有用信息(如区分同形状不同颜色的物体),但对大多数操作任务,几何比颜色更本质。
Q4:DP3 用最大池化聚合点云特征。为什么必须用"顺序无关"的操作,而不能像处理图像那样直接用卷积或全连接?
提示
因为点云是无序集合——同样一朵点云,你把点的排列顺序打乱,它表示的还是同一个物体。如果用普通全连接/卷积(对输入顺序敏感),同一朵点云换个点序就会得到不同特征,这显然不对。最大池化(或求和/平均)是"置换不变"的——不管点以什么顺序输入,池化结果都一样。所以点云网络必须用这类顺序无关的聚合操作,这也是 PointNet 的核心思想。
Q5:论文发现给 BCRNN、IBC 加上 3D 编码器(+3D 变体)也有提升,但远不如 DP3。这说明了什么?如果只把"用了 3D"当成 DP3 成功的原因,会犯什么错?
提示
说明成功来自"整体设计的合力",而非单一因素"3D"。BCRNN+3D 从 9.8 涨到 14.5、IBC+3D 从 5.0 涨到 10.4,确实 3D 有帮助,但都远不及 DP3 的 74.4。差距来自动作生成骨干——扩散策略的表达力远强于 RNN 回归和能量模型。如果只把"用了 3D"当原因,就会误以为随便什么策略加 3D 都能到 DP3 水平,忽略了"扩散骨干 + 稀疏点云 + 极简编码器 + 端到端训练"这套设计的协同。这是控制变量法的重要教训。
Q6:DP3 在真机上"极少发出危险指令",而基线经常发。为什么 3D 空间理解会带来安全性?
提示
因为 3D 表示让模型对"物体和机器人在空间的真实位置"有准确把握,从而生成的动作在空间上更合理、更少越界。2D 策略因为要从像素猜空间,空间估计一旦出错(比如把远处物体判成近处),就可能生成把手臂猛地伸向错误位置的指令,可能撞到桌子/自己/物体。3D 策略直接看到几何,不容易犯这种"空间幻觉"错误,所以动作更平稳安全。这是数据效率之外一个实际部署很关键的隐性好处。
Q7:DP3 用单视角相机以求实用,但这带来遮挡盲区。如果一个任务需要操作被遮挡的物体,DP3 会遇到什么问题?你会怎么改?
提示
问题:单视角相机看不到被遮挡的部分,那里没有点云,模型对遮挡区域"盲",无法准确操作被遮挡物体。改进方向:加多视角相机融合点云(代价是标定复杂、可能变慢,且失去单相机的实用简洁);用时序信息,让机器人在运动中从不同角度看到更多(利用历史点云补全);用点云补全/生成模型脑补被遮挡部分(引入不确定性);或结合触觉传感在接触时补充信息。核心权衡是"感知完整性 vs 系统简洁性"。
所以这一节是想说:能回答这 7 题,你就真正理解了 DP3 为什么用点云、极简编码器、去颜色、顺序无关聚合,以及 3D 带来的数据效率、泛化和安全性。
一些好奇心问答(FAQ)
Q1:DP3 和 Diffusion Policy 到底差在哪? 只差"眼睛"。动作生成骨干(扩散去噪)几乎完全一样,DP3 把输入从 2D 图像 + ResNet 换成了稀疏点云 + 极简 MLP。就这一处改动,带来 24.2% 的相对提升和大幅的数据效率、泛化提升。
Q2:只要 512 个点够吗?会不会太粗糙? 够。论文实测 512 或 1024 点就足够所有仿真和真机任务。因为控制需要的是"物体大致在哪、几何关系如何",不需要稠密细节。稀疏点云反而让推理更快。
Q3:为什么推理不慢?3D 不是通常更重吗? 因为 DP3 用的是稀疏点云(几百点)+ 64 维紧凑特征 + 极简 MLP,不是稠密体素或注意力语言 token。加上 DDIM 只用 10 步去噪。所以速度甚至略快于 2D Diffusion Policy,打破了"3D 必然慢"的成见。
Q4:需要多少示范? 仿真大多数任务只要 10 个;真机 4 个任务每个 40 个。对比 Diffusion Policy 真机要 100–200 个——省一个量级。
Q5:能做灵巧手操作吗? 能,而且是亮点。真机用 Allegro 灵巧手(22 维动作)做可变形物体操作(包卷、包饺子),只要 40 示范就到 85%。仿真里还有 Shadow 手的高维任务(52 维)。
Q6:为什么用 sample prediction 而不是 epsilon prediction? 论文发现对高维动作生成,让网络直接预测"去噪后的样本"比预测"加的噪声"效果更好。这是个工程经验选择,高维动作空间下 sample prediction 更稳。
所以这一节是想说:DP3 的实操问题(与 DP 的区别、点数、速度、示范量、灵巧手、预测方式)都有明确答案,核心就是"换 3D 眼睛这一招"。
如果你想再深入
按"必读前置 → 编码器来源 → 对比 → 后续"排序:
- 必读前置:Diffusion Policy(Chi et al. 2023) — DP3 的动作生成骨干,本仓库有深读笔记,不懂它读不懂 DP3。
- 编码器来源:PointNet(Qi et al. 2017) — 点云网络的地基,理解"顺序无关的最大池化"。
- 对比:PerAct / 3D Diffuser Actor — 另一类 3D 策略(关键帧/注意力),对照能看出 DP3 "密集控制 + 快"的取舍。
- 加速方向:Consistency Policy / Flow Matching(π0) — 进一步压缩扩散步数,本仓库有相关笔记。
- 灵巧操作同族:DexMV / DexCap — 本仓库有笔记,理解"少数据学灵巧技能"这条线。
所以这一节是想说:把 Diffusion Policy + PointNet + DP3 连起来读,就能看清"2D 扩散策略 → 3D 扩散策略"的完整技术脉络。
原文信息
BibTeX
@inproceedings{ze2024dp3,
title = {3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations},
author = {Ze, Yanjie and Zhang, Gu and Zhang, Kangning and Hu, Chenyuan and Wang, Muhan and Xu, Huazhe},
booktitle = {Proceedings of Robotics: Science and Systems (RSS)},
year = {2024}
}
链接
- arXiv:arxiv.org/abs/2403.03954
- 项目主页:3d-diffusion-policy.github.io
- 代码:github.com/YanjieZe/3D-Diffusion-Policy
所以这一节是想说:这是 Ze et al. 2024 年发表在 RSS 的工作,用"稀疏点云 + 极简编码器 + 扩散策略"证明了 3D 表示对机器人学习的关键价值——少示范、强泛化、真机安全。
◼
引用本笔记 / Cite this note
@online{eai_dp3_2026,
title = {(readable note) 3D Diffusion Policy (DP3)},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dp3/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?