Diffusion Policy
把'选动作'重新定义成'去噪'。从一团随机数开始,一步步擦回到平滑可执行的动作序列——结果是模仿学习里少见的稳定多模态策略。
先读这三篇。
Diffusion Policy 把扩散搬进控制 → 3D-DP 给它装 3D 眼睛 → π0 把流匹配做到产业级基础模型。
-
1
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
让机器人像调电视雪花一样产生动作:从满屏乱码开始,擦几下,下一步该怎么动就擦出来了。
-
2
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
让机器人改看 3D 立体形状(点云)而不是 2D 照片来学动作,10 条示范就够,72 个任务平均比原版强 24.2%,真机成功率从 35% 涨到 85%,安全违规率 0%。
-
3
π₀: A Vision-Language-Action Flow Model for General Robot Control
Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 种机器人、68 任务、1 万+ 小时数据
2023 到 2026,16 篇怎么排开。
祖师爷
经典
前沿