Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 43

Diffusion Policy Policy Optimization (DPPO)

20 min read · 7035 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者写的精读笔记。语言尽量像聊天,公式全部翻译成人话,术语第一次出现一定先解释。

一句话讲什么(TL;DR)

先跟着老师傅模仿,再自己上手练。DPPO 把"自己练"那一步拆成很多个小动作,让一套很常规的强化学习算法(PPO)也能稳稳地调教"扩散策略"这种脑子里要打好几遍草稿才动手的机器人。

所以这一节是想说:DPPO 给"会打草稿的机器人"配了一套能真正把它练强的强化学习办法。


这是个什么场景

想象你跟着 1000 段老师傅炒菜的录像照葫芦画瓢,练出了一个会炒菜的机器人。它动作有模有样,但说白了是"死记硬背"——灶火忽大忽小、土豆比平时切厚一点,它就懵了。这一步叫"模仿预训练(imitation pretraining)",对应我们之前讲过的 Diffusion Policy。

模仿学习(Imitation Learning):给模型看一堆"专家在什么情况下做了什么动作"的录像,让它照着学。最朴素的版本叫行为克隆(Behavior Cloning,简称 BC),就是把"看到的画面 → 该做的动作"当成一道监督学习的填空题。

要让机器人真正变强,正常做法是让它自己上灶练几百次——烧糊几次、调整几次,跟小孩学骑车摔几跤就会了一样。这一步就是强化学习(RL)微调。

强化学习(Reinforcement Learning,RL):不给标准答案,只给"分数"(叫奖励 reward)。机器人自己试,做得好加分,做得差扣分,靠这个分数一点点摸索出更好的做法。

但这个机器人有个怪毛病:它出招不是"想一下就动手",而是先在脑子里画一团噪声当草稿,再润色好几遍,才把最终动作交给手。这几遍润色,专业叫"去噪步(denoising step)"。

问题来了——常规 RL 面对这种"出一个动作要先打 K 遍草稿"的策略会很懵:菜炒砸了,到底是哪一遍草稿没画好?分数该算到哪一步头上?DPPO 就是来回答这个问题的。

所以这一节是想说:扩散策略动作好,但它"先打草稿再动手"的习惯让常规 RL 不知道该怎么给它打分、怎么改它。


Diffusion Policy Policy Optimization (DPPO) — 场景示意:这论文要解决的现实问题
Plate Nº IDiffusion Policy Policy Optimization (DPPO) — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Diffusion Policy(Chi et al., 2023):用扩散模型当机器人策略,模仿学习效果非常好,但它本身只做行为克隆,没回答"在线 RL 怎么继续提升它"。相当于练成了但不会自我进步。
  • 传统 PPO + 高斯策略:策略直接输出一个"钟形曲线"(高斯分布),它的概率好算,PPO 直接能用;但表达力远不如扩散——同一状态下有几种合理做法时(叫多模态),它会被强行压成一个平均值,谁都不像。
  • 离线 RL + 扩散(Diffusion-QL、IDQL 等):也用扩散建模动作,但走的是 Q-learning 路线、依赖固定的离线数据集,不是"边跑边学"的在线微调。
  • 早期 score-based / DDPM 上做策略梯度:思路对,但往往要近似概率密度、对超参数极度敏感,没形成一套能照抄的稳定配方。
  • 奖励加权回归(Reward-weighted Regression):简单、稳,但样本效率和能力上限都不如真正的策略梯度。

多模态(multimodal,这里指动作多模态):同一个情况下有好几种都对的做法。比如绕过障碍物,从左绕、从右绕都行。高斯策略会取两者平均——直接撞上去。扩散策略能同时保留"左绕"和"右绕"两种可能。

所以这一节是想说:要么模型表达力够但不会在线进步,要么会进步但表达力被压扁,DPPO 之前没人把"强表达 + 稳在线微调"干净地凑到一起。


这篇论文的新想法

像写作文打草稿——以前 RL 只看你交上来的最终稿评分,DPPO 让老师逐句给你反馈:第一稿哪里改、第二稿哪里改……每一笔润色都能拿到指导。

核心一句话:把扩散策略每次采样要做的 K 步去噪,看成一个"内层的小决策过程"——每去噪一步就算做了一次小动作,最后一步去噪出来的才是真正交给环境的动作。这样整条经历就变成了"环境步 × 去噪步"两层嵌套的大流程,PPO 在这个大流程上就完全合法了。

等等,先慢一拍——PPO 到底靠什么工作?PPO 更新参数时要知道"我现在这一步动作,跟我上一版策略比,概率是涨了还是跌了",这个比值叫 ratio。而能不能算出 ratio,取决于动作的概率(专业叫"似然 likelihood")能不能写出公式。

DPPO 的几个关键观察:

  1. 似然有封闭解(closed form):扩散每一步去噪其实是一个高斯转移,它的概率一行公式就能写出来,所以 ratio 天然就有,不用搞复杂的密度估计。
  2. 梯度路径更短:把每一步去噪当成独立小动作,比"把整条 K 步链条当一次动作再反向传播"梯度传得更短、噪声更小,更好训。
  3. 保住了多模态:RL 微调不会把策略压成单峰,因为 PPO 只在每一步转移上做限幅(clip),没动扩散本身的结构。

所以这一节是想说:DPPO 的巧劲在于"把去噪的每一步都当成一次可以被打分的动作",从而让成熟的 PPO 直接套上扩散策略。


它分几步做的(方法)

这是全篇最核心的部分。我们把 DPPO 拆成四块,每块都讲清楚"喂进去什么 → 里面做什么 → 吐出来什么"。

1. 两阶段训练框架

输入:一批专家示范数据(很多段"观测 → 动作"的录像)。

处理

  • 第一阶段是 Diffusion Policy 风格的模仿预训练,得到一个基础还不错的扩散策略,我们叫它 π_θ(θ 是它体内那一大堆可调的数字,即参数)。
  • 第二阶段进入 RL 微调,目标函数换成 PPO 的"限幅代理目标(clipped surrogate objective)"——一个专门防止一步走太远把策略搞崩的损失函数。

输出:一个既保留了模仿能力、又能通过和环境互动继续变强的策略。

打个比方:第一阶段像学徒抄了一年师傅的菜谱,第二阶段像学徒自己开火,一边做一边根据客人反应调整手法。

2. 内外两层"决策过程"的串联

这是 DPPO 的灵魂,值得慢慢讲。

MDP(马尔可夫决策过程):描述"决策"的标准数学框架。它说的是:你在某个状态 s,做一个动作 a,环境给你一个奖励 r,再把你带到下一个状态。RL 全部建立在这个框架上。

输入:机器人当前的观测。

处理:DPPO 把过程套成两层——

  • 外层 MDP:机器人和真实环境打交道。状态 s_t,环境动作 a_t,奖励 r_t,这是我们平时理解的那一层。
  • 内层 MDP:每一个要交给环境的 a_t,其实是从一团噪声 x_K 一路去噪到干净动作 x_0 的。每去噪一小步(x_k → x_{k-1})就算内层的一次转移。

关键设计:奖励只在最外层的末端给(因为环境只有在你真执行了动作以后才会反馈),中间所有去噪步的即时奖励都是 0,靠一个叫 GAE 的工具把末端的奖励"回传"到每一个去噪步上。

GAE(Generalized Advantage Estimation,广义优势估计):一个把"未来奖励"折算回"现在这一步值不值"的公式。它在"看得太近"和"看得太远"之间做平衡,是 PPO 的标准搭档。

输出:一条被打平成"环境步 + 去噪步"的长序列,每一步都能算 ratio、能被 PPO 更新。

用生活语言说:原来"炒一盘菜"是一个动作,现在被拆成"打第 1 遍草稿、打第 2 遍草稿……端上桌"这一长串小动作,每个小动作都能单独被评价。

3. PPO 具体套在去噪步上

输入:内层每一个去噪转移 (x_k → x_{k-1}),以及当前观测 s。

处理

  • 对每个去噪转移,定义 ratio = 新策略给这一步的概率 ÷ 旧策略给这一步的概率,写成公式是 ratio = π_θ(x_{k-1} | x_k, s) / π_{θ_old}(x_{k-1} | x_k, s)。 人话翻译:"我改完之后,走这一笔的可能性,是原来的几倍。"
  • 按 PPO 标准做法:min( ratio × A , clip(ratio, 1-ε, 1+ε) × A )。 人话翻译:"如果这一笔比平均好(A 为正),就鼓励它,但别鼓励过头(限幅在 1+ε 以内);不好就压它,也别压过头。" ε 是一个小数字,控制"每次最多改多少"。
  • 优势 A 来自一个叫 critic(评论员网络)的东西估计出的价值 V(s),再分摊到内层各去噪步上。

输出:一次参数更新,让策略在保持稳定的前提下往"分更高"的方向挪一点点。

一个关键工程细节:推理时的去噪步数 K 要远小于训练扩散时用的步数。比如扩散本体训了很多步,推理时用一种叫 DDIM 的加速调度只走 5–10 步。因为 RL 要反复 rollout,去噪步太多整个训练就慢到跑不动。

4. 去噪步的"概率"到底怎么写出来

前面反复说"每一步去噪的概率有封闭解",这里把它讲透,因为这是整套方法能成立的地基。

输入:一步去噪转移,也就是"从更噪的 x_k 走到更干净的 x_{k-1}"这一小步。

处理:扩散模型里,去噪网络吃进当前的噪声版本 x_k、当前是第几步 k、以及观测 s,吐出一个"这一步该往哪个方向挪、挪多少"的预测。数学上这一步被建成一个高斯分布:中心(均值)由网络算出来,散布(方差)由去噪调度固定。于是"走这一笔的概率"就是"把 x_{k-1} 代进这个高斯的密度公式"——高斯密度是有现成公式的,一行就能写完,对参数 θ 还处处可导。

输出:一个可以直接求导的 log π_θ(x_{k-1} | x_k, s)。有了它,新旧策略的 ratio 就是两个 log 相减再取指数,PPO 需要的一切就都齐了。

打个比方:整条去噪链像"抄一段话抄了 K 遍、每遍改几个字"。以前 RL 只能看最终稿,算不出"某一遍改字的概率";DPPO 发现每一遍改字其实都服从一个规规矩矩的钟形分布,于是每一笔都能被单独定价。

5. 只微调"最后几步草稿"的省钱技巧

输入:一条已经能跑的去噪链(比如推理用 10 步)。

处理:论文观察到一个很实用的现象——不必把 10 步去噪全部交给 PPO 去改。越靠前的去噪步(还是一团粗噪声时)对最终动作的影响越模糊,越靠后的几步(快成形时)才真正决定动作长什么样。所以可以只对"最后若干步"计算 PPO 梯度、让更前面的步保持冻结或只做前向。这样既省显存又省算力,梯度信噪比还更高。DPPO 把这类选择(微调哪几步、用什么去噪调度、DDIM 还是 DDPM 采样)当成可调旋钮,属于它"配方"的一部分。

输出:一条训练更快、更稳,但动作质量几乎不掉的微调管线。

6. critic 与优势在两层之间怎么分配

输入:外层拿到的稀疏环境奖励 r_t,以及一条"环境步 × 去噪步"展平后的长轨迹。

处理

  • 训一个 critic(评论员网络)去估计"在状态 s 下,这盘棋大概能得多少分",也就是价值函数 V(s)。critic 只在外层的真实状态上估值,因为只有外层状态才有真实语义。
  • 用 GAE 把末端奖励沿着轨迹折现,算出每个时刻的优势 A("这一步比平均好多少")。
  • 关键分配问题:外层一个动作 a_t 底下挂着 K 个去噪步,这 K 个内层小步共享同一个外层优势信号——相当于"这盘菜最后评了 8 分,功劳/责任要摊到打草稿的每一遍上"。DPPO 对内层去噪步的折扣因子做了专门设计,避免长链条把优势稀释或放大到失真。

输出:每个去噪步都拿到一个可用的优势值 A,PPO 的 min(ratio·A, clip(ratio)·A) 就能逐步更新。

7. 结构化探索与网络骨架

输入:当前策略、当前观测。

处理

  • 探索来自去噪噪声本身。普通高斯策略靠"在均值上加一个可学的噪声"来探索;扩散策略天生就在每一步去噪注入噪声,DPPO 直接把这份内建随机性当成探索来源,还可以调"探索温度"控制它探得多野。这让探索是"结构化"的——它探的是几种合理动作模式之间,而不是在单峰上乱抖。
  • 骨架可换。动作头可以用 UNet(适合高维/图像式动作)或更轻的 MLP(适合低维状态输入)。观测编码器则视任务用 CNN、点云网络或状态 MLP。DPPO 是"训练框架",对具体骨架不挑食。

输出:一个在保持多模态的同时能有效探索、且能接到各种感知骨架上的可训练策略。

所以这几节合起来是想说:DPPO 之所以能稳,靠的是"高斯转移给出可导似然 + 只微调关键去噪步 + 优势在两层间合理分配 + 用去噪噪声做结构化探索"这一整套彼此咬合的设计。

8. 用伪代码把一次训练迭代走一遍

把上面的零件拼起来,一次完整的训练迭代长这样(伪代码,仅示意流程,不是原文逐行代码):

for 每一轮迭代:
    # 1. 采样阶段:用当前策略在环境里跑
    for 每个环境步 t:
        s_t = 观测
        # 内层:从纯噪声去噪 K 步得到动作,并记录每一步
        x_K = 高斯噪声
        for k = K..1:
            x_{k-1} ~ π_θ(· | x_k, s_t)   # 高斯转移,记下 log 概率
        a_t = x_0
        执行 a_t,拿到 r_t, s_{t+1}
    # 2. 优势估计:只在外层真实状态上跑 critic + GAE
    A = GAE(r, V(s))               # 再摊到每个内层去噪步
    # 3. 更新阶段:在展平的"环境步×去噪步"上做 PPO
    for 若干个 epoch:
        ratio = exp(logπ_θ - logπ_θ_old)   # 逐去噪步
        loss = -min(ratio·A, clip(ratio,1-ε,1+ε)·A) + c·价值损失 - 熵奖励
        θ ← θ - lr·∇loss

读这段伪代码要抓三个点:第一,采样时每一步去噪的 log 概率都被记下来,这样更新时才能算 ratio;第二,critic 和 GAE 只在外层真实状态上工作,内层去噪步靠"摊派"拿优势;第三,更新阶段完全是标准 PPO 的样子——限幅、价值损失、熵奖励一个不少,唯一特别的是"一个样本单位"从"一个环境动作"变成了"一个去噪转移"。正因为骨架没变,社区里现成的 PPO 实现稍作改造就能跑起来,这也降低了别人复现和在此基础上继续研究的门槛。

输出:一次把"采样—估优势—限幅更新"走完的迭代,重复很多轮,策略就从"只会模仿"慢慢爬到"能自我超越"。

所以这一节是想说:DPPO 落到代码上,就是把常规 PPO 的"一个动作"替换成"一个去噪步",其余训练骨架几乎原样复用——这正是它工程上讨喜的原因。

9. 让它真的稳的工程配方

这篇论文真正值钱的地方,不是新理论,而是"哪些技巧让它稳"。论文给了一整套配方,包括但不限于:去噪调度怎么选、KL 正则(防止新策略偏离旧策略太远的一种约束)强度多少、评论员网络怎么预热、仿真和真机上分别用多大 batch 和多长 rollout、探索温度怎么退火。这些具体数值需读原文,这里不编造。

KL 正则(KL regularization):KL 是衡量"两个概率分布差多远"的尺子。加一点 KL 惩罚,等于告诉模型"别一下子变得跟原来的自己太不一样",是稳定训练的常用手段。

下面用一张 ASCII 图把整条流水线串起来:

专家数据 ──► [阶段1: 扩散模仿预训练] ──► 基础策略 π_θ
                                            │
                     ┌──────────────────────┘
                     ▼
   ┌─────────────────────────────────────────────┐
   │  外层 MDP:s_t ──a_t──► r_t ──► s_{t+1}       │
   │            ▲                                   │
   │            │ a_t 由内层去噪产生                │
   │  内层 MDP: x_K→x_{K-1}→...→x_1→x_0 = a_t      │
   │            每一步都能算 ratio + clip           │
   └─────────────────────────────────────────────┘
                     │
                     ▼   PPO 更新(GAE 回传奖励)
              更强的策略 π_θ'

所以这一节是想说:DPPO 把"去噪链条"拆成一层可训练的小决策,再用标准 PPO 逐步更新,最后靠一套细致的工程配方把它调稳。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Diffusion Policy Policy Optimizatio… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Diffusion Policy Policy Optimization (DPPO) — 方法示意:核心 pipeline
Plate Nº IIDiffusion Policy Policy Optimization (DPPO) — 方法示意:核心 pipeline

关键数字(What works)

DPPO 是方法/配方类论文,真正的绝对数字(成功率、样本效率、提升百分比)需以原文表格为准,本笔记不编造。下面这张表列出它"关心什么指标、和谁比",具体数值标注状态。

关注点 对比对象 结果方向(原文为准) 具体数值
任务成功率 纯 BC 扩散策略(不做 RL) DPPO 明显更高 原文未在本笔记转录
样本效率 其他扩散 + RL 方案(如 DIPO/QSM 类) DPPO 更稳、更省交互 原文未在本笔记转录
对超参数敏感度 传统高斯策略 + PPO DPPO 更鲁棒 原文未在本笔记转录
多模态保持 高斯策略微调后 DPPO 不塌成单峰 定性证据,见原文可视化
推理去噪步数 K 训练扩散步数 K 远小于训练步(如个位数量级) 具体调度需读原文

提醒:以上"结果方向"是论文的定性结论;任何百分比请以 arXiv 原文(2409.00588)的实验表格为准。

所以这一节是想说:DPPO 的卖点是"比只模仿更强、比其它扩散 RL 更稳、还不丢多模态",精确数字要回原文核对。


实验结果说明了什么

  • RL 微调确实能突破模仿的天花板:纯 BC 学到的是"示范的平均水平",DPPO 通过和环境互动,能做到示范里没出现过的更优解。这说明"先模仿再强化"这条路对扩散策略是通的。
  • 建模方式比新算法更重要:DPPO 没发明新的 RL 算法(就是 PPO),赢在"把去噪步建成内层 MDP"这个建模选择上。这提醒我们,很多时候难点不是找新工具,而是把问题摆成工具能用的样子。
  • 多模态没被牺牲:这是和高斯策略最大的区别。RL 微调后策略依然能保留多种合理做法,这对复杂操作任务很关键。
  • 配方可迁移:论文强调的一堆工程技巧,本质是"如何把一个内部有多步采样过程的策略接进 PPO",这个思路未来接到别的模型(比如给语言模型的思维链做 RL)也成立。

所以这一节是想说:实验证明"两阶段 + 内层 MDP"不只是理论好看,而是真能把扩散策略练得更强且不失多样性。


你应该懂的几个新词

Diffusion Policy(扩散策略):把"生成动作"当成扩散模型的去噪过程。给定观测,从纯噪声开始去噪 K 步,得到动作。表达力强,特别适合多模态示范。

去噪步(denoising step):扩散模型推理时,把噪声 x_K 一步步变成干净动作 x_0 的中间步,每一步是一次小高斯采样。

PPO(Proximal Policy Optimization,近端策略优化):当前工业界最常用的 RL 算法之一,核心是用 ratio 限幅防止一次更新走太远。

ratio / 限幅(clip):ratio 是新旧策略在同一动作上的概率之比;clip 是把它强行限制在一个小区间里,避免更新过猛。

内外层 MDP:DPPO 的核心建模——外层是环境步,内层是去噪步,PPO 在内层每个转移上算 ratio。

优势 / GAE(Advantage / GAE):评价一个动作"比平均好多少"。GAE 是常用的估计器,平衡偏差和方差。

行为克隆(Behavior Cloning,BC):最朴素的模仿学习,直接监督学 (观测, 动作) 对,不和环境互动。

所以这一节是想说:把"扩散策略、去噪步、PPO、ratio、内外层 MDP"这五个词串起来,你就抓住了 DPPO 的骨架。


它有什么搞不定的

  • 依赖一个好的预训练起点:DPPO 是"微调器",如果第一阶段 BC 学得很差,RL 也难点石成金。它假设你已经有一个能力下限不错的扩散策略。
  • 计算开销不小:每一步环境交互背后要跑好几步去噪,还要在这些去噪步上做 PPO,rollout 成本比高斯策略高。去噪步数 K 稍大就会拖慢训练。
  • 需要能给奖励的环境:RL 的前提是有 reward 信号。真实机器人任务里 reward 常常稀疏或难设计,这限制了它在纯真机场景的直接落地。
  • 配方对超参仍有依赖:虽然论文强调它比同类更稳,但那一整套技巧(KL 强度、调度、预热)本身就说明"不是无脑就能调好",换个任务可能要重新找配方。
  • 仿真到真机的差距:很多实验在仿真里做,真机上奖励、噪声、延迟都更恶劣,迁移仍是公开难题。

所以这一节是想说:DPPO 强,但它挑起点、吃算力、要奖励,且换场景仍要调,不是即插即用的银弹。


它和别的几篇是什么关系

  • 直接前置Diffusion Policy。DPPO 假设你已经有一个 BC 训出来的扩散策略,回答"接下来怎么用 RL 把它推得更好"。
  • 同样在乎"去噪步要少"Consistency Policy3D Diffusion PolicyiDP3 这些工作降低去噪步数或换骨架;DPPO 的 RL 阶段也强烈依赖"K 不能太多"。
  • 多模态动作的另一条路BeT 用离散 token 表达多模态动作;DPPO 走"扩散保多模态 + PPO 微调"。
  • 方法论亲缘:和大语言模型里"用 PPO 微调一个预训练模型(RLHF)"的范式同构——那边是 token 级 PPO,这边是去噪步级 PPO。
  • 下游可能影响OpenVLART-2 等大模型策略若接上扩散动作头,DPPO 的配方可直接复用。

所以这一节是想说:DPPO 站在 Diffusion Policy 的肩膀上,把 RLHF 那套成熟范式干净地搬到了扩散策略上。


和本导读的关系

  • 主线章节:Ch13 扩散策略。DPPO 是扩散策略从"只会模仿"走向"能自我强化"的关键一环,读完 Ch13 再看它最顺。
  • 强化学习基础:Ch16 强化学习基础。里面讲的 PPO、reward shaping 正是 DPPO 的底层工具,建议先补。
  • 若你关心仿真与真机落地,可对照 Ch17 Sim-to-Real 理解为什么"能在仿真里稳定微调"很重要。

所以这一节是想说:DPPO 是 Ch13(扩散策略)和 Ch16(强化学习)交叉处的代表作。


思考题

Q1:为什么把每一步去噪都当成一次"动作",PPO 就能用了?如果把整条 K 步去噪链当成一次动作会怎样?

提示

想想 PPO 需要什么——它需要能算出每个动作的概率(似然)和 ratio。每一步去噪是高斯转移,概率有封闭解;整条链当一次动作则要把 K 个高斯乘起来再反向传播,梯度路径长、方差大、还容易数值不稳。

Q2:奖励只在最外层末端给,中间去噪步奖励是 0,那模型怎么知道"某一步草稿打得好不好"?

提示

靠 GAE 把末端奖励"折现"回每一步的优势 A。即使即时奖励是 0,优势值也能把"这一步是不是把局面带向更高分"传递回来。

Q3:DPPO 说自己不破坏多模态,靠的是什么机制?和高斯策略被压成单峰的区别在哪?

提示

PPO 只在每一步去噪转移上做 ratio 限幅,没有强迫整体动作分布变成单峰;而高斯策略的表达形式本身只有一个峰,微调只会更集中。

Q4:为什么推理去噪步数 K 要远小于训练时的扩散步数?这个取舍代价是什么?

提示

RL 要反复 rollout,K 大则每步交互成本高、训练慢。代价是去噪步太少可能降低动作质量,所以要用 DDIM 这类加速调度来折中。

Q5:如果一个任务的奖励非常稀疏(只有成功那一下才给 1 分),DPPO 会遇到什么困难?可以怎么缓解?

提示

稀疏奖励下优势信号极弱,探索困难。可以做 reward shaping、加好的预训练起点、或用课程学习从简单任务过渡。

Q6:DPPO 和大语言模型的 RLHF(用 PPO 微调)在结构上有什么相同点?

提示

都是"预训练模型 + PPO 微调"。区别只是被拆成小步的对象不同:RLHF 拆成一个个 token,DPPO 拆成一个个去噪步。

Q7:如果你只有很少的真机交互预算,DPPO 和纯 BC,你会怎么选?

提示

DPPO 需要在线交互和奖励,真机预算很少时 RL 阶段可能跑不起来;这时纯 BC 或先在仿真里 DPPO 再迁移,可能更现实。

所以这一节是想说:想清楚这些题,你就理解了"为什么要拆去噪步""奖励怎么回传""多模态怎么保住"这三件 DPPO 的核心事。


一些好奇心问答(FAQ)

Q:DPPO 是全新的 RL 算法吗?

不是。它用的就是标准 PPO。创新在"把扩散去噪过程建成内层 MDP"这个建模,以及一整套让训练变稳的工程配方。

Q:我不做扩散策略,读它有用吗?

有用。它示范了"如何把一个内部有多步采样的策略接进 PPO",这个思路可以迁移到很多"生成过程分多步"的模型上。

Q:它在仿真还是真机上验证的?

论文覆盖仿真为主,也涉及类真机/真机设定。具体任务与平台需以原文为准,本笔记不列举没把握的数字。

Q:为什么不直接用离线 RL(不和环境互动)?

离线 RL 受限于数据集里已有的行为,很难突破示范上限。DPPO 走在线路线,就是为了让策略能主动探索出更好的做法。

Q:K 步去噪是不是让训练慢很多?

会慢。这也是为什么推理只用很少的去噪步、并用 DDIM 加速。速度和质量之间要权衡。

所以这一节是想说:DPPO 的门槛不在"看懂新算法",而在"接受一个新建模视角 + 愿意调那套配方"。


如果你想再深入

  1. 前置必读:Diffusion Policy(Chi et al., 2023) —— 先吃透"扩散模型怎么当机器人策略",否则 DPPO 的内层 MDP 会很抽象。
  2. 补 PPO 基础 —— Sutton & Barto 第 13 章 + 任意一篇 PPO 讲解博客,搞懂 ratio、clip、GAE 三件事。
  3. 横向对照 Consistency Policy / iDP3 —— 理解"减少去噪步"这条并行线,会更明白 DPPO 为什么强依赖小 K。
  4. 类比 RLHF —— 读一篇 InstructGPT/RLHF 的介绍,感受"预训练 + PPO 微调"这套范式在语言侧的样子。
  5. 想复现 —— 直接看原文附录的超参表和消融,比正文更实用。

所以这一节是想说:先补 Diffusion Policy 和 PPO,再把 DPPO 当作"两者的缝合成品"来读,最顺。


原文信息

@inproceedings{ren2025dppo,
  title  = {Diffusion Policy Policy Optimization},
  author = {Ren, Allen Z. and others},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year   = {2025},
  note   = {arXiv:2409.00588}
}

BibTeX 中作者字段仅据公开信息填写,完整作者列表与页码请以 arXiv/ICLR 官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_dppo_2026,
  title       = {(readable note) Diffusion Policy Policy Optimization (DPPO)},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dppo/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?