Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 42

DiT-Policy

22 min read · 7635 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"已经懂 Diffusion Policy、想知道怎么把它放大"的读者的精读笔记。建议先读 diffusion-policy 深读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

扩散策略强在"多模态",Transformer 强在"可扩展",但把两者硬凑到一起训练极不稳定(原版 Diffusion Policy 的 Transformer 实现几乎训不动)。这篇论文找到了正确配方——用 adaLN-Zero 注意力块 + ResNet 图像分词器,让扩散 Transformer 策略稳定训练,在 ALOHA 双臂 1500+ 步长程灵巧任务上刷新 SOTA。

所以这一节是想说:这篇论文不发明新范式,而是解决一个卡住整个领域的工程难题——"怎么把扩散和 Transformer 稳定地焊在一起"。


这是个什么场景

近几年机器人学有两个正交的大进步:

  1. Transformer 高容量架构:能吃大规模、多样的数据,模型越大、数据越多效果越好(可扩展)。
  2. 扩散生成模型:能优雅表达"多模态动作"(同一个画面下多种合理做法),且训练稳定(相比能量模型)。

按理说,把这两个优点合起来——用 Transformer 当扩散策略的去噪网络——应该能得到一个"既能表达多模态、又能随数据规模扩展"的超强策略。但现实很打脸:

原版 Diffusion Policy 论文自己就试过一个"朴素的交叉注意力 Transformer"实现,结果极难训练(作者自己承认)。所以后续工作大多退回用它的 U-Net 架构——U-Net 好调,但对任务有苛刻要求(动作信号必须足够平滑),且是 CNN,扩展性不如 Transformer。

结果就是:高容量扩散建模对很多机器人应用遥不可及——你想用 Transformer 吃大数据,但它训不稳;你想稳,就得退回 U-Net 牺牲扩展性。

机器人任务还叠加三个难点,让这个矛盾更尖锐:

  • 多相机高维观测:全局相机 + 腕部相机,容易过拟合到某一路信号(比如只看本体感或全局相机),部署时忽略关键的腕部相机导致灾难性失败。
  • 毫米级精度:物体操作容错极低,尤其长程任务(做寿司要连续达成多个毫米级子目标)。
  • 多模态动作:数据越大,不同专家的做法越多样,取平均就会犹豫不决、出错。

DiT-Block Policy 要解的题:怎么让扩散 Transformer 策略稳定训练、无需每个设置都痛苦调参,从而真正吃到"扩散多模态 + Transformer 可扩展"两个红利?

所以这一节是想说:扩散和 Transformer 各有优点但焊不到一起(训练不稳),本文来找那个正确的焊接配方。


DiT-Policy — 场景示意:这论文要解决的现实问题
Plate Nº IDiT-Policy — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:Diffusion Policy + U-Net(主流) 退回用 CNN 的 U-Net 当去噪网络。类比:用好调但受限的老设备。问题:对任务有苛刻要求(动作要平滑),且 CNN 扩展性不如 Transformer,吃不好大规模多样数据。

  • 方案 B:Diffusion Policy + 朴素交叉注意力 Transformer 直接把 U-Net 换成标准交叉/联合注意力 Transformer。类比:想升级设备但装不稳。问题:训练极不稳定——原论文自己都说难训,本文实测这个基线在所有任务上都是 0% 成功率(不稳定训练导致动作嘈杂/危险)。

  • 方案 C:ACT(Action Chunking Transformer) 标准编码器-解码器 Transformer(基于 DETR)+ L1 回归损失 + 可选隐变量 plan。类比:用回归而非生成。问题:不是生成模型,多模态表达弱于扩散;某些任务会翻车(如开笔帽)。

  • 方案 D:单一共享编码器处理所有模态 一个网络同时吃所有相机 + 本体感。问题:学到脆弱特征,过拟合到某一路输入(如只看全局相机和本体感),忽略腕部相机,遇到遮挡就崩。

  • 核心难题:Transformer 是吃大数据的关键,但扩散 Transformer 训练不稳;退回 U-Net 又牺牲扩展性和通用性。需要一个既稳又可扩展的扩散 Transformer 架构。

所以这一节是想说:U-Net 稳但受限、朴素 Transformer 可扩展但训不稳、ACT 非生成、共享编码器易过拟合,缺一个稳定的扩散 Transformer 配方。


这篇论文的新想法

关键洞察:扩散 Transformer 训练不稳不是本质问题,而是"条件注入方式"没选对——标准的交叉/联合注意力块不适合扩散目标。换掉它就能稳。

灵感来自图像生成里的 DiT(Scalable Diffusion Transformers, Peebles & Xie):那篇论文发现用 adaLN(自适应 LayerNorm) 注入条件,能让扩散 Transformer 稳定扩展。本文把这个思想搬到机器人策略上。

三个核心配方(论文自称"ingredients"):

  1. 可扩展注意力块(adaLN-Zero):把标准交叉注意力块换成自适应 LayerNorm 块——不用注意力去"索引"条件,而是把条件变成 scale/shift 直接调制 LayerNorm,且输出投影层零初始化(identity 跳连起步)。仅此一招,在 1000+ 步长程灵巧任务上提升 30%+
  2. 高效观测分词(ResNet 图像分词器):对比 ViT 等,发现"每路相机用独立 ResNet 编码器 + Transformer 策略"这个相对简单的方案,能带来 40%+ 提升。
  3. DiT-Block Policy:把最优组件整合成统一架构,在双臂 ALOHA 和单臂 DROID Franka 上都拿 SOTA。

外加开源贡献:BiPlay 数据集——首个语言标注的、场景/物体/任务多样的双臂操作数据集(7023 个片段、9.7 小时、326 个场景)。

【朴素交叉注意力(不稳) vs adaLN-Zero(稳)】

Diffusion Policy + 朴素交叉/联合注意力 Transformer:
   条件靠注意力"索引" ─▶ 训练极不稳 ─▶ 实测所有任务 0% 成功率

DiT-Block Policy:
   每路相机独立 ResNet 分词(相比 ViT +40%)
        │
   条件 ─▶ 变成 scale/shift 调制 LayerNorm(adaLN-Zero, 输出投影零初始化)
        │   (不再用注意力去索引条件)
        ▼
   又稳又可扩展的扩散 Transformer(1000+步长程 +30%; ALOHA/DROID 均 SOTA)

所以这一节是想说:不稳不是宿命,把条件注入从交叉注意力换成 adaLN-Zero + 每路相机独立 ResNet,扩散 Transformer 就又稳又强。


它分几步做的(方法)

DiT-Block Policy 的整体结构:

多相机图像 ──▶ [每路独立 ResNet-26] ──┐
语言目标 g ──▶ [DistilBERT] ─FiLM─────┤
本体感 q ──▶ [per-dim 观测dropout] ───┤
                                      ▼
                          [Block Attention 编码器 (来自Octo)]
                                      │ 编码嵌入 e^(1)..e^(L)
噪声动作 x_k + 时间步 k ──▶ [扩散解码器: adaLN-Zero 块 × N]
                                      ▼
                              预测噪声 ε ──▶ 去噪 ──▶ H=100 动作块

下面逐块拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 问题设定与扩散目标

输入:多相机图像观测 o_t + 语言目标 g。目标是学一个目标条件策略 π(a_t | o_t, g),输出 H 步的关节/笛卡尔动作块。用行为克隆(BC)训练。

处理:策略是一个条件 DDPM(去噪扩散概率模型)。给定噪声 x_k 和噪声预测网络 ε_θ(x_k, k, o_t, g),去噪过程逐步生成动作。训练用 MSE 损失让网络预测加进去的噪声。训练用 k=100 步去噪 + 余弦噪声调度,推理用确定性采样降到 k=10 步

输出:去噪得到的动作块。

小结:这是一个标准的目标条件扩散策略,创新在去噪网络 ε_θ 的架构,不在扩散框架本身。

5.2 观测分词:每路相机独立 ResNet + FiLM 语言

类比:给每个摄像头配一个专属的"翻译官",而不是让一个翻译官同时听所有摄像头。

输入 → 处理 → 输出

  • 图像:每路相机(全局 + 腕部)用独立的 ResNet-26 编码。为什么用 CNN 而不是 ViT?因为机器人任务数据有限、需要密集空间推理,CNN 的空间先验在低数据下更有用。消融证明这是关键(见数字)。
  • 语言目标:用预训练 DistilBERT 编码成向量,再通过 FiLM 层注入视觉编码器——让语言在网络所有层影响视觉注意力("看什么"由语言指令引导)。
  • 本体感:先做 per-dimension 观测 dropout 正则化(防止过拟合到本体感信号),再分词。
  • 加可学习位置编码,用 Octo 的 Block Attention 编码器一起处理,得到编码嵌入 e^(1)..e^(L)

小结:每路相机独立 ResNet 避免过拟合到单一模态,语言用 FiLM 全层注入,本体感用 dropout 正则——这是 +40% 的来源。

5.3 核心:adaLN-Zero 扩散解码块

类比:不要让解码器用"注意力"去费劲地检索条件,而是把条件直接变成"旋钮"拧在每层归一化上。

输入:噪声动作 x_k、时间步 k、编码器嵌入 e^(i)

处理:标准做法是解码器用交叉注意力去"索引"编码器记忆——本文的关键洞察是这正是训练不稳的元凶。改法:

  • adaLN(自适应 LayerNorm) 注入条件:x = a(e^(i), k)·x + b(e^(i), k),即把条件变成 scale a 和 shift b 作用在 LayerNorm 上。
  • ab 是简单的全连接层,作用在"编码器嵌入的均值 + 时间向量"上:a(e^(i), k) = tokenmean(e^(i)) + k
  • 零初始化(Zero):输出的 scale 投影层(残差前)初始化为 0——这让去噪网络起步时是恒等跳连(identity skip),极大改善学习动态。

为什么这样更稳:交叉注意力让梯度通过复杂的注意力权重流动,扩散目标下这条路径不稳定;adaLN 把条件变成简单的仿射调制,梯度路径干净,零初始化保证起步平稳。

输出:预测的噪声 ε

小结:把条件注入从"交叉注意力"换成"adaLN-Zero 仿射调制 + 零初始化",这是扩散 Transformer 稳定训练的核心配方,单独贡献 30%+。

5.4 训练协议与动作块

输入 → 处理 → 输出

  • 每个评估任务采 100+ 条示范,再混入开源数据(ALOHA 数据集、YaY 最优 rollout)做正则。
  • 250K 迭代,AdamW + 余弦学习率。
  • 预测 H=100 步动作块(而非单步)——既是训练正则,又能用**时序集成(temporal ensembling)**提升运行时稳定性。

小结:大动作块 + 时序集成 + 数据混合,让训练稳、部署稳。

5.5 为什么这套配方是关键

  • adaLN-Zero 解决了"稳"——让 Transformer 能真正当扩散去噪网络(对比标准交叉注意力全崩到 0%)。
  • 每路 ResNet 解决了"感知"——避免过拟合单一模态,低数据下 CNN 空间先验比 ViT 强。
  • Transformer 骨干 解决了"扩展"——用 BiPlay 大数据训练时比基线扩展性更好(用 BiPlay 领先 20%,不用只领先 10%)。
  • 三者合力:既稳、又能感知、又能随数据扩展——这正是原版扩散策略求而不得的组合。

小结:adaLN-Zero 管稳、ResNet 管感知、Transformer 管扩展——正确配方缺一不可。

5.6 时序集成:把重叠的多段预测"投票"成平滑动作

类比:不是每一步都听最新一次的规划,而是把最近几次规划里"都对这一步给了建议"的意见加权平均,像多位教练一起投票,减少个别失误。

输入:策略在连续时刻预测出的、彼此重叠的动作块(每次都预测未来 H=100 步)。

处理:因为每个时刻都会重新预测一整段未来动作,同一个真实时刻其实被多段预测覆盖过(这一段预测它是第 1 步、上一段预测它是第 2 步……)。**时序集成(temporal ensembling)**把这些对同一时刻的多个预测做指数加权平均,得到最终下发的动作。好处是:(1) 平滑掉单次预测的抖动和偶发错误;(2) 让动作在时间上更连贯,避免"这一段和下一段接不上"的突变。这项技术借自 ACT,但在这里配合大动作块(H=100)和稳定的 adaLN-Zero 去噪器,能进一步提升部署时的鲁棒性。

输出:平滑、连贯、抗抖动的实际执行动作。

小结:预测重叠的大动作块 + 时序集成加权投票,把多次规划融成一条平滑轨迹,显著提升部署稳定性。

5.7 一套架构,两个真机平台

类比:同一个"通用大脑",既能装到双手协作的机器人上,也能装到单臂机器人上,只换手脚不换脑。

输入 → 处理 → 输出:为证明这套配方不是"为某台机器人定制",作者在两个差异很大的平台上都跑了它:双臂 ALOHA(两条手臂协作,做寿司这种需要连续达成多个毫米级子目标的长程精细任务)和单臂 DROID Franka(单个 Franka 机械臂)。两个平台的相机数量、动作维度、任务类型都不同,但去噪网络架构(adaLN-Zero 块 + 每路 ResNet + Block Attention 编码器)保持一致,只按平台调整输入路数和动作维度。结果两边都拿到 SOTA——说明"adaLN-Zero + 每路 ResNet + Transformer 骨干"是一套跨机体通用的配方,而不是碰巧适配某台机器人。

小结:同一架构在双臂 ALOHA 和单臂 DROID Franka 上都夺得 SOTA,证明这套配方是跨平台通用的,而非针对单一机器人调参得来。


DiT-Policy — 方法示意:核心 pipeline
Plate Nº IIDiT-Policy — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"正确配方"到底值多少。

数字 1:双臂 ALOHA 任务 vs SOTA 基线(成功率)

方法 用 BiPlay 平均 不用 BiPlay 平均
DiT-Block Policy 60% ± 9% 51% ± 9%
ACT 33% ± 8% 37% ± 8%
D.P. U-Net 42% ± 9% 30% ± 9%
D.P. Transformer(朴素) 0% ± 0% 0% ± 0%

关键含义:DiT-Block Policy 领先最强基线约 20%(用 BiPlay 时),且朴素 Transformer 扩散全崩到 0%——直接证明"配方"而非"Transformer 本身"是关键。用大数据(BiPlay)时领先更多,说明扩展性更好。

数字 2:注意力块消融(成功率,DDIM 步数)

注意力块 DDIM 步数 Pick Place Pen Uncap
adaLN-Zero(本文) 10 50% ± 12% 100% ± 0%
去掉零初始化 10 38% ± 11% 80% ± 13%
交叉注意力 10 0% 0%
交叉注意力 100 38% ± 15% 70% ± 11%
In-Context 100 0% 0%

关键含义:交叉注意力 10 步全崩,得加到 100 步才勉强跑(还更慢更差);adaLN-Zero 10 步就满血。零初始化再额外贡献约 16%。这是"adaLN-Zero 是稳定核心"的直接证据。

数字 3:编码器消融(参数量 / 成功率)

编码器 参数量 Pick Place Pen Uncap
ResNet(本文) 115M 50% ± 12% 100% ± 0%
无 ResNet(等参数) 85M 0% 0%
无 ResNet(放大补偿) 150M 13% ± 8% 20% ± 13%

关键含义:把 ResNet 换成 Transformer 自己的卷积 stem,即使把参数放大到 150M 也补不回来——低数据机器人任务里 CNN 编码器不可替代

数字 4:仿真标准评测(robomimic,成功率)

任务 DiT-Block Policy D.P. Transformer
Lift 100% 100%
Can 98% 100%
Square 84% 100%
Tool Hang 72% 76%
仿真平均 88.5% 94%
ALOHA 真机平均 60% 0%

关键含义:仿真里 DiT-Block 略低于精调的 D.P. Transformer(88.5% vs 94%),但几乎没做任务专属调参;而真机上 DiT-Block 60% 完胜 D.P. Transformer 的 0%——真机才是真正的考验(sim-to-real gap)。

数字 5:BiPlay 数据集

维度 数据
片段数 7023 clips
时长 9.7 小时
场景数 326 unique scenes
标注数 2000 annotations
任务数 200+
特点 首个语言标注、多样场景/物体的双臂操作数据集

所以这一节是想说:数据证明——adaLN-Zero 是稳定核心、ResNet 编码器不可替代、真机完胜朴素 Transformer、扩展性更好。


实验结果说明了什么

问题一:扩散 Transformer 训练不稳是本质问题吗? 不是。这是全文最重要的结论。朴素交叉注意力 Transformer 扩散在真机上全崩到 0%(不稳定训练导致动作嘈杂危险),但换成 adaLN-Zero 后 10 步 DDIM 就能满血运行(Pick Place 50%、Pen Uncap 100%)。所以"不稳"是条件注入方式的问题,不是 Transformer 或扩散的固有缺陷。

问题二:零初始化真有那么重要吗? 重要。去掉零初始化(只用 adaLN 不 Zero),Pick Place 从 50% 掉到 38%、Pen Uncap 从 100% 掉到 80%——约 16% 的额外贡献。零初始化让网络起步时是恒等映射,避免训练早期的剧烈扰动,改善学习动态。

问题三:为什么坚持用 CNN 编码器而不是全 Transformer? 因为低数据机器人任务需要 CNN 的空间归纳偏置。消融显示:把 ResNet 换掉,即使把 Transformer 参数放大到 150M(比本文 115M 还多)也只有 13%/20%,远不及本文的 50%/100%。这说明"把参数堆在 Transformer 里"补偿不了"没有 CNN 空间先验"的损失——CNN 在数据稀缺时仍是更优的图像编码器。

问题四:能泛化到不同机器人吗? 能。除了双臂 ALOHA,还在单臂 Franka FR3(不同形态、笛卡尔速度动作空间、单外部相机有遮挡)上测试,比 ACT 领先 20%、比 D.P. U-Net 领先 35%。说明配方对动作/观测空间不敏感,不像 D.P. U-Net 那样挑任务。

问题五:仿真略输、真机完胜,说明什么? 仿真里 DiT-Block(88.5%)略低于精调的 D.P. Transformer(94%),但真机上 60% vs 0%。这说明:(1) DiT-Block 几乎不用任务专属调参就能接近精调基线;(2) 真机的 sim-to-real gap 更考验鲁棒性,DiT-Block 的稳定性优势在真机上才充分体现。真机结果应更有分量。

所以这一节是想说:实验系统回答了五个问题——不稳非宿命、零初始化关键、CNN 不可替代、能跨形态泛化、真机才见真章。


你应该懂的几个新词

扩散策略(Diffusion Policy):用扩散去噪生成动作序列的策略。本文的基础,仓库有深读笔记。

DiT(Diffusion Transformer):用 Transformer 当扩散骨干的架构,来自图像生成。本文把它搬到机器人策略。

adaLN(自适应 LayerNorm):把条件变成 scale/shift 系数调制 LayerNorm 的条件注入方式,是 DiT 稳定训练的关键。

adaLN-Zero:adaLN + 输出投影层零初始化,让网络起步时是恒等跳连,进一步稳定训练。

交叉注意力(cross attention):解码器用注意力"索引"编码器记忆的标准条件注入方式。本文发现它导致扩散 Transformer 训练不稳。

FiLM(Feature-wise Linear Modulation):把条件(这里是语言)变成缩放/平移系数注入网络的方式。

观测 dropout(observation dropout):随机丢弃部分观测维度做正则,防止过拟合到单一模态(如只看本体感)。

动作块 / Action Chunking:一次预测 H 步动作而非单步,配时序集成提升稳定性。ACT 首创,本文用 H=100。

时序集成(temporal ensembling):对重叠的动作块预测做加权平均,平滑执行、抗抖动。

DDPM / DDIM:扩散的训练框架(100 步)和快速确定性采样(10 步)。

所以这一节是想说:这十个词里 adaLN-Zero 是本文的灵魂,其余是理解现代扩散 Transformer 策略的通用词汇。


它有什么搞不定的

  • 仿真上不如精调基线:robomimic 仿真 88.5% 略低于精调的 D.P. Transformer 94%。本文的卖点是"少调参 + 真机稳",在允许充分调参的仿真里没有绝对优势。
  • 仍需 100+ 示范/任务:虽然能吃大数据扩展,但每个评估任务仍采了 100+ 示范。不是少样本方法。
  • 依赖 CNN 空间先验,数据多时未必最优:结论"CNN 不可替代"是在低数据下得出的。当数据规模极大时,ViT 可能反超——本文没探讨这个规模拐点。
  • 长程任务仍会累积误差:Sushi Cut(2 分钟、毫米级)即使 DiT-Block 也只有 29%(用 BiPlay)——长程灵巧任务远未解决,小误差会在长轨迹上放大。
  • 推理仍需多步去噪:10 步 DDIM 比单步前向慢。高频控制场景仍受限(后续 Consistency Policy 等针对此发力)。
  • BiPlay 仍是单一硬件平台:数据虽多样,但都来自 ALOHA play-pen,跨机体泛化还需更大规模数据。

所以这一节是想说:DiT-Block 解决了"扩散 Transformer 怎么稳定训练"这个卡点,但长程灵巧任务、少样本、高频控制、跨机体这些根问题仍在。


它和别的论文是什么关系

  • 上游(被它借用)
    • Diffusion Policy(Chi et al. 2023):本文的基础,仓库有深读笔记。本文解决的正是它 Transformer 版训不动的问题。
    • DiT(Peebles & Xie 2023):adaLN-Zero 条件注入的思想来源(图像生成)。
    • ACT(Zhao et al. 2023):动作块 + 时序集成来源,也是主要对比基线。
    • Octo:Block Attention 编码器实现来源。
    • DistilBERT / FiLM / ResNet:语言编码、条件注入、图像编码的组件。
  • 对比关系
    • ALOHA Unleashed(Zhao et al. 2024):并行工作,用交叉注意力 + 扩散拿到 SOTA,但需要大得多的数据(26K episodes)和大量调参;本文用 adaLN-Zero 更省数据省调参。
    • 3D Diffuser Actor / DP3:那些走 3D 表示路线;本文走"2D 多相机 + Transformer 扩展"路线。
  • 下游 / 同族:本文的 adaLN-Zero 配方为后续大规模 VLA + 扩散动作头(如 π0 类工作)提供了"如何稳定训练扩散 Transformer"的关键经验。BiPlay 数据集也成为双臂操作研究的资源。

所以这一节是想说:本文站在 Diffusion Policy + DiT + ACT + Octo 的肩膀上,把"扩散 Transformer 策略"从"训不动"变成"又稳又可扩展",是扩散策略走向大规模的关键工程一步。


和本导读的关系

本笔记对应导读 Ch13:扩散策略——Diffusion Policy / 3D-DP / π0

导读 Ch13 讲扩散策略的演进:Diffusion Policy(2023,原型,CNN U-Net)→ 3D Diffusion Policy(2024,3D 感知)→ π0(2024,产业级基础模型)。DiT-Block Policy 补上了这条线上一个关键的架构工程环节——如何把扩散策略的骨干从 U-Net 换成可扩展的 Transformer 而不失稳定性。这正是从"学术原型"走向"吃大数据的基础模型"必须跨过的坎。

读完本笔记,建议:先回看 diffusion-policy 深读笔记(理解 U-Net vs Transformer 的取舍——原论文就发现 Transformer 版难训,本文正是接着这个问题往下做),再看 π0 类工作(大规模 VLA + 扩散/流匹配动作头,它们受益于本文"如何稳定训练扩散 Transformer"的经验)。DiT-Block Policy 的核心贡献是证明了"扩散 Transformer 的不稳定可以用正确的条件注入(adaLN-Zero)解决",为扩散策略的规模化扫清了一个架构障碍。

所以这一节是想说:本笔记是导读 Ch13 "扩散策略架构工程"这一格的深度展开,衔接 Diffusion Policy 的遗留问题与后续大规模 VLA。


思考题

以下问题检验你是否真正理解了 DiT-Block Policy 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:原版 Diffusion Policy 的 Transformer 实现"极难训练",本文却用 Transformer 训得很稳。差别在哪?这说明"不稳"的根源是什么?

提示

差别在条件注入方式。原版用标准交叉注意力让解码器"索引"编码器记忆,本文换成 adaLN-Zero(把条件变成 scale/shift 仿射调制 LayerNorm,且零初始化)。这说明"不稳"的根源不是 Transformer 或扩散本身,而是"交叉注意力这种条件注入路径在扩散目标下梯度不稳定"。换一种梯度路径更干净的注入方式,问题就解了。实验证据:交叉注意力 10 步全崩到 0%,adaLN-Zero 10 步就满血。

Q2:adaLN-Zero 的"Zero"(零初始化)具体做了什么?为什么它能改善训练?

提示

零初始化把 adaLN 块输出的 scale 投影层(残差连接前的那层)初始化为 0。这样在训练最开始,每个块的输出 = 输入(恒等跳连,identity skip),整个网络起步时相当于一个"什么都不改"的恒等函数。好处:训练早期网络不会因为随机初始化的条件调制而产生剧烈扰动,梯度平稳,然后逐渐学会有意义的调制。这和 ResNet 的残差、"训练 ImageNet 一小时"里 BN 的零初始化同理——让深网络起步平稳。消融显示它额外贡献约 16%。

Q3:编码器消融显示,把 ResNet 换成 Transformer 卷积 stem 后,即使参数放大到 150M(比本文 115M 还多)也只有 13%/20%。这个反直觉结果说明什么?

提示

说明"参数量"补偿不了"归纳偏置"。CNN 有强空间归纳偏置(局部性、平移等变),在数据稀缺的机器人任务里,这个先验让它能高效学到"物体在图像哪个位置"这种空间特征。Transformer 缺这个先验,要从数据里学,而机器人数据太少不够它学出来——所以即使堆参数(150M)也补不回。这挑战了"大模型总更好"的直觉:在低数据域,带正确归纳偏置的小结构好过无偏置的大结构。这也和 Diffusion Policy 原论文"端到端小编码器好过预训练大编码器"的观察一致。

Q4:为什么每路相机用独立的 ResNet,而不是一个共享编码器处理所有相机?

提示

共享编码器容易学到脆弱特征、过拟合到某一路强信号(比如全局相机 + 本体感),部署时干脆忽略其他路(如腕部相机)。但腕部相机在精细操作和遮挡时恰恰最关键——忽略它会导致部署灾难性失败。独立编码器让每路相机的特征被独立、充分地提取,策略被迫综合利用所有视角。本文还配合 per-dim 观测 dropout 进一步防止过拟合到单一模态。这套组合贡献了约 40% 的提升。

Q5:仿真里 DiT-Block(88.5%)略输精调的 D.P. Transformer(94%),真机上却是 60% vs 0%。为什么真机结果应该更有分量?

提示

因为仿真里可以对每个任务充分调参、且没有 sim-to-real gap,精调基线能发挥到极致。但真机部署有传感器噪声、动力学差异、遮挡等,对训练稳定性和鲁棒性要求高得多。D.P. Transformer 在真机上因训练不稳导致动作嘈杂/危险,全崩到 0%;DiT-Block 的稳定性让它在真机达到 60%。真机才是策略的最终使用场景,且论文强调 DiT-Block "几乎没做任务专属调参"就接近仿真精调基线。所以"少调参 + 真机稳"是它的真正价值。

Q6:本文预测 H=100 步的大动作块并用时序集成。如果改成预测单步动作,会有什么问题?

提示

单步预测有几个问题:(1) 多模态下相邻步可能选不同模式导致抖动;(2) 无法做时序集成(需要重叠的多步预测来平均);(3) 长程任务缺乏长期规划的连贯性;(4) 训练时单步的监督信号弱,大动作块本身是一种正则(迫使模型学连贯轨迹)。本文用 H=100 大块 + 时序集成,让相邻时刻的多个块预测互相平均,运行时更平滑稳定。代价是块太大时后半段预测越远越不准,需要靠滚动重规划/集成来缓解。

Q7:并行工作 ALOHA Unleashed 用交叉注意力 + 扩散也拿到了 SOTA,但用了 26K episodes 和大量调参。这和本文的对比揭示了什么权衡?

提示

揭示了"架构设计 vs 数据规模/调参"的权衡。交叉注意力扩散不是不能用,而是在数据足够多(26K episodes)+ 充分调参下能被"暴力"驯服。本文的 adaLN-Zero 则用更好的架构设计,在少得多的数据、几乎不调参的情况下就稳定。两条路都能到 SOTA,但本文的路更可及、更省资源。这对实践者的启示:好的架构归纳偏置能替代大量数据和调参成本——尤其在数据昂贵的机器人领域,这个权衡很关键。

所以这一节是想说:能回答这 7 题,你就真正理解了 DiT-Block Policy 为什么用 adaLN-Zero、零初始化、独立 ResNet、大动作块,以及"架构设计 vs 数据规模"的核心权衡。


一些好奇心问答(FAQ)

Q1:DiT-Block Policy 和普通 Diffusion Policy 差在哪? 差在去噪网络的架构。普通 Diffusion Policy 主流用 CNN 的 U-Net;DiT-Block 用 Transformer + adaLN-Zero 条件注入,既稳又可扩展。扩散框架本身(加噪去噪、DDIM 采样)基本一样。

Q2:为什么叫 "Block Policy"? 因为核心是那个特制的 adaLN-Zero 注意力块(block)——把它作为解码器的基本单元堆叠。名字强调"关键在块的设计"。

Q3:交叉注意力真的完全不能用吗? 不是完全不能,而是难用。本文实测交叉注意力 10 步去噪全崩,加到 100 步(更慢)才勉强 38%/70%,仍不如 adaLN-Zero 的 10 步 50%/100%。并行工作证明它在超大数据 + 大量调参下能用,但成本高。

Q4:BiPlay 数据集有什么用? 它是首个语言标注、场景/物体多样的双臂操作数据集(7023 片段、9.7 小时、326 场景)。用它训练时 DiT-Block 领先基线更多(20% vs 不用时的 10%),证明模型能吃大数据扩展。也开源给社区做双臂研究。

Q5:能跑多快? 推理用 10 步 DDIM。比单步前向慢,但比需要 100 步的交叉注意力快得多。高频控制仍受多步去噪限制。

Q6:这套方法能用到单臂机器人吗? 能。论文在单臂 Franka FR3(笛卡尔速度控制、单相机有遮挡)上验证,比 ACT 领先 20%、比 D.P. U-Net 领先 35%。说明配方对形态和动作空间不敏感。

所以这一节是想说:DiT-Block Policy 的实操问题(与 DP 区别、命名、交叉注意力可用性、数据集、速度、跨形态)都有明确答案,核心就是"adaLN-Zero 这个正确配方"。


如果你想再深入

按"必读前置 → 核心来源 → 对比 → 后续"排序:

  1. 必读前置:Diffusion Policy(Chi et al. 2023) — 本文的基础,仓库有深读笔记,它遗留的"Transformer 版难训"正是本文的起点。
  2. 核心来源:Scalable Diffusion Transformers / DiT(Peebles & Xie 2023) — adaLN-Zero 的思想源头。
  3. 对比:ACT(Zhao et al. 2023) — 动作块 + 时序集成来源,也是基线。
  4. 并行对比:ALOHA Unleashed(Zhao et al. 2024) — 交叉注意力 + 扩散的另一条路,对照"架构 vs 数据"权衡。
  5. 后续加速:Consistency Policy(Prasad et al. 2024) — 针对多步去噪慢的问题做蒸馏加速。

所以这一节是想说:把 Diffusion Policy + DiT + ACT + ALOHA Unleashed 连起来读,就能看清"扩散 Transformer 策略"的完整技术脉络和权衡。


原文信息

BibTeX

@inproceedings{dasari2024ingredients,
  title     = {The Ingredients for Robotic Diffusion Transformers},
  author    = {Dasari, Sudeep and Mees, Oier and Zhao, Sebastian and Srirama, Mohan Kumar and Levine, Sergey},
  booktitle = {IEEE International Conference on Robotics and Automation (ICRA)},
  year      = {2025}
}

链接

所以这一节是想说:这是 Dasari et al.(ICRA 2025)的工作,用 adaLN-Zero + ResNet 分词器找到了稳定训练扩散 Transformer 策略的配方,为扩散策略的规模化扫清了关键架构障碍。

引用本笔记 / Cite this note
BibTeX
@online{eai_dit_policy_2026,
  title       = {(readable note) DiT-Policy},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dit-policy/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?