Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 119

RDT-1B: Diffusion Foundation Model for Bimanual Manipulation

19 min read · 6717 字 · ⭐⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI / 机器人"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。

一句话讲什么(TL;DR)

清华团队给双臂机器人造的"大脑":用**扩散模型(diffusion)**当动作生成器、**Diffusion Transformer(DiT)**当骨架,把参数推到 12 亿(1.2B)——目前最大的扩散式机器人操作基础模型。它先在 **46 个多机器人数据集(约 100 万条轨迹)**上预训练,再在自采的 6K+ 条双臂轨迹(300+ 任务)上微调,靠一个物理可解释的统一动作空间把五花八门的机器人塞进同一套表示。真机上零样本泛化到没见过的物体/场景,1~5 个演示就能学新技能,平均成功率比基线高约 56%

所以这一节是想说:RDT-1B 把"大模型预训练 + 扩散连续动作 + 双臂"三件事第一次缝到一起,是双臂机器人基础模型的开山之作之一。


这是个什么场景

你试过单手叠衣服吗?基本叠不起来——一只手按住领子、另一只手翻折袖子,少一只手就卡住。倒水也是:左手扶杯、右手拿壶,单手只能先放下杯子再去拿壶,全程慢半拍还容易洒。

机器人世界一直有这个尴尬:

  • 单臂机器人 = 只有一只手的厨师,递盘子要先放下再拿起,动作串行;
  • 双臂机器人 = 两只手的厨师,但两只手得"知道对方在干嘛",不能互相打架;
  • RDT-1B 的目标 = 给这个双手厨师装一个够大的脑子,能听懂你的话、看懂摄像头画面,然后同时规划两只手的下一步;而且这脑子不是只会一道菜,是先学过各种厨房(预训练)、再针对自家双臂硬件微调(fine-tuning)。

为什么这事难?两个坎:

  1. 两只手的动作高度耦合(coordinated action,配合协调),错一步全错——像跳双人舞,一个人踩错点整支舞就乱。而且双臂的动作维度更高(两条 7 自由度手臂加起来 14 维以上),"合理走法"往往不止一种(多模态 multi-modal)。
  2. 双臂训练数据特别少——现实里公开数据大多是单臂的。等于你只看过单手厨师的视频,却要训出双手厨师。

所以这一节是想说:RDT-1B 面对的是"双臂协调 + 数据稀缺 + 动作多模态"这三重难题,目标是一个能泛化的双臂通用策略。


RDT-1B — 场景示意:这论文要解决的现实问题
Plate Nº IRDT-1B — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Diffusion Policy(2023):在单臂任务上证明"用扩散模型当策略"比 MLP/Transformer 头更稳,但参数量小(百万级)、任务专用,没做多任务/多机器人泛化。
  • RT-1 / RT-2(Google):把 VLM(视觉语言模型)当策略骨干,能跨任务,但动作是离散 token、单臂为主
  • Octo(2024):开源跨机器人策略,Transformer 骨干 + 扩散头,做了"多家机器人数据混合预训练",但规模偏小(~93M),双臂不是主战场
  • ALOHA / Mobile ALOHA:优秀的双臂硬件 + 模仿学习方案,但策略本身是任务专用的小模型,不能跨任务零样本。
  • 依赖任务专属基元(task-specific primitives)的传统方法:靠人工设计的抓取/规划模块,泛化窄、复杂任务易崩。

多模态动作分布(multi-modal action distribution):同一个观察下有多种同样合理的动作。若用普通回归硬学,会学成这些动作的"平均",可能是完全无效的动作(比如既不向左也不向右)。扩散模型天然能表示这种"答案不唯一"的分布。

共同空白:**没人把"扩散策略 + 大规模预训练 + 双臂"三件事拼到一起。**RDT-1B 正是来填这个空。

所以这一节是想说:前人各有一块拼图(扩散/预训练/双臂),但没人合三为一,RDT-1B 把它们缝成一个双臂基础模型。


这篇论文的新想法

像 ChatGPT 把"大模型 + 海量预训练"那套从聊天搬到机器人,但坚持用扩散模型生成动作——不是像打字一样一个字符蹦出动作,而是像画家从一团涂鸦逐步擦出清晰画面。

三句话核心:

  1. 扩散适合画"动作"这张画:双臂动作是连续值、高维度、多模态。扩散本就擅长在"答案不唯一"的空间里采样,比硬把动作切成离散 token(像把油画压成像素方块)损失小。
  2. 大就是好,但骨架要撑得住:参数推到 1.2B(同期 OpenVLA 7B、π0 3B 也验证了 scaling 有效);普通 U-Net 撑不住这么大,改用 Transformer 风格的扩散骨干 DiT(Diffusion Transformer),并针对机器人数据做了三处关键改造(见方法)。
  3. 先广学再专精 + 统一动作空间:用 46 个数据集(各种机器人形态,单双臂都有)预训练打底子,再用自家双臂数据微调;关键前提是设计一个物理可解释的统一动作空间,把不同机器人的动作对齐到同一组带物理含义的槽位。

所以这一节是想说:RDT-1B 的新想法是"扩散 + DiT + 统一动作空间 + 两段式训练",专为双臂的多模态高维动作和数据稀缺量身定制。


它分几步做的(方法)

方法可拆成五块:扩散建模、多模态编码、DiT 三处改造、统一动作空间、两段式训练。这是全文最核心的部分。

1. 用扩散建模动作分布(Diffusion Modeling)

类比:画家不是一笔画出成品,而是从一团噪点出发,一步步擦掉噪声,最后浮现出清晰的动作。

输入:语言指令 ℓ、观察 o_t(图像 + 本体状态),以及一段"加了噪声的动作块"。

处理:不把"看到什么→做什么"当成一个确定映射去回归(那样会学成多模态动作的平均,可能无效),而是建模连续条件分布 p(动作 | 指令, 观察)。训练时给真动作加噪声得到 ã_t,让一个去噪网络 f_θ 从噪声里估计出干净动作,最小化去噪的均方误差(MSE)。而且一次预测**一整段动作块(action chunk)**而非单步,以保证时序连贯、减少累积误差。

输出:给定观察,采样出一段合理的双臂动作序列。因为动作维度远低于图像,扩散采样开销很小——这让扩散在机器人上比在图像生成上更划算。

action chunk(动作块):一次预测未来若干步动作,而非只预测下一步。能减少高频抖动和决策次数。

所以这一节是想说:扩散让 RDT 能表示"同一情况有多种合理走法"的双臂动作,且因动作维度低而采样很快。


2. 多模态编码:把图、语言、低维量分别喂进去(Multi-modal Encoding)

类比:三种原料用三种刀法处理,再下同一口锅。

输入:图像、语言指令、低维物理量(本体状态、动作块、控制频率)。

处理

  • 图像输入:用图文对齐的预训练视觉编码器 SigLIP 提取紧凑表示,训练时冻结权重以省显存;
  • 语言输入:用预训练的 T5-XXL(Transformer 语言模型)编码,同样冻结
  • 低维输入(本体状态、动作块、控制频率):用带 **Fourier 特征(傅里叶特征)**的 MLP 编码——傅里叶特征擅长捕捉低维空间里的高频变化,这正是机器人物理量的特点。

输出:三路编码后的条件表示,供去噪网络使用。

本体状态 / 本体感受(proprioception):机器人自己的关节角度等内部状态,回答"我现在手在哪、姿态如何"。

所以这一节是想说:RDT 用现成冻结的强编码器处理图和文(省算力),用傅里叶 MLP 专门伺候高频抖动的机器人低维量。


3. DiT 的三处关键改造(QKNorm / RMSNorm / ACI)

类比:把画图用的 DiT 拿来画动作,得先给它做三处"防抖 + 防偏科"的改装。

输入:加噪动作块 + 扩散时间步 k + 图像/语言条件。

处理:机器人数据和图像/视频差别很大——数值范围不稳、有非线性动力学、高频变化。原始 DiT 直接用会训练不稳甚至爆炸。三处改造:

  1. QKNorm:在算注意力时对 Query/Key 做归一化,避免机器人物理量数值范围不稳导致的数值溢出/梯度不稳。
  2. RMSNorm 替换 LayerNorm:机器人动作可看作时间序列,LayerNorm 的"中心化(减均值)"操作会造成 token 偏移和注意力偏移,破坏时序对称性;RMSNorm 不做中心化,更适合。论文指出没有这些改造,大规模预训练极易发散甚至爆炸。
  3. 交替条件注入(Alternating Condition Injection, ACI):图像 token 通常远多于文本 token,如果每层都同时注入两者,图像会盖过文本、削弱指令跟随能力。ACI 让相邻层交替注入图像和文本(用 cross-attention 而非把条件压成单 token),既容纳变长条件、又避免图像淹没语言。

输出:一个能稳定训练到 1.2B、且不"忽视语言"的扩散去噪骨干。

所以这一节是想说:三处改造(QKNorm、RMSNorm、ACI)是把图像用的 DiT 改造成"能稳训、听得懂话"的机器人 DiT 的关键工程。


4. 物理可解释的统一动作空间(Unified Action Space)

类比:一个翻译,把各地方言(单臂 6 维、双臂 14 维、其他形态各种维度)都翻译成同一种"标准普通话",且每个词都有明确物理含义。

输入:各种机器人各自原始的动作/状态表示。

处理:设计一个统一的大向量空间,给"大多数机器人的主要物理量"都留固定槽位(每个槽位有清晰物理含义,如某关节角、某方向位移、夹爪开合)。每台机器人按自己的运动学把动作填进对应槽位,没用到的槽位打 **mask(掩码)**标记。因为动作 a_t 通常是"下一时刻期望状态 z_{t+1}"的子集,状态空间天然包含动作空间,所以本体状态和动作可以共用一套空间。

输出:一套所有机器人共享、物理可解释的动作表示,让 1.2B 模型能从异构多机器人数据里学到可迁移的物理规律,而不是被格式差异淹没。

所以这一节是想说:统一动作空间是"把 100 万条五花八门轨迹喂进同一个模型"的前提,物理可解释让跨机器人知识能真正迁移。


5. 两段式训练:预训练 + 微调(Pre-train then Fine-tune)

类比:学生先读通识课,再读专业课。

输入:预训练用 46 个多机器人数据集(OXE / RH20T / RoboSet 等的子集,约 100 万条轨迹);微调用自采双臂数据集。

处理

  • 预训练(通识课):在迄今最大的多机器人数据集合上训练去噪目标——"看着观测,把噪声动作还原成合理动作"。把数据量放大约三个数量级,逼出可迁移的物理先验。
  • 微调(专业课):在自采的 6K+ 条双臂轨迹上继续训。这个数据集强调三点质量:数量(6K+,是当时最大的双臂集之一)、全面(300+ 挑战性任务,从抓放到插线甚至写数学公式)、多样(100+ 刚性和柔性物体,各种尺寸纹理)。
  • 推理时:你说"把杯子递给我" → 模型看画面 → 在"草稿纸"上跑几步去噪 → 得到一段双臂动作 → 执行 → 再看画面、再去噪(类似开车每隔几秒重新看路,叫 滚动时域控制 receding horizon control)。

输出:一个能零样本泛化、少样本(1~5 演示)学新技能、胜任双臂灵巧任务的策略。

整体数据流(ASCII)

        图像 ──► SigLIP(冻结) ──┐
        语言 ──► T5-XXL(冻结) ──┤ 交替注入(ACI, cross-attn)
   本体状态/动作块/控制频率 ──► Fourier-MLP ──┤
                                              ▼
   加噪动作块 ã_t + 扩散步 k ──►  DiT 去噪网络 f_θ (1.2B)
                                   (QKNorm + RMSNorm)
                                              │ 迭代去噪 K 步
                                              ▼
                              干净双臂动作块 a_{t:t+Ta}

两段式训练(ASCII)

  46 数据集 / ~1M 轨迹        自采双臂 6K+ 轨迹 / 300+ 任务
  (单臂+双臂, 多形态)          (高质量, 目标 ALOHA 双臂)
        │ 预训练                     │ 微调
        ▼                            ▼
   通用物理先验  ───────────►  目标双臂机器人专精策略

所以这一节是想说:RDT 靠"100 万轨迹预训练 + 6K 双臂精调"两段式吃下数据稀缺,统一动作空间让预训练的物理知识能迁移到目标双臂。


RDT-1B — 方法示意:核心 pipeline
Plate Nº IIRDT-1B — 方法示意:核心 pipeline

关键数字(What works)

论文摘要与正文可确认的数字如下;未明确报告的标"原文未报告"。

模型与数据规模

项目 数值
参数量 1.2B(12 亿)
定位 最大的扩散式机器人操作基础模型
骨架 Diffusion Transformer(DiT,改造版)
视觉编码器 SigLIP(冻结)
语言编码器 T5-XXL(冻结)
预训练数据集数 46 个多机器人数据集
预训练轨迹量 1M(100 万)条(数量级)
微调数据 自采 6K+ 条双臂轨迹
微调任务数 300+
微调物体数 100+(刚性 + 柔性)
目标机器人 ALOHA 双臂(两臂 + 三相机)

性能(真机,相对基线)

指标 数值
平均成功率提升(跨挑战任务,相对强基线) +56%
少样本学新技能 1~5 个演示
零样本泛化 未见物体 / 场景 / 指令
图示的相对提升(预训练 vs 从零) 68.2% vs 34.8%(约 +33.4%,见论文示意图)

改造消融(定性):不加 QKNorm/RMSNorm,大规模预训练易发散甚至爆炸;不用 ACI,图像 token 淹没文本、指令跟随能力下降(论文 Fig. 4 给定量结果)。

所以这一节是想说:可确认的硬数字是"1.2B 参数、46 数据集预训练、6K+ 双臂微调、平均成功率约 +56%、1~5 演示学新技能"。


实验结果说明了什么

**结论 1:扩散比离散 token 更适合双臂动作。**双臂动作高维、多模态,扩散能表示"答案不唯一"的分布,避免离散化的量化误差和"回归到无效平均"的问题。这是 RDT 选扩散而非 RT-2 式 token 化的根据。

**结论 2:跨机器人预训练能对冲双臂数据稀缺。**把双臂数据量的短板用 100 万条多机器人轨迹补上(放大约三个数量级),预训练 vs 从零训练的对比(约 +33.4% 的示意提升)说明预训练的物理先验确实迁移到了目标双臂。

**结论 3:统一动作空间是跨机器人学习的钥匙。**只有把异构机器人的动作对齐到物理可解释的同一空间,模型才能从杂乱数据里学到共通规律,而不是被格式差异困住。

**结论 4:针对机器人数据的架构改造不可省。**QKNorm/RMSNorm 让大模型稳得住不爆炸,ACI 让语言不被图像淹没。没有这些,1.2B 规模根本训不起来或训成"聋子"。

**结论 5:scaling 在机器人上同样成立。**1.2B 是当时最大的扩散机器人模型,配合大数据得到强泛化和少样本能力,印证"大模型 + 大数据"范式从 NLP/CV 迁到机器人依然有效。

所以这一节是想说:核心 takeaway 是"扩散建多模态 + 跨机器人预训练补数据 + 统一动作空间迁移知识 + 架构改造稳训练",四者缺一不可。


你应该懂的几个新词

双臂操作(bimanual manipulation):两条机械臂协同完成任务,难点是动作耦合 + 数据稀缺。

扩散策略(diffusion policy):把图像生成里的"去噪扩散"搬来当动作生成器,从噪声逐步还原出动作。特别适合多模态连续动作。

DiT(Diffusion Transformer):用 Transformer 替代 U-Net 当扩散骨干,scaling 友好。RDT 在其上做了三处机器人化改造。

多模态动作分布:同一观察下有多种合理动作。扩散能采样其一,普通回归会学成无效平均。

统一动作空间(unified action space):把不同机器人形态的动作映射到同一组带物理含义的维度,让混训成为可能。

本体感受(proprioception):机器人自身关节等内部状态。

滚动时域控制(receding horizon control):每次预测一段动作、执行一部分、再重新观察预测,滚动向前。

QKNorm / RMSNorm / ACI:RDT 对 DiT 的三处改造,分别解决数值不稳、时序对称性、图像淹没语言的问题。

所以这一节是想说:抓住"扩散策略""DiT""统一动作空间""多模态动作"这四个词,就抓住了 RDT 的骨架。


它有什么搞不定的

  1. 推理有采样开销:扩散要迭代去噪多步。虽然动作维度低、开销比图像小,但相比一次性回归或并行解码(如 OpenVLA-OFT)仍偏慢,高频控制上不占优。
  2. 微调数据仍需自采:6K+ 双臂轨迹是团队自己遥操采的,换一台新双臂机器人仍要收集高质量演示,成本不低。
  3. 依赖冻结的 SigLIP / T5:视觉和语言编码器冻结以省显存,好处是省算力,代价是它们对机器人视角/指令的适配受限(不像 OpenVLA 会解冻视觉编码器)。
  4. 1.2B 的算力门槛:预训练 100 万轨迹 + 1.2B 参数需要可观算力,普通实验室难复现预训练(微调门槛低一些)。
  5. 多模态采样的稳定性:扩散能表示多模态,但也可能在关键时刻采样到一个"少数派"动作导致失败;确定性任务上多模态未必是优点。
  6. 长时程可靠性:复杂长任务里,滚动时域执行仍可能累积误差,摘要报告的是平均成功率提升,不代表每个任务都接近满分。

所以这一节是想说:RDT 的代价是"扩散采样偏慢 + 编码器冻结的适配限制 + 预训练算力门槛",以及多模态采样在确定性任务上的双刃剑。


它和别的几篇是什么关系

家族树(ASCII)

   Diffusion Policy(扩散当策略, 单臂小模型)
   DiT(扩散用 Transformer, 图像生成)
   ALOHA(双臂硬件平台)
            │  合三为一 + scaling 到 1.2B
            ▼
        RDT-1B(扩散 + DiT + 双臂 + 跨机器人预训练)
      ┌─────────┼──────────────┐
   竞品          竞品             对照范式
   OpenVLA(7B)   π0(3B)          RT-2
  (离散token,单臂) (flow matching) (动作当文本token)
  • 上游:Diffusion Policy(扩散当策略的奠基)、DiT(扩散用 Transformer)、ALOHA(双臂硬件)。
  • 同辈/竞品
    • Octo(2024):开源跨机器人策略,规模更小、单臂为主;
    • OpenVLA(2024):7B VLM 路线、动作离散 token、单臂(见 openvla.md);
    • π0(Physical Intelligence):3B flow matching 策略,和 RDT 思路最接近——都走"大模型 + 连续动作生成 + 跨机器人预训练",但 π0 用 flow matching 而非 diffusion(见 pi0.md)。
  • 与 RT-2 的关键差异:RT-2 把动作压成文本 token 让 VLM 输出;RDT 保留动作连续性、用扩散显式建模分布。
  • 下游影响:是后续国产双臂基模和 humanoid 全身策略的直接前作,证明"扩散 + 双臂基模"这条路可行。

所以这一节是想说:RDT-1B = Diffusion Policy 的扩散思想 + DiT 骨架 + 统一动作空间 + 跨机器人预训练,是双臂版的机器人基础模型,与 π0 是"扩散 vs flow matching"的对照。


和本导读的关系

本篇对应 Ch13: 扩散策略

Ch13 讲"为什么用扩散/流生成连续动作、以及模态平均问题"。这条线的叙事大致是:Diffusion Policy(验证扩散当策略)→ 3D Diffusion Policy(加 3D 感知)→ 大规模基础模型(π0、RDT-1B)。RDT-1B 是这条线在"双臂 + 基础模型规模"上的代表:它把 Diffusion Policy 的核心思想 scaling 到 1.2B,并解决了"多机器人异构数据怎么混训"(统一动作空间)和"大扩散模型怎么稳训"(DiT 三处改造)。读完 Ch13 的 Diffusion Policy 基础,再读 RDT,就能看到扩散策略如何长成基础模型;对照 π0 则能理解 diffusion 与 flow matching 在动作生成上的工程取舍。

所以这一节是想说:RDT-1B 是 Ch13 扩散策略线上"双臂 + 基础模型规模"的关键一站,与 π0 并列为该线的产业级标杆。


思考题

Q1:RDT 用扩散显式建模多模态动作分布,而 OpenVLA/RT-2 用离散 token。对"双臂协调"这个具体场景,为什么多模态建模尤其重要?

提示

双臂协调的合理解法往往不止一种(左手先动还是右手先动、从左边绕还是右边绕),动作维度又高(14+ 维),模式更多。若用确定性回归,模型会学成这些模式的平均——比如两只手都停在中间,这是物理上无效甚至危险的动作。扩散能采样出其中一个自洽的完整模式,保证两只手的动作是"一套配合"而不是"多套配合的平均"。离散 token 虽也能表示多模态,但量化误差在高维双臂上被放大。

Q2:RDT 冻结了 SigLIP 和 T5,而 OpenVLA 解冻了视觉编码器一起训。两种选择各自赌的是什么?

提示

RDT 冻结是为了省显存、把有限算力留给 1.2B 的 DiT 去噪骨干,赌"预训练视觉/语言表示已经够用,机器人特有的适配交给下游模块和统一动作空间"。OpenVLA 解冻是赌"机器人视角和互联网图差异大,必须让视觉编码器适应机器人视角"。取舍本质是"算力分配 + 领域差距"的判断:冻结省算力但适配弱,解冻适配强但更贵更易破坏通用表征。

Q3:论文强调不加 RMSNorm(用原始 LayerNorm)会破坏时序对称性。为什么把机器人动作当"时间序列"看会改变归一化的选择?

提示

LayerNorm 会对每个 token 减均值(中心化)。对时间序列,这种中心化会引入依赖于整段序列统计量的偏移(token shift / attention shift),破坏"时间平移不变"这种序列本该有的对称性——同样的动作模式出现在序列前段和后段,中心化后表示会不一致。RMSNorm 只按幅度缩放、不减均值,保留了这种对称性。这说明"把动作当序列"这个视角直接影响了归一化层的设计。

Q4:统一动作空间给每台机器人留固定槽位、没用到的打 mask。这种设计和 π0 的"pad 到统一维度 + mask"有何异同?会不会学到虚假相关?

提示

相同点:都用"固定大向量 + mask"容纳异构形态。不同点:RDT 强调每个槽位"物理可解释"(某槽位固定表示某个物理量),让不同机器人的同类物理量对齐到同一维,从而迁移物理规律;单纯 pad 不保证语义对齐。虚假相关风险确实存在——如果 mask 处理不当,模型可能把"某维恒为 0/被 mask"当成 embodiment 的线索。缓解靠 mask 不参与损失、以及物理对齐让有效维度承载真实信息。

Q5:RDT 能用 1~5 个演示学新技能。这种少样本能力主要来自哪一步?如果去掉预训练,还能少样本吗?

提示

主要来自大规模预训练学到的可迁移物理先验——模型已经"见过世界上各种操作长什么样",新技能只是在已有先验上做小幅适配,所以几个演示就够。去掉预训练(从零训练),模型没有先验,几个演示远不足以学会一个新技能(论文的预训练 vs 从零对比正说明这点,约 +33.4% 差距)。这与语言模型"预训练后少样本 in-context 学习"是同一逻辑。

Q6:RDT(扩散)和 π0(flow matching)都做连续动作生成。如果你要在一台需要 50Hz 高频控制的机器人上二选一,会考虑哪些因素?

提示

关键是推理延迟。扩散通常需要较多去噪步;flow matching 学"直线路径"的速度场,π0 用 10 步即可部署,更适合高频。所以纯看高频延迟,flow matching 占优。但也要看动作维度(RDT 强调动作维度低使扩散开销可控)、多模态需求、以及是否有 KV cache 等工程优化。若能把扩散步数压到很低(如 consistency 蒸馏),差距会缩小。这道题本质是"采样步数 vs 控制频率"的权衡。


一些好奇心问答(FAQ)

Q:RDT 是 VLA 吗?

它是"语言-视觉-运动策略(language-visuomotor policy)",功能上属于 VLA 大家族(看图 + 听指令 → 出动作),但动作生成走扩散而非离散 token,且专攻双臂。

Q:1.2B 和 OpenVLA 7B、π0 3B 比谁大?

RDT 1.2B 比它们参数少,但它是"最大的扩散式机器人操作基础模型"——比较的是扩散这一类里的规模。

Q:需要什么硬件?

目标机器人是 ALOHA 双臂(两臂 + 三相机)。但论文强调方法对任意双臂夹爪机器人通用。

Q:数据开源吗?

论文提供项目主页(代码和视频)。预训练用的是公开多机器人数据集的子集;自采的 6K+ 双臂数据以官方发布为准。

Q:为什么是清华团队做的,意义在哪?

它是国内机器人基础模型里影响力最大的工作之一,证明了"中国团队也能做基础模型规模的机器人策略",是理解中国具身智能路线绕不开的一篇。

所以这一节是想说:对多数人,RDT 的价值是理解"扩散 + 双臂 + 跨机器人预训练"这套组合,而非复现其预训练。


如果你想再深入

  1. 前置(必读):Diffusion Policy (Chi et al. 2023) — 扩散当策略的奠基,先懂它再懂 RDT 的 scaling。见 diffusion-policy.md
  2. 骨架来源:DiT (Peebles & Xie, 2023) — 扩散用 Transformer 的原始设计,看 RDT 改了哪三处。
  3. 对照读:π0 (Physical Intelligence, 2024) — flow matching vs diffusion,两篇放一起看能立刻理解动作生成的工程取舍。见 pi0.md
  4. 单臂对照:OpenVLA (Kim et al. 2024) — 离散 token 单臂 VLA,对比连续 vs 离散动作。见 openvla.md
  5. 硬件背景:ALOHA / Mobile ALOHA — RDT 的目标双臂平台和数据采集方式。

读顺序建议:

Diffusion Policy → DiT → RDT-1B(你在这)
                          ├─► π0(flow matching 对照)
                          └─► OpenVLA(离散单臂对照)

所以这一节是想说:把 RDT 放在"Diffusion Policy → 基础模型"的脉络里读,对照 π0 看扩散与 flow 的取舍,对照 OpenVLA 看连续与离散的取舍。


原文信息

@inproceedings{liu2024rdt,
  title={RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation},
  author={Liu, Songming and Wu, Lingxuan and Li, Bangguo and Tan, Hengkai and Chen, Huayu and Wang, Zhengyi and Xu, Ke and Su, Hang and Zhu, Jun},
  booktitle={International Conference on Learning Representations (ICLR)},
  year={2025}
}
  • arXiv:2410.07864
  • 机构:清华大学(Tsinghua University)
  • 一句话定位:1.2B 扩散 + DiT 双臂基础模型,46 数据集预训练 + 6K 双臂精调,统一动作空间,平均成功率约 +56%。

引用本笔记 / Cite this note
BibTeX
@online{eai_rdt_1b_2026,
  title       = {(readable note) RDT-1B: Diffusion Foundation Model for Bimanual Manipulation},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rdt-1b/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?