Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 109

RT-1: Robotics Transformer for Real-World Control at Scale

36 min read · 12465 字 · ⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI 和机器人"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话。


一句话讲什么(TL;DR)

Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式在物理世界同样有效。

所以这一节是想说:RT-1 是具身 AI 领域第一个用大规模数据 + Transformer 跑通"端到端机器人控制"的工作,从此 VLA 范式正式登场。


这是个什么场景

周末下午,你瘫在沙发上刷手机,茶几上摆着半罐喝剩的可乐。你随口对客厅那台机器人喊一句:"把茶几上的可乐罐放进中间那个抽屉。"你期待它像个刚来的家政阿姨——听懂这句话、抬头瞄一眼茶几、走过去、拉开抽屉、捏起可乐、放进去、再把抽屉关上。中间任何一步出错——没听懂"中间那个"、把可乐看成纸巾盒、手指夹太松把罐子捏扁——都会让整件事砸锅。

可 2022 年,机器人圈做不到这件事。当时台面上的玩家长这样:工厂流水线机器人能把一种零件精准塞进一个孔,可你把螺丝换成螺母它就懵了,像那种只会做番茄炒蛋的厨师,让他炒土豆丝就翻车。会聊天的 AI(GPT 那种)菜谱倒背如流、"可乐放抽屉"的步骤说得头头是道,但它没有手,落不到现实,像光会写美食推文的评论家。仿真训出来的机器人在电脑游戏里抓积木抓得飞起,搬到真实桌子上一脚踹翻杯子,像在驾校模拟器拿了满分、第一次真上路就追尾的新司机。

RT-1 想做的事,就是把这三类的好处捏一起:一个统一的模型,听得懂中文或英文指令,能看摄像头画面,直接告诉机器人 7 个关节该怎么转、夹爪该开多大,并且在真实办公室厨房里能搞定 700 多种活。

所以这一节是想说:RT-1 要造的是一个"能听话、能看、会动手"的通用机器人控制大脑——在当时这三个能力从没被同时装进一个模型。


RT-1 — 场景示意:这论文要解决的现实问题
Plate Nº IRT-1 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

方案 A:流水线拼接(先识别、再规划、再控制)。 类比:流水线工厂——视觉组识别物体丢给规划组,规划组算出路径丢给控制组。任何一环出错整条线都崩,且每个组件都得人手维护。组件之间的接口用文本或者坐标传信息,物理细节大量丢失。

方案 B:BC-Z(行为克隆)。 用 ResNet 看图,直接输出连续动作。但它每次只看当前一帧,没有记忆——上一秒做了什么这一秒就忘了。复杂任务做不了。在 Google 的真实数据集上,它的训练任务成功率只有 72%,泛化到新指令更只有 19%。

方案 C:Gato(DeepMind 的通才模型)。 用大 Transformer 学多种任务——玩游戏、机器人、写文字混着学。但 Gato 只在仿真里堆了 1 个搭积木任务,真实世界覆盖很少;模型 1.2B 参数,跑一次推理 1.9 秒——机器人手早动完了。为了能上真机只好砍到 37M,结果架构和数据利用都不如 RT-1。

方案 D:小数据 + 强假设。 用几百条示教,加各种手工先验(关节限制、物理约束)。换个任务就要重新调几个月,无法复用。

核心难题:缺一个"既能吸收大数据、又能 100ms 内出动作"的模型架构。模型大了跑不快,跑得快的又学不下海量任务。

所以这一节是想说:以前的方法要么不够通用、要么不够快、要么数据吃不下——RT-1 要同时把这三块解决。


这篇论文的新想法

把"看图 + 听指令 + 输出动作"当成一个序列翻译问题,用一个 35M 参数的小 Transformer 端到端学,再用一些工程技巧把它压到 100ms 内出结果。

听起来朴素,但这是机器人圈第一次有人系统证明:只要架构对、数据够多够杂,机器人也能"涌现"出泛化能力——用训练时见过的概念片段重新组合,完成从没见过的新指令。这个结论的意义相当于 NLP 圈证明"语言模型可以做 few-shot"——从此所有人都朝这个方向冲了。

所以这一节是想说:核心创新是把机器人控制重新框成"序列建模",再配上一套能在真机器人上 3Hz 跑起来的架构工程。


它分几步做的(方法)

Figure 1(ar5iv 原图)
Plate Nº IIFigure 1(ar5iv 原图)

上图说明:Figure 1(ar5iv 原图)(论文原图)。

Figure 2(ar5iv 原图)
Plate Nº IIIFigure 2(ar5iv 原图)

上图说明:Figure 2(ar5iv 原图)(论文原图)。

Figure 3(ar5iv 原图)
Plate Nº IVFigure 3(ar5iv 原图)

上图说明:Figure 3(ar5iv 原图)(论文原图)。

整篇论文做了 4 件事:花 17 个月攒数据、设计 token 化方案把多模态输入统一成 Transformer 能吃的格式、搭建一个跑得快的 Transformer 出动作 token、用模仿学习训练整个系统。下面逐一拆开。

下图是 RT-1 从"图像 + 指令"到"动作 token"的端到端管线:

  一句指令 "pick coke can"        头顶摄像头最近 6 帧 (300×300)
        │                                │
        ▼                                ▼
  ┌──────────┐  语言向量(512)   ┌─────────────────────────┐
  │  USE     │─────FiLM 染色───►│ FiLM-EfficientNet-B3    │  每帧→9×9×512
  │句子编码器│  (1+γ)·x+β       │ (早融合: 语言指导看图)  │  =81 token
  └──────────┘                  └────────────┬────────────┘
                                              ▼
                                 ┌─────────────────────────┐
                                 │ TokenLearner 软选择      │  81→8 token/帧
                                 │ (2.4× 提速)              │  ×6 帧 = 48 token
                                 └────────────┬────────────┘
                                              ▼
                                 ┌─────────────────────────┐
                                 │ decoder-only Transformer│  8 层 self-attn
                                 │ (19M, 48 token 输入)     │
                                 └────────────┬────────────┘
                                              ▼
                        11 维动作 token (每维 256 选1, 并行非自回归)
                        末端 xyz+rpy + 夹爪 + 底盘 xy+yaw + 模式
                                              ▼
                        闭环 3Hz 执行 → 重新拍照 → 循环

上图说明:语言经 FiLM 在 EfficientNet 内部就"指导看图"(早融合),TokenLearner 把每帧压到 8 个 token 提速,Transformer 一次并行吐出 11 维离散动作,闭环 3Hz 边看边纠错。


第一步:攒一个"大而杂"的机器人数据集

类比:想让小孩学会说话,不能只让他听天气预报循环播放——得听到妈妈讲故事、爸爸念绘本、邻居唠家常、电视放动画片,杂七杂八凑在一起,他才学得会语言。机器人也一样:单一任务数据训出来的是工具人,杂任务数据训出来的才是通才。

它在干什么:Google 团队动用了 13 台 Everyday Robots 移动机器人(每台有一个 7 自由度手臂、两指夹爪和可移动底盘),在 17 个月里,让人类操作员通过 VR 遥控手柄给机器人录下了约 130,000 段示教视频。每段视频配上一句文字说明,比如"把可乐罐放进中间抽屉"。采集地点是专门搭建的"机器人教室"——模拟真实办公室厨房的操作台,方便大规模平行录制。

操作员的遥控方式值得一提:两个 VR 遥控器,3D 位移映射到手臂末端的 6D 位姿变化,摇杆映射到底盘的转向和行驶。这保证了采集到的动作和模型输出动作处于同一坐标空间,不需要额外对齐。

数据集涵盖 744 种语言指令,分成 8 大技能:

  • 拿起物体(pick):130 个变种
  • 移动物体到另一物体附近(move X near Y):337 个变种
  • 把长条物体立起来(place upright):8 个
  • 推倒长条物体(knock over):8 个
  • 开抽屉(open drawer):3 个
  • 关抽屉(close drawer):3 个
  • 把物体放进容器(place into receptacle):84 个
  • 从容器拿出再放台面(pick from receptacle and place on counter):162 个
  • 额外的高难度现实指令(如"打开大玻璃瓶装的开心果""从纸巾盒里拉出纸巾"):9 个

每个 episode 的长度取决于任务复杂度,通常在 2-4 秒内完成(人类手速下限)。这个时间也决定了模型必须达到 3Hz 以上的控制频率才不会拖慢操作。

为什么数据多样性比数据量更重要:论文在 6.5 节做了一组关键消融实验。把任务种类砍 25%(数据总量只少 3%),泛化分数的下降 ≈ 把数据量直接砍 49% 的效果。换句话说,多样性的杠杆是数据量的 2 倍。如果你要采更多数据,宁可加新任务也别多采已有的同一种任务。这条结论后来被几乎所有具身 AI 论文反复验证——RT-2 的 co-fine-tuning 策略和 OpenVLA 的数据混合都建立在这个发现之上。

数据增长与性能的关系:论文附录展示了 17 个月里数据量、任务数和模型性能的增长曲线。随着任务数从几十增加到 700+,模型在已见任务上的成功率从不到 50% 稳步爬升到 97%。这个趋势类似 NLP 圈观察到的"数据越多 → 模型越好"的 scaling law,但维度从"文本 token 数"变成了"任务多样性 × 示教量"。

示教(demonstration):人手把着机器人或用 VR 手柄遥控,让它做一件事。机器人记录下每个时刻的画面 + 自己的动作。AI 之后会模仿这些记录。

行为克隆(Behavioral Cloning):训练方式之一。给定一堆"输入 + 正确动作",让模型学着在同样输入下输出同样动作。和小学抄写课文一个意思。

所以这一节是想说:通用机器人的命根是"任务多样性 × 量",作者花了 17 个月才把数据这一关熬出来——没有这 13 万条杂七杂八的示教,后面再好的模型也是空中楼阁。


第二步:把图、文、动作全部"塞进" Transformer 能吃的格式

类比:想象 Transformer 是一台只认豆腐块的麻辣烫机器:扔进什么食材都行,但必须切成同样大小的小方块才能下锅。米饭、青菜、肉,统统先切丁。这个"切方块"的过程在 AI 圈叫 tokenization(标记化)。RT-1 要把三种完全不同的东西——摄像头画面、一句英文指令、机器人关节角度——都切成统一格式的 token,然后串成一条序列扔给 Transformer 处理。

等等,先慢一拍——Transformer 到底是个啥? 把它想成一个超级会"找重点"的阅读理解学霸。你给它一串小方块(一句话、一段视频帧、一连串动作),它会左看看右看看,自动判断哪几块最相关(这个机制叫 self-attention),然后输出下一块该是什么。GPT、Claude 都是这套路。RT-1 把"输出下一块"换成"输出下一个关节角度 token"。

token(标记):模型能直接处理的最小单位。文字里一个 token 大约是半个英文单词;图片里一个 token 是一小块画面的数字摘要;动作里一个 token 是某个关节角度离散化后的编号。

Transformer:一种 AI 架构,2017 年由 Google 提出(论文名"Attention is All You Need")。它擅长处理"序列"——一串按顺序排列的 token。GPT、ChatGPT、Claude、CLIPLLaVA、RT-1 都是 Transformer 家族成员。

下面按信息流的顺序,讲清楚 RT-1 的每个组件。


2a. 图像 token 化("眼睛")

输入:机器人头顶摄像头拍到的最近 6 帧画面(每帧 300×300 像素 RGB 图像)。为什么保留 6 帧而不是只看当前 1 帧?因为很多任务需要运动历史——比如"我刚才把手移到了杯子上方"这个信息只看当前帧是看不出来的(上一帧手在桌面中央,这一帧手在杯子正上方——两帧对比才知道方向)。消融实验证明去掉历史信息后,抗干扰物能力明显下降。

处理管线:6 帧图像逐帧通过一个 ImageNet 预训练的 EfficientNet-B3 网络。EfficientNet 是 Google 设计的图像识别网络,同等精度下参数比 ResNet 少一半。B3 版本经过 ImageNet 100 万张图像的预训练,已经学会了"什么是边缘""什么是物体轮廓""什么是颜色"这些基础视觉知识。每帧图像经过 EfficientNet 的卷积层后,输出一个 9×9×512 的特征图(feature map)。把这 81 个空间位置拍扁,就得到 81 个图像 token,每个 token 是一个 512 维向量。

EfficientNet:Google 2019 年提出的卷积网络系列。核心思想是同时调节网络的深度、宽度和输入分辨率,找到最优平衡。RT-1 用 B3 版本,约 12M 参数。

特征图(feature map):卷积网络的中间产物。一张 300×300 的图片经过多层卷积后变成 9×9×512 的"浓缩版"。9×9 的每个格子对应原图的一块区域(receptive field),512 个通道编码了这块区域的各种语义信息(有没有边缘、有没有特定物体、颜色是什么)。

为什么用预训练 EfficientNet 而不是从头训? 消融实验结果很直接:去掉 ImageNet 预训练后,对未见任务的成功率从 76% 暴跌到 43%(跌了 33 个百分点)。ImageNet 数据集有 1000 类、128 万张图像,让 EfficientNet 学会了"苹果长什么样""金属罐子的反光模式""布面台面的纹理"等通用视觉知识。不用白不用。


2b. 语言指令注入("耳朵")——FiLM 条件化

输入:一句自然语言指令,例如"pick coke can from top drawer and place on counter"。

第一步:编码成向量。 用 Universal Sentence Encoder(USE)把指令编码成一个固定长度(512 维)的向量。USE 是 Google 2018 年发布的句子编码器,能把任意长度的英文句子压成一个数字摘要。

第二步:通过 FiLM 层注入图像编码器。 把语言向量"染色"到 EfficientNet 的每一层卷积之后——具体来说,语言向量经过两个全连接层生成一组 γ(缩放因子)和 β(偏移量),然后对 EfficientNet 内部特征做逐通道线性调制:输出 = (1+γ) × 输入 + β

FiLM(Feature-wise Linear Modulation,特征逐维线性调制):一种把一个信息源(比如指令)"染色"到另一个信息源(比如图像特征)上的技巧。类比:你拿着购物清单逛超市。FiLM 就像清单在你脑子里激活了某些"高亮模式"——清单上写了"牛奶",你的眼睛对冷藏柜特别敏感。机器人看到指令"拿可乐",它的视觉系统就会对红色圆柱形的东西特别敏感。

identity initialization 的小技巧:EfficientNet 是 ImageNet 预训练好的,权重很金贵。直接往中间插 FiLM 层会破坏已有的特征流。解决方案:把生成 γ 和 β 的全连接层权重初始化为零——这样 FiLM 层刚开始等价于恒等映射(γ=0 → 1+γ=1,β=0),完全不改变特征。随着训练推进,FiLM 层会逐渐学到"有效"的 γ 和 β 值,从而温和地注入语言信息。这个技巧在 VLM 社区后来被广泛使用。

为什么要早融合(early fusion)而不是晚融合? 对比方案是 Gato 的做法:先把图像单独编码成 token、把文字单独编码成 token,然后在 Transformer 里让它们互相看(晚融合)。RT-1 的 FiLM 在 EfficientNet 内部就完成了"语言指导看图",这样图像 token 从一开始就带有任务信息——只保留和任务相关的视觉特征,天然过滤掉干扰物。论文附录的注意力可视化(Figure 13)证实:模型的注意力确实聚焦在指令提到的物体和交互区域上。Gato 在抗干扰物测试上比 RT-1 低 40 个百分点(43% vs 83%),很大一部分原因就是晚融合导致图像 token 里保留了太多无关信息。

RT-1 的 FiLM-EfficientNet-B3 总计约 16M 参数,含 26 层 MBConv 块和对应的 FiLM 层,最终输出 81 个"视觉-语言融合 token"。


2c. TokenLearner:从 81 个 token 压缩到 8 个

问题:81 个图像 token × 6 帧 = 486 个 token。对一个要在 100ms 内出结果的模型来说太多了——Transformer 的计算量和 token 数的平方成正比(self-attention 复杂度 O(n²))。486 个 token 的 attention 矩阵有 23 万个元素,推理太慢。

解决方案:在 EfficientNet 输出和 Transformer 输入之间插入一个 TokenLearner 模块。TokenLearner(来自 Google 2021 年的视频理解论文)是一个"软注意力选择器"——它学会从 81 个 token 里挑出最关键的 8 个(或者说,学会把 81 个 token 做加权组合压缩成 8 个新 token)。类比:一家公司 81 个员工要给 CEO 汇报,但 CEO 只有时间听 8 个人的。TokenLearner 就是那个替 CEO 挑人的行政助理——它看看 81 个人的报告,挑出最值得听的 8 个关键摘要。

实现细节:TokenLearner 对每个"输出 token 槽位"学习一个空间注意力图(spatial attention map),尺寸 9×9,与特征图大小相同。这个注意力图对 81 个空间位置做加权,加权和就是该槽位的输出 token。8 个槽位 = 8 张不同的注意力图 = 从不同"视角"提取不同的关键信息。

6 帧 × 8 token/帧 = 48 个 token。这就是最终喂给 Transformer 的序列长度。

速度收益:加入 TokenLearner 后推理速度快了 2.4 倍(从 36ms 降到 15ms),同时性能几乎没掉。消融实验显示去掉 TokenLearner 不影响准确率但会把推理时间拉长到无法满足 100ms 要求。


2d. 动作 token 化("手")

机器人动作空间定义:RT-1 控制的 Everyday Robots 机器人有 11 个动作维度:

  • 手臂末端的 x/y/z 位移变化(3 维)
  • 手臂末端的 roll/pitch/yaw 旋转变化(3 维)
  • 夹爪开合度(1 维)——连续值,不是简单的开/关
  • 底盘的 x/y 位移和 yaw 旋转(3 维)
  • 模式切换(1 维,离散值):正在控制手臂 / 正在控制底盘 / 终止当前 episode

关键设计决策:离散化(discretization)。 把每个连续维度的取值范围均匀分成 256 个格子(bin)。例如,手臂 x 方向的位移如果范围是 [-5cm, +5cm],那每个 bin 大约对应 0.04cm 的精度。模型的任务就是对每个维度做一个"256 选 1"的分类——像做选择题而不是填空题。

离散化(discretization):把连续的数(如 0.347)压到有限个固定档位(如第 89 档)。好处:模型可以像选答案那样输出动作(256 选 1),避免了连续回归常见的"模式坍缩"问题(多个正确答案时回归会输出它们的平均值,导致动作不伦不类)。代价:精度受限于 bin 数量——256 个 bin 对桌面抓取够用,但对穿针这种亚毫米操作就不够了。

为什么不用连续输出? 消融实验给出了答案:把离散动作换成连续高斯分布输出后,已见任务成功率从 97% 降到 68%(跌了 29 个百分点),对未见任务更是从 76% 降到 43%。原因是 RT-1 的训练数据来自不同的操作员、不同时间段,同一个任务可能有多种合理的执行方式("先抓左边还是先抓右边")。连续高斯只能输出一个均值,面对多模态分布时会输出一个"折中"的无意义动作;离散分类则可以在每个维度独立地给多个 bin 分配高概率,天然支持多模态。这个发现后来直接影响了 RT-2 的设计——RT-2 沿用了 256 格离散动作 token 的方案。

非自回归输出:和 GPT 不同,RT-1 的 11 个动作 token 之间不互相依赖——它们是一次性并行输出的,不需要"先生成第 1 个再根据第 1 个生成第 2 个"。这是另一个工程选择:消融实验显示加入自回归依赖后推理时间翻倍(36ms → 约 70ms+),但性能并没有提升(甚至在已见任务上略降)。原因可能是 11 个维度的动作之间的协调关系已经被 Transformer 的 attention 隐式学到了,不需要显式的因果依赖。


2e. 主 Transformer 骨干

架构参数

  • 类型:decoder-only Transformer(和 GPT 一样的"只有解码器"风格)
  • 层数:8 层 self-attention
  • 参数量:19M
  • 输入:48 个视觉-语言 token(加位置编码)
  • 输出:11 个动作 token(每个是 256 分类)

总参数量拆分:EfficientNet-B3(约 12M)+ FiLM 层 + TokenLearner(总计图像编码侧 16M)+ Transformer(19M)= 约 35M。这个大小对 NLP 来说极小(GPT-3 是 175B,比它大 5000 倍),但对 2022 年的机器人控制来说已经是当时最大的端到端控制模型之一。小的原因不是不想大,而是大了就跑不动——论文后面会证明 35M 在 15ms 内能完成推理,而 Gato 的 1.2B 需要 1.9 秒。

训练用的损失函数:标准的 categorical cross-entropy(分类交叉熵),加上 causal masking(因果遮罩——只能看到当前时步之前的 token)。翻译成人话:模型对每个动作维度输出一个 256 维的概率分布,如果正确答案对应的 bin 概率高就扣分少,否则扣分多。和 GPT 预测下一个词的损失函数一模一样。


2f. Token 缓存——进一步的速度优化

类比:你看视频时,前后两帧之间大部分画面是相同的(相机没动、物体只微微移了一点)。如果每帧都从头算,大部分计算是浪费的。视频编码器早就学会了"只算变化的部分"。

RT-1 的做法类似:6 帧画面里,相邻两次推理之间有 5 帧是重复的(只有最新 1 帧是新的)。对这 5 帧重复的画面,直接复用上一次推理时已经算好的 token,只对新来的那 1 帧跑 EfficientNet + TokenLearner。这个 token 缓存策略把推理再快了 1.7 倍。

两项优化叠加:TokenLearner(2.4×)+ token 缓存(1.7×)= 整体 约 4 倍加速,让 35M 模型在真机器人上 100ms 内出结果成为可能。

4.4 非自回归动作输出

类比:写作文时,GPT 一个字一个字蹦(后一个字依赖前一个字)——这叫自回归(auto-regressive)。但如果让你填一份表格(姓名、年龄、地址各填各的),你可以同时写三栏,不需要按顺序来。

RT-1 的 11 维动作 token 之间是独立的——x 方向移多少不依赖 y 方向移多少。所以 Transformer 一次性并行输出 11 个 token,不需要串行生成。这避免了自回归带来的 11 倍串行延迟。

论文消融实验(Table 13)验证了这一点:加上自回归条件后推理时间从 15ms 涨到 36ms(2.4 倍慢),但性能没有显著提升。这说明动作维度之间的依赖关系很弱,并行输出是正确选择。

4.5 EfficientNet 而非更大的图像模型

类比:拍证件照不需要用相机阵列——手机就够了。同理,机器人在 300×300 分辨率下识别桌面物体,不需要 ViT-22B 那种巨无霸。

EfficientNet-B3 的优势在于:(1) 相同精度下参数比 ResNet-50 少约一半;(2) 支持 FiLM 层插入;(3) ImageNet 预训练提供了丰富的视觉先验。消融实验显示,去掉 ImageNet 预训练后泛化能力下降 33%——这些预训练权重相当于免费的"视觉常识"。

4.6 闭环控制:边看边改

RT-1 是闭环控制(closed-loop)系统:每次出动作前都重新拍一张照片,根据当前状态决定下一步。

闭环 vs 开环的区别,像导航时"每走 100 米重新看一次地图" vs "出发前规划好路线然后闭眼走"。闭环让 RT-1 能纠错——比如第一次没夹住可乐罐,它会看到"手是空的"然后再试一次。

3Hz 的控制频率意味着每秒重新决策 3 次。对于"拿可乐放抽屉"这种 2-4 秒的任务,6-12 次决策机会足以纠正中途的小偏差。

4.7 整体延迟预算

论文对延迟预算的分配如下:

  • 总控制周期:333ms(3Hz)
  • 模型推理:<100ms
  • 相机延迟 + 通信 + 电机响应:~233ms
  • 固定等待机制:280ms(等所有组件同步)

系统引入了一个固定时间等待机制:在捕获用于计算下一动作的状态后,等待 280ms(所有组件观测到的最大延迟)再执行动作,避免抖动(jitter)。这个看似"浪费时间"的设计确保了动作输出频率的稳定性——对物理控制来说,稳定比快更重要。


5. 训练:纯粹的模仿学习

5.1 损失函数

类比:考试时,老师给你一道选择题(256 选 1),你选对了得满分、选错了扣分。模型对每个动作维度的 256 个 bin 打一个概率分,选对了奖励、选偏了惩罚。

具体来说,训练使用标准的分类交叉熵损失(categorical cross-entropy)+ 因果掩码(causal masking):

  • 输入:6 帧画面 + 1 句指令
  • 目标:人类示教中的 11 维离散动作 token
  • 损失计算:每个动作维度独立做 256 类分类,所有维度的交叉熵相加

翻译成人话:给定画面和指令,模型逐维度猜"应该选第几格",和人类示教的答案对比,猜错越多扣分越重。

5.2 为什么选模仿学习而不是强化学习

模仿学习(behavioral cloning)不需要奖励信号——人做对了就是"正确答案"。和强化学习相比:

  • 强化学习需要机器人自己试错几百万次(在真机器人上不现实)
  • 模仿学习只需要一次性数据采集(人类示教几万次就够了)
  • 训练成本低 100 倍以上

但天花板也明确:模型不会比示教者做得更好。人类操作员手抖了,模型也学到手抖。这是 RT-2OpenVLA 想突破的方向——通过预训练 VLM 引入"超越示教"的常识能力。

5.3 训练基础设施

论文没有详细报告训练超参数,但从模型卡和附录可以推断:

  • 训练硬件:TPU(具体数量未报告,推测为几十张 TPU v4)
  • 训练时长:约 2 周
  • 模型选择:使用"real-to-sim"方法——把真实数据训练的模型放进模拟器评估 551 个任务的成功率,选出表现最好的 checkpoint
  • 模拟器使用 RetinaGAN 做"真实图像 → 模拟图像"的域适配

这个 real-to-sim 的模型选择方法本身也是贡献之一——在拥有 700+ 任务的情况下,你不可能每个 checkpoint 都在真机器人上评估所有任务。


6. 数据集设计:多样性是命根

6.1 数据采集流程

类比:如果你想培养一个"什么菜都会做"的厨师,不能只让他反复炒 10 万次番茄炒蛋。你得让他切过各种蔬菜、煮过各种面、烤过各种肉——品种多比数量多重要得多。

数据采集设置:

  • 13 台 Everyday Robots 移动操作机器人
  • 2 个 VR 遥控器控制(直视操作)
  • 17 个月持续采集
  • 130k 段示教视频
  • 每段配一句文字指令标注

采集环境是专门搭建的"机器人教室"(robot classroom)——模仿办公室厨房场景,有台面、抽屉、各种零食饮料等。

每个 episode 开始时,机器人自主走到工位,然后通知操作员需要示教什么指令以及如何摆放场景(通过软件模块随机采样)。这种自动化的采集流水线是支撑 13 万量级数据的关键工程。

6.2 指令/技能分布

744 条不同的语言指令,分成 8 大技能类别(后来扩展到 9 类加入了更复杂的长指令):

  • Pick Object(130 条):抬起桌面物体
  • Move Object Near Object(337 条):把 A 移到 B 附近
  • Place Object Upright(8 条):把长条物体立起来
  • Knock Object Over(8 条):推倒长条物体
  • Open Drawer(3 条):开抽屉
  • Close Drawer(3 条):关抽屉
  • Place Object into Receptacle(84 条):放进容器
  • Pick from Receptacle and Place on Counter(162 条):从容器拿出放台面
  • Additional realistic tasks(9 条):开罐子、抽纸巾等

注意数据分布极度不平衡——"Move Object Near Object"有 337 种变体,但"Open Drawer"只有 3 种。这不是失误,而是有意设计:337 种"移动"指令来自不同物体组合(A 移到 B 附近、C 移到 D 附近……),展示的是语言组合的多样性。

6.3 关键发现:多样性 > 数据量

论文 Section 6.5(Table 7)做了两组消融实验:

  • 减数据量但保多样性:把每个任务的数据上限设为 200/100/50 条(分别保留 51%/37%/22% 的数据),任务种类不变
  • 减多样性但保数据量:删掉数据最少的 25% 任务类别(保留 97% 的数据)

结果:删 25% 任务种类造成的泛化下降 ≈ 删 49% 数据量造成的下降。换句话说,多样性的杠杆效应是数据量的约 2 倍

这个结论后来被几乎所有具身 AI 后续工作验证和引用——包括 Open X-Embodiment、DROID 等大规模数据集项目。

所以这一节是想说:RT-1 的方法不复杂——token 化一切 + 小 Transformer + 行为克隆——但每一步都有精心的工程考量(早期融合、软选择压缩、非自回归并行、闭环纠错),配上"多样性优先"的数据策略,才让机器人第一次在 700+ 任务上达到了可用水平。


下图拆解 RT-1 的动作空间——11 维离散动作 token 如何"并行非自回归"一次吐出:

【动作空间: 11 维, 每维离散成 256 格 (bin)】

   手臂末端         夹爪    底盘            模式
   ┌──┬──┬──┐┌──┬──┬──┐ ┌──┐  ┌──┬──┬──┐  ┌──────┐
   │Δx│Δy│Δz││ r│ p│ y│ │开│  │ x│ y│yaw│  │臂/底 │
   └──┴──┴──┘└──┴──┴──┘ └合┘  └──┴──┴──┘  │/终止 │
    位移(3)   旋转(3)    (1)    底盘(3)     └──────┘(1)
      每一维 = 在 [-max,+max] 均匀切 256 格, 模型做"256 选 1"

【输出方式: 非自回归 (对比 GPT 自回归)】
   Transformer 顶层
        │
        ├──► token1 (Δx)  ┐
        ├──► token2 (Δy)  │ 11 个 token 同时并行输出
        ├──► token3 (Δz)  │ 彼此不依赖 (无因果链)
        │      ...        │ → 一次前向, 不串行
        └──► token11(模式)┘

   GPT 式:  t1 ─► t2 ─► t3 ─► ...   (串行, 慢 2.4×)
   RT-1:    t1 t2 t3 ... t11 一起蹦  (并行, 15ms)

   离散分类天然支持多峰 (左抓/右抓都给高概率)
   连续高斯只能输出均值 → 成功率 97%→68%

上图说明:11 个动作维度各自离散成 256 格做分类,且一次并行吐出(非自回归)——离散化让模型能表达"多种正确解"的多峰分布,并行输出把延迟压到 15ms。


RT-1 — 方法示意:核心 pipeline
Plate Nº VRT-1 — 方法示意:核心 pipeline

关键数字(What works)

实验维度 指标 RT-1 BC-Z Gato BC-Z XL 备注
训练任务(200+条指令) 成功率 97% 72% 65% 56% 真实环境,物体位置随机
未见任务(21 条新组合) 成功率 76% 19% 52% 43% 训练时没见过的指令组合
干扰物鲁棒性(9 个干扰物) 成功率 83% 47% 43% 23% 桌面加 9 个无关物体
背景鲁棒性(新厨房) 成功率 59% 41% 35% 35% 不同灯光、台面、背景
长程任务-Kitchen1(~50 步) 执行成功率 67% 53% 33% - SayCan 框架,规划成功率 87%
长程任务-Kitchen2(~50 步) 执行成功率 67% 13% 0% - 全新厨房,最大泛化挑战
仿真数据融合 仿真物体真实成功率 87% - - - 原先只有 23%,+64%
跨机器人数据融合 Bin-picking 成功率 39% - - - 原先 22%,+17%
数据消融:减 25% 任务种类 泛化下降 ≈减 49% 数据量 - - - 多样性杠杆是数据量 2 倍
推理速度 推理延迟 15ms 5.3ms 129ms 5.9ms BC-Z 更快但性能差很多

所以这一节是想说:数字告诉我们——数据多样性是泛化命根、Transformer+token 化是架构关键、工程优化让"跑得动"成为现实。


实验结果说明了什么

1. Transformer 在机器人控制中也是王者。 RT-1 在所有指标上都大幅领先同数据训练的 Gato 和 BC-Z,证明了"FiLM 早期融合 + TokenLearner + decoder-only Transformer"这套架构在机器人域的有效性。

2. 泛化来自数据多样性,不只来自数据量。 Table 7 的消融实验是本文最有价值的发现之一。它给出了一个实操指导原则:如果你有固定的数据采集预算,宁可多加任务种类也别多采某一种任务。

3. 仿真数据可以低成本增强泛化。 加入 518k 条仿真示教后,仿真物体在真实世界的成功率从 23% 飙升到 87%(+64%),而原始任务性能几乎没掉(-2%)。这意味着未来可以用便宜的仿真数据大规模扩展机器人的知识面,而不需要全靠真实数据。

4. 跨形态数据迁移是可能的。 把另一个完全不同的机器人(Kuka)的抓取数据混进来,不但没有损害原有任务(-2%),还提升了类似场景的泛化(+17%)。这为 Open X-Embodiment 这类跨机器人大数据集项目奠定了实证基础。

5. 可靠性已经接近"能用"的门槛。 在 Kitchen2 上做 50 步长程任务还能保持 67% 的成功率——考虑到每步 95% 的成功率对应的 50 步总成功率只有 7.7%,67% 说明 RT-1 单步成功率已经非常高。

所以这一节是想说:实验结果用数据证明了"规模 + 多样性 + 端到端 Transformer = 机器人泛化"这个假设成立。


你应该懂的几个新词

VLA(Vision-Language-Action Model,视觉-语言-动作模型):既能看图、又能听指令、又能输出动作的 AI。RT-1 是这个范式的开山之作,后续有 RT-2OpenVLA、π0 等。

Transformer:2017 年 Google 提出的 AI 架构,靠 self-attention 处理序列。GPT、Claude、RT-1 都用它。RT-1 用的是 decoder-only 变体,8 层 self-attention,19M 参数。

Token / Tokenization:把万物切成小方块。文字、图像、动作都能切。Transformer 只吃 token。RT-1 的创新在于把三种模态统一成了相同格式的 token 序列。

EfficientNet:Google 设计的高效图像识别网络,同等精度下参数比 ResNet 少约一半。RT-1 用 B3 版本(约 16M 参数),ImageNet 预训练。

FiLM(Feature-wise Linear Modulation,特征逐维线性调制):把一个信息源(指令)"染色"到另一个信息源(图像特征)上的技巧,公式是 输出 = (1+γ) × 输入 + β,其中 γ 和 β 由指令算出。RT-1 用 identity-initialization 保护预训练权重。

TokenLearner:一个能从一堆 token 里"软选择"出少数关键 token 的模块。RT-1 把 81 个图像 token 压到 8 个,推理快 2.4 倍。本质是一个可学习的注意力池化。

USE(Universal Sentence Encoder):Google 的文字编码器,把一句话变成一个固定长度向量。RT-1 用它编码指令,然后通过 FiLM 注入视觉编码器。

行为克隆(Behavior Cloning, BC):模仿学习的最朴素形式——抄人类示教的答案。优点是简单稳定,缺点是天花板被示教者锁定。

离散化动作(Discrete Action):把连续的关节角度压到有限格子里(如 256 格),让模型像做选择题那样输出动作。比连续输出更稳定,但牺牲了精细度。

闭环控制(Closed-loop Control):每步前都重新看一眼现状再决定下一步。RT-1 以 3Hz 频率闭环运行。

SayCan:Google 之前的工作,让大语言模型把高层指令("准备早餐")拆成低层指令序列。RT-1 配上 SayCan 后能做 50 步长程任务。

3Hz 控制频率:每秒重新决策 3 次,每次 333ms。在桌面操作场景下足够,对高频任务(接球)不够。

所以这一节是想说:上面这些词是你以后看任何 VLA 论文都会反复出现的基础词汇。


它有什么搞不定的

1. 天花板被人类示教者锁死。 行为克隆的本质是抄答案——模型不会比示教者做得更好。人类操作员手抖了,模型也学到手抖。要突破这个天花板,需要引入强化学习或预训练 VLM 的"超越示教"能力(RT-2 走的路线)。

2. 只会"组合"已知概念,不会"发明"新动作。 RT-1 的泛化是"已知技能 + 已知物体的新组合"(比如训练时分别见过"拿苹果"和"放进碗里",测试时能做"拿苹果放进碗里")。但如果新任务需要一种从未见过的运动模式(比如旋拧瓶盖、用筷子夹东西),RT-1 做不到。

3. 离散化限制了精细度。 256 格的动作分辨率大约对应每维 0.8% 的精度,对厘米级的桌面操作够用,但穿针、拼图、写字等亚毫米精度任务做不了。后续 π0 和 diffusion policy 用连续/扩散输出弥补了这一点。

4. 夹爪只有"开/关"两档,缺乏力度控制。 无法做到"轻轻放下玻璃杯"和"用力插入 USB 接口"的区分。

5. 训练成本高昂,普通实验室复现不了。 13 万示教 + 17 个月 + 13 台机器人——这是工业级资源投入。这也是为什么后来开源数据集(Open X-Embodiment、DROID)和开源模型(OpenVLA)如此重要。

6. 3Hz 控制频率对快速任务不够。 接球、躲避、乒乓球等需要 20Hz+ 的场景无法应对。

所以这一节是想说:RT-1 在通用度、灵巧度、训练成本、控制频率上都留下了大空间,为后续 RT-2、π0、OpenVLA 等工作指明了改进方向。


它和别的几篇是什么关系

直接继承者:RT-2(2023.7)——同一团队。把 RT-1 自己训练的 EfficientNet 眼睛换成互联网预训练的巨型 VLM(PaLI-X 55B),让机器人"带着网页常识做任务"。RT-1 提供了骨架(动作 token 化 + 数据集),RT-2 注入了灵魂(VLM 的世界知识)。泛化能力从 RT-1 的 32% 翻倍到 62%。

高层搭档:SayCan(2022.4)——同 Google。SayCan 用 LLM 做高层任务拆解("准备午餐"→"开冰箱→拿牛奶→关冰箱→倒杯子"),RT-1 当低层执行手。两者结合后能做 50 步长程任务,验证了"思考-执行"分层的可行性。但 SayCan 的上限受限于预设技能清单——RT-2 后来把这两层合并成了一个端到端模型。

同期对手:Gato(DeepMind, 2022.5)——通才模型路线。Gato 1.2B 参数什么都学(玩游戏、机器人、聊天混着来),但真实机器人任务只有 1 个(彩色积木堆叠),且推理 1.9 秒太慢。缩到 37M 后架构不如 RT-1 优化(无早期语言融合、无 TokenLearner),全指标被 RT-1 碾压。专精 > 通才 的早期判决。

同期对手:BC-Z(Jang et al., 2021)——行为克隆派代表。用 ResNet 骨干、连续动作、无历史信息。RT-1 在其基础上加了 Transformer + 历史帧 + 离散动作,所有指标拉开 25-57 个百分点。BC-Z 的价值在于它是后来一切 VLA 的"最低基线"。

后续开源化:OpenVLA(2024)——站在 RT-1 + RT-2 的肩膀上,用开源 VLM(Llama 2 + DINOv2)复刻 RT-2 的配方,让学术界也能跑 VLA 实验。消费级显卡可微调。

后续进化:π0(Physical Intelligence, 2024)——把扩散模型当动作头,输出连续平滑轨迹(解决 RT-1 离散化导致的精度限制)。代表了"VLA + diffusion"方向。

数据扩展:Open X-Embodiment(2023.10)——Google DeepMind 牵头的跨机器人数据集联盟,把 RT-1 的"数据多样性重于量"结论推到极致——22 种机器人、100 万+ 轨迹。RT-1 的跨机器人融合实验是这个项目的理论基石。

所以这一节是想说:RT-1 是 VLA 范式的"祖宗模板"——后面所有"大模型 + 机器人"的工作都直接或间接继承了它的动作 token 化 + Transformer 架构思路。


和本导读的关系

在导读 Ch11 中,RT-1 被定位为"从遥控指挥到亲自下场"的第一步跳跃:

  • Ch10(SayCan / Code-as-Policies)= CEO 坐办公室打电话
  • Ch11 前半(RT-1)= CEO 第一次走进车间亲自操作
  • Ch11 后半(RT-2)= CEO 带着所有管理经验下场

导读特别强调了 RT-1 的三个"定义性贡献":(1) 证明动作可以是 token;(2) 证明数据规模和多样性能让机器人泛化;(3) 提出了一套能在真机器人上 3Hz 跑起来的工程方案。这三点构成了后续所有 VLA 论文的"必选项"——不做 token 化你就进不了 Transformer 生态,没有大规模数据你就没有泛化,跑不动就不是真机器人工作。

CLIPLLaVA → RT-1 → RT-2 的演化线索是:不断给 Transformer 加新模态。CLIP 对齐了视觉和语言;LLaVA 让 LLM 能看图说话;RT-1 让 Transformer 能输出动作;RT-2 让已有 VLM 直接控制机器人。动作不过是另一种"语言"。

所以这一节是想说:RT-1 在导读中承上启下——上接模块化规划的瓶颈,下启端到端 VLA 的范式转换。


思考题

Q1:如果你只有 1000 条机器人示教数据(而不是 13 万条),RT-1 的架构还能工作吗?你会怎么改?

参考思路 1000 条太少,35M 参数的模型会严重过拟合。可以考虑的改动:(1) 冻结 EfficientNet 预训练权重只训练 Transformer 头部,减少可训练参数;(2) 加数据增强(图像翻转、颜色抖动、模拟不同光照);(3) 用更小的 Transformer(减到 2-4 层);(4) 引入仿真数据补充(论文已证明仿真数据 +64% 提升)。或者干脆换 RT-2 的思路——用预训练 VLM 的知识弥补数据不足。

Q2:RT-1 用 256 格离散化动作。如果改成 1024 格会怎样?改成 16 格呢?

参考思路 1024 格:精度更高(从 0.8% 到 0.1%),但 Transformer 的输出词表变大(256→1024 类),训练可能更慢、需要更多数据才能学好每个 bin 的概率。对桌面操作来说可能过度精细。 16 格:精度大幅下降(约 6% 每格),动作变得粗糙——机器人可能"抖得像手滑",无法精确定位物体。但训练更容易收敛(16 选 1 比 256 选 1 简单)。 实际选择是精度和训练难度的 trade-off。256 是经验上的"甜蜜点"——后续 RT-2 沿用了这个选择。

Q3:论文发现"多样性的杠杆效应是数据量的 2 倍"。如果你是数据采集团队的负责人,你会如何分配采集预算?

参考思路 优先策略:(1) 先广度后深度——尽量多覆盖不同的技能/物体/场景组合,每种只采少量(比如 50-100 条);(2) 在已有技能上,优先加新物体而不是重复采已有物体;(3) 定期检查泛化指标——如果某类任务泛化已经饱和,把资源转向新类别;(4) 利用仿真数据廉价地扩展物体多样性(论文证明了 sim→real 迁移有效)。核心原则:每多花一分钱,都应该增加数据集的"见识面"而不是"练习量"。

Q4:RT-1 去掉 Transformer 只保留 EfficientNet(消融实验中的"w/o Transformer")后,性能只下降了 13%。那 Transformer 的真正价值在哪里?

参考思路 Transformer 的价值不在于"看"(那是 EfficientNet 的活),而在于"记"和"跨帧推理"。6 帧历史的 token 通过 self-attention 互相关联,让模型知道"刚才手已经伸出去了,现在该收回来"。在简单的单步任务(如"拿起可乐")上,一张图就够了所以 Transformer 优势不明显。但在需要多步协调的任务(如"从抽屉拿出再放台面"需要先开抽屉→伸手→抓住→抬起→放下)上,Transformer 的历史建模是关键。消融实验中干扰物鲁棒性下降了 16%,说明 Transformer 帮助模型"记住自己的目标不被干扰带偏"。

Q5:RT-1 在 Kitchen1 和 Kitchen2 上的长程任务成功率都是 67%,没有下降。这违反直觉——换了完全不同的厨房怎么还一样好?你的解释是什么?

参考思路 可能的解释:(1) 长程任务的失败主要来自规划错误或中间步骤的累积误差,而不是单步的环境适应——两个厨房对单步的挑战差不多(都有台面、抽屉、物体);(2) SayCan 框架把长任务拆成了很多小步,每小步本身的泛化难度有限("拿可乐"在哪个台面上做差别不大);(3) RT-1 的 FiLM + ImageNet 预训练让视觉编码器对背景变化很鲁棒(注意力主要集中在手和目标物体上,不太关心台面颜色)。但也可能是评估样本量有限导致的统计噪声。

Q6:如果要把 RT-1 用在一个全新类型的机器人(比如双臂人形机器人)上,哪些部分可以复用,哪些必须重新设计?

参考思路 可以复用的:(1) FiLM-EfficientNet 视觉编码器(ImageNet 预训练的视觉特征对所有机器人都通用);(2) Transformer 架构本身;(3) 离散化动作 token 的思路。必须重新设计的:(1) 动作空间——从 11 维(7 臂 + 3 底盘 + 1 模式)变成可能 30+ 维(双臂各 7 自由度 + 双手各 5 指……),token 数量和维度要重新定义;(2) 数据集——需要该机器人的专用示教;(3) 可能需要更大的 Transformer(更多 token 需要更多注意力容量)。跨机器人实验(Kuka 数据融合)暗示了"共享视觉理解 + 适配动作空间"的可行路线。

Q7:RT-1 只用了 6 帧历史。如果给它 60 帧(20 秒的历史),会更好吗?

参考思路 不一定。更长的历史意味着:(1) token 数量从 48 增到 480,推理延迟可能超过 100ms 预算(Transformer 的注意力是 O(n²) 复杂度);(2) 模型需要学会"哪些历史是相关的"——如果大部分历史对当前决策无用,可能引入噪声。在机器人桌面操作中,2 秒(6 帧 × 3Hz)的历史已经覆盖了大部分"需要记忆"的场景。更好的方向可能是"稀疏长历史"——比如保留 2 秒近期帧 + 每 5 秒一个关键帧,用更少的 token 覆盖更长时间跨度。后续工作如 RT-H 和 MUTEX 探索了这个方向。

一些好奇心问答(FAQ)

Q1:35M 参数在 AI 圈算大模型吗?

按 NLP 标准极小(GPT-3 是 175B,是 RT-1 的 5000 倍)。但在 2022 年的机器人控制圈,这是最大的端到端实时控制模型之一。机器人圈的瓶颈不是模型大小而是推理延迟和数据量——这也是 RT-1 选择"小而快"而非"大而慢"的原因。

Q2:13 万示教数据怎么采的?能下载吗?

人类操作员用 2 个 VR 遥控器直视操控机器人完成任务。Google 内部数据最初没开源,但 2023 年的 Open X-Embodiment 项目公开了其中一部分,HuggingFace 上可下载(搜索 "fractal" 数据集即 RT-1 数据的代号)。

Q3:为什么动作用 256 格离散而不是连续输出?

消融实验(Table 13)直接回答了:换成连续高斯输出后,训练任务成功率从 97% 暴跌到 68%(-29%),干扰物鲁棒性从 83% 跌到 37%(-46%)。原因是连续高斯只能表示单峰分布,但真实的"正确动作"可能是多峰的(比如杯子可以从左边抓也可以从右边抓)。256 格离散化可以表示任意复杂的多峰分布。

Q4:3Hz 够快吗?人手不是更快?

人做"拿可乐放抽屉"大约 2-4 秒。3Hz 意味着这 2-4 秒里模型决策 6-12 次,足够纠错。对慢任务够用,对快速任务(接球、躲避)不够。后续工作通过更高效的架构或更轻量的模型把频率提到 10-30Hz。

Q5:普通学校实验室能复现 RT-1 吗?

原版规模(13 台机器人 + TPU 集群)不行。但现在可以用:(1) OpenVLA(基于 RT 思路 + 开源 VLM)在几张 A100 上微调;(2) Open X-Embodiment 公开数据训练;(3) 用更便宜的机器人(如 WidowX)+ 小规模数据做概念验证。核心思想(token 化 + Transformer + 行为克隆)在小规模上一样成立。

Q6:FiLM 为什么要 identity-initialized?

EfficientNet 是 ImageNet 预训练好的,权重很值钱。直接插入 FiLM 层(γ 和 β 随机初始化)会破坏预训练特征。Identity-init 意味着初始时 γ=0, β=0,则 (1+0)×输入 + 0 = 输入——FiLM 层一开始"透明"的,不干扰预训练权重。随着训练推进,γ 和 β 慢慢从 0 长出来,FiLM 层逐渐发挥"根据指令调制视觉"的作用。这是保护已有知识的巧妙初始化技巧。

Q7:Gato 比 RT-1 大几十倍(原版 1.2B vs 35M),为什么反而更差?

两个原因:(1) 为了在真机器人上跑,Gato 必须缩到 37M——缩小后架构没有针对机器人优化(没有 FiLM 早期融合、没有 TokenLearner、没有预训练 USE 语言编码);(2) Gato 的训练数据里机器人任务只占一小部分(大部分是游戏和文字),相当于"样样通样样松"。RT-1 虽小但全部容量都分配给了机器人控制。

所以这一节是想说:RT-1 的设计选择(小而快、离散化、FiLM 早期融合)都有消融实验的硬证据支撑,不是拍脑袋做的。


如果你想再深入

前传——理解 RT-1 的来路:

  • BC-Z(Jang et al., CoRL 2021):行为克隆派的代表作,RT-1 的直接基线。读它能清楚看到"加 Transformer + 离散动作"带来的巨大提升。
  • Gato(Reed et al., 2022):DeepMind 的通才模型,"一个模型做所有事"的极端路线。读它能理解"通才 vs 专精"辩论的源头。
  • SayCan(Ahn et al., 2022):RT-1 的高层搭档,"LLM 规划 + 低层执行"的经典范式。读它能理解为什么后来要走端到端。

续作——看 RT-1 的影响力:

  • RT-2(Brohan et al., 2023.7):直接下一步。把 EfficientNet 换成预训练 VLM,让机器人具备"常识"。如果只看一篇后续,看这篇。
  • OpenVLA(Kim et al., 2024):RT-2 的开源复刻版,7B 参数,消费级显卡可跑。学术界复现 VLA 思路的首选。

衍生方向——看端到端机器人的分化:

  • PerAct(Shridhar et al., 2022):用 Perceiver + 体素表征的多任务机器人。和 RT-1 的 2D 图像路线形成"3D vs 2D"对比。
  • Diffusion Policy(Chi et al., 2023):用扩散模型生成连续动作轨迹,解决 RT-1 离散化的精度问题。代表了"VLA + diffusion"的方向。
  • π0(Physical Intelligence, 2024):把 VLM 和扩散动作头结合,是 RT-1 + Diffusion Policy 的融合体。

所以这一节是想说:BC-Z → RT-1 → RT-2 → OpenVLA 是 VLA 的主线;Diffusion Policy → π0 是补充精度的支线。两条线后来在 π0 合流。


原文信息

标题:RT-1: Robotics Transformer for Real-World Control at Scale

作者:Anthony Brohan, Noah Brown, Justice Carbajal, Yevgen Chebotar, Joseph Dabis, Chelsea Finn, Keerthana Gopalakrishnan, Karol Hausman, Alex Herzog, Jasmine Hsu, Julian Ibarz, Brian Ichter, Alex Irpan, Tomas Jackson, Sally Jesmonth, Nikhil J Joshi, Ryan Julian, Dmitry Kalashnikov, Yuheng Kuang, Isabel Leal, Kuang-Huei Lee, Sergey Levine, Yao Lu, Utsav Malla, Deeksha Manjunath, Igor Mordatch, Ofir Nachum, Carolina Parada, Jodilyn Peralta, Emily Perez, Karl Pertsch, Jornell Quiambao, Kanishka Rao, Michael Ryoo, Grecia Salazar, Pannag Sanketi, Kevin Sayed, Jaspiar Singh, Sumedh Sontakke, Austin Stone, Clayton Tan, Huong Tran, Vincent Vanhoucke, Steve Vega, Quan Vuong, Fei Xia, Ted Xiao, Peng Xu, Sichun Xu, Tianhe Yu, Brianna Zitkovich

机构:Robotics at Google / Everyday Robots / Google Research, Brain Team

会议:RSS 2023(Robotics: Science and Systems)

年份:2022(arXiv 首发 2022.12,正式发表 2023)

arXiv2212.06817

代码github.com/google-research/robotics_transformer

BibTeX

@inproceedings{brohan2023rt1,
  title={RT-1: Robotics Transformer for Real-World Control at Scale},
  author={Brohan, Anthony and Brown, Noah and Carbajal, Justice and Chebotar, Yevgen and Dabis, Joseph and Finn, Chelsea and Gopalakrishnan, Keerthana and Hausman, Karol and Herzog, Alex and Hsu, Jasmine and Ibarz, Julian and Ichter, Brian and Irpan, Alex and Jackson, Tomas and Jesmonth, Sally and Joshi, Nikhil J and Julian, Ryan and Kalashnikov, Dmitry and Kuang, Yuheng and Leal, Isabel and Lee, Kuang-Huei and Levine, Sergey and Lu, Yao and Malla, Utsav and Manjunath, Deeksha and Mordatch, Igor and Nachum, Ofir and Parada, Carolina and Peralta, Jodilyn and Perez, Emily and Pertsch, Karl and Quiambao, Jornell and Rao, Kanishka and Ryoo, Michael and Salazar, Grecia and Sanketi, Pannag and Sayed, Kevin and Singh, Jaspiar and Sontakke, Sumedh and Stone, Austin and Tan, Clayton and Tran, Huong and Vanhoucke, Vincent and Vega, Steve and Vuong, Quan and Xia, Fei and Xiao, Ted and Xu, Peng and Xu, Sichun and Yu, Tianhe and Zitkovich, Brianna},
  booktitle={Robotics: Science and Systems (RSS)},
  year={2023}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_rt_1_2026,
  title       = {(readable note) RT-1: Robotics Transformer for Real-World Control at Scale},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rt-1/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?