Ch21: 数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO
Ch21: 数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO
返回目录 上一章:Ch20: 听觉智能 | 下一章:Ch22: 实战指南
21.1 引子:机器人数据为什么这么难搞
21.1.1 感知完毕,数据在哪?
Ch20 结尾时,我们已经有了一台"五感俱全"的机器人——它有眼睛(Ch8-9 的视觉)、有耳朵(Ch20 的听觉)、甚至能感知墙后的事物(Ch19 的射频感知)。感知问题在技术上已经取得了巨大进步。
但感知只是输入端。要让机器人真的干活,你还需要另一件东西:训练数据。
在 Ch11 和 Ch12 中我们学到,RT-1 用了 13 万条真机演示数据训练,RT-2 在此基础上加上了大规模互联网图文数据。Ch13 的 Diffusion Policy 用了几百条演示就能学会一个新任务。Ch14 则系统解释了模仿学习为什么需要"好数据"而非"多数据"。
但一个关键问题被我们有意回避了:这些数据从哪来?
答案很不愉快——每一条机器人操作数据,都需要一台真机器人在真实环境里,由人(或人控制的遥操作系统)完成一次完整的任务演示。这不是爬网页就能搞定的事。
21.1.2 机器人数据 vs 网络文本:三重鸿沟
LLM 的训练数据从哪来?互联网。几万亿 token 的文本,爬虫自动抓取,成本几乎为零。GPT-4 的训练数据量大约 13 万亿 token——这个数字的背后是整个互联网几十年的内容积累。
机器人操作数据的获取,和互联网文本完全不同。有三重鸿沟:
鸿沟一:采集成本
一条网络文本的采集成本接近零——写个爬虫跑一圈就有了。一条机器人操作数据的采集成本是什么?一个人坐在机器人前面,戴上 VR 手套或握着遥操作杆,花 1-5 分钟完成一次操作演示。每条数据的"标价"是 1-5 分钟的人类劳动。
换算一下:RT-1 的 13 万条数据,假设平均每条 2 分钟,那就是 260,000 分钟 = 4,333 小时 = 180 天不间断操作。这还是理想情况——实际采集中有设备故障、标定偏移、数据损坏等各种问题,有效利用率可能只有 60-70%。
鸿沟二:物理绑定
网络文本是"无身体"的——一篇关于做菜的博客文章,任何人任何设备都能读到,和"谁写的""在哪写的"没有关系。但机器人数据是"有身体"的——一条 WidowX 机械臂的抓取数据,不能直接给 Franka 机械臂用,因为关节结构、工作空间、力矩范围完全不同。
这意味着你很难"借"别人的数据来训练自己的机器人。每换一种硬件,就可能需要重新采集数据。
鸿沟三:规模差距
互联网文本:~13 万亿 token(GPT-4 级别)。机器人操作数据:截至 2023 年底,全球最大的公开数据集 Open X-Embodiment 也只有 160 万条轨迹。差了四个数量级以上。
用一个类比总结这三重鸿沟:
LLM 有互联网——几万亿 token 免费爬取,相当于拥有一个全球图书馆的免费通行证。机器人只有"自家厨房"——每一条数据都要真机器人在真环境里真做一遍,相当于你得亲自下厨录菜谱,而且换了个厨房(换机器人硬件)之前的菜谱格式还对不上。
21.1.3 数据瓶颈如何制约了整个领域
数据瓶颈不是一个孤立的问题——它像一根绳子,拴住了整个具身 AI 领域的发展。
在 2023 年之前,几乎每个 VLA 模型都只能在自家数据上训练。RT-1/RT-2 只有 Google 的 Everyday Robots 数据;BC-Z 只有 Google 的另一批数据;各大学实验室各有各的小数据集。这导致了一个恶性循环:
- 数据少 → 模型泛化差
- 泛化差 → 只能在窄场景用
- 窄场景用 → 没动力投入更多数据采集
- 没投入 → 数据继续少
打破这个循环需要两件事同时发生:一是有人提供足够大的共享数据集,降低"入场费";二是有人证明"用大数据集训练的模型确实更好",提供动力。
2023 年,这两件事同时发生了。BridgeData V2、Open X-Embodiment 先后发布,RT-2-X 证明了跨机器人数据混训的正迁移效应。从那以后,具身 AI 的数据生态发生了质变——从"各实验室各搞各的"变成了"社区共建共享"。
这一转变,正是本章要讲的核心故事。
21.1.4 本章路线图
本章按"真机 → 仿真"的顺序组织,每一节聚焦一个关键数据集/基准:
21.2 先从历史视角划分三个时代,让你看到数据集生态的演进脉络。
21.3 深入四个真机操作数据集——BridgeData V2(低成本预训练底座)、Open X-Embodiment(跨形态聚合的 ImageNet)、DROID(统一硬件的极端场景多样性)、RH20T(接触富集任务的多模态数据)。这四个数据集代表了真机数据采集的四种路线。
21.4 转向仿真操作基准——Meta-World、RLBench、RoboMimic、CALVIN、LIBERO、RoboCasa、BEHAVIOR-1K、ManiSkill。它们不是用来"训练"机器人的,而是用来"考试"的——公平比较不同算法的性能。
Part 2 将继续讨论数据增强与合成技术、数据质量评估框架、以及数据集建设的未来方向。
21.2 数据集的三个时代
21.2.1 划分依据
理解机器人数据集的演进,最清晰的视角不是按时间线罗列,而是按数据生产的组织方式划分。组织方式变了,意味着谁在造数据、造什么样的数据、数据怎么流通——这些都发生了根本变化。
我们划分三个时代:
| 时代 | 时间 | 组织方式 | 规模 | 代表 |
|---|---|---|---|---|
| 单实验室小规模 | 2018-2020 | 各自为战 | < 10K 轨迹 | RoboTurk, robosuite, RoboMimic |
| 社区聚合 + 标准化 | 2021-2023 | 统一格式,汇总百家 | 60K-1.6M | BridgeData V2, Open X-Embodiment, RH20T |
| 分布式采集 + 跨形态训练 | 2024+ | 统一硬件,协同生产 | 76K-1M+ | DROID, Octo, π0 |
注意每个时代的代表性规模不是单调递增的——DROID 的 76K 比 OXE 的 1.6M 少,但它的数据质量和场景多样性远超 OXE。规模不是唯一维度,数据的"质量密度"同样重要。
21.2.2 第一时代(2018-2020):单实验室小规模
背景:2018 年前后,模仿学习(IL)和 RL 在机器人操作上的研究刚刚起步。每个实验室有一台或几台机器人,在自己的实验台上采集数据、训练策略、发论文。
RoboTurk(Stanford,2018)
RoboTurk 是最早的"大规模"机器人遥操作数据采集项目之一。它的核心思路是众包:通过手机 APP 让远程操作者控制机器人完成任务。听起来很前沿,但实际采集的规模很小——9 个任务,每个任务大约 2,000 条轨迹,总计不到 20K 条。
RoboTurk 的真正贡献不是数据量,而是证明了一件事:遥操作数据的质量可以足够好,以至于简单的行为克隆就能学会复杂操作。在那之前,很多人认为 IL 需要专家级的演示才能工作,RoboTurk 用"业余玩家"的数据也跑出了不错的结果。
robosuite / RoboMimic(MIT / NVIDIA,2019-2021)
robosuite 是一个标准化的仿真操作框架,RoboMimic 是建立在其上的"控制变量实验台"。它们不是大规模真机数据集,而是提供了系统评估 IL 方法的小规模仿真基准。RoboMimic 的核心价值在于:用完全相同的任务、完全相同的环境,只变化数据质量(专家 vs 中等 vs 多人混合),然后看算法表现怎么变。这种"控制变量"的实验设计对理解数据质量的影响至关重要,我们会在 21.4 节深入讨论。
第一时代的特点
- 各自为战:每个实验室用自己的机器人、自己的环境、自己的数据格式。A 实验室的数据 B 实验室几乎无法直接使用
- 格式不统一:有的存 RGB 图像,有的只存关节角;有的有语言标注,有的没有;有的用 HDF5,有的用 TFRecord,有的用 pickle
- 规模极小:大多数数据集 < 10K 轨迹,只能训练单任务模型,泛化能力极差
类比:各家厨房自己录菜谱——张家的菜谱用"大火"而不写温度,李家的菜谱只写"加盐"而不写几克,王家的菜谱格式是手写纸条不是电子文档。你想照着做可以,但想把这些菜谱汇总成一本通用烹饪教材就很难了。
21.2.3 第二时代(2021-2023):社区聚合 + 标准化
背景:2021 年开始,社区意识到"各自为战"的问题。两个方向的努力同时展开:
一是横向聚合——把不同实验室的数据"格式统一后收在一起",代表是 Open X-Embodiment(2023)。22 家实验室把各自的数据集用统一的 RLDS 格式重新组织,拼成了一个 1.6M 轨迹的"大集合"。
二是纵向深耕——用一个标准化的硬件和采集流程,大规模采集高质量数据,代表是 BridgeData V2(2023)。单个实验室、单个机械臂,但场景和任务的覆盖面极广。
BridgeData V2 的意义
BridgeData V2 证明了"一个实验室也能造出对社区有用的数据集"。关键在于它的三个设计决策:横向广 > 纵向深(24 个不同场景而非 1 个场景的 24 倍数据);真机 > 仿真(所有数据都是真实环境采集);全语言标注(每条轨迹都有自然语言描述)。
这三个决策让它成为了 2023-2024 年开源 VLA 的"标准预训练底座"——RT-2、OpenVLA、Octo、Diffusion Policy 都用它做预训练或评测。就像 ImageNet 之于计算机视觉:它不是最大的,但它是最"好用"的。
Open X-Embodiment 的意义
OXE 证明了"跨形态数据混训确实有正迁移"。RT-2-X 的实验表明:用 22 种机器人的数据混合训练,比只用单种机器人的数据训练,在下游任务上的表现更好。这个发现非常重要——它意味着机器人数据不需要"同一台机器"才能复用,只要格式统一,异构数据也有价值。
RH20T 的补充
RH20T(2023)走了另一条路:不在场景广度上做文章,而在模态深度上深耕——除了常见的 RGB 图像和关节状态,还同步记录力/力矩传感器和音频数据。这为需要"触感"的任务(如拧瓶盖、插销钉)提供了宝贵的数据。
第二时代的特点
- 格式标准化:RLDS(Reinforcement Learning Datasets)格式成为事实标准,定义了统一的 schema(观测、动作、奖励、语言标注等字段)
- 社区共享:数据集公开发布在 HuggingFace / TensorFlow Datasets 上,任何人可以下载使用
- 规模跃升:从 10K 级别跳到 100K-1M 级别
- 跨形态验证:首次证明多机器人数据混训有正迁移
类比:有人开始"收百家菜谱,统一目录格式"——每家还是做自己的菜,但菜名、食材列表、做法步骤的记录方式统一了。这样你就能在一本大册子里同时翻到张家的红烧肉和李家的红烧肉,比较异同。
21.2.4 第三时代(2024+):分布式采集 + 跨形态训练
背景:第二时代的 OXE 虽然聚合了大量数据,但有一个根本问题——数据是"事后汇总"的。22 家实验室用各自的硬件、各自的环境、各自的标准采集数据,然后事后再统一格式。这导致数据质量参差不齐,很多数据集缺乏语言标注,动作空间差异巨大。
第三时代的核心思路是:既然格式统一不够,那就硬件也统一。全球多家实验室用同一种机器人、同一种传感器、同一种遥操作方案采集数据,从源头上保证数据的一致性。
DROID(2024)
DROID(Distributed Robot Interaction Dataset)是这个思路的代表。18 家机构分布在 13 个国家,全部使用 Franka Panda 机械臂 + ZED 双目相机 + Oculus 遥操作控制器。硬件统一了,但场景完全自由——每家在自己真实的实验室、办公室、家庭环境中采集。
结果是一个"场景极其多样但数据质量高度一致"的数据集:76K 轨迹、564 个场景、86 种任务。虽然轨迹数比 OXE 少,但 DROID 预训练的模型在下游任务上的表现比 OXE 预训练的更好——证明了数据质量 > 数据数量。
Octo / π0 的预训练范式
Octo(2024)和 π0(Physical Intelligence,2024)代表了第三时代的另一个趋势:通用机器人基础模型。它们不是为某个特定任务训练的,而是在大规模多样化数据上预训练一个"通才模型",然后在特定任务上微调。
Octo 在 OXE 数据上预训练,用扩散头部(diffusion head)输出动作。π0 在更大规模的私有数据上预训练,用流匹配(flow matching)输出动作。两者都证明了"预训练 + 微调"的范式在机器人领域也能工作——就像 NLP 领域的 BERT/GPT 一样。
第三时代的特点
- 统一硬件:从"统一格式"到"统一硬件",从源头保证数据一致性
- 协同生产:多家机构按统一协议同时采集,不是事后汇总
- 数据质量优先:宁可数据量少一些,也要保证每条数据的质量和一致性
- 基础模型范式:预训练通才模型 + 任务微调成为主流
类比:从"谁有数据"到"一起造数据"——以前是你家有菜谱给我一份,格式不同我帮你转;现在是我们一起定好标准、统一设备、同步开工,从第一天产出的数据就能直接拼在一起用。
21.2.5 三个时代的核心矛盾演变
每个时代都在解决一个核心矛盾:
| 时代 | 核心矛盾 | 解决方案 | 遗留问题 |
|---|---|---|---|
| 第一时代 | 数据太少 | 各自采集 | 格式不统一,无法复用 |
| 第二时代 | 格式不统一 | 标准化聚合 | 数据质量参差不齐 |
| 第三时代 | 质量不齐 | 统一硬件协同生产 | 规模受限于硬件成本 |
第三时代的遗留问题很现实:Franka Panda 一台 ~30 万人民币,不是每个实验室都买得起。统一硬件的代价是参与门槛高,能贡献数据的机构数量有限。如何降低参与门槛同时保持数据质量,是当前社区正在探索的方向(如低成本的 WidowX 方案、手机遥操作方案等)。
21.3 真机操作数据集
21.3.1 BridgeData V2——低成本单本体的 VLA 预训练底座
超简版:BridgeData V2 是一份公开的"机器人干活录像库"——6 万段机械臂在 24 个真实场景里的演示视频,大家训机器人时把它当共同起跑线。
基本参数
| 维度 | 数值 |
|---|---|
| 轨迹数 | ~60K |
| 场景数 | 24 |
| 机器人 | WidowX 250(6-DoF) |
| 观测 | 第三人称 RGB 图像 + 本体感受 |
| 动作 | 7-DoF(6D 末端位姿增量 + 夹爪) |
| 语言标注 | 每条轨迹均有(这是关键) |
| 采集时间 | 2021-2023 |
三个关键设计决策
BridgeData V2 不是"随便录了一堆数据"——它的每一个设计决策都经过深思熟虑,而且这些决策的优先级排序直接塑造了它在社区中的地位。
决策一:横向广 > 纵向深
24 个不同风格的场景,每个场景只有几千条轨迹,而不是 1 个场景录 6 万条。为什么?
想象两个旅行博主:博主 A 在同一家咖啡馆拍了 6 万张照片,博主 B 在 24 家不同风格的咖啡馆各拍了 2500 张。谁的视频更能让你"了解咖啡馆"?显然是 B——A 的照片虽然多,但信息高度冗余,你从第 1000 张开始就看不到新东西了。
机器人数据也是一样。在同一个桌面上反复抓同一个物体,后面的轨迹带来的新信息越来越少。而换一个场景——不同桌面、不同物体、不同光照——每一条新轨迹都有信息增量。VLA 模型需要的是多样性而非重复量。
这个决策的实验验证也很直接:用 24 个场景的数据预训练,在全新场景上的微调性能,显著优于用 1 个场景的等量数据预训练。
决策二:真机 > 仿真
所有数据都在真实环境中采集,不使用仿真器。为什么不用仿真?仿真可以无限生成数据,成本几乎为零。
核心原因在 Ch17 中已经详细讨论过:sim-to-real gap。仿真数据再逼真,和真实数据之间仍有可感知的分布差异。用仿真数据预训练的 VLA,在真机微调时需要更多的真机数据来"弥合差距";而用真机数据预训练的 VLA,微调时只需少量真机数据就能快速适配。
BridgeData V2 的目标是"预训练底座"——它应该让下游用户尽可能少地采集自己的数据。真机数据虽然采集成本高,但作为预训练底座的效果远优于仿真数据。
决策三:全语言标注
每条轨迹都有自然语言描述,如"把红色杯子放到蓝色盘子上"。这一点看似简单,实际上极其重要——它是 BridgeData V2 能成为 VLA 预训练底座的前提条件。
VLA 模型(RT-2、OpenVLA 等)的训练需要"图像 + 语言 + 动作"三元组。如果数据没有语言标注,你只能用它训练纯视觉-动作模型(如 Diffusion Policy),而不能训练 VLA。OXE 中的很多子数据集就缺乏语言标注——这大大限制了它们在 VLA 训练中的可用性。
BridgeData V2 选择了全语言标注,代价是标注工作量大(每条轨迹需要人工写描述),但收益是:它可以同时用于纯视觉-动作模型和 VLA 的训练,覆盖了更广的下游需求。
为什么它成了"标准配方"
2023-2024 年间,几乎所有开源 VLA 都用 BridgeData V2 做预训练或评测:
- RT-2:用 BridgeData V2 评估泛化能力
- OpenVLA:在 OXE + BridgeData V2 上预训练
- Octo:在 OXE 上预训练,但 BridgeData V2 是 OXE 中质量最高的子集之一
- Diffusion Policy:用 BridgeData V2 做部分任务的训练和评测
它成为标准不是因为"最大"——OXE 比它大 27 倍。而是因为"最实用":格式规范、语言标注完整、场景多样、采集质量稳定。就像 ImageNet 不是最大的图像数据集(LAION-5B 比它大几千倍),但它是最"好用"的基准。
局限
BridgeData V2 有三个明显的局限:
- 单本体:只有 WidowX 250 一种机械臂。换用其他机器人时,动作空间不兼容,需要额外的适配工作
- 桌面场景:24 个场景都是桌面高度的操作,没有地面、架子、家庭环境等更复杂的场景
- 规模有限:60K 轨迹对于训练通用 VLA 仍然偏小。RT-1 用了 13 万条还只学会了单一厨房的任务
这些局限直接催生了后续的数据集——OXE 解决了"单本体"问题,DROID 解决了"桌面场景"问题,两者合在一起在规模上也远超 BridgeData V2。
21.3.2 Open X-Embodiment——跨形态异构聚合的 ImageNet
超简版:22 家实验室把各种机器人的"练手视频"凑成一个大数据集,再训一个通吃模型,发现喂多种机器人比单喂一种学得更好。
基本参数
| 维度 | 数值 |
|---|---|
| 轨迹数 | ~1.6M |
| 机器人形态 | 22 种 |
| 技能数 | 500+ |
| 任务数 | 150,000+ |
| 数据格式 | RLDS |
| 参与机构 | 21 家(Google DeepMind 主导) |
核心设计:统一格式而非统一硬件
OXE 最核心的设计决策是:只统一数据的"格式",不统一数据的"来源"。
具体来说,OXE 定义了一套 RLDS(Reinforcement Learning Datasets)schema,规定了每条轨迹必须包含哪些字段、字段的数据类型、存储格式。22 家实验室各自用自己的机器人、自己的环境、自己的方式采集数据,但最终都把数据转换为 RLDS 格式上传。
类比:让 22 家餐厅用同一套菜谱模板——不是让它们改造厨房(统一硬件),只是统一"菜名怎么写、食材怎么列、做法怎么记"(统一格式)。这样你拿到任何一家餐厅的菜谱,都能用同样的方式阅读和比较。
这个设计的优势是参与门槛低——任何实验室都可以把已有数据转成 RLDS 格式加入,不需要换硬件或重新采集。这使 OXE 在短时间内聚合了大量数据。
但劣势也很明显:数据质量参差不齐。有的子数据集有高质量的语言标注和精确的动作记录,有的只有粗糙的图像和关节数据。有的场景光照稳定、背景干净,有的场景杂乱、光照变化大。这些异质性给下游训练带来了挑战。
RLDS Schema 技术细节
RLDS 格式的核心思想是"保留一切,不丢失信息"。每条轨迹包含以下标准字段:
steps/observation:观测数据,包含 RGB 图像、深度图(如有)、本体感受(关节角、末端位姿)steps/action:动作数据,维度和含义因机器人而异,但存储格式统一steps/language_instruction:语言标注(部分轨迹缺失)steps/language_embedding:语言嵌入向量(预计算的,节省训练时的编码开销)steps/discount:折扣因子(RL 数据需要,IL 数据通常设为 1.0)steps/reward:奖励信号(RL 数据需要,IL 数据通常设为 0)steps/is_terminal:是否终止steps/is_first:是否起始
关键设计:action 字段的语义没有统一——WidowX 的 7-DoF 动作和 Franka 的 7-DoF 动作含义不同(前者是末端位姿增量,后者可能是关节角增量)。OXE 保留了这种差异,不做归一化——这既是灵活性,也是麻烦的来源。
踩坑提醒:使用 OXE 数据训练 VLA 时,必须注意动作空间的归一化。最常用的做法是将所有动作归一化到 [-1, 1] 范围,但这需要知道每种机器人的动作空间边界。Octo 论文详细描述了这个过程,推荐参考其数据处理代码。
RT-1-X / RT-2-X 的正迁移实验
OXE 最核心的实验结论是:多机器人混训比单机器人训练效果更好。
RT-1-X(在 OXE 全部数据上训练的 RT-1)和 RT-2-X(在 OXE 全部数据上训练的 RT-2)在多种机器人的下游任务上做了评估。关键发现:
- 在 WidowX 上的任务:RT-1-X 比 RT-1(只在 Google 内部数据上训练)高 50%
- 在 Franka 上的任务:RT-1-X 甚至超过了只在 Franka 数据上训练的基线
- RT-2-X 展现了"涌现能力"——能理解并执行训练中从未见过的指令
为什么多机器人数据会有正迁移?直觉上可以这样理解:不同机器人虽然硬件不同,但它们操作的物理世界是相同的。"抓住一个杯子"的视觉特征无论用 WidowX 还是 Franka 去看,杯子的形状、颜色、位置是不变的。多机器人数据让模型看到了更多样化的"世界状态",而不仅仅是更多样化的"机器人自身状态"。
与 ImageNet 的类比和差异
OXE 常被称为"机器人领域的 ImageNet"。这个类比有其道理,但也有重要的差异:
相似之处:
- 都是大规模聚合数据集,打破了"各实验室小数据"的困局
- 都定义了标准格式(ImageNet 的 WordNet 层次 / OXE 的 RLDS schema)
- 都催生了后续的基础模型(ImageNet → CLIP, ViT / OXE → RT-X, Octo)
关键差异:
- ImageNet 的"标签"是统一的(1000 类),OXE 的"动作"是不统一的(22 种机器人各有各的动作空间)
- ImageNet 的数据质量相对均匀(都是标注好的图像),OXE 的数据质量参差不齐(有些子集缺乏语言标注)
- ImageNet 是 I.I.D. 的(每张图像独立同分布),OXE 是非 I.I.D. 的(轨迹内有时序依赖,不同机器人的数据分布差异大)
这些差异意味着 OXE 的使用比 ImageNet 复杂得多——你不能简单地把所有数据混在一起训练,需要仔细处理动作空间归一化、数据权重、负迁移等问题。
负迁移的存在
多机器人混训并非总是有益的。当两种机器人的任务完全不同(如四足行走 vs 桌面操作),混训可能导致负迁移——模型被无关数据"干扰"了。OXE 论文中也报告了这种情况,但没有系统性地分析哪些机器人组合会产生负迁移。
这是当前的一个重要开放问题:如何自动识别和避免跨形态训练中的负迁移?
21.3.3 DROID——统一硬件 × 极端场景多样性
超简版:全球 18 家实验室一起拍机器人干活的视频,凑出 7.6 万段、564 个真实场景,让机器人不再只会"自家桌子上那点活"。
基本参数
| 维度 | 数值 |
|---|---|
| 轨迹数 | ~76K |
| 场景数 | 564 |
| 任务数 | 86 |
| 采集时长 | ~350 小时遥操作 |
| 参与机构 | 18 家 |
| 覆盖国家 | 13 个 |
| 机器人 | Franka Panda |
| 相机 | ZED 双目 |
| 遥操作 | Oculus Quest 控制器 |
核心设计:统一硬件,自由场景
DROID 的设计路线和 OXE 恰好相反:
- OXE:统一格式 + 异构硬件 → 聚合已有数据
- DROID:统一硬件 + 异构场景 → 协同生产新数据
DROID 的核心论点是:机器人基础模型缺的不是更聪明的算法,是更接近真实世界分布的数据。
为什么统一硬件?因为不同机器人的动作空间不兼容是跨形态训练最大的技术障碍(OXE 的实践已经证明了这一点)。统一硬件后,所有数据共享同一个动作空间——不需要归一化、不需要适配器、不用担心负迁移。模型训练变得简单了。
为什么自由场景?因为机器人的泛化瓶颈不是"不会做这个动作",而是"没见过这种环境"。在办公室桌上训练的抓取策略,到厨房桌上就失效了——不是因为抓取动作变了,而是因为背景、光照、物体排列不同,视觉编码器"迷路"了。DROID 通过 564 个不同场景、13 个国家的地理多样性,让模型在预训练阶段就见过各种环境,减少微调时需要适应的新环境"惊喜"。
类比:连锁店统一设备,各店口味不同——麦当劳全球统一设备和工作流程,但每个城市的麦当劳因为食材供应和当地口味偏好,产品细节有所不同。统一设备保证了基础质量,分散布局保证了适应性。
与 OXE 的路线对比
| 维度 | OXE | DROID |
|---|---|---|
| 核心思路 | 事后聚合已有数据 | 事前协同生产数据 |
| 硬件 | 22 种机器人 | 1 种(Franka) |
| 动作空间 | 不统一,需归一化 | 统一,直接可用 |
| 场景多样性 | 有限(多为实验室) | 极高(564 场景,13 国家) |
| 语言标注 | 部分缺失 | 全部有(自动生成 + 人工校验) |
| 数据质量 | 参差不齐 | 高度一致 |
| 参与门槛 | 低(格式转换即可) | 高(需购买指定硬件) |
| 规模 | 1.6M 轨迹 | 76K 轨迹 |
两条路线不是互相替代的,而是互补的。OXE 适合训练通用 VLA(跨形态能力),DROID 适合训练特定形态的高性能 VLA(单形态深度泛化)。实际应用中,先用 OXE 做预训练获得跨形态知识,再用 DROID 微调获得高质量的单形态性能,可能是更好的策略。
Scaling Law 实证
DROID 论文做了一个关键实验:分别用 25%、50%、100% 的数据预训练,然后在下游任务上微调,看性能怎么随数据量变化。
结果:性能随数据量单调提升,从 25% 到 100% 几乎是线性增长。这看起来是"废话"——数据多了性能当然好?但在机器人领域,这并不是显而易见的。之前有很多实验表明,加入低质量数据反而会降低性能(因为噪声干扰了学习)。DROID 的单调提升说明:当数据质量有保证时,scaling law 在机器人领域也成立。
更有说服力的对比:DROID 预训练 > OXE 预训练 > 从零训练。用 DROID 预训练的模型在下游任务上比用 OXE 预训练的更好,尽管 DROID 的数据量只有 OXE 的 5%。这再次验证了"数据质量 > 数据数量"。
质量控制流程
DROID 之所以能保证数据质量,是因为它有一套完整的质量控制流程:
- 硬件标定:每家机构在采集前必须完成标准化的相机标定和机器人标定流程
- 自动检查:上传数据后自动检查格式完整性、动作范围合理性、图像质量
- 语言标注:先用 VLM 自动生成语言描述,再由人工校验
- 异常过滤:检测并过滤掉采集失败、动作异常、图像模糊的轨迹
这套流程使 DROID 的"有效数据比例"远高于 OXE——几乎每条轨迹都是可用的。
局限
- 只有 Franka:统一硬件解决了动作空间兼容问题,但也意味着 DROID 只能用于 Franka 这一种机器人。用 WidowX 或 UR5 的实验室无法直接使用
- 偏 pick-and-place:86 种任务中大部分是"拿起-放下"类型,缺乏需要精细力控制的操作(如拧螺丝、切菜)
- 规模仍然有限:76K 轨迹对训练基础模型来说偏小。DROID 团队正在持续扩展中
21.3.4 RH20T——接触富集任务的多模态数据
超简版:机器人数据集,除拍视频外还录了"手感"和"声音":拧瓶盖多大力、咔哒卡到位。147 项任务、11 万段。
基本参数
| 维度 | 数值 |
|---|---|
| 轨迹数 | 110K+ |
| 任务数 | 147 |
| 模态 | RGB-D + 力/力矩 + 音频 + 本体感受 |
| 时间同步 | 毫秒级 |
| 采集时长 | 1,000+ 小时 |
为什么"接触富集"很重要
在 Ch13 和 Ch14 中,我们讨论的几乎所有 IL 方法都只用视觉(RGB 图像)作为输入。这在"看得到就能做"的任务上工作得很好——拿起杯子、推箱子、叠积木,这些动作的关键信息都在视觉中。
但有一类任务,关键信息不在"看"而在"摸":拧瓶盖需要知道阻力什么时候突然减小(盖子松了);插 USB 需要感受到对准时的轻微"咔嗒";切菜需要根据刀接触砧板的震动反馈调整力度。这些任务叫做接触富集任务(contact-rich tasks)——成功与否取决于精确的力控制,而力信息从视频中是学不到的。
你不可能从视频里看出拧瓶盖用了多大的力。你只能看到手在旋转瓶盖,但旋转的力度、加速的时机、停止的阈值——这些信息完全在视觉之外。就像你不可能从一张照片里听出那首歌好不好听一样。
RH20T 填补的就是这个空白——它不仅记录"机器人看到了什么",还记录"机器人摸到了什么""机器人听到了什么"。
四模态时间同步
RH20T 同时记录四种模态的数据:
- RGB-D 图像:第三人称视角的彩色图像 + 深度图,标准的视觉输入
- 力/力矩:安装在机械臂末端的力/力矩传感器,6 维(Fx, Fy, Fz, Tx, Ty, Tz),实时记录接触力
- 音频:桌面麦克风,记录操作过程中的声音(碰撞声、滑动声、卡扣声)
- 本体感受:关节角、关节速度、末端位姿等机器人内部状态
四种模态的毫秒级时间同步是 RH20T 最大的工程挑战,也是它最独特的技术贡献。
为什么时间同步这么难?因为四种传感器的工作频率不同:RGB-D 通常是 30Hz,力/力矩传感器是 500-1000Hz,音频是 44100Hz,本体感受是 100-500Hz。你要把这些不同频率的数据流精确对齐到同一个时间轴上,误差不能超过几毫秒——否则"力突然增大"和"图像中出现碰撞"就对不上了。
RH20T 通过硬件时钟同步 + 软件时间戳校准实现了这一目标。具体做法是:所有传感器共享同一个 NTP 时间服务器,采集时为每一帧数据打上精确的时间戳,后处理时根据时间戳插值对齐。
与 OXE/DROID 的互补关系
RH20T 和 OXE/DROID 不是竞争关系,而是互补关系:
| 维度 | OXE / DROID | RH20T |
|---|---|---|
| 核心追求 | 场景广度 | 模态深度 |
| 数据类型 | 视觉 + 动作 | 视觉 + 力 + 声音 + 动作 |
| 适用任务 | pick-and-place 为主 | 接触富集操作 |
| 可训练模型 | 视觉-动作 VLA | 多模态感知-动作模型 |
类比:做纪录片不光录画面,还挂麦克风、戴力传感手套——OXE/DROID 是"拍了 100 部风景大片",RH20T 是"拍了一部 4D 体感电影"。前者的广度帮助模型泛化,后者的深度帮助模型理解物理交互。
初学者常见误解:认为机器人只需要"看"就够了。实际上,人类的操作能力很大程度上依赖触觉反馈——盲人可以完成很多精细操作,但手部麻木的人连扣扣子都很困难。机器人也是一样:纯视觉的策略在接触富集任务上注定有上限。
局限
- 单一机器人:只有一种机械臂(未公开具体型号),跨形态复用受限
- 模态利用不足:虽然采集了四模态数据,但现有的 VLA 架构大多只支持视觉输入。如何有效地将力/力矩和音频融入策略网络,仍是一个开放问题
- 场景多样性有限:相比 DROID 的 564 个场景,RH20T 的场景数较少
21.4 仿真操作基准
21.4.0 从"数据集"到"考卷"
Ch17 中我们详细讨论了仿真平台——Isaac Gym、MuJoCo、Habitat 等,它们是"训练场"。本节关注的是"考卷"——仿真操作基准(benchmark)。
两者的区别在于目的不同:
- 训练场(仿真平台):提供环境让你训练策略,重点是物理保真度和速度
- 考卷(基准):提供标准化的任务和评估协议,让你公平比较不同算法,重点是可复现性和区分度
同一份仿真数据(如 RLBench 的示范轨迹)既可以用作训练数据,也可以用作评估基准——但设计意图不同。基准的设计者需要仔细考虑:任务难度是否合适?评估指标是否公平?训练/测试拆分是否防止了"作弊"?
本节从"算法适配"的角度重新分类仿真基准——不同的基准是为不同的算法范式设计的:
| 算法范式 | 对应基准 | 核心诉求 |
|---|---|---|
| RL(强化学习) | Meta-World, RLBench | 明确的奖励函数,可大规模试错 |
| IL(模仿学习) | RoboMimic | 控制变量的数据质量实验 |
| 语言条件 + 长时序 | CALVIN, LIBERO | 多步推理和指令跟随 |
| 家务 + 关节物体 | RoboCasa, BEHAVIOR-1K, ManiSkill | 日常场景泛化 |
21.4.1 RL 导向基准:Meta-World
超简版:给那些号称"会举一反三"的机器人算法办一场 50 道动手题的统一考试。
基本参数
| 维度 | 数值 |
|---|---|
| 任务数 | 50 |
| 难度分层 | 5 级(ML1 → ML45) |
| 观测空间 | 统一 39 维(机器人状态 + 物体状态) |
| 动作空间 | 统一 4 维(3D 末端位移 + 夹爪) |
| 机器人 | Sawyer(7-DoF) |
| 物理引擎 | MuJoCo |
设计哲学:统一接口
Meta-World 的核心贡献不是 50 个任务本身(很多任务是经典操作任务的变体),而是统一的观测和动作空间。50 个任务全部共享:
- 相同的 39 维观测向量(Sawyer 的关节角 + 物体的位置/旋转/速度)
- 相同的 4 维动作向量(末端执行器的 3D 位移 + 夹爪开合)
- 相同的稀疏奖励定义(1 = 成功,0 = 失败)
这种统一性让多任务学习和元学习算法有了"苹果对苹果"的比较基础。你不需要为每个任务设计不同的网络架构或超参数——一个算法配置就能跑全部 50 个任务。
类比:50 项体能测试,都是田径类——100 米、跳远、铅球,虽然项目不同,但都是"用身体完成"的运动,评分标准统一。如果有人声称他的训练方法"全面提升运动能力",你让他跑一遍 50 项测试就知道真假了。
五个难度层级
Meta-World 定义了 5 个递增的评估配置:
| 配置 | 任务数 | 含义 |
|---|---|---|
| ML1 | 1 | 单任务:训练和测试同一个任务 |
| ML10 | 10 | 多任务:10 个任务联合训练和评估 |
| ML45 | 45 | 多任务:45 个任务联合训练和评估 |
| MT10 | 10 | 元学习:10 个任务,测试在新任务上的快速适应 |
| MT50 | 50 | 元学习:50 个任务,测试在新任务上的快速适应 |
关键发现:MT10→MT50 性能减半
Meta-World 论文中最重要的实验结果是:多任务性能随任务数增加急剧下降。
- MT10(10 个任务):平均成功率 68.3%
- MT50(50 个任务):平均成功率 38.5%
几乎减半。而单任务 SAC(每个任务独立训练)能 50/50 全部成功。
这个结果意味着什么?瓶颈在算法,不在任务本身。 任务本身是可以解的(SAC 证明),但当前的多任务/元学习算法在同时处理 50 个任务时,出现了严重的"任务干扰"(task interference)——不同任务的梯度方向冲突,网络在"学 A 忘 B"之间反复。
这个发现对后续研究的影响很大:它把社区的注意力从"设计更多任务"转向了"设计更好的多任务学习算法"——如任务条件化的网络架构、梯度方向投影、任务分组等。
踩坑提醒:Meta-World 使用稀疏奖励。在单任务设定下,SAC 配合 HER(Hindsight Experience Replay)可以解决大多数任务。但在多任务设定下,稀疏奖励使 RL 几乎无法学习——建议使用 IL 方法或密集奖励塑形。
21.4.2 RL 导向基准:RLBench
超简版:给机器人手臂出了一套 100 道题的"统考卷",从此大家都做同一套题,第一次能公平比谁更厉害。
基本参数
| 维度 | 数值 |
|---|---|
| 任务数 | 100 |
| 变体数 | 每个任务多个变体(如不同颜色/位置的目标) |
| 示范来源 | OMPL 运动规划器(无限生成) |
| 动作空间 | 8 种可选 |
| 物理引擎 | CoppeliaSim |
三层结构
RLBench 的任务组织是三层结构:
- Task(任务):如"把物品放进箱子里",100 个
- Variation(变体):同一任务的不同配置,如箱子位置不同、物品颜色不同
- Episode(回合):同一变体下的单次执行
这种分层设计支持两种评估模式:
- 同变体评估:训练和测试用同一组变体——测"学会没有"
- 新变体评估:训练用一组变体,测试用新变体——测"能不能泛化"
8 种动作空间
RLBench 提供了 8 种不同的动作空间表示,从低维到高维:
| 动作空间 | 维度 | 描述 |
|---|---|---|
| 末端位姿(绝对) | 7 | 6D 位姿 + 夹爪 |
| 末端位姿(增量) | 7 | 位姿增量 + 夹爪 |
| 关节角(绝对) | 8 | 7 关节 + 夹爪 |
| 关节角(增量) | 8 | 关节增量 + 夹爪 |
| ... | ... | 其他 4 种变体 |
不同算法偏好不同的动作空间:RL 通常用连续的绝对关节角,IL 通常用增量式的末端位姿。RLBench 允许研究者选择最适合自己算法的空间,同时保持任务定义不变。
关键发现:纯 RL + 稀疏奖励几乎全挂
RLBench 论文的一个核心实验是:用纯 RL(SAC、TD3、PPO)+ 稀疏奖励在 100 个任务上训练。结果——绝大多数任务的成功率为 0%。
这和 Meta-World 形成鲜明对比。Meta-World 中 SAC 至少能解单任务,但 RLBench 的任务更复杂(更长的操作序列、更多的物体交互、更精细的力控制),稀疏奖励几乎无法提供有效的学习信号。
解决方案:模仿学习主导。RLBench 可以通过 OMPL(Open Motion Planning Library)运动规划器无限生成高质量的示范轨迹。用这些示范训练 IL 方法(如 BC、BC-RNN),在大部分任务上都能达到 >50% 的成功率。
类比:RLBench 是一套"统考卷"——以前大家各自出题,你说你算法好、我说我算法好,没法比。现在大家做同一套卷子,分数摆出来,谁强谁弱一目了然。
少样本评估协议
RLBench 还定义了一种"少样本评估"协议:给算法 K 条示范(K=1, 5, 10, 20),看它能在多少个任务上成功。这个协议模拟了现实中"快速教机器人一个新任务"的场景——你不想花几小时采集数百条演示,只想"演示几次就让它自己干"。
局限
最大的局限是 sim-to-real gap:RLBench 的任务全部在仿真中。一个在 RLBench 上 90% 成功率的策略,部署到真机上可能只有 30%。这不是 RLBench 的"bug",而是所有仿真基准的共同问题——仿真的物理和视觉都和真实世界有差异(详见 Ch17)。
21.4.3 模仿学习导向基准:RoboMimic
超简版:把"机器人看录像学操作"里每个变量挨个换一遍,告诉你哪些真有用。
基本参数
| 维度 | 数值 |
|---|---|
| 任务数 | 多个(Lift, Can, Square, Transport, Tool Hang 等) |
| 数据质量 | 3 档(PH / MH / MG) |
| 采集方式 | 真机遥操作 + 仿真 |
| 物理引擎 | MuJoCo |
三档数据质量
RoboMimic 最核心的贡献不是新的任务或新的算法,而是系统性的数据质量控制变量实验。它为每个任务提供了三档数据:
| 档次 | 缩写 | 含义 | 操作者 |
|---|---|---|---|
| 专业级 | PH | Proficient Human | 有经验的遥操作者 |
| 混合级 | MH | Mixed Human | 专业 + 新手混合 |
| 多人级 | MG | Multi-Gen(MimicGen 生成) | 程序自动生成 |
关键区别:PH 数据每条都是"完美操作";MH 数据中混入了新手操作(有犹豫、有失误、有冗余动作);MG 数据是用 MimicGen 算法从少量人类示范自动合成的。
核心发现一:数据质量 > 数据数量
用 PH 数据训练的 BC 策略,200 条示范就能达到 90%+ 的成功率。用 MH 数据训练,即使有 1000 条示范,成功率也只有 60-70%。用 MG 数据训练,效果介于两者之间。
这个结论深刻影响了后续的数据采集策略:与其追求更多数据,不如追求更高质量的数据。Diffusion Policy、ACT/ALOHA 等后续工作都采用了这个思路——用少量高质量示范而不是大量低质量示范来训练策略。
核心发现二:Offline RL 没赢 BC
RoboMimic 对比了 BC(行为克隆)、BC-RNN(带 RNN 的行为克隆)和多种 offline RL 方法(CQL、IRIS 等)。结果出乎很多人意料:
- 在 PH 数据上:BC 和 BC-RNN 就够了,offline RL 没有显著优势
- 在 MH 数据上:offline RL 略有优势(能从混合质量数据中学得更好),但差距不大
- 在所有设定下:BC-RNN(用 RNN 建模时序依赖)始终优于 BC
这个结果对社区的启示是:在机器人 IL 领域,算法复杂度的边际收益很小,数据质量的边际收益很大。与其花精力设计更复杂的 RL 算法,不如花精力采集更好的数据。
对后续工作的影响
RoboMimic 的发现直接催生了几个重要方向:
- Diffusion Policy(Ch13):RoboMimic 发现 BC-RNN 比 BC 好,说明建模动作分布的多模态性很重要。Diffusion Policy 用扩散模型更好地建模了这种多模态性
- ACT/ALOHA:RoboMimic 的数据质量结论支持了 ALOHA "少量高质量示范 + 时空注意力"的路线
- BeT(Behavior Transformer):直接受 RoboMimic "BC-RNN > BC" 的启发,用 Transformer 替代 RNN 建模时序依赖
21.4.4 语言条件 + 长时序基准:CALVIN
超简版:CALVIN 是一把"机器人听话考试"的尺子:人说一段话,机器人要在桌上一步接一步把活干完。
基本参数
| 维度 | 数值 |
|---|---|
| 任务数 | 34 种原子操作 |
| 环境数 | 4(A/B/C/D,逐步变化) |
| 评估方式 | 5 步链式评估 |
| 语言类型 | 自然语言指令 |
| 物理引擎 | PyBullet |
链式评估:连环考题
CALVIN 的核心创新是链式评估(chained evaluation)。不是给机器人一个任务做完了打分,而是给一串任务——"打开抽屉 → 拿起红方块 → 放到蓝区域 → 关上抽屉 → 推动绿瓶子"——必须一步不差地全做完才算成功。
这比单任务评估难得多。如果每一步的成功率是 90%,5 步链式成功率只有 0.9^5 = 59%。任何一步失败,后面的全废。
类比:高考连环题——错一步整题废。单任务评估是"每道选择题独立计分",链式评估是"大题的第一步错了后面全没分"。后者更接近真实需求——你让机器人"收拾桌子",它必须把所有东西都放好才算完成,中间任何一步打翻杯子就失败了。
四个环境:渐进式泛化
CALVIN 定义了 4 个环境(A/B/C/D),逐步增加泛化难度:
- A → B:同一环境,不同起始状态
- A → C:换了桌面颜色和部分物体
- A → D:完全不同的物体配置和颜色
这种设计让研究者可以精确测量模型在不同泛化层级上的表现——是只能做自己见过的环境(A→A),还是能适应新的布局(A→C),还是能适应完全陌生的场景(A→D)?
21.4.5 语言条件 + 长时序基准:LIBERO
超简版:教机器人学新技能时别忘旧技能。LIBERO 是这事的标准考卷,4 套题分别考空间、物体、目标和综合。
基本参数
| 维度 | 数值 |
|---|---|
| 任务数 | 130 |
| 套件 | 4(Spatial / Object / Goal / LIBERO-100) |
| 每任务演示数 | 50 |
| 语言标注 | 全部有 |
| 物理引擎 | MuJoCo |
四套题设计:知识类型解耦
LIBERO 最巧妙的设计是:将泛化能力拆解为四种独立的知识类型,分别出题。
| 套件 | 考什么 | 核心挑战 | 示例任务 |
|---|---|---|---|
| LIBERO-Spatial | 空间泛化 | 同物体新位置 | "把红碗放到蓝板左边"→ 红碗换了位置 |
| LIBERO-Object | 物体泛化 | 同任务新物体 | "把碗放到盘子上"→ 碗换成了杯子 |
| LIBERO-Goal | 目标泛化 | 同场景新目标 | 桌上有碗和盘子 → "把碗放到盘子上"vs"把盘子放到碗上" |
| LIBERO-100 | 综合长时序 | 全部 + 顺序学习 | 100 个任务依次学习,不能忘 |
这种解耦设计有一个直接的好处:你可以精确诊断模型的弱点在哪。如果 Spatial 分数低但 Goal 分数高,说明模型的视觉定位能力不足但指令理解没问题;如果 Object 分数低,说明模型对未见物体的泛化能力差。
类比:医学诊断不是只看"你病了",而是分科检查——内科、外科、骨科、神经科。LIBERO 的四套题就是四科体检,帮你定位模型的"病"在哪。
"一卷两吃":终身学习 + VLA 微调评测
LIBERO 的另一个独特设计是它同时服务于两个研究社区:
终身学习(Lifelong Learning)社区:LIBERO-100 的 100 个任务需要依次学习——学完任务 1 再学任务 2,依此类推。核心挑战是"学新不忘旧"(avoid catastrophic forgetting)。这使得 LIBERO 成为终身学习的标准基准。
VLA 微调评测社区:LIBERO 的每个任务都有 50 条演示 + 语言指令,可以直接用于 VLA 的微调和评测。2024 年以来,几乎所有开源 VLA 都在 LIBERO 上做评测——OpenVLA、π0、RDT-1B 等。
这种"一卷两吃"的设计让 LIBERO 成为仿真基准中"使用率最高"的一个。它不是最大最难的,但它是最"好用"的——任务设计合理、评估协议清晰、代码库维护良好、社区支持完善。
为什么它成了 VLA 微调的事实标准
几个原因叠加:
- 语言条件 + 视觉输入:VLA 需要同时处理图像和语言,LIBERO 的每个任务都有精确的语言指令,完美匹配 VLA 的输入格式
- 难度适中:比 Meta-World 难(需要语言理解和物体泛化),但不像 BEHAVIOR-1K 那么难(不需要复杂的长程规划),适合做"微调后提升多少"的评测
- 四套题解耦:可以分别评测不同维度的泛化能力,而不是只有一个总分
- 开源生态:代码、演示数据、评估脚本全部公开,HuggingFace 上一键下载
21.4.6 家庭/家务基准:RoboCasa
超简版:想造个会做饭的家用机器人?RoboCasa 给你 120 个虚拟厨房、100 个小动作、十万次练习录像。
基本参数
| 维度 | 数值 |
|---|---|
| 厨房场景 | 120 |
| 原子任务 | 100 |
| 总回合数 | 100K+ |
| 物体数 | 2500+ |
| 物理引擎 | MuJoCo |
核心特点:AI 生成资产
RoboCasa 的场景和物体大量使用 AI 生成——不是手工建模,而是通过程序化生成(procedural generation)自动创建。这意味着:
- 120 个厨房各不相同(布局、颜色、家具类型都随机化)
- 2500+ 个物体覆盖了厨房中常见的锅碗瓢盆
- 可以无限扩展——需要更多场景?运行生成脚本即可
类比:训练保姆去 100 家不同厨房实习——每家的灶台位置、调料架高度、锅碗样式都不同,但都是"真实的"厨房场景(只是是虚拟的)。
MimicGen 轨迹改写
RoboCasa 的另一个技术亮点是使用 MimicGen 进行数据扩增。MimicGen 的思路是:给定少量人类示范(如"拿起杯子"),自动改写出在新场景配置下的示范(杯子换了位置、换了颜色、换了形状,但动作的"骨架"相同)。这大大降低了数据采集成本——不需要为每个新场景都重新遥操作。
局限
RoboCasa 的主要局限是家庭场景的复杂性远不止厨房。真实的家务包括洗衣、打扫、整理、照顾宠物等,而 RoboCasa 目前只覆盖了厨房操作。不过作为"厨房模拟器",它在这个特定场景上做得足够深入。
21.4.7 家庭/家务基准:BEHAVIOR-1K
超简版:斯坦福搭的"机器人家务考场":1000 道家务题、50 间样板房、9000 多件物品。
基本参数
| 维度 | 数值 |
|---|---|
| 任务数 | 1000 |
| 场景数 | 50 |
| 物体数 | 9000+ |
| 任务来源 | 1461 人调研 |
| 判分方式 | BDDL 谓词逻辑 |
"产品需求调研"思路
BEHAVIOR-1K 的任务定义方式和其他基准截然不同——它不是由研究者"拍脑袋"想出来的,而是通过大规模人类调研确定的。
斯坦福团队调查了 1461 个人,问他们"你最希望机器人帮你做什么家务",然后从回答中提炼出 1000 种最常见的日常活动。这种"用户驱动"的任务定义方式确保了基准的生态效度(ecological validity)——评测的任务确实是人类关心的,而不是研究者觉得"酷"的。
类比:产品经理做需求调研——先问 1461 个人他们需要什么,再挑 top 1000 做成需求列表。而不是工程师自己想 1000 个"我觉得用户需要"的功能。
BDDL 判分
BEHAVIOR-1K 使用 BDDL(Behavior Domain Description Language)来定义任务的成功条件。BDDL 是一种谓词逻辑语言,可以表达复杂的状态约束:
- 简单任务:"杯子在桌子上" →
on(cup, table) - 复杂任务:"把干净的衣服叠好放进衣柜" →
inside(clothes, closet) ∧ folded(clothes) ∧ clean(clothes)
这种形式化的判分方式避免了"这算不算成功"的主观争议——谓词为真就是成功,为假就是失败。
状态变化模拟
BEHAVIOR-1K 的一个独特能力是模拟物体的状态变化:脏的→干净的(洗过)、完整的→破碎的(摔了)、湿的→干的(晾过)。这比大多数仿真基准只能模拟物体的位置变化要复杂得多——但也更接近真实的家务场景。
21.4.8 关节物体基准:ManiSkill
超简版:ManiSkill 是教机器人开抽屉、开柜门的统一考场——专测它练完几十个柜子之后,能不能上手没见过的第 101 个。
基本参数
| 维度 | 数值 |
|---|---|
| 任务类型 | 多种(开抽屉、开门、推物体等) |
| 物体来源 | PartNet-Mobility |
| 物体实例 | 数百个 |
| 拆分方式 | 按物体实例 train/test |
核心挑战:物体实例泛化
ManiSkill 的核心评估问题是:策略能不能泛化到没见过的物体?
训练时用的是 A 组抽屉,测试时换成 B 组抽屉——关节参数、尺寸比例、把手位置都不同。策略必须从视觉输入中理解"这是一个抽屉,需要沿这个方向拉",而不是过拟合到"看到这个特定形状就执行这个特定动作"。
类比:驾校改革——以前只练同一辆桑塔纳,考试也开这辆桑塔纳;现在换十几种车练,考试开没碰过的车。如果只会背桑塔纳的离合点,换车就不会开了;真正理解了"离合器的原理",什么车都能开。
与 Ch17 的联系
ManiSkill 报告的"训练 88.7% → 测试 22.9%"的落差,不是 sim-to-real gap(都在仿真中),而是物体泛化 gap。这个 gap 说明:即使仿真和真实完全一致,策略仍然可能无法泛化到新物体。这和 Ch17 中 SAPIEN/ManiSkill 的讨论一脉相承——泛化能力是独立于 sim-to-real gap 的另一个关键挑战。
21.4.9 仿真基准对比与互补
八个仿真基准各有侧重,不存在"最好"的——它们是互补的:
| 基准 | 算法定位 | 核心考察点 | 适合谁用 |
|---|---|---|---|
| Meta-World | RL | 多任务/元学习 | RL 算法研究者 |
| RLBench | RL/IL | 任务多样性 + 少样本 | IL + few-shot 研究者 |
| RoboMimic | IL | 数据质量 vs 数量 | IL 方法论研究者 |
| CALVIN | 语言条件 | 链式长时序 | VLA + 长程规划研究者 |
| LIBERO | 语言条件 | 知识类型解耦 | VLA 微调 + 终身学习研究者 |
| RoboCasa | 家庭场景 | 厨房操作多样性 | 家务机器人研究者 |
| BEHAVIOR-1K | 家庭场景 | 真实家务复杂度 | 长程家务研究者 |
| ManiSkill | 关节物体 | 物体实例泛化 | 操作泛化研究者 |
如果你的研究需要选一个基准,决策流程是:
- 你的算法是 RL 还是 IL?→ RL 选 Meta-World/RLBench,IL 选 RoboMimic
- 需要语言条件吗?→ 需要,选 CALVIN 或 LIBERO
- 关注家庭场景吗?→ 关注,选 RoboCasa 或 BEHAVIOR-1K
- 关注物体泛化吗?→ 关注,选 ManiSkill
更实际的做法是选 2-3 个互补的基准——例如 LIBERO(语言条件 + 知识类型解耦)+ ManiSkill(物体泛化)+ 一个真机数据集(DROID/BridgeData V2)做 sim-to-real 验证。
仿真基准的共同局限
最后,所有仿真基准都有一个共同的局限:它们测的是仿真中的性能,不是真机上的性能。一个在 LIBERO 上 90% 成功率的 VLA,部署到真机上可能只有 40-50%。这个 gap 的来源和处理方法在 Ch17 中已有详细讨论,此处不再展开。
但有一点值得强调:仿真基准的价值不在于"预测真机性能",而在于快速迭代和公平比较。在仿真中,你可以一天训练 100 个模型变体并评估;在真机上,同样的实验可能需要一个月。仿真基准让算法迭代速度提高了 100 倍——即使最终还需要真机验证,前期的快速筛选仍然极大地提高了研发效率。
21.5 数据集的四个设计维度(横切对比)
前面四个小节是"纵向"逐个看每个数据集——OXE 的跨本体野心、DROID 的分布式采集、BridgeData V2 的 VLA 基石、RH20T 的多模态丰富性、LIBERO/CALVIN 的终身学习基准、RoboCasa/BEHAVIOR-1K 的场景多样性、RLBench/Meta-World/ManiSkill/RoboMimic 的经典地位。每个数据集我们都理解了它"为什么这样设计"。
现在换个视角——用四个横切维度把所有数据集拉到同一张表上比较。这就像你逛完一圈手机店,每款手机都摸过了,现在拿出一张对比表:屏幕大小、电池容量、拍照像素、价格——四个维度同时比较,哪个适合你一目了然。
数据集也一样。四个设计维度是:
- 真机 vs 仿真:数据从哪来?
- 单本体 vs 跨本体:数据给几种机器人用?
- 视觉 vs 多模态:数据包含哪些感官信号?
- 数据集 vs 基准:数据是用来"喂"的还是用来"考"的?
每个维度都不是简单的二选一——它背后是一组 trade-off,选 A 得到什么、失去什么,选 B 又如何。理解这些 trade-off,比记住每个数据集的参数更重要。
21.5.1 真机 vs 仿真
Trade-off 的核心:真实度 vs 规模/成本
想象你要训练一个厨师。方案 A:让他在真实厨房里做一千道菜,用真实食材,烧糊了就倒掉重来。食材成本、厨房占用、油烟清理——每次实验的代价都很高。方案 B:让他在模拟厨房里做一百万道菜。食材是虚拟的,烧多少都不心疼,但"虚拟盐"放多少和"真实盐"放多少的手感不完全一样。
这就是真机 vs 仿真的根本 trade-off:
| 维度 | 真机数据 | 仿真数据 |
|---|---|---|
| 真实度 | 高(数据来自真实物理世界) | 取决于仿真器保真度 |
| 规模 | 受限于采集成本,通常千~万级 | 理论上无限,可轻松到百万级 |
| 可重置性 | 差(每次实验需要手动复位) | 好(一键重置环境) |
| 安全性 | 有风险(机器人可能损坏物品或伤人) | 完全安全 |
| 一致性 | 低(光照、纹理、物理参数自然变化) | 高(参数精确可控) |
| Sim-to-Real Gap | 无(数据本身就是 real) | 存在(需要额外迁移策略) |
真机数据集的优势与代价
OXE、DROID、BridgeData V2、RH20T 都是真机数据集。它们最大的优势用两个字概括:无 gap。在真机数据上训练的策略,部署到真机不需要跨越 sim-to-real gap——因为训练和部署在同一个物理世界里。你在真实厨房里练出来的颠勺技术,换一个真实厨房也能用。
但真机数据的代价是规模天花板。DROID 动用了 13 个机构、60 台机器人、持续数月才采集了 76K 条轨迹。这个规模和 NLP 领域的万亿 token 相比,差了六个数量级。为什么真机数据这么难采?
- 硬件成本:一台 Franka 机械臂约 3 万美元,加上相机、力传感器、计算设备,一个工作站成本超过 5 万美元
- 人力成本:每条轨迹需要人操控机器人(teleoperation),平均每条 30 秒到 2 分钟,一个人一天最多采 200-400 条
- 故障时间:机器人关节过热、传感器失灵、网络中断——真实硬件的不稳定性导致 10-30% 的时间花在维护而非采集上
- 环境准备:DROID 有 564 个不同场景,每个场景需要布置物品、调整灯光、校准相机
仿真数据集的优势与代价
RLBench、Meta-World、LIBERO、CALVIN、BEHAVIOR-1K、RoboCasa、ManiSkill 都是仿真数据集。它们最大的优势也是两个字:无限。仿真的数据量只受限于计算资源。RoboCasa 用 MimicGen 从少量人工演示自动生成了 100K+ 条轨迹,这个规模在真机上是不可能达到的。
仿真的另一个关键优势是安全和可重置。RL 训练需要数百万步试错,在真机上让机器人反复摔倒、碰撞、损坏物品——成本不可接受。仿真里随便摔,env.reset() 一秒钟回到初始状态。
但仿真的核心问题是 Ch17 中详细讨论的 sim-to-real gap。仿真渲染的图像缺乏真实相机的噪声、模糊和色彩偏差;仿真的物理引擎假设摩擦系数是常数,真实世界摩擦系数随温度和压力变化;仿真中机器人关节的响应是即时的,真实电机有延迟。
举一个具体例子:在 RLBench 中训练的抓取策略,仿真里 Franka 的夹爪闭合角度和真实 Franka 的夹爪闭合角度可能差 2-3 度——这在抓取小物体(如笔、硬币)时足以导致抓取失败。在 LIBERO 中训练的长序列策略,仿真里物体碰撞的反弹轨迹和真实碰撞的反弹轨迹有差异——这种差异在单步操作中不明显,但会在长序列中累积,导致第 8 步以后的状态偏离预期。
还有一个容易被忽视的劣势:仿真数据的多样性有上限。无论你在仿真中怎么域随机化,物体的 3D 模型、纹理贴图、物理参数都来自人工设计——仿真世界里的"杯子"只有建模者做过的那几十种,真实世界里的杯子有无数种。这也是为什么 Ch17 的域随机化策略有一个隐含前提:随机化的参数范围必须足够宽,才能"包住"真实世界的参数分布。
混合策略:仿真预训练 + 真机微调
实践中最常用的不是"纯真机"或"纯仿真",而是混合策略:先用大规模仿真数据预训练(获得基础操作能力),再用少量真机数据微调(适配真实世界的物理和视觉特性)。这就像在模拟器里先学会开车的基本操作(方向盘、油门、刹车),然后上真实道路练几天适应实际路况。
Octo 就是这种策略的典型代表:它用 OXE 中 800K 条混合数据(含仿真和真机)预训练,部署时只需 50-200 条目标环境的真机演示就能微调适配。Ch12 中的 OpenVLA 也采用了类似策略——在 OXE 的 970K 轨迹上预训练,然后针对特定下游任务微调。
混合策略的数学直觉可以这么理解:假设模型需要学习的总知识量是 K。纯真机策略用少量高质量数据学到了 K 的 60%,但数据不够,无法学到剩余的 40%。纯仿真策略用大量低质量数据学到了 K 的 80%,但其中 20% 是"仿真世界的偏见"(sim-specific bias),迁移到真机时会出错。混合策略用仿真数据先学到 K 的 80%,然后用少量真机数据"修正"那 20% 的偏见——最终学到了 K 的 90%+。50-200 条真机数据的成本远低于从零开始用真机数据训练所需的数万条。
SimplerEnv(21.6.1 节将详细介绍)则从另一个角度弥合 gap:不追求让仿真更逼真,而是让仿真的评测分数和真机评测分数高度相关——在仿真里跑分就能预测真机表现。
初学者常见误解:"仿真数据没用,一定要真机数据。"事实是:纯仿真数据训出来的策略确实不能直接部署到真机,但仿真数据提供的"基础操作能力"(抓取、推动、旋转等 primitive)是可以在真机微调时被复用的。从零开始只用真机数据训练,达到同等性能需要的数据量可能是混合策略的 5-10 倍。
真机 vs 仿真综合对比
| 数据集 | 真机/仿真 | 典型规模 | 能否直接部署真机 | 训练成本 |
|---|---|---|---|---|
| OXE | 真机 | 1.6M traj | 能 | 高(多人多机构) |
| DROID | 真机 | 76K traj | 能 | 高(13 机构联合) |
| BridgeData V2 | 真机 | 60K traj | 能 | 中(单一硬件) |
| RH20T | 真机 | 110K traj | 能 | 高(多传感器同步) |
| LIBERO | 仿真 | 130 tasks | 需迁移 | 低 |
| CALVIN | 仿真 | 34 tasks | 需迁移 | 低 |
| RoboCasa | 仿真 | 100K+ traj | 需迁移 | 低(MimicGen 自动化) |
| BEHAVIOR-1K | 仿真 | 1000 tasks | 需迁移 | 低 |
| RLBench | 仿真 | 100 tasks | 需迁移 | 低 |
| Meta-World | 仿真 | 50 tasks | 需迁移 | 低 |
| ManiSkill | 仿真 | Skills x 100s | 需迁移 | 低 |
| RoboMimic | 仿真(+少真机) | 多层级 | 部分可 | 低 |
21.5.2 单本体 vs 跨本体
一台机器人的数据 vs 多台机器人的数据
想象你在学开车。方案 A:你只在一辆车上练,把这辆车的方向盘手感、油门响应、刹车行程全部练到肌肉记忆。方案 B:你轮流在轿车、SUV、卡车、面包车上练,每辆车的手感都不同,但你学会了一种更通用的"驾驶能力"——给你一辆没开过的车,你也能很快上手。
方案 A = 单本体路线,方案 B = 跨本体路线。
单本体路线的代表:BridgeData V2(只用 WidowX)、DROID(只用 Franka)、LIBERO(只用仿真 Franka)。这些数据集的优势是数据一致性高——所有轨迹来自同一种机器人,动作空间、传感器配置、控制频率完全统一,模型训练时不需要处理异构数据。
跨本体路线的代表:OXE(22 种机器人)。它的核心假设是:不同机器人之间的操作知识可以迁移——"抓杯子"的动作在 WidowX 和 Franka 上执行方式不同,但"识别杯子"、"规划接近路径"、"判断抓取成功"这些高层知识是共享的。
Trade-off:数据一致性 vs 形态多样性
单本体的优势是"纯净"。BridgeData V2 的 60K 条轨迹全部来自 WidowX,动作空间是统一的 7 维关节角度,模型不需要学习"不同机器人有不同的动作空间"这件事。训练更简单,下限更高——不会出现"混淆不同机器人动作空间"的负迁移。
跨本体的优势是"广度"。OXE 包含了从单臂机械臂到双臂机器人、从夹爪到灵巧手的多种形态。如果模型能从这些异构数据中学到通用的操作表征,它就有了"零样本迁移"到新机器人上的潜力——不需要在新机器人上采集任何数据就能控制它。
但跨本体的风险是负迁移(negative transfer):某些机器人的数据混在一起不仅没有帮助,反而会降低性能。21.6.3 节会详细讨论 OXE 的正迁移/负迁移实验。
实证结果:正迁移 vs 负迁移
OXE 的 RT-1-X 实验给出了关键的实证数据:
- 正迁移:用 22 种机器人的混合数据训练的 RT-1-X,在 WidowX 上的成功率比只用 WidowX 数据训练的 RT-1 高出约 50%。说明跨本体数据确实带来了增益
- 负迁移:某些特定组合下,混入异构数据反而降低了性能。例如,把双臂机器人的数据混入单臂机器人的训练集,成功率下降了约 10%。原因可能是动作空间的维度差异(7 维 vs 14 维)导致模型产生了混淆
RT-2-X 进一步发现:跨本体的正迁移在"语义理解"层面最为显著——RT-2-X 能理解从未见过的指令("把 Taylor Swift 的图片拿起来"),这是单本体训练绝对做不到的。但在"精细控制"层面,跨本体数据的增益有限——精细控制仍然需要目标本体的真机数据。
踩坑提醒:不要以为"数据越多越好,混在一起就行"。OXE 的实验明确显示,盲目混合所有数据可能不如精心挑选数据。在 21.6.3 节中我们会看到,哪些跨本体组合是有益的,哪些是有害的。
未来趋势:跨本体是大势,但需要更好的动作空间归一化
当前的跨本体数据集(主要是 OXE)用 RLDS 格式统一了数据存储,但动作空间的归一化仍然是一个未解决的难题。7 维关节角度和 7 维末端位姿虽然都是 7 维向量,但物理含义完全不同。Franka 的关节角度范围是 [-2.9, 2.9] 弧度,WidowX 的关节角度范围是 [-π, π]——直接拼接在一起训练,模型很难区分哪个维度属于哪种机器人。
RLDS(Reinforcement Learning Datasets)格式是 OXE 团队提出的统一数据存储规范。它解决了"不同数据集用不同格式"的工程问题——之前 BridgeData V2 用 RLDS,DROID 用 HDF5,RH20T 用自定义格式,每个数据集都需要单独写数据加载器。RLDS 把所有数据集统一到一个 TensorFlow Dataset 格式下,使得跨数据集训练的代码量从"每个数据集写一个加载器"变成了"所有数据集共用一个加载器"。
但 RLDS 只解决了存储格式的统一,没有解决语义格式的统一。两个数据集都是 RLDS 格式,但一个的动作是关节角度(7 维),另一个的动作是末端位姿增量(7 维)——数据加载器不报错,但模型拿到的是语义不一致的输入。这就是"负迁移"的工程根源之一。
未来的解决方案可能包括:
- 通用动作表示:把所有动作映射到一个与本体无关的通用空间(如末端执行器的相对位姿变化)。Octo 部分采用了这个思路——它把不同机器人的动作统一归一化到 [-1, 1] 范围内,但这只是数值层面的归一化,语义层面的统一仍然缺失
- 本体条件化:给模型输入一个"我是哪种机器人"的标识,让模型根据本体调整动作生成。RT-1-X 和 RT-2-X 在输入中加入了机器人类型的 embedding,让模型知道当前在控制哪种机器人——这是一个简单但有效的临时方案
- 分层策略:高层策略输出与本体无关的"意图"(如"抓取杯子"),低层策略将"意图"翻译为具体的关节角度。这和 Ch10 中 SayCan 的"高层规划 + 低层执行"架构异曲同工,只不过这里的"低层"是针对每种本体单独训练的
21.5.3 视觉 vs 多模态
大多数数据集:纯 RGB + 本体感受
回顾一下 21.1-21.4 介绍的 12 个数据集,你会发现一个规律:绝大多数数据集的感知输入只有两种——RGB 图像和本体感受(关节角度、夹爪状态)。
这不是偶然。RGB 相机是最便宜、最通用、最容易部署的传感器——一个 USB 摄像头几十美元就能买到,不需要标定,即插即用。本体感受是机器人自带的——关节编码器和力矩传感器是工业机器人的标配,不需要额外安装。
这两种信号的组合(RGB + proprioception)已经能解决大部分操作任务:看懂场景(RGB)、知道自己的状态(proprioception)、输出动作——形成了 VLA 的标准输入范式。从 Ch11 的 RT-1/RT-2 到 Ch12 的 OpenVLA/Octo,所有主流 VLA 都采用了这个输入范式。
但"大部分"不等于"全部"。有一类任务,纯视觉+本体感受的组合是明显不够的——凡是需要接触力反馈或非视觉状态判断的任务,VLA 就像一个闭着眼睛端咖啡的人——只知道去端,不知道端得稳不稳。
RH20T:加入力/力矩和音频
但有些任务光靠"看"和"感知自身"是不够的。比如:
- 拧螺丝:你需要知道螺丝有没有拧紧——这靠力/力矩传感器来判断,而不是靠眼睛看
- 倒水:你需要知道水什么时候倒满了——靠听水声的变化比靠看水面高度更可靠
- 材质判断:敲一下物体听声音,比看外观更能判断材质
RH20T 是目前唯一一个大规模包含力/力矩和音频信号的操作数据集。它采集了 110K 条轨迹,每条轨迹同时记录了 RGB-D 图像、6 维力/力矩传感器数据、双耳麦克风音频、以及语言标注。
让我们用一张表格对比不同数据集的模态覆盖情况,直观地展示 RH20T 的独特性:
| 模态 | OXE | DROID | BridgeData V2 | RH20T | LIBERO | RoboCasa |
|---|---|---|---|---|---|---|
| RGB | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| 深度 | 部分 | ✓ | - | ✓ | - | ✓ |
| 本体感受 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| 语言 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| 力/力矩 | - | - | - | ✓ | - | - |
| 音频 | - | - | - | ✓ | - | - |
从表中可以看出,除了 RH20T 之外的所有数据集都只覆盖了"视觉+本体感受+语言"三种模态。RH20T 多出的力/力矩和音频两列,正是它在数据集生态中不可替代的原因。
为什么多模态数据采集这么难
既然多模态数据这么有用,为什么只有 RH20T 一个数据集做了?答案是:传感器同步、标定和噪声三大工程难题。
同步问题:RGB 相机跑 30Hz,力传感器跑 500Hz,麦克风跑 44100Hz。三种传感器的时间戳必须精确对齐——否则你看到的画面和感受到的力可能差了几十毫秒,对需要精细力控的任务(如插入、拧螺丝)这是致命的。多传感器的时间同步需要硬件触发线(hardware trigger),不是简单的软件同步能解决的。
标定问题:力/力矩传感器安装在哪里?腕部(wrist-mounted)还是基座(base-mounted)?每种安装方式的力读数含义不同,需要精确的外力标定(把重力、惯性力从读数中扣除)。音频的麦克风位置和方向也会显著影响录到的声音特征。
噪声问题:力传感器受电机振动影响——机械臂运动时的电机嗡嗡声会叠加在力信号上,需要滤波。音频在工业环境中受背景噪声影响——空调声、气动阀门声、其他设备运转声都会污染语音和环境音信号。
这些工程难题使得多模态数据采集的成本是纯 RGB 采集的 3-5 倍。RH20T 团队花了大量精力解决同步和标定问题——这也是为什么它是 2023 年唯一的大规模多模态操作数据集,至今(2025 年)仍然没有出现同等规模的竞品。
多模态数据集的下游价值
尽管采集困难,多模态数据的下游价值是明确的:
- 力觉:Ch18 中讨论的触觉感知(如 Sparsh 触觉编码器)正在证明,接触力信息对精细操作任务(插入、装配、柔软物体处理)至关重要。RH20T 的力/力矩数据为训练力觉感知模型提供了宝贵资源
- 音频:Ch20 详细讨论了听觉智能——从判断水是否沸腾到检测机器故障,声音信号携带了视觉无法获取的信息。RH20T 的音频数据是训练听觉感知模型的少数可用资源之一
- 深度:DROID 和 RH20T 都包含深度图。深度信息在透明物体、低纹理表面、遮挡场景中提供了 RGB 无法替代的 3D 几何信息
初学者常见误解:"多模态就是多加几个传感器。"事实是:数据采集只是第一步,真正的挑战在于多模态信息的融合策略——如何在时间上对齐、在空间上配准、在语义上互补?这和 Ch18 中 ImageBind 讨论的模态对齐是同一个问题的不同层面。
未来:触觉可能成为下一个加入的模态
Ch18 中的 Sparsh 触觉编码器展示了触觉感知的潜力:它能从 GelSight 触觉传感器的高分辨率接触图像中提取通用触觉表征,并迁移到不同的触觉传感器和下游任务上。如果 Sparsh 的思路被验证成功,触觉可能成为继力觉和音频之后,下一个被大规模采集的模态。
但触觉的数据采集面临更严峻的挑战:触觉传感器(如 GelSight、DIGIT)的覆盖范围极小(通常只有指尖大小),每个手指需要单独的传感器和数据采集通道。一个三指机械手就需要三个独立的触觉传感器同步采集——硬件复杂度远超力传感器和麦克风。
21.5.4 数据集 vs 基准
"训练食材" vs "评测尺子"
这是最容易被忽略、但影响最深远的区分。
想象你要写一本烹饪教材。你需要两类东西:一是食材——各种蔬菜、肉类、调料,量越大、种类越多越好,这是你教学生做菜的原材料。二是考试标准——"宫保鸡丁必须在 8 分钟内完成、花生必须酥脆、鸡肉必须嫩滑",这是你检验学生水平的尺子。
你不能用"食材"当"尺子"——"我用了 500 种食材教学生,所以学生一定做得好"?不一定。你也不能用"尺子"当"食材"——"我让学生反复做考试那三道菜,他们就只会做那三道菜"。
数据集和基准的区分完全一样:
食材型数据集:大规模、多样性高、用于预训练。典型代表是 OXE(1.6M 轨迹,22 种机器人)、DROID(76K 轨迹,564 场景)、BridgeData V2(60K 轨迹,24 环境)。这些数据集的目标是"喂给模型足够多足够杂的数据,让模型学到通用的操作表征"。
尺子型基准:标准化、评测严格、用于横向对比。典型代表是 Meta-World(50 个任务、5 个难度层级)、RLBench(100 个任务、标准化评测协议)、LIBERO(130 个任务、4 套解耦评测 suite)、CALVIN(34 个任务、长序列评测协议)。这些数据集的目标是"给所有模型同一张考卷,谁的分数高谁更强"。
尺子型基准之所以能做"尺子",是因为它们在三个层面做了严格的标准化:
- 任务定义标准化:每个任务有明确的初始状态、目标条件、成功判定标准。Meta-World 的每个任务都指定了物体的初始位置(在半径 0.2m 的圆内随机)、目标位置、成功距离阈值(通常 0.05m)
- 评测协议标准化:评测次数(通常每个任务 25 或 50 次试验)、随机种子、评价指标(success rate、路径效率等)都有统一规定。RLBench 要求评测 25 次取平均,CALVIN 要求评测 1000 次取统计显著性
- 环境控制标准化:物理参数(重力、摩擦、阻尼)、渲染参数(光照、纹理)、传感器参数(相机位姿、噪声模型)都固定。两个不同实验室用同一个 benchmark,跑出来的分数可以直接对比
双栖型:RoboCasa 既提供大规模仿真数据(100K+ 轨迹、120 个厨房场景),又有标准化的评测基准——你可以在 RoboCasa 数据上预训练,然后在 RoboCasa benchmark 上评测。
为什么这个区分重要
混淆这两类数据集会导致两个常见错误:
错误一:用尺子当食材。如果你的预训练数据只来自 LIBERO 的 130 个任务,模型学到的只是这 130 个任务的"应试技巧",迁移到新任务上的能力很弱。这就像只让学生做考试题——考试成绩很高,但换个没见过的菜就不会做了。
错误二:用食材当尺子。如果你在 OXE 的 1.6M 轨迹上评测两个模型,你无法得出"谁更强"的结论——因为 OXE 的任务分布不均匀(某些机器人/任务的数据远多于其他),评测结果被数据分布偏差严重扭曲。这就像用"谁用的食材多"来评判厨师水平——完全没有参考价值。
错误三:用尺子训练、用尺子评测——"过拟合到评测集"。这是最隐蔽的错误。如果你在 Meta-World 的 50 个任务上训练,又在 Meta-World 的 50 个任务上评测,你当然得到了很高的分数——但这就像让学生做考试题学习、又用同一套考试题测试,分数高并不代表真正的能力。正确的做法是:训练和评测使用不同的任务集合(hold-out),或者用零样本迁移到全新的任务上评测。
踩坑提醒:很多 VLA 论文会在 OXE 数据上"评测"自己的模型,报告一个 aggregate success rate。这个数字可以作为参考,但不能作为严格的横向对比依据——因为评测集的任务分布、数据质量、甚至标注方式都不统一。严格对比应该在标准 benchmark(如 LIBERO、CALVIN)上进行。
类比总结:"食谱合集" vs "米其林评审标准"
| 特征 | 食材型数据集 | 尺子型基准 |
|---|---|---|
| 目标 | 提供训练资源 | 提供评测标准 |
| 规模 | 大(万~百万级) | 适中(百~千级) |
| 多样性 | 越多越好 | 精心设计 |
| 评测协议 | 无或不严格 | 严格统一 |
| 典型用途 | 预训练 | 横向对比 |
| 代表 | OXE, DROID, BridgeData V2 | Meta-World, RLBench, LIBERO, CALVIN |
21.5.5 综合横切对比大表
下面这张表把 14 个数据集在四个维度上同时展开。每个维度用简短标记表示,便于快速对比:
| 数据集 | 真机/仿真 | 单本体/跨本体 | 视觉/多模态 | 食材/尺子 |
|---|---|---|---|---|
| OXE | 真机 | 跨本体(22 种) | RGB+state+lang | 食材 |
| DROID | 真机 | 单本体(Franka) | RGB+depth+state+lang | 食材 |
| BridgeData V2 | 真机 | 单本体(WidowX) | RGB+state+lang | 食材 |
| RH20T | 真机 | 多本体 | RGB-D+force+audio+lang | 食材 |
| LIBERO | 仿真 | 单本体(Franka) | RGB+state+lang | 尺子 |
| CALVIN | 仿真 | 单本体(Franka) | RGB+proprio+lang | 尺子 |
| RoboCasa | 仿真 | 单本体(RoboSuite) | RGB-D+state+lang | 双栖 |
| RoboMimic | 仿真(+少真机) | 单本体 | State/image+action | 尺子 |
| RLBench | 仿真 | 单本体(Franka) | RGB+depth+seg+state+lang | 尺子 |
| BEHAVIOR-1K | 仿真 | 多本体 | RGB-D+state+BDDL | 尺子 |
| Meta-World | 仿真 | 单本体(Sawyer) | State(39d)+action(4d) | 尺子 |
| ManiSkill | 仿真 | 多本体 | State/PC/RGBD | 尺子 |
| SimplerEnv | 仿真 | 多本体(对齐真机) | RGB-D+proprio | 尺子(代理) |
| Octo | 混合 | 跨本体 | Image+lang+proprio | 食材+模型 |
从这张表可以读出几个关键模式:
- 真机数据集几乎都是食材型——采集真机数据成本太高,不可能做到严格的标准化评测
- 仿真数据集几乎都是尺子型——仿真可以精确控制条件,天然适合做评测
- 跨本体和真机高度相关——真机采集的异构数据(OXE)是跨本体的主要来源
- 多模态数据极度稀缺——只有 RH20T 包含了力觉和音频,其余都是视觉+本体感受
- 双栖型数据集极其罕见——RoboCasa 是少数兼具食材和尺子属性的数据集
这些模式不是偶然的,而是由每个维度的 trade-off 逻辑决定的:真机采集成本高 → 只能采大量数据做食材,不能严格标准化做尺子;仿真条件可控 → 天然适合做尺子,但数据有 sim-to-real gap 做食材效果打折。
如何使用这张表
这张表不仅是一个参考,更是一个决策工具。当你面临"选哪个数据集"的问题时,可以按以下流程使用:
- 先确定目标:你是要预训练模型(需要食材),还是要评测模型(需要尺子),还是要两者兼顾(需要双栖型)?
- 再确定环境:你有真机吗?如果有,可以考虑真机数据集;如果没有,只能在仿真数据集里选
- 然后确定本体:你要在一种机器人上做实验(单本体),还是跨多种机器人(跨本体)?
- 最后确定模态:你的任务需要力觉/音频吗?如果不需要,纯视觉数据集足够;如果需要,目前只有 RH20T 可选
举个例子:你想在 Franka 上训练一个桌面操作的 VLA,但没有真机。按流程走:目标=预训练 → 环境=仿真 → 本体=单本体(Franka)→ 模态=视觉。查表发现 LIBERO、CALVIN、RLBench 都符合条件。如果要评测,选 LIBERO(有解耦评估)或 CALVIN(有长序列评测);如果要训练,选 RoboCasa 的数据(虽然是 RoboSuite 不是 Franka,但桌面操作场景高度重叠,21.5.2 节讨论的正迁移应该会起作用)。
21.6 评估基础设施:从数据集到"数据集能告诉我们什么"
21.5 节从四个维度横向对比了所有数据集。但有一个问题还没有回答:数据集本身不能告诉我们"模型到底有多好"。你需要一套评估基础设施——在数据集上跑实验、算指标、得出可比较的结论。
这就像学校里有教材(数据集)还需要有考试和评分标准(评估基础设施)。光有教材不行——你不知道学生学到了什么程度。光有评分标准也不行——没有教材你无从教起。两者缺一不可。
本节介绍三种不同哲学的评估基础设施:SimplerEnv 追求"仿真分数和真机分数对齐"、LIBERO 追求"不同类型的知识被分别评估"、OXE 追求"跨本体迁移到底是正还是负"。
21.6.1 SimplerEnv——仿真评测与真机对齐
核心理念:"对齐 > 真实"
Ch17 讲了 sim-to-real gap 的三种来源(物理参数差异、传感器差异、执行延迟差异)和三种应对策略(高保真仿真、域随机化、非对称训练)。SimplerEnv 不是第四种策略——它解决的是一个不同的问题:
不追求让仿真更逼真,而是让仿真里的评测分数和真机评测分数高度相关。
类比:手机评测的跑分软件。跑分高不等于手机一定好用——但你观察到一个规律:跑分排名和实际体验排名高度相关。跑分第 1 的手机大概率体验也是第 1;跑分第 5 的大概率体验也是第 5。跑分不是"真实体验",但它是"真实体验的可靠代理"。
SimplerEnv 就是 VLA 的跑分软件。你不需要搬真机器人出来测试——在电脑里跑仿真就能给 VLA 打分,分数和真机测试几乎一样准。
目前 SimplerEnv 已经支持对 Google Robot 和 WidowX 两种真机平台的 VLA 评测代理。它基于 DM Control(DeepMind Control Suite)和 ManiSkill2 仿真器构建,提供了与真机环境在视觉和物理上对齐的仿真场景。对每个真机评测任务,SimplerEnv 提供了对应的仿真版本——包括相同的物体布局、相机视角、光照条件。
两种评测模式
SimplerEnv 提供了两种评测模式,对应两种不同的需求:
Visual Matching 模式:仿真渲染的图像尽量接近真实相机拍到的画面。具体做法是:调整仿真中相机的位置、角度、焦距,使其与真机相机参数匹配;调整光照条件,使仿真图像的亮度和色温接近真机;调整物体纹理,使其与真实物体外观一致。
这种模式的评测结果和真机评测的 Pearson 相关系数 通常在 0.85-0.95 之间——非常高的线性相关性。也就是说,Visual Matching 模式下的成功率和真机成功率几乎是一一对应的线性关系。
Variant Aggregation 模式:在 Visual Matching 的基础上加入域随机化(domain randomization)。随机变化光照强度、物体颜色、相机角度、摩擦系数等参数,然后对多次随机变体的评测结果取平均。
这种模式的评测结果和真机的 Spearman 秩相关系数 通常在 0.90-0.98 之间——排名相关性极高。Variant Aggregation 不追求绝对分数一致(仿真里的 60% 成功率不一定对应真机的 60%),但追求排名一致——仿真里 A 比 B 好,真机里 A 大概率也比 B 好。
两种模式的选择取决于你的需求:
| 需求 | 推荐模式 | 原因 |
|---|---|---|
| 预测真机的绝对成功率 | Visual Matching | Pearson 相关性高,分数可以直接映射 |
| 对比两个模型的相对优劣 | Variant Aggregation | Spearman 相关性高,排名更稳定 |
| 评测鲁棒性 | Variant Aggregation | 域随机化考验模型在各种干扰下的表现 |
| 快速筛选候选模型 | Visual Matching | 计算量更小,单次评测更快 |
Pearson vs Spearman:两种相关性指标
这里需要区分两种相关性指标,因为 SimplerEnv 同时报告了两者:
Pearson 相关系数衡量的是两组数据的线性相关性。如果仿真分数是 X,真机分数是 Y,Pearson r 接近 1 意味着 Y ≈ aX + b(一条直线)。这是最直觉的相关性——仿真 60% 对应真机 60%,仿真 80% 对应真机 80%。
Spearman 秩相关系数衡量的是两组数据的排名相关性。它不关心绝对数值,只关心排名——仿真里第一名是不是真机里也是第一名?Spearman ρ 接近 1 意味着排名几乎一致,即使绝对分数有偏移。
举个例子:五个模型在仿真里的成功率是 [90%, 75%, 60%, 45%, 30%],真机里是 [85%, 70%, 50%, 40%, 25%]。Pearson r 可能只有 0.99(因为线性关系很好),Spearman ρ 是 1.0(排名完全一致)。但如果仿真分数是 [90%, 75%, 60%, 45%, 30%],真机分数是 [30%, 45%, 60%, 75%, 90%](完全反序),Pearson r 会接近 -1,Spearman ρ 也是 -1。
对 VLA 评测来说,Spearman 比 Pearson 更实用——因为我们更关心"哪个模型更好"(排名),而不是"仿真 60% 到底对应真机 60% 还是 55%"(绝对值)。
物理参数回调的工程细节
SimplerEnv 的"对齐"不是自动的——它需要人工调整仿真器的物理参数,使得仿真评测分数和真机评测分数对齐。这个过程被团队形容为"像调钢琴一样调摩擦系数"。
具体来说,需要回调的参数包括:
- 摩擦系数:仿真器默认 0.7-1.0,真实桌面可能是 0.3-0.8。调整到使得仿真中的抓取成功率和真机一致
- 阻尼系数:关节阻尼影响动作的平滑程度。过高则仿真中动作"发黏",过低则"发飘"
- 接触阈值:判断"物体是否被抓住"的力阈值。仿真中接触力的计算方式和真机力传感器不同,需要校准
- 渲染参数:光照方向、环境光强度、阴影模式——这些影响 VLA 的视觉输入质量
每个参数的调整都需要一个"回调循环":在仿真里跑评测 → 和真机分数对比 → 调参数 → 再跑 → 再对比 → 直到相关性满足要求。SimplerEnv 论文报告了这个过程大约需要 2-3 天的手动调参,之后同一个环境就不需要再调了。
对 VLA 评测的变革意义
在 SimplerEnv 出现之前,评测一个 VLA 模型的流程是这样的:
- 把模型部署到真机器人上(需要物理访问权限)
- 在 10-20 个任务上各跑 25 次试验(每个任务约 30 分钟)
- 手动记录每次试验的成功/失败
- 总共需要 2-3 天的实验室时间 + 一台价值 5 万美元的机器人
SimplerEnv 把这个流程变成了:
- 在电脑上运行
python -m simpler_env.evaluate --policy-path xxx - 30 分钟内得到所有任务的评测结果
- 不需要物理访问任何机器人
SimplerEnv 的 TL;DR:不用搬真机器人,在电脑里就能给 VLA 打分,分数和真机几乎一样准。
这个变革的影响是深远的:以前只有有大机器人的实验室才能做 VLA 评测,现在任何有 GPU 的人都能做。评测民主化意味着更多的研究者可以参与 VLA 的迭代优化,加速整个领域的进步。
SimplerEnv 的局限
公平起见,也要指出 SimplerEnv 的三个局限:
- 覆盖范围有限:目前只支持 Google Robot 和 WidowX 两种机器人。Franka、UR5 等主流研究平台尚未被覆盖。扩展到新机器人需要重新进行物理参数回调——每个新平台又要花 2-3 天调参
- 只评测"成功/失败",不评测"做得好不好":SimplerEnv 的评测指标是二元成功(success rate),不衡量轨迹质量(如路径是否平滑、动作是否高效)。两个模型都 80% 成功率,一个动作丝滑一个动作抖动——SimplerEnv 区分不出来
- 对视觉依赖强的任务更有效:SimplerEnv 的对齐主要在视觉和物理参数层面。对于需要精细力控的任务(如插孔、拧螺丝),仿真的力反馈和真机差异更大,SimplerEnv 的代理准确性会下降
尽管有这些局限,SimplerEnv 仍然是当前 VLA 评测领域最重要的基础设施之一——它第一次让"没有真机的研究者也能做有意义的 VLA 评测"成为现实。
21.6.2 LIBERO 的知识类型解耦评估
四套 suite 分别测什么
SimplerEnv 解决的是"在仿真里评测是否可靠"的问题。LIBERO 解决的是另一个问题:不同类型的知识是否以不同速率被学习和遗忘?
LIBERO 设计了四套评测 suite,每套隔离一种类型的知识变化:
| Suite | 测什么 | 典型任务 | 核心认知能力 |
|---|---|---|---|
| LIBERO-Spatial | "放在哪里" | 同一物体,不同目标位置 | 空间推理 |
| LIBERO-Object | "用什么" | 同一任务,不同物体 | 物体泛化 |
| LIBERO-Goal | "做什么" | 同一场景,不同目标 | 任务泛化 |
| LIBERO-100 | "连续做多步" | 长序列,10 步组合 | 长时规划 |
这四套 suite 的设计哲学是"解耦"——就像考试不光看总分,还要看阅读理解扣了几分、数学扣了几分、物理扣了几分。总分一样 80 分,A 是"数学 100 阅读 60",B 是"数学 60 阅读 100"——两人的能力结构完全不同,需要不同的后续学习策略。
为什么"解耦"很重要
不同的知识类型有不同的学习曲线和遗忘曲线。LIBERO 的实验揭示了一个反直觉的发现:
- 空间知识(放在哪里)学习最快、遗忘也最快——因为空间推理更多依赖感知,较少依赖长期记忆
- 目标知识(做什么)学习最慢、但一旦被新的目标覆盖就最容易被遗忘——因为任务语义需要更深层的理解
- 物体知识(用什么)介于两者之间——新物体的泛化能力取决于训练集中物体分布的多样性
- 长时规划(连续多步)是最难的——因为它需要前三种知识的组合,任何一环出错都会导致整个序列失败
如果你只看一个总分(如"LIBERO 平均成功率 60%"),你完全不知道这 60% 是怎么来的——是空间推理拉了后腿?还是长时规划拖了后腿?解耦评估告诉你答案,让你可以针对性地改进模型。
举一个具体的例子来说明解耦的价值:假设两个 VLA 模型在 LIBERO-100 上的平均成功率都是 60%。但解耦评估揭示了截然不同的能力结构:
| 模型 | Spatial | Object | Goal | Long-horizon | 平均 |
|---|---|---|---|---|---|
| VLA-A | 90% | 80% | 40% | 30% | 60% |
| VLA-B | 50% | 50% | 70% | 70% | 60% |
两个模型平均分一样,但能力结构完全不同。VLA-A 擅长空间推理和物体泛化,但目标理解和长时规划薄弱——它"看得懂但想不明白"。VLA-B 恰好相反——它"想得明白但看不准"。改进策略也完全不同:VLA-A 需要更强的语言理解能力(提升 Goal score),VLA-B 需要更好的视觉编码器(提升 Spatial score)。如果只看平均分,你可能给两个模型开出同样的"药方"——这显然是错的。
FWT 和 BWT 指标
LIBERO 评测的另一个创新是引入了终身学习(lifelong learning)的两个核心指标:
FWT(Forward Transfer,前向迁移):学习任务 B 之后,在任务 A 上的表现有没有提升?如果提升了,说明 B 的知识正向迁移到了 A。FWT > 0 表示正迁移,FWT < 0 表示负迁移。
BWT(Backward Transfer,后向迁移):学习任务 B 之后,在任务 A 上的表现有没有下降?如果下降了,说明学 B 的过程中"遗忘"了 A 的知识。BWT < 0 就是灾难性遗忘(catastrophic forgetting)——终身学习最核心的敌人。
理想情况:FWT > 0 且 BWT ≥ 0——新任务不仅没有让旧任务变差,反而帮助了旧任务。这就是为什么跨本体数据在 OXE 实验中有时能提升单本体性能——不同任务/本体之间的共享知识形成了正迁移。
最差情况:FWT < 0 且 BWT < 0——新任务既没有帮助旧任务,还让旧任务变差了。这就是灾难性遗忘 + 负迁移的双重打击。
用一个具体数字来说明:假设模型按顺序学习了 LIBERO-100 中的 10 个任务。学完第 10 个任务后,第 1 个任务的成功率从 90% 降到了 40%(BWT = -50%),但第 5 个任务的成功率从 60% 升到了 75%(FWT = +15%)。如果你只看第 10 个任务的成功率 85%,你会觉得"模型很强";但 BWT 暴露了严重遗忘,FWT 暴露了不均匀迁移——这些信息在单一的 success rate 中完全丢失。
实际使用中的偏差
尽管 LIBERO 设计了精细的解耦评估和 FWT/BWT 指标,但实际使用中存在一个普遍的偏差:
大多数 VLA 论文只报告 LIBERO 的 success rate,忽略 FWT/BWT 指标。
这就像一个学生只报总分,不报各科分数——你不知道他的能力结构。为什么会出现这个偏差?原因有三:
- 报告惯例:早期 VLA 论文(RT-1、RT-2)只报 success rate,后续论文跟随了这个惯例
- 计算成本:FWT/BWT 需要在学习每个新任务前后都评测所有旧任务,计算量是只报最终 success rate 的 N 倍(N = 任务数)
- 结果不够"好看":FWT/BWT 往往暴露了模型的弱点(如 BWT < 0 表示有遗忘),研究者自然倾向于不报告
但这个偏差的代价是严重的:如果所有人都只看 success rate,整个领域就会朝着"刷分"的方向发展——在特定任务上反复优化以获得更高的成功率,而忽略了终身学习能力的培养。LIBERO 的设计初衷恰恰是为了防止这种"应试"倾向。
踩坑提醒:如果你在论文中使用了 LIBERO,请务必报告四套 suite 的分别成绩和 FWT/BWT 指标。只报一个 aggregate success rate 是对 LIBERO 设计思想的浪费。
21.6.3 OXE 的正迁移 vs 负迁移实验
RT-1-X / RT-2-X 的关键实验
21.5.2 节提到了 OXE 的跨本体迁移 trade-off,但没有展开实验细节。这里我们深入分析 RT-1-X 和 RT-2-X 的迁移实验——它们是目前为止最大规模的跨本体迁移实证。
RT-1-X 实验:Google 团队在 OXE 的 22 种机器人数据上训练了 RT-1-X,然后在 5 种目标机器人上评测。关键发现:
- 在 5 种目标机器人中的 4 种上,RT-1-X 的成功率高于只用目标机器人数据训练的 RT-1。正迁移!
- 在第 5 种目标机器人上,RT-1-X 的成功率低于只用目标机器人数据训练的 RT-1。负迁移!
- 平均来看,跨本体预训练带来了约 50% 的相对提升
RT-2-X 实验:更强大的 RT-2-X 在跨本体数据上展现了涌现能力(emergent capabilities)——它能执行从未在训练数据中出现过的指令,如"把 Taylor Swift 的图片拿起来"。这种语义理解能力来自 RT-2 的 VLM 预训练,而 OXE 的跨本体数据让这种语义理解能力得以在多种机器人上落地。
哪些跨形态迁移有用,哪些反而伤害性能
RT-1-X 的实验提供了具体的正迁移和负迁移案例:
正迁移案例:
- WidowX 的桌面操作数据帮助了 Franka 的桌面操作——因为两种机器人面对的场景(桌面上的小物体操作)高度重叠
- 不同视角的同一任务数据帮助了新视角下的同一任务——因为视觉表征可以共享
负迁移案例:
- 双臂机器人数据混入单臂机器人训练,成功率下降——7 维动作空间和 14 维动作空间的维度差异导致模型混淆
- 移动机器人(如 Kuka iisy 的全向移动 + 操作)数据混入固定底座机械臂训练,成功率下降——移动带来的视角变化和固定底座的固定视角是本质不同的视觉模式
把这些案例整理成一张正/负迁移速查表:
| 源本体 | 目标本体 | 迁移方向 | 效果 | 可能原因 |
|---|---|---|---|---|
| WidowX(桌面操作) | Franka(桌面操作) | 正 | 提升 ~30% | 场景高度重叠,视觉知识共享 |
| 不同视角同一任务 | 新视角 | 正 | 提升 ~20% | 视角不变的视觉表征 |
| 双臂机器人 | 单臂机器人 | 负 | 下降 ~10% | 动作空间维度不匹配(14d vs 7d) |
| 移动机器人 | 固定底座机械臂 | 负 | 下降 ~15% | 视觉模式本质不同 |
| Franka(操作) | Franka(操作) | 基线 | — | 同本体,无迁移问题 |
形态差异 vs 任务差异——哪个影响更大
OXE 的实验揭示了一个重要发现:任务差异对迁移的影响远大于形态差异。
用一个 2x2 矩阵来可视化这个发现:
| 同一任务 | 不同任务 | |
|---|---|---|
| 同一形态 | 基线(无迁移问题) | 中等迁移(运动模式共享,视觉模式不同) |
| 不同形态 | 正迁移(视觉+语义知识共享) | 最差迁移(双重差异叠加) |
注意到一个反直觉的结论:"同一任务、不同形态"比"不同任务、同一形态"迁移效果更好。为什么?因为"同一任务"意味着视觉场景高度重叠(同样的物体、布局、光照),模型学到的视觉特征可以直接复用——而视觉特征是 VLA 的核心能力。Ch11 中 RT-1 的 FiLM-EfficientNet 视觉编码器就证明了:视觉表征的质量直接决定了动作预测的精度。
具体来说:
- 同一任务、不同形态:如"抓杯子"在 WidowX 和 Franka 上的数据,正迁移效果显著。虽然动作执行方式不同(关节角度不同),但"识别杯子"、"规划接近路径"等视觉和语义知识完全共享
- 不同任务、同一形态:如"抓杯子"和"开门"在 Franka 上的数据,迁移效果中等。视觉和运动模式差异较大,但本体感受的分布是共享的
- 不同任务、不同形态:如"抓杯子"在 WidowX 上和"开门"在双臂机器人上,迁移效果最差。两种差异叠加,模型几乎无法找到共享结构
这个发现对"大一统模型"的启示是:跨本体迁移的成功与否,主要取决于任务层面的语义重叠,而非形态层面的硬件相似度。如果两个机器人的操作场景高度重叠(如都在桌面上操作小物体),即使硬件完全不同,跨本体迁移也大概率是正的。
对"大一统模型"的启示
"不是所有数据混在一起就更好。"
这是 OXE 实验最核心的 takeaway。大一统模型(如 RT-X 系列)的愿景是一个模型控制所有机器人——但实验表明,盲目混合所有数据不如精心选择与目标任务相关的数据。
这和 Ch11 中讨论的 RT-2 的 co-fine-tuning 策略异曲同工:RT-2 在微调时同时保留 VLM 的网络知识问答能力和机器人控制能力,而不是"只学机器人控制"——后者会导致网络知识被遗忘。同样,跨本体预训练需要保留与目标任务相关的知识、过滤掉可能造成干扰的知识,而不是一股脑全混进去。
Ch12 中 OpenVLA 的训练策略也体现了这个思想:它虽然用了 OXE 的 970K 轨迹,但不是所有数据都被等权重对待——经过筛选和加权,确保预训练数据分布与下游评测任务的分布有足够的重叠。
21.7 通向下一章
本章总结
Ch21 回答了一个看似简单、实则深刻的问题:训练具身 AI,到底喂什么数据?
我们从 12 个数据集的纵向精读开始,理解了每个数据集的设计动机、核心特征、优势与局限。然后用四个横切维度(真机 vs 仿真、单本体 vs 跨本体、视觉 vs 多模态、数据集 vs 基准)把所有数据集拉到同一张表上比较,揭示了每个维度背后的 trade-off。最后深入三种评估基础设施(SimplerEnv 的仿真-真机对齐、LIBERO 的知识解耦评估、OXE 的正/负迁移实验),理解了"数据集能告诉我们什么"和"数据集不能告诉我们什么"。
回顾本章的三个核心部分:
**Part 1(21.1-21.4)**的纵向精读让我们理解了每个数据集的"个性"——OXE 是跨本体的野心家,DROID 是分布式采集的实践者,BridgeData V2 是 VLA 预训练的基石,RH20T 是多模态的先驱,LIBERO 是终身学习的考官,CALVIN 是长时规划的试金石,RoboCasa 是厨房场景的百科全书,其余经典数据集各司其职。
**Part 2(21.5)**的横切对比让我们看到了数据集设计空间的"地形图"——真机 vs 仿真是真实度与规模的 trade-off,单本体 vs 跨本体是一致性与多样性的 trade-off,视觉 vs 多模态是简便性与信息量的 trade-off,食材 vs 尺子是训练资源与评测标准的区分。理解了这些 trade-off,你就能根据具体需求选择合适的数据集,而不是盲目追求"最大""最新"。
**Part 2(21.6)**的评估基础设施让我们意识到"评测"和"训练"同等重要——SimplerEnv 打通了仿真评测与真机对齐,让没有真机的研究者也能做有意义的评测;LIBERO 的解耦评估让我们不只看总分还看能力结构;OXE 的迁移实验告诉我们"不是所有数据混在一起就更好"。
关键 Takeaway
数据集的规模决定了模型的上限,数据集的质量决定了模型达到上限的速度。
真机数据没有 sim-to-real gap,但规模受限于采集成本;仿真数据规模无限,但需要迁移策略才能部署到真机。混合策略(仿真预训练 + 真机微调)是当前最实用的路线。
跨本体迁移的成功与否,主要取决于任务层面的语义重叠,而非形态层面的硬件相似度。不是所有数据混在一起就更好。
数据集和基准是两种不同的东西:食材型数据集用于预训练,尺子型基准用于评测。用错了会误导研究方向。
评估基础设施与数据集同等重要。SimplerEnv 让 VLA 评测民主化,LIBERO 让知识评估精细化,OXE 让迁移实验可复现。
数据集趋势预判
基于 Ch21 的分析,我们预判未来数据集的四个发展方向:
1. 规模继续增长
OXE 1.6M 轨迹听起来很多,但和 NLP 领域的万亿 token 相比差了六个数量级。DROID 的 76K 轨迹只覆盖了 564 个场景——真实世界的场景多样性远不止于此。下一代数据集(如正在筹备中的 OXE 2.0 和 DROID 2.0)的目标是把规模再推一个数量级:OXE 2.0 可能达到 10M+ 轨迹,DROID 2.0 可能扩展到 5000+ 场景。规模增长的关键瓶颈不是计算,而是采集效率——如何让更多机构用更少的成本贡献更多数据。
2. 多模态扩展
RH20T 证明了力觉和音频对接触密集型任务的价值。下一代数据集中,力/力矩传感器可能成为标配(就像深度相机已经成为标配一样),音频采集可能从"少数数据集的特色"变成"大多数数据集的默认选项"。更远的未来,Ch18 中讨论的触觉感知(如 Sparsh 编码器)可能成为下一个被大规模采集的模态。
3. 自动化采集
RoboCasa 用 MimicGen 从少量人工演示自动生成了 100K+ 条轨迹,展示了"自动化采集"的可行性。下一代数据集可能不再完全依赖人工遥操作——RL 策略、脚本化策略、甚至 VLA 自身生成的轨迹都可能成为数据来源。但质量控制(如何确保自动生成的轨迹是正确的、多样化的)将成为新的核心挑战。
自动化采集有三种主要路线:
- 脚本化策略生成:MimicGen 的方式——人工提供少量关键帧演示(通常 5-20 条),然后算法自动在新的物体位置和场景布局上插值生成新轨迹。优点是可控性强,缺点是生成的轨迹多样性受限于关键帧的空间分布
- RL 策略生成:在仿真中用 RL 训练一个策略,让它自动采集轨迹。Ch16 中讨论的 PPO/SAC 训练的策略可以作为数据生成器。优点是策略可以探索到人工演示没有覆盖的状态空间,缺点是 RL 策略在早期训练阶段(成功率低时)会生成大量失败轨迹
- VLA 自身生成:让已有的 VLA 模型(如 Octo、OpenVLA)在仿真或真机上执行任务,采集其生成的轨迹作为新模型的训练数据。这和 Ch14 中讨论的行为克隆(BC)的"自我蒸馏"思路类似——上一代模型的输出成为下一代模型的输入。风险是"错误累积"——如果 VLA 的成功率只有 70%,那么 30% 的训练数据是错误的
4. 评估基础设施与数据集同等重要
SimplerEnv 证明了一件事:评测和训练一样重要。如果一个领域只有好的训练数据但没有好的评测方法,研究者就无法判断哪种方法更好,整个领域的进步就会停滞。未来会看到更多像 SimplerEnv 这样专注于"评测对齐"的工作,也会看到 LIBERO 式的解耦评估被推广到更多场景。
预告 Ch22:实战指南
数据集回答了"喂什么",评测回答了"怎么量"。但一个完整的项目还需要回答:"怎么做"——从选数据集到训模型到测性能到部署真机,每一步的具体操作是什么?
Ch22 将是一份实战指南(Task 1 & Task 2),把前 21 章学到的知识落地。具体来说:
- Task 1:基于仿真数据的 VLA 训练与评测——选数据集(OXE vs BridgeData V2)、配环境(RLDS 数据管线 + 训练超参)、训模型(从 RT-1 架构开始)、评测(LIBERO / CALVIN benchmark)、分析(正/负迁移、四类知识解耦)
- Task 2:从仿真到真机的端到端部署——混合数据预训练 + 目标环境微调、SimplerEnv 代理评测、域随机化策略选择、真机评测协议
两个 Task 递进:Task 1 在纯仿真环境中完成,任何人有 GPU 就能做;Task 2 需要真机访问权限,但 SimplerEnv 可以让没有真机的人完成大部分评测工作。
如果你已经跟到了这里,Ch22 就是你把所有理论变成实践的地方。
上一章:Ch20: 听觉智能 | 下一章:Ch22: 实战指南 返回目录
本章涉及论文 18 篇
点击查看论文笔记全文,标有 ● 的为已读。