Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Guide · Part 6: 横切主题与实战

Ch21: 数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO


Ch21: 数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO

返回目录 上一章:Ch20: 听觉智能 | 下一章:Ch22: 实战指南


21.1 引子:机器人数据为什么这么难搞

21.1.1 感知完毕,数据在哪?

Ch20 结尾时,我们已经有了一台"五感俱全"的机器人——它有眼睛(Ch8-9 的视觉)、有耳朵(Ch20 的听觉)、甚至能感知墙后的事物(Ch19 的射频感知)。感知问题在技术上已经取得了巨大进步。

但感知只是输入端。要让机器人真的干活,你还需要另一件东西:训练数据

Ch11Ch12 中我们学到,RT-1 用了 13 万条真机演示数据训练,RT-2 在此基础上加上了大规模互联网图文数据。Ch13 的 Diffusion Policy 用了几百条演示就能学会一个新任务。Ch14 则系统解释了模仿学习为什么需要"好数据"而非"多数据"。

但一个关键问题被我们有意回避了:这些数据从哪来?

答案很不愉快——每一条机器人操作数据,都需要一台真机器人在真实环境里,由人(或人控制的遥操作系统)完成一次完整的任务演示。这不是爬网页就能搞定的事。

21.1.2 机器人数据 vs 网络文本:三重鸿沟

LLM 的训练数据从哪来?互联网。几万亿 token 的文本,爬虫自动抓取,成本几乎为零。GPT-4 的训练数据量大约 13 万亿 token——这个数字的背后是整个互联网几十年的内容积累。

机器人操作数据的获取,和互联网文本完全不同。有三重鸿沟:

鸿沟一:采集成本

一条网络文本的采集成本接近零——写个爬虫跑一圈就有了。一条机器人操作数据的采集成本是什么?一个人坐在机器人前面,戴上 VR 手套或握着遥操作杆,花 1-5 分钟完成一次操作演示。每条数据的"标价"是 1-5 分钟的人类劳动。

换算一下:RT-1 的 13 万条数据,假设平均每条 2 分钟,那就是 260,000 分钟 = 4,333 小时 = 180 天不间断操作。这还是理想情况——实际采集中有设备故障、标定偏移、数据损坏等各种问题,有效利用率可能只有 60-70%。

鸿沟二:物理绑定

网络文本是"无身体"的——一篇关于做菜的博客文章,任何人任何设备都能读到,和"谁写的""在哪写的"没有关系。但机器人数据是"有身体"的——一条 WidowX 机械臂的抓取数据,不能直接给 Franka 机械臂用,因为关节结构、工作空间、力矩范围完全不同。

这意味着你很难"借"别人的数据来训练自己的机器人。每换一种硬件,就可能需要重新采集数据。

鸿沟三:规模差距

互联网文本:~13 万亿 token(GPT-4 级别)。机器人操作数据:截至 2023 年底,全球最大的公开数据集 Open X-Embodiment 也只有 160 万条轨迹。差了四个数量级以上。

用一个类比总结这三重鸿沟:

LLM 有互联网——几万亿 token 免费爬取,相当于拥有一个全球图书馆的免费通行证。机器人只有"自家厨房"——每一条数据都要真机器人在真环境里真做一遍,相当于你得亲自下厨录菜谱,而且换了个厨房(换机器人硬件)之前的菜谱格式还对不上。

21.1.3 数据瓶颈如何制约了整个领域

数据瓶颈不是一个孤立的问题——它像一根绳子,拴住了整个具身 AI 领域的发展。

在 2023 年之前,几乎每个 VLA 模型都只能在自家数据上训练。RT-1/RT-2 只有 Google 的 Everyday Robots 数据;BC-Z 只有 Google 的另一批数据;各大学实验室各有各的小数据集。这导致了一个恶性循环:

  1. 数据少 → 模型泛化差
  2. 泛化差 → 只能在窄场景用
  3. 窄场景用 → 没动力投入更多数据采集
  4. 没投入 → 数据继续少

打破这个循环需要两件事同时发生:一是有人提供足够大的共享数据集,降低"入场费";二是有人证明"用大数据集训练的模型确实更好",提供动力。

2023 年,这两件事同时发生了。BridgeData V2、Open X-Embodiment 先后发布,RT-2-X 证明了跨机器人数据混训的正迁移效应。从那以后,具身 AI 的数据生态发生了质变——从"各实验室各搞各的"变成了"社区共建共享"。

这一转变,正是本章要讲的核心故事。

21.1.4 本章路线图

本章按"真机 → 仿真"的顺序组织,每一节聚焦一个关键数据集/基准:

21.2 先从历史视角划分三个时代,让你看到数据集生态的演进脉络。

21.3 深入四个真机操作数据集——BridgeData V2(低成本预训练底座)、Open X-Embodiment(跨形态聚合的 ImageNet)、DROID(统一硬件的极端场景多样性)、RH20T(接触富集任务的多模态数据)。这四个数据集代表了真机数据采集的四种路线。

21.4 转向仿真操作基准——Meta-World、RLBench、RoboMimic、CALVIN、LIBERO、RoboCasa、BEHAVIOR-1K、ManiSkill。它们不是用来"训练"机器人的,而是用来"考试"的——公平比较不同算法的性能。

Part 2 将继续讨论数据增强与合成技术、数据质量评估框架、以及数据集建设的未来方向。


21.2 数据集的三个时代

21.2.1 划分依据

理解机器人数据集的演进,最清晰的视角不是按时间线罗列,而是按数据生产的组织方式划分。组织方式变了,意味着谁在造数据、造什么样的数据、数据怎么流通——这些都发生了根本变化。

我们划分三个时代:

时代 时间 组织方式 规模 代表
单实验室小规模 2018-2020 各自为战 < 10K 轨迹 RoboTurk, robosuite, RoboMimic
社区聚合 + 标准化 2021-2023 统一格式,汇总百家 60K-1.6M BridgeData V2, Open X-Embodiment, RH20T
分布式采集 + 跨形态训练 2024+ 统一硬件,协同生产 76K-1M+ DROID, Octo, π0

注意每个时代的代表性规模不是单调递增的——DROID 的 76K 比 OXE 的 1.6M 少,但它的数据质量和场景多样性远超 OXE。规模不是唯一维度,数据的"质量密度"同样重要。

21.2.2 第一时代(2018-2020):单实验室小规模

背景:2018 年前后,模仿学习(IL)和 RL 在机器人操作上的研究刚刚起步。每个实验室有一台或几台机器人,在自己的实验台上采集数据、训练策略、发论文。

RoboTurk(Stanford,2018)

RoboTurk 是最早的"大规模"机器人遥操作数据采集项目之一。它的核心思路是众包:通过手机 APP 让远程操作者控制机器人完成任务。听起来很前沿,但实际采集的规模很小——9 个任务,每个任务大约 2,000 条轨迹,总计不到 20K 条。

RoboTurk 的真正贡献不是数据量,而是证明了一件事:遥操作数据的质量可以足够好,以至于简单的行为克隆就能学会复杂操作。在那之前,很多人认为 IL 需要专家级的演示才能工作,RoboTurk 用"业余玩家"的数据也跑出了不错的结果。

robosuite / RoboMimic(MIT / NVIDIA,2019-2021)

robosuite 是一个标准化的仿真操作框架,RoboMimic 是建立在其上的"控制变量实验台"。它们不是大规模真机数据集,而是提供了系统评估 IL 方法的小规模仿真基准。RoboMimic 的核心价值在于:用完全相同的任务、完全相同的环境,只变化数据质量(专家 vs 中等 vs 多人混合),然后看算法表现怎么变。这种"控制变量"的实验设计对理解数据质量的影响至关重要,我们会在 21.4 节深入讨论。

第一时代的特点

  1. 各自为战:每个实验室用自己的机器人、自己的环境、自己的数据格式。A 实验室的数据 B 实验室几乎无法直接使用
  2. 格式不统一:有的存 RGB 图像,有的只存关节角;有的有语言标注,有的没有;有的用 HDF5,有的用 TFRecord,有的用 pickle
  3. 规模极小:大多数数据集 < 10K 轨迹,只能训练单任务模型,泛化能力极差

类比:各家厨房自己录菜谱——张家的菜谱用"大火"而不写温度,李家的菜谱只写"加盐"而不写几克,王家的菜谱格式是手写纸条不是电子文档。你想照着做可以,但想把这些菜谱汇总成一本通用烹饪教材就很难了。

21.2.3 第二时代(2021-2023):社区聚合 + 标准化

背景:2021 年开始,社区意识到"各自为战"的问题。两个方向的努力同时展开:

一是横向聚合——把不同实验室的数据"格式统一后收在一起",代表是 Open X-Embodiment(2023)。22 家实验室把各自的数据集用统一的 RLDS 格式重新组织,拼成了一个 1.6M 轨迹的"大集合"。

二是纵向深耕——用一个标准化的硬件和采集流程,大规模采集高质量数据,代表是 BridgeData V2(2023)。单个实验室、单个机械臂,但场景和任务的覆盖面极广。

BridgeData V2 的意义

BridgeData V2 证明了"一个实验室也能造出对社区有用的数据集"。关键在于它的三个设计决策:横向广 > 纵向深(24 个不同场景而非 1 个场景的 24 倍数据);真机 > 仿真(所有数据都是真实环境采集);全语言标注(每条轨迹都有自然语言描述)。

这三个决策让它成为了 2023-2024 年开源 VLA 的"标准预训练底座"——RT-2、OpenVLA、Octo、Diffusion Policy 都用它做预训练或评测。就像 ImageNet 之于计算机视觉:它不是最大的,但它是最"好用"的。

Open X-Embodiment 的意义

OXE 证明了"跨形态数据混训确实有正迁移"。RT-2-X 的实验表明:用 22 种机器人的数据混合训练,比只用单种机器人的数据训练,在下游任务上的表现更好。这个发现非常重要——它意味着机器人数据不需要"同一台机器"才能复用,只要格式统一,异构数据也有价值。

RH20T 的补充

RH20T(2023)走了另一条路:不在场景广度上做文章,而在模态深度上深耕——除了常见的 RGB 图像和关节状态,还同步记录力/力矩传感器和音频数据。这为需要"触感"的任务(如拧瓶盖、插销钉)提供了宝贵的数据。

第二时代的特点

  1. 格式标准化:RLDS(Reinforcement Learning Datasets)格式成为事实标准,定义了统一的 schema(观测、动作、奖励、语言标注等字段)
  2. 社区共享:数据集公开发布在 HuggingFace / TensorFlow Datasets 上,任何人可以下载使用
  3. 规模跃升:从 10K 级别跳到 100K-1M 级别
  4. 跨形态验证:首次证明多机器人数据混训有正迁移

类比:有人开始"收百家菜谱,统一目录格式"——每家还是做自己的菜,但菜名、食材列表、做法步骤的记录方式统一了。这样你就能在一本大册子里同时翻到张家的红烧肉和李家的红烧肉,比较异同。

21.2.4 第三时代(2024+):分布式采集 + 跨形态训练

背景:第二时代的 OXE 虽然聚合了大量数据,但有一个根本问题——数据是"事后汇总"的。22 家实验室用各自的硬件、各自的环境、各自的标准采集数据,然后事后再统一格式。这导致数据质量参差不齐,很多数据集缺乏语言标注,动作空间差异巨大。

第三时代的核心思路是:既然格式统一不够,那就硬件也统一。全球多家实验室用同一种机器人、同一种传感器、同一种遥操作方案采集数据,从源头上保证数据的一致性。

DROID(2024)

DROID(Distributed Robot Interaction Dataset)是这个思路的代表。18 家机构分布在 13 个国家,全部使用 Franka Panda 机械臂 + ZED 双目相机 + Oculus 遥操作控制器。硬件统一了,但场景完全自由——每家在自己真实的实验室、办公室、家庭环境中采集。

结果是一个"场景极其多样但数据质量高度一致"的数据集:76K 轨迹、564 个场景、86 种任务。虽然轨迹数比 OXE 少,但 DROID 预训练的模型在下游任务上的表现比 OXE 预训练的更好——证明了数据质量 > 数据数量

Octo / π0 的预训练范式

Octo(2024)和 π0(Physical Intelligence,2024)代表了第三时代的另一个趋势:通用机器人基础模型。它们不是为某个特定任务训练的,而是在大规模多样化数据上预训练一个"通才模型",然后在特定任务上微调。

Octo 在 OXE 数据上预训练,用扩散头部(diffusion head)输出动作。π0 在更大规模的私有数据上预训练,用流匹配(flow matching)输出动作。两者都证明了"预训练 + 微调"的范式在机器人领域也能工作——就像 NLP 领域的 BERT/GPT 一样。

第三时代的特点

  1. 统一硬件:从"统一格式"到"统一硬件",从源头保证数据一致性
  2. 协同生产:多家机构按统一协议同时采集,不是事后汇总
  3. 数据质量优先:宁可数据量少一些,也要保证每条数据的质量和一致性
  4. 基础模型范式:预训练通才模型 + 任务微调成为主流

类比:从"谁有数据"到"一起造数据"——以前是你家有菜谱给我一份,格式不同我帮你转;现在是我们一起定好标准、统一设备、同步开工,从第一天产出的数据就能直接拼在一起用。

21.2.5 三个时代的核心矛盾演变

每个时代都在解决一个核心矛盾:

时代 核心矛盾 解决方案 遗留问题
第一时代 数据太少 各自采集 格式不统一,无法复用
第二时代 格式不统一 标准化聚合 数据质量参差不齐
第三时代 质量不齐 统一硬件协同生产 规模受限于硬件成本

第三时代的遗留问题很现实:Franka Panda 一台 ~30 万人民币,不是每个实验室都买得起。统一硬件的代价是参与门槛高,能贡献数据的机构数量有限。如何降低参与门槛同时保持数据质量,是当前社区正在探索的方向(如低成本的 WidowX 方案、手机遥操作方案等)。


21.3 真机操作数据集

21.3.1 BridgeData V2——低成本单本体的 VLA 预训练底座

超简版:BridgeData V2 是一份公开的"机器人干活录像库"——6 万段机械臂在 24 个真实场景里的演示视频,大家训机器人时把它当共同起跑线。

基本参数

维度 数值
轨迹数 ~60K
场景数 24
机器人 WidowX 250(6-DoF)
观测 第三人称 RGB 图像 + 本体感受
动作 7-DoF(6D 末端位姿增量 + 夹爪)
语言标注 每条轨迹均有(这是关键)
采集时间 2021-2023

三个关键设计决策

BridgeData V2 不是"随便录了一堆数据"——它的每一个设计决策都经过深思熟虑,而且这些决策的优先级排序直接塑造了它在社区中的地位。

决策一:横向广 > 纵向深

24 个不同风格的场景,每个场景只有几千条轨迹,而不是 1 个场景录 6 万条。为什么?

想象两个旅行博主:博主 A 在同一家咖啡馆拍了 6 万张照片,博主 B 在 24 家不同风格的咖啡馆各拍了 2500 张。谁的视频更能让你"了解咖啡馆"?显然是 B——A 的照片虽然多,但信息高度冗余,你从第 1000 张开始就看不到新东西了。

机器人数据也是一样。在同一个桌面上反复抓同一个物体,后面的轨迹带来的新信息越来越少。而换一个场景——不同桌面、不同物体、不同光照——每一条新轨迹都有信息增量。VLA 模型需要的是多样性而非重复量

这个决策的实验验证也很直接:用 24 个场景的数据预训练,在全新场景上的微调性能,显著优于用 1 个场景的等量数据预训练。

决策二:真机 > 仿真

所有数据都在真实环境中采集,不使用仿真器。为什么不用仿真?仿真可以无限生成数据,成本几乎为零。

核心原因在 Ch17 中已经详细讨论过:sim-to-real gap。仿真数据再逼真,和真实数据之间仍有可感知的分布差异。用仿真数据预训练的 VLA,在真机微调时需要更多的真机数据来"弥合差距";而用真机数据预训练的 VLA,微调时只需少量真机数据就能快速适配。

BridgeData V2 的目标是"预训练底座"——它应该让下游用户尽可能少地采集自己的数据。真机数据虽然采集成本高,但作为预训练底座的效果远优于仿真数据。

决策三:全语言标注

每条轨迹都有自然语言描述,如"把红色杯子放到蓝色盘子上"。这一点看似简单,实际上极其重要——它是 BridgeData V2 能成为 VLA 预训练底座的前提条件

VLA 模型(RT-2、OpenVLA 等)的训练需要"图像 + 语言 + 动作"三元组。如果数据没有语言标注,你只能用它训练纯视觉-动作模型(如 Diffusion Policy),而不能训练 VLA。OXE 中的很多子数据集就缺乏语言标注——这大大限制了它们在 VLA 训练中的可用性。

BridgeData V2 选择了全语言标注,代价是标注工作量大(每条轨迹需要人工写描述),但收益是:它可以同时用于纯视觉-动作模型和 VLA 的训练,覆盖了更广的下游需求。

为什么它成了"标准配方"

2023-2024 年间,几乎所有开源 VLA 都用 BridgeData V2 做预训练或评测:

  • RT-2:用 BridgeData V2 评估泛化能力
  • OpenVLA:在 OXE + BridgeData V2 上预训练
  • Octo:在 OXE 上预训练,但 BridgeData V2 是 OXE 中质量最高的子集之一
  • Diffusion Policy:用 BridgeData V2 做部分任务的训练和评测

它成为标准不是因为"最大"——OXE 比它大 27 倍。而是因为"最实用":格式规范、语言标注完整、场景多样、采集质量稳定。就像 ImageNet 不是最大的图像数据集(LAION-5B 比它大几千倍),但它是最"好用"的基准。

局限

BridgeData V2 有三个明显的局限:

  1. 单本体:只有 WidowX 250 一种机械臂。换用其他机器人时,动作空间不兼容,需要额外的适配工作
  2. 桌面场景:24 个场景都是桌面高度的操作,没有地面、架子、家庭环境等更复杂的场景
  3. 规模有限:60K 轨迹对于训练通用 VLA 仍然偏小。RT-1 用了 13 万条还只学会了单一厨房的任务

这些局限直接催生了后续的数据集——OXE 解决了"单本体"问题,DROID 解决了"桌面场景"问题,两者合在一起在规模上也远超 BridgeData V2。

21.3.2 Open X-Embodiment——跨形态异构聚合的 ImageNet

超简版:22 家实验室把各种机器人的"练手视频"凑成一个大数据集,再训一个通吃模型,发现喂多种机器人比单喂一种学得更好。

基本参数

维度 数值
轨迹数 ~1.6M
机器人形态 22 种
技能数 500+
任务数 150,000+
数据格式 RLDS
参与机构 21 家(Google DeepMind 主导)

核心设计:统一格式而非统一硬件

OXE 最核心的设计决策是:只统一数据的"格式",不统一数据的"来源"

具体来说,OXE 定义了一套 RLDS(Reinforcement Learning Datasets)schema,规定了每条轨迹必须包含哪些字段、字段的数据类型、存储格式。22 家实验室各自用自己的机器人、自己的环境、自己的方式采集数据,但最终都把数据转换为 RLDS 格式上传。

类比:让 22 家餐厅用同一套菜谱模板——不是让它们改造厨房(统一硬件),只是统一"菜名怎么写、食材怎么列、做法怎么记"(统一格式)。这样你拿到任何一家餐厅的菜谱,都能用同样的方式阅读和比较。

这个设计的优势是参与门槛低——任何实验室都可以把已有数据转成 RLDS 格式加入,不需要换硬件或重新采集。这使 OXE 在短时间内聚合了大量数据。

但劣势也很明显:数据质量参差不齐。有的子数据集有高质量的语言标注和精确的动作记录,有的只有粗糙的图像和关节数据。有的场景光照稳定、背景干净,有的场景杂乱、光照变化大。这些异质性给下游训练带来了挑战。

RLDS Schema 技术细节

RLDS 格式的核心思想是"保留一切,不丢失信息"。每条轨迹包含以下标准字段:

  • steps/observation:观测数据,包含 RGB 图像、深度图(如有)、本体感受(关节角、末端位姿)
  • steps/action:动作数据,维度和含义因机器人而异,但存储格式统一
  • steps/language_instruction:语言标注(部分轨迹缺失)
  • steps/language_embedding:语言嵌入向量(预计算的,节省训练时的编码开销)
  • steps/discount:折扣因子(RL 数据需要,IL 数据通常设为 1.0)
  • steps/reward:奖励信号(RL 数据需要,IL 数据通常设为 0)
  • steps/is_terminal:是否终止
  • steps/is_first:是否起始

关键设计:action 字段的语义没有统一——WidowX 的 7-DoF 动作和 Franka 的 7-DoF 动作含义不同(前者是末端位姿增量,后者可能是关节角增量)。OXE 保留了这种差异,不做归一化——这既是灵活性,也是麻烦的来源。

踩坑提醒:使用 OXE 数据训练 VLA 时,必须注意动作空间的归一化。最常用的做法是将所有动作归一化到 [-1, 1] 范围,但这需要知道每种机器人的动作空间边界。Octo 论文详细描述了这个过程,推荐参考其数据处理代码。

RT-1-X / RT-2-X 的正迁移实验

OXE 最核心的实验结论是:多机器人混训比单机器人训练效果更好

RT-1-X(在 OXE 全部数据上训练的 RT-1)和 RT-2-X(在 OXE 全部数据上训练的 RT-2)在多种机器人的下游任务上做了评估。关键发现:

  • 在 WidowX 上的任务:RT-1-X 比 RT-1(只在 Google 内部数据上训练)高 50%
  • 在 Franka 上的任务:RT-1-X 甚至超过了只在 Franka 数据上训练的基线
  • RT-2-X 展现了"涌现能力"——能理解并执行训练中从未见过的指令

为什么多机器人数据会有正迁移?直觉上可以这样理解:不同机器人虽然硬件不同,但它们操作的物理世界是相同的。"抓住一个杯子"的视觉特征无论用 WidowX 还是 Franka 去看,杯子的形状、颜色、位置是不变的。多机器人数据让模型看到了更多样化的"世界状态",而不仅仅是更多样化的"机器人自身状态"。

与 ImageNet 的类比和差异

OXE 常被称为"机器人领域的 ImageNet"。这个类比有其道理,但也有重要的差异:

相似之处:

  • 都是大规模聚合数据集,打破了"各实验室小数据"的困局
  • 都定义了标准格式(ImageNet 的 WordNet 层次 / OXE 的 RLDS schema)
  • 都催生了后续的基础模型(ImageNet → CLIP, ViT / OXE → RT-X, Octo)

关键差异:

  • ImageNet 的"标签"是统一的(1000 类),OXE 的"动作"是不统一的(22 种机器人各有各的动作空间)
  • ImageNet 的数据质量相对均匀(都是标注好的图像),OXE 的数据质量参差不齐(有些子集缺乏语言标注)
  • ImageNet 是 I.I.D. 的(每张图像独立同分布),OXE 是非 I.I.D. 的(轨迹内有时序依赖,不同机器人的数据分布差异大)

这些差异意味着 OXE 的使用比 ImageNet 复杂得多——你不能简单地把所有数据混在一起训练,需要仔细处理动作空间归一化、数据权重、负迁移等问题。

负迁移的存在

多机器人混训并非总是有益的。当两种机器人的任务完全不同(如四足行走 vs 桌面操作),混训可能导致负迁移——模型被无关数据"干扰"了。OXE 论文中也报告了这种情况,但没有系统性地分析哪些机器人组合会产生负迁移。

这是当前的一个重要开放问题:如何自动识别和避免跨形态训练中的负迁移?

21.3.3 DROID——统一硬件 × 极端场景多样性

超简版:全球 18 家实验室一起拍机器人干活的视频,凑出 7.6 万段、564 个真实场景,让机器人不再只会"自家桌子上那点活"。

基本参数

维度 数值
轨迹数 ~76K
场景数 564
任务数 86
采集时长 ~350 小时遥操作
参与机构 18 家
覆盖国家 13 个
机器人 Franka Panda
相机 ZED 双目
遥操作 Oculus Quest 控制器

核心设计:统一硬件,自由场景

DROID 的设计路线和 OXE 恰好相反:

  • OXE:统一格式 + 异构硬件 → 聚合已有数据
  • DROID:统一硬件 + 异构场景 → 协同生产新数据

DROID 的核心论点是:机器人基础模型缺的不是更聪明的算法,是更接近真实世界分布的数据

为什么统一硬件?因为不同机器人的动作空间不兼容是跨形态训练最大的技术障碍(OXE 的实践已经证明了这一点)。统一硬件后,所有数据共享同一个动作空间——不需要归一化、不需要适配器、不用担心负迁移。模型训练变得简单了。

为什么自由场景?因为机器人的泛化瓶颈不是"不会做这个动作",而是"没见过这种环境"。在办公室桌上训练的抓取策略,到厨房桌上就失效了——不是因为抓取动作变了,而是因为背景、光照、物体排列不同,视觉编码器"迷路"了。DROID 通过 564 个不同场景、13 个国家的地理多样性,让模型在预训练阶段就见过各种环境,减少微调时需要适应的新环境"惊喜"。

类比:连锁店统一设备,各店口味不同——麦当劳全球统一设备和工作流程,但每个城市的麦当劳因为食材供应和当地口味偏好,产品细节有所不同。统一设备保证了基础质量,分散布局保证了适应性。

与 OXE 的路线对比

维度 OXE DROID
核心思路 事后聚合已有数据 事前协同生产数据
硬件 22 种机器人 1 种(Franka)
动作空间 不统一,需归一化 统一,直接可用
场景多样性 有限(多为实验室) 极高(564 场景,13 国家)
语言标注 部分缺失 全部有(自动生成 + 人工校验)
数据质量 参差不齐 高度一致
参与门槛 低(格式转换即可) 高(需购买指定硬件)
规模 1.6M 轨迹 76K 轨迹

两条路线不是互相替代的,而是互补的。OXE 适合训练通用 VLA(跨形态能力),DROID 适合训练特定形态的高性能 VLA(单形态深度泛化)。实际应用中,先用 OXE 做预训练获得跨形态知识,再用 DROID 微调获得高质量的单形态性能,可能是更好的策略。

Scaling Law 实证

DROID 论文做了一个关键实验:分别用 25%、50%、100% 的数据预训练,然后在下游任务上微调,看性能怎么随数据量变化。

结果:性能随数据量单调提升,从 25% 到 100% 几乎是线性增长。这看起来是"废话"——数据多了性能当然好?但在机器人领域,这并不是显而易见的。之前有很多实验表明,加入低质量数据反而会降低性能(因为噪声干扰了学习)。DROID 的单调提升说明:当数据质量有保证时,scaling law 在机器人领域也成立

更有说服力的对比:DROID 预训练 > OXE 预训练 > 从零训练。用 DROID 预训练的模型在下游任务上比用 OXE 预训练的更好,尽管 DROID 的数据量只有 OXE 的 5%。这再次验证了"数据质量 > 数据数量"。

质量控制流程

DROID 之所以能保证数据质量,是因为它有一套完整的质量控制流程:

  1. 硬件标定:每家机构在采集前必须完成标准化的相机标定和机器人标定流程
  2. 自动检查:上传数据后自动检查格式完整性、动作范围合理性、图像质量
  3. 语言标注:先用 VLM 自动生成语言描述,再由人工校验
  4. 异常过滤:检测并过滤掉采集失败、动作异常、图像模糊的轨迹

这套流程使 DROID 的"有效数据比例"远高于 OXE——几乎每条轨迹都是可用的。

局限

  1. 只有 Franka:统一硬件解决了动作空间兼容问题,但也意味着 DROID 只能用于 Franka 这一种机器人。用 WidowX 或 UR5 的实验室无法直接使用
  2. 偏 pick-and-place:86 种任务中大部分是"拿起-放下"类型,缺乏需要精细力控制的操作(如拧螺丝、切菜)
  3. 规模仍然有限:76K 轨迹对训练基础模型来说偏小。DROID 团队正在持续扩展中

21.3.4 RH20T——接触富集任务的多模态数据

超简版:机器人数据集,除拍视频外还录了"手感"和"声音":拧瓶盖多大力、咔哒卡到位。147 项任务、11 万段。

基本参数

维度 数值
轨迹数 110K+
任务数 147
模态 RGB-D + 力/力矩 + 音频 + 本体感受
时间同步 毫秒级
采集时长 1,000+ 小时

为什么"接触富集"很重要

Ch13Ch14 中,我们讨论的几乎所有 IL 方法都只用视觉(RGB 图像)作为输入。这在"看得到就能做"的任务上工作得很好——拿起杯子、推箱子、叠积木,这些动作的关键信息都在视觉中。

但有一类任务,关键信息不在"看"而在"摸":拧瓶盖需要知道阻力什么时候突然减小(盖子松了);插 USB 需要感受到对准时的轻微"咔嗒";切菜需要根据刀接触砧板的震动反馈调整力度。这些任务叫做接触富集任务(contact-rich tasks)——成功与否取决于精确的力控制,而力信息从视频中是学不到的。

你不可能从视频里看出拧瓶盖用了多大的力。你只能看到手在旋转瓶盖,但旋转的力度、加速的时机、停止的阈值——这些信息完全在视觉之外。就像你不可能从一张照片里听出那首歌好不好听一样。

RH20T 填补的就是这个空白——它不仅记录"机器人看到了什么",还记录"机器人摸到了什么""机器人听到了什么"。

四模态时间同步

RH20T 同时记录四种模态的数据:

  1. RGB-D 图像:第三人称视角的彩色图像 + 深度图,标准的视觉输入
  2. 力/力矩:安装在机械臂末端的力/力矩传感器,6 维(Fx, Fy, Fz, Tx, Ty, Tz),实时记录接触力
  3. 音频:桌面麦克风,记录操作过程中的声音(碰撞声、滑动声、卡扣声)
  4. 本体感受:关节角、关节速度、末端位姿等机器人内部状态

四种模态的毫秒级时间同步是 RH20T 最大的工程挑战,也是它最独特的技术贡献。

为什么时间同步这么难?因为四种传感器的工作频率不同:RGB-D 通常是 30Hz,力/力矩传感器是 500-1000Hz,音频是 44100Hz,本体感受是 100-500Hz。你要把这些不同频率的数据流精确对齐到同一个时间轴上,误差不能超过几毫秒——否则"力突然增大"和"图像中出现碰撞"就对不上了。

RH20T 通过硬件时钟同步 + 软件时间戳校准实现了这一目标。具体做法是:所有传感器共享同一个 NTP 时间服务器,采集时为每一帧数据打上精确的时间戳,后处理时根据时间戳插值对齐。

与 OXE/DROID 的互补关系

RH20T 和 OXE/DROID 不是竞争关系,而是互补关系:

维度 OXE / DROID RH20T
核心追求 场景广度 模态深度
数据类型 视觉 + 动作 视觉 + 力 + 声音 + 动作
适用任务 pick-and-place 为主 接触富集操作
可训练模型 视觉-动作 VLA 多模态感知-动作模型

类比:做纪录片不光录画面,还挂麦克风、戴力传感手套——OXE/DROID 是"拍了 100 部风景大片",RH20T 是"拍了一部 4D 体感电影"。前者的广度帮助模型泛化,后者的深度帮助模型理解物理交互。

初学者常见误解:认为机器人只需要"看"就够了。实际上,人类的操作能力很大程度上依赖触觉反馈——盲人可以完成很多精细操作,但手部麻木的人连扣扣子都很困难。机器人也是一样:纯视觉的策略在接触富集任务上注定有上限。

局限

  1. 单一机器人:只有一种机械臂(未公开具体型号),跨形态复用受限
  2. 模态利用不足:虽然采集了四模态数据,但现有的 VLA 架构大多只支持视觉输入。如何有效地将力/力矩和音频融入策略网络,仍是一个开放问题
  3. 场景多样性有限:相比 DROID 的 564 个场景,RH20T 的场景数较少

21.4 仿真操作基准

21.4.0 从"数据集"到"考卷"

Ch17 中我们详细讨论了仿真平台——Isaac Gym、MuJoCo、Habitat 等,它们是"训练场"。本节关注的是"考卷"——仿真操作基准(benchmark)。

两者的区别在于目的不同:

  • 训练场(仿真平台):提供环境让你训练策略,重点是物理保真度和速度
  • 考卷(基准):提供标准化的任务和评估协议,让你公平比较不同算法,重点是可复现性和区分度

同一份仿真数据(如 RLBench 的示范轨迹)既可以用作训练数据,也可以用作评估基准——但设计意图不同。基准的设计者需要仔细考虑:任务难度是否合适?评估指标是否公平?训练/测试拆分是否防止了"作弊"?

本节从"算法适配"的角度重新分类仿真基准——不同的基准是为不同的算法范式设计的:

算法范式 对应基准 核心诉求
RL(强化学习) Meta-World, RLBench 明确的奖励函数,可大规模试错
IL(模仿学习) RoboMimic 控制变量的数据质量实验
语言条件 + 长时序 CALVIN, LIBERO 多步推理和指令跟随
家务 + 关节物体 RoboCasa, BEHAVIOR-1K, ManiSkill 日常场景泛化

21.4.1 RL 导向基准:Meta-World

超简版:给那些号称"会举一反三"的机器人算法办一场 50 道动手题的统一考试。

基本参数

维度 数值
任务数 50
难度分层 5 级(ML1 → ML45)
观测空间 统一 39 维(机器人状态 + 物体状态)
动作空间 统一 4 维(3D 末端位移 + 夹爪)
机器人 Sawyer(7-DoF)
物理引擎 MuJoCo

设计哲学:统一接口

Meta-World 的核心贡献不是 50 个任务本身(很多任务是经典操作任务的变体),而是统一的观测和动作空间。50 个任务全部共享:

  • 相同的 39 维观测向量(Sawyer 的关节角 + 物体的位置/旋转/速度)
  • 相同的 4 维动作向量(末端执行器的 3D 位移 + 夹爪开合)
  • 相同的稀疏奖励定义(1 = 成功,0 = 失败)

这种统一性让多任务学习和元学习算法有了"苹果对苹果"的比较基础。你不需要为每个任务设计不同的网络架构或超参数——一个算法配置就能跑全部 50 个任务。

类比:50 项体能测试,都是田径类——100 米、跳远、铅球,虽然项目不同,但都是"用身体完成"的运动,评分标准统一。如果有人声称他的训练方法"全面提升运动能力",你让他跑一遍 50 项测试就知道真假了。

五个难度层级

Meta-World 定义了 5 个递增的评估配置:

配置 任务数 含义
ML1 1 单任务:训练和测试同一个任务
ML10 10 多任务:10 个任务联合训练和评估
ML45 45 多任务:45 个任务联合训练和评估
MT10 10 元学习:10 个任务,测试在新任务上的快速适应
MT50 50 元学习:50 个任务,测试在新任务上的快速适应

关键发现:MT10→MT50 性能减半

Meta-World 论文中最重要的实验结果是:多任务性能随任务数增加急剧下降。

  • MT10(10 个任务):平均成功率 68.3%
  • MT50(50 个任务):平均成功率 38.5%

几乎减半。而单任务 SAC(每个任务独立训练)能 50/50 全部成功。

这个结果意味着什么?瓶颈在算法,不在任务本身。 任务本身是可以解的(SAC 证明),但当前的多任务/元学习算法在同时处理 50 个任务时,出现了严重的"任务干扰"(task interference)——不同任务的梯度方向冲突,网络在"学 A 忘 B"之间反复。

这个发现对后续研究的影响很大:它把社区的注意力从"设计更多任务"转向了"设计更好的多任务学习算法"——如任务条件化的网络架构、梯度方向投影、任务分组等。

踩坑提醒:Meta-World 使用稀疏奖励。在单任务设定下,SAC 配合 HER(Hindsight Experience Replay)可以解决大多数任务。但在多任务设定下,稀疏奖励使 RL 几乎无法学习——建议使用 IL 方法或密集奖励塑形。

21.4.2 RL 导向基准:RLBench

超简版:给机器人手臂出了一套 100 道题的"统考卷",从此大家都做同一套题,第一次能公平比谁更厉害。

基本参数

维度 数值
任务数 100
变体数 每个任务多个变体(如不同颜色/位置的目标)
示范来源 OMPL 运动规划器(无限生成)
动作空间 8 种可选
物理引擎 CoppeliaSim

三层结构

RLBench 的任务组织是三层结构:

  1. Task(任务):如"把物品放进箱子里",100 个
  2. Variation(变体):同一任务的不同配置,如箱子位置不同、物品颜色不同
  3. Episode(回合):同一变体下的单次执行

这种分层设计支持两种评估模式:

  • 同变体评估:训练和测试用同一组变体——测"学会没有"
  • 新变体评估:训练用一组变体,测试用新变体——测"能不能泛化"

8 种动作空间

RLBench 提供了 8 种不同的动作空间表示,从低维到高维:

动作空间 维度 描述
末端位姿(绝对) 7 6D 位姿 + 夹爪
末端位姿(增量) 7 位姿增量 + 夹爪
关节角(绝对) 8 7 关节 + 夹爪
关节角(增量) 8 关节增量 + 夹爪
... ... 其他 4 种变体

不同算法偏好不同的动作空间:RL 通常用连续的绝对关节角,IL 通常用增量式的末端位姿。RLBench 允许研究者选择最适合自己算法的空间,同时保持任务定义不变。

关键发现:纯 RL + 稀疏奖励几乎全挂

RLBench 论文的一个核心实验是:用纯 RL(SAC、TD3、PPO)+ 稀疏奖励在 100 个任务上训练。结果——绝大多数任务的成功率为 0%。

这和 Meta-World 形成鲜明对比。Meta-World 中 SAC 至少能解单任务,但 RLBench 的任务更复杂(更长的操作序列、更多的物体交互、更精细的力控制),稀疏奖励几乎无法提供有效的学习信号。

解决方案:模仿学习主导。RLBench 可以通过 OMPL(Open Motion Planning Library)运动规划器无限生成高质量的示范轨迹。用这些示范训练 IL 方法(如 BC、BC-RNN),在大部分任务上都能达到 >50% 的成功率。

类比:RLBench 是一套"统考卷"——以前大家各自出题,你说你算法好、我说我算法好,没法比。现在大家做同一套卷子,分数摆出来,谁强谁弱一目了然。

少样本评估协议

RLBench 还定义了一种"少样本评估"协议:给算法 K 条示范(K=1, 5, 10, 20),看它能在多少个任务上成功。这个协议模拟了现实中"快速教机器人一个新任务"的场景——你不想花几小时采集数百条演示,只想"演示几次就让它自己干"。

局限

最大的局限是 sim-to-real gap:RLBench 的任务全部在仿真中。一个在 RLBench 上 90% 成功率的策略,部署到真机上可能只有 30%。这不是 RLBench 的"bug",而是所有仿真基准的共同问题——仿真的物理和视觉都和真实世界有差异(详见 Ch17)。

21.4.3 模仿学习导向基准:RoboMimic

超简版:把"机器人看录像学操作"里每个变量挨个换一遍,告诉你哪些真有用。

基本参数

维度 数值
任务数 多个(Lift, Can, Square, Transport, Tool Hang 等)
数据质量 3 档(PH / MH / MG)
采集方式 真机遥操作 + 仿真
物理引擎 MuJoCo

三档数据质量

RoboMimic 最核心的贡献不是新的任务或新的算法,而是系统性的数据质量控制变量实验。它为每个任务提供了三档数据:

档次 缩写 含义 操作者
专业级 PH Proficient Human 有经验的遥操作者
混合级 MH Mixed Human 专业 + 新手混合
多人级 MG Multi-Gen(MimicGen 生成) 程序自动生成

关键区别:PH 数据每条都是"完美操作";MH 数据中混入了新手操作(有犹豫、有失误、有冗余动作);MG 数据是用 MimicGen 算法从少量人类示范自动合成的。

核心发现一:数据质量 > 数据数量

用 PH 数据训练的 BC 策略,200 条示范就能达到 90%+ 的成功率。用 MH 数据训练,即使有 1000 条示范,成功率也只有 60-70%。用 MG 数据训练,效果介于两者之间。

这个结论深刻影响了后续的数据采集策略:与其追求更多数据,不如追求更高质量的数据。Diffusion Policy、ACT/ALOHA 等后续工作都采用了这个思路——用少量高质量示范而不是大量低质量示范来训练策略。

核心发现二:Offline RL 没赢 BC

RoboMimic 对比了 BC(行为克隆)、BC-RNN(带 RNN 的行为克隆)和多种 offline RL 方法(CQL、IRIS 等)。结果出乎很多人意料:

  • 在 PH 数据上:BC 和 BC-RNN 就够了,offline RL 没有显著优势
  • 在 MH 数据上:offline RL 略有优势(能从混合质量数据中学得更好),但差距不大
  • 在所有设定下:BC-RNN(用 RNN 建模时序依赖)始终优于 BC

这个结果对社区的启示是:在机器人 IL 领域,算法复杂度的边际收益很小,数据质量的边际收益很大。与其花精力设计更复杂的 RL 算法,不如花精力采集更好的数据。

对后续工作的影响

RoboMimic 的发现直接催生了几个重要方向:

  • Diffusion PolicyCh13):RoboMimic 发现 BC-RNN 比 BC 好,说明建模动作分布的多模态性很重要。Diffusion Policy 用扩散模型更好地建模了这种多模态性
  • ACT/ALOHA:RoboMimic 的数据质量结论支持了 ALOHA "少量高质量示范 + 时空注意力"的路线
  • BeT(Behavior Transformer):直接受 RoboMimic "BC-RNN > BC" 的启发,用 Transformer 替代 RNN 建模时序依赖

21.4.4 语言条件 + 长时序基准:CALVIN

超简版:CALVIN 是一把"机器人听话考试"的尺子:人说一段话,机器人要在桌上一步接一步把活干完。

基本参数

维度 数值
任务数 34 种原子操作
环境数 4(A/B/C/D,逐步变化)
评估方式 5 步链式评估
语言类型 自然语言指令
物理引擎 PyBullet

链式评估:连环考题

CALVIN 的核心创新是链式评估(chained evaluation)。不是给机器人一个任务做完了打分,而是给一串任务——"打开抽屉 → 拿起红方块 → 放到蓝区域 → 关上抽屉 → 推动绿瓶子"——必须一步不差地全做完才算成功。

这比单任务评估难得多。如果每一步的成功率是 90%,5 步链式成功率只有 0.9^5 = 59%。任何一步失败,后面的全废。

类比:高考连环题——错一步整题废。单任务评估是"每道选择题独立计分",链式评估是"大题的第一步错了后面全没分"。后者更接近真实需求——你让机器人"收拾桌子",它必须把所有东西都放好才算完成,中间任何一步打翻杯子就失败了。

四个环境:渐进式泛化

CALVIN 定义了 4 个环境(A/B/C/D),逐步增加泛化难度:

  • A → B:同一环境,不同起始状态
  • A → C:换了桌面颜色和部分物体
  • A → D:完全不同的物体配置和颜色

这种设计让研究者可以精确测量模型在不同泛化层级上的表现——是只能做自己见过的环境(A→A),还是能适应新的布局(A→C),还是能适应完全陌生的场景(A→D)?

21.4.5 语言条件 + 长时序基准:LIBERO

超简版:教机器人学新技能时别忘旧技能。LIBERO 是这事的标准考卷,4 套题分别考空间、物体、目标和综合。

基本参数

维度 数值
任务数 130
套件 4(Spatial / Object / Goal / LIBERO-100)
每任务演示数 50
语言标注 全部有
物理引擎 MuJoCo

四套题设计:知识类型解耦

LIBERO 最巧妙的设计是:将泛化能力拆解为四种独立的知识类型,分别出题。

套件 考什么 核心挑战 示例任务
LIBERO-Spatial 空间泛化 同物体新位置 "把红碗放到蓝板左边"→ 红碗换了位置
LIBERO-Object 物体泛化 同任务新物体 "把碗放到盘子上"→ 碗换成了杯子
LIBERO-Goal 目标泛化 同场景新目标 桌上有碗和盘子 → "把碗放到盘子上"vs"把盘子放到碗上"
LIBERO-100 综合长时序 全部 + 顺序学习 100 个任务依次学习,不能忘

这种解耦设计有一个直接的好处:你可以精确诊断模型的弱点在哪。如果 Spatial 分数低但 Goal 分数高,说明模型的视觉定位能力不足但指令理解没问题;如果 Object 分数低,说明模型对未见物体的泛化能力差。

类比:医学诊断不是只看"你病了",而是分科检查——内科、外科、骨科、神经科。LIBERO 的四套题就是四科体检,帮你定位模型的"病"在哪。

"一卷两吃":终身学习 + VLA 微调评测

LIBERO 的另一个独特设计是它同时服务于两个研究社区:

  1. 终身学习(Lifelong Learning)社区:LIBERO-100 的 100 个任务需要依次学习——学完任务 1 再学任务 2,依此类推。核心挑战是"学新不忘旧"(avoid catastrophic forgetting)。这使得 LIBERO 成为终身学习的标准基准。

  2. VLA 微调评测社区:LIBERO 的每个任务都有 50 条演示 + 语言指令,可以直接用于 VLA 的微调和评测。2024 年以来,几乎所有开源 VLA 都在 LIBERO 上做评测——OpenVLA、π0、RDT-1B 等。

这种"一卷两吃"的设计让 LIBERO 成为仿真基准中"使用率最高"的一个。它不是最大最难的,但它是最"好用"的——任务设计合理、评估协议清晰、代码库维护良好、社区支持完善。

为什么它成了 VLA 微调的事实标准

几个原因叠加:

  1. 语言条件 + 视觉输入:VLA 需要同时处理图像和语言,LIBERO 的每个任务都有精确的语言指令,完美匹配 VLA 的输入格式
  2. 难度适中:比 Meta-World 难(需要语言理解和物体泛化),但不像 BEHAVIOR-1K 那么难(不需要复杂的长程规划),适合做"微调后提升多少"的评测
  3. 四套题解耦:可以分别评测不同维度的泛化能力,而不是只有一个总分
  4. 开源生态:代码、演示数据、评估脚本全部公开,HuggingFace 上一键下载

21.4.6 家庭/家务基准:RoboCasa

超简版:想造个会做饭的家用机器人?RoboCasa 给你 120 个虚拟厨房、100 个小动作、十万次练习录像。

基本参数

维度 数值
厨房场景 120
原子任务 100
总回合数 100K+
物体数 2500+
物理引擎 MuJoCo

核心特点:AI 生成资产

RoboCasa 的场景和物体大量使用 AI 生成——不是手工建模,而是通过程序化生成(procedural generation)自动创建。这意味着:

  • 120 个厨房各不相同(布局、颜色、家具类型都随机化)
  • 2500+ 个物体覆盖了厨房中常见的锅碗瓢盆
  • 可以无限扩展——需要更多场景?运行生成脚本即可

类比:训练保姆去 100 家不同厨房实习——每家的灶台位置、调料架高度、锅碗样式都不同,但都是"真实的"厨房场景(只是是虚拟的)。

MimicGen 轨迹改写

RoboCasa 的另一个技术亮点是使用 MimicGen 进行数据扩增。MimicGen 的思路是:给定少量人类示范(如"拿起杯子"),自动改写出在新场景配置下的示范(杯子换了位置、换了颜色、换了形状,但动作的"骨架"相同)。这大大降低了数据采集成本——不需要为每个新场景都重新遥操作。

局限

RoboCasa 的主要局限是家庭场景的复杂性远不止厨房。真实的家务包括洗衣、打扫、整理、照顾宠物等,而 RoboCasa 目前只覆盖了厨房操作。不过作为"厨房模拟器",它在这个特定场景上做得足够深入。

21.4.7 家庭/家务基准:BEHAVIOR-1K

超简版:斯坦福搭的"机器人家务考场":1000 道家务题、50 间样板房、9000 多件物品。

基本参数

维度 数值
任务数 1000
场景数 50
物体数 9000+
任务来源 1461 人调研
判分方式 BDDL 谓词逻辑

"产品需求调研"思路

BEHAVIOR-1K 的任务定义方式和其他基准截然不同——它不是由研究者"拍脑袋"想出来的,而是通过大规模人类调研确定的。

斯坦福团队调查了 1461 个人,问他们"你最希望机器人帮你做什么家务",然后从回答中提炼出 1000 种最常见的日常活动。这种"用户驱动"的任务定义方式确保了基准的生态效度(ecological validity)——评测的任务确实是人类关心的,而不是研究者觉得"酷"的。

类比:产品经理做需求调研——先问 1461 个人他们需要什么,再挑 top 1000 做成需求列表。而不是工程师自己想 1000 个"我觉得用户需要"的功能。

BDDL 判分

BEHAVIOR-1K 使用 BDDL(Behavior Domain Description Language)来定义任务的成功条件。BDDL 是一种谓词逻辑语言,可以表达复杂的状态约束:

  • 简单任务:"杯子在桌子上" → on(cup, table)
  • 复杂任务:"把干净的衣服叠好放进衣柜" → inside(clothes, closet) ∧ folded(clothes) ∧ clean(clothes)

这种形式化的判分方式避免了"这算不算成功"的主观争议——谓词为真就是成功,为假就是失败。

状态变化模拟

BEHAVIOR-1K 的一个独特能力是模拟物体的状态变化:脏的→干净的(洗过)、完整的→破碎的(摔了)、湿的→干的(晾过)。这比大多数仿真基准只能模拟物体的位置变化要复杂得多——但也更接近真实的家务场景。

21.4.8 关节物体基准:ManiSkill

超简版:ManiSkill 是教机器人开抽屉、开柜门的统一考场——专测它练完几十个柜子之后,能不能上手没见过的第 101 个。

基本参数

维度 数值
任务类型 多种(开抽屉、开门、推物体等)
物体来源 PartNet-Mobility
物体实例 数百个
拆分方式 按物体实例 train/test

核心挑战:物体实例泛化

ManiSkill 的核心评估问题是:策略能不能泛化到没见过的物体?

训练时用的是 A 组抽屉,测试时换成 B 组抽屉——关节参数、尺寸比例、把手位置都不同。策略必须从视觉输入中理解"这是一个抽屉,需要沿这个方向拉",而不是过拟合到"看到这个特定形状就执行这个特定动作"。

类比:驾校改革——以前只练同一辆桑塔纳,考试也开这辆桑塔纳;现在换十几种车练,考试开没碰过的车。如果只会背桑塔纳的离合点,换车就不会开了;真正理解了"离合器的原理",什么车都能开。

Ch17 的联系

ManiSkill 报告的"训练 88.7% → 测试 22.9%"的落差,不是 sim-to-real gap(都在仿真中),而是物体泛化 gap。这个 gap 说明:即使仿真和真实完全一致,策略仍然可能无法泛化到新物体。这和 Ch17 中 SAPIEN/ManiSkill 的讨论一脉相承——泛化能力是独立于 sim-to-real gap 的另一个关键挑战。

21.4.9 仿真基准对比与互补

八个仿真基准各有侧重,不存在"最好"的——它们是互补的:

基准 算法定位 核心考察点 适合谁用
Meta-World RL 多任务/元学习 RL 算法研究者
RLBench RL/IL 任务多样性 + 少样本 IL + few-shot 研究者
RoboMimic IL 数据质量 vs 数量 IL 方法论研究者
CALVIN 语言条件 链式长时序 VLA + 长程规划研究者
LIBERO 语言条件 知识类型解耦 VLA 微调 + 终身学习研究者
RoboCasa 家庭场景 厨房操作多样性 家务机器人研究者
BEHAVIOR-1K 家庭场景 真实家务复杂度 长程家务研究者
ManiSkill 关节物体 物体实例泛化 操作泛化研究者

如果你的研究需要选一个基准,决策流程是:

  1. 你的算法是 RL 还是 IL?→ RL 选 Meta-World/RLBench,IL 选 RoboMimic
  2. 需要语言条件吗?→ 需要,选 CALVIN 或 LIBERO
  3. 关注家庭场景吗?→ 关注,选 RoboCasa 或 BEHAVIOR-1K
  4. 关注物体泛化吗?→ 关注,选 ManiSkill

更实际的做法是选 2-3 个互补的基准——例如 LIBERO(语言条件 + 知识类型解耦)+ ManiSkill(物体泛化)+ 一个真机数据集(DROID/BridgeData V2)做 sim-to-real 验证。

仿真基准的共同局限

最后,所有仿真基准都有一个共同的局限:它们测的是仿真中的性能,不是真机上的性能。一个在 LIBERO 上 90% 成功率的 VLA,部署到真机上可能只有 40-50%。这个 gap 的来源和处理方法在 Ch17 中已有详细讨论,此处不再展开。

但有一点值得强调:仿真基准的价值不在于"预测真机性能",而在于快速迭代和公平比较。在仿真中,你可以一天训练 100 个模型变体并评估;在真机上,同样的实验可能需要一个月。仿真基准让算法迭代速度提高了 100 倍——即使最终还需要真机验证,前期的快速筛选仍然极大地提高了研发效率。


21.5 数据集的四个设计维度(横切对比)

前面四个小节是"纵向"逐个看每个数据集——OXE 的跨本体野心、DROID 的分布式采集、BridgeData V2 的 VLA 基石、RH20T 的多模态丰富性、LIBERO/CALVIN 的终身学习基准、RoboCasa/BEHAVIOR-1K 的场景多样性、RLBench/Meta-World/ManiSkill/RoboMimic 的经典地位。每个数据集我们都理解了它"为什么这样设计"。

现在换个视角——用四个横切维度把所有数据集拉到同一张表上比较。这就像你逛完一圈手机店,每款手机都摸过了,现在拿出一张对比表:屏幕大小、电池容量、拍照像素、价格——四个维度同时比较,哪个适合你一目了然。

数据集也一样。四个设计维度是:

  1. 真机 vs 仿真:数据从哪来?
  2. 单本体 vs 跨本体:数据给几种机器人用?
  3. 视觉 vs 多模态:数据包含哪些感官信号?
  4. 数据集 vs 基准:数据是用来"喂"的还是用来"考"的?

每个维度都不是简单的二选一——它背后是一组 trade-off,选 A 得到什么、失去什么,选 B 又如何。理解这些 trade-off,比记住每个数据集的参数更重要。


21.5.1 真机 vs 仿真

Trade-off 的核心:真实度 vs 规模/成本

想象你要训练一个厨师。方案 A:让他在真实厨房里做一千道菜,用真实食材,烧糊了就倒掉重来。食材成本、厨房占用、油烟清理——每次实验的代价都很高。方案 B:让他在模拟厨房里做一百万道菜。食材是虚拟的,烧多少都不心疼,但"虚拟盐"放多少和"真实盐"放多少的手感不完全一样。

这就是真机 vs 仿真的根本 trade-off:

维度 真机数据 仿真数据
真实度 高(数据来自真实物理世界) 取决于仿真器保真度
规模 受限于采集成本,通常千~万级 理论上无限,可轻松到百万级
可重置性 差(每次实验需要手动复位) 好(一键重置环境)
安全性 有风险(机器人可能损坏物品或伤人) 完全安全
一致性 低(光照、纹理、物理参数自然变化) 高(参数精确可控)
Sim-to-Real Gap 无(数据本身就是 real) 存在(需要额外迁移策略)

真机数据集的优势与代价

OXE、DROID、BridgeData V2、RH20T 都是真机数据集。它们最大的优势用两个字概括:无 gap。在真机数据上训练的策略,部署到真机不需要跨越 sim-to-real gap——因为训练和部署在同一个物理世界里。你在真实厨房里练出来的颠勺技术,换一个真实厨房也能用。

但真机数据的代价是规模天花板。DROID 动用了 13 个机构、60 台机器人、持续数月才采集了 76K 条轨迹。这个规模和 NLP 领域的万亿 token 相比,差了六个数量级。为什么真机数据这么难采?

  • 硬件成本:一台 Franka 机械臂约 3 万美元,加上相机、力传感器、计算设备,一个工作站成本超过 5 万美元
  • 人力成本:每条轨迹需要人操控机器人(teleoperation),平均每条 30 秒到 2 分钟,一个人一天最多采 200-400 条
  • 故障时间:机器人关节过热、传感器失灵、网络中断——真实硬件的不稳定性导致 10-30% 的时间花在维护而非采集上
  • 环境准备:DROID 有 564 个不同场景,每个场景需要布置物品、调整灯光、校准相机

仿真数据集的优势与代价

RLBench、Meta-World、LIBERO、CALVIN、BEHAVIOR-1K、RoboCasa、ManiSkill 都是仿真数据集。它们最大的优势也是两个字:无限。仿真的数据量只受限于计算资源。RoboCasa 用 MimicGen 从少量人工演示自动生成了 100K+ 条轨迹,这个规模在真机上是不可能达到的。

仿真的另一个关键优势是安全可重置。RL 训练需要数百万步试错,在真机上让机器人反复摔倒、碰撞、损坏物品——成本不可接受。仿真里随便摔,env.reset() 一秒钟回到初始状态。

但仿真的核心问题是 Ch17 中详细讨论的 sim-to-real gap。仿真渲染的图像缺乏真实相机的噪声、模糊和色彩偏差;仿真的物理引擎假设摩擦系数是常数,真实世界摩擦系数随温度和压力变化;仿真中机器人关节的响应是即时的,真实电机有延迟。

举一个具体例子:在 RLBench 中训练的抓取策略,仿真里 Franka 的夹爪闭合角度和真实 Franka 的夹爪闭合角度可能差 2-3 度——这在抓取小物体(如笔、硬币)时足以导致抓取失败。在 LIBERO 中训练的长序列策略,仿真里物体碰撞的反弹轨迹和真实碰撞的反弹轨迹有差异——这种差异在单步操作中不明显,但会在长序列中累积,导致第 8 步以后的状态偏离预期。

还有一个容易被忽视的劣势:仿真数据的多样性有上限。无论你在仿真中怎么域随机化,物体的 3D 模型、纹理贴图、物理参数都来自人工设计——仿真世界里的"杯子"只有建模者做过的那几十种,真实世界里的杯子有无数种。这也是为什么 Ch17 的域随机化策略有一个隐含前提:随机化的参数范围必须足够宽,才能"包住"真实世界的参数分布。

混合策略:仿真预训练 + 真机微调

实践中最常用的不是"纯真机"或"纯仿真",而是混合策略:先用大规模仿真数据预训练(获得基础操作能力),再用少量真机数据微调(适配真实世界的物理和视觉特性)。这就像在模拟器里先学会开车的基本操作(方向盘、油门、刹车),然后上真实道路练几天适应实际路况。

Octo 就是这种策略的典型代表:它用 OXE 中 800K 条混合数据(含仿真和真机)预训练,部署时只需 50-200 条目标环境的真机演示就能微调适配。Ch12 中的 OpenVLA 也采用了类似策略——在 OXE 的 970K 轨迹上预训练,然后针对特定下游任务微调。

混合策略的数学直觉可以这么理解:假设模型需要学习的总知识量是 K。纯真机策略用少量高质量数据学到了 K 的 60%,但数据不够,无法学到剩余的 40%。纯仿真策略用大量低质量数据学到了 K 的 80%,但其中 20% 是"仿真世界的偏见"(sim-specific bias),迁移到真机时会出错。混合策略用仿真数据先学到 K 的 80%,然后用少量真机数据"修正"那 20% 的偏见——最终学到了 K 的 90%+。50-200 条真机数据的成本远低于从零开始用真机数据训练所需的数万条。

SimplerEnv(21.6.1 节将详细介绍)则从另一个角度弥合 gap:不追求让仿真更逼真,而是让仿真的评测分数和真机评测分数高度相关——在仿真里跑分就能预测真机表现。

初学者常见误解:"仿真数据没用,一定要真机数据。"事实是:纯仿真数据训出来的策略确实不能直接部署到真机,但仿真数据提供的"基础操作能力"(抓取、推动、旋转等 primitive)是可以在真机微调时被复用的。从零开始只用真机数据训练,达到同等性能需要的数据量可能是混合策略的 5-10 倍。

真机 vs 仿真综合对比

数据集 真机/仿真 典型规模 能否直接部署真机 训练成本
OXE 真机 1.6M traj 高(多人多机构)
DROID 真机 76K traj 高(13 机构联合)
BridgeData V2 真机 60K traj 中(单一硬件)
RH20T 真机 110K traj 高(多传感器同步)
LIBERO 仿真 130 tasks 需迁移
CALVIN 仿真 34 tasks 需迁移
RoboCasa 仿真 100K+ traj 需迁移 低(MimicGen 自动化)
BEHAVIOR-1K 仿真 1000 tasks 需迁移
RLBench 仿真 100 tasks 需迁移
Meta-World 仿真 50 tasks 需迁移
ManiSkill 仿真 Skills x 100s 需迁移
RoboMimic 仿真(+少真机) 多层级 部分可

21.5.2 单本体 vs 跨本体

一台机器人的数据 vs 多台机器人的数据

想象你在学开车。方案 A:你只在一辆车上练,把这辆车的方向盘手感、油门响应、刹车行程全部练到肌肉记忆。方案 B:你轮流在轿车、SUV、卡车、面包车上练,每辆车的手感都不同,但你学会了一种更通用的"驾驶能力"——给你一辆没开过的车,你也能很快上手。

方案 A = 单本体路线,方案 B = 跨本体路线。

单本体路线的代表:BridgeData V2(只用 WidowX)、DROID(只用 Franka)、LIBERO(只用仿真 Franka)。这些数据集的优势是数据一致性高——所有轨迹来自同一种机器人,动作空间、传感器配置、控制频率完全统一,模型训练时不需要处理异构数据。

跨本体路线的代表:OXE(22 种机器人)。它的核心假设是:不同机器人之间的操作知识可以迁移——"抓杯子"的动作在 WidowX 和 Franka 上执行方式不同,但"识别杯子"、"规划接近路径"、"判断抓取成功"这些高层知识是共享的。

Trade-off:数据一致性 vs 形态多样性

单本体的优势是"纯净"。BridgeData V2 的 60K 条轨迹全部来自 WidowX,动作空间是统一的 7 维关节角度,模型不需要学习"不同机器人有不同的动作空间"这件事。训练更简单,下限更高——不会出现"混淆不同机器人动作空间"的负迁移。

跨本体的优势是"广度"。OXE 包含了从单臂机械臂到双臂机器人、从夹爪到灵巧手的多种形态。如果模型能从这些异构数据中学到通用的操作表征,它就有了"零样本迁移"到新机器人上的潜力——不需要在新机器人上采集任何数据就能控制它。

但跨本体的风险是负迁移(negative transfer):某些机器人的数据混在一起不仅没有帮助,反而会降低性能。21.6.3 节会详细讨论 OXE 的正迁移/负迁移实验。

实证结果:正迁移 vs 负迁移

OXE 的 RT-1-X 实验给出了关键的实证数据:

  • 正迁移:用 22 种机器人的混合数据训练的 RT-1-X,在 WidowX 上的成功率比只用 WidowX 数据训练的 RT-1 高出约 50%。说明跨本体数据确实带来了增益
  • 负迁移:某些特定组合下,混入异构数据反而降低了性能。例如,把双臂机器人的数据混入单臂机器人的训练集,成功率下降了约 10%。原因可能是动作空间的维度差异(7 维 vs 14 维)导致模型产生了混淆

RT-2-X 进一步发现:跨本体的正迁移在"语义理解"层面最为显著——RT-2-X 能理解从未见过的指令("把 Taylor Swift 的图片拿起来"),这是单本体训练绝对做不到的。但在"精细控制"层面,跨本体数据的增益有限——精细控制仍然需要目标本体的真机数据。

踩坑提醒:不要以为"数据越多越好,混在一起就行"。OXE 的实验明确显示,盲目混合所有数据可能不如精心挑选数据。在 21.6.3 节中我们会看到,哪些跨本体组合是有益的,哪些是有害的。

未来趋势:跨本体是大势,但需要更好的动作空间归一化

当前的跨本体数据集(主要是 OXE)用 RLDS 格式统一了数据存储,但动作空间的归一化仍然是一个未解决的难题。7 维关节角度和 7 维末端位姿虽然都是 7 维向量,但物理含义完全不同。Franka 的关节角度范围是 [-2.9, 2.9] 弧度,WidowX 的关节角度范围是 [-π, π]——直接拼接在一起训练,模型很难区分哪个维度属于哪种机器人。

RLDS(Reinforcement Learning Datasets)格式是 OXE 团队提出的统一数据存储规范。它解决了"不同数据集用不同格式"的工程问题——之前 BridgeData V2 用 RLDS,DROID 用 HDF5,RH20T 用自定义格式,每个数据集都需要单独写数据加载器。RLDS 把所有数据集统一到一个 TensorFlow Dataset 格式下,使得跨数据集训练的代码量从"每个数据集写一个加载器"变成了"所有数据集共用一个加载器"。

但 RLDS 只解决了存储格式的统一,没有解决语义格式的统一。两个数据集都是 RLDS 格式,但一个的动作是关节角度(7 维),另一个的动作是末端位姿增量(7 维)——数据加载器不报错,但模型拿到的是语义不一致的输入。这就是"负迁移"的工程根源之一。

未来的解决方案可能包括:

  • 通用动作表示:把所有动作映射到一个与本体无关的通用空间(如末端执行器的相对位姿变化)。Octo 部分采用了这个思路——它把不同机器人的动作统一归一化到 [-1, 1] 范围内,但这只是数值层面的归一化,语义层面的统一仍然缺失
  • 本体条件化:给模型输入一个"我是哪种机器人"的标识,让模型根据本体调整动作生成。RT-1-X 和 RT-2-X 在输入中加入了机器人类型的 embedding,让模型知道当前在控制哪种机器人——这是一个简单但有效的临时方案
  • 分层策略:高层策略输出与本体无关的"意图"(如"抓取杯子"),低层策略将"意图"翻译为具体的关节角度。这和 Ch10 中 SayCan 的"高层规划 + 低层执行"架构异曲同工,只不过这里的"低层"是针对每种本体单独训练的

21.5.3 视觉 vs 多模态

大多数数据集:纯 RGB + 本体感受

回顾一下 21.1-21.4 介绍的 12 个数据集,你会发现一个规律:绝大多数数据集的感知输入只有两种——RGB 图像本体感受(关节角度、夹爪状态)。

这不是偶然。RGB 相机是最便宜、最通用、最容易部署的传感器——一个 USB 摄像头几十美元就能买到,不需要标定,即插即用。本体感受是机器人自带的——关节编码器和力矩传感器是工业机器人的标配,不需要额外安装。

这两种信号的组合(RGB + proprioception)已经能解决大部分操作任务:看懂场景(RGB)、知道自己的状态(proprioception)、输出动作——形成了 VLA 的标准输入范式。从 Ch11 的 RT-1/RT-2 到 Ch12 的 OpenVLA/Octo,所有主流 VLA 都采用了这个输入范式。

但"大部分"不等于"全部"。有一类任务,纯视觉+本体感受的组合是明显不够的——凡是需要接触力反馈非视觉状态判断的任务,VLA 就像一个闭着眼睛端咖啡的人——只知道去端,不知道端得稳不稳。

RH20T:加入力/力矩和音频

但有些任务光靠"看"和"感知自身"是不够的。比如:

  • 拧螺丝:你需要知道螺丝有没有拧紧——这靠力/力矩传感器来判断,而不是靠眼睛看
  • 倒水:你需要知道水什么时候倒满了——靠听水声的变化比靠看水面高度更可靠
  • 材质判断:敲一下物体听声音,比看外观更能判断材质

RH20T 是目前唯一一个大规模包含力/力矩和音频信号的操作数据集。它采集了 110K 条轨迹,每条轨迹同时记录了 RGB-D 图像、6 维力/力矩传感器数据、双耳麦克风音频、以及语言标注。

让我们用一张表格对比不同数据集的模态覆盖情况,直观地展示 RH20T 的独特性:

模态 OXE DROID BridgeData V2 RH20T LIBERO RoboCasa
RGB
深度 部分 - -
本体感受
语言
力/力矩 - - - - -
音频 - - - - -

从表中可以看出,除了 RH20T 之外的所有数据集都只覆盖了"视觉+本体感受+语言"三种模态。RH20T 多出的力/力矩和音频两列,正是它在数据集生态中不可替代的原因。

为什么多模态数据采集这么难

既然多模态数据这么有用,为什么只有 RH20T 一个数据集做了?答案是:传感器同步、标定和噪声三大工程难题。

同步问题:RGB 相机跑 30Hz,力传感器跑 500Hz,麦克风跑 44100Hz。三种传感器的时间戳必须精确对齐——否则你看到的画面和感受到的力可能差了几十毫秒,对需要精细力控的任务(如插入、拧螺丝)这是致命的。多传感器的时间同步需要硬件触发线(hardware trigger),不是简单的软件同步能解决的。

标定问题:力/力矩传感器安装在哪里?腕部(wrist-mounted)还是基座(base-mounted)?每种安装方式的力读数含义不同,需要精确的外力标定(把重力、惯性力从读数中扣除)。音频的麦克风位置和方向也会显著影响录到的声音特征。

噪声问题:力传感器受电机振动影响——机械臂运动时的电机嗡嗡声会叠加在力信号上,需要滤波。音频在工业环境中受背景噪声影响——空调声、气动阀门声、其他设备运转声都会污染语音和环境音信号。

这些工程难题使得多模态数据采集的成本是纯 RGB 采集的 3-5 倍。RH20T 团队花了大量精力解决同步和标定问题——这也是为什么它是 2023 年唯一的大规模多模态操作数据集,至今(2025 年)仍然没有出现同等规模的竞品。

多模态数据集的下游价值

尽管采集困难,多模态数据的下游价值是明确的:

  • 力觉Ch18 中讨论的触觉感知(如 Sparsh 触觉编码器)正在证明,接触力信息对精细操作任务(插入、装配、柔软物体处理)至关重要。RH20T 的力/力矩数据为训练力觉感知模型提供了宝贵资源
  • 音频Ch20 详细讨论了听觉智能——从判断水是否沸腾到检测机器故障,声音信号携带了视觉无法获取的信息。RH20T 的音频数据是训练听觉感知模型的少数可用资源之一
  • 深度:DROID 和 RH20T 都包含深度图。深度信息在透明物体、低纹理表面、遮挡场景中提供了 RGB 无法替代的 3D 几何信息

初学者常见误解:"多模态就是多加几个传感器。"事实是:数据采集只是第一步,真正的挑战在于多模态信息的融合策略——如何在时间上对齐、在空间上配准、在语义上互补?这和 Ch18 中 ImageBind 讨论的模态对齐是同一个问题的不同层面。

未来:触觉可能成为下一个加入的模态

Ch18 中的 Sparsh 触觉编码器展示了触觉感知的潜力:它能从 GelSight 触觉传感器的高分辨率接触图像中提取通用触觉表征,并迁移到不同的触觉传感器和下游任务上。如果 Sparsh 的思路被验证成功,触觉可能成为继力觉和音频之后,下一个被大规模采集的模态。

但触觉的数据采集面临更严峻的挑战:触觉传感器(如 GelSight、DIGIT)的覆盖范围极小(通常只有指尖大小),每个手指需要单独的传感器和数据采集通道。一个三指机械手就需要三个独立的触觉传感器同步采集——硬件复杂度远超力传感器和麦克风。


21.5.4 数据集 vs 基准

"训练食材" vs "评测尺子"

这是最容易被忽略、但影响最深远的区分。

想象你要写一本烹饪教材。你需要两类东西:一是食材——各种蔬菜、肉类、调料,量越大、种类越多越好,这是你教学生做菜的原材料。二是考试标准——"宫保鸡丁必须在 8 分钟内完成、花生必须酥脆、鸡肉必须嫩滑",这是你检验学生水平的尺子。

你不能用"食材"当"尺子"——"我用了 500 种食材教学生,所以学生一定做得好"?不一定。你也不能用"尺子"当"食材"——"我让学生反复做考试那三道菜,他们就只会做那三道菜"。

数据集和基准的区分完全一样:

食材型数据集:大规模、多样性高、用于预训练。典型代表是 OXE(1.6M 轨迹,22 种机器人)、DROID(76K 轨迹,564 场景)、BridgeData V2(60K 轨迹,24 环境)。这些数据集的目标是"喂给模型足够多足够杂的数据,让模型学到通用的操作表征"。

尺子型基准:标准化、评测严格、用于横向对比。典型代表是 Meta-World(50 个任务、5 个难度层级)、RLBench(100 个任务、标准化评测协议)、LIBERO(130 个任务、4 套解耦评测 suite)、CALVIN(34 个任务、长序列评测协议)。这些数据集的目标是"给所有模型同一张考卷,谁的分数高谁更强"。

尺子型基准之所以能做"尺子",是因为它们在三个层面做了严格的标准化:

  1. 任务定义标准化:每个任务有明确的初始状态、目标条件、成功判定标准。Meta-World 的每个任务都指定了物体的初始位置(在半径 0.2m 的圆内随机)、目标位置、成功距离阈值(通常 0.05m)
  2. 评测协议标准化:评测次数(通常每个任务 25 或 50 次试验)、随机种子、评价指标(success rate、路径效率等)都有统一规定。RLBench 要求评测 25 次取平均,CALVIN 要求评测 1000 次取统计显著性
  3. 环境控制标准化:物理参数(重力、摩擦、阻尼)、渲染参数(光照、纹理)、传感器参数(相机位姿、噪声模型)都固定。两个不同实验室用同一个 benchmark,跑出来的分数可以直接对比

双栖型:RoboCasa 既提供大规模仿真数据(100K+ 轨迹、120 个厨房场景),又有标准化的评测基准——你可以在 RoboCasa 数据上预训练,然后在 RoboCasa benchmark 上评测。

为什么这个区分重要

混淆这两类数据集会导致两个常见错误:

错误一:用尺子当食材。如果你的预训练数据只来自 LIBERO 的 130 个任务,模型学到的只是这 130 个任务的"应试技巧",迁移到新任务上的能力很弱。这就像只让学生做考试题——考试成绩很高,但换个没见过的菜就不会做了。

错误二:用食材当尺子。如果你在 OXE 的 1.6M 轨迹上评测两个模型,你无法得出"谁更强"的结论——因为 OXE 的任务分布不均匀(某些机器人/任务的数据远多于其他),评测结果被数据分布偏差严重扭曲。这就像用"谁用的食材多"来评判厨师水平——完全没有参考价值。

错误三:用尺子训练、用尺子评测——"过拟合到评测集"。这是最隐蔽的错误。如果你在 Meta-World 的 50 个任务上训练,又在 Meta-World 的 50 个任务上评测,你当然得到了很高的分数——但这就像让学生做考试题学习、又用同一套考试题测试,分数高并不代表真正的能力。正确的做法是:训练和评测使用不同的任务集合(hold-out),或者用零样本迁移到全新的任务上评测。

踩坑提醒:很多 VLA 论文会在 OXE 数据上"评测"自己的模型,报告一个 aggregate success rate。这个数字可以作为参考,但不能作为严格的横向对比依据——因为评测集的任务分布、数据质量、甚至标注方式都不统一。严格对比应该在标准 benchmark(如 LIBERO、CALVIN)上进行。

类比总结:"食谱合集" vs "米其林评审标准"

特征 食材型数据集 尺子型基准
目标 提供训练资源 提供评测标准
规模 大(万~百万级) 适中(百~千级)
多样性 越多越好 精心设计
评测协议 无或不严格 严格统一
典型用途 预训练 横向对比
代表 OXE, DROID, BridgeData V2 Meta-World, RLBench, LIBERO, CALVIN

21.5.5 综合横切对比大表

下面这张表把 14 个数据集在四个维度上同时展开。每个维度用简短标记表示,便于快速对比:

数据集 真机/仿真 单本体/跨本体 视觉/多模态 食材/尺子
OXE 真机 跨本体(22 种) RGB+state+lang 食材
DROID 真机 单本体(Franka) RGB+depth+state+lang 食材
BridgeData V2 真机 单本体(WidowX) RGB+state+lang 食材
RH20T 真机 多本体 RGB-D+force+audio+lang 食材
LIBERO 仿真 单本体(Franka) RGB+state+lang 尺子
CALVIN 仿真 单本体(Franka) RGB+proprio+lang 尺子
RoboCasa 仿真 单本体(RoboSuite) RGB-D+state+lang 双栖
RoboMimic 仿真(+少真机) 单本体 State/image+action 尺子
RLBench 仿真 单本体(Franka) RGB+depth+seg+state+lang 尺子
BEHAVIOR-1K 仿真 多本体 RGB-D+state+BDDL 尺子
Meta-World 仿真 单本体(Sawyer) State(39d)+action(4d) 尺子
ManiSkill 仿真 多本体 State/PC/RGBD 尺子
SimplerEnv 仿真 多本体(对齐真机) RGB-D+proprio 尺子(代理)
Octo 混合 跨本体 Image+lang+proprio 食材+模型

从这张表可以读出几个关键模式:

  1. 真机数据集几乎都是食材型——采集真机数据成本太高,不可能做到严格的标准化评测
  2. 仿真数据集几乎都是尺子型——仿真可以精确控制条件,天然适合做评测
  3. 跨本体和真机高度相关——真机采集的异构数据(OXE)是跨本体的主要来源
  4. 多模态数据极度稀缺——只有 RH20T 包含了力觉和音频,其余都是视觉+本体感受
  5. 双栖型数据集极其罕见——RoboCasa 是少数兼具食材和尺子属性的数据集

这些模式不是偶然的,而是由每个维度的 trade-off 逻辑决定的:真机采集成本高 → 只能采大量数据做食材,不能严格标准化做尺子;仿真条件可控 → 天然适合做尺子,但数据有 sim-to-real gap 做食材效果打折。

如何使用这张表

这张表不仅是一个参考,更是一个决策工具。当你面临"选哪个数据集"的问题时,可以按以下流程使用:

  1. 先确定目标:你是要预训练模型(需要食材),还是要评测模型(需要尺子),还是要两者兼顾(需要双栖型)?
  2. 再确定环境:你有真机吗?如果有,可以考虑真机数据集;如果没有,只能在仿真数据集里选
  3. 然后确定本体:你要在一种机器人上做实验(单本体),还是跨多种机器人(跨本体)?
  4. 最后确定模态:你的任务需要力觉/音频吗?如果不需要,纯视觉数据集足够;如果需要,目前只有 RH20T 可选

举个例子:你想在 Franka 上训练一个桌面操作的 VLA,但没有真机。按流程走:目标=预训练 → 环境=仿真 → 本体=单本体(Franka)→ 模态=视觉。查表发现 LIBERO、CALVIN、RLBench 都符合条件。如果要评测,选 LIBERO(有解耦评估)或 CALVIN(有长序列评测);如果要训练,选 RoboCasa 的数据(虽然是 RoboSuite 不是 Franka,但桌面操作场景高度重叠,21.5.2 节讨论的正迁移应该会起作用)。


21.6 评估基础设施:从数据集到"数据集能告诉我们什么"

21.5 节从四个维度横向对比了所有数据集。但有一个问题还没有回答:数据集本身不能告诉我们"模型到底有多好"。你需要一套评估基础设施——在数据集上跑实验、算指标、得出可比较的结论。

这就像学校里有教材(数据集)还需要有考试和评分标准(评估基础设施)。光有教材不行——你不知道学生学到了什么程度。光有评分标准也不行——没有教材你无从教起。两者缺一不可。

本节介绍三种不同哲学的评估基础设施:SimplerEnv 追求"仿真分数和真机分数对齐"、LIBERO 追求"不同类型的知识被分别评估"、OXE 追求"跨本体迁移到底是正还是负"。


21.6.1 SimplerEnv——仿真评测与真机对齐

核心理念:"对齐 > 真实"

Ch17 讲了 sim-to-real gap 的三种来源(物理参数差异、传感器差异、执行延迟差异)和三种应对策略(高保真仿真、域随机化、非对称训练)。SimplerEnv 不是第四种策略——它解决的是一个不同的问题:

不追求让仿真更逼真,而是让仿真里的评测分数和真机评测分数高度相关。

类比:手机评测的跑分软件。跑分高不等于手机一定好用——但你观察到一个规律:跑分排名和实际体验排名高度相关。跑分第 1 的手机大概率体验也是第 1;跑分第 5 的大概率体验也是第 5。跑分不是"真实体验",但它是"真实体验的可靠代理"。

SimplerEnv 就是 VLA 的跑分软件。你不需要搬真机器人出来测试——在电脑里跑仿真就能给 VLA 打分,分数和真机测试几乎一样准。

目前 SimplerEnv 已经支持对 Google Robot 和 WidowX 两种真机平台的 VLA 评测代理。它基于 DM Control(DeepMind Control Suite)和 ManiSkill2 仿真器构建,提供了与真机环境在视觉和物理上对齐的仿真场景。对每个真机评测任务,SimplerEnv 提供了对应的仿真版本——包括相同的物体布局、相机视角、光照条件。

两种评测模式

SimplerEnv 提供了两种评测模式,对应两种不同的需求:

Visual Matching 模式:仿真渲染的图像尽量接近真实相机拍到的画面。具体做法是:调整仿真中相机的位置、角度、焦距,使其与真机相机参数匹配;调整光照条件,使仿真图像的亮度和色温接近真机;调整物体纹理,使其与真实物体外观一致。

这种模式的评测结果和真机评测的 Pearson 相关系数 通常在 0.85-0.95 之间——非常高的线性相关性。也就是说,Visual Matching 模式下的成功率和真机成功率几乎是一一对应的线性关系。

Variant Aggregation 模式:在 Visual Matching 的基础上加入域随机化(domain randomization)。随机变化光照强度、物体颜色、相机角度、摩擦系数等参数,然后对多次随机变体的评测结果取平均。

这种模式的评测结果和真机的 Spearman 秩相关系数 通常在 0.90-0.98 之间——排名相关性极高。Variant Aggregation 不追求绝对分数一致(仿真里的 60% 成功率不一定对应真机的 60%),但追求排名一致——仿真里 A 比 B 好,真机里 A 大概率也比 B 好。

两种模式的选择取决于你的需求:

需求 推荐模式 原因
预测真机的绝对成功率 Visual Matching Pearson 相关性高,分数可以直接映射
对比两个模型的相对优劣 Variant Aggregation Spearman 相关性高,排名更稳定
评测鲁棒性 Variant Aggregation 域随机化考验模型在各种干扰下的表现
快速筛选候选模型 Visual Matching 计算量更小,单次评测更快

Pearson vs Spearman:两种相关性指标

这里需要区分两种相关性指标,因为 SimplerEnv 同时报告了两者:

Pearson 相关系数衡量的是两组数据的线性相关性。如果仿真分数是 X,真机分数是 Y,Pearson r 接近 1 意味着 Y ≈ aX + b(一条直线)。这是最直觉的相关性——仿真 60% 对应真机 60%,仿真 80% 对应真机 80%。

Spearman 秩相关系数衡量的是两组数据的排名相关性。它不关心绝对数值,只关心排名——仿真里第一名是不是真机里也是第一名?Spearman ρ 接近 1 意味着排名几乎一致,即使绝对分数有偏移。

举个例子:五个模型在仿真里的成功率是 [90%, 75%, 60%, 45%, 30%],真机里是 [85%, 70%, 50%, 40%, 25%]。Pearson r 可能只有 0.99(因为线性关系很好),Spearman ρ 是 1.0(排名完全一致)。但如果仿真分数是 [90%, 75%, 60%, 45%, 30%],真机分数是 [30%, 45%, 60%, 75%, 90%](完全反序),Pearson r 会接近 -1,Spearman ρ 也是 -1。

对 VLA 评测来说,Spearman 比 Pearson 更实用——因为我们更关心"哪个模型更好"(排名),而不是"仿真 60% 到底对应真机 60% 还是 55%"(绝对值)。

物理参数回调的工程细节

SimplerEnv 的"对齐"不是自动的——它需要人工调整仿真器的物理参数,使得仿真评测分数和真机评测分数对齐。这个过程被团队形容为"像调钢琴一样调摩擦系数"。

具体来说,需要回调的参数包括:

  • 摩擦系数:仿真器默认 0.7-1.0,真实桌面可能是 0.3-0.8。调整到使得仿真中的抓取成功率和真机一致
  • 阻尼系数:关节阻尼影响动作的平滑程度。过高则仿真中动作"发黏",过低则"发飘"
  • 接触阈值:判断"物体是否被抓住"的力阈值。仿真中接触力的计算方式和真机力传感器不同,需要校准
  • 渲染参数:光照方向、环境光强度、阴影模式——这些影响 VLA 的视觉输入质量

每个参数的调整都需要一个"回调循环":在仿真里跑评测 → 和真机分数对比 → 调参数 → 再跑 → 再对比 → 直到相关性满足要求。SimplerEnv 论文报告了这个过程大约需要 2-3 天的手动调参,之后同一个环境就不需要再调了。

对 VLA 评测的变革意义

在 SimplerEnv 出现之前,评测一个 VLA 模型的流程是这样的:

  1. 把模型部署到真机器人上(需要物理访问权限)
  2. 在 10-20 个任务上各跑 25 次试验(每个任务约 30 分钟)
  3. 手动记录每次试验的成功/失败
  4. 总共需要 2-3 天的实验室时间 + 一台价值 5 万美元的机器人

SimplerEnv 把这个流程变成了:

  1. 在电脑上运行 python -m simpler_env.evaluate --policy-path xxx
  2. 30 分钟内得到所有任务的评测结果
  3. 不需要物理访问任何机器人

SimplerEnv 的 TL;DR:不用搬真机器人,在电脑里就能给 VLA 打分,分数和真机几乎一样准。

这个变革的影响是深远的:以前只有有大机器人的实验室才能做 VLA 评测,现在任何有 GPU 的人都能做。评测民主化意味着更多的研究者可以参与 VLA 的迭代优化,加速整个领域的进步。

SimplerEnv 的局限

公平起见,也要指出 SimplerEnv 的三个局限:

  1. 覆盖范围有限:目前只支持 Google Robot 和 WidowX 两种机器人。Franka、UR5 等主流研究平台尚未被覆盖。扩展到新机器人需要重新进行物理参数回调——每个新平台又要花 2-3 天调参
  2. 只评测"成功/失败",不评测"做得好不好":SimplerEnv 的评测指标是二元成功(success rate),不衡量轨迹质量(如路径是否平滑、动作是否高效)。两个模型都 80% 成功率,一个动作丝滑一个动作抖动——SimplerEnv 区分不出来
  3. 对视觉依赖强的任务更有效:SimplerEnv 的对齐主要在视觉和物理参数层面。对于需要精细力控的任务(如插孔、拧螺丝),仿真的力反馈和真机差异更大,SimplerEnv 的代理准确性会下降

尽管有这些局限,SimplerEnv 仍然是当前 VLA 评测领域最重要的基础设施之一——它第一次让"没有真机的研究者也能做有意义的 VLA 评测"成为现实。


21.6.2 LIBERO 的知识类型解耦评估

四套 suite 分别测什么

SimplerEnv 解决的是"在仿真里评测是否可靠"的问题。LIBERO 解决的是另一个问题:不同类型的知识是否以不同速率被学习和遗忘?

LIBERO 设计了四套评测 suite,每套隔离一种类型的知识变化:

Suite 测什么 典型任务 核心认知能力
LIBERO-Spatial "放在哪里" 同一物体,不同目标位置 空间推理
LIBERO-Object "用什么" 同一任务,不同物体 物体泛化
LIBERO-Goal "做什么" 同一场景,不同目标 任务泛化
LIBERO-100 "连续做多步" 长序列,10 步组合 长时规划

这四套 suite 的设计哲学是"解耦"——就像考试不光看总分,还要看阅读理解扣了几分、数学扣了几分、物理扣了几分。总分一样 80 分,A 是"数学 100 阅读 60",B 是"数学 60 阅读 100"——两人的能力结构完全不同,需要不同的后续学习策略。

为什么"解耦"很重要

不同的知识类型有不同的学习曲线和遗忘曲线。LIBERO 的实验揭示了一个反直觉的发现:

  • 空间知识(放在哪里)学习最快、遗忘也最快——因为空间推理更多依赖感知,较少依赖长期记忆
  • 目标知识(做什么)学习最慢、但一旦被新的目标覆盖就最容易被遗忘——因为任务语义需要更深层的理解
  • 物体知识(用什么)介于两者之间——新物体的泛化能力取决于训练集中物体分布的多样性
  • 长时规划(连续多步)是最难的——因为它需要前三种知识的组合,任何一环出错都会导致整个序列失败

如果你只看一个总分(如"LIBERO 平均成功率 60%"),你完全不知道这 60% 是怎么来的——是空间推理拉了后腿?还是长时规划拖了后腿?解耦评估告诉你答案,让你可以针对性地改进模型。

举一个具体的例子来说明解耦的价值:假设两个 VLA 模型在 LIBERO-100 上的平均成功率都是 60%。但解耦评估揭示了截然不同的能力结构:

模型 Spatial Object Goal Long-horizon 平均
VLA-A 90% 80% 40% 30% 60%
VLA-B 50% 50% 70% 70% 60%

两个模型平均分一样,但能力结构完全不同。VLA-A 擅长空间推理和物体泛化,但目标理解和长时规划薄弱——它"看得懂但想不明白"。VLA-B 恰好相反——它"想得明白但看不准"。改进策略也完全不同:VLA-A 需要更强的语言理解能力(提升 Goal score),VLA-B 需要更好的视觉编码器(提升 Spatial score)。如果只看平均分,你可能给两个模型开出同样的"药方"——这显然是错的。

FWT 和 BWT 指标

LIBERO 评测的另一个创新是引入了终身学习(lifelong learning)的两个核心指标:

FWT(Forward Transfer,前向迁移):学习任务 B 之后,在任务 A 上的表现有没有提升?如果提升了,说明 B 的知识正向迁移到了 A。FWT > 0 表示正迁移,FWT < 0 表示负迁移。

BWT(Backward Transfer,后向迁移):学习任务 B 之后,在任务 A 上的表现有没有下降?如果下降了,说明学 B 的过程中"遗忘"了 A 的知识。BWT < 0 就是灾难性遗忘(catastrophic forgetting)——终身学习最核心的敌人。

理想情况:FWT > 0 且 BWT ≥ 0——新任务不仅没有让旧任务变差,反而帮助了旧任务。这就是为什么跨本体数据在 OXE 实验中有时能提升单本体性能——不同任务/本体之间的共享知识形成了正迁移。

最差情况:FWT < 0 且 BWT < 0——新任务既没有帮助旧任务,还让旧任务变差了。这就是灾难性遗忘 + 负迁移的双重打击。

用一个具体数字来说明:假设模型按顺序学习了 LIBERO-100 中的 10 个任务。学完第 10 个任务后,第 1 个任务的成功率从 90% 降到了 40%(BWT = -50%),但第 5 个任务的成功率从 60% 升到了 75%(FWT = +15%)。如果你只看第 10 个任务的成功率 85%,你会觉得"模型很强";但 BWT 暴露了严重遗忘,FWT 暴露了不均匀迁移——这些信息在单一的 success rate 中完全丢失。

实际使用中的偏差

尽管 LIBERO 设计了精细的解耦评估和 FWT/BWT 指标,但实际使用中存在一个普遍的偏差:

大多数 VLA 论文只报告 LIBERO 的 success rate,忽略 FWT/BWT 指标。

这就像一个学生只报总分,不报各科分数——你不知道他的能力结构。为什么会出现这个偏差?原因有三:

  1. 报告惯例:早期 VLA 论文(RT-1、RT-2)只报 success rate,后续论文跟随了这个惯例
  2. 计算成本:FWT/BWT 需要在学习每个新任务前后都评测所有旧任务,计算量是只报最终 success rate 的 N 倍(N = 任务数)
  3. 结果不够"好看":FWT/BWT 往往暴露了模型的弱点(如 BWT < 0 表示有遗忘),研究者自然倾向于不报告

但这个偏差的代价是严重的:如果所有人都只看 success rate,整个领域就会朝着"刷分"的方向发展——在特定任务上反复优化以获得更高的成功率,而忽略了终身学习能力的培养。LIBERO 的设计初衷恰恰是为了防止这种"应试"倾向。

踩坑提醒:如果你在论文中使用了 LIBERO,请务必报告四套 suite 的分别成绩和 FWT/BWT 指标。只报一个 aggregate success rate 是对 LIBERO 设计思想的浪费。


21.6.3 OXE 的正迁移 vs 负迁移实验

RT-1-X / RT-2-X 的关键实验

21.5.2 节提到了 OXE 的跨本体迁移 trade-off,但没有展开实验细节。这里我们深入分析 RT-1-X 和 RT-2-X 的迁移实验——它们是目前为止最大规模的跨本体迁移实证。

RT-1-X 实验:Google 团队在 OXE 的 22 种机器人数据上训练了 RT-1-X,然后在 5 种目标机器人上评测。关键发现:

  • 在 5 种目标机器人中的 4 种上,RT-1-X 的成功率高于只用目标机器人数据训练的 RT-1。正迁移!
  • 在第 5 种目标机器人上,RT-1-X 的成功率低于只用目标机器人数据训练的 RT-1。负迁移!
  • 平均来看,跨本体预训练带来了约 50% 的相对提升

RT-2-X 实验:更强大的 RT-2-X 在跨本体数据上展现了涌现能力(emergent capabilities)——它能执行从未在训练数据中出现过的指令,如"把 Taylor Swift 的图片拿起来"。这种语义理解能力来自 RT-2 的 VLM 预训练,而 OXE 的跨本体数据让这种语义理解能力得以在多种机器人上落地。

哪些跨形态迁移有用,哪些反而伤害性能

RT-1-X 的实验提供了具体的正迁移和负迁移案例:

正迁移案例

  • WidowX 的桌面操作数据帮助了 Franka 的桌面操作——因为两种机器人面对的场景(桌面上的小物体操作)高度重叠
  • 不同视角的同一任务数据帮助了新视角下的同一任务——因为视觉表征可以共享

负迁移案例

  • 双臂机器人数据混入单臂机器人训练,成功率下降——7 维动作空间和 14 维动作空间的维度差异导致模型混淆
  • 移动机器人(如 Kuka iisy 的全向移动 + 操作)数据混入固定底座机械臂训练,成功率下降——移动带来的视角变化和固定底座的固定视角是本质不同的视觉模式

把这些案例整理成一张正/负迁移速查表:

源本体 目标本体 迁移方向 效果 可能原因
WidowX(桌面操作) Franka(桌面操作) 提升 ~30% 场景高度重叠,视觉知识共享
不同视角同一任务 新视角 提升 ~20% 视角不变的视觉表征
双臂机器人 单臂机器人 下降 ~10% 动作空间维度不匹配(14d vs 7d)
移动机器人 固定底座机械臂 下降 ~15% 视觉模式本质不同
Franka(操作) Franka(操作) 基线 同本体,无迁移问题

形态差异 vs 任务差异——哪个影响更大

OXE 的实验揭示了一个重要发现:任务差异对迁移的影响远大于形态差异

用一个 2x2 矩阵来可视化这个发现:

同一任务 不同任务
同一形态 基线(无迁移问题) 中等迁移(运动模式共享,视觉模式不同)
不同形态 正迁移(视觉+语义知识共享) 最差迁移(双重差异叠加)

注意到一个反直觉的结论:"同一任务、不同形态"比"不同任务、同一形态"迁移效果更好。为什么?因为"同一任务"意味着视觉场景高度重叠(同样的物体、布局、光照),模型学到的视觉特征可以直接复用——而视觉特征是 VLA 的核心能力。Ch11 中 RT-1 的 FiLM-EfficientNet 视觉编码器就证明了:视觉表征的质量直接决定了动作预测的精度。

具体来说:

  • 同一任务、不同形态:如"抓杯子"在 WidowX 和 Franka 上的数据,正迁移效果显著。虽然动作执行方式不同(关节角度不同),但"识别杯子"、"规划接近路径"等视觉和语义知识完全共享
  • 不同任务、同一形态:如"抓杯子"和"开门"在 Franka 上的数据,迁移效果中等。视觉和运动模式差异较大,但本体感受的分布是共享的
  • 不同任务、不同形态:如"抓杯子"在 WidowX 上和"开门"在双臂机器人上,迁移效果最差。两种差异叠加,模型几乎无法找到共享结构

这个发现对"大一统模型"的启示是:跨本体迁移的成功与否,主要取决于任务层面的语义重叠,而非形态层面的硬件相似度。如果两个机器人的操作场景高度重叠(如都在桌面上操作小物体),即使硬件完全不同,跨本体迁移也大概率是正的。

对"大一统模型"的启示

"不是所有数据混在一起就更好。"

这是 OXE 实验最核心的 takeaway。大一统模型(如 RT-X 系列)的愿景是一个模型控制所有机器人——但实验表明,盲目混合所有数据不如精心选择与目标任务相关的数据。

这和 Ch11 中讨论的 RT-2 的 co-fine-tuning 策略异曲同工:RT-2 在微调时同时保留 VLM 的网络知识问答能力和机器人控制能力,而不是"只学机器人控制"——后者会导致网络知识被遗忘。同样,跨本体预训练需要保留与目标任务相关的知识、过滤掉可能造成干扰的知识,而不是一股脑全混进去。

Ch12 中 OpenVLA 的训练策略也体现了这个思想:它虽然用了 OXE 的 970K 轨迹,但不是所有数据都被等权重对待——经过筛选和加权,确保预训练数据分布与下游评测任务的分布有足够的重叠。


21.7 通向下一章

本章总结

Ch21 回答了一个看似简单、实则深刻的问题:训练具身 AI,到底喂什么数据?

我们从 12 个数据集的纵向精读开始,理解了每个数据集的设计动机、核心特征、优势与局限。然后用四个横切维度(真机 vs 仿真、单本体 vs 跨本体、视觉 vs 多模态、数据集 vs 基准)把所有数据集拉到同一张表上比较,揭示了每个维度背后的 trade-off。最后深入三种评估基础设施(SimplerEnv 的仿真-真机对齐、LIBERO 的知识解耦评估、OXE 的正/负迁移实验),理解了"数据集能告诉我们什么"和"数据集不能告诉我们什么"。

回顾本章的三个核心部分:

**Part 1(21.1-21.4)**的纵向精读让我们理解了每个数据集的"个性"——OXE 是跨本体的野心家,DROID 是分布式采集的实践者,BridgeData V2 是 VLA 预训练的基石,RH20T 是多模态的先驱,LIBERO 是终身学习的考官,CALVIN 是长时规划的试金石,RoboCasa 是厨房场景的百科全书,其余经典数据集各司其职。

**Part 2(21.5)**的横切对比让我们看到了数据集设计空间的"地形图"——真机 vs 仿真是真实度与规模的 trade-off,单本体 vs 跨本体是一致性与多样性的 trade-off,视觉 vs 多模态是简便性与信息量的 trade-off,食材 vs 尺子是训练资源与评测标准的区分。理解了这些 trade-off,你就能根据具体需求选择合适的数据集,而不是盲目追求"最大""最新"。

**Part 2(21.6)**的评估基础设施让我们意识到"评测"和"训练"同等重要——SimplerEnv 打通了仿真评测与真机对齐,让没有真机的研究者也能做有意义的评测;LIBERO 的解耦评估让我们不只看总分还看能力结构;OXE 的迁移实验告诉我们"不是所有数据混在一起就更好"。

关键 Takeaway

数据集的规模决定了模型的上限,数据集的质量决定了模型达到上限的速度。

真机数据没有 sim-to-real gap,但规模受限于采集成本;仿真数据规模无限,但需要迁移策略才能部署到真机。混合策略(仿真预训练 + 真机微调)是当前最实用的路线。

跨本体迁移的成功与否,主要取决于任务层面的语义重叠,而非形态层面的硬件相似度。不是所有数据混在一起就更好。

数据集和基准是两种不同的东西:食材型数据集用于预训练,尺子型基准用于评测。用错了会误导研究方向。

评估基础设施与数据集同等重要。SimplerEnv 让 VLA 评测民主化,LIBERO 让知识评估精细化,OXE 让迁移实验可复现。

数据集趋势预判

基于 Ch21 的分析,我们预判未来数据集的四个发展方向:

1. 规模继续增长

OXE 1.6M 轨迹听起来很多,但和 NLP 领域的万亿 token 相比差了六个数量级。DROID 的 76K 轨迹只覆盖了 564 个场景——真实世界的场景多样性远不止于此。下一代数据集(如正在筹备中的 OXE 2.0 和 DROID 2.0)的目标是把规模再推一个数量级:OXE 2.0 可能达到 10M+ 轨迹,DROID 2.0 可能扩展到 5000+ 场景。规模增长的关键瓶颈不是计算,而是采集效率——如何让更多机构用更少的成本贡献更多数据。

2. 多模态扩展

RH20T 证明了力觉和音频对接触密集型任务的价值。下一代数据集中,力/力矩传感器可能成为标配(就像深度相机已经成为标配一样),音频采集可能从"少数数据集的特色"变成"大多数数据集的默认选项"。更远的未来,Ch18 中讨论的触觉感知(如 Sparsh 编码器)可能成为下一个被大规模采集的模态。

3. 自动化采集

RoboCasa 用 MimicGen 从少量人工演示自动生成了 100K+ 条轨迹,展示了"自动化采集"的可行性。下一代数据集可能不再完全依赖人工遥操作——RL 策略、脚本化策略、甚至 VLA 自身生成的轨迹都可能成为数据来源。但质量控制(如何确保自动生成的轨迹是正确的、多样化的)将成为新的核心挑战。

自动化采集有三种主要路线:

  • 脚本化策略生成:MimicGen 的方式——人工提供少量关键帧演示(通常 5-20 条),然后算法自动在新的物体位置和场景布局上插值生成新轨迹。优点是可控性强,缺点是生成的轨迹多样性受限于关键帧的空间分布
  • RL 策略生成:在仿真中用 RL 训练一个策略,让它自动采集轨迹。Ch16 中讨论的 PPO/SAC 训练的策略可以作为数据生成器。优点是策略可以探索到人工演示没有覆盖的状态空间,缺点是 RL 策略在早期训练阶段(成功率低时)会生成大量失败轨迹
  • VLA 自身生成:让已有的 VLA 模型(如 Octo、OpenVLA)在仿真或真机上执行任务,采集其生成的轨迹作为新模型的训练数据。这和 Ch14 中讨论的行为克隆(BC)的"自我蒸馏"思路类似——上一代模型的输出成为下一代模型的输入。风险是"错误累积"——如果 VLA 的成功率只有 70%,那么 30% 的训练数据是错误的

4. 评估基础设施与数据集同等重要

SimplerEnv 证明了一件事:评测和训练一样重要。如果一个领域只有好的训练数据但没有好的评测方法,研究者就无法判断哪种方法更好,整个领域的进步就会停滞。未来会看到更多像 SimplerEnv 这样专注于"评测对齐"的工作,也会看到 LIBERO 式的解耦评估被推广到更多场景。

预告 Ch22:实战指南

数据集回答了"喂什么",评测回答了"怎么量"。但一个完整的项目还需要回答:"怎么做"——从选数据集到训模型到测性能到部署真机,每一步的具体操作是什么?

Ch22 将是一份实战指南(Task 1 & Task 2),把前 21 章学到的知识落地。具体来说:

  • Task 1:基于仿真数据的 VLA 训练与评测——选数据集(OXE vs BridgeData V2)、配环境(RLDS 数据管线 + 训练超参)、训模型(从 RT-1 架构开始)、评测(LIBERO / CALVIN benchmark)、分析(正/负迁移、四类知识解耦)
  • Task 2:从仿真到真机的端到端部署——混合数据预训练 + 目标环境微调、SimplerEnv 代理评测、域随机化策略选择、真机评测协议

两个 Task 递进:Task 1 在纯仿真环境中完成,任何人有 GPU 就能做;Task 2 需要真机访问权限,但 SimplerEnv 可以让没有真机的人完成大部分评测工作。

如果你已经跟到了这里,Ch22 就是你把所有理论变成实践的地方。


上一章:Ch20: 听觉智能 | 下一章:Ch22: 实战指南 返回目录

本章涉及论文 18 篇

点击查看论文笔记全文,标有 的为已读。

№ 34 Datasets & Benchmarks · 前沿

DROID

№ 32 Datasets & Benchmarks · 经典

RH20T

№ 31 Datasets & Benchmarks · 经典

LIBERO

№ 26 Datasets & Benchmarks · 祖师爷

Meta-World

№ 27 Datasets & Benchmarks · 祖师爷

RLBench

№ 30 Datasets & Benchmarks · 经典

CALVIN

№ 36 Datasets & Benchmarks · 前沿

RoboCasa

№ 102 Simulation & Sim2Real · 经典

ManiSkill

№ 37 Simulation & Sim2Real · 前沿

SimplerEnv

№ 111 End-to-End VLA · 经典

Octo

№ 28 Datasets & Benchmarks · 祖师爷

robosuite

№ 47 Diffusion Policy · 前沿

π₀

№ 119 End-to-End VLA · 前沿

RDT-1B