Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Datasets & Benchmarks · Plate Nº 106

BridgeData V2

24 min read · 8439 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过机器人学习数据集"的读者的精读笔记。语言尽量像聊天,概念全部翻译成人话。

一句话讲什么(TL;DR)

BridgeData V2 是伯克利等校做的一份大规模真机操作数据集:用一台约 4000 美元、谁都买得到的 WidowX 机械臂,在 24 个环境里采了 60096 条轨迹、13 种技能。它专门设计成"多方法通用 + 跨环境跨机构泛化"——同一份数据能喂给 6 种主流学习算法(模仿学习、离线强化学习),训出的策略能在别的实验室零样本工作,而且数据越多、模型越大、技能越多样,效果越好。

所以这一节是想说:BridgeData V2 的核心就是"用平价机器人采一份人人能用、跨机构通用的大规模操作数据",把 NLP/CV 的"大数据 + 大模型"配方搬到机器人上。


这是个什么场景

想象你是个机器人学习研究者,想验证一个新算法。深度学习在 NLP 和 CV 上成功的配方很清楚:大数据 + 大模型 = 强泛化。机器人也想照抄这个配方:先采一大批机器人做事的示范,再用行为克隆或离线强化学习训个策略,让它泛化到各种任务和环境。

配方听起来简单,但采一份"好用"的机器人数据集极难,有几个坑:

  • 采集耗时,所以数据集必须能被别的实验室复用——不能只有采集者自己能用。
  • 要复用,数据就得覆盖足够多的任务和环境,否则别人得把自家场景布置得和你一模一样才能用。
  • 要支持灵活的任务指定(目标图像或语言指令),别人才能方便地让策略做新任务。
  • 每个环境里要有多种可能任务的数据,逼着多任务策略去"看任务指令"而不是"从画面猜任务"。

之前的数据集大多栽在这些坑上:要么只有一两个环境和任务(别人没法用)、要么用私有机器人(别人买不起)、要么只被一种方法验证过。

BridgeData V2 要解的题:能不能造一份大规模、多样、用平价公开机器人采集、支持多种学习方法、能跨实验室泛化的操作数据集?

所以这一节是想说:机器人想照搬"大数据大模型"配方,但缺一份"人人能用、跨环境通用、支持多方法"的大规模真机数据集,BridgeData V2 来补这个空。


BridgeData V2 — 场景示意:这论文要解决的现实问题
Plate Nº IBridgeData V2 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:单任务单环境小数据集 为研究某个算法采一小批数据。类比:只在自家厨房拍了几十段视频。问题:环境单一,别人要用就得把场景复制得一模一样,无法跨环境泛化。

  • 方案 B:单一行为的大数据集(抓取、推、戳、绳操作) 为某一种行为(如抓取)采海量数据。问题:只有一种技能,学不出通用多技能策略。

  • 方案 C:多任务但单环境的数据集(BC-Z、MT-Opt) 多个任务,但都在一个环境里采。问题:不支持跨环境泛化,别人复现困难。

  • 方案 D:用私有机器人的大数据集(RT-1、BC-Z) 大而多样,但用的是 Google 等的私有机器人。问题:数据/机器人不公开,学界买不起、复现不了。

  • 方案 E:手持采集设备 用低成本手持夹爪采数据。问题:要从视频反推动作再迁移到机器人,有额外的迁移损失。

  • 方案 F:仿真数据 在仿真里采。问题:难以复刻真实世界的物体、光照、物理,无法充分评测真机泛化。

  • 核心难题:怎么造一份足够大 + 足够多样(多技能多环境)+ 平价公开机器人 + 支持目标图/语言双条件 + 兼容多种学习方法 + 能跨机构泛化的真机数据集?之前的数据集总缺其中几项。

所以这一节是想说:小数据集不通用、单技能数据集不全能、单环境数据集不跨域、私有机器人不可及、仿真不够真——没有一份"全都要"的数据集,BridgeData V2 来做这个"全能选手"。


这篇论文的新想法

类比:如果说 ImageNet 是"人人能下载、人人能刷榜"的图像数据集,BridgeData V2 想做机器人操作界的 ImageNet——用一台平价、公开、谁都能买的机械臂,采一份大到、多样到、通用到"任何实验室拿去都能训出能用策略"的数据集。

BridgeData V2 的核心判断:数据集的价值不只在"大",更在"设计得让它能被广泛复用"——覆盖多技能多环境、支持多种任务条件、兼容多种学习方法、能跨机构泛化。

它在前作 Bridge Dataset 上做了几个关键升级:

  1. 规模与多样性大增:60096 条轨迹(50365 条人类示范 + 9731 条脚本自动采集),13 种技能、24 个环境、100+ 物体——是原版的 7 倍多。
  2. 为"多任务 + 开放词表"而采:每个场景里采多种可能任务的数据,逼策略看任务指令;支持目标图像自然语言两种任务条件。
  3. 加脚本自动采集的次优数据:用一个高度随机化的脚本抓放策略自动采了 9731 条(虽常失败),专门喂给能从次优数据获益的离线强化学习。
  4. 用一份数据验证 6 种主流方法:这是极其少见的——证明它不是"为某一种算法定制",而是真正通用。
  5. 平价公开机器人:WidowX 250 机械臂,整套约 4000 美元,两周内能凑齐,任何实验室都能买。
【把数据集当"通用基础设施"设计】

           ┌─ 规模多样:60096 轨迹(50365人示范+9731脚本) / 13技能 / 24环境
           │
BridgeData ┼─ 双任务条件:目标图像 + 自然语言(开放词表)
   V2      │
           ├─ 兼容多方法:一份数据验证 6 种主流方法(BC/离线RL/目标条件…)
           │
           └─ 平价公开:WidowX 250(~$4000, 两周可凑齐) ─▶ 跨机构可复现/泛化

   对比旧数据集:小/单技能/单环境/私有机器人/仿真 —— 各缺一块

所以这一节是想说:BridgeData V2 的新想法是"把数据集当作通用基础设施来设计"——大、多样、平价、双条件、多方法通用、跨机构泛化,而非只堆数量。


它分几步做的(方法)

BridgeData V2 的数据采集与评测流程:

【硬件】WidowX 250 机械臂(~$4000) + 4相机(肩上RGBD/2个随机位RGB/腕部RGB)
   │ 640×480, 5Hz, VR手柄遥操作
   ▼
【采集哲学】每个场景采"任意可行任务", 不复位不标名
   │ 每50条: 换相机位/换物体/换工作区位置
   ├─ 人类遥操作: 50365条 (84%)
   └─ 脚本随机抓放: 9731条 (16%, 次优, 喂离线RL)
   ▼ 共 60096 条轨迹, 13技能, 24环境, 100+物体
   │
【事后标注】众包给每条轨迹写语言描述(重点标物体最终位置)
   ▼
【多方法评测】同一份数据训6种方法
   ├─ 目标图条件: GCBC / D-GCBC / ACT / CRL
   └─ 语言条件: LCBC / RT-1
   ▼ 评测: 见过任务 / 未见物体环境 / 跨机构 / 规模缩放

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 硬件系统:平价公开的 WidowX + 多相机

类比:不用高端定制设备,而是用一套"宜家式"人人能买、两周装好的机器人。

输入:采集需求(大规模、多环境、可复现)。

处理:用 WidowX 250 机械臂,整套约 4000 美元、全部公开可购、两周内到货。传感器包括:一个固定在"过肩视角"的 RGBD 相机、两个采集时位姿随机化的 RGB 相机、一个装在腕部的 RGB 相机。图像存 640×480,控制频率 5Hz。采集方式是人用 VR 手柄遥操作机器人。

输出:一套低成本、可复现、多视角的采集平台。

小结:平价公开的 WidowX + 多相机 + VR 遥操作,是"人人能用、能复现"这个目标的物质前提。

5.2 采集哲学:每个场景采"任意可行任务"

类比:不预先规定"今天只练开抽屉",而是在一个厨房场景里,采集者看到啥能做就做啥——开抽屉、把餐具放进水槽、拿起食物……

输入:一个布置好的场景(如带食物、餐具、抽屉的厨房)。

处理:采集者在场景里做任意可行任务。为加速:轨迹之间不复位物体和机器人位置、不当场标注任务名。每采 50 条,就随机化相机位姿、换掉场景里的物体、随机化工作区相对机器人的位置。这个哲学和原版不同——原版是为一小组预定义任务采集。这样做能保证同一环境里有多种任务,逼多任务策略去"看指令"而非"从画面猜任务"。

输出:覆盖多任务、带丰富变化(物体、相机、位置)的人类示范。

小结:"每个场景采任意任务 + 频繁随机化"的哲学,是数据能支持多任务学习和广泛泛化的关键。

5.3 脚本自动采集次优数据

类比:除了人工精采,还派一个"手笨但不知疲倦"的机器人自动去抓放,虽然常失败,但量大、便宜。

输入:抓放(pick-and-place)这个最基础、最通用的技能。

处理:用一个高度随机化的脚本抓放策略自动采集。它经常失败,但能自主大量运行,比人工遥操作快得多地采集大量抓放数据(覆盖各种物体)。这些次优数据对能从次优/含噪数据获益的方法(如离线强化学习)特别有用——因为 RL 需要更广的覆盖、也能利用失败样本。用户可自由选择是否用这部分数据。

输出:9731 条脚本抓放轨迹(占 16%),增强基础抓放技能的鲁棒性。

小结:脚本采集用低成本换来大量次优数据,专门服务离线 RL,体现了"一份数据兼容多方法"的设计。

5.4 事后众包语言标注

类比:采集时不停下来写标签(费时),而是事后请人看回放、给每段视频配一句话说明。

输入:无任务名的原始轨迹。

处理:因为采集时不标注任务名,用众包平台事后标注——请标注者描述每条轨迹里机器人做了什么,特别强调被移动物体的最终位置

输出:每条轨迹配上自然语言描述,支持语言条件学习。

小结:事后众包标语言,既不拖慢采集,又让数据支持开放词表的语言条件任务指定。

5.5 用一份数据评测 6 种学习方法

类比:造好这把"万能扳手"后,拿它去拧 6 种不同的螺丝,证明它真通用。

输入:BridgeData V2 数据(观测统一为 128×128 RGB,用过肩视角;动作是 7 维——6 维连续笛卡尔末端相对位姿 + 1 维离散夹爪开合)。

处理:训 6 种 SOTA 方法,覆盖不同假设:

  • 目标图像条件:GCBC(ResNet-34 编码观测和目标图 + 全连接出动作)、D-GCBC(扩散版 BC,用 DDPM 建模多模态动作)、ACT(Transformer + CVAE,预测动作序列/action chunking)、CRL(对比式目标条件 RL)。
  • 语言条件:LCBC(MUSE 句向量 + ResNet-34 FiLM 条件)、RT-1(大 Transformer,EfficientNet 图像 token + 预训练语言 token,输出离散化动作,唯一用观测历史 + 更高分辨率的方法)。 这些方法在架构、是否用历史、动作是否离散化、动作预测时域等关键设计上各不相同。

输出:4 类评测结果——见过任务、未见物体/环境、跨机构、规模缩放(见下节数字)。

小结:用一份数据成功训 6 种假设迥异的方法,是 BridgeData V2 "通用基础设施"定位的最强证明。

5.6 为什么"通用设计 + 规模多样"是关键

  • 通用设计让数据被广泛复用:多技能多环境 + 双条件 + 多方法兼容,让任何实验室、任何方法都能拿去用。
  • 规模与多样性带来泛化:数据越多、技能越多样,泛化越好——把 CV/NLP 的规模化经验坐实到机器人。
  • 平价公开降低门槛:4000 美元的公开机器人,让"跨机构复现和泛化"从口号变可能。

所以这一节是想说:BridgeData V2 的方法五步(平价硬件 → 任意任务采集哲学 → 脚本次优数据 → 事后语言标注 → 多方法评测),核心是"把数据集当通用基础设施来设计 + 用规模和多样性驱动泛化"。


BridgeData V2 — 方法示意:核心 pipeline
Plate Nº IIBridgeData V2 — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"这份数据集有多大、多通用、多能泛化"。

数字 1:数据集规模对比

数据集 轨迹数 技能 环境 语言 公开数据 公开机器人
BridgeData(原版) 7.2k 4 12
BC-Z 26.0k 3 1
RT-1 130k 2 3
RH20T 13.0k 41 50
RoboSet 98.5k 6 11
BridgeData V2 60.1k 13 24

关键含义:BridgeData V2 在"规模 + 技能 + 环境 + 全公开(数据和机器人都公开)"上综合最均衡。RT-1 更大但机器人/数据不公开,学界用不了。

数字 2:见过任务的成功率(10 次试验平均)

方法 平均成功率
GCBC(目标图 BC) 0.49
D-GCBC(扩散 BC) 0.49
ACT(动作分块 Transformer) 0.41
CRL(对比 RL) 0.42
LCBC(语言 BC 基线) 0.23
RT-1(大 Transformer) 0.49

关键含义:目标图条件方法彼此相当(~0.49);语言条件里 RT-1(0.49)远超朴素 LCBC 基线(0.23)——归功于更大图像、动作离散化、观测历史等设计。

数字 3:未见物体/环境的成功率(10 次试验平均)

方法 平均成功率
GCBC 0.60
D-GCBC 0.55
ACT 0.28
CRL 0.52
LCBC 0.08
RT-1 0.50

关键含义:大而多样的数据带来可观泛化,多数方法在未见任务上非零成功。但语言条件方法在未见物体上很吃力(LCBC 仅 0.08),因为这些物体名没在数据里"落地"(grounding)。

数字 4:跨机构评测(Lab 1 → Lab 2,平均成功率)

方法 Lab 1 Lab 2(零样本)
GCBC 0.30 0.13
D-GCBC 0.23 0.13
CRL 0.13 0.20
RT-1 0.47 0.40

关键含义:换到另一个机构(不同机器人搭建、相机、光照、物体),零样本下所有方法仍有非零成功,RT-1 几乎不掉(0.47→0.40)。证明数据能跨实验室泛化——这是数据集"人人能用"的硬核证据。

数字 5:技能多样性的影响(未见抓放任务,20 次试验)

训练数据 成功率
只用 3 种技能(~28k 条) 0.30
全部 13 种技能(~27k 条) 0.65

关键含义:数据量几乎相同,但技能更多样时,未见抓放任务成功率从 0.30 翻到 0.65——说明"别的技能的数据能提升抓放的鲁棒性"(技能间正迁移)。此外规模缩放实验也显示:模型越大、数据越多,效果越好。

所以这一节是想说:数据证明四件事——规模多样综合领先、多方法都能用、能跨物体/环境/机构泛化、技能多样性和规模都带来正收益。


实验结果说明了什么

问题一:一份数据能同时喂给多种假设不同的方法吗? 能,这是核心贡献。BridgeData V2 成功训了 6 种方法——目标图条件的 BC/扩散 BC/ACT/对比 RL,语言条件的 LCBC/RT-1。它们在架构、是否用历史、动作离散化、动作时域上各不相同,却都能用同一份数据训出能用的策略。这在过去几乎没有——大多数数据集只被一两种方法验证过。

问题二:学到的技能能泛化到新物体和新环境吗? 能,且规模多样性是关键。在未见物体/环境上多数方法非零成功(GCBC 平均 0.60)。但语言条件方法在未见物体上很弱(LCBC 0.08),因为新物体名没在训练数据里落地——这揭示了语言 grounding 的难题。目标图条件方法更鲁棒,因为它给的是"目标长什么样"的图像,不依赖物体名。

问题三:别的实验室能用这份数据吗? 能。另一个机构用同款机器人、在存在明显域偏移(不同搭建、相机、光照、物体实例)的情况下,零样本评测所有方法都有非零成功,RT-1 几乎不掉(0.47→0.40)。这直接证明了数据集"跨机构可用"这个最重要的设计目标,且作者指出用少量本地数据微调还能进一步提升。

问题四:规模化配方在机器人上成立吗? 成立。模型越大成功率越高;数据越多,见过和未见任务都更好;技能越多样,泛化越好(3 技能 0.30 vs 13 技能 0.65,数据量相当)。这把 CV/NLP 的"大数据 + 大模型 = 强泛化"配方在真机操作上坐实了,并扩展了 RT-1 的结论——不只是物体多样性,技能多样性也能提升泛化。

所以这一节是想说:实验系统回答了四个问题——一份数据多方法通用、能跨物体/环境泛化、能跨机构零样本用、规模化配方在机器人上成立。


你应该懂的几个新词

模仿学习 / 行为克隆(BC):从示范学"观测→动作"的映射,是数据集最主要的用法。

离线强化学习(offline RL):不与环境实时交互,只从已采集的(含次优)数据里学策略,能利用失败样本。

目标条件(goal-conditioned):用一张"目标图像"告诉策略要达成什么状态,不依赖物体名。

语言条件(language-conditioned):用自然语言指令指定任务,需要把词和物体"落地"(grounding)。

开放词表(open-vocabulary):能处理训练时没见过的物体名/指令,泛化到新任务。

技能 vs 任务:技能指相似动作(如抓放、擦、折),任务指相似语言指令(抓叉子 vs 抓碗是同技能不同任务)。

动作分块(action chunking):一次预测未来一段动作序列而非单步,能更好建模多模态、减少抖动(ACT 用它)。

动作离散化(action discretization):把连续动作切成离散桶,便于用分类/Transformer 生成(RT-1 用它)。

跨机构泛化(cross-institution generalization):在别的实验室(不同搭建/光照/物体)也能工作,是数据"人人能用"的关键。

正迁移(positive transfer):学一种技能的数据能帮助另一种技能(如多技能数据提升抓放鲁棒性)。

所以这一节是想说:这十个词是读任何"大规模机器人数据集/策略学习"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 任务多为低精度、不涉及力控:数据里的任务大多是低精度操作,不覆盖需要精细力控的场景(如工业插装、投掷、搬重物、动态任务)。适合研究泛化,但不适合研究力控/动态操作。
  • 只在单一机构采集:虽然用多环境证明了跨机构可用,但数据本身全在一个机构采的,环境覆盖仍可更广。
  • 单一机器人形态:为可及性选了 WidowX,但别的实验室未必都standardize到同款机器人;跨机器人形态的泛化数据是未来方向。
  • 语言 grounding 弱:语言条件方法在未见物体上几乎归零(LCBC 0.08),因为新物体名没在数据里落地。
  • 控制频率和分辨率有限:5Hz、640×480 采集,对需要高频精细控制或高分辨率感知的任务可能不够。
  • 脚本数据是次优的:16% 的脚本抓放数据常失败,对纯模仿学习可能是噪声(虽然对离线 RL 有用),用户需自行取舍。

所以这一节是想说:BridgeData V2 把"大规模、多样、通用、跨机构"这条路走通了,但低精度、单机构、单机器人形态、语言 grounding 弱这些问题仍在——后续(如 Open X-Embodiment 多机器人数据)继续发力。


它和别的论文是什么关系

  • 上游 / 前作
    • BridgeData(原版,Ebert et al. 2021):直接前作,V2 在其上扩了 7 倍多,并加入自动采集数据、语言标注、多方法验证。
    • RT-1(Brohan et al. 2022):作为评测的一种方法被复现;V2 也扩展了 RT-1 关于"多样性提升泛化"的结论(从物体多样性到技能多样性)。
  • 评测中用到的方法:Diffusion Policy(D-GCBC 的思想来源,本仓库有笔记)、ACT(动作分块,本仓库有相关笔记)、对比 RL(CRL)、MUSE(语言编码)。
  • 对比关系
    • RH20T / RoboSet:同期的大规模数据集,各有侧重(RH20T 技能更多但每技能少),V2 强在"多方法 + 跨机构"的系统验证。
    • 仿真数据集(BEHAVIOR-1K、CALVIN):那些是仿真,V2 是真机;真机更真实、更能评测真实泛化,但采集更贵。
  • 下游 / 同族:BridgeData V2 是 Open X-Embodiment 等大规模跨机器人数据集运动的重要组成,也常被用作训练/评测各类 VLA 模型的数据源。

所以这一节是想说:BridgeData V2 站在 BridgeData + RT-1 的肩膀上,用"平价公开机器人 + 通用设计 + 系统的多方法多机构验证",成为真机操作数据集的标杆,并汇入了跨机器人大数据的浪潮。


和本导读的关系

本笔记对应导读中"数据集与规模化"这条线的关键节点。

机器人学习要复刻 CV/NLP 的成功,绕不开"数据"这个基础设施。BridgeData V2 的意义在于——它证明了"大数据 + 大模型 = 强泛化"的配方在真机操作上成立,并给出了一份人人能用、跨机构通用的数据。理解了它,你就理解了为什么后来会有 Open X-Embodiment 这种把几十个实验室数据汇总的运动,也理解了 RT-1/RT-2/OpenVLA 这些大模型的数据从哪来。

读完本笔记,建议:对照看 CALVIN / BEHAVIOR-1K 笔记(仿真数据/基准,理解真机 vs 仿真的取舍),再看 RT-1 / OpenVLA 等 VLA 模型笔记(理解这些数据怎么被用来训大策略)。三者连起来,就能看清"数据 → 模型 → 评测"的规模化闭环。

对应导读章节:Ch21:数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO

所以这一节是想说:本笔记是"数据集与规模化"这条线的核心,读它能理解真机大数据的价值,再结合仿真基准和 VLA 模型笔记看清规模化全貌。


思考题

以下问题检验你是否真正理解了 BridgeData V2 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么 BridgeData V2 坚持每个场景采"任意可行任务",而不像原版那样为一小组预定义任务采集?

提示

关键是逼多任务策略"看任务指令"而非"从画面猜任务"。如果一个场景里只采一种任务(比如厨房里只采"开抽屉"),那策略看到厨房画面就能直接推断出"要开抽屉"——它根本不需要看任务指令,任务信息泄露在了初始观测里。这样训出的"多任务"策略其实是假的,换个指令它不会响应。而在同一个厨房场景里采集多种可能任务(开抽屉、放餐具、拿食物……),同样的初始画面对应多个不同任务,策略就必须去看目标图/语言指令才能知道该做哪个。这才是真正的多任务、开放词表策略。所以这个采集哲学是为"可条件化的多任务学习"服务的,是数据集设计的深思熟虑之处。

Q2:为什么要额外用脚本策略采集"经常失败"的次优数据?失败的数据不是噪声吗?

提示

对不同的学习方法,"失败数据"的价值不同。对纯模仿学习(行为克隆),失败数据确实可能是噪声——你不想让策略模仿失败动作。但对离线强化学习,次优/失败数据非常有价值:RL 通过奖励信号学习"什么该做、什么不该做",它需要更广的状态-动作覆盖(包括失败的),才能学出鲁棒策略并知道如何从错误中恢复。而且脚本自动采集比人工遥操作快得多、便宜得多,能快速积累大量抓放数据覆盖各种物体。这正体现了 BridgeData V2 "一份数据兼容多方法"的设计——它同时服务 BC 和离线 RL 两类假设不同的方法,所以既有高质量人类示范(给 BC),又有大量次优脚本数据(给 RL)。用户还能自由选择是否用这部分,灵活取舍。

Q3:实验发现语言条件方法(LCBC)在未见物体上几乎归零(0.08),而目标图条件方法(GCBC 0.60)好得多。为什么?

提示

差别在"任务怎么指定"。语言条件方法要理解物体的名字并把它和视觉中的物体对应起来(grounding)。如果一个物体名(比如某种没见过的水果)从没在训练数据里出现过,策略就不知道这个词指的是画面里哪个东西——语言 grounding 失败,自然做不了。而目标图像条件方法给的是"目标状态长什么样"的一张图,它不依赖物体名,只需要把当前画面变成目标画面的样子——即使物体没见过,只要它在目标图里,策略也能大致知道要把它移到哪。所以对未见物体,目标图条件天然更鲁棒。这也揭示了语言条件学习的核心挑战:开放词表的 grounding。后续工作(如用预训练 VLM 提供更强的语言-视觉对齐)正是为解决这个问题。

Q4:跨机构实验中,RT-1 几乎不掉(0.47→0.40),而目标图方法掉得多。RT-1 做对了什么?

提示

RT-1 有几个关键设计让它对域偏移更鲁棒:(1) 更大的图像分辨率(320×256 vs 其他 128×128),保留更多细节,对新环境的视觉变化更有辨别力;(2) 动作离散化,把动作预测变成分类问题,通常比连续回归更稳定;(3) 观测历史,用过去几帧的信息,能更好地消歧、抵抗单帧的域偏移;(4) 它是更大容量的 Transformer,配合大数据能学到更泛化的表示。此外,语言条件(RT-1 用)在跨机构时可能比目标图条件更稳——因为目标图方法需要在新实验室提供匹配的目标图,而"翻转锅到正立"这类任务的目标图很难区分朝向,反而吃亏。综合这些,RT-1 在跨机构零样本上表现最好。这也印证了论文的规模化结论:更大模型 + 更多设计(历史、离散化、大图)在泛化上有优势。

Q5:技能多样性实验中,数据量几乎相同(28k vs 27k),但 13 种技能训练比 3 种技能在未见抓放任务上好一倍(0.65 vs 0.30)。这个"正迁移"是怎么发生的?

提示

正迁移来自"不同技能共享底层能力"。抓放(pick-and-place)这个技能,本质上需要一系列子能力:识别物体、对准、控制夹爪、协调手臂运动、感知空间关系等。而别的技能(推、擦、折、开门……)也在锻炼这些子能力——比如"推"锻炼空间对准和运动控制,"折布"锻炼精细操作,"开门"锻炼精确对准把手。当策略在多样技能上训练时,它学到的这些共享底层表示更通用、更鲁棒,迁移回抓放时就更强,尤其在未见物体上(因为它见过更多样的物体交互,泛化更好)。反之只用 3 种技能训练,学到的表示更狭窄、更容易过拟合到那几种技能的特定模式。这个结果扩展了 RT-1 的发现——RT-1 说物体多样性提升泛化,BridgeData V2 说技能多样性也能提升泛化,两者都指向"多样性是规模化的关键维度"。

Q6:BridgeData V2 用 5Hz 控制频率、低精度任务。如果有人想用它研究"高速动态操作"或"精密插装",会遇到什么问题?

提示

会遇到根本性的不匹配。(1) 控制频率不够:5Hz 意味着每 0.2 秒才发一个指令,对高速动态任务(如接飞来的球、快速投掷)远远不够——这类任务需要几十甚至上百 Hz 的闭环控制。用 5Hz 数据训出的策略无法产生高频精细的动作。(2) 缺力控信息:数据只有视觉和位置,没有力/触觉。精密插装(如把插头插进孔、拧螺丝到位)本质是力控任务,需要感知和调节接触力,纯位置/视觉信息学不出来。(3) 任务本身是低精度的:数据里的任务对精度要求不高(把东西大致放到某处即可),没有高精度示范可学。所以 BridgeData V2 不适合这两类研究。想研究它们需要专门的数据集:高频采集(用于动态任务)、带力/触觉传感(用于精密插装)、且包含高精度示范。这也是论文明确列出的局限和未来方向——数据集是为研究"泛化"设计的,不是为研究"力控/动态"设计的,用对场景很重要。

Q7:BridgeData V2 特意用平价公开的机器人以便"人人能用",但也承认别的实验室未必都用同款机器人。你觉得怎么解决"跨机器人形态"的通用性问题?

提示

这是个开放难题,几个思路:(1) 汇总多机器人数据——这正是 Open X-Embodiment 的做法:把几十个实验室、各种机器人的数据合到一起训练,让模型见过多种形态,从而学出某种跨形态的通用表示。BridgeData V2 本身就是这个运动的重要组成。(2) 形态无关的动作表示——用末端执行器空间的相对动作(而非关节空间),不同机器人的关节结构虽异,但末端位姿的语义相通,便于迁移。(3) 少量目标机器人数据微调——先在多机器人大数据上预训练,再用目标机器人的少量数据微调(论文也提到用少量本地数据能显著提升)。(4) 显式的形态条件——把机器人的形态参数(关节数、连杆长度等)作为输入条件,让一个模型能适配多种机器人(如 RT-X、跨形态策略工作)。核心矛盾是"数据采集要标准化到某款机器人 vs 想让策略跨机器人通用"——单一数据集无法两全,需要靠社区汇总多机器人数据 + 形态无关/形态条件的建模来共同解决。BridgeData V2 选择先把"单一平价机器人上的跨环境跨机构"做扎实,把跨形态留给更大的联合努力。

所以这一节是想说:能回答这 7 题,你就真正理解了 BridgeData V2 为什么采任意任务、加脚本数据、用目标图/语言双条件,以及它的力控/动态/跨形态局限。


一些好奇心问答(FAQ)

Q1:BridgeData V2 到底有多大? 60096 条轨迹,其中 50365 条人类遥操作示范(84%)+ 9731 条脚本自动采集(16%),涵盖 13 种技能、24 个环境、100+ 物体。是原版 Bridge Dataset 的 7 倍多。

Q2:用的什么机器人?贵吗? WidowX 250 机械臂,整套约 4000 美元,全部公开可购、两周内能凑齐——这是它"人人能用"的关键。

Q3:数据里有语言吗? 有。采集时不标注,事后用众包平台给每条轨迹配语言描述,重点标注被移动物体的最终位置。支持语言条件和目标图像条件两种任务指定。

Q4:它验证了几种学习方法? 6 种:目标图条件的 GCBC、D-GCBC、ACT、CRL;语言条件的 LCBC、RT-1。用一份数据训这么多假设不同的方法,是它极少见的优点。

Q5:真能在别的实验室用吗? 能。另一个机构零样本评测,所有方法都有非零成功,RT-1 几乎不掉(0.47→0.40)。作者还指出用少量本地数据微调能进一步提升。

Q6:为什么控制频率只有 5Hz? 因为它面向的是低精度、非动态的操作任务(抓放、推、折等),研究的是泛化而非高速控制,5Hz 够用。高速动态任务需要更高频率的数据。

所以这一节是想说:BridgeData V2 的实操问题(规模、机器人成本、语言、验证方法数、跨机构、控制频率)都有明确答案,核心就是"平价通用大数据"这一招。


如果你想再深入

按"必读前置 → 评测方法 → 对比 → 后续"排序:

  1. 必读前置:BridgeData / RT-1(Ebert 2021 / Brohan 2022) — 前作和被复现的方法,理解 V2 在解决什么、扩展了什么结论。
  2. 评测方法:Diffusion Policy / ACT — 本仓库有笔记,理解 D-GCBC 和 ACT 的动作生成思路。
  3. 对比:CALVIN / BEHAVIOR-1K — 本仓库有笔记,仿真基准,对照理解真机 vs 仿真。
  4. 后续:Open X-Embodiment — 跨机器人大数据汇总,BridgeData V2 是其组成部分。
  5. 应用:OpenVLA / RT-2 — 理解这些数据怎么被用来训大规模 VLA 模型。

所以这一节是想说:把 BridgeData + RT-1 + BridgeData V2 + Open X-Embodiment 连起来读,就能看清真机操作数据从"小而专"到"大而通用再到跨机器人"的完整脉络。


原文信息

BibTeX

@inproceedings{walke2023bridgedatav2,
  title     = {BridgeData V2: A Dataset for Robot Learning at Scale},
  author    = {Walke, Homer and Black, Kevin and Lee, Abraham and Kim, Moo Jin and Du, Max and Zheng, Chongyi and Zhao, Tony and Hansen-Estruch, Philippe and Vuong, Quan and He, Andre and Myers, Vivek and Fang, Kuan and Finn, Chelsea and Levine, Sergey},
  booktitle = {Proceedings of the Conference on Robot Learning (CoRL)},
  year      = {2023}
}

链接

所以这一节是想说:这是 Walke et al. 2023 年发表在 CoRL 的工作,用"平价公开机器人 + 通用设计 + 系统的多方法多机构验证",证明了大数据大模型配方在真机操作上成立,成为机器人操作数据集的标杆。

引用本笔记 / Cite this note
BibTeX
@online{eai_bridgedata_v2_2026,
  title       = {(readable note) BridgeData V2},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/bridgedata-v2/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?