BridgeData V2
这是一份写给"没接触过机器人学习数据集"的读者的精读笔记。语言尽量像聊天,概念全部翻译成人话。
一句话讲什么(TL;DR)
BridgeData V2 是伯克利等校做的一份大规模真机操作数据集:用一台约 4000 美元、谁都买得到的 WidowX 机械臂,在 24 个环境里采了 60096 条轨迹、13 种技能。它专门设计成"多方法通用 + 跨环境跨机构泛化"——同一份数据能喂给 6 种主流学习算法(模仿学习、离线强化学习),训出的策略能在别的实验室零样本工作,而且数据越多、模型越大、技能越多样,效果越好。
所以这一节是想说:BridgeData V2 的核心就是"用平价机器人采一份人人能用、跨机构通用的大规模操作数据",把 NLP/CV 的"大数据 + 大模型"配方搬到机器人上。
这是个什么场景
想象你是个机器人学习研究者,想验证一个新算法。深度学习在 NLP 和 CV 上成功的配方很清楚:大数据 + 大模型 = 强泛化。机器人也想照抄这个配方:先采一大批机器人做事的示范,再用行为克隆或离线强化学习训个策略,让它泛化到各种任务和环境。
配方听起来简单,但采一份"好用"的机器人数据集极难,有几个坑:
- 采集耗时,所以数据集必须能被别的实验室复用——不能只有采集者自己能用。
- 要复用,数据就得覆盖足够多的任务和环境,否则别人得把自家场景布置得和你一模一样才能用。
- 要支持灵活的任务指定(目标图像或语言指令),别人才能方便地让策略做新任务。
- 每个环境里要有多种可能任务的数据,逼着多任务策略去"看任务指令"而不是"从画面猜任务"。
之前的数据集大多栽在这些坑上:要么只有一两个环境和任务(别人没法用)、要么用私有机器人(别人买不起)、要么只被一种方法验证过。
BridgeData V2 要解的题:能不能造一份大规模、多样、用平价公开机器人采集、支持多种学习方法、能跨实验室泛化的操作数据集?
所以这一节是想说:机器人想照搬"大数据大模型"配方,但缺一份"人人能用、跨环境通用、支持多方法"的大规模真机数据集,BridgeData V2 来补这个空。

之前的人怎么做的,为什么不够好
方案 A:单任务单环境小数据集 为研究某个算法采一小批数据。类比:只在自家厨房拍了几十段视频。问题:环境单一,别人要用就得把场景复制得一模一样,无法跨环境泛化。
方案 B:单一行为的大数据集(抓取、推、戳、绳操作) 为某一种行为(如抓取)采海量数据。问题:只有一种技能,学不出通用多技能策略。
方案 C:多任务但单环境的数据集(BC-Z、MT-Opt) 多个任务,但都在一个环境里采。问题:不支持跨环境泛化,别人复现困难。
方案 D:用私有机器人的大数据集(RT-1、BC-Z) 大而多样,但用的是 Google 等的私有机器人。问题:数据/机器人不公开,学界买不起、复现不了。
方案 E:手持采集设备 用低成本手持夹爪采数据。问题:要从视频反推动作再迁移到机器人,有额外的迁移损失。
方案 F:仿真数据 在仿真里采。问题:难以复刻真实世界的物体、光照、物理,无法充分评测真机泛化。
核心难题:怎么造一份足够大 + 足够多样(多技能多环境)+ 平价公开机器人 + 支持目标图/语言双条件 + 兼容多种学习方法 + 能跨机构泛化的真机数据集?之前的数据集总缺其中几项。
所以这一节是想说:小数据集不通用、单技能数据集不全能、单环境数据集不跨域、私有机器人不可及、仿真不够真——没有一份"全都要"的数据集,BridgeData V2 来做这个"全能选手"。
这篇论文的新想法
类比:如果说 ImageNet 是"人人能下载、人人能刷榜"的图像数据集,BridgeData V2 想做机器人操作界的 ImageNet——用一台平价、公开、谁都能买的机械臂,采一份大到、多样到、通用到"任何实验室拿去都能训出能用策略"的数据集。
BridgeData V2 的核心判断:数据集的价值不只在"大",更在"设计得让它能被广泛复用"——覆盖多技能多环境、支持多种任务条件、兼容多种学习方法、能跨机构泛化。
它在前作 Bridge Dataset 上做了几个关键升级:
- 规模与多样性大增:60096 条轨迹(50365 条人类示范 + 9731 条脚本自动采集),13 种技能、24 个环境、100+ 物体——是原版的 7 倍多。
- 为"多任务 + 开放词表"而采:每个场景里采多种可能任务的数据,逼策略看任务指令;支持目标图像和自然语言两种任务条件。
- 加脚本自动采集的次优数据:用一个高度随机化的脚本抓放策略自动采了 9731 条(虽常失败),专门喂给能从次优数据获益的离线强化学习。
- 用一份数据验证 6 种主流方法:这是极其少见的——证明它不是"为某一种算法定制",而是真正通用。
- 平价公开机器人:WidowX 250 机械臂,整套约 4000 美元,两周内能凑齐,任何实验室都能买。
【把数据集当"通用基础设施"设计】
┌─ 规模多样:60096 轨迹(50365人示范+9731脚本) / 13技能 / 24环境
│
BridgeData ┼─ 双任务条件:目标图像 + 自然语言(开放词表)
V2 │
├─ 兼容多方法:一份数据验证 6 种主流方法(BC/离线RL/目标条件…)
│
└─ 平价公开:WidowX 250(~$4000, 两周可凑齐) ─▶ 跨机构可复现/泛化
对比旧数据集:小/单技能/单环境/私有机器人/仿真 —— 各缺一块
所以这一节是想说:BridgeData V2 的新想法是"把数据集当作通用基础设施来设计"——大、多样、平价、双条件、多方法通用、跨机构泛化,而非只堆数量。
它分几步做的(方法)
BridgeData V2 的数据采集与评测流程:
【硬件】WidowX 250 机械臂(~$4000) + 4相机(肩上RGBD/2个随机位RGB/腕部RGB)
│ 640×480, 5Hz, VR手柄遥操作
▼
【采集哲学】每个场景采"任意可行任务", 不复位不标名
│ 每50条: 换相机位/换物体/换工作区位置
├─ 人类遥操作: 50365条 (84%)
└─ 脚本随机抓放: 9731条 (16%, 次优, 喂离线RL)
▼ 共 60096 条轨迹, 13技能, 24环境, 100+物体
│
【事后标注】众包给每条轨迹写语言描述(重点标物体最终位置)
▼
【多方法评测】同一份数据训6种方法
├─ 目标图条件: GCBC / D-GCBC / ACT / CRL
└─ 语言条件: LCBC / RT-1
▼ 评测: 见过任务 / 未见物体环境 / 跨机构 / 规模缩放
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 硬件系统:平价公开的 WidowX + 多相机
类比:不用高端定制设备,而是用一套"宜家式"人人能买、两周装好的机器人。
输入:采集需求(大规模、多环境、可复现)。
处理:用 WidowX 250 机械臂,整套约 4000 美元、全部公开可购、两周内到货。传感器包括:一个固定在"过肩视角"的 RGBD 相机、两个采集时位姿随机化的 RGB 相机、一个装在腕部的 RGB 相机。图像存 640×480,控制频率 5Hz。采集方式是人用 VR 手柄遥操作机器人。
输出:一套低成本、可复现、多视角的采集平台。
小结:平价公开的 WidowX + 多相机 + VR 遥操作,是"人人能用、能复现"这个目标的物质前提。
5.2 采集哲学:每个场景采"任意可行任务"
类比:不预先规定"今天只练开抽屉",而是在一个厨房场景里,采集者看到啥能做就做啥——开抽屉、把餐具放进水槽、拿起食物……
输入:一个布置好的场景(如带食物、餐具、抽屉的厨房)。
处理:采集者在场景里做任意可行任务。为加速:轨迹之间不复位物体和机器人位置、不当场标注任务名。每采 50 条,就随机化相机位姿、换掉场景里的物体、随机化工作区相对机器人的位置。这个哲学和原版不同——原版是为一小组预定义任务采集。这样做能保证同一环境里有多种任务,逼多任务策略去"看指令"而非"从画面猜任务"。
输出:覆盖多任务、带丰富变化(物体、相机、位置)的人类示范。
小结:"每个场景采任意任务 + 频繁随机化"的哲学,是数据能支持多任务学习和广泛泛化的关键。
5.3 脚本自动采集次优数据
类比:除了人工精采,还派一个"手笨但不知疲倦"的机器人自动去抓放,虽然常失败,但量大、便宜。
输入:抓放(pick-and-place)这个最基础、最通用的技能。
处理:用一个高度随机化的脚本抓放策略自动采集。它经常失败,但能自主大量运行,比人工遥操作快得多地采集大量抓放数据(覆盖各种物体)。这些次优数据对能从次优/含噪数据获益的方法(如离线强化学习)特别有用——因为 RL 需要更广的覆盖、也能利用失败样本。用户可自由选择是否用这部分数据。
输出:9731 条脚本抓放轨迹(占 16%),增强基础抓放技能的鲁棒性。
小结:脚本采集用低成本换来大量次优数据,专门服务离线 RL,体现了"一份数据兼容多方法"的设计。
5.4 事后众包语言标注
类比:采集时不停下来写标签(费时),而是事后请人看回放、给每段视频配一句话说明。
输入:无任务名的原始轨迹。
处理:因为采集时不标注任务名,用众包平台事后标注——请标注者描述每条轨迹里机器人做了什么,特别强调被移动物体的最终位置。
输出:每条轨迹配上自然语言描述,支持语言条件学习。
小结:事后众包标语言,既不拖慢采集,又让数据支持开放词表的语言条件任务指定。
5.5 用一份数据评测 6 种学习方法
类比:造好这把"万能扳手"后,拿它去拧 6 种不同的螺丝,证明它真通用。
输入:BridgeData V2 数据(观测统一为 128×128 RGB,用过肩视角;动作是 7 维——6 维连续笛卡尔末端相对位姿 + 1 维离散夹爪开合)。
处理:训 6 种 SOTA 方法,覆盖不同假设:
- 目标图像条件:GCBC(ResNet-34 编码观测和目标图 + 全连接出动作)、D-GCBC(扩散版 BC,用 DDPM 建模多模态动作)、ACT(Transformer + CVAE,预测动作序列/action chunking)、CRL(对比式目标条件 RL)。
- 语言条件:LCBC(MUSE 句向量 + ResNet-34 FiLM 条件)、RT-1(大 Transformer,EfficientNet 图像 token + 预训练语言 token,输出离散化动作,唯一用观测历史 + 更高分辨率的方法)。 这些方法在架构、是否用历史、动作是否离散化、动作预测时域等关键设计上各不相同。
输出:4 类评测结果——见过任务、未见物体/环境、跨机构、规模缩放(见下节数字)。
小结:用一份数据成功训 6 种假设迥异的方法,是 BridgeData V2 "通用基础设施"定位的最强证明。
5.6 为什么"通用设计 + 规模多样"是关键
- 通用设计让数据被广泛复用:多技能多环境 + 双条件 + 多方法兼容,让任何实验室、任何方法都能拿去用。
- 规模与多样性带来泛化:数据越多、技能越多样,泛化越好——把 CV/NLP 的规模化经验坐实到机器人。
- 平价公开降低门槛:4000 美元的公开机器人,让"跨机构复现和泛化"从口号变可能。
所以这一节是想说:BridgeData V2 的方法五步(平价硬件 → 任意任务采集哲学 → 脚本次优数据 → 事后语言标注 → 多方法评测),核心是"把数据集当通用基础设施来设计 + 用规模和多样性驱动泛化"。

关键数字(What works)
数字本身不重要,重要的是它们说明"这份数据集有多大、多通用、多能泛化"。
数字 1:数据集规模对比
| 数据集 | 轨迹数 | 技能 | 环境 | 语言 | 公开数据 | 公开机器人 |
|---|---|---|---|---|---|---|
| BridgeData(原版) | 7.2k | 4 | 12 | ✓ | ✓ | ✓ |
| BC-Z | 26.0k | 3 | 1 | ✓ | ✓ | ✗ |
| RT-1 | 130k | 2 | 3 | ✓ | ✗ | ✗ |
| RH20T | 13.0k | 41 | 50 | ✓ | ✓ | ✓ |
| RoboSet | 98.5k | 6 | 11 | ✓ | ✓ | ✓ |
| BridgeData V2 | 60.1k | 13 | 24 | ✓ | ✓ | ✓ |
关键含义:BridgeData V2 在"规模 + 技能 + 环境 + 全公开(数据和机器人都公开)"上综合最均衡。RT-1 更大但机器人/数据不公开,学界用不了。
数字 2:见过任务的成功率(10 次试验平均)
| 方法 | 平均成功率 |
|---|---|
| GCBC(目标图 BC) | 0.49 |
| D-GCBC(扩散 BC) | 0.49 |
| ACT(动作分块 Transformer) | 0.41 |
| CRL(对比 RL) | 0.42 |
| LCBC(语言 BC 基线) | 0.23 |
| RT-1(大 Transformer) | 0.49 |
关键含义:目标图条件方法彼此相当(~0.49);语言条件里 RT-1(0.49)远超朴素 LCBC 基线(0.23)——归功于更大图像、动作离散化、观测历史等设计。
数字 3:未见物体/环境的成功率(10 次试验平均)
| 方法 | 平均成功率 |
|---|---|
| GCBC | 0.60 |
| D-GCBC | 0.55 |
| ACT | 0.28 |
| CRL | 0.52 |
| LCBC | 0.08 |
| RT-1 | 0.50 |
关键含义:大而多样的数据带来可观泛化,多数方法在未见任务上非零成功。但语言条件方法在未见物体上很吃力(LCBC 仅 0.08),因为这些物体名没在数据里"落地"(grounding)。
数字 4:跨机构评测(Lab 1 → Lab 2,平均成功率)
| 方法 | Lab 1 | Lab 2(零样本) |
|---|---|---|
| GCBC | 0.30 | 0.13 |
| D-GCBC | 0.23 | 0.13 |
| CRL | 0.13 | 0.20 |
| RT-1 | 0.47 | 0.40 |
关键含义:换到另一个机构(不同机器人搭建、相机、光照、物体),零样本下所有方法仍有非零成功,RT-1 几乎不掉(0.47→0.40)。证明数据能跨实验室泛化——这是数据集"人人能用"的硬核证据。
数字 5:技能多样性的影响(未见抓放任务,20 次试验)
| 训练数据 | 成功率 |
|---|---|
| 只用 3 种技能(~28k 条) | 0.30 |
| 全部 13 种技能(~27k 条) | 0.65 |
关键含义:数据量几乎相同,但技能更多样时,未见抓放任务成功率从 0.30 翻到 0.65——说明"别的技能的数据能提升抓放的鲁棒性"(技能间正迁移)。此外规模缩放实验也显示:模型越大、数据越多,效果越好。
所以这一节是想说:数据证明四件事——规模多样综合领先、多方法都能用、能跨物体/环境/机构泛化、技能多样性和规模都带来正收益。
实验结果说明了什么
问题一:一份数据能同时喂给多种假设不同的方法吗? 能,这是核心贡献。BridgeData V2 成功训了 6 种方法——目标图条件的 BC/扩散 BC/ACT/对比 RL,语言条件的 LCBC/RT-1。它们在架构、是否用历史、动作离散化、动作时域上各不相同,却都能用同一份数据训出能用的策略。这在过去几乎没有——大多数数据集只被一两种方法验证过。
问题二:学到的技能能泛化到新物体和新环境吗? 能,且规模多样性是关键。在未见物体/环境上多数方法非零成功(GCBC 平均 0.60)。但语言条件方法在未见物体上很弱(LCBC 0.08),因为新物体名没在训练数据里落地——这揭示了语言 grounding 的难题。目标图条件方法更鲁棒,因为它给的是"目标长什么样"的图像,不依赖物体名。
问题三:别的实验室能用这份数据吗? 能。另一个机构用同款机器人、在存在明显域偏移(不同搭建、相机、光照、物体实例)的情况下,零样本评测所有方法都有非零成功,RT-1 几乎不掉(0.47→0.40)。这直接证明了数据集"跨机构可用"这个最重要的设计目标,且作者指出用少量本地数据微调还能进一步提升。
问题四:规模化配方在机器人上成立吗? 成立。模型越大成功率越高;数据越多,见过和未见任务都更好;技能越多样,泛化越好(3 技能 0.30 vs 13 技能 0.65,数据量相当)。这把 CV/NLP 的"大数据 + 大模型 = 强泛化"配方在真机操作上坐实了,并扩展了 RT-1 的结论——不只是物体多样性,技能多样性也能提升泛化。
所以这一节是想说:实验系统回答了四个问题——一份数据多方法通用、能跨物体/环境泛化、能跨机构零样本用、规模化配方在机器人上成立。
你应该懂的几个新词
模仿学习 / 行为克隆(BC):从示范学"观测→动作"的映射,是数据集最主要的用法。
离线强化学习(offline RL):不与环境实时交互,只从已采集的(含次优)数据里学策略,能利用失败样本。
目标条件(goal-conditioned):用一张"目标图像"告诉策略要达成什么状态,不依赖物体名。
语言条件(language-conditioned):用自然语言指令指定任务,需要把词和物体"落地"(grounding)。
开放词表(open-vocabulary):能处理训练时没见过的物体名/指令,泛化到新任务。
技能 vs 任务:技能指相似动作(如抓放、擦、折),任务指相似语言指令(抓叉子 vs 抓碗是同技能不同任务)。
动作分块(action chunking):一次预测未来一段动作序列而非单步,能更好建模多模态、减少抖动(ACT 用它)。
动作离散化(action discretization):把连续动作切成离散桶,便于用分类/Transformer 生成(RT-1 用它)。
跨机构泛化(cross-institution generalization):在别的实验室(不同搭建/光照/物体)也能工作,是数据"人人能用"的关键。
正迁移(positive transfer):学一种技能的数据能帮助另一种技能(如多技能数据提升抓放鲁棒性)。
所以这一节是想说:这十个词是读任何"大规模机器人数据集/策略学习"论文都会反复出现的基础词汇。
它有什么搞不定的
- 任务多为低精度、不涉及力控:数据里的任务大多是低精度操作,不覆盖需要精细力控的场景(如工业插装、投掷、搬重物、动态任务)。适合研究泛化,但不适合研究力控/动态操作。
- 只在单一机构采集:虽然用多环境证明了跨机构可用,但数据本身全在一个机构采的,环境覆盖仍可更广。
- 单一机器人形态:为可及性选了 WidowX,但别的实验室未必都standardize到同款机器人;跨机器人形态的泛化数据是未来方向。
- 语言 grounding 弱:语言条件方法在未见物体上几乎归零(LCBC 0.08),因为新物体名没在数据里落地。
- 控制频率和分辨率有限:5Hz、640×480 采集,对需要高频精细控制或高分辨率感知的任务可能不够。
- 脚本数据是次优的:16% 的脚本抓放数据常失败,对纯模仿学习可能是噪声(虽然对离线 RL 有用),用户需自行取舍。
所以这一节是想说:BridgeData V2 把"大规模、多样、通用、跨机构"这条路走通了,但低精度、单机构、单机器人形态、语言 grounding 弱这些问题仍在——后续(如 Open X-Embodiment 多机器人数据)继续发力。
它和别的论文是什么关系
- 上游 / 前作:
- BridgeData(原版,Ebert et al. 2021):直接前作,V2 在其上扩了 7 倍多,并加入自动采集数据、语言标注、多方法验证。
- RT-1(Brohan et al. 2022):作为评测的一种方法被复现;V2 也扩展了 RT-1 关于"多样性提升泛化"的结论(从物体多样性到技能多样性)。
- 评测中用到的方法:Diffusion Policy(D-GCBC 的思想来源,本仓库有笔记)、ACT(动作分块,本仓库有相关笔记)、对比 RL(CRL)、MUSE(语言编码)。
- 对比关系:
- 和 RH20T / RoboSet:同期的大规模数据集,各有侧重(RH20T 技能更多但每技能少),V2 强在"多方法 + 跨机构"的系统验证。
- 和 仿真数据集(BEHAVIOR-1K、CALVIN):那些是仿真,V2 是真机;真机更真实、更能评测真实泛化,但采集更贵。
- 下游 / 同族:BridgeData V2 是 Open X-Embodiment 等大规模跨机器人数据集运动的重要组成,也常被用作训练/评测各类 VLA 模型的数据源。
所以这一节是想说:BridgeData V2 站在 BridgeData + RT-1 的肩膀上,用"平价公开机器人 + 通用设计 + 系统的多方法多机构验证",成为真机操作数据集的标杆,并汇入了跨机器人大数据的浪潮。
和本导读的关系
本笔记对应导读中"数据集与规模化"这条线的关键节点。
机器人学习要复刻 CV/NLP 的成功,绕不开"数据"这个基础设施。BridgeData V2 的意义在于——它证明了"大数据 + 大模型 = 强泛化"的配方在真机操作上成立,并给出了一份人人能用、跨机构通用的数据。理解了它,你就理解了为什么后来会有 Open X-Embodiment 这种把几十个实验室数据汇总的运动,也理解了 RT-1/RT-2/OpenVLA 这些大模型的数据从哪来。
读完本笔记,建议:对照看 CALVIN / BEHAVIOR-1K 笔记(仿真数据/基准,理解真机 vs 仿真的取舍),再看 RT-1 / OpenVLA 等 VLA 模型笔记(理解这些数据怎么被用来训大策略)。三者连起来,就能看清"数据 → 模型 → 评测"的规模化闭环。
对应导读章节:Ch21:数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO。
所以这一节是想说:本笔记是"数据集与规模化"这条线的核心,读它能理解真机大数据的价值,再结合仿真基准和 VLA 模型笔记看清规模化全貌。
思考题
以下问题检验你是否真正理解了 BridgeData V2 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:为什么 BridgeData V2 坚持每个场景采"任意可行任务",而不像原版那样为一小组预定义任务采集?
提示
关键是逼多任务策略"看任务指令"而非"从画面猜任务"。如果一个场景里只采一种任务(比如厨房里只采"开抽屉"),那策略看到厨房画面就能直接推断出"要开抽屉"——它根本不需要看任务指令,任务信息泄露在了初始观测里。这样训出的"多任务"策略其实是假的,换个指令它不会响应。而在同一个厨房场景里采集多种可能任务(开抽屉、放餐具、拿食物……),同样的初始画面对应多个不同任务,策略就必须去看目标图/语言指令才能知道该做哪个。这才是真正的多任务、开放词表策略。所以这个采集哲学是为"可条件化的多任务学习"服务的,是数据集设计的深思熟虑之处。
Q2:为什么要额外用脚本策略采集"经常失败"的次优数据?失败的数据不是噪声吗?
提示
对不同的学习方法,"失败数据"的价值不同。对纯模仿学习(行为克隆),失败数据确实可能是噪声——你不想让策略模仿失败动作。但对离线强化学习,次优/失败数据非常有价值:RL 通过奖励信号学习"什么该做、什么不该做",它需要更广的状态-动作覆盖(包括失败的),才能学出鲁棒策略并知道如何从错误中恢复。而且脚本自动采集比人工遥操作快得多、便宜得多,能快速积累大量抓放数据覆盖各种物体。这正体现了 BridgeData V2 "一份数据兼容多方法"的设计——它同时服务 BC 和离线 RL 两类假设不同的方法,所以既有高质量人类示范(给 BC),又有大量次优脚本数据(给 RL)。用户还能自由选择是否用这部分,灵活取舍。
Q3:实验发现语言条件方法(LCBC)在未见物体上几乎归零(0.08),而目标图条件方法(GCBC 0.60)好得多。为什么?
提示
差别在"任务怎么指定"。语言条件方法要理解物体的名字并把它和视觉中的物体对应起来(grounding)。如果一个物体名(比如某种没见过的水果)从没在训练数据里出现过,策略就不知道这个词指的是画面里哪个东西——语言 grounding 失败,自然做不了。而目标图像条件方法给的是"目标状态长什么样"的一张图,它不依赖物体名,只需要把当前画面变成目标画面的样子——即使物体没见过,只要它在目标图里,策略也能大致知道要把它移到哪。所以对未见物体,目标图条件天然更鲁棒。这也揭示了语言条件学习的核心挑战:开放词表的 grounding。后续工作(如用预训练 VLM 提供更强的语言-视觉对齐)正是为解决这个问题。
Q4:跨机构实验中,RT-1 几乎不掉(0.47→0.40),而目标图方法掉得多。RT-1 做对了什么?
提示
RT-1 有几个关键设计让它对域偏移更鲁棒:(1) 更大的图像分辨率(320×256 vs 其他 128×128),保留更多细节,对新环境的视觉变化更有辨别力;(2) 动作离散化,把动作预测变成分类问题,通常比连续回归更稳定;(3) 观测历史,用过去几帧的信息,能更好地消歧、抵抗单帧的域偏移;(4) 它是更大容量的 Transformer,配合大数据能学到更泛化的表示。此外,语言条件(RT-1 用)在跨机构时可能比目标图条件更稳——因为目标图方法需要在新实验室提供匹配的目标图,而"翻转锅到正立"这类任务的目标图很难区分朝向,反而吃亏。综合这些,RT-1 在跨机构零样本上表现最好。这也印证了论文的规模化结论:更大模型 + 更多设计(历史、离散化、大图)在泛化上有优势。
Q5:技能多样性实验中,数据量几乎相同(28k vs 27k),但 13 种技能训练比 3 种技能在未见抓放任务上好一倍(0.65 vs 0.30)。这个"正迁移"是怎么发生的?
提示
正迁移来自"不同技能共享底层能力"。抓放(pick-and-place)这个技能,本质上需要一系列子能力:识别物体、对准、控制夹爪、协调手臂运动、感知空间关系等。而别的技能(推、擦、折、开门……)也在锻炼这些子能力——比如"推"锻炼空间对准和运动控制,"折布"锻炼精细操作,"开门"锻炼精确对准把手。当策略在多样技能上训练时,它学到的这些共享底层表示更通用、更鲁棒,迁移回抓放时就更强,尤其在未见物体上(因为它见过更多样的物体交互,泛化更好)。反之只用 3 种技能训练,学到的表示更狭窄、更容易过拟合到那几种技能的特定模式。这个结果扩展了 RT-1 的发现——RT-1 说物体多样性提升泛化,BridgeData V2 说技能多样性也能提升泛化,两者都指向"多样性是规模化的关键维度"。
Q6:BridgeData V2 用 5Hz 控制频率、低精度任务。如果有人想用它研究"高速动态操作"或"精密插装",会遇到什么问题?
提示
会遇到根本性的不匹配。(1) 控制频率不够:5Hz 意味着每 0.2 秒才发一个指令,对高速动态任务(如接飞来的球、快速投掷)远远不够——这类任务需要几十甚至上百 Hz 的闭环控制。用 5Hz 数据训出的策略无法产生高频精细的动作。(2) 缺力控信息:数据只有视觉和位置,没有力/触觉。精密插装(如把插头插进孔、拧螺丝到位)本质是力控任务,需要感知和调节接触力,纯位置/视觉信息学不出来。(3) 任务本身是低精度的:数据里的任务对精度要求不高(把东西大致放到某处即可),没有高精度示范可学。所以 BridgeData V2 不适合这两类研究。想研究它们需要专门的数据集:高频采集(用于动态任务)、带力/触觉传感(用于精密插装)、且包含高精度示范。这也是论文明确列出的局限和未来方向——数据集是为研究"泛化"设计的,不是为研究"力控/动态"设计的,用对场景很重要。
Q7:BridgeData V2 特意用平价公开的机器人以便"人人能用",但也承认别的实验室未必都用同款机器人。你觉得怎么解决"跨机器人形态"的通用性问题?
提示
这是个开放难题,几个思路:(1) 汇总多机器人数据——这正是 Open X-Embodiment 的做法:把几十个实验室、各种机器人的数据合到一起训练,让模型见过多种形态,从而学出某种跨形态的通用表示。BridgeData V2 本身就是这个运动的重要组成。(2) 形态无关的动作表示——用末端执行器空间的相对动作(而非关节空间),不同机器人的关节结构虽异,但末端位姿的语义相通,便于迁移。(3) 少量目标机器人数据微调——先在多机器人大数据上预训练,再用目标机器人的少量数据微调(论文也提到用少量本地数据能显著提升)。(4) 显式的形态条件——把机器人的形态参数(关节数、连杆长度等)作为输入条件,让一个模型能适配多种机器人(如 RT-X、跨形态策略工作)。核心矛盾是"数据采集要标准化到某款机器人 vs 想让策略跨机器人通用"——单一数据集无法两全,需要靠社区汇总多机器人数据 + 形态无关/形态条件的建模来共同解决。BridgeData V2 选择先把"单一平价机器人上的跨环境跨机构"做扎实,把跨形态留给更大的联合努力。
所以这一节是想说:能回答这 7 题,你就真正理解了 BridgeData V2 为什么采任意任务、加脚本数据、用目标图/语言双条件,以及它的力控/动态/跨形态局限。
一些好奇心问答(FAQ)
Q1:BridgeData V2 到底有多大? 60096 条轨迹,其中 50365 条人类遥操作示范(84%)+ 9731 条脚本自动采集(16%),涵盖 13 种技能、24 个环境、100+ 物体。是原版 Bridge Dataset 的 7 倍多。
Q2:用的什么机器人?贵吗? WidowX 250 机械臂,整套约 4000 美元,全部公开可购、两周内能凑齐——这是它"人人能用"的关键。
Q3:数据里有语言吗? 有。采集时不标注,事后用众包平台给每条轨迹配语言描述,重点标注被移动物体的最终位置。支持语言条件和目标图像条件两种任务指定。
Q4:它验证了几种学习方法? 6 种:目标图条件的 GCBC、D-GCBC、ACT、CRL;语言条件的 LCBC、RT-1。用一份数据训这么多假设不同的方法,是它极少见的优点。
Q5:真能在别的实验室用吗? 能。另一个机构零样本评测,所有方法都有非零成功,RT-1 几乎不掉(0.47→0.40)。作者还指出用少量本地数据微调能进一步提升。
Q6:为什么控制频率只有 5Hz? 因为它面向的是低精度、非动态的操作任务(抓放、推、折等),研究的是泛化而非高速控制,5Hz 够用。高速动态任务需要更高频率的数据。
所以这一节是想说:BridgeData V2 的实操问题(规模、机器人成本、语言、验证方法数、跨机构、控制频率)都有明确答案,核心就是"平价通用大数据"这一招。
如果你想再深入
按"必读前置 → 评测方法 → 对比 → 后续"排序:
- 必读前置:BridgeData / RT-1(Ebert 2021 / Brohan 2022) — 前作和被复现的方法,理解 V2 在解决什么、扩展了什么结论。
- 评测方法:Diffusion Policy / ACT — 本仓库有笔记,理解 D-GCBC 和 ACT 的动作生成思路。
- 对比:CALVIN / BEHAVIOR-1K — 本仓库有笔记,仿真基准,对照理解真机 vs 仿真。
- 后续:Open X-Embodiment — 跨机器人大数据汇总,BridgeData V2 是其组成部分。
- 应用:OpenVLA / RT-2 — 理解这些数据怎么被用来训大规模 VLA 模型。
所以这一节是想说:把 BridgeData + RT-1 + BridgeData V2 + Open X-Embodiment 连起来读,就能看清真机操作数据从"小而专"到"大而通用再到跨机器人"的完整脉络。
原文信息
BibTeX
@inproceedings{walke2023bridgedatav2,
title = {BridgeData V2: A Dataset for Robot Learning at Scale},
author = {Walke, Homer and Black, Kevin and Lee, Abraham and Kim, Moo Jin and Du, Max and Zheng, Chongyi and Zhao, Tony and Hansen-Estruch, Philippe and Vuong, Quan and He, Andre and Myers, Vivek and Fang, Kuan and Finn, Chelsea and Levine, Sergey},
booktitle = {Proceedings of the Conference on Robot Learning (CoRL)},
year = {2023}
}
链接
所以这一节是想说:这是 Walke et al. 2023 年发表在 CoRL 的工作,用"平价公开机器人 + 通用设计 + 系统的多方法多机构验证",证明了大数据大模型配方在真机操作上成立,成为机器人操作数据集的标杆。
◼
引用本笔记 / Cite this note
@online{eai_bridgedata_v2_2026,
title = {(readable note) BridgeData V2},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/bridgedata-v2/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?