Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Datasets & Benchmarks · Plate Nº 27

RLBench: The Robot Learning Benchmark & Learning Environment

40 min read · 14125 字 · ⭐⭐ · 长篇结构化

这是一份给"完全没接触过机器人 / AI"的读者看的精读笔记。语言尽量像聊天,公式和术语全部翻成人话。

1. 一句话讲什么(TL;DR)

给机器人手臂出了一套 100 道题的"统考卷",从此大家都做同一套题,第一次能公平比谁更厉害。

所以这一节是想说:这篇论文做的是一套"统一考卷",不是新算法。


2. 这是个什么场景

想象你和朋友都说自己厨艺好。你晒一张番茄炒蛋,他晒一份红烧肉,菜不一样、用的锅不一样、连"好吃"的标准都不一样——你们怎么比?

2019 年的机器人研究圈就是这副样子:

北京实验室让机器人学"开门",写论文说成功率 85%。 上海实验室让机器人学"叠杯子",写论文说成功率 92%。 你想问:到底哪家方法更强?

答不出来。因为每家:

  • 用的机器人不一样(这家是 UR5,那家是 Sawyer)
  • 摆的桌子不一样(这家有摄像头在头顶,那家在手腕)
  • 出的题不一样(开门 vs 叠杯子,根本没法比)
  • 评分标准不一样(这家算"碰到了就算赢",那家要求"完全闭合")

就像每个学校都自己出高考卷、自己阅卷,然后宣布"我们学校理科满分率最高"。没有统一卷子,所有"我比你强"都是空话

更糟的是:算法被偷偷"为题目量身定做"。如果一个方法在某个难任务上不行,研究者就只报告它在简单任务上的分数。读者根本看不出来。

RLBench 想做的事,是给机器人圈造一场"高考":

  • 100 道全国统一题
  • 同一种机器人手臂(Franka Panda 7 自由度)
  • 同一种摄像头布置(一个头顶相机 + 一个手腕相机)
  • 同一种评分(任务完成 +1 分,没完成 0 分)
  • 同一种数据接口(一行 Python 代码就能取题)

只要大家都用这套,第一次能光明正大说"我的方法比你强 5 个点"。

所以这一节是想说:RLBench 要做机器人圈的"普通高考"——一套谁都得用的统一卷子。


RLBench — 场景示意:这论文要解决的现实问题
Plate Nº IRLBench — 场景示意:这论文要解决的现实问题

3. 之前的人怎么做的,为什么不够好

  • OpenAI Gym / DeepMind Control Suite:游戏型基准,比如让虚拟人形走路、平衡杆。问题是太抽象——和真实机器人在桌上抓东西完全不像。在这种基准上跑得好的算法,搬到真实机器人就崩。
  • OpenAI Gym 里的少数机器人任务:太简单,几个抓取就完事,没有长链条任务(比如"开烤箱 → 把托盘放进去")。
  • Amazon Robotics Challenge / RoboCup@Home:是真正的机器人比赛,但每年只搞一次,需要实体场地,普通实验室根本复现不了。没法当日常评测用
  • RoboTurk:用众包让人类远程操作机器人录数据,但只有 3 个任务——多样性根本不够。
  • Meta-World(同期对手):也是 19 年提出的多任务基准,方向相近,但当时文档还没齐,定位不清。
  • 大家各自造任务:最常见的做法。每篇论文设计自己的几个抓取任务、自己的奖励函数。结果就是上面说的"没法横向比较"。

所以这一节是想说:之前要么是过家家级别的玩具任务、要么是一年一次的大赛、要么是各家自造,没有"日常用、能复现、覆盖广"的统一题库。


4. 这篇论文的新想法

用一套带"任务建造工具"的仿真环境,造出 100 个手工设计的真实操作任务,每个任务能自动生成无限示范数据;并且首次定义"机器人少样本挑战"作为这套基准的最高难度赛道。

听起来朴素,但当时没人愿意花这个力气把"100 个任务 + 无限示范 + 共享接口 + 难度分层 + 工具链"全做齐。

所以这一节是想说:核心创新是工程"狠"——把一个分散领域真正缺的基础设施一次性铺平。


5. 它分几步做的(方法)

Figure:RLBench 基于 CoppeliaSim 的任务与场景 API
Plate Nº IIFigure:RLBench 基于 CoppeliaSim 的任务与场景 API

上图说明:Figure:RLBench 基于 CoppeliaSim 的任务与场景 API(论文原图)。

Figure:100 任务变体与评测协议示意
Plate Nº IIIFigure:100 任务变体与评测协议示意

上图说明:Figure:100 任务变体与评测协议示意(论文原图)。

把这套"机器人高考"做出来,作者其实在干 5 件事——就像办一场高考要准备的东西:考场、题型、答题示范、出题工具、加试赛道。一件件来:

  1. 统一仿真场景(搭考场)
  2. 任务三层结构(定义"题型 / 题目 / 实测")
  3. 自动生成示范(请数学算法当陪练)
  4. 任务建造工具(让别人也能加题)
  5. 少样本挑战(设一条加试赛道)

5.1 统一仿真场景:所有 100 道题共用一张桌子

类比

想象一个大学物理实验室。所有实验都在同一张实验台上做:力学题、光学题、电学题——桌子不变、灯不变、椅子不变,只换桌上的实验器材。

RLBench 就是这种统一实验台:

  • 机器人:一台 Franka Emika Panda 7 自由度机械臂,固定在一张木桌上。
  • 摄像头:一个头顶立体相机(双目,能算深度)+ 一个绑在手腕上的单目相机。
  • 数据:每帧返回 RGB 彩图、深度图、分割图(每个像素属于哪个物体)。
  • 机器人状态:关节角度、关节速度、关节力、末端位置和姿态(姿态 = 朝哪个方向、转了多少)。
  • 光线:3 盏定向灯。

自由度(DoF, Degrees of Freedom):机械臂能独立动的关节数。7 自由度意味着臂可以从任何角度伸到目标点,比 6 自由度灵活得多。

立体相机(stereo camera):两个并排的镜头,像人的两只眼睛。两个视角的差异可以反推距离,得到"深度图"。

深度图(depth map):和 RGB 图一样大的一张灰度图,每个像素的"亮度"=该点离相机的距离(米)。

分割图(segmentation mask):和 RGB 图一样大,每个像素填一个物体 ID。仿真器能直接吐出来,不像现实世界要用 AI 才能算。

末端位置和姿态(end-effector pose):手腕这一头在 3D 空间里的坐标(x, y, z)+ 它朝哪个方向(用四元数或欧拉角表示)。

它在干什么

每道题开始时:

  1. 把机器人手归位到固定起始姿势(不抓任何东西)。
  2. 在桌子中央生成这道题需要的物体(比如一个锅、一个锅盖)。
  3. 物体的位置每次随机扰动(防止模型死记位置)。
  4. 用户的 Agent 开始接收摄像头流和机器人状态,输出动作。

为什么这步有用

  • 桌子和机器人不变 = 所有论文都在比"同一个考场",公平。
  • 同时给 RGB / 深度 / 分割三种视觉数据 = 不同流派的方法都能用:纯像素派用 RGB、几何派用深度、有标签派用分割。
  • 不带初始抓握 = 模拟现实情况——家里的机器人不会自动握着勺子站着。

论文还特别提到一个设计决策:所有任务都假设机器人一开始没有握住任何物体。这和当时很多论文"预设机器人已经抓好了工具"的做法不同。作者的理由是——家用机器人未来的工作场景就是"从零开始自己拿工具",所以基准也应该这么设。代价是任务难度显著上升。

场景的额外设计细节

论文还提到了几个容易被忽略但重要的场景设计选择:

  • 机械臂可替换:虽然默认用 Franka Panda,但作者明确说"可以用一行代码换成别的机械臂"。这个设计的意图是支持 sim-to-real 研究——如果你的实验室有一台别的型号的机械臂,你可以把仿真里的 Panda 换成你的型号,在统一任务集上对比 sim-to-real 方法。这在 Section VI-c 中被作为一个独立研究方向提出。
  • Domain Randomization 渲染选项:场景支持域随机化渲染——随机改变光照方向、物体纹理、相机位置等视觉参数。这是为 sim-to-real transfer 铺路的:如果模型只在固定渲染条件下训练,搬到真实世界就会因为光照/纹理差异而崩溃。域随机化让模型"见过足够多的视觉变体",从而对新环境更鲁棒。
  • 头顶立体相机 vs 手腕单目相机的分工:头顶相机看到全局场景(桌面全貌、物体分布),适合"规划去哪";手腕相机看到局部细节(夹爪和物体的近距离视角),适合"精确对准"。两个视角互补,模拟了人类"先环顾四周再低头干活"的视觉策略。同时,手腕相机的存在也为"部分可观测"(partial observability)研究打开了入口——当你只用手腕相机时,机器人看不到桌面全貌,必须靠记忆和探索来补全信息。
  • 3 盏定向灯的选择:不是随意放的——3 个方向的光源确保物体从各角度都有明暗对比,避免单光源导致的"一面全亮一面全黑"。这让 RGB 图像包含更多可用的视觉特征,也模拟了室内多光源照明的真实情况。

Environment API:用户怎么和这套场景交互

论文 Figure 5 展示了完整的 API 使用流程,核心是一个 Environment 类:

env = Environment(DATASET, ActionMode.ABS_JOINT_VELOCITY)
env.launch()
task = env.sample_task()  # 随机抽一个任务
demos = task.get_demos(2)  # 取 2 条示范
# RL 训练循环
for i in range(training_steps):
    if i % episode_length == 0:
        descriptions, obs = task.reset()  # 重置 + 返回文字描述
    action = agent.act(obs)  # 模型输出动作
    obs, reward, terminate = task.step(action)  # 执行 + 返回观测/奖励/是否结束

这个 API 模仿了标准的 RL agent-environment 循环:reset() 返回初始观测和任务描述,step(action) 返回新观测 + 奖励 + 终止信号。关键细节:reset() 返回的 descriptions 是一个字符串列表(如 ['take lid off the saucepan']),这就是给自然语言接口预留的入口。奖励 reward 在任务完成时为 +1,其余时刻为 0——完全稀疏。terminate 在成功或超时时为 True。

所以这一节是想说:所有 100 道题用一张同款实验台,把硬件不一致这个噪音先消掉;同时通过可替换机械臂、域随机化、双视角相机等设计,为 sim-to-real 和部分可观测研究预留了接口。


5.2 任务的三层结构:Task / Variation / Episode

类比

把这套结构想成"题型 → 题目 → 实测":

  • Task(题型):比如"叠积木"。
  • Variation(题目):题型下的具体版本——"叠 3 块红色积木"是一道,"叠 5 块蓝色积木"是另一道。变的通常是颜色、数量、目标物。
  • Episode(实测):同一道题目里,物体每次摆放位置都不一样——这叫一次实测。可以无限抽。

任务(Task):题型,相当于一个 Python 类。比如 StackBlocks

变种(Variation):题型下用整数索引的不同子配置。比如变种 0 = 红积木,变种 1 = 蓝积木。每个变种自带一段文字描述(比如"stack 3 red blocks"),未来给 NLP / 自然语言指令用。

片段(Episode):从某个变种随机抽出的一次"开局"。每次只换物体初始位置。

轨迹(trajectory):一次 episode 里所有时刻的"观察 + 动作"序列。论文写成 τ = [(o₁, a₁), ..., (o_T, a_T)]。说人话:一段时间里"机器人看到的画面 + 它做的动作"按时间排好。

它在干什么

为啥要分三层?因为研究者对"任务"的定义吵不清。"拿苹果"和"拿香蕉"算一个任务还是两个?吵了很多年。RLBench 干脆说:

  • 这两件事属于"拿东西"这一个 Task。
  • 但是不同的 Variation。
  • 多变种放一起就能训练"听话"——给一句话指令,机器人去执行。
  • 多片段放一起就能训练"鲁棒"——同一道题每次摆得不一样,机器人都要做对。

100 道题里很多自带十几个变种,所以总变种数远超 100。

形式化定义如下:每个 Task 是一个变种集合 T = {ν₁, ..., ν_N},每个变种 ν 可以无限抽样出 episode 轨迹 τ ∼ ν,每条轨迹 τ = [(o₁, a₁), ..., (o_T, a_T)] 由观测-动作对序列组成。

三层结构的另一个妙用:评测粒度可控

这三层结构不只是为了"分清楚任务定义"——它直接决定了你能做什么样的实验:

  • 如果你想测位置鲁棒性("同一个任务换不同摆放能不能做对")→ 在同一个 Variation 下抽多个 Episode 做测试。
  • 如果你想测同族泛化("学会拿红苹果后,能不能拿绿香蕉")→ 在同一个 Task 下,用部分 Variation 训练,剩余 Variation 测试。
  • 如果你想测跨任务迁移("学会开门后,能不能更快学会开抽屉")→ 在 Task 层面切分训练/测试集。
  • 如果你想测少样本学习("见过 90 道题后,给 5 条示范能不能学会第 91 道")→ 用 90 个 Task 做 meta-train,10 个 Task 做 meta-test,每个测试 Task 给 K 条示范。

这意味着同一套基准可以服务四个不同的研究问题——研究者只需在不同的层级切分训练/测试边界。这是 RLBench 设计中最经济的一点:三层结构 = 四种评测协议的天然支撑。

论文 Figure 4 用一个示意图展示了这个结构:以"stack blocks"任务为例,它有 V 个 Variation(不同颜色/数量的积木),每个 Variation 有 E 个 Episode(不同摆放位置)。每个 Variation 附带文字描述列表,用于自然语言接口。

为什么这步有用

  • 一刀切:清空所有"这是不是同一个任务"的吵架。
  • 自然支持多任务、少样本、自然语言指令三个研究方向——你想测哪个,就在哪一层切分训练 / 测试就行。

所以这一节是想说:用三层抽象一次性解决了"任务到底是啥"的定义之争。


5.3 自动生成无限示范:让运动规划器当"陪练"

类比

教学徒做菜,最贵的是请大厨示范。100 道菜每道演 50 遍,请大厨累死。

RLBench 的方案:在仿真里让数学算法当大厨——在每道题创建时,作者手工标好"先到这个点,再到那个点"的几个关键路标,剩下的由"运动规划器"自动算出怎么走过去。

运动规划器(motion planner):一种数学算法,输入是"机械臂现在在哪、要走到哪、桌上哪些地方有障碍",输出是一段不撞东西的关节角度序列。RLBench 用的是 OMPL(Open Motion Planning Library),开源、成熟。

路标(waypoint):3D 空间里的一个点 + 一个姿态。任务设计者先在仿真里手动放几个"必经点",规划器负责把它们连成完整轨迹。

示范(demonstration):完整的一段"专家"轨迹,让机器人模仿。

专家策略(expert policy π*:理论上"会做这道题"的最优做法。这里就是"路标 + 运动规划器"组合。

它在干什么

  1. 设计者建任务时,在仿真里手动拖几个路标("先飞到锅上方、再下降抓锅盖、再抬起来")。
  2. 调用 OMPL 把路标连成一条不撞物体的关节序列。
  3. 物体位置随机扰动后,重新算一遍——每次都是新示范。
  4. 想要 1 万条示范?跑 1 万次就好,仿真不要钱

论文中的形式化表达:每个任务都有一个对应的专家策略 π*,由 OMPL 在任务创建时预设的 waypoint 序列上运行运动规划来生成示范轨迹。这个 π* 不是学出来的,是"规划"出来的——所以它的质量取决于 waypoint 设计得好不好,而不是训练数据多不多。

为什么这步有用

  • 模仿学习(让 AI 模仿专家)最大的瓶颈是"哪来这么多专家数据"。RLBench 把这个瓶颈直接抹掉。
  • 后来很多重磅论文(CLIPort、PerAct、RVT、3D Diffuser Actor、Diffusion Policy 的部分变体)能爆发出来,就是因为 RLBench 提供了海量免费示范
  • 但代价:示范都是"运动规划器"风格——动作流畅但不像人手会的"摸索 + 校正"。这一点后面会有论文(如 RoboMimic)补刀。

用户有两种获取示范的方式:一是从预先采集好的数据集里直接加载(task.get_demos(2)),二是运行时实时生成。前者适合大规模训练前批量采集,后者适合需要动态数据的场景。

OMPL 的技术细节

OMPL(Open Motion Planning Library)是一个开源运动规划库,支持多种规划算法。RLBench 使用它的核心原因是:

  1. 无需训练:OMPL 是基于采样的规划器(如 RRT、PRM),不依赖任何学习过程——给定起点、终点和障碍物几何,直接算路径。这意味着示范质量是确定性的、可复现的。
  2. 处理高维空间:Franka Panda 有 7 个关节 + 1 个夹爪 = 8 维配置空间。OMPL 的采样规划器在高维空间中比网格搜索高效几个数量级。
  3. 碰撞检测:OMPL 集成了碰撞检测,保证生成的轨迹不会穿过桌面或物体。但碰撞检测的精度取决于仿真器的物理模型——如果物体的碰撞网格不够精细,规划器可能生成"看似可行但实际会蹭到"的轨迹。

示范质量与局限的深入分析

运动规划器生成的示范有一个隐含假设:任务的正确解法是"从 A 到 B 走最优路径"。但很多真实操作任务的解法不是最优路径——比如拧瓶盖需要旋转动作,倒水需要倾斜控制,这些不是简单的"从 A 点到 B 点"能描述的。RLBench 的 waypoint 设计部分解决了这个问题(设计者可以在 waypoint 中指定旋转、倾斜等特殊动作),但本质上还是"离散关键帧 + 连续插值"的范式,不能表达需要力反馈的连续调整动作。

这也是为什么后来的 RoboMimic 基准专门引入了人类遥操作数据——人类在拧瓶盖时会根据触觉反馈动态调整力度和角度,这种"闭环调整"是开环的运动规划器做不到的。

所以这一节是想说:用"路标 + 数学规划器"造出无限示范,让模仿学习的训练数据成本降为零;但代价是示范的"机器手风格"——平滑、最优、不含校正——这种风格在需要力反馈和闭环调整的任务上有天然局限。


5.4 任务建造工具:让别人能给题库添题

类比

Wikipedia 之所以能成今天这样,不是因为创始人写了所有词条,而是因为他们造了一个"任何人都能加词条"的编辑器。

RLBench 也是这个思路。每个任务由两个文件组成:

  • 场景文件(.ttm):用 V-REP 图形界面拖出来的 3D 场景(锅、锅盖、桌子摆好)+ 路标位置。像在 PowerPoint 里画演示文稿——拖拖拽拽,不用编程。
  • Python 文件(.py):30 行左右的代码,告诉系统"什么算成功"。比如 TakeLidOffSaucepan 这道题,只要"夹爪握着锅盖" + "锅盖被检测到在'成功区'里"两个条件同时满足就赢。

V-REP(即后来的 CoppeliaSim):一个图形化机器人仿真器,可以拖拽建场景。论文用的版本叫 V-REP。

PyRep:作者团队自己写的 Python 库,给 V-REP 套一层快速接口,让深度学习代码能高频调用。这是 RLBench 能跑起来的关键工程。

成功条件(success condition):一组判断逻辑,决定这一 episode 算不算赢。RLBench 提供了一组现成的判断模块("被夹住"、"被传感器检测到"、"两个物体重叠"等),用户像搭积木一样组合。

它在干什么

任务创建的生命周期分三步:

  1. init_task() 只调一次——注册可抓取的物体、设定成功条件。
  2. init_variation(int i) 每个变种调一次——返回文字描述列表,用于自然语言接口。
  3. init_episode() 每个 episode 调一次——做位置随机化。

设计者写完代码后,用任务校验工具(task validation tool)自动跑 N 遍示范采集,确保运动规划器的成功率足够高(论文要求失败率极低)。校验通过后通过 GitHub PR 提交到主仓库。

论文特别解释了为什么选 V-REP 而不是 MuJoCo 或 Bullet:MuJoCo 和 Bullet 是物理引擎,不是机器人框架。建一个带相机、灯光、可拖拽路标、IK 求解器的完整场景,在 V-REP 里几分钟拖出来,在 MuJoCo 里要写很多 XML。这对"让社区快速贡献新任务"至关重要。

任务创建的完整流程

论文 Figure 6 给出了一个完整的任务文件示例(TakeLidOffSaucepan),我们可以看到创建一道新题需要做什么:

  1. 在 V-REP 里拖场景(.ttm 文件):放入锅(saucepan)、锅盖(saucepan_lid)、接近传感器(success proximity sensor)。摆好位置。然后在场景里手动放置 waypoint——"飞到锅盖上方 → 下降到锅盖位置 → 闭合夹爪 → 抬起 → 移到传感器上方"。
  2. 写 Python 类(.py 文件):
    • init_task():注册可抓取物体(锅盖),设定成功条件("夹爪握着锅盖" AND "锅盖被接近传感器检测到")。
    • init_episode(index):返回文字描述列表 ['take lid off the saucepan']
    • variation_count():返回 1(这道题只有 1 个变种)。
  3. 跑校验工具:自动用 OMPL 尝试采集 N 条示范。如果成功率达标(论文要求失败率极低),任务通过校验。
  4. 提 GitHub PR:提交到 RLBench 主仓库,合并后所有人都能用。

RLBench 提供的成功条件模块库(conditions)是降低门槛的关键:

  • GraspedCondition(gripper, object):物体被夹爪握住
  • DetectedCondition(object, sensor):物体被接近传感器检测到
  • 还可以组合多个条件(AND 逻辑),用 register_success_conditions([cond_set]) 注册

这些模块像搭积木一样组合,覆盖了"抓住""放到指定区域""被传感器检测到"等常见成功判定。如果任务需要更复杂的判定逻辑,用户可以在 Python 文件里写自定义代码。

为什么这步有用

  • 这是 RLBench 能从 100 道题持续扩展的根本——论文发布后社区源源不断加题。
  • 把"机器人任务设计"从"研究员的私房菜"变成"开放协作",类似游戏圈的 Mod 社区。
  • 同样的思路 5 年后被 Meta 的 Habitat、NVIDIA 的 Isaac Lab 等更大平台继承。

所以这一节是想说:作者不只是建了 100 道题,还把"建第 101 道题"的工具开放给所有人。


5.5 首次定义机器人少样本挑战

类比

你已经会包饺子。现在请你在看 5 遍"包烧麦"演示之后,能自己包烧麦——这就叫少样本学习:人类天生擅长,机器学起来很难。

RLBench 把它做成正式比赛:

把 100 道题里 10% 拿出来当"测试卷"(meta-test),其他当"训练卷"(meta-train)。允许你在训练卷上随便用——海量示范、强化学习、什么都可以。

测试时,给你 K 段"测试卷"上某道题的演示视频(K=1、5、20 三档),你的系统要立刻能在这道题的新摆放上做对。

元训练 / 元测试(meta-train / meta-test):机器学习里"训练集 / 测试集"这一对的"上一层"——元训练里的整个任务集合是你"学经验"的地方;元测试里的任务你之前完全没见过,要快速适应。

K-shot:测试时只给你 K 个示范。1-shot 几乎是"看一眼就要会",20-shot 算很慷慨了。

少样本学习(few-shot learning):在极少示范下学会新任务的能力。当时主要在图像分类领域火过(Matching Networks、Prototypical Networks、MAML),机器人圈这是第一个大规模评测协议。

它在干什么

  • 锁定固定的 train / test 划分(公开在网站上,所有人用同一份)。
  • 报告 1-shot、5-shot、20-shot 三个数字——支持的算法谱系:循环网络派([41,42,43])、度量学习派(Matching Net、Prototypical Net)、梯度派(MAML)。
  • 随时间扩任务,叫成 v1.0 / v2.0 / v3.0,避免"以后题变了,老分数没意义"。

协议的关键约束:测试时系统只能获得 K 条示范的观测数据,不能获得关于未见任务的任何先验知识。这迫使系统真正"学会如何学习",而不是偷偷记住答案。

为什么这步有用

  • 当时图像少样本学界已经热闹了几年,机器人界一直没有可比的协议。RLBench 把"训练 80 道题、测试 10 道未见过的题"这个流程标准化了。
  • 这条路 5 年后开花结果:CLIPort、PerAct、RT-1、RT-2、OpenVLA 等都是奔"通用多任务 / 少样本机器人"去的。RLBench 是它们的早期跑分场。

论文还提出了其他应用方向:强化学习(用示范 bootstrap RL 策略来降低样本复杂度)、Sim-to-Real(一行代码换机械臂,方便对比 sim-to-real 方法)、多任务学习(同时学所有任务,不要求泛化到全新任务)、以及 SLAM(探索"操作型 SLAM"——什么地图表示最适合机器人操作任务)。这些方向在论文中是展望而非实验,但为后续社区研究指明了路径。

少样本协议的技术约束细节

协议对"什么信息可以给系统"做了严格限定,这些约束不是随意的——每一条都堵死了一种"作弊"路径:

  • 只能获得 K 条示范的观测数据:不能获得测试任务的奖励函数、动力学模型、或任务身份。如果系统知道"这是第 37 号任务",它可以从训练阶段偷学第 37 号的解法——这就不是"少样本学习"而是"查表"了。
  • 训练阶段无限制:meta-train 的 90 道题可以随便用——海量示范、RL 自行探索、多任务联合训练都行。这模拟了"机器人在工厂里学了很多技能后再被送到你家"的场景。
  • 报告 1-shot、5-shot、20-shot 三档:这三档分别模拟"看一眼就要会""看几遍大致会""认真学一阵子"三种现实场景。1-shot 是极限挑战,20-shot 是实用下限。
  • 版本化(v1.0):论文明确说"我们叫它 v1.0 是因为预期任务数量会持续增长"。每次任务集大幅扩展时发布新版本号,旧版本的成绩不会被新版本"稀释"。这解决了"基准 evolve 了之后老分数还有没有意义"的问题——有,只要你标注用的是哪个版本。

论文还列出了三类有望在这个挑战上发力的少样本算法家族:循环网络方法(MANN [41]、RL² [42]、SNAIL [43],用循环隐状态"记住"任务特征)、度量学习方法(Matching Networks [44]、Prototypical Networks [45],在特征空间中"最近邻匹配"新任务)、梯度方法(MAML [46]、LEO [47],学一个好的初始化使得几步梯度下降就能适应新任务)。论文指出这些方法"从未在如此大规模上测试过"——RLBench 是它们的第一次大考。

所以这一节是想说:第一次给机器人圈定义了什么叫"少样本评测"——不只是"给 K 条示范"这么简单,而是一整套堵死作弊路径、支持版本化、覆盖三类算法家族的严格协议,开启了通用机器人这条路线。


RLBench — 方法示意:核心 pipeline
Plate Nº IVRLBench — 方法示意:核心 pipeline

6. 关键数字(What works)

这篇论文的"成绩"不是某个算法的分数(它本身不提算法),而是"基准本身的规模"。

6.1 任务规模对比

基准 任务数 示范来源 示范数量 动作空间种类
RLBench 100 运动规划器(无限) 无限 8 种
Meta-World 50 无内置示范 0 1 种
RoboTurk 3 众包人类遥操作 每题数百条 1 种
OpenAI Gym(机器人部分) 几个 0 1 种

6.2 任务长度分布

论文 Figure 7(下)从 75 个任务的第一变种中各取 5 条示范,统计平均时间步数:

长度区间 代表任务 说明
约 100 步 伸手碰目标(reach target) 最简单,单步动作
约 300-500 步 抓锅盖、按按钮 中等,含抓取 + 放置
约 800-1000 步 清空洗碗机(empty dishwasher) 最长,多步链:开门 → 拉托盘 → 抓盘子 → 抬起 → 放外面

对比 OpenAI Gym 大部分任务 100 步内结束。RLBench 的长任务真正提供了"长时序"挑战——短任务测反应力,长任务测规划力,前者好做,后者后来才被 Diffusion Policy / VLA 系列攻破。

6.3 观测模态一览

模态 来源 维度/格式 用途
RGB 彩图 头顶立体相机 + 手腕单目相机 2 张图/帧 纯像素方法
深度图 头顶立体相机 1 张图/帧 几何方法
分割图 头顶立体相机 1 张图/帧 有标签方法
关节角度 机器人本体 7 维向量 底层控制
关节速度 机器人本体 7 维向量 底层控制
关节力矩 机器人本体 7 维向量 力控方法
末端位姿 机器人本体 7 维(位置+姿态) 高层规划
夹爪状态 机器人本体 1 维 二值控制

6.4 动作空间 8 选 1

动作空间 层级 适合的方法类型
绝对关节速度 底层控制 RL(连续控制)
增量关节速度 底层控制 RL
绝对关节位置 底层控制 RL / 经典控制
增量关节位置 底层控制 RL
绝对关节力矩 底层控制 力敏 RL
增量关节力矩 底层控制 力敏 RL
绝对末端位姿 高层规划 IL / VLA
增量末端位姿 高层规划 IL / VLA

你想做的研究是"控制层"还是"决策层"?RLBench 都让你用——做底层控制的用关节力矩,做高层规划的用末端位姿。一套基准跨多个层级

6.5 奖励设计

设计选择 RLBench Meta-World 说明
奖励类型 完全稀疏(成功 +1,否则 0) 密集 + 稀疏两种 RLBench 刻意不设中间奖励
目的 测算法的探索能力 兼顾训练便利 RLBench 的稀疏奖励是 RL 的"地狱难度"
后果 纯 RL 几乎跑不动 RL 可解单任务 RLBench 上 IL 路线先吃饱红利

6.6 任务三层结构

层级 名称 数量 说明
第 1 层 Task(任务) 100 手工设计的完全独特操作任务
第 2 层 Variation(变种) 每任务若干 改颜色/数量/目标物,总变种数远超 100
第 3 层 Episode(片段) 无限 同变种内随机初始位置

所以这一节是想说:这套基准的"分量"来自规模、长度、稀疏奖励、三层结构、多动作接口五个维度叠加,是一套真正"重量级"的考卷。


7. 实验结果说明了什么

实验目标:RLBench 是一篇基准论文,不做算法实验。它的"实验"是验证基准本身是否可用——即:任务是否可解、示范是否能稳定生成、规模是否够大。

任务校验实验

论文提供了 task validation tool——每设计完一道新任务,用 OMPL 自动跑 N 次示范采集,统计成功率。只有当运动规划器的失败率极低时,这道题才被接受。这相当于"出题前先自己答一遍,确保题目没有 bug"。这个校验机制是 RLBench 质量的基本保障——如果某道题连运动规划器都做不出来,学习算法就更不可能成功了。

任务长度分析(Figure 7 下)

从 75 个任务的第一变种各取 5 条示范,统计平均时间步。结果:任务长度从 100 到 1000 步不等。论文指出长任务通常涉及"组合动作链"——例如"清空洗碗机"需要开门 → 拉托盘 → 抓盘子 → 抬出四步串行。这一发现为后续长时序研究(Diffusion Policy、VLA 系列)提供了明确的挑战目标。

描述词频分析(Figure 7 上)

对所有变种的文字描述做词频统计(去掉功能词),展示内容词分布。高频词包括"push""put""open""close""stack"等动作动词和"block""button""drawer"等名词。这张图的价值在于:它验证了 100 道任务的描述覆盖了足够多样的动词和名词——如果所有任务都是"pick and place",词频图会非常单调。

少样本挑战协议设计

论文没有跑少样本算法实验,但定义了完整的评测协议:

  • 100 道题中 10%(约 10 道)划为 meta-test,其余为 meta-train
  • 测试时给 K 条示范(K=1/5/20),评估新 episode 上的成功率
  • 训练阶段无限制——可用海量示范、RL、任何方法
  • 版本化(v1.0),随任务增长更新版本号

社区后续实验发现

虽然论文本身不跑算法,但社区在 RLBench 上的大量实验形成了以下共识:

  • 纯 RL + 稀疏奖励几乎全挂:SAC、TD3、PPO 在绝大多数任务上成功率为 0%。这和 Meta-World 形成鲜明对比——Meta-World 中 SAC 至少能解单任务,但 RLBench 的任务更复杂(更长操作序列、更多物体交互、更精细力控制)。
  • 模仿学习主导:用 OMPL 生成的示范训练 BC / BC-RNN,在大部分任务上能达 >50% 成功率。RLBench 上的论文几乎都是 IL 派的。
  • 3D 表征方法爆发:PerAct(2022)引入 3D 体素表征,RVT(2023)引入多视角 Transformer,3D Diffuser Actor(2024)引入 3D 扩散策略——它们都在 RLBench 上跑分,把成绩从"勉强能做"拉到"基本能解"。

控制变量

变量 如何控制
硬件 固定 Franka Panda + 固定桌面 + 固定灯光
视角 固定头顶立体相机 + 固定手腕相机
起始状态 每次归位到同一初始姿势,不预设抓握
随机化 只在 episode 级别随机化物体位置
成功判定 统一用 Python 注册的条件组合,非人为打分

所以这一节是想说:RLBench 的"实验"是基准自身的可用性验证——任务校验、长度分析、词频分析三项确保了这套题库的质量下限;而社区后续的大量实验则验证了它的上限和生态价值。


8. 你应该懂的几个新词

基准(benchmark):一套统一的任务和评测协议。AI 圈所有"我比你强"的论文都得在某个基准上比。RLBench 就是机器人操作领域的一个基准。

仿真环境(simulator):用代码模拟物理世界。机器人能在仿真里摔 1 万次不报废。RLBench 用的是 V-REP(现叫 CoppeliaSim)。

运动规划器(motion planner):给定起点、终点、障碍物,自动算一条不撞东西的路径。RLBench 用 OMPL。它是无限示范的核心。

路标(waypoint):3D 空间里的一个"必经点"。任务设计者手工放几个,规划器负责连。

末端执行器(end-effector):机械臂最末端的工具,这里是夹爪。"末端位姿"指夹爪的位置和朝向。

自由度(DoF):机械臂能独立动的关节数。Franka Panda 是 7 DoF,比 6 DoF 灵活,能从更多角度伸到同一个点。

示范 / 演示(demonstration):一段"专家"完整完成任务的动作记录。模仿学习就是让模型学这种轨迹。

模仿学习(imitation learning, IL):让模型学专家的动作。给一段"看到这个画面,专家做了这个动作"的配对数据,让模型记住。

强化学习(reinforcement learning, RL):让模型自己试错。做对加分、做错扣分,反复试一万次后慢慢学会。在稀疏奖励的 RLBench 上很难直接跑通,所以早期更多用 IL。

少样本学习(few-shot learning):只给极少(1-20)示范就要学会新任务的能力。RLBench 第一次给机器人圈定义了正式的少样本协议。

多任务学习(multi-task learning):一次训一个模型,同时会做多个任务,互相借力。

稀疏奖励(sparse reward):只有"完成"才有 +1,其余时间都是 0。是 RL 的最难模式。

PyRep:作者团队自己写的 Python-V-REP 桥梁库,让仿真和深度学习代码高效通信。是 RLBench 跑得动的工程基础。

所以这一节是想说:这十几个词以后看任何机器人学习论文都会反复出现,先和"考试 / 教学徒 / 实验台"这些日常类比挂钩。


9. 它有什么搞不定的

RLBench 不是万能的,作者也老实讲了几个硬伤:

  • 不够真:物理与渲染的 sim-to-real gap。仿真里的物体摩擦、形变、光影都比真实世界粗糙。一个在仿真里 90% 成功的策略,搬到真实 Franka Panda 上常常掉到 30%。这是 RLBench 时代的核心痛点,后续 Domain Randomization、Real2Sim 等路线都是为了缩这个差距。
  • 示范都是"机器手"风格。运动规划器生成的轨迹是平滑、最优的,不像人手那种"摸一下、校正一下"。模型学到的是"理想专家"的动作分布,遇到真实的乱糟糟世界容易抓瞎。
  • 奖励太稀疏,纯 RL 几乎跑不动。RL 在 RLBench 上"硬刚"基本不出活,得先模仿学习起步。这导致几年里 RLBench 上的论文几乎都是 IL 派的。
  • 任务多样但仍偏桌面操作。所有任务都在一张桌子上、用一个机械臂——没有移动机器人、没有双臂协作、没有人机交互。这些维度后来由别的基准(如 LIBERO、Habitat、ManiSkill)补上。

所以这一节是想说:RLBench 让"桌面单臂操作"变成可比、可复现的领域,但仿真真实度、双臂、移动操作都得后人补。


10. 它和别的论文是什么关系

把 RLBench 放进我们读过的论文坐标系里看:

  • 和 Habitat(同年同期,dataset-eval):方向互补。Habitat 解决的是"室内导航"基准——机器人在家里走来走去找东西;RLBench 解决的是"桌面操作"基准——机器人手伸出去做事。两套合起来覆盖了"具身 AI"的两大支柱。机器人要既会走又会动手。
  • 和 Diffusion Policy / IBC(imitation 类):这些是后来在 RLBench 这套题上跑出顶尖分数的算法。没有 RLBench 这种统一题库,就没有它们的可比性。RLBench 是"考场",它们是"考生"。
  • 和 OpenVLA / VLAs / SayCan(vla / planning 类):VLA 时代的工作开始把"语言指令 + 视觉"当成机器人输入。RLBench 早期就给每个 Variation 配了文字描述,本质上预留了这个接口——只是 2019 年还没有大模型来用。后来 RT-2、OpenVLA 等都把 RLBench 当跑分场之一。
  • 和 GAIL(imitation foundation):GAIL 是模仿学习的算法范式(用对抗训练学专家分布),RLBench 给它提供"用什么数据来学"。两者是"算法 ↔ 数据"的关系。

简单类比:RLBench 像高考的命题委员会,Diffusion Policy / OpenVLA 这些是来考试的学生。命题委员会本身不当学霸,但没有它就没有"全国卷之争"。

所以这一节是想说:RLBench 是后续一大批操作论文得以横向比较的基础设施,是机器人圈的 ImageNet 雏形之一。


11. 和本导读的关系

对应章节:Ch21(数据集全景)—— 21.4.2 节"RL 导向基准:RLBench"

在导读体系中的位置

Ch21 按"真机 → 仿真"的顺序梳理了整个机器人数据/基准生态。RLBench 被归类为"仿真操作基准"中的 RL/IL 导向类——它不是用来"训练"机器人的数据集,而是用来"考试"的标准化测试平台。导读特别强调了"纯 RL + 稀疏奖励几乎全挂"这一发现,并将其解读为"IL 路线在复杂操作任务上的必然性"的关键证据。

在 Ch21 的"尺子型 vs 食材型"分类框架中,RLBench 属于尺子型基准——标准化、评测严格、用于横向对比。与 OXE / DROID / BridgeData V2 等"食材型数据集"不同,RLBench 的目标不是"喂给模型足够多的数据",而是"给所有模型同一张考卷,分数高者强"。

与导读其他章节的联系

  • Ch11(RT-1/RT-2)和 Ch12(OpenVLA):这些 VLA 模型在评测泛化能力时,沿用了 RLBench 开创的"多任务统一评测 + 少样本协议"思路。RLBench 的三层结构(Task/Variation/Episode)为 VLA 的"语言条件 + 视觉"评测提供了天然接口。
  • Ch13(Diffusion Policy):Diffusion Policy 在 RLBench 类型的长时序任务上展示了 IL 方法处理"多步组合动作"的能力,验证了 RLBench 长任务(100-1000 步)的研究价值。
  • Ch17(Sim-to-Real):RLBench 纯仿真的局限正是 Ch17 讨论 sim-to-real gap 的出发点之一。Ch21 中提到"仿真里 Franka 夹爪闭合角度和真实差 2-3 度"这一具体例子,就是 RLBench 时代的典型痛点。
  • 21.4.1(Meta-World):Meta-World 是 RLBench 的"同期对手"。两者方向不同——RLBench 偏"操作种类多 + 视觉为主 + 含长任务",Meta-World 偏"机械任务结构清晰 + 强 RL 友好"。后来 Meta-World 在 RL 圈用得多,RLBench 在视觉操作 / 模仿学习 / VLA 圈用得多。
  • 21.4.4-5(CALVIN/LIBERO):这两个基准补全了 RLBench 缺失的"长时序 + 语言条件"维度。LIBERO 可以看作"RLBench 思路 + VLA 时代需求"的更新版。

作为标准基准的传承

RLBench 是 PerAct(2022)、RVT(2023)、3D Diffuser Actor(2024)这一系列 3D 表征操作论文的标准跑分场。这些论文在 RLBench 上逐步把成绩从"勉强能做"拉到"基本能解",形成了清晰的算法进化链。新论文为了和这些经典工作对比,至今仍需在 RLBench 上报告结果。

定位一句话:RLBench 是仿真操作基准中的"视觉操作基石"——它定义了"100 任务 + 无限示范 + 少样本协议"的评测范式,后续所有视觉操作基准都在它的基础上补全某个维度(长时序/语言条件/家庭场景/跨形态)。

所以这一节是想说:在 Ch21 的"八大仿真基准"地图上,RLBench 占据"视觉操作 + 少样本"这个生态位,是理解整个评测体系从 RL 向 IL/VLA 演进的关键节点。


12. 思考题

Q1:RLBench 的三层结构(Task / Variation / Episode)解决了什么问题?如果只有 Task 和 Episode 两层(去掉 Variation),会丢失什么能力?

三层结构解决的是"任务定义的主观性"问题——"拿苹果"和"拿香蕉"算一个任务还是两个,学术界吵了很多年。RLBench 用 Task 归类(都是"拿东西"),用 Variation 区分细节(苹果 vs 香蕉),用 Episode 做位置随机化。

如果去掉 Variation 层:每个"拿苹果"和"拿香蕉"要么合并成一个 Task(丢失了"同族任务间的泛化"评测能力),要么各自独立成 Task(丢失了"任务结构共享"的训练信号)。少样本协议也会崩——meta-test 的"未见任务"如果只是"同 Task 不同位置",那测的就不是"举一反三"而是"位置鲁棒性"了。Variation 层让"同族不同细节"有了正式的归属,是少样本和多任务学习的关键中间粒度。

Q2:RLBench 用 OMPL 运动规划器生成示范。这种"机器手风格"的示范和人类遥操作示范有什么本质区别?对下游学习算法有什么影响?

运动规划器生成的轨迹是平滑、最优、确定性的——它走的是数学上的最短无碰撞路径,每一步都精确到位。人类遥操作的轨迹是曲折、含校正、含停顿的——人手会先大致靠近、再微调、有时候犹豫一下再动。

对下游学习算法的影响:

  1. 分布偏移:模型学到的是"理想专家"的动作分布,部署到真实世界时遇到噪声和扰动就容易崩——因为它从没见过"需要校正"的情况
  2. 多样性不足:所有示范都走同一类最优路径,模型学不到"多条路都能到达目标"的鲁棒性
  3. Multi-modality 缺失:人类示范可能有多种解法(先抓左边再翻 vs 先抓右边再翻),规划器通常只给一种。后来 Diffusion Policy 等方法专门解决多模态动作分布问题,但 RLBench 示范本身不天然提供多模态信号

这就是为什么 RoboMimic 后来专门提供人类遥操作数据——让模型学到更"接地气"的动作分布。

Q3:RLBench 同时提供 RGB、深度、分割三种视觉观测。如果你要设计一个只依赖 RGB 的方法和一个融合 RGB + 深度的方法,在 RLBench 上哪种任务上后者优势最大?为什么?

深度图优势最大的任务是需要精确空间定位的抓取和插入类任务,例如"把形状积木插到对应孔位"(shape insertion)或"把 USB 插头插入端口"。

原因:

  1. RGB 图像的深度信息是隐式的——模型需要从阴影、透视、纹理等线索中推断距离,这在仿真渲染中可能不够真实
  2. 深度图直接给出每个像素到相机的距离,不需要学习"从 2D 到 3D"的映射
  3. 插入类任务要求毫米级精度——夹爪需要对准孔位才能插入,深度信息直接告诉你"还差多远"
  4. 分割图告诉你"哪些像素是目标物体",但不告诉你"目标在 3D 空间哪里"——深度图补上了这一环

反过来,对于"按按钮"这种只需粗略定位的任务,RGB 就够了,深度图的边际收益不大。RLBench 同时提供三种模态的价值在于:让研究者能公平比较"纯视觉"和"几何增强"两类方法的适用边界。

Q4:RLBench 有 100 个任务,Meta-World 有 50 个。为什么任务数量从 50 到 100 是一个质变而不仅仅是量变?关键差异在哪里?

关键差异不在数量本身,而在任务复杂度和多样性维度

  1. 长时序任务:RLBench 包含需要 800-1000 步的多阶段任务(如"清空洗碗机":开门 → 拉托盘 → 抓盘子 → 抬出),Meta-World 的任务大多在 100-200 步内完成。长时序任务的"规划"挑战是短任务没有的。
  2. 视觉复杂度:RLBench 任务有多个物体交互(锅 + 锅盖 + 灶台),视觉场景更复杂;Meta-World 大多是单物体操作(一个推块、一个按钮),视觉信息较简单。
  3. 任务种类跨度:RLBench 从"伸手碰目标"到"摆国际象棋"到"浇花",跨越日常生活多个域;Meta-World 集中在工业/机械操作(按按钮、开门、推滑块),域内一致性高但跨域多样性低。
  4. 示范供应:RLBench 的 100 道题每道都有无限示范(OMPL),Meta-World 没有内置示范。这意味着 RLBench 的 100 道题可以直接用于 IL 大规模训练,而 Meta-World 的 50 道题更适合 RL 自行探索。

所以 100 不是简单比 50 多——RLBench 的 100 道题在复杂度、视觉多样性、示范供应三个维度上都上了新台阶。

Q5:RLBench 选择完全稀疏奖励(成功 +1,否则 0)。如果你要在这个基准上跑 RL,有哪些策略可以缓解稀疏奖励带来的学习困难?

几种可行策略:

  1. 用示范 bootstrap:先用 OMPL 示范做行为克隆(BC)得到一个初始策略,再用 RL 微调。这相当于"先教会大概怎么做,再让 RL 自己优化细节"。论文本身也提到这个方向(bootstrapping RL with demonstrations)。
  2. Hindsight Experience Replay(HER):把失败 episode 的实际终态当作"目标"重新标注,让"没到达 A 但到达了 B"的 episode 变成"目标 B 的成功 episode"。这在 Meta-World 上有效,但在 RLBench 的长时序多步任务上效果有限——因为中间步骤太多,HER 只能覆盖最后一步。
  3. 奖励塑形(reward shaping):手动设计中间奖励(如"靠近目标物体"、"成功抓取"等),把稀疏变密集。但这违背了 RLBench"不靠人类调奖励"的初衷,且不同任务需要不同的塑形函数,工程量大。
  4. 课程学习:先在简单任务(reach target)上训,再逐步迁移到难任务。但 RLBench 的任务之间差异太大,迁移效果不确定。

实际上社区给出的答案是:直接用 IL。RLBench 的稀疏奖励设计本意就是"逼算法展示探索能力",但结果证明了 2019 年的 RL 算法在这个难度上还不够强——IL 路线先吃饱了红利。

Q6:RLBench 的少样本挑战协议要求:测试时只能获得 K 条示范的观测数据,不能获得关于未见任务的任何先验知识。这个约束为什么重要?如果放松这个约束会怎样?

这个约束的重要性在于:它确保测的是真正的"学会学习"能力,而不是"偷偷记住答案"。

如果放松约束,会出现以下"作弊"路径:

  1. 如果允许知道测试任务的身份:系统可以为每个测试任务单独训一个模型,那"少样本"就退化成"小数据 BC"——任何 BC 方法都能做到,失去了"元学习"的考察意义。
  2. 如果允许访问测试任务的额外信息(如奖励函数、动力学模型):系统可以直接用规划器解这个任务,那测的就不是"从示范中学习"而是"从环境模型中规划"。
  3. 如果允许在测试任务上做大量交互(类似 RL 的在线探索):系统可以通过试错慢慢学会,那"少样本"的"少"字就没有意义了。

这个约束的深层逻辑是:真正的通用机器人应该像人一样——看几遍演示就能大致会做,不需要几万次试错。RLBench 把这个目标形式化为 K-shot 协议,为后续 VLA 时代(RT-2、OpenVLA 等)的"少样本指令跟随"评测奠定了基础。

Q7:RLBench 选择 V-REP(CoppeliaSim)而不是 MuJoCo 作为仿真器。从"让社区快速贡献新任务"的角度,这个选择为什么关键?如果选 MuJoCo 会发生什么?

V-REP 是图形化机器人仿真器,MuJoCo 是物理引擎。区别在于:

在 V-REP 中创建一个新任务:打开图形界面 → 拖拽 3D 物体到桌面 → 用鼠标放置 waypoint → 写 30 行 Python 注册成功条件 → 用校验工具自动测试 → 提交 PR。整个过程可能 1-2 小时。

在 MuJoCo 中做同样的事:手写 XML 描述所有物体的几何体、质量、摩擦系数 → 手写相机参数(位置、朝向、FOV)→ 手写灯光参数 → 手写 IK 求解器接口 → 手写 OMPL 对接代码 → 手写场景渲染代码。整个过程可能 1-2 天甚至更长。

如果选 MuJoCo,"让社区贡献新任务"这个目标基本无法实现——大部分研究者不会花两天时间建一个场景再提交。RLBench 能从 100 道题持续增长,V-REP 的低门槛是工程前提。

代价是:V-REP 的物理精度不如 MuJoCo(摩擦、接触力的模拟更粗糙),渲染质量也一般。这是一个"易用性 vs 精度"的权衡——RLBench 选择了易用性,因为对基准来说"题量大 + 社区参与"比"物理完美"更重要。


13. 一些好奇心问答(FAQ)

Q1:100 道题都是什么样的?

涵盖从"伸手碰目标"(最简单)到"清空洗碗机"(要 1000 步、多步骤)。中间有摆水果、插积木、按下按钮、开门、抓螺丝刀、转水龙头、堆 6 块积木金字塔、设置棋盘等。你可以在论文配套网站 sites.google.com/view/rlbench 看视频。

Q2:能不能跑在我自己电脑上?

能。RLBench + V-REP + PyRep 都是开源的。普通 CPU 就能跑(不像训神经网络要 GPU),但渲染图像的速度可能不快。如果只是收集数据,一台普通电脑跑一晚上能采几千条示范。训练神经网络的话才需要 GPU。

Q3:为什么用 V-REP 不用 MuJoCo / PyBullet?

作者解释:MuJoCo 和 PyBullet 是物理引擎,不是机器人仿真器。建一个带相机、灯光、可拖拽路标、IK 求解器的完整场景,在 V-REP 里几分钟就能拖出来,在 MuJoCo 里要写很多 XML。后来 MuJoCo 也加强了机器人方向(如 MuJoCo Menagerie),但 2019 年时 V-REP 工具链更成熟。

Q4:示范都是运动规划器跑出来的,会不会"太完美"导致模型学不到真实噪声?

会。这是 RLBench 的已知短板。后来一些论文用更接近人类的示范——比如 RoboMimic 提供人类遥操作数据,模型在这上面训练后泛化更好。RLBench 的示范适合做"基础动作模仿"训练,不适合做"鲁棒性"训练。

Q5:100 个任务里 RL 算法能解几道?

2019 年发表时,纯 RL 用稀疏奖励基本只能解最简单几道(比如伸手碰目标)。绝大多数任务必须靠模仿学习起步、或加上密集奖励。这一现象推动了后续"模仿 + RL 混合"路线的兴起。

Q6:少样本挑战的 v1.0 划分具体哪 10 道?

论文里没列具体清单(让网站去维护,因为版本会更新)。重点是**"划分公开、所有人用同一份"**——这个原则比具体哪 10 道更重要。

Q7:RLBench 和 Meta-World 谁赢了?

两者方向不同:RLBench 偏"操作种类多 + 视觉为主 + 含长任务";Meta-World 偏"机械任务结构清晰 + 强 RL 友好"。后来 Meta-World 在 RL 圈用得多,RLBench 在视觉操作 / 模仿学习 / VLA 圈用得多。可以理解为两个并存的标准,覆盖不同子领域。

Q8:现在(2026 年)还有人用 RLBench 吗?

用,但不是唯一选择。CLIPort、PerAct、RVT、3D Diffuser Actor 这一系列经典论文都在 RLBench 上跑分,所以新论文为了和它们比仍会用 RLBench。但同时 LIBERO、ManiSkill、Robosuite、Habitat 等新基准也在分流。RLBench 现在更像是"必跑之一"而不是"唯一基准"。

所以这一节是想说:RLBench 是机器人操作圈的"老大哥基准",可用、可复现、有传承,但不再唯一。


14. 如果你想再深入

按"前传 → 同期对手 → 用 RLBench 跑出名的论文 → 后继基准"四类排:

  1. 前传:PyRep(James 等,2019) — RLBench 的工程基础,论文短,看完能理解 V-REP 怎么和 Python 高效通信。
  2. 同期对手:Meta-World(Yu 等,2019) — 同年的多任务 / 元学习基准,方向相近。读完能看出"为啥两套基准没有互相吃掉对方"——它们做了不同的取舍。
  3. 用 RLBench 跑出名:CLIPort / PerAct / RVT / 3D Diffuser Actor — 这些是 2021-2023 年的代表作,把 RLBench 上的成绩从"勉强能做"拉到"基本能解"。读它们能直观看到 RLBench 这个"考场"的演化。
  4. 后继基准:LIBERO(2023) — 专门为"语言指令 + 长任务 + 持续学习"设计的下一代操作基准。可以看作 RLBench 思路 + VLA 时代需求的更新版。
  5. 后继基准:ManiSkill(2021 起) — 用 SAPIEN 仿真器的同类基准,强调更真实的物理和更大规模并行采样。
  6. 延伸方向:Habitat(同年) — 不在桌面而在室内导航。把 Habitat + RLBench 一起读,能看到 2019 年具身 AI 基础设施同时在两个方向铺路。

所以这一节是想说:把 RLBench + Meta-World + CLIPort/PerAct + LIBERO 这一串串起来读,能看到机器人操作基准从 2019 到 2026 的整条演化线。


15. 原文信息

  • 标题:RLBench: The Robot Learning Benchmark & Learning Environment
  • 作者:Stephen James, Zicong Ma, David Rovick Arrojo, Andrew J. Davison
  • 机构:Dyson Robotics Lab, Imperial College London
  • 发表:IEEE Robotics and Automation Letters (RA-L), 2020
  • arXiv:1909.12271(2019 年 9 月首发)
  • 项目页https://sites.google.com/view/rlbench
  • 代码https://github.com/stepjam/RLBench
  • 依赖:PyRep(https://github.com/stepjam/PyRep),基于 V-REP / CoppeliaSim
  • 运动规划库:OMPL(Open Motion Planning Library)
  • 机器人:Franka Emika Panda 7-DoF
  • BibTeX:James et al., "RLBench: The Robot Learning Benchmark", IEEE RA-L 2020

引用本笔记 / Cite this note
BibTeX
@online{eai_rlbench_2026,
  title       = {(readable note) RLBench: The Robot Learning Benchmark & Learning Environment},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2019 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rlbench/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?