RLBench: The Robot Learning Benchmark & Learning Environment
这是一份给"完全没接触过机器人 / AI"的读者看的精读笔记。语言尽量像聊天,公式和术语全部翻成人话。
1. 一句话讲什么(TL;DR)
给机器人手臂出了一套 100 道题的"统考卷",从此大家都做同一套题,第一次能公平比谁更厉害。
所以这一节是想说:这篇论文做的是一套"统一考卷",不是新算法。
2. 这是个什么场景
想象你和朋友都说自己厨艺好。你晒一张番茄炒蛋,他晒一份红烧肉,菜不一样、用的锅不一样、连"好吃"的标准都不一样——你们怎么比?
2019 年的机器人研究圈就是这副样子:
北京实验室让机器人学"开门",写论文说成功率 85%。 上海实验室让机器人学"叠杯子",写论文说成功率 92%。 你想问:到底哪家方法更强?
答不出来。因为每家:
- 用的机器人不一样(这家是 UR5,那家是 Sawyer)
- 摆的桌子不一样(这家有摄像头在头顶,那家在手腕)
- 出的题不一样(开门 vs 叠杯子,根本没法比)
- 评分标准不一样(这家算"碰到了就算赢",那家要求"完全闭合")
就像每个学校都自己出高考卷、自己阅卷,然后宣布"我们学校理科满分率最高"。没有统一卷子,所有"我比你强"都是空话。
更糟的是:算法被偷偷"为题目量身定做"。如果一个方法在某个难任务上不行,研究者就只报告它在简单任务上的分数。读者根本看不出来。
RLBench 想做的事,是给机器人圈造一场"高考":
- 100 道全国统一题
- 同一种机器人手臂(Franka Panda 7 自由度)
- 同一种摄像头布置(一个头顶相机 + 一个手腕相机)
- 同一种评分(任务完成 +1 分,没完成 0 分)
- 同一种数据接口(一行 Python 代码就能取题)
只要大家都用这套,第一次能光明正大说"我的方法比你强 5 个点"。
所以这一节是想说:RLBench 要做机器人圈的"普通高考"——一套谁都得用的统一卷子。

3. 之前的人怎么做的,为什么不够好
- OpenAI Gym / DeepMind Control Suite:游戏型基准,比如让虚拟人形走路、平衡杆。问题是太抽象——和真实机器人在桌上抓东西完全不像。在这种基准上跑得好的算法,搬到真实机器人就崩。
- OpenAI Gym 里的少数机器人任务:太简单,几个抓取就完事,没有长链条任务(比如"开烤箱 → 把托盘放进去")。
- Amazon Robotics Challenge / RoboCup@Home:是真正的机器人比赛,但每年只搞一次,需要实体场地,普通实验室根本复现不了。没法当日常评测用。
- RoboTurk:用众包让人类远程操作机器人录数据,但只有 3 个任务——多样性根本不够。
- Meta-World(同期对手):也是 19 年提出的多任务基准,方向相近,但当时文档还没齐,定位不清。
- 大家各自造任务:最常见的做法。每篇论文设计自己的几个抓取任务、自己的奖励函数。结果就是上面说的"没法横向比较"。
所以这一节是想说:之前要么是过家家级别的玩具任务、要么是一年一次的大赛、要么是各家自造,没有"日常用、能复现、覆盖广"的统一题库。
4. 这篇论文的新想法
用一套带"任务建造工具"的仿真环境,造出 100 个手工设计的真实操作任务,每个任务能自动生成无限示范数据;并且首次定义"机器人少样本挑战"作为这套基准的最高难度赛道。
听起来朴素,但当时没人愿意花这个力气把"100 个任务 + 无限示范 + 共享接口 + 难度分层 + 工具链"全做齐。
所以这一节是想说:核心创新是工程"狠"——把一个分散领域真正缺的基础设施一次性铺平。
5. 它分几步做的(方法)

上图说明:Figure:RLBench 基于 CoppeliaSim 的任务与场景 API(论文原图)。

上图说明:Figure:100 任务变体与评测协议示意(论文原图)。
把这套"机器人高考"做出来,作者其实在干 5 件事——就像办一场高考要准备的东西:考场、题型、答题示范、出题工具、加试赛道。一件件来:
- 统一仿真场景(搭考场)
- 任务三层结构(定义"题型 / 题目 / 实测")
- 自动生成示范(请数学算法当陪练)
- 任务建造工具(让别人也能加题)
- 少样本挑战(设一条加试赛道)
5.1 统一仿真场景:所有 100 道题共用一张桌子
类比
想象一个大学物理实验室。所有实验都在同一张实验台上做:力学题、光学题、电学题——桌子不变、灯不变、椅子不变,只换桌上的实验器材。
RLBench 就是这种统一实验台:
- 机器人:一台 Franka Emika Panda 7 自由度机械臂,固定在一张木桌上。
- 摄像头:一个头顶立体相机(双目,能算深度)+ 一个绑在手腕上的单目相机。
- 数据:每帧返回 RGB 彩图、深度图、分割图(每个像素属于哪个物体)。
- 机器人状态:关节角度、关节速度、关节力、末端位置和姿态(姿态 = 朝哪个方向、转了多少)。
- 光线:3 盏定向灯。
自由度(DoF, Degrees of Freedom):机械臂能独立动的关节数。7 自由度意味着臂可以从任何角度伸到目标点,比 6 自由度灵活得多。
立体相机(stereo camera):两个并排的镜头,像人的两只眼睛。两个视角的差异可以反推距离,得到"深度图"。
深度图(depth map):和 RGB 图一样大的一张灰度图,每个像素的"亮度"=该点离相机的距离(米)。
分割图(segmentation mask):和 RGB 图一样大,每个像素填一个物体 ID。仿真器能直接吐出来,不像现实世界要用 AI 才能算。
末端位置和姿态(end-effector pose):手腕这一头在 3D 空间里的坐标(x, y, z)+ 它朝哪个方向(用四元数或欧拉角表示)。
它在干什么
每道题开始时:
- 把机器人手归位到固定起始姿势(不抓任何东西)。
- 在桌子中央生成这道题需要的物体(比如一个锅、一个锅盖)。
- 物体的位置每次随机扰动(防止模型死记位置)。
- 用户的 Agent 开始接收摄像头流和机器人状态,输出动作。
为什么这步有用
- 桌子和机器人不变 = 所有论文都在比"同一个考场",公平。
- 同时给 RGB / 深度 / 分割三种视觉数据 = 不同流派的方法都能用:纯像素派用 RGB、几何派用深度、有标签派用分割。
- 不带初始抓握 = 模拟现实情况——家里的机器人不会自动握着勺子站着。
论文还特别提到一个设计决策:所有任务都假设机器人一开始没有握住任何物体。这和当时很多论文"预设机器人已经抓好了工具"的做法不同。作者的理由是——家用机器人未来的工作场景就是"从零开始自己拿工具",所以基准也应该这么设。代价是任务难度显著上升。
场景的额外设计细节
论文还提到了几个容易被忽略但重要的场景设计选择:
- 机械臂可替换:虽然默认用 Franka Panda,但作者明确说"可以用一行代码换成别的机械臂"。这个设计的意图是支持 sim-to-real 研究——如果你的实验室有一台别的型号的机械臂,你可以把仿真里的 Panda 换成你的型号,在统一任务集上对比 sim-to-real 方法。这在 Section VI-c 中被作为一个独立研究方向提出。
- Domain Randomization 渲染选项:场景支持域随机化渲染——随机改变光照方向、物体纹理、相机位置等视觉参数。这是为 sim-to-real transfer 铺路的:如果模型只在固定渲染条件下训练,搬到真实世界就会因为光照/纹理差异而崩溃。域随机化让模型"见过足够多的视觉变体",从而对新环境更鲁棒。
- 头顶立体相机 vs 手腕单目相机的分工:头顶相机看到全局场景(桌面全貌、物体分布),适合"规划去哪";手腕相机看到局部细节(夹爪和物体的近距离视角),适合"精确对准"。两个视角互补,模拟了人类"先环顾四周再低头干活"的视觉策略。同时,手腕相机的存在也为"部分可观测"(partial observability)研究打开了入口——当你只用手腕相机时,机器人看不到桌面全貌,必须靠记忆和探索来补全信息。
- 3 盏定向灯的选择:不是随意放的——3 个方向的光源确保物体从各角度都有明暗对比,避免单光源导致的"一面全亮一面全黑"。这让 RGB 图像包含更多可用的视觉特征,也模拟了室内多光源照明的真实情况。
Environment API:用户怎么和这套场景交互
论文 Figure 5 展示了完整的 API 使用流程,核心是一个 Environment 类:
env = Environment(DATASET, ActionMode.ABS_JOINT_VELOCITY)
env.launch()
task = env.sample_task() # 随机抽一个任务
demos = task.get_demos(2) # 取 2 条示范
# RL 训练循环
for i in range(training_steps):
if i % episode_length == 0:
descriptions, obs = task.reset() # 重置 + 返回文字描述
action = agent.act(obs) # 模型输出动作
obs, reward, terminate = task.step(action) # 执行 + 返回观测/奖励/是否结束
这个 API 模仿了标准的 RL agent-environment 循环:reset() 返回初始观测和任务描述,step(action) 返回新观测 + 奖励 + 终止信号。关键细节:reset() 返回的 descriptions 是一个字符串列表(如 ['take lid off the saucepan']),这就是给自然语言接口预留的入口。奖励 reward 在任务完成时为 +1,其余时刻为 0——完全稀疏。terminate 在成功或超时时为 True。
所以这一节是想说:所有 100 道题用一张同款实验台,把硬件不一致这个噪音先消掉;同时通过可替换机械臂、域随机化、双视角相机等设计,为 sim-to-real 和部分可观测研究预留了接口。
5.2 任务的三层结构:Task / Variation / Episode
类比
把这套结构想成"题型 → 题目 → 实测":
- Task(题型):比如"叠积木"。
- Variation(题目):题型下的具体版本——"叠 3 块红色积木"是一道,"叠 5 块蓝色积木"是另一道。变的通常是颜色、数量、目标物。
- Episode(实测):同一道题目里,物体每次摆放位置都不一样——这叫一次实测。可以无限抽。
任务(Task):题型,相当于一个 Python 类。比如
StackBlocks。变种(Variation):题型下用整数索引的不同子配置。比如变种 0 = 红积木,变种 1 = 蓝积木。每个变种自带一段文字描述(比如"stack 3 red blocks"),未来给 NLP / 自然语言指令用。
片段(Episode):从某个变种随机抽出的一次"开局"。每次只换物体初始位置。
轨迹(trajectory):一次 episode 里所有时刻的"观察 + 动作"序列。论文写成
τ = [(o₁, a₁), ..., (o_T, a_T)]。说人话:一段时间里"机器人看到的画面 + 它做的动作"按时间排好。
它在干什么
为啥要分三层?因为研究者对"任务"的定义吵不清。"拿苹果"和"拿香蕉"算一个任务还是两个?吵了很多年。RLBench 干脆说:
- 这两件事属于"拿东西"这一个 Task。
- 但是不同的 Variation。
- 多变种放一起就能训练"听话"——给一句话指令,机器人去执行。
- 多片段放一起就能训练"鲁棒"——同一道题每次摆得不一样,机器人都要做对。
100 道题里很多自带十几个变种,所以总变种数远超 100。
形式化定义如下:每个 Task 是一个变种集合 T = {ν₁, ..., ν_N},每个变种 ν 可以无限抽样出 episode 轨迹 τ ∼ ν,每条轨迹 τ = [(o₁, a₁), ..., (o_T, a_T)] 由观测-动作对序列组成。
三层结构的另一个妙用:评测粒度可控
这三层结构不只是为了"分清楚任务定义"——它直接决定了你能做什么样的实验:
- 如果你想测位置鲁棒性("同一个任务换不同摆放能不能做对")→ 在同一个 Variation 下抽多个 Episode 做测试。
- 如果你想测同族泛化("学会拿红苹果后,能不能拿绿香蕉")→ 在同一个 Task 下,用部分 Variation 训练,剩余 Variation 测试。
- 如果你想测跨任务迁移("学会开门后,能不能更快学会开抽屉")→ 在 Task 层面切分训练/测试集。
- 如果你想测少样本学习("见过 90 道题后,给 5 条示范能不能学会第 91 道")→ 用 90 个 Task 做 meta-train,10 个 Task 做 meta-test,每个测试 Task 给 K 条示范。
这意味着同一套基准可以服务四个不同的研究问题——研究者只需在不同的层级切分训练/测试边界。这是 RLBench 设计中最经济的一点:三层结构 = 四种评测协议的天然支撑。
论文 Figure 4 用一个示意图展示了这个结构:以"stack blocks"任务为例,它有 V 个 Variation(不同颜色/数量的积木),每个 Variation 有 E 个 Episode(不同摆放位置)。每个 Variation 附带文字描述列表,用于自然语言接口。
为什么这步有用
- 一刀切:清空所有"这是不是同一个任务"的吵架。
- 自然支持多任务、少样本、自然语言指令三个研究方向——你想测哪个,就在哪一层切分训练 / 测试就行。
所以这一节是想说:用三层抽象一次性解决了"任务到底是啥"的定义之争。
5.3 自动生成无限示范:让运动规划器当"陪练"
类比
教学徒做菜,最贵的是请大厨示范。100 道菜每道演 50 遍,请大厨累死。
RLBench 的方案:在仿真里让数学算法当大厨——在每道题创建时,作者手工标好"先到这个点,再到那个点"的几个关键路标,剩下的由"运动规划器"自动算出怎么走过去。
运动规划器(motion planner):一种数学算法,输入是"机械臂现在在哪、要走到哪、桌上哪些地方有障碍",输出是一段不撞东西的关节角度序列。RLBench 用的是 OMPL(Open Motion Planning Library),开源、成熟。
路标(waypoint):3D 空间里的一个点 + 一个姿态。任务设计者先在仿真里手动放几个"必经点",规划器负责把它们连成完整轨迹。
示范(demonstration):完整的一段"专家"轨迹,让机器人模仿。
专家策略(expert policy π)*:理论上"会做这道题"的最优做法。这里就是"路标 + 运动规划器"组合。
它在干什么
- 设计者建任务时,在仿真里手动拖几个路标("先飞到锅上方、再下降抓锅盖、再抬起来")。
- 调用 OMPL 把路标连成一条不撞物体的关节序列。
- 物体位置随机扰动后,重新算一遍——每次都是新示范。
- 想要 1 万条示范?跑 1 万次就好,仿真不要钱。
论文中的形式化表达:每个任务都有一个对应的专家策略 π*,由 OMPL 在任务创建时预设的 waypoint 序列上运行运动规划来生成示范轨迹。这个 π* 不是学出来的,是"规划"出来的——所以它的质量取决于 waypoint 设计得好不好,而不是训练数据多不多。
为什么这步有用
- 模仿学习(让 AI 模仿专家)最大的瓶颈是"哪来这么多专家数据"。RLBench 把这个瓶颈直接抹掉。
- 后来很多重磅论文(CLIPort、PerAct、RVT、3D Diffuser Actor、Diffusion Policy 的部分变体)能爆发出来,就是因为 RLBench 提供了海量免费示范。
- 但代价:示范都是"运动规划器"风格——动作流畅但不像人手会的"摸索 + 校正"。这一点后面会有论文(如 RoboMimic)补刀。
用户有两种获取示范的方式:一是从预先采集好的数据集里直接加载(task.get_demos(2)),二是运行时实时生成。前者适合大规模训练前批量采集,后者适合需要动态数据的场景。
OMPL 的技术细节
OMPL(Open Motion Planning Library)是一个开源运动规划库,支持多种规划算法。RLBench 使用它的核心原因是:
- 无需训练:OMPL 是基于采样的规划器(如 RRT、PRM),不依赖任何学习过程——给定起点、终点和障碍物几何,直接算路径。这意味着示范质量是确定性的、可复现的。
- 处理高维空间:Franka Panda 有 7 个关节 + 1 个夹爪 = 8 维配置空间。OMPL 的采样规划器在高维空间中比网格搜索高效几个数量级。
- 碰撞检测:OMPL 集成了碰撞检测,保证生成的轨迹不会穿过桌面或物体。但碰撞检测的精度取决于仿真器的物理模型——如果物体的碰撞网格不够精细,规划器可能生成"看似可行但实际会蹭到"的轨迹。
示范质量与局限的深入分析
运动规划器生成的示范有一个隐含假设:任务的正确解法是"从 A 到 B 走最优路径"。但很多真实操作任务的解法不是最优路径——比如拧瓶盖需要旋转动作,倒水需要倾斜控制,这些不是简单的"从 A 点到 B 点"能描述的。RLBench 的 waypoint 设计部分解决了这个问题(设计者可以在 waypoint 中指定旋转、倾斜等特殊动作),但本质上还是"离散关键帧 + 连续插值"的范式,不能表达需要力反馈的连续调整动作。
这也是为什么后来的 RoboMimic 基准专门引入了人类遥操作数据——人类在拧瓶盖时会根据触觉反馈动态调整力度和角度,这种"闭环调整"是开环的运动规划器做不到的。
所以这一节是想说:用"路标 + 数学规划器"造出无限示范,让模仿学习的训练数据成本降为零;但代价是示范的"机器手风格"——平滑、最优、不含校正——这种风格在需要力反馈和闭环调整的任务上有天然局限。
5.4 任务建造工具:让别人能给题库添题
类比
Wikipedia 之所以能成今天这样,不是因为创始人写了所有词条,而是因为他们造了一个"任何人都能加词条"的编辑器。
RLBench 也是这个思路。每个任务由两个文件组成:
- 场景文件(.ttm):用 V-REP 图形界面拖出来的 3D 场景(锅、锅盖、桌子摆好)+ 路标位置。像在 PowerPoint 里画演示文稿——拖拖拽拽,不用编程。
- Python 文件(.py):30 行左右的代码,告诉系统"什么算成功"。比如
TakeLidOffSaucepan这道题,只要"夹爪握着锅盖" + "锅盖被检测到在'成功区'里"两个条件同时满足就赢。
V-REP(即后来的 CoppeliaSim):一个图形化机器人仿真器,可以拖拽建场景。论文用的版本叫 V-REP。
PyRep:作者团队自己写的 Python 库,给 V-REP 套一层快速接口,让深度学习代码能高频调用。这是 RLBench 能跑起来的关键工程。
成功条件(success condition):一组判断逻辑,决定这一 episode 算不算赢。RLBench 提供了一组现成的判断模块("被夹住"、"被传感器检测到"、"两个物体重叠"等),用户像搭积木一样组合。
它在干什么
任务创建的生命周期分三步:
init_task()只调一次——注册可抓取的物体、设定成功条件。init_variation(int i)每个变种调一次——返回文字描述列表,用于自然语言接口。init_episode()每个 episode 调一次——做位置随机化。
设计者写完代码后,用任务校验工具(task validation tool)自动跑 N 遍示范采集,确保运动规划器的成功率足够高(论文要求失败率极低)。校验通过后通过 GitHub PR 提交到主仓库。
论文特别解释了为什么选 V-REP 而不是 MuJoCo 或 Bullet:MuJoCo 和 Bullet 是物理引擎,不是机器人框架。建一个带相机、灯光、可拖拽路标、IK 求解器的完整场景,在 V-REP 里几分钟拖出来,在 MuJoCo 里要写很多 XML。这对"让社区快速贡献新任务"至关重要。
任务创建的完整流程
论文 Figure 6 给出了一个完整的任务文件示例(TakeLidOffSaucepan),我们可以看到创建一道新题需要做什么:
- 在 V-REP 里拖场景(.ttm 文件):放入锅(saucepan)、锅盖(saucepan_lid)、接近传感器(success proximity sensor)。摆好位置。然后在场景里手动放置 waypoint——"飞到锅盖上方 → 下降到锅盖位置 → 闭合夹爪 → 抬起 → 移到传感器上方"。
- 写 Python 类(.py 文件):
init_task():注册可抓取物体(锅盖),设定成功条件("夹爪握着锅盖" AND "锅盖被接近传感器检测到")。init_episode(index):返回文字描述列表['take lid off the saucepan']。variation_count():返回 1(这道题只有 1 个变种)。
- 跑校验工具:自动用 OMPL 尝试采集 N 条示范。如果成功率达标(论文要求失败率极低),任务通过校验。
- 提 GitHub PR:提交到 RLBench 主仓库,合并后所有人都能用。
RLBench 提供的成功条件模块库(conditions)是降低门槛的关键:
GraspedCondition(gripper, object):物体被夹爪握住DetectedCondition(object, sensor):物体被接近传感器检测到- 还可以组合多个条件(AND 逻辑),用
register_success_conditions([cond_set])注册
这些模块像搭积木一样组合,覆盖了"抓住""放到指定区域""被传感器检测到"等常见成功判定。如果任务需要更复杂的判定逻辑,用户可以在 Python 文件里写自定义代码。
为什么这步有用
- 这是 RLBench 能从 100 道题持续扩展的根本——论文发布后社区源源不断加题。
- 把"机器人任务设计"从"研究员的私房菜"变成"开放协作",类似游戏圈的 Mod 社区。
- 同样的思路 5 年后被 Meta 的 Habitat、NVIDIA 的 Isaac Lab 等更大平台继承。
所以这一节是想说:作者不只是建了 100 道题,还把"建第 101 道题"的工具开放给所有人。
5.5 首次定义机器人少样本挑战
类比
你已经会包饺子。现在请你在看 5 遍"包烧麦"演示之后,能自己包烧麦——这就叫少样本学习:人类天生擅长,机器学起来很难。
RLBench 把它做成正式比赛:
把 100 道题里 10% 拿出来当"测试卷"(meta-test),其他当"训练卷"(meta-train)。允许你在训练卷上随便用——海量示范、强化学习、什么都可以。
测试时,给你 K 段"测试卷"上某道题的演示视频(K=1、5、20 三档),你的系统要立刻能在这道题的新摆放上做对。
元训练 / 元测试(meta-train / meta-test):机器学习里"训练集 / 测试集"这一对的"上一层"——元训练里的整个任务集合是你"学经验"的地方;元测试里的任务你之前完全没见过,要快速适应。
K-shot:测试时只给你 K 个示范。1-shot 几乎是"看一眼就要会",20-shot 算很慷慨了。
少样本学习(few-shot learning):在极少示范下学会新任务的能力。当时主要在图像分类领域火过(Matching Networks、Prototypical Networks、MAML),机器人圈这是第一个大规模评测协议。
它在干什么
- 锁定固定的 train / test 划分(公开在网站上,所有人用同一份)。
- 报告 1-shot、5-shot、20-shot 三个数字——支持的算法谱系:循环网络派([41,42,43])、度量学习派(Matching Net、Prototypical Net)、梯度派(MAML)。
- 随时间扩任务,叫成 v1.0 / v2.0 / v3.0,避免"以后题变了,老分数没意义"。
协议的关键约束:测试时系统只能获得 K 条示范的观测数据,不能获得关于未见任务的任何先验知识。这迫使系统真正"学会如何学习",而不是偷偷记住答案。
为什么这步有用
- 当时图像少样本学界已经热闹了几年,机器人界一直没有可比的协议。RLBench 把"训练 80 道题、测试 10 道未见过的题"这个流程标准化了。
- 这条路 5 年后开花结果:CLIPort、PerAct、RT-1、RT-2、OpenVLA 等都是奔"通用多任务 / 少样本机器人"去的。RLBench 是它们的早期跑分场。
论文还提出了其他应用方向:强化学习(用示范 bootstrap RL 策略来降低样本复杂度)、Sim-to-Real(一行代码换机械臂,方便对比 sim-to-real 方法)、多任务学习(同时学所有任务,不要求泛化到全新任务)、以及 SLAM(探索"操作型 SLAM"——什么地图表示最适合机器人操作任务)。这些方向在论文中是展望而非实验,但为后续社区研究指明了路径。
少样本协议的技术约束细节
协议对"什么信息可以给系统"做了严格限定,这些约束不是随意的——每一条都堵死了一种"作弊"路径:
- 只能获得 K 条示范的观测数据:不能获得测试任务的奖励函数、动力学模型、或任务身份。如果系统知道"这是第 37 号任务",它可以从训练阶段偷学第 37 号的解法——这就不是"少样本学习"而是"查表"了。
- 训练阶段无限制:meta-train 的 90 道题可以随便用——海量示范、RL 自行探索、多任务联合训练都行。这模拟了"机器人在工厂里学了很多技能后再被送到你家"的场景。
- 报告 1-shot、5-shot、20-shot 三档:这三档分别模拟"看一眼就要会""看几遍大致会""认真学一阵子"三种现实场景。1-shot 是极限挑战,20-shot 是实用下限。
- 版本化(v1.0):论文明确说"我们叫它 v1.0 是因为预期任务数量会持续增长"。每次任务集大幅扩展时发布新版本号,旧版本的成绩不会被新版本"稀释"。这解决了"基准 evolve 了之后老分数还有没有意义"的问题——有,只要你标注用的是哪个版本。
论文还列出了三类有望在这个挑战上发力的少样本算法家族:循环网络方法(MANN [41]、RL² [42]、SNAIL [43],用循环隐状态"记住"任务特征)、度量学习方法(Matching Networks [44]、Prototypical Networks [45],在特征空间中"最近邻匹配"新任务)、梯度方法(MAML [46]、LEO [47],学一个好的初始化使得几步梯度下降就能适应新任务)。论文指出这些方法"从未在如此大规模上测试过"——RLBench 是它们的第一次大考。
所以这一节是想说:第一次给机器人圈定义了什么叫"少样本评测"——不只是"给 K 条示范"这么简单,而是一整套堵死作弊路径、支持版本化、覆盖三类算法家族的严格协议,开启了通用机器人这条路线。

6. 关键数字(What works)
这篇论文的"成绩"不是某个算法的分数(它本身不提算法),而是"基准本身的规模"。
6.1 任务规模对比
| 基准 | 任务数 | 示范来源 | 示范数量 | 动作空间种类 |
|---|---|---|---|---|
| RLBench | 100 | 运动规划器(无限) | 无限 | 8 种 |
| Meta-World | 50 | 无内置示范 | 0 | 1 种 |
| RoboTurk | 3 | 众包人类遥操作 | 每题数百条 | 1 种 |
| OpenAI Gym(机器人部分) | 几个 | 无 | 0 | 1 种 |
6.2 任务长度分布
论文 Figure 7(下)从 75 个任务的第一变种中各取 5 条示范,统计平均时间步数:
| 长度区间 | 代表任务 | 说明 |
|---|---|---|
| 约 100 步 | 伸手碰目标(reach target) | 最简单,单步动作 |
| 约 300-500 步 | 抓锅盖、按按钮 | 中等,含抓取 + 放置 |
| 约 800-1000 步 | 清空洗碗机(empty dishwasher) | 最长,多步链:开门 → 拉托盘 → 抓盘子 → 抬起 → 放外面 |
对比 OpenAI Gym 大部分任务 100 步内结束。RLBench 的长任务真正提供了"长时序"挑战——短任务测反应力,长任务测规划力,前者好做,后者后来才被 Diffusion Policy / VLA 系列攻破。
6.3 观测模态一览
| 模态 | 来源 | 维度/格式 | 用途 |
|---|---|---|---|
| RGB 彩图 | 头顶立体相机 + 手腕单目相机 | 2 张图/帧 | 纯像素方法 |
| 深度图 | 头顶立体相机 | 1 张图/帧 | 几何方法 |
| 分割图 | 头顶立体相机 | 1 张图/帧 | 有标签方法 |
| 关节角度 | 机器人本体 | 7 维向量 | 底层控制 |
| 关节速度 | 机器人本体 | 7 维向量 | 底层控制 |
| 关节力矩 | 机器人本体 | 7 维向量 | 力控方法 |
| 末端位姿 | 机器人本体 | 7 维(位置+姿态) | 高层规划 |
| 夹爪状态 | 机器人本体 | 1 维 | 二值控制 |
6.4 动作空间 8 选 1
| 动作空间 | 层级 | 适合的方法类型 |
|---|---|---|
| 绝对关节速度 | 底层控制 | RL(连续控制) |
| 增量关节速度 | 底层控制 | RL |
| 绝对关节位置 | 底层控制 | RL / 经典控制 |
| 增量关节位置 | 底层控制 | RL |
| 绝对关节力矩 | 底层控制 | 力敏 RL |
| 增量关节力矩 | 底层控制 | 力敏 RL |
| 绝对末端位姿 | 高层规划 | IL / VLA |
| 增量末端位姿 | 高层规划 | IL / VLA |
你想做的研究是"控制层"还是"决策层"?RLBench 都让你用——做底层控制的用关节力矩,做高层规划的用末端位姿。一套基准跨多个层级。
6.5 奖励设计
| 设计选择 | RLBench | Meta-World | 说明 |
|---|---|---|---|
| 奖励类型 | 完全稀疏(成功 +1,否则 0) | 密集 + 稀疏两种 | RLBench 刻意不设中间奖励 |
| 目的 | 测算法的探索能力 | 兼顾训练便利 | RLBench 的稀疏奖励是 RL 的"地狱难度" |
| 后果 | 纯 RL 几乎跑不动 | RL 可解单任务 | RLBench 上 IL 路线先吃饱红利 |
6.6 任务三层结构
| 层级 | 名称 | 数量 | 说明 |
|---|---|---|---|
| 第 1 层 | Task(任务) | 100 | 手工设计的完全独特操作任务 |
| 第 2 层 | Variation(变种) | 每任务若干 | 改颜色/数量/目标物,总变种数远超 100 |
| 第 3 层 | Episode(片段) | 无限 | 同变种内随机初始位置 |
所以这一节是想说:这套基准的"分量"来自规模、长度、稀疏奖励、三层结构、多动作接口五个维度叠加,是一套真正"重量级"的考卷。
7. 实验结果说明了什么
实验目标:RLBench 是一篇基准论文,不做算法实验。它的"实验"是验证基准本身是否可用——即:任务是否可解、示范是否能稳定生成、规模是否够大。
任务校验实验
论文提供了 task validation tool——每设计完一道新任务,用 OMPL 自动跑 N 次示范采集,统计成功率。只有当运动规划器的失败率极低时,这道题才被接受。这相当于"出题前先自己答一遍,确保题目没有 bug"。这个校验机制是 RLBench 质量的基本保障——如果某道题连运动规划器都做不出来,学习算法就更不可能成功了。
任务长度分析(Figure 7 下)
从 75 个任务的第一变种各取 5 条示范,统计平均时间步。结果:任务长度从 100 到 1000 步不等。论文指出长任务通常涉及"组合动作链"——例如"清空洗碗机"需要开门 → 拉托盘 → 抓盘子 → 抬出四步串行。这一发现为后续长时序研究(Diffusion Policy、VLA 系列)提供了明确的挑战目标。
描述词频分析(Figure 7 上)
对所有变种的文字描述做词频统计(去掉功能词),展示内容词分布。高频词包括"push""put""open""close""stack"等动作动词和"block""button""drawer"等名词。这张图的价值在于:它验证了 100 道任务的描述覆盖了足够多样的动词和名词——如果所有任务都是"pick and place",词频图会非常单调。
少样本挑战协议设计
论文没有跑少样本算法实验,但定义了完整的评测协议:
- 100 道题中 10%(约 10 道)划为 meta-test,其余为 meta-train
- 测试时给 K 条示范(K=1/5/20),评估新 episode 上的成功率
- 训练阶段无限制——可用海量示范、RL、任何方法
- 版本化(v1.0),随任务增长更新版本号
社区后续实验发现
虽然论文本身不跑算法,但社区在 RLBench 上的大量实验形成了以下共识:
- 纯 RL + 稀疏奖励几乎全挂:SAC、TD3、PPO 在绝大多数任务上成功率为 0%。这和 Meta-World 形成鲜明对比——Meta-World 中 SAC 至少能解单任务,但 RLBench 的任务更复杂(更长操作序列、更多物体交互、更精细力控制)。
- 模仿学习主导:用 OMPL 生成的示范训练 BC / BC-RNN,在大部分任务上能达 >50% 成功率。RLBench 上的论文几乎都是 IL 派的。
- 3D 表征方法爆发:PerAct(2022)引入 3D 体素表征,RVT(2023)引入多视角 Transformer,3D Diffuser Actor(2024)引入 3D 扩散策略——它们都在 RLBench 上跑分,把成绩从"勉强能做"拉到"基本能解"。
控制变量
| 变量 | 如何控制 |
|---|---|
| 硬件 | 固定 Franka Panda + 固定桌面 + 固定灯光 |
| 视角 | 固定头顶立体相机 + 固定手腕相机 |
| 起始状态 | 每次归位到同一初始姿势,不预设抓握 |
| 随机化 | 只在 episode 级别随机化物体位置 |
| 成功判定 | 统一用 Python 注册的条件组合,非人为打分 |
所以这一节是想说:RLBench 的"实验"是基准自身的可用性验证——任务校验、长度分析、词频分析三项确保了这套题库的质量下限;而社区后续的大量实验则验证了它的上限和生态价值。
8. 你应该懂的几个新词
基准(benchmark):一套统一的任务和评测协议。AI 圈所有"我比你强"的论文都得在某个基准上比。RLBench 就是机器人操作领域的一个基准。
仿真环境(simulator):用代码模拟物理世界。机器人能在仿真里摔 1 万次不报废。RLBench 用的是 V-REP(现叫 CoppeliaSim)。
运动规划器(motion planner):给定起点、终点、障碍物,自动算一条不撞东西的路径。RLBench 用 OMPL。它是无限示范的核心。
路标(waypoint):3D 空间里的一个"必经点"。任务设计者手工放几个,规划器负责连。
末端执行器(end-effector):机械臂最末端的工具,这里是夹爪。"末端位姿"指夹爪的位置和朝向。
自由度(DoF):机械臂能独立动的关节数。Franka Panda 是 7 DoF,比 6 DoF 灵活,能从更多角度伸到同一个点。
示范 / 演示(demonstration):一段"专家"完整完成任务的动作记录。模仿学习就是让模型学这种轨迹。
模仿学习(imitation learning, IL):让模型学专家的动作。给一段"看到这个画面,专家做了这个动作"的配对数据,让模型记住。
强化学习(reinforcement learning, RL):让模型自己试错。做对加分、做错扣分,反复试一万次后慢慢学会。在稀疏奖励的 RLBench 上很难直接跑通,所以早期更多用 IL。
少样本学习(few-shot learning):只给极少(1-20)示范就要学会新任务的能力。RLBench 第一次给机器人圈定义了正式的少样本协议。
多任务学习(multi-task learning):一次训一个模型,同时会做多个任务,互相借力。
稀疏奖励(sparse reward):只有"完成"才有 +1,其余时间都是 0。是 RL 的最难模式。
PyRep:作者团队自己写的 Python-V-REP 桥梁库,让仿真和深度学习代码高效通信。是 RLBench 跑得动的工程基础。
所以这一节是想说:这十几个词以后看任何机器人学习论文都会反复出现,先和"考试 / 教学徒 / 实验台"这些日常类比挂钩。
9. 它有什么搞不定的
RLBench 不是万能的,作者也老实讲了几个硬伤:
- 不够真:物理与渲染的 sim-to-real gap。仿真里的物体摩擦、形变、光影都比真实世界粗糙。一个在仿真里 90% 成功的策略,搬到真实 Franka Panda 上常常掉到 30%。这是 RLBench 时代的核心痛点,后续 Domain Randomization、Real2Sim 等路线都是为了缩这个差距。
- 示范都是"机器手"风格。运动规划器生成的轨迹是平滑、最优的,不像人手那种"摸一下、校正一下"。模型学到的是"理想专家"的动作分布,遇到真实的乱糟糟世界容易抓瞎。
- 奖励太稀疏,纯 RL 几乎跑不动。RL 在 RLBench 上"硬刚"基本不出活,得先模仿学习起步。这导致几年里 RLBench 上的论文几乎都是 IL 派的。
- 任务多样但仍偏桌面操作。所有任务都在一张桌子上、用一个机械臂——没有移动机器人、没有双臂协作、没有人机交互。这些维度后来由别的基准(如 LIBERO、Habitat、ManiSkill)补上。
所以这一节是想说:RLBench 让"桌面单臂操作"变成可比、可复现的领域,但仿真真实度、双臂、移动操作都得后人补。
10. 它和别的论文是什么关系
把 RLBench 放进我们读过的论文坐标系里看:
- 和 Habitat(同年同期,dataset-eval):方向互补。Habitat 解决的是"室内导航"基准——机器人在家里走来走去找东西;RLBench 解决的是"桌面操作"基准——机器人手伸出去做事。两套合起来覆盖了"具身 AI"的两大支柱。机器人要既会走又会动手。
- 和 Diffusion Policy / IBC(imitation 类):这些是后来在 RLBench 这套题上跑出顶尖分数的算法。没有 RLBench 这种统一题库,就没有它们的可比性。RLBench 是"考场",它们是"考生"。
- 和 OpenVLA / VLAs / SayCan(vla / planning 类):VLA 时代的工作开始把"语言指令 + 视觉"当成机器人输入。RLBench 早期就给每个 Variation 配了文字描述,本质上预留了这个接口——只是 2019 年还没有大模型来用。后来 RT-2、OpenVLA 等都把 RLBench 当跑分场之一。
- 和 GAIL(imitation foundation):GAIL 是模仿学习的算法范式(用对抗训练学专家分布),RLBench 给它提供"用什么数据来学"。两者是"算法 ↔ 数据"的关系。
简单类比:RLBench 像高考的命题委员会,Diffusion Policy / OpenVLA 这些是来考试的学生。命题委员会本身不当学霸,但没有它就没有"全国卷之争"。
所以这一节是想说:RLBench 是后续一大批操作论文得以横向比较的基础设施,是机器人圈的 ImageNet 雏形之一。
11. 和本导读的关系
对应章节:Ch21(数据集全景)—— 21.4.2 节"RL 导向基准:RLBench"
在导读体系中的位置:
Ch21 按"真机 → 仿真"的顺序梳理了整个机器人数据/基准生态。RLBench 被归类为"仿真操作基准"中的 RL/IL 导向类——它不是用来"训练"机器人的数据集,而是用来"考试"的标准化测试平台。导读特别强调了"纯 RL + 稀疏奖励几乎全挂"这一发现,并将其解读为"IL 路线在复杂操作任务上的必然性"的关键证据。
在 Ch21 的"尺子型 vs 食材型"分类框架中,RLBench 属于尺子型基准——标准化、评测严格、用于横向对比。与 OXE / DROID / BridgeData V2 等"食材型数据集"不同,RLBench 的目标不是"喂给模型足够多的数据",而是"给所有模型同一张考卷,分数高者强"。
与导读其他章节的联系:
- Ch11(RT-1/RT-2)和 Ch12(OpenVLA):这些 VLA 模型在评测泛化能力时,沿用了 RLBench 开创的"多任务统一评测 + 少样本协议"思路。RLBench 的三层结构(Task/Variation/Episode)为 VLA 的"语言条件 + 视觉"评测提供了天然接口。
- Ch13(Diffusion Policy):Diffusion Policy 在 RLBench 类型的长时序任务上展示了 IL 方法处理"多步组合动作"的能力,验证了 RLBench 长任务(100-1000 步)的研究价值。
- Ch17(Sim-to-Real):RLBench 纯仿真的局限正是 Ch17 讨论 sim-to-real gap 的出发点之一。Ch21 中提到"仿真里 Franka 夹爪闭合角度和真实差 2-3 度"这一具体例子,就是 RLBench 时代的典型痛点。
- 21.4.1(Meta-World):Meta-World 是 RLBench 的"同期对手"。两者方向不同——RLBench 偏"操作种类多 + 视觉为主 + 含长任务",Meta-World 偏"机械任务结构清晰 + 强 RL 友好"。后来 Meta-World 在 RL 圈用得多,RLBench 在视觉操作 / 模仿学习 / VLA 圈用得多。
- 21.4.4-5(CALVIN/LIBERO):这两个基准补全了 RLBench 缺失的"长时序 + 语言条件"维度。LIBERO 可以看作"RLBench 思路 + VLA 时代需求"的更新版。
作为标准基准的传承:
RLBench 是 PerAct(2022)、RVT(2023)、3D Diffuser Actor(2024)这一系列 3D 表征操作论文的标准跑分场。这些论文在 RLBench 上逐步把成绩从"勉强能做"拉到"基本能解",形成了清晰的算法进化链。新论文为了和这些经典工作对比,至今仍需在 RLBench 上报告结果。
定位一句话:RLBench 是仿真操作基准中的"视觉操作基石"——它定义了"100 任务 + 无限示范 + 少样本协议"的评测范式,后续所有视觉操作基准都在它的基础上补全某个维度(长时序/语言条件/家庭场景/跨形态)。
所以这一节是想说:在 Ch21 的"八大仿真基准"地图上,RLBench 占据"视觉操作 + 少样本"这个生态位,是理解整个评测体系从 RL 向 IL/VLA 演进的关键节点。
12. 思考题
Q1:RLBench 的三层结构(Task / Variation / Episode)解决了什么问题?如果只有 Task 和 Episode 两层(去掉 Variation),会丢失什么能力?
三层结构解决的是"任务定义的主观性"问题——"拿苹果"和"拿香蕉"算一个任务还是两个,学术界吵了很多年。RLBench 用 Task 归类(都是"拿东西"),用 Variation 区分细节(苹果 vs 香蕉),用 Episode 做位置随机化。
如果去掉 Variation 层:每个"拿苹果"和"拿香蕉"要么合并成一个 Task(丢失了"同族任务间的泛化"评测能力),要么各自独立成 Task(丢失了"任务结构共享"的训练信号)。少样本协议也会崩——meta-test 的"未见任务"如果只是"同 Task 不同位置",那测的就不是"举一反三"而是"位置鲁棒性"了。Variation 层让"同族不同细节"有了正式的归属,是少样本和多任务学习的关键中间粒度。
Q2:RLBench 用 OMPL 运动规划器生成示范。这种"机器手风格"的示范和人类遥操作示范有什么本质区别?对下游学习算法有什么影响?
运动规划器生成的轨迹是平滑、最优、确定性的——它走的是数学上的最短无碰撞路径,每一步都精确到位。人类遥操作的轨迹是曲折、含校正、含停顿的——人手会先大致靠近、再微调、有时候犹豫一下再动。
对下游学习算法的影响:
- 分布偏移:模型学到的是"理想专家"的动作分布,部署到真实世界时遇到噪声和扰动就容易崩——因为它从没见过"需要校正"的情况
- 多样性不足:所有示范都走同一类最优路径,模型学不到"多条路都能到达目标"的鲁棒性
- Multi-modality 缺失:人类示范可能有多种解法(先抓左边再翻 vs 先抓右边再翻),规划器通常只给一种。后来 Diffusion Policy 等方法专门解决多模态动作分布问题,但 RLBench 示范本身不天然提供多模态信号
这就是为什么 RoboMimic 后来专门提供人类遥操作数据——让模型学到更"接地气"的动作分布。
Q3:RLBench 同时提供 RGB、深度、分割三种视觉观测。如果你要设计一个只依赖 RGB 的方法和一个融合 RGB + 深度的方法,在 RLBench 上哪种任务上后者优势最大?为什么?
深度图优势最大的任务是需要精确空间定位的抓取和插入类任务,例如"把形状积木插到对应孔位"(shape insertion)或"把 USB 插头插入端口"。
原因:
- RGB 图像的深度信息是隐式的——模型需要从阴影、透视、纹理等线索中推断距离,这在仿真渲染中可能不够真实
- 深度图直接给出每个像素到相机的距离,不需要学习"从 2D 到 3D"的映射
- 插入类任务要求毫米级精度——夹爪需要对准孔位才能插入,深度信息直接告诉你"还差多远"
- 分割图告诉你"哪些像素是目标物体",但不告诉你"目标在 3D 空间哪里"——深度图补上了这一环
反过来,对于"按按钮"这种只需粗略定位的任务,RGB 就够了,深度图的边际收益不大。RLBench 同时提供三种模态的价值在于:让研究者能公平比较"纯视觉"和"几何增强"两类方法的适用边界。
Q4:RLBench 有 100 个任务,Meta-World 有 50 个。为什么任务数量从 50 到 100 是一个质变而不仅仅是量变?关键差异在哪里?
关键差异不在数量本身,而在任务复杂度和多样性维度:
- 长时序任务:RLBench 包含需要 800-1000 步的多阶段任务(如"清空洗碗机":开门 → 拉托盘 → 抓盘子 → 抬出),Meta-World 的任务大多在 100-200 步内完成。长时序任务的"规划"挑战是短任务没有的。
- 视觉复杂度:RLBench 任务有多个物体交互(锅 + 锅盖 + 灶台),视觉场景更复杂;Meta-World 大多是单物体操作(一个推块、一个按钮),视觉信息较简单。
- 任务种类跨度:RLBench 从"伸手碰目标"到"摆国际象棋"到"浇花",跨越日常生活多个域;Meta-World 集中在工业/机械操作(按按钮、开门、推滑块),域内一致性高但跨域多样性低。
- 示范供应:RLBench 的 100 道题每道都有无限示范(OMPL),Meta-World 没有内置示范。这意味着 RLBench 的 100 道题可以直接用于 IL 大规模训练,而 Meta-World 的 50 道题更适合 RL 自行探索。
所以 100 不是简单比 50 多——RLBench 的 100 道题在复杂度、视觉多样性、示范供应三个维度上都上了新台阶。
Q5:RLBench 选择完全稀疏奖励(成功 +1,否则 0)。如果你要在这个基准上跑 RL,有哪些策略可以缓解稀疏奖励带来的学习困难?
几种可行策略:
- 用示范 bootstrap:先用 OMPL 示范做行为克隆(BC)得到一个初始策略,再用 RL 微调。这相当于"先教会大概怎么做,再让 RL 自己优化细节"。论文本身也提到这个方向(bootstrapping RL with demonstrations)。
- Hindsight Experience Replay(HER):把失败 episode 的实际终态当作"目标"重新标注,让"没到达 A 但到达了 B"的 episode 变成"目标 B 的成功 episode"。这在 Meta-World 上有效,但在 RLBench 的长时序多步任务上效果有限——因为中间步骤太多,HER 只能覆盖最后一步。
- 奖励塑形(reward shaping):手动设计中间奖励(如"靠近目标物体"、"成功抓取"等),把稀疏变密集。但这违背了 RLBench"不靠人类调奖励"的初衷,且不同任务需要不同的塑形函数,工程量大。
- 课程学习:先在简单任务(reach target)上训,再逐步迁移到难任务。但 RLBench 的任务之间差异太大,迁移效果不确定。
实际上社区给出的答案是:直接用 IL。RLBench 的稀疏奖励设计本意就是"逼算法展示探索能力",但结果证明了 2019 年的 RL 算法在这个难度上还不够强——IL 路线先吃饱了红利。
Q6:RLBench 的少样本挑战协议要求:测试时只能获得 K 条示范的观测数据,不能获得关于未见任务的任何先验知识。这个约束为什么重要?如果放松这个约束会怎样?
这个约束的重要性在于:它确保测的是真正的"学会学习"能力,而不是"偷偷记住答案"。
如果放松约束,会出现以下"作弊"路径:
- 如果允许知道测试任务的身份:系统可以为每个测试任务单独训一个模型,那"少样本"就退化成"小数据 BC"——任何 BC 方法都能做到,失去了"元学习"的考察意义。
- 如果允许访问测试任务的额外信息(如奖励函数、动力学模型):系统可以直接用规划器解这个任务,那测的就不是"从示范中学习"而是"从环境模型中规划"。
- 如果允许在测试任务上做大量交互(类似 RL 的在线探索):系统可以通过试错慢慢学会,那"少样本"的"少"字就没有意义了。
这个约束的深层逻辑是:真正的通用机器人应该像人一样——看几遍演示就能大致会做,不需要几万次试错。RLBench 把这个目标形式化为 K-shot 协议,为后续 VLA 时代(RT-2、OpenVLA 等)的"少样本指令跟随"评测奠定了基础。
Q7:RLBench 选择 V-REP(CoppeliaSim)而不是 MuJoCo 作为仿真器。从"让社区快速贡献新任务"的角度,这个选择为什么关键?如果选 MuJoCo 会发生什么?
V-REP 是图形化机器人仿真器,MuJoCo 是物理引擎。区别在于:
在 V-REP 中创建一个新任务:打开图形界面 → 拖拽 3D 物体到桌面 → 用鼠标放置 waypoint → 写 30 行 Python 注册成功条件 → 用校验工具自动测试 → 提交 PR。整个过程可能 1-2 小时。
在 MuJoCo 中做同样的事:手写 XML 描述所有物体的几何体、质量、摩擦系数 → 手写相机参数(位置、朝向、FOV)→ 手写灯光参数 → 手写 IK 求解器接口 → 手写 OMPL 对接代码 → 手写场景渲染代码。整个过程可能 1-2 天甚至更长。
如果选 MuJoCo,"让社区贡献新任务"这个目标基本无法实现——大部分研究者不会花两天时间建一个场景再提交。RLBench 能从 100 道题持续增长,V-REP 的低门槛是工程前提。
代价是:V-REP 的物理精度不如 MuJoCo(摩擦、接触力的模拟更粗糙),渲染质量也一般。这是一个"易用性 vs 精度"的权衡——RLBench 选择了易用性,因为对基准来说"题量大 + 社区参与"比"物理完美"更重要。
13. 一些好奇心问答(FAQ)
Q1:100 道题都是什么样的?
涵盖从"伸手碰目标"(最简单)到"清空洗碗机"(要 1000 步、多步骤)。中间有摆水果、插积木、按下按钮、开门、抓螺丝刀、转水龙头、堆 6 块积木金字塔、设置棋盘等。你可以在论文配套网站 sites.google.com/view/rlbench 看视频。
Q2:能不能跑在我自己电脑上?
能。RLBench + V-REP + PyRep 都是开源的。普通 CPU 就能跑(不像训神经网络要 GPU),但渲染图像的速度可能不快。如果只是收集数据,一台普通电脑跑一晚上能采几千条示范。训练神经网络的话才需要 GPU。
Q3:为什么用 V-REP 不用 MuJoCo / PyBullet?
作者解释:MuJoCo 和 PyBullet 是物理引擎,不是机器人仿真器。建一个带相机、灯光、可拖拽路标、IK 求解器的完整场景,在 V-REP 里几分钟就能拖出来,在 MuJoCo 里要写很多 XML。后来 MuJoCo 也加强了机器人方向(如 MuJoCo Menagerie),但 2019 年时 V-REP 工具链更成熟。
Q4:示范都是运动规划器跑出来的,会不会"太完美"导致模型学不到真实噪声?
会。这是 RLBench 的已知短板。后来一些论文用更接近人类的示范——比如 RoboMimic 提供人类遥操作数据,模型在这上面训练后泛化更好。RLBench 的示范适合做"基础动作模仿"训练,不适合做"鲁棒性"训练。
Q5:100 个任务里 RL 算法能解几道?
2019 年发表时,纯 RL 用稀疏奖励基本只能解最简单几道(比如伸手碰目标)。绝大多数任务必须靠模仿学习起步、或加上密集奖励。这一现象推动了后续"模仿 + RL 混合"路线的兴起。
Q6:少样本挑战的 v1.0 划分具体哪 10 道?
论文里没列具体清单(让网站去维护,因为版本会更新)。重点是**"划分公开、所有人用同一份"**——这个原则比具体哪 10 道更重要。
Q7:RLBench 和 Meta-World 谁赢了?
两者方向不同:RLBench 偏"操作种类多 + 视觉为主 + 含长任务";Meta-World 偏"机械任务结构清晰 + 强 RL 友好"。后来 Meta-World 在 RL 圈用得多,RLBench 在视觉操作 / 模仿学习 / VLA 圈用得多。可以理解为两个并存的标准,覆盖不同子领域。
Q8:现在(2026 年)还有人用 RLBench 吗?
用,但不是唯一选择。CLIPort、PerAct、RVT、3D Diffuser Actor 这一系列经典论文都在 RLBench 上跑分,所以新论文为了和它们比仍会用 RLBench。但同时 LIBERO、ManiSkill、Robosuite、Habitat 等新基准也在分流。RLBench 现在更像是"必跑之一"而不是"唯一基准"。
所以这一节是想说:RLBench 是机器人操作圈的"老大哥基准",可用、可复现、有传承,但不再唯一。
14. 如果你想再深入
按"前传 → 同期对手 → 用 RLBench 跑出名的论文 → 后继基准"四类排:
- 前传:PyRep(James 等,2019) — RLBench 的工程基础,论文短,看完能理解 V-REP 怎么和 Python 高效通信。
- 同期对手:Meta-World(Yu 等,2019) — 同年的多任务 / 元学习基准,方向相近。读完能看出"为啥两套基准没有互相吃掉对方"——它们做了不同的取舍。
- 用 RLBench 跑出名:CLIPort / PerAct / RVT / 3D Diffuser Actor — 这些是 2021-2023 年的代表作,把 RLBench 上的成绩从"勉强能做"拉到"基本能解"。读它们能直观看到 RLBench 这个"考场"的演化。
- 后继基准:LIBERO(2023) — 专门为"语言指令 + 长任务 + 持续学习"设计的下一代操作基准。可以看作 RLBench 思路 + VLA 时代需求的更新版。
- 后继基准:ManiSkill(2021 起) — 用 SAPIEN 仿真器的同类基准,强调更真实的物理和更大规模并行采样。
- 延伸方向:Habitat(同年) — 不在桌面而在室内导航。把 Habitat + RLBench 一起读,能看到 2019 年具身 AI 基础设施同时在两个方向铺路。
所以这一节是想说:把 RLBench + Meta-World + CLIPort/PerAct + LIBERO 这一串串起来读,能看到机器人操作基准从 2019 到 2026 的整条演化线。
15. 原文信息
- 标题:RLBench: The Robot Learning Benchmark & Learning Environment
- 作者:Stephen James, Zicong Ma, David Rovick Arrojo, Andrew J. Davison
- 机构:Dyson Robotics Lab, Imperial College London
- 发表:IEEE Robotics and Automation Letters (RA-L), 2020
- arXiv:1909.12271(2019 年 9 月首发)
- 项目页:https://sites.google.com/view/rlbench
- 代码:https://github.com/stepjam/RLBench
- 依赖:PyRep(https://github.com/stepjam/PyRep),基于 V-REP / CoppeliaSim
- 运动规划库:OMPL(Open Motion Planning Library)
- 机器人:Franka Emika Panda 7-DoF
- BibTeX:James et al., "RLBench: The Robot Learning Benchmark", IEEE RA-L 2020
◼
引用本笔记 / Cite this note
@online{eai_rlbench_2026,
title = {(readable note) RLBench: The Robot Learning Benchmark & Learning Environment},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2019 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rlbench/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?