Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 105

BEHAVIOR-1K

23 min read · 8190 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过具身智能基准"的读者的精读笔记。语言尽量像聊天,概念全部翻译成人话。

一句话讲什么(TL;DR)

BEHAVIOR-1K 是斯坦福搭的"机器人家务驾校":先问了 1461 个真人"你最想让机器人帮你干啥",从答案里挑出 1000 道最实用的家务题(洗地、擦浴缸、做饭……),配上 50 个场景、9000 多件带"使用说明"的物品,跑在一个能模拟流体、软体、温度的新仿真器 OmniGibson 上。实验结论很扎心——现在最强的算法连一道题都很难独立完成。

所以这一节是想说:BEHAVIOR-1K 的核心就是"让普通人出题 + 逼真物理仿真",给具身智能立一把统一、真实、够难的尺子。


这是个什么场景

想象你买了个家政机器人,想让它"把脏盘子放进洗碗机、把沙发上的毛毯叠好"。你敢让它直接在自家厨房练手吗?碗打碎了、冰箱撞凹了谁赔?

人类学开车靠驾校——先在封闭场地练熟再上路。机器人也需要这样一个"驾校":一间虚拟样板房,让它撞坏一万次也不心疼。这就是**具身智能仿真基准(benchmark)**要干的事——在仿真里安全、高效地训练和评测机器人。

但之前的基准有个共同毛病:题都是研究者自己拍脑袋编的。研究者觉得"抓个方块""导航到某点"很有代表性,但这真的是普通人想要机器人做的吗?没人认真调研过。结果就是每个实验室用自己的小基准,题目带研究者偏见、彼此还不可比。

BEHAVIOR-1K 要解的题:能不能造一个既"源自人的真实需求"(让普通人出题)、又"逼真到能反映现实"(高保真物理仿真)的大规模具身智能基准? 一句话,做一把大家公认、贴近真实、够难的统一尺子。

所以这一节是想说:机器人需要安全的"仿真驾校",但之前的基准题目由研究者编、缺真实需求和物理逼真度,BEHAVIOR-1K 来补这个空。


BEHAVIOR-1K — 场景示意:这论文要解决的现实问题
Plate Nº IBEHAVIOR-1K — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:AI2-THOR / iGibson / Habitat(导航为主) 场景多,但任务偏简单(导航、抓一两件东西)。类比:驾校只教"绕操场走一圈"。问题:缺长程家务、物体交互能力弱,做不了"拧瓶盖"这种细粒度操作。

  • 方案 B:RLBench / ManiSkill / Metaworld(桌面操作) 任务量不少、物理较真实,但都是桌面单一台面(tabletop)。问题:不是真实家居环境,任务种类少(几个到几十个),缺多样性。

  • 方案 C:VirtualHome / ALFRED(指令跟随) 场景、物体、状态变化多样。问题:低层物理真实度差——它偏符号化/高层规划,不模拟真实的抓取、力、流体。存在"多样性 vs 真实性"的权衡。

  • 方案 D:Habitat 2.0 / TDW / SoftGym(真实物理) 物理仿真真实、动作执行逼真。问题:任务太少(就几个重排/搬运任务),多样性严重不足。

  • 方案 E:BEHAVIOR-100(前作) 100 个任务 + 15 个场景(全是房子)+ 300+ 物体类别,且用了逻辑语言定义任务和评测指标。问题:规模上不去、场景单一、物理保真度有限,任务仍由研究者选。

  • 核心难题:怎么同时做到任务源自真实人类需求 + 极高多样性(场景/物体/状态)+ 逼真物理(流体、软体、温度)?之前的基准总在"多样性"和"真实性"之间二选一。

所以这一节是想说:导航基准太简单、桌面基准不真实、指令基准缺物理、物理基准缺多样性、前作规模小——没有一个能同时满足"真实需求 + 多样 + 逼真",BEHAVIOR-1K 来打破这个权衡。


这篇论文的新想法

类比:BEHAVIOR-1K 就像一个"由用户投票出题、由高保真物理引擎监考"的机器人家务国考。题目不是命题组闭门造车,而是先做全国问卷"你最想被代劳什么",再把高频答案变成可自动判分的标准题。

BEHAVIOR-1K 的核心判断:一个以人为中心的基准,不仅要"为人的需求设计",更要"源自人的需求"。 它有三个关键想法:

  1. 让用户出题,不让研究者出题。 像产品经理做需求调研——对 1461 人发问卷"你日常最希望机器人帮你做什么",从约 2000 个候选活动里(来自时间使用调查和 WikiHow)按偏好打分,挑出最想要的 909 个 + 继承 BEHAVIOR-100 的 91 个 = 1000 道题。结果显示需求高度分散(Gini 系数 0.158),枯燥家务(刷浴室地板)排最高、娱乐活动(打游戏)排最低。

  2. 把"做完没"写成机器能自动判的逻辑公式。BDDL(BEHAVIOR 领域定义语言,基于谓词逻辑)把每道题写成"初始状态 + 目标状态",比如"所有盘子都在洗碗机里"。普通人也能在语义层面标注,仿真器自动核对,不用人肉打分。

  3. 物体不光长得像,还"懂自己是什么"。 9000+ 物体除了 3D 外形,还标了"能装液体吗""能加热吗""能折叠吗"等丰富物理/语义属性,配合新仿真器 OmniGibson(基于 NVIDIA Omniverse + PhysX 5)跑流体、软体、温度等复杂物理。

【打破"多样性 vs 真实性"的二选一】

  真实性
   ↑   Habitat2.0 / TDW ●(物理真但任务极少)
   │
   │                        ★ BEHAVIOR-1K
   │                        (1000任务/50场景/9000+物体
   │   Metaworld ●            + 流体/软体/温度)
   │   ● AI2-THOR/Habitat(任务简单)
   │            ● VirtualHome/ALFRED(符号化, 物理弱)
   └────────────────────────────────▶ 多样性

  三招同时拿下:用户投票出题(1461人问卷) + BDDL谓词逻辑自动判分 + OmniGibson高保真物理

所以这一节是想说:BEHAVIOR-1K 的新想法是"用户投票出题(问卷)+ 谓词逻辑判分(BDDL)+ 会懂物理的物体和仿真器(OmniGibson)",从而打破多样性和真实性的权衡。


它分几步做的(方法)

BEHAVIOR-1K 的构建流程:

【第1步 问卷出题】1461人 × 2000候选活动(时间调查+WikiHow)
   │ 按"想让机器人代劳"程度打分
   ▼ 909高分活动 + 91个BEHAVIOR-100活动 = 1000道题
   │
【第2步 BDDL形式化】谓词逻辑写初始/目标状态
   │ inside(dishes, dishwasher)... 众包标注
   ▼ 1000个BDDL任务定义 + 知识库(属性/状态转移)
   │
【第3步 资产建模】50场景(房/店/餐厅/办公) + 9000+物体
   │ 每物体: mesh + 碰撞体 + 铰接关节 + 属性标签(cookable/fillable...)
   ▼ BEHAVIOR-1K 数据集
   │
【第4步 OmniGibson仿真器】Omniverse + PhysX5
   │ 刚体+软体+流体+温度+湿度 统一物理; 自动生成初始配置/判定目标
   ▼ 1000道题都能真实跑起来
   │
【第5步 基线评测 + sim-real校准】RL-VMC / RL-Prim / RL-Prim.Hist
   ▼ 结论: 现有算法极难解, 长程+抓取是最大瓶颈

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 用问卷让真人出题

类比:不是命题组闭门造车,而是先做一次全国性的"你最想机器人帮你干啥"民意调查。

输入:约 2000 个候选活动,来自时间使用调查(记录人们怎么花时间,如 ATUS)和 WikiHow 文章。

处理:在 Amazon Mechanical Turk 上对 1461 名美国人发问卷,每个活动收 50 份 10 点李克特量表打分,问"你多想让机器人代劳这件事"。再让普通标注者给活动写定义。结果按"人类偏好分"排序:需求高度分散(Gini 0.158),枯燥的清洁类(约 200 个)、烹饪类(200+ 个)排最高,娱乐类排最低。

输出:排名前 1000 的活动(909 个高分 + 91 个继承自 BEHAVIOR-100)。

小结:用大规模真人问卷选题,让基准"源自人的真实需求",这是它区别于所有前作的根本创新。

5.2 用 BDDL 把任务写成可判分的逻辑

类比:考试要有标准答案才能自动阅卷。BDDL 就是把"这道题算不算做完"写成机器能核对的判定句。

输入:1000 个活动的自然语言描述。

处理:用 BDDL(BEHAVIOR Domain Definition Language)——基于谓词逻辑、专为普通人易用设计——众包标注每个活动的初始状态目标状态。它用"物体 + 物体状态"来描述(如 cooked(apple)inside(apple, fridge)),是语义层面的定义,而非某张具体图片/几何构型。好处是同一个语义目标可以对应多种合法的物理实现(多种初始摆放、多种解法都算对),仿真器能自动判定。

输出:1000 个 BDDL 任务定义 + 一个常识知识库(物体、属性、状态转移规则)。

小结:BDDL 用谓词逻辑把任务的"起点和终点"写成机器可判的公式,让 1000 道题都能自动判分、且允许多种合法解。

5.3 建 50 场景 + 9000+ 会"懂物理"的物体

类比:搭 50 套逼真的样板间,每件道具都自带"使用说明书"——这杯子能装水、这面团能揉、这抽屉能拉开。

输入:任务集所需的场景和物体类别。

处理

  • 50 个场景:覆盖住宅、商店、餐厅、办公等(不像前作全是房子),部分来自真实房屋扫描重建,家具都可交互(抽屉能开、门能转、灯能关)。
  • 9000+ 物体、1900+ 类别:每个物体有 mesh、UV 贴图、碰撞体、铰接关节(articulation),还有抽象状态标签(cookable / fillable / foldable / soakable 等)。物体经 WordNet 词义对齐(共 2964 个叶子 synset),并标注了 (物体, 属性) 级别的参数(如每种可煮物体的 cookTemperature)——因为苹果和鸡肉煮熟的温度不同,光知道"都可煮"不够。

输出:BEHAVIOR-1K 数据集(知识库 + 3D 资产库)。

小结:50 个多类型可交互场景 + 9000 件带丰富物理/语义属性的物体,是"多样性 + 真实性"的物质基础。

5.4 OmniGibson:能跑复杂物理的仿真器

类比:一个能同时模拟"倒水会流、布会皱、锅会热、地会脏"的超级物理沙盒。

输入:BEHAVIOR-1K 数据集里的场景、物体、任务定义。

处理:在 NVIDIA Omniverse + PhysX 5 之上二次开发出 OmniGibson,关键能力:

  • 刚体 + 可变形体 + 流体的统一物理仿真,PBR 逼真渲染。
  • 扩展的物体状态:温度、开关(toggled)、浸湿(soaked)、脏污(dirtiness)、热效应(火/蒸汽/烟)等。
  • 能根据 BDDL 定义自动生成合法的初始配置,并判定目标是否达成(区分有效解)。
  • 支持多种机器人(Fetch、Tiago、Stretch、Franka 等)。 视觉质量分 3.20,远高于 BEHAVIOR-100 的 1.69 和其他基准(~1.7)。

输出:1000 道题都能真实实例化、可交互地跑起来的仿真环境。

小结:OmniGibson 用 Omniverse + PhysX5 提供流体/软体/温度等复杂物理和高保真渲染,是让 1000 道题"真实可跑"的工程底座。

5.5 基线评测与 sim-to-real 校准

类比:题库建好后,先让现有的"最强考生"来试考,看看能考多少分、错在哪,再检验"仿真里学会的能不能搬到真机器人上"。

输入:BEHAVIOR-1K 的几个代表任务(StoreDecoration、CollectTrash、CleanTable)。

处理:评测三种基线(都用稀疏的任务成功奖励,不做奖励工程):

  • RL-VMC:端到端视觉运动控制(在原始动作空间用 PPO)。
  • RL-Prim.:基于采样式运动规划的动作原语(pick、place、push、navigate、dip、wipe),策略只需离散选"对哪个物体用哪个原语"。
  • RL-Prim.Hist.:在 RL-Prim. 基础上加观测记忆(历史)。 为加速训练,抓取用了辅助性 pick 原语(手指接触即建立刚性连接),原语只检查最终配置的可行性。还做了 sim-to-real 校准:把一个真实公寓扫描成数字孪生,用双臂移动机器人 Tiago(YOLOv3 检测物体、LiDAR + 粒子滤波定位)跑 CollectTrash。

输出:成功率、效率指标、失败来源分析(见下节数字)。

小结:用三档基线(端到端 vs 动作原语 vs 加记忆)系统摸底,并用数字孪生 + 真机 Tiago 校准仿真-现实差距。

5.6 为什么"真实需求 + 逼真仿真"是关键

  • 真实需求让基准有意义:题源自 1461 人问卷,评测的是"人真正想要机器人做的事",而非研究者臆想。
  • BDDL 让评测可扩展、可判定:语义谓词逻辑既让普通人能出题、又让机器能自动判分,还允许多种合法解。
  • 逼真物理让结论可信、可迁移:流体/软体/温度 + 高保真渲染,让仿真里的成败更能反映现实;数字孪生校准则量化了 sim-real 差距。

所以这一节是想说:BEHAVIOR-1K 的方法五步(问卷出题 → BDDL 判分 → 资产建模 → OmniGibson 仿真 → 基线评测与校准),核心是"真实需求 + 逼真仿真"这套组合拳。


BEHAVIOR-1K — 方法示意:核心 pipeline
Plate Nº IIBEHAVIOR-1K — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"这个基准有多难、难在哪"。

数字 1:规模对比(vs 前作与主流基准)

维度 BEHAVIOR-1K BEHAVIOR-100 典型桌面基准
活动数 1000 100 1–100
是否源自人类偏好调查
场景 / 房间 50 / 373 15 / 100 多为 1
物体类别 1949 391 几~几十
物体模型 9318 1217 几~百
每任务物体数 3–47 3–34 1–5
视觉质量分 3.20 1.69 ~1.7

关键含义:活动数 10 倍于前作、物体近 8 倍、场景类型更丰富、视觉质量近乎翻倍——且唯一一个"源自人类需求调查"的基准。

数字 2:三种基线的任务成功率

方法 StoreDecoration CollectTrash CleanTable
RL-VMC(端到端视觉控制) 0.0±0.0 0.0±0.0 0.0±0.0
RL-Prim.(动作原语) 0.48±0.06 0.42±0.02 0.77±0.08
RL-Prim.Hist.(原语+记忆) 0.55±0.05 0.63±0.03 0.88±0.02

关键含义:端到端视觉控制一道题都学不会(全 0),因为任务太长程(信用分配、深度探索、梯度消失)。必须用动作原语抽象动作空间才行。记忆对长程任务帮助巨大(CollectTrash 0.42→0.63)。

数字 3:任务长度与难度

任务 最优原语步数 说明
CleanTable 6 步 相对短,成功率最高
CollectTrash ≥16 步 长程 + 观测混淆,最难,需记忆

关键含义:越长程越难。CollectTrash 需至少 16 个原语步,且机器人看着垃圾桶时需要记忆才知道"哪些地方已经清过"。

数字 4:去掉简化假设后的成功率(RL-Prim. 消融)

设置 StoreDecoration CollectTrash CleanTable
全物理抓取 + 全轨迹运动 0.0±0.0 0.0±0.0 0.0±0.0
简化抓取 + 全轨迹运动 0.46±0.04 0.36±0.08 0.73±0.03
简化抓取 + 简化运动(默认) 0.48±0.06 0.42±0.02 0.77±0.08

关键含义:一旦启用完全基于物理的抓取,性能崩到 0——抓取是核心难题。而完全轨迹运动执行影响小,说明训练时假设运动规划可行是合理的加速手段。

数字 5:真机 sim-to-real 失败来源(Tiago,CollectTrash)

失败来源 占比 说明
抓取(真机) ~40% 真实抓取很难,训练/最优策略都受此拖累
视觉策略选错原语 44%(学习策略) 仿真图与真实图差异(相机动态范围差、木纹反光未建模)
感知(物体检测) 部分 最优策略下检测错误

关键含义:真机上抓取(~40%)和感知差异(视觉策略 44% 选错)是主要 sim-real 差距来源,可用更针对性的域随机化缓解。

所以这一节是想说:数据证明四件事——规模空前、端到端算法全崩、长程与抓取是最大瓶颈、sim-real 差距主要在抓取和感知。


实验结果说明了什么

问题一:现有最强算法能做 BEHAVIOR-1K 吗? 基本不能。端到端视觉运动控制(RL-VMC)连一道题都学不会(全 0),因为任务极端长程带来信用分配、深度探索、梯度消失等困难。只有引入动作原语(把动作抽象成 pick/place/navigate 等)并注入大量领域知识后,才能到 40% 以上。这说明 BEHAVIOR-1K 把具身智能的天花板抬得很高,现有方法远未触及。

问题二:任务的哪些要素最难? 两个:长程抓取。长程上,任务越长成功率越低(CleanTable 6 步 vs CollectTrash 16 步),且长程任务离不开记忆(CollectTrash 0.42→0.63)——因为机器人需要记住"哪些地方已经做过"。抓取上,一旦用完全基于物理的真实抓取,成功率直接崩到 0,说明"为任意物体设计真实抓取原语"本身就是未解难题。

问题三:训练时的简化假设合理吗? 部分合理。简化"运动执行"(假设运动规划能找到可行路径)影响很小,是合理的加速手段;但简化"抓取"影响巨大——去掉辅助抓取后性能崩溃。所以研究者简化抓取要非常谨慎,它是任何具身任务的关键环节。

问题四:仿真学到的能迁移到真机吗?差距在哪? 有明显差距,主要来自抓取感知。真机上抓取占约 40% 的失败;视觉策略因仿真图和真实图的差异(真实相机动态范围差、木纹反光等未建模)有 44% 选错原语。这些可通过更有针对性的域随机化缓解。这个数字孪生实验量化了 sim-real 差距的来源,为后续研究指方向。

所以这一节是想说:实验系统回答了四个问题——现有算法远不够、长程和抓取最难、简化抓取危险、sim-real 差距主要在抓取和感知。


你应该懂的几个新词

具身智能(Embodied AI):让 AI 拥有"身体"、能在物理/仿真世界感知和行动,区别于纯文字/图像 AI。

基准(benchmark):一套标准化的任务 + 数据 + 评测协议,让不同方法能在同一把尺子上比较。

BDDL(BEHAVIOR 领域定义语言):基于谓词逻辑的任务定义语言,用"物体 + 状态"描述初始/目标条件,可自动判分。

谓词(predicate):描述对象关系的布尔函数,如 inside(apple, fridge)is_open(door)

铰接物体(articulated object):有可活动关节的物体,如能拉开的抽屉、能转的水龙头,区别于整块刚体。

OmniGibson:BEHAVIOR-1K 配套的仿真器,基于 NVIDIA Omniverse + PhysX 5,支持流体/软体/温度。

长程任务(long-horizon task):需要几十上百步才能完成的任务,如"做一顿饭"含取材、加热、摆盘多个子任务。

动作原语(action primitive):把底层控制抽象成高层技能(pick、place、navigate 等),策略只需选用哪个原语。

移动操作(mobile manipulation):机器人边移动边操作物体,比只在固定台面操作难得多。

sim-to-real gap(仿真-现实差距):仿真里训好的策略搬到真机时性能下降的现象,主要来自物理和感知差异。

所以这一节是想说:这十个词是读任何"具身智能基准/仿真"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 当前算法几乎解不了:这既是贡献也是"局限"——1000 道题里现有 SOTA 连单题都极难独立完成,基准的实用性依赖未来算法进步。
  • 抓取还靠简化假设:为了能跑实验,用了辅助性 pick 原语;真实物理抓取一开就崩到 0,"为任意物体设计真实抓取"仍是开放难题。
  • sim-real 差距仍大:真机上抓取和视觉感知差异导致大量失败,仿真训练的策略不能直接可靠地上真机。
  • 仿真的物理仍非完美:虽然支持流体/软体/温度,但真实相机动态范围、材质反光等细节未完全建模,是视觉迁移的坑。
  • BDDL 是语义级判定:谓词逻辑判"做完没"很灵活,但也意味着它不直接约束"做得好不好/像不像人",对精细操作质量的刻画有限。
  • 计算成本高:高保真物理 + 渲染 + 1000 任务,跑起来对算力要求高,普通实验室全量使用有门槛。

所以这一节是想说:BEHAVIOR-1K 立起了一把够真、够难的尺子,但抓取仿真、sim-real 差距、算力成本这些问题仍在——它更多是给领域"指出还有多难",而非给出解法。


它和别的论文是什么关系

  • 上游 / 继承
    • BEHAVIOR-100(Srivastava 2021):直接前作,继承了活动来源(ATUS)、BDDL 逻辑语言、评测指标;BEHAVIOR-1K 把规模扩了一个量级。
    • iGibson 系列:OmniGibson 是 iGibson 的下一代,物理保真度大幅提升(加了流体、软体)。
    • NVIDIA Omniverse / PhysX 5:OmniGibson 的底层物理和渲染引擎。
  • 对比关系
    • Habitat / AI2-THOR:那些偏导航 + 简单交互,BEHAVIOR-1K 偏复杂物理操作和长程家务。
    • RLBench / ManiSkill / Metaworld:那些是桌面操作,BEHAVIOR-1K 是全屋移动操作。
    • VirtualHome / ALFRED:那些多样但物理浅,BEHAVIOR-1K 既多样又物理逼真——打破多样性/真实性权衡。
  • 下游 / 同族:BEHAVIOR-1K 常被 OpenVLA、RDT-1B 等 VLA 模型当作标准化评测床;和真实数据集(RT-X 等)互补——"先 sim 训练再迁移真机"是常见流水线。

所以这一节是想说:BEHAVIOR-1K 站在 BEHAVIOR-100 + iGibson + Omniverse 的肩膀上,用"真实需求 + 逼真仿真"打破了具身基准的多样性-真实性权衡,成为领域的统一尺子。


和本导读的关系

本笔记对应导读中"仿真与基准"这条线的关键节点。

具身智能要落地,绕不开两个问题:在哪练(仿真)怎么评(基准)。BEHAVIOR-1K 同时回答了这两个——它既是一个高保真仿真环境(OmniGibson),又是一套源自人类需求的评测基准(1000 道题 + BDDL)。理解了它,你就理解了"为什么 sim-to-real 这条路这么难",以及"评测一个通用家务机器人到底要考什么"。

读完本笔记,建议:对照看 CALVIN 笔记(另一个语言条件的长程操作基准,规模更小但更聚焦策略学习),理解不同基准的定位差异;再看各类 VLA 模型(如 RT 系列、OpenVLA)笔记,理解这些基准是怎么被用来评测大模型的。三者连起来,就能看清"基准 → 仿真 → 模型"的评测闭环。

对应导读章节:Ch17:Sim-to-Real——仿真训练与真机部署

所以这一节是想说:本笔记是"仿真与基准"这条线的核心,读它能校准你对"通用机器人当前能力"的认知,再结合 CALVIN 和 VLA 模型笔记理解评测闭环。


思考题

以下问题检验你是否真正理解了 BEHAVIOR-1K 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:BEHAVIOR-1K 为什么要花大力气做 1461 人的问卷来出题,而不像别的基准那样由研究者直接定任务?

提示

因为"以人为中心"不只是"为人设计",更要"源自人的需求"。研究者定任务有两个问题:(1) 带偏见——研究者觉得重要的(如抓方块、导航)未必是普通人想要机器人做的;(2) 不可验证——没人知道这些任务是否真的对应现实需求。做大规模问卷(1461 人、每活动 50 份打分)能直接拿到"人真正想让机器人代劳什么"的客观数据,从而让基准评测的是有实际价值的能力。结果也很有启发:枯燥家务(刷地板)排最高、娱乐(打游戏)排最低,需求高度分散(Gini 0.158)——这些洞察本身就指导了基准该覆盖什么。这是 BEHAVIOR-1K 区别于所有前作的根本创新,让"以人为中心"从口号变成方法。

Q2:为什么用 BDDL(谓词逻辑)来定义任务,而不用"给一张目标图片"或"给一段目标视频"?

提示

因为谓词逻辑是语义级的,允许"多种合法解"。如果用一张目标图片定义"把盘子放进洗碗机",就等于规定了盘子必须摆成图片里那个精确位置/角度——但现实中盘子放进去有无数种合法摆法,都算完成任务。用 inside(dishes, dishwasher) 这样的谓词,只要盘子在洗碗机里就算对,不管具体怎么摆。这带来三个好处:(1) 允许多种初始配置和多种解法都被判为成功,更贴近现实;(2) 普通人能在直观的语义层面出题(不用懂几何/像素);(3) 仿真器能自动核对谓词是否满足,无需人肉判分,可扩展到 1000 个任务。代价是它不直接刻画"做得好不好、像不像人",对操作质量的约束较弱。

Q3:实验中端到端视觉运动控制(RL-VMC)在所有任务上都是 0%,而动作原语方法能到 40%+。这说明了什么根本问题?

提示

说明长程任务需要动作空间的抽象。端到端控制要在原始动作空间(每个时刻输出关节/末端指令)里,靠稀疏的"任务完成"奖励一步步试出几十上百步的正确序列——这面临信用分配(不知道是哪一步导致最终成败)、深度探索(要探索的序列空间指数爆炸)、梯度消失(长序列反传困难)等根本难题。动作原语(pick、place、navigate 等)把连续的底层控制抽象成有意义的高层技能,策略只需在少数原语里离散选择,大幅缩短了决策序列、降低了探索难度,所以能学出来。这印证了一个重要观点:解决长程具身任务,某种形式的动作/时间抽象几乎是必需的——纯端到端目前还啃不动。这也是为什么很多后续工作走"分层/技能"路线。

Q4:消融实验发现,一旦启用"完全基于物理的抓取",成功率就崩到 0,但启用"完全轨迹运动"影响很小。这个对比说明什么?对研究者有什么警示?

提示

说明抓取是具身操作的核心瓶颈,而自由空间运动相对容易。运动规划在自由空间找一条无碰撞路径是相对成熟的问题,所以训练时假设"运动可行"、评测时启用真实运动,影响不大。但抓取涉及接触力、摩擦、物体几何、手指配合等复杂物理,"为任意物体可靠抓取"本身就是未解难题——所以用辅助抓取训练、评测时换成真实物理抓取,性能直接崩。警示是:研究者在设计实验时如果为了方便而简化了抓取(用 sticky/assistive grasp),得到的高成功率可能严重高估真实能力,把结论从仿真搬到真机会大跌。简化假设要诚实地标注并做消融,尤其抓取这种关键环节不能想当然。

Q5:BEHAVIOR-1K 的一个"卖点"是现有算法几乎解不了它。一个"没人能做出来"的基准,价值在哪?会不会太难反而没用?

提示

价值在于它给领域指明了正确的难度和方向,而非立即可刷分。好的基准应该略微超前于当前能力——如果现有方法轻松刷满分,基准就失去了区分度和牵引力(比如很多旧基准很快饱和)。BEHAVIOR-1K 足够难,意味着它能在很长时间里持续区分方法优劣、牵引研究进步(就像 ImageNet 当年也远超当时能力)。而且它不是"无脑难"——它通过基线实验和消融,明确指出了难在哪(长程、抓取、记忆、sim-real),给研究者提供了清晰的切入点。此外它是模块化的:研究者可以先在任务子集、用简化假设起步,逐步去掉简化。所以"太难"不是缺点,只要它的难是有结构、可分解、能指方向的难。风险在于如果太难到无人问津或无法分解,才会失去价值——BEHAVIOR-1K 通过提供基线和分析规避了这一点。

Q6:真机实验显示 sim-real 差距主要来自抓取(~40%)和视觉感知(44% 选错原语)。如果你要缩小这个差距,会优先做什么?

提示

针对两个主因分别下手。感知差距(视觉策略因仿真图和真实图差异而选错)相对好解:论文指出差异来自真实相机动态范围差、木纹反光等未建模效应,可用更有针对性的域随机化(训练时随机化光照、纹理、相机参数)让策略对视觉差异更鲁棒;也可以用更真实的渲染、或在真实图上做少量微调/域适应。抓取差距更难:需要更好的抓取算法(如学习式抓取、结合触觉反馈),或提升仿真的接触物理保真度让仿真抓取更接近真实。优先级上,感知差距投入产出比更高(域随机化成本低、见效快),可以先做;抓取是更深的研究问题,需要长期投入。此外还可以做 sim-real 协同(少量真机数据微调)。核心思路是:先量化差距来源(这正是数字孪生实验的价值),再按"性价比"逐个击破。

Q7:BEHAVIOR-1K 用仿真来规避"真机练习会撞坏东西"的问题。但它自己也承认 sim-real 差距很大。那"在仿真里练"这条路到底靠不靠谱?

提示

靠谱,但要正确使用。仿真的核心价值无可替代:安全(撞坏一万次不心疼)、高效(可并行加速、无需真机硬件)、可控(能生成多样场景、自动判分、复现实验)。这些是真机练习给不了的,尤其对需要海量试错的学习算法。sim-real 差距的存在不否定仿真的价值,而是提醒:仿真训练不能是终点,需要配合 sim-to-real 技术(域随机化、真机微调、系统辨识)来弥合差距。BEHAVIOR-1K 的态度正是务实的——它一方面提供高保真仿真(尽量缩小差距),另一方面主动做数字孪生实验去量化差距、分析来源,为后续 sim-to-real 研究铺路。所以正确的理解是:"仿真训练 + sim-to-real 迁移"是当前最可行的范式,纯真机训练不现实,纯仿真又不够,两者结合才是路。BEHAVIOR-1K 的贡献是把这个范式的"仿真"一端做到了新高度,并诚实地暴露了"迁移"一端的挑战。

所以这一节是想说:能回答这 7 题,你就真正理解了 BEHAVIOR-1K 为什么用问卷出题、BDDL 判分、动作原语,以及抓取瓶颈、sim-real 差距和仿真训练范式的价值与边界。


一些好奇心问答(FAQ)

Q1:BEHAVIOR-1K 是数据集、仿真器还是基准? 三位一体。它包含 BEHAVIOR-1K 数据集(1000 个 BDDL 任务定义 + 知识库 + 50 场景 + 9000+ 物体)和 OmniGibson 仿真器,合起来构成一个完整的具身智能评测基准。

Q2:1000 道题从哪来? 909 个来自 1461 人问卷的最高偏好活动,91 个继承自前作 BEHAVIOR-100,共 1000 个。候选活动源自时间使用调查和 WikiHow。

Q3:OmniGibson 和 iGibson 什么关系? OmniGibson 是 iGibson 的下一代,建在 NVIDIA Omniverse + PhysX 5 上,新增了流体、软体、温度、湿度等复杂物理和更高保真渲染。

Q4:支持哪些机器人? Fetch、Tiago、Stretch、Franka 等多种。真机 sim-to-real 实验用的是双臂移动机器人 Tiago。

Q5:为什么端到端 RL 全是 0 分? 因为任务极端长程(几十步以上),面临信用分配、深度探索、梯度消失等难题,稀疏奖励下端到端根本探索不到成功序列。必须用动作原语抽象动作空间。

Q6:普通实验室能用吗? 能,会开源,但高保真物理 + 渲染 + 1000 任务对算力要求较高,建议从任务子集起步。

所以这一节是想说:BEHAVIOR-1K 的实操问题(三位一体、题目来源、仿真器血缘、机器人支持、RL 为何失败、算力门槛)都有明确答案,核心就是"真实需求 + 逼真仿真"这套组合。


如果你想再深入

按"必读前置 → 仿真底座 → 对比 → 应用"排序:

  1. 必读前置:BEHAVIOR-100(Srivastava et al. 2021) — 直接前作,理解 BDDL、评测指标和活动来源的由来。
  2. 仿真底座:iGibson / NVIDIA Omniverse 文档 — 理解 OmniGibson 的物理和渲染能力边界。
  3. 对比基准:CALVIN — 本仓库有笔记,另一个长程操作基准,对照理解不同基准定位。
  4. 对比基准:Habitat 2.0 / ManiSkill — 理解"多样性 vs 真实性"权衡的另一端。
  5. 应用:OpenVLA / RT-X — 理解这些基准如何被用来评测大规模 VLA 模型。

所以这一节是想说:把 BEHAVIOR-100 + iGibson + CALVIN + BEHAVIOR-1K 连起来读,就能看清具身智能基准从"研究者出题"到"用户出题 + 逼真仿真"的完整演进。


原文信息

BibTeX

@inproceedings{li2024behavior1k,
  title     = {BEHAVIOR-1K: A Human-Centered, Embodied AI Benchmark with 1,000 Everyday Activities and Realistic Simulation},
  author    = {Li, Chengshu and Zhang, Ruohan and Wong, Josiah and Gokmen, Cem and Srivastava, Sanjana and Mart{\'\i}n-Mart{\'\i}n, Roberto and Wang, Chen and Levine, Gabrael and others},
  booktitle = {Proceedings of the Conference on Robot Learning (CoRL)},
  year      = {2024}
}

链接

所以这一节是想说:这是 Li et al. 2024 年发表在 CoRL 的工作,用"1461 人问卷出题 + BDDL 判分 + OmniGibson 逼真仿真",给具身智能立了一把源自真实需求、够多样、够逼真、也够难的统一尺子。

引用本笔记 / Cite this note
BibTeX
@online{eai_behavior_1k_2026,
  title       = {(readable note) BEHAVIOR-1K},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/behavior-1k/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?