Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 101

Habitat 2.0

15 min read · 5202 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

上一代 Habitat 只能在虚拟房子里走路看;2.0 让小机器人能真的开冰箱、把杯子从厨房拿到客厅做家务。

所以这一节是想说:Habitat 2.0 把"能看能走"的虚拟房子,升级成"能动手做家务"的可交互训练场。


这是个什么场景

想象你想训练一个机器人帮你做家务——下班回家让它从冰箱拿瓶汽水放到沙发茶几上。但在真机器人上反复试错几千次太贵也太慢(撞坏的杯子要赔钱、跑一晚才走 100 步),所以研究者干脆在电脑里造一个"虚拟房子"当训练场,让 AI 在里面跑上亿次再迁移到真机。

上一代 Habitat(1.0)就是这样的虚拟房子,但它更像一个只能转头看景的看房 demo——你能让小人在房间里走路、看墙壁、记地图,但柜门是死的、杯子是画上去的,伸手过去什么都抓不起来。Habitat 2.0 把这套虚拟房子升级成真能"过家家"的厨房客厅:冰箱门能拉开、抽屉能滑出、杯子有重量被撞会倒,机器人撞到桌角也会被挡住。

研究者要的就是这种"能动手"的虚拟房子——真正的家庭机器人最终要在物理世界做事,光会看路、记地图远远不够。

具身 AI(Embodied AI):让 AI 有"身体",在(仿真或真实)世界里感知和行动,而不只是输入输出文字。

所以这一节是想说:场景是"在虚拟房子里训练家务机器人",2.0 要让这个房子从"能看"进化到"能动手交互"。


Habitat 2.0 — 场景示意:这论文要解决的现实问题
Plate Nº IHabitat 2.0 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Habitat 1.0(2019):渲染快、场景多,但场景是静态网格,不能交互,只能跑 PointNav / ObjectNav 这类纯导航任务。
  • AI2-THOR / RoboTHOR:支持开关抽屉、拿放物体,但用的是离散"魔法动作"(瞬移式),不是真物理。
  • iGibson / SAPIEN:开始引入物理和关节物体,但要么场景小、要么仿真慢,跑不动 RL 所需的亿级 step。
  • 传统机器人仿真器(Gazebo / MuJoCo / PyBullet):物理强,但没有照片级视觉,也没成套家居场景资产。
  • 结论:在 Habitat 2.0 之前,没人能同时做到"快 + 真物理 + 视觉真实 + 大规模可交互家居"。

RL(强化学习):靠"奖励"信号让 agent 自己试错学习。它动辄要跑上亿个动作步,所以仿真必须够快。

所以这一节是想说:前人要么快但不能交互、要么能交互但慢或不真,四个优点没人凑齐。


这篇论文的新想法

把"模拟器"当作一个由三层组成的栈来重做:资产层(ReplicaCAD)+ 仿真层(Habitat-Sim 2.0 物理引擎)+ 任务层(HAB)。每一层都为了同一个目标——让 RL agent 能在 GPU 上以超高吞吐做家居物理交互——重新设计:

  • 资产做成铰接的(柜子有可动门、抽屉有可滑轨道)。
  • 仿真用 Bullet 物理引擎 + 自家优化把吞吐推到很高的 SPS(steps per second)。
  • 任务用一组接近真实生活语义的"重排"长流程(找物体、抓、放、回家),而不是单一短动作。

这不是"加个物理就完事",而是把整个 pipeline 重新做了一遍,让具身 AI 第一次能在"长任务 + 真物理 + 视觉真实"里同时被训练和评测。

SPS(steps per second,每秒步数):仿真器一秒能模拟多少个"动作步"。RL 要跑亿级步,SPS 高一倍,训练时间就少一半。所以"快"不是炫技,是决定研究能不能被普通实验室做出来。

所以这一节是想说:新想法 = 把仿真器拆成"资产/仿真/任务"三层重做,全为 GPU 上高速物理交互服务。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. ReplicaCAD:可交互的家居资产

输入:真实扫描的房间(来自 Replica 数据集)。

处理:像宜家把整套家具拆成一个个能转动的零件交给你 DIY。人工把家具一件件重做成 CAD 风格的、带关节信息的 3D 模型。冰箱不是一坨死网格,而是"机身 + 一个可绕铰链旋转的门";抽屉柜不是一坨死网格,而是"机身 + 几个可沿滑轨平移的抽屉"。

输出:一批带关节、带碰撞体、可交互的家居 3D 资产。

这样 agent 才能"打开 → 伸手 → 关上"。

铰接物体(articulated object):带关节的物体,比如能开关的门、能拉出的抽屉。区别于一坨不能动的刚体网格。

2. Habitat-Sim 2.0:高吞吐物理仿真

输入:ReplicaCAD 资产 + agent 的动作。

处理:像把普通游戏机改装成 1000 倍速快进的训练机——画面一样好看,但同样时间能多跑几千场。在 Habitat 1.0 的渲染基础上接入 Bullet 物理引擎,并大量做工程优化:批渲染、避免 CPU-GPU 反复拷贝、向量化环境。

输出:一个单 GPU 就能跑到很高 SPS 的物理 + 渲染仿真器(具体数值需读原文,量级是每秒数千步)。

等等,先慢一拍——为什么这么在意速度?因为 RL 训练要跑亿级动作步,SPS 高一倍训练时间就减半,这直接决定一个课题组用得起还是用不起。

3. Home Assistant Benchmark(HAB)

输入:ReplicaCAD 场景 + 一组家居长任务定义。

处理:像驾校出的考题——不是只让你直行,而是倒库 + 侧方 + 上坡一气呵成。论文定义了一组家居长任务:

  • SetTable:把碗筷从橱柜拿出摆到桌上。
  • TidyHouse:把散乱物体放回该放的地方。
  • PrepareGroceries:把购物袋里的东西归位到冰箱/橱柜。

每个任务都要求 agent 完成一连串"导航 + 开柜 + 抓取 + 放置"的子动作,整体长度可达分钟级。

输出:一套可复现、可打分的长任务评测集。

重排任务(Rearrangement):让 agent 把环境里的物体从初始状态搬到目标状态,是具身 AI 社区在 2020 前后逐渐共识的"任务原型"。

4. 两类策略基线

输入:HAB 任务。

处理:一种像新手厨师从切菜到上桌全靠肌肉记忆死磕,一种像老厨师把活拆成"洗/切/炒/摆盘"分别练熟再串起来。论文跑了两种 agent:

  • 端到端 RL:视觉直接到电机指令,一个网络包办到底。
  • 分层(hierarchical):先把长任务拆成子技能(pick / place / nav / open),每个子技能单独训练,再用一个高层策略串起来。

输出:两条基线的成绩对比——分层显著更高,揭示了端到端长任务的难度。

分层策略(hierarchical policy):高层选"技能"(如 pick),低层执行原子动作(电机指令)。在长任务中常比端到端 RL 稳定。

ASCII 总览:

Replica 扫描 ──►[人工做成铰接资产]──► ReplicaCAD(门能开/抽屉能拉)
                                            │
                                            ▼
                         [Habitat-Sim 2.0: Bullet物理 + 高速渲染]
                                            │ 每秒数千步
                                            ▼
              [HAB 长任务: SetTable / TidyHouse / PrepareGroceries]
                                            │
                     ┌──────────────────────┴──────────────────────┐
              端到端 RL(弱)                                   分层技能组合(强)

5. 为什么"快"才是这篇论文真正的硬骨头

很多人以为造仿真器的难点是画得逼真,其实对训练机器人来说,跑得快才是命门。这一节讲清楚 Habitat 2.0 为此做了什么。

输入:一个残酷的算力账——强化学习动辄要跑上亿甚至几十亿个动作步,agent 才能从摸索中学会长任务。

处理:假设仿真器每秒只能跑 100 步,那跑十亿步要几个月,没有课题组耗得起。Habitat 2.0 把"每秒仿真步数(SPS)"当成第一优先级去死磕:把物理计算(Bullet 引擎)和画面渲染解耦,各自并行;用批渲染一次处理很多环境;尽量避免数据在 CPU 和 GPU 之间来回搬(这种拷贝是隐形的性能杀手);把整个环境向量化,让一块 GPU 同时跑成百上千个并行副本。这些工程优化叠起来,把 SPS 顶到每秒数千步的量级(具体数值以原文为准),让"亿级步训练"从"几个月"压缩到"可接受的时间"。

输出:一个把训练时间从"用不起"变成"用得起"的高吞吐仿真器——这才是它被广泛采用的根本原因。

打个比方:别人的仿真器像正常速度放录像,Habitat 2.0 像开了千倍速快进,同样的墙上时钟,它能让 agent 多活几千辈子去试错。

6. "抽象抓取":为了保住速度做的关键妥协

输入:一个矛盾——真实的抓取涉及手指和物体之间复杂的接触力学,算起来极慢,会把 SPS 拖垮。

处理:Habitat 2.0 用了一个很聪明的简化叫"抽象抓取(abstract grasp)":当机械臂末端足够靠近某个可抓物体时,不去精细模拟每根手指的接触力,而是直接把物体"吸附"到手上(运动学式地绑定),放置时再解绑。这等于跳过了物理上最烧算力的那一环,却保留了"抓起—搬运—放下"这个任务层面的完整语义。这么做当然牺牲了抓取的真实感(现实里抓不稳会滑落,这里不会),但换来了让整套长任务训练仍能高速跑的可能。这是一个非常典型的"为了系统目标(快 + 能训长任务)而在保真度上做取舍"的工程决策。

输出:一个既能做操作任务、又不至于被抓取物理拖慢的折中方案。

所以这一节是想说:速度是硬约束,抽象抓取是为守住速度而对物理保真度做的清醒妥协。

7. 为什么分层策略把端到端打得很惨

输入:SetTable 这类要跑好几分钟、串起导航+开柜+抓取+放置的长任务。

处理:端到端 RL 想用一个网络从像素直接学到电机指令、一气呵成完成整条长任务,听起来优雅,但会撞上两堵墙。第一堵是信用分配:任务几分钟才成功一次,奖励极稀疏,模型很难搞清楚成千上万步里到底哪一步做对了。第二堵是误差累积:长序列里任何一个子环节出小错,后面全崩,端到端很难从这种复合失败里学出来。分层策略把长任务拆成 pick / place / nav / open 这些子技能,每个子技能短、目标明确、单独训练容易收敛,再用一个高层策略像搭积木一样按顺序调用它们。于是"难的长任务"被降解成"若干个好学的短任务 + 一个简单的调度",成功率自然高出一大截。

输出:一个清晰的结论——当前长时序具身任务,模块化分层显著优于纯端到端,这也给后续研究指了方向。

8. 为什么先在仿真里做,以及它的定位

输入:一个"为什么不直接上真机"的疑问。

处理:真机采数据慢、贵、还危险,一个长任务失败可能摔坏机械臂。Habitat 2.0 的定位是"先在超快仿真里把策略和方法论磨出来",用海量廉价的仿真试错替代昂贵的真机试错,等方法成熟再考虑迁移。它提供的不是一个具体策略,而是一整套可复现的基础设施:可交互资产(ReplicaCAD)、高速仿真器(Habitat-Sim 2.0)、标准长任务与打分(HAB)。这让整个社区能在同一把尺子下比较方法,加速集体进展——这正是"平台型论文"的价值所在。

输出:一个让具身操作研究得以规模化、可复现、可横向比较的公共训练场。

所以这一节是想说:把资产做成可交互、把仿真做到超快(并用抽象抓取守住速度)、把任务做成长流程,再用端到端和分层两条基线揭示"长任务需要模块化"这一核心难度,最终交付的是一整套可复现的研究基础设施。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Habitat 2.0 · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Habitat 2.0 — 方法示意:核心 pipeline
Plate Nº IIHabitat 2.0 — 方法示意:核心 pipeline

关键数字(What works)

Habitat 2.0 是 NeurIPS 2021 论文,SPS 吞吐、各任务成功率等精确数值需以原文为准,本笔记不编造。下表说明它"测什么、结论方向"。

关注点 说明 具体数值
仿真吞吐 SPS 对比 1.0 和其它仿真器 量级每秒数千步,具体需读原文
端到端 RL 成功率 HAB 长任务 很低,几乎做不动长任务
分层策略成功率 HAB 长任务 明显高于端到端,但仍不高
泛化 新 layout 下的表现 有一定泛化

提醒:任何 SPS 和成功率数字请以 arXiv 原文(2106.14405)为准。

所以这一节是想说:核心结论是"仿真够快 + 端到端做不动长任务 + 分层更好但仍留大空间",具体数字回原文。


实验结果说明了什么

  • 仿真吞吐达标:Habitat-Sim 2.0 的 SPS 足以支撑亿级 step 的 RL 训练,让"天级别训练"在单 GPU 上可行——这是整套系统的地基。
  • 端到端 RL 撑不起长任务:在 SetTable 等分钟级任务上,端到端 RL 几乎做不动,说明"长时序 + 稀疏奖励 + 物理交互"叠加起来极难。
  • 分层是当时的救命稻草:把长任务拆成技能再组合,成功率显著提升——这个"端到端 vs 分层"的差距,塑造了之后两三年整个具身 AI 社区的方法论方向。
  • 可交互资产是前提:没有 ReplicaCAD 的铰接物体,"开柜取物"这类任务根本无从谈起。

所以这一节是想说:实验既证明了系统可用,也诚实暴露了长任务的巨大难度,给后续研究留下明确的靶子。


你应该懂的几个新词

Embodied AI(具身 AI):有"身体"、在世界里感知与行动的 AI,要处理感知-动作循环。

Rearrangement(重排任务):把物体从初始状态搬到目标状态的任务原型。

SPS(steps per second):仿真器每秒模拟的环境步数,决定 RL 训练快慢。

Articulated object(铰接物体):带关节可动的物体,如门、抽屉。

Hierarchical policy(分层策略):高层选技能、低层执行动作的两层结构。

Skill / sub-policy(技能/子策略):解决一个子任务的低层小策略,如 pick 只管抓。

所以这一节是想说:抓住"具身 AI、重排、SPS、铰接物体、分层策略"这几个词,就抓住了 Habitat 2.0。


它有什么搞不定的

  • 长任务成功率仍低:即便分层,分钟级家务任务的成功率也不高,离"真能替你做家务"很远。
  • 物理仍是近似:Bullet 物理引擎为速度做了取舍,接触/柔性物体等复杂物理不如专用物理仿真精确。
  • 资产制作昂贵:ReplicaCAD 靠人工把扫描件重做成铰接模型,规模受限于人力,场景多样性有天花板。
  • sim-to-real 差距未解:论文聚焦仿真内训练与评测,真机迁移仍是开放问题。
  • 单机器人、无人类:场景里只有机器人,没有会动的人——这正是 Habitat 3.0 要补的。

所以这一节是想说:Habitat 2.0 打好了地基,但长任务难、物理近似、资产贵、无人协作、sim-to-real 未解仍是遗留问题。


它和别的几篇是什么关系

  • 承接 Habitat 1.0(同实验室):1.0 解决"跑得快 + 视觉真",2.0 加上"能动手 + 长任务"。
  • 平行/对手:iGibson 2.0、ManiSkill、SAPIEN——同期都做"物理交互家居仿真器",各有取舍(视觉 vs 物理 vs 速度)。
  • 下游催生Habitat 3.0(人机协作)、HomeRobot、OVMM 这些更复杂的任务都直接基于 Habitat 2.0 的栈。
  • 和 RoboCasa / SimplerEnv 的关系:后两者更偏"机械臂任务集合 + 真机对齐",Habitat 2.0 偏"全身移动 + 长流程家居"。
  • BEHAVIOR-1K:BEHAVIOR 追求任务多样性(1000 个任务),Habitat 2.0 更追求训练吞吐和 RL 友好度。

所以这一节是想说:Habitat 2.0 是 Habitat 三部曲的第二章,也是家居具身仿真"从导航走向操作"的标志。


和本导读的关系

  • 主线章节:Ch17 Sim-to-Real。Habitat 2.0 是"高速仿真训练"这条线的核心平台。
  • 强化学习:Ch16 强化学习基础。HAB 上的端到端 vs 分层对比,是理解长任务 RL 难点的好案例。
  • 数据与任务:Ch21 数据集全景。HAB 是家居长任务评测的重要 benchmark。

所以这一节是想说:Habitat 2.0 落在 Ch17(仿真)、Ch16(RL)、Ch21(任务集)三章的交叉处。


思考题

Q1:为什么 Habitat 2.0 如此强调 SPS(仿真速度)?慢一点不行吗?

提示

RL 要跑亿级动作步,SPS 直接决定训练要几小时还是几周,慢会让研究成本高到普通实验室做不起。

Q2:为什么端到端 RL 在 SetTable 这种长任务上几乎做不动?

提示

长时序 + 稀疏奖励 + 物理交互叠加,探索空间巨大,一个网络很难从零学会"导航+开柜+抓+放"的完整链条。

Q3:分层策略为什么更容易成功?它的代价是什么?

提示

把长任务拆成可单独训练的技能降低了难度;代价是要设计技能边界、训多个子策略、还要一个高层调度,工程更复杂且技能衔接可能出错。

Q4:ReplicaCAD 的"铰接资产"为什么是长任务的前提?

提示

没有可开的门/可拉的抽屉,"开柜取物"这类交互无从发生,任务只能退化成纯导航。

Q5:Habitat 2.0 为速度牺牲了部分物理精度,这在什么任务上会成问题?

提示

需要精细接触/力控或柔性物体(叠衣、倒液体)的任务,近似物理会失真,迁移真机更难。

Q6:Habitat 2.0 场景里只有机器人,这个设定有什么局限?由谁来补?

提示

真实家里有人,机器人要躲人、配合人。这个"人在场"的局限由 Habitat 3.0 引入可控人形 avatar 来补。

所以这一节是想说:想清楚这些题,你就理解了"为何求快""长任务为何难""分层的取舍""铰接资产的必要"这几件核心事。


一些好奇心问答(FAQ)

Q:Habitat 2.0 是开源的吗?

是,Habitat-Sim 和 Habitat-Lab 都开源,ReplicaCAD 资产也公开,是社区常用平台。

Q:它能跑真机吗?

它是仿真平台,训出的策略要迁移真机仍需处理 sim-to-real。论文本身聚焦仿真内训练与评测。

Q:HAB 任务现在还有人用吗?

有,作为家居长任务的经典 benchmark,后续很多工作在它或其升级版上评测。

Q:为什么用 Bullet 而不是 MuJoCo?

Bullet 在 GPU 批量仿真和渲染集成上更契合 Habitat 的高吞吐目标;MuJoCo 精度高但当时并行吞吐不占优。

Q:分层里的技能是怎么来的?

每个技能(pick/place/nav/open)单独用 RL 或模仿训练,再由高层策略按任务顺序调用。

所以这一节是想说:Habitat 2.0 是开源、可复现的家居仿真地基,理解它就理解了后续家居具身研究的起点。


如果你想再深入

  1. 先读 Habitat 1.0 —— 搞清"为什么仿真器要追 SPS"和渲染管线,才感受到 2.0 的工程贡献。
  2. 跳到 HAB 任务定义 —— 看 SetTable/TidyHouse/PrepareGroceries 具体要 agent 做什么。
  3. 回看 ReplicaCAD 资产 —— 理解铰接物体在数据层长什么样(关节、自由度、碰撞体)。
  4. 看 baseline 结果 —— 重点是"端到端 vs 分层"的差距,它塑造了后续方法论。
  5. 续读 Habitat 3.0 —— 看"加了会动的人"之后任务如何升级。

所以这一节是想说:先补 Habitat 1.0 的仿真基础,重点读 HAB 任务和 baseline 差距,再顺到 Habitat 3.0。


原文信息

@inproceedings{szot2021habitat2,
  title  = {Habitat 2.0: Training Home Assistants to Rearrange their Habitat},
  author = {Szot, Andrew and others},
  booktitle = {Advances in Neural Information Processing Systems (NeurIPS)},
  year   = {2021},
  note   = {arXiv:2106.14405}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_habitat_2_2026,
  title       = {(readable note) Habitat 2.0},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2021 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/habitat-2/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?