Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 106

Habitat 3.0

15 min read · 5236 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

在虚拟的家里加一个会走会动的"假人",让机器人练习扫地搬东西时,得学会一边干活一边躲人、配合人。

所以这一节是想说:Habitat 3.0 给虚拟家务训练场加了"会动的人",把问题从"机器人独居"升级成"人机共处"。


这是个什么场景

想象你周末在厨房做饭,室友进来想顺手帮忙拿盘子。两个人不用说话也有默契:你拉冰箱门她会自动后退半步;她端着热汤穿过过道,你会把锅铲收一下让出空间;最后你们还能分工——她切菜、你炒。这种"两个人挤在同一屋子里既不撞、还能配合"的能力,人类觉得是常识,机器人却完全不会。

之前主流的家用机器人仿真器(给机器人练手的"虚拟样板间")几乎都是"空屋子里就一台机器人",它可以把整个家折腾得鸡飞狗跳也不用顾忌别人——更像独居练拳,不像跟家人住一起。Habitat 3.0 做的事很简单:在虚拟屋子里加一个"假人",这个假人会自己走、会自己拿东西、会挡机器人的路,也能跟机器人一起搬桌子。机器人从此得学一件新事——屋里还有别人

人机协作(Human-Robot Collaboration,HRC):机器人和人在同一空间里既不冲突、又能配合完成任务。这是家用机器人真正落地绕不开的能力。

所以这一节是想说:场景是"人和机器人同住一屋做家务",Habitat 3.0 要在仿真里训练这种共处能力。


Habitat 3.0 — 场景示意:这论文要解决的现实问题
Plate Nº IHabitat 3.0 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Habitat 1.0/2.0:Meta 自家前作。1 主打导航,2 加了可交互家具(开抽屉、拿东西),但场景里只有机器人。
  • AI2-THOR / ManipulaTHOR / iGibson:同期家居仿真平台,物理交互各有侧重,人形 agent 大多缺席或只是装饰摆件,不可被策略控制。
  • 多智能体 RL(MARL)研究:在网格世界、星际争霸、足球这类抽象环境里研究协作,但缺"真实物理 + 真实家居布局 + 真人体动作"。
  • VR 遥操作数据:用 VR 让真人遥控仿真里的虚拟人,能拿到真实人类行为,但成本高、规模有限。
  • 结果:之前要研究人机协作只能在受限的桌面 setup 或动捕实验室里做,规模化训练很难。

多智能体强化学习(Multi-Agent RL,MARL):多个 agent 在同一环境里同时学习,要处理彼此的互动、竞争或协作。

所以这一节是想说:以前要么没有可控的人、要么协作研究停留在抽象环境,缺一个"真实家居 + 可控人形"的舞台。


这篇论文的新想法

像搭一个"机器人 + 真人混住的虚拟样板间":把可控的假人、机器人、家居环境、高速渲染四样东西拼进同一个仿真器。这个假人很灵活——可以被脚本驱动(按剧本做家务)、可以被强化学习训练(自己学行为)、还可以被真人戴 VR 头盔接管(直接示范"人类会怎么干")。机器人就和它一起住在屋里。

更关键的是:作者顺手把"协作"做成了可以打分的考试题,给出两个标准任务:

  • Social Navigation(社交导航):机器人跟着主人走但不挡路,像跟着妈妈逛超市的小孩。
  • Social Rearrangement(社交重排):机器人和人一起整理屋子,像两口子一起收拾客厅。

这样别的研究者就能在同一套题目上比谁的机器人更会"跟人共处"。

所以这一节是想说:新想法 = 把"可控人形 + 机器人 + 家居 + 高速仿真"合到一起,并配两个可打分的协作 benchmark。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 人形 avatar 的实现

输入:一个需要"会动的虚拟人"的需求。

处理:你玩过 3D 动画里的"骨架小人"吗?作者用 SMPL-X 这种"标准人体模板"(学界通用的、有骨头有关节、能调胖瘦高矮的虚拟人模型)来捏出假人,让它会走路、转身、伸手、拿东西放东西。

输出:一个可被脚本 / RL / VR 三种方式驱动的人形 avatar。

等等,先慢一拍——「motion primitives(运动基元)」是什么?想象你不是一帧帧画动作,而是攒了一个"动作积木盒":里面有"向前走一步""伸右手""蹲下"这些预制片段,要做家务时把积木拼起来就行。这样既快,看起来又自然。低层用积木做动作,高层("现在该去拿什么")由策略或脚本决定。

SMPL-X:一个参数化的三维人体模型,能生成不同体型、不同姿态的虚拟人,是计算机图形/视觉里的通用人体模板。

2. 高速仿真

输入:屋子里两个 agent(机器人 + 人形)的动作。

处理:Habitat 系列一直的招牌是"快",单张 GPU 一秒能渲染上万帧逼真画面(约是普通游戏帧率的百倍以上,因为机器人要练成千上万次)。3.0 把这速度延伸到"屋里有两个 agent",工程上要处理双方撞不撞、谁挡谁的视线、动作怎么同时推进等问题。

输出:一个支持"多 agent + 高吞吐"的家居仿真环境。具体吞吐数字需读原文。

3. 两个基准任务

输入:HSSD 提供的家居场景 + 任务定义。

处理:像出两道考试题——

  • Social Navigation:机器人要在屋里找到主人并跟着走,但不能挡路。
  • Social Rearrangement:机器人和假人一起把客厅杂物各归各位,既要分工、又不能撞车。

背景房间用 HSSD(Habitat Synthetic Scenes Dataset,Habitat 团队自己做的合成 3D 家居数据集)提供,房型够多够杂。

输出:两套可复现、可打分的协作任务。

HSSD(Habitat Synthetic Scenes Dataset):Habitat 团队的合成 3D 家居场景库,提供大量可交互房型,给协作任务当舞台。

4. baseline 与评测

输入:两个基准任务。

处理:作者拉了几类对照选手——纯端到端 RL(从零学)、heuristic(手写死规则的启发式)、planning-based(先想再做的规划方法)——一起跑这两道题。打分维度包括:任务成功率、用了多久、撞了人几次、有没有打扰到人。

输出:各类方法在协作任务上的成绩,揭示当前水位(不高)。具体数值需读原文。

ASCII 总览:

SMPL-X 人体模板 ──►[motion primitives 动作积木]──► 可控人形avatar
                                    │(脚本/RL/VR 三种驱动)
HSSD 家居场景 ────────────────────┐  │
                                  ▼  ▼
                    [Habitat 3.0 高速多-agent仿真]
                                  │
              ┌───────────────────┴───────────────────┐
        Social Navigation                       Social Rearrangement
        (跟人走不挡路)                          (和人一起整理)
                                  │
                    baseline: RL / heuristic / planning

5. 为什么"屋里多一个人"是质变,不是简单加一个物体

这一节讲清楚 Habitat 3.0 相比前作最本质的跨越在哪。

输入:一个原本只有机器人独自干活的家居仿真。

处理:往屋里加一个人,看似只是多一个可移动物体,实则彻底改变了问题的性质。桌子、椅子是静止的、可预测的;人却是自主的、会动的、有自己意图的——他会突然起身、会挡在门口、会伸手去拿机器人正想拿的那个杯子。机器人不能再把环境当成"死的、只会被自己改变的世界",它必须实时感知另一个 agent、预测他要干嘛、并据此调整自己。这从单 agent 的"我怎么完成任务"升级成多 agent 的"我怎么在一个有他人存在、且他人也在行动的世界里完成任务"。技术上,仿真器必须同时推进两个 agent 的动作、处理他们之间的碰撞、遮挡、视线争夺,还要保证这一切在高吞吐下仍跑得动。

输出:一个真正意义上的"人机共处"仿真——问题从控制论升级成了社会性协作。

打个比方:以前是一个人在空厨房里做饭,现在是两个人挤在同一个厨房里同时做饭,你得时刻留意别撞到对方、别抢同一口锅。

6. 让真人通过 VR 驱动 avatar 为什么重要

输入:一个需要"像真人一样行动"的虚拟人。

处理:avatar 可以用脚本驱动(按写死的规则动)、用 RL 驱动(学出来的策略),但这两种都有个共同风险——它们的行为模式是有限的、可能被机器人"背下来"。Habitat 3.0 特意支持第三种:让真实的人戴 VR 头显亲自操控 avatar。这带来一个关键价值:真人的行为充满脚本造不出来的随机性、犹豫、临时改主意,这才是机器人未来在真实家庭里要面对的。用真人驱动来测试,等于把机器人放到"分布外"的人类行为下考验,检验它是真学会了协作,还是只对某一种假人过拟合。论文也关心"在脚本人上训练的机器人,能不能泛化到 RL 人、真人"这个跨人类策略的泛化问题。

输出:一套能用真实人类行为压力测试机器人社交能力的接口。

所以这一节是想说:VR 接入真人,是为了让评测不至于自欺欺人——机器人得对真实、多变的人类也管用。

7. 为什么评测要新增"别撞人、别打扰人"这些维度

输入:两个协作任务的表现。

处理:在单 agent 时代,评价一个机器人基本就看"任务成没成、用了多久"。但一旦有人在场,只看成功率是危险的——一个横冲直撞、把人挤到墙角、最后确实把活干完的机器人,任务成功率可能很高,却完全不能进真实家庭。所以 Habitat 3.0 把评测扩展到社会维度:撞了人几次、有没有长时间挡住人的路、是否高效分工而不是和人抢同一件事。这些指标共同定义了"好的协作"——不仅要把事办成,还要办得让共处的人舒服、安全。这是把"任务智能"往"社会智能"推进的一步。

输出:一套把"社交礼貌与安全"量化进去的评测标准。

8. "会感知人"对照"当没人"这个实验说明了什么

输入:两种机器人——一种把人纳入观测并主动预测/避让,一种无视人的存在。

处理:这是论文最有说服力的对照。如果"感知人"的机器人在碰撞率、效率上明显优于"当没人"的机器人,就直接证明了主动建模他人是有实打实收益的,而不是可有可无的点缀。它把"社交意识很重要"这句直觉,变成了可测量的性能差距。这个结论给后续研究定了调:做家庭机器人,不能只把人当障碍物绕开,而要把人当成一个需要理解和配合的协作方来建模。

输出:一个"社交感知带来可测收益"的实证依据,为人机协作研究指明方向。这也解释了为什么这套仿真基础设施值得投入——它让"社交智能有没有用"这种原本只能靠直觉争论的问题,第一次能在统一的场景和指标下被量化、被复现、被不同方法公平比较。

所以这一节是想说:用 SMPL-X + 动作积木造可控人形、支持脚本/RL/VR 三种驱动,放进高速多-agent 仿真,配两个协作 benchmark 和"含碰撞/打扰"的社会性指标,再用多类 baseline 评测——核心是把问题从"单机器人干活"推进到"人机共处协作",并证明主动建模他人确有收益。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Habitat 3.0 · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Habitat 3.0 — 方法示意:核心 pipeline
Plate Nº IIHabitat 3.0 — 方法示意:核心 pipeline

关键数字(What works)

Habitat 3.0 是 ICLR 2024 论文,仿真吞吐、成功率、碰撞率等精确数值需以原文为准,本笔记不编造。下表说明它"测什么、结论方向"。

关注点 说明 具体数值
多-agent 仿真吞吐 屋里有机器人+人形时的速度 量级仍高,具体需读原文
Social Nav 成功率 跟人不挡路 见原文
Social Rearrange 成功率 和人一起整理 见原文
感知人 vs 当没人 碰撞次数/效率对比 会感知人的更优
不同 human policy 泛化 脚本/RL/VR 人类 有一定泛化

提醒:任何吞吐与成功率数字请以 arXiv 原文(2310.13724)为准。

所以这一节是想说:核心结论是"多-agent 仿真仍快 + 会感知人比当没人更好 + 协作任务水位不高",具体数字回原文。


实验结果说明了什么

  • 仿真跑得动多-agent 协作训练:把 RL 跑在 Social Nav/Rearrange 上,成功率随训练提升,说明系统撑得起这种规模的协作训练。
  • 建模"屋里有人"是值得的:让机器人当作没人 vs 会感知人,后者碰撞更少、效率更高,证明"人在场"这件事确实需要显式建模。
  • 面对不同"人类风格"仍要泛化:人可以是脚本、learned policy 或 VR 真人接管,机器人要对这些不同风格都能完成任务——这是 sim-to-real 之前的"sim-to-human-variation"考验。
  • 当前水位不高:各 baseline 在协作任务上都还不强,留下大量研究空间,这正是论文的价值——立起一个可攻的靶子。

所以这一节是想说:实验证明协作可训练、感知人有价值、需应对多样人类,同时诚实暴露了当前能力的不足。


你应该懂的几个新词

humanoid avatar(人形化身):仿真器里的虚拟人,有骨骼关节、能走能拿东西。这里既是任务的一部分,也是数据来源。

Social Navigation / Social Rearrangement:本文提出的两类协作 benchmark,前者"跟人走不打扰",后者"和人一起整理"。

HSSD:Habitat 团队的合成 3D 家居场景库。

MARL(多智能体强化学习):多个 agent 同时学习、互相影响的 RL。

kinematic vs dynamic 仿真:人形动作可走 kinematic(位姿插值,快但不真实碰撞)或 dynamic(真物理,慢但真实),要工程取舍。

embodied AI(具身智能):强调 agent 有身体、在世界里行动,区别于纯文本 LLM。

所以这一节是想说:抓住"人形 avatar、两个协作 benchmark、HSSD、MARL"这几个词,就抓住了 Habitat 3.0。


它有什么搞不定的

  • 人形行为仍偏"假":由动作积木/脚本驱动的假人,行为多样性和真实性不如真人,机器人学到的协作可能对真实人类不够鲁棒。
  • 协作成功率不高:当前 baseline 在两个任务上表现都有限,离"真能和人默契配合"很远。
  • kinematic 近似的取舍:为速度用位姿插值时,人形和物体的碰撞不完全真实,可能让机器人学到不安全的贴身行为。
  • 只有一个假人:现实家里可能有多人、宠物、小孩,本文主要设定是单人协作,扩展性有限。
  • sim-to-real 未闭环:加了人只是"离真实近一步",真机面对真人时的安全与舒适仍需专门验证。

所以这一节是想说:Habitat 3.0 把人加进来了,但假人不够真、协作还很弱、物理有近似、真机安全仍未解。


它和别的几篇是什么关系

  • 承接 Habitat 1.0(导航)→ Habitat 2.0(交互)→ Habitat 3.0(协作):Meta Habitat 三部曲的第三章,每代加一个维度。
  • 平行 AI2-THOR / iGibson / RoboCasa:都是家居具身仿真平台,但 Habitat 3 在"人形 avatar 可控 + 协作 benchmark"这个交集上更系统。
  • 下游 sim-to-real:Habitat 训出的策略最终要部署到真机(如 Spot、Stretch),3.0 的"人在场"训练可减少真机面对人时的意外。
  • 和 Open X-Embodiment / RT-X:那一类用真实数据规模化训机器人,Habitat 3 用仿真规模化训协作,两条路互补。
  • 和 LLM-as-policy 的连接:协作任务的"高层调度"未来可能交给 LLM,Habitat 3 提供底层执行环境。

所以这一节是想说:Habitat 3.0 是 Habitat 三部曲的收官,把家居仿真从"机器人独处"推进到"人机共处"。


和本导读的关系

所以这一节是想说:Habitat 3.0 落在 Ch17(仿真)与 Ch16(多智能体 RL)的交叉处。


思考题

Q1:为什么在仿真里加"会动的人"对家用机器人如此重要?

提示

真实家里永远有人,机器人必须学会躲人、让路、配合。空屋子训出的策略面对真人会频繁冲突或打扰。

Q2:人形 avatar 支持脚本/RL/VR 三种驱动,各自有什么用?

提示

脚本保证可控可复现;RL 让人自己学出多样行为;VR 让真人直接示范"人类会怎么做",提供真实行为数据。

Q3:为什么用 motion primitives 而不是逐帧生成人形动作?

提示

预制动作积木拼起来又快又自然,避免逐帧生成的高成本,也便于高层策略在"技能"层做决策。

Q4:"会感知人"的机器人比"当没人"的碰撞更少,这个对比想证明什么?

提示

证明"屋里有人"这件事值得显式建模——把人纳入观测和决策,才能真正减少冲突、提高效率。

Q5:kinematic(位姿插值)人形动作为速度做了取舍,可能带来什么隐患?

提示

碰撞不完全真实,机器人可能学到"贴人很近也没事"的不安全习惯,迁移真机时有风险。

Q6:Habitat 3.0 的"sim-to-human-variation"和传统"sim-to-real"有什么区别?

提示

sim-to-real 关注物理/视觉从仿真到真实的差距;sim-to-human-variation 关注机器人能否泛化到不同风格的人类行为,是协作特有的挑战。

所以这一节是想说:想清楚这些题,你就理解了"为何加人""三种驱动""感知人的价值""kinematic 取舍"这几件核心事。


一些好奇心问答(FAQ)

Q:Habitat 3.0 开源吗?

是,随 Habitat 平台开源,包含人形 avatar、HSSD 场景和两个协作 benchmark。

Q:它能训真人和机器人一起干活吗?

仿真里可以用 VR 让真人接管人形与机器人共处;真机部署仍需额外的安全验证。

Q:一个假人够吗?现实里常常好几个人。

本文主要设定单人协作,多人/宠物/小孩等更复杂场景是未来方向。

Q:为什么用 SMPL-X?

它是通用参数化人体模型,能生成多样体型姿态且被图形/视觉社区广泛支持,便于复用。

Q:这和多智能体游戏 AI(如星际)有何不同?

那些是抽象环境;Habitat 3.0 提供真实家居布局 + 物理 + 视觉,协作研究不再是"玩具环境"。

所以这一节是想说:Habitat 3.0 是开源、系统的人机协作仿真平台,理解它就理解了协作研究的当前起点。


如果你想再深入

  1. 先看官网 demo(habitat.ai) —— 30 秒看明白"人形在屋里走 + 机器人配合"的画面。
  2. 前置:Habitat 2.0 —— 懂可交互家居和 HAB 长任务。
  3. 读两个 benchmark 定义 —— 搞懂 Social Nav/Rearrange 的任务和评测指标。
  4. 回看人形 avatar 实现 —— motion primitives + 高层策略的分层设计。
  5. 扫 baseline 表 —— 知道协作任务当前水位(不高),这是入手研究的缝隙。

所以这一节是想说:先看 demo,补 Habitat 2.0,再重点读两个协作 benchmark 和人形实现。


原文信息

@inproceedings{puig2024habitat3,
  title  = {Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots},
  author = {Puig, Xavier and others},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year   = {2024},
  note   = {arXiv:2310.13724}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_habitat_3_2026,
  title       = {(readable note) Habitat 3.0},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/habitat-3/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?