Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 103

ProcTHOR

13 min read · 4435 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过具身 AI/仿真"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么手工搭几十个房间不够、而用程序自动生成上万个不重样的房子,能让机器人学会在没见过的家里导航和整理"。

一句话讲什么(TL;DR)

用一套程序自动"造房子":想要多少个不重样的、可交互的、带家具的虚拟房子都能生成。用它造出的 1 万个房子预训练一个简单的神经网络机器人,只靠 RGB 摄像头、不建地图、不用人给任务监督,就在 6 个具身 AI 基准(导航、重排、机械臂操作)上刷到当时最强,甚至不微调直接零样本也很强。

所以这一节是想说:这篇论文用"程序化生成"批量造训练环境,让具身智能体像被海量数据喂大的视觉/语言模型一样变强。


这是个什么场景

计算机视觉之所以爆发,靠的是 ImageNet 这种海量图片;自然语言之所以爆发,靠的是海量文本。那具身 AI(能在环境里移动、交互的智能体,如家务机器人)为什么迟迟没爆发?一个关键卡点是:训练环境太少

以前研究者要靠人手一间一间地搭虚拟房间:设计布局、摆家具、调材质,几十上百个就到头了。机器人在这么少、这么像的房子里练,很容易"背下"这几个房子,一换到没见过的家就抓瞎——就像只在几张固定图片上训练的视觉模型,泛化很差。

理想情况是:像给视觉模型喂海量图片一样,给机器人喂海量不重样的房子。 但人手搭不出上万个。ProcTHOR 要解决的正是这个:用程序自动生成任意多、足够多样、可交互、还跑得快的房子,把"环境稀缺"这个瓶颈打掉。

所以这一节是想说:具身 AI 缺的是"海量多样训练环境",ProcTHOR 用程序化生成来批量供应。


ProcTHOR — 场景示意:这论文要解决的现实问题
Plate Nº IProcTHOR — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 手工搭建环境(如原版 AI2-THOR、RoboTHOR、iGibson 的场景):质量高、可交互,但数量少(几十到几百),机器人容易过拟合到这几个场景,泛化差。
  • 扫描真实房屋(如 Matterport3D、Gibson):真实感强,但不可交互(多是静态网格,开不了抽屉、搬不动东西),且数量仍有限、采集贵。
  • 游戏/随机布局环境:有的能大量生成,但要么不真实、要么不可交互、要么和下游任务对不上。
  • 共同短板:要么"多但不可交互/不真实",要么"可交互但太少"。缺一个能大量生成 + 可交互 + 多样 + 跑得快的环境工厂。

所以这一节是想说:以前是"手工搭得少"或"扫描的不可交互",缺一个能海量生成可交互多样房子的工厂。


这篇论文的关键想法

三个关键点:

第一,程序化生成(procedural generation)房子。 写一套规则和算法,让计算机自动生成房子:先定房间布局(几室几厅、怎么连通),再摆墙、门、窗,再往每个房间里按语义摆合理的家具(厨房放灶台冰箱、卧室放床),再随机化材质、光照、物体摆放。每次生成都不一样,想要多少个就生成多少个。且这些房子建在 AI2-THOR 之上,天生可交互(能开抽屉、拿东西、坐下)。

第二,造出 ProcTHOR-10K:1 万个房子的数据集。 作为示范,作者生成了 1 万个不重样的房子,用来预训练智能体。

第三,证明"环境规模"就是硬道理。 用一个简单的神经网络智能体,只靠 RGB、不建显式地图、不用人给任务监督,在 ProcTHOR-10K 上预训练,就在 6 个具身 AI 基准上刷到当时最强,还展示了强大的零样本能力(在 ProcTHOR 上预训练后不在下游任务上微调,直接测就很强)。这传达的信息和 ImageNet 一样:数据/环境的规模和多样性,本身就能带来质变。

所以这一节是想说:核心是"程序化批量生成可交互多样房子 + 用规模证明它能带来具身 AI 的泛化质变"。


ProcTHOR — 方法示意:核心 pipeline
Plate Nº IIProcTHOR — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:房子生成流程、多样性与可交互性、数据集与智能体、评测方式。逐块按"输入 → 处理 → 输出"讲。

1. 程序化房子生成流程

输入。 一些高层参数(房间数量、类型分布等)和一个资产库(家具、材质、物体的 3D 模型)。

处理(分步生成)。

  1. 布局生成:先决定房子有几个房间、各是什么类型(厨房/卧室/客厅/卫生间)、怎么连通——像自动画户型图。
  2. 结构搭建:按户型图放墙、门、窗,保证可通行、合乎常识。
  3. 家具摆放:按房间语义往里摆合适的家具(厨房摆灶台/冰箱/橱柜,卧室摆床/衣柜),并保证摆放物理合理(不重叠、能通过)。
  4. 小物件与随机化:在桌面、柜子里摆小物体,随机化材质、颜色、光照、物体位置,制造多样性。

程序化生成(procedural generation):用规则和算法自动造内容,而不是人手一件件做。游戏里用它造无限地图,这里用它造无限房子。

输出。 一个完整、布局合理、摆满家具、且每次都不一样的可交互虚拟房子。

所以这一节是想说:生成分"布局→结构→家具→小物件随机化"四步,自动产出合理又多样的房子。

2. 多样性、可交互性与性能

输入。 上一步的生成流程。

处理。 三个刻意保证的属性:

  • 多样性(diverse):布局、家具、材质、光照都随机,房子彼此差异大,逼智能体学通用规律而非死记。
  • 可交互(interactive):建在 AI2-THOR 上,物体能被打开、拾取、移动——支持导航之外的交互和操作任务。
  • 高性能(performant):仿真跑得快,能支撑大规模强化学习训练(要训得动上万房子,仿真必须高效)。
  • 可定制(customizable):可以按需控制生成的分布(多生成厨房、多放某类物体等)。

输出。 一个既多样、又可交互、还跑得快、可定制的"环境工厂"。

所以这一节是想说:ProcTHOR 同时保证多样、可交互、高性能、可定制,这四点缺一都撑不起大规模训练。

3. ProcTHOR-10K 数据集与简单智能体

输入。 生成流程 + 任务定义(导航、重排、操作等)。

处理。 生成 1 万个房子(ProcTHOR-10K)作为示范数据集。在上面用强化学习预训练一个结构简单的神经网络智能体——关键限制条件:只用 RGB 图像(不用深度/GPS 等特权信息)、不建显式地图不用人类的任务监督。这三条限制让结果更有说服力:不是靠复杂工程堆出来的,而是靠环境规模。

输出。 一个在海量多样房子里被"喂大"的通用具身智能体。

所以这一节是想说:用 1 万房子 + 简单 RGB 智能体,靠规模而非工程技巧来证明观点。

4. 评测:预训练 + 迁移到 6 个基准

输入。 预训练好的智能体 + 6 个下游具身 AI 基准。

处理。 把在 ProcTHOR 上预训练的智能体迁移到 6 个基准上(导航、重排、机械臂操作),包括 Habitat 2022、AI2-THOR Rearrangement 2022、RoboTHOR 等。两种测法:(a) 预训练后再在下游数据上微调;(b) 零样本——预训练后不微调直接测。

输出。 在多个基准上刷到当时最强(SOTA),零样本也常常超过用了下游训练数据的旧方法。

下面用 ASCII 图把整体思路画出来:

   资产库 + 高层参数
        │  程序化生成(布局→结构→家具→随机化)
        ▼
   ∞ 个不重样、可交互的房子  ──取1万个──►  ProcTHOR-10K
        │
        ▼  强化学习预训练(仅RGB, 不建图, 无人类任务监督)
   简单神经网络智能体
        │  迁移
        ▼
   6 个具身AI基准(导航/重排/操作) ── SOTA + 强零样本

再用一张 ASCII 图对比"手工少环境 vs 程序化海量环境":

   手工:   [房1][房2][房3] ... 几十个   → 智能体易过拟合, 换新家就废
   ProcTHOR: [房1][房2]...[房10000]... 无限 → 智能体学通用规律, 泛化强

所以这一整节是想说:ProcTHOR = 四步生成流程 + 多样可交互高性能 + 1 万房子预训练简单智能体 + 迁移到 6 基准,用规模换泛化。


关键数字(What works)

数字来自论文摘要(arXiv:2206.06994);各基准的具体分数属正文,标注"需读原文"。

项目 数值/结论 说明
示范数据集 ProcTHOR-10K(1 万房子) 可生成任意多
底座 AI2-THOR 天生可交互
智能体输入 仅 RGB 无深度/GPS 特权
工程限制 不建显式地图、无人类任务监督 突出"靠规模"
覆盖任务 导航 / 重排 / 机械臂操作 多类具身任务
达到 SOTA 的基准数 6 个 含 Habitat 2022、RoboTHOR 等
零样本 强,常超旧的有监督方法 预训练即迁移

三个要点:第一,**"1 万房子、可无限生成"**把具身 AI 的环境供给从"稀缺"变"充足",这是范式级的改变;第二,仅 RGB + 不建图 + 无任务监督还能 SOTA,强有力地说明"是环境规模在起作用",而非复杂工程;第三,零样本超过有监督旧方法,呼应了"大规模预训练带来泛化"的大趋势(这也是它拿 NeurIPS 杰出论文的原因)。

所以这一节是想说:可无限生成的多样环境 + 极简智能体也能 SOTA + 强零样本,共同证明"环境规模就是硬道理"。


实验结果说明了什么

论文实验主要证明:

  • 环境规模带来泛化:在 1 万房子上预训练的简单智能体,泛化到 6 个下游基准都很强,说明"多样环境"就像"海量数据"一样能提升泛化。
  • 不靠工程技巧也行:仅 RGB、不建图、无人类任务监督的极简设置也能 SOTA,反过来证明贡献来自环境本身。
  • 零样本迁移强:预训练后不微调直接测,常超过用了下游数据训练的旧方法——具身 AI 也进入了"预训练 + 迁移"的范式。
  • 可交互支撑多任务:不仅导航,还能做重排和机械臂操作,说明程序化生成的房子足够真实可交互。

所以这一节是想说:实验把"具身 AI 也能靠大规模预训练泛化"这件事第一次强有力地证明了。


你应该懂的几个新词

  • 具身 AI(Embodied AI):能在环境里移动、感知、交互的智能体(如家务机器人)。
  • 程序化生成(procedural generation):用算法自动造内容(房子、地图),而非人手做。
  • AI2-THOR:一个可交互的室内仿真平台,ProcTHOR 建在它之上。
  • 导航 / 重排(rearrangement)/ 操作(manipulation):三类典型具身任务——走到目标、把物体归位、用机械臂操作。
  • 零样本(zero-shot)迁移:预训练后不在下游任务上再训练,直接测试。
  • RGB-only / 不建图:只用彩色摄像头、不构建显式地图,是更贴近真实且更难的设置。
  • 强化学习(RL):让智能体通过试错 + 奖励学习行为。
  • 过拟合(overfitting):模型死记训练样本,换新样本就失灵。

所以这一节是想说:程序化生成、具身任务三分类、零样本迁移是理解本篇的关键词。


它有什么搞不定的

  • 仍是仿真,有 sim-to-real gap:程序化房子再多再真,物理和视觉与真实仍有差距,上真机需要额外工作。
  • 生成的"合理性"受规则限制:程序化布局虽多样,但受生成规则约束,可能出现不够自然或不符合真实居家习惯的布局。
  • 资产库是天花板:家具/物体种类受资产库限制,覆盖不到的物体不会出现。
  • 多样 ≠ 覆盖长尾:随机生成的分布未必覆盖真实世界的罕见情形(奇怪户型、极端杂乱)。
  • 任务复杂度有限:主要是导航/重排/基础操作,离"做一顿饭"这种长程复杂家务还远。

所以这一节是想说:它解决了"环境数量",但 sim-to-real、生成合理性、资产天花板、长尾覆盖仍是限制。


它和别的几篇是什么关系

  • 底座:AI2-THOR / RoboTHOR(可交互仿真)是它的地基,ProcTHOR 给它们加了"无限生成"。
  • 对照:Habitat / Matterport3D / Gibson(扫描真实房屋)真实但不可交互;ProcTHOR 用可交互 + 可生成互补。
  • 同类思想:程序化生成在游戏和 RL(如 ProcGen)里早有先例,ProcTHOR 把它带进具身 AI 环境。
  • 后续:BEHAVIOR-1K、RoboCasa 等在场景丰富度、任务复杂度上进一步推进;ProcTHOR 是"大规模具身环境"这条线的里程碑。

所以这一节是想说:ProcTHOR 站在 AI2-THOR 上,用程序化生成把具身环境规模化,是这条线的关键节点。


和本导读的关系

本笔记对应导读 Ch17: Sim-to-Real。Ch17 讲的是"在仿真里训练、迁移到真实"的整条路线,其中环境规模与多样性是关键前提。ProcTHOR 正面回答了"训练环境从哪来"这个问题——用程序化生成无限供应多样可交互环境。读完本篇再看同章的 habitat(扫描真实房屋做导航)、sapien/maniskill(关节操作)、isaac-gym(GPU 并行),能理解"具身仿真环境"的不同供给方式(扫描 vs 生成 vs 引擎)。

所以这一节是想说:把 ProcTHOR 放进 Ch17,它代表"用程序化生成解决具身训练环境稀缺"的关键答案。


思考题

Q1:为什么"手工搭几十个房间"会让机器人过拟合?程序化生成怎么破解?

提示

太少太像,机器人会背下这几个房子。海量不重样的房子逼它学"厨房长什么样"的通用规律。想想 ImageNet 的作用。

Q2:为什么作者刻意用"仅 RGB、不建图、无任务监督"的极简智能体?

提示

要证明性能来自"环境规模"而非复杂工程。限制越多、还能 SOTA,越说明是环境的功劳。

Q3:程序化生成的房子和扫描真实房屋各有什么优劣?

提示

生成的多、可交互、可定制但可能不够真实;扫描的真实但不可交互、少、贵。想想 ProcTHOR 选可交互的理由。

Q4:零样本超过"用了下游数据训练"的旧方法,这为什么令人惊讶?

提示

零样本连下游数据都没用过就赢了用过的,说明大规模预训练学到的通用能力极强。呼应视觉/语言的预训练范式。

Q5:生成 1 万个房子就够了吗?再生成 100 万个会更强吗?极限在哪?

提示

多样性有边际递减;受生成规则和资产库限制,超过一定量后新房子提供的新信息减少。想想数据规模的收益曲线。

Q6:程序化生成的"合理性"由规则决定,这可能引入什么系统性偏差?

提示

规则外的布局永远不会出现,模型学到的是"规则内的世界"。真实世界的怪异情形可能没覆盖。

Q7:ProcTHOR 解决了环境数量,要让机器人真的会做家务还缺什么?

提示

sim-to-real、长程复杂任务、更真实的物理与物体多样性、语言指令理解等。想想从"能导航"到"会做饭"的差距。


一些好奇心问答(FAQ)

Q:ProcTHOR 生成的房子真实吗?

布局和家具摆放力求合乎常识、可交互,但受生成规则和资产库限制,未必达到扫描真实房屋的逼真度。它的优势在"多、可交互、可控"。

Q:为什么它拿了 NeurIPS 杰出论文?

因为它有力地证明了"具身 AI 也能像视觉/语言一样靠大规模预训练获得泛化",并提供了可无限生成的环境工具,影响深远。

Q:我能自己生成房子来训练吗?

可以,ProcTHOR 的生成框架和 ProcTHOR-10K 都是公开的,可基于它生成自定义环境。

Q:它能直接让真机器人会导航吗?

不能直接。仿真训练是基础,迁移到真机还需处理 sim-to-real 差距(如域随机化、真机微调)。

所以这一节是想说:它是"具身环境工厂",主打规模和可交互,真机落地仍需迁移工作。


如果你想再深入

  1. 底座:AI2-THOR / RoboTHOR — 理解可交互仿真平台。
  2. 对照:Habitat / Matterport3D — 理解"扫描真实房屋"这条路线。
  3. 思想来源:ProcGen(程序化生成 RL 基准) — 理解程序化生成在 RL 里的先例。
  4. 后续:BEHAVIOR-1K / RoboCasa — 看场景/任务复杂度如何进一步提升。
  5. 范式:视觉/语言的大规模预训练 — 理解"规模带来泛化"的大背景。

所以这一节是想说:把 AI2-THOR → ProcTHOR → BEHAVIOR-1K/RoboCasa 串起来,能看清具身环境从手工到生成的演进。


原文信息

  • 标题:ProcTHOR: Large-Scale Embodied AI Using Procedural Generation
  • 作者:Matt Deitke, Eli VanderBilt, Alvaro Herrasti, Luca Weihs, Jordi Salvador, Kiana Ehsani, Winson Han, Eric Kolve, Ali Farhadi, Aniruddha Kembhavi, Roozbeh Mottaghi
  • 会议:NeurIPS 2022(Outstanding Paper)
  • arXiv:https://arxiv.org/abs/2206.06994
@inproceedings{deitke2022procthor,
  title     = {ProcTHOR: Large-Scale Embodied AI Using Procedural Generation},
  author    = {Deitke, Matt and VanderBilt, Eli and Herrasti, Alvaro and Weihs, Luca and Salvador, Jordi and Ehsani, Kiana and Han, Winson and Kolve, Eric and Farhadi, Ali and Kembhavi, Aniruddha and Mottaghi, Roozbeh},
  booktitle = {Advances in Neural Information Processing Systems (NeurIPS)},
  year      = {2022},
  url       = {https://arxiv.org/abs/2206.06994}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_procthor_2026,
  title       = {(readable note) ProcTHOR},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/procthor/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?