Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Datasets & Benchmarks · Plate Nº 36

RoboCasa

12 min read · 4285 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过机器人仿真/数据集"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么用 AI 自动造家具和出任务,能搭出上百个逼真厨房、10 万条演示,用来训练能干各种家务的通用机器人"。

一句话讲什么(TL;DR)

一个专门模拟"日常家务"(尤其是厨房)的大规模仿真平台:它用生成式 AI 工具造出 120 个厨房场景和 2500 多个 3D 物体,用大语言模型帮忙设计各种任务,支持移动机械臂和人形机器人,还配了超过 10 万条演示轨迹——目标是给"通用家务机器人"提供一个又大、又多样、又逼真的训练与评测场。

所以这一节是想说:这篇论文用生成式 AI 造出大规模逼真厨房仿真,作为通用机器人的训练/评测基座。


这是个什么场景

我们想要能干家务的机器人:进厨房,打开微波炉、把菜放进去、按开关、倒杯水、擦擦台面。要训练这样的通用机器人,需要海量、多样的练习环境和演示——就像视觉模型需要 ImageNet、语言模型需要海量文本。

但机器人的"练习场"很难搞:真机采数据又贵又慢又危险(见 RH20T 的苦);仿真虽然便宜,但做一个逼真、丰富、可交互的厨房极其费人工——要建模每个橱柜、每种锅碗瓢盆、每台电器,还要设计一大堆任务、写好每个任务的成功判据。以前靠人手做,几十个场景就到头了,物体种类也有限,机器人练得太单一,换个新厨房就抓瞎。

RoboCasa 要问的是:能不能借助最近爆发的生成式 AI(能自动生成 3D 物体、图片、文本),把"造逼真厨房 + 造物体 + 出任务"这些苦活自动化,从而搭出大规模、多样的家务仿真?

所以这一节是想说:目标是用生成式 AI 自动化"造场景/物体/任务",为通用家务机器人提供大规模逼真训练场。


RoboCasa — 场景示意:这论文要解决的现实问题
Plate Nº IRoboCasa — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 手工搭仿真场景(如原版 RoboSuite、部分家庭仿真):质量可控,但造场景和物体极费人工,数量和多样性上不去,机器人易过拟合到少数场景。
  • 程序化生成(如 ProcTHOR):能大量生成房子,但资产多来自固定库、物体种类受限,且更偏导航/重排,不够聚焦"逼真的接触操作 + 厨房家务"。
  • 真机数据集(如 RH20T、DROID):真实但贵、难扩展,且不能像仿真那样任意重置、批量并行、精确评测。
  • 任务设计靠人:每个任务要人定义目标、成功判据,费时且难覆盖多样任务。
  • 共同短板:要么费人工做不大,要么资产/任务不够丰富逼真,缺一个"大规模 + 逼真 + 多任务 + 支持多种机器人"的家务仿真。

所以这一节是想说:以前手工做不大、程序化又不够逼真丰富、真机太贵,缺一个借 AI 自动化造出的大规模家务仿真。


这篇论文的关键想法

RoboCasa 的核心是"让生成式 AI 来干造场景/物体/任务的苦活",四根支柱:

第一,用生成式 AI 造多样资产。 借助文本生成 3D、文本生成图像等工具,造出 2500 多个 3D 物体(各种厨房用品)和 120 个厨房场景,多样性远超手工。

第二,跨形态支持(cross-embodiment)。 平台同时支持移动机械臂(会移动的机械臂机器人)和人形机器人,让同一批任务能用于研究不同身体形态的机器人。

第三,用大语言模型帮忙设计任务。 借 LLM 的常识和创意,生成大量多样、合理的家务任务(开关电器、加热、清洗、摆放等),大大降低"人工出题"的成本。

第四,海量演示数据。 提供超过 10 万条演示轨迹,供模仿学习/策略训练使用。

底层建在 RoboSuite(基于 MuJoCo 物理引擎)之上,保证接触操作的物理质量。合起来:用 AI 自动化把"造练习场"这件苦活规模化,服务通用机器人。

所以这一节是想说:核心是"生成式 AI 造资产 + LLM 出任务 + 跨形态支持 + 10 万演示",四根支柱撑起大规模家务仿真。


RoboCasa — 方法示意:核心 pipeline
Plate Nº IIRoboCasa — 方法示意:核心 pipeline

它分几步做的(方法)

RoboCasa 是一个平台/数据集,它的"方法"就是四根支柱怎么落地。逐块按"输入 → 处理 → 输出"讲。

1. 生成式 AI 造资产:物体与场景

输入。 文本描述(想要什么物体/什么风格的厨房)+ 生成式 AI 工具(文本生成 3D、文本生成图像/纹理等)。

处理。 用这些工具批量生成2500+ 个 3D 物体(锅、碗、杯、食材、电器等)和 120 个厨房场景(不同布局、风格、材质)。生成式 AI 让"造一个新物体/新厨房"从"美工手搓几天"变成"描述一下就有",多样性和规模因此暴涨。生成的资产经整理后放进可交互的仿真里。

生成式 AI 资产(generative assets):用 AI 模型(如文本→3D、文本→图)自动生成的 3D 物体和纹理,替代人工建模。

输出。 一个庞大多样、可交互的厨房资产库(物体 + 场景)。

所以这一节是想说:用生成式 AI 把"造物体和厨房"自动化,得到 2500+ 物体、120 场景的大资产库。

2. 跨形态支持:移动机械臂 + 人形

输入。 不同机器人形态的模型(移动机械臂、人形机器人)。

处理。 平台把任务设计成能用于不同形态的机器人——既能是"底盘 + 机械臂"的移动操作机器人,也能是人形机器人。这样研究者可以在同一套任务上比较不同形态,或研究跨形态迁移。

输出。 一个支持多种机器人身体的仿真环境。

所以这一节是想说:跨形态支持让同一批家务任务服务移动机械臂和人形机器人。

3. LLM 出任务:大规模多样的家务任务

输入。 场景与物体信息 + 大语言模型。

处理。 用 LLM 的常识和生成能力,设计大量家务任务——从"原子任务"(单一动作,如开微波炉、拿起杯子、按开关)到更复杂的组合任务。LLM 帮忙想出多样、合理的任务及其描述,省去人工逐个设计的巨大工作量。每个任务配好成功判据。

输出。 一大批多样、带语言描述、可评测的家务任务。

所以这一节是想说:LLM 当"出题老师",批量生成多样合理的家务任务,降低人工出题成本。

4. 海量演示 + 物理底座

输入。 任务 + 仿真环境 + 演示来源(遥操作/自动化生成等)。

处理。 收集/生成超过 10 万条演示轨迹,供模仿学习训练策略。底层用 RoboSuite(MuJoCo 物理)保证接触操作的仿真质量。数据可用于训练通用策略并在平台上评测。

输出。 一个"大规模演示 + 高质量物理 + 可评测任务"的完整训练/评测基座。

下面用 ASCII 图把四根支柱画出来:

   ┌──────────────────────── RoboCasa(建在 RoboSuite / MuJoCo 上)────────────────────────┐
   │  ①生成式AI资产: 120 厨房场景 + 2500+ 3D物体                                            │
   │  ②跨形态: 移动机械臂 + 人形机器人                                                       │
   │  ③LLM出任务: 大量原子/组合家务任务 + 语言描述 + 成功判据                                │
   │  ④海量演示: 10万+ 轨迹                                                                  │
   └────────────────────────────────────────┬───────────────────────────────────────────┘
                                             ▼
                            训练通用家务机器人策略 → 在平台上评测泛化

再用一张 ASCII 图对比"手工仿真 vs RoboCasa":

   手工:     [场景×几十] [物体×有限] [任务人工出]   → 慢、少、机器人易过拟合
   RoboCasa: [场景×120] [物体×2500+] [任务LLM出] [演示×10万]  → 大、多样、逼真
             (资产由生成式AI造)

所以这一整节是想说:RoboCasa = 生成式AI资产 + 跨形态 + LLM出任务 + 10万演示 + MuJoCo物理,用AI把家务仿真规模化。


关键数字(What works)

数字来自论文(arXiv:2406.02523);具体策略成功率、scaling 结论属正文,标注"需读原文"。

项目 数值 说明
厨房场景 120 个 生成式 AI 辅助
3D 物体 2500+ 个 生成式 AI 辅助
演示轨迹 超过 10 万条 供模仿学习
机器人形态 移动机械臂 + 人形 跨形态
任务设计 LLM 辅助 大量原子/组合任务
物理底座 RoboSuite / MuJoCo 接触操作质量
领域聚焦 厨房家务 日常任务

三个要点:第一,120 场景 + 2500+ 物体 + 10 万演示的规模,靠的是"生成式 AI + LLM"把造场景/物体/任务的苦活自动化——这是它区别于手工仿真的根本;第二,**跨形态(含人形)**顺应了人形机器人热潮,让平台面向更广的机器人研究;第三,聚焦厨房家务且建在 MuJoCo 上,保证了接触操作的逼真度和评测的针对性。

所以这一节是想说:AI 自动化带来的大规模、跨形态、逼真厨房,是 RoboCasa 的三个关键点。


实验结果说明了什么

RoboCasa 首先是平台/数据集贡献,它"说明了什么"更多体现在使能与验证:

  • 生成式 AI 能撑起大规模仿真:用 AI 造资产、LLM 出任务,确实能搭出远超手工规模的多样逼真环境——这本身就是一个重要范式验证。
  • 数据规模有用:论文研究了"更多演示数据/更多场景"如何提升学到的策略(scaling 趋势,细节需读原文),呼应"规模带来泛化"。
  • 跨形态可行:同一平台支持移动机械臂和人形,为跨形态机器人研究提供了统一场地。
  • 可评测泛化:多样场景/物体让"换个厨房/换个物体还能不能做"这种泛化考核成为可能。

所以这一节是想说:实验验证了"用生成式 AI 规模化造仿真"可行、有用,并支撑规模化与跨形态的机器人学习研究。


你应该懂的几个新词

  • 仿真平台(simulation platform):在电脑里模拟机器人和环境,用于训练和评测,便宜、可批量、可重置。
  • RoboSuite / MuJoCo:RoboCasa 的底层框架/物理引擎,擅长接触丰富的操作仿真。
  • 生成式 AI 资产:用 AI(文本→3D、文本→图)自动生成的物体和纹理。
  • 跨形态(cross-embodiment):同一任务/方法用于不同身体形态的机器人(移动臂、人形)。
  • 移动机械臂 / 人形机器人:会移动的机械臂机器人 / 双足类人机器人。
  • 原子任务 / 组合任务:单一动作的小任务 / 由多个原子任务串成的复杂任务。
  • 演示轨迹(demonstration):示范"怎么做才成功"的动作序列,供模仿学习。
  • 泛化(generalization):换新场景/物体/任务仍能完成。

所以这一节是想说:生成式资产、跨形态、原子/组合任务是理解本篇的关键词。


它有什么搞不定的

  • 仿真终有 sim-to-real gap:厨房再逼真,物理、接触、视觉与真实仍有差距,上真机需额外工作。
  • 生成资产的质量参差:AI 生成的 3D 物体可能有几何/物理瑕疵,需要筛选清理,不是全都能直接用。
  • 聚焦厨房:主打厨房家务,覆盖不到其它场景(客厅、户外、工厂)的任务。
  • LLM 出的任务可能不合理:LLM 生成任务偶尔会出常识错误或不可执行,需要人工把关。
  • 数据规模不等于策略强:有了大数据和大平台,如何训出真正泛化的策略仍是开放算法问题。

所以这一节是想说:它把仿真做大做逼真,但 sim-to-real、生成资产质量、领域局限和"数据≠能力"仍是约束。


它和别的几篇是什么关系

  • 底座:RoboSuite(MuJoCo)是其物理框架;robomimic 提供了模仿学习的工具链背景(同一 Yuke Zhu 生态)。
  • 仿真环境对照:ProcTHOR(程序化生成房子,偏导航/重排)、Habitat(导航)、ManiSkill/SAPIEN(关节操作)——RoboCasa 主打"逼真厨房家务 + 生成式资产 + 跨形态"。
  • 数据派系:与真机数据集(Open X-Embodiment、DROID、RH20T)互补——仿真便宜可批量,真机真实。
  • 趋势呼应:用生成式 AI/LLM 造训练环境,是"用大模型造数据喂大模型"这一新潮流的代表。
  • 下游用户:训练 VLA、通用家务策略、人形操作的工作可用它当训练/评测场。

所以这一节是想说:RoboCasa 是"用生成式 AI 规模化造家务仿真"的代表,与程序化生成、真机数据形成互补。


和本导读的关系

本笔记对应导读 Ch21: 数据集与评测(同时关联 Ch17 Sim-to-Real)。Ch21 讲的是"机器人学习的数据/环境从哪来、怎么评测"。RoboCasa 在这条线里代表"用生成式 AI + LLM 把仿真训练场规模化"的前沿方向——它回答了"逼真、多样的家务练习场怎么低成本造出来"。读完本篇再看同章的 maniskill(关节操作仿真)、procthor(程序化生成房子)、open-x-embodiment/rh20t(真机数据),能理解"仿真 vs 真机""手工 vs 生成"这两组关键取舍。

所以这一节是想说:把 RoboCasa 放进 Ch21,它代表"生成式 AI 规模化造仿真训练场"的新范式。


思考题

Q1:为什么手工搭仿真厨房"做不大"?生成式 AI 怎么破解?

提示

手工建每个物体和场景要美工数天。生成式 AI 用文本就能造物体/纹理,规模和多样性因此暴涨。想想"手搓"和"批量生成"的差别。

Q2:用 LLM 出任务有什么好处和风险?

提示

好处是多样、省人工;风险是偶尔生成不合理/不可执行的任务,需要人工把关。想想"创意"和"可靠"的权衡。

Q3:为什么 RoboCasa 要支持"跨形态"(移动臂 + 人形)?

提示

顺应人形机器人热潮,也便于研究同一任务在不同身体上的迁移。想想统一平台对比不同形态的价值。

Q4:生成式 AI 造的 3D 物体可能有物理瑕疵,这会怎样影响接触操作仿真?

提示

几何/碰撞体不准会让抓取、放置的物理不真实,训出的策略可能学到错误接触。想想为什么要筛选清理。

Q5:RoboCasa(仿真)和 RH20T(真机)各自的优劣是什么?它们如何互补?

提示

仿真便宜、可批量、可精确评测但有 sim-to-real gap;真机真实但贵、难扩展。互补:仿真预训练 + 真机微调/验证。

Q6:"用生成式 AI 造数据来训练机器人大模型",这个循环有什么潜在问题?

提示

生成数据的偏差/瑕疵会传递给策略;可能陷入"AI 造的世界"而偏离真实。想想数据质量和真实性的把关。

Q7:如果要把 RoboCasa 从厨房扩到"整个家",你觉得最难的是哪一步?

提示

新场景资产、新任务设计、更长程的任务、跨房间移动等。想想厨房相对聚焦、扩到全屋后复杂度的跃升。


一些好奇心问答(FAQ)

Q:RoboCasa 只能做厨房吗?

它主打厨房家务(120 个厨房场景),这是它的聚焦点。扩展到其它场景需要更多资产和任务,但方法论(生成式 AI + LLM)是可推广的。

Q:它和 ProcTHOR 有什么区别?

ProcTHOR 用程序化规则生成房子、偏导航/重排、资产来自固定库;RoboCasa 用生成式 AI 造逼真资产、聚焦厨房接触操作、支持跨形态、配 10 万演示。

Q:10 万条演示是怎么来的?

来自遥操作/自动化生成等(具体见论文)。这些演示用于训练模仿学习策略。

Q:我能用它训 VLA 吗?

可以作为训练/评测场,尤其适合需要多样场景和任务的通用策略。它建在 RoboSuite 上,工具链成熟。

所以这一节是想说:把 RoboCasa 理解成"生成式 AI 造出的大规模逼真厨房仿真基座",定位就清楚了。


如果你想再深入

  1. 底座:RoboSuite / robomimic — 理解其物理框架和模仿学习工具链。
  2. 仿真对照:ProcTHOR / Habitat / ManiSkill — 理解不同仿真环境的侧重。
  3. 真机对照:Open X-Embodiment / RH20T — 理解真机数据的取舍。
  4. 生成式资产:文本→3D / 文本→图 工具 — 理解资产是怎么造的。
  5. 同章:Ch21 数据集综述 — 建立"仿真 vs 真机、手工 vs 生成"的全景。

所以这一节是想说:把 RoboCasa 与 RoboSuite、ProcTHOR、真机数据一起读,能看清机器人训练场的多条路线。


原文信息

  • 标题:RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots
  • 作者:Soroush Nasiriany, Abhiram Maddukuri, Lance Zhang, Adeet Parikh, Aaron Lo, Abhishek Joshi, Ajay Mandlekar, Yuke Zhu
  • 会议:RSS 2024(UT Austin / NVIDIA)
  • arXiv:https://arxiv.org/abs/2406.02523
@inproceedings{nasiriany2024robocasa,
  title     = {RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots},
  author    = {Nasiriany, Soroush and Maddukuri, Abhiram and Zhang, Lance and Parikh, Adeet and Lo, Aaron and Joshi, Abhishek and Mandlekar, Ajay and Zhu, Yuke},
  booktitle = {Robotics: Science and Systems (RSS)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2406.02523}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_robocasa_2026,
  title       = {(readable note) RoboCasa},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/robocasa/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?