Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 108

MuJoCo Playground

13 min read · 4482 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过机器人仿真"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么以前训练机器人要一堆环境和几天时间,而现在一句 pip install 就能在一块显卡上几分钟训出能上真机的策略"。

一句话讲什么(TL;DR)

一个完全开源、"pip install playground" 一句就能装的机器人学习框架:它把物理仿真、批量渲染、训练环境打包在一起,全部跑在 GPU 上,让研究者在单块显卡上几分钟训出策略,并且能零样本(zero-shot)迁移到真实机器人——不管是四足狗、人形、灵巧手还是机械臂,也不管输入是状态还是像素。

所以这一节是想说:这篇论文提供的是一套"一装即用、单卡分钟级、能上真机"的开源机器人训练全家桶。


这是个什么场景

假设你是个想入门机器人学习的学生。你想训一只仿真机器狗学会走路,然后把学到的策略拷进真狗里让它真的走起来。按老办法,你要经历一串折磨:装一个仿真器(各种依赖冲突)、找/写机器人模型文件、配置一套强化学习训练代码、调好几天参数、还常常发现仿真里学得飞起、一到真机就摔个狗吃屎(这叫 sim-to-real gap,仿真与现实的差距)。

痛点有两层:门槛高(环境难装、代码难拼、训练慢)和 迁移难(仿真里学的到真机就废)。这两件事把很多人挡在门外,也拖慢了整个领域。

MuJoCo Playground 想让这件事变得像"装个 App"一样简单:一句命令装好,选一个平台(狗/人形/手/臂),几分钟在一块显卡上训出来,而且这些环境是经过精心设计的,训出来的策略能直接零样本上真机

所以这一节是想说:它要把"训练机器人 + 迁移到真机"这件原本又难又慢的事,降低到"一装即用、单卡分钟级"。


MuJoCo Playground — 场景示意:这论文要解决的现实问题
Plate Nº IMuJoCo Playground — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 传统 MuJoCo(CPU 版):MuJoCo 是老牌高质量物理引擎,但经典版主要在 CPU 上跑,一次只能仿真少数几个环境,采样慢,训练一个策略动辄几小时到几天。
  • 各种分散的仿真器 + RL 库:Isaac Gym、PyBullet、Brax、dm_control 等各有各的安装方式、各有各的环境格式、各有各的训练代码。想拼一套完整流水线(物理 + 渲染 + 训练)要自己缝,缝合成本高、易出错。
  • 像素输入更难:很多快仿真只支持"状态输入"(直接给关节角等数字),要从摄像头像素学习就得再接一个渲染器,而快速的批量渲染(一次渲很多个环境)并不好搞。
  • sim-to-real 靠各自摸索:能不能迁移到真机,往往取决于环境有没有做好随机化、参数对不对,缺乏"开箱就能上真机"的成熟环境集。

所以这一节是想说:以前是"引擎慢、工具散、像素难、迁移靠玄学",缺一套整合好、跑得快、还验证过能上真机的框架。


这篇论文的关键想法

MuJoCo Playground 的核心不是发明新算法,而是把一整套"快又能上真机"的基建整合成一个开箱即用的包。三个关键决定:

第一,建在 MJX 之上,让物理仿真跑上 GPU。 MJX 是 MuJoCo 的 JAX/XLA 版本,能在 GPU 上同时并行仿真成千上万个环境。仿真快了,采样就快,训练自然从几天缩到几分钟。

第二,把物理引擎、批量渲染器、训练环境整合成一个栈。 你不用自己缝合——物理(MJX)、渲染(批量渲染器,一次渲很多环境的像素)、以及一批现成的训练环境(狗/人形/手/臂)都在一个包里,状态输入和像素输入都支持。

第三,环境经过精心打磨以支持零样本 sim-to-real。 论文强调多个平台上都能从仿真直接零样本迁移到真机(既有状态输入也有像素输入的例子)。也就是说,这些环境不是玩具,而是"训完就能上真机"的成熟配置。

所以这一节是想说:它的创新在"整合 + 提速 + 可迁移"——用 MJX 把 MuJoCo 搬上 GPU,配齐渲染和环境,并保证能上真机。


MuJoCo Playground — 方法示意:核心 pipeline
Plate Nº IIMuJoCo Playground — 方法示意:核心 pipeline

它分几步做的(方法)

这是一篇"系统/框架"论文,它的"方法"就是这套集成栈怎么搭。分四块:GPU 物理(MJX)、批量渲染、训练环境集、sim-to-real 配方。逐块按"输入 → 处理 → 输出"讲。

1. MJX:把 MuJoCo 物理搬上 GPU

输入。 机器人模型(MuJoCo 的 MJCF/XML 描述:关节、连杆、质量、摩擦等)和一批并行环境的当前状态。

处理。 MJX 用 JAX + XLA 把物理仿真编译成能在 GPU 上大规模并行的计算。JAX 是 Google 的数值计算库,能自动求导、自动编译到 GPU/TPU;XLA 是它底层的编译器。结果是:不是一次仿真一个环境,而是一次仿真几千上万个环境,采样吞吐量暴涨。

并行仿真(parallel/batched simulation):同时跑很多份仿真副本。强化学习需要海量试错样本,仿真副本越多、单位时间收集的经验越多,训练越快。

输出。 高吞吐的物理状态转移——喂给强化学习算法当"经验"。

所以这一节是想说:MJX 让 MuJoCo 从"CPU 一次几个"变成"GPU 一次几千个",这是分钟级训练的根本。

2. 批量渲染器:让像素输入也能快

输入。 并行环境的场景几何和相机设置。

处理。 一个批量渲染器(batch renderer)一次性把很多个环境的画面都渲出来,产出图像观测。没有这个,"从摄像头像素学习"就会成为瓶颈——因为渲染慢会拖垮整个采样速度。有了它,像素输入的训练也能跟上 GPU 物理的节奏。

输出。 批量的图像观测,让"从像素学策略"变得可行且快速。

所以这一节是想说:批量渲染把"像素输入"从奢侈品变成了和状态输入一样快的常规选项。

3. 训练环境集:狗、人形、手、臂一应俱全

输入。 各类机器人平台的模型和任务定义。

处理。 Playground 内置覆盖多种形态的环境:四足(quadruped,机器狗行走)、人形(humanoid,双足运动/全身控制)、灵巧手(dexterous hand,多指操作)、机械臂(robotic arm,抓取操作)。每类都配好了任务、奖励、观测。用户 pip install 后选一个直接训,不用自己写环境。

输出。 一组标准化、可直接训练的任务环境,覆盖机器人学习的主流形态。

所以这一节是想说:它把最常见的机器人形态都做成了"选一个就能训"的现成环境。

4. sim-to-real 配方:训完能上真机

输入。 在仿真里训好的策略。

处理。 环境在设计时融入了让策略可迁移的做法(如域随机化 domain randomization——训练时随机扰动物理参数、外观等,让策略见多识广、不挑环境;具体配置需读原文)。论文展示了多个平台从状态输入和像素输入零样本迁移到真机的结果——即仿真里训完,权重直接拷到真机,不再额外训练。

零样本 sim-to-real(zero-shot sim-to-real):仿真里训好的策略,不在真机上做任何额外训练/微调,直接部署就能工作。这是仿真训练的圣杯。

输出。 能直接跑在真实机器狗/人形/手/臂上的策略。

下面用 ASCII 图把整个栈画出来:

   pip install playground
            │
            ▼
   ┌───────────────────────── 一体化 GPU 栈 ─────────────────────────┐
   │  MJX 物理引擎(几千并行环境)  ──►  批量渲染器(像素观测)            │
   │            │                              │                       │
   │            └──────► 训练环境集(狗/人形/手/臂) ◄──────┘           │
   │                          │                                        │
   │                    RL 训练(单卡, 分钟级)                          │
   └──────────────────────────┬─────────────────────────────────────┘
                              ▼
                  策略  ──(零样本, 状态或像素输入)──►  真实机器人

再用一张 ASCII 图对比"老办法 vs Playground":

   老办法:  装依赖(数天崩溃) → 拼环境/RL代码 → CPU采样(几天) → 调随机化 → 也许能上真机
   Playground: pip install → 选平台 → GPU采样(几分钟) → 零样本上真机

所以这一整节是想说:MuJoCo Playground = MJX 物理 + 批量渲染 + 现成环境 + sim-to-real 配方,四合一打包成 pip 装即用。


关键数字(What works)

数字来自论文摘要(arXiv:2502.08844);具体每个任务的训练时长、真机成功率等细项属正文/项目页,标注"需读原文/项目页"。

项目 数值/结论 说明
安装 pip install playground 一行 极低门槛
训练时间 单块 GPU 上"几分钟" 得益于 MJX 并行
支持形态 四足 / 人形 / 灵巧手 / 机械臂 覆盖主流平台
观测类型 状态 + 像素 都能训、都能迁移
sim-to-real 零样本迁移 多平台验证
组成 物理引擎 + 批量渲染 + 训练环境 一体化栈
开源 完全开源,playground.mujoco.org 免费可用
每任务具体耗时/真机成功率 需读原文/项目页 摘要未逐条给出

三个要点:第一,**"几分钟 + 单卡"**把强化学习训练的时间和硬件门槛砍到极低,这是 MJX GPU 并行的直接红利;第二,状态和像素都支持且都能零样本上真机,说明它不是只做简单 state 任务的玩具;第三,完全开源 + 官方出品(作者含 MuJoCo 核心作者 Yuval Tassa、Pieter Abbeel 等),意味着长期维护和生态可靠。

所以这一节是想说:分钟级 + 单卡 + 状态/像素双支持 + 零样本上真机 + 官方开源,这套组合是它的核心竞争力。


实验结果说明了什么

作为框架论文,它的"实验"主要是演示(demonstration)而非刷榜:

  • 多平台可训、可迁移:在四足、人形、灵巧手、机械臂上都训出了策略并零样本迁移到真机,证明这套栈的通用性和 sim-to-real 有效性。
  • 像素输入也行:不仅是状态输入,从摄像头像素也能训并迁移,验证了批量渲染器的价值——这比纯 state 任务难得多。
  • 速度优势:单卡分钟级训练,降低了迭代成本,让研究者能快速试错。

它想传达的核心信号是:"高质量物理 + GPU 速度 + 可迁移环境"可以整合成一个人人可用的包,从而降低整个领域的入门和迭代门槛。

所以这一节是想说:实验以"多平台零样本上真机 + 像素可训 + 分钟级速度"来证明这套整合基建确实好用。


你应该懂的几个新词

  • MuJoCo:老牌高质量物理引擎,擅长接触丰富的连续控制仿真(关节、摩擦、碰撞)。
  • MJX:MuJoCo 的 JAX/XLA 实现,能在 GPU 上大规模并行仿真。
  • JAX / XLA:Google 的数值计算库 / 底层编译器,支持自动求导和 GPU/TPU 加速。
  • 并行/批量仿真(batched simulation):同时跑很多份仿真副本,加快 RL 采样。
  • 批量渲染器(batch renderer):一次渲多个环境的画面,让像素输入训练不拖后腿。
  • sim-to-real / 零样本迁移:把仿真里训的策略不加额外训练直接搬到真机。
  • 域随机化(domain randomization):训练时随机扰动物理/外观参数,让策略对现实差异更鲁棒。
  • 形态(embodiment):机器人的身体类型,如四足、人形、灵巧手、机械臂。

所以这一节是想说:MJX、批量渲染、域随机化是理解"为什么它又快又能上真机"的三个关键词。


它有什么搞不定的

  • 仿真终究不是现实:即便有域随机化和零样本演示,MuJoCo 的接触/摩擦模型仍是近似,某些高度接触敏感的任务迁移仍会有差距。
  • 需要 GPU:分钟级训练建立在有一块像样 GPU 的前提上;没有 GPU 就享受不到这份加速。
  • JAX 生态门槛:底层是 JAX/MJX,遇到深度定制或 debug 时,需要理解 JAX 的函数式/编译范式,对新手有学习曲线。
  • 内置环境有限:现成环境覆盖主流形态,但你自己的特殊机器人/任务仍要自己建模和调参。
  • 零样本不是万能:论文展示了成功案例,但并非任何任务都能零样本迁移;难任务可能仍需真机微调或更精细的随机化。

所以这一节是想说:它极大降低门槛,但没消除 sim-to-real 的物理本质差距,也依赖 GPU 和 JAX 生态。


它和别的几篇是什么关系

  • 上游:MuJoCo(Todorov 2012)是物理引擎本体;Brax、dm_control 是 MuJoCo/JAX 生态里的前辈。
  • 同赛道仿真器:Isaac Gym / Isaac Lab(NVIDIA,GPU 并行仿真)是最直接的竞品;SAPIEN、Habitat 面向不同任务(关节操作 / 具身导航)。
  • benchmark 邻居:ManiSkill、RoboCasa 关注"任务和场景多样性",MuJoCo Playground 更关注"引擎速度 + 一体化 + 可迁移"。
  • 下游用户:任何做 RL 运动控制、四足/人形/灵巧手研究、需要快速 sim-to-real 的工作都可拿它当训练底座。

所以这一节是想说:它是 GPU 并行仿真赛道(对标 Isaac Gym)里 MuJoCo 阵营的一体化答卷。


和本导读的关系

本笔记对应导读 Ch17: Sim-to-Real。Ch17 讲的正是"为什么要在仿真里训、以及怎么把学到的迁到真机"。MuJoCo Playground 是这条线上最新的基建代表——它把"高质量物理 + GPU 速度 + 可迁移环境"整合成一个开箱即用的包,直接回应了 Ch17 的两个核心议题:训练效率和 sim-to-real。读完本篇再看同章的 isaac-gym(另一条 GPU 仿真路线)、sapien/maniskill(关节操作)、habitat(导航),能拼出"仿真训练生态"的全景。

所以这一节是想说:把 MuJoCo Playground 放进 Ch17,它代表"用整合基建同时解决训练效率和迁移"的最新尝试。


思考题

Q1:为什么"把仿真搬上 GPU"能把训练从几天缩到几分钟?瓶颈原来在哪?

提示

RL 的瓶颈常是采样速度。CPU 一次仿真几个环境,GPU 一次几千个,单位时间收集的经验多了几个数量级。想想采样吞吐和训练时间的关系。

Q2:为什么"从像素学习"比"从状态学习"难,需要专门的批量渲染器?

提示

状态是现成数字,像素要先渲染再从图里提取信息,渲染慢会拖垮采样。批量渲染让像素观测跟上物理速度。

Q3:域随机化为什么能帮助零样本 sim-to-real?它的代价是什么?

提示

随机扰动让策略"见多识广",把现实当成训练分布里的一个样本。代价是任务变难、可能牺牲一点仿真内性能。

Q4:即使有零样本演示,为什么不能保证"任何任务都能直接上真机"?

提示

接触/摩擦等物理越敏感的任务,仿真近似误差越致命。想想走路 vs 精细插孔哪个更难迁移。

Q5:MuJoCo Playground 和 Isaac Gym 都做 GPU 并行仿真,你会从哪些维度比较它们?

提示

物理引擎精度、渲染、生态/易用性、支持的形态、开源程度、社区。想想选型时你最在意什么。

Q6:一个框架把物理、渲染、环境、训练全整合,有什么好处,又有什么潜在风险?

提示

好处是开箱即用、少踩坑;风险是耦合太深、定制困难、被单一栈锁定。想想"方便"和"灵活"的权衡。

Q7:如果你要用它训一个真实四足机器狗走路,你的完整流程会是哪几步?

提示

装包 → 选四足环境 → 配好机器狗模型和随机化 → 单卡训练 → 零样本部署到真狗 → 若不行再加随机化或微调。


一些好奇心问答(FAQ)

Q:它是 NVIDIA Isaac Gym 的竞品吗?

在"GPU 并行仿真 + 机器人学习"这个定位上是同赛道。区别在物理引擎(MuJoCo/MJX vs PhysX)、生态和易用性。两者各有拥趸。

Q:我没有 GPU 能用吗?

能装能跑,但享受不到"分钟级"的加速——那个速度的前提就是 GPU 并行。

Q:它自带强化学习算法吗?

它主要提供环境 + 物理 + 渲染这套底座,可对接常见 RL 训练器(JAX 生态里的算法库),具体集成见项目文档。

Q:为什么这篇作者阵容里有 MuJoCo 和 RL 的大牛?

因为它是 MuJoCo 官方生态的延伸(Yuval Tassa 是 MuJoCo 核心人物),Pieter Abbeel 等在机器人 RL 领域有深厚积累,保证了质量和长期维护。

所以这一节是想说:把它理解为"MuJoCo 官方的 GPU 机器人学习全家桶",定位就清楚了。


如果你想再深入

  1. 底座:MuJoCo(Todorov 2012) — 理解物理引擎本体。
  2. 前辈:Brax / dm_control — 看 JAX 生态里的仿真与任务集。
  3. 竞品:Isaac Gym / Isaac Lab — 对比另一条 GPU 并行仿真路线。
  4. 迁移:域随机化经典论文(Tobin 2017) — 理解 sim-to-real 的核心技巧。
  5. 同章:ManiSkill / RoboCasa / Habitat — 看仿真生态里"任务/场景多样性"这条互补线。

所以这一节是想说:把 MuJoCo → MJX/Brax → MuJoCo Playground → Isaac Gym 串起来,能看清 GPU 仿真的技术版图。


原文信息

  • 标题:MuJoCo Playground
  • 作者:Kevin Zakka, Baruch Tabanpour, Qiayuan Liao, Mustafa Haiderbhai, Samuel Holt, Jing Yuan Luo, Arthur Allshire, Erik Frey, Koushil Sreenath, Lueder A. Kahrs, Carmelo Sferrazza, Yuval Tassa, Pieter Abbeel
  • 发表:arXiv 2025(项目页 playground.mujoco.org)
  • arXiv:https://arxiv.org/abs/2502.08844
@article{zakka2025mujocoplayground,
  title   = {MuJoCo Playground},
  author  = {Zakka, Kevin and Tabanpour, Baruch and Liao, Qiayuan and Haiderbhai, Mustafa and Holt, Samuel and Luo, Jing Yuan and Allshire, Arthur and Frey, Erik and Sreenath, Koushil and Kahrs, Lueder A. and Sferrazza, Carmelo and Tassa, Yuval and Abbeel, Pieter},
  journal = {arXiv preprint arXiv:2502.08844},
  year    = {2025},
  url     = {https://arxiv.org/abs/2502.08844}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_mujoco_playground_2026,
  title       = {(readable note) MuJoCo Playground},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mujoco-playground/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?