Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Simulation & Sim2Real · Plate Nº 107

Isaac Lab

15 min read · 5155 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

机器人在电脑里"练功"的虚拟训练场。以前练得飞快但看不清画面,画面漂亮又练得慢;Isaac Lab 把这两件事捏到了一起。

所以这一节是想说:Isaac Lab 把"高速物理训练"和"高保真渲染"合进一个统一框架,让感知和控制能一站式端到端训练。


这是个什么场景

想象你要教一个新手厨师颠勺。直接让他上真灶台太贵——油溅了、锅砸了都是钱。聪明的做法是先在"模拟厨房"里练几千遍,再上真灶。机器人也一样:直接拿真机训练,摔坏一个人形机器人就是几十万。所以大家都在电脑里盖一个"虚拟健身房",让机器人在里面摔个百万次,再把学会的动作复制回真机。

但虚拟健身房有个老问题:

  • 只想练动作的房间(Isaac Gym 前辈):像没开灯的健身房——动作算得飞快,每秒练几千次,但你看不见画面,机器人也"看不见"东西。
  • 画面漂亮的房间(Isaac Sim):像影视片场——灯光、阴影、相机都很真,但训练慢,更像拍样片而不是练功。
  • Isaac Lab(本文):把"地下健身房"和"影视片场"打通——同一个屋子里,既能高速颠勺一百万次,也能在需要时开灯看清画面。

机器人训练里最头疼的事叫 sim-to-real gap(仿真到真机的落差):在电脑里练得很溜,搬到真机就翻车。原因常常是仿真里看到的画面太假、传感器太糙。Isaac Lab 要做的,就是把这条"从仿真走到真机"的桥铺平一点。

sim-to-real gap(仿真到真机的差距):仿真训得好、真机翻车的现象。视觉太假、传感器太糙、物理不准都是原因。

所以这一节是想说:场景是"机器人在仿真里练功再上真机",Isaac Lab 要同时满足"练得快"和"看得真"。


Isaac Lab — 场景示意:这论文要解决的现实问题
Plate Nº IIsaac Lab — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Isaac Gym(2021):GPU 上跑物理 + RL 训练,速度快了几十倍,但渲染粗糙,传感器只有简化版。
  • MuJoCo / PyBullet:CPU 仿真器,物理精度好,但并行能力差、渲染更弱。
  • Webots / Gazebo(ROS 系):偏工程化,资产丰富但训练吞吐量不够。
  • Omniverse Isaac Sim:渲染和场景非常漂亮,但偏"演示和数字孪生",RL 训练 pipeline 不顺手。
  • 结果:研究者要么"快但难看",要么"漂亮但慢",没法一站式拿到感知 + 控制的端到端训练。

数字孪生(digital twin):给一个真实系统建一个高保真的虚拟副本,用来仿真、监控、预测。偏展示与工程,不一定为 RL 训练优化。

所以这一节是想说:以前"快"和"真"是两个割裂的工具,Isaac Lab 想把它们合成一个。


这篇论文的新想法

像合并两间工坊:一间专做"练动作"(Isaac Gym),一间专做"做画面"(Isaac Sim)。Isaac Lab 把两间合到同一个屋檐下,再用三个小巧思解决"既要快又要真"的老矛盾:

  • 多频率仿真(multi-rate simulation):像家里的电器各有节奏——空调每秒检测一次温度,闹钟每分钟跳一格。物理引擎跑得最快(约 1kHz),相机慢一点(约 30Hz),IMU 中速(约 200Hz),各跑各的,不强行对齐。
  • 渲染画质可切换:训练阶段用"草图模式"(快速光栅化)狂练;快上真机时切到"电影模式"(光线追踪)让画面更接近真实,减小视觉落差。
  • 统一接口:人形、机械臂、四足狗、无人机都接同一个"插座"(API)。写一份配置文件就能换机器人,不用每种重写一套。

所以这一节是想说:新想法 = 合并 Isaac Gym 与 Isaac Sim,再用多频率仿真 + 可切换渲染 + 统一接口解决"又快又真"。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 分三层楼盖房子

输入:一个机器人学习任务的需求。

处理:像一栋楼分地基—中间—顶楼。

  • 地基:Omniverse / PhysX 5(NVIDIA 的 GPU 物理引擎,负责"力学"计算)。
  • 中间:Isaac Lab 自己写的"环境抽象层",把强化学习需要的四件套(reset 重置、step 走一步、observation 观察、reward 奖励)做成统一接口。
  • 顶楼:具体任务,比如走路、抓东西、导航。

输出:一套地基换了、顶楼任务代码也不用改的分层架构。

环境抽象层:把底层物理引擎的复杂细节包起来,只对上层暴露 reset/step/observation/reward 这几个 RL 通用接口。

2. 传感器各按各的钟点上班

输入:多个不同刷新率的传感器(相机、IMU 等)+ 高频物理仿真。

处理:像办公楼里有人 9 点打卡、有人 10 点打卡,调度员不强行让所有人同时到。每个物理 tick(最小时间步)里,调度器只唤醒那些"该刷新"的传感器。这样 1024 个机器人同时训练时,相机不会拖累整条流水线。

输出:一个高吞吐、各传感器按真实频率运行的仿真循环。具体吞吐数字需读原文。

等等,先慢一拍——什么是"渲染 backend(后端)"?就是"画画的引擎"。同一个场景你可以让铅笔素描(快但糙)来画,也可以让油画大师(慢但真)来画。

3. 三种画师任你选

输入:同一个仿真场景。

处理:提供多种渲染后端——

  • 栅格化(rasterization):最快,训练用,类似铅笔素描。
  • 路径追踪 / 光追(path tracing):最真,做 sim-to-real 时用,类似油画。
  • Hydra render delegate:按 OpenUSD 标准对接外部工具,类似把画稿交给别人继续修。

输出:训练阶段用快的、验收阶段切慢的,同一场景两种画质自由切换。

OpenUSD:一种开放的 3D 场景描述格式(类比 3D 世界里的"通用文件格式"),让不同工具能共享同一个场景。

4. 开源菜谱社区

输入:社区贡献的机器人、场景、任务。

处理:所有任务都是开源 Python 配置加 URDF/USD(机器人和场景的"建筑图纸")资产,谁都能贡献新机器人、新场景。这和 Isaac Gym 时代很不一样——以前菜谱主要由 NVIDIA 自己写。

输出:一个可持续增长的开源任务/资产生态。

ASCII 总览:

             [顶楼: 任务(走路/抓取/导航)]
                        │  统一 API
             [中间: 环境抽象层 reset/step/obs/reward]
                        │
             [地基: Omniverse / PhysX 5 (GPU物理)]
                        │
   多频率调度: 物理~1kHz | IMU~200Hz | 相机~30Hz (各按各的钟点)
                        │
   渲染切换: 栅格化(快,训练) ⇄ 光追(真,sim2real) ⇄ Hydra(外部工具)

5. 为什么"全程留在 GPU 上"是这类框架的命根子

这一节讲清楚 Isaac Lab(以及它的前身 Isaac Gym)到底快在哪、为什么快。

输入:一个需要跑几十亿步才能学会走路的强化学习任务。

处理:传统机器人仿真器(如很多基于 CPU 的物理引擎)有个致命瓶颈:物理算在 CPU、神经网络算在 GPU,每走一步都要把数据在两者之间搬来搬去,这种拷贝的开销常常比计算本身还大,导致再多显卡也喂不饱。Isaac Lab 的核心是让物理仿真、观测生成、策略推理全部在 GPU 上完成,数据从头到尾不下 GPU。这样就能在一块显卡上同时并行成千上万个机器人环境(1024、4096 甚至更多),它们齐步走、齐步算,吞吐量相比 CPU 方案是数量级的提升。对 RL 来说,吞吐量几乎直接等于"多久能训好",所以"数据不出 GPU"这一条,才是它能把训练时间从几周压到几小时的根本。

输出:一个能在单机上并行海量环境、把 GPU 算力真正吃满的高吞吐仿真。

打个比方:别人是一条流水线一次做一个零件、还要不停在两个车间之间搬货;Isaac Lab 是同一个车间里开了几千条流水线一起转,货也不用搬来搬去。

6. 多频率调度背后的物理与工程账

输入:一个物理需要高频、传感器各有各慢频率的仿真。

处理:这里有个绕不开的矛盾。物理仿真为了数值稳定(不让积分发散、穿模),最小时间步必须很小、频率很高(可达上千赫兹);但相机这类传感器现实里也就几十赫兹刷新一次,IMU 两百赫兹左右。如果偷懒让所有东西都跟着物理的最高频率一起跑,那每个物理 tick 都渲染一遍相机,算力会被严重浪费在"根本不该更新的传感器"上。Isaac Lab 的调度器按各自的真实频率决定"这一 tick 唤醒谁":物理每步都算,相机隔很多步才渲染一次。这既省了算力、保住了高吞吐,又让仿真里的传感器时序更贴近真实硬件——后者对 sim-to-real 很重要,因为真机上传感器就是这么不同步的。

输出:一个既省算力又时序真实的多传感器仿真循环。

所以这一节是想说:多频率调度不是花架子,它同时解决了"别浪费算力"和"别造出现实里不存在的完美同步"两件事。

7. 可切换渲染怎么服务 sim-to-real

输入:同一个 3D 场景,两种截然不同的需求。

处理:训练时你要的是"快"——跑几十亿步,画面糙一点无所谓,用栅格化渲染(像铅笔素描,飞快)。但当你要把仿真里训的策略搬到真机,就撞上"sim-to-real 视觉鸿沟":仿真画面太假,策略在真实相机图像上就水土不服。这时你要的是"真"——用路径追踪/光追渲染出接近照片级的画面(像油画,慢但逼真),让策略在训练/微调时见到的图像更接近现实。Isaac Lab 让你在同一个场景上按阶段自由切换渲染后端,还能配合域随机化(随机改光照、材质、纹理)进一步逼模型学到对视觉变化鲁棒的特征。一套场景,训练用快的、迁移用真的,正好覆盖 sim-to-real 的两端。

输出:一个能同时照顾"训练速度"和"迁移真实感"的渲染方案。

8. 从 Isaac Gym 到 Isaac Lab,架构升级意味着什么

输入:前代 Isaac Gym 的经验与局限。

处理:Isaac Gym 证明了"GPU 并行仿真"这条路能行,但它相对封闭、任务主要由官方提供、和底层引擎耦合较紧。Isaac Lab 的关键升级是解耦与开放:中间加一层环境抽象层(把 reset/step/observation/reward 做成统一接口),于是底层物理引擎升级换代时,上层任务代码几乎不用改;采用 OpenUSD 这个开放的 3D 场景标准,让场景和资产能在不同工具间流通;任务和资产都是开源 Python 配置 + URDF/USD 图纸,社区谁都能贡献新机器人、新场景。这把一个"公司自家的工具"变成了"可持续生长的社区基础设施"——这才是系统类论文真正的长期价值:不是某一次跑分,而是让整个领域能在同一个高效平台上累积成果。

输出:一个解耦、开放、可持续演进的机器人学习平台。

所以这一节是想说:三层架构(解耦底层引擎)+ 全程 GPU 高吞吐 + 多频率调度(省算力又贴近真实)+ 可切换渲染(覆盖 sim-to-real 两端)+ 开源资产生态,五件事拼出一个"又快又真又通用又可持续"的训练框架。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Isaac Lab · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Isaac Lab — 方法示意:核心 pipeline
Plate Nº IIIsaac Lab — 方法示意:核心 pipeline

关键数字(What works)

Isaac Lab 是系统类论文(arXiv 2025),吞吐量、sim-to-real 成功率等精确数值需以原文为准,本笔记不编造。下表说明它"测什么"。

关注点 说明 具体数值
吞吐量基准 不同 GPU 上跑 1k/4k/16k 并行 env 的每秒 step 见原文
任务复现 迁移 Isaac Gym 经典 locomotion/manipulation 训练曲线对齐或更好,见原文
sim-to-real 部署到真机(如 Unitree H1、ANYmal、Franka) 成功率/零样本迁移见原文
多机器人异构 同脚本训人形/四足/机械臂 验证 API 通用性

提醒:任何吞吐与成功率数字请以 arXiv 原文(2511.04831)为准。

所以这一节是想说:核心看"并行吞吐 + 经典任务复现 + sim-to-real 迁移 + 多机器人通用",具体值回原文。


实验结果说明了什么

  • "又快又真"是可行的:多频率调度让高保真传感器不拖累高频物理,证明"高速训练"和"真实渲染"可以共存于一个框架,而非二选一。
  • 统一接口降低门槛:同一份脚本能训人形/四足/机械臂,说明抽象层设计成功,研究者省下大量重复工程。
  • sim-to-real 有实证:训出的策略能部署到真机(H1、ANYmal、Franka 等),说明可切换的高保真渲染确实帮助缩小视觉落差。
  • 开源生态是长期价值:任务/资产由社区共建,意味着平台会随生态持续增长,而不是一次性发布。

所以这一节是想说:实验证明 Isaac Lab 在"速度、通用性、真机迁移"三方面同时站得住,是一个可持续的训练底座。


你应该懂的几个新词

Isaac Gym:NVIDIA 2021 年开源的 GPU 物理 + RL 框架,本论文的前身。

Omniverse / OpenUSD:NVIDIA 主推的 3D 协作平台和场景描述格式,类比 Photoshop 之于图像、USD 之于 3D 场景。

PhysX 5:NVIDIA 的 GPU 物理引擎,支持刚体/软体/关节动力学。

多频率仿真(multi-rate simulation):不同传感器/控制器以各自真实频率运行,避免被最高频拖累。

sim-to-real gap:仿真训练迁移真机时性能下降的现象。

domain randomization(领域随机化):训练时随机化光照、纹理、摩擦、质量等,让策略更鲁棒,是缩小 sim-to-real 的常用手段。

所以这一节是想说:抓住"Isaac Gym、Omniverse/USD、多频率仿真、sim-to-real、领域随机化"这几个词,就抓住了 Isaac Lab。


它有什么搞不定的

  • 绑定 NVIDIA 生态:依赖 Omniverse / PhysX / NVIDIA GPU,没有 NV 硬件基本用不了,跨厂商可移植性差。
  • 学习曲线陡:Omniverse/USD 概念多,新手上手仍需时间,虽比 Isaac Gym 友好但不算零门槛。
  • sim-to-real 未被消除:它只是"铺平桥",减小视觉落差,但物理近似、接触建模、真机噪声等差距依然存在。
  • 高保真渲染仍慢:光追模式很真但慢,只能在验收/少量场景用,不能全程开着训练。
  • 资产质量参差:开源社区贡献的机器人/场景质量不一,用之前要自己甄别。

所以这一节是想说:Isaac Lab 强在统一与高速,但绑定 NV 生态、有上手门槛、sim-to-real 未根除、高保真渲染仍慢。


它和别的几篇是什么关系

  • 直接前身Isaac Gym(Makoviychuk 2021)——提供了 GPU 并行 RL 这个核心能力。
  • 同代竞品:Genesis(2024 大学联合)、MuJoCo MJX(DeepMind 把 MuJoCo 上 GPU/TPU)、Brax(Google 的 JAX 物理引擎)、Drake(MIT,偏 control 严谨度)。
  • 下游用户:几乎所有 2024–2026 的人形 locomotion 论文(H1、G1、Atlas 系)和很多 manipulation/whole-body 工作都开始默认用 Isaac Lab。
  • RoboCasa / Habitat 互补:后者专注 home/indoor 大场景资产,Isaac Lab 提供物理 + 渲染底座。
  • SAPIEN:都提供物理仿真,SAPIEN 偏铰接物体操作,Isaac Lab 偏 GPU 大规模并行 + 多本体。

所以这一节是想说:Isaac Lab 是 Isaac Gym 的升级继任者,也是 2025 年前后人形/四足/操作研究的事实标准仿真底座。


和本导读的关系

  • 主线章节:Ch17 Sim-to-Real。Isaac Lab 是"高速仿真 + 缩小视觉落差"的核心平台,是 sim-to-real 的基础设施。
  • 强化学习:Ch16 强化学习基础。它的环境抽象层正是为大规模并行 RL 服务。
  • 对照其它仿真:Habitat 2.0 / Habitat 3.0 偏家居场景,Isaac Lab 偏物理 + 多本体,可对照理解仿真平台的分工。

所以这一节是想说:Isaac Lab 落在 Ch17(sim-to-real)与 Ch16(RL 训练)的核心位置。


思考题

Q1:为什么"多频率仿真"能同时兼顾高速和高保真?

提示

物理按最高频跑保证控制精度,相机等重传感器按自己较低的真实频率刷新,不被强行拉到最高频,从而不拖累整体吞吐。

Q2:训练用栅格化、验收用光追,这个"渲染切换"解决了什么矛盾?

提示

训练要快(栅格化),sim-to-real 要真(光追)。切换让同一场景既能高速训、又能在需要时逼近真实视觉,缩小落差。

Q3:统一 API 让一份脚本能训多种机器人,这对研究者最大的价值是什么?

提示

省下为每种机器人重写环境的重复工程,把精力投到 idea 验证上,也便于跨本体对比。

Q4:Isaac Lab 绑定 NVIDIA 生态,这是优点还是缺点?取决于什么?

提示

优点是深度优化、性能强、生态活跃;缺点是可移植性差。取决于你是否有 NV 硬件、是否需要跨平台。

Q5:Isaac Lab 能"铺平" sim-to-real 的桥,但为什么不能彻底消除 gap?

提示

它主要减小视觉落差,但物理近似、接触建模、真机传感器噪声等差距依然存在,需要领域随机化等额外手段。

Q6:为什么开源社区共建资产对这类平台是长期价值?

提示

平台价值很大程度取决于可用的机器人/场景/任务数量,社区共建让生态持续增长,而非依赖官方一次性发布。

所以这一节是想说:想清楚这些题,你就理解了"多频率的巧思""渲染切换""统一接口""生态绑定"这几件核心事。


一些好奇心问答(FAQ)

Q:Isaac Lab 是开源的吗?

是,代码和大量任务开源,社区可贡献机器人和场景。

Q:我没有 NVIDIA GPU 能用吗?

基本不行。它深度绑定 Omniverse/PhysX/NV GPU,是使用前提。

Q:它比 Isaac Gym 好在哪?

统一抽象层、多频率仿真、可切换高保真渲染、更友好的开发体验,且渲染真实度大幅提升。

Q:新手多久能上手?

跑通一个 cartpole/ant 例子通常一两天,改一个自己的任务比读完整论文更高效。

Q:为什么 2025 年人形论文都爱用它?

它是当下 GPU 并行 + 高保真 + 多本体一站式训练最成熟的开源平台,不熟它会读不懂别人的实验设置。

所以这一节是想说:Isaac Lab 是 2025 前后具身 AI 的事实标准仿真底座,学它回报期长,但前提是有 NV 硬件。


如果你想再深入

  1. 先跑 quickstart —— GitHub README 的 cartpole/ant 例子,建立对"环境抽象层"的直观认知。
  2. 前置:Isaac Gym —— 懂 GPU 并行 RL 的核心能力。
  3. 读架构 + 多频率仿真节 —— 理解为什么这套抽象比 Isaac Gym 灵活。
  4. 看 sim-to-real 案例 —— 决定是否值得迁移自己的项目。
  5. 翻 isaaclab_tasks —— 若做人形/操作,照着改一个任务比读完整论文高效。

所以这一节是想说:先跑例子,补 Isaac Gym,重点读架构与多频率仿真,再照着任务库改。


原文信息

  • 标题:Isaac Lab: A GPU-Accelerated Simulation Framework for Robot Learning
  • arXiv:https://arxiv.org/abs/2511.04831
  • 发表:技术报告(arXiv)
  • 年份:2025
@article{mittal2025isaaclab,
  title  = {Isaac Lab: A GPU-Accelerated Simulation Framework for Robot Learning},
  author = {Mittal, Mayank and others},
  journal = {arXiv preprint arXiv:2511.04831},
  year   = {2025}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_isaac_lab_2026,
  title       = {(readable note) Isaac Lab},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/isaac-lab/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?