Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
High-Level Planning · Plate Nº 81

GenSim

15 min read · 5220 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

让 ChatGPT 当"出题老师",自动给机器人编一堆练习关卡,连标准答案(专家怎么解)也一起写好。

所以这一节是想说:GenSim 把"设计机器人训练任务"这件苦力活外包给大语言模型,用代码的形式批量造题。


这是个什么场景

想象你在教小孩玩积木。要让他学会各种摆法,你得自己一关一关出题:「把红积木放盒子里」「按大小排成一排」……出 100 道题就能让你出到怀疑人生。而且每道题你还得亲自演示一遍标准动作给他看。

机器人训练就是这样。研究员要手写一个个虚拟"小桌面"任务给机器人练手——任务越多机器人越聪明,但人写得过来吗?写不过来。

GenSim 的想法很直接:让 ChatGPT 这种大语言模型(LLM)来当"出题老师 + 答案老师"。它写一段 Python 代码搭出一个虚拟桌面(放哪些方块、目标摆成啥样),再写一段代码演示"标准摆法"。机器人就在这堆 LLM 出的题里反复刷题。

核心洞察:仿真任务说到底就是一段代码——而代码恰好是 LLM 最擅长写的东西之一。

大语言模型(LLM):会读写文字和代码的超大 AI,比如 GPT-4。它写代码的能力尤其强,这正是 GenSim 要借用的。

所以这一节是想说:场景是"机器人训练缺任务多样性",GenSim 用 LLM 写代码来批量生成任务。


GenSim — 场景示意:这论文要解决的现实问题
Plate Nº IGenSim — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 人类手写仿真任务:Meta-World、RLBench、CALVIN 等 benchmark 都是研究员一个个手工设计的,规模受限于人力(几十到一两百个任务)。
  • 领域随机化(domain randomization):在已有任务上随机改纹理、光照、物体位置,扩出"变体",但任务本身的语义结构没变。
  • 程序化生成(procedural generation):用规则脚本随机组合物体(如 ProcTHOR 生成房间),但规则本身仍是人写的,难以涌现新的任务类型。
  • 演示数据采集:靠遥操作(teleoperation)人工演示,每条轨迹都很贵。
  • 专家脚本(scripted policy):研究员针对每个任务手写个状态机当 expert,扩到新任务又要重写。

benchmark(基准):一套公认的标准测试任务,用来公平比较不同方法。任务越多越丰富,训出的策略越可能泛化。

所以这一节是想说:以前造任务靠人力,规模和多样性都被卡住,GenSim 想用 LLM 突破这个瓶颈。


这篇论文的新想法

任务多样性是策略泛化能力的瓶颈,但人类设计任务太慢。让 LLM 既写"任务定义代码"(环境长什么样、目标是什么、reward 怎么算)也写"专家策略代码"(怎么一步步把任务解掉),就能把任务库从几十个膨胀到几百上千个。

更进一步:把生成的任务存进一个"任务库",让 LLM 在生成新任务时把库里现有任务作为 in-context 示例参考,形成"自举"循环——任务越多,新任务质量越高。

in-context learning(上下文学习):不改模型参数,只在 prompt 里塞几个例子,LLM 就能照着举一反三。

自举(bootstrapping):模型自己生成的东西再拿去喂自己(或下一轮自己),靠迭代把能力/资产滚大。

所以这一节是想说:新想法 = LLM 写任务代码 + 写专家代码 + 任务库自举循环,让任务越滚越多、越滚越好。


它分几步做的(方法)

这是全篇最核心部分,按四块讲清楚"进什么、做什么、出什么"。

1. 任务的代码化表示

输入:一个想要的任务概念(比如"排序""堆叠")。

处理:先把"出一道题"拆成统一格式,就像老师出题永远要写「场景 + 评分标准 + 参考答案」三栏。GenSim 基于 Ravens / CLIPort 这类 tabletop manipulation(桌面操作)仿真环境,每个任务被表示为一个 Python 类,包含三块代码:

  • 场景搭建:放哪些物体、目标位置在哪。
  • reward / 成功判定:怎么算通关。
  • 专家策略:用 pick-and-place 抓放原语一步步把物体摆到目标位。

输出:一段结构化的 Python 任务代码。

等等,先慢一拍——pick-and-place 原语是啥?就是把"机械臂动作"简化成两步:抓起 A,放到 B。CLIPort 这套环境里所有任务都靠这俩动作组合,所以 LLM 写"专家策略"其实就是写一串 pick-and-place 序列,难度大大降低。

pick-and-place 原语(primitive):最简化的动作单元——"抓起某物、放到某处"。复杂任务由许多这样的原语拼成。

2. 目标导向 vs 探索性两种生成模式

输入:要么一个高层任务描述,要么"随便出个新题"的指令。

处理:像两种出题思路——

  • 目标导向(按大纲出题):给 LLM 一个高层描述("做一个排序任务"),让它写对应代码。保证覆盖已知概念。
  • 探索性(自由发挥):让 LLM 在已有任务库基础上提出新颖任务。制造惊喜、扩展任务空间。

输出:一批候选任务代码。

两种模式互补:前者覆盖已知,后者拓展未知。

3. 任务库 + in-context 自举

输入:LLM 生成的候选任务代码 + 现有任务库。

处理:像学生写作文总要参考几篇范文。生成的代码先丢进仿真器跑一遍验证——能跑通且专家策略能解出来才算合格,通过的存入"任务库"。下一轮生成时,LLM 的 prompt 里塞几个库里的样例当参考,相当于"看着以前的题出新题",库越大新题质量越稳。

输出:一个不断增长、经过验证的任务库。

这一步是论文最有迁移价值的工程细节:用"生成 → 验证 → 入库 → 作为下一轮示例"的循环,把 LLM 的一次性输出变成可累积的资产。

4. 下游策略训练

输入:任务库里的大量任务。

处理:题出好了就让机器人做题。批量跑专家策略采集数据,喂给一个语言条件的多任务策略(multi-task policy,基于 CLIPort 架构)。

输出:一个在丰富任务上训练过、泛化更强的机器人策略。具体训练规模和数据量需读原文。

multi-task policy(多任务策略):一个网络处理多种任务,通常用语言指令区分要做哪件事。

ASCII 总览:

任务概念/自由发挥 ──► [LLM 写代码]
                          │  三块:场景 + reward + 专家策略
                          ▼
                   候选任务代码 ──► [仿真器验证]
                          │           跑得通且能解?
                    验证通过 │              ▼ 否→丢弃
                          ▼
                   ┌───► 任务库(不断增长)───┐
                   │        │作为下一轮示例    │
                   └────────┘(in-context 自举)
                            │
                            ▼
                   批量采数据 → 训练多任务策略

5. 为什么非要"写成代码",而不是让 LLM 用自然语言描述任务

这是 GenSim 最关键、也最容易被忽略的设计决定。

输入:一个"我想要一个新任务"的念头。

处理:如果让 LLM 用自然语言描述任务("把红块放到蓝盘上"),你会遇到一个死结——这句话没法自动验证对错,也没法直接拿来训练。自然语言含糊、可以随便编,LLM 说得天花乱坠你也不知道这个任务在仿真里到底能不能成立。GenSim 的破局点是让 LLM 直接输出可执行的 Python 代码:场景搭建代码、成功判定代码、专家策略代码。代码有个自然语言没有的硬性质——它要么能跑、要么报错,一试便知。这就把"LLM 出题"从一个无法检验的创意活,变成了一个可以被仿真器当场判分的工程活。

输出:一段能被机器直接执行、直接验真的任务定义。

打个比方:让人"口头描述一道菜"很容易吹牛,但让他"写出能照着做出成品的完整菜谱",好不好当场下锅一试就知道。代码就是那份能下锅的菜谱。

6. 验证闭环怎么把 LLM 的"一本正经胡说"挡在门外

输入:LLM 生成的候选任务代码。

处理:大家都知道 LLM 会幻觉——它可能写出语法对但物理上根本解不出的任务,或者专家策略压根摆不到目标位。GenSim 不信任 LLM 的任何一次输出,而是让每份代码都过两道闸:一是能不能在仿真器里无错跑起来(语法、API 用对没有),二是内置的专家策略能不能真把任务解到成功判定通过(这个任务是不是真的可解、可达标)。两关都过才准入库,否则直接丢弃。这一步等于给 LLM 装了个"事实核查员",把幻觉产物在进入训练数据前就筛掉。质量不靠 LLM 自觉,靠仿真器这个客观裁判。

输出:一个只含"可执行 + 可解 + 达标"任务的干净任务库。

所以这一节是想说:仿真器是这套系统的守门员,它让 LLM 的创造力可以放开用,因为错的会被自动拦下。

7. in-context 自举为什么越滚雪球越大越好

输入:一个已经攒了若干合格任务的任务库。

处理:每次让 LLM 出新题时,prompt 里都会塞进几个从库里挑出来的、已经验证通过的任务当范例(few-shot 示例)。这带来一个正向循环:库里好任务越多,能给 LLM 的参考越丰富、越多样,它写出的新任务质量和新颖度就越稳;新任务验证通过后又回流进库,让下一轮参考更好。为了不让新题总是重复老题,还会做多样性/去重控制,鼓励 LLM 往任务空间没覆盖到的角落探。于是任务库不是被一次性生成的,而是像滚雪球一样越滚越大、越滚越丰富——这正是它能规模化产出任务的核心机制。

输出:一个自我增强、随规模变强的任务生成飞轮。

8. 任务越多样,训出来的策略为什么越能打

输入:任务库里成百上千种任务采集到的示范数据。

处理:这里的因果链很直接——机器人策略的泛化能力,很大程度上取决于它训练时见过多少种不同任务。人手设计任务又慢又贵,天花板就那么高;GenSim 把任务供给这一环自动化、规模化后,多任务策略(语言条件的 CLIPort 架构)就能在远比以往丰富的任务分布上训练。见得多,才可能对没见过的新任务举一反三。论文也关心"用这些自动生成的任务预训练,能不能帮助迁移到人工设计的任务、甚至真实机器人",这正是把"自动造题"和"策略泛化"接起来的意义。

输出:一个因任务多样性而显著更能泛化的多任务机器人策略。

所以这一节是想说:LLM 把任务写成可验证的三块代码,仿真器当守门员筛掉幻觉,合格任务入库并作为示例喂回去形成自举飞轮,最后用海量多样任务训一个泛化更强的多任务策略——"代码化 + 验证闭环"是整套能成立的两块基石。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【GenSim · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

GenSim — 方法示意:核心 pipeline
Plate Nº IIGenSim — 方法示意:核心 pipeline

关键数字(What works)

GenSim 是 ICLR 2024 论文,任务库规模、成功率提升等需以原文为准,本笔记不编造。下表说明它"测什么、和谁比"。

关注点 对比对象 结果方向(原文为准) 具体数值
任务库规模 CLIPort/Ravens 原版几十任务 数量级扩张(宣称上百任务) 具体数目需读原文
多任务策略性能 只在原 benchmark 训练 GenSim 任务联训后更强 原文未在本笔记转录
任务多样性 —— 用 embedding 距离/人工验证"真新" 见原文
泛化/迁移 基线 迁到未见任务、sim-to-real 有提升 原文未在本笔记转录
消融:去掉自举 保留自举 任务通过率下降 见原文消融

提醒:任何具体数目与百分比请以 arXiv 原文(2310.01361)为准。

所以这一节是想说:核心看"任务库扩了多少 + 策略泛化提升多少 + 自举是否真有用",具体值回原文。


实验结果说明了什么

  • LLM 真能当"任务工厂":生成的任务能通过仿真验证、专家策略能解,说明"任务即代码、代码交给 LLM"这条路可行。
  • 任务多样性提升泛化:在更丰富任务上联训的多任务策略,在原 benchmark 和未见任务上都更强,印证"多样性是泛化瓶颈"这一动机。
  • 自举循环有效:去掉"任务库当示例"这一步后任务通过率下降,说明"看着旧题出新题"确实提高了生成质量。
  • 验证是关键防线:LLM 会写出跑不通或解不了的任务,仿真验证这一步把废题挡在库外,保证资产质量。

所以这一节是想说:实验证明"LLM 造题 + 验证入库 + 自举"能把任务库和策略泛化同时做大做强。


你应该懂的几个新词

Tabletop manipulation(桌面操作):机械臂在一张桌子上抓放物体的简化场景,是 manipulation 研究的"实验室小白鼠"。

Pick-and-place primitive(抓放原语):最简化的动作单元(抓起 A 放到 B),CLIPort 建立在它之上。

In-context learning(上下文学习):不更新参数、只靠 prompt 里的例子让 LLM 举一反三。

Bootstrapping(自举):模型生成的资产再喂回自己,迭代滚大。

Domain randomization(领域随机化):随机扰动仿真参数(纹理/光照/摩擦),让策略更鲁棒。

Multi-task policy(多任务策略):一个网络处理多种任务,用语言指令区分目标。

所以这一节是想说:抓住"任务即代码、pick-and-place、in-context、自举、多任务策略"这几个词,就抓住了 GenSim。


它有什么搞不定的

  • 受限于 pick-and-place 原语:GenSim 的任务建立在抓放原语上,对灵巧手(dexterous manipulation)、精细力控、连续接触任务难以直接扩展。
  • "看起来新但本质同质"的风险:LLM 生成的任务可能只是换了物体名的近亲,多样性需要额外度量验证。
  • 专家策略靠脚本:专家解法是 LLM 写的 pick-and-place 序列,对需要复杂规划或反馈控制的任务写不出好专家。
  • 仿真到真机仍有 gap:任务再多,仿真里学到的东西迁移真机仍面临 sim-to-real 差距。
  • 依赖 LLM 能力上限:LLM 不理解的物理/任务类型,它就编不出对应代码,天花板被 LLM 锁死。

所以这一节是想说:GenSim 强在"批量造桌面抓放题",但对灵巧操作、真机迁移、多样性真实性都有硬边界。


它和别的几篇是什么关系

  • CLIPort / Ravens:GenSim 的 benchmark 母体和动作原语来源;GenSim 本质是 CLIPort 的"任务工厂"。
  • Code as Policies / ProgPrompt:同样让 LLM 写代码控制机器人,但那一脉写"运行时控制代码",GenSim 写"训练时的环境和专家代码"——一个面向部署,一个面向训练数据生成。
  • RoboGen / Eurekaverse / Holodeck:同期或后续的"LLM 生成仿真任务/环境"工作,思路一脉相承,区别在生成对象(任务 vs 整个 3D 场景 vs reward 函数)。
  • Eureka:同样让 LLM 自动写 reward 代码,但 Eureka 聚焦单任务的 reward shaping,GenSim 聚焦多任务的任务定义扩展。
  • RT-1 / Open X-Embodiment:靠人类遥操作大规模采数据;GenSim 是对立方向——用仿真 + LLM 生成代替人工采集。

所以这一节是想说:GenSim 是"LLM 当数据工厂"这条思路的代表作,和 Code as Policies、Eureka、RoboGen 构成一个"LLM 写代码给机器人用"的家族。


和本导读的关系

所以这一节是想说:GenSim 落在 Ch10(LLM 规划/代码生成)与 Ch21/Ch17(数据来源)的交叉处。


思考题

Q1:为什么说"仿真任务本质是代码"是 GenSim 成立的前提?

提示

因为 LLM 最擅长写结构化文本/代码。既然任务能被表达成 Python 类(场景 + reward + 专家),LLM 就能批量生成它。

Q2:仿真验证这一步为什么不可省略?

提示

LLM 会写出跑不通或专家解不了的任务,不验证就会把废题混进库里,污染下游训练。

Q3:in-context 自举循环是怎么让新任务质量越来越好的?

提示

把库里已验证的优质任务当 prompt 示例,LLM 照着"范文"出新题,风格和可解性更有保障,库越大示例越好。

Q4:如何判断 LLM 生成的任务是"真多样"还是"换名同质"?

提示

用 embedding 距离度量任务间差异,或人工检查任务结构,避免只是换了物体名的近亲。

Q5:GenSim 能不能扩展到灵巧手或移动操作?瓶颈在哪?

提示

难。瓶颈在动作原语——pick-and-place 撑不起灵巧/连续接触任务,需要更丰富的原语和专家生成能力。

Q6:GenSim(造训练任务)和 Code as Policies(造运行时代码)在定位上有何本质区别?

提示

GenSim 面向训练数据生成(离线造题),Code as Policies 面向部署时控制(在线写执行代码)。一个喂训练,一个直接干活。

Q7:"自举循环 + 库化存储"这个模式除了造任务,还能用在哪些 LLM 应用上?

提示

任何"一次性输出可累积成资产"的场景:自动写测试、生成 reward、构建知识库、self-improving agent 等。

所以这一节是想说:想清楚这些题,你就理解了"任务即代码""验证的必要""自举的价值""原语的边界"这几件核心事。


一些好奇心问答(FAQ)

Q:GenSim 用的什么 LLM?

主要用 GPT 系列(如 GPT-4)当生成器。具体版本和 prompt 需读原文。

Q:它生成的任务能直接用于真机吗?

任务在仿真里生成和验证,迁移真机仍需处理 sim-to-real gap,不是即插即用。

Q:任务库能开源共享吗?

GenSim 提供了代码和生成的任务,社区可以继续贡献新机器人、新任务——这和 Isaac Gym 时代主要靠官方写任务不同。

Q:为什么选 CLIPort/Ravens 而不是更复杂的仿真?

因为它们的 pick-and-place 原语简单、任务能干净地代码化,最适合让 LLM 上手生成。

Q:GenSim 会不会生成危险或无意义的任务?

会生成无意义或不可解的任务,靠仿真验证过滤。危险性在桌面抓放场景中不显著。

所以这一节是想说:GenSim 的门槛不高,核心是理解"用 LLM 造代码化任务 + 验证入库自举"这一范式。


如果你想再深入

  1. 先看一个生成的任务 —— 在代码仓库找一个 sample task 类,看 LLM 写的"场景/reward/专家"三块结构。
  2. 前置:CLIPort —— 懂 pick-and-place 原语和多任务策略架构。
  3. 对照:Code as Policies —— 看"运行时代码 vs 训练时代码"的区别。
  4. 对照:Eureka / RoboGen —— 看"LLM 生成 reward / 生成场景"的邻居工作。
  5. 想复现 —— 重点研究自举循环的 prompt 设计,这是最有迁移价值的部分。

所以这一节是想说:先看一个生成任务的样子,再补 CLIPort,然后横向对比 Code as Policies/Eureka/RoboGen 理解这个家族。


原文信息

@inproceedings{wang2024gensim,
  title  = {GenSim: Generating Robotic Simulation Tasks via Large Language Models},
  author = {Wang, Lirui and others},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year   = {2024},
  note   = {arXiv:2310.01361}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_gensim_2026,
  title       = {(readable note) GenSim},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/gensim/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?