GenSim
这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。
一句话讲什么(TL;DR)
让 ChatGPT 当"出题老师",自动给机器人编一堆练习关卡,连标准答案(专家怎么解)也一起写好。
所以这一节是想说:GenSim 把"设计机器人训练任务"这件苦力活外包给大语言模型,用代码的形式批量造题。
这是个什么场景
想象你在教小孩玩积木。要让他学会各种摆法,你得自己一关一关出题:「把红积木放盒子里」「按大小排成一排」……出 100 道题就能让你出到怀疑人生。而且每道题你还得亲自演示一遍标准动作给他看。
机器人训练就是这样。研究员要手写一个个虚拟"小桌面"任务给机器人练手——任务越多机器人越聪明,但人写得过来吗?写不过来。
GenSim 的想法很直接:让 ChatGPT 这种大语言模型(LLM)来当"出题老师 + 答案老师"。它写一段 Python 代码搭出一个虚拟桌面(放哪些方块、目标摆成啥样),再写一段代码演示"标准摆法"。机器人就在这堆 LLM 出的题里反复刷题。
核心洞察:仿真任务说到底就是一段代码——而代码恰好是 LLM 最擅长写的东西之一。
大语言模型(LLM):会读写文字和代码的超大 AI,比如 GPT-4。它写代码的能力尤其强,这正是 GenSim 要借用的。
所以这一节是想说:场景是"机器人训练缺任务多样性",GenSim 用 LLM 写代码来批量生成任务。

之前的人怎么做的,为什么不够好
- 人类手写仿真任务:Meta-World、RLBench、CALVIN 等 benchmark 都是研究员一个个手工设计的,规模受限于人力(几十到一两百个任务)。
- 领域随机化(domain randomization):在已有任务上随机改纹理、光照、物体位置,扩出"变体",但任务本身的语义结构没变。
- 程序化生成(procedural generation):用规则脚本随机组合物体(如 ProcTHOR 生成房间),但规则本身仍是人写的,难以涌现新的任务类型。
- 演示数据采集:靠遥操作(teleoperation)人工演示,每条轨迹都很贵。
- 专家脚本(scripted policy):研究员针对每个任务手写个状态机当 expert,扩到新任务又要重写。
benchmark(基准):一套公认的标准测试任务,用来公平比较不同方法。任务越多越丰富,训出的策略越可能泛化。
所以这一节是想说:以前造任务靠人力,规模和多样性都被卡住,GenSim 想用 LLM 突破这个瓶颈。
这篇论文的新想法
任务多样性是策略泛化能力的瓶颈,但人类设计任务太慢。让 LLM 既写"任务定义代码"(环境长什么样、目标是什么、reward 怎么算)也写"专家策略代码"(怎么一步步把任务解掉),就能把任务库从几十个膨胀到几百上千个。
更进一步:把生成的任务存进一个"任务库",让 LLM 在生成新任务时把库里现有任务作为 in-context 示例参考,形成"自举"循环——任务越多,新任务质量越高。
in-context learning(上下文学习):不改模型参数,只在 prompt 里塞几个例子,LLM 就能照着举一反三。
自举(bootstrapping):模型自己生成的东西再拿去喂自己(或下一轮自己),靠迭代把能力/资产滚大。
所以这一节是想说:新想法 = LLM 写任务代码 + 写专家代码 + 任务库自举循环,让任务越滚越多、越滚越好。
它分几步做的(方法)
这是全篇最核心部分,按四块讲清楚"进什么、做什么、出什么"。
1. 任务的代码化表示
输入:一个想要的任务概念(比如"排序""堆叠")。
处理:先把"出一道题"拆成统一格式,就像老师出题永远要写「场景 + 评分标准 + 参考答案」三栏。GenSim 基于 Ravens / CLIPort 这类 tabletop manipulation(桌面操作)仿真环境,每个任务被表示为一个 Python 类,包含三块代码:
- 场景搭建:放哪些物体、目标位置在哪。
- reward / 成功判定:怎么算通关。
- 专家策略:用 pick-and-place 抓放原语一步步把物体摆到目标位。
输出:一段结构化的 Python 任务代码。
等等,先慢一拍——pick-and-place 原语是啥?就是把"机械臂动作"简化成两步:抓起 A,放到 B。CLIPort 这套环境里所有任务都靠这俩动作组合,所以 LLM 写"专家策略"其实就是写一串 pick-and-place 序列,难度大大降低。
pick-and-place 原语(primitive):最简化的动作单元——"抓起某物、放到某处"。复杂任务由许多这样的原语拼成。
2. 目标导向 vs 探索性两种生成模式
输入:要么一个高层任务描述,要么"随便出个新题"的指令。
处理:像两种出题思路——
- 目标导向(按大纲出题):给 LLM 一个高层描述("做一个排序任务"),让它写对应代码。保证覆盖已知概念。
- 探索性(自由发挥):让 LLM 在已有任务库基础上提出新颖任务。制造惊喜、扩展任务空间。
输出:一批候选任务代码。
两种模式互补:前者覆盖已知,后者拓展未知。
3. 任务库 + in-context 自举
输入:LLM 生成的候选任务代码 + 现有任务库。
处理:像学生写作文总要参考几篇范文。生成的代码先丢进仿真器跑一遍验证——能跑通且专家策略能解出来才算合格,通过的存入"任务库"。下一轮生成时,LLM 的 prompt 里塞几个库里的样例当参考,相当于"看着以前的题出新题",库越大新题质量越稳。
输出:一个不断增长、经过验证的任务库。
这一步是论文最有迁移价值的工程细节:用"生成 → 验证 → 入库 → 作为下一轮示例"的循环,把 LLM 的一次性输出变成可累积的资产。
4. 下游策略训练
输入:任务库里的大量任务。
处理:题出好了就让机器人做题。批量跑专家策略采集数据,喂给一个语言条件的多任务策略(multi-task policy,基于 CLIPort 架构)。
输出:一个在丰富任务上训练过、泛化更强的机器人策略。具体训练规模和数据量需读原文。
multi-task policy(多任务策略):一个网络处理多种任务,通常用语言指令区分要做哪件事。
ASCII 总览:
任务概念/自由发挥 ──► [LLM 写代码]
│ 三块:场景 + reward + 专家策略
▼
候选任务代码 ──► [仿真器验证]
│ 跑得通且能解?
验证通过 │ ▼ 否→丢弃
▼
┌───► 任务库(不断增长)───┐
│ │作为下一轮示例 │
└────────┘(in-context 自举)
│
▼
批量采数据 → 训练多任务策略
5. 为什么非要"写成代码",而不是让 LLM 用自然语言描述任务
这是 GenSim 最关键、也最容易被忽略的设计决定。
输入:一个"我想要一个新任务"的念头。
处理:如果让 LLM 用自然语言描述任务("把红块放到蓝盘上"),你会遇到一个死结——这句话没法自动验证对错,也没法直接拿来训练。自然语言含糊、可以随便编,LLM 说得天花乱坠你也不知道这个任务在仿真里到底能不能成立。GenSim 的破局点是让 LLM 直接输出可执行的 Python 代码:场景搭建代码、成功判定代码、专家策略代码。代码有个自然语言没有的硬性质——它要么能跑、要么报错,一试便知。这就把"LLM 出题"从一个无法检验的创意活,变成了一个可以被仿真器当场判分的工程活。
输出:一段能被机器直接执行、直接验真的任务定义。
打个比方:让人"口头描述一道菜"很容易吹牛,但让他"写出能照着做出成品的完整菜谱",好不好当场下锅一试就知道。代码就是那份能下锅的菜谱。
6. 验证闭环怎么把 LLM 的"一本正经胡说"挡在门外
输入:LLM 生成的候选任务代码。
处理:大家都知道 LLM 会幻觉——它可能写出语法对但物理上根本解不出的任务,或者专家策略压根摆不到目标位。GenSim 不信任 LLM 的任何一次输出,而是让每份代码都过两道闸:一是能不能在仿真器里无错跑起来(语法、API 用对没有),二是内置的专家策略能不能真把任务解到成功判定通过(这个任务是不是真的可解、可达标)。两关都过才准入库,否则直接丢弃。这一步等于给 LLM 装了个"事实核查员",把幻觉产物在进入训练数据前就筛掉。质量不靠 LLM 自觉,靠仿真器这个客观裁判。
输出:一个只含"可执行 + 可解 + 达标"任务的干净任务库。
所以这一节是想说:仿真器是这套系统的守门员,它让 LLM 的创造力可以放开用,因为错的会被自动拦下。
7. in-context 自举为什么越滚雪球越大越好
输入:一个已经攒了若干合格任务的任务库。
处理:每次让 LLM 出新题时,prompt 里都会塞进几个从库里挑出来的、已经验证通过的任务当范例(few-shot 示例)。这带来一个正向循环:库里好任务越多,能给 LLM 的参考越丰富、越多样,它写出的新任务质量和新颖度就越稳;新任务验证通过后又回流进库,让下一轮参考更好。为了不让新题总是重复老题,还会做多样性/去重控制,鼓励 LLM 往任务空间没覆盖到的角落探。于是任务库不是被一次性生成的,而是像滚雪球一样越滚越大、越滚越丰富——这正是它能规模化产出任务的核心机制。
输出:一个自我增强、随规模变强的任务生成飞轮。
8. 任务越多样,训出来的策略为什么越能打
输入:任务库里成百上千种任务采集到的示范数据。
处理:这里的因果链很直接——机器人策略的泛化能力,很大程度上取决于它训练时见过多少种不同任务。人手设计任务又慢又贵,天花板就那么高;GenSim 把任务供给这一环自动化、规模化后,多任务策略(语言条件的 CLIPort 架构)就能在远比以往丰富的任务分布上训练。见得多,才可能对没见过的新任务举一反三。论文也关心"用这些自动生成的任务预训练,能不能帮助迁移到人工设计的任务、甚至真实机器人",这正是把"自动造题"和"策略泛化"接起来的意义。
输出:一个因任务多样性而显著更能泛化的多任务机器人策略。
所以这一节是想说:LLM 把任务写成可验证的三块代码,仿真器当守门员筛掉幻觉,合格任务入库并作为示例喂回去形成自举飞轮,最后用海量多样任务训一个泛化更强的多任务策略——"代码化 + 验证闭环"是整套能成立的两块基石。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【GenSim · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
GenSim 是 ICLR 2024 论文,任务库规模、成功率提升等需以原文为准,本笔记不编造。下表说明它"测什么、和谁比"。
| 关注点 | 对比对象 | 结果方向(原文为准) | 具体数值 |
|---|---|---|---|
| 任务库规模 | CLIPort/Ravens 原版几十任务 | 数量级扩张(宣称上百任务) | 具体数目需读原文 |
| 多任务策略性能 | 只在原 benchmark 训练 | GenSim 任务联训后更强 | 原文未在本笔记转录 |
| 任务多样性 | —— | 用 embedding 距离/人工验证"真新" | 见原文 |
| 泛化/迁移 | 基线 | 迁到未见任务、sim-to-real 有提升 | 原文未在本笔记转录 |
| 消融:去掉自举 | 保留自举 | 任务通过率下降 | 见原文消融 |
提醒:任何具体数目与百分比请以 arXiv 原文(2310.01361)为准。
所以这一节是想说:核心看"任务库扩了多少 + 策略泛化提升多少 + 自举是否真有用",具体值回原文。
实验结果说明了什么
- LLM 真能当"任务工厂":生成的任务能通过仿真验证、专家策略能解,说明"任务即代码、代码交给 LLM"这条路可行。
- 任务多样性提升泛化:在更丰富任务上联训的多任务策略,在原 benchmark 和未见任务上都更强,印证"多样性是泛化瓶颈"这一动机。
- 自举循环有效:去掉"任务库当示例"这一步后任务通过率下降,说明"看着旧题出新题"确实提高了生成质量。
- 验证是关键防线:LLM 会写出跑不通或解不了的任务,仿真验证这一步把废题挡在库外,保证资产质量。
所以这一节是想说:实验证明"LLM 造题 + 验证入库 + 自举"能把任务库和策略泛化同时做大做强。
你应该懂的几个新词
Tabletop manipulation(桌面操作):机械臂在一张桌子上抓放物体的简化场景,是 manipulation 研究的"实验室小白鼠"。
Pick-and-place primitive(抓放原语):最简化的动作单元(抓起 A 放到 B),CLIPort 建立在它之上。
In-context learning(上下文学习):不更新参数、只靠 prompt 里的例子让 LLM 举一反三。
Bootstrapping(自举):模型生成的资产再喂回自己,迭代滚大。
Domain randomization(领域随机化):随机扰动仿真参数(纹理/光照/摩擦),让策略更鲁棒。
Multi-task policy(多任务策略):一个网络处理多种任务,用语言指令区分目标。
所以这一节是想说:抓住"任务即代码、pick-and-place、in-context、自举、多任务策略"这几个词,就抓住了 GenSim。
它有什么搞不定的
- 受限于 pick-and-place 原语:GenSim 的任务建立在抓放原语上,对灵巧手(dexterous manipulation)、精细力控、连续接触任务难以直接扩展。
- "看起来新但本质同质"的风险:LLM 生成的任务可能只是换了物体名的近亲,多样性需要额外度量验证。
- 专家策略靠脚本:专家解法是 LLM 写的 pick-and-place 序列,对需要复杂规划或反馈控制的任务写不出好专家。
- 仿真到真机仍有 gap:任务再多,仿真里学到的东西迁移真机仍面临 sim-to-real 差距。
- 依赖 LLM 能力上限:LLM 不理解的物理/任务类型,它就编不出对应代码,天花板被 LLM 锁死。
所以这一节是想说:GenSim 强在"批量造桌面抓放题",但对灵巧操作、真机迁移、多样性真实性都有硬边界。
它和别的几篇是什么关系
- CLIPort / Ravens:GenSim 的 benchmark 母体和动作原语来源;GenSim 本质是 CLIPort 的"任务工厂"。
- Code as Policies / ProgPrompt:同样让 LLM 写代码控制机器人,但那一脉写"运行时控制代码",GenSim 写"训练时的环境和专家代码"——一个面向部署,一个面向训练数据生成。
- RoboGen / Eurekaverse / Holodeck:同期或后续的"LLM 生成仿真任务/环境"工作,思路一脉相承,区别在生成对象(任务 vs 整个 3D 场景 vs reward 函数)。
- Eureka:同样让 LLM 自动写 reward 代码,但 Eureka 聚焦单任务的 reward shaping,GenSim 聚焦多任务的任务定义扩展。
- RT-1 / Open X-Embodiment:靠人类遥操作大规模采数据;GenSim 是对立方向——用仿真 + LLM 生成代替人工采集。
所以这一节是想说:GenSim 是"LLM 当数据工厂"这条思路的代表作,和 Code as Policies、Eureka、RoboGen 构成一个"LLM 写代码给机器人用"的家族。
和本导读的关系
- 主线章节:Ch10 高层规划。GenSim 把 LLM 用作"任务/代码生成器",是 LLM 赋能机器人的一种范式。
- 数据与仿真:Ch17 Sim-to-Real 与 Ch21 数据集全景。GenSim 关心的正是"训练数据从哪来"这个核心问题。
所以这一节是想说:GenSim 落在 Ch10(LLM 规划/代码生成)与 Ch21/Ch17(数据来源)的交叉处。
思考题
Q1:为什么说"仿真任务本质是代码"是 GenSim 成立的前提?
提示
因为 LLM 最擅长写结构化文本/代码。既然任务能被表达成 Python 类(场景 + reward + 专家),LLM 就能批量生成它。
Q2:仿真验证这一步为什么不可省略?
提示
LLM 会写出跑不通或专家解不了的任务,不验证就会把废题混进库里,污染下游训练。
Q3:in-context 自举循环是怎么让新任务质量越来越好的?
提示
把库里已验证的优质任务当 prompt 示例,LLM 照着"范文"出新题,风格和可解性更有保障,库越大示例越好。
Q4:如何判断 LLM 生成的任务是"真多样"还是"换名同质"?
提示
用 embedding 距离度量任务间差异,或人工检查任务结构,避免只是换了物体名的近亲。
Q5:GenSim 能不能扩展到灵巧手或移动操作?瓶颈在哪?
提示
难。瓶颈在动作原语——pick-and-place 撑不起灵巧/连续接触任务,需要更丰富的原语和专家生成能力。
Q6:GenSim(造训练任务)和 Code as Policies(造运行时代码)在定位上有何本质区别?
提示
GenSim 面向训练数据生成(离线造题),Code as Policies 面向部署时控制(在线写执行代码)。一个喂训练,一个直接干活。
Q7:"自举循环 + 库化存储"这个模式除了造任务,还能用在哪些 LLM 应用上?
提示
任何"一次性输出可累积成资产"的场景:自动写测试、生成 reward、构建知识库、self-improving agent 等。
所以这一节是想说:想清楚这些题,你就理解了"任务即代码""验证的必要""自举的价值""原语的边界"这几件核心事。
一些好奇心问答(FAQ)
Q:GenSim 用的什么 LLM?
主要用 GPT 系列(如 GPT-4)当生成器。具体版本和 prompt 需读原文。
Q:它生成的任务能直接用于真机吗?
任务在仿真里生成和验证,迁移真机仍需处理 sim-to-real gap,不是即插即用。
Q:任务库能开源共享吗?
GenSim 提供了代码和生成的任务,社区可以继续贡献新机器人、新任务——这和 Isaac Gym 时代主要靠官方写任务不同。
Q:为什么选 CLIPort/Ravens 而不是更复杂的仿真?
因为它们的 pick-and-place 原语简单、任务能干净地代码化,最适合让 LLM 上手生成。
Q:GenSim 会不会生成危险或无意义的任务?
会生成无意义或不可解的任务,靠仿真验证过滤。危险性在桌面抓放场景中不显著。
所以这一节是想说:GenSim 的门槛不高,核心是理解"用 LLM 造代码化任务 + 验证入库自举"这一范式。
如果你想再深入
- 先看一个生成的任务 —— 在代码仓库找一个 sample task 类,看 LLM 写的"场景/reward/专家"三块结构。
- 前置:CLIPort —— 懂 pick-and-place 原语和多任务策略架构。
- 对照:Code as Policies —— 看"运行时代码 vs 训练时代码"的区别。
- 对照:Eureka / RoboGen —— 看"LLM 生成 reward / 生成场景"的邻居工作。
- 想复现 —— 重点研究自举循环的 prompt 设计,这是最有迁移价值的部分。
所以这一节是想说:先看一个生成任务的样子,再补 CLIPort,然后横向对比 Code as Policies/Eureka/RoboGen 理解这个家族。
原文信息
- 标题:GenSim: Generating Robotic Simulation Tasks via Large Language Models
- arXiv:https://arxiv.org/abs/2310.01361
- 会议:ICLR 2024
- 年份:2024
@inproceedings{wang2024gensim,
title = {GenSim: Generating Robotic Simulation Tasks via Large Language Models},
author = {Wang, Lirui and others},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2024},
note = {arXiv:2310.01361}
}
BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。
◼
引用本笔记 / Cite this note
@online{eai_gensim_2026,
title = {(readable note) GenSim},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/gensim/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?