Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
High-Level Planning · Plate Nº 84

VoxPoser

13 min read · 4597 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

VoxPoser 让大模型给机器人画两张 3D 地图:红色地方要去、灰色地方要躲,机器人照着地图规划出动作——全程不训练任何新模型。

所以这一节是想说:VoxPoser 用"LLM 写代码生成 3D 代价场 + 零训练规划器执行"实现开放语言指令的机器人操作。


这是个什么场景

你跟外卖小哥说:"帮我把这杯奶茶放阳台桌左边,别被狗碰到,路过客厅时离婴儿床远一点。"小哥会脑补一张房间地图:阳台桌左边画个"目的地"圆圈,狗窝和婴儿床各画个"绕行"红圈,然后挑一条路绕过去。

这条指令里其实混着三种信息:

  • 目标("放阳台桌左边"——某个 3D 位置要被靠近)
  • 约束("别被狗碰到"——某些区域要被避开)
  • 偏好(隐性的速度/姿态参数)

机器人也要做同样的事,但难点在:以前的做法是工程师提前把每种动词都写成 API("放在哪""避开什么"),动词没列进去就抓瞎。VoxPoser 换思路:让大模型当场对着房间画那张"红圈 + 绕行圈"的地图,机器人顺着地图走。地图不是预先准备的,是 LLM 现场画的——指令变了,地图就跟着变。

体素场(voxel field):把 3D 空间切成均匀小方块(体素),每个方块存一个数值。可以理解成"3D 版的灰度图"。VoxPoser 画的两张地图就是体素场。

所以这一节是想说:VoxPoser 面对的是"机器人只会执行工程师预写的动词、没见过的指令就抓瞎"这个泛化瓶颈。


VoxPoser — 场景示意:这论文要解决的现实问题
Plate Nº IVoxPoser — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 行为克隆 / RT-1 / RT-2 路线:收集大量 (语言, 图像, 动作) 三元组训端到端策略。问题:每个新动词都要新数据。
  • SayCan / Code-as-Policies:让 LLM 把指令拆成预定义技能(pick/place/open)的组合。问题:受限于技能库边界,没见过的组合易失败。
  • 传统运动规划 + 手写代价函数:每个任务由工程师设计 cost function。问题:写不动、泛化不了。
  • 基于学习的世界模型 + RL:训练成本极高,sim-to-real 难。
  • 关键缺口:上述路线要么"动作端"要么"任务端"硬编码,缺一个能把开放语言直接映射到 3D 空间几何约束的桥梁。

所以这一节是想说:以前要么靠堆数据、要么靠固定技能库、要么靠手写代价函数,都没法把任意自然语言直接变成机器人能用的空间约束。


这篇论文的新想法

核心 insight:LLM 已经懂"靠近/避开/经过/对齐"这些空间动词,VLM 已经懂场景里有哪些物体,缺的只是把这两件事翻译成机器人能用的几何表达。

VoxPoser 的赌注是——这个翻译不需要再训一个模型,而是让 LLM 直接生成"调用 VLM 找物体 + 在 3D 体素网格上写值"的 Python 代码。代码跑完,得到两张体素场:

  • Affordance map(亲和力场):值越高代表越想去。
  • Constraint map(代价/约束场):值越高代表越要避。

然后用一个无优化(zero-shot)的运动规划器,在两张场上做梯度下降式的轨迹合成。整个流程没有任务专属训练。

所以这一节是想说:VoxPoser 的新意是"让基础模型生成中间的几何表达(代价场),而不是直接生成动作",从而零训练地支持开放语言。


它分几步做的(方法)

这一节是全篇核心,拆成"LLM 写代码、VLM 锚定几何、体素场合成、闭环更新"四段。

整体数据流 ASCII 示意:

   指令 ─► LLM 写 Python 代码 ─► 调用 detect(物体) ─► VLM(OWL-ViT) 定位 ─► 3D 坐标
                                  在体素场上写值: 目标处写高斯峰(吸引), 障碍处写倒高斯(排斥)
   两张体素场叠加 ─► 总代价场 C(x) ─► 零训练规划器搜最小代价轨迹 ─► 执行
   执行中周期重调 VLM ─► 更新体素场(动态纠错)

第 1 步:LLM 当指挥官——写代码而不是写动作

输入:一条自然语言指令("把抽屉里的瓶子放到水槽旁边,但别碰到刀")。

处理:把指令喂给 LLM,让它输出一段 Python 代码。代码调用一组预定义的"原语函数":detect(物体名) 返回 VLM 给的 3D 位置/mask;get_empty_voxel_map() 给一张空体素场;然后 LLM 在这张场上写值——比如在水槽附近写一个高斯峰(吸引),在刀的位置写一个倒高斯(排斥)。

输出:一段可执行代码,跑完得到两张体素场。

第 2 步:VLM 当眼睛——把语言锚到几何上

输入:LLM 发出的指令,如"找瓶子在哪里"。

处理:LLM 不直接看图,它发指令,由 OWL-ViT / CLIP 类的开放词汇检测器在 RGB-D 图上定位物体,再投影回 3D 得到坐标。这一步把"瓶子"这个抽象 token 变成体素索引 (i, j, k)。

输出:物体的 3D 位置/mask,供代码在体素场上写值。

开放词汇检测(open-vocabulary detection):传统检测器只认训练见过的类(COCO 80 类),开放词汇检测器(OWL-ViT、Detic)能识别任意名词。VoxPoser 靠它把"那个红色的杯子"变成一个框。

第 3 步:体素场合成 + 规划器执行

输入:两张体素场(亲和力 + 约束)。

处理:叠加成一个总代价场:

C(x) = -Affordance(x) + λ · Constraint(x)

人话翻译:想去的地方代价低(负的亲和力),要躲的地方代价高(正的约束),λ 是"多怕撞"的权重。一个简单的轨迹优化器(论文用 greedy + 模型预测控制类思路)从机器人当前位置出发,在场上找一条总代价最小的路径。因为场是稠密的,规划器不需要符号级别的子目标。

输出:一条可执行的动作轨迹。

等等,先慢一拍——为什么不让 LLM 直接输出动作?

因为让 LLM 直接吐"关节角度序列"既不准也不可调试。让它输出代码 + 几何场这种中间表达,好处是:可读(你能看懂它想干嘛)、可调试(哪一步写错值一眼看出)、可组合(换个物体换个约束就改几行)。这就是 VoxPoser 相比"端到端黑盒 VLA"最大的方法论差异。

第 4 步:闭环 + 动态更新

输入:执行过程中的实时场景。

处理:场景变化(被推动的物体、新出现的障碍)通过周期性重新调用 VLM 检测来更新体素场。这让 VoxPoser 在动态环境(人手干扰、物体被移动)里仍能纠错。

输出:随环境实时调整的轨迹。具体重规划频率和场分辨率需查原文。

等等,先慢一拍——为什么 VoxPoser 敢"零训练"就上手新任务?

一般机器人策略要会一个新任务,得先收集这个任务的演示数据、再训练一个策略,换个任务又得重来。VoxPoser 绕开了这一整套。它的诀窍是把"任务理解"和"物理执行"彻底解耦:任务理解交给现成的大模型——LLM 已经从海量文本里学过"擦桌子要避开杯子""把刀放远离小孩"这类常识,VLM 已经会在图里认出杯子、刀、小孩在哪;VoxPoser 要做的只是让 LLM 写几行代码,调用 VLM 把这些常识翻译成一张"哪里该去、哪里该躲"的三维代价场。而物理执行交给一个通用的轨迹优化器——它不认识"擦桌子"这个概念,只会在给定的代价场上找一条代价最低的路。因为这两部分都不需要针对具体任务训练(一个靠预训练大模型的通识、一个是通用优化器),换个新指令时只是让 LLM 重写一段代码、生成一张新的场,规划器照跑不误。这就是"零样本泛化到新任务"的底层逻辑,也是它和需要逐任务训练的端到端 VLA 最大的分野。

所以这一节是想说:VoxPoser 的方法 = LLM 写代码 + VLM 锚定 3D + 代价场合成 + 零训练规划器 + 闭环重算,五步把开放语言变成可执行、可纠错的动作,而"任务理解靠预训练大模型、物理执行靠通用优化器"的解耦正是它零训练泛化的根基。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【VoxPoser · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

VoxPoser — 方法示意:核心 pipeline
Plate Nº IIVoxPoser — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体成功率/任务条数请查原文,此处不编造。

维度 说明
训练量 零(不训练任何新策略)
中间表达 两张体素场(亲和力 + 约束)
LLM 角色 写调用 VLM + 操作体素场的 Python 代码
VLM 角色 开放词汇检测把语言锚到 3D
规划器 零训练轨迹优化(greedy + MPC 类)
评测 RLBench 仿真 + Franka 类真机
卖点 开放语言 + 零训练 + 动态纠错 + 真机可跑

关键结论:VoxPoser 能执行训练数据里完全没见过的指令组合(zero-shot 长尾),在动态干扰下仍能完成(因为场会重算),且不需要预定义技能库。这三点是它相对 SayCan/RT 路线的核心优势。

所以这一节是想说:数字告诉我们,零训练也能做开放语言操作,而且靠体素场重算获得了动态纠错能力。


实验结果说明了什么

论文在仿真和真机上都做了实验。仿真用 RLBench 等基准评估"自由形式指令"的成功率,与 Code-as-Policies、传统 BC 等对比。真机用桌面机械臂(Franka 类)做"开抽屉、避开人手、按颜色分类、跟随移动目标"等任务。

亮点:

  • 任务可以是训练数据里完全没见过的组合(zero-shot 长尾)。
  • 在动态干扰下仍能完成(因为场会重算)。
  • 与 SayCan 类方法相比无需预定义技能库。

具体成功率、任务条数、与基线的对比百分比需查原文。

所以这一节是想说:实验证明"生成几何中间表达"这个思路真能在真机上零训练地做开放语言操作,且抗动态干扰。


你应该懂的几个新词

  • 体素场(voxel field):把 3D 空间切成小方块、每块存一个数值的表示,"3D 版灰度图"。
  • 亲和力图(affordance map):值越大代表越值得去/越适合做某动作。词源来自 Gibson 的 affordance 心理学。
  • 约束/代价图(constraint map):和亲和力互补,值越大越要避开。
  • 开放词汇检测:能识别任意名词的检测器(OWL-ViT、Detic),不限于固定类别。
  • 零样本运动规划(zero-shot motion planning):规划器不需任务专属训练,给定代价场就能搜轨迹。
  • LLM-as-code-writer:不让 LLM 直接输出动作,而让它输出可执行代码——可读、可调试、可组合。源自 Code-as-Policies。

所以这一节是想说:这几个词是理解"基础模型 + 几何中间表达 + 零训练控制"这条线的通用语。


它有什么搞不定的

  • LLM 会写错代码:指令复杂时 LLM 生成的代码逻辑或数值可能出错,直接导致场画错、动作离谱。
  • VLM 检测是瓶颈:物体检测错了(找错杯子、漏检),后面全崩。开放词汇检测在杂乱/遮挡场景不稳。
  • 体素场表达有限:适合"位置吸引/排斥"这类空间约束,难表达"以某个角度插入""保持接触力"等更复杂的操作约束。
  • 依赖 RGB-D:投影回 3D 需要深度信息,纯 RGB 场景要额外估计深度。
  • 规划器简单:零训练规划器处理不了需要精细动力学或长程复杂序列的任务。

所以这一节是想说:VoxPoser 的短板集中在"LLM/VLM 出错就崩、体素场表达力有限"上——它清晰可调试,但能力天花板受中间表达限制。


它和别的几篇是什么关系

  • 直接前辈Code-as-Policies(同组,2022)——LLM 写代码调技能;VoxPoser 把"技能"换成"几何场操作",更细粒度。
  • 同期对照SayCan(2022)——LLM 选技能,技能库受限;VoxPoser 不要技能库。
  • 共用工具:VLM 检测部分和 PaLM-E、CLIPort 等"语言锚到 3D"工作共享思路。
  • 后继发展:ReKep(2024)、CoPa、ManipLLM 等把"几何约束"推得更远——从体素场扩展到关键点关系、SDF 等表达。
  • 互补路线Diffusion PolicyOpenVLAPi0 走"训练大策略"路线,VoxPoser 走"零训练 + 几何中间表达"路线。两条路在 2024-2025 开始融合(用 VLM 写 cost、再用扩散采轨迹)。

所以这一节是想说:VoxPoser 是"让基础模型生成几何中间表达"这个范式的开创性代表,衍生出一整支关键点/约束系列工作。


和本导读的关系

本篇对应导读 Ch10: 规划。Ch10 讲 LLM 怎么帮机器人做任务规划,其中一条重要分支就是"LLM 不直接给动作,而是给中间表达"。VoxPoser 是这条分支最清晰的样本——它证明了让 LLM 生成"几何代价场"这种可读、可调试的中间表达,能零训练地支持开放语言操作。读完本篇,配合同章的 SayCan(技能库路线)、Code-as-Policies(写代码路线)、Tree-Planner(树规划),能看清 LLM 规划的多种范式。

所以这一节是想说:把 VoxPoser 放进 Ch10 的规划主线里读,它是"LLM 生成几何中间表达"这一格的开创者。


思考题

Q1:为什么 VoxPoser 让 LLM 写代码 + 生成体素场,而不是直接输出动作?

提示

代码 + 几何场是可读、可调试、可组合的中间表达。直接输出关节动作既不准也是黑盒,出错没法排查。中间表达让"语言→几何→动作"每一步都看得见。

Q2:亲和力场和约束场为什么要分成两张,而不是合成一张?

提示

分开画更清晰、更好调("想去哪"和"要躲什么"是两类语义),最后用带权重 λ 叠加成总代价场。分离也让 LLM 生成代码时逻辑更简单。

Q3:VoxPoser 号称"零训练",那它的能力从哪来?

提示

来自预训练好的 LLM(懂空间动词)和 VLM(懂物体在哪)。VoxPoser 只是把这两个现成模型的能力"翻译"成几何场,自己不学任何新参数。

Q4:如果 VLM 把"刀"检测错位置,会发生什么?这暴露了什么依赖?

提示

约束场的排斥峰会画在错误位置,机器人可能撞到真正的刀。这暴露了 VoxPoser 对 VLM 检测精度的强依赖——感知错了,后面全崩。

Q5:体素场适合表达哪类约束、不适合哪类?

提示

适合"靠近某点/避开某区域"这类空间位置约束。不适合"以特定角度插入""保持某个接触力""对齐两个物体的轴"这类需要姿态/力/关系的复杂约束——这正是 ReKep 用关键点关系来补的。

Q6:VoxPoser(零训练 + 几何表达)和 OpenVLA(训练大策略)怎么可能融合?

提示

用 VLM/LLM 生成代价场或关键点约束当"高层指导",再用训练好的扩散策略在这个约束下采精细动作。高层可解释 + 底层强执行,各取所长。这是 2024-2025 的融合趋势。

所以这一节是想说:这几个问题带你把"中间表达、零训练来源、感知依赖、表达力边界、范式融合"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:VoxPoser 真的完全不训练吗?

是的,不训练任何新策略/模型。它靠现成的 LLM + 开放词汇 VLM + 零训练规划器组合。这是它最大的卖点之一。

Q2:它能跑多复杂的任务?

擅长"靠近/避开/经过"这类空间任务,尤其开放语言、动态干扰场景。但对精细接触、复杂长程序列力不从心。

Q3:需要什么硬件?

需要 RGB-D 相机(做 3D 投影)+ 一个机械臂(如 Franka)。LLM 和 VLM 可以是 API 或本地模型。

Q4:它和 SayCan 到底差在哪?

SayCan 从固定技能库里选技能,没见过的组合会失败。VoxPoser 不用技能库,直接让 LLM 画几何场,泛化到新指令更好,还能动态纠错。

Q5:为什么后来有 ReKep?

因为体素场只能表达位置吸引/排斥,表达不了"以某角度插入""对齐两轴"这类关系约束。ReKep 用关键点关系约束把表达力推得更远,是 VoxPoser 的精神续作。

Q6:读完 VoxPoser 接下来看什么?

想看前辈看 Code-as-PoliciesSayCan;想看续作看 ReKep;想看对照的训练派看 OpenVLADiffusion Policy

所以这一节是想说:真不训练吗、什么硬件、和 SayCan 差在哪、为什么有 ReKep——这些实操问题都有明确答案。


如果你想再深入

按"前辈 → 对照 → 续作"排序:

  1. 前辈:Code-as-Policies —— LLM 写代码调技能,VoxPoser 的直接来源。
  2. 对照:SayCan —— 技能库路线,看 VoxPoser 去掉技能库后的取舍。
  3. 续作:ReKep / CoPa —— 把几何约束从体素场推到关键点关系。
  4. 融合:Diffusion Policy / OpenVLA —— 训练派,看两条路怎么融合。

所以这一节是想说:把 Code-as-Policies + SayCan + VoxPoser + ReKep 连起来读,就能看懂"LLM 生成中间表达"这条线的演化。


原文信息

  • 标题:VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models
  • arXiv:https://arxiv.org/abs/2307.05973
  • 会议:CoRL 2023
  • 年份:2023

BibTeX:

@inproceedings{huang2023voxposer,
  title     = {VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models},
  author    = {Huang, Wenlong and Wang, Chen and Zhang, Ruohan and Li, Yunzhu and Wu, Jiajun and Fei-Fei, Li},
  booktitle = {Conference on Robot Learning (CoRL)},
  year      = {2023},
  url       = {https://arxiv.org/abs/2307.05973}
}

所以整篇是想说:VoxPoser 让大模型给机器人画"去哪、躲哪"的 3D 地图,机器人零训练地照图走——它开创了"让基础模型生成几何中间表达而非直接生成动作"这个既可解释又能泛化的范式。

引用本笔记 / Cite this note
BibTeX
@online{eai_voxposer_2026,
  title       = {(readable note) VoxPoser},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/voxposer/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?