Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 63

Behavior Generation with Latent Actions (VQ-BeT)

13 min read · 4406 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

机器人本来要画一条平滑曲线动作,VQ-BeT 让它改成"先从菜单里选一个动作词、再小修一点"——就像挑表情包再加文字,比硬画曲线更不容易出怪招,还比扩散策略快得多。

所以这一节是想说:VQ-BeT 用"残差 VQ 把动作离散成词 + Transformer 预测词 + 小偏移微调"解决模仿学习的多模态难题,且单步推理很快。


这是个什么场景

你妈让你"去把门打开",你录了 100 次自己开门的视频想教弟弟。问题是这 100 次每次都不太一样:有时先伸右手、有时先扭手腕、有时顺时针拧、有时逆时针拧。如果弟弟看完视频去算"所有示范的平均动作",他会学出一个谁都不像的怪动作——手悬在半空、不左不右地哆嗦。

这就是模仿学习的老毛病:同一个起点有好几个合理答案(叫多模态),平均一下就变成四不像。

VQ-BeT 换思路:先把所有动作风格整理成一本"动作菜单"——比如菜单里有"轻拧""猛拧""先抬手再拧"几道菜。机器人下一步先从菜单里勾一道菜(这一步是"二选一三选一",不会被平均掉),再根据当前情况把数值微调一下("猛拧但偏左 5 度")。选菜是离散的所以稳,微调是连续的所以准。

多模态行为(multi-modal behavior):同一个状态下有多个都合理的动作。用均方误差(MSE)直接拟合会把它们平均成一个谁也不像的动作——模仿学习的头号痛点。

所以这一节是想说:VQ-BeT 面对的是"专家演示同一情况有多种做法、直接回归会平均成四不像"这个模仿学习老大难。


Behavior Generation with Latent Actions (VQ-BeT) — 场景示意:这论文要解决的现实问题
Plate Nº IBehavior Generation with Latent Actions (VQ-BeT) — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 行为克隆 BC + MSE 回归:把动作当连续值直接拟合,多模态场景下只能学到平均,得到"四不像"。
  • 混合高斯(MDN)/ 能量模型(IBC):能建多模态分布,但训练不稳、长 horizon 易塌缩。
  • BeT(Behavior Transformer,VQ-BeT 前作):先用 k-means 把动作聚成 K 个 bin,Transformer 预测哪个 bin + 一个连续偏移量。问题是 k-means 一次性聚类、不可学习、不分层,动作越复杂越糙。
  • Diffusion Policy:用扩散从噪声逐步去噪生成动作,能多模态,但推理要跑很多步、慢。
  • 隐式策略 / 自回归连续 Transformer:直接让 Transformer 出连续值,依然要面对回归的多模态塌缩。

所以这一节是想说:以前要么回归被平均、要么建多模态但慢/不稳,没人同时做到"多模态、快、稳"。


这篇论文的新想法

把 BeT 里那个"k-means 聚类 + 偏移量"整体换成残差 VQ-VAE。两层关键升级:

  1. VQ 而不是 k-means:VQ-VAE 的码本(codebook)是端到端可学的(梯度通过 straight-through estimator 反传),聚类中心随训练迁移,比 k-means 一次性硬聚类更贴动作分布。
  2. Residual(残差)而不是单层:把动作分两步量化——第一层码本编码"粗略动作类别",第二层码本编码"在第一层之上的精细修正"。相当于先选"猛拧",再选"猛拧里的偏左 5 度"。两层离散码的笛卡尔积提供远超单层的表达力,又不损失离散性带来的多模态稳定性。

下游 Transformer 头变成"预测两层离散码 + 一个小的连续偏移量"的多任务输出:离散码处理"选哪种风格",偏移量处理"具体数值微调"。

所以这一节是想说:VQ-BeT 的新意是把动作离散化从"一次性 k-means"升级成"端到端可学的残差 VQ",兼顾多模态稳定和精细表达。


它分几步做的(方法)

这一节是全篇核心,拆成"编动作菜单、看场景挑菜、组装动作、为什么解决四不像"四块。

整体流程 ASCII 示意:

阶段一(离线): 专家动作 chunk ─► 残差 VQ-VAE ─► 码本1(粗类) + 码本2(精修)  ← 学出"动作菜单"
阶段二(策略): 观测历史 ─► GPT 式 Transformer ─► 预测 码1(分类) + 码2(分类) + 偏移(回归)
阶段三(推理): 查码本 ─► 向量 + 偏移 ─► VQ 解码器 ─► 连续动作   (一步出结果, 不去噪)

第 1 步:先编一本动作菜单——训练残差 VQ-VAE

输入:专家示范的动作序列,切成 action chunk(连续几步的动作打包成一段)。

处理:像出版社编菜谱——把动作丢给 VQ-VAE,它在一本"码本(动作菜单)"里找最像的那一项;若还差点意思,就把"差的那部分(残差)"再去第二本码本查一次,等于"先选大类、再选小调整"。这步只看动作本身,不看环境画面。

输出:两本训练好的码本(粗类 + 精修)+ 一个能把离散码还原成连续动作的解码器。

等等,先慢一拍——VQ-VAE 是什么?把它想成一台"用菜单代替原始数据"的机器:你给它一段连续数字,它强行把这段翻译成菜单里某个固定编号(比如"3 号")。要训练的就是这本菜单的编号到底代表什么。

action chunk(动作块):一次表示/预测未来连续几步动作,而非只一步。能减少推理频次、抑制误差累积。

第 2 步:教机器人看场景挑菜——训练状态条件的 Transformer

输入:机器人最近几步的观测(画面、摸到的东西、之前做过的动作)。

处理:用一个 GPT 风格的 Transformer,输出三样东西——第一本菜单选几号(分类)、第二本菜单选几号(分类)、再加一个小数值微调(连续偏移)。前两样用分类损失(交叉熵),后一样用 MSE。

输出:给定当前场景,预测出"选哪道菜 + 怎么微调"。

第 3 步:上菜——推理时组装动作

输入:Transformer 报出的两个菜单编号 + 偏移量。

处理:去码本里查到对应向量,加上偏移,再用 VQ-VAE 解码器还原成真正的连续动作。

输出:一段连续动作。整个过程一步出结果,不像 Diffusion Policy 要反复去噪几十步,所以推理快很多(具体倍数需查原文)。

第 4 步:为什么这样能解决"四不像"?

因为"选几号菜"是分类题,分类天然可以表示"50% 选 A、50% 选 B",采样时随机挑一个就好,不会被平均成中间值。微调那一小步只在选定菜之后做精修,不需要承担"表达多种风格"这件难事。分类负责多模态、回归负责精度,各司其职。

第 5 步:两阶段训练的次序——先编好菜单,再学会点菜

输入:全部专家演示动作。

处理:这里有个容易忽略但很关键的工程细节——VQ-BeT 是分两个阶段训练的,次序不能乱。第一阶段只训残差 VQ-VAE:拿所有演示动作反复"压缩—重建",把码本(动作菜单)学到能高保真还原各种动作为止;这一阶段完全不碰策略,只关心"菜单是否齐全"。第二阶段冻住码本,再训 Transformer 学"给定场景该点几号菜 + 加多少偏移"。为什么要分开?因为如果码本和策略同时学,码本会一直变,Transformer 就像在追一个不断改名的菜单,学不稳;先把菜单固定下来,点菜这件事才有稳定的目标。这也是 VQ 类方法(SoundStream、VQ-VAE)的通用套路。

输出:一个菜单稳定、点菜精准的两段式策略。具体码本大小、残差层数需查原文。

所以这一节是想说:VQ-BeT 的方法 = 残差 VQ 编动作菜单 + Transformer 分类选菜 + 小偏移微调 + 单步解码 + 先定菜单后学点菜的两阶段训练,用"分类抗平均、回归保精度"一举解决多模态且快。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Behavior Generation with Latent Act… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Behavior Generation with Latent Actions (VQ-BeT) — 方法示意:核心 pipeline
Plate Nº IIBehavior Generation with Latent Actions (VQ-BeT) — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体成功率/延迟请查原文,此处不编造。

维度 说明
动作离散化 残差 VQ-VAE(端到端可学,多层)
策略头 GPT 式 Transformer,预测两层码 + 偏移
推理 单步(对比 Diffusion Policy 的多步去噪)
多模态处理 靠"选码"这个分类步天然表达
评测 push-T、Franka Kitchen、robomimic 等
对照 BC、BeT、Diffusion Policy、IBC
核心卖点 和扩散同样多模态,但推理快几个数量级

关键结论:VQ-BeT 主打"和 Diffusion Policy 同样能处理多模态,但推理快几个数量级",同时相比前作 BeT(k-means)在复杂动作上更精细、更稳。

所以这一节是想说:数字告诉我们,把动作离散换成残差 VQ 后,多模态、精度、速度三者可以兼得。


实验结果说明了什么

VQ-BeT 在以下基准上对照 BC / BeT / Diffusion Policy / IBC:

  • 多模态玩具任务:push-T、blocks-stacking 这种同状态多解法的任务,验证"不会塌成平均"。
  • 机械臂仿真robomimic / Franka Kitchen 等,验证长 horizon 成功率。
  • 真实机器人:可能在 xArm / Franka 上做物体操纵,验证 sim-to-real 与速度。

报告指标主要是成功率、动作分布覆盖度(多模态保留得好不好)、推理延迟。具体数字需查原文。

所以这一节是想说:实验证明"离散 latent + 单步推理"在多模态玩具任务和真实操作上都能媲美扩散,且快得多。


你应该懂的几个新词

  • VQ-VAE(向量量化 VAE):把编码器的连续 latent 强行映射到码本里最近的那个向量,让 latent 变离散符号。DALL-E 早期、SoundStream 都用它。
  • 残差 VQ(residual VQ):把"量化误差"再交给下一层码本量化,多层叠加。来自音频 codec(SoundStream、Encodec)。
  • 码本(codebook):一组可学习的向量 [e_1, ..., e_K],量化时找输入 latent 最近的那个。
  • Straight-Through Estimator (STE):量化不可导,反传时假装它是恒等函数把梯度直通过去,让码本端到端可训。
  • action chunk:一次预测未来 N 步动作,减少推理频次、抑制误差累积。
  • 多模态塌缩(mode collapse / averaging):MSE 回归在多解时倾向输出平均,结果哪个都不像。

所以这一节是想说:这几个词是理解"离散 latent 策略"这条线的通用基础,也是从音频/图像 codec 迁移到机器人动作的关键概念。


它有什么搞不定的

  • 码本容量是超参:码本太小表达不够、太大难学,需要调。
  • 两阶段训练:先训 VQ-VAE 再训策略,比端到端多一道工序,且 VQ-VAE 训不好会拖累策略。
  • VQ 训练本身有坑:码本崩溃(大部分码没被用到)是 VQ 的常见问题,需要技巧缓解。
  • 表达力仍受离散限制:离散码 + 小偏移的组合虽强,但对极其连续/精细的动作,理论上不如纯连续生成灵活。
  • 依赖动作数据质量:菜单是从专家动作里学的,演示差菜单就差。

所以这一节是想说:VQ-BeT 的短板集中在"两阶段、码本调参、VQ 训练坑"上——它快且稳,但引入了 VQ 特有的工程复杂度。


它和别的几篇是什么关系

  • 直接前作 BeT(同组 NYU Lerrel Pinto 团队):把 k-means 换成残差 VQ 是核心增量。BeT 的"离散 + 偏移"框架被 VQ-BeT 完全继承。
  • 同期对手 Diffusion Policy(RSS 2023):另一条多模态路线。VQ-BeT 主打"和扩散同样多模态、但推理快几个数量级"。
  • 方法源头 VQ-VAE / SoundStream:把音频/图像里成熟的"离散 latent + Transformer"配方搬到机器人动作,是 2023-2024 年明显的跨域迁移趋势(RT-2、OpenVLA 的 action token 化同源)。
  • 下游/后续:可看作给 OpenVLA 这类 VLA 的 action head 提供替代——不用让大模型直接吐 token,而是把动作量化后让小 Transformer 学。
  • 同范式邻居Consistency Policy(蒸馏扩散加速)、ACT(action chunking with transformers)。
  • 评测台:以 robomimic 为标准跑分,回应它揭示的多模态天花板。

所以这一节是想说:VQ-BeT 是"离散 latent 动作生成"这条线的代表,和 Diffusion Policy 并列为解多模态的两大主流方案。


和本导读的关系

本篇对应导读 Ch14: 模仿学习Ch13: Diffusion Policy。Ch14 指出多模态是模仿学习的核心天花板(robomimic 已经量化过),Ch13 讲扩散策略这条解法。VQ-BeT 是另一条解法——用离散 latent 换来单步推理的速度。读完本篇,配合 Diffusion Policy 对照,你能理解"离散 latent + 单步" vs "连续 latent + 多步去噪"这个当前模仿学习必修的对照组。

所以这一节是想说:把 VQ-BeT 放进 Ch13/Ch14 里读,它是"用离散 latent 解多模态"的代表,和扩散策略互为镜像。


思考题

Q1:为什么"选码"这个分类步能天然处理多模态,而 MSE 回归不行?

提示

分类输出是一个概率分布,可以说"50% 选 A、50% 选 B",采样时挑一个即可,不会平均。MSE 回归只能输出一个点估计,多解时被拉到中间成四不像。

Q2:残差 VQ 相比单层 VQ 好在哪?用"选菜"的类比说明。

提示

单层 VQ 只能选一道菜(粗)。残差第二层再选"这道菜的微调"(精)。两层码的组合数是笛卡尔积,表达力远大于单层,又保留离散的稳定性。

Q3:VQ-BeT 相比 Diffusion Policy 最大的优势和代价各是什么?

提示

优势:单步推理,快几个数量级。代价:两阶段训练 + VQ 特有的码本调参/崩溃问题,工程上更绕。

Q4:为什么 VQ-BeT 要用 straight-through estimator?没有它会怎样?

提示

量化(找最近码)这个操作不可导,梯度传不回编码器和码本。STE 在反传时假装量化是恒等函数把梯度直通过去,让整个 VQ 端到端可训。没有它码本学不动。

Q5:如果码本崩溃(大部分码从没被选中),会有什么后果?怎么缓解?

提示

有效"菜品"变少,表达力下降,多模态又退化。缓解手段包括码本重置、EMA 更新、commitment loss 调权重等 VQ 常用技巧。

Q6:能不能把 VQ-BeT 的动作头装到 OpenVLA 这类 VLA 上?会带来什么?

提示

可以。让 VLA 的大模型不直接吐动作 token,而是预测 VQ 码,再解码成连续动作。好处是动作更平滑、多模态更好、推理仍是单步。这正是 VQ-BeT 作为"可复用零件"的价值。

所以这一节是想说:这几个问题带你把"分类抗平均、残差表达、快慢取舍、STE、码本崩溃、可复用性"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:VQ-BeT 比 Diffusion Policy 快多少?

主要差在推理——扩散要几十步去噪,VQ-BeT 一步出结果,通常快一到两个数量级。具体倍数看论文。

Q2:它一定要两阶段训练吗?

是的——先训 VQ-VAE 编动作菜单,再训策略选菜。这是它的标准流程,也是它比端到端多一道工序的地方。

Q3:码本要设多大?

是个超参,太小表达不够、太大难学易崩溃。论文会给推荐值,实践中要按任务动作复杂度调。

Q4:它和 BeT 到底差在哪?

BeT 用 k-means(一次性、不可学、单层)离散动作;VQ-BeT 用残差 VQ(端到端可学、多层)。换了这个零件,复杂动作上更精细更稳。

Q5:实现难吗?

比 Diffusion Policy 好调一些——一个标准 Transformer + 一个标准 VQ-VAE,组合好即可,不用调一堆噪声 schedule。但要处理 VQ 的码本崩溃问题。

Q6:读完 VQ-BeT 接下来看什么?

先补 BeT 理解前身;对照读 Diffusion Policy 理解两条多模态路线;想看评测台看 robomimic

所以这一节是想说:快多少、要不要两阶段、和 BeT 差在哪、好不好实现——这些实操问题都有明确答案。


如果你想再深入

按"前作 → 对照 → 源头"排序:

  1. 前作:BeT —— "离散 + 偏移"框架的起点,理解 VQ-BeT 换了什么零件。
  2. 对照:Diffusion Policy —— 另一条多模态路线,必修对照组。
  3. 源头:VQ-VAE / SoundStream —— 残差量化的机制来源。
  4. 评测台:robomimic —— 多模态天花板的量化基准。

所以这一节是想说:把 BeT + VQ-BeT + Diffusion Policy 连起来读,就能看懂模仿学习解多模态的两大主流思路。


原文信息

BibTeX:

@inproceedings{lee2024vqbet,
  title     = {Behavior Generation with Latent Actions},
  author    = {Lee, Seungjae and Wang, Yibin and Etukuru, Haritheja and others},
  booktitle = {International Conference on Machine Learning (ICML)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2403.03181}
}

所以整篇是想说:VQ-BeT 把机器人动作从"硬画一条曲线"改成"先从菜单选风格、再微调数值"——用离散选择天然抵抗平均、用残差量化保住精度、用单步解码换来速度,成了 Diffusion Policy 之外解多模态的另一条主流答案。

引用本笔记 / Cite this note
BibTeX
@online{eai_vq_bet_2026,
  title       = {(readable note) Behavior Generation with Latent Actions (VQ-BeT)},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/vq-bet/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?