Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 55

RoboCat

13 min read · 4630 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过机器人策略/通用智能体"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么一个机器人大脑能同时控制好几种不同的机械臂、只看一张目标图就干活,还能自己生成数据来自我提升"。

一句话讲什么(TL;DR)

DeepMind 造的一个"通用机器人操作大脑":它能同时控制多种不同的机械臂、做多种任务,只要给它一张"目标长啥样"的图片就知道该干什么;遇到新任务或新机器人,用 100–1000 个示范就能快速上手;更关键的是,它能用自己练出的能力去生成新数据,再拿这些数据把自己练得更强,形成一个自我提升的循环。

所以这一节是想说:这篇论文做的是一个多机器人、多任务、看图定目标、还能自我提升的通用操作智能体。


这是个什么场景

视觉和语言领域有"基础模型"(foundation model):在海量数据上预训练一个通用大模型,然后稍微适配就能干各种下游任务。机器人领域也想要这样一个"通用大脑"——一个模型能控制各种机器人、干各种活,而不是"一个任务训一个专用模型"。

但机器人这条路有个特别的死结:数据太贵。真机数据要人一条条遥操作采集,慢、贵、危险。视觉/语言能靠爬全网数据变强,机器人却没有"全网机器人数据"可爬。于是一个诱人的想法冒出来:能不能让机器人自己造数据? 就像 AlphaZero 通过自我对弈越下越强,机器人能不能"自己练、自己录、再拿录下来的数据把自己练得更强"?

RoboCat 要解决的正是:造一个通用操作智能体,既能跨机器人跨任务,又能靠自我生成数据不断自我提升,缓解真机数据稀缺。

所以这一节是想说:目标是造一个通用机器人操作大脑,并用"自我生成数据"打破真机数据稀缺的死结。


RoboCat — 场景示意:这论文要解决的现实问题
Plate Nº IRoboCat — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 一任务一模型:每个任务/每种机器人单独训一个策略。效果好但完全不通用、不复用,扩展性极差。
  • 多任务策略(如 Gato、早期通用智能体):能一个模型干多任务,但在"跨不同机器人形态 + 快速适应新任务 + 真机验证"上做得还不够充分。
  • 纯靠人采数据:真机数据贵、慢,规模上不去,成了瓶颈。
  • 语言条件方案:用语言指定任务很灵活,但"用一张目标图片指定任务"在很多操作场景下更直接、更好定义成功。
  • 共同短板:要么不通用(一任务一模型),要么受困于真机数据稀缺、且缺少"自我提升"的机制。

所以这一节是想说:以前要么不通用、要么被真机数据稀缺卡死,缺一个能跨机器人、快速适应、还能自我造数据的通用智能体。


这篇论文的关键想法

RoboCat 有三个关键设计:

第一,把它做成"视觉目标条件的决策 Transformer"。 决策 Transformer(decision transformer)是把"控制"当成"序列预测":给它一串(观测、动作)历史,它预测下一个动作,像语言模型预测下一个词。RoboCat 在此基础上用**一张目标图片(visual goal)**来指定任务——"把场景变成这张图的样子"。用图片当目标,比语言更直接地定义了"什么算成功"。

第二,多机器人、多任务统一吃进一个模型。 它消化来自仿真和真实不同机械臂(观测和动作空间都不一样)的大量带动作标注的视觉经验。为了让不同机器人的不同观测/动作能进同一个模型,它把图像等输入统一 token 化(借鉴 Gato 的思路)。这样一个模型就能控制多种机器人、干多种活,并能零样本迁移到新任务/新机器人,或用 100–1000 个示范快速适应。

第三,自我提升循环(self-improvement loop)。 这是最亮的点:训练好的 RoboCat 可以自己去尝试新任务、录下成功的轨迹当新数据,再把这些自生成数据加进训练集,训出更强的下一代 RoboCat。如此循环,数据越滚越多、能力越练越强——一个"基本的自主提升积木"。

所以这一节是想说:核心是"视觉目标条件的决策 Transformer + 多机器人多任务统一 + 自我生成数据的提升循环"。


RoboCat — 方法示意:核心 pipeline
Plate Nº IIRoboCat — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:统一表示与决策 Transformer、视觉目标条件、快速适应、自我提升循环。逐块按"输入 → 处理 → 输出"讲。

1. 统一表示 + 决策 Transformer:一个模型控制多种机器人

输入。 来自多种机器人(仿真 + 真机)的带动作标注的经验:图像观测、本体状态、以及对应的动作。不同机器人的观测和动作维度都不一样。

处理。 把图像等观测统一 token 化(切成离散符号,借鉴 Gato 把一切都变成 token 的思路),连同动作一起排成序列,喂给一个 决策 Transformer。它像语言模型预测下一个词一样,根据"过去的观测+动作+目标"预测下一个动作。因为一切都被 token 化统一了,不同机器人的不同接口能进同一个模型。

决策 Transformer(decision transformer):把强化学习/控制问题重写成"序列预测"——给定历史(和目标),预测接下来的动作,用 Transformer 来做。

token 化:把图像、状态、动作都切成离散符号,让一个通用序列模型能统一处理各种输入。

输出。 一个能接收多种机器人观测、输出对应动作的通用策略模型。

所以这一节是想说:用统一 token 化 + 决策 Transformer,让一个模型能控制多种机器人、干多种活。

2. 视觉目标条件:用一张图告诉它"要做成什么样"

输入。 一张目标图片(goal image),表示"任务完成时场景该是什么样"。

处理。 模型以这张目标图为条件来选动作——不断行动,努力把当前场景变成目标图的样子。用图片指定目标的好处:成功判据清晰(像不像目标图),且不同任务只要换一张目标图就行,天然支持多任务。

输出。 面向"达成目标图"的动作序列。

所以这一节是想说:视觉目标条件让"指定任务"变成"给一张目标图",成功判据清晰、多任务统一。

3. 快速适应:新任务/新机器人只需少量示范

输入。 一个新任务或新机器人 + 100–1000 个该任务的示范。

处理。 有两种玩法:零样本——如果新任务与训练分布够接近,直接用;少样本适应(fine-tune)——用 100–1000 个示范微调一下,就能上手新任务甚至新机器人形态。这体现了"通用预训练 + 少量适配"的基础模型范式,正是它相对"一任务一模型"的优势。

输出。 快速适配到新任务/新机器人的策略。

所以这一节是想说:预训练好的 RoboCat 能零样本或用少量示范快速适应新任务和新机器人。

4. 自我提升循环:自己造数据把自己练强

这是 RoboCat 的灵魂机制。

输入。 当前这一代 RoboCat + 一批新任务。

处理(循环)。

  1. 用当前 RoboCat 去尝试新任务(可能先用少量示范适应一下)。
  2. 录下它成功完成的轨迹,作为新的训练数据(自生成数据)。
  3. 把自生成数据加进训练集,训出更强的下一代 RoboCat。
  4. 回到第 1 步,能力和数据一起滚雪球。

这样,数据不再完全依赖人采——模型自己就能扩充数据集。论文指出:随着训练数据变多变杂,RoboCat 不仅出现跨任务迁移的迹象,适应新任务也变得更高效

输出。 一代比一代强、数据越滚越多的自我提升智能体。

下面用 ASCII 图把整体架构和循环画出来:

   多机器人经验(仿真+真机) ─► 统一token化 ─► 决策Transformer(以目标图为条件) ─► 动作
                                                      ▲
                                              目标图片(要做成什么样)

   自我提升循环:
     RoboCat_t ──尝试新任务(少量示范适应)──► 录下成功轨迹(自生成数据)
         ▲                                              │
         └──────── 加入训练集, 训出 RoboCat_{t+1} ◄─────┘   越滚越强

再用一张 ASCII 图看"通用 + 快速适应"的直觉:

   一任务一模型:  任务A→模型A  任务B→模型B  ... (不复用)
   RoboCat:       [一个大脑] + 目标图 → 做A/B/C; 新任务只需100~1000示范

所以这一整节是想说:RoboCat = 统一token决策Transformer + 视觉目标条件 + 少样本快速适应 + 自我生成数据循环,合成一个越练越强的通用操作大脑。


关键数字(What works)

数字来自论文(arXiv:2306.11706);各任务成功率、迭代提升幅度属正文,标注"需读原文"。

项目 数值/结论 说明
通用性 多机器人 + 多任务 一个模型统管
任务指定 视觉目标图片 成功判据清晰
快速适应 100–1000 个示范 新任务/新机器人
零样本 支持(分布内) 无需示范
真机验证 3 种真实机器人形态 不止仿真
自我提升 自生成数据再训练 能力滚雪球
观察到 跨任务迁移 + 适应更高效 随数据增长

三个要点:第一,100–1000 示范就能适应新任务/新机器人,把"新任务的数据门槛"砍到很低,是通用预训练的直接红利;第二,在 3 种真实机器人上验证,证明不是仿真里的空谈;第三,自我提升循环是最有想象力的贡献——它给出了"机器人也能像 AlphaZero 那样自己造数据变强"的一个可行雏形。

所以这一节是想说:低门槛适应 + 真机验证 + 自我提升循环,是 RoboCat 的三个关键成果。


实验结果说明了什么

论文实验主要证明:

  • 通用大脑可行:一个模型能控制多种机器人、做多种任务,验证了机器人"基础模型"路线的可行性。
  • 少样本适应有效:新任务/新机器人只需 100–1000 示范即可上手,远低于"从零训一个专用策略"的数据需求。
  • 自我提升有效:用模型自生成的数据再训练,能进一步提升能力;随着数据增多变杂,出现跨任务迁移、适应更高效的现象——说明"自己造数据变强"这条路走得通。
  • 真机可靠:在 3 种真实机器人形态上做了大规模评测,不只是仿真结论。

所以这一节是想说:实验证明"通用 + 少样本适应 + 自我提升"三件事都成立,且在真机上验证。


你应该懂的几个新词

  • 通用智能体 / 基础模型(generalist agent / foundation model):一个模型干多种任务,预训练后稍加适配即可迁移。
  • 决策 Transformer(decision transformer):把控制当序列预测,给历史预测下一个动作。
  • 视觉目标条件(visual goal-conditioned):用一张"目标图"指定任务,努力把场景变成那样。
  • 多形态 / 跨形态(multi-embodiment):一个模型控制多种不同机器人。
  • token 化:把图像/状态/动作统一切成离散符号,便于一个序列模型处理。
  • 少样本适应(few-shot adaptation):用很少的示范(100–1000)快速学会新任务。
  • 自我提升循环(self-improvement loop):模型自己生成数据,再用来训练更强的自己。
  • 跨任务迁移(cross-task transfer):在一些任务上学到的能力帮助另一些任务。

所以这一节是想说:决策 Transformer、视觉目标、多形态、自我提升是理解本篇的四个关键词。


它有什么搞不定的

  • 自我提升会放大偏差:自生成数据来自模型自己,若模型有系统性错误,可能被循环放大(自我强化坏习惯),需要质量把关。
  • 只录成功轨迹的偏置:自生成数据通常筛成功的,可能缺乏"失败中学习"的多样性。
  • 视觉目标的局限:有些任务难用一张图定义目标(如"轻轻地"、"重复三次"这类过程性要求)。
  • 仍需要初始大数据:自我提升是"锦上添花",起步仍依赖大量人采/仿真数据来预训练。
  • 真机适应成本:即便 100–1000 示范也需真机采集,对新机器人仍有工程成本;且真机部署有安全与稳定性挑战。

所以这一节是想说:它开创了自我提升,但自生成数据的偏差、目标图局限、以及对初始大数据的依赖是明显边界。


它和别的几篇是什么关系

  • 直接前身:Gato(DeepMind 的通用智能体,把一切 token 化用一个 Transformer 干多任务)——RoboCat 把这套思路聚焦到机器人操作,并加了视觉目标条件和自我提升。
  • 自我提升思想邻居:AlphaZero 的自我对弈、以及各种"模型生成数据再训练"的自举方法。
  • 通用机器人策略对照:RT-1/RT-2、Octo、OpenVLA 等 VLA 是"通用机器人大脑"的另一支(多用语言条件),RoboCat 用视觉目标 + 自我提升区别开。
  • 数据背景:真机数据稀缺是它要解决的核心痛点,与 Open X-Embodiment、RH20T 等数据工作互相呼应。

所以这一节是想说:RoboCat 是 Gato 思路在机器人上的深化,融入了 AlphaZero 式的自我提升,与 VLA 路线并行。


和本导读的关系

本笔记对应导读 Ch14: 模仿学习。Ch14 讲的是"从示范中学"这条主线,以及数据规模/质量如何决定成败。RoboCat 在这条线里代表两个前沿理念:一是通用(多机器人多任务)+ 少样本适应,二是自我提升(自己造示范数据)——后者直面模仿学习最大的痛点"数据从哪来"。读完本篇再看同章的 act-alohamobile-aloha(真机数据采集)、diffusion-policy(另一种策略学习),能理解"通用大脑 + 自我造数据"如何补足纯人采数据的路线。

所以这一节是想说:把 RoboCat 放进 Ch14,它代表模仿学习走向"通用智能体 + 自我提升"的前沿。


思考题

Q1:为什么"用一张目标图片"指定任务,比用语言在很多操作场景下更直接?

提示

图片明确规定了"完成时长什么样",成功判据是"像不像目标图",比模糊的语言更好定义和评估。想想哪些任务图比话好说。

Q2:决策 Transformer 把控制当"序列预测",这和语言模型预测下一个词有什么相通?

提示

都是给历史预测下一个 token;只不过一个 token 是词,一个是动作。这让机器人能复用序列模型的成熟机器。

Q3:自我提升循环最大的风险是什么?为什么可能"越练越偏"?

提示

自生成数据带着模型自身的偏差/错误,循环会放大它。想想"近亲繁殖"式的数据退化,以及如何质量把关。

Q4:自生成数据通常只留成功轨迹,这会漏掉什么?

提示

失败轨迹里也有信息(什么不该做)。只学成功可能缺乏对错误的辨别。想想"从失败中学"的价值。

Q5:为什么"100–1000 示范就能适应新机器人"是件大事?

提示

从零训一个专用策略要海量数据。少样本适应大幅降低新任务/新机器人的门槛,正是通用预训练的红利。

Q6:RoboCat 用视觉目标 + 自我提升,VLA(RT-2 等)用语言条件,你觉得两条路会怎样融合?

提示

也许语言指定高层任务、图像指定精确目标状态;自我提升可用于任何路线扩数据。想想互补而非对立。

Q7:RoboCat 的自我提升和 AlphaZero 的自我对弈有何异同?为什么机器人更难?

提示

都靠自己产生数据变强。但棋类有完美模拟器和明确胜负;真机操作有物理噪声、安全风险、无完美奖励,采数据贵得多。


一些好奇心问答(FAQ)

Q:RoboCat 真的能"自己变强"而不需要人吗?

它能用自生成数据扩充训练集、迭代提升,但仍需人设定任务、提供初始大数据、把关数据质量。是"半自主"的提升循环,不是完全无人。

Q:它和 Gato 什么关系?

Gato 是更早的"万能 token 化通用智能体"(玩游戏、控制、对话都能)。RoboCat 把这套思路聚焦机器人操作,加了视觉目标条件和自我提升。

Q:为什么不用语言指定任务?

很多操作任务用一张"目标状态图"定义更清晰、成功更好判。当然语言也可以,两者可互补。

Q:自生成数据会不会把模型带坏?

有这个风险(放大偏差)。所以通常只保留成功轨迹并做质量筛选,但这也带来"只学成功"的偏置,是待研究的问题。

所以这一节是想说:它是"半自主自我提升的通用操作大脑",起步仍依赖人和初始数据。


如果你想再深入

  1. 前身:Gato — 理解"万能 token 化通用智能体"的思路。
  2. 决策 Transformer 原论文 — 理解"控制即序列预测"。
  3. VLA 对照:RT-2 / Octo / OpenVLA — 看语言条件的通用机器人大脑。
  4. 自我提升思想:AlphaZero / 自举方法 — 理解"自己造数据变强"的先例。
  5. 数据背景:Open X-Embodiment / RH20T — 理解真机数据稀缺这个大痛点。

所以这一节是想说:把 Gato → 决策 Transformer → RoboCat → VLA 串起来,能看清通用机器人智能体的演进。


原文信息

  • 标题:RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation
  • 作者:Konstantinos Bousmalis, Giulia Vezzani, Dushyant Rao, Coline Devin, Alex X. Lee, Maria Bauza, 等(DeepMind,39 位作者)
  • 发表:TMLR 2023(DeepMind)
  • arXiv:https://arxiv.org/abs/2306.11706
@article{bousmalis2023robocat,
  title   = {RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation},
  author  = {Bousmalis, Konstantinos and Vezzani, Giulia and Rao, Dushyant and Devin, Coline and Lee, Alex X. and Bauza, Maria and others},
  journal = {Transactions on Machine Learning Research (TMLR)},
  year    = {2023},
  url     = {https://arxiv.org/abs/2306.11706}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_robocat_2026,
  title       = {(readable note) RoboCat},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/robocat/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?