RoboCat
这是一份写给"完全没接触过机器人策略/通用智能体"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么一个机器人大脑能同时控制好几种不同的机械臂、只看一张目标图就干活,还能自己生成数据来自我提升"。
一句话讲什么(TL;DR)
DeepMind 造的一个"通用机器人操作大脑":它能同时控制多种不同的机械臂、做多种任务,只要给它一张"目标长啥样"的图片就知道该干什么;遇到新任务或新机器人,用 100–1000 个示范就能快速上手;更关键的是,它能用自己练出的能力去生成新数据,再拿这些数据把自己练得更强,形成一个自我提升的循环。
所以这一节是想说:这篇论文做的是一个多机器人、多任务、看图定目标、还能自我提升的通用操作智能体。
这是个什么场景
视觉和语言领域有"基础模型"(foundation model):在海量数据上预训练一个通用大模型,然后稍微适配就能干各种下游任务。机器人领域也想要这样一个"通用大脑"——一个模型能控制各种机器人、干各种活,而不是"一个任务训一个专用模型"。
但机器人这条路有个特别的死结:数据太贵。真机数据要人一条条遥操作采集,慢、贵、危险。视觉/语言能靠爬全网数据变强,机器人却没有"全网机器人数据"可爬。于是一个诱人的想法冒出来:能不能让机器人自己造数据? 就像 AlphaZero 通过自我对弈越下越强,机器人能不能"自己练、自己录、再拿录下来的数据把自己练得更强"?
RoboCat 要解决的正是:造一个通用操作智能体,既能跨机器人跨任务,又能靠自我生成数据不断自我提升,缓解真机数据稀缺。
所以这一节是想说:目标是造一个通用机器人操作大脑,并用"自我生成数据"打破真机数据稀缺的死结。

之前的人怎么做的,为什么不够好
- 一任务一模型:每个任务/每种机器人单独训一个策略。效果好但完全不通用、不复用,扩展性极差。
- 多任务策略(如 Gato、早期通用智能体):能一个模型干多任务,但在"跨不同机器人形态 + 快速适应新任务 + 真机验证"上做得还不够充分。
- 纯靠人采数据:真机数据贵、慢,规模上不去,成了瓶颈。
- 语言条件方案:用语言指定任务很灵活,但"用一张目标图片指定任务"在很多操作场景下更直接、更好定义成功。
- 共同短板:要么不通用(一任务一模型),要么受困于真机数据稀缺、且缺少"自我提升"的机制。
所以这一节是想说:以前要么不通用、要么被真机数据稀缺卡死,缺一个能跨机器人、快速适应、还能自我造数据的通用智能体。
这篇论文的关键想法
RoboCat 有三个关键设计:
第一,把它做成"视觉目标条件的决策 Transformer"。 决策 Transformer(decision transformer)是把"控制"当成"序列预测":给它一串(观测、动作)历史,它预测下一个动作,像语言模型预测下一个词。RoboCat 在此基础上用**一张目标图片(visual goal)**来指定任务——"把场景变成这张图的样子"。用图片当目标,比语言更直接地定义了"什么算成功"。
第二,多机器人、多任务统一吃进一个模型。 它消化来自仿真和真实、不同机械臂(观测和动作空间都不一样)的大量带动作标注的视觉经验。为了让不同机器人的不同观测/动作能进同一个模型,它把图像等输入统一 token 化(借鉴 Gato 的思路)。这样一个模型就能控制多种机器人、干多种活,并能零样本迁移到新任务/新机器人,或用 100–1000 个示范快速适应。
第三,自我提升循环(self-improvement loop)。 这是最亮的点:训练好的 RoboCat 可以自己去尝试新任务、录下成功的轨迹当新数据,再把这些自生成数据加进训练集,训出更强的下一代 RoboCat。如此循环,数据越滚越多、能力越练越强——一个"基本的自主提升积木"。
所以这一节是想说:核心是"视觉目标条件的决策 Transformer + 多机器人多任务统一 + 自我生成数据的提升循环"。

它分几步做的(方法)
方法分四块:统一表示与决策 Transformer、视觉目标条件、快速适应、自我提升循环。逐块按"输入 → 处理 → 输出"讲。
1. 统一表示 + 决策 Transformer:一个模型控制多种机器人
输入。 来自多种机器人(仿真 + 真机)的带动作标注的经验:图像观测、本体状态、以及对应的动作。不同机器人的观测和动作维度都不一样。
处理。 把图像等观测统一 token 化(切成离散符号,借鉴 Gato 把一切都变成 token 的思路),连同动作一起排成序列,喂给一个 决策 Transformer。它像语言模型预测下一个词一样,根据"过去的观测+动作+目标"预测下一个动作。因为一切都被 token 化统一了,不同机器人的不同接口能进同一个模型。
决策 Transformer(decision transformer):把强化学习/控制问题重写成"序列预测"——给定历史(和目标),预测接下来的动作,用 Transformer 来做。
token 化:把图像、状态、动作都切成离散符号,让一个通用序列模型能统一处理各种输入。
输出。 一个能接收多种机器人观测、输出对应动作的通用策略模型。
所以这一节是想说:用统一 token 化 + 决策 Transformer,让一个模型能控制多种机器人、干多种活。
2. 视觉目标条件:用一张图告诉它"要做成什么样"
输入。 一张目标图片(goal image),表示"任务完成时场景该是什么样"。
处理。 模型以这张目标图为条件来选动作——不断行动,努力把当前场景变成目标图的样子。用图片指定目标的好处:成功判据清晰(像不像目标图),且不同任务只要换一张目标图就行,天然支持多任务。
输出。 面向"达成目标图"的动作序列。
所以这一节是想说:视觉目标条件让"指定任务"变成"给一张目标图",成功判据清晰、多任务统一。
3. 快速适应:新任务/新机器人只需少量示范
输入。 一个新任务或新机器人 + 100–1000 个该任务的示范。
处理。 有两种玩法:零样本——如果新任务与训练分布够接近,直接用;少样本适应(fine-tune)——用 100–1000 个示范微调一下,就能上手新任务甚至新机器人形态。这体现了"通用预训练 + 少量适配"的基础模型范式,正是它相对"一任务一模型"的优势。
输出。 快速适配到新任务/新机器人的策略。
所以这一节是想说:预训练好的 RoboCat 能零样本或用少量示范快速适应新任务和新机器人。
4. 自我提升循环:自己造数据把自己练强
这是 RoboCat 的灵魂机制。
输入。 当前这一代 RoboCat + 一批新任务。
处理(循环)。
- 用当前 RoboCat 去尝试新任务(可能先用少量示范适应一下)。
- 录下它成功完成的轨迹,作为新的训练数据(自生成数据)。
- 把自生成数据加进训练集,训出更强的下一代 RoboCat。
- 回到第 1 步,能力和数据一起滚雪球。
这样,数据不再完全依赖人采——模型自己就能扩充数据集。论文指出:随着训练数据变多变杂,RoboCat 不仅出现跨任务迁移的迹象,适应新任务也变得更高效。
输出。 一代比一代强、数据越滚越多的自我提升智能体。
下面用 ASCII 图把整体架构和循环画出来:
多机器人经验(仿真+真机) ─► 统一token化 ─► 决策Transformer(以目标图为条件) ─► 动作
▲
目标图片(要做成什么样)
自我提升循环:
RoboCat_t ──尝试新任务(少量示范适应)──► 录下成功轨迹(自生成数据)
▲ │
└──────── 加入训练集, 训出 RoboCat_{t+1} ◄─────┘ 越滚越强
再用一张 ASCII 图看"通用 + 快速适应"的直觉:
一任务一模型: 任务A→模型A 任务B→模型B ... (不复用)
RoboCat: [一个大脑] + 目标图 → 做A/B/C; 新任务只需100~1000示范
所以这一整节是想说:RoboCat = 统一token决策Transformer + 视觉目标条件 + 少样本快速适应 + 自我生成数据循环,合成一个越练越强的通用操作大脑。
关键数字(What works)
数字来自论文(arXiv:2306.11706);各任务成功率、迭代提升幅度属正文,标注"需读原文"。
| 项目 | 数值/结论 | 说明 |
|---|---|---|
| 通用性 | 多机器人 + 多任务 | 一个模型统管 |
| 任务指定 | 视觉目标图片 | 成功判据清晰 |
| 快速适应 | 100–1000 个示范 | 新任务/新机器人 |
| 零样本 | 支持(分布内) | 无需示范 |
| 真机验证 | 3 种真实机器人形态 | 不止仿真 |
| 自我提升 | 自生成数据再训练 | 能力滚雪球 |
| 观察到 | 跨任务迁移 + 适应更高效 | 随数据增长 |
三个要点:第一,100–1000 示范就能适应新任务/新机器人,把"新任务的数据门槛"砍到很低,是通用预训练的直接红利;第二,在 3 种真实机器人上验证,证明不是仿真里的空谈;第三,自我提升循环是最有想象力的贡献——它给出了"机器人也能像 AlphaZero 那样自己造数据变强"的一个可行雏形。
所以这一节是想说:低门槛适应 + 真机验证 + 自我提升循环,是 RoboCat 的三个关键成果。
实验结果说明了什么
论文实验主要证明:
- 通用大脑可行:一个模型能控制多种机器人、做多种任务,验证了机器人"基础模型"路线的可行性。
- 少样本适应有效:新任务/新机器人只需 100–1000 示范即可上手,远低于"从零训一个专用策略"的数据需求。
- 自我提升有效:用模型自生成的数据再训练,能进一步提升能力;随着数据增多变杂,出现跨任务迁移、适应更高效的现象——说明"自己造数据变强"这条路走得通。
- 真机可靠:在 3 种真实机器人形态上做了大规模评测,不只是仿真结论。
所以这一节是想说:实验证明"通用 + 少样本适应 + 自我提升"三件事都成立,且在真机上验证。
你应该懂的几个新词
- 通用智能体 / 基础模型(generalist agent / foundation model):一个模型干多种任务,预训练后稍加适配即可迁移。
- 决策 Transformer(decision transformer):把控制当序列预测,给历史预测下一个动作。
- 视觉目标条件(visual goal-conditioned):用一张"目标图"指定任务,努力把场景变成那样。
- 多形态 / 跨形态(multi-embodiment):一个模型控制多种不同机器人。
- token 化:把图像/状态/动作统一切成离散符号,便于一个序列模型处理。
- 少样本适应(few-shot adaptation):用很少的示范(100–1000)快速学会新任务。
- 自我提升循环(self-improvement loop):模型自己生成数据,再用来训练更强的自己。
- 跨任务迁移(cross-task transfer):在一些任务上学到的能力帮助另一些任务。
所以这一节是想说:决策 Transformer、视觉目标、多形态、自我提升是理解本篇的四个关键词。
它有什么搞不定的
- 自我提升会放大偏差:自生成数据来自模型自己,若模型有系统性错误,可能被循环放大(自我强化坏习惯),需要质量把关。
- 只录成功轨迹的偏置:自生成数据通常筛成功的,可能缺乏"失败中学习"的多样性。
- 视觉目标的局限:有些任务难用一张图定义目标(如"轻轻地"、"重复三次"这类过程性要求)。
- 仍需要初始大数据:自我提升是"锦上添花",起步仍依赖大量人采/仿真数据来预训练。
- 真机适应成本:即便 100–1000 示范也需真机采集,对新机器人仍有工程成本;且真机部署有安全与稳定性挑战。
所以这一节是想说:它开创了自我提升,但自生成数据的偏差、目标图局限、以及对初始大数据的依赖是明显边界。
它和别的几篇是什么关系
- 直接前身:Gato(DeepMind 的通用智能体,把一切 token 化用一个 Transformer 干多任务)——RoboCat 把这套思路聚焦到机器人操作,并加了视觉目标条件和自我提升。
- 自我提升思想邻居:AlphaZero 的自我对弈、以及各种"模型生成数据再训练"的自举方法。
- 通用机器人策略对照:RT-1/RT-2、Octo、OpenVLA 等 VLA 是"通用机器人大脑"的另一支(多用语言条件),RoboCat 用视觉目标 + 自我提升区别开。
- 数据背景:真机数据稀缺是它要解决的核心痛点,与 Open X-Embodiment、RH20T 等数据工作互相呼应。
所以这一节是想说:RoboCat 是 Gato 思路在机器人上的深化,融入了 AlphaZero 式的自我提升,与 VLA 路线并行。
和本导读的关系
本笔记对应导读 Ch14: 模仿学习。Ch14 讲的是"从示范中学"这条主线,以及数据规模/质量如何决定成败。RoboCat 在这条线里代表两个前沿理念:一是通用(多机器人多任务)+ 少样本适应,二是自我提升(自己造示范数据)——后者直面模仿学习最大的痛点"数据从哪来"。读完本篇再看同章的 act-aloha、mobile-aloha(真机数据采集)、diffusion-policy(另一种策略学习),能理解"通用大脑 + 自我造数据"如何补足纯人采数据的路线。
所以这一节是想说:把 RoboCat 放进 Ch14,它代表模仿学习走向"通用智能体 + 自我提升"的前沿。
思考题
Q1:为什么"用一张目标图片"指定任务,比用语言在很多操作场景下更直接?
提示
图片明确规定了"完成时长什么样",成功判据是"像不像目标图",比模糊的语言更好定义和评估。想想哪些任务图比话好说。
Q2:决策 Transformer 把控制当"序列预测",这和语言模型预测下一个词有什么相通?
提示
都是给历史预测下一个 token;只不过一个 token 是词,一个是动作。这让机器人能复用序列模型的成熟机器。
Q3:自我提升循环最大的风险是什么?为什么可能"越练越偏"?
提示
自生成数据带着模型自身的偏差/错误,循环会放大它。想想"近亲繁殖"式的数据退化,以及如何质量把关。
Q4:自生成数据通常只留成功轨迹,这会漏掉什么?
提示
失败轨迹里也有信息(什么不该做)。只学成功可能缺乏对错误的辨别。想想"从失败中学"的价值。
Q5:为什么"100–1000 示范就能适应新机器人"是件大事?
提示
从零训一个专用策略要海量数据。少样本适应大幅降低新任务/新机器人的门槛,正是通用预训练的红利。
Q6:RoboCat 用视觉目标 + 自我提升,VLA(RT-2 等)用语言条件,你觉得两条路会怎样融合?
提示
也许语言指定高层任务、图像指定精确目标状态;自我提升可用于任何路线扩数据。想想互补而非对立。
Q7:RoboCat 的自我提升和 AlphaZero 的自我对弈有何异同?为什么机器人更难?
提示
都靠自己产生数据变强。但棋类有完美模拟器和明确胜负;真机操作有物理噪声、安全风险、无完美奖励,采数据贵得多。
一些好奇心问答(FAQ)
Q:RoboCat 真的能"自己变强"而不需要人吗?
它能用自生成数据扩充训练集、迭代提升,但仍需人设定任务、提供初始大数据、把关数据质量。是"半自主"的提升循环,不是完全无人。
Q:它和 Gato 什么关系?
Gato 是更早的"万能 token 化通用智能体"(玩游戏、控制、对话都能)。RoboCat 把这套思路聚焦机器人操作,加了视觉目标条件和自我提升。
Q:为什么不用语言指定任务?
很多操作任务用一张"目标状态图"定义更清晰、成功更好判。当然语言也可以,两者可互补。
Q:自生成数据会不会把模型带坏?
有这个风险(放大偏差)。所以通常只保留成功轨迹并做质量筛选,但这也带来"只学成功"的偏置,是待研究的问题。
所以这一节是想说:它是"半自主自我提升的通用操作大脑",起步仍依赖人和初始数据。
如果你想再深入
- 前身:Gato — 理解"万能 token 化通用智能体"的思路。
- 决策 Transformer 原论文 — 理解"控制即序列预测"。
- VLA 对照:RT-2 / Octo / OpenVLA — 看语言条件的通用机器人大脑。
- 自我提升思想:AlphaZero / 自举方法 — 理解"自己造数据变强"的先例。
- 数据背景:Open X-Embodiment / RH20T — 理解真机数据稀缺这个大痛点。
所以这一节是想说:把 Gato → 决策 Transformer → RoboCat → VLA 串起来,能看清通用机器人智能体的演进。
原文信息
- 标题:RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation
- 作者:Konstantinos Bousmalis, Giulia Vezzani, Dushyant Rao, Coline Devin, Alex X. Lee, Maria Bauza, 等(DeepMind,39 位作者)
- 发表:TMLR 2023(DeepMind)
- arXiv:https://arxiv.org/abs/2306.11706
@article{bousmalis2023robocat,
title = {RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation},
author = {Bousmalis, Konstantinos and Vezzani, Giulia and Rao, Dushyant and Devin, Coline and Lee, Alex X. and Bauza, Maria and others},
journal = {Transactions on Machine Learning Research (TMLR)},
year = {2023},
url = {https://arxiv.org/abs/2306.11706}
}
◼
引用本笔记 / Cite this note
@online{eai_robocat_2026,
title = {(readable note) RoboCat},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/robocat/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?