RoboFlamingo
这是一份写给"完全没接触过 VLM/机器人策略"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么不用从头训机器人大模型,而是拿一个开源的看图聊天模型(OpenFlamingo)稍微改一改、微调一下,就能让机器人听懂人话去操作"。
一句话讲什么(TL;DR)
拿一个现成的开源视觉语言大模型(OpenFlamingo,会看图 + 读文字),给它加一个专门负责"看历史、出动作"的小脑袋(policy head),再用机器人的模仿数据轻轻微调一下,就得到一个能听懂语言指令、看着画面去操作的机器人——在 CALVIN 这个语言指令操作基准上大幅超过当时最强,还便宜、好用、能跑在低配平台上。
所以这一节是想说:这篇论文用"现成 VLM + 加个动作脑袋 + 轻微调"的简单配方,把看图聊天模型变成能干活的机器人。
这是个什么场景
你希望对机器人说"把左边的红积木放到抽屉里",它就看着桌面、听懂这句话、动手完成。这类模型叫 VLA(Vision-Language-Action,视觉-语言-动作模型):看图 + 听指令 → 输出动作。
问题是,造一个 VLA 通常很费劲:要么从头训一个巨大的多模态模型(贵、要海量数据),要么把视觉、语言、动作硬拼在一起、精心设计架构和训练。而与此同时,开源社区已经有了很强的视觉语言模型(VLM)——比如 OpenFlamingo,它已经在海量图文上训练过,很懂"看图说话"。这些 VLM 里其实已经藏着丰富的视觉常识和语言理解能力。
RoboFlamingo 的出发点很朴素:既然现成 VLM 已经这么会看图读字,能不能别重造轮子,直接拿它来当机器人的大脑,只做最小的改动和微调? 目标是给出一个简单、便宜、好复现的方案,让"人人都能微调出自己的机器人策略"。
所以这一节是想说:目标是用最小改动把现成的强 VLM 直接改造成能听语言、干操作的机器人。

之前的人怎么做的,为什么不够好
- 从头训大型 VLA:能力强,但需要海量机器人数据和算力,门槛极高,普通团队做不起。
- 复杂定制架构:把视觉、语言、动作模块精心拼接、联合训练,工程复杂、难复现。
- 没充分利用现成 VLM:很多方案没有直接站在"已经很强的开源 VLM"肩膀上,等于浪费了 VLM 里已有的视觉语言常识。
- 闭源方案(如 RT-2):把 VLM 扩成 VLA 的思路很强,但闭源、贵,社区难复现。
- 共同短板:要么贵、要么复杂、要么闭源,缺一个"简单微调现成 VLM 就能用"的低成本方案。
所以这一节是想说:以前造 VLA 要么贵要么复杂要么闭源,没充分吃现成 VLM 的红利。
这篇论文的关键想法
RoboFlamingo 的核心是"最小改动地复用现成 VLM",三个关键设计:
第一,用 OpenFlamingo 做"单步的视觉语言理解"。 OpenFlamingo 是开源版的 Flamingo——它擅长"看一张图 + 读一段文字,理解当前这一步的场景和指令"。RoboFlamingo 直接拿它来理解"此刻画面 + 语言指令",不去动它已经学好的视觉语言能力。
第二,加一个显式的"策略脑袋"(policy head)来建模时间历史、输出动作。 单步理解还不够——机器人操作是连续的,得记住"之前几步发生了什么"。所以作者在 VLM 之上加一个专门的 policy head(比如一个循环结构),把"每一步的视觉语言理解"串成时间序列,并输出机器人的动作。理解归 VLM,时序和动作归 policy head,职责清晰地解耦。
第三,只用模仿学习轻微调,且只在语言条件的操作数据上训。 不重训整个大模型,而是用机器人的语言条件模仿数据(如 CALVIN)稍微 fine-tune 一下。这套"解耦 + 轻微调"的设计还带来两个实用好处:支持开环控制(open-loop,一次预测一串动作后按序执行,不必每步都重算),以及能部署到低配平台(因为可以不必每步都跑完整大模型)。
所以这一节是想说:核心是"OpenFlamingo 管单步理解 + policy head 管时序与动作 + 轻量模仿微调",简单地把 VLM 变成机器人。

它分几步做的(方法)
方法分四块:VLM 单步理解、policy head 时序建模、模仿微调、以及解耦带来的部署优势。逐块按"输入 → 处理 → 输出"讲。
1. VLM 单步理解:让 OpenFlamingo 读懂"此刻"
输入。 当前时刻的画面(摄像头图像)+ 语言指令(如"把红积木放进抽屉")。
处理。 用 OpenFlamingo 处理这一步的图 + 文。OpenFlamingo 内部用**交叉注意力(cross-attention)**把视觉信息注入语言模型——让语言模型"看到"图里的内容,从而理解"此刻场景是什么、指令要我干嘛"。这一部分基本沿用 VLM 已训好的能力,不重造。
交叉注意力(cross-attention):让一路信息(这里是文字)去"关注"另一路信息(图像特征),从而把图的内容融进语言理解里。Flamingo 系就是靠它把视觉塞进语言模型。
输出。 对当前这一步的"视觉语言联合理解"(一个融合了图和指令的特征)。
所以这一节是想说:OpenFlamingo 负责把"此刻的画面 + 指令"理解成一个融合特征,复用其现成能力。
2. policy head:把单步理解串成动作序列
输入。 每一步 VLM 输出的"视觉语言理解"特征,按时间排成序列。
处理。 一个显式的 policy head(如循环网络 LSTM 之类)接收这些逐步特征,建模时间历史(记住之前发生了什么),并输出机器人当前该执行的动作(末端位姿变化、夹爪开合等)。这一步是把"会理解"变成"会行动"的关键:VLM 只懂单步,policy head 补上时序和动作决策。
输出。 机器人在每个时刻的动作。
所以这一节是想说:policy head 把 VLM 的逐步理解串成带历史的动作序列,让模型真正"会动手"。
3. 模仿微调:只在语言条件操作数据上轻训
输入。 语言条件的机器人模仿数据(如 CALVIN:给一句指令 + 一段专家操作演示)。
处理。 用模仿学习(imitation learning,模仿专家演示的动作)稍微微调整个系统——主要让 policy head 学会出动作、并让 VLM 与动作任务对齐。只用语言条件的操作数据,不需要海量额外数据,也不重训 VLM 的大部分。
模仿学习(imitation learning):给模型看专家怎么做(示范),让它学着模仿,是最直接的"从示范学策略"的方法。
输出。 一个能听语言、看画面、出动作的机器人策略。
所以这一节是想说:只用语言条件模仿数据轻微调,就把现成 VLM 对齐到机器人操作任务。
4. 解耦带来的部署优势:开环 + 低配平台
输入。 训练好的 RoboFlamingo(VLM + policy head 解耦结构)。
处理。 因为"单步理解"和"时序动作"是解耦的,系统可以做开环控制(一次理解后预测一串动作,按序执行,不必每步都重跑大模型),也因此能部署到算力较弱的平台(不用每步都完整推理大 VLM)。这让方案更实用、更省资源。
输出。 一个灵活、可在低配平台上运行的机器人策略。
下面用 ASCII 图把整体结构画出来:
每一步: 画面(图) + 指令(文)
│
▼
OpenFlamingo(交叉注意力融合图文) ─► 单步视觉语言理解
│ │ │ (t-2)(t-1)(t)
└────────────┴────────────┘ 按时间排成序列
│
▼
Policy Head(建模历史, 如LSTM) ─► 动作(位姿变化+夹爪)
│
(解耦→支持开环控制, 可上低配平台)
再用一张 ASCII 图对比"从头训 VLA vs RoboFlamingo":
从头训VLA: 海量数据 + 巨大算力 + 复杂架构 → 贵, 难复现
RoboFlamingo: 现成OpenFlamingo + 加policy head + 语言条件模仿轻微调 → 便宜, 好复现
所以这一整节是想说:RoboFlamingo = OpenFlamingo 单步理解 + policy head 时序动作 + 语言条件模仿轻微调 + 解耦部署优势,用最小改动把 VLM 变机器人。
关键数字(What works)
数字来自论文摘要(arXiv:2311.01378);CALVIN 上的具体成功率/长程链条数属正文表格,标注"需读原文"。
| 项目 | 数值/结论 | 说明 |
|---|---|---|
| 基座 | OpenFlamingo(开源 VLM) | 复用现成能力 |
| 新增 | 显式 policy head | 建模历史 + 出动作 |
| 训练 | 仅语言条件模仿微调 | 轻量、不重训 |
| 评测 | CALVIN 语言操作基准 | 大幅超当时 SOTA |
| 部署 | 支持开环 + 低配平台 | 解耦带来的实用性 |
| 定位 | 便宜、易用、可复现 | 人人可微调 |
三个要点:第一,"现成 VLM + 轻微调"就能大幅超 SOTA,证明开源 VLM 里的视觉语言常识对机器人操作极有价值,不必从头训;第二,理解与时序解耦不只是架构美感,还直接换来了开环控制和低配部署这两个实用好处;第三,便宜、易复现的定位,让"微调出自己的机器人策略"变成社区可及的事——这是它影响力的来源。
所以这一节是想说:复用 VLM 大幅超 SOTA + 解耦带来实用部署 + 低成本可复现,是 RoboFlamingo 的三个关键点。
实验结果说明了什么
论文实验主要证明:
- 复用 VLM 非常有效:在 CALVIN 语言条件操作基准上大幅超过当时最强方法,说明"站在现成强 VLM 肩膀上"这条路又简单又强。
- 解耦设计好用:理解与时序动作解耦,带来开环控制和低配部署的灵活性,且不损性能。
- 不同 VLM 的行为差异:作者还分析了不同预训练 VLM 在操作任务上的表现差异(哪些 VLM 更适合当机器人底座),给后续工作提供了经验结论(细节需读原文)。
- 低成本可行:只用语言条件模仿数据轻微调即可,验证了"人人可微调"的可行性。
所以这一节是想说:实验证明"简单复用 + 轻微调"既强又实用,并揭示了不同 VLM 底座的适配差异。
你应该懂的几个新词
- VLM(视觉语言模型):会看图 + 读文字的多模态模型,如 OpenFlamingo。
- VLA(视觉-语言-动作模型):看图 + 听指令 → 输出机器人动作。
- OpenFlamingo / Flamingo:用交叉注意力把视觉塞进语言模型的 VLM;OpenFlamingo 是开源复现版。
- 交叉注意力(cross-attention):让文字去关注图像特征,把图内容融进语言理解。
- policy head(策略脑袋):加在 VLM 之上、负责建模历史并输出动作的模块。
- 模仿学习(imitation learning):模仿专家示范来学策略。
- 语言条件(language-conditioned):用语言指令指定要做的任务。
- 开环控制(open-loop):一次预测一串动作后按序执行,不必每步重算。
- CALVIN:一个语言条件的长程操作基准,常用于评测这类模型。
所以这一节是想说:VLM/VLA、交叉注意力、policy head、模仿学习是理解本篇的四个关键词。
它有什么搞不定的
- 性能受底座 VLM 限制:能力很大程度取决于所用 VLM 的强弱;VLM 的偏见和短板会被继承。
- 开环控制不擅长应对突变:一次预测一串动作、按序执行,遇到中途扰动(物体被碰动)没法及时纠偏。
- 仿真为主的验证:主要在 CALVIN 等基准验证,真机部署仍需处理 sim-to-real 与噪声。
- 模仿学习的老问题:只学专家示范,遇到示范里没出现的状态可能出错(分布漂移)。
- 语言指令的粒度:对非常抽象或多步骤的复杂指令,单个 policy head 未必能可靠拆解执行。
所以这一节是想说:它简单好用,但受底座 VLM、开环局限、模仿学习分布漂移和真机差距等约束。
它和别的几篇是什么关系
- 基座:OpenFlamingo(开源 Flamingo)是它的 VLM 底座;Flamingo 定义了交叉注意力融合视觉的范式。
- 同类 VLA 对照:RT-2(闭源,把 VLM 扩成 VLA)、OpenVLA(开源 VLA)是"用 VLM 做机器人"的其它代表;RoboFlamingo 的差异是"最小改动 + 加 policy head + 轻微调 + 解耦部署"。
- 评测:CALVIN 是它的主战场,属于语言条件操作基准。
- 理念邻居:LLaVA 等"编码器 + LLM"范式;RoboFlamingo 把这种复用 VLM 的思路用到了动作输出上。
- 出品方:字节跳动团队,主打低成本、易复现。
所以这一节是想说:RoboFlamingo 是"复用开源 VLM 做机器人"这条线的低成本代表,与 RT-2/OpenVLA 并列。
和本导读的关系
本笔记对应导读 Ch12: OpenVLA / VLAs / MLA(其规划/语言指令性质也关联 Ch10)。Ch12 讲的是"用视觉语言模型做机器人策略(VLA)"的兴起与演化。RoboFlamingo 是这条线上一个很有代表性的节点——它证明了不必从头训、只需在现成开源 VLM 上加个动作脑袋轻微调,就能得到强力、便宜、可复现的机器人策略。读完本篇再看同章的 openvla(开源 VLA)、rt-2(VLM→VLA 的闭源开创),能理解"如何把 VLM 变成 VLA"的几种不同路线。
所以这一节是想说:把 RoboFlamingo 放进 Ch12,它代表"低成本复用现成 VLM 做机器人"的路线。
思考题
Q1:为什么"复用现成 VLM"比"从头训 VLA"更划算?VLM 里已经藏着什么?
提示
VLM 已经在海量图文上学了丰富的视觉常识和语言理解。复用它就省掉了重新学这些的巨大成本。想想"站在肩膀上"。
Q2:为什么单靠 OpenFlamingo 不够,还要加一个 policy head?
提示
VLM 只懂"单步理解",机器人操作是连续的、要记历史、要出动作。policy head 补上时序建模和动作决策。
Q3:"理解"和"时序动作"解耦,带来了哪两个实用好处?
提示
开环控制(不必每步重跑大模型)和低配平台部署。想想解耦如何降低运行成本。
Q4:开环控制省算力,但在什么情况下会翻车?
提示
中途环境变化(物体被碰动、抓空)时,按预定动作序列执行无法及时纠偏。想想开环 vs 闭环的取舍。
Q5:RoboFlamingo 的能力受底座 VLM 限制,这对选 VLM 有什么启示?
提示
底座越强、越适配操作任务,效果越好;VLM 的偏见短板也会继承。论文分析了不同 VLM 的差异正是为此。
Q6:只用语言条件模仿数据轻微调,可能遇到模仿学习的什么老问题?
提示
分布漂移:遇到示范里没出现的状态可能出错。想想为什么模仿学习需要覆盖足够多样的状态。
Q7:RoboFlamingo(复用 VLM + policy head)和 RT-2(把动作也当 token 让 VLM 直接吐)路线不同,各有何优劣?
提示
RoboFlamingo 改动小、解耦灵活、便宜;RT-2 更统一(动作也是 token)、可能更端到端。想想简洁 vs 统一的权衡。
一些好奇心问答(FAQ)
Q:RoboFlamingo 需要多少数据训练?
它只用语言条件的操作模仿数据(如 CALVIN)做轻微调,不需要海量额外数据,也不重训整个 VLM——这正是它便宜的原因。
Q:它和 RT-2 有什么不同?
RT-2 把动作也当作 token 让 VLM 直接输出(闭源、大);RoboFlamingo 保留 VLM 做理解、外加一个 policy head 出动作(开源、轻、解耦),更便宜好复现。
Q:为什么强调"能上低配平台"?
因为解耦 + 开环让它不必每步都跑完整大模型,降低了算力需求,更容易实际部署。
Q:它能上真机吗?
方法上可以,但主要在 CALVIN 等基准验证;真机部署需额外处理 sim-to-real 和现实噪声。
所以这一节是想说:把 RoboFlamingo 理解成"最小改动、轻微调、可复现的 VLM→机器人"方案,定位就清楚了。
如果你想再深入
- 基座:Flamingo / OpenFlamingo — 理解交叉注意力融合视觉的 VLM 范式。
- 对照:RT-2 — 看"把动作当 token 让 VLM 直接吐"的另一条路。
- 对照:OpenVLA — 看开源 VLA 的完整方案。
- 评测:CALVIN — 理解语言条件长程操作基准。
- 基础:模仿学习(Ch14) — 理解它训练所依赖的范式。
所以这一节是想说:把 Flamingo → RoboFlamingo → RT-2/OpenVLA 串起来,能看清"VLM 变 VLA"的几条路线。
原文信息
- 标题:Vision-Language Foundation Models as Effective Robot Imitators(RoboFlamingo)
- 作者:Xinghang Li, Minghuan Liu, Hanbo Zhang, Cunjun Yu, Jie Xu, Hongtao Wu, Chilam Cheang, Ya Jing, Weinan Zhang, Huaping Liu, Hang Li, Tao Kong
- 会议:ICLR 2024(字节跳动等)
- arXiv:https://arxiv.org/abs/2311.01378
@inproceedings{li2024roboflamingo,
title = {Vision-Language Foundation Models as Effective Robot Imitators},
author = {Li, Xinghang and Liu, Minghuan and Zhang, Hanbo and Yu, Cunjun and Xu, Jie and Wu, Hongtao and Cheang, Chilam and Jing, Ya and Zhang, Weinan and Liu, Huaping and Li, Hang and Kong, Tao},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2024},
url = {https://arxiv.org/abs/2311.01378}
}
◼
引用本笔记 / Cite this note
@online{eai_roboflamingo_2026,
title = {(readable note) RoboFlamingo},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/roboflamingo/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?