Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 120

RoboMamba

15 min read · 5406 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。公式全部翻译成人话,术语第一次出现一定配类比。

一句话讲什么(TL;DR)

机器人的"大脑"原来是用 Transformer 搭的,反应慢、显存吃紧。RoboMamba 把大脑主干换成 Mamba(一种"流水线式"的新架构),让机器人既能听懂指令、看懂画面,又能快速吐出手臂动作,而且推理开销大幅下降。

所以这一节是想说:这篇论文做出了一个"想得快、算得省"的机器人大脑。


这是个什么场景

你下班回家瘫在沙发上,对厨房里的家用机器人喊一句:

"把桌上那个红苹果递给我。"

机器人得在一两秒内做完三件事:

  1. ——摄像头里哪个是苹果,桌子在哪,苹果离手臂多远。
  2. 听懂——"红的""那个"到底指哪一个物体。
  3. ——手臂的每个关节该转多少度,夹爪什么时候闭合。

这类"能看、能听、能动"的机器人模型,学名叫 VLA(Vision-Language-Action,视觉-语言-动作模型)。它吃进去的是"一张图 + 一句话",吐出来的是"机器人的动作指令"。

难点在于"实时"。机器人做连续控制,通常需要每秒吐好几次动作(10Hz 以上)才不会显得笨手笨脚。但过去的 VLA 大脑用的是 Transformer,摄像头一旦切成高清,画面切成的小方块(token)数量翻倍,Transformer 的计算量就按平方往上翻,机器人当场卡顿。

token(词元):模型处理信息的最小单位。一句话被切成一个个词是文字 token,一张图被切成一个个小方块是图像 token。模型眼里的世界,就是一长串 token。

所以这一节是想说:RoboMamba 要解决的,是"让机器人大脑在保持聪明的同时还能跑得快"这件事。


RoboMamba — 场景示意:这论文要解决的现实问题
Plate Nº IRoboMamba — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • RT-2(Google, 2023):把一个超大的视觉语言模型直接改造成机器人策略,把动作离散化成 token 一把梭输出。效果好,但模型巨大、推理慢,只能在 Google 内部的 TPU 集群上跑。 类比:请了个满腹经纶的教授来帮你拧螺丝——学问是够,但你养不起,他动作也不快。

  • OpenVLA(2024):开源版的 RT-2 路线,7B 参数,用 LLaMA 当主干。人人能下载,但 7B 在机器人本体自带的边缘 GPU 上依然偏重,部署成本高。

  • Octo / Diffusion Policy:用扩散模型出动作,动作质量高,但对自然语言指令的理解相对薄弱,"听话"这块弱一点。

  • 共同的物理瓶颈——二次复杂度:Transformer 的核心机制"注意力(attention)"要让每个 token 和所有其他 token 两两比较一遍。token 数是 n,计算量就是 n×n(记作 O(n²))。序列越长越慢,这对需要看高清图、做长任务的机器人是硬伤。 类比:Transformer 像一家凡事都要"全员开大会"的公司——每加一个员工,所有人都得重新听他发言一遍,会议时间平方级膨胀。

所以这一节是想说:以前的机器人大脑要么太大养不起,要么因为 Transformer 的平方复杂度而跑不快,"又聪明又快"这个中间地带一直空着。


这篇论文的新想法

RoboMamba 的核心赌注只有一句话:用线性复杂度的 Mamba 主干,加上一个极简的动作头,能在保住 VLA 能力的同时把推理开销砍下来。

这背后有三个判断:

  1. 理解世界不一定非得 Transformer。 Mamba 属于"状态空间模型(SSM)"家族,在自然语言处理里已经证明能和 Transformer 打平,而它的计算量只随 token 数线性增长(O(n)),不是平方。 类比:把"全员大会"改成"流水线传话"——每个人只看手里的纸条 + 上一个人塞过来的便签,开会人数翻倍,时间也只翻倍。

  2. 动作输出本质上是个低维小事。 机器人的动作说到底就是几个关节角度、夹爪开合,是个低维向量。没必要用一个庞大的解码器去生成它,一个小小的动作头就够。

  3. 先学"看懂世界",再学"动起来"。 先在通用的图文数据上让模型学会看图说话,再用少量机器人数据教它出动作。用大规模通用数据打底,可以用很少的机器人数据撬动不错的泛化。

所以这一节是想说:RoboMamba 的新意在于——把机器人大脑的主干从"平方级的 Transformer"换成"线性级的 Mamba",并把动作输出做得极简。


它分几步做的(方法)

RoboMamba 的流程可以拆成"主干怎么搭、两阶段怎么训、动作头怎么接、为什么推理快"四块。这一节最长,也是全篇的核心。

先看整体数据流的 ASCII 示意:

   图像 ──► 视觉编码器(CLIP/SigLIP) ──► 图像 token ┐
                                                    ├─► Mamba 主干 ─► hidden state ─┬─► 语言输出(看图说话)
   指令 ──► 文本 tokenizer ───────────► 文本 token ┘                              └─► 动作头(MLP) ─► 末端位姿

第 1 步:主干——把"眼睛"和"流水线大脑"接起来

输入:一张 RGB 图 + 一句自然语言指令。

处理:图先过一个现成的视觉编码器(CLIP 或 SigLIP,把图切成小方块再各自编码成向量的网络),得到一串图像 token;指令过文本 tokenizer 变成文本 token。两串 token 拼在一起,喂进 Mamba 主干。

输出:Mamba 逐个 token 读过去,维护一个隐状态(hidden state),最后一层的隐状态就是"我已经理解了这张图 + 这句话"的浓缩表示。

隐状态(hidden state):模型读到当前为止,把已经看过的信息压缩成的一串数字。可以理解成一个人边听边在脑子里记的"要点便签"。

为什么这步关键:Transformer 是"每读一个新词,回头把所有旧词再扫一遍";Mamba 是"每读一个新词,只更新手里那张固定大小的便签"。前者越读越慢,后者速度恒定。

等等,先慢一拍——Mamba 块里到底发生了什么?

一句话:它是个会挑重点的传话员

Mamba 的核心机制叫 选择性扫描(selective scan)。每来一个 token,它会根据这个 token 的内容动态决定:"这条信息往便签里塞多少、又忘掉多少。"

这跟老式的 RNN(循环神经网络,按顺序一个个传话的老架构)不一样。RNN 的"遗忘"是固定死的,不看内容;Mamba 的遗忘是"看菜下饭"的——重要的多记,废话直接扔。所以 Mamba 既有 RNN 那种"线性传话"的速度,又有 Transformer 那种"按需关注"的判断力。

用公式最朴素的形式写,SSM 的更新长这样:

h_t = A · h_{t-1} + B · x_t      (新便签 = 旧便签打个折 + 这次输入的重点)
y_t = C · h_t                    (输出 = 从便签里读出要点)

人话翻译:h 是那张便签,x 是这次读到的 token,y 是吐出来的东西。Mamba 的魔法在于让 A、B、C 不再是固定表格,而是随输入内容变化——所以叫"选择性"。

第 2 步:两阶段训练——先教看图说话,再教动手

阶段 1(先学看世界)

  • 输入:通用的图文数据(图文配对、看图问答 VQA 等)。
  • 冻结:视觉编码器基本不动(它已经在几亿张图上训过,动它只会变差)。
  • 训练:让 Mamba 主干学会"看图说话"——图配文字、回答关于图的问题。
  • 输出:一个能理解画面和语言的 Mamba 大脑。 类比:新员工入职先培训"认识公司产品",还不碰真活。

阶段 2(再学动手)

  • 输入:机器人数据(真机 + 仿真的"指令 + 画面 + 演示动作"三元组,具体配比需查原文)。
  • 处理:在 Mamba 主干上挂一个轻量的动作头(policy head)。
  • 输出:让模型学会把"理解"翻译成"动作"。 类比:培训完产品的员工被派去仓库,开始真搬箱子。

第 3 步:动作头——把"理解"翻译成"关节该怎么转"

输入:Mamba 最后一层的隐状态。

处理:一个很小的多层感知机(MLP,最基础的神经网络),故意做得轻。因为"理解世界"这件重活已经被主干干完了,动作头只需要做最后一步"翻译"。

输出:末端执行器(机械臂最末端那个夹爪)的位姿——它在空间里的位置 + 朝向,通常是 6 或 7 个数字,外加夹爪开还是合。

末端执行器位姿(end-effector pose):机械臂最前端夹爪在空间中的落点和角度。给定这几个数,机器人的控制器就能反算出每个关节该转多少。

为什么这步关键:把动作头做小,是 RoboMamba"省"的一半来源——大脑用线性的 Mamba 省一半,输出端用极简 MLP 再省一半。

第 4 步:为什么推理时特别爽

Transformer 每吐一个新 token,都要回头翻所有历史 token 的笔记,这个笔记叫 KV cache,会越积越厚,像越攒越多的会议纪要。聊得越久,显存占用和延迟越夸张。

Mamba 只维护一张固定大小的便签(隐状态)——不管聊了多久,本子就那么厚。对"把桌上东西一个个收进抽屉"这种要连续做几十步的长任务(长 horizon 任务),延迟不会随步数暴涨。这正是机器人实时控制最看重的性质。

所以这一节是想说:RoboMamba 用"线性大脑 + 极简动作头 + 两阶段训练"三件事,把一个既能理解世界又能出动作的机器人策略,做到了推理开销可控。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【RoboMamba · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

RoboMamba — 方法示意:核心 pipeline
Plate Nº IIRoboMamba — 方法示意:核心 pipeline

关键数字(What works)

下面的数字来自论文与官方公开材料的定性描述。RoboMamba 的卖点是"效率-能力帕累托前沿",所以最该看的是"推理速度"和"跟大模型的能力差距"两栏。凡是笔者不能确证的精确数值,一律标注"需查原文",绝不编造。

维度 RoboMamba 对照/说明
主干架构 Mamba(SSM,线性复杂度 O(n)) OpenVLA/RT-2 用 Transformer,O(n²)
参数规模 约 2.7B 量级(含视觉+语言+动作) 远小于 RT-2 的数十 B
动作推理速度 论文主打"比同类 VLA 快数倍" 具体倍数需查原文
动作头 轻量 MLP,仅需少量微调即可学会出动作 强调"高效微调"
训练阶段 两阶段(先 VL 预训练,再动作微调) 沿用 LLaVA 式配方
评测环境 SimplerEnv / 真机操作任务 与 OpenVLA 等对比成功率

关键定性结论:RoboMamba 想证明的不是"我分最高",而是"在差不多的任务成功率下,我的推理明显更快、更省"。这类工作最有价值的图通常是一张"横轴延迟、纵轴成功率"的散点图,RoboMamba 应落在左上角(又快又准)。

所以这一节是想说:数字告诉我们,RoboMamba 的价值在效率维度——用可接受的能力代价换来了明显的速度与部署优势。


实验结果说明了什么

RoboMamba 的实验主要回答三个问题:

  1. 能力够不够? 在 SimplerEnv 这类机器人 benchmark 和真机任务上,和 OpenVLA、RT-2 系列比操作成功率。结论方向是"接近同级大模型",而不是碾压。

  2. 效率是不是真赢? 对比推理延迟、显存、参数量。这是 Mamba 路线的立身之本——如果这里赢不了,整篇就没意义。

  3. 哪个设计最关键? 靠消融实验回答。最值得看的一行是"把 Mamba 主干换成同参数量的 Transformer"——如果换了以后速度掉、能力不变,说明快确实来自 Mamba,而不是"因为模型小所以快"。

读实验时,重点盯长 horizon 任务:如果 Mamba 真有线性优势,它应该在需要连续做很多步的任务上,把延迟差距拉得最开。

所以这一节是想说:实验的意义不在于刷榜,而在于验证"线性主干能不能在保住能力的前提下换来实打实的速度"。


你应该懂的几个新词

  • VLA(Vision-Language-Action):视觉-语言-动作模型。吃"图 + 指令",吐"机器人动作"。
  • SSM(State Space Model,状态空间模型):用一个隐状态向量在序列上线性递推的模型族,Mamba 是其中的明星成员。
  • Mamba:2023 年提出的一种 SSM,靠"选择性扫描"兼顾了 RNN 的速度和 Transformer 的表达力。
  • 选择性扫描(selective scan):Mamba 的核心,让隐状态的更新依赖当前输入内容,等于一个"会看内容的动态遗忘门"。
  • 二次复杂度 / 线性复杂度:Transformer 注意力是 O(n²),Mamba 是 O(n),n 是 token 数——序列越长,两者差距越大。
  • KV cache:Transformer 推理时缓存的历史键值,随生成长度线性增长,是长序列推理的显存和延迟大户。Mamba 不需要它。
  • 动作头(action head):把语言模型隐状态映射成连续动作的小网络。
  • 末端执行器位姿:机械臂最末端夹爪的位置 + 朝向,通常 6-7 维。

所以这一节是想说:这几个词是理解"高效 VLA"这条研究线的通用钥匙,以后看 SmolVLA、TinyVLA 都会反复用到。


它有什么搞不定的

  • 能力上限受主干限制:Mamba 在超长上下文、复杂多步推理上,和最顶尖的大 Transformer 还有差距。RoboMamba 走的是"够用且快",不是"最强"。
  • 机器人数据仍然稀缺:两阶段训练里第二阶段依赖真机/仿真数据,这类数据的采集成本高、覆盖任务有限,泛化到全新场景仍是挑战。
  • 动作头简单是双刃剑:极简 MLP 动作头对"同一画面有多种合理动作"(多模态动作分布)的建模能力弱,不如 Diffusion Policy 那类能表达多解的输出方式。
  • Mamba 生态不成熟:相比 Transformer 铺天盖地的工具链、算子优化,Mamba 的硬件支持和调试工具还在早期,工程落地有隐性成本。

所以这一节是想说:RoboMamba 的定位是"效率优先的中量级选手",它在能力天花板、数据依赖和输出多模态上都有明确短板。


它和别的几篇是什么关系

  • 正面对比OpenVLA、RT-2-X、Octo——RoboMamba 主要在这些基线上证明"我更快、更省"。
  • 方法亲戚:Mamba(Gu & Dao, 2023)是它的主干来源;视觉那侧借鉴了 LLaVA / SigLIP 这些视觉语言模型的接法。
  • 同赛道邻居TinyVLASmolVLA 也都在做"把 VLA 做小做快",但它们主要靠"缩小 Transformer + 换动作头",RoboMamba 是"直接换非 Transformer 主干",是更激进的一条路。
  • 互补关系:跟 Diffusion Policy 不是死敌——Diffusion 强在动作多模态建模,Mamba 强在主干效率,理论上可以拼起来(Mamba 主干 + Diffusion 动作头)。
  • 下游影响:以后凡是做"边缘设备上的 VLA"(机器人上不了 A100),这条"用线性架构降本"的线都会被反复引用。

所以这一节是想说:RoboMamba 是"把新架构从 NLP 搬进机器人"的代表尝试,和缩小派 VLA 并列,共同回答"VLA 怎么才能真上机器人本体"。


和本导读的关系

本篇对应导读 Ch12: OpenVLA / VLAs / MLA。Ch12 讲的是通用机器人策略(VLA)从"大而强"到"可部署"的演化脉络。RoboMamba 是这条线里"换主干求效率"的关键样本——读完它,再回看同章的 openvla(7B 基准)、tinyvla(缩小派)、smolvla(社区民主化),你就能画出一张"VLA 怎么变小变快"的分岔图:一条是缩小 Transformer,一条是干脆换掉 Transformer。

所以这一节是想说:把 RoboMamba 放进 Ch12 的"VLA 效率化"主线里读,能看清它在整条演化树上的位置。


思考题

Q1:为什么 Mamba 在长序列任务上相对 Transformer 的优势会被放大,而在很短的任务上几乎看不出来?

提示

回到复杂度公式。O(n²) 和 O(n) 在 n 很小时差距不大(比如 n=5,25 vs 5),但 n 一大就天差地别(n=1000,一百万 vs 一千)。机器人做几十步长任务时,token 序列会越拖越长。

Q2:RoboMamba 把动作头做得很小,这个选择在什么样的任务上会成为瓶颈?

提示

想想"同一个画面下有多种都对的动作"的场景(比如从两个方向都能绕过障碍)。小 MLP 倾向于输出一个"平均动作",可能哪个都不像。这正是 Diffusion Policy 想解决的多模态问题。

Q3:如果把 Mamba 换成同样参数量的 Transformer,重跑一遍实验,你预期哪些指标会变、哪些不会变?

提示

能力(成功率)可能变化不大甚至 Transformer 略高;但推理延迟、长序列显存会明显不同。这正是消融实验要隔离的变量——把"快"归因给架构而不是规模。

Q4:两阶段训练里,为什么第一阶段要冻结视觉编码器?如果第一阶段就解冻它会怎样?

提示

视觉编码器是在几亿张图上预训练好的。RoboMamba 手里的数据量小得多,解冻它容易"越训越差"(灾难性遗忘)。这和 LLaVA 冻结 CLIP 是同一个道理。

Q5:选择性扫描的"选择性"具体体现在哪?去掉这个"选择性"(退回固定参数的普通 SSM)会损失什么?

提示

"选择性"= 让 A/B/C 随输入内容变化。去掉后模型对"这个 token 重不重要"就一视同仁,无法根据内容动态记忆或遗忘,表达力会明显下降——这正是 Mamba 相对早期 SSM(如 S4)的关键改进。

Q6:为什么说 Mamba 主干 + Diffusion 动作头"理论上可以拼起来"?拼起来会牺牲什么?

提示

主干负责理解、动作头负责输出,两者相对独立,接口是隐状态。拼起来能同时拿到"主干快"和"动作多模态",但 Diffusion 头要多步去噪,会把 Mamba 省下来的推理时间又吃回去一部分。

所以这一节是想说:这几个问题带你把"复杂度、多模态、冻结策略、架构消融"这些核心概念自己推一遍。


一些好奇心问答(FAQ)

Q1:Mamba 真的比 Transformer 强吗?为什么大家还在用 Transformer?

不是"更强",是"不同权衡"。Mamba 省、快、擅长长序列;Transformer 生态成熟、并行训练友好、超大规模下效果依然最稳。目前主流大模型仍以 Transformer 为主,Mamba 更多在"要省要快"的场景发光,机器人正是这种场景。

Q2:RoboMamba 我自己能跑吗?

它是 NeurIPS 2024 的公开工作,有开源代码和权重。2.7B 量级比 7B 的 OpenVLA 友好,一张高显存消费级 GPU 有机会跑推理。真机部署还需要对应的机械臂和控制栈。

Q3:它和 OpenVLA 到底谁的成功率高?

在多数报告里两者接近,RoboMamba 不以刷成功率为目标,而以"相近能力下更快"为卖点。要精确数字请查论文的主结果表。

Q4:动作是离散 token 还是连续值?

RoboMamba 走的是"隐状态 → 动作头 → 连续末端位姿"的连续路线,而不是 RT-2 那种把动作切成离散 token。连续输出对精细操作更自然。

Q5:为什么视觉还是用 CLIP/SigLIP 这种 Transformer 编码器,没一起换成 Mamba?

视觉编码器的输入 token 数相对固定且不算长,Transformer 的平方复杂度在这里不是主要瓶颈;而且现成的 CLIP/SigLIP 权重质量极高,直接拿来用最划算。省要省在最痛的地方——序列会变长的主干。

Q6:读完 RoboMamba 接下来看什么?

如果对"VLA 做小"感兴趣,接着读 TinyVLASmolVLA,对比三种降本思路;如果对 Mamba 本身好奇,去读 Mamba 原论文的选择性扫描章节。

所以这一节是想说:实操层面(能不能跑、动作怎么出、为什么这么设计)作者都考虑过,门槛比想象低。


如果你想再深入

按"前置 → 同赛道 → 延伸"排序:

  1. 前置:Mamba(Gu & Dao, 2023) —— 不懂选择性扫描,RoboMamba 的方法章会看不懂"为什么要选择性"。先啃 Mamba 原论文的核心机制。
  2. 前置:OpenVLA —— 理解标准 VLA 长什么样、瓶颈在哪,才知道 RoboMamba 在省什么。
  3. 同赛道:TinyVLA / SmolVLA —— 另外两条"VLA 降本"路线,横向对比最能看清设计取舍。
  4. 延伸:Diffusion Policy —— 理解"动作多模态"这个 RoboMamba 的短板,是它未来可能的融合方向。

所以这一节是想说:把 Mamba + OpenVLA + RoboMamba 这三篇连起来读,就能看懂"高效 VLA"这条线的来龙去脉。


原文信息

  • 标题:RoboMamba: Multimodal State Space Model for Efficient Robot Reasoning and Manipulation
  • arXiv:https://arxiv.org/abs/2406.04339
  • 会议:NeurIPS 2024
  • 年份:2024

BibTeX:

@inproceedings{liu2024robomamba,
  title     = {RoboMamba: Multimodal State Space Model for Efficient Robot Reasoning and Manipulation},
  author    = {Liu, Jiaming and Liu, Mengzhen and Wang, Zhenyu and others},
  booktitle = {Advances in Neural Information Processing Systems (NeurIPS)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2406.04339}
}

所以整篇是想说:当 Transformer 的平方复杂度成为机器人实时控制的绊脚石,RoboMamba 用一个线性主干 + 极简动作头证明——"又聪明又快"的机器人大脑,是可以造出来的。

引用本笔记 / Cite this note
BibTeX
@online{eai_robomamba_2026,
  title       = {(readable note) RoboMamba},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/robomamba/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?