Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 6

MLA: Multisensory Language-Action Model

33 min read · 11675 字 · ⭐⭐⭐⭐ · 长篇结构化

这是给读者写的"零术语"版本。任何新词第一次出现都会用一句话+生活类比讲清楚。只看这份笔记就能理解全文机制。

一句话讲什么(TL;DR)

让机器人不只用眼睛看,还会用"手感"和"空间感",并且大脑自己直接听三种感官(不请翻译),训练时还要脑补未来的画面、形状和触感——推理时省掉脑补这步,相当于白嫖了一波理解力,最终在接触密集操作任务上大幅超越前辈。

所以这一节是想说:MLA 给机器人加了"手感"和"空间感",让大脑直接理解而不经翻译,训练时逼它做"预判题"来强化物理直觉,干活时不考这些题、速度不变。


这是个什么场景

想象一下:你拿着湿布擦黑板。眼睛盯着哪里还有粉笔字;手腕在感受压得紧不紧——压太轻擦不掉,压太重又会"吱啦"一声把黑板划花;胳膊在感受布有没有真贴在板上。这三件事你是同时在做的,根本没在脑子里分开想。

现在换个玩法:让你戴上 VR 头盔,远程操作一只机械手去擦——你只能"看",没有手感、没有距离感。结果就是擦个黑板都跟拆炸弹一样紧张。

机器人今天就处在这个尴尬位置。它过去主要靠摄像头(相当于只有眼睛),可现实里很多活——擦桌、盖图章、用铲子把鸡蛋铲到面包上——光看是不够的,得眼睛、距离感、指尖三样一起配合才不会出岔子。

MLA 这篇论文瞄准的就是这类"接触密集任务"(contact-rich task):机器人要反复碰到物体、还要施力的活儿。比如盖章(需要感知按到底了没有)、擦白板(需要感知是否贴在板上)、用铲子翻鸡蛋(需要感知铲子底部是否托住了鸡蛋)。它的实验平台是 Franka 机械臂,包括单臂 4 个任务和双臂 2 个任务。

整体思路:老办法 vs MLA
Plate Nº I整体思路:老办法 vs MLA

所以这一节是想说:擦黑板、盖章这种"用力气"的事,光看摄像头办不到,得有手感和距离感。MLA 想让机器人像人一样三感并用。


MLA — 场景示意:这论文要解决的现实问题
Plate Nº IIMLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

在 MLA 之前,让机器人"看图听话动手"的 VLA(Vision-Language-Action)模型已经是主流路线了。你在之前精读过的 OpenVLA 就是代表——它把动作伪装成"单词",让一个会"看图说话"的 AI 顺手把"该往哪动"也说出来。但这条路线有四个核心限制:

限制一:只让机器人看摄像头,不给手感。 像 OpenVLA 和 pi0 这样的经典 VLA,输入只有 RGB 图像和语言指令。就像戴 VR 远程擦黑板——光有视觉,擦不干净。这类模型在接触密集任务上的成功率比 MLA 低 12-24 个百分点,差距不是偶然。

限制二:要加新感官,就外挂一个新的"翻译机"(编码器)。 比如想加 3D 信息,SpatialVLA 就外挂了一个 3D 编码器。想加触觉?又得外挂一个触觉编码器。每加一种感官就多一个模块。这带来两个问题:第一,多一个翻译多一道损耗——原始信息经过编码器"翻译"之后难免丢东西;第二,系统越来越臃肿,推理速度拖慢。MLA 的消融实验直接证明了这一点——在 MLA 上额外加装 SigLIP 和 Lift3D 编码器,性能反而掉了 7 个百分点。

限制三:外挂翻译机没和大脑一起练过。 OpenVLA 用的双视觉编码器(DINOv2 + SigLIP)是在互联网图片上预训练的,它学到的是"这张图里有什么东西"。但机器人需要回答的是"这个东西在三维空间里的精确位置和姿态是什么"。编码器的"偏见"和大脑(LLM)的需求对不上号——你请了一个英语翻译来翻日语,翻得再好也有走样。

限制四:就算它会"想象未来",也只能想象下一张图片。 DreamVLA、CoT-VLA 这类工作让模型预测未来画面来增强物理理解,但它们只预测 2D 图像。机器人真正想知道的还包括"我手按下去会有多紧"(触觉)和"那个东西的三维形状会怎么变"(点云)。只想象图片是不够的。

VLA(Vision-Language-Action 模型):让大脑既能看图、又能听话、又能控制机器人手脚的一类系统。相当于一个人同时具备眼(视觉)、耳(语言)、手(动作)三种能力。

编码器(Encoder):把某种感官的原始信号翻译成大脑听得懂的"语言"的小程序。好比把法语翻译成中文的翻译官。

大语言模型(LLM, Large Language Model):吃过海量文字的"大脑",现在的 ChatGPT 内核就是这种东西。MLA 用的是 LLaMA-2 7B。

所以这一节是想说:以前要么感官太少,要么外挂翻译太多翻出来还不对味,要么只会脑补图片不够立体。MLA 想一网打尽这四个问题。


这篇论文的新想法

MLA 的核心思路可以用两句话概括:

第一句:不请翻译,让大脑自己直接听三种感官。 把图像、3D 点云、触觉信号都简单切碎后直接塞进 LLM,让 LLM 的前几层充当"万能感知层"——不需要外挂任何专用编码器。同时用几何关系做"对齐考试",让大脑知道三种感官说的是同一件东西。

第二句:让大脑同时脑补未来的画面、形状和触感,干活时省掉这步。 训练时逼模型同时预测未来关键帧的 RGB 图像、3D 点云和触觉信号。这三道"预判题"只在训练阶段考——推理时不考,好处全拿,代价不交。

对比 OpenVLA 的思路——"把大规模预训练 VLM 微调成控制器"(VLA 三连的第一篇),MLA 走的是一条不同的路:它不需要外挂编码器、不走离散 token 的动作表示、也不需要超大规模的预训练数据来支撑多模态融合。它用一套精巧的训练信号(几何对比学习 + 多感官未来预测)来迫使 LLM 自己长出处理多模态信号的能力。这是一条"不依赖大规模预训练编码器"的轻量级替代路线。

对比 VLAs Survey 的分类体系,MLA 属于"带辅助预测任务的端到端 VLA",且是第一个将辅助预测从单一 2D 图像扩展到多模态(图像 + 点云 + 触觉)的工作。

所以这一节是想说:把"感知"和"预判"都塞回大脑里,外挂越少越好——用训练信号的巧思替代架构的堆料。


它分几步做的(方法)

这是本文最核心的部分。MLA 的方法可以拆成五个模块,它们像搭积木一样叠在一起。下面逐个拆解。

整体框架图
Plate Nº III整体框架图

上面这张图是论文的"地图"——三种感官的输入在哪、对齐考试加在哪、未来预测分支挂在哪,全在这一张。建议反复对照。


步骤 1:把三种感官直接塞进大脑(多模态输入 Tokenizer)

类比:原来你请了三个翻译(英语翻译、法语翻译、西班牙语翻译)开会,每种信息都得绕一圈。现在你直接找一个本身会三种语言的人来听,省去全部翻译。

输入:一张 RGB 图片、一堆 3D 坐标点(点云)、两个指尖的力度数据(触觉)、语言指令、机器人当前姿态。

处理:MLA 不装任何外挂编码器。它为三种感官各设计了一个极简的"切碎器"(Tokenizer),把原始信号变成 LLM 能吃的 token 序列:

图像切碎器(Image Tokenizer):把一张图片切成 14 像素 x 14 像素的小方格,总共产生 256 个 token。每个 token 经过一个简单的线性投影,维度变成 4096(和 LLM 的内部维度一样)。这和 Vision Transformer 处理图像的方式完全一样——区别只是后面不接独立的 Transformer 编码器,而是直接送进 LLM。

Token(令牌):大脑处理信息的最小单位。对文字来说是一个词或半个词;对图片来说是一个小方格;对点云来说是一小簇 3D 点。

3D 点云切碎器(3D Point Cloud Tokenizer):原始输入是 1024 个三维坐标点。通过三轮"选代表"操作把它们压成 256 个 token。每轮操作分三步:(1)用最远点采样(FPS)从一堆点里挑出几个"互相离得最远"的点当"小队长"——就像从全班同学里挑 5 个身高差异最大的人代表全班;(2)用 K 近邻(KNN)给每个小队长找它周围最近的一群"队员";(3)用一个线性层把每个小队连同队员的坐标编码成一个 token。三轮之后,256 个 token 就代表了整个 3D 场景的空间结构。

点云(Point Cloud):用深度摄像头测出来的一堆三维坐标点。想象往场景里洒了 1024 颗小珠子,每颗珠子知道自己在空间里的 (x, y, z) 位置。

最远点采样(FPS):从一堆点里挑出几个"互相离得最远"的代表。目的是用最少的点覆盖最大的空间范围。

K 近邻(KNN):给一个点找它周围最近的 K 个朋友。就像你在班里的 K 个最近的同学。

触觉切碎器(Tactile Tokenizer):每个夹爪指尖装一个触觉传感器,每个传感器输出 6 个数字——法向力(按了多紧)、切向力(横向摩擦有多大)、力的方向(两个分量)。两个指尖总共 12 个数字,经过一个简单的 MLP(多层感知机,就是"几层全连接计算"),变成 1 个 token。没错,触觉只有 1 个 token——因为触觉信号本身维度极低,不需要更多。

输出:把所有 token 拼成一条长序列,送入 LLaMA-2 7B 的第一层:

[256 个图像 token] + [256 个点云 token] + [1 个触觉 token] + [语言指令 token] + [机器人状态 token] + [噪声 token(给扩散头用)]

为什么这步有用

  • 少装翻译机,省内存、省算力,跑得更快——对比加了编码器反而掉 7% 性能。
  • 大脑的"理解空间"是它自己从海量文本中学出来的,外挂编码器的特征空间是另外学的——两边"频道"对不上。让大脑自己直接处理,等于让它用自己最舒服的方式理解新模态。
  • LLM 的底层(前几层)实际上学到了非常通用的模式匹配能力——局部相关性、重复结构、频率分析。这些能力对图像(空间相邻关系)、点云(局部几何)、触觉(时序模式)同样有用。

所以这一节是想说:感官信号直接交给大脑前几层处理,省掉中间商。三种感官加在一起只有 513 个 token,没比纯图像(256 token)增加太多负担。


步骤 2:强迫大脑认识到"这是同一个东西"(Encoder-Free Multimodal Alignment)

类比:班级合影里有 30 个人,老师指着一张人脸说"这是张三"。你看一眼就能在另一张运动会照片里把张三认出来——因为你知道"同一个人出现在不同场景"。但机器原本不知道:图像里的某个 patch = 点云里的某个 3D 小队 = 触觉传感器感知到的那个接触位置。得有人手把手教它。

输入:LLM 第 8 层的隐藏状态(各模态的 token 经过 8 层处理后的表征)。

处理核心:在 LLM 的第 8 层加一个"对齐考试"——用对比学习(Contrastive Learning)让三种模态中描述同一物理位置的 token 互相靠近,不相关的 token 互相远离。

具体分三步:

第一步:用几何投影找"同一件事"。 论文最巧妙的地方就在这里——它不靠模型自己猜"哪些 token 对应同一个物体",而是用确定性的几何关系直接算出来:

  • 对于点云的第 i 个 token(它是一个 3D 点的"小队长"),用相机的内参和外参矩阵做投影,算出这个 3D 点落在 RGB 图片的哪个 14x14 小方格里。这是纯几何运算,不用学习——就像你知道"教室前排第三个座位"在班级合影里的哪个位置一样。
  • 对于触觉 token,直接读取夹爪在世界坐标系中的 3D 位置,投影到 RGB 图像上找到对应的 patch。

第二步:构造正负样本对。

  • 正样本对:点云 token i 和它投影到的图像 patch j —— 它们描述的是同一个物理位置。
  • 负样本对:点云 token i 和其他 255 个图像 patch —— 它们描述的不是同一个位置。
  • 触觉同理:触觉 token 和它投影到的那个图像 patch 是正对。

第三步:用 InfoNCE 损失"考试"。 考试规则是"对的拉近、错的推远":

对于图像-点云对齐,损失公式(用人话说)是:

  • 对于每对正样本(图像 patch j,点云 token i),计算它们的相似度(向量夹角的余弦值除以温度系数)
  • 正样本的相似度要远远大于所有负样本的相似度之和
  • 256 对正样本的平均"差距"就是扣分——差距越小扣分越多

对于触觉-图像和触觉-点云对齐,触觉只有 1 个 token,所以是单向对比——把这 1 个触觉 token 拉向它对应的图像/点云位置。

三个对齐损失加在一起:L_contrastive = L_img-pc + L_tac-img + L_tac-pc

对比学习(Contrastive Learning):训练模型的一种方式——告诉它"这两个东西是一回事(正样本),要靠近"和"这两个东西不是一回事(负样本),要远离"。CLIP 用图文对做对比学习;MLA 用几何投影构造的位置对做对比学习。

InfoNCE 损失:对比学习中最常用的一种"扣分规则"。名字来源于 Noise Contrastive Estimation。直觉:正样本的相似度应该在所有候选中占最大比例。

输出:经过第 8 层对齐后,LLM 后续的第 9-32 层拿到的就是"已经知道三种感官说的是同一件事"的表征,可以放心做高层推理和决策。

为什么选第 8 层而不是别的层? 论文做了消融实验——分别在第 4、8、12、32 层加考试:

考试位置 效果
第 4 层 信号太原始,特征还没成型,考试"出题太早"
第 8 层 最好——特征已有一定抽象但还没偏向文本语义,是"刚成型还没决策"的甜区
第 12 层 略差——开始分化成语言特有表征了
第 32 层 最差——最后一层已经在同时优化动作输出和未来预测,再加对齐任务导致"任务打架"

为什么用几何而不靠模型自己学? 如果让模型自己判断"图像里的猫和点云里的猫是同一个猫",这很难定义、容易学偏。但"3D 坐标 (x,y,z) 通过相机矩阵投影到像素 (u,v)"是确定性的几何运算——结果唯一、不需要猜。论文聪明地用几何当老师,省去了大量自监督学习的不确定性。

所以这一节是想说:用确定性的几何投影找到"同一件事"在不同感官中的对应,再用对比学习把它们在 LLM 内部表征空间中拉到一起。这让大脑真正"知道"三种感官说的是同一个物理世界。


步骤 3:让大脑脑补"下一秒"会发生什么(Future Multisensory Generation)

类比:打篮球抢板,你不会等球落下来才举手——你会预判球会弹到哪里然后提前到位。高水平球员和菜鸟的最大区别就在"预判"。MLA 让机器人也学会这种预判能力——不是靠天赋,而是靠训练时做"脑补未来"的练习题。

输入:LLM 最后一层的隐藏状态(即模型对当前场景的全部理解)。

处理:在 LLM 后面挂三个轻量级的 Transformer Decoder(解码器),分别负责生成未来关键帧的三种感官状态:

图像预测:一个 4 层 Transformer Decoder,从 LLM 的最终特征出发,生成未来关键帧的 RGB 图像。用 MSE 损失(像素级别的均方误差)做监督——让预测出的图像和真实未来图像的差距最小。一个小技巧:背景像素不参与计分,只看前景物体——用深度图把背景遮掉,省得模型把功夫花在桌面布纹这种没用的细节上。

点云预测:另一个 4 层 Transformer Decoder,生成未来关键帧的 3D 点云。这里用了一个叫 Chamfer Distance 的度量——直觉上就是"预测的点云和真实的点云之间每个点到最近邻的平均距离"。先用 FPS 把真实点云分成 G 个局部小组,让 Decoder 先预测小组中心点的位置(粗定位),再预测每组内的邻近点(精细化)。

关键帧(Keyframe):动作的"转折时刻"——比如夹爪从张开变合上的那一帧、机器手从快速移动变成慢速接触的那一帧。一段 200 帧的视频里关键帧通常只有 5-15 帧。预测关键帧比预测"下一帧"更有挑战——因为关键帧之间的变化更大、信息量更多。

Chamfer Distance:衡量两堆点之间的"像不像"的指标。对于预测的每个点,找到真实点云中离它最近的点,算距离;反过来也算一遍;两边取平均。越小说明两堆点越像。

触觉预测:最简单的一个 Decoder,输出未来关键帧的低维触觉向量(6 个数字),用 MSE 损失。

关键设计决策:只在训练时做,推理时去掉。 这三个 Decoder 和它们的损失只在训练阶段起作用——相当于给模型布置了三道"附加题"。机器人真正干活时,这三个分支完全不参与计算,不拖慢推理速度。它们的价值在于:训练时逼着 LLM 的内部特征去编码"未来会怎样"的信息,这些信息沉淀在 LLM 的中间表征里,间接帮助了动作生成——即使推理时不显式预测未来了,那些"对未来有感觉"的特征仍然在为动作决策服务。

为什么预测"关键帧"而不是"下一帧"? 论文做了对比——预测相邻帧(下一帧)只有 64% 成功率,预测关键帧有 70%。原因是相邻帧之间变化太小(机器人每帧只动了一点点),模型几乎可以"抄当前帧的答案"就拿高分——学不到真正的物理动态。而关键帧之间的变化大、信息量多,模型必须真正理解"动作导致什么后果"才能预测对。

输出:训练时产生三个额外损失项(L_future = L_img_pred + L_pc_pred + L_tac_pred)。推理时这些分支不参与。

脑补未来画面的可视化
Plate Nº IV脑补未来画面的可视化

上图:左边是真实未来画面,右边是 MLA 脑补出来的。可以看到机械臂的姿势、物体的状态都被合理地猜出来了。

所以这一节是想说:训练时多让大脑做"预判题"(同时脑补画面、形状、手感),干活时省掉这部分计算,相当于白嫖了一波物理世界理解力。预测关键帧比预测下一帧更有效,因为迫使模型学真正的动态而不是"抄作业"。


步骤 4:训练分三阶段,像婴儿学走路

类比:婴儿先学认人脸和听声音(基础感知),再学触摸东西的手感(多感官融合),最后学会预判球会飞到哪里(物理预判)。一口气全教是教不来的——得按顺序来。

为什么不能一锅炖? 网上能找到的开源机器人数据(570K 轨迹、3600 万帧画面)几乎都只有 RGB 图像和动作标签,没有点云、没有触觉。如果一开始就要求模型同时处理三种感官,空位置的 token 会干扰训练。先用海量"看图听话"数据打底,再逐步加新感官,更稳定。

阶段 数据 教什么 损失函数
1. 大规模预训练 570K 轨迹 / 3600 万帧(公开数据集,28 个数据源) 只教"看图 + 听话 + 出动作"。点云和触觉位置先空着。 L_diff(扩散去噪损失)
2. 监督微调(SFT) 6 个真机任务,每任务 200 段示范 加入点云和触觉,开始练"对齐三种感官"——启动对比学习。 L_sft = L_diff + L_contrastive
3. 后训练(Post-Training) 同 SFT 数据 在 SFT 之上,再加"脑补未来"的预测损失。 L_post = L_diff + L_contrastive + L_future

阶段 1 细节:训练 10 个 epoch。数据来自 Open-X-Embodiment、DROID、RoboMIND 等 28 个公开数据集的合并,按比例采样(BridgeV2 占 21%、Kuka 占 20%、Fractal 占 14% 是三大来源)。此阶段 LLM 的初始权重来自 Prismatic VLM(这是 OpenVLA 同一个底座),已经具备基本的图文理解能力。

阶段 2 细节:在自采数据上训练 300 个 epoch。此时点云和触觉的 token 位置不再空着,开始真正送入三种感官数据。对比学习损失开始强制对齐。AdamW 优化器。

阶段 3 细节:在阶段 2 的基础上继续训练 100 个 epoch。新增未来多感官预测的三个 Decoder 和对应的损失。

为什么 SFT 要 300 个 epoch 这么多? 因为自采数据只有 200 条示范 x 6 任务 = 1200 条轨迹——数据量很小。和 OpenVLA 在 970K 轨迹上训 27 epoch 不同,MLA 在小数据上需要更多遍历才能学好。这也是实验室规模工作的典型特征。

所以这一节是想说:分阶段教,先用海量纯视觉数据打底,再用小量多感官数据精调,最后加预判题。每阶段只加一点新东西,稳定可控。


步骤 5:用"画家擦噪点"的方式输出动作(Diffusion Action Head)

类比:素描班老师让你先在白纸上随意涂一团乱线,然后一遍遍擦、修,最后浮现出一只猫的轮廓。MLA 输出动作的方式就是这样——先给一团乱数字,再迭代几步擦干净,最后变成机器人手要走的精确路径。

输入:LLM 处理完所有 token 后输出的隐藏状态,加上一组随机噪声 token(附在输入序列末尾)。

处理

  • 训练时:把真实动作(一组 7 个数字:3 个位移方向 + 3 个旋转角度 + 1 个夹爪开合)人工加上随机噪声,让模型学着预测加的是什么噪声(从而间接学会"去噪")。损失是 DDPM 目标——预测噪声和真实噪声之间的 MSE。
  • 推理时:从纯噪声开始,用 DDIM 采样器迭代 4 步去噪,得到最终动作。

为什么用扩散模型而不是像 OpenVLA 那样用 256-bin 离散分类? 两个原因:

第一,精度无上限。OpenVLA 的 256 bin 精度约 4mm,对精密操作(如盖章时的下压控制)可能不够。扩散头输出的是真正的连续值。

第二,天然处理多模态分布。同一个场景下经常有好几种合理动作——比如铲鸡蛋时从左边铲或从右边铲都行。如果用分类方法直接一步算,会被"平均值"坑——输出一个左右之间的"中间动作",那个中间值往往不能执行。扩散模型天然能在每次去噪时"选择"一条合理路径——不同的初始噪声收敛到不同的合理动作。

扩散模型(Diffusion Model):先加噪声再擦干净的生成方式。日常用的 AI 画图工具(Midjourney、Stable Diffusion)也是这套,只不过它擦的是图片噪声,MLA 擦的是动作噪声。

DDIM:一种加速去噪的方法——原版扩散要擦 1000 步才干净,DDIM 可以只擦 4 步就得到高质量结果。代价是每步计算量略大。

单臂的动作是 7 维向量:[Dx, Dy, Dz, R_roll, R_pitch, R_yaw, gripper]。双臂是把两个单臂拼成 14 维。

输出:7 维(或 14 维)连续动作向量,直接送给机器人控制器执行。

和 OpenVLA 动作输出的对比

维度 OpenVLA MLA
表示方式 256-bin 离散 token 连续值(扩散)
生成方式 自回归逐 token(7 次 forward) 4 步 DDIM 去噪
精度 ~4mm 理论无限
多模态动作 不好处理 天然支持
预测步数 1 步动作 1 步动作(但训练时有预测未来关键帧的辅助任务)

所以这一节是想说:动作输出像素描一样"先乱画再修",避免被"平均值"坑,精度也比离散化更高。4 步就够用,不拖速度。


方法总结:完整流程一览

把五步串起来,一条完整的推理链路是:

RGB 图 → 切碎成 256 token ─┐
点云 → 切碎成 256 token ──┤
触觉 → 变成 1 token ──────┤→ 拼成一条长序列
语言指令 → tokenize ───────┤   → 送入 LLaMA-2 7B
机器人状态 → embed ─────────┤      → 第 8 层做对齐(推理时免费,权重已学好)
噪声 token ─────────────────┘      → 第 32 层输出特征
                                       → 扩散头 4 步去噪
                                       → 7 维连续动作

训练时额外有:第 8 层的对比损失 + 最后一层接三个 Decoder 做未来预测。推理时这些都不参与。

所以这一节(方法整体)是想说:MLA 的方法论核心是"减法 + 训练信号的加法"——架构上做减法(去掉编码器),训练信号上做加法(对比对齐 + 未来预测),用巧思的训练策略替代笨重的架构堆料。


MLA — 方法示意:核心 pipeline
Plate Nº VMLA — 方法示意:核心 pipeline

关键数字(What works)

每个数字都按"实验怎么做 → 结果 → 跟谁比 → 意味着什么"读。

真机实验结果
Plate Nº VI真机实验结果
实验 设置 MLA 对比对象 差距 意义
真机 6 任务平均 每任务 200 示范,15 次评测,随机初始位置 领先 pi0 (2D SOTA) +12% 纯 2D 视觉不够用
真机 vs 3D 方案 同上 领先 SpatialVLA (3D SOTA) +24% 外挂 3D 编码器不如无编码器
RLBench 仿真 10 任务 每任务 100 示范,20 次评测,无触觉 81% pi0 65%, SpatialVLA 46% +16%, +35% 砍掉触觉也赢,核心方法本身站得住
泛化-换物体 训练用鸡蛋,测试改生菜 掉 15% pi0 掉 26% 少掉 11% 多感官表征更鲁棒
泛化-换背景 训练桌面干净,测试堆杂物 掉 25% pi0 掉 47% 少掉 22% 距实用更近一步
对比层位置 第 4/8/12/32 层 第 8 层最好 第 32 层最差 中段是甜区
加编码器 加 SigLIP + Lift3D 掉 7% 无编码器版本 少请翻译不只省钱,本身更好
关键帧 vs 相邻帧 预测目标不同 关键帧 70% 相邻帧 64% +6% 预判要有"信息量"才有效
消融实验
Plate Nº VII消融实验

所以这一节是想说:MLA 的赢面不是靠堆硬件或堆传感器,而是靠"少装翻译 + 对齐三感官 + 预判未来"这套思路。即使砍掉触觉(仿真实验),光靠对齐和预判也大幅领先。


实验结果说明了什么

透过数字看三个核心结论:

结论一:感知的"统一性"比"丰富性"更重要。 SpatialVLA 有专业的 3D 编码器,按理说 3D 表征应该更好——但它在真机上输 MLA 24 个百分点。因为 SpatialVLA 的 3D 编码器和 LLM 之间存在"翻译断层":编码器没和 LLM 一起预训练过,两边的特征空间是"两种方言"。MLA 虽然没有专业的 3D 编码器,但它的三种模态直接在 LLM 内部被统一处理,特征空间天然一致——"讲的是同一种话"。

结论二:辅助训练信号的价值被严重低估。 未来预测分支在推理时完全不参与,但它在训练时提供的梯度信号让 LLM 的中间特征更"懂物理"。消融实验显示,去掉图像预测掉 X%,去掉点云预测掉 Y%,去掉触觉预测也掉——三种预测各有贡献,缺一不可。这说明"多维度的预判"确实能逼出更好的物理理解。

结论三:泛化能力和多感官感知正相关。 MLA 在换物体和换背景时掉分远比 pi0 少——这不只是因为多了一些感官输入,更因为多感官对齐后的表征更鲁棒:即使图像被背景杂物干扰了,3D 几何和触觉反馈还能提供互补信息。好比你蒙着一只眼还能靠另一只走路,但全盲就不行。

所以这一节是想说:实验结果验证了 MLA 的核心信念——用更好的训练信号(对比对齐 + 未来预测)来替代更复杂的架构(外挂编码器),既性能更好、又更简洁。


你应该懂的几个新词

  • VLA(Vision-Language-Action 视觉-语言-动作模型):让一个吃过海量文字图片的大脑去控制机器人手脚的系统。类比:一个会聊天的人被装上手和身体后开始干活。
  • 大语言模型(LLM):吃过海量文字训练出来的"大脑"。ChatGPT 的内核就是这种东西。MLA 用的是 LLaMA-2 7B(70 亿参数)。
  • 接触密集任务(Contact-rich Task):机器人要反复接触物体并施力的活。擦、按、压、铲都算。
  • 点云(Point Cloud):用深度摄像头测出来的一堆三维坐标点。类比:把场景洒满标记小珠子,每颗知道自己的 (x,y,z)。
  • 对比学习(Contrastive Learning):训练方式——"对的拉近、错的推远"。CLIP 用图文对做;MLA 用几何投影确定的位置对做。
  • InfoNCE 损失:对比学习最常用的扣分规则。正样本的相似度要在所有候选中占压倒性比例。
  • 关键帧(Keyframe):动作的转折时刻。如夹爪从开变合、从快速移动变缓慢接触的那一帧。类比:电影的"高潮节点"。
  • 扩散模型(Diffusion Model):先加噪声再擦干净的生成方式。AI 画图用它画图片,MLA 用它输出动作。
  • DDIM:加速去噪的算法——让扩散模型只擦 4 步就出好结果,而不用原始的 1000 步。
  • 最远点采样(FPS):从一堆点里挑出互相离得最远的 N 个代表。类比:从全班挑 5 个身高差异最大的人代表全班。
  • Chamfer Distance:衡量两堆点像不像的指标——每个点找最近邻算距离,两边取平均。越小越像。
  • 末端执行器(End-Effector):机器人手最末端接触物体的部分,通常是夹爪。
  • 自由度(DoF):能独立控制的轴数。单臂 7 个 = 3 移动 + 3 旋转 + 1 夹爪开合。

所以这一节是想说:把这些词记住,再读其他 VLA 论文就不会被生词卡住。


它有什么搞不定的

  1. 极端环境迁移仍然会跪:换背景时 MLA 成功率掉 25%。如果客户家的光线、桌面颜色和实验室差太远(比如从白色桌面换成黑色大理石 + 射灯),成功率可能腰斩。encoder-free 的代价是——没有在 ImageNet 上见过各种背景的预训练编码器来"兜底"。

  2. 触觉传感器一坏就废:论文没测"传感器损坏 / 噪声大"的情况。触觉只有 1 个 token,如果这个 token 的数据源有问题,模型没有冗余信息可以弥补。

  3. 关键帧检测靠速度变化:如果你的任务是缓慢精细操作(比如缓慢倒酒、写字),速度变化平滑,关键帧找不准。预测一个"不太关键"的关键帧,学习效果会打折扣。

  4. 没换过语言指令:泛化实验只换了物体和背景,语言指令始终不变。"把鸡蛋放到面包上"这句话有没有换成"把蛋放吐司上"?没测。语言泛化是另一个维度的挑战。

  5. 只在一种机械臂上验证:Franka Research 3。换到 UR5 或其他机械臂能不能跑?没测。跨平台迁移是 VLA 领域的共性难题。

  6. 代码和数据未开源:截至发稿,论文没承诺开源模型权重或自采数据。这意味着社区无法独立验证结果。和 OpenVLA 的全面开源形成鲜明对比——讽刺的是,性能最好的模型因为不开源而无法被改进。

  7. 训练成本不透明:论文未公开用了多少显卡、训练了多长时间。粗估:570K 轨迹预训练 + 300 epoch SFT + 100 epoch 后训练,至少需要 4-8 张 A100 跑数天,成本在 5-20 万人民币量级。

所以这一节是想说:方法精巧,但离普通人买回家用还远——硬件贵、环境敏感、无法复现。它更像一个"概念验证",证明了方向对,但通往工业部署的路还很长。


它和别的几篇是什么关系

MLA 处在 VLA 发展的一个十字路口,和几条路线都有交集:

和 OpenVLA 的关系(VLA 三连第 1 篇):OpenVLA 走的是"大规模预训练 + 开源"路线——用海量数据把一个 VLM 微调成通用控制器,动作用 256-bin 离散 token 表示。MLA 走的是几乎相反的路线——不依赖外挂编码器、用连续扩散动作、用精巧的训练信号而不是更多数据来获取多模态能力。两者的共同点是底座都基于 Prismatic VLM / LLaMA-2 7B。如果说 OpenVLA 是"量产车"(人人能开),MLA 是"概念跑车"(性能极致但你买不到)。

和 VLAs Survey 的关系(VLA 三连第 2 篇):在 VLAs Survey 的分类体系中,MLA 属于"带辅助预测任务的多模态端到端 VLA"——survey 识别的一个前沿方向。MLA 是这个方向上走得最远的工作(同时预测三种模态的未来状态)。Survey 指出的"编码器架构日趋复杂"的趋势,MLA 给出了一个反方向的答案——去掉编码器。

和 pi0 的关系:pi0 是 MLA 在真机实验中反复对比的"前任冠军"——同为 2024 年的 2D VLA SOTA。pi0 也用扩散动作头,但只有 2D 视觉输入。MLA 比它多了 3D 和触觉,并且证明了这些额外感官在接触密集任务上的价值(+12%)。

和 SpatialVLA 的关系:两者都想给 VLA 加 3D 能力,但走了相反的路——SpatialVLA 加专门的 3D 编码器,MLA 去掉编码器用对比学习自学。结果 MLA 赢了 24 个百分点,直接证明了"加编码器不一定好"。

和 DreamVLA / CoT-VLA / UP-VLA 的关系:都属于"未来预测派"——让模型脑补未来来增强物理理解。但它们只预测 2D 图像。MLA 把预测扩展到 3D 和触觉,形成"全面脑补"。在 RLBench 上 MLA 比 DreamVLA 高 16 个百分点。

技术依赖:MLA 的关键帧检测方法和点云分组方式(FPS + KNN 三级)直接借自 Lift3D 这篇前作(同一团队)。

时间线上的位置:

2024.06 ━━ OpenVLA (开源 7B baseline)
2024.10 ━━ pi0 (2D SOTA, 扩散动作)
2025.01 ━━ SpatialVLA (3D 编码器路线)
2025.xx ━━ DreamVLA (2D 未来预测)
2025.xx ━━ MLA (多感官 + 无编码器 + 全面未来预测)

所以这一节是想说:MLA 是把"多感官融合"和"未来预测"两条支线合并、同时用"去编码器"做减法的工作。它站在 OpenVLA(底座)、Lift3D(技术组件)、pi0(动作头范式)的肩膀上,走出了一条独特的路。


和本导读的关系

本笔记对应导读 Ch12: 端到端 VLA (II)——OpenVLA / VLAS / MLA 的第 5 节"MLA 深度剖析:不要编码器,让 LLM 自己长出感官"。

在导读的框架中,Ch12 讲的是"VLA 从 1 到 N 的扩展"。三个模型分别代表三个扩展方向:OpenVLA 解决封闭性和效率(开源 + 单卡);VLAS 解决输入模态的局限(加语音);MLA 解决编码器冗余和感知贫乏(去编码器 + 加 3D/触觉)。

MLA 在 VLA 三连中的定位是"第三篇"——如果 OpenVLA 证明了"VLA 可以开源且便宜",MLA 则证明了"VLA 可以不需要外挂编码器且性能更好"。两者代表了 VLA 发展的两个不同维度:一个是"降门槛",一个是"提上限"。

导读 6.1 节的对比表将三者并列,MLA 处在"架构突破"的位置。它的深层启示是:也许我们一直在"过度设计"多模态系统——更少的专用组件 + 更好的训练信号 = 更强的性能。

所以这一节是想说:MLA 是导读 Ch12 三个模型中"性能天花板最高但最不开放"的那个,它证明了一个反直觉的方向值得探索。


思考题

Q1:为什么去掉专用视觉编码器反而更好?请从"表征偏见"的角度解释。

提示

想一想:SigLIP 是用"图文对比"训练的——它被优化来回答"这张图里有什么"(语义分类)。但机器人操作需要回答的是"这个东西在三维空间里的精确位置和姿态"。一个优化目标不同的编码器,可能会强加一种对当前任务不利的"表征偏见"。让 LLM 自己学,反而能找到对控制更有用的特征(比如精确的 patch 位置信息)。

Q2:如果把对比学习损失从第 8 层移到第 2 层或第 20 层,你预期会发生什么?为什么?

提示

第 2 层:特征太原始(几乎还是线性投影后的 patch embedding 本身),对比学习能提供的监督信号太弱——"拉近"和"推远"的梯度无法有效回传到有意义的表征层。第 20 层:特征已经高度偏向文本/决策语义,强行插入多模态对齐可能"打架"——干扰了已经在学动作生成的高层表征。第 8 层是"刚有足够抽象、还没定型"的甜区。

Q3:MLA 的未来预测只在训练时做,推理时去掉。如果推理时也保留预测分支,会怎样?有好处吗?有坏处吗?

提示

好处:可以把预测的未来状态作为"显式规划信号"——比如模型预测的未来触觉显示会撞上东西,就可以修改动作。坏处:三个 Decoder 的推理开销不可忽略(额外的 forward pass),会拖慢控制频率。另外,预测结果可能不准,用不准的预测去修改动作可能反而引入错误。论文选择"去掉"说明作者认为间接好处(更好的特征)比直接利用预测结果更可靠。

Q4:假设你只有一台 RGB 摄像头(没有深度摄像头、没有触觉传感器),MLA 的方法还能用多少?哪些组件会失效?

提示

没有深度 → 没有点云 → 256 个点云 token 全空 → 图像-点云对比学习完全失效 → 点云未来预测失效。没有触觉 → 触觉 token 空 → 触觉相关对比和预测都失效。仿真实验正好验证了这一点——RLBench 上没有触觉,MLA 只用图像和点云依然达 81%。所以"只有 RGB + 点云"还能保留大部分方法;"只有 RGB"则退化成"encoder-free + 图像未来预测"的简化版本,核心创新只剩一半。

Q5:MLA 和 OpenVLA 都基于 LLaMA-2 7B,但动作输出方式完全不同(扩散 vs 256-bin 离散 token)。各自适合什么场景?

提示

256-bin 离散 token 适合"精度要求不极端、且希望完全复用 LLM 原生推理框架"的场景——实现最简单,不需要额外训练扩散头。扩散头适合"精度要求高、动作分布多模态(多条合理路径)"的场景——如接触密集操作中力度的连续微调。代价是增加了推理步数(4 步去噪)和训练复杂度。

Q6:论文用"几何投影"来构造正样本对。如果相机标定不准(比如移动机器人的相机在晃),这个方法会怎样?

提示

相机标定不准 → 投影计算出的"对应关系"有误差 → 本该是正样本对的变成了弱正样本甚至假正样本 → 对比学习被"错误的老师"误导。后果:多模态对齐质量下降,LLM 学到的跨模态表征可能不一致。这也是论文只在固定相机的实验台上验证的原因之一。移动机器人要用这套方法,需要额外的在线标定或自适应几何估计。

Q7:为什么预测"关键帧"比预测"下一帧"效果好 6 个百分点?请用信息论的直觉解释。

提示

相邻帧之间的变化极小(机器人每帧只移动零点几毫米)——预测"下一帧"几乎可以靠"复制当前帧"拿到很低的 loss,模型学到的是"什么都不变"这个 trivial 规律。关键帧之间的变化大(状态有质的转折),模型必须真正建模"动作导致什么后果"才能预测对——信息量高、学习信号丰富。用信息论的话说:关键帧之间的互信息比相邻帧之间高得多,作为预测目标提供了更强的梯度信号。

Q8:如果有人想用 MLA 的思路但数据量只有 50 条示范(而不是 200 条),你会建议调整哪些设置?

提示

数据极少时过拟合风险大。建议:(1) 增大预训练阶段的 epoch 数,让基础能力更扎实;(2) 减少 SFT 的 epoch(从 300 降到 100-150);(3) 考虑冻结 LLM 的部分层只训前几层 + tokenizer;(4) 后训练阶段的未来预测可能因为数据太少而不稳定,可以先去掉看基线表现;(5) 数据增强——比如对 RGB 做颜色/亮度 jittering、对点云做随机旋转。


一些好奇心问答(FAQ)

Q1:模型多大?我家电脑跑得动吗?

模型主体约 70 亿参数(7B)。光是模型权重就要 14 GB 显存(FP16)。训练至少需要 4-8 张 80GB 的 A100。推理理论上需要一张 24GB 高端卡(如 RTX 4090 紧巴巴)。普通笔记本的 RTX 4070 12GB 跑不动。但论文没公布是否支持量化推理——如果支持 4-bit 量化,可能降到 ~4GB 权重 + KV-cache,那就有希望。

Q2:训练数据从哪来?

大基础阶段:28 个公开数据集合并(570K 轨迹、3600 万帧),不需要授权。专项阶段:作者用 Gello 远程操作平台自己采的 6 个任务共 1200 段示范——这部分没承诺开源。

Q3:为什么不用更简单的办法,比如直接给机器人写 if-else 规则?

因为接触密集任务的力度、角度、位置随场景千变万化。"盖章时下压力应该是多少"取决于墨水粘度、纸张硬度、桌面高度——写规则要穷举到天荒地老。让模型从 200 段示范里自己学是唯一可扩展的办法。

Q4:触觉传感器是什么?贵吗?

论文用的是 Tashan TS-E-A 传感器,每个夹爪指尖装一个,能测 6 维力数据。单个传感器几千块人民币。配套的 Franka Research 3 机械臂约 25-35 万。整套硬件不是个人玩家能负担的。

Q5:为什么训练要分三阶段,不能从头一起练?

公开数据只有图像和动作,没有触觉和点云。一开始就把三种感官全打开,空位置的 token 会被优化成"垃圾信号"——模型不知道该把什么信息填在那里。先用海量视觉数据让 LLM 学会基本的"看图出动作",再逐步引入新感官,每次只加一种新东西,模型能稳定地学会每个新能力。

Q6:推理频率是多少?够快吗?

论文未公开具体数字。粗估 5-10 Hz(每秒 5-10 次决策)。对擦白板、盖章这种慢速接触操作够用,但做不了像打羽毛球、接抛球这种需要 >30Hz 反应的事。

Q7:这套方法以后能用在自动驾驶里吗?

思路(多感官融合 + 预判未来)是通用的——自动驾驶同样需要视觉 + 激光雷达 + 预判前方动态。但 MLA 目前只验证了桌面操作,搬到汽车上需要重新训练、重新适配传感器布局。而且自动驾驶对实时性要求更高(>30Hz),MLA 目前的推理速度不够。

Q8:和 Manipulate-Anything 是同一篇论文吗?

不是。标题容易混淆:Manipulate-Anything(2024,Ren et al.)是用 VLM 做任务规划 + 抓取点检测的模块化方案,VLM 不直接输出动作。本文的 MLA(Multisensory Language-Action)是端到端的 VLA 模型,LLM 直接输出连续动作。两者的技术路线完全不同——Manipulate-Anything 用 VLM 当规划器配合 motion primitive,MLA 是让 LLM 直接当控制器。

所以这一节是想说:硬件贵、显卡费、训练慢、未开源——但思路本身对整个多模态 AI 架构设计有深远启发。


如果你想再深入

按"必读 → 续作 → 竞争"的顺序:

  1. pi0(2024):MLA 反复对比的"前任冠军"。读它能让你理解"没有 3D 和触觉时机器人能做到什么",也能理解扩散动作头的详细机制。
  2. OpenVLA(2024):开源代码量最大的同类系统。如果你想动手跑 VLA,先跑 OpenVLA 比尝试复现 MLA 容易十倍。
  3. SpatialVLA(2025):走"加 3D 编码器"的相反路线。对比读能看清"encoder-free vs encoder-based"两种 3D 思路的优缺点。
  4. DreamVLA(2025):纯做 2D 未来预测的同期工作。MLA 在仿真里赢它 16 个百分点,对比读能看出"预测点云和触觉"额外带来了什么。
  5. Lift3D Policy(2025):MLA 的关键帧检测和点云分组直接借自这篇(同一团队前作)。想真复现 MLA,这是绕不过去的技术依赖。

如果你只能读 1 篇,挑 pi0 —— 它是这条线的"标尺",也是扩散动作头的教科书式实现。


原文信息

标题:MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

作者:Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构:Peking University, Beijing Innovation Center of Humanoid Robotics (X-Humanoid), CUHK

年份:2024/2025

项目主页https://robotic-mla.github.io/

@article{liu2025mla,
  title={MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation},
  author={Liu, Zhuoyang and Liu, Jiaming and Xu, Jiadong and Han, Nuowei and Gu, Chenyang and Chen, Hao and Zhou, Kaichen and Zhang, Renrui and Hsieh, Kai Chin and Wu, Kun and Che, Zhengping and Tang, Jian and Zhang, Shanghang},
  journal={arXiv preprint},
  year={2025}
}

所以这一节是想说:想深入这条线,5 篇就够了;想动手,先从 OpenVLA 开始。MLA 本身的价值更多在"思路启发"而非"直接复用"。

引用本笔记 / Cite this note
BibTeX
@online{eai_mla_2026,
  title       = {(readable note) MLA: Multisensory Language-Action Model},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?