Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 117

DexVLA

26 min read · 9132 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过 VLA 和扩散策略"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 diffusion-policy 和一篇 VLA 笔记(如 3d-vla)再看本篇。

一句话讲什么(TL;DR)

现在的 VLA 模型(如 OpenVLA、π0)都在拼命把"视觉语言模型(VLM)"那部分做大,却忽略了真正产生动作的"动作专家"太小、动作表示是瓶颈。DexVLA 反其道而行——把扩散动作专家放大到 10 亿参数、做成多头结构支持跨机体,再配一套"具身课程学习"三阶段训练,还让模型自己生成"分步推理"来指挥长程任务。结果:只用 100 小时数据预训练、单张 A6000 上 60Hz 推理,在叠衬衫(0.92 分)、跨新机体学灵巧技能(<100 示范)、直接指令叠脏衣服(0.4 vs π0 的 0.2)等任务上全面超过 OpenVLA 和 π0。

所以这一节是想说:DexVLA 的核心是"把动作专家(扩散模型)做大做强 + 具身课程学习 + 自生成分步推理",用少得多的数据实现更强的跨机体长程灵巧控制。


这是个什么场景

想象你想要一个"全能机器人基础模型"——给它下任何自然语言指令("把衣服叠好""把桌子收拾干净"),它就能在各种机器人身上(单臂、双臂、灵巧手)完成。这正是 VLA(Vision-Language-Action,视觉-语言-动作)模型追求的目标:把在互联网海量图文上预训练的**视觉语言模型(VLM)**改造成机器人策略,既能理解语言和视觉、又能输出动作。

但现实很骨感,有两大瓶颈:

  1. 数据稀缺:SOTA 模型极度吃数据——OpenVLA 用 Open-X Embodiment 的 4000 小时,π0 用了 1 万小时。人工采集这些示范极其昂贵费力。

  2. 架构失衡:现在的 VLA 都在拼命放大 VLM 那部分(OpenVLA 用 7B VLM、π0 用 3B VLM),但 VLM 再强也是"隔靴搔痒"——它是在互联网图文上训的,和机器人具身的、感觉运动的动作是脱节的。真正产生动作的"动作专家"往往只有几百万参数,动作表示成了真正的瓶颈

而且要完成"叠脏衣服"这种超长程任务,连 π0 这么强的模型都得靠一个外部的高层策略(SayCan)每两秒更新一次指令来分解任务。

DexVLA 要解的题:能不能不靠堆 VLM 和堆数据,而是从"动作表示"这个瓶颈下手,用更聪明的架构和训练策略,让 VLA 用少得多的数据实现更强的跨机体、长程、灵巧控制,还不用外部高层策略?

所以这一节是想说:VLA 想做全能机器人大脑,但卡在数据稀缺和"重 VLM 轻动作"的架构失衡上,DexVLA 想从动作表示这个瓶颈突破。


DexVLA — 场景示意:这论文要解决的现实问题
Plate Nº IDexVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:放大 VLM 的 VLA(OpenVLA 7B、RT-2) 把视觉语言模型做大,动作直接由 VLM 输出(离散化 token)。类比:给机器人配个博学的大脑,但手很笨。问题:VLM 再强也和具身动作脱节,动作表示粗糙(离散化损失精度),且吃海量数据。

  • 方案 B:VLM + 小动作专家(π0、TinyVLA) 在 VLM 外接一个动作专家(如扩散头)。类比:博学大脑 + 小手。问题:动作专家只有几百万参数、太小,学不动复杂灵巧技能和跨机体数据;训练还是依赖整个大模型,效率低。

  • 方案 C:靠外部高层策略分解长程任务(π0 + SayCan) 用 SayCan 等外部规划器每两秒把长任务拆成子目标,VLA 逐个完成。问题:(1) 依赖外部模块,不够端到端;(2) 固定频率更新(每 2 秒)可能产生冗余或重复状态,不能自适应地切分任务。

  • 方案 D:纯扩散策略(Diffusion Policy) 不用 VLM,直接扩散生成动作。问题:没有 VLM 的语言理解和泛化能力,长程复杂任务和语言指令跟随做不了。

  • 核心难题:怎么在不堆 VLM、不堆数据的前提下,解决"动作表示是瓶颈"这个问题,让 VLA 高效地学跨机体的灵巧技能、并能自己分解长程任务?

所以这一节是想说:重 VLM 的动作粗糙、小动作专家学不动、靠外部规划器不端到端、纯扩散没语言——缺一个"把动作专家做大做强 + 自带分步推理 + 高效训练"的方案,DexVLA 来补这个空。


这篇论文的新想法

类比:如果说别的 VLA 是"给机器人配个越来越聪明的大脑(VLM),但手一直很笨(小动作专家)",DexVLA 是"给它配一双同样强大的手(10 亿参数扩散专家),再用循序渐进的方式教它——先练基本功、再适应自己的身体、最后精通复杂任务"。

DexVLA 的核心判断:VLA 的瓶颈不在 VLM 而在动作专家。把动作专家(扩散模型)放大到十亿参数、并用正确的课程训练它,才能高效学出跨机体的灵巧技能。

它有三个关键创新:

  1. 十亿参数扩散动作专家:用 ScaleDP(Transformer 版的 Diffusion Policy,最大 1B 参数)当动作专家,比传统的百万参数级大了三个量级。关键是做成多头结构——每个头对应一种机体配置(单臂/双臂/灵巧手),从而能在跨机体数据上预训练(类似 Octo)。

  2. 具身课程学习(Embodied Curriculum Learning):三阶段、由易到难,像人先学抓握再学叠衣服——

    • Stage 1 跨机体预训练:只训扩散专家(不带 VLM),学与机体无关的底层运动技能。
    • Stage 2 机体特定对齐:"适应你的身体"——把 VLM 的抽象视觉语言表示和具体机器人的物理约束对齐。
    • Stage 3 任务特定适应:精通复杂长程任务、泛化到新物体。
  3. 自生成分步推理(Substep Reasoning):不用外部 SayCan,而是让 VLM 骨干自己生成分步推理(把"叠衬衫"拆成"抚平褶皱→对齐袖子→固定折叠"),通过 FiLM 层注入扩散专家指导动作。相当于把高层规划能力直接内化进模型。

底座 VLM 用 Qwen2-VL。训练损失 = 扩散损失 + α×下一 token 预测损失(α=1)。

【VLA 瓶颈在"动作表示" → DexVLA 换个大脑】

传统 VLA(OpenVLA/π0):强 VLM + 百万参数级小动作头
                      └ 动作表示是瓶颈, 学不动复杂灵巧技能

DexVLA:
  Qwen2-VL(VLM) ─推理token─FiLM─┐
                ─动作token─投影─┤
                                ▼
     十亿参数扩散专家(ScaleDP; 多头 = 每头一种机体)
  训练:三阶段具身课程(跨机体预训练 → 机体特定对齐 → 任务特定适应)
  自生成分步推理(每 ~5 秒一子步) 替代外部 SayCan

所以这一节是想说:DexVLA 的新想法是"把扩散动作专家做大到 1B + 多头支持跨机体 + 三阶段具身课程 + 自生成分步推理",从动作表示这个瓶颈突破 VLA。


它分几步做的(方法)

DexVLA 的架构与训练:

【架构】
  Qwen2-VL (VLM骨干)
   │ 图像编码→与语言token同空间; 多相机视图拼接
   ├─ 推理token ──FiLM──▶ 调制扩散专家的投影层
   └─ 动作token ──投影(2线性层+LayerNorm, 类LLaVA connector)──▶
   │
  十亿参数扩散专家 (ScaleDP, 多头: 每头一种机体)
   │ (推理引导 + 指令 → 生成动作)
   ▼ 机器人动作

【三阶段具身课程学习】
  Stage1 跨机体预训练: 只训扩散专家(不带VLM)
         ResNet-50图像编码 + DistilBERT语言 + FiLM注入
         学机体无关的底层运动技能
   ▼
  Stage2 机体特定对齐: VLM+投影层+扩散专家联合训(冻结VLM视觉编码器)
         对齐抽象视觉语言表示 ↔ 具体机器人动作空间
         →已能叠衬衫、bin picking
   ▼
  Stage3 任务特定适应: 精通复杂长程任务、泛化新物体
         用分步推理标注(每~5秒一个子步)当中间语言输出

损失: L = L_diff + α·L_ntp  (α=1)

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 架构:VLM + 十亿参数扩散专家

类比:博学大脑(VLM)负责理解"要干什么"、生成推理,强壮的手(扩散专家)负责精细地"怎么动",两者用巧妙的接口连起来。

输入:机器人的图像观测(多相机视图)+ 语言指令。

处理

  • VLM 骨干(Qwen2-VL):图像编码器把观测投到和语言 token 同一空间,多相机视图拼接。VLM 产生两种输出:推理 token动作 token
  • 动作 token 经一个投影模块(两个线性层 + LayerNorm,类似 LLaVA 的 connector),把 VLM 的嵌入空间转换成动作专家能吃的输入。
  • 推理 token 通过 FiLM 层注入策略模型——缩放和平移投影层的参数,让模型能自主生成推理、并用推理指导动作生成。
  • 扩散专家:用 ScaleDP(Transformer 版 Diffusion Policy,最大 1B),做成多头输出——每个头负责一种机体配置,从而支持跨机体预训练。

输出:机器人动作序列。

小结:VLM 生成推理和动作 token,推理经 FiLM 调制、动作经投影送入十亿参数多头扩散专家,实现"推理指导动作"的强动作生成。

5.2 Stage 1:跨机体预训练扩散专家

类比:先让"手"练好基本功——不管是哪个机器人的身体,先学会通用的抓、放、移动这些底层动作。

输入:所有可用的跨机体数据(单臂、双臂、灵巧手等)。

处理只训扩散专家,暂时不接 VLM——聚焦发展稳健的动作生成能力,不依赖语言接地。这一阶段用 ResNet-50 当图像编码器(和 Diffusion Policy 一致)、DistilBERT 当语言嵌入,语言嵌入经 FiLM 层注入。多头结构让不同机体的数据都能用上(每头一种机体)。

输出:一个学会了机体无关底层运动技能的扩散专家。

小结:Stage 1 单独把十亿参数扩散专家在跨机体数据上"练基本功",既学底层技能又"预热"庞大的参数,为后续接 VLM 打基础。

5.3 Stage 2:机体特定对齐

类比:"适应你自己的身体"——通用基本功学好后,针对目标机器人(比如这台双臂 AgileX)微调,把大脑的理解和这具身体的动作对齐。

输入:只含目标机体的数据(每个样本单一机体)。

处理:Stage 1 的跨机体学习可能损害目标机体的性能,所以 Stage 2 用机体特定数据对齐——把 VLM 的抽象视觉语言表示和扩散专家的动作空间对齐(类似 LLaVA 的对齐阶段)。联合训练 VLM、投影层和扩散专家,但冻结 VLM 的视觉编码器。这让扩散专家能把 VLM 的高层视觉语言理解接地到目标机器人的具体运动控制空间。

输出:一个在目标机体上已能做多种任务(叠衬衫、bin picking)的模型——这一阶段本身就够用了(无需任务特定训练)。

小结:Stage 2 用目标机体数据把 VLM 的理解和扩散专家的动作对齐,冻结视觉编码器联合训练,单靠它就能完成叠衬衫等任务。

5.4 Stage 3:任务特定适应

类比:最后的"专项集训"——针对超难长程任务(叠脏衣服)用高质量示范精调,像大模型的后训练。

输入:目标复杂任务的高质量专家示范(含分步推理标注)。

处理:对简单任务(叠衬衫、收桌子、抓已知物体)无需这一步,Stage 2 就够了。但对复杂、需精细上下文动作的长程任务,需要用流畅一致的高质量示范后训练。关键技巧:Stage 2 和 3 都用分步推理标注的语言数据,但不是当输入,而是当中间语言输出——逼模型自己学会生成这些分步描述。这让模型能内部解读任务状态、把理解注入策略指导动作,无需外部高层策略

输出:能完成叠脏衣服等超长程任务的模型。

小结:Stage 3 用高质量示范 + 分步推理"当输出"精调,让模型自己学会分解长程任务,替代了 π0 需要的外部 SayCan。

5.5 分步推理:把高层规划内化

类比:不请外部导演(SayCan)每 2 秒喊一次口令,而是让演员自己在心里把长镜头分成几个小段,边演边想下一步。

输入:长程任务(如收拾桌子,常超 2 分钟)的示范。

处理:长程任务对扩散专家来说太难,单条语言指令学不会。所以把长任务分解成子步骤标注——通常每 5 秒一个子步(避免过度细分)。训练时让模型学会自己生成这些分步推理(而非作为输入),从而学到"语言子指令 → 精确运动基元"的解耦动作表示。对比 π0 用 SayCan 固定每 2 秒更新指令,DexVLA 的分步推理能自适应地切分长程任务的状态空间。

输出:能自主分解长程任务的推理能力。

小结:分步推理把高层规划内化进 VLA——模型自己把长任务切成子步并生成推理,比外部 SayCan 更自适应、更端到端。

5.6 为什么"大动作专家 + 课程 + 分步推理"是关键

  • 大动作专家攻破瓶颈:把被忽视的动作表示做大到 1B、多头支持跨机体,让模型真正学得动复杂灵巧技能。
  • 课程学习让庞大参数可训:Stage 1 单独预热扩散专家(否则十亿参数难优化、会完全学不会),再逐步接 VLM、精调任务。
  • 分步推理去掉外部规划器:自生成推理让长程任务端到端可解,还比固定频率的 SayCan 更自适应。

所以这一节是想说:DexVLA 的方法(架构 → Stage1 预训练 → Stage2 对齐 → Stage3 适应 → 分步推理),核心是"把动作专家做大 + 用课程逐步训练它 + 让模型自生成分步推理"。


DexVLA — 方法示意:核心 pipeline
Plate Nº IIDexVLA — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"把动作专家做大 + 课程 + 分步推理"到底值多少。

数字 1:效率对比(数据与推理)

维度 DexVLA 对比
预训练数据 100 小时 OpenVLA 4000 小时、π0 1 万小时
推理速度 60Hz(单张 A6000)
VLM 骨干 Qwen2-VL OpenVLA 7B VLM、π0 3B VLM
动作专家 10 亿参数扩散专家 传统百万参数级

关键含义:用少一到两个数量级的数据、单卡快速推理,靠的是"把动作专家做大 + 好的训练策略"而非堆数据堆 VLM。

数字 2:无任务特定适应(Stage 2 后,10 次试验平均分)

任务 DexVLA OpenVLA / Octo / Diffusion Policy
叠衬衫(shirt folding,满分 3) 0.92 几乎全 0(做不了任何一步)
bin picking / 收桌子 明显更高 偶有零星成功、总分很低

关键含义:只到 Stage 2、一套参数,DexVLA 就能叠衬衫(0.92),而 OpenVLA/Octo/Diffusion Policy 在这种复杂任务上几乎完全失败。

数字 3:跨新机体学灵巧技能(<100 示范,10 次试验平均)

方法 两个新机体任务平均分
DexVLA 0.90
OpenVLA / Octo 挣扎(很低)
Diffusion Policy(专为少样本设计) 明显低于 DexVLA

关键含义:在训练里没见过的新机体(Franka + 灵巧手 12 DoF、双臂 UR5e)上,只用 <100 示范就到 0.90,超过大规模预训练的 OpenVLA 和专门少样本的 Diffusion Policy。

数字 4:复杂长程任务直接指令(10 次试验平均)

任务 DexVLA π0
叠脏衣服(laundry folding,满分 4) 0.4 0.2
收桌子(hard) 比 π0 高 0.08

关键含义:最难的叠脏衣服任务,直接下指令(无外部规划器)DexVLA 0.4 是 π0(0.2)的两倍;且 π0 还依赖 SayCan,DexVLA 靠自生成分步推理。

数字 5:消融——动作专家大小 & 分步推理 & 三阶段

消融项 结果(叠衬衫平均分)
扩散专家 UNet(93M) 0.17
扩散专家 410M 0.63
扩散专家 1B 0.92
去掉分步推理(直接指令训扩散专家) 0.92 → 0.07
两阶段都去分步推理 0(完全失败)
只 Stage1 或只 Stage2 0 / 0
Stage1+2(无 Stage3)叠脏衣服 0(vs 全三阶段 0.4)

关键含义:动作专家越大越好(93M→1B:0.17→0.92);分步推理至关重要(去掉暴跌到 0.07 甚至 0);三阶段缺一不可(Stage1 预热必需,否则庞大参数学不动)。

所以这一节是想说:数据证明四件事——用少得多数据超越 SOTA、动作专家越大越强、分步推理是长程任务命门、三阶段课程缺一不可。


实验结果说明了什么

问题一:不堆 VLM 不堆数据,光把动作专家做大有用吗? 非常有用。DexVLA 用 100 小时数据(vs OpenVLA 4000、π0 1 万)、Qwen2-VL 骨干,却全面超过它们。消融最直接:扩散专家从 93M→410M→1B,叠衬衫分从 0.17→0.63→0.92。这坐实了论文的核心论点——动作表示才是 VLA 的真正瓶颈,把动作专家做大比堆 VLM/数据更划算

问题二:具身课程学习(三阶段)真有必要吗? 缺一不可。只 Stage 1 或只 Stage 2 都是 0 分;没有 Stage 1,模型完全学不会任何有意义的动作——因为十亿参数的扩散专家太难优化,Stage 1 既教基本功又"预热"参数。没有 Stage 3,叠脏衣服从 0.4 掉到 0。所以三阶段(预训练→对齐→适应)由易到难,是让庞大动作专家可训、并逐步精通复杂任务的关键。

问题三:自生成分步推理 vs 外部 SayCan,哪个好? 自生成更好。用 SayCan 替换 DexVLA 的分步推理,性能明显下降(如收桌子 hard 0.70→0.58)。原因:(1) 自生成推理能解耦不同特征的动作空间,学得更有效;(2) SayCan 固定每 2 秒更新指令,可能产生冗余重复状态,而 DexVLA 的分步推理能自适应地切分长程任务。而且去掉分步推理,叠衬衫从 0.92 暴跌到 0.07、两阶段都去则完全失败——说明它是长程任务的命门。

问题四:能快速适应全新机体吗? 能。在训练里完全没见过的新机体(Franka+灵巧手 12DoF、双臂 UR5e)上,只用 <100 示范,DexVLA 达 0.90,超过大规模预训练的 OpenVLA 和专为少样本设计的 Diffusion Policy。这说明多头扩散专家 + 课程学习学到的底层技能能高效迁移到新身体。

所以这一节是想说:实验系统回答了四个问题——做大动作专家确实值、三阶段课程缺一不可、自生成分步推理胜过外部 SayCan、能少样本适应新机体。


你应该懂的几个新词

VLA(视觉-语言-动作模型):把预训练的视觉语言模型改造成能输出机器人动作的策略。

VLM(视觉语言模型):在海量图文上预训练、能理解图像和语言的模型(DexVLA 用 Qwen2-VL)。

动作专家(action expert):VLA 里专门产生动作的模块,DexVLA 把它做成 10 亿参数的扩散模型。

扩散策略 / ScaleDP:用扩散模型从噪声生成动作序列的策略;ScaleDP 是它的 Transformer 大规模版(可到 1B)。

跨机体(cross-embodiment):在多种不同结构的机器人(单臂/双臂/灵巧手)上学习,DexVLA 用多头结构支持。

课程学习(curriculum learning):由易到难分阶段训练,DexVLA 的"具身课程"是预训练→对齐→适应三阶段。

分步推理(substep reasoning):把长任务拆成子步(如"抚平褶皱→对齐袖子"),DexVLA 让模型自己生成,替代外部规划器。

FiLM 层:用一组参数对特征做缩放和平移的条件化技巧,DexVLA 用它把推理/语言注入动作专家。

多头结构(multi-head):一个模型多个输出头,每头对应一种机体配置,实现跨机体学习(类似 Octo)。

SayCan:一种外部高层策略,把长任务分解成子目标供 VLA 逐个完成(π0 依赖它,DexVLA 想摆脱它)。

所以这一节是想说:这十个词是读任何"VLA / 扩散策略 / 跨机体机器人"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 超长程接触丰富任务仍难:叠脏衣服这种超长(>2 分钟)、软体可变形的任务,DexVLA 也只到 0.4 分——虽超 π0(0.2),但离可靠还远。
  • 依赖分步推理标注:Stage 2/3 需要分步推理标注的数据(每 5 秒一个子步),虽用 Gemini 2.0 + Grounding-DINO 半自动标注,但 Stage 3 仍需人工检查高质量标注,非零成本。
  • 十亿参数扩散专家难优化:没有 Stage 1 预热就完全学不会——说明大动作专家的优化很脆弱,训练策略必须精心设计。
  • 仍需机体特定数据对齐:Stage 1 的跨机体学习会损害目标机体性能,必须 Stage 2 用机体特定数据对齐,不能纯靠跨机体预训练直接部署。
  • VLM 视觉编码器冻结:Stage 2 冻结 VLM 视觉编码器,可能限制视觉表示对机器人场景的适配。
  • 评测规模有限:主要在几种机体、每任务 10 次试验上评测,长程任务分数普遍不高,大规模可靠性仍待验证。

所以这一节是想说:DexVLA 证明了"做大动作专家 + 课程 + 分步推理"的威力,但超长程任务、标注依赖、大参数优化脆弱这些问题仍在——它是重要一步而非终点。


它和别的论文是什么关系

  • 上游(被它借用)
    • Diffusion Policy(Chi et al. 2023):动作专家的思想源头,本仓库有深读笔记。
    • ScaleDP:把 Diffusion Policy 放大到 Transformer/1B 的工作,DexVLA 的动作专家骨干。
    • Qwen2-VL:VLM 骨干。
    • Octo:多头跨机体学习的思路来源。
    • LLaVA:投影 connector 和对齐阶段的思路来源。
  • 对比关系
    • OpenVLA(7B VLM):DexVLA 用小得多的数据、强得多的动作专家,全面超越——证明"重动作专家"胜过"重 VLM"。
    • π0(3B VLM + 小动作专家 + SayCan):DexVLA 动作专家更大、且用自生成分步推理替代 SayCan,长程任务分数翻倍。
    • 纯 Diffusion Policy:DexVLA 加了 VLM 的语言理解和泛化,长程复杂任务远超它。
  • 下游 / 同族:DexVLA 属于"VLM + 扩散动作专家"这条 VLA 路线(和 π0、TinyVLA 同族),它的贡献是把动作专家做大 + 具身课程 + 自生成推理,代表了"重视动作表示"的设计转向。

所以这一节是想说:DexVLA 站在 Diffusion Policy + ScaleDP + Qwen2-VL + Octo 的肩膀上,用"做大动作专家 + 课程学习 + 自生成分步推理"证明了动作表示才是 VLA 的关键瓶颈。


和本导读的关系

本笔记对应导读中"VLA 模型"这条线的前沿节点,尤其是"扩散动作专家"这一分支。

VLA 的发展有两条思路:一条是把 VLM 做大(OpenVLA、RT-2 用 VLM 直接输出离散动作),一条是"VLM + 扩散动作专家"(π0、DexVLA)。DexVLA 把后者推向极致——它明确指出"动作表示才是瓶颈",并把动作专家做到十亿参数。理解了它,你就理解了 VLA 领域一个重要的设计转向:从"堆大脑"到"强壮的手"。

读完本笔记,建议:先回看 Diffusion Policy 深读笔记(理解扩散动作生成的地基)和 3D-VLA / dp3 笔记(理解 VLA 和扩散策略的结合),再对照 π0 相关笔记(理解另一个"VLM + 扩散专家"模型,及它对 SayCan 的依赖)。几篇连起来,就能看清 VLA 从"离散动作"到"扩散动作专家"、从"外部规划器"到"自生成推理"的演进。

对应导读章节:Ch12:端到端 VLA (II)——OpenVLA / VLAS / MLA

所以这一节是想说:本笔记是"VLA + 扩散动作专家"这条线的前沿节点,读它前先懂 Diffusion Policy,读它时对照 π0 理解设计转向。


思考题

以下问题检验你是否真正理解了 DexVLA 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:DexVLA 的核心论点是"动作表示才是 VLA 的瓶颈,而非 VLM"。它用什么证据支持这个论点?

提示

最直接的证据是动作专家大小的消融:把扩散专家从 UNet(93M) → 410M → 1B,叠衬衫平均分从 0.17 → 0.63 → 0.92 单调大涨。这说明在 VLM 骨干不变的情况下,仅仅把动作专家做大就能带来巨大提升——动作专家的容量是性能的关键约束。另一个证据是对比实验:DexVLA 用远小的数据(100 小时 vs OpenVLA 4000、π0 1 万)和不算最大的 VLM(Qwen2-VL),却全面超过堆 VLM 堆数据的 OpenVLA(7B VLM)和 π0(3B VLM)。如果 VLM 是瓶颈,那 DexVLA 该输才对;它反而赢,说明性能来自动作专家而非 VLM。这两组证据共同支撑了"动作表示是瓶颈"的论点,也是 DexVLA 区别于"拼命放大 VLM"主流路线的核心洞察。

Q2:为什么必须有 Stage 1(只训扩散专家、不接 VLM)?没有它为什么模型会"完全学不会"?

提示

关键是十亿参数扩散专家的优化难度。DexVLA 把动作专家做到 1B 参数——这是个巨大的、难以优化的网络。如果一上来就把它和 VLM 一起端到端训练(跳过 Stage 1),庞大的动作专家参数处于随机初始化状态,优化过程会极其困难,梯度信号又要同时协调 VLM 和动作专家,结果是模型完全学不会任何有意义的动作(消融里是 0 分)。Stage 1 的作用有二:(1) 用所有跨机体数据单独训练扩散专家,让它先学会机体无关的底层运动技能(抓、放、移动);(2) 更重要的是"预热"这些庞大参数,让它们进入一个良好的、能理解视觉线索和语言指令的状态。有了这个预热的、已具备基本动作能力的扩散专家,Stage 2 再接上 VLM 联合训练时,优化就顺畅得多。这类似训练大模型时的分阶段/warmup 策略——直接从随机初始化端到端训巨型模型往往失败,需要先把关键组件预训练好。所以 Stage 1 不是可选的加分项,而是让整个系统能训起来的必要前提。

Q3:DexVLA 让模型"自己生成"分步推理,而不是把分步推理当输入喂给它。这个设计选择为什么重要?

提示

因为"当输出"能把高层规划能力真正内化进模型,而"当输入"只是外部喂食。如果分步推理是输入,那模型永远依赖一个外部来源(人或另一个规划器)来提供"下一步该干什么"——这正是 π0 依赖 SayCan 的模式,不够端到端,且外部规划器可能不适配。DexVLA 让模型学会自己生成分步推理(把它当中间语言输出来训练),逼模型内部学会"解读当前任务状态 → 决定下一个子步 → 用这个推理指导动作"。这样训练后,部署时模型能自主地把长任务分解、边做边想下一步,无需任何外部高层策略。而且这个内化过程还有个好处:它逼模型学到"语言子指令 → 精确运动基元"的解耦动作表示,让不同子步的动作空间分开,学得更有效。消融也证明:去掉分步推理(改成直接指令训扩散专家),叠衬衫从 0.92 暴跌到 0.07。所以"当输出"不只是形式差异,而是把外部规划能力真正变成模型自身能力的关键设计。

Q4:对比实验显示 DexVLA 的自生成分步推理胜过外部 SayCan。除了"端到端",SayCan 还有什么固有缺陷?

提示

SayCan 的核心缺陷是固定频率更新——它每 2 秒更新一次指令。这带来几个问题:(1) 状态冗余/重复:长程任务里,不同阶段的耗时差异很大——有的子步几秒就完(拿起衣服),有的要很久(把褶皱抚平)。固定每 2 秒喊一次口令,会在慢子步里产生大量冗余、重复的指令(反复说"继续抚平"),在快子步里又可能来不及切换,造成状态混乱。(2) 不自适应:固定频率无法根据任务实际进展动态调整——它不知道当前子步到底完成了没,只会机械地按时间切。而 DexVLA 的自生成分步推理是自适应地切分状态空间:模型根据实际观测判断当前处于哪个子步、何时该切换到下一步,切分和任务的自然节奏对齐。这就像一个好的司机根据路况换挡,而不是每 2 秒机械换一次挡。此外 SayCan 是外部模块,增加系统复杂度和延迟。所以 DexVLA 的推理不仅端到端,还更贴合长程任务的自然结构,这是它性能更好的深层原因(如收桌子 hard 0.70 vs SayCan 的 0.58)。

Q5:DexVLA 只用 100 小时数据就超过用 4000-10000 小时的 OpenVLA/π0。这是否意味着"数据规模不重要"?怎么理解数据和架构的关系?

提示

不能得出"数据不重要"的结论,正确理解是"数据效率取决于架构和训练策略"。同样的数据,用对的架构(大动作专家)和训练策略(具身课程 + 分步推理),能榨出多得多的价值——这是 DexVLA 的贡献。它证明的是"当前 VLA 的数据利用效率低下,因为架构失衡(重 VLM 轻动作)和训练方式没优化",而不是"数据规模无所谓"。事实上,数据规模和架构是互补的:(1) 更好的架构能用更少数据达到同样效果(DexVLA 的情况);(2) 但给同样的好架构更多数据,通常还能进一步提升(规模化规律仍在)。此外要注意 DexVLA 的"100 小时"是预训练数据,它还用了跨机体数据、每个新任务的 <100 示范等——不是完全零数据。而且它的对比是在特定的复杂长程任务上,OpenVLA/π0 的海量数据覆盖更广的任务分布,泛化面可能更宽。所以合理的结论是:DexVLA 展示了"架构和训练策略能极大提升数据效率",这提醒研究者不要只顾堆数据,而应同时优化架构(尤其被忽视的动作表示)——数据和架构要一起投资,而非二选一。

Q6:DexVLA 的扩散专家用多头结构(每头一种机体)来支持跨机体。为什么不用一个共享头处理所有机体?多头有什么好处和代价?

提示

多头的核心好处是处理不同机体动作空间的异质性。不同机器人的动作空间差异巨大:单臂是 7 维、双臂是 14 维、灵巧手是 12+ 维,各关节的语义、范围、控制方式都不同。如果用一个共享头输出所有机体的动作,这个头要同时拟合形态迥异的动作分布,容易互相干扰、难以学好(一个机体的动作模式可能污染另一个)。多头结构让每个头专门负责一种机体配置,各自拟合自己的动作空间,避免了跨机体的负干扰,同时共享底层的扩散专家主干——主干学通用的、机体无关的运动技能表示,头部学机体特定的动作映射。这样既能利用跨机体数据的共性(共享主干带来正迁移,Stage 1 就靠它学基本功),又能处理各机体的特性(专属头)。这个设计借鉴了 Octo。代价:(1) 每加一种机体要加一个头,参数和复杂度增加;(2) 新机体需要新头 + 一些数据来训练(虽然 <100 示范就够);(3) 头之间不直接共享机体特定知识。但总体上,多头是"共享通用 + 专属特定"的合理折中,比纯共享头更能驾驭跨机体的异质性。

Q7:DexVLA 在最难的叠脏衣服任务上也只有 0.4 分(满分 4)。如果你要把这个分数提上去,你会从哪里下手?

提示

叠脏衣服难在几点:超长程(>2 分钟)、软体可变形(衣服有无穷多种褶皱状态,难识别、难预测)、接触丰富、需要极精细的双手协调。提升方向:(1) 更多更高质量的示范——软体的状态空间巨大,需要覆盖更多褶皱构型的示范,尤其是 Stage 3 的高质量数据;(2) 更强的感知——可变形物体的状态识别是瓶颈,可加深度/触觉传感、或用更强的视觉表示来更好地理解衣服当前的形状和状态;(3) 更细/更自适应的分步推理——超长任务可能需要更精细的子步分解、以及从失败中恢复的推理(如"没抓住,重新抓");(4) 加入闭环纠错——像 DexCap 的人在环或自监督纠错,让模型能在执行中检测并修正错误(软体任务极易中途出错);(5) 世界模型辅助——用世界模型预测"这样折会变成什么样"来做规划;(6) 触觉反馈——叠衣服的力控很关键(抚平褶皱要合适的力),加触觉能显著帮助;(7) 更大的动作专家或更长的动作时域——处理更长的连续动作。核心矛盾是"软体可变形 + 超长程"带来的巨大状态空间和误差累积——需要在感知(看懂衣服状态)、推理(分解和纠错)、控制(精细力控)、数据(覆盖更多状态)多方面同时发力。这也是当前灵巧操作最前沿、最难的方向之一。

所以这一节是想说:能回答这 7 题,你就真正理解了 DexVLA 为什么做大动作专家、为什么三阶段、为什么自生成分步推理、多头结构的作用,以及它在超长程软体任务上的局限。


一些好奇心问答(FAQ)

Q1:DexVLA 的动作专家有多大?为什么这么强调它? 10 亿参数(用 ScaleDP),比传统动作专家的百万参数级大三个量级。论文的核心论点就是"动作表示是 VLA 的瓶颈",所以把动作专家做大是关键——消融显示 93M→1B 让叠衬衫从 0.17 涨到 0.92。

Q2:三个训练阶段分别干什么? Stage 1:只训扩散专家(不接 VLM),学跨机体的底层运动技能 + 预热参数。Stage 2:接上 VLM 联合训练,用机体特定数据对齐视觉语言理解和动作空间。Stage 3:用高质量示范精调复杂长程任务。

Q3:它怎么不用 SayCan 就能做长程任务? 靠自生成分步推理。训练时把分步推理标注当"中间语言输出",逼模型自己学会把长任务拆成子步(每约 5 秒一个)、生成推理、并用推理指导动作。相当于把高层规划内化进模型。

Q4:跑得快吗?要多少数据? 快且省数据。单张 A6000 上 60Hz 推理,预训练只用 100 小时数据(对比 OpenVLA 4000、π0 1 万小时)。

Q5:能用在哪些机器人上? 单臂、双臂、灵巧手、移动双臂等。多头扩散专家支持跨机体,还能用 <100 示范快速适应训练里没见过的新机体(如 Franka+灵巧手、双臂 UR5e)。

Q6:底座 VLM 是什么? Qwen2-VL。图像编码投到语言 token 空间,VLM 输出推理 token(经 FiLM 注入动作专家)和动作 token(经投影送入动作专家)。

所以这一节是想说:DexVLA 的实操问题(动作专家大小、三阶段、无 SayCan、速度数据、机体支持、VLM 骨干)都有明确答案,核心就是"做大动作专家 + 课程 + 自生成推理"这套组合。


如果你想再深入

按"必读前置 → 动作骨干 → 对比 → 同族"排序:

  1. 必读前置:Diffusion Policy(Chi et al. 2023) — 动作专家的思想地基,本仓库有深读笔记。
  2. 动作骨干:ScaleDP — 把 Diffusion Policy 放大到 1B 的工作,DexVLA 的动作专家。
  3. 对比路线:OpenVLA / RT-2 — "重 VLM、离散动作"路线,对照理解 DexVLA "重动作专家"的转向。
  4. 同族对比:π0 — 另一个"VLM + 扩散专家"模型,理解它对 SayCan 的依赖和 DexVLA 的改进。
  5. 跨机体思路:Octo — 多头跨机体学习的来源,理解 DexVLA 多头结构的由来。

所以这一节是想说:把 Diffusion Policy + ScaleDP + π0 + Octo + DexVLA 连起来读,就能看清 VLA 从"重 VLM 离散动作"到"重扩散动作专家 + 自生成推理"的演进脉络。


原文信息

BibTeX

@article{wen2025dexvla,
  title     = {DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control},
  author    = {Wen, Junjie and Zhu, Yichen and Li, Jinming and Tang, Zhibin and Shen, Chaomin and Feng, Feifei},
  journal   = {arXiv preprint arXiv:2502.05855},
  year      = {2025}
}

链接

所以这一节是想说:这是 Wen et al. 2025 年的工作,用"十亿参数扩散动作专家 + 具身课程学习 + 自生成分步推理"证明了动作表示才是 VLA 的关键瓶颈,用少得多的数据实现更强的跨机体长程灵巧控制。

引用本笔记 / Cite this note
BibTeX
@online{eai_dexvla_2026,
  title       = {(readable note) DexVLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dexvla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?