DexVLA
这是一份写给"没接触过 VLA 和扩散策略"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 diffusion-policy 和一篇 VLA 笔记(如 3d-vla)再看本篇。
一句话讲什么(TL;DR)
现在的 VLA 模型(如 OpenVLA、π0)都在拼命把"视觉语言模型(VLM)"那部分做大,却忽略了真正产生动作的"动作专家"太小、动作表示是瓶颈。DexVLA 反其道而行——把扩散动作专家放大到 10 亿参数、做成多头结构支持跨机体,再配一套"具身课程学习"三阶段训练,还让模型自己生成"分步推理"来指挥长程任务。结果:只用 100 小时数据预训练、单张 A6000 上 60Hz 推理,在叠衬衫(0.92 分)、跨新机体学灵巧技能(<100 示范)、直接指令叠脏衣服(0.4 vs π0 的 0.2)等任务上全面超过 OpenVLA 和 π0。
所以这一节是想说:DexVLA 的核心是"把动作专家(扩散模型)做大做强 + 具身课程学习 + 自生成分步推理",用少得多的数据实现更强的跨机体长程灵巧控制。
这是个什么场景
想象你想要一个"全能机器人基础模型"——给它下任何自然语言指令("把衣服叠好""把桌子收拾干净"),它就能在各种机器人身上(单臂、双臂、灵巧手)完成。这正是 VLA(Vision-Language-Action,视觉-语言-动作)模型追求的目标:把在互联网海量图文上预训练的**视觉语言模型(VLM)**改造成机器人策略,既能理解语言和视觉、又能输出动作。
但现实很骨感,有两大瓶颈:
数据稀缺:SOTA 模型极度吃数据——OpenVLA 用 Open-X Embodiment 的 4000 小时,π0 用了 1 万小时。人工采集这些示范极其昂贵费力。
架构失衡:现在的 VLA 都在拼命放大 VLM 那部分(OpenVLA 用 7B VLM、π0 用 3B VLM),但 VLM 再强也是"隔靴搔痒"——它是在互联网图文上训的,和机器人具身的、感觉运动的动作是脱节的。真正产生动作的"动作专家"往往只有几百万参数,动作表示成了真正的瓶颈。
而且要完成"叠脏衣服"这种超长程任务,连 π0 这么强的模型都得靠一个外部的高层策略(SayCan)每两秒更新一次指令来分解任务。
DexVLA 要解的题:能不能不靠堆 VLM 和堆数据,而是从"动作表示"这个瓶颈下手,用更聪明的架构和训练策略,让 VLA 用少得多的数据实现更强的跨机体、长程、灵巧控制,还不用外部高层策略?
所以这一节是想说:VLA 想做全能机器人大脑,但卡在数据稀缺和"重 VLM 轻动作"的架构失衡上,DexVLA 想从动作表示这个瓶颈突破。

之前的人怎么做的,为什么不够好
方案 A:放大 VLM 的 VLA(OpenVLA 7B、RT-2) 把视觉语言模型做大,动作直接由 VLM 输出(离散化 token)。类比:给机器人配个博学的大脑,但手很笨。问题:VLM 再强也和具身动作脱节,动作表示粗糙(离散化损失精度),且吃海量数据。
方案 B:VLM + 小动作专家(π0、TinyVLA) 在 VLM 外接一个动作专家(如扩散头)。类比:博学大脑 + 小手。问题:动作专家只有几百万参数、太小,学不动复杂灵巧技能和跨机体数据;训练还是依赖整个大模型,效率低。
方案 C:靠外部高层策略分解长程任务(π0 + SayCan) 用 SayCan 等外部规划器每两秒把长任务拆成子目标,VLA 逐个完成。问题:(1) 依赖外部模块,不够端到端;(2) 固定频率更新(每 2 秒)可能产生冗余或重复状态,不能自适应地切分任务。
方案 D:纯扩散策略(Diffusion Policy) 不用 VLM,直接扩散生成动作。问题:没有 VLM 的语言理解和泛化能力,长程复杂任务和语言指令跟随做不了。
核心难题:怎么在不堆 VLM、不堆数据的前提下,解决"动作表示是瓶颈"这个问题,让 VLA 高效地学跨机体的灵巧技能、并能自己分解长程任务?
所以这一节是想说:重 VLM 的动作粗糙、小动作专家学不动、靠外部规划器不端到端、纯扩散没语言——缺一个"把动作专家做大做强 + 自带分步推理 + 高效训练"的方案,DexVLA 来补这个空。
这篇论文的新想法
类比:如果说别的 VLA 是"给机器人配个越来越聪明的大脑(VLM),但手一直很笨(小动作专家)",DexVLA 是"给它配一双同样强大的手(10 亿参数扩散专家),再用循序渐进的方式教它——先练基本功、再适应自己的身体、最后精通复杂任务"。
DexVLA 的核心判断:VLA 的瓶颈不在 VLM 而在动作专家。把动作专家(扩散模型)放大到十亿参数、并用正确的课程训练它,才能高效学出跨机体的灵巧技能。
它有三个关键创新:
十亿参数扩散动作专家:用 ScaleDP(Transformer 版的 Diffusion Policy,最大 1B 参数)当动作专家,比传统的百万参数级大了三个量级。关键是做成多头结构——每个头对应一种机体配置(单臂/双臂/灵巧手),从而能在跨机体数据上预训练(类似 Octo)。
具身课程学习(Embodied Curriculum Learning):三阶段、由易到难,像人先学抓握再学叠衣服——
- Stage 1 跨机体预训练:只训扩散专家(不带 VLM),学与机体无关的底层运动技能。
- Stage 2 机体特定对齐:"适应你的身体"——把 VLM 的抽象视觉语言表示和具体机器人的物理约束对齐。
- Stage 3 任务特定适应:精通复杂长程任务、泛化到新物体。
自生成分步推理(Substep Reasoning):不用外部 SayCan,而是让 VLM 骨干自己生成分步推理(把"叠衬衫"拆成"抚平褶皱→对齐袖子→固定折叠"),通过 FiLM 层注入扩散专家指导动作。相当于把高层规划能力直接内化进模型。
底座 VLM 用 Qwen2-VL。训练损失 = 扩散损失 + α×下一 token 预测损失(α=1)。
【VLA 瓶颈在"动作表示" → DexVLA 换个大脑】
传统 VLA(OpenVLA/π0):强 VLM + 百万参数级小动作头
└ 动作表示是瓶颈, 学不动复杂灵巧技能
DexVLA:
Qwen2-VL(VLM) ─推理token─FiLM─┐
─动作token─投影─┤
▼
十亿参数扩散专家(ScaleDP; 多头 = 每头一种机体)
训练:三阶段具身课程(跨机体预训练 → 机体特定对齐 → 任务特定适应)
自生成分步推理(每 ~5 秒一子步) 替代外部 SayCan
所以这一节是想说:DexVLA 的新想法是"把扩散动作专家做大到 1B + 多头支持跨机体 + 三阶段具身课程 + 自生成分步推理",从动作表示这个瓶颈突破 VLA。
它分几步做的(方法)
DexVLA 的架构与训练:
【架构】
Qwen2-VL (VLM骨干)
│ 图像编码→与语言token同空间; 多相机视图拼接
├─ 推理token ──FiLM──▶ 调制扩散专家的投影层
└─ 动作token ──投影(2线性层+LayerNorm, 类LLaVA connector)──▶
│
十亿参数扩散专家 (ScaleDP, 多头: 每头一种机体)
│ (推理引导 + 指令 → 生成动作)
▼ 机器人动作
【三阶段具身课程学习】
Stage1 跨机体预训练: 只训扩散专家(不带VLM)
ResNet-50图像编码 + DistilBERT语言 + FiLM注入
学机体无关的底层运动技能
▼
Stage2 机体特定对齐: VLM+投影层+扩散专家联合训(冻结VLM视觉编码器)
对齐抽象视觉语言表示 ↔ 具体机器人动作空间
→已能叠衬衫、bin picking
▼
Stage3 任务特定适应: 精通复杂长程任务、泛化新物体
用分步推理标注(每~5秒一个子步)当中间语言输出
损失: L = L_diff + α·L_ntp (α=1)
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 架构:VLM + 十亿参数扩散专家
类比:博学大脑(VLM)负责理解"要干什么"、生成推理,强壮的手(扩散专家)负责精细地"怎么动",两者用巧妙的接口连起来。
输入:机器人的图像观测(多相机视图)+ 语言指令。
处理:
- VLM 骨干(Qwen2-VL):图像编码器把观测投到和语言 token 同一空间,多相机视图拼接。VLM 产生两种输出:推理 token 和 动作 token。
- 动作 token 经一个投影模块(两个线性层 + LayerNorm,类似 LLaVA 的 connector),把 VLM 的嵌入空间转换成动作专家能吃的输入。
- 推理 token 通过 FiLM 层注入策略模型——缩放和平移投影层的参数,让模型能自主生成推理、并用推理指导动作生成。
- 扩散专家:用 ScaleDP(Transformer 版 Diffusion Policy,最大 1B),做成多头输出——每个头负责一种机体配置,从而支持跨机体预训练。
输出:机器人动作序列。
小结:VLM 生成推理和动作 token,推理经 FiLM 调制、动作经投影送入十亿参数多头扩散专家,实现"推理指导动作"的强动作生成。
5.2 Stage 1:跨机体预训练扩散专家
类比:先让"手"练好基本功——不管是哪个机器人的身体,先学会通用的抓、放、移动这些底层动作。
输入:所有可用的跨机体数据(单臂、双臂、灵巧手等)。
处理:只训扩散专家,暂时不接 VLM——聚焦发展稳健的动作生成能力,不依赖语言接地。这一阶段用 ResNet-50 当图像编码器(和 Diffusion Policy 一致)、DistilBERT 当语言嵌入,语言嵌入经 FiLM 层注入。多头结构让不同机体的数据都能用上(每头一种机体)。
输出:一个学会了机体无关底层运动技能的扩散专家。
小结:Stage 1 单独把十亿参数扩散专家在跨机体数据上"练基本功",既学底层技能又"预热"庞大的参数,为后续接 VLM 打基础。
5.3 Stage 2:机体特定对齐
类比:"适应你自己的身体"——通用基本功学好后,针对目标机器人(比如这台双臂 AgileX)微调,把大脑的理解和这具身体的动作对齐。
输入:只含目标机体的数据(每个样本单一机体)。
处理:Stage 1 的跨机体学习可能损害目标机体的性能,所以 Stage 2 用机体特定数据对齐——把 VLM 的抽象视觉语言表示和扩散专家的动作空间对齐(类似 LLaVA 的对齐阶段)。联合训练 VLM、投影层和扩散专家,但冻结 VLM 的视觉编码器。这让扩散专家能把 VLM 的高层视觉语言理解接地到目标机器人的具体运动控制空间。
输出:一个在目标机体上已能做多种任务(叠衬衫、bin picking)的模型——这一阶段本身就够用了(无需任务特定训练)。
小结:Stage 2 用目标机体数据把 VLM 的理解和扩散专家的动作对齐,冻结视觉编码器联合训练,单靠它就能完成叠衬衫等任务。
5.4 Stage 3:任务特定适应
类比:最后的"专项集训"——针对超难长程任务(叠脏衣服)用高质量示范精调,像大模型的后训练。
输入:目标复杂任务的高质量专家示范(含分步推理标注)。
处理:对简单任务(叠衬衫、收桌子、抓已知物体)无需这一步,Stage 2 就够了。但对复杂、需精细上下文动作的长程任务,需要用流畅一致的高质量示范后训练。关键技巧:Stage 2 和 3 都用分步推理标注的语言数据,但不是当输入,而是当中间语言输出——逼模型自己学会生成这些分步描述。这让模型能内部解读任务状态、把理解注入策略指导动作,无需外部高层策略。
输出:能完成叠脏衣服等超长程任务的模型。
小结:Stage 3 用高质量示范 + 分步推理"当输出"精调,让模型自己学会分解长程任务,替代了 π0 需要的外部 SayCan。
5.5 分步推理:把高层规划内化
类比:不请外部导演(SayCan)每 2 秒喊一次口令,而是让演员自己在心里把长镜头分成几个小段,边演边想下一步。
输入:长程任务(如收拾桌子,常超 2 分钟)的示范。
处理:长程任务对扩散专家来说太难,单条语言指令学不会。所以把长任务分解成子步骤标注——通常每 5 秒一个子步(避免过度细分)。训练时让模型学会自己生成这些分步推理(而非作为输入),从而学到"语言子指令 → 精确运动基元"的解耦动作表示。对比 π0 用 SayCan 固定每 2 秒更新指令,DexVLA 的分步推理能自适应地切分长程任务的状态空间。
输出:能自主分解长程任务的推理能力。
小结:分步推理把高层规划内化进 VLA——模型自己把长任务切成子步并生成推理,比外部 SayCan 更自适应、更端到端。
5.6 为什么"大动作专家 + 课程 + 分步推理"是关键
- 大动作专家攻破瓶颈:把被忽视的动作表示做大到 1B、多头支持跨机体,让模型真正学得动复杂灵巧技能。
- 课程学习让庞大参数可训:Stage 1 单独预热扩散专家(否则十亿参数难优化、会完全学不会),再逐步接 VLM、精调任务。
- 分步推理去掉外部规划器:自生成推理让长程任务端到端可解,还比固定频率的 SayCan 更自适应。
所以这一节是想说:DexVLA 的方法(架构 → Stage1 预训练 → Stage2 对齐 → Stage3 适应 → 分步推理),核心是"把动作专家做大 + 用课程逐步训练它 + 让模型自生成分步推理"。

关键数字(What works)
数字本身不重要,重要的是它们说明"把动作专家做大 + 课程 + 分步推理"到底值多少。
数字 1:效率对比(数据与推理)
| 维度 | DexVLA | 对比 |
|---|---|---|
| 预训练数据 | 100 小时 | OpenVLA 4000 小时、π0 1 万小时 |
| 推理速度 | 60Hz(单张 A6000) | — |
| VLM 骨干 | Qwen2-VL | OpenVLA 7B VLM、π0 3B VLM |
| 动作专家 | 10 亿参数扩散专家 | 传统百万参数级 |
关键含义:用少一到两个数量级的数据、单卡快速推理,靠的是"把动作专家做大 + 好的训练策略"而非堆数据堆 VLM。
数字 2:无任务特定适应(Stage 2 后,10 次试验平均分)
| 任务 | DexVLA | OpenVLA / Octo / Diffusion Policy |
|---|---|---|
| 叠衬衫(shirt folding,满分 3) | 0.92 | 几乎全 0(做不了任何一步) |
| bin picking / 收桌子 | 明显更高 | 偶有零星成功、总分很低 |
关键含义:只到 Stage 2、一套参数,DexVLA 就能叠衬衫(0.92),而 OpenVLA/Octo/Diffusion Policy 在这种复杂任务上几乎完全失败。
数字 3:跨新机体学灵巧技能(<100 示范,10 次试验平均)
| 方法 | 两个新机体任务平均分 |
|---|---|
| DexVLA | 0.90 |
| OpenVLA / Octo | 挣扎(很低) |
| Diffusion Policy(专为少样本设计) | 明显低于 DexVLA |
关键含义:在训练里没见过的新机体(Franka + 灵巧手 12 DoF、双臂 UR5e)上,只用 <100 示范就到 0.90,超过大规模预训练的 OpenVLA 和专门少样本的 Diffusion Policy。
数字 4:复杂长程任务直接指令(10 次试验平均)
| 任务 | DexVLA | π0 |
|---|---|---|
| 叠脏衣服(laundry folding,满分 4) | 0.4 | 0.2 |
| 收桌子(hard) | 比 π0 高 0.08 | — |
关键含义:最难的叠脏衣服任务,直接下指令(无外部规划器)DexVLA 0.4 是 π0(0.2)的两倍;且 π0 还依赖 SayCan,DexVLA 靠自生成分步推理。
数字 5:消融——动作专家大小 & 分步推理 & 三阶段
| 消融项 | 结果(叠衬衫平均分) |
|---|---|
| 扩散专家 UNet(93M) | 0.17 |
| 扩散专家 410M | 0.63 |
| 扩散专家 1B | 0.92 |
| 去掉分步推理(直接指令训扩散专家) | 0.92 → 0.07 |
| 两阶段都去分步推理 | 0(完全失败) |
| 只 Stage1 或只 Stage2 | 0 / 0 |
| Stage1+2(无 Stage3)叠脏衣服 | 0(vs 全三阶段 0.4) |
关键含义:动作专家越大越好(93M→1B:0.17→0.92);分步推理至关重要(去掉暴跌到 0.07 甚至 0);三阶段缺一不可(Stage1 预热必需,否则庞大参数学不动)。
所以这一节是想说:数据证明四件事——用少得多数据超越 SOTA、动作专家越大越强、分步推理是长程任务命门、三阶段课程缺一不可。
实验结果说明了什么
问题一:不堆 VLM 不堆数据,光把动作专家做大有用吗? 非常有用。DexVLA 用 100 小时数据(vs OpenVLA 4000、π0 1 万)、Qwen2-VL 骨干,却全面超过它们。消融最直接:扩散专家从 93M→410M→1B,叠衬衫分从 0.17→0.63→0.92。这坐实了论文的核心论点——动作表示才是 VLA 的真正瓶颈,把动作专家做大比堆 VLM/数据更划算。
问题二:具身课程学习(三阶段)真有必要吗? 缺一不可。只 Stage 1 或只 Stage 2 都是 0 分;没有 Stage 1,模型完全学不会任何有意义的动作——因为十亿参数的扩散专家太难优化,Stage 1 既教基本功又"预热"参数。没有 Stage 3,叠脏衣服从 0.4 掉到 0。所以三阶段(预训练→对齐→适应)由易到难,是让庞大动作专家可训、并逐步精通复杂任务的关键。
问题三:自生成分步推理 vs 外部 SayCan,哪个好? 自生成更好。用 SayCan 替换 DexVLA 的分步推理,性能明显下降(如收桌子 hard 0.70→0.58)。原因:(1) 自生成推理能解耦不同特征的动作空间,学得更有效;(2) SayCan 固定每 2 秒更新指令,可能产生冗余重复状态,而 DexVLA 的分步推理能自适应地切分长程任务。而且去掉分步推理,叠衬衫从 0.92 暴跌到 0.07、两阶段都去则完全失败——说明它是长程任务的命门。
问题四:能快速适应全新机体吗? 能。在训练里完全没见过的新机体(Franka+灵巧手 12DoF、双臂 UR5e)上,只用 <100 示范,DexVLA 达 0.90,超过大规模预训练的 OpenVLA 和专为少样本设计的 Diffusion Policy。这说明多头扩散专家 + 课程学习学到的底层技能能高效迁移到新身体。
所以这一节是想说:实验系统回答了四个问题——做大动作专家确实值、三阶段课程缺一不可、自生成分步推理胜过外部 SayCan、能少样本适应新机体。
你应该懂的几个新词
VLA(视觉-语言-动作模型):把预训练的视觉语言模型改造成能输出机器人动作的策略。
VLM(视觉语言模型):在海量图文上预训练、能理解图像和语言的模型(DexVLA 用 Qwen2-VL)。
动作专家(action expert):VLA 里专门产生动作的模块,DexVLA 把它做成 10 亿参数的扩散模型。
扩散策略 / ScaleDP:用扩散模型从噪声生成动作序列的策略;ScaleDP 是它的 Transformer 大规模版(可到 1B)。
跨机体(cross-embodiment):在多种不同结构的机器人(单臂/双臂/灵巧手)上学习,DexVLA 用多头结构支持。
课程学习(curriculum learning):由易到难分阶段训练,DexVLA 的"具身课程"是预训练→对齐→适应三阶段。
分步推理(substep reasoning):把长任务拆成子步(如"抚平褶皱→对齐袖子"),DexVLA 让模型自己生成,替代外部规划器。
FiLM 层:用一组参数对特征做缩放和平移的条件化技巧,DexVLA 用它把推理/语言注入动作专家。
多头结构(multi-head):一个模型多个输出头,每头对应一种机体配置,实现跨机体学习(类似 Octo)。
SayCan:一种外部高层策略,把长任务分解成子目标供 VLA 逐个完成(π0 依赖它,DexVLA 想摆脱它)。
所以这一节是想说:这十个词是读任何"VLA / 扩散策略 / 跨机体机器人"论文都会反复出现的基础词汇。
它有什么搞不定的
- 超长程接触丰富任务仍难:叠脏衣服这种超长(>2 分钟)、软体可变形的任务,DexVLA 也只到 0.4 分——虽超 π0(0.2),但离可靠还远。
- 依赖分步推理标注:Stage 2/3 需要分步推理标注的数据(每 5 秒一个子步),虽用 Gemini 2.0 + Grounding-DINO 半自动标注,但 Stage 3 仍需人工检查高质量标注,非零成本。
- 十亿参数扩散专家难优化:没有 Stage 1 预热就完全学不会——说明大动作专家的优化很脆弱,训练策略必须精心设计。
- 仍需机体特定数据对齐:Stage 1 的跨机体学习会损害目标机体性能,必须 Stage 2 用机体特定数据对齐,不能纯靠跨机体预训练直接部署。
- VLM 视觉编码器冻结:Stage 2 冻结 VLM 视觉编码器,可能限制视觉表示对机器人场景的适配。
- 评测规模有限:主要在几种机体、每任务 10 次试验上评测,长程任务分数普遍不高,大规模可靠性仍待验证。
所以这一节是想说:DexVLA 证明了"做大动作专家 + 课程 + 分步推理"的威力,但超长程任务、标注依赖、大参数优化脆弱这些问题仍在——它是重要一步而非终点。
它和别的论文是什么关系
- 上游(被它借用):
- Diffusion Policy(Chi et al. 2023):动作专家的思想源头,本仓库有深读笔记。
- ScaleDP:把 Diffusion Policy 放大到 Transformer/1B 的工作,DexVLA 的动作专家骨干。
- Qwen2-VL:VLM 骨干。
- Octo:多头跨机体学习的思路来源。
- LLaVA:投影 connector 和对齐阶段的思路来源。
- 对比关系:
- 和 OpenVLA(7B VLM):DexVLA 用小得多的数据、强得多的动作专家,全面超越——证明"重动作专家"胜过"重 VLM"。
- 和 π0(3B VLM + 小动作专家 + SayCan):DexVLA 动作专家更大、且用自生成分步推理替代 SayCan,长程任务分数翻倍。
- 和 纯 Diffusion Policy:DexVLA 加了 VLM 的语言理解和泛化,长程复杂任务远超它。
- 下游 / 同族:DexVLA 属于"VLM + 扩散动作专家"这条 VLA 路线(和 π0、TinyVLA 同族),它的贡献是把动作专家做大 + 具身课程 + 自生成推理,代表了"重视动作表示"的设计转向。
所以这一节是想说:DexVLA 站在 Diffusion Policy + ScaleDP + Qwen2-VL + Octo 的肩膀上,用"做大动作专家 + 课程学习 + 自生成分步推理"证明了动作表示才是 VLA 的关键瓶颈。
和本导读的关系
本笔记对应导读中"VLA 模型"这条线的前沿节点,尤其是"扩散动作专家"这一分支。
VLA 的发展有两条思路:一条是把 VLM 做大(OpenVLA、RT-2 用 VLM 直接输出离散动作),一条是"VLM + 扩散动作专家"(π0、DexVLA)。DexVLA 把后者推向极致——它明确指出"动作表示才是瓶颈",并把动作专家做到十亿参数。理解了它,你就理解了 VLA 领域一个重要的设计转向:从"堆大脑"到"强壮的手"。
读完本笔记,建议:先回看 Diffusion Policy 深读笔记(理解扩散动作生成的地基)和 3D-VLA / dp3 笔记(理解 VLA 和扩散策略的结合),再对照 π0 相关笔记(理解另一个"VLM + 扩散专家"模型,及它对 SayCan 的依赖)。几篇连起来,就能看清 VLA 从"离散动作"到"扩散动作专家"、从"外部规划器"到"自生成推理"的演进。
对应导读章节:Ch12:端到端 VLA (II)——OpenVLA / VLAS / MLA。
所以这一节是想说:本笔记是"VLA + 扩散动作专家"这条线的前沿节点,读它前先懂 Diffusion Policy,读它时对照 π0 理解设计转向。
思考题
以下问题检验你是否真正理解了 DexVLA 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:DexVLA 的核心论点是"动作表示才是 VLA 的瓶颈,而非 VLM"。它用什么证据支持这个论点?
提示
最直接的证据是动作专家大小的消融:把扩散专家从 UNet(93M) → 410M → 1B,叠衬衫平均分从 0.17 → 0.63 → 0.92 单调大涨。这说明在 VLM 骨干不变的情况下,仅仅把动作专家做大就能带来巨大提升——动作专家的容量是性能的关键约束。另一个证据是对比实验:DexVLA 用远小的数据(100 小时 vs OpenVLA 4000、π0 1 万)和不算最大的 VLM(Qwen2-VL),却全面超过堆 VLM 堆数据的 OpenVLA(7B VLM)和 π0(3B VLM)。如果 VLM 是瓶颈,那 DexVLA 该输才对;它反而赢,说明性能来自动作专家而非 VLM。这两组证据共同支撑了"动作表示是瓶颈"的论点,也是 DexVLA 区别于"拼命放大 VLM"主流路线的核心洞察。
Q2:为什么必须有 Stage 1(只训扩散专家、不接 VLM)?没有它为什么模型会"完全学不会"?
提示
关键是十亿参数扩散专家的优化难度。DexVLA 把动作专家做到 1B 参数——这是个巨大的、难以优化的网络。如果一上来就把它和 VLM 一起端到端训练(跳过 Stage 1),庞大的动作专家参数处于随机初始化状态,优化过程会极其困难,梯度信号又要同时协调 VLM 和动作专家,结果是模型完全学不会任何有意义的动作(消融里是 0 分)。Stage 1 的作用有二:(1) 用所有跨机体数据单独训练扩散专家,让它先学会机体无关的底层运动技能(抓、放、移动);(2) 更重要的是"预热"这些庞大参数,让它们进入一个良好的、能理解视觉线索和语言指令的状态。有了这个预热的、已具备基本动作能力的扩散专家,Stage 2 再接上 VLM 联合训练时,优化就顺畅得多。这类似训练大模型时的分阶段/warmup 策略——直接从随机初始化端到端训巨型模型往往失败,需要先把关键组件预训练好。所以 Stage 1 不是可选的加分项,而是让整个系统能训起来的必要前提。
Q3:DexVLA 让模型"自己生成"分步推理,而不是把分步推理当输入喂给它。这个设计选择为什么重要?
提示
因为"当输出"能把高层规划能力真正内化进模型,而"当输入"只是外部喂食。如果分步推理是输入,那模型永远依赖一个外部来源(人或另一个规划器)来提供"下一步该干什么"——这正是 π0 依赖 SayCan 的模式,不够端到端,且外部规划器可能不适配。DexVLA 让模型学会自己生成分步推理(把它当中间语言输出来训练),逼模型内部学会"解读当前任务状态 → 决定下一个子步 → 用这个推理指导动作"。这样训练后,部署时模型能自主地把长任务分解、边做边想下一步,无需任何外部高层策略。而且这个内化过程还有个好处:它逼模型学到"语言子指令 → 精确运动基元"的解耦动作表示,让不同子步的动作空间分开,学得更有效。消融也证明:去掉分步推理(改成直接指令训扩散专家),叠衬衫从 0.92 暴跌到 0.07。所以"当输出"不只是形式差异,而是把外部规划能力真正变成模型自身能力的关键设计。
Q4:对比实验显示 DexVLA 的自生成分步推理胜过外部 SayCan。除了"端到端",SayCan 还有什么固有缺陷?
提示
SayCan 的核心缺陷是固定频率更新——它每 2 秒更新一次指令。这带来几个问题:(1) 状态冗余/重复:长程任务里,不同阶段的耗时差异很大——有的子步几秒就完(拿起衣服),有的要很久(把褶皱抚平)。固定每 2 秒喊一次口令,会在慢子步里产生大量冗余、重复的指令(反复说"继续抚平"),在快子步里又可能来不及切换,造成状态混乱。(2) 不自适应:固定频率无法根据任务实际进展动态调整——它不知道当前子步到底完成了没,只会机械地按时间切。而 DexVLA 的自生成分步推理是自适应地切分状态空间:模型根据实际观测判断当前处于哪个子步、何时该切换到下一步,切分和任务的自然节奏对齐。这就像一个好的司机根据路况换挡,而不是每 2 秒机械换一次挡。此外 SayCan 是外部模块,增加系统复杂度和延迟。所以 DexVLA 的推理不仅端到端,还更贴合长程任务的自然结构,这是它性能更好的深层原因(如收桌子 hard 0.70 vs SayCan 的 0.58)。
Q5:DexVLA 只用 100 小时数据就超过用 4000-10000 小时的 OpenVLA/π0。这是否意味着"数据规模不重要"?怎么理解数据和架构的关系?
提示
不能得出"数据不重要"的结论,正确理解是"数据效率取决于架构和训练策略"。同样的数据,用对的架构(大动作专家)和训练策略(具身课程 + 分步推理),能榨出多得多的价值——这是 DexVLA 的贡献。它证明的是"当前 VLA 的数据利用效率低下,因为架构失衡(重 VLM 轻动作)和训练方式没优化",而不是"数据规模无所谓"。事实上,数据规模和架构是互补的:(1) 更好的架构能用更少数据达到同样效果(DexVLA 的情况);(2) 但给同样的好架构更多数据,通常还能进一步提升(规模化规律仍在)。此外要注意 DexVLA 的"100 小时"是预训练数据,它还用了跨机体数据、每个新任务的 <100 示范等——不是完全零数据。而且它的对比是在特定的复杂长程任务上,OpenVLA/π0 的海量数据覆盖更广的任务分布,泛化面可能更宽。所以合理的结论是:DexVLA 展示了"架构和训练策略能极大提升数据效率",这提醒研究者不要只顾堆数据,而应同时优化架构(尤其被忽视的动作表示)——数据和架构要一起投资,而非二选一。
Q6:DexVLA 的扩散专家用多头结构(每头一种机体)来支持跨机体。为什么不用一个共享头处理所有机体?多头有什么好处和代价?
提示
多头的核心好处是处理不同机体动作空间的异质性。不同机器人的动作空间差异巨大:单臂是 7 维、双臂是 14 维、灵巧手是 12+ 维,各关节的语义、范围、控制方式都不同。如果用一个共享头输出所有机体的动作,这个头要同时拟合形态迥异的动作分布,容易互相干扰、难以学好(一个机体的动作模式可能污染另一个)。多头结构让每个头专门负责一种机体配置,各自拟合自己的动作空间,避免了跨机体的负干扰,同时共享底层的扩散专家主干——主干学通用的、机体无关的运动技能表示,头部学机体特定的动作映射。这样既能利用跨机体数据的共性(共享主干带来正迁移,Stage 1 就靠它学基本功),又能处理各机体的特性(专属头)。这个设计借鉴了 Octo。代价:(1) 每加一种机体要加一个头,参数和复杂度增加;(2) 新机体需要新头 + 一些数据来训练(虽然 <100 示范就够);(3) 头之间不直接共享机体特定知识。但总体上,多头是"共享通用 + 专属特定"的合理折中,比纯共享头更能驾驭跨机体的异质性。
Q7:DexVLA 在最难的叠脏衣服任务上也只有 0.4 分(满分 4)。如果你要把这个分数提上去,你会从哪里下手?
提示
叠脏衣服难在几点:超长程(>2 分钟)、软体可变形(衣服有无穷多种褶皱状态,难识别、难预测)、接触丰富、需要极精细的双手协调。提升方向:(1) 更多更高质量的示范——软体的状态空间巨大,需要覆盖更多褶皱构型的示范,尤其是 Stage 3 的高质量数据;(2) 更强的感知——可变形物体的状态识别是瓶颈,可加深度/触觉传感、或用更强的视觉表示来更好地理解衣服当前的形状和状态;(3) 更细/更自适应的分步推理——超长任务可能需要更精细的子步分解、以及从失败中恢复的推理(如"没抓住,重新抓");(4) 加入闭环纠错——像 DexCap 的人在环或自监督纠错,让模型能在执行中检测并修正错误(软体任务极易中途出错);(5) 世界模型辅助——用世界模型预测"这样折会变成什么样"来做规划;(6) 触觉反馈——叠衣服的力控很关键(抚平褶皱要合适的力),加触觉能显著帮助;(7) 更大的动作专家或更长的动作时域——处理更长的连续动作。核心矛盾是"软体可变形 + 超长程"带来的巨大状态空间和误差累积——需要在感知(看懂衣服状态)、推理(分解和纠错)、控制(精细力控)、数据(覆盖更多状态)多方面同时发力。这也是当前灵巧操作最前沿、最难的方向之一。
所以这一节是想说:能回答这 7 题,你就真正理解了 DexVLA 为什么做大动作专家、为什么三阶段、为什么自生成分步推理、多头结构的作用,以及它在超长程软体任务上的局限。
一些好奇心问答(FAQ)
Q1:DexVLA 的动作专家有多大?为什么这么强调它? 10 亿参数(用 ScaleDP),比传统动作专家的百万参数级大三个量级。论文的核心论点就是"动作表示是 VLA 的瓶颈",所以把动作专家做大是关键——消融显示 93M→1B 让叠衬衫从 0.17 涨到 0.92。
Q2:三个训练阶段分别干什么? Stage 1:只训扩散专家(不接 VLM),学跨机体的底层运动技能 + 预热参数。Stage 2:接上 VLM 联合训练,用机体特定数据对齐视觉语言理解和动作空间。Stage 3:用高质量示范精调复杂长程任务。
Q3:它怎么不用 SayCan 就能做长程任务? 靠自生成分步推理。训练时把分步推理标注当"中间语言输出",逼模型自己学会把长任务拆成子步(每约 5 秒一个)、生成推理、并用推理指导动作。相当于把高层规划内化进模型。
Q4:跑得快吗?要多少数据? 快且省数据。单张 A6000 上 60Hz 推理,预训练只用 100 小时数据(对比 OpenVLA 4000、π0 1 万小时)。
Q5:能用在哪些机器人上? 单臂、双臂、灵巧手、移动双臂等。多头扩散专家支持跨机体,还能用 <100 示范快速适应训练里没见过的新机体(如 Franka+灵巧手、双臂 UR5e)。
Q6:底座 VLM 是什么? Qwen2-VL。图像编码投到语言 token 空间,VLM 输出推理 token(经 FiLM 注入动作专家)和动作 token(经投影送入动作专家)。
所以这一节是想说:DexVLA 的实操问题(动作专家大小、三阶段、无 SayCan、速度数据、机体支持、VLM 骨干)都有明确答案,核心就是"做大动作专家 + 课程 + 自生成推理"这套组合。
如果你想再深入
按"必读前置 → 动作骨干 → 对比 → 同族"排序:
- 必读前置:Diffusion Policy(Chi et al. 2023) — 动作专家的思想地基,本仓库有深读笔记。
- 动作骨干:ScaleDP — 把 Diffusion Policy 放大到 1B 的工作,DexVLA 的动作专家。
- 对比路线:OpenVLA / RT-2 — "重 VLM、离散动作"路线,对照理解 DexVLA "重动作专家"的转向。
- 同族对比:π0 — 另一个"VLM + 扩散专家"模型,理解它对 SayCan 的依赖和 DexVLA 的改进。
- 跨机体思路:Octo — 多头跨机体学习的来源,理解 DexVLA 多头结构的由来。
所以这一节是想说:把 Diffusion Policy + ScaleDP + π0 + Octo + DexVLA 连起来读,就能看清 VLA 从"重 VLM 离散动作"到"重扩散动作专家 + 自生成推理"的演进脉络。
原文信息
BibTeX
@article{wen2025dexvla,
title = {DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control},
author = {Wen, Junjie and Zhu, Yichen and Li, Jinming and Tang, Zhibin and Shen, Chaomin and Feng, Feifei},
journal = {arXiv preprint arXiv:2502.05855},
year = {2025}
}
链接
- arXiv:arxiv.org/abs/2502.05855
- 项目主页:dex-vla.github.io
所以这一节是想说:这是 Wen et al. 2025 年的工作,用"十亿参数扩散动作专家 + 具身课程学习 + 自生成分步推理"证明了动作表示才是 VLA 的关键瓶颈,用少得多的数据实现更强的跨机体长程灵巧控制。
◼
引用本笔记 / Cite this note
@online{eai_dexvla_2026,
title = {(readable note) DexVLA},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2025 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dexvla/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?