3D-VLA
这是一份写给"没接触过 VLA、3D 点云、扩散模型"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 openvla / rt-2 相关笔记再看本篇。
一句话讲什么(TL;DR)
现在主流的 VLA(视觉-语言-动作模型,如 RT-2、OpenVLA)都是"看 2D 照片 → 直接出动作",缺了三维空间感,也不会"想象未来"。3D-VLA 做了两件事:(1) 把眼睛从 2D 图像换成 3D 点云;(2) 在动手之前,先用扩散模型"脑补"出任务完成后的画面(目标图像 / 目标点云),再照着这张想象图去规划动作。它在 2M(两百万)条 3D-语言-动作数据上训练,推理指标 BLEU-4 从基线的 15.48 提到 26.80,定位 IoU 从 19.81 提到 29.33。
所以这一节是想说:3D-VLA 的核心就一句话——给 VLA 换上 3D 眼睛,再加一个"先想象目标、再规划动作"的世界模型大脑。
这是个什么场景
想象你在厨房,要"把最远的那个杯子放进中间的抽屉"。
如果你只有一张正面照片,你只能大概判断"杯子在那个区域",但伸手过去经常会撞到前排的牛奶盒——因为照片告诉你"它在那儿",却没告诉你"它离你多远、它和牛奶谁前谁后"。这就是 2D 图像的先天盲点:把三维世界拍平成了平面,丢了深度和空间关系。
而人真正拿杯子时,眼睛看到的是立体世界,脑子里还会闪过一个画面——"等下我的手会绕过牛奶、正好夹住杯子放进抽屉"。这个想象出来的完成态帮你提前规划路径。
3D-VLA 要让机器人也学会这套组合拳:看立体(3D 点云)+ 先想象(生成目标图像/点云)+ 再动手(生成动作)。它面对的场景是通用机器人操作——听一句话指令,在真实的三维环境里完成抓取、放置、开抽屉等任务。
所以这一节是想说:机器人在三维世界里干活,却只用 2D 照片当眼睛、还不会想象未来——3D-VLA 就是来补这两个洞的。

之前的人怎么做的,为什么不够好
方案 A:2D VLA(RT-2、PaLM-E、OpenVLA) 输入 2D RGB 图像 + 语言,直接输出动作 token。类比:只看照片就下命令。问题:没有 3D 空间理解,遇到"最远的杯子""书后面的杯子"这种需要深度和前后关系的指令就容易错;深度靠模型脑补,不稳。
方案 B:直接映射的 3D 具身模型(3D-LLM、embodied generalist) 能理解 3D 场景,但大多停在"感知 → 动作"的直接映射,学的是"看到什么就做什么"。类比:条件反射式做事。问题:缺乏对"世界动态"的理解——不知道"这个动作会让世界变成什么样",也就无法根据预期结果去规划。
方案 C:把通用视频扩散模型直接搬来预测未来(Runway、DreamLLM 冻结 SD) 想用现成的视频/图像生成模型预测未来帧。问题:这些模型不是为机器人场景设计的——让 Runway 生成"打开抽屉"的未来帧,整个场景视角、纹理、布局全乱了;直接冻结在互联网数据上训的 Stable Diffusion 会输出崩坏结果。
方案 D:3D 基础模型(3D-LLM 系) 能理解和推理当前可见的 3D 场景,但只停在"分析现在",无法"预测超出当前视野的未来状态",更接不上动作输出。
核心难题:怎么把"3D 感知 + 想象未来 + 生成动作"三件事拧进一个统一的具身基础模型?而且——训练它的数据从哪来?现有具身数据集 95% 以上只有 2D 图像/视频,没有 3D 标注。
所以这一节是想说:2D VLA 缺 3D、直接映射的 3D 模型缺"世界模型"、通用扩散模型不适配机器人、且没有 3D 数据——3D-VLA 要同时解掉这四个问题。
这篇论文的新想法
类比:以前的 VLA 像个"看照片就条件反射下命令的人",3D-VLA 把他升级成"有立体视觉、还会在脑子里预演结果的人"。
3D-VLA 的核心判断:人类是靠"世界模型"办事的——先根据 3D 内部表示想象未来会发生什么,再据此规划动作。机器人也应该这样。
它由三个关键设计组成:
3D 输入 + 交互 token:以 3D-LLM 为骨架(底层是 BLIP2-FlanT5XL),把多视角图像转成 3D 场景特征喂给大语言模型。并往词表里加一批"交互 token":物体 token(框住被操作物体)、位置 token(用 6 个数表示 3D 包围盒 AABB)、场景 token(框住一个静态场景的 embedding)、动作 token(7 自由度机械臂动作离散化)。
注入目标生成能力(会做梦):先分别预训练两个"具身扩散模型"——RGBD→RGBD(图像+深度)和 point→point(点云→点云),让它们学会"给定初始状态和指令,生成完成后的目标状态"。
用投影器把 LLM 和扩散模型对齐:加特殊 token(如
<image>、<pcd>)告诉解码器该输出哪种模态,再用一个基于 Transformer 的 projector 把 LLM 的输出特征映射进扩散模型的空间。用 LoRA 微调扩散模型,避免灾难性遗忘。自己造数据:设计一条流水线,从现有机器人数据集里"提炼"出 3D 标注,凑出 2M 条 3D-语言-动作数据对。
【旧 2D VLA vs 3D-VLA】
旧 2D VLA(RT-2/OpenVLA):
2D 照片 + 语言 ──▶ 直接出动作token
(缺深度、不懂前后遮挡、不会想象未来)
3D-VLA:
多视角图 ─▶ 3D场景特征 ─▶ 3D-LLM(BLIP2-FlanT5XL骨架)
│ 词表加"交互token":物体/位置(AABB)/场景/动作
│
①想象 ──────────┤ 具身扩散世界模型
(RGBD→RGBD, point→point):生成"任务完成后"的目标图/目标点云
│
②规划 ──────────┘ 照着想象的目标 ─▶ 7-DoF 动作
所以这一节是想说:3D-VLA = 3D-LLM 骨架 + 交互 token(表达 3D)+ 具身扩散模型(想象未来)+ 投影器(对齐)+ 自建 2M 3D 数据集。
它分几步做的(方法)
3D-VLA 分"造数据"和"搭模型"两大块。整体流程如下:
[造数据流水线]
现有机器人/HOI 数据集(多为2D)
│
▼ ZoeDepth 估深度 + RAFT 光流对齐深度一致性
│
▼ 提升为3D点云(相机内外参)
│
▼ spaCy解析指令取名词 → Grounded-SAM出2D掩码 → 抬升成3D框
│
▼ ChatGPT扩写语言模板
▼
2M条 <3D场景, 语言, 动作, 未来目标> 数据
[模型结构]
多视角图像 → 3D场景特征 ─┐
语言指令 ────────────────┤
交互token(物体/位置/场景/动作)─┼─▶ 3D-LLM(BLIP2-FlanT5XL) ─▶ 动作token
│ │
│ ▼ <image>/<pcd> token
│ Transformer投影器
│ │
└────────────────────▶ 具身扩散模型 ─▶ 目标图像/点云
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。Method 是本文最重要的部分,请慢读。
5.1 造数据第一步:给 2D 视频补上深度和点云
类比:老照片没有立体信息,先用 AI 给每张照片"估个深度",再拼成立体模型。
输入:现有具身数据集的视频帧(95% 以上没有 3D 信息),来自 12 个 Open-X 数据集 + Dobb-E、RH20T、RLBench、CALVIN(机器人)+ Epic-Kitchens、HOI4D(人-物交互)。
处理:
- 用 ZoeDepth(一个零样本深度估计器)给每帧估计深度图;
- 用 RAFT(光流估计)算相邻帧的像素运动。对相机没动的视频段,用光流找出"没动的背景像素",把这些背景的深度图跨帧对齐(每帧深度乘一个系数),保证深度一致性——否则逐帧独立估的深度会跳变;
- 有了深度图后,用相机内外参把 RGB-D 直接抬升成 3D 点云。
输出:每帧配套的深度图 + 3D 点云。
小结:先用 ZoeDepth+RAFT 把没有 3D 的 2D 视频"补"成带深度、带点云、且深度时序一致的 3D 数据。
5.2 造数据第二步:生成 3D 标注(框、目标、动作)
类比:给立体模型贴标签——框出"要操作的物体",标出"做完后长什么样"。
输入:上一步得到的点云 + 数据集自带的文本指令 + 7 自由度动作。
处理:
- 3D 包围盒:用 spaCy 解析指令,取出所有名词块(含被操作物体);用 Grounded-SAM(开放世界分割模型)得到每个物体的 2D 掩码;把 2D 掩码抬升到 3D 点云,得到 3D 包围盒。选被操作物体时,挑"光流大(在动)+ 置信度高"的那个。
- 目标状态:因为已经重建了深度和点云,可以直接把未来帧的图像/深度/点云当作"目标(想象结果)"的真值。
- 动作:直接用数据集提供的 7 DoF 动作。
输出:3D 框、目标图像/深度/点云、动作,全部配齐。
小结:靠 spaCy+Grounded-SAM 自动标 3D 框,用未来帧当"目标"真值,凑齐"想象未来"所需的监督信号。
5.3 造数据第三步:用 ChatGPT 把标注写成多样的语言
类比:把死板的模板句子改写成人话,让模型见过各种问法。
输入:上面生成的所有 3D 标注(框、目标、动作)。
处理:先用预定义模板 + 特殊 token 把标注拼成"提问+回答"对(涵盖任务描述、定位、稠密描述、目标生成、动作预测等六类任务);再用 ChatGPT(GPT-3.5-turbo) 配 2-3 个人工示范,把模板句改写得更多样自然;没有模板的任务直接让 ChatGPT 生成问答。
输出:2M 条 3D-语言-动作数据对。
小结:模板打底 + ChatGPT 扩写,把机械的标注变成两百万条多样的训练对话。
5.4 搭模型第一步:3D-LLM 骨架 + 交互 token
类比:给一个会说话的大脑(LLM)装上"看立体"的眼睛,再教它几个专门表达 3D 的新词。
输入:多视角图像、语言指令。
处理:
- 骨架:跟 3D-LLM 一样,用多视角图像特征生成 3D 场景特征,喂进预训练 VLM。因为自建数据集没到训练多模态 LLM 所需的十亿级规模,所以不从头训,而是用 BLIP2-FlanT5XL 当预训练底座。训练时解冻新 token 的输入输出 embedding 和 Q-Former 权重。
- 交互 token:往词表加四类——(1) 物体 token 框住名词;(2) 位置 token 用 6 个 token 表示 3D 包围盒(AABB 格式,即轴对齐最小/最大角点);(3) 场景 token 框住静态场景 embedding,让模型能处理"3D 场景与文本交错"的输入、理解动态;(4) 动作 token:7 自由度动作离散化成位置/旋转/夹爪开合的离散 token,动作之间用
<ACT_SEP>隔开。
输出:一个能理解 3D 场景、能吐动作 token 的 3D-LLM。
小结:BLIP2-FlanT5XL 当底座接 3D 特征,再加物体/位置/场景/动作四类交互 token,让 LLM 学会"用语言表达三维世界并输出动作"。
5.5 搭模型第二步:具身扩散模型 + 投影器(会做梦)
类比:先单独训练一个"会画完成态"的画师,再请一个翻译官(投影器)把大脑的想法翻译给画师听。
输入:初始状态(RGBD 或点云)+ 指令;以及 LLM 的输出特征。
处理:
- 预训练具身扩散模型:训两个条件扩散模型——RGBD→RGBD 用 Stable Diffusion V1.4 打底(把 RGB latent 和 depth latent 拼起来当图像条件,在 VAE 潜空间高效生成);point→point 用 Point-E 打底(加点云条件输入)。它们学"根据指令,把初始状态编辑成目标状态"。这一步解决了"通用扩散模型不适配机器人"的问题——用机器人数据专门训。
- 对齐(投影器):加特殊 token(如
<image>、<pcd>)告诉解码器输出哪种模态;在这对 token 之间,监督 LLM 生成给机器人执行的指令(可含物体 token、位置 token)。用一个基于 Transformer 的 projector 把 LLM 输出特征和 embedding 映射到扩散模型的空间。用 LoRA(低秩微调,只训极少参数)微调扩散模型避免遗忘;只训新特殊 token 的 embedding、对应输出线性层和整个 projector。总损失 = LLM 损失 + 扩散去噪损失。
输出:给定指令,模型能生成目标图像、目标深度、目标点云(想象出的完成态)。
小结:先用机器人数据把 SD 和 Point-E 训成"会画完成态"的具身扩散模型,再用 projector+LoRA 把它们对齐进 LLM,让 3D-VLA 能一边说话一边做梦。
5.6 为什么"3D + 世界模型"是关键
- 3D 信息给精确空间:点云直接携带 (x,y,z),模型不用从像素猜深度,"最远的杯子""书后面的杯子"这类空间推理直接可解。
- 想象目标当中间桥梁:先生成目标图像/点云,等于给长程任务立了个可对齐的"子目标路标"。实验发现"给真值完成态"能提升推理和规划——所以让模型自己学会想象,就等于内化了这个好处。
- 3D 框当注意力锚点:预测中间 3D 框能让模型聚焦到被操作物体上,目标生成和推理都更准(消融验证,去掉预测框性能下降)。
- 投影器 + LoRA 保证可训:不从头训扩散模型,而是对齐 + 低秩微调,既省算力又不灾难性遗忘。
小结:3D 管精确空间、想象目标管长程规划、3D 框管聚焦、投影器+LoRA 管高效训练——四者叠起来才是 3D-VLA。

关键数字(What works)
数字来自原文,重点看"3D + 想象"到底带来多少提升。
数字 1:3D 推理能力(held-in 数据,越高越好)
| 任务 | 模型 | BLEU-4 | ROUGE-L | EM@1 |
|---|---|---|---|---|
| Embodied QA | BLIP2 FlanT5XL | 15.48 | 38.92 | 15.35 |
| Embodied QA | 3D-VLA | 26.80 | 49.33 | 24.53 |
| Task Caption | BLIP2 FlanT5XL | 3.16 | 26.12 | 7.75 |
| Task Caption | 3D-VLA | 34.88 | 62.01 | 29.34 |
| What-if QA | BLIP2 FlanT5XL | 0.06 | 28.41 | 5.85 |
| What-if QA | 3D-VLA | 29.38 | 52.82 | 14.7 |
| Dense Caption | BLIP2 FlanT5XL | 13.96 | 40.56 | 13.10 |
| Dense Caption | 3D-VLA | 34.62 | 55.91 | 39.49 |
关键含义:在所有推理任务上,3D-VLA 全面碾压最强的 2D 基线(同样在机器人数据上训过的 BLIP2 FlanT5XL)。3D 信息 + 定位标注带来的空间理解是主因。
数字 2:3D 定位(held-in,越高越好)
| 方法 | IoU | Acc@25 | Acc@50 |
|---|---|---|---|
| Kosmos-2 (w/ GT Depth) | 10.92 | 12.73 | 3.85 |
| CoVLM (w/ GT Depth) | 19.81 | 25.39 | 16.61 |
| 3D-VLA | 29.33 | 42.26 | 27.09 |
关键含义:即便给 2D 基线灌真值深度,3D-VLA 的定位(IoU 29.33)仍大幅领先——大量 3D 标注让它学到了鲁棒的 3D 定位能力。
数字 3:目标图像生成(Open-X 未见测试集)
| 方法 | PSNR↑ | SSIM↑ | FID↓ |
|---|---|---|---|
| Instruct-P2P(零样本) | 14.41 | 0.389 | 0.309 |
| SuSIE | 15.20 | 0.549 | 0.182 |
| NeXT-GPT | 8.86 | 0.153 | 0.432 |
| Instruct-P2P*(同数据训) | 16.67 | 0.628 | 0.178 |
| 3D-VLA w/o 预测框 | 17.02 | 0.632 | 0.173 |
| 3D-VLA | 17.21 | 0.636 | 0.177 |
关键含义:即便和"用同样机器人数据训过的 Instruct-P2P*"比,3D-VLA 仍更好;去掉预测的 3D 框会小幅下降,证明中间框有用。
数字 4:目标点云生成 & 动作规划
| 指标/任务 | 基线 | 3D-VLA |
|---|---|---|
| 点云 P-FID↓ | Point-E* 5.241 | 4.796 |
| 点云 Chamfer-L1↓ | Point-E* 0.159 | 0.139 |
| RLBench 放刀 | LanCon(His.) 32.2 | 68 |
| RLBench 拿杯子(未见) | — | 24(有泛化) |
| CALVIN 连续完成1个 | MCIL 28.2 | 44.7 |
| CALVIN 连续完成3个 | MCIL 0.3 | 8.1 |
关键含义:点云生成更保真;动作规划上,3D-VLA 用开环控制就超过用了历史观测的 LanCon-Learn;CALVIN 长程任务上远超 MCIL。
所以这一节是想说:数字全面证明——3D + 想象目标让推理、定位、目标生成、动作规划四方面都显著变强。
实验结果说明了什么
问题一:3D 信息真的比 2D 更利于推理吗? 是。所有推理任务上 3D-VLA 都碾压同数据训练的 2D 基线(Embodied QA BLEU-4:26.80 vs 15.48)。原因有二:3D 提供了更准的空间信息;数据集里大量 3D 定位标注让模型学会聚焦关键物体。而且 3D-LLM(没在机器人数据上训)在这些任务上表现很差,说明"收集并训练机器人专属 3D 数据"是必要的。
问题二:"想象目标"这个中间步骤有用吗? 有用。消融显示:去掉预测的 3D 框,目标图像和点云生成质量都会下降(PSNR 17.21→17.02,P-FID 4.796→4.914)。论文还提到"给真值完成态能提升推理和规划"——所以让模型学会自己想象目标,等于内化了这个增益。它给长程任务提供了可对齐的子目标。
问题三:为什么要自己训扩散模型,不用现成的? 因为现成的不适配。让 Runway 生成"打开抽屉"的未来帧会导致整个场景视角/纹理/布局崩坏;直接冻结互联网上训的 SD(DreamLLM 做法)会输出崩溃结果。用机器人数据专门训 RGBD→RGBD 和 point→point 扩散模型后,生成的目标能"保持背景不变、只精准改变目标物体状态"。
问题四:动作规划上的表现说明什么? 说明"想象目标 + 定位物体"能提供丰富信息帮助推断动作。RLBench 上 3D-VLA 只用开环控制就超过用了历史观测和物体状态的 LanCon-Learn(放刀 68 vs 32.2),还能泛化到未见的拿杯子任务(24)。CALVIN 长程上远超 MCIL。
所以这一节是想说:实验系统回答了四个问题——3D 利于推理、想象目标有实效、专训扩散模型必要、想象+定位显著帮助动作规划。
你应该懂的几个新词
VLA(视觉-语言-动作模型):输入图像+语言、输出机器人动作的模型,如 RT-2、OpenVLA。3D-VLA 是它的 3D + 世界模型升级版。
世界模型(world model):能"想象/预测未来状态"的内部模型。人类靠它先设想结果再行动。3D-VLA 的核心特征。
点云(point cloud):一堆带 (x,y,z) 坐标的 3D 点,直接表达几何。3D-VLA 的输入之一。
token(词元):LLM 眼里的"词"。图像、点云、动作都得先翻译成 token 才能被 LLM 处理。
交互 token:3D-VLA 新加的一批专用 token——物体、位置(3D 框)、场景、动作,让 LLM 能用语言表达三维世界。
AABB(轴对齐包围盒):用最小角点和最大角点两个 3D 坐标(共 6 个数)表示的立体框。
扩散模型(diffusion model):从噪声一步步去噪生成图像/点云的生成模型。3D-VLA 用它来"想象目标"。
LoRA(低秩适配):只训练少量额外低秩参数来微调大模型,省算力、防遗忘。3D-VLA 用它微调扩散模型。
投影器(projector):把 LLM 的输出特征映射到扩散模型输入空间的"翻译官",本文用 Transformer 实现。
BLIP2-FlanT5XL:3D-VLA 的预训练底座,一个视觉-语言模型。
ZoeDepth / RAFT / Grounded-SAM:分别是深度估计、光流、开放世界分割模型,是造 3D 数据流水线的三个"零件"。
所以这一节是想说:这十来个词是读任何"3D + 世界模型 + VLA"论文都会反复出现的基础词汇。
它有什么搞不定的
- 依赖估计的深度,误差会累积:训练用 ZoeDepth 估的深度(因为原数据没有真深度),估计误差会污染点云和 3D 框,进而影响下游。真值深度场景下才是上限。
- 数据流水线易出错:Grounded-SAM 在复杂场景可能检错物体位置,所以论文特意"过滤掉复杂场景数据集"——意味着当前方法对杂乱场景不鲁棒。
- 开环控制,长程仍脆弱:动作预测用开环控制,CALVIN 连续完成 5 个任务仍是 0——长程闭环执行还没解决。
- 仿真/受限环境为主:动作规划在 RLBench、CALVIN 仿真上评测,真机大规模验证有限;论文自己在 Impact Statement 里说需先仿真训练再人监督部署。
- 算力门槛高:预训练用 6×32 张 V100、对齐用 6×64 张 V100,复现成本很高。
- 想象未必总对:扩散模型生成的目标可能有偏差,错误的想象会误导规划,且模型对"想象不确定性"没有显式建模。
所以这一节是想说:3D-VLA 打通了 3D+想象+动作,但受限于估计深度的误差、数据流水线的脆弱、开环长程、算力门槛这些现实问题。
它和别的论文是什么关系
- 上游(被它借用):
- 3D-LLM(Hong et al. 2023):3D-VLA 的骨架,提供"多视角特征→3D 场景特征→喂进 VLM"的思路。
- BLIP2(Li et al. 2023):预训练底座 FlanT5XL 版。
- Stable Diffusion / Point-E:目标图像、目标点云生成的扩散模型底座。
- LoRA:高效微调扩散模型。
- ZoeDepth / RAFT / Grounded-SAM / spaCy:造 3D 数据流水线的工具链。
- 对比关系:
- 和 RT-2 / PaLM-E / OpenVLA:那些是 2D VLA,直接感知→动作;3D-VLA 加了 3D 和世界模型。
- 和 3D-LLM / embodied generalist:那些做 3D 感知但只"分析现在"、直接映射动作;3D-VLA 会"想象未来"。
- 和 SuSIE / Instruct-P2P / NeXT-GPT:目标图像生成的对比基线,3D-VLA 生成质量更好。
- 下游 / 同族:3D-VLA 属于"世界模型 + 具身智能"这条线,和本仓库的 world-model 章节、以及后续的生成式规划工作同族。它和 dp3(3D Diffusion Policy)都强调"3D 表示对机器人的价值",但 dp3 是纯控制策略,3D-VLA 是带推理+生成的大模型。
所以这一节是想说:3D-VLA 站在 3D-LLM + BLIP2 + SD/Point-E + LoRA 的肩膀上,把"2D VLA"升级成"会看立体、会想象未来的世界模型"。
和本导读的关系
本笔记对应导读 Ch12:OpenVLA / VLAs / MLA 关于 VLA 演进的部分,也与 Ch15:世界模型 强相关。
导读 Ch12 讲了 VLA 的主线:RT-1(动作 token 化)→ RT-2(借 VLM 网络知识)→ OpenVLA(开源)。3D-VLA 是这条线上的一个"分叉与升级"——它指出了 2D VLA 的两个盲点(缺 3D、缺世界模型),并给出解法。读完本笔记,建议:先回看 rt-2 / openvla 笔记理解"2D VLA 怎么把动作当语言输出",再看 Ch15 世界模型章节理解"想象未来"这一支的整体脉络(如 Genie、Cosmos)。三者连起来,就能看清"从直接映射动作 → 借世界模型先想象再规划"的思想跃迁。
所以这一节是想说:本笔记是导读 Ch12/Ch15 交叉处的深度展开,读前先懂 2D VLA,读后接世界模型章节。
思考题
以下问题检验你是否真正理解了 3D-VLA 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:为什么 2D VLA 遇到"把最远的杯子放进中间抽屉"这种指令会容易出错,而 3D-VLA 能解?
提示
因为"最远"是一个深度/空间关系概念。2D 图像把三维拍平了,"最远"在像素里没有直接对应——模型得从遮挡、大小、透视等线索间接猜深度,很不稳。3D-VLA 直接拿到点云 (x,y,z),"最远"就是 z 坐标最大的那个,一目了然。加上它有大量 3D 定位标注训练,能准确框出被指物体。所以涉及深度、前后、远近的空间推理,3D 表示有本质优势。
Q2:3D-VLA 为什么要"先想象目标图像/点云,再规划动作",而不是像 RT-2 那样直接出动作?多这一步的好处是什么?
提示
这是"世界模型"思想。直接映射(感知→动作)学的是条件反射,没有对"这个动作会让世界变成什么样"的理解,长程任务里容易迷失。先想象目标态,等于给任务立了个明确的"路标":动作只要朝着这个想象的完成态推进就行,长程任务可以被分解成"到达一系列子目标"。论文也验证了给真值完成态能提升推理和规划——想象目标把这个增益内化进模型。代价是想象可能出错,会误导规划。
Q3:论文为什么不直接用现成的视频扩散模型(如 Runway)来预测未来,而要自己训 RGBD→RGBD 和 point→point 扩散模型?
提示
因为通用扩散模型不适配机器人场景。让 Runway 生成"打开抽屉"的未来帧,它会大改整个场景——视角变了、物体变形、纹理乱换、布局扭曲;DreamLLM 那种直接冻结互联网上训的 SD 会输出崩坏结果。机器人任务需要的是"背景基本不变、只精准改变被操作物体的状态"。所以必须用机器人数据专门训练具身扩散模型,让它学会这种"局部编辑"式的目标生成。
Q4:3D-VLA 的训练数据是"造"出来的(2M 条)。这条造数据流水线有哪些潜在风险?
提示
主要风险来自流水线每一环的误差累积:(1) 深度是 ZoeDepth 估的(原数据没有真深度),估计误差直接污染点云和 3D 框;(2) RAFT 光流对齐深度一致性,光流错了深度就跳变;(3) Grounded-SAM 在复杂场景可能分割错物体——所以论文特意过滤掉复杂场景数据集,这也暴露了方法对杂乱场景不鲁棒;(4) ChatGPT 扩写语言可能引入幻觉或不准确的描述。这些误差会一路传到最终模型。
Q5:3D-VLA 用 projector + LoRA 把 LLM 和扩散模型对齐,而不是端到端从头训。这个设计的动机和权衡是什么?
提示
动机:从头训一个能生成多模态的具身基础模型需要十亿级数据,而自建数据集只有百万级,规模不够。所以复用预训练组件(BLIP2 底座、SD/Point-E 扩散模型),只训"接口"——新 token embedding、输出线性层、projector,扩散模型用 LoRA 低秩微调。权衡:好处是省算力、防灾难性遗忘、能快速把多个模态的解码器接进来;代价是各组件是分阶段对齐而非完全端到端联合优化,可能不如从头训的联合最优,且性能受预训练组件质量约束。
Q6:3D-VLA 在 CALVIN 上"连续完成 5 个任务"仍是 0。这暴露了什么根本问题?你会怎么改进?
提示
暴露的是长程闭环执行的脆弱性。当前动作预测用开环控制(预测一串动作直接执行,不根据执行后的真实观测调整),误差会随任务链累积——第一个任务的小误差会让后续任务的初始状态偏离,越往后越崩。改进方向:(1) 改成闭环——每步/每个子目标后重新观测、重新规划;(2) 用想象的目标态做反馈,检测"是否达到子目标"再决定下一步;(3) 引入失败恢复机制;(4) 更好的低层动作控制器(当前动作是离散 token,精度有限)。核心是把"想象目标"和"闭环反馈"真正连起来。
Q7:3D-VLA 把动作表示成离散 token(位置/旋转/夹爪离散化)。这种动作表示有什么局限?和扩散策略(如 dp3)的连续动作生成相比如何?
提示
离散 token 动作的局限:(1) 精度受量化粒度限制,把连续的位置/旋转切成有限的桶,细腻操作会损失精度;(2) 桶太多则词表爆炸、难学,桶太少则动作粗糙;(3) 相邻动作在离散空间可能不连续,轨迹不够平滑。扩散策略(dp3、Diffusion Policy)直接在连续空间生成动作序列,能表达多模态动作分布、轨迹平滑、精度高,特别适合灵巧连续控制。但离散 token 的好处是能无缝复用 LLM 的自回归生成框架,和语言/推理统一在一个模型里——这正是 3D-VLA 选它的原因(它要的是"统一的世界模型",不是纯控制策略)。两者是"统一多模态 vs 专精控制"的取舍。
所以这一节是想说:能回答这 7 题,你就真正理解了 3D-VLA 为什么用 3D 点云、为什么先想象目标、为什么自训扩散模型、以及它的数据流水线和动作表示的取舍。
一些好奇心问答(FAQ)
Q1:3D-VLA 和 RT-2 到底差在哪? 两处。眼睛:RT-2 看 2D 图像,3D-VLA 看 3D 点云。大脑:RT-2 直接"感知→动作",3D-VLA 多了个"先想象目标态再规划"的世界模型环节。
Q2:它真的能在真机上用吗? 论文主要在 held-in 数据和 RLBench、CALVIN 仿真上评测,也在互联网/日常场景的图片上测了目标生成的鲁棒性。Impact Statement 明确说部署需"先仿真训练、再真机人监督",真机大规模验证仍有限。
Q3:2M 数据是人工标的吗? 不是。是用流水线自动"造"的——ZoeDepth 补深度、RAFT 对齐、Grounded-SAM 分割出 3D 框、未来帧当目标真值、ChatGPT 扩写语言。只用了少量人工示范引导 ChatGPT。
Q4:为什么用 BLIP2-FlanT5XL 而不用 3D-LLM 的预训练权重? 因为 3D-LLM 的训练数据主要是物体和室内场景,和机器人具身场景不对齐。所以借 3D-LLM 的方法(多视角特征→3D 特征),但底座用 BLIP2-FlanT5XL,不加载 3D-LLM 权重。
Q5:想象出来的目标图像准吗? 在测试集和互联网场景上,生成的目标能保持背景不变、精准改变目标物体状态,视觉和语义都接近真值(PSNR 17.21、SSIM 0.636)。但仍是生成结果,可能有偏差。
Q6:为什么预测中间 3D 框能帮上忙? 3D 框像"注意力锚点",让模型聚焦到被操作物体上,从而更好理解整个场景、把注意力分给指令提到的物体,最终目标生成和推理都更准。消融证明去掉它性能会降。
所以这一节是想说:3D-VLA 的实操问题(与 RT-2 区别、真机、数据来源、底座选择、想象质量、3D 框作用)都有明确答案。
如果你想再深入
按"必读前置 → 骨架来源 → 生成组件 → 同族"排序:
- 必读前置:RT-2 / OpenVLA — 理解 2D VLA 怎么把动作当语言 token 输出,本仓库有相关笔记。
- 骨架来源:3D-LLM(Hong et al. 2023) — 3D-VLA 的直接前身,理解"多视角特征→3D 场景特征→喂进 LLM"。
- 底座:BLIP2(Li et al. 2023) — 视觉-语言预训练底座,本仓库导读 Ch09 有讲。
- 生成组件:Stable Diffusion / Point-E — 目标图像、目标点云生成的扩散模型基础。
- 同族对比:dp3(3D Diffusion Policy) — 同样强调 3D 表示,但是纯控制策略,本仓库有深读笔记,对照能看出"统一世界模型 vs 专精控制"的取舍。
- 世界模型线:Genie / Cosmos — 理解"想象未来"这一支的整体脉络,本仓库有相关笔记。
所以这一节是想说:把 RT-2 + 3D-LLM + BLIP2 + dp3 连起来读,就能看清"2D VLA → 3D 世界模型 VLA"的完整技术脉络。
原文信息
BibTeX
@inproceedings{zhen20243dvla,
title = {3D-VLA: A 3D Vision-Language-Action Generative World Model},
author = {Zhen, Haoyu and Qiu, Xiaowen and Chen, Peihao and Yang, Jincheng and Yan, Xin and Du, Yilun and Hong, Yining and Gan, Chuang},
booktitle = {Proceedings of the International Conference on Machine Learning (ICML)},
year = {2024}
}
链接
所以这一节是想说:这是 Zhen et al. 2024 年发表在 ICML 的工作,用"3D 点云 + 具身扩散模型 + 交互 token"把 VLA 升级成会看立体、会想象未来的生成式世界模型。
◼
引用本笔记 / Cite this note
@online{eai_3d_vla_2026,
title = {(readable note) 3D-VLA},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/3d-vla/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?