Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 114

3D-VLA

22 min read · 7722 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过 VLA、3D 点云、扩散模型"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 openvla / rt-2 相关笔记再看本篇。

一句话讲什么(TL;DR)

现在主流的 VLA(视觉-语言-动作模型,如 RT-2、OpenVLA)都是"看 2D 照片 → 直接出动作",缺了三维空间感,也不会"想象未来"。3D-VLA 做了两件事:(1) 把眼睛从 2D 图像换成 3D 点云;(2) 在动手之前,先用扩散模型"脑补"出任务完成后的画面(目标图像 / 目标点云),再照着这张想象图去规划动作。它在 2M(两百万)条 3D-语言-动作数据上训练,推理指标 BLEU-4 从基线的 15.48 提到 26.80,定位 IoU 从 19.81 提到 29.33。

所以这一节是想说:3D-VLA 的核心就一句话——给 VLA 换上 3D 眼睛,再加一个"先想象目标、再规划动作"的世界模型大脑。


这是个什么场景

想象你在厨房,要"把最远的那个杯子放进中间的抽屉"。

如果你只有一张正面照片,你只能大概判断"杯子在那个区域",但伸手过去经常会撞到前排的牛奶盒——因为照片告诉你"它在那儿",却没告诉你"它离你多远、它和牛奶谁前谁后"。这就是 2D 图像的先天盲点:把三维世界拍平成了平面,丢了深度和空间关系。

而人真正拿杯子时,眼睛看到的是立体世界,脑子里还会闪过一个画面——"等下我的手会绕过牛奶、正好夹住杯子放进抽屉"。这个想象出来的完成态帮你提前规划路径。

3D-VLA 要让机器人也学会这套组合拳:看立体(3D 点云)+ 先想象(生成目标图像/点云)+ 再动手(生成动作)。它面对的场景是通用机器人操作——听一句话指令,在真实的三维环境里完成抓取、放置、开抽屉等任务。

所以这一节是想说:机器人在三维世界里干活,却只用 2D 照片当眼睛、还不会想象未来——3D-VLA 就是来补这两个洞的。


3D-VLA — 场景示意:这论文要解决的现实问题
Plate Nº I3D-VLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:2D VLA(RT-2、PaLM-E、OpenVLA) 输入 2D RGB 图像 + 语言,直接输出动作 token。类比:只看照片就下命令。问题:没有 3D 空间理解,遇到"最远的杯子""书后面的杯子"这种需要深度和前后关系的指令就容易错;深度靠模型脑补,不稳。

  • 方案 B:直接映射的 3D 具身模型(3D-LLM、embodied generalist) 能理解 3D 场景,但大多停在"感知 → 动作"的直接映射,学的是"看到什么就做什么"。类比:条件反射式做事。问题:缺乏对"世界动态"的理解——不知道"这个动作会让世界变成什么样",也就无法根据预期结果去规划。

  • 方案 C:把通用视频扩散模型直接搬来预测未来(Runway、DreamLLM 冻结 SD) 想用现成的视频/图像生成模型预测未来帧。问题:这些模型不是为机器人场景设计的——让 Runway 生成"打开抽屉"的未来帧,整个场景视角、纹理、布局全乱了;直接冻结在互联网数据上训的 Stable Diffusion 会输出崩坏结果。

  • 方案 D:3D 基础模型(3D-LLM 系) 能理解和推理当前可见的 3D 场景,但只停在"分析现在",无法"预测超出当前视野的未来状态",更接不上动作输出。

  • 核心难题:怎么把"3D 感知 + 想象未来 + 生成动作"三件事拧进一个统一的具身基础模型?而且——训练它的数据从哪来?现有具身数据集 95% 以上只有 2D 图像/视频,没有 3D 标注。

所以这一节是想说:2D VLA 缺 3D、直接映射的 3D 模型缺"世界模型"、通用扩散模型不适配机器人、且没有 3D 数据——3D-VLA 要同时解掉这四个问题。


这篇论文的新想法

类比:以前的 VLA 像个"看照片就条件反射下命令的人",3D-VLA 把他升级成"有立体视觉、还会在脑子里预演结果的人"。

3D-VLA 的核心判断:人类是靠"世界模型"办事的——先根据 3D 内部表示想象未来会发生什么,再据此规划动作。机器人也应该这样。

它由三个关键设计组成:

  1. 3D 输入 + 交互 token:以 3D-LLM 为骨架(底层是 BLIP2-FlanT5XL),把多视角图像转成 3D 场景特征喂给大语言模型。并往词表里加一批"交互 token":物体 token(框住被操作物体)、位置 token(用 6 个数表示 3D 包围盒 AABB)、场景 token(框住一个静态场景的 embedding)、动作 token(7 自由度机械臂动作离散化)。

  2. 注入目标生成能力(会做梦):先分别预训练两个"具身扩散模型"——RGBD→RGBD(图像+深度)和 point→point(点云→点云),让它们学会"给定初始状态和指令,生成完成后的目标状态"。

  3. 用投影器把 LLM 和扩散模型对齐:加特殊 token(如 <image><pcd>)告诉解码器该输出哪种模态,再用一个基于 Transformer 的 projector 把 LLM 的输出特征映射进扩散模型的空间。用 LoRA 微调扩散模型,避免灾难性遗忘。

  4. 自己造数据:设计一条流水线,从现有机器人数据集里"提炼"出 3D 标注,凑出 2M 条 3D-语言-动作数据对

【旧 2D VLA vs 3D-VLA】

旧 2D VLA(RT-2/OpenVLA):
   2D 照片 + 语言 ──▶ 直接出动作token
   (缺深度、不懂前后遮挡、不会想象未来)

3D-VLA:
   多视角图 ─▶ 3D场景特征 ─▶ 3D-LLM(BLIP2-FlanT5XL骨架)
                              │  词表加"交互token":物体/位置(AABB)/场景/动作
                              │
             ①想象 ──────────┤  具身扩散世界模型
             (RGBD→RGBD, point→point):生成"任务完成后"的目标图/目标点云
                              │
             ②规划 ──────────┘  照着想象的目标 ─▶ 7-DoF 动作

所以这一节是想说:3D-VLA = 3D-LLM 骨架 + 交互 token(表达 3D)+ 具身扩散模型(想象未来)+ 投影器(对齐)+ 自建 2M 3D 数据集。


它分几步做的(方法)

3D-VLA 分"造数据"和"搭模型"两大块。整体流程如下:

      [造数据流水线]
现有机器人/HOI 数据集(多为2D)
   │
   ▼ ZoeDepth 估深度 + RAFT 光流对齐深度一致性
   │
   ▼ 提升为3D点云(相机内外参)
   │
   ▼ spaCy解析指令取名词 → Grounded-SAM出2D掩码 → 抬升成3D框
   │
   ▼ ChatGPT扩写语言模板
   ▼
 2M条 <3D场景, 语言, 动作, 未来目标> 数据

      [模型结构]
多视角图像 → 3D场景特征 ─┐
语言指令 ────────────────┤
交互token(物体/位置/场景/动作)─┼─▶ 3D-LLM(BLIP2-FlanT5XL) ─▶ 动作token
                          │                              │
                          │                              ▼ <image>/<pcd> token
                          │                        Transformer投影器
                          │                              │
                          └────────────────────▶ 具身扩散模型 ─▶ 目标图像/点云

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。Method 是本文最重要的部分,请慢读。

5.1 造数据第一步:给 2D 视频补上深度和点云

类比:老照片没有立体信息,先用 AI 给每张照片"估个深度",再拼成立体模型。

输入:现有具身数据集的视频帧(95% 以上没有 3D 信息),来自 12 个 Open-X 数据集 + Dobb-E、RH20T、RLBench、CALVIN(机器人)+ Epic-Kitchens、HOI4D(人-物交互)。

处理

  • ZoeDepth(一个零样本深度估计器)给每帧估计深度图;
  • RAFT(光流估计)算相邻帧的像素运动。对相机没动的视频段,用光流找出"没动的背景像素",把这些背景的深度图跨帧对齐(每帧深度乘一个系数),保证深度一致性——否则逐帧独立估的深度会跳变;
  • 有了深度图后,用相机内外参把 RGB-D 直接抬升成 3D 点云。

输出:每帧配套的深度图 + 3D 点云。

小结:先用 ZoeDepth+RAFT 把没有 3D 的 2D 视频"补"成带深度、带点云、且深度时序一致的 3D 数据。

5.2 造数据第二步:生成 3D 标注(框、目标、动作)

类比:给立体模型贴标签——框出"要操作的物体",标出"做完后长什么样"。

输入:上一步得到的点云 + 数据集自带的文本指令 + 7 自由度动作。

处理

  • 3D 包围盒:用 spaCy 解析指令,取出所有名词块(含被操作物体);用 Grounded-SAM(开放世界分割模型)得到每个物体的 2D 掩码;把 2D 掩码抬升到 3D 点云,得到 3D 包围盒。选被操作物体时,挑"光流大(在动)+ 置信度高"的那个。
  • 目标状态:因为已经重建了深度和点云,可以直接把未来帧的图像/深度/点云当作"目标(想象结果)"的真值。
  • 动作:直接用数据集提供的 7 DoF 动作。

输出:3D 框、目标图像/深度/点云、动作,全部配齐。

小结:靠 spaCy+Grounded-SAM 自动标 3D 框,用未来帧当"目标"真值,凑齐"想象未来"所需的监督信号。

5.3 造数据第三步:用 ChatGPT 把标注写成多样的语言

类比:把死板的模板句子改写成人话,让模型见过各种问法。

输入:上面生成的所有 3D 标注(框、目标、动作)。

处理:先用预定义模板 + 特殊 token 把标注拼成"提问+回答"对(涵盖任务描述、定位、稠密描述、目标生成、动作预测等六类任务);再用 ChatGPT(GPT-3.5-turbo) 配 2-3 个人工示范,把模板句改写得更多样自然;没有模板的任务直接让 ChatGPT 生成问答。

输出2M 条 3D-语言-动作数据对。

小结:模板打底 + ChatGPT 扩写,把机械的标注变成两百万条多样的训练对话。

5.4 搭模型第一步:3D-LLM 骨架 + 交互 token

类比:给一个会说话的大脑(LLM)装上"看立体"的眼睛,再教它几个专门表达 3D 的新词。

输入:多视角图像、语言指令。

处理

  • 骨架:跟 3D-LLM 一样,用多视角图像特征生成 3D 场景特征,喂进预训练 VLM。因为自建数据集没到训练多模态 LLM 所需的十亿级规模,所以不从头训,而是用 BLIP2-FlanT5XL 当预训练底座。训练时解冻新 token 的输入输出 embedding 和 Q-Former 权重。
  • 交互 token:往词表加四类——(1) 物体 token 框住名词;(2) 位置 token 用 6 个 token 表示 3D 包围盒(AABB 格式,即轴对齐最小/最大角点);(3) 场景 token 框住静态场景 embedding,让模型能处理"3D 场景与文本交错"的输入、理解动态;(4) 动作 token:7 自由度动作离散化成位置/旋转/夹爪开合的离散 token,动作之间用 <ACT_SEP> 隔开。

输出:一个能理解 3D 场景、能吐动作 token 的 3D-LLM。

小结:BLIP2-FlanT5XL 当底座接 3D 特征,再加物体/位置/场景/动作四类交互 token,让 LLM 学会"用语言表达三维世界并输出动作"。

5.5 搭模型第二步:具身扩散模型 + 投影器(会做梦)

类比:先单独训练一个"会画完成态"的画师,再请一个翻译官(投影器)把大脑的想法翻译给画师听。

输入:初始状态(RGBD 或点云)+ 指令;以及 LLM 的输出特征。

处理

  • 预训练具身扩散模型:训两个条件扩散模型——RGBD→RGBD 用 Stable Diffusion V1.4 打底(把 RGB latent 和 depth latent 拼起来当图像条件,在 VAE 潜空间高效生成);point→point 用 Point-E 打底(加点云条件输入)。它们学"根据指令,把初始状态编辑成目标状态"。这一步解决了"通用扩散模型不适配机器人"的问题——用机器人数据专门训。
  • 对齐(投影器):加特殊 token(如 <image><pcd>)告诉解码器输出哪种模态;在这对 token 之间,监督 LLM 生成给机器人执行的指令(可含物体 token、位置 token)。用一个基于 Transformer 的 projector 把 LLM 输出特征和 embedding 映射到扩散模型的空间。用 LoRA(低秩微调,只训极少参数)微调扩散模型避免遗忘;只训新特殊 token 的 embedding、对应输出线性层和整个 projector。总损失 = LLM 损失 + 扩散去噪损失。

输出:给定指令,模型能生成目标图像、目标深度、目标点云(想象出的完成态)。

小结:先用机器人数据把 SD 和 Point-E 训成"会画完成态"的具身扩散模型,再用 projector+LoRA 把它们对齐进 LLM,让 3D-VLA 能一边说话一边做梦。

5.6 为什么"3D + 世界模型"是关键

  • 3D 信息给精确空间:点云直接携带 (x,y,z),模型不用从像素猜深度,"最远的杯子""书后面的杯子"这类空间推理直接可解。
  • 想象目标当中间桥梁:先生成目标图像/点云,等于给长程任务立了个可对齐的"子目标路标"。实验发现"给真值完成态"能提升推理和规划——所以让模型自己学会想象,就等于内化了这个好处。
  • 3D 框当注意力锚点:预测中间 3D 框能让模型聚焦到被操作物体上,目标生成和推理都更准(消融验证,去掉预测框性能下降)。
  • 投影器 + LoRA 保证可训:不从头训扩散模型,而是对齐 + 低秩微调,既省算力又不灾难性遗忘。

小结:3D 管精确空间、想象目标管长程规划、3D 框管聚焦、投影器+LoRA 管高效训练——四者叠起来才是 3D-VLA。


3D-VLA — 方法示意:核心 pipeline
Plate Nº II3D-VLA — 方法示意:核心 pipeline

关键数字(What works)

数字来自原文,重点看"3D + 想象"到底带来多少提升。

数字 1:3D 推理能力(held-in 数据,越高越好)

任务 模型 BLEU-4 ROUGE-L EM@1
Embodied QA BLIP2 FlanT5XL 15.48 38.92 15.35
Embodied QA 3D-VLA 26.80 49.33 24.53
Task Caption BLIP2 FlanT5XL 3.16 26.12 7.75
Task Caption 3D-VLA 34.88 62.01 29.34
What-if QA BLIP2 FlanT5XL 0.06 28.41 5.85
What-if QA 3D-VLA 29.38 52.82 14.7
Dense Caption BLIP2 FlanT5XL 13.96 40.56 13.10
Dense Caption 3D-VLA 34.62 55.91 39.49

关键含义:在所有推理任务上,3D-VLA 全面碾压最强的 2D 基线(同样在机器人数据上训过的 BLIP2 FlanT5XL)。3D 信息 + 定位标注带来的空间理解是主因。

数字 2:3D 定位(held-in,越高越好)

方法 IoU Acc@25 Acc@50
Kosmos-2 (w/ GT Depth) 10.92 12.73 3.85
CoVLM (w/ GT Depth) 19.81 25.39 16.61
3D-VLA 29.33 42.26 27.09

关键含义:即便给 2D 基线灌真值深度,3D-VLA 的定位(IoU 29.33)仍大幅领先——大量 3D 标注让它学到了鲁棒的 3D 定位能力。

数字 3:目标图像生成(Open-X 未见测试集)

方法 PSNR↑ SSIM↑ FID↓
Instruct-P2P(零样本) 14.41 0.389 0.309
SuSIE 15.20 0.549 0.182
NeXT-GPT 8.86 0.153 0.432
Instruct-P2P*(同数据训) 16.67 0.628 0.178
3D-VLA w/o 预测框 17.02 0.632 0.173
3D-VLA 17.21 0.636 0.177

关键含义:即便和"用同样机器人数据训过的 Instruct-P2P*"比,3D-VLA 仍更好;去掉预测的 3D 框会小幅下降,证明中间框有用。

数字 4:目标点云生成 & 动作规划

指标/任务 基线 3D-VLA
点云 P-FID↓ Point-E* 5.241 4.796
点云 Chamfer-L1↓ Point-E* 0.159 0.139
RLBench 放刀 LanCon(His.) 32.2 68
RLBench 拿杯子(未见) 24(有泛化)
CALVIN 连续完成1个 MCIL 28.2 44.7
CALVIN 连续完成3个 MCIL 0.3 8.1

关键含义:点云生成更保真;动作规划上,3D-VLA 用开环控制就超过用了历史观测的 LanCon-Learn;CALVIN 长程任务上远超 MCIL。

所以这一节是想说:数字全面证明——3D + 想象目标让推理、定位、目标生成、动作规划四方面都显著变强。


实验结果说明了什么

问题一:3D 信息真的比 2D 更利于推理吗? 是。所有推理任务上 3D-VLA 都碾压同数据训练的 2D 基线(Embodied QA BLEU-4:26.80 vs 15.48)。原因有二:3D 提供了更准的空间信息;数据集里大量 3D 定位标注让模型学会聚焦关键物体。而且 3D-LLM(没在机器人数据上训)在这些任务上表现很差,说明"收集并训练机器人专属 3D 数据"是必要的。

问题二:"想象目标"这个中间步骤有用吗? 有用。消融显示:去掉预测的 3D 框,目标图像和点云生成质量都会下降(PSNR 17.21→17.02,P-FID 4.796→4.914)。论文还提到"给真值完成态能提升推理和规划"——所以让模型学会自己想象目标,等于内化了这个增益。它给长程任务提供了可对齐的子目标。

问题三:为什么要自己训扩散模型,不用现成的? 因为现成的不适配。让 Runway 生成"打开抽屉"的未来帧会导致整个场景视角/纹理/布局崩坏;直接冻结互联网上训的 SD(DreamLLM 做法)会输出崩溃结果。用机器人数据专门训 RGBD→RGBD 和 point→point 扩散模型后,生成的目标能"保持背景不变、只精准改变目标物体状态"。

问题四:动作规划上的表现说明什么? 说明"想象目标 + 定位物体"能提供丰富信息帮助推断动作。RLBench 上 3D-VLA 只用开环控制就超过用了历史观测和物体状态的 LanCon-Learn(放刀 68 vs 32.2),还能泛化到未见的拿杯子任务(24)。CALVIN 长程上远超 MCIL。

所以这一节是想说:实验系统回答了四个问题——3D 利于推理、想象目标有实效、专训扩散模型必要、想象+定位显著帮助动作规划。


你应该懂的几个新词

VLA(视觉-语言-动作模型):输入图像+语言、输出机器人动作的模型,如 RT-2、OpenVLA。3D-VLA 是它的 3D + 世界模型升级版。

世界模型(world model):能"想象/预测未来状态"的内部模型。人类靠它先设想结果再行动。3D-VLA 的核心特征。

点云(point cloud):一堆带 (x,y,z) 坐标的 3D 点,直接表达几何。3D-VLA 的输入之一。

token(词元):LLM 眼里的"词"。图像、点云、动作都得先翻译成 token 才能被 LLM 处理。

交互 token:3D-VLA 新加的一批专用 token——物体、位置(3D 框)、场景、动作,让 LLM 能用语言表达三维世界。

AABB(轴对齐包围盒):用最小角点和最大角点两个 3D 坐标(共 6 个数)表示的立体框。

扩散模型(diffusion model):从噪声一步步去噪生成图像/点云的生成模型。3D-VLA 用它来"想象目标"。

LoRA(低秩适配):只训练少量额外低秩参数来微调大模型,省算力、防遗忘。3D-VLA 用它微调扩散模型。

投影器(projector):把 LLM 的输出特征映射到扩散模型输入空间的"翻译官",本文用 Transformer 实现。

BLIP2-FlanT5XL:3D-VLA 的预训练底座,一个视觉-语言模型。

ZoeDepth / RAFT / Grounded-SAM:分别是深度估计、光流、开放世界分割模型,是造 3D 数据流水线的三个"零件"。

所以这一节是想说:这十来个词是读任何"3D + 世界模型 + VLA"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 依赖估计的深度,误差会累积:训练用 ZoeDepth 估的深度(因为原数据没有真深度),估计误差会污染点云和 3D 框,进而影响下游。真值深度场景下才是上限。
  • 数据流水线易出错:Grounded-SAM 在复杂场景可能检错物体位置,所以论文特意"过滤掉复杂场景数据集"——意味着当前方法对杂乱场景不鲁棒。
  • 开环控制,长程仍脆弱:动作预测用开环控制,CALVIN 连续完成 5 个任务仍是 0——长程闭环执行还没解决。
  • 仿真/受限环境为主:动作规划在 RLBench、CALVIN 仿真上评测,真机大规模验证有限;论文自己在 Impact Statement 里说需先仿真训练再人监督部署。
  • 算力门槛高:预训练用 6×32 张 V100、对齐用 6×64 张 V100,复现成本很高。
  • 想象未必总对:扩散模型生成的目标可能有偏差,错误的想象会误导规划,且模型对"想象不确定性"没有显式建模。

所以这一节是想说:3D-VLA 打通了 3D+想象+动作,但受限于估计深度的误差、数据流水线的脆弱、开环长程、算力门槛这些现实问题。


它和别的论文是什么关系

  • 上游(被它借用)
    • 3D-LLM(Hong et al. 2023):3D-VLA 的骨架,提供"多视角特征→3D 场景特征→喂进 VLM"的思路。
    • BLIP2(Li et al. 2023):预训练底座 FlanT5XL 版。
    • Stable Diffusion / Point-E:目标图像、目标点云生成的扩散模型底座。
    • LoRA:高效微调扩散模型。
    • ZoeDepth / RAFT / Grounded-SAM / spaCy:造 3D 数据流水线的工具链。
  • 对比关系
    • RT-2 / PaLM-E / OpenVLA:那些是 2D VLA,直接感知→动作;3D-VLA 加了 3D 和世界模型。
    • 3D-LLM / embodied generalist:那些做 3D 感知但只"分析现在"、直接映射动作;3D-VLA 会"想象未来"。
    • SuSIE / Instruct-P2P / NeXT-GPT:目标图像生成的对比基线,3D-VLA 生成质量更好。
  • 下游 / 同族:3D-VLA 属于"世界模型 + 具身智能"这条线,和本仓库的 world-model 章节、以及后续的生成式规划工作同族。它和 dp3(3D Diffusion Policy)都强调"3D 表示对机器人的价值",但 dp3 是纯控制策略,3D-VLA 是带推理+生成的大模型。

所以这一节是想说:3D-VLA 站在 3D-LLM + BLIP2 + SD/Point-E + LoRA 的肩膀上,把"2D VLA"升级成"会看立体、会想象未来的世界模型"。


和本导读的关系

本笔记对应导读 Ch12:OpenVLA / VLAs / MLA 关于 VLA 演进的部分,也与 Ch15:世界模型 强相关。

导读 Ch12 讲了 VLA 的主线:RT-1(动作 token 化)→ RT-2(借 VLM 网络知识)→ OpenVLA(开源)。3D-VLA 是这条线上的一个"分叉与升级"——它指出了 2D VLA 的两个盲点(缺 3D、缺世界模型),并给出解法。读完本笔记,建议:先回看 rt-2 / openvla 笔记理解"2D VLA 怎么把动作当语言输出",再看 Ch15 世界模型章节理解"想象未来"这一支的整体脉络(如 Genie、Cosmos)。三者连起来,就能看清"从直接映射动作 → 借世界模型先想象再规划"的思想跃迁。

所以这一节是想说:本笔记是导读 Ch12/Ch15 交叉处的深度展开,读前先懂 2D VLA,读后接世界模型章节。


思考题

以下问题检验你是否真正理解了 3D-VLA 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么 2D VLA 遇到"把最远的杯子放进中间抽屉"这种指令会容易出错,而 3D-VLA 能解?

提示

因为"最远"是一个深度/空间关系概念。2D 图像把三维拍平了,"最远"在像素里没有直接对应——模型得从遮挡、大小、透视等线索间接猜深度,很不稳。3D-VLA 直接拿到点云 (x,y,z),"最远"就是 z 坐标最大的那个,一目了然。加上它有大量 3D 定位标注训练,能准确框出被指物体。所以涉及深度、前后、远近的空间推理,3D 表示有本质优势。

Q2:3D-VLA 为什么要"先想象目标图像/点云,再规划动作",而不是像 RT-2 那样直接出动作?多这一步的好处是什么?

提示

这是"世界模型"思想。直接映射(感知→动作)学的是条件反射,没有对"这个动作会让世界变成什么样"的理解,长程任务里容易迷失。先想象目标态,等于给任务立了个明确的"路标":动作只要朝着这个想象的完成态推进就行,长程任务可以被分解成"到达一系列子目标"。论文也验证了给真值完成态能提升推理和规划——想象目标把这个增益内化进模型。代价是想象可能出错,会误导规划。

Q3:论文为什么不直接用现成的视频扩散模型(如 Runway)来预测未来,而要自己训 RGBD→RGBD 和 point→point 扩散模型?

提示

因为通用扩散模型不适配机器人场景。让 Runway 生成"打开抽屉"的未来帧,它会大改整个场景——视角变了、物体变形、纹理乱换、布局扭曲;DreamLLM 那种直接冻结互联网上训的 SD 会输出崩坏结果。机器人任务需要的是"背景基本不变、只精准改变被操作物体的状态"。所以必须用机器人数据专门训练具身扩散模型,让它学会这种"局部编辑"式的目标生成。

Q4:3D-VLA 的训练数据是"造"出来的(2M 条)。这条造数据流水线有哪些潜在风险?

提示

主要风险来自流水线每一环的误差累积:(1) 深度是 ZoeDepth 估的(原数据没有真深度),估计误差直接污染点云和 3D 框;(2) RAFT 光流对齐深度一致性,光流错了深度就跳变;(3) Grounded-SAM 在复杂场景可能分割错物体——所以论文特意过滤掉复杂场景数据集,这也暴露了方法对杂乱场景不鲁棒;(4) ChatGPT 扩写语言可能引入幻觉或不准确的描述。这些误差会一路传到最终模型。

Q5:3D-VLA 用 projector + LoRA 把 LLM 和扩散模型对齐,而不是端到端从头训。这个设计的动机和权衡是什么?

提示

动机:从头训一个能生成多模态的具身基础模型需要十亿级数据,而自建数据集只有百万级,规模不够。所以复用预训练组件(BLIP2 底座、SD/Point-E 扩散模型),只训"接口"——新 token embedding、输出线性层、projector,扩散模型用 LoRA 低秩微调。权衡:好处是省算力、防灾难性遗忘、能快速把多个模态的解码器接进来;代价是各组件是分阶段对齐而非完全端到端联合优化,可能不如从头训的联合最优,且性能受预训练组件质量约束。

Q6:3D-VLA 在 CALVIN 上"连续完成 5 个任务"仍是 0。这暴露了什么根本问题?你会怎么改进?

提示

暴露的是长程闭环执行的脆弱性。当前动作预测用开环控制(预测一串动作直接执行,不根据执行后的真实观测调整),误差会随任务链累积——第一个任务的小误差会让后续任务的初始状态偏离,越往后越崩。改进方向:(1) 改成闭环——每步/每个子目标后重新观测、重新规划;(2) 用想象的目标态做反馈,检测"是否达到子目标"再决定下一步;(3) 引入失败恢复机制;(4) 更好的低层动作控制器(当前动作是离散 token,精度有限)。核心是把"想象目标"和"闭环反馈"真正连起来。

Q7:3D-VLA 把动作表示成离散 token(位置/旋转/夹爪离散化)。这种动作表示有什么局限?和扩散策略(如 dp3)的连续动作生成相比如何?

提示

离散 token 动作的局限:(1) 精度受量化粒度限制,把连续的位置/旋转切成有限的桶,细腻操作会损失精度;(2) 桶太多则词表爆炸、难学,桶太少则动作粗糙;(3) 相邻动作在离散空间可能不连续,轨迹不够平滑。扩散策略(dp3、Diffusion Policy)直接在连续空间生成动作序列,能表达多模态动作分布、轨迹平滑、精度高,特别适合灵巧连续控制。但离散 token 的好处是能无缝复用 LLM 的自回归生成框架,和语言/推理统一在一个模型里——这正是 3D-VLA 选它的原因(它要的是"统一的世界模型",不是纯控制策略)。两者是"统一多模态 vs 专精控制"的取舍。

所以这一节是想说:能回答这 7 题,你就真正理解了 3D-VLA 为什么用 3D 点云、为什么先想象目标、为什么自训扩散模型、以及它的数据流水线和动作表示的取舍。


一些好奇心问答(FAQ)

Q1:3D-VLA 和 RT-2 到底差在哪? 两处。眼睛:RT-2 看 2D 图像,3D-VLA 看 3D 点云。大脑:RT-2 直接"感知→动作",3D-VLA 多了个"先想象目标态再规划"的世界模型环节。

Q2:它真的能在真机上用吗? 论文主要在 held-in 数据和 RLBench、CALVIN 仿真上评测,也在互联网/日常场景的图片上测了目标生成的鲁棒性。Impact Statement 明确说部署需"先仿真训练、再真机人监督",真机大规模验证仍有限。

Q3:2M 数据是人工标的吗? 不是。是用流水线自动"造"的——ZoeDepth 补深度、RAFT 对齐、Grounded-SAM 分割出 3D 框、未来帧当目标真值、ChatGPT 扩写语言。只用了少量人工示范引导 ChatGPT。

Q4:为什么用 BLIP2-FlanT5XL 而不用 3D-LLM 的预训练权重? 因为 3D-LLM 的训练数据主要是物体和室内场景,和机器人具身场景不对齐。所以借 3D-LLM 的方法(多视角特征→3D 特征),但底座用 BLIP2-FlanT5XL,不加载 3D-LLM 权重。

Q5:想象出来的目标图像准吗? 在测试集和互联网场景上,生成的目标能保持背景不变、精准改变目标物体状态,视觉和语义都接近真值(PSNR 17.21、SSIM 0.636)。但仍是生成结果,可能有偏差。

Q6:为什么预测中间 3D 框能帮上忙? 3D 框像"注意力锚点",让模型聚焦到被操作物体上,从而更好理解整个场景、把注意力分给指令提到的物体,最终目标生成和推理都更准。消融证明去掉它性能会降。

所以这一节是想说:3D-VLA 的实操问题(与 RT-2 区别、真机、数据来源、底座选择、想象质量、3D 框作用)都有明确答案。


如果你想再深入

按"必读前置 → 骨架来源 → 生成组件 → 同族"排序:

  1. 必读前置:RT-2 / OpenVLA — 理解 2D VLA 怎么把动作当语言 token 输出,本仓库有相关笔记。
  2. 骨架来源:3D-LLM(Hong et al. 2023) — 3D-VLA 的直接前身,理解"多视角特征→3D 场景特征→喂进 LLM"。
  3. 底座:BLIP2(Li et al. 2023) — 视觉-语言预训练底座,本仓库导读 Ch09 有讲。
  4. 生成组件:Stable Diffusion / Point-E — 目标图像、目标点云生成的扩散模型基础。
  5. 同族对比:dp3(3D Diffusion Policy) — 同样强调 3D 表示,但是纯控制策略,本仓库有深读笔记,对照能看出"统一世界模型 vs 专精控制"的取舍。
  6. 世界模型线:Genie / Cosmos — 理解"想象未来"这一支的整体脉络,本仓库有相关笔记。

所以这一节是想说:把 RT-2 + 3D-LLM + BLIP2 + dp3 连起来读,就能看清"2D VLA → 3D 世界模型 VLA"的完整技术脉络。


原文信息

BibTeX

@inproceedings{zhen20243dvla,
  title     = {3D-VLA: A 3D Vision-Language-Action Generative World Model},
  author    = {Zhen, Haoyu and Qiu, Xiaowen and Chen, Peihao and Yang, Jincheng and Yan, Xin and Du, Yilun and Hong, Yining and Gan, Chuang},
  booktitle = {Proceedings of the International Conference on Machine Learning (ICML)},
  year      = {2024}
}

链接

所以这一节是想说:这是 Zhen et al. 2024 年发表在 ICML 的工作,用"3D 点云 + 具身扩散模型 + 交互 token"把 VLA 升级成会看立体、会想象未来的生成式世界模型。

引用本笔记 / Cite this note
BibTeX
@online{eai_3d_vla_2026,
  title       = {(readable note) 3D-VLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/3d-vla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?