Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 4

OpenVLA: An Open-Source Vision-Language-Action Model

20 min read · 6938 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI / 机器人"的读者写的精读笔记。所有专业词第一次出现都会解释清楚。只看这份笔记就能理解全文机制。

一句话讲什么(TL;DR)

把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。

所以这一节是想说:它是第一个全开源、能跑在消费级显卡上、效果还能打过闭源大哥的 VLA 模型。


这是个什么场景

想一下你早上出门前的桌面:钥匙、橡皮、水杯、耳机散一桌。你懒得动手,对旁边的机械臂喊一句"把橡皮放进笔筒"——摄像头一闪,它就从一堆杂物里挑出橡皮,伸过去,松手放进笔筒。

听起来像电影,但要让它真的发生,这只机械臂得同时搞定三件事:

  • :从摄像头里的一坨像素中分辨出"橡皮在左下、笔筒在右上"
  • :听懂"把橡皮放进笔筒"——不是"扔掉橡皮"也不是"拿走笔筒"
  • :在内部算清楚"右手往左前 12cm,下降 3cm,夹爪开 2cm",然后真的执行

如果把这三件事分给三个 AI 接力(像 SayCan 那样),每一步都会丢信息。所以人们想:能不能把这三件事塞进同一个 AI

这就是 VLA(Vision-Language-Action)——一个端到端模型,输入是"一张图 + 一句指令",输出是"机械臂下一步怎么动"。

类比:像一个开车的司机——眼睛盯路、耳朵听导航、脚踩油门,三件事在同一个大脑里同步完成。不是后排坐三个人轮流喊"前面有车!""左转!""踩刹车!"。

OpenVLA 整体形态
Plate Nº IOpenVLA 整体形态

所以这一节是想说:VLA 要把看、听、动三件事压进一个 AI,不再分模块接力。OpenVLA 是第一个做到这件事的开源模型。


OpenVLA — 场景示意:这论文要解决的现实问题
Plate Nº IIOpenVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

OpenVLA 之前,"让机械臂跟着语言指令动手"主要有三条技术路线,每条都有问题:

路线 A:模块化流水线(SayCan、Code-as-Policies)

做法:LLM 负责"想",视觉模型负责"看",控制器负责"动"——三个模块接力。

问题:模块之间信息传递不完整。LLM 说"拿起海绵",但它不知道海绵在哪个角度、有多滑、机器人手够不够长。每个模块各自为战,整体脆弱。

路线 B:从零训练的小策略(RT-1-X、Octo)

做法:不借助互联网预训练知识,直接在机器人数据上训一个 35M~93M 参数的小网络。

问题:模型太小,泛化能力差——换个背景、换个物体颜色,就不认识了。它没见过互联网上海量的物体图片,所以对"没训练过的东西"几乎无能为力。

路线 C:闭源大 VLA(RT-2-X,55B)

做法:用超大 VLM(PaLI-X,55B 参数)在 Google 内部的机器人数据上微调。效果最好。

问题三座大山:

  • 闭源不开放:权重不公开,代码不公开,API 都没有。
  • 太大跑不动:55B 参数需要多张高端 GPU,普通实验室根本承受不起。
  • 没有微调指南:你换了机器人型号,完全不知道怎么适配。

端到端(end-to-end):一个 AI 直接从原始输入到最终输出,中间没有人为切分的模块。和"模块化流水线"是两种路线。

泛化(generalization):模型能处理训练时没见过的新情况——比如新背景、新物体、新指令。

OpenVLA 的目标很明确:做一个开源、7B 参数(比 RT-2-X 小 7 倍)、普通显卡能跑、效果还要赢的 VLA

所以这一节是想说:之前最强的方案太大太贵不开源,普通研究者只能远观。OpenVLA 要把门槛拉低一个量级。


这篇论文的新想法

核心思路一句话:把"机械臂动作"伪装成"几个单词",让一个原本只会看图说话的 AI,顺手就把"该往哪儿动"也"说"出来。

类比:你有个朋友超会写日记(预训练 VLM)。你不想从零教一个新人,于是跟他说:"以后'右手抬 5cm'就当成是你日记里的一个生僻字(token),照着规则写出来就行。" 他会写字这件事不用重学——只需要学会用这套新"字"。

为什么要这么绕?因为:

  1. 从零造一个"看图 + 听话 + 动手"的 AI 太贵(需要 Internet-scale 的预训练)
  2. 但世界上已经有成千上万个"看图说话"的现成 AI
  3. 能复用就别重造——站在 VLM 的肩膀上,只教它一件新事:怎么输出动作

所以这一节是想说:不从零造,把动作翻译成单词,让现成 VLM 顺手生成动作。这是 VLA 范式的核心 insight。


它分几步做的(方法)

整个方法可以拆成 5 个清晰的步骤。

OpenVLA 内部三段式架构
Plate Nº IIIOpenVLA 内部三段式架构

1. 用一个"会看图说话"的 AI 当起点(VLM Backbone)

类比:你想训练一只会看导盲提示走路的狗。与其从一只什么都不懂的小狗教起,不如先找一只已经会"看 + 听人话"的狗,再教它走路——能省掉 99% 的基础教育。

输入:无(这是选择起点的架构决策)

处理:选择 Prismatic-7B 作为骨架——它是一个已经训练好的"看图说话 AI"(VLM),由三个零件组成:

零件 名字 功能 参数量
两只眼睛 DINOv2 + SigLIP 把图片变成数字摘要 600M
翻译官 2-layer MLP 把图的数字翻译成语言模型能听懂的格式 很小
大脑 Llama 2 7B 接收图+文字,输出下一个 token 7B

为什么要两只眼睛而不是一只?

  • DINOv2:擅长"看空间位置和形状"——物体在哪、边缘在哪、离多远。类比:一个会量尺寸的测量师。
  • SigLIP:擅长"看这是什么东西"——杯子还是碗、红色还是蓝色。类比:一个会认名字的分类员。
  • 机器人两样都需要——既要认得"这是杯子",又要量出"夹爪离杯子边 3mm"。用一只眼睛只能做一件事。

实验验证:Prismatic(双眼)比 LLaVA(单眼)在多物体语言定位任务上高 10% 成功率。

输出:一个已经会"看图 + 理解文字"的 7B 模型,等着被教"怎么输出动作"。

VLM(Vision-Language Model):看图说话 AI。输入图 + 文字提问,输出文字回答。和 VLA 的区别是:VLM 只输出文字,VLA 还能输出动作。

预训练(pretraining):在海量数据上训练模型获得通用能力的阶段。类比:上大学拿通识教育。之后针对特定任务再训叫"微调"(fine-tuning),类比:工作后考专业证书。

所以这一节是想说:不从零开始,拿一个已经会看图说话的 AI 当地基——双眼设计让它既认物体又量距离。


2. 把动作切成 256 档,伪装成"单词"(Action Tokenization)

类比:音量旋钮原本是连续旋转的(任何角度都行)。现在改成 256 个按键档位,每按一档对应一个角度。再把这 256 个档位起 256 个奇怪的名字(像字典里不常用的生僻字),塞进 AI 的词典。这样会写字的人就也能"按按钮"了。

输入:机械臂的连续动作数值(比如"右移 0.03m、下降 0.02m、夹爪关合度 0.8")

处理

  1. 机械臂每一步要决定 7 个数字:x/y/z 三轴平移 + 绕三个轴旋转 + 夹爪开合。
  2. 看一遍全部训练数据,找到每个维度"第 1 百分位到第 99 百分位"的范围(去掉极端异常值)。
  3. 把每个维度的范围均匀切成 256 段。任何一个连续数值落在哪一段,就编号为 0~255 的整数。
  4. 在 Llama 2 的词典里挑 256 个最不常用的 token(词典最后 256 个位置),用来代表这 256 档动作。
  5. 这样,一个 7 维动作就变成了 7 个"生僻词 token"的序列。

输出:每个动作变成 7 个离散 token,可以像普通文字一样被 LLM "续写"出来。

关键设计选择

  • 为什么用 256 档而不是更多?256 = 2^8,计算效率高。精度约 0.04mm 级别,对桌面操作足够。
  • 为什么用百分位而不是 min-max?避免极端异常值把范围撑得太大导致有效精度下降。
  • 为什么要"抢占"词典中的生僻位置?因为 Llama tokenizer 只预留了 100 个 special token,不够 256 个。直接覆盖最不常用的 token 是最简单的方案。

离散化(discretization):把连续的数变成有限个档位的整数。类比:把温度从"任意小数"改成 256 档刻度。

token(词元):AI 把文字/图/动作切成的"最小单元",每个单元在词典里有一个编号。类比:英文里的"单词"。

所以这一节是想说:把动作翻译成"单词"是 VLA 的关键 trick——旧 AI 的 70 亿参数全都能继续派上用场,不用从零学。


3. 拿 97 万段机器人视频喂它(Training Data)

970k 训练数据
Plate Nº IV970k 训练数据

类比:教一个司机能应对各种路况,最快办法是给他看全国各地的行车记录仪视频——但前提是先把不同摄像头、不同车型的视频统一成同样格式。

输入:Open X-Embodiment 数据集(70+ 个机器人数据集合并成的统一格式大集合,超过 200 万条轨迹)

处理

  1. 筛选:只留"单臂 + 至少一个第三人称摄像头 + 末端执行器控制"的数据。双臂的、视角太怪的、非标准控制的全扔掉。
  2. 加权采样:借用 Octo 团队设计的混合权重——多样性高的数据集多采,重复无聊的少采。
  3. 清洗:过滤掉"机械臂没动但还在录"的废帧(全零动作帧)。
  4. 移除问题数据:DROID 数据集的 action token accuracy 始终很低,训练最后 1/3 时直接剔除它。

输出:97 万条清洁的机械臂操作轨迹,覆盖多种机器人型号、多种桌面物体、多种任务。

关键数字

属性 数值
总轨迹数 ~970,000
机器人类型 多种(WidowX、Franka、Google Robot 等)
数据来源 Open X-Embodiment 子集
对比 RT-2-X 训练数据 970K vs 350K(OpenVLA 多 2.8 倍)

Open X-Embodiment(OpenX):机器人界的"ImageNet"——70+ 个数据集合并成的统一格式。"Embodiment" = "身体",不同身体(不同型号机器人)的数据放一起。

轨迹(trajectory/episode):一次完整的机器人操作录像——从任务开始到结束的一系列帧。

所以这一节是想说:用全网最大的开源机器人数据集训练,但关键在筛选和清洗——数据干净比数据多更重要。


4. 反直觉的训练配方(Training Recipe)

类比:常规做法是"找一个外语很好的同事帮你看图,你不动他的外语能力(冻住眼睛),只让他学看图答题"。但机器人场景不一样——他原来认得"杯子"是从淘宝商品图认的,不知道杯子从机械臂的斜上方第三人称视角看长什么样。所以得让他重新练眼睛

五个反直觉的决定

决定 常规做法 OpenVLA 做法 原因
视觉编码器 冻住不动 解冻一起训 机器人视角与互联网图差异大,需要适应
训练轮数 1~2 epoch 27 epoch 机器人数据远少于语言/图文数据,要多看几遍
学习率 warmup + decay 固定 2e-5 实验发现不需要 warmup
图片分辨率 越高越好(384px) 224×224 VLA 场景下高分辨率没提升,还贵 3 倍
Action loss 全 token loss 只算 action token 的 loss 让模型专注学动作预测

算力账单

  • 硬件:64 张 A100 GPU
  • 时间:14 天
  • 总计:21,500 A100-hours ≈ 3~6 万美元
  • Batch size:2048

epoch:把整本练习册从头到尾过一遍。27 epoch = 同一批数据看了 27 遍。

学习率(learning rate):每次调整模型参数时的"步子大小"。太大会跳过最优点,太小会走太慢。

loss(损失):模型的"扣分"——预测动作和真实动作之间的差距。训练目标就是让 loss 越来越小。

所以这一节是想说:解冻眼睛、训 27 遍、224px 就够——全是违反 VLM 常识但对 VLA 有效的工程秘方。


5. 让普通人也能玩:LoRA + 量化(Efficient Fine-tuning & Inference)

类比:LoRA 像给西装只换领口和袖口——主体不动,几个小补丁适配新场景。量化像把高清照片压成朋友圈小图——肉眼几乎一样但文件小一半。

LoRA 微调

  • 冻住 7B 主网络全部参数
  • 只训练几个极小的"补丁矩阵"(rank=32,占总参数的 1.4%)
  • 效果:几乎追平全量微调(差 2% 以内)
  • 显存需求:从 >200GB 降到 60GB(单卡 A100 可做)
  • 新任务适配:10150 段演示视频 + 单卡 515 小时

量化推理

  • 4-bit 量化后显存从 15GB 降到 ~7GB
  • RTX 4070(12GB)就能跑
  • 下游任务成功率几乎不掉

推理速度

硬件 速度
RTX 4090 ~6 Hz
A100 ~8 Hz
4-bit 量化 4070 ~4 Hz

LoRA(Low-Rank Adaptation):训练时主网络冻住,只训练几个很小的"补丁矩阵"。改完只多几百万参数,存盘只多几十 MB。

量化(quantization):把每个参数的存储精度降低(如 16-bit → 4-bit),省内存。类比:1080p 视频压成 480p。

所以这一节是想说:靠 LoRA + 4-bit 量化,从"公司级基建"降到"学生宿舍能玩"——这是 OpenVLA 民主化 VLA 的关键。


OpenVLA — 方法示意:核心 pipeline
Plate Nº VOpenVLA — 方法示意:核心 pipeline

关键数字(What works)

所有数字来自真实物理机械臂评测(不是仿真)。

BridgeData V2 测评结果
Plate Nº VIBridgeData V2 测评结果
评测 OpenVLA (7B) RT-2-X (55B) Octo (93M) RT-1-X (35M)
BridgeData V2 平均(17 任务) 70.6% 50.6% 24.7% 18.8%
Google Robot(12 任务) 85.0% 78.3% 49.2%
语义泛化(新概念) 60% 80%
语言定位(多物体选正确的) 83% 67%

最有冲击力的数字

  1. 小 7 倍却赢 16.5 个百分点:OpenVLA 7B 比 RT-2-X 55B 在 29 个任务上平均成功率高 16.5%(绝对值)。证明 VLA 不是"越大越好"——数据质量 + 骨架设计 + 训练配方比盲目堆参数重要。

  2. 微调后碾压 Diffusion Policy:在 7 个新任务上 LoRA 微调后的 OpenVLA 比从零训练的 Diffusion Policy 高 20.4%。证明"预训练→微调"范式对机器人和对语言模型一样有效。

  3. LoRA 只用 1.4% 参数追平全量微调:参数效率惊人。意味着任何人只要有一张 A100 就能做自己的机器人策略。

  4. OpenVLA 是唯一"全科及格"的方法:在 7 个微调任务中全部 ≥50% 成功率。其他方法总有一两个任务彻底崩盘。

  5. 224px 就够:把分辨率从 224 提到 384,训练慢 3 倍但成功率不涨。说明 VLA 当前的瓶颈不在视觉分辨率。

所以这一节是想说:用 1/7 的参数 + 全开源 + 消费级显卡,在真机器人上全面超越闭源大哥——数据和配方比参数量重要。


实验结果说明了什么

从数字中提炼五条核心结论:

结论 1:互联网预训练对机器人至关重要。

OpenVLA(有互联网预训练)比 Octo(无互联网预训练)高 46 个百分点(70.6% vs 24.7%)。证明 VLM 从互联网学到的"物体长什么样""语言什么意思"可以直接迁移到机器人领域。

结论 2:VLA 不是越大越好,配方比尺寸重要。

7B 打赢 55B——差距来自:(1) 更大更干净的训练数据(970K vs 350K);(2) 双视觉编码器提供空间+语义特征;(3) 解冻视觉编码器让模型适应机器人视角。

结论 3:"预训练→微调"范式对机器人有效。

10~150 段演示就能让 OpenVLA 适应全新机器人 + 全新任务,比从零训练的 Diffusion Policy 高 20%。这意味着 VLA 可以像语言模型一样"下载→微调→部署"。

结论 4:唯一输的地方是语义泛化。

RT-2-X 在"看到训练时没见过的概念"(如识别 Taylor Swift)上更强(80% vs 60%),因为它在微调时保留了更多互联网知识(co-fine-tuning with internet data)。OpenVLA 纯用机器人数据微调,有些互联网知识被覆盖了。

结论 5:开源降低了整个领域的门槛。

OpenVLA 发布后 18 个月内,出现了 OpenVLA-OFT、RDT-1B、π0 等十余个后续工作——全部以 OpenVLA 为 baseline 或起点。这验证了开源对加速科研的价值。

所以这一节是想说:核心 takeaway 是"预训练知识 + 好数据 + 好配方 > 盲目堆参数",以及开源对整个领域的催化作用。


你应该懂的几个新词

VLA(Vision-Language-Action):输入图 + 文字指令,输出机械臂动作的端到端 AI。类比:边看路边听导航边踩油门的司机大脑。

VLM(Vision-Language Model):会看图说话但不会动手的 AI。VLA 是 VLM 的"动手版"。

离散化(discretization):把连续数值切成有限个档位。核心 trick——把动作变成"单词"。

token:AI 的最小处理单元。文字被切成 token,图被切成 patch token,动作被切成 action token。

LoRA:冻住主网络只训小补丁。从"8 卡 A100"降到"单卡 A100"的关键技术。

量化(quantization):降低参数精度省内存。从 15GB 降到 7GB 的关键技术。

Open X-Embodiment:机器人界的 ImageNet——70+ 个数据集合并的统一格式。

Prismatic-7B:OpenVLA 的骨架 VLM。特点是双视觉编码器(DINOv2 + SigLIP)。

DINOv2:Meta 的自监督视觉模型,擅长空间几何理解。

SigLIP:Google 的对比学习视觉模型,擅长语义识别。

端到端(end-to-end):一个模型从原始输入直接到最终输出。和"模块化分段处理"对应。

灾难性遗忘(catastrophic forgetting):学新任务时把旧知识忘了。OpenVLA 微调后语义泛化下降就是这个问题。

所以这一节是想说:掌握这些词就有了理解 VLA 论文的入场券。


它有什么搞不定的

  1. 只看当前一帧:它一次只看一张图,不会"回看一秒前手在哪"。需要观察变化的任务(倒水到八分满、拧螺丝到某个角度)就吃力。后续的 π0 通过 action chunking 部分缓解。

  2. 速度不够快:6 Hz = 每秒 6 次动作。穿针(需要 50+ Hz)、剥鸡蛋(需要快速反应)做不了。后续 OpenVLA-OFT 通过并行解码提到 30 Hz。

  3. 可靠性不够工业级:多数任务 7090% 成功率,意味着 10 次坏 13 次。演示够用,工厂部署差一截。

  4. 环状/透明/反光物体是盲区:白色胶带、玻璃杯、镜面——模型常把夹爪伸进洞里抓空。这是视觉编码器在互联网数据中对这类物体见得少导致的。

  5. 微调时会"忘旧知识"(灾难性遗忘):训完机器人任务后,识别 Taylor Swift 的能力下降。导致语义泛化不如 RT-2-X。

  6. 动作表示精度有限:256 档离散化在高精度任务(如 sub-mm 装配)上可能不够。后续 π0 转向连续动作输出。

  7. 不支持双臂:训练数据筛选时去掉了双臂数据。需要双手协作的任务不行。

所以这一节是想说:单帧、慢速、精度受限、遗忘——这四个是 OpenVLA 后续工作(π0、OFT、RDT)分别瞄准的靶子。


它和别的几篇是什么关系

家族树

[互联网预训练基座]
 CLIP → LLaVA → Prismatic-7B(VLM 骨架)
                       ↓ 加上动作 token
[闭源大哥]           OpenVLA (7B, 开源)  ←→ [对比路线] Diffusion Policy
RT-2 → RT-2-X (55B)      ↓                              (连续动作,不用 token)
                    [后续改进]
              OpenVLA-OFT / π0 / RDT-1B

与 SayCan 的关系(本导读前一篇):

SayCan 是"模块化"路线的代表——LLM 负责规划,value function 负责接地,执行策略负责动作。OpenVLA 是"端到端"路线的代表——一个模型从像素直接到动作。OpenVLA 的存在证明了:如果 VLM 够大够好,可以不需要 SayCan 那种分段式架构。

与 VLAs / MLA 的关系(本导读下两篇):

  • VLAs (Embodied AI Survey):综述了整个 VLA 范式的发展,OpenVLA 是其中"autoregressive token-based VLA"的代表案例
  • MLA (Manipulate-Anything):一种不需要大规模预训练的替代路线,用小模型 + 更多结构化先验来做操作

与 RT-2-X 的对比

维度 OpenVLA RT-2-X
参数 7B 55B
开源 全开源 完全闭源
数据量 970K 350K
视觉编码器 DINOv2+SigLIP PaLI-X 自带
微调支持 LoRA + 量化
语义泛化 较弱 更强
其他泛化 更强 较弱

因果关系

  • LLaVA 证明"简单的投影层就能连接视觉和语言" → Prismatic 把它做成双眼版 → OpenVLA 在其上加动作 token
  • RT-2 首创"动作当 token"范式 → OpenVLA 用更小模型 + 更多数据 + 开源复现了这条路
  • OpenVLA 发布 → 催生 10+ 后续工作(π0、OFT、RDT)→ 定义了 2024~2025 年 VLA 研究范式

所以这一节是想说:OpenVLA = Prismatic VLM + RT-2 的 token 化思路 + OpenX 大数据 + 全开源,是开源 VLA 的"标准答案"。


和本导读的关系

本篇对应 Ch12: 开源 VLA——OpenVLA / VLAs 综述 / MLA

Ch12 将 OpenVLA 与 VLAs 综述和 MLA 三篇并列讲解,重点是"VLA 范式有哪些变体"。OpenVLA 是 autoregressive token-based VLA 的标杆;VLAs 综述提供全景视角;MLA 展示了不需要大规模预训练的替代路线。

三篇的关系:OpenVLA 代表"大预训练→微调"主流路线,MLA 代表"小模型+结构化先验"路线,VLAs 综述把两条路线和其他变体(如 diffusion-based VLA)统一到一个框架下分析。

所以这一节是想说:读完 OpenVLA 知道主流 VLA 长什么样,再读 VLAs 和 MLA 可以看到替代方案和全景。


思考题

Q1:OpenVLA 把动作离散成 256 档 token。如果某个任务需要 sub-mm 精度(比如 PCB 插件),256 档够不够?如何改进?

提示

假设工作空间是 50cm,256 档的每档精度 ≈ 50/256 ≈ 2mm。对 PCB 插件(需要 0.1mm)远远不够。改进方案:(1) 增加档数到 1024 或 4096;(2) 用连续动作输出头代替离散 token(如 π0 的做法);(3) 用"粗定位 + 精调"的两阶段策略。后续的 π0 和 OpenVLA-OFT 都转向了连续动作表示。

Q2:OpenVLA 解冻视觉编码器训练,而大多数 VLM 工作冻住视觉编码器。为什么机器人场景需要解冻?这会带来什么风险?

提示

解冻原因:互联网图片(正面产品照、高清生活照)和机器人视角(斜上方第三人称、运动模糊、局部遮挡)差异巨大,冻住的编码器可能提取不到机器人需要的细粒度空间特征。风险:(1) 破坏编码器已学到的通用视觉表征 → 语义泛化下降(论文实验确认了这一点);(2) 训练更不稳定,需要更小心地选择学习率。论文选择全量解冻+低学习率作为折中。

Q3:论文发现训练需要 27 epoch 才能收敛。VLM 通常只需 1~2 epoch。为什么 VLA 需要这么多轮?

提示

核心原因是数据量差异。VLM 预训练数据有数十亿条(每条只需看一次就够学到模式)。OpenVLA 的机器人数据只有 97 万条——比语言数据少 3 个数量级。模型需要反复看同一批数据才能建立"像素→动作"的精确映射。这类似于人类学驾驶——同一条路可能要跑几十遍才能形成肌肉记忆。风险是过拟合,但作者发现 27 epoch 时测试性能仍在上升。

Q4:如果你只有 10 段新任务的演示视频,LoRA 微调和全量微调哪个更好?为什么?

提示

10 段数据极少。全量微调 7B 参数容易严重过拟合(参数太多、数据太少)。LoRA 只调 1.4% 参数(约 1 亿),相当于正则化——限制了模型的"自由度",不容易对少量数据死记硬背。论文实验也证实在数据极少时 LoRA 效果接近全量微调。类比:10 道题你背不下整本教材,但可以学几个解题套路。

Q5:OpenVLA 在语义泛化上输给 RT-2-X(60% vs 80%)。如果你要修复这个弱点,应该改训练过程的哪个环节?

提示

RT-2-X 的优势来自"co-fine-tuning"——同时在机器人数据和互联网图文数据上训练,保持互联网知识不被覆盖。修复方案:(1) 训练时混入一定比例的原始 VLM 数据(如 LLaVA 1.5 图文对);(2) 用 LoRA 微调而不是全量微调(保留主网络的互联网知识);(3) 在 loss 中加入语言-视觉 alignment 的辅助项。这本质上是"学新本事的同时不忘旧知识"的平衡问题。

Q6:假设明天有人发布了 100M 条高质量机器人数据(比 OpenVLA 多 100 倍),OpenVLA 的哪些设计决定会需要改变?

提示

(1) 训练轮数可能降回 1~2 epoch(数据够多就不需要反复看);(2) 可能需要更大模型来吸收更多数据(7B 可能成为容量瓶颈);(3) 视觉编码器可能可以重新冻住(足够多的机器人视角数据可能让解冻变得不再必要);(4) 分辨率可能需要提高(更多数据意味着可以负担更长的训练时间)。本质上,很多"反直觉"的设计决定都是在数据量小的约束下做出的妥协。


一些好奇心问答(FAQ)

Q:模型多大?我的电脑跑得动吗?

7B 参数,存盘约 14GB。正常加载需要 15GB 显存(RTX 4090 够)。4-bit 量化后约 7GB(RTX 4070 够)。如果只有 8GB 显存,4-bit 量化是唯一选择。

Q:训练一次多少钱?我能复现吗?

预训练:64 张 A100 × 14 天 ≈ 36 万美元。普通学生不可能复现预训练。但微调只需 1 张 A100 + 几小时 ≈ 3060 美元——这是任何人都能负担的。

Q:数据需要授权吗?

Open X-Embodiment 是公开数据集,多数为 CC-BY-4.0 协议,引用即可使用。

Q:推理速度够做什么任务?

6 Hz 够做"抓放物体""开关抽屉"等桌面操作。不够做需要快速反应的灵巧操作(穿针、缝纫需要 30+ Hz)。

Q:为什么选 Llama 2 不选更新的 Llama 3?

时间线问题。OpenVLA 训练时 Llama 3 还没发布(或刚发布)。后续工作(如 π0)已经用了更新的 backbone。

Q:开源到什么程度?

权重(HuggingFace)、代码(GitHub)、训练 notebook、tokenizer、微调教程——全部开源。这是它和 RT-2-X 的根本区别。

所以这一节是想说:对大多数人来说,OpenVLA 的正确用法是"下载权重 → LoRA 微调到自己的机器人",不需要复现预训练。


如果你想再深入

  1. 前传(必读):RT-2 (Brohan et al. 2023) — "动作当 token"思路的原创者。读完才知道 OpenVLA 继承了什么、改了什么。

  2. 骨架来源:Prismatic VLMs (Karamcheti et al. 2024) — OpenVLA 的 VLM 地基。看到"为什么双眼比单眼好"的原始实验数据。

  3. 竞争路线:Diffusion Policy (Chi et al. 2023) — 不用 token 化,用扩散模型直接生成连续动作序列。OpenVLA 在多任务泛化上赢,Diffusion Policy 在单任务平滑度上赢。

  4. 续作(实操首选):OpenVLA-OFT (Kim et al. 2025) — 原团队的优化版。速度 6→30 Hz,加了 action chunking。如果你要实操部署,直接用 OFT 版。

  5. 续作(产业级):π0 (Physical Intelligence, 2024) — 几位 OpenVLA 作者创业后做的下一代。用 flow matching 替代 token 化,支持双臂+灵巧手。代表 VLA 的产业化方向。

读顺序建议:

RT-2 → OpenVLA(你在这) → OpenVLA-OFT(优化版)
                           → π0(下一代)
                           → Diffusion Policy(竞争路线)

所以这一节是想说:OpenVLA 是 VLA 开源生态的起点。实操用 OFT,研究看 π0,了解对手看 Diffusion Policy。


原文信息

@inproceedings{kim2024openvla,
  title={OpenVLA: An Open-Source Vision-Language-Action Model},
  author={Kim, Moo Jin and Pertsch, Karl and Karamcheti, Siddharth and Xiao, Ted and Balakrishna, Ashwin and Nair, Suraj and Rafailov, Rafael and Foster, Ethan and Lam, Grace and Sanketi, Pannag and others},
  booktitle={Conference on Robot Learning (CoRL)},
  year={2024}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_openvla_2026,
  title       = {(readable note) OpenVLA: An Open-Source Vision-Language-Action Model},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/openvla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?