Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 118

OpenVLA-OFT

18 min read · 6211 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI / 机器人"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。

一句话讲什么(TL;DR)

原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配一个极简的 L1 回归目标,把 LIBERO 仿真基准的平均成功率从 76.5% 拉到 97.1%,动作吞吐量提高 26 倍,还能在双臂 ALOHA 上做高频灵巧操作,超过 π0、RDT-1B 以及从零训练的 Diffusion Policy / ACT。

所以这一节是想说:OFT 不是一个新模型架构,而是一套"怎么微调 VLA 才最优"的配方(recipe),把速度和成功率同时拉满。


这是个什么场景

想象你请了个学徒帮你叠衣服。你说"把那件 T 恤叠好放进抽屉",他得三件事一起做:眼睛看到 T 恤、耳朵听懂你的话、然后手动起来。这就是 **VLA(Vision-Language-Action,视觉-语言-动作模型)**想干的事——看图 + 听指令 + 直接输出机器人动作。

但前作 OpenVLA 这个学徒有个怪毛病:他动手前要一个字一个字念出动作口令——"肩—抬—一—档,肘—弯—两—档……"念完一句才动一下。而且口令只有 256 个刻度可选(像只有 256 格的颜料盒),调不出更细的颜色,叠出来的衣服边角一抖一抖。更糟的是,遇到需要每秒几十次决策的高频动作(比如双手协调塞衣角),这种"念口令"的速度根本跟不上。

OpenVLA-OFT 想让这个学徒改三个习惯:

  • 别念了,心里一次想好整句直接动手(并行解码);
  • 别一步一停,一口气想好接下来一整段动作再去做(动作分块);
  • 别拿 256 格色板凑色,直接说出准确的连续小数(连续动作表征)。

三个习惯合起来,就是这篇论文的核心。它面对的痛点很具体:现有 VLA 换到一台新机器人上必须微调,但"怎么微调"没人系统研究过,大家各调各的。

所以这一节是想说:OFT 面向的是"我有一台新机器人、想把现成 VLA 微调到它上面、还要跑得快"的工程场景,答案是一份被消融验证过的配方。


OpenVLA-OFT — 场景示意:这论文要解决的现实问题
Plate Nº IOpenVLA-OFT — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

在 OFT 之前,让 VLA 输出动作的路线各占了"大模型 / 分块 / 连续动作"三条边的一两条,但没人把三者拆开、一个个做对照实验:

  • OpenVLA(2024):7B Llama 接上双视觉编码器(DINOv2 + SigLIP),把动作离散化成 256 个 bin,按 token 自回归吐出。能跑,但慢、动作糙、长时序(long-horizon)任务掉点。它是本文的基座(base model)。
  • RT-2 / RT-1(Google):同样把"动作"当成语言的一部分,用离散 token 逐步生成。单臂为主,高频灵巧操作受限。
  • Diffusion Policy / 3D Diffusion Policy:用扩散模型(diffusion)一次性画出一段连续动作块,动作丝滑,但通常没有大语言模型主干,语义泛化弱。
  • ACT(Action Chunking Transformer):最早系统化"一次预测一段动作"的分块思路,但规模和泛化不如 VLA 路线。

自回归解码(autoregressive decoding):像写字一样一个 token 接一个 token 生成,每个 token 都要看前面所有 token。表达力强但慢。

离散化动作 token:把每一维连续动作切成 N 个档位(OpenVLA 用 256),用类似"生僻字"的 token 表达。精度受档位数限制。

共同的空白:这些工作要么绑死一套设计,要么只改一条边,没人把"解码方式 / 动作粒度 / 动作表征"三个维度解耦,逐一测量各自的贡献。于是"想微调 VLA 的人到底该开哪些开关"始终是玄学。

所以这一节是想说:前人各调各的,缺一份"拆开三个旋钮、逐一消融"的系统研究,OFT 就是来填这个空的。


这篇论文的新想法

核心思路一句话:把 VLA 微调看成一个有三个独立旋钮的控制台,每个旋钮可以单独翻转、互不绑定,然后做对照实验找出最优组合。

三个旋钮分别是:

  1. 解码方式:自回归(一个个吐) vs 并行(一次前向同时吐出整个动作向量 / 整段 chunk);
  2. 动作粒度:单步(只预测下一步) vs 分块(一次预测未来 H 步);
  3. 动作表征:离散 token(256 bin) vs 连续(L1 回归实数 / 扩散头)。

类比:以前大家买"套餐"——要么全离散自回归单步,要么全连续扩散分块,从不拆开点菜。OFT 的贡献是把套餐拆成三道单点菜,逐一尝出哪道菜贡献最大,最后发现"三个旋钮全开(并行 + 分块 + 连续)+ 一个极简 L1 回归目标"的组合,在推理延迟、轨迹平滑度、成功率上全面碾压原版。

关键的反直觉点:**动作表征不必用复杂的扩散头,简单的 L1 回归就够好,而且更快更稳。**这让整套配方极易复现。

所以这一节是想说:OFT 的新想法不是发明新结构,而是"解耦 + 消融"的研究方法论,最终得到一份可直接抄的最优微调配方。


它分几步做的(方法)

整套 OFT 配方可以拆成四个可独立翻转的设计决定。我们逐个讲清楚"输入 → 处理 → 输出"。

1. 换"嘴巴",不换"脑子"(复用 OpenVLA 主干)

类比:给厨师换一把更趁手的刀,但菜谱知识(对食材的理解)全部保留。

输入:一张(或多张)RGB 图 + 一句语言指令。

处理:完整复用 OpenVLA 的视觉-语言主干——Llama 系语言模型 + DINOv2 / SigLIP 双视觉编码器。这部分负责"看懂 + 听懂",权重直接继承预训练成果,不推倒重来。只把**负责输出动作的"动作头"**换掉。原版动作头把每维动作切成 256 档、按 token 顺序一个个吐;OFT 把它替换成"并行 + 连续"的新头。

输出:一个仍然会看图听话、但输出方式被改造的 VLA。

动作头(action head):模型最后负责把"内部理解"翻译成"具体动作数值"的那一层。OFT 的所有改动几乎都集中在这里。

所以这一节是想说:OFT 站在 OpenVLA 肩膀上,只动最后的输出环节,保留昂贵的视觉-语言预训练能力。


2. 并行解码:别再排队了(Parallel Decoding)

类比:翻译"我饿了"这三个字,其实可以同时翻成 "I am hungry",没必要等"我"翻完再翻"饿"。机器人 7 个关节在同一瞬间是一起动的,动作各维之间并没有真正的先后因果。

输入:视觉-语言主干处理后的隐藏表示(hidden states)。

处理:原版自回归解码要求"生成第 k 个 token 时必须看到前 k-1 个 token"(这个限制叫 因果掩码 causal mask)。OFT 把动作部分的因果掩码拆掉,让模型在一次前向传播(one forward pass)里同时输出所有动作维度。推理步数从"与动作维度 × chunk 长度成正比"降到常数级——这正是 26 倍吞吐量提升的主要来源。

输出:整个动作向量(或整段 chunk)一次性生成,不再逐 token 排队。

并行解码 / 非自回归(non-autoregressive):一次前向同时输出多个 token,舍弃 token 间的顺序依赖来换速度。自然语言里的非自回归翻译是同源思路。

所以这一节是想说:动作各维本无先后关系,强行自回归是浪费;并行解码一步到位,是速度提升的第一大功臣。


3. 动作分块:一次想好一整段(Action Chunking)

类比:下棋时一次想清楚接下来 5 步,而不是每落一子都从头重算。

输入:当前观察(图 + 指令 + 可选的本体状态)。

处理:让模型一次输出未来 H 步动作(一个 action chunk),机器人执行完这一整段再回头问模型。好处有二:(1) 少问几次 → 推理开销摊薄;(2) 长任务(叠衣服、整理桌面)里累积漂移(drift)更小,因为决策次数变少、误差不容易一步步滚雪球。代价是环境突变时反应会慢一拍——靠调整 H 的大小在"平滑"与"反应速度"之间平衡。

输出:一段连续的多步动作序列,配合并行解码一次性生成。

动作分块(action chunking):一次预测未来 H 步而非只预测下一步。ACT 论文最早系统化,能显著减少高频抖动。

所以这一节是想说:分块把"高频决策"变成"低频规划一段再执行",既省算力又稳住长任务。


4. 连续动作表征 + L1 回归目标(Continuous Action + L1)

类比:从只有 256 格的色板,换成能调任意小数的调色盘。想画淡蓝,不用再选最接近的那格。

输入:主干的隐藏表示。

处理:抛弃 256 档离散 token,让动作头直接回归连续实数。训练目标用最简单的 L1 回归(预测值与真值的绝对误差 |ŷ − y|),而不是复杂的扩散去噪目标。论文的消融发现:L1 回归在成功率上不输扩散头,却训练更简单、推理更快、更稳定。轨迹立刻从"一格一格阶梯状"变得丝滑。

输出:精确的连续动作数值,且训练/推理都极简。

L1 回归(L1 regression):以预测值和真值的绝对差为损失。相比 L2(平方差)对离群点更鲁棒,相比扩散头简单得多。

四个旋钮的整体数据流(ASCII)

   图像 + 语言指令
        │
        ▼
 ┌──────────────────────┐
 │  OpenVLA 视觉-语言主干  │  ← 复用(DINOv2+SigLIP + Llama)
 │  DINOv2 / SigLIP → Llama│
 └──────────┬───────────┘
            │ hidden states
            ▼
 ┌──────────────────────┐
 │   OFT 动作头(改造点)    │
 │  · 并行解码:一步出全部   │
 │  · 分块:一次出未来 H 步  │
 │  · 连续表征 + L1 回归    │
 └──────────┬───────────┘
            ▼
   [a_t, a_{t+1}, ..., a_{t+H-1}]  连续动作 chunk(一次性)

为什么三个旋钮要一起开?——论文的消融显示它们不打架、反而互补:并行解码提供速度,分块提供长时序稳定性,连续表征提供精度。三个都开 ≫ 单开任意一个 ≫ 原版 OpenVLA。

所以这一节是想说:Method 的精髓是"三个正交旋钮 + 一个极简 L1 目标",缺哪个都不是最优,全开才既快又准。


OpenVLA-OFT — 方法示意:核心 pipeline
Plate Nº IIOpenVLA-OFT — 方法示意:核心 pipeline

关键数字(What works)

所有数字来自论文摘要与公开正文,未报告的一律标注"原文未报告"。

LIBERO 仿真基准(4 个任务套件平均成功率)

指标 OpenVLA(原版) OpenVLA-OFT
LIBERO 平均成功率(4 套件) 76.5% 97.1%
动作生成吞吐量 基线 1× 26×

真机双臂 ALOHA(相对其他方法)

对比对象 差距(平均成功率,绝对值)
π0(用其默认配方微调) OFT 最高领先 15%
RDT-1B(用其默认配方微调) OFT 领先(含在"最高 15%"内)
Diffusion Policy(从零训练) OFT 领先(含在"最高 15%"内)
ACT(从零训练) OFT 领先(含在"最高 15%"内)

三个旋钮的定位

旋钮 原版做法 OFT 做法 主要收益
解码方式 自回归逐 token 并行一次出 速度(26× 的主因)
动作粒度 单步 分块 H 步 长时序稳定性
动作表征 256 离散 bin 连续 + L1 回归 精度 + 平滑 + 易复现

最有冲击力的三点

  1. 成功率 +20.6 个百分点(76.5% → 97.1%):同一个基座 OpenVLA,只改微调配方,LIBERO 就逼近满分。证明"配方"本身就是巨大的性能杠杆。
  2. 吞吐量 26 倍:并行解码 + 分块把"逐 token 排队"的开销几乎抹平,使 VLA 第一次能胜任双臂高频灵巧控制。
  3. L1 打平扩散头:不需要复杂的扩散去噪,简单 L1 回归即可,配方极易被别人抄走复现。

所以这一节是想说:一份好配方能把成功率拉 20 个点、速度提 26 倍,且用最简单的 L1 目标——工程价值远超"再堆一个新结构"。


实验结果说明了什么

从数字里能提炼几条核心结论:

**结论 1:微调配方是被严重低估的性能杠杆。**同一个 OpenVLA 基座,不换架构、不加参数,仅优化"怎么微调",LIBERO 平均成功率就从 76.5% 涨到 97.1%。这说明社区之前在"怎么把 VLA 微调到新机器人"上留了大量性能没吃到。

**结论 2:动作各维之间的自回归依赖是多余的。**并行解码不但没伤成功率,反而配合分块把吞吐量拉到 26 倍。这印证了"机器人多维动作是同时发生的、不该逐 token 排队"的直觉。

**结论 3:简单胜过复杂。**L1 回归打平了扩散头,却更快更稳更易复现。这对工程落地是极好的消息——不需要为动作生成引入一整套扩散训练/采样机制。

**结论 4:配方可迁移到高频灵巧任务。**在双臂 ALOHA 上,OFT 微调的 OpenVLA 超过了专门为高频设计的 π0、RDT-1B,以及从零训练的 Diffusion Policy / ACT,最高领先 15%。说明这套配方不是只在仿真里刷分,真机高频控制同样成立。

**结论 5:解耦研究法本身有示范价值。**把复杂系统拆成可独立翻转的旋钮再逐一消融,让"哪个设计贡献多少"第一次有了清晰答案,也让后来者知道该开哪些开关。

所以这一节是想说:核心 takeaway 是"配方 > 新结构、并行 > 自回归、简单 L1 > 复杂扩散",以及解耦消融这套方法论的价值。


你应该懂的几个新词

VLA(Vision-Language-Action):把"看图 + 听语言指令 + 输出机器人动作"塞进同一个大模型的范式。代表作 RT-2、OpenVLA。

自回归解码 vs 并行解码:前者一个 token 接一个 token 生成(慢、有顺序依赖);后者一次前向同时输出多个维度(快、舍弃顺序依赖)。

动作分块(action chunking):一次预测未来 H 步动作,减少决策次数和累积漂移。

离散动作 token vs 连续动作:前者把每维动作切成 N 个 bin(如 256)用 token 表达;后者直接回归实数或用扩散生成连续向量。

L1 回归:以预测值与真值的绝对差为损失,简单、鲁棒,OFT 用它取代扩散头。

LIBERO:VLA / 机器人操作领域常用的仿真基准,含 Spatial / Object / Goal / Long 四个子任务套件。

因果掩码(causal mask):限制模型"只能看前面 token"的注意力机制。OFT 在动作部分拆掉它以实现并行解码。

所以这一节是想说:掌握"自回归 vs 并行""离散 vs 连续""分块"这三对概念,就抓住了 OFT 全部要点。


它有什么搞不定的

  1. 反应滞后风险:动作分块一次执行 H 步,环境突然变化(物体被碰倒、人手伸进来)时,模型要等这一段执行完才重新决策,反应比单步慢一拍。H 越大越明显。
  2. 并行解码丢弃维度间依赖:极少数任务里,动作各维可能确实存在强耦合先后关系,一次性并行输出理论上会损失这种依赖建模能力(论文以成功率证明多数场景无碍,但非绝对)。
  3. 仍需针对新机器人微调:OFT 是"微调配方",不是"零样本即插即用"。换一台新机器人依然要收集演示数据做微调。
  4. 依赖 OpenVLA 基座的固有局限:视觉-语言主干继承自 OpenVLA,其对透明 / 反光 / 环状物体的视觉盲区、语义泛化的弱点等,OFT 并未专门修复。
  5. 具体超参需读原文:学习率、LoRA 还是全参微调、H 的取值、数据规模等细节,摘要未全部给出,复现前需查正文与开源代码。
  6. L1 的多模态表达力:L1 回归本质是回归到一个点,对"同一情况有多种合理动作"(多模态动作分布)的建模不如扩散头天然。论文中 L1 够用,但在强多模态任务上是否始终最优仍值得关注。

所以这一节是想说:OFT 的主要代价是"分块换来的反应滞后"和"并行/L1 对维度依赖与多模态的简化",且它解决的是微调而非零样本部署。


它和别的几篇是什么关系

家族树(ASCII)

              RT-2(动作当 token 的范式起点)
                     │
                OpenVLA(7B 开源,离散自回归单步)  ← OFT 的基座
                     │  改微调配方(三旋钮全开 + L1)
                     ▼
              OpenVLA-OFT(并行 + 分块 + 连续)
        ┌────────────┼────────────┐
        │ 借鉴        │ 对比        │ 竞争
     ACT(分块)  Diffusion Policy   π0 / RDT-1B
                 (连续+扩散头)   (连续动作 VLA)
  • 上游 / 基座:OpenVLA(前作,本文主干)、RT-2(VLA 范式起点)。
  • 被借鉴的思路:ACT(动作分块)、Diffusion Policy(连续动作 + 扩散头)、非自回归翻译(并行解码)。
  • 平行竞品:π0(flow matching 连续动作)、RDT-1B(扩散 + 双臂基模)、Octo、CogACT——各自在数据、架构、动作表征上做不同优化。OFT 在双臂 ALOHA 上直接把 π0、RDT-1B 当对照组并胜出。
  • 下游影响:2025 年下半年起,很多 VLA 论文默认用"分块 + 连续动作"做基线,OFT 已成为 LIBERO 榜单上的常见强基线(strong baseline)。

与 OpenVLA 的对比

维度 OpenVLA OpenVLA-OFT
解码 自回归逐 token 并行一次出
动作粒度 单步 分块 H 步
动作表征 256 离散 bin 连续 + L1
LIBERO 平均 76.5% 97.1%
吞吐量 26×
高频双臂 吃力 胜任

所以这一节是想说:OFT = OpenVLA 基座 + ACT 的分块 + Diffusion Policy 式连续动作 + 非自回归并行解码,缝成一份最优微调配方。


和本导读的关系

本篇对应 Ch12: 开源 VLA——OpenVLA / VLAs 综述 / MLA

Ch12 讲"VLA 范式有哪些变体",OpenVLA 是其中 autoregressive token-based VLA 的标杆。OpenVLA-OFT 正是对这个标杆做"输出端手术"的续作:保留 OpenVLA 的看/听能力,把"动"的方式换成并行 + 分块 + 连续。读完 OpenVLA 理解"离散自回归 VLA 长什么样",再读 OFT 就能看到"同一个基座如何通过配方进化成又快又准的版本",并顺势对照 Ch13 扩散策略线的 π0 / RDT-1B。

所以这一节是想说:OFT 是 Ch12 里 OpenVLA 词条的"实操升级版",也是通往 Ch13 连续动作路线的桥。


思考题

Q1:并行解码舍弃了动作各维之间的顺序依赖,为什么在机器人上几乎不掉成功率,但在自然语言翻译里非自回归往往会掉质量?

提示

关键在"输出各元素之间是否有强顺序依赖"。语言里"下一个词"高度依赖前面的词(语法、语义连贯),非自回归容易生成重复/不通顺。机器人一个时刻的 7 维动作是同一瞬间物理上同时发生的,各维之间并没有"先动肩再动肘"的语言式因果,所以并行输出损失很小。这也解释了为什么同一个 trick 在两个领域收益不同。

Q2:OFT 用 L1 回归打平了扩散头。什么样的任务下,扩散头可能反而比 L1 更好?

提示

想"多模态动作分布":同一个观察下有多种同样合理的动作(比如绕左边或绕右边避障)。L1 回归会回归到这些模式的"平均",可能得到一个既不像左也不像右的无效动作;扩散头能从多模态分布里采样出其中一种。所以强多模态、需要多样性的任务里扩散头理论上更有优势。LIBERO / ALOHA 上 L1 够用,说明这些任务的多模态性没强到让 L1 崩掉。

Q3:动作分块的 H(一次预测多少步)该怎么选?调大和调小各有什么后果?

提示

H 大:决策次数少、推理开销摊薄、长任务累积漂移小,但环境突变时反应慢(要等一整段执行完)。H 小:反应快、更接近闭环,但决策频繁、开销大、长任务误差易累积。最优 H 取决于任务的"动态程度"——静态桌面操作可用大 H,人机交互/易扰动场景要用小 H。这本质是"开环执行长度 vs 闭环反应速度"的权衡。

Q4:如果不改 OpenVLA 的任何输出方式,只是单纯延长训练/加数据,能达到 97.1% 吗?为什么论文要强调"配方"而不是"训练更久"?

提示

论文的核心论点是三个旋钮带来的是"结构性"收益:并行解码把吞吐提 26 倍(延长训练做不到)、分块降低累积漂移(数据多也难根治单步自回归的漂移)、连续表征突破 256 档的精度天花板(离散表征无论训多久都卡在量化误差上)。所以这些是训练时长/数据量无法替代的收益,必须从输出方式本身改。

Q5:OFT 在双臂 ALOHA 上超过了专门为高频设计的 π0。既然架构基座是 OpenVLA(原本高频吃力),为什么改了配方就能追上专用设计?

提示

OpenVLA 高频吃力的根因不是"脑子笨",而是"嘴巴慢"——逐 token 自回归 + 256 离散 bin 导致每次决策又慢又糙。并行解码解决"慢",连续表征解决"糙",分块让它一次规划一整段高频动作。也就是说 π0 的优势很大程度来自它的连续 flow chunk 动作头,而 OFT 把等价的"连续 + 分块 + 并行"能力补给了 OpenVLA,于是基座的强视觉-语言能力得以在高频场景释放。

Q6:从研究方法角度,"把系统拆成正交旋钮逐一消融"有什么风险?三个旋钮真的完全正交吗?

提示

风险在于旋钮之间可能存在交互效应(interaction):单独开 A 无用、单独开 B 无用,但 A+B 一起才有用;或者 A 的最优设置依赖 B 的取值。严格的消融需要测所有组合(2×2×2)而不只是"逐一翻转"。论文的结论"全开最好"暗示存在正向交互(互补),所以单看每个旋钮的边际贡献可能低估了组合价值——这正是为什么要报告全开而非只报单开。


一些好奇心问答(FAQ)

Q:OFT 是一个新模型还是一套方法?

是一套微调配方(recipe),外加一个用该配方微调 OpenVLA 得到的具体模型 OpenVLA-OFT。核心贡献是配方,模型是配方的实例化。

Q:我想把自己的 VLA 提速,能直接抄 OFT 吗?

能。三个旋钮(并行解码、动作分块、连续动作 + L1)是通用思路,作者也开源了代码和 checkpoint(openvla-oft.github.io)。对任何离散自回归的 VLA 都值得尝试。

Q:26 倍吞吐量是怎么来的?

主要来自并行解码(把"逐 token 逐维排队"压成一次前向)叠加动作分块(一次出多步、少问几次)。两者相乘产生数量级的加速。

Q:97.1% 是真机还是仿真?

LIBERO 的 76.5%→97.1% 是仿真基准。真机结果是双臂 ALOHA 上相对 π0 / RDT-1B / DP / ACT 最高领先 15%(绝对成功率)。

Q:为什么发表在 RSS?

RSS(Robotics: Science and Systems)是机器人顶会,偏系统与真机验证,和 OFT"配方 + 真机高频控制"的定位契合。

所以这一节是想说:对多数人,OFT 的正确用法是"把三个旋钮搬到自己的 VLA 微调里",作者已把代码和权重开源。


如果你想再深入

  1. 基座(必读):OpenVLA (Kim et al. 2024) — 先懂原版的离散自回归单步长什么样,才知道 OFT 改了什么。见 openvla.md
  2. 分块思想来源:ACT (Zhao et al. 2023) — 动作分块的系统化起点。
  3. 连续动作对照:Diffusion Policy (Chi et al. 2023) — 扩散头做连续动作,理解为什么 OFT 选了更简单的 L1。见 diffusion-policy.md
  4. 竞品对照:π0 (Physical Intelligence, 2024) — flow matching 连续动作 VLA,OFT 在真机上直接与之比较。见 pi0.md
  5. 官方资源:openvla-oft.github.io(代码 + 预训练 checkpoint + 消融表)。实操前重点看消融表,它是全文最核心的证据。

读顺序建议:

OpenVLA(基座) → OpenVLA-OFT(你在这,配方升级)
                   → ACT / Diffusion Policy(分块与连续动作来源)
                   → π0 / RDT-1B(真机竞品)

所以这一节是想说:OFT 是 OpenVLA 生态的"提速手术",配套读 ACT、Diffusion Policy 理解它借了哪些零件,读 π0 看它的对手。


原文信息

@inproceedings{kim2025openvlaoft,
  title={Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success},
  author={Kim, Moo Jin and Finn, Chelsea and Liang, Percy},
  booktitle={Robotics: Science and Systems (RSS)},
  year={2025}
}
  • arXiv:2502.19645
  • 项目主页:openvla-oft.github.io
  • 机构:Stanford University
  • 一句话定位:OpenVLA 的"三旋钮微调配方",LIBERO 76.5%→97.1%,吞吐 26×。

引用本笔记 / Cite this note
BibTeX
@online{eai_openvla_oft_2026,
  title       = {(readable note) OpenVLA-OFT},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/openvla-oft/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?