OpenVLA-OFT
给"完全没接触过 AI / 机器人"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。
一句话讲什么(TL;DR)
原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配一个极简的 L1 回归目标,把 LIBERO 仿真基准的平均成功率从 76.5% 拉到 97.1%,动作吞吐量提高 26 倍,还能在双臂 ALOHA 上做高频灵巧操作,超过 π0、RDT-1B 以及从零训练的 Diffusion Policy / ACT。
所以这一节是想说:OFT 不是一个新模型架构,而是一套"怎么微调 VLA 才最优"的配方(recipe),把速度和成功率同时拉满。
这是个什么场景
想象你请了个学徒帮你叠衣服。你说"把那件 T 恤叠好放进抽屉",他得三件事一起做:眼睛看到 T 恤、耳朵听懂你的话、然后手动起来。这就是 **VLA(Vision-Language-Action,视觉-语言-动作模型)**想干的事——看图 + 听指令 + 直接输出机器人动作。
但前作 OpenVLA 这个学徒有个怪毛病:他动手前要一个字一个字念出动作口令——"肩—抬—一—档,肘—弯—两—档……"念完一句才动一下。而且口令只有 256 个刻度可选(像只有 256 格的颜料盒),调不出更细的颜色,叠出来的衣服边角一抖一抖。更糟的是,遇到需要每秒几十次决策的高频动作(比如双手协调塞衣角),这种"念口令"的速度根本跟不上。
OpenVLA-OFT 想让这个学徒改三个习惯:
- 别念了,心里一次想好整句直接动手(并行解码);
- 别一步一停,一口气想好接下来一整段动作再去做(动作分块);
- 别拿 256 格色板凑色,直接说出准确的连续小数(连续动作表征)。
三个习惯合起来,就是这篇论文的核心。它面对的痛点很具体:现有 VLA 换到一台新机器人上必须微调,但"怎么微调"没人系统研究过,大家各调各的。
所以这一节是想说:OFT 面向的是"我有一台新机器人、想把现成 VLA 微调到它上面、还要跑得快"的工程场景,答案是一份被消融验证过的配方。

之前的人怎么做的,为什么不够好
在 OFT 之前,让 VLA 输出动作的路线各占了"大模型 / 分块 / 连续动作"三条边的一两条,但没人把三者拆开、一个个做对照实验:
- OpenVLA(2024):7B Llama 接上双视觉编码器(DINOv2 + SigLIP),把动作离散化成 256 个 bin,按 token 自回归吐出。能跑,但慢、动作糙、长时序(long-horizon)任务掉点。它是本文的基座(base model)。
- RT-2 / RT-1(Google):同样把"动作"当成语言的一部分,用离散 token 逐步生成。单臂为主,高频灵巧操作受限。
- Diffusion Policy / 3D Diffusion Policy:用扩散模型(diffusion)一次性画出一段连续动作块,动作丝滑,但通常没有大语言模型主干,语义泛化弱。
- ACT(Action Chunking Transformer):最早系统化"一次预测一段动作"的分块思路,但规模和泛化不如 VLA 路线。
自回归解码(autoregressive decoding):像写字一样一个 token 接一个 token 生成,每个 token 都要看前面所有 token。表达力强但慢。
离散化动作 token:把每一维连续动作切成 N 个档位(OpenVLA 用 256),用类似"生僻字"的 token 表达。精度受档位数限制。
共同的空白:这些工作要么绑死一套设计,要么只改一条边,没人把"解码方式 / 动作粒度 / 动作表征"三个维度解耦,逐一测量各自的贡献。于是"想微调 VLA 的人到底该开哪些开关"始终是玄学。
所以这一节是想说:前人各调各的,缺一份"拆开三个旋钮、逐一消融"的系统研究,OFT 就是来填这个空的。
这篇论文的新想法
核心思路一句话:把 VLA 微调看成一个有三个独立旋钮的控制台,每个旋钮可以单独翻转、互不绑定,然后做对照实验找出最优组合。
三个旋钮分别是:
- 解码方式:自回归(一个个吐) vs 并行(一次前向同时吐出整个动作向量 / 整段 chunk);
- 动作粒度:单步(只预测下一步) vs 分块(一次预测未来 H 步);
- 动作表征:离散 token(256 bin) vs 连续(L1 回归实数 / 扩散头)。
类比:以前大家买"套餐"——要么全离散自回归单步,要么全连续扩散分块,从不拆开点菜。OFT 的贡献是把套餐拆成三道单点菜,逐一尝出哪道菜贡献最大,最后发现"三个旋钮全开(并行 + 分块 + 连续)+ 一个极简 L1 回归目标"的组合,在推理延迟、轨迹平滑度、成功率上全面碾压原版。
关键的反直觉点:**动作表征不必用复杂的扩散头,简单的 L1 回归就够好,而且更快更稳。**这让整套配方极易复现。
所以这一节是想说:OFT 的新想法不是发明新结构,而是"解耦 + 消融"的研究方法论,最终得到一份可直接抄的最优微调配方。
它分几步做的(方法)
整套 OFT 配方可以拆成四个可独立翻转的设计决定。我们逐个讲清楚"输入 → 处理 → 输出"。
1. 换"嘴巴",不换"脑子"(复用 OpenVLA 主干)
类比:给厨师换一把更趁手的刀,但菜谱知识(对食材的理解)全部保留。
输入:一张(或多张)RGB 图 + 一句语言指令。
处理:完整复用 OpenVLA 的视觉-语言主干——Llama 系语言模型 + DINOv2 / SigLIP 双视觉编码器。这部分负责"看懂 + 听懂",权重直接继承预训练成果,不推倒重来。只把**负责输出动作的"动作头"**换掉。原版动作头把每维动作切成 256 档、按 token 顺序一个个吐;OFT 把它替换成"并行 + 连续"的新头。
输出:一个仍然会看图听话、但输出方式被改造的 VLA。
动作头(action head):模型最后负责把"内部理解"翻译成"具体动作数值"的那一层。OFT 的所有改动几乎都集中在这里。
所以这一节是想说:OFT 站在 OpenVLA 肩膀上,只动最后的输出环节,保留昂贵的视觉-语言预训练能力。
2. 并行解码:别再排队了(Parallel Decoding)
类比:翻译"我饿了"这三个字,其实可以同时翻成 "I am hungry",没必要等"我"翻完再翻"饿"。机器人 7 个关节在同一瞬间是一起动的,动作各维之间并没有真正的先后因果。
输入:视觉-语言主干处理后的隐藏表示(hidden states)。
处理:原版自回归解码要求"生成第 k 个 token 时必须看到前 k-1 个 token"(这个限制叫 因果掩码 causal mask)。OFT 把动作部分的因果掩码拆掉,让模型在一次前向传播(one forward pass)里同时输出所有动作维度。推理步数从"与动作维度 × chunk 长度成正比"降到常数级——这正是 26 倍吞吐量提升的主要来源。
输出:整个动作向量(或整段 chunk)一次性生成,不再逐 token 排队。
并行解码 / 非自回归(non-autoregressive):一次前向同时输出多个 token,舍弃 token 间的顺序依赖来换速度。自然语言里的非自回归翻译是同源思路。
所以这一节是想说:动作各维本无先后关系,强行自回归是浪费;并行解码一步到位,是速度提升的第一大功臣。
3. 动作分块:一次想好一整段(Action Chunking)
类比:下棋时一次想清楚接下来 5 步,而不是每落一子都从头重算。
输入:当前观察(图 + 指令 + 可选的本体状态)。
处理:让模型一次输出未来 H 步动作(一个 action chunk),机器人执行完这一整段再回头问模型。好处有二:(1) 少问几次 → 推理开销摊薄;(2) 长任务(叠衣服、整理桌面)里累积漂移(drift)更小,因为决策次数变少、误差不容易一步步滚雪球。代价是环境突变时反应会慢一拍——靠调整 H 的大小在"平滑"与"反应速度"之间平衡。
输出:一段连续的多步动作序列,配合并行解码一次性生成。
动作分块(action chunking):一次预测未来 H 步而非只预测下一步。ACT 论文最早系统化,能显著减少高频抖动。
所以这一节是想说:分块把"高频决策"变成"低频规划一段再执行",既省算力又稳住长任务。
4. 连续动作表征 + L1 回归目标(Continuous Action + L1)
类比:从只有 256 格的色板,换成能调任意小数的调色盘。想画淡蓝,不用再选最接近的那格。
输入:主干的隐藏表示。
处理:抛弃 256 档离散 token,让动作头直接回归连续实数。训练目标用最简单的 L1 回归(预测值与真值的绝对误差 |ŷ − y|),而不是复杂的扩散去噪目标。论文的消融发现:L1 回归在成功率上不输扩散头,却训练更简单、推理更快、更稳定。轨迹立刻从"一格一格阶梯状"变得丝滑。
输出:精确的连续动作数值,且训练/推理都极简。
L1 回归(L1 regression):以预测值和真值的绝对差为损失。相比 L2(平方差)对离群点更鲁棒,相比扩散头简单得多。
四个旋钮的整体数据流(ASCII):
图像 + 语言指令
│
▼
┌──────────────────────┐
│ OpenVLA 视觉-语言主干 │ ← 复用(DINOv2+SigLIP + Llama)
│ DINOv2 / SigLIP → Llama│
└──────────┬───────────┘
│ hidden states
▼
┌──────────────────────┐
│ OFT 动作头(改造点) │
│ · 并行解码:一步出全部 │
│ · 分块:一次出未来 H 步 │
│ · 连续表征 + L1 回归 │
└──────────┬───────────┘
▼
[a_t, a_{t+1}, ..., a_{t+H-1}] 连续动作 chunk(一次性)
为什么三个旋钮要一起开?——论文的消融显示它们不打架、反而互补:并行解码提供速度,分块提供长时序稳定性,连续表征提供精度。三个都开 ≫ 单开任意一个 ≫ 原版 OpenVLA。
所以这一节是想说:Method 的精髓是"三个正交旋钮 + 一个极简 L1 目标",缺哪个都不是最优,全开才既快又准。

关键数字(What works)
所有数字来自论文摘要与公开正文,未报告的一律标注"原文未报告"。
LIBERO 仿真基准(4 个任务套件平均成功率):
| 指标 | OpenVLA(原版) | OpenVLA-OFT |
|---|---|---|
| LIBERO 平均成功率(4 套件) | 76.5% | 97.1% |
| 动作生成吞吐量 | 基线 1× | 26× |
真机双臂 ALOHA(相对其他方法):
| 对比对象 | 差距(平均成功率,绝对值) |
|---|---|
| π0(用其默认配方微调) | OFT 最高领先 15% |
| RDT-1B(用其默认配方微调) | OFT 领先(含在"最高 15%"内) |
| Diffusion Policy(从零训练) | OFT 领先(含在"最高 15%"内) |
| ACT(从零训练) | OFT 领先(含在"最高 15%"内) |
三个旋钮的定位:
| 旋钮 | 原版做法 | OFT 做法 | 主要收益 |
|---|---|---|---|
| 解码方式 | 自回归逐 token | 并行一次出 | 速度(26× 的主因) |
| 动作粒度 | 单步 | 分块 H 步 | 长时序稳定性 |
| 动作表征 | 256 离散 bin | 连续 + L1 回归 | 精度 + 平滑 + 易复现 |
最有冲击力的三点:
- 成功率 +20.6 个百分点(76.5% → 97.1%):同一个基座 OpenVLA,只改微调配方,LIBERO 就逼近满分。证明"配方"本身就是巨大的性能杠杆。
- 吞吐量 26 倍:并行解码 + 分块把"逐 token 排队"的开销几乎抹平,使 VLA 第一次能胜任双臂高频灵巧控制。
- L1 打平扩散头:不需要复杂的扩散去噪,简单 L1 回归即可,配方极易被别人抄走复现。
所以这一节是想说:一份好配方能把成功率拉 20 个点、速度提 26 倍,且用最简单的 L1 目标——工程价值远超"再堆一个新结构"。
实验结果说明了什么
从数字里能提炼几条核心结论:
**结论 1:微调配方是被严重低估的性能杠杆。**同一个 OpenVLA 基座,不换架构、不加参数,仅优化"怎么微调",LIBERO 平均成功率就从 76.5% 涨到 97.1%。这说明社区之前在"怎么把 VLA 微调到新机器人"上留了大量性能没吃到。
**结论 2:动作各维之间的自回归依赖是多余的。**并行解码不但没伤成功率,反而配合分块把吞吐量拉到 26 倍。这印证了"机器人多维动作是同时发生的、不该逐 token 排队"的直觉。
**结论 3:简单胜过复杂。**L1 回归打平了扩散头,却更快更稳更易复现。这对工程落地是极好的消息——不需要为动作生成引入一整套扩散训练/采样机制。
**结论 4:配方可迁移到高频灵巧任务。**在双臂 ALOHA 上,OFT 微调的 OpenVLA 超过了专门为高频设计的 π0、RDT-1B,以及从零训练的 Diffusion Policy / ACT,最高领先 15%。说明这套配方不是只在仿真里刷分,真机高频控制同样成立。
**结论 5:解耦研究法本身有示范价值。**把复杂系统拆成可独立翻转的旋钮再逐一消融,让"哪个设计贡献多少"第一次有了清晰答案,也让后来者知道该开哪些开关。
所以这一节是想说:核心 takeaway 是"配方 > 新结构、并行 > 自回归、简单 L1 > 复杂扩散",以及解耦消融这套方法论的价值。
你应该懂的几个新词
VLA(Vision-Language-Action):把"看图 + 听语言指令 + 输出机器人动作"塞进同一个大模型的范式。代表作 RT-2、OpenVLA。
自回归解码 vs 并行解码:前者一个 token 接一个 token 生成(慢、有顺序依赖);后者一次前向同时输出多个维度(快、舍弃顺序依赖)。
动作分块(action chunking):一次预测未来 H 步动作,减少决策次数和累积漂移。
离散动作 token vs 连续动作:前者把每维动作切成 N 个 bin(如 256)用 token 表达;后者直接回归实数或用扩散生成连续向量。
L1 回归:以预测值与真值的绝对差为损失,简单、鲁棒,OFT 用它取代扩散头。
LIBERO:VLA / 机器人操作领域常用的仿真基准,含 Spatial / Object / Goal / Long 四个子任务套件。
因果掩码(causal mask):限制模型"只能看前面 token"的注意力机制。OFT 在动作部分拆掉它以实现并行解码。
所以这一节是想说:掌握"自回归 vs 并行""离散 vs 连续""分块"这三对概念,就抓住了 OFT 全部要点。
它有什么搞不定的
- 反应滞后风险:动作分块一次执行 H 步,环境突然变化(物体被碰倒、人手伸进来)时,模型要等这一段执行完才重新决策,反应比单步慢一拍。H 越大越明显。
- 并行解码丢弃维度间依赖:极少数任务里,动作各维可能确实存在强耦合先后关系,一次性并行输出理论上会损失这种依赖建模能力(论文以成功率证明多数场景无碍,但非绝对)。
- 仍需针对新机器人微调:OFT 是"微调配方",不是"零样本即插即用"。换一台新机器人依然要收集演示数据做微调。
- 依赖 OpenVLA 基座的固有局限:视觉-语言主干继承自 OpenVLA,其对透明 / 反光 / 环状物体的视觉盲区、语义泛化的弱点等,OFT 并未专门修复。
- 具体超参需读原文:学习率、LoRA 还是全参微调、H 的取值、数据规模等细节,摘要未全部给出,复现前需查正文与开源代码。
- L1 的多模态表达力:L1 回归本质是回归到一个点,对"同一情况有多种合理动作"(多模态动作分布)的建模不如扩散头天然。论文中 L1 够用,但在强多模态任务上是否始终最优仍值得关注。
所以这一节是想说:OFT 的主要代价是"分块换来的反应滞后"和"并行/L1 对维度依赖与多模态的简化",且它解决的是微调而非零样本部署。
它和别的几篇是什么关系
家族树(ASCII):
RT-2(动作当 token 的范式起点)
│
OpenVLA(7B 开源,离散自回归单步) ← OFT 的基座
│ 改微调配方(三旋钮全开 + L1)
▼
OpenVLA-OFT(并行 + 分块 + 连续)
┌────────────┼────────────┐
│ 借鉴 │ 对比 │ 竞争
ACT(分块) Diffusion Policy π0 / RDT-1B
(连续+扩散头) (连续动作 VLA)
- 上游 / 基座:OpenVLA(前作,本文主干)、RT-2(VLA 范式起点)。
- 被借鉴的思路:ACT(动作分块)、Diffusion Policy(连续动作 + 扩散头)、非自回归翻译(并行解码)。
- 平行竞品:π0(flow matching 连续动作)、RDT-1B(扩散 + 双臂基模)、Octo、CogACT——各自在数据、架构、动作表征上做不同优化。OFT 在双臂 ALOHA 上直接把 π0、RDT-1B 当对照组并胜出。
- 下游影响:2025 年下半年起,很多 VLA 论文默认用"分块 + 连续动作"做基线,OFT 已成为 LIBERO 榜单上的常见强基线(strong baseline)。
与 OpenVLA 的对比:
| 维度 | OpenVLA | OpenVLA-OFT |
|---|---|---|
| 解码 | 自回归逐 token | 并行一次出 |
| 动作粒度 | 单步 | 分块 H 步 |
| 动作表征 | 256 离散 bin | 连续 + L1 |
| LIBERO 平均 | 76.5% | 97.1% |
| 吞吐量 | 1× | 26× |
| 高频双臂 | 吃力 | 胜任 |
所以这一节是想说:OFT = OpenVLA 基座 + ACT 的分块 + Diffusion Policy 式连续动作 + 非自回归并行解码,缝成一份最优微调配方。
和本导读的关系
本篇对应 Ch12: 开源 VLA——OpenVLA / VLAs 综述 / MLA。
Ch12 讲"VLA 范式有哪些变体",OpenVLA 是其中 autoregressive token-based VLA 的标杆。OpenVLA-OFT 正是对这个标杆做"输出端手术"的续作:保留 OpenVLA 的看/听能力,把"动"的方式换成并行 + 分块 + 连续。读完 OpenVLA 理解"离散自回归 VLA 长什么样",再读 OFT 就能看到"同一个基座如何通过配方进化成又快又准的版本",并顺势对照 Ch13 扩散策略线的 π0 / RDT-1B。
所以这一节是想说:OFT 是 Ch12 里 OpenVLA 词条的"实操升级版",也是通往 Ch13 连续动作路线的桥。
思考题
Q1:并行解码舍弃了动作各维之间的顺序依赖,为什么在机器人上几乎不掉成功率,但在自然语言翻译里非自回归往往会掉质量?
提示
关键在"输出各元素之间是否有强顺序依赖"。语言里"下一个词"高度依赖前面的词(语法、语义连贯),非自回归容易生成重复/不通顺。机器人一个时刻的 7 维动作是同一瞬间物理上同时发生的,各维之间并没有"先动肩再动肘"的语言式因果,所以并行输出损失很小。这也解释了为什么同一个 trick 在两个领域收益不同。
Q2:OFT 用 L1 回归打平了扩散头。什么样的任务下,扩散头可能反而比 L1 更好?
提示
想"多模态动作分布":同一个观察下有多种同样合理的动作(比如绕左边或绕右边避障)。L1 回归会回归到这些模式的"平均",可能得到一个既不像左也不像右的无效动作;扩散头能从多模态分布里采样出其中一种。所以强多模态、需要多样性的任务里扩散头理论上更有优势。LIBERO / ALOHA 上 L1 够用,说明这些任务的多模态性没强到让 L1 崩掉。
Q3:动作分块的 H(一次预测多少步)该怎么选?调大和调小各有什么后果?
提示
H 大:决策次数少、推理开销摊薄、长任务累积漂移小,但环境突变时反应慢(要等一整段执行完)。H 小:反应快、更接近闭环,但决策频繁、开销大、长任务误差易累积。最优 H 取决于任务的"动态程度"——静态桌面操作可用大 H,人机交互/易扰动场景要用小 H。这本质是"开环执行长度 vs 闭环反应速度"的权衡。
Q4:如果不改 OpenVLA 的任何输出方式,只是单纯延长训练/加数据,能达到 97.1% 吗?为什么论文要强调"配方"而不是"训练更久"?
提示
论文的核心论点是三个旋钮带来的是"结构性"收益:并行解码把吞吐提 26 倍(延长训练做不到)、分块降低累积漂移(数据多也难根治单步自回归的漂移)、连续表征突破 256 档的精度天花板(离散表征无论训多久都卡在量化误差上)。所以这些是训练时长/数据量无法替代的收益,必须从输出方式本身改。
Q5:OFT 在双臂 ALOHA 上超过了专门为高频设计的 π0。既然架构基座是 OpenVLA(原本高频吃力),为什么改了配方就能追上专用设计?
提示
OpenVLA 高频吃力的根因不是"脑子笨",而是"嘴巴慢"——逐 token 自回归 + 256 离散 bin 导致每次决策又慢又糙。并行解码解决"慢",连续表征解决"糙",分块让它一次规划一整段高频动作。也就是说 π0 的优势很大程度来自它的连续 flow chunk 动作头,而 OFT 把等价的"连续 + 分块 + 并行"能力补给了 OpenVLA,于是基座的强视觉-语言能力得以在高频场景释放。
Q6:从研究方法角度,"把系统拆成正交旋钮逐一消融"有什么风险?三个旋钮真的完全正交吗?
提示
风险在于旋钮之间可能存在交互效应(interaction):单独开 A 无用、单独开 B 无用,但 A+B 一起才有用;或者 A 的最优设置依赖 B 的取值。严格的消融需要测所有组合(2×2×2)而不只是"逐一翻转"。论文的结论"全开最好"暗示存在正向交互(互补),所以单看每个旋钮的边际贡献可能低估了组合价值——这正是为什么要报告全开而非只报单开。
一些好奇心问答(FAQ)
Q:OFT 是一个新模型还是一套方法?
是一套微调配方(recipe),外加一个用该配方微调 OpenVLA 得到的具体模型 OpenVLA-OFT。核心贡献是配方,模型是配方的实例化。
Q:我想把自己的 VLA 提速,能直接抄 OFT 吗?
能。三个旋钮(并行解码、动作分块、连续动作 + L1)是通用思路,作者也开源了代码和 checkpoint(openvla-oft.github.io)。对任何离散自回归的 VLA 都值得尝试。
Q:26 倍吞吐量是怎么来的?
主要来自并行解码(把"逐 token 逐维排队"压成一次前向)叠加动作分块(一次出多步、少问几次)。两者相乘产生数量级的加速。
Q:97.1% 是真机还是仿真?
LIBERO 的 76.5%→97.1% 是仿真基准。真机结果是双臂 ALOHA 上相对 π0 / RDT-1B / DP / ACT 最高领先 15%(绝对成功率)。
Q:为什么发表在 RSS?
RSS(Robotics: Science and Systems)是机器人顶会,偏系统与真机验证,和 OFT"配方 + 真机高频控制"的定位契合。
所以这一节是想说:对多数人,OFT 的正确用法是"把三个旋钮搬到自己的 VLA 微调里",作者已把代码和权重开源。
如果你想再深入
- 基座(必读):OpenVLA (Kim et al. 2024) — 先懂原版的离散自回归单步长什么样,才知道 OFT 改了什么。见
openvla.md。 - 分块思想来源:ACT (Zhao et al. 2023) — 动作分块的系统化起点。
- 连续动作对照:Diffusion Policy (Chi et al. 2023) — 扩散头做连续动作,理解为什么 OFT 选了更简单的 L1。见
diffusion-policy.md。 - 竞品对照:π0 (Physical Intelligence, 2024) — flow matching 连续动作 VLA,OFT 在真机上直接与之比较。见
pi0.md。 - 官方资源:openvla-oft.github.io(代码 + 预训练 checkpoint + 消融表)。实操前重点看消融表,它是全文最核心的证据。
读顺序建议:
OpenVLA(基座) → OpenVLA-OFT(你在这,配方升级)
→ ACT / Diffusion Policy(分块与连续动作来源)
→ π0 / RDT-1B(真机竞品)
所以这一节是想说:OFT 是 OpenVLA 生态的"提速手术",配套读 ACT、Diffusion Policy 理解它借了哪些零件,读 π0 看它的对手。
原文信息
@inproceedings{kim2025openvlaoft,
title={Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success},
author={Kim, Moo Jin and Finn, Chelsea and Liang, Percy},
booktitle={Robotics: Science and Systems (RSS)},
year={2025}
}
- arXiv:2502.19645
- 项目主页:openvla-oft.github.io
- 机构:Stanford University
- 一句话定位:OpenVLA 的"三旋钮微调配方",LIBERO 76.5%→97.1%,吞吐 26×。
◼
引用本笔记 / Cite this note
@online{eai_openvla_oft_2026,
title = {(readable note) OpenVLA-OFT},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2025 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/openvla-oft/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?