OpenHelix
这是一份给"完全没接触过 VLA、只知道机器人能听指令干活"的读者看的精读笔记。所有术语都翻成人话,类比来自日常生活。数字全部来自原文/项目页,没有的地方会写明"原文未报告"。
指令:"把红色瓶子递过来" + 当前画面
│
▼
┌───────────────────────────────┐
│ System 2(慢脑):LLaVA-7B │ 低频、会思考
│ 参数全冻结 + 只训一个 <ACT> token │
│ 输出:一个 latent 目标向量 │
└───────────────┬───────────────┘
4096 → 512 │ 线性投影(替代 3DDA 的文本编码器)
▼
┌───────────────────────────────┐
│ System 1(快手):3D Diffuser Actor│ 高频、只管动手
│ 输入:RGB + 点云 + 本体感知 + latent│
│ 输出:连续动作(扩散生成) │
└───────────────────────────────┘
│ 异步:System 2 每 N 步才更新一次(N 可到 60)
▼
机器人动作
1. 一句话讲什么(TL;DR)
OpenHelix 是机器人版"大脑 + 小脑"分工的开源实现:一个大的视觉语言模型(LLaVA-7B)当慢脑负责听懂指令,一个 3D 扩散策略(3D Diffuser Actor)当快手负责飞快动作,中间用一个学出来的 <ACT> token + 一层线性投影把两者接起来。它对标 Figure 公司不公开的 Helix,把代码、模型全部开源。
更具体一点,它做了三件事:(1) 一篇简短综述,把已有的双系统 VLA 架构(LCB、RoboDual、HiRT 等)按 7 个设计维度拆开对比;(2) 一套系统的实证分析,在 CALVIN 及其增强版(CALVIN-D 动态、CALVIN-E 富语言)上逐一测试这些设计选择到底哪个有效;(3) 一个低成本开源模型 OpenHelix。关键发现包括:慢脑用**提示微调(prompt tuning,只训一个新 token、冻结 7B 主干)既省算力又保住泛化;给 latent 加一个辅助任务(auxiliary task)**强迫慢脑真的做视觉推理,显著提性能;异步推理出奇地稳——慢脑每 60 步才更新一次,性能才掉约 3%。
所以这一节是想说:OpenHelix 不是提出一个全新算法,而是把"双系统 VLA"这个工业界热门架构开源化、并把每个设计旋钮都拆开做消融,告诉社区"哪些设计真有用"。
2. 这是个什么场景
你正在厨房颠勺。身边的人喊一句:"帮我把灶台上那个红色的瓶子递过来。"
你脑子里其实同时在跑两件事:
- 慢的那件事(大脑):听懂"红色瓶子"是哪一个、它在哪、要先放下锅铲再去拿。这一步要思考,慢一点没关系,但必须搞对。
- 快的那件事(小脑 + 肌肉记忆):伸手、避开热锅边缘、手指收紧抓住瓶身——这些动作每秒要微调几十次,根本来不及"想",全靠身体的本能反应。
如果你逼大脑去管每根手指怎么弯,整个人会卡成 PPT;如果只让肌肉记忆主导,又压根听不懂"红色瓶子"是啥。人类靠"慢思考 + 快反射"两套系统分工,才能又听得懂又动得快。
机器人现在就卡在这个两难里。VLM(Vision-Language Model,视觉语言模型)很会"听懂复杂指令",但参数量大、推理慢,做不了高频控制;专门的动作策略(扩散策略等)很会"快速动手",但听不懂人话、换个说法或换个没见过的物体就崩。
这正是**双系统 VLA(Dual-System Vision-Language-Action)**架构要解决的:让慢的 VLM 当 System 2(慢脑,负责想什么),让快的动作策略当 System 1(快手,负责做什么),两者分工、异步运行、互不拖累。这个思路源自诺奖得主 Kahneman 的双过程理论(System 1 快而直觉、System 2 慢而深思)。
问题是——工业界(Figure 的 Helix、Physical Intelligence 的 π0)已经在做双系统,但代码和细节都不开源,社区只能从 demo 视频和博客猜结构。原文一针见血地指出:双系统 VLA 已成研究热点,但缺乏足够的开源工作来做进一步的性能分析和优化。OpenHelix 就是来补这个缺口的。
所以这一节是想说:本文瞄准的是"双系统 VLA 很热但没开源、没人系统研究过它的设计选择"这个空白——它要把这套"慢脑 + 快手"架构开源化并研究透。

3. 之前的人怎么做的,为什么不够好
原文把已有做法梳理成两类,再重点对比三个已有的双系统工作:
单体 VLA(RT-2、OpenVLA):一个大模型从图像 + 语言直接输出动作 token。端到端简洁,泛化好,但推理慢,难做高频闭环控制。想让一个 7B 模型每秒跑几十次控制环,算力吃不消。
专用扩散/动作策略(Diffusion Policy、3D Diffuser Actor、ACT):动作头很快、精度高,但语言理解弱、多任务泛化差,遇到没见过的物体或表述就崩。
已有双系统工作,各有设计缺陷(原文综述重点对比):
- LCB:双系统 VLA 的开创者。慢脑用 LLaVA,给它一个特殊 token 当高层 latent 目标;快手用预训练的 3D Diffuser Actor。慢脑用 LoRA 微调。它还用 CLIP loss 约束 latent 去贴近原始文本的 CLIP 嵌入——但原文批评这个做法"把模型限制在下游训练过的情况里,反而抵消了引入 MLLM 泛化能力的初衷"。
- RoboDual:慢脑用 OpenVLA,快手是从零训练的 DiT,融合 RGB/深度/触觉/本体感知。慢脑 LoRA 微调、快手从零训。
- HiRT:慢脑用 InstructBLIP,取最后一层视觉+语言特征做 max-pooling 当 latent;快手用 RT-1 结构从零训。
核心痛点:这些双系统工作各自做了不同的设计选择(用哪个 MLLM、慢脑怎么训、latent 怎么表示、怎么接、怎么异步),但没人系统地对比过这些选择哪个更好、哪个是关键。 而且它们大多闭源或半开源,社区无法复现和优化。
所以这一节是想说:前人要么单体 VLA 太慢、要么纯动作策略听不懂话;已有的双系统工作又各搞各的设计、缺乏系统对比和开源。OpenHelix 的空位就是"把这些设计维度拆开、逐一实证、并完全开源"。
4. 这篇论文的新想法
OpenHelix 的核心命题:双系统架构不是工业界的专利,社区也能复现它,而且要把每一个设计选择拆开来做消融,搞清楚哪些真有用。
原文把双系统的设计空间归纳成 7 个维度(这是它综述部分的骨架):
- MLLM 选型:慢脑用哪个视觉语言模型?多大够用?
- Policy 选型:快手用哪种动作策略(DiT、Flow Matching、扩散等)?
- Latent 特征表示:慢脑传给快手的"中间想法"用什么形式?最后一层隐藏态?中间层?max-pooling?还是一个专门的 token?(原文说这是"最复杂、最亟需研究"的一环)
- MLLM 训练策略:慢脑该冻结还是微调?怎么在不损失泛化的前提下融合下游任务?
- Policy 训练策略:快手从零训还是从预训练模型微调?
- 双系统整合策略:latent 怎么作为条件注入快手?投影层怎么训?
- 异步策略:慢脑和快手频率不同会不会影响性能?
原文明确说:它把维度 1、2、3、7 标准化固定下来(为了公平对比),重点实证维度 4、5、6(这些技术相对通用、独立于具体模型选择)。
基于这些实证,它提出 OpenHelix 这个"简单但有效"的模型,几个关键设计决策:
- 慢脑 = LLaVA-7B,全冻结,只用提示微调(prompt tuning):给 LLaVA 词表加一个新的
<ACT>token,只训练这个 token 的嵌入,其他 7B 参数全不动。这样既省算力,又不破坏 LLaVA 原有的泛化能力。 - 快手 = 预训练的 3D Diffuser Actor(3DDA):一个在 3D 空间做扩散的动作策略,融合 RGB、点云、本体感知。用预训练权重微调而非从零训。
- 桥接 =
<ACT>token → 线性投影(4096 → 512):用一层线性层把 LLaVA 输出的 4096 维 latent 降到 512 维,替换掉 3DDA 原来的文本编码器输入。 - 辅助任务(auxiliary task):强迫慢脑从它的 latent 嵌入直接预测动作,逼它真的做多模态推理,而不是走个过场。原文强调这一步对性能很关键。
- 异步推理:慢脑低频更新目标,快手高频执行。
等等,先慢一拍——为什么要给慢脑加"辅助任务"? 因为如果只让 <ACT> token 被下游动作损失间接训练,慢脑可能学会"敷衍"——输出一个能让快手勉强工作、但并没有真正理解画面的 latent。辅助任务直接要求"从这个 latent 就能预测出动作",相当于给慢脑单独出了一张考卷,逼它真的看懂场景、真的推理,这样传给快手的 latent 才有货。
所以这一节是想说:本文的贡献是把双系统 VLA 拆成 7 个设计维度做实证,并基于结论提出一个"冻结 LLaVA + prompt tuning + 辅助任务 + 预训练 3DDA + 异步"的简洁开源模型。
5. 它分几步做的(方法)
OpenHelix 由两个预训练模型(慢脑 MLLM f_φ 和快手 policy π_θ)拼成,关键在"怎么接、怎么训、怎么异步"。下面拆开讲。
5.1 System 2 慢脑:LLaVA-7B + 一个 token
类比:餐厅里经验老道但手慢的主厨——负责看菜单、判断这道菜该怎么烧,但不亲自切配翻炒。
输入:当前帧 RGB 图像 + 自然语言指令,末尾拼上一个新加的 <ACT> token。
处理:LLaVA-7B(一个视觉编码器 + 大语言模型的组合)处理图文输入,做多模态理解。<ACT> token 在最后一层的输出,就是慢脑给出的"高层 latent 目标"——一个 4096 维的向量,浓缩了"该往哪个方向、抓什么"的意图。
关键设计——prompt tuning(提示微调):不用 LoRA、更不做全量微调。做法是:在 LLaVA 的词表里手动加一个新 token,只训练这个新 token 的嵌入(以及 lm-head 相关部分),冻结其余全部 7B 参数。原文的理由很清楚:这相当于在词表里训练一个"只和下游任务相关的额外 token",完全不改动 LLaVA 本身的泛化能力,从而更好地保住慢脑的通用理解力。
输出:一个 4096 维的 latent 目标向量。
LLaVA:一个开源的视觉语言模型,把图像投影进语言模型的嵌入空间,实现图文联合理解。这里当"慢脑"用。
prompt tuning vs LoRA vs 全量微调:全量微调改所有参数(贵、易破坏泛化);LoRA 只训低秩增量(省一些);prompt tuning 更极致——只训几个新 token 的嵌入,主干完全冻结。
所以这一节是想说:慢脑用冻结的 LLaVA-7B 加一个可训练的
5.2 桥接:latent token → 线性投影(4096 → 512)
类比:主厨和学徒说的不是同一种"行话"——主厨脑子里的想法是 4096 维,学徒只能听懂 512 维。中间需要一个"翻译"把话转成学徒能消化的格式。
输入:慢脑输出的 4096 维 latent。
处理:一个线性投影层把 4096 维降到 512 维,正好对上 3D Diffuser Actor 的输入维度。关键做法——这个投影替换掉了 3DDA 原来的文本编码器。也就是说,快手本来是靠文本编码器理解指令的,现在改成直接吃慢脑的 latent,语义信息更丰富、更连续(不经过文字这道离散化的弯路)。
输出:512 维的条件向量,喂给快手当指令。
一个重要的工程细节(来自维度 6 的实证):当快手是预训练模型时,先"预对齐(pre-alignment)"投影层、暂不训练慢脑,非常重要。如果一上来就把慢脑和快手一起解冻联合训练,梯度会互相打架、训练不稳。原文的做法是先花 2000 步做预对齐,让投影层先学会"把慢脑的话翻译成快手能懂的格式",再进入第二阶段训练(一直到 100000 步)。
所以这一节是想说:桥接用一层线性投影(4096→512)替换掉快手的文本编码器,让快手直接吃慢脑的连续 latent;而"先预对齐投影、再联合训练"是让这个桥接稳定收敛的关键工程技巧。
5.3 System 1 快手:预训练的 3D Diffuser Actor
类比:手快的学徒,专门负责切配翻炒——不用管菜单怎么读,主厨给个信号,它就飞快执行。
输入:RGB 图像、点云(3D 场景表示)、本体感知(proprioception,机器人自身关节状态)、以及慢脑传来的 latent 条件。
处理:3D Diffuser Actor(3DDA)是一个基于 Transformer 的扩散策略——通过多层交叉注意力(cross-attention)把各种条件信息(3D 场景、本体感知、慢脑的 latent)融合进去,然后用扩散过程从噪声"去噪"出一段连续动作。关键是它在 3D 空间做扩散(结合 RGB 特征和点云几何),比纯 2D 的策略更懂空间关系。OpenHelix 用预训练的 3DDA(取其第 65000 次迭代的 checkpoint 当起点)再微调,而不是从零训。
输出:连续动作(末端位姿 / 关节增量)。
扩散策略(Diffusion Policy):把"预测动作"变成"从一团噪声里去噪出动作序列",擅长处理"同一场景下有多种合理动作"的多模态情况。
3D Diffuser Actor:一个在 3D 场景表示上做扩散的动作策略,用点云 + RGB + 交叉注意力条件化生成动作。
为什么用预训练而非从零训:原文维度 5 的实证给了答案——预训练初始化明显优于从零训(项目页数据:单任务成功率 96% vs 89%)。预训练的快手已经会基本的动作技能,微调只需教它"听慢脑的 latent",事半功倍。
所以这一节是想说:快手用预训练的 3D Diffuser Actor,通过交叉注意力吃进 3D 场景、本体感知和慢脑 latent,用扩散生成连续动作;从预训练微调比从零训好得多。
5.4 辅助任务:逼慢脑真的做推理
类比:给主厨单独出一张考卷——不光要他给学徒下指令,还要他自己也能"说出这道菜该怎么做",逼他真的动脑,而不是随口应付。
输入:慢脑的 latent 嵌入。
处理:加一个辅助任务,要求慢脑从它的 latent 嵌入直接预测动作(而不是只把 latent 传给快手、由快手的损失间接训练它)。这相当于给慢脑一个额外的监督信号,强迫它输出的 latent 里真的包含了"看懂场景、推理出动作方向"的信息。
输出:一个额外的动作预测(训练时用,推理时可不用),以及被"逼着做推理"的更好的 latent。
为什么关键:如果没有辅助任务,慢脑可能学会"偷懒"——输出一个能让快手凑合工作但并没真正理解画面的 latent。原文和项目页都强调,辅助任务"对性能至关重要",能显著提升成功率。它解决的是双系统的一个隐患:慢脑可能对视觉场景不敏感(原文在异步实验里发现,即使慢脑很久才更新一次性能也不掉,反过来说明当前慢脑对场景变化本就不太敏感——辅助任务正是想缓解这个)。
所以这一节是想说:辅助任务直接要求慢脑从 latent 预测动作,逼它真的做多模态推理而非敷衍,是 OpenHelix 提性能的关键一招。
5.5 异步推理:慢脑低频、快手高频
类比:主厨在后厨慢慢琢磨菜单,学徒不会傻站着等他想完——学徒一直按上一条指示翻炒,主厨想好了再更新指令。
输入:慢脑的 latent(低频更新)+ 实时观测(快手高频接收)。
处理:部署时慢脑和快手异步运行。慢脑每 N 步才更新一次 latent 目标,快手在两次更新之间一直高频执行。原文做了系统实验:在 CALVIN-D 上把 N 从 1 变到 60(3DDA 单条指令的最大动作时长就是 60 环境步),测性能怎么变。
输出:连续的机器人控制。
惊人发现:性能在 N=1 到 60 的整个范围内出奇地稳定,即使在动态环境下。N=60(慢脑几乎只在开头想一次)性能才掉约 3%。原文对此的解读很坦诚且深刻:这"有点出乎意料",说明当前的 MLLM 对视觉场景变化相当不敏感——直觉上你以为慢脑更新越勤越能适应动态变化,但实验说明不是。这既是好消息(可以把慢脑放在远端服务器上低频跑、快手放在边缘设备高频跑,工程上很实用),也暴露了一个问题(慢脑的视觉推理还不够"活",这正是辅助任务想改进的方向)。
所以这一节是想说:异步推理让慢脑低频、快手高频,实测性能在慢脑更新间隔拉到 60 步时才掉约 3%——这既证明了双系统工程上可落地,也揭示了当前 MLLM 对场景变化不够敏感的隐忧。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【OpenHelix · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

6. 关键数字(What works)
评测环境:CALVIN ABC→D(语言条件长程操作 benchmark,连续完成 5 个任务),指标是"连续完成 1/2/3/4/5 个任务的成功率(%)"和"平均完成任务数 Avg. Len(满分 5)"。此外还有增强版 CALVIN-D(动态物体)和 CALVIN-E(富语言指令)。
6.1 快手训练策略:预训练 vs 从零(维度 5)
| 快手训练方式 | 单任务成功率 |
|---|---|
| 预训练初始化 + 微调 | 96%(项目页) |
| 从零训练 | 89%(项目页) |
6.2 慢脑训练策略 + 整合策略消融(CALVIN,Avg. Len 满分 5)
| 慢脑训练 | 是否 CLIP Loss | 1 | 2 | 3 | 4 | 5 | Avg. Len |
|---|---|---|---|---|---|---|---|
| Fine-tuning | 有 | 96 | 83 | 68 | 58 | 48 | 3.53 |
| Fine-tuning | 无 | 88 | 72 | 56 | 46 | 30 | 3.13 |
| Frozen | 有 | 94 | 80 | 64 | 51 | 41 | 3.30 |
| Frozen | 无 | 90 | 74 | 61 | 54 | 40 | 3.33 |
| Prompt-tuning | 有 | 94 | 78 | 62 | 52 | 42 | 3.28 |
| Prompt-tuning | 无 | 94 | 77 | 67 | 60 | 47 | 3.45 |
6.3 完整模型的逐组件消融(CALVIN,Avg. Len 满分 5)
| 配置 | 1 | 2 | 3 | 4 | 5 | Avg. Len |
|---|---|---|---|---|---|---|
| 仅快手(3DDA) | 92.2 | 78.7 | 63.9 | 51.2 | 41.2 | 3.27 |
| + 慢脑(prompt tuning) | 92.2 | 79.2 | 65.0 | 52.9 | 40.9 | 3.30 |
| + 辅助任务 + 异步(N=10) | 93.3 | 81.8 | 67.9 | 56.6 | 46.0 | 3.45 |
| + 辅助任务 + 异步(N=60) | 92.8 | 79.7 | 67.5 | 57.3 | 46.9 | 3.44 |
6.4 关键实证结论
| 设计问题 | 结论 |
|---|---|
| 慢脑该怎么训? | Prompt-tuning(无 CLIP loss)在保泛化前提下表现好(Avg. 3.45) |
| CLIP loss 好不好? | 全量微调时有帮助,但会限制泛化;prompt tuning 时反而不加更好 |
| 快手预训练 vs 从零? | 预训练明显更好(96% vs 89%) |
| 投影层怎么训? | 快手预训练时必须先"预对齐"投影层,否则联合训练不稳 |
| 辅助任务有用吗? | 有用且关键,显著提升成功率 |
| 异步影响大吗? | 出奇地小——N 拉到 60 才掉约 3% |
生活语言解读:CALVIN ABC→D 是长程任务——要连续完成 5 个动作,Avg. Len 越接近 5 越好。6.3 表讲了一个清晰的故事:从"仅快手"(3.27)到"加慢脑"(3.30,提升有限)再到"加辅助任务 + 异步"(3.45),辅助任务才是真正带来提升的那一步——光把慢脑接上去、不逼它认真推理,几乎没用。6.2 表则揭示 CLIP loss 这个 LCB 用过的技巧其实有争议:在 prompt tuning 下反而是"不加 CLIP loss"更好(3.45 vs 3.28)。6.4 的异步结论最反直觉——慢脑几乎不用勤更新,这对"慢脑跑服务器、快手跑边缘设备"的实际部署是大好消息。
所以这一节是想说:数字证明了三条关键结论——快手要用预训练、慢脑用 prompt tuning + 辅助任务才有货、异步几乎不掉分;而辅助任务是提升的真正来源。
7. 实验结果说明了什么
原文的实证围绕它梳理的设计维度,回答了几个"到底该怎么设计双系统"的问题:
问题一:慢脑该冻结、微调还是 prompt tuning? 6.2 表对比三种。全量微调 + CLIP loss 分数最高(Avg. 3.53),但原文警告全量微调会破坏 LLaVA 的泛化。Prompt tuning(不加 CLIP loss)拿到 3.45,几乎追平、却完整保住了泛化能力和极低的训练成本。结论:prompt tuning 是"性能 - 泛化 - 成本"的最佳平衡点——这也是 OpenHelix 最终的选择。
问题二:LCB 的 CLIP loss 技巧到底好不好? 原文批评 CLIP loss 会把 latent 强行拉向原始文本嵌入,反而限制模型只能处理下游训练过的情况、抵消了引入 MLLM 泛化的初衷。6.2 表印证:在 prompt tuning 下不加 CLIP loss(3.45)比加(3.28)更好。结论:不要用 CLIP loss 硬约束 latent,让它自由些反而好。
问题三:快手从零训还是用预训练? 预训练明显胜出(96% vs 89% 单任务)。原文还发现:单系统工作(如 RoboFlamingo)在动态的 CALVIN-D 上直接崩溃(成功率归零)——因为它依赖处理前 6 帧图像得到 latent,动态场景下这些 latent 变得不稳定。这既说明预训练快手更强,也论证了为什么需要双系统(单系统在动态场景不鲁棒)。
问题四:辅助任务值不值? 6.3 表说明:只加慢脑几乎不提升(3.27→3.30),加了辅助任务才跳到 3.45。结论:辅助任务是让慢脑"真的推理"而非敷衍的关键,是性能提升的主要来源。
问题五:异步会不会损性能? 出乎意料地不会——N 从 1 到 60 性能基本稳定。原文的深刻解读:这说明当前 MLLM 对视觉场景变化不够敏感。这是一个诚实且有价值的负面发现——它既给了工程便利(慢脑可低频跑),也指出了下一步该改进的方向(让慢脑的视觉推理更"活")。
所以这一节是想说:实验系统回答了"慢脑怎么训、CLIP loss 要不要、快手要不要预训练、辅助任务值不值、异步影响多大"五个设计问题,其中"prompt tuning + 辅助任务"是核心正面结论,"MLLM 对场景不敏感"是重要负面发现。
8. 你应该懂的几个新词
VLA(Vision-Language-Action):把视觉语言模型的能力扩展到输出机器人动作的模型类别。可以理解为"会看会听、还会动手的机器人控制器"。
双系统 / System 1 + System 2:源自 Kahneman 的双过程理论。System 2 慢思考、深思熟虑(对应大 VLM);System 1 快反射、直觉(对应小动作策略)。机器人里映射为"高层慢脑 + 低层快手"。
MLLM(Multimodal Large Language Model,多模态大语言模型):能同时处理图像和文本的大模型,如 LLaVA。这里当慢脑。
LLaVA:一个开源视觉语言模型,把图像投影进语言模型的嵌入空间实现图文理解。OpenHelix 用 LLaVA-7B 当 System 2。
latent token / latent 目标:连续的隐变量向量,用来在两个网络间传递信息。比文本通道带宽更高、比离散动作 token 更连续。OpenHelix 用一个 <ACT> token 的输出当 latent。
prompt tuning(提示微调):只训练少量新加的 token 嵌入、冻结主干的一种极省参数的微调方式。相比 LoRA 更轻、更能保住原模型泛化。
3D Diffuser Actor(3DDA):一个在 3D 场景表示(RGB + 点云)上做扩散的动作策略。OpenHelix 用它当 System 1。
扩散策略(Diffusion Policy):把动作生成建模为"从噪声去噪出动作",擅长处理多模态动作分布。
辅助任务(auxiliary task):主任务之外额外加的监督信号。这里指"让慢脑从 latent 直接预测动作",逼它真做推理。
异步推理(asynchronous inference):两个模型按不同频率运行、互不阻塞。慢脑低频、快手高频。是双系统能跑得快的工程基础。
CALVIN / CALVIN-D / CALVIN-E:语言条件长程操作的仿真 benchmark。ABC→D 指在 ABC 环境训练、在 D 环境测试。CALVIN-D 是动态物体版、CALVIN-E 是富语言指令版(本文新增的两个增强 benchmark)。
Avg. Len:CALVIN 上"平均连续完成的任务数",满分 5,越高越好。
所以这一节是想说:读懂本文的关键是把"双系统术语(System 1/2、MLLM、latent、异步)""训练术语(prompt tuning、辅助任务、扩散策略)""评测术语(CALVIN、Avg. Len)"三套词摸一遍。
9. 它有什么搞不定的
MLLM 对视觉场景不够敏感:这是原文自己发现的最大问题——异步实验显示慢脑更新频率几乎不影响性能,反过来说明慢脑没在"实时看懂场景变化"。也就是说慢脑的视觉推理还不够"活",双系统的潜力没完全发挥。辅助任务是缓解手段,但没根治。
主要在仿真(CALVIN)上验证:原文明确说真机实验"稍后补充"(will be supplemented later)。CALVIN 是仿真 benchmark,仿真里的结论能否迁移到真机、真机上的延迟优势有多大,本文还没给出。
只标准化研究了部分维度:原文只重点实证了维度 4、5、6(慢脑训练、快手训练、整合策略),维度 1、2、3、7(MLLM 选型、policy 选型、latent 表示、异步策略)大多固定住了,没充分探索。比如"到底哪个 MLLM 最适合、latent 用哪一层最好"这些关键问题留待未来。
沿用 LCB 的部分设定、有历史包袱:为了和 LCB 公平对比,本文用 LLaVA 1.0、3DDA 等相对早的组件。用更新更强的 MLLM/policy 会不会改变结论,是开放问题。
数据处理有简化:原文提到没有实现 LCB 那种"在 token 前构造对话式响应",只是简单地把 <ACT> token 拼在指令后面,说"虽然没实现这个功能但性能还行",留待未来完善。
异步的更深层机制未探明:为什么慢脑低频也不掉分?原文给了"MLLM 不敏感"的解释,但这背后是模型能力问题、任务特性问题、还是架构问题,没有彻底厘清。
持续更新中的项目:原文自陈这是一个会持续更新实验结论和模型的项目,意味着当前版本的结论可能被后续迭代修正——它更像一个"活的研究平台"而非定论。
所以这一节是想说:OpenHelix 的强项是把双系统开源化并做系统实证,但代价是慢脑视觉推理不够活、只在仿真验证、只探索了部分维度、且是持续更新的项目——这些都是明确的开放问题。
10. 它和别的几篇是什么关系
对标 Figure Helix(闭源):名字直接致敬,目标就是做开源版的 Helix——把工业界不公开的双系统架构复现出来给社区。
综述并对比 LCB / RoboDual / HiRT(已有双系统工作):LCB 是双系统 VLA 开创者(LLaVA + 3DDA + LoRA + CLIP loss),OpenHelix 在它基础上改进(prompt tuning 替 LoRA、去掉 CLIP loss、加辅助任务)。RoboDual(OpenVLA + DiT)、HiRT(InstructBLIP + RT-1)是另外两条设计路线,原文把它们按 7 维度并列对比。
对比单体 VLA(OpenVLA / RT-2):见 openvla.md。OpenHelix 是对"单体 VLA 太慢"的回应——如果你读过 OpenVLA,这篇能告诉你为什么社区在转向双系统。
对标 Physical Intelligence π0 / π0.5:另一条工业界双系统路线,π0 用流匹配(flow matching)做动作头。见 pi0.md、pi05.md。OpenHelix 的快手用扩散(3DDA)。
延续 SayCan / Code as Policies 的分层思路:但前者用文本接口做高层规划,OpenHelix 用连续 latent 接口,工程上更紧、损耗更小。见 saycan.md、code-as-policies.md。
快手用了 3D Diffuser Actor:和扩散策略一脉相承。见 diffusion-policy.md、3d-diffusion-policy.md——理解扩散策略能帮你懂 OpenHelix 的快手怎么生成动作。
所以这一节是想说:OpenHelix 站在"开源复现工业界双系统"的定位上,综述并改进了 LCB/RoboDual/HiRT,对标 Figure Helix 和 π0,是理解 2025 年双系统 VLA 赛道共识的社区视角样本。
11. 和本导读的关系
本篇对应导读 Ch12: OpenVLA / VLAs / MLA。Ch12 讲的是 VLA 从"单体架构"向"分层/双系统架构"演进的脉络。OpenHelix 正是这个演进的关键节点——它系统地论证了"为什么要双系统"(单体太慢、单系统在动态场景崩)以及"双系统该怎么设计"(prompt tuning、辅助任务、异步)。
Ch12 的一个核心观点是:机器人系统的瓶颈往往不在某个模型多强,而在两个模块怎么对接。OpenHelix 是这个观点的最佳教材——它花了大量篇幅研究"latent 用什么表示、投影层怎么训、慢脑怎么冻",也就是接口设计 > 模型选型。读它能强化你对"系统集成本身就是研究"的理解。
Ch12 还会串起 RT-2(单体 VLA 起点)、OpenVLA(开源单体)、π0(双系统 + flow matching)等。OpenHelix 补上了"开源双系统 + 系统消融"这一块,让你看到从"一个大模型直出动作"到"慢脑快手分工"的完整思想演进。它还引入了 Kahneman 双过程理论作为架构的认知科学依据,这也呼应了 Ch12 讨论的"机器人认知架构"话题。
从阅读路线看,建议先读 openvla.md(单体 VLA)理解"为什么慢",再读 octo.md(通用策略 + 扩散头)理解动作头,然后读本篇看双系统怎么把慢脑快手拼起来,最后对照 pi0.md 看工业界的另一条双系统路线。
所以这一节是想说:本篇是 Ch12 里"开源双系统 VLA + 接口设计研究"的代表,印证了"接口设计 > 模型选型"和"VLA 从单体走向分层"两个核心主题。
12. 思考题
Q1:为什么慢脑和快手之间用连续的 latent token 通信,而不是让慢脑生成文字指令给快手?
提示
如果用文字,慢脑要先把脑内的画面/意图转成离散的字(有信息损耗、有延迟),快手再把字读回向量。连续 latent 直接是向量,带宽更高、更连续、没有离散化损失。想想 OpenHelix 为什么用一个线性投影替换掉 3DDA 原本的文本编码器——是不是就是为了绕开"文字"这道弯?
Q2:OpenHelix 用 prompt tuning(只训一个 token、冻结 7B 主干)而不是全量微调。全量微调分数其实更高(3.53 vs 3.45),为什么还选 prompt tuning?
提示
分数不是唯一标准。全量微调会改动 LLaVA 的全部参数,可能破坏它在互联网数据上学到的泛化能力(对新物体、新表述的理解)。CALVIN 分数高不代表泛化好。想想 prompt tuning 保住了什么?训练成本又省了多少(只训一个 token vs 训 7B 参数)?在"训练集分数"和"泛化 + 成本"之间怎么权衡?
Q3:辅助任务"让慢脑从 latent 直接预测动作"为什么能显著提性能?没有它慢脑会怎样"偷懒"?
提示
如果只靠下游动作损失间接训练慢脑,慢脑可能学会输出一个"能让快手勉强工作、但没真正理解画面"的 latent(走过场)。辅助任务直接要求"从这个 latent 就能预测出动作",相当于给慢脑单独出考卷,逼它真的看懂场景、真的推理。想想 6.3 表里"只加慢脑"几乎不提升、"加辅助任务"才跳一大截,说明了什么?
Q4:异步实验发现慢脑更新频率从 N=1 到 N=60 性能几乎不变。原文说这"有点出乎意料"。这个发现是好消息还是坏消息?
提示
两面看。好消息:工程上可以把慢脑放远端服务器低频跑、快手放边缘设备高频跑,部署很实用。坏消息:它说明当前 MLLM 对视觉场景变化不敏感——直觉上动态环境里慢脑该勤更新才对,但它不勤更新也不掉分,反而暴露了慢脑"没在实时看懂场景"。想想这对"双系统的潜力发挥了没有"意味着什么?
Q5:原文批评 LCB 用 CLIP loss 约束 latent。为什么"把 latent 拉向原始文本 CLIP 嵌入"反而会限制模型?
提示
CLIP loss 强迫 latent 去贴近"训练时见过的文本嵌入"。这等于把 latent 锁在了下游训练过的指令范围里,遇到新表述就没法泛化——而引入大 MLLM 的初衷正是为了泛化。想想这是不是"为了对齐而牺牲了泛化"?6.2 表里 prompt tuning 下不加 CLIP loss 更好,是否印证了这个批评?
Q6:为什么快手要用预训练的 3DDA 而不是从零训练?预训练的快手已经会了什么,微调只需教它什么?
提示
预训练的 3DDA 已经会基本动作技能(怎么抓、怎么移动)。从零训练要同时学"动作技能"和"听慢脑 latent"两件事,容易过拟合、收敛慢。微调预训练模型只需教它"听懂慢脑的新 latent 条件"这一件事。想想 96% vs 89% 这个差距,以及为什么"站在巨人肩膀上"更省事。
Q7:OpenHelix 主要在 CALVIN 仿真上验证,真机实验"稍后补充"。仿真上的双系统结论(尤其是异步的延迟优势)能直接迁移到真机吗?有哪些风险?
提示
仿真里没有真实的传感器噪声、通信延迟、执行误差。双系统的核心卖点之一是"异步降低延迟"——但这个优势只有在真机闭环里、慢脑真的跑在慢硬件上时才看得出来。想想仿真里"慢脑低频也不掉分"是因为任务本身对场景不敏感,还是因为慢脑真的够用?真机的动态性和延迟会不会让结论变化?
13. 一些好奇心问答(FAQ)
Q1:OpenHelix 和 Figure 的 Helix 是一回事吗?
不是。Helix 是 Figure 公司的闭源双系统 VLA,只有 demo 视频和博客。OpenHelix 是学术界做的开源版本,名字致敬 Helix,目标是把这类架构复现出来、开源、并系统研究其设计选择。你可以把 OpenHelix 理解为"社区对工业界双系统的逆向工程 + 公开消融"。
Q2:它提出了全新算法吗?
严格说没有。它的贡献是"综述 + 实证 + 开源模型"三合一——把已有双系统架构按 7 维度梳理对比、逐一做消融、再给一个简洁开源实现。价值在于"把设计空间研究清楚并开源",而不是发明新组件。这类工作对想自己搭 VLA 的人价值极高。
Q3:为什么慢脑用 7B 这么大,快手却小得多?
因为分工不同。慢脑要"听懂复杂指令、理解场景",需要大模型的知识和泛化;快手只要"根据慢脑的信号快速生成动作",小模型就够、还能跑得快。这正是双系统的精髓——把"要聪明"和"要快"解耦,各用合适大小的模型。
Q4:latent 就是慢脑说的"一句话"吗?
可以这么理解,但它不是文字,是一个 512 维(投影后)的连续向量,浓缩了"该往哪、抓什么"的高层意图。比文字带宽更高、更连续。慢脑把这个向量传给快手,快手据此生成具体动作。
Q5:异步推理为什么对部署这么重要?
如果慢脑(7B,慢)和快手(小,快)必须同步跑,整个系统的速度会被最慢的慢脑拖垮,双系统就失去意义。异步让快手一直高频跑、慢脑偶尔更新目标,才能既聪明又快。OpenHelix 实测慢脑每 60 步更新一次也几乎不掉分,意味着可以把慢脑放远端服务器、快手放机器人本地。
Q6:CALVIN 的 Avg. Len 3.45 是什么水平?
CALVIN ABC→D 要连续完成 5 个任务,Avg. Len 是平均完成数(满分 5)。3.45 意味着平均能连续做完约 3.5 个任务,在这个有挑战性的长程 benchmark 上属于强性能。但要注意这是仿真结果,真机表现待验证。
Q7:我想自己搭一个 VLA,OpenHelix 值得当起点吗?
非常值得。它完全开源(代码 + 模型),而且把"每个设计选择的利弊"都实证过了——你能直接知道慢脑该用 prompt tuning、快手该用预训练、要加辅助任务、异步可以拉很松。比从零摸索省很多时间。它明确定位为"低成本、可持续更新"的开源起点。
所以这一节是想说:OpenHelix 的价值在于"开源 + 把设计空间研究透",它是想搭双系统 VLA 或理解这个赛道当前共识的人最实用的起点。
14. 如果你想再深入
Figure AI, "Helix" 博客 — OpenHelix 对标的闭源工业系统。看它的 demo 能理解双系统在真机上想达到的效果,再看 OpenHelix 怎么开源复现。
LCB(Language-Conditioned ... / Latent Codes as Bridges) — 双系统 VLA 的开创者,LLaVA + 3DDA + LoRA + CLIP loss。OpenHelix 大量对比和改进它,是理解本文的前置。
Ke et al., 2024, "3D Diffuser Actor: Policy Diffusion with 3D Scene Representations" — OpenHelix 的快手(System 1)。想懂动作怎么生成,必读。本仓库 diffusion-policy.md、3d-diffusion-policy.md 是相关背景。
Liu et al., 2023, "LLaVA" — OpenHelix 的慢脑(System 2)。本仓库 llava.md 有精读。理解 LLaVA 才懂 prompt tuning 那个 token 在改什么。
Kahneman, "Thinking, Fast and Slow" — 双过程理论的科普源头。System 1 快而直觉、System 2 慢而深思——这是所有双系统机器人架构的认知科学依据。
OpenHelix 项目页与 GitHub — https://openhelix-robot.github.io/ 和 https://github.com/OpenHelix-robot/OpenHelix/ 。有代码、模型、持续更新的实验结论。想复现或当 baseline,直接 clone。
CALVIN benchmark — 本文的主要评测环境。想复现或做长程语言操作研究,先熟悉 CALVIN 的任务定义和 ABC→D 设定。
所以这一节是想说:要理解目标读 Helix;要理解前身读 LCB;要理解两个子系统读 3D Diffuser Actor 和 LLaVA;要理解认知依据读 Kahneman;要动手上项目页和 CALVIN。
15. 原文信息
本文(笔记所评论文)
@article{cui2025openhelix,
title={OpenHelix: A Short Survey, Empirical Analysis, and Open-Source Dual-System VLA Model for Robotic Manipulation},
author={Cui, Can and Ding, Pengxiang and Song, Wenxuan and Bai, Shuanghao and Tong, Xinyang and Ge, Zirui and Suo, Runze and Zhou, Wanqi and Liu, Yang and Jia, Baozhu and Zhao, Han and Huang, Siteng and Wang, Donglin},
journal={arXiv preprint arXiv:2505.03912},
year={2025}
}
关键子模块(3D Diffuser Actor)
@article{ke20243ddiffuseractor,
title={3D Diffuser Actor: Policy Diffusion with 3D Scene Representations},
author={Ke, Tsung-Wei and Gkanatsios, Nikolaos and Fragkiadaki, Katerina},
journal={arXiv preprint arXiv:2402.10885},
year={2024}
}
相关链接
- 论文:arXiv:2505.03912
- 项目页:https://openhelix-robot.github.io/
- 代码:https://github.com/OpenHelix-robot/OpenHelix/
- 慢脑精读:llava.md
- 导读章节:Ch12: OpenVLA / VLAs / MLA
笔记结束。如果你只记住一件事:双系统 VLA 的性能瓶颈不在慢脑或快手单独多强,而在"怎么把它们接起来"——OpenHelix 用 prompt tuning + 辅助任务 + 异步这套简洁配方,把工业界闭源的"慢脑快手"架构开源化,并第一次把每个设计旋钮的利弊都实证了一遍。
◼
引用本笔记 / Cite this note
@online{eai_openhelix_2026,
title = {(readable note) OpenHelix},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2025 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/openhelix/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?