Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 111

Octo: An Open-Source Generalist Robot Policy

29 min read · 9991 字 · ⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过机器人学习、只知道 ChatGPT"的读者看的精读笔记。所有术语都翻成人话,类比来自日常生活。数字全部来自原文,没有的地方会写明"原文未报告"。

   输入(可插拔的 token)
   ┌────────────┬────────────┬─────────────┐
   │ 语言指令    │ 目标图像    │ 观测(多相机)│
   │ "放红方块" │ 目标状态照   │ 第三人称+腕部 │
   └─────┬──────┴──────┬─────┴──────┬──────┘
      T5 编码器    浅层卷积→patch  浅层卷积→patch
         │            │            │
         ▼            ▼            ▼
   ┌──────────────────────────────────────┐
   │ Transformer 主干(block-wise 掩码)     │
   │  27M(Small) / 93M(Base)               │
   │  插入 readout token(只读不被读)        │
   └──────────────────┬───────────────────┘
                      ▼
   ┌──────────────────────────────────────┐
   │ 扩散动作头(Diffusion head, DDPM)      │
   │  主干只前向一次,去噪全在小头里做         │
   └──────────────────┬───────────────────┘
                      ▼
   动作块(action chunk,未来 K 步连续动作)

   训练:800k 条 OXE 轨迹(25 个数据集)
   下游:~100 条新数据 + 几小时微调 → 适配新机器人/新动作空间

1. 一句话讲什么(TL;DR)

第一个真正开源的通用机器人"大脑":先看 80 万段机器人录像学会基础动作,你下载回来、在自己机器人上收约 100 条新数据、微调几小时,就能让它学新活——而且模型权重、训练代码、数据流水线全部公开。

更具体一点:Octo 是一个基于 Transformer 的通用机器人策略(generalist robot policy, GRP),在 Open X-Embodiment(OXE)数据集的 80 万条轨迹(25 个子数据集)上预训练。它的设计核心是模块化 + 灵活——输入(语言指令、目标图像、多路相机观测)和输出(不同机器人的动作空间)都做成可插拔的 token 化模块,所以换个机器人只要加个 adapter 再微调。动作头用扩散(diffusion)生成连续、多模态的动作块。它提供 27M(Small)和 93M(Base)两个尺寸的预训练权重。在 4 个机构的 9 个真机平台上验证,微调 Octo 比从零训练平均高出 52%。最重要的是——它是第一个能微调到新观测/新动作空间、且完全开源(权重 + 代码 + 数据)的通用机器人策略

所以这一节是想说:Octo 是机器人版的"可下载、可微调的开源基座模型"——先在海量跨机器人数据上学通用动作,再让任何人用少量数据快速适配到自己的机器人。


2. 这是个什么场景

想象你开了一家连锁咖啡店,全国几百家分店,每家的咖啡机牌子、吧台高度、杯子大小都不一样。

以前店长招新店员的做法是:每家店从零教,从"杯子放哪""怎么按按钮"开始练。学得慢,而且这个店员调到隔壁分店,又得重学一遍。这就是机器人学习长期的痛:每来一个新机器人、新任务,就要从头收集几千条数据、从头训练一个策略,迁移性差、成本高。

Octo 想做的事,跟 ChatGPT 学文字是一个套路——先让一个"通用咖啡师"看完全世界所有咖啡店的工作录像,把"抓杯子大概什么手感、按按钮大概什么力度"这种底层感觉学透。然后每家分店拿这个"已经懂基础"的咖啡师,做几小时入职培训(行话叫 fine-tune,微调),就能上岗。原文的原话是:与其从零训练,不如用在多样机器人数据上预训练的通用策略做初始化,只要少量领域内数据就能微调、还能广泛泛化。

而机器人比语言更难的地方在于:不同机器人的"身体"完全不同——机械臂几个关节、什么夹爪、几个相机、动作空间是末端位姿还是关节角,全都不一样。原文点破了这个独特挑战:训练一个统一的控制策略,必须处理不同的机器人形态(embodiment)、传感器配置、动作空间、任务定义、环境、算力预算。这就是为什么"机器人版的 GPT"比"文本版的 GPT"难做得多。

最关键的一点是:这个"基础咖啡师"是公开放在网上的,谁都能下载、谁都能在它身上继续教自己的活。在 2024 年之前,机器人圈几乎没有这种东西——大公司(Google 的 RT-1/RT-2)训了也不放出来,外部研究者只能眼馋。

所以这一节是想说:本文瞄准的是"机器人学习没有可下载、可微调的通用基座"这个空白——它要造一个像 ChatGPT 一样先学通用能力、再快速适配到各种机器人的开源策略。


Octo — 场景示意:这论文要解决的现实问题
Plate Nº IOcto — 场景示意:这论文要解决的现实问题

3. 之前的人怎么做的,为什么不够好

  • RT-1 / RT-2(Google):在大规模机器人数据上训了 Transformer 策略,效果强,但权重不开源,外部研究者只能看论文眼馋,没法在它基础上继续做。RT-2 还是个 55B 参数的巨型 VLM,普通实验室根本跑不起。

  • RT-X / RT-1-X / RT-2-X(跨形态版本):在 Open X-Embodiment 数据上训练、能控制多个机器人,是最接近 Octo 的对比对象。但原文指出它们的关键局限:用户被锁死在预训练时的输入输出格式上——比如只能用单一相机流,不支持微调到新的观测(如力矩传感器)或新的动作空间(如关节控制)。而且它们只在 350K 条 episode 的更受限子集上训练(Octo 用 800k)。

  • 每个实验室各训各的:每来一个新机器人或新任务,从头收数据(几千条起步)、从头训,迁移性差、重复劳动。

  • Diffusion Policy 系列:方法很强(扩散动作头就是从这条线来的),但默认是单任务、小规模训练,没有"通用预训练 + 下游微调"的范式。

  • 用预训练视觉表示(如 VC-1):有人用在大量视频上预训练的视觉编码器 + MLP 动作头。但这只预训练了"看",没预训练"动作策略本身",泛化和数据效率不如端到端预训练的策略。

  • Open X-Embodiment 数据集(同期):22 个机构把机器人数据合并成一个大池子。但它只是数据,没人交付一个"训好的、可继续训的"通用策略——社区有了食材,缺一个做好的、能改的"预制菜"。

核心痛点:社区缺一个机器人版的 BERT/CLIP——能下载、能改、能在同一起点上做公平对比的统一基线。已有的强模型要么闭源、要么锁死输入输出、要么只是数据。

所以这一节是想说:前人要么闭源(RT-2)、要么锁死输入输出(RT-X)、要么只给数据不给模型(OXE);Octo 的空位是"一个开源、可微调到任意新观测/动作空间的通用策略基座"。


4. 这篇论文的新想法

三个核心设计选择 + 一个工程层面的关键决策:

  1. 架构上选 Transformer + 模块化 token 化输入输出:不写死"必须用 RGB + 末端位姿",而是把每种观测(图像、语言、目标图)和每种动作空间(末端、关节、移动底盘)都做成可插拔的 token 化模块。新机器人来了,只要写一个新的输入 tokenizer 或输出 head,主干几乎不用动。原文强调:切换观测或任务不需要重新初始化模型的大部分参数——这正是它区别于 RT-X"锁死输入"的关键。

  2. 目标可以是语言也可以是图像:可以告诉它"把红色方块放进盒子"(语言条件),也可以丢一张"目标状态的照片"让它复现(goal-image 条件)。两种模态同时训练,训练时随机把语言或目标图置零,让模型学会用任意一种条件工作。

  3. 动作头用扩散(diffusion action head):输出动作不再是回归一个数或离散化成 token,而是用扩散从噪声"去噪"出一段未来动作序列(action chunk)。原文实测:扩散头在零样本和微调评估上都优于 MSE 回归头和离散化动作头,稳定性和多模态性更好——这一点继承自 Diffusion Policy。

加上真正开源这个关键工程决策:模型权重(27M / 93M 两个尺寸)、训练代码、数据处理流水线全部公开。原文明确说 Octo 是第一个能有效微调到新观测和动作空间、且完全开源的通用机器人操作策略。这让社区第一次能在同一个起点上做对比实验、快速搭自己的机器人。

等等,先慢一拍——为什么"模块化"这么重要? 因为机器人世界的输入输出实在太杂了。RT-X 那种"固定输入格式"的模型,你想给机器人加个腕部相机、或者从末端控制换成关节控制,就得大改甚至重训。Octo 把每种输入输出都做成"积木",换机器人就像换乐高零件——加一块、拆一块,主体不动。这个"可插拔"设计正是它能被广泛复用的根本。

所以这一节是想说:本文的新意是"模块化 token 化架构(可插拔输入输出)+ 语言/图像双条件 + 扩散动作头 + 完全开源"四件套的独特组合,让通用策略第一次能被任何人下载并适配到任意新机器人。


5. 它分几步做的(方法)

Octo 本质是一个把"任意输入 token → Transformer → 动作输出"的策略 π。核心是三部分:输入 tokenizer、Transformer 主干(带 readout token)、扩散动作头。下面逐一拆开,再讲数据和训练。

5.1 输入端的 token 化:把不同模态翻译成同一种"中间语"

类比:联合国开会,各国代表说不同语言,先都翻译成同一种工作语言,大家才能一起讨论。机器人面对的输入也很杂——摄像头画面、口头指令、一张"目标长这样"的照片。

输入:语言指令 ℓ、目标图像 g、观测序列 o(多路相机流,如第三人称 + 腕部相机)。

处理:用各自的模态专属 tokenizer 把它们都变成同一种格式的 token:

  • 语言:过一个预训练的语言编码器(T5 系列)变成 token。
  • 图像观测和目标图:过一个浅层卷积栈,再切成一串展平的 patch(借鉴 ViT 的做法)。
  • 给所有 token 加上可学习的位置嵌入,按 [任务 token, 观测 token_1, 观测 token_2, ...] 的顺序拼成一长串。

输出:一长串统一格式的 token,喂给 Transformer 主干。

为什么这步关键:好处是有的训练数据只有语言、有的只有目标图,都能丢进同一个模型一起训。更重要的是——换个机器人有新的传感器(比如多一个腕部相机),只要写一个新的 tokenizer 加进去就行,主干不用动。这是模块化的入口。

所以这一节是想说:输入 token 化把语言、目标图、多路观测都翻译成统一 token,既让异构数据能混训,又让新传感器能即插即用。

5.2 Transformer 主干与 readout token:理解大脑 + 一个"只读窗口"

类比:主干是个"理解大脑",把所有输入信息消化融合。readout token 像会议记录员——它能听所有人发言(读取信息),但没人会因为它说了什么而改变发言(它不影响别人),最后由它整理出结论交给下一步。

输入:5.1 拼好的 token 序列。

处理:一个标准的 Transformer(GPT 同款架构,分 27M 的 Small 和 93M 的 Base 两个尺寸)。它的注意力用块级掩码(block-wise masking)

  • 观测 token 只能因果地注意到"当前及更早时刻的观测 token"以及任务 token(语言/目标图)。
  • 不存在的观测对应的 token 被完全屏蔽(比如某个数据集没有语言指令,就把语言 token 屏蔽掉)。
  • 额外插入可学习的 readout token T_R——它能注意到序列里它之前的观测和任务 token,但不被任何观测或任务 token 注意到(只读不被读,像旁观者记笔记)。

输出:readout token 对应的嵌入,交给动作头。

为什么这样设计:块级掩码 + readout token 的组合,让模型可以自由地增删观测或任务(微调时加减输入),而不破坏其余部分——这就是"换输入不用重新初始化大部分参数"的实现方式。readout token 类似 BERT 的 [CLS] token,是一个专门用来"汇总并输出"的接口,把主干和动作头解耦。

所以这一节是想说:Transformer 主干用块级掩码处理可增删的 token,用只读的 readout token 作为"汇总接口"输出给动作头——这套设计是模块化和可微调的核心机制。

5.3 扩散动作头:从噪声"去噪"出一段动作

类比:给动作画画的笔。不是直接吐出"下一步该转多少度"这个数字,而是像画家从一团随机涂鸦里逐步修出一幅画——从纯噪声出发,一步步去噪,最终得到一段平滑的未来动作。

输入:readout token 的嵌入 e。

处理:一个条件扩散解码头(conditional diffusion head),用 DDPM(去噪扩散概率模型)从高斯噪声去噪出连续动作。关键工程优化——主干每次预测动作只前向一次,多步去噪过程完全在这个小小的扩散头里做(去噪要迭代很多步,如果每步都跑一遍大主干就太慢了;放在小头里做就快)。用标准的余弦噪声调度,训练时给真实动作加高斯噪声、训练去噪网络 ε_θ 还原。输出的是动作块(action chunk)——一次预测未来 K 步连续动作,而不是只预测下一步。

输出:一段连续的未来动作序列(action chunk)。

为什么用扩散? 因为同一个画面下,机器人合理的动作可能有好几种(左手抓也行、右手抓也行,从左边绕或从右边绕都对)。普通回归方法会被这种"多种正确答案"卡住——它会输出几个答案的平均,结果哪个都不是。扩散正好擅长处理这种多模态分布。原文实测扩散头在零样本和微调上都优于 MSE 回归头和离散化动作 token。

扩散模型(diffusion):原本给 AI 画图用的技术,从一团噪声里逐步"去噪"生成目标。用来生成动作时,能自然处理"同一情况有多种合理动作"的多模态问题。

动作块(action chunk):一次预测未来 K 步动作而非单步,能减少抖动、提升时间一致性,源自 ACT 论文。

所以这一节是想说:扩散动作头从噪声去噪出多步动作块,用小头做多步去噪保证速度,用扩散的多模态特性避免"动作平均"问题——这是 Octo 动作质量的关键。

5.4 预训练数据:80 万条 OXE 轨迹

类比:食材决定菜的上限。Octo 的食材是全世界机器人的操作录像大杂烩。

输入:Open X-Embodiment 数据集里挑出的 25 个子数据集。

处理:约 80 万条机器人操作轨迹——原文称之为"迄今最大的机器人操作数据集"。这些数据高度异构:不同机器人形态、不同场景、不同任务、有的有语言标注有的没有、相机配置也各异。对没有语言标注的数据,就用目标图像条件(goal-image conditioning),从视觉观测里自监督地学控制,减轻语言标注负担。训练用 2 帧观测历史(原文说超过 1 帧额外历史后收益就明显递减),并用事后目标重标注(hindsight goal relabeling)——从轨迹未来随机选一个状态当作目标图,配合常见的图像数据增强。

输出:预训练好的 Octo 权重(27M / 93M)。

为什么这步关键:数据的规模和多样性决定了通用性的上限。800k 的规模 + 25 个数据集的多样性,是 Octo 能"零样本控制多种机器人"的底气。对比 RT-1-X/RT-2-X 只用了 350K 的更受限子集。

所以这一节是想说:Octo 在 80 万条高度异构的 OXE 轨迹上预训练,用目标图条件 + 事后重标注减轻语言标注负担,海量多样数据是它通用性的根基。

5.5 下游微调:约 100 条数据、几小时适配新机器人

类比:预训练好的"通用咖啡师"到你的分店,做几小时入职培训就能上岗——不用从"杯子放哪"重新教。

输入:目标机器人上采的一小批新数据(约 100 条轨迹)。

处理:论文最想让你记住的卖点。下载权重后,给新数据加上合适的输入 tokenizer / 输出 head(比如新增力矩传感器输入、或换成关节位置动作空间),然后微调。所有微调实验用同一套配方和超参:约 100 条轨迹、微调 50k 步、余弦衰减学习率 + 线性预热、更新整个模型(原文发现全量微调比冻结部分参数效果更好)。几小时就能跑完(消费级 GPU 上)。

输出:适配到新机器人/新任务的策略。

为什么这步是灵魂:这是它和 RT-2 类闭源工作差异最大的地方。它证明了"少量数据就能 adapt"——而且是能适配到新观测和新动作空间,不是只能在预训练格式里打转。这把"通用策略"从"看个 demo"变成了"真能拿来用的可微调 checkpoint"。

所以这一节是想说:下游微调用约 100 条新数据、统一配方、几小时就能把 Octo 适配到带新传感器/新动作空间的机器人——"少量数据快速适配"是全篇最核心的卖点。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Octo: An Open-Source Generalist Rob… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   Octo 微调      ──► 基准(最优)                 ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Octo — 方法示意:核心 pipeline
Plate Nº IIOcto — 方法示意:核心 pipeline

6. 关键数字(What works)

6.1 模型与数据规模

项目 数值
预训练数据 80 万(800k)条轨迹
数据来源 Open X-Embodiment,25 个子数据集
模型尺寸 Octo-Small 27M / Octo-Base 93M
观测历史 2 帧
评测平台 9 个真机 setup,4 个机构
微调数据量 约 100 条轨迹
微调步数 50k 步(统一配方)

6.2 下游微调对比(6 个评测 setup 平均)

方法 相对表现 说明
Octo 微调 基准(最优) 统一配方微调
次优基线 比 Octo 低 52% Octo 平均高出次优基线 52%
ResNet+Transformer 从零训(28M) 更差 小数据上很快过拟合
VC-1(预训练视觉表示 + MLP,MSE) 更差 只预训练"看"、没预训练策略

原文原话:在 6 个评测 setup 上平均,Octo 比次优基线高出 52%,且所有任务用同一套微调配方和超参。

6.3 零样本 / 跨形态对比

对比对象 参数 / 数据 关系
RT-1-X 350K episodes 用其发布 checkpoint 对比零样本多机器人控制
RT-2-X 55B 参数,350K episodes 巨型闭源 VLM 微调版
Octo 27M/93M,800k episodes 更大更多样的数据、开源、可微调新输入输出

6.4 关键设计消融结论

设计选择 结论
动作头:扩散 vs MSE vs 离散 扩散在零样本和微调上都最优
微调:全量 vs 冻结部分 全量微调更好
观测历史:2 帧 vs 更多 超过 1 帧额外历史收益明显递减
条件:语言 / 目标图 两种都支持,训练时随机置零

生活语言解读:52% 这个数字是全篇最硬的成绩——微调 Octo 比"从零训练"或"用预训练视觉表示"平均好一半,而且用的是同一套配方(不用为每个任务调参)。这说明"预训练通用策略"确实是比从零开始更好的起点。6.3 表则体现了它的定位:不追求参数最大(27M/93M 远小于 RT-2-X 的 55B),而追求数据更多更杂 + 开源 + 可微调新输入输出。6.4 的扩散头消融很关键——它证明了"用扩散生成动作"不是花架子,而是真的比回归和离散化好,尤其在处理多模态动作时。

所以这一节是想说:数字证明了三件事——预训练策略做初始化比从零训好一半(52%)、扩散动作头确实最优、Octo 用小得多的模型 + 更多样的数据 + 开源可微调,走了一条和 RT-2 巨型闭源不同的路。


7. 实验结果说明了什么

原文的实验回答了三个核心问题(也是它明确列出的三个 research question):

问题一:Octo 能开箱即用地控制多种机器人、完成语言和目标任务吗? 在多个匹配预训练数据的真机 setup 上做零样本评估,Octo 能直接控制不同机器人执行语言指令和目标图任务。对比 RT-1-X(用其发布 checkpoint)和 55B 的 RT-2-X,Octo 用小得多的模型达到了有竞争力的零样本能力。这证明了海量多样预训练确实赋予了跨形态的通用控制能力。

问题二:Octo 权重是好的初始化吗,能数据高效地微调到新任务和新机器人吗? 这是最有说服力的结果。在 6 个评测 setup(包括新观测如 Berkeley Insertion 的力矩输入、新动作空间如关节位置控制)上,微调 Octo 比次优基线平均高 52%,比从零训练和 VC-1 预训练视觉表示都好。而且全部用同一套配方——这说明 Octo 不只是"能微调",而是"能作为一个可靠的默认起点稳定地微调"。关键是它能适配到预训练时没有的观测和动作空间,这是 RT-X 做不到的。

问题三:哪些设计决策最关键? 详细消融给出答案:(1) 扩散动作头在零样本和微调上都优于 MSE 回归和离散化——多模态动作建模是关键;(2) 全量微调优于冻结部分参数;(3) 2 帧观测历史够了,更多历史收益递减;(4) 语言和目标图双条件都能工作。这些消融为后来者"该怎么搭通用策略"提供了直接的工程指南。

原文还诚实地指出,Octo 的目标是"奠定基础"(lay the groundwork)——它把架构、数据流水线、训练配方全部开源,就是为了让社区在同一起点上继续研究。这种"交付一个可复现的基线 + 详尽消融"的做法,本身就是重要贡献。

所以这一节是想说:实验证明了 Octo 能零样本控制多机器人、能数据高效微调到新观测/新动作空间(高出基线 52%)、并通过消融厘清了扩散头等关键设计——它是一个可复现、可继续研究的通用策略基线。


8. 你应该懂的几个新词

Generalist policy(通用策略,GRP):一个网络处理多种机器人、多种任务、多种观测模态,相对于"一个任务一个模型"的专才(specialist)。类比:一个会开各种车的老司机 vs 只会开一款车的新手。

Embodiment(形态):机器人本体——什么样的臂、几个关节、什么夹爪、几个相机。"跨 embodiment 泛化"指换一个机器人还能用。

Open X-Embodiment(OXE):2023 年 22 机构联合发布的大规模跨形态机器人数据集,是 Octo 的训练食材。见 open-x-embodiment.md

Tokenizer(token 化器):把某种输入(图像/语言/目标图)转成模型能消化的 token(小词块)的模块。Octo 每种输入配一个,可插拔。

Readout token(读出 token):主干里插入的、"只读不被读"的特殊 token,专门用来汇总信息并输出给动作头,类似 BERT 的 [CLS]。

Block-wise masking(块级掩码):控制注意力"谁能看谁"的规则。Octo 用它让观测/任务 token 可自由增删,是模块化的实现机制。

Diffusion head(扩散动作头):用扩散模型生成动作,从噪声去噪到一段轨迹,能很好处理多模态分布(同一观测下有几种合理动作)。

Action chunk(动作块):一次预测未来 K 步动作而非单步,减少抖动、提升时间一致性,源自 ACT。

Goal-image conditioning(目标图条件):不用文字、而用一张"目标状态照片"来告诉机器人该达到什么状态。对没有语言标注的数据尤其有用。

Hindsight goal relabeling(事后目标重标注):从一条轨迹的未来随机选一个状态当作"目标",把无标注轨迹变成可训练的目标条件样本。

Finetuning(微调):在预训练模型上用少量新数据继续训练,使其适配新任务/新机器人。Octo 的核心卖点。

所以这一节是想说:读懂 Octo 的关键是把"通用策略术语(GRP/embodiment/OXE)""架构术语(tokenizer/readout token/块级掩码/扩散头/动作块)""训练术语(目标图条件/事后重标注/微调)"三套词摸一遍。


9. 它有什么搞不定的

规模不算大、能力有天花板:Octo 是 27M/93M 的中等模型,不是 RT-2-X 那种 55B 巨模型。在需要强语义推理、常识、复杂长程规划的任务上,它的能力受限于规模——它擅长"底层视觉运动控制",不擅长"想清楚该做什么"。

依赖预训练数据的分布:预训练数据主要是桌面操作、单臂/双臂机械臂。对预训练分布之外的形态(如灵巧手、腿足机器人、水下机器人)泛化能力未知,可能需要更多微调数据。

扩散头推理有额外开销:虽然主干只前向一次、去噪放在小头里,但多步去噪仍比一次回归慢。对要求极高控制频率的场景,这是需要权衡的成本(原文重点未在此,端到端控制频率细节需看原文附录)。

语言理解相对弱:语言只是过一个 T5 编码器当条件,不像 RT-2 那样把动作和大 VLM 深度耦合。所以对复杂、少见、需要推理的语言指令,理解力不如基于大 VLM 的 VLA。

微调仍需真机数据和调试:虽然只要约 100 条,但你还是得在目标机器人上采这些数据、配好 tokenizer/head、跑几小时微调。不是"下载即用零成本"。

主要在实验室 setup 验证:9 个真机 setup 在 4 个机构,仍是相对受控的实验室环境。真实开放世界(杂乱、光照多变、长时序)的鲁棒性未充分验证。

"通用"是相对的:它在预训练见过的任务分布内泛化好,但遇到完全陌生的任务类别,零样本仍会失败——通用策略不等于万能策略。

所以这一节是想说:Octo 的强项是"开源、可微调、底层控制通用",但代价是模型规模有限、语义推理弱、依赖预训练分布、微调仍需真机数据——它是强大的基线而非万能钥匙。


10. 它和别的几篇是什么关系

接住的(上游)

  • Open X-Embodiment(数据底座):Octo 的 80 万条训练数据来自它。见 open-x-embodiment.md
  • RT-1 / RT-2(Transformer 机器人策略范式):Octo 继承了"用 Transformer 做机器人策略"的思路,但走向开源和模块化。见 rt-1.mdrt-2.md
  • Diffusion Policy(扩散动作头):Octo 的动作头直接来自这条线。见 diffusion-policy.md
  • ACT(action chunk):一次预测多步动作的思想来自 ACT。见 act-aloha.md

同期对手

  • RT-2-X(Google 的跨形态巨型版本,55B,闭源)——Octo 用小得多的模型 + 开源正面对比。
  • OpenVLA(同样开源、晚几个月、走 LLaVA 风格的视觉-语言主干)——两者是"开源通用策略"的双子星,路线不同(Octo 从零 Transformer + 扩散头,OpenVLA 基于大 VLM)。见 openvla.md

被它启发的(下游)

  • π0 / π0-FAST / π0.5(更大规模 + flow matching 动作头)、SmolVLA 等后续 VLA,都默认要开源、要可微调——这个"社区契约"很大程度上是 Octo 立的。见 pi0.mdpi05.mdsmolvla.md
  • OpenHelix 等双系统工作里的快手也常用扩散策略,与 Octo 的动作头思路相通。见 openhelix.md

位置坐标:Octo 在"开源通用策略"这条路上是奠基石;OpenVLA 把基座换成 LLaVA-style 大 VLM;π0 把规模和动作头(flow matching)再升级。读懂 Octo,等于拿到了理解 2024 年后所有 VLA 工作的钥匙。

所以这一节是想说:Octo 接住了 OXE 数据、RT 系列范式、Diffusion Policy 和 ACT 的动作思想,与 RT-2-X/OpenVLA 同台竞争,并为 π0、SmolVLA 等后续开源可微调 VLA 立下了范式。


11. 和本导读的关系

本篇对应导读 Ch12: OpenVLA / VLAs / MLA。Ch12 讲的是通用机器人策略(VLA)的兴起与演化,而 Octo 是这条线上"开源可微调通用策略"的奠基之作。理解 Octo,就理解了后面 OpenVLA、π0、SmolVLA 等一系列工作的共同起点和"社区契约"。

Ch12 的一个核心主题是从"专才"到"通才"的范式转变——不再为每个任务从零训练,而是先预训练一个通用基座、再微调。Octo 是这个范式在机器人操作上最清晰的实现,它把"预训练 + 微调"这套 NLP/CV 早已成熟的流程,第一次以开源、可复现的形式带进机器人学习。

Ch12 还强调模块化与接口设计的重要性。Octo 的可插拔 tokenizer、readout token、块级掩码,正是"如何设计一个能适配任意机器人的架构"的教科书级案例。这与 openhelix.md 强调的"接口设计 > 模型选型"一脉相承——都在讲机器人系统的关键往往在"怎么接"而非"某个模块多强"。

从阅读路线看,建议先读 open-x-embodiment.md(理解数据底座)和 diffusion-policy.md(理解扩散动作头),再读本篇看它们如何组合成一个通用策略,然后读 openvla.md 看另一条基于大 VLM 的开源路线,最后读 pi0.md 看规模和动作头的进一步升级。这条线读下来,2024 年后 VLA 的技术地图就清晰了。

所以这一节是想说:本篇是 Ch12 里"开源可微调通用策略"的奠基石,体现了"从专才到通才的范式转变"和"模块化接口设计"两个核心主题,是理解后续所有 VLA 工作的起点。


12. 思考题

Q1:Octo 为什么把输入输出都做成可插拔的 token 化模块?这相比 RT-X 那种"固定输入格式"带来了什么关键能力?

提示

RT-X 锁死了输入(如单相机)和动作空间,想加个腕部相机或换成关节控制就得大改甚至重训。Octo 把每种输入配一个 tokenizer、用块级掩码支持增删,换机器人只要加/换积木。想想这对"微调到新观测(力矩传感器)和新动作空间(关节控制)"意味着什么?为什么原文强调"不用重新初始化大部分参数"?

Q2:为什么动作头用扩散(diffusion)而不是直接回归一个动作值?什么情况下回归会出问题?

提示

想象同一个画面下,机器人从左边绕或从右边绕都能完成任务(多模态)。回归方法会输出这几个答案的"平均"——可能是直接撞上去,哪个都不是。扩散能建模"多个合理答案"的分布,采样出其中一个完整的动作。想想为什么原文说扩散头在零样本和微调上都优于 MSE 和离散化头?

Q3:readout token 被设计成"只读不被读"(能注意别人、但不被别人注意)。为什么要这样设计?它类似哪个熟悉的机制?

提示

类似 BERT 的 [CLS] token——一个专门用来"汇总并输出"的接口。如果 readout token 也被观测/任务 token 注意到,就会反过来影响主干的表示、破坏模块化。想想"只读"如何让动作头和主干解耦,从而支持自由增删输入 token?

Q4:Octo 只用 27M/93M 参数,远小于 RT-2-X 的 55B。它为什么不追求更大?小模型 + 更多数据 + 开源的组合,取舍在哪?

提示

大模型(55B)语义推理强但跑不起、闭源。Octo 的定位是"底层视觉运动控制的通用基座 + 可下载可微调"。想想对一个要被很多实验室在消费级 GPU 上微调的工具,模型大小的重要性;以及"通用底层控制"是否真的需要 55B 那么大的语义能力?它牺牲了什么(提示:复杂语言推理)?

Q5:Octo 同时用语言和目标图两种条件训练,训练时随机把其中一个置零。这样做的好处是什么?对没有语言标注的数据尤其重要吗?

提示

随机置零让模型学会"只用语言""只用目标图""两者都用"任意一种模式工作。OXE 里很多数据没有语言标注——对这些数据只能用目标图条件(配合事后重标注)。想想这如何减轻了语言标注的负担、让更多无标注数据能被利用?

Q6:下游微调只要约 100 条数据、几小时。为什么预训练策略做初始化会比从零训练好这么多(高 52%)?从零训练在小数据上会遇到什么问题?

提示

原文提到大 Transformer 从零训练在小数据集上"很快过拟合"。预训练已经学会了通用的视觉运动技能(怎么抓、怎么移动),微调只需教它新任务的特定部分。想想这和 NLP 里"预训练 BERT 微调"为什么比从零训好是同一个道理吗?"通用基座 + 少量适配"的范式为什么数据高效?

Q7:Octo 立下了"开源 + 可微调"的社区契约,后续 OpenVLA、π0、SmolVLA 都遵循。为什么"开源一个可微调的 checkpoint"比"发一篇 SOTA 论文"对社区影响更大?

提示

闭源的 SOTA(如 RT-2)别人没法在其基础上继续做,只能眼馋。开源可微调的 checkpoint 让所有人站在同一起点、做公平对比、快速搭自己的机器人。想想 ImageNet 预训练模型、BERT、CLIP 对各自领域的推动作用——它们的影响力是不是主要来自"可下载可复用"?Octo 想做的是不是机器人版的这个?


13. 一些好奇心问答(FAQ)

Q1:Octo 和 ChatGPT 到底像在哪?

像在"预训练 + 微调"的范式和"开源基座"的定位上。ChatGPT 的底层 GPT 先在海量文本上预训练通用能力,再微调到具体任务;Octo 先在 80 万条机器人数据上预训练通用动作,再微调到具体机器人。区别是 Octo 面对的输入输出(机器人形态)比文本杂得多,所以要做模块化 token 化。

Q2:为什么机器人版 GPT 比文本版难做这么多?

因为"身体"不统一。文本世界里输入输出都是 token,格式统一。机器人世界里每台机器几个关节、什么夹爪、几个相机、动作是末端位姿还是关节角,全都不同。原文列的挑战——不同形态、传感器、动作空间、任务、环境——就是这个"异构性"。Octo 的模块化设计正是为了对付它。

Q3:27M 和 93M 两个版本该用哪个?

看你的算力和任务。Small(27M)更省、更快,适合算力有限或简单任务;Base(93M)能力更强,适合复杂任务。两个权重都开源,可以都试试。原文提供两个尺寸就是为了让不同预算的用户都能用。

Q4:扩散头会不会让机器人反应变慢?

有一点开销,但被优化过——主干每次只前向一次,多步去噪放在很小的扩散头里做,所以没有"每步去噪都跑一遍大主干"那么慢。对大多数操作任务够用。要极高控制频率的场景需要权衡(具体频率数字看原文)。

Q5:我没有 OXE 里那种机器人,能用 Octo 吗?

能,这正是它的卖点。你在自己的机器人上采约 100 条数据,配好对应的输入 tokenizer 和输出 head(哪怕是预训练没见过的传感器/动作空间),微调几小时即可。这是它区别于 RT-X"锁死输入"的关键优势。

Q6:Octo 和 OpenVLA 都开源,我该学哪个?

两个都值得,路线不同。Octo 是从零搭的 Transformer + 扩散头,架构清晰、组件边界分明、适合入门理解通用策略的骨架。OpenVLA 基于大 VLM(LLaVA 风格),语义理解更强但更重。建议先读 Octo 建立框架,再看 OpenVLA 看另一条路。

Q7:为什么说 Octo 定义了一个"产品形态"?

因为它交付的不是一个 demo 视频或一篇论文,而是"一个能下载、能改、能在你自己机器人上跑的 checkpoint + 完整训练代码 + 数据流水线"。这个"可下载可微调的通用策略"交付标准,之后成了行业默认——后续 VLA 工作几乎都遵循。它把"通用策略"从学术概念变成了可用的工具。

所以这一节是想说:Octo 把"机器人版 GPT"这个想法落地成一个可下载、可微调、开源的工具,它的很多设计(两个尺寸、扩散头优化、模块化)都是为了让真实用户能拿来适配自己的机器人。


14. 如果你想再深入

按"数据底座 → 架构组件 → 同期对手 → 后续升级"排序:

  1. Open X-Embodiment(RT-X,2023) — Octo 的数据来源。理解这个 22 机构合并的数据集,才懂 Octo 通用性从哪来。本仓库 open-x-embodiment.md

  2. Diffusion Policy(Chi et al., 2023) — Octo 扩散动作头的直接来源。想懂"从噪声去噪出动作",读它。本仓库 diffusion-policy.md

  3. RT-1 / RT-2(Google) — Transformer 机器人策略的范式源头,也是 Octo 对比的闭源对手。本仓库 rt-1.mdrt-2.md

  4. ACT(Zhao et al., 2023) — action chunk 的出处。本仓库 act-aloha.md

  5. OpenVLA(2024) — 同期的另一条开源通用策略路线(基于大 VLM)。和 Octo 对照读能看清"从零 Transformer + 扩散头" vs "大 VLM 主干"两条路。本仓库 openvla.md

  6. π0(Physical Intelligence, 2024) — 后续升级版:更大规模 + flow matching 动作头。本仓库 pi0.md

  7. Octo 项目页与代码https://octo-models.github.io/ ,有预训练权重(27M/93M)、微调脚本、数据流水线。想动手微调到自己的机器人,直接从这里开始。

所以这一节是想说:要理解数据读 OXE;要理解动作头读 Diffusion Policy 和 ACT;要理解范式读 RT-1/RT-2;要看对手和升级读 OpenVLA 和 π0;要动手上 Octo 项目页拿权重和微调脚本。


15. 原文信息

本文(笔记所评论文)

@inproceedings{octo2024,
  title={Octo: An Open-Source Generalist Robot Policy},
  author={{Octo Model Team} and Ghosh, Dibya and Walke, Homer and Pertsch, Karl and Black, Kevin and Mees, Oier and Dasari, Sudeep and Hejna, Joey and Kreiman, Tobias and Xu, Charles and others},
  booktitle={Robotics: Science and Systems (RSS)},
  year={2024}
}

关键数据底座(Open X-Embodiment)

@inproceedings{open_x_embodiment_2023,
  title={Open X-Embodiment: Robotic Learning Datasets and RT-X Models},
  author={{Open X-Embodiment Collaboration}},
  booktitle={arXiv preprint arXiv:2310.08864},
  year={2023}
}

相关链接


笔记结束。如果你只记住一件事:Octo 把"预训练通用基座 + 少量数据微调"这套 NLP/CV 的成功范式,第一次以完全开源、可微调到任意新机器人的形式带进了机器人学习——它交付的不是一个 demo,而是一个能下载、能改、能用的通用策略 checkpoint,这个标准从此成了 VLA 领域的默认契约。

引用本笔记 / Cite this note
BibTeX
@online{eai_octo_2026,
  title       = {(readable note) Octo: An Open-Source Generalist Robot Policy},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/octo/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?