Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 60

Mobile ALOHA

22 min read · 7844 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式和术语全部翻译成人话。

一句话讲什么(TL;DR)

给原来只能趴在桌上干活的双臂机器人焊一辆能跑的小车,让一个人同时"手控双臂 + 腰推底盘"把整套家务动作录下来;再用一个很朴素的招数——把新录的"移动家务"数据和以前攒的一大堆"桌面双臂"数据混在一起训——就能让机器人只看 50 次示范,学会炒虾、擦红酒渍、进电梯这种"边走边用两只手"的复杂长任务。

所以这一节是想说:Mobile ALOHA 的贡献是"一套买得起的全身遥操硬件(约 3.2 万美元)"加"一个几乎零改动就能用的联合训练(co-training)技巧",两件事合起来把模仿学习从桌面拓展到了整个屋子。


这是个什么场景

想象你想教刚来的家政阿姨做你家那道炒虾。你不会丢一本菜谱让她自己啃,而是站在她旁边,扶着她的手切葱、握锅铲、调火,做几遍她自己就上手了。

机器人学家务也是这个套路。今天让机器人学技能最靠谱的一条路叫模仿学习(imitation learning,让机器人照着人的示范动作学,不用自己试错):人先"手把手"给机器人做一遍,把每一刻的画面和动作都录下来,再喂给神经网络,让它学会"看到这个画面,下一步该怎么动"。

但过去这类工作几乎都卡在桌面上:机器人被固定在一张桌子前,只能做穿电池、拆拉链、叠毛巾这种"手边"的活。原因很简单——它没有腿。锅在灶台上,它够不着;椅子在三米外,它推不到。

真实的家务恰恰不是"手边"的:

把一口重锅收进柜子这一件"小事",机器人得先到柜子前(要腿),一边后退一边用两只手拉开两扇柜门(要全身协调),再双手合力把锅抬进去(一只手抬不动)。走、协调、双手——缺一样都做不成。

Mobile ALOHA 想补的就是"腿"这一课,同时还要保证两件事不能丢:(1)要便宜,普通实验室买得起、能复现;(2)遥操作要顺手,一个人就能同时把"走"和"两只手干活"演出来,不用两个人配合、也不用戴笨重的头盔。

所以这一节是想说:机器人缺的不是"手",而是"腿" + "一个人能同时把腿和手都演出来的顺手接口";Mobile ALOHA 就是来补这两样的。


Mobile ALOHA — 场景示意:这论文要解决的现实问题
Plate Nº IMobile ALOHA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:买现成的双臂移动机器人(PR2、TIAGo)。 硬件是有的,但一台常常超过 20 万美元($200k),普通实验室根本买不起;而且要在上面做遥操作还得额外装触觉设备、脚踏板、做繁琐标定。类比:想学做饭却被要求先买下整间米其林后厨。

  • 方案 B:把"导航"和"操作"拆成两半做(传统机器人路线)。 先用 SLAM/规划把车开到位置,停稳,再让手臂干活;干完再开车。类比:一个人走路时绝不动手、动手时绝不走路。像"一边后退一边拉开双开门"这种走和动手必须同时发生的动作,这条路做不了。

  • 方案 C:用强化学习或预设技能块(skill primitives)。 靠奖励函数或人工设计的"抓取""放置"模块拼任务。类比:给机器人一本写死的招式手册,招式之外的情况就抓瞎,换任务要重调,工程量巨大。

  • 方案 D:已有的模仿学习基本只在桌面验证。 RT-1、Diffusion Policy、原版 ALOHA 都证明了"表达力强的策略(如扩散模型、Transformer)"能学好精细桌面操作,但没人验证过同一套配方在"加了底盘、自由度更多"的移动场景还灵不灵。多出来的底盘自由度会带来新麻烦:底盘位置差一点点,手臂末端就会漂一大截。

  • 核心缺口:既没有买得起又顺手的全身遥操硬件来采集"移动 + 双臂"数据,也没人证明过"少量这种数据 + 经典模仿学习"能撑起复杂长任务。

所以这一节是想说:以前要么硬件太贵、要么走和动手不能同时、要么只在桌面上验证过;Mobile ALOHA 要一次补齐"买得起的全身遥操硬件"和"移动场景下的模仿学习配方"。


这篇论文的新想法

一句话:像组装宜家家具一样,把几块"已有的好零件"拧到一起,再加一个几乎不用改代码的训练小技巧。

  1. 硬件:在原版 ALOHA 下面焊一辆便宜的轮式底盘,人用腰"推"着走。 原版 ALOHA 是一套低成本的双臂"主从遥操"装置——人手里握着两条"主臂",机器人身上有两条一模一样的"从臂",人动一下、从臂同步动一下。Mobile ALOHA 把它整套架到一辆仓储用的差速小车(AgileX Tracer)上,操作员像系着婴儿车背带一样把腰拴在车后,双手照旧操控主臂,同时用腰前后左右"倒推"轮子来控制底盘。这样一个人、两只手全占着,还能同时把底盘也开起来

  2. 动作表示:把手和底盘拼成一个向量,别的什么都不改。 把两条手臂的 14 个关节角度(含两个夹爪),和底盘的"前进速度 + 转向速度"这 2 个数,直接首尾拼成一个 16 维动作向量。因为只是"拼数字",现成的模仿学习算法(ACT、Diffusion Policy)几乎一行都不用改就能用。

  3. 训练技巧:co-training(联合训练)——把新数据和老数据混着学。 每个新任务只录 50 次示范,单靠这点数据训出来的策略很脆。作者的招数是:把这 50 条"移动家务"数据,和以前攒下的一大堆(825 条)"桌面双臂"老数据混在一个训练批次里一起学。老数据里"怎么稳稳抓住一个东西""怎么把手对准目标"的通用手感,会迁移过来,把新任务的成功率显著抬高——即便老数据的任务、机械臂摆位都和新任务不一样。

所以这一节是想说:新想法不在于某个炫酷模型,而在于"便宜顺手的硬件 + 把动作拼成一个向量 + 新老数据混训"这三个朴素选择合起来,恰好把模仿学习从桌面搬进了整间屋子。


它分几步做的(方法)

这一节最长,因为 Mobile ALOHA 真正的功夫全在"硬件怎么搭、数据怎么采、训练怎么混"这些工程细节里。我们按"硬件 → 遥操接口 → 数据 → 训练目标 → 推理时的小心机"五步拆开讲,每步都标清楚"输入 → 处理 → 输出"。

第 1 步:硬件——挑一辆"又快又稳又便宜"的底盘(输入:设计约束;输出:一台能跑的车)

作者给底盘定了四条硬指标,像买车前列的需求清单:

  • 快(Mobile):能以接近人走路的速度移动,约 1.42 m/s。
  • 稳(Stable):抬重锅、拉柜门时不能翻车。
  • 全身可遥操(Whole-body teleoperation):两条手臂 + 底盘的所有自由度必须能同时被一个人控制。
  • 不用拖线(Untethered):电源和计算全背在车上。

据此他们选了仓储物流用的 AgileX Tracer 差速小车:最高 1.6 m/s(和人快走差不多),载重 100 kg,机身只有 17 mm 高,能翻过 10 mm 高的小坎、爬 8 度带载坡道,离地间隙 30 mm(实测连电梯和地面之间那道缝都能过)。价格 7000 美元,比同规格的科研级 AGV(如 Clearpath)便宜 5 倍以上。

为了"不用拖线",车底装了一块 1.26 kWh、14 kg 的电池——它同时兼职压舱配重,把重心压低防翻车。所有计算跑在一台消费级笔记本上(Nvidia 3070 Ti,8GB 显存 + i7-12800H),不需要工作站。

整台车最终能:垂直够到 65–200 cm(弯腰到举高)、水平探出底盘 100 cm、单次抬起 1.5 kg、在 1.5 m 高处施加 100 N 拉力。总预算约 3.2 万美元,和一台工业协作臂 Franka Panda 单臂差不多——但你得到的是"双臂 + 移动 + 车载算力"的完整系统。

第 2 步:遥操接口——用"腰推车"解决"手不够用"(输入:人的身体动作;输出:底盘速度 + 双臂关节)

这里有个很妙的痛点:全身遥操最大的难题是人的两只手已经被两条主臂占满了,拿什么去控制底盘?

作者没有加摇杆、没有加脚踏板,而是选了最土也最直接的方案:把操作员的腰用背带拴在车后端。轮子在不通电时摩擦极小(在 PVC 地板上倒推的阻力约 13 N,一般人推得动),操作员像倒推购物车一样用腰"带"着车走。这样做的好处有三:

  1. 人的运动直觉直接迁移:你想让车往哪走,身体往哪靠就行,不用学摇杆。
  2. 天然的粗糙力反馈:车撞到东西,人的腰能直接感到那股顶劲。
  3. 不需要 FPV 头盔:操作员本人就在车旁,用自己的眼睛看现场,不用戴头盔看机器人第一视角的直播画面。

系统实时记录底盘的线速度和角速度作为动作标签,同时记录全部 4 条手臂(2 主 2 从)的关节角度。执行阶段(机器人自主干活时),拴腰的背带和两条主臂只要拧开 4 颗螺丝就能拆掉,机器人瞬间"瘦身",只剩两条从臂。

一张图看懂"一个人怎么同时控制手和车":

                操作员(一个人)
        ┌────────────┼─────────────┐
     左手握主臂     腰拴背带      右手握主臂
        │            │             │
        ▼            ▼             ▼
   ┌─────────┐  ┌──────────┐  ┌─────────┐
   │ 左从臂   │  │ 倒推轮子  │  │ 右从臂   │
   │ 7 关节   │  │→底盘vx,ω │  │ 7 关节   │
   └────┬────┘  └────┬─────┘  └────┬────┘
        └────────────┼─────────────┘
                     ▼
        14 维手臂关节 + 2 维底盘速度 = 16 维动作
                     ▼
             与 3 路相机画面一起,30/50Hz 录成"画面-动作"配对

第 3 步:数据采集——三只眼睛 + 30/50 Hz 录像(输入:一次任务演示;输出:带时间戳的"画面-动作"配对)

观测(机器人"看到 + 感到"的东西)由两部分组成:

  • 视觉:3 个 Logitech RGB 相机,分辨率 480×640。两个装在左右手腕(近距离盯着夹爪在干什么),一个装在双臂之间朝前(顶部俯视/第一视角全景)。
  • 本体感觉(proprioception):4 条手臂的关节角度,通过 USB 串口读;底盘速度通过 CAN 总线读。

一句话补充术语——本体感觉就是机器人"闭着眼也知道自己每个关节现在弯了多少度"的能力,类似你闭眼也知道自己胳膊是伸直还是弯着。

每个任务录约 50 条演示(长任务 High Five、Cook Shrimp 因为更费时只录 20 条)。

第 4 步:训练目标——co-training 的数学其实很朴素(输入:新老两批数据;输出:一个策略网络)

记聚合起来的桌面老数据为 $D_{\text{static}}$(共 825 条,任务是封保鲜袋、拿叉子、包糖、撕纸巾、插电池等,和移动任务完全不重叠,连两条手臂的摆位都不同),某个移动任务 $m$ 的新数据为 $D_{\text{mobile}}^{m}$。手臂动作是 14 维目标关节角 $a_{\text{arms}}\in\mathbb{R}^{14}$,底盘动作是 2 维目标速度 $a_{\text{base}}\in\mathbb{R}^{2}$。训练目标是这样一个"两项相加"的损失:

$$ \mathbb{E}{D{\text{mobile}}^{m}}\big[L(a_{\text{arms}}, a_{\text{base}}, \pi^m(o))\big] ;+; \mathbb{E}{D{\text{static}}}\big[L(a_{\text{arms}}, [0,0], \pi^m(o))\big] $$

人话翻译:这个公式就一句话——"新数据和老数据各学一半"。

  • 第一项:喂移动数据时,让网络同时预测对手臂和底盘的动作。
  • 第二项:喂桌面老数据时,因为老数据没有底盘,就把底盘动作当成 0 来凑数(zero-pad,补零),只让网络学好手臂那部分。

具体做法:从两个数据集各以 50% 概率采样凑成一个 batch(batch size = 16);老数据只有黑桌面前拍的画面、没有前置相机,就忽略前相机让两边都统一成 3 路画面;所有动作按移动数据自己的统计量做归一化。就这么简单——没有对比学习、没有额外网络、没有花哨的对齐,就是"新老掺着喂"。

用一张图看 co-training 的数据流:

   新数据 D_mobile (50 条/任务)        老数据 D_static (825 条桌面)
   [画面 + 14维手臂 + 2维底盘]        [画面 + 14维手臂 + 底盘补0]
          │  各 50% 概率采样            │
          └───────────┬───────────────┘
                      ▼
              同一个策略网络 π
          (ACT / Diffusion Policy / VINN)
                      ▼
        损失 = 移动项(手臂+底盘) + 桌面项(仅手臂, 底盘=0)
                      ▼
     老数据的"抓取/对位"手感 → 迁移 → 抬高新任务成功率

这套配方能套在任意底层算法上。论文试了三种:

  • ACT(Action Chunking Transformer):原版 ALOHA 的方法,用 Transformer + CVAE,一次预测未来 45 步动作(chunk size = 45)。
  • Diffusion Policy:用扩散模型一点点"去噪"出动作序列,chunk size = 64,推理用 DDIM 加速。
  • VINN:一个"查字典"式方法,先学视觉表征(BYOL),再用最近邻从示范库里检索动作,作者给它也加上了动作分块(chunk size = 100)。

顺带补一个关键术语——动作分块(action chunking):策略不是走一步算一步,而是一次预测未来一整串(一个 chunk)动作。好处一是缓解模仿学习的老毛病"复合误差"(每步都偏一点点,几十步后就偏出天际),二是能灵活对付硬件延迟。

第 5 步:推理时的小心机——用分块错位补底盘延迟(输入:一个动作块;输出:错开执行的手臂/底盘指令)

作者发现底盘的"下令速度"和"实际速度"之间有明显延迟(电机、地面打滑导致),而位置控制的手臂几乎没延迟。于是他们用动作分块玩了个错位:对一个长度为 $k$ 的动作块,若底盘延迟 $d$ 步,就执行前 $k-d$ 步的手臂动作 + 后 $k-d$ 步的底盘动作,让底盘的指令"提前发",正好和它慢半拍的实际响应对齐。

一个反直觉但关键的事实:作者验证过,把一条演示原封不动"开环回放"(不看画面、照着录像的动作硬走一遍),整任务成功率是 0%。 因为底盘速度控制有随机性——同一段"半径 1m 的 180 度转弯"回放 20 次,末端位置平均漂了 10cm 以上、散布约 20cm。所以策略必须闭环:一边看画面一边实时纠偏,才能把任务做成。这也反过来说明学到的策略确实在"看着干活",而不是背录像。

所以这一节是想说:Mobile ALOHA 的方法核心不在算法本身(算法直接借用现成的),而在"腰推底盘的顺手接口 + 把手和底盘拼成一个向量 + 新老数据各半掺训 + 分块错位补延迟"这一整套工程组合拳,让复杂移动操作第一次能用几十条数据学出来。


Mobile ALOHA — 方法示意:核心 pipeline
Plate Nº IIMobile ALOHA — 方法示意:核心 pipeline

关键数字(What works)

先看硬件与系统规格:

指标 Mobile ALOHA 对照
整机预算 约 $32k PR2 / TIAGo > $200k
底盘(Tracer)单价 $7,000 同规格科研 AGV 贵 5 倍以上
最高移动速度 1.6 m/s(人快走 ~1.42 m/s)
底盘载重 / 高度 100 kg / 17 mm
可达高度 / 水平伸展 65–200 cm / 100 cm
抬举 / 拉力 1.5 kg / 100 N @ 1.5 m
电池 1.26 kWh, 14 kg(兼配重)
计算 笔记本 3070 Ti (8GB) + i7-12800H
相机 3× RGB 480×640(双腕 + 顶部)
占地 90 cm × 135 cm

再看核心结论——co-training 对 ACT 在 7 个任务上"整任务成功率(%)"的提升(每项 20 次试验,Cook Shrimp 仅 5 次;括号为示范条数):

任务 无 co-train 有 co-train 提升
Wipe Wine 擦红酒渍 (50) 50 95 +45
Cook Shrimp 炒虾 (20) 20 40 +20
Rinse Pan 洗锅 (50) 0 80 +80
Use Cabinet 收锅入柜 (50) 85 85 0
Call Elevator 叫电梯 (50) 0 95 +95
Push Chairs 推椅子 (50) 0 80 +80
High Five 击掌 (20) 85 85 0

一些能看出"co-training 到底帮在哪"的子任务对比:

子任务 无 co-train 有 co-train
洗锅:拧开水龙头 0 80
叫电梯:按按钮 5 100
叫电梯:进电梯 0 95
推椅子:第 5 把(训练没见过) 0 89

其他关键消融:

实验 设置 结果
数据配比鲁棒性(Wipe Wine) 老数据占 30 / 50 / 70% 95 / 95 / 90
co-train vs pre-train(Wipe Wine) co-train / 先预训后微调 / 都不用 95 / 40 / 50
数据效率(Wipe Wine) co-train 35 条 vs 无 co-train 50 条 70 vs 50(少用数据反而更好)
遥操上手速度(用户研究,8 人) Wipe Wine 完成时间 46s → 28s(快 39%)
遥操上手速度 Use Cabinet 完成时间 75s → 36s(快 52%)

一句总括:只用 20–50 条示范,7 个任务里 5 个能到 80%+,平均绝对提升 34%;而且 co-training 对数据配比不敏感、比"先预训再微调"更好、还更省数据。

所以这一节是想说:co-training 不是锦上添花,而是把"精细操作瓶颈子任务"(拧水龙头、按按钮、进电梯)从"几乎做不成"直接拉到"基本能用",这才是它值 34% 平均提升的原因。


实验结果说明了什么

第一,co-training 主要救的是"精细接触"那几步。 无 co-train 时,洗锅的"拧水龙头"、叫电梯的"进电梯"成功率是 0——不是机器人不想做,而是底盘随机漂移带来的复合误差把手臂对准的机会毁了。掺入桌面老数据后,那些"稳稳抓住、精准对位"的通用手感迁移过来,把这些卡点子任务从 0 抬到 80–95%。作者推测:桌面数据里"抓取、接近物体的运动先验"配合手腕相机的视角不变性,正好补上了移动场景最缺的那一环。

第二,co-training 比"先预训再微调"更好,且对配比不敏感。 先在老数据上训、再用新数据微调(pre-train)只有 40%,甚至不如什么都不加的 50%——因为微调阶段网络"忘"掉了老数据学到的东西(灾难性遗忘)。而"新老同时喂"(co-train)达 95%。而且老数据占 30% / 50% / 70% 时结果都在 90–95%,说明这招几乎不用调参就能直接用到新任务上,工程上非常省心。

第三,它对算法不挑食。 ACT、Diffusion Policy、VINN 三种风格迥异的方法都能在 Mobile ALOHA 上跑通、都能从 co-training 受益。不过在 50 条这种小数据下,ACT 最稳(Wipe Wine 95%),Diffusion Policy 稍逊(65%,作者认为扩散模型通常要 250+ 条才够),VINN 最弱(15%)但也能用。这说明"数据 + 硬件"这套系统本身是通用底座,不绑死在某个算法上。

第四,硬件顺手是有据可查的,不是自夸。 8 名新手(一半没遥操经验)在 5 次尝试内就把两个陌生任务的完成时间砍掉近一半、接近专家速度——这说明"腰推底盘 + 主从双臂"的接口学习曲线极陡(好的意义上),是这套数据采集能规模化的前提。

所以这一节是想说:实验讲了一个连贯的故事——便宜顺手的硬件让人能高效采数据,而 co-training 让这点数据足以攻克真正的瓶颈(精细接触步骤),两者缺一,复杂移动家务都学不出来。


你应该懂的几个新词

  • 模仿学习(imitation learning)/ 行为克隆(behavior cloning, BC):让神经网络照着人的"状态→动作"示范学,不用像强化学习那样自己试错找奖励。BC 是它最朴素的形式。
  • 遥操作(teleoperation):人操控、机器人忠实复制人的动作,是采集示范数据最常用的手段。
  • 全身控制 / 全身遥操(whole-body teleoperation):同时协调多个执行器(这里是双臂 + 底盘)完成一个目标,而不是分阶段"先走后动手"。
  • co-training(联合训练):把不同分布的多批数据混在一个训练过程里一起学,让稀缺任务借用充足任务的先验。区别于"先在 A 上预训、再到 B 上微调"。
  • 动作分块(action chunking):策略一次预测未来 K 步动作而非单步,缓解复合误差、抗延迟。ACT 的核心思想。
  • 复合误差(compounding error):模仿学习的老问题——每步预测都有小误差,几十步后累积到偏出训练分布,再也回不来。
  • 本体感觉(proprioception):机器人对自身关节角度/速度的感知,相当于人闭眼也知道胳膊弯没弯。
  • 开环 vs 闭环(open-loop vs closed-loop):开环 = 不看反馈照着预定动作硬走;闭环 = 一边看画面一边实时纠偏。Mobile ALOHA 证明这类任务必须闭环。

所以这一节是想说:读懂 Mobile ALOHA 只需抓住三个词——模仿学习(怎么学)、动作分块(怎么稳)、co-training(怎么用少量数据学好)。


它有什么搞不定的

  1. 占地太大,进不了窄路。 整机 footprint 90 cm × 135 cm,对某些窄走廊、窄门就太宽了。作者把"缩小占地"列为未来工作。
  2. 手臂高度固定,够不到低处。 两条从臂的安装高度是固定的,导致低矮柜子、烤箱、洗碗机很难够到。需要给手臂加"升降自由度"才能解决。
  3. 只做了单任务模仿,不会自我进化。 每个任务单独训一个策略,机器人既不能自主探索获取新知识,也不能在使用中自我改进——学会的就是那几招。
  4. 依赖高质量专家示范。 数据由两名熟练操作员采集。如何从"很差、很杂、水平参差"的示范里学好,论文没解决,留给了未来。
  5. 底盘速度控制随机性大,强依赖闭环纠偏。 开环回放整任务成功率为 0(180 度转弯末端漂 >10cm)。这意味着一旦视觉受扰(如炒虾时白碗白桌低对比度),策略纠不回来就容易失败——Cook Shrimp 只有 40% 正是栽在这里(长 75s、仅 20 条数据、白碗白桌)。
  6. 数据仍需真人逐条遥操,规模化有天花板。 虽然比买 20 万的机器人便宜,但每个新任务仍要人工采几十条、每条几十秒到分钟级,扩到成百上千个任务时人力成本不可忽视。

所以这一节是想说:Mobile ALOHA 证明了"便宜硬件 + 少量数据"能做复杂移动操作,但它还是"一招一学、靠人喂数据、靠闭环救场"的窄专家,离"自己会琢磨、能泛化"的通用机器人还很远。


它和别的几篇是什么关系

  • 承接 ALOHA / ACT(同组前作,Zhao et al. 2023):硬件的双臂主从结构、ACT 算法、825 条静态数据全部直接复用。可以粗略地把 Mobile ALOHA 理解为"ALOHA + 一辆车 + co-training 技巧"。
  • 对照 RT-1 / RT-2 / Open X-Embodiment:这几条线靠"超大数据 + 大模型"追求广泛泛化;Mobile ALOHA 反着来,用"少量高质量遥操数据 + 经典模仿学习"专攻复杂长任务。它借用的正是 Open X-Embodiment(RT-X)里释放的静态 ALOHA 数据。
  • 对比 Diffusion Policy:作为三个 baseline 之一被对比。结论是在 50 条这种小数据下 ACT 更稳,但 Diffusion Policy 在数据更多时更有潜力。
  • 延伸到 HumanPlus(同组后作):HumanPlus 把"双臂 + 轮式底盘"进一步升级为"全身人形",把"腰推遥操"换成"影子模仿",是这条研究线的自然下一步。轮式(Mobile ALOHA)更稳更便宜,双足(HumanPlus)更通用——是路线之争。
  • 影响一大批"廉价 ALOHA 复现"工作:2024 年后 ALOHA Unleashed、各种开源复现项目大量沿用它的硬件设计和 co-training 思路。

所以这一节是想说:Mobile ALOHA 站在 ALOHA 的肩膀上、借了 RT-X 的数据、和大模型路线互为对照,又亲手把接力棒传给了人形机器人(HumanPlus)。


和本导读的关系

它属于导读里模仿学习这条主线,建议配合 第 14 章 · 模仿学习 阅读。那一章讲清了行为克隆、DAgger、动作分块、co-training 的来龙去脉;Mobile ALOHA 是这些概念落到"真实家务 + 移动操作"上的一个完整系统级案例。读完本篇再回看同章的 act-aloha(算法起点)、diffusion-policy(对照方法)、humanplus(人形延伸),能串出一条"桌面双臂 → 移动双臂 → 全身人形"的清晰演进线。


思考题

Q1:为什么"co-training(新老掺着一起训)"比"先在老数据上预训、再用新数据微调"效果好那么多(95% vs 40%)?

提示

想想"灾难性遗忘"。微调阶段网络只见新数据,会逐渐忘掉预训练学到的东西;而 co-training 全程新老同时在场,老数据的"抓取/对位先验"一直被复习,不会丢。论文也明确用"网络在微调时忘掉了静态数据经验"来解释。

Q2:论文说"把一条演示原封不动开环回放,整任务成功率是 0%"。这个看似负面的结果,为什么其实是个好消息?

提示

它证明了学到的策略不是在"背录像",而是在真正地"看着画面实时纠偏"(闭环)。如果开环回放就能成功,反而说明任务太简单、或策略没学到有意义的反馈控制。底盘速度控制的随机性(转弯漂 >10cm)逼着策略必须闭环。

Q3:为什么作者选"用腰把人拴在车后倒推"这种很土的方案,而不是给操作员加一个摇杆或脚踏板来控制底盘?

提示

因为人的两只手已经被两条主臂占满了。腰推方案(1)不占用手;(2)让人的运动直觉直接迁移,几乎零学习成本(用户研究 5 次就接近专家);(3)撞到东西时腰能感到,天然带粗糙力反馈。摇杆/脚踏板要么占手要么要额外学习。

Q4:静态 ALOHA 老数据的任务(封袋、拿叉子)和移动任务(炒虾、进电梯)完全不重叠,两条手臂摆位也不同,为什么掺进去还能帮上忙?

提示

因为迁移的不是"具体任务",而是更底层的"通用手感"——怎么稳稳抓住一个东西、怎么把夹爪对准目标。这些运动先验和具体任务无关。加上手腕相机带来的视角不变性(相机跟着手走,看到的相对画面在不同任务里相似),让这种迁移即便在任务/摆位不同的情况下也成立。

Q5:为什么在 50 条这种小数据下 ACT(95%)明显比 Diffusion Policy(65%)稳?换成更大的数据集,结论会不会反过来?

提示

扩散模型表达力强,但也更"吃"数据——论文指出过去用 Diffusion Policy 的工作往往训 250+ 条。50 条对它来说容易欠拟合/不够精准(表现为接近厨台、抓酒杯时不够准)。数据量上去后,表达力更强的扩散模型很可能反超,这也是后续很多工作转向扩散/流匹配的原因。

Q6:动作分块(一次预测未来 K 步)在 Mobile ALOHA 里除了缓解复合误差,还额外解决了一个"移动"特有的问题,是什么?

提示

硬件延迟不一致——底盘的"下令速度→实际速度"有明显延迟,而位置控制的手臂几乎没延迟。动作分块让作者能"错位执行":执行前 k−d 步手臂动作 + 后 k−d 步底盘动作,把底盘指令提前发,正好对齐它慢半拍的响应。

Q7:如果给你 3.2 万美元预算,让你改进 Mobile ALOHA 里成功率最低的 Cook Shrimp(40%),你会先从硬件、数据、还是算法下手?为什么?

提示

论文归因是"仅 20 条数据 + 长 75s + 白碗白桌低对比度"。最省钱见效快的多半是数据侧(多采几十条、换成高对比度的碗/桌背景);其次是感知(换更好相机或加深度);算法侧(换扩散/更大模型)在数据不足时收益有限。关键是先定位失败模式,再对症下药,而不是盲目堆算法。

Q8:Mobile ALOHA 走"轮式底盘",HumanPlus 走"双足人形"。抛开炫酷程度,从"数据采集效率"和"任务成功率"角度,轮式相比双足有哪些实打实的优势?

提示

轮式天生稳定(不用花力气学平衡),底盘控制自由度少、更可预测;遥操接口简单(腰推即可),采数据快、门槛低、成本低。双足要额外用 RL 训一个"管平衡的小脑",sim-to-real gap 大、易摔。轮式在"平地家务"这个场景里,把有限的数据和算力都花在了操作本身而非平衡上。


一些好奇心问答(FAQ)

Q:为什么整机预算能压到 3.2 万美元,而现成的双臂移动机器人要 20 万以上?

关键是"拆掉贵的、留下够用的"。底盘用仓储物流的量产小车(7000 美元,比科研级 AGV 便宜 5 倍以上),计算用一台消费级笔记本(3070 Ti)而非工作站,手臂沿用 ALOHA 已经验证过的低成本方案,遥操接口用"腰推"而非昂贵的触觉设备。全部软硬件开源,含 3D 打印、装配、安装教程。

Q:机器人真的在"炒"虾吗,还是摆拍?

真的炒——单面煎、翻面、装盘全套。作者特别指出炒虾最难的是"虾会粘锅,铲子要伸到虾底下精准翻面",这也是它成功率只有 40% 的原因之一。项目主页有完整视频。

Q:为什么老数据要把底盘动作补成 0,而不是干脆不算这部分损失?

补 0 是为了让新老两批数据的动作维度对齐(都变成 16 维),实现上最省事——同一个网络、同一个损失函数就能同时吃两批数据,几乎不用改代码。这正是 co-training 之所以"朴素好用"的工程细节之一。

Q:这套东西能直接买来用吗?

硬件和软件全开源,有详细教程,学术圈可以自己搭。但它是研究原型,不是消费级产品——每个新任务仍要你亲自遥操采几十条数据、单独训一个策略。


如果你想再深入

  1. 先看视频再读论文:项目主页 mobile-aloha.github.io,30 分钟看完所有 demo,建立"任务到底多难"的直觉(炒虾真炒、擦桌真擦)。
  2. 读 §3 硬件 + §4 co-training:这两节是全文最"新"的部分;§2 的 ACT 已在原版 ALOHA 论文里讲透,可先跳过。
  3. 精读 Table 1 的子任务成功率:对比"拧水龙头 0→80""按电梯按钮 5→100"这些子任务,体会 co-training 到底救在了哪一步。
  4. 动手复现的最佳起点:BOM 清单 + 装配图 + 软件全开源,是从 0 搭一台双臂移动遥操机器人的最佳参考。若对底层实现感兴趣,附录 A.3 有 ACT / Diffusion Policy / VINN 的全部超参。

原文信息(BibTeX + 链接)

@inproceedings{fu2024mobilealoha,
  title     = {Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation},
  author    = {Fu, Zipeng and Zhao, Tony Z. and Finn, Chelsea},
  booktitle = {Conference on Robot Learning (CoRL)},
  year      = {2024}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_mobile_aloha_2026,
  title       = {(readable note) Mobile ALOHA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mobile-aloha/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?