Mobile ALOHA
这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式和术语全部翻译成人话。
一句话讲什么(TL;DR)
给原来只能趴在桌上干活的双臂机器人焊一辆能跑的小车,让一个人同时"手控双臂 + 腰推底盘"把整套家务动作录下来;再用一个很朴素的招数——把新录的"移动家务"数据和以前攒的一大堆"桌面双臂"数据混在一起训——就能让机器人只看 50 次示范,学会炒虾、擦红酒渍、进电梯这种"边走边用两只手"的复杂长任务。
所以这一节是想说:Mobile ALOHA 的贡献是"一套买得起的全身遥操硬件(约 3.2 万美元)"加"一个几乎零改动就能用的联合训练(co-training)技巧",两件事合起来把模仿学习从桌面拓展到了整个屋子。
这是个什么场景
想象你想教刚来的家政阿姨做你家那道炒虾。你不会丢一本菜谱让她自己啃,而是站在她旁边,扶着她的手切葱、握锅铲、调火,做几遍她自己就上手了。
机器人学家务也是这个套路。今天让机器人学技能最靠谱的一条路叫模仿学习(imitation learning,让机器人照着人的示范动作学,不用自己试错):人先"手把手"给机器人做一遍,把每一刻的画面和动作都录下来,再喂给神经网络,让它学会"看到这个画面,下一步该怎么动"。
但过去这类工作几乎都卡在桌面上:机器人被固定在一张桌子前,只能做穿电池、拆拉链、叠毛巾这种"手边"的活。原因很简单——它没有腿。锅在灶台上,它够不着;椅子在三米外,它推不到。
真实的家务恰恰不是"手边"的:
把一口重锅收进柜子这一件"小事",机器人得先走到柜子前(要腿),一边后退一边用两只手拉开两扇柜门(要全身协调),再双手合力把锅抬进去(一只手抬不动)。走、协调、双手——缺一样都做不成。
Mobile ALOHA 想补的就是"腿"这一课,同时还要保证两件事不能丢:(1)要便宜,普通实验室买得起、能复现;(2)遥操作要顺手,一个人就能同时把"走"和"两只手干活"演出来,不用两个人配合、也不用戴笨重的头盔。
所以这一节是想说:机器人缺的不是"手",而是"腿" + "一个人能同时把腿和手都演出来的顺手接口";Mobile ALOHA 就是来补这两样的。

之前的人怎么做的,为什么不够好
方案 A:买现成的双臂移动机器人(PR2、TIAGo)。 硬件是有的,但一台常常超过 20 万美元($200k),普通实验室根本买不起;而且要在上面做遥操作还得额外装触觉设备、脚踏板、做繁琐标定。类比:想学做饭却被要求先买下整间米其林后厨。
方案 B:把"导航"和"操作"拆成两半做(传统机器人路线)。 先用 SLAM/规划把车开到位置,停稳,再让手臂干活;干完再开车。类比:一个人走路时绝不动手、动手时绝不走路。像"一边后退一边拉开双开门"这种走和动手必须同时发生的动作,这条路做不了。
方案 C:用强化学习或预设技能块(skill primitives)。 靠奖励函数或人工设计的"抓取""放置"模块拼任务。类比:给机器人一本写死的招式手册,招式之外的情况就抓瞎,换任务要重调,工程量巨大。
方案 D:已有的模仿学习基本只在桌面验证。 RT-1、Diffusion Policy、原版 ALOHA 都证明了"表达力强的策略(如扩散模型、Transformer)"能学好精细桌面操作,但没人验证过同一套配方在"加了底盘、自由度更多"的移动场景还灵不灵。多出来的底盘自由度会带来新麻烦:底盘位置差一点点,手臂末端就会漂一大截。
核心缺口:既没有买得起又顺手的全身遥操硬件来采集"移动 + 双臂"数据,也没人证明过"少量这种数据 + 经典模仿学习"能撑起复杂长任务。
所以这一节是想说:以前要么硬件太贵、要么走和动手不能同时、要么只在桌面上验证过;Mobile ALOHA 要一次补齐"买得起的全身遥操硬件"和"移动场景下的模仿学习配方"。
这篇论文的新想法
一句话:像组装宜家家具一样,把几块"已有的好零件"拧到一起,再加一个几乎不用改代码的训练小技巧。
硬件:在原版 ALOHA 下面焊一辆便宜的轮式底盘,人用腰"推"着走。 原版 ALOHA 是一套低成本的双臂"主从遥操"装置——人手里握着两条"主臂",机器人身上有两条一模一样的"从臂",人动一下、从臂同步动一下。Mobile ALOHA 把它整套架到一辆仓储用的差速小车(AgileX Tracer)上,操作员像系着婴儿车背带一样把腰拴在车后,双手照旧操控主臂,同时用腰前后左右"倒推"轮子来控制底盘。这样一个人、两只手全占着,还能同时把底盘也开起来。
动作表示:把手和底盘拼成一个向量,别的什么都不改。 把两条手臂的 14 个关节角度(含两个夹爪),和底盘的"前进速度 + 转向速度"这 2 个数,直接首尾拼成一个 16 维动作向量。因为只是"拼数字",现成的模仿学习算法(ACT、Diffusion Policy)几乎一行都不用改就能用。
训练技巧:co-training(联合训练)——把新数据和老数据混着学。 每个新任务只录 50 次示范,单靠这点数据训出来的策略很脆。作者的招数是:把这 50 条"移动家务"数据,和以前攒下的一大堆(825 条)"桌面双臂"老数据混在一个训练批次里一起学。老数据里"怎么稳稳抓住一个东西""怎么把手对准目标"的通用手感,会迁移过来,把新任务的成功率显著抬高——即便老数据的任务、机械臂摆位都和新任务不一样。
所以这一节是想说:新想法不在于某个炫酷模型,而在于"便宜顺手的硬件 + 把动作拼成一个向量 + 新老数据混训"这三个朴素选择合起来,恰好把模仿学习从桌面搬进了整间屋子。
它分几步做的(方法)
这一节最长,因为 Mobile ALOHA 真正的功夫全在"硬件怎么搭、数据怎么采、训练怎么混"这些工程细节里。我们按"硬件 → 遥操接口 → 数据 → 训练目标 → 推理时的小心机"五步拆开讲,每步都标清楚"输入 → 处理 → 输出"。
第 1 步:硬件——挑一辆"又快又稳又便宜"的底盘(输入:设计约束;输出:一台能跑的车)
作者给底盘定了四条硬指标,像买车前列的需求清单:
- 快(Mobile):能以接近人走路的速度移动,约 1.42 m/s。
- 稳(Stable):抬重锅、拉柜门时不能翻车。
- 全身可遥操(Whole-body teleoperation):两条手臂 + 底盘的所有自由度必须能同时被一个人控制。
- 不用拖线(Untethered):电源和计算全背在车上。
据此他们选了仓储物流用的 AgileX Tracer 差速小车:最高 1.6 m/s(和人快走差不多),载重 100 kg,机身只有 17 mm 高,能翻过 10 mm 高的小坎、爬 8 度带载坡道,离地间隙 30 mm(实测连电梯和地面之间那道缝都能过)。价格 7000 美元,比同规格的科研级 AGV(如 Clearpath)便宜 5 倍以上。
为了"不用拖线",车底装了一块 1.26 kWh、14 kg 的电池——它同时兼职压舱配重,把重心压低防翻车。所有计算跑在一台消费级笔记本上(Nvidia 3070 Ti,8GB 显存 + i7-12800H),不需要工作站。
整台车最终能:垂直够到 65–200 cm(弯腰到举高)、水平探出底盘 100 cm、单次抬起 1.5 kg、在 1.5 m 高处施加 100 N 拉力。总预算约 3.2 万美元,和一台工业协作臂 Franka Panda 单臂差不多——但你得到的是"双臂 + 移动 + 车载算力"的完整系统。
第 2 步:遥操接口——用"腰推车"解决"手不够用"(输入:人的身体动作;输出:底盘速度 + 双臂关节)
这里有个很妙的痛点:全身遥操最大的难题是人的两只手已经被两条主臂占满了,拿什么去控制底盘?
作者没有加摇杆、没有加脚踏板,而是选了最土也最直接的方案:把操作员的腰用背带拴在车后端。轮子在不通电时摩擦极小(在 PVC 地板上倒推的阻力约 13 N,一般人推得动),操作员像倒推购物车一样用腰"带"着车走。这样做的好处有三:
- 人的运动直觉直接迁移:你想让车往哪走,身体往哪靠就行,不用学摇杆。
- 天然的粗糙力反馈:车撞到东西,人的腰能直接感到那股顶劲。
- 不需要 FPV 头盔:操作员本人就在车旁,用自己的眼睛看现场,不用戴头盔看机器人第一视角的直播画面。
系统实时记录底盘的线速度和角速度作为动作标签,同时记录全部 4 条手臂(2 主 2 从)的关节角度。执行阶段(机器人自主干活时),拴腰的背带和两条主臂只要拧开 4 颗螺丝就能拆掉,机器人瞬间"瘦身",只剩两条从臂。
一张图看懂"一个人怎么同时控制手和车":
操作员(一个人)
┌────────────┼─────────────┐
左手握主臂 腰拴背带 右手握主臂
│ │ │
▼ ▼ ▼
┌─────────┐ ┌──────────┐ ┌─────────┐
│ 左从臂 │ │ 倒推轮子 │ │ 右从臂 │
│ 7 关节 │ │→底盘vx,ω │ │ 7 关节 │
└────┬────┘ └────┬─────┘ └────┬────┘
└────────────┼─────────────┘
▼
14 维手臂关节 + 2 维底盘速度 = 16 维动作
▼
与 3 路相机画面一起,30/50Hz 录成"画面-动作"配对
第 3 步:数据采集——三只眼睛 + 30/50 Hz 录像(输入:一次任务演示;输出:带时间戳的"画面-动作"配对)
观测(机器人"看到 + 感到"的东西)由两部分组成:
- 视觉:3 个 Logitech RGB 相机,分辨率 480×640。两个装在左右手腕(近距离盯着夹爪在干什么),一个装在双臂之间朝前(顶部俯视/第一视角全景)。
- 本体感觉(proprioception):4 条手臂的关节角度,通过 USB 串口读;底盘速度通过 CAN 总线读。
一句话补充术语——本体感觉就是机器人"闭着眼也知道自己每个关节现在弯了多少度"的能力,类似你闭眼也知道自己胳膊是伸直还是弯着。
每个任务录约 50 条演示(长任务 High Five、Cook Shrimp 因为更费时只录 20 条)。
第 4 步:训练目标——co-training 的数学其实很朴素(输入:新老两批数据;输出:一个策略网络)
记聚合起来的桌面老数据为 $D_{\text{static}}$(共 825 条,任务是封保鲜袋、拿叉子、包糖、撕纸巾、插电池等,和移动任务完全不重叠,连两条手臂的摆位都不同),某个移动任务 $m$ 的新数据为 $D_{\text{mobile}}^{m}$。手臂动作是 14 维目标关节角 $a_{\text{arms}}\in\mathbb{R}^{14}$,底盘动作是 2 维目标速度 $a_{\text{base}}\in\mathbb{R}^{2}$。训练目标是这样一个"两项相加"的损失:
$$ \mathbb{E}{D{\text{mobile}}^{m}}\big[L(a_{\text{arms}}, a_{\text{base}}, \pi^m(o))\big] ;+; \mathbb{E}{D{\text{static}}}\big[L(a_{\text{arms}}, [0,0], \pi^m(o))\big] $$
人话翻译:这个公式就一句话——"新数据和老数据各学一半"。
- 第一项:喂移动数据时,让网络同时预测对手臂和底盘的动作。
- 第二项:喂桌面老数据时,因为老数据没有底盘,就把底盘动作当成 0 来凑数(zero-pad,补零),只让网络学好手臂那部分。
具体做法:从两个数据集各以 50% 概率采样凑成一个 batch(batch size = 16);老数据只有黑桌面前拍的画面、没有前置相机,就忽略前相机让两边都统一成 3 路画面;所有动作按移动数据自己的统计量做归一化。就这么简单——没有对比学习、没有额外网络、没有花哨的对齐,就是"新老掺着喂"。
用一张图看 co-training 的数据流:
新数据 D_mobile (50 条/任务) 老数据 D_static (825 条桌面)
[画面 + 14维手臂 + 2维底盘] [画面 + 14维手臂 + 底盘补0]
│ 各 50% 概率采样 │
└───────────┬───────────────┘
▼
同一个策略网络 π
(ACT / Diffusion Policy / VINN)
▼
损失 = 移动项(手臂+底盘) + 桌面项(仅手臂, 底盘=0)
▼
老数据的"抓取/对位"手感 → 迁移 → 抬高新任务成功率
这套配方能套在任意底层算法上。论文试了三种:
- ACT(Action Chunking Transformer):原版 ALOHA 的方法,用 Transformer + CVAE,一次预测未来 45 步动作(chunk size = 45)。
- Diffusion Policy:用扩散模型一点点"去噪"出动作序列,chunk size = 64,推理用 DDIM 加速。
- VINN:一个"查字典"式方法,先学视觉表征(BYOL),再用最近邻从示范库里检索动作,作者给它也加上了动作分块(chunk size = 100)。
顺带补一个关键术语——动作分块(action chunking):策略不是走一步算一步,而是一次预测未来一整串(一个 chunk)动作。好处一是缓解模仿学习的老毛病"复合误差"(每步都偏一点点,几十步后就偏出天际),二是能灵活对付硬件延迟。
第 5 步:推理时的小心机——用分块错位补底盘延迟(输入:一个动作块;输出:错开执行的手臂/底盘指令)
作者发现底盘的"下令速度"和"实际速度"之间有明显延迟(电机、地面打滑导致),而位置控制的手臂几乎没延迟。于是他们用动作分块玩了个错位:对一个长度为 $k$ 的动作块,若底盘延迟 $d$ 步,就执行前 $k-d$ 步的手臂动作 + 后 $k-d$ 步的底盘动作,让底盘的指令"提前发",正好和它慢半拍的实际响应对齐。
一个反直觉但关键的事实:作者验证过,把一条演示原封不动"开环回放"(不看画面、照着录像的动作硬走一遍),整任务成功率是 0%。 因为底盘速度控制有随机性——同一段"半径 1m 的 180 度转弯"回放 20 次,末端位置平均漂了 10cm 以上、散布约 20cm。所以策略必须闭环:一边看画面一边实时纠偏,才能把任务做成。这也反过来说明学到的策略确实在"看着干活",而不是背录像。
所以这一节是想说:Mobile ALOHA 的方法核心不在算法本身(算法直接借用现成的),而在"腰推底盘的顺手接口 + 把手和底盘拼成一个向量 + 新老数据各半掺训 + 分块错位补延迟"这一整套工程组合拳,让复杂移动操作第一次能用几十条数据学出来。

关键数字(What works)
先看硬件与系统规格:
| 指标 | Mobile ALOHA | 对照 |
|---|---|---|
| 整机预算 | 约 $32k | PR2 / TIAGo > $200k |
| 底盘(Tracer)单价 | $7,000 | 同规格科研 AGV 贵 5 倍以上 |
| 最高移动速度 | 1.6 m/s(人快走 ~1.42 m/s) | — |
| 底盘载重 / 高度 | 100 kg / 17 mm | — |
| 可达高度 / 水平伸展 | 65–200 cm / 100 cm | — |
| 抬举 / 拉力 | 1.5 kg / 100 N @ 1.5 m | — |
| 电池 | 1.26 kWh, 14 kg(兼配重) | — |
| 计算 | 笔记本 3070 Ti (8GB) + i7-12800H | — |
| 相机 | 3× RGB 480×640(双腕 + 顶部) | — |
| 占地 | 90 cm × 135 cm | — |
再看核心结论——co-training 对 ACT 在 7 个任务上"整任务成功率(%)"的提升(每项 20 次试验,Cook Shrimp 仅 5 次;括号为示范条数):
| 任务 | 无 co-train | 有 co-train | 提升 |
|---|---|---|---|
| Wipe Wine 擦红酒渍 (50) | 50 | 95 | +45 |
| Cook Shrimp 炒虾 (20) | 20 | 40 | +20 |
| Rinse Pan 洗锅 (50) | 0 | 80 | +80 |
| Use Cabinet 收锅入柜 (50) | 85 | 85 | 0 |
| Call Elevator 叫电梯 (50) | 0 | 95 | +95 |
| Push Chairs 推椅子 (50) | 0 | 80 | +80 |
| High Five 击掌 (20) | 85 | 85 | 0 |
一些能看出"co-training 到底帮在哪"的子任务对比:
| 子任务 | 无 co-train | 有 co-train |
|---|---|---|
| 洗锅:拧开水龙头 | 0 | 80 |
| 叫电梯:按按钮 | 5 | 100 |
| 叫电梯:进电梯 | 0 | 95 |
| 推椅子:第 5 把(训练没见过) | 0 | 89 |
其他关键消融:
| 实验 | 设置 | 结果 |
|---|---|---|
| 数据配比鲁棒性(Wipe Wine) | 老数据占 30 / 50 / 70% | 95 / 95 / 90 |
| co-train vs pre-train(Wipe Wine) | co-train / 先预训后微调 / 都不用 | 95 / 40 / 50 |
| 数据效率(Wipe Wine) | co-train 35 条 vs 无 co-train 50 条 | 70 vs 50(少用数据反而更好) |
| 遥操上手速度(用户研究,8 人) | Wipe Wine 完成时间 | 46s → 28s(快 39%) |
| 遥操上手速度 | Use Cabinet 完成时间 | 75s → 36s(快 52%) |
一句总括:只用 20–50 条示范,7 个任务里 5 个能到 80%+,平均绝对提升 34%;而且 co-training 对数据配比不敏感、比"先预训再微调"更好、还更省数据。
所以这一节是想说:co-training 不是锦上添花,而是把"精细操作瓶颈子任务"(拧水龙头、按按钮、进电梯)从"几乎做不成"直接拉到"基本能用",这才是它值 34% 平均提升的原因。
实验结果说明了什么
第一,co-training 主要救的是"精细接触"那几步。 无 co-train 时,洗锅的"拧水龙头"、叫电梯的"进电梯"成功率是 0——不是机器人不想做,而是底盘随机漂移带来的复合误差把手臂对准的机会毁了。掺入桌面老数据后,那些"稳稳抓住、精准对位"的通用手感迁移过来,把这些卡点子任务从 0 抬到 80–95%。作者推测:桌面数据里"抓取、接近物体的运动先验"配合手腕相机的视角不变性,正好补上了移动场景最缺的那一环。
第二,co-training 比"先预训再微调"更好,且对配比不敏感。 先在老数据上训、再用新数据微调(pre-train)只有 40%,甚至不如什么都不加的 50%——因为微调阶段网络"忘"掉了老数据学到的东西(灾难性遗忘)。而"新老同时喂"(co-train)达 95%。而且老数据占 30% / 50% / 70% 时结果都在 90–95%,说明这招几乎不用调参就能直接用到新任务上,工程上非常省心。
第三,它对算法不挑食。 ACT、Diffusion Policy、VINN 三种风格迥异的方法都能在 Mobile ALOHA 上跑通、都能从 co-training 受益。不过在 50 条这种小数据下,ACT 最稳(Wipe Wine 95%),Diffusion Policy 稍逊(65%,作者认为扩散模型通常要 250+ 条才够),VINN 最弱(15%)但也能用。这说明"数据 + 硬件"这套系统本身是通用底座,不绑死在某个算法上。
第四,硬件顺手是有据可查的,不是自夸。 8 名新手(一半没遥操经验)在 5 次尝试内就把两个陌生任务的完成时间砍掉近一半、接近专家速度——这说明"腰推底盘 + 主从双臂"的接口学习曲线极陡(好的意义上),是这套数据采集能规模化的前提。
所以这一节是想说:实验讲了一个连贯的故事——便宜顺手的硬件让人能高效采数据,而 co-training 让这点数据足以攻克真正的瓶颈(精细接触步骤),两者缺一,复杂移动家务都学不出来。
你应该懂的几个新词
- 模仿学习(imitation learning)/ 行为克隆(behavior cloning, BC):让神经网络照着人的"状态→动作"示范学,不用像强化学习那样自己试错找奖励。BC 是它最朴素的形式。
- 遥操作(teleoperation):人操控、机器人忠实复制人的动作,是采集示范数据最常用的手段。
- 全身控制 / 全身遥操(whole-body teleoperation):同时协调多个执行器(这里是双臂 + 底盘)完成一个目标,而不是分阶段"先走后动手"。
- co-training(联合训练):把不同分布的多批数据混在一个训练过程里一起学,让稀缺任务借用充足任务的先验。区别于"先在 A 上预训、再到 B 上微调"。
- 动作分块(action chunking):策略一次预测未来 K 步动作而非单步,缓解复合误差、抗延迟。ACT 的核心思想。
- 复合误差(compounding error):模仿学习的老问题——每步预测都有小误差,几十步后累积到偏出训练分布,再也回不来。
- 本体感觉(proprioception):机器人对自身关节角度/速度的感知,相当于人闭眼也知道胳膊弯没弯。
- 开环 vs 闭环(open-loop vs closed-loop):开环 = 不看反馈照着预定动作硬走;闭环 = 一边看画面一边实时纠偏。Mobile ALOHA 证明这类任务必须闭环。
所以这一节是想说:读懂 Mobile ALOHA 只需抓住三个词——模仿学习(怎么学)、动作分块(怎么稳)、co-training(怎么用少量数据学好)。
它有什么搞不定的
- 占地太大,进不了窄路。 整机 footprint 90 cm × 135 cm,对某些窄走廊、窄门就太宽了。作者把"缩小占地"列为未来工作。
- 手臂高度固定,够不到低处。 两条从臂的安装高度是固定的,导致低矮柜子、烤箱、洗碗机很难够到。需要给手臂加"升降自由度"才能解决。
- 只做了单任务模仿,不会自我进化。 每个任务单独训一个策略,机器人既不能自主探索获取新知识,也不能在使用中自我改进——学会的就是那几招。
- 依赖高质量专家示范。 数据由两名熟练操作员采集。如何从"很差、很杂、水平参差"的示范里学好,论文没解决,留给了未来。
- 底盘速度控制随机性大,强依赖闭环纠偏。 开环回放整任务成功率为 0(180 度转弯末端漂 >10cm)。这意味着一旦视觉受扰(如炒虾时白碗白桌低对比度),策略纠不回来就容易失败——Cook Shrimp 只有 40% 正是栽在这里(长 75s、仅 20 条数据、白碗白桌)。
- 数据仍需真人逐条遥操,规模化有天花板。 虽然比买 20 万的机器人便宜,但每个新任务仍要人工采几十条、每条几十秒到分钟级,扩到成百上千个任务时人力成本不可忽视。
所以这一节是想说:Mobile ALOHA 证明了"便宜硬件 + 少量数据"能做复杂移动操作,但它还是"一招一学、靠人喂数据、靠闭环救场"的窄专家,离"自己会琢磨、能泛化"的通用机器人还很远。
它和别的几篇是什么关系
- 承接 ALOHA / ACT(同组前作,Zhao et al. 2023):硬件的双臂主从结构、ACT 算法、825 条静态数据全部直接复用。可以粗略地把 Mobile ALOHA 理解为"ALOHA + 一辆车 + co-training 技巧"。
- 对照 RT-1 / RT-2 / Open X-Embodiment:这几条线靠"超大数据 + 大模型"追求广泛泛化;Mobile ALOHA 反着来,用"少量高质量遥操数据 + 经典模仿学习"专攻复杂长任务。它借用的正是 Open X-Embodiment(RT-X)里释放的静态 ALOHA 数据。
- 对比 Diffusion Policy:作为三个 baseline 之一被对比。结论是在 50 条这种小数据下 ACT 更稳,但 Diffusion Policy 在数据更多时更有潜力。
- 延伸到 HumanPlus(同组后作):HumanPlus 把"双臂 + 轮式底盘"进一步升级为"全身人形",把"腰推遥操"换成"影子模仿",是这条研究线的自然下一步。轮式(Mobile ALOHA)更稳更便宜,双足(HumanPlus)更通用——是路线之争。
- 影响一大批"廉价 ALOHA 复现"工作:2024 年后 ALOHA Unleashed、各种开源复现项目大量沿用它的硬件设计和 co-training 思路。
所以这一节是想说:Mobile ALOHA 站在 ALOHA 的肩膀上、借了 RT-X 的数据、和大模型路线互为对照,又亲手把接力棒传给了人形机器人(HumanPlus)。
和本导读的关系
它属于导读里模仿学习这条主线,建议配合 第 14 章 · 模仿学习 阅读。那一章讲清了行为克隆、DAgger、动作分块、co-training 的来龙去脉;Mobile ALOHA 是这些概念落到"真实家务 + 移动操作"上的一个完整系统级案例。读完本篇再回看同章的 act-aloha(算法起点)、diffusion-policy(对照方法)、humanplus(人形延伸),能串出一条"桌面双臂 → 移动双臂 → 全身人形"的清晰演进线。
思考题
Q1:为什么"co-training(新老掺着一起训)"比"先在老数据上预训、再用新数据微调"效果好那么多(95% vs 40%)?
提示
想想"灾难性遗忘"。微调阶段网络只见新数据,会逐渐忘掉预训练学到的东西;而 co-training 全程新老同时在场,老数据的"抓取/对位先验"一直被复习,不会丢。论文也明确用"网络在微调时忘掉了静态数据经验"来解释。
Q2:论文说"把一条演示原封不动开环回放,整任务成功率是 0%"。这个看似负面的结果,为什么其实是个好消息?
提示
它证明了学到的策略不是在"背录像",而是在真正地"看着画面实时纠偏"(闭环)。如果开环回放就能成功,反而说明任务太简单、或策略没学到有意义的反馈控制。底盘速度控制的随机性(转弯漂 >10cm)逼着策略必须闭环。
Q3:为什么作者选"用腰把人拴在车后倒推"这种很土的方案,而不是给操作员加一个摇杆或脚踏板来控制底盘?
提示
因为人的两只手已经被两条主臂占满了。腰推方案(1)不占用手;(2)让人的运动直觉直接迁移,几乎零学习成本(用户研究 5 次就接近专家);(3)撞到东西时腰能感到,天然带粗糙力反馈。摇杆/脚踏板要么占手要么要额外学习。
Q4:静态 ALOHA 老数据的任务(封袋、拿叉子)和移动任务(炒虾、进电梯)完全不重叠,两条手臂摆位也不同,为什么掺进去还能帮上忙?
提示
因为迁移的不是"具体任务",而是更底层的"通用手感"——怎么稳稳抓住一个东西、怎么把夹爪对准目标。这些运动先验和具体任务无关。加上手腕相机带来的视角不变性(相机跟着手走,看到的相对画面在不同任务里相似),让这种迁移即便在任务/摆位不同的情况下也成立。
Q5:为什么在 50 条这种小数据下 ACT(95%)明显比 Diffusion Policy(65%)稳?换成更大的数据集,结论会不会反过来?
提示
扩散模型表达力强,但也更"吃"数据——论文指出过去用 Diffusion Policy 的工作往往训 250+ 条。50 条对它来说容易欠拟合/不够精准(表现为接近厨台、抓酒杯时不够准)。数据量上去后,表达力更强的扩散模型很可能反超,这也是后续很多工作转向扩散/流匹配的原因。
Q6:动作分块(一次预测未来 K 步)在 Mobile ALOHA 里除了缓解复合误差,还额外解决了一个"移动"特有的问题,是什么?
提示
硬件延迟不一致——底盘的"下令速度→实际速度"有明显延迟,而位置控制的手臂几乎没延迟。动作分块让作者能"错位执行":执行前 k−d 步手臂动作 + 后 k−d 步底盘动作,把底盘指令提前发,正好对齐它慢半拍的响应。
Q7:如果给你 3.2 万美元预算,让你改进 Mobile ALOHA 里成功率最低的 Cook Shrimp(40%),你会先从硬件、数据、还是算法下手?为什么?
提示
论文归因是"仅 20 条数据 + 长 75s + 白碗白桌低对比度"。最省钱见效快的多半是数据侧(多采几十条、换成高对比度的碗/桌背景);其次是感知(换更好相机或加深度);算法侧(换扩散/更大模型)在数据不足时收益有限。关键是先定位失败模式,再对症下药,而不是盲目堆算法。
Q8:Mobile ALOHA 走"轮式底盘",HumanPlus 走"双足人形"。抛开炫酷程度,从"数据采集效率"和"任务成功率"角度,轮式相比双足有哪些实打实的优势?
提示
轮式天生稳定(不用花力气学平衡),底盘控制自由度少、更可预测;遥操接口简单(腰推即可),采数据快、门槛低、成本低。双足要额外用 RL 训一个"管平衡的小脑",sim-to-real gap 大、易摔。轮式在"平地家务"这个场景里,把有限的数据和算力都花在了操作本身而非平衡上。
一些好奇心问答(FAQ)
Q:为什么整机预算能压到 3.2 万美元,而现成的双臂移动机器人要 20 万以上?
关键是"拆掉贵的、留下够用的"。底盘用仓储物流的量产小车(7000 美元,比科研级 AGV 便宜 5 倍以上),计算用一台消费级笔记本(3070 Ti)而非工作站,手臂沿用 ALOHA 已经验证过的低成本方案,遥操接口用"腰推"而非昂贵的触觉设备。全部软硬件开源,含 3D 打印、装配、安装教程。
Q:机器人真的在"炒"虾吗,还是摆拍?
真的炒——单面煎、翻面、装盘全套。作者特别指出炒虾最难的是"虾会粘锅,铲子要伸到虾底下精准翻面",这也是它成功率只有 40% 的原因之一。项目主页有完整视频。
Q:为什么老数据要把底盘动作补成 0,而不是干脆不算这部分损失?
补 0 是为了让新老两批数据的动作维度对齐(都变成 16 维),实现上最省事——同一个网络、同一个损失函数就能同时吃两批数据,几乎不用改代码。这正是 co-training 之所以"朴素好用"的工程细节之一。
Q:这套东西能直接买来用吗?
硬件和软件全开源,有详细教程,学术圈可以自己搭。但它是研究原型,不是消费级产品——每个新任务仍要你亲自遥操采几十条数据、单独训一个策略。
如果你想再深入
- 先看视频再读论文:项目主页 mobile-aloha.github.io,30 分钟看完所有 demo,建立"任务到底多难"的直觉(炒虾真炒、擦桌真擦)。
- 读 §3 硬件 + §4 co-training:这两节是全文最"新"的部分;§2 的 ACT 已在原版 ALOHA 论文里讲透,可先跳过。
- 精读 Table 1 的子任务成功率:对比"拧水龙头 0→80""按电梯按钮 5→100"这些子任务,体会 co-training 到底救在了哪一步。
- 动手复现的最佳起点:BOM 清单 + 装配图 + 软件全开源,是从 0 搭一台双臂移动遥操机器人的最佳参考。若对底层实现感兴趣,附录 A.3 有 ACT / Diffusion Policy / VINN 的全部超参。
原文信息(BibTeX + 链接)
- 论文:Zipeng Fu, Tony Z. Zhao, Chelsea Finn. Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation. CoRL 2024.
- arXiv:https://arxiv.org/abs/2401.02117
- 项目主页:https://mobile-aloha.github.io
@inproceedings{fu2024mobilealoha,
title = {Mobile ALOHA: Learning Bimanual Mobile Manipulation with Low-Cost Whole-Body Teleoperation},
author = {Fu, Zipeng and Zhao, Tony Z. and Finn, Chelsea},
booktitle = {Conference on Robot Learning (CoRL)},
year = {2024}
}
◼
引用本笔记 / Cite this note
@online{eai_mobile_aloha_2026,
title = {(readable note) Mobile ALOHA},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mobile-aloha/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?