Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 56

ALOHA 2

26 min read · 9015 字 · ⭐⭐ · 长篇结构化

这是一份给"完全没搭过机器人、也不懂模仿学习"的读者看的精读笔记。所有术语都翻成人话,类比都来自日常生活。这是一篇硬件技术报告,评价它不能只看算法指标,要看它作为"研究基础设施"好不好用。数字没有的地方会写明"原文未报告"。

   人(操作员)                 机器(工作端)
   ┌──────────┐               ┌──────────┐
   │ 左主臂    │──同步映射────►│ 左从臂    │  抓、拧、拉
   │ 右主臂    │──同步映射────►│ 右从臂    │  精细双手操作
   └──────────┘               └──────────┘
        │  全过程录制(关节角 + 图像)
        ▼
   示范数据集 ──► 模仿学习(ACT / Diffusion Policy)──► 机器人自主执行

   ALOHA 2 的改动:不是新算法,而是把这台"教学设备"升级
   ├─ 夹爪握把重设计(能连续操作数小时不酸手)
   ├─ 结构件加固(日常使用更耐久)
   ├─ 工作台/视觉标准化(跨实验室数据可合并)
   ├─ 官方 MuJoCo 仿真模型 + 系统辨识
   └─ 全套硬件设计开源(CAD + 教程)

1. 一句话讲什么(TL;DR)

ALOHA 2 不是新算法,而是把"教机器人用双手干活"的那台遥操作设备升级了一遍:更顺手、更耐用、还配了一个和真机对齐的仿真模型,全部图纸和教程开源,目的就是让全世界实验室能更快、更规模化地采集双臂操作数据。

更具体一点:它是斯坦福 ALOHA(一代)的增强版,在三方面变好——性能(performance)、人体工学(ergonomics)、鲁棒性(robustness)。它还发布了一个带**系统辨识(system identification)**的 MuJoCo 仿真模型,让你在电脑里模拟的 ALOHA 2 和真机行为接近。作者把所有硬件设计连同详细教程全部开源,明确目标是"加速大规模双臂操作研究"。这类工作的价值不在某个 benchmark 数字,而在它把"采数据"这件事的门槛降下来了——而数据,正是当下模仿学习最大的瓶颈。

所以这一节是想说:ALOHA 2 是一份"研究基础设施"的工程交付——把双臂遥操作平台打磨得更好用、更耐用、可仿真、可复刻,让整个社区更容易攒出高质量的双臂示范数据。


2. 这是个什么场景

想象你在教一个从没下过厨的朋友剥虾:光说"把头掐掉、剥壳、挑虾线"没用,最快的办法是抓着他的手做一遍,让他记住手指该使多大力、什么时候该转腕。教机器人叠衣服、倒水、拉拉链也是这套逻辑——人捏着两只"主臂"(leader)操作,机器上对应的两只"从臂"(follower)同步动,全过程录下来,机器人事后照着数据练。这套"人手把手教、机器录下来学"的流程,就是遥操作 + 模仿学习

第一代 ALOHA 就是这么个"教学手柄 + 双臂机器",成本约 2 万美元,比动辄几十万的商用机械臂便宜得多,还开源,所以火遍了机器人学习圈。但用过的人会抱怨:

  • 捏一上午手就酸了(人体工学差);
  • 某个零件三天断一次(耐久度差);
  • 想自己也搭一台,要踩半个月的坑(复刻门槛高)。

ALOHA 2 干的事,就像把一台手工组装的原型车改造成 4S 店量产款——工作原理没变(还是同构主从遥操作),但你能舒服地连录 8 小时,合作实验室也能在合理时间内复刻一台一模一样的、还能在仿真里先跑通。

为什么这件事重要?原文开门见山点破了行业现状:多样化的示范数据集推动了机器人学习的重大进展,但数据的"灵巧度"和"规模"被三样东西卡住了——硬件成本、硬件鲁棒性、遥操作的易用性。 换句话说,算法(ACT、Diffusion Policy)已经很强了,瓶颈悄悄从"算法"挪到了"能不能低成本、大规模、稳定地采到好数据"。ALOHA 2 正是冲着这三个卡点去的。

所以这一节是想说:本文瞄准的是模仿学习的真正瓶颈——数据采集基础设施。它要让"低成本、大规模、稳定地采双臂示范数据"这件事变得可行。


ALOHA 2 — 场景示意:这论文要解决的现实问题
Plate Nº IALOHA 2 — 场景示意:这论文要解决的现实问题

3. 之前的人怎么做的,为什么不够好

  • ALOHA v1(2023,斯坦福):低成本(约 2 万美元)双臂遥操作平台的开创者,配套 ACT 算法。证明了"便宜的同构主从 + 模仿学习"能学会精细双臂任务。但它是研究原型而非产品级——人体工学和耐久度还有不少粗糙处,长时间用会累、零件易坏。

  • Mobile ALOHA(2024 早):在 ALOHA 上加了移动底盘,证明"低成本双臂 + 模仿学习"能做出做饭、擦地等长时序移动任务。但它继承了 v1 的硬件痛点,采数据仍然不够舒服、不够稳。

  • 昂贵的商用双臂方案(Franka Panda 双臂、ABB YuMi 等):遥操作精度高、耐久好,但单台数十万人民币,想靠它规模化采集成千上万条示范,成本上几乎不可行。

  • VR / 视觉遥操作(Quest、Vision Pro + 视觉反馈):用头显和手部追踪代替主从机械臂,省了主端硬件,但缺了力反馈和"主从关节一一对应"的同构感,对需要力控和精细协调的双手任务不够友好。

  • 算法侧工作(ACT、Diffusion Policy 等):算法越做越强,但都被"数据不够多 / 不够干净"卡住——瓶颈从算法转移到了数据采集流程。

核心判断:便宜的原型(ALOHA v1)不够耐用好用,好用耐用的商用方案又太贵。中间缺一个"既便宜、又好用耐用、还能大规模复刻"的标准化平台。

所以这一节是想说:前人要么便宜但粗糙(ALOHA v1),要么好用但昂贵(商用臂);ALOHA 2 的空位是"把便宜平台打磨到接近产品级的好用和耐用,并让它可标准化复刻"。


4. 这篇论文的新想法

核心判断:模仿学习的瓶颈已经从"算法"挪到了"数据采集基础设施"。算法(ACT、Diffusion Policy)在 50–200 条示范上已能学会单任务,但要走向通用机器人,需要 10⁴–10⁶ 量级的双臂示范——这只能靠"很多实验室、很多操作员、很多小时"的众包模式。

要让这个众包模式跑起来,硬件必须同时满足三件事,这也正是 ALOHA 2 的三个改进方向:

  1. 人能舒服地操作数小时(不是数分钟)——重新设计夹爪握把、平衡配重、视觉反馈布置,把"单次连续操作时长"从分钟级推到小时级(性能 + 人体工学)。

  2. 零件在日常高强度使用下不轻易坏——替换易磨损部件、加固结构和线缆走向,提升耐久(鲁棒性)。

  3. 任何人按文档能复刻,还能先在仿真里验证——完整开源 CAD、装配教程、软件栈,并提供带系统辨识的 MuJoCo 模型,让仿真行为贴近真机。

等等,先慢一拍——"发布仿真模型"为什么是个重要贡献? 因为有了和真机对齐的仿真,你可以在电脑里先跑通策略、调好参数,再迁移到真机,省下大量真机试错的时间和磨损。而"系统辨识"是关键——它测量真机的物理参数(质量、摩擦、电机特性等)并写进仿真,让仿真里的机械臂动起来和真机像,而不是一个"看着像但动起来不对"的花瓶模型。

ALOHA 2 没发明新算法、没发新数据集,它发的是一份"让别人能更快、更省、更稳地做研究"的工程交付。这本身就是一类一流贡献。

所以这一节是想说:本文的新意是把"数据采集平台"当成一等研究对象,从人体工学、耐久性、可仿真、可复刻四个维度系统升级,为大规模双臂数据众包扫清硬件障碍。


5. 它分几步做的(方法)

这是硬件技术报告,"方法"就是各项工程改进。下面逐项拆开,每项先打比方,再讲"改了什么 → 为什么改 → 带来什么"。需要注意:作为技术报告,许多改动的定量效果原文未给出具体数字,判断它好不好主要看后续社区采用率。

5.1 夹爪与握把重设计(gripper & handle)

类比:把一把廉价剪刀换成专业理发剪——同样是"剪东西",但握感和耐用度完全两回事。

改了什么:一代 ALOHA 的夹爪开合常用橡皮筋作被动元件,磨损快、扭矩不稳定(橡皮筋拉久了变松,夹持力就飘)。ALOHA 2 换成了更稳定的低摩擦机构(具体机械方案以原文/开源图纸为准,可能是张紧弹簧/滑轨类结构),同时把主臂握把做成更贴合手部解剖的形状。

为什么改:橡皮筋的力道不稳会直接影响示范质量——你以为夹住了其实没夹稳,录进数据就是噪声。握把不贴手则会让操作员几分钟就累,没法长时间采集。

带来什么:夹持力更稳定、可重复;握持疲劳大幅降低,把"单次连续操作时长"从分钟级推到小时级。这是"能不能采大规模数据"的第一道关。

所以这一节是想说:夹爪和握把的重设计既提升了示范数据的稳定性(力控更可靠),又让操作员能久握不累,是支撑大规模采集的关键改动。

5.2 结构件与传动的耐久性升级

类比:把宜家板材家具升级成实木打榫——看着差不多,但天天摇晃就知道差距。

改了什么:把一代里易坏的部件(如部分 3D 打印件)换成更耐用的材料/工艺,重新设计关键关节的电机座和线缆走向,减少线材在反复运动中的应力集中。

为什么改:众包采集意味着每台机器每天要被不同操作员用很多小时、连续用很多天。三天断一次零件的平台,根本没法支撑"很多实验室、很多小时"的规模。

带来什么:整机在每天数小时、长期使用下更少出故障(具体的平均无故障时长等耐久数字原文未报告)。耐久度直接决定平台能不能真正跑起规模化采集。

所以这一节是想说:结构与传动的加固是为"高强度、长周期、多操作员"的众包场景服务的——不耐用的平台无法规模化,这一步是鲁棒性的核心。

5.3 视觉与工作台标准化

类比:连锁餐厅的"标准后厨"——每家店的灶台高度、刀具摆位都一致,菜谱才能跨店复用。

改了什么:给摄像头位置、工作台尺寸、灯光环境等给出推荐的标准配置(具体参数以原文/开源文档为准)。

为什么改:这看似琐碎,但对"跨实验室数据可合并"极其关键。如果 A 实验室的桌子比 B 矮 5cm、相机视角偏 10°,那么 A 采的数据训出的策略到 B 就可能直接失效——数据合不到一起,众包就成了空话。

带来什么:不同实验室、不同操作员采的数据能被规整到同一套坐标和视角约定下,从而可以合并成一个大数据集。这是"很多实验室的数据能不能变成一个大池子"的前提。

所以这一节是想说:工作台和视觉的标准化是让跨实验室数据可合并的隐形基础设施——没有它,众包采来的数据就是一盘散沙。

5.4 MuJoCo 仿真模型 + 系统辨识

类比:给真车配一个高保真的驾驶模拟器——你可以在模拟器里先练、先撞、先调,成本低还不伤真车;但前提是模拟器的物理手感要和真车一致,否则练了白练。

改了什么:发布一个 ALOHA 2 的 MuJoCo 仿真模型,并做了系统辨识——测量真机的物理参数(惯量、摩擦、电机响应等)写进仿真,让仿真的动力学贴近真机。

为什么改:真机试错慢、伤零件。有了对齐的仿真,可以在电脑里先跑通策略、生成合成数据、做算法原型,再迁移真机,大幅提速。系统辨识是"仿真可信"的关键——没有它,仿真只是个动起来不像真机的摆设。

带来什么:一个 sim-to-real 差距更小的仿真环境,让研究者能低成本地做算法开发、数据增强和迁移实验。

系统辨识(system identification):通过实验测量一个物理系统的参数,建立能准确预测它行为的数学模型。这里指测量真机 ALOHA 2 的动力学参数并写进 MuJoCo。

sim-to-real gap(仿真到现实的差距):仿真里训好的策略搬到真机上性能下降的现象。系统辨识就是缩小这个差距的手段之一。

所以这一节是想说:带系统辨识的 MuJoCo 模型让研究者能在可信的仿真里先验证再上真机,降低了试错成本和真机磨损,是本文相比一代的重要新增。

5.5 开源交付:CAD、BOM、装配教程、软件栈

类比:搭一台机器人光有代码不够,你还得知道每颗螺丝从哪买、怎么拧、固件怎么烧。所以这里的"开源"像 IKEA 那本图文说明书 + 物料清单 + 视频教程的组合包。

改了什么/给了什么:原文明确开源了全部硬件设计并配详细教程——CAD 文件、物料清单(BOM)、装配手册、ROS 驱动、遥操作脚本、数据录制管线,以及与 ACT/Diffusion Policy 的接入示例。

为什么改:要让"任何实验室都能复刻一台一模一样的"成真,光放代码没用,必须提供"从下单零件到跑通 demo"的完整路径。

带来什么:显著降低复刻门槛,让平台可以真正扩散到很多实验室,形成事实上的标准采集平台。

BOM(Bill of Materials,物料清单):搭一台机器需要的每个零件型号、数量、参考链接。开源硬件里 BOM 完整度直接决定别人能不能复刻。

所以这一节是想说:完整的开源交付(CAD + BOM + 教程 + 软件栈)把"复刻一台 ALOHA 2"从踩坑半个月变成照着手册来,是让平台标准化扩散的最后一块拼图。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【ALOHA 2 · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

ALOHA 2 — 方法示意:核心 pipeline
Plate Nº IIALOHA 2 — 方法示意:核心 pipeline

6. 关键数字(What works)

作为技术报告,ALOHA 2 没有算法论文那种"我在 benchmark 上比谁高 X%"的主表。它的"关键数字"更多是平台参数和交付物清单。下面把已知的整理出来,未报告的诚实标注。

6.1 平台定位与交付物

项目 内容 说明
定位 ALOHA 一代的增强版 更好的性能 / 人体工学 / 鲁棒性
成本量级 沿袭 ALOHA 低成本路线(一代约 $20k) ALOHA 2 具体总成本原文未单列
遥操作方式 同构主从(isomorphic leader-follower) 主臂动作≈1:1 映射到从臂
手臂数 双臂(bimanual) 面向双手协调任务
仿真 MuJoCo 模型 + 系统辨识 缩小 sim-to-real 差距
开源内容 全部硬件 CAD + BOM + 教程 + 软件栈 "从下单到 demo"的完整路径

6.2 三个改进维度(相对一代 ALOHA)

维度 改动 定量效果
性能 Performance 夹爪机构、传动优化 原文未报告具体数字
人体工学 Ergonomics 握把重设计、配重、视觉反馈 连续操作时长从分钟级→小时级(定性)
鲁棒性 Robustness 耐久部件、电机座、线缆走向 原文未报告平均无故障时长

6.3 配套算法(用于验证平台,非本文贡献)

算法 关系
ACT(Action Chunking with Transformers) ALOHA 一代配套算法,预测动作块缓解复合误差
Diffusion Policy 常与 ALOHA 平台搭配的策略学习方法

生活语言解读:ALOHA 2 该怎么判断"好不好"?不是看某个成功率数字,而是看两件事:(1) 它是否真的让采数据更舒服、更耐用、可复刻——这些原文主要以定性和交付物形式呈现;(2) 更硬核的验证是后续社区的采用率——在它发布后的一段时间里,有多少论文用 ALOHA 2 平台采的数据、用它的仿真做实验。对一篇平台论文来说,"被广泛使用"就是最好的成绩单。原文中许多耐久度、成本、视觉配置的精确数字需查原文/开源文档确认。

所以这一节是想说:平台论文的"关键数字"是交付物和参数,而不是 benchmark 分数;它的真正成绩单是社区采用率,很多定量指标原文以定性或开源文档形式给出。


7. 实验结果说明了什么

作为技术报告,ALOHA 2 的"实验"重心和算法论文不同,它想证明的是"这个平台好用、耐用、可仿真、可复刻":

证明一:能做精细双臂任务。 原文用 ALOHA 2 演示了一组需要双手精细协调的任务(如系带、扣扣、操作复杂物体等定性 demo),说明升级后的硬件精度和稳定性撑得起这些场景。这回答了"改了硬件会不会反而变难用"的疑虑——不会,反而更能干精细活。

证明二:人体工学和耐久的工程化改善。 通过握把重设计、配重、耐久部件替换等,让长时间连续采集成为可能。虽然原文没给"连续采集 X 小时无故障"这类硬数字(原文未报告),但改进方向明确对准了"分钟级→小时级"的采集时长和"日常高强度使用"的耐久需求。

证明三:仿真与真机对齐。 通过发布带系统辨识的 MuJoCo 模型,说明可以在仿真里做贴近真机的实验,缩小 sim-to-real 差距。这为"先仿真验证再真机部署"的研究流程提供了工具。

证明四:可复刻。 通过完整开源 CAD + 教程,证明这不是一台只有原作者能用的实验室特供机,而是任何实验室都能照着搭出来的标准平台。这是它区别于闭源商用臂的核心价值。

需要清醒认识的是:它没有、也不需要"我的算法在 benchmark 上 SOTA"这种表格。它是平台论文,判断标准是"后续有多少工作建立在它之上"。这也提醒读者——评价一份工作的价值,要看它在生态里扮演的角色,而不是机械地找成功率数字。

所以这一节是想说:ALOHA 2 的实验证明了"平台能干精细活、更耐用好用、可仿真、可复刻"四件事,它的价值要用生态采用率而非 benchmark 分数来衡量。


8. 你应该懂的几个新词

遥操作(teleoperation):人通过主控设备实时驱动机器人,机器人记录关节角度等作为训练数据。ALOHA 用的是同构主从结构。类比:捏着提线木偶的手柄,木偶就跟着动,同时把动作录下来。

同构主从(isomorphic leader-follower):主臂(leader,人握的)和从臂(follower,干活的)自由度、关节顺序一致。优点是不需要复杂的运动学映射,操作员动作几乎 1:1 传到机器,上手快;代价是主臂也要做出近似形态,硬件成本上升。

模仿学习(imitation learning):让机器人从人的示范里学策略。最朴素的版本是行为克隆(behavior cloning)——输入观测、输出动作,监督学习。ACT 和 Diffusion Policy 都是这条路上的方法。

ACT(Action Chunking with Transformers):ALOHA 一代的配套算法,每次预测一段连续动作(chunk)而非单步,缓解了行为克隆在精细任务上的复合误差问题。类比:先想好接下来几步怎么走,而不是走一步看一步。

BOM(Bill of Materials,物料清单):搭一台机器需要的每个零件型号、数量、参考链接。开源硬件里 BOM 完整度直接决定别人能不能复刻。

系统辨识(system identification):通过实验测量物理系统的参数,建立能准确预测其行为的数学模型。这里指测量真机参数写进 MuJoCo 仿真。

MuJoCo:一个广泛使用的机器人物理仿真引擎,擅长模拟接触和关节动力学。ALOHA 2 发布了它的 MuJoCo 模型。

sim-to-real gap(仿真到现实的差距):仿真里训好的策略搬到真机后性能下降。系统辨识是缩小它的手段之一。

数据采集基础设施(data collection infrastructure):相对于传统的"算法 + 数据集"二分,强调把"硬件平台 + 操作流程 + 数据格式"当作一类独立的研究对象。ALOHA 2、UMI、DROID 都属于这一脉。

所以这一节是想说:理解本文的关键是把"遥操作/同构主从/模仿学习/ACT"这套采集与学习术语,和"BOM/系统辨识/MuJoCo/sim-to-real"这套硬件与仿真术语都摸一遍。


9. 它有什么搞不定的

没有新算法或新数据集:ALOHA 2 本身不解决"怎么学得更好"或"提供多少数据"的问题,它只提供更好的采集工具。如果你期待的是算法突破,这篇不是。

成本仍非人人可负担:虽然走低成本路线(一代约 $20k),但对个人爱好者或经费紧张的小组仍是一笔不小的开销,且需要一定的机械/电子动手能力来组装。

同构主从的固有局限:主臂要做出近似从臂的形态,增加了硬件成本和复杂度;相比 UMI 那种"手持夹爪直接录视频"的方案,便携性和部署灵活性差一些。

耐久与人体工学缺硬数据:原文以定性和工程描述为主,"连续采集多少小时无故障""疲劳降低多少"等量化指标原文未报告,读者难以精确评估改进幅度。

仿真仍有 sim-to-real 差距:系统辨识缩小了差距但没消除。接触丰富的精细操作(软物体、变形物、复杂摩擦)在仿真里依然难以完美还原,仿真训练的策略上真机仍需适配。

标准化依赖大家自觉遵守:工作台/视觉的标准化只有在各实验室都照做时才让数据可合并。一旦有人偷懒改了配置,跨实验室数据合并的价值就打折。

判断某任务失败的归因变复杂:因为它是平台,当基于它的某个策略做不好某个动作时,可能是算法问题,也可能是夹爪结构的物理限制——读下游论文时要能分辨这两者。

所以这一节是想说:ALOHA 2 的强项是采集工具的打磨,但它不碰算法、成本仍有门槛、耐久缺硬数据、仿真仍有差距、标准化靠自觉——这些是使用和评价它时要清醒认识的边界。


10. 它和别的几篇是什么关系

承接 ALOHA / Mobile ALOHA:直接的硬件迭代,思想没变(低成本 + 同构主从 + 模仿学习),打磨的是工程细节和可复刻性。见本仓库 act-aloha.md(一代 ALOHA + ACT 算法)、mobile-aloha.md(加移动底盘版)。

对比 UMI(Universal Manipulation Interface):UMI 走另一条路——用手持夹爪直接录视频,省掉机械臂主端,更便携;但对动作精度和力控感的还原不如 ALOHA 这种主从结构。两者是互补而非替代。见 umi.md

和 DROID 相互呼应:DROID 是用 Franka 单臂收集的大规模数据集(约 76k 轨迹);ALOHA 2 是双臂版本的硬件标准。研究范式上都在赌"先把数据采集这件事做大做规范"。见 droid.md

为通用机器人大模型提供数据基座:当训练 OpenVLA、RT-2、π0 这类通用策略需要海量双臂数据时,ALOHA 2 是社区最常被引用的"标准化采集平台"之一——可以理解为机器人学习领域的"ImageNet 拍摄棚"。

与算法工作的分工:ACT、Diffusion Policy、3D Diffusion Policy 等负责"从数据里学策略",ALOHA 2 负责"把数据采出来"。两者是"数据基础设施"和"学习算法"的上下游关系。

所以这一节是想说:ALOHA 2 处在"数据采集基础设施"这条脉络上,承接 ALOHA 系列、与 UMI/DROID 并列,是喂养下游通用机器人大模型的标准双臂数据源。


11. 和本导读的关系

本篇对应导读 Ch14: 模仿学习。Ch14 的核心论点之一是:模仿学习的成败越来越取决于数据的质量、规模和一致性,而不只是算法本身。ALOHA 2 正是这个论点的硬件注脚——它把"怎么采到又多又好又能合并的双臂数据"作为一等问题来解决。

Ch14 会讲行为克隆(BC)、ACT、Diffusion Policy 这条算法主线。ALOHA 2 是这条主线的"数据供给端":ACT 就是 ALOHA 平台的配套算法,理解 ALOHA 2 的硬件设计(尤其是同构主从和动作录制方式),能帮你看懂 ACT 为什么那样设计动作块、为什么在这类数据上有效。

Ch14 还强调一个观念:在机器人学习里,"硬件 + 流程 + 开源交付"本身就是一类一流贡献,不必非得有炫酷算法才能写论文。ALOHA 2 是这个观念的最佳范例——它没有新算法,却因为把采集平台做到可复刻、可仿真、可规模化而具有很高价值。这对实习期判断"什么工作值得做"很有启发:有时候把一个别人都嫌麻烦的基础设施做扎实,比再刷一个点更有影响力。

从阅读路线看,建议按 act-aloha.md(一代 + 算法)→ mobile-aloha.md(移动版)→ 本篇(增强版硬件)→ umi.md / droid.md(其他采集范式)的顺序读,能把"机器人数据采集"这条脉络串成一条线。

所以这一节是想说:本篇是 Ch14 模仿学习章节里"数据采集基础设施"的代表,印证了"数据决定成败"和"硬件/流程/开源也是一流贡献"两个核心观念。


12. 思考题

Q1:为什么说模仿学习的瓶颈从"算法"转移到了"数据采集基础设施"?这个判断成立的前提是什么?

提示

前提是:算法(ACT、Diffusion Policy)在少量示范(50–200 条)上已能学会单任务。想想如果单任务已经解决,要走向通用机器人还缺什么——是更聪明的算法,还是覆盖 10⁴–10⁶ 量级任务/场景的海量数据?数据从哪来?谁来采?这就把问题推向了"采集的成本、稳定性、易用性"。

Q2:ALOHA 2 用"同构主从"结构(主臂和从臂形态一致)。这相比 VR 遥操作有什么优缺点?为什么精细双手任务更适合同构主从?

提示

同构主从:操作员动作几乎 1:1 映射到机器,不需要复杂运动学转换,还能有力反馈感。VR 遥操作省了主端硬件但缺力反馈和精确同构。想想拧螺丝、拉拉链这种需要"感受到阻力和精确力控"的任务,哪种方式录出的数据更能反映真实操作?代价是什么(提示:主臂也要做出近似形态,成本上升)?

Q3:为什么"工作台和视觉标准化"对跨实验室数据合并如此关键?如果不标准化会发生什么?

提示

想象 A 实验室桌子比 B 矮 5cm、相机视角偏 10°。在 A 采的数据里"杯子在图像中央偏下",到 B 就"偏左上"。策略学到的是"图像里某个位置对应某个动作"。数据合并后这种不一致会怎样?模型会不会学混?标准化本质是在消除什么变量?

Q4:ALOHA 2 发布了带系统辨识的 MuJoCo 模型。系统辨识具体做什么?没有它的仿真模型会有什么问题?

提示

系统辨识是测量真机的物理参数(惯量、摩擦、电机响应)写进仿真。没有它,仿真的机械臂"看着像但动起来不像真机"——同样的控制指令在仿真和真机里produces不同的运动。想想这会如何影响"在仿真里训好的策略搬到真机"的效果(sim-to-real gap)?

Q5:这是一篇没有新算法、没有新数据集的技术报告,却被认为很有价值。你怎么评价这类"基础设施型"工作?该用什么标准判断它成功与否?

提示

传统论文看 benchmark 分数,但平台论文的价值在于"降低了别人做研究的门槛"。想想该看什么指标——发布后多少论文用了它的平台/仿真/数据格式?社区采用率算不算成绩单?为什么"把一个别人都嫌麻烦的基础设施做扎实"有时比刷一个点更有影响力?

Q6:当一个基于 ALOHA 2 的策略在某个精细任务上失败时,可能有哪几种原因?作为读者怎么区分"算法问题"和"硬件物理限制"?

提示

可能是算法学得不好,也可能是夹爪机构本身够不到那个精度/力度(物理限制)。想想怎么区分:如果换个更强的算法还是失败,是不是更可能是硬件限制?如果人自己遥操作都做不好这个任务,那策略学不会是不是也正常?理解平台的物理边界能帮你正确归因下游论文的实验结果。

Q7:ALOHA 2(主从机械臂)和 UMI(手持夹爪录视频)是两种采集范式。如果你要为"叠衣服"这类可变形物体任务采数据,你会选哪个?为什么?

提示

考虑几个维度:力反馈(叠衣服需要感知布料阻力吗)、便携性(要不要在很多不同地点采)、精度(同构主从更精确 vs 手持更灵活)、成本。没有标准答案,关键是能说清每种范式的取舍,以及它们为什么互补而非替代。


13. 一些好奇心问答(FAQ)

Q1:ALOHA 2 到底贵不贵?普通学生能买得起吗?

它走的是低成本路线(一代约 $20k,两三万人民币量级的核心硬件),比几十万的商用双臂便宜一个数量级,但对个人仍不算便宜,且需要动手组装。它面向的是研究实验室,不是消费者。ALOHA 2 的具体总成本原文未单列,以开源 BOM 为准。

Q2:"2"版本到底改了啥,值得单独发一篇吗?

改的是性能、人体工学、鲁棒性三方面,外加发布了对齐真机的 MuJoCo 仿真模型和完整开源教程。对一个要被很多实验室、很多小时使用的平台来说,"更耐用 + 更好用 + 可仿真 + 可复刻"这些工程改进的累积价值很大——它决定了能不能真正跑起规模化采集。所以作为技术报告单独发是合理的。

Q3:为什么这么强调"开源"?放个代码不就行了?

搭机器人光有代码不够。你还得知道每颗螺丝哪买、怎么拧、固件怎么烧、软件怎么配。所以这里的开源是"IKEA 说明书 + 物料清单 + 视频教程 + 软件栈"的完整包,目标是让别人能走通"从下单零件到跑通 demo"的全程,而不只是读代码。

Q4:有了仿真模型,是不是就不用真机了?

不是。仿真适合做算法原型、数据增强、快速迭代,但系统辨识只是缩小 sim-to-real 差距、没消除它。接触丰富的精细操作(软物体、复杂摩擦)在仿真里仍难完美还原,最终还得在真机上验证和适配。仿真是加速器,不是替代品。

Q5:ALOHA 2 和 Mobile ALOHA 什么关系?

Mobile ALOHA 是在(一代)ALOHA 上加移动底盘,让它能做移动 + 操作的长任务。ALOHA 2 是对固定式双臂平台本身的硬件增强。二者关注点不同——一个加"腿"扩展能力范围,一个把"手"打磨得更好用耐用。

Q6:为什么不直接用 VR(Quest/Vision Pro)遥操作,省掉主臂硬件?

VR 遥操作省硬件,但缺了力反馈和"主从关节一一对应"的同构感。对拧、拉、扣这种需要精确力控和双手协调的任务,主从结构录出的数据质量更高。这是个取舍——省成本 vs 数据质量,ALOHA 2 选了后者。

Q7:判断 ALOHA 2 成功的标准是什么?

看社区采用率。发布后一段时间里,有多少论文用它的平台采数据、用它的仿真做实验、照它的图纸复刻。对平台论文来说,"被广泛使用、成为事实标准"就是最高评价,而不是某个成功率数字。

所以这一节是想说:ALOHA 2 的很多设计选择(低成本、同构主从、完整开源、配套仿真)都是围绕"让规模化采集真正跑起来"这个目标做的务实权衡,理解这些能帮你判断它在你的研究里适不适用。


14. 如果你想再深入

Zhao et al., RSS 2023, "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"(ALOHA + ACT) — 一代 ALOHA 和 ACT 算法的原始论文。理解了它,ALOHA 2 的硬件改进就有了参照系。本仓库 act-aloha.md 有精读。

Fu et al., 2024, "Mobile ALOHA" — 加移动底盘的版本,展示了低成本双臂 + 模仿学习能做做饭、擦地等长任务。本仓库 mobile-aloha.md

Chi et al., 2024, "Universal Manipulation Interface (UMI)" — 另一条采集范式(手持夹爪录视频)。和 ALOHA 对照读,能看清两种范式的取舍。本仓库 umi.md

Khazatsky et al., 2024, "DROID" — 用 Franka 单臂采的大规模数据集(约 76k 轨迹),和 ALOHA 2 的双臂标准呼应。本仓库 droid.md

ALOHA 2 项目网站https://aloha-2.github.io ,有演示视频、CAD、BOM、装配教程。想复刻或理解硬件细节,先看这里,比读 paper 直观得多。

MuJoCo 文档https://mujoco.org ,本文仿真模型的引擎。想在仿真里跑 ALOHA 2,先熟悉 MuJoCo 的模型格式和接触仿真。

所以这一节是想说:要理解硬件源头读一代 ALOHA + ACT;要看采集范式对照读 UMI、DROID;要动手先上项目官网拿 CAD 和教程、并熟悉 MuJoCo。


15. 原文信息

本文(笔记所评论文)

@techreport{aloha2team2024,
  title={ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation},
  author={{ALOHA 2 Team}},
  year={2024},
  institution={Google DeepMind},
  note={arXiv:2405.02292},
  url={https://aloha-2.github.io}
}

关键前驱(一代 ALOHA + ACT)

@inproceedings{zhao2023aloha,
  title={Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware},
  author={Zhao, Tony Z. and Kumar, Vikash and Levine, Sergey and Finn, Chelsea},
  booktitle={Robotics: Science and Systems (RSS)},
  year={2023}
}

相关链接


笔记结束。如果你只记住一件事:在机器人学习里,把"数据采集平台"打磨到好用、耐用、可仿真、可复刻,本身就是一流的研究贡献——ALOHA 2 没发明新算法,却因为解决了"大规模采双臂数据"这个真瓶颈而被整个社区当作标准工具。

引用本笔记 / Cite this note
BibTeX
@online{eai_aloha_2_2026,
  title       = {(readable note) ALOHA 2},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/aloha-2/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?