ALOHA 2
这是一份给"完全没搭过机器人、也不懂模仿学习"的读者看的精读笔记。所有术语都翻成人话,类比都来自日常生活。这是一篇硬件技术报告,评价它不能只看算法指标,要看它作为"研究基础设施"好不好用。数字没有的地方会写明"原文未报告"。
人(操作员) 机器(工作端)
┌──────────┐ ┌──────────┐
│ 左主臂 │──同步映射────►│ 左从臂 │ 抓、拧、拉
│ 右主臂 │──同步映射────►│ 右从臂 │ 精细双手操作
└──────────┘ └──────────┘
│ 全过程录制(关节角 + 图像)
▼
示范数据集 ──► 模仿学习(ACT / Diffusion Policy)──► 机器人自主执行
ALOHA 2 的改动:不是新算法,而是把这台"教学设备"升级
├─ 夹爪握把重设计(能连续操作数小时不酸手)
├─ 结构件加固(日常使用更耐久)
├─ 工作台/视觉标准化(跨实验室数据可合并)
├─ 官方 MuJoCo 仿真模型 + 系统辨识
└─ 全套硬件设计开源(CAD + 教程)
1. 一句话讲什么(TL;DR)
ALOHA 2 不是新算法,而是把"教机器人用双手干活"的那台遥操作设备升级了一遍:更顺手、更耐用、还配了一个和真机对齐的仿真模型,全部图纸和教程开源,目的就是让全世界实验室能更快、更规模化地采集双臂操作数据。
更具体一点:它是斯坦福 ALOHA(一代)的增强版,在三方面变好——性能(performance)、人体工学(ergonomics)、鲁棒性(robustness)。它还发布了一个带**系统辨识(system identification)**的 MuJoCo 仿真模型,让你在电脑里模拟的 ALOHA 2 和真机行为接近。作者把所有硬件设计连同详细教程全部开源,明确目标是"加速大规模双臂操作研究"。这类工作的价值不在某个 benchmark 数字,而在它把"采数据"这件事的门槛降下来了——而数据,正是当下模仿学习最大的瓶颈。
所以这一节是想说:ALOHA 2 是一份"研究基础设施"的工程交付——把双臂遥操作平台打磨得更好用、更耐用、可仿真、可复刻,让整个社区更容易攒出高质量的双臂示范数据。
2. 这是个什么场景
想象你在教一个从没下过厨的朋友剥虾:光说"把头掐掉、剥壳、挑虾线"没用,最快的办法是抓着他的手做一遍,让他记住手指该使多大力、什么时候该转腕。教机器人叠衣服、倒水、拉拉链也是这套逻辑——人捏着两只"主臂"(leader)操作,机器上对应的两只"从臂"(follower)同步动,全过程录下来,机器人事后照着数据练。这套"人手把手教、机器录下来学"的流程,就是遥操作 + 模仿学习。
第一代 ALOHA 就是这么个"教学手柄 + 双臂机器",成本约 2 万美元,比动辄几十万的商用机械臂便宜得多,还开源,所以火遍了机器人学习圈。但用过的人会抱怨:
- 捏一上午手就酸了(人体工学差);
- 某个零件三天断一次(耐久度差);
- 想自己也搭一台,要踩半个月的坑(复刻门槛高)。
ALOHA 2 干的事,就像把一台手工组装的原型车改造成 4S 店量产款——工作原理没变(还是同构主从遥操作),但你能舒服地连录 8 小时,合作实验室也能在合理时间内复刻一台一模一样的、还能在仿真里先跑通。
为什么这件事重要?原文开门见山点破了行业现状:多样化的示范数据集推动了机器人学习的重大进展,但数据的"灵巧度"和"规模"被三样东西卡住了——硬件成本、硬件鲁棒性、遥操作的易用性。 换句话说,算法(ACT、Diffusion Policy)已经很强了,瓶颈悄悄从"算法"挪到了"能不能低成本、大规模、稳定地采到好数据"。ALOHA 2 正是冲着这三个卡点去的。
所以这一节是想说:本文瞄准的是模仿学习的真正瓶颈——数据采集基础设施。它要让"低成本、大规模、稳定地采双臂示范数据"这件事变得可行。

3. 之前的人怎么做的,为什么不够好
ALOHA v1(2023,斯坦福):低成本(约 2 万美元)双臂遥操作平台的开创者,配套 ACT 算法。证明了"便宜的同构主从 + 模仿学习"能学会精细双臂任务。但它是研究原型而非产品级——人体工学和耐久度还有不少粗糙处,长时间用会累、零件易坏。
Mobile ALOHA(2024 早):在 ALOHA 上加了移动底盘,证明"低成本双臂 + 模仿学习"能做出做饭、擦地等长时序移动任务。但它继承了 v1 的硬件痛点,采数据仍然不够舒服、不够稳。
昂贵的商用双臂方案(Franka Panda 双臂、ABB YuMi 等):遥操作精度高、耐久好,但单台数十万人民币,想靠它规模化采集成千上万条示范,成本上几乎不可行。
VR / 视觉遥操作(Quest、Vision Pro + 视觉反馈):用头显和手部追踪代替主从机械臂,省了主端硬件,但缺了力反馈和"主从关节一一对应"的同构感,对需要力控和精细协调的双手任务不够友好。
算法侧工作(ACT、Diffusion Policy 等):算法越做越强,但都被"数据不够多 / 不够干净"卡住——瓶颈从算法转移到了数据采集流程。
核心判断:便宜的原型(ALOHA v1)不够耐用好用,好用耐用的商用方案又太贵。中间缺一个"既便宜、又好用耐用、还能大规模复刻"的标准化平台。
所以这一节是想说:前人要么便宜但粗糙(ALOHA v1),要么好用但昂贵(商用臂);ALOHA 2 的空位是"把便宜平台打磨到接近产品级的好用和耐用,并让它可标准化复刻"。
4. 这篇论文的新想法
核心判断:模仿学习的瓶颈已经从"算法"挪到了"数据采集基础设施"。算法(ACT、Diffusion Policy)在 50–200 条示范上已能学会单任务,但要走向通用机器人,需要 10⁴–10⁶ 量级的双臂示范——这只能靠"很多实验室、很多操作员、很多小时"的众包模式。
要让这个众包模式跑起来,硬件必须同时满足三件事,这也正是 ALOHA 2 的三个改进方向:
人能舒服地操作数小时(不是数分钟)——重新设计夹爪握把、平衡配重、视觉反馈布置,把"单次连续操作时长"从分钟级推到小时级(性能 + 人体工学)。
零件在日常高强度使用下不轻易坏——替换易磨损部件、加固结构和线缆走向,提升耐久(鲁棒性)。
任何人按文档能复刻,还能先在仿真里验证——完整开源 CAD、装配教程、软件栈,并提供带系统辨识的 MuJoCo 模型,让仿真行为贴近真机。
等等,先慢一拍——"发布仿真模型"为什么是个重要贡献? 因为有了和真机对齐的仿真,你可以在电脑里先跑通策略、调好参数,再迁移到真机,省下大量真机试错的时间和磨损。而"系统辨识"是关键——它测量真机的物理参数(质量、摩擦、电机特性等)并写进仿真,让仿真里的机械臂动起来和真机像,而不是一个"看着像但动起来不对"的花瓶模型。
ALOHA 2 没发明新算法、没发新数据集,它发的是一份"让别人能更快、更省、更稳地做研究"的工程交付。这本身就是一类一流贡献。
所以这一节是想说:本文的新意是把"数据采集平台"当成一等研究对象,从人体工学、耐久性、可仿真、可复刻四个维度系统升级,为大规模双臂数据众包扫清硬件障碍。
5. 它分几步做的(方法)
这是硬件技术报告,"方法"就是各项工程改进。下面逐项拆开,每项先打比方,再讲"改了什么 → 为什么改 → 带来什么"。需要注意:作为技术报告,许多改动的定量效果原文未给出具体数字,判断它好不好主要看后续社区采用率。
5.1 夹爪与握把重设计(gripper & handle)
类比:把一把廉价剪刀换成专业理发剪——同样是"剪东西",但握感和耐用度完全两回事。
改了什么:一代 ALOHA 的夹爪开合常用橡皮筋作被动元件,磨损快、扭矩不稳定(橡皮筋拉久了变松,夹持力就飘)。ALOHA 2 换成了更稳定的低摩擦机构(具体机械方案以原文/开源图纸为准,可能是张紧弹簧/滑轨类结构),同时把主臂握把做成更贴合手部解剖的形状。
为什么改:橡皮筋的力道不稳会直接影响示范质量——你以为夹住了其实没夹稳,录进数据就是噪声。握把不贴手则会让操作员几分钟就累,没法长时间采集。
带来什么:夹持力更稳定、可重复;握持疲劳大幅降低,把"单次连续操作时长"从分钟级推到小时级。这是"能不能采大规模数据"的第一道关。
所以这一节是想说:夹爪和握把的重设计既提升了示范数据的稳定性(力控更可靠),又让操作员能久握不累,是支撑大规模采集的关键改动。
5.2 结构件与传动的耐久性升级
类比:把宜家板材家具升级成实木打榫——看着差不多,但天天摇晃就知道差距。
改了什么:把一代里易坏的部件(如部分 3D 打印件)换成更耐用的材料/工艺,重新设计关键关节的电机座和线缆走向,减少线材在反复运动中的应力集中。
为什么改:众包采集意味着每台机器每天要被不同操作员用很多小时、连续用很多天。三天断一次零件的平台,根本没法支撑"很多实验室、很多小时"的规模。
带来什么:整机在每天数小时、长期使用下更少出故障(具体的平均无故障时长等耐久数字原文未报告)。耐久度直接决定平台能不能真正跑起规模化采集。
所以这一节是想说:结构与传动的加固是为"高强度、长周期、多操作员"的众包场景服务的——不耐用的平台无法规模化,这一步是鲁棒性的核心。
5.3 视觉与工作台标准化
类比:连锁餐厅的"标准后厨"——每家店的灶台高度、刀具摆位都一致,菜谱才能跨店复用。
改了什么:给摄像头位置、工作台尺寸、灯光环境等给出推荐的标准配置(具体参数以原文/开源文档为准)。
为什么改:这看似琐碎,但对"跨实验室数据可合并"极其关键。如果 A 实验室的桌子比 B 矮 5cm、相机视角偏 10°,那么 A 采的数据训出的策略到 B 就可能直接失效——数据合不到一起,众包就成了空话。
带来什么:不同实验室、不同操作员采的数据能被规整到同一套坐标和视角约定下,从而可以合并成一个大数据集。这是"很多实验室的数据能不能变成一个大池子"的前提。
所以这一节是想说:工作台和视觉的标准化是让跨实验室数据可合并的隐形基础设施——没有它,众包采来的数据就是一盘散沙。
5.4 MuJoCo 仿真模型 + 系统辨识
类比:给真车配一个高保真的驾驶模拟器——你可以在模拟器里先练、先撞、先调,成本低还不伤真车;但前提是模拟器的物理手感要和真车一致,否则练了白练。
改了什么:发布一个 ALOHA 2 的 MuJoCo 仿真模型,并做了系统辨识——测量真机的物理参数(惯量、摩擦、电机响应等)写进仿真,让仿真的动力学贴近真机。
为什么改:真机试错慢、伤零件。有了对齐的仿真,可以在电脑里先跑通策略、生成合成数据、做算法原型,再迁移真机,大幅提速。系统辨识是"仿真可信"的关键——没有它,仿真只是个动起来不像真机的摆设。
带来什么:一个 sim-to-real 差距更小的仿真环境,让研究者能低成本地做算法开发、数据增强和迁移实验。
系统辨识(system identification):通过实验测量一个物理系统的参数,建立能准确预测它行为的数学模型。这里指测量真机 ALOHA 2 的动力学参数并写进 MuJoCo。
sim-to-real gap(仿真到现实的差距):仿真里训好的策略搬到真机上性能下降的现象。系统辨识就是缩小这个差距的手段之一。
所以这一节是想说:带系统辨识的 MuJoCo 模型让研究者能在可信的仿真里先验证再上真机,降低了试错成本和真机磨损,是本文相比一代的重要新增。
5.5 开源交付:CAD、BOM、装配教程、软件栈
类比:搭一台机器人光有代码不够,你还得知道每颗螺丝从哪买、怎么拧、固件怎么烧。所以这里的"开源"像 IKEA 那本图文说明书 + 物料清单 + 视频教程的组合包。
改了什么/给了什么:原文明确开源了全部硬件设计并配详细教程——CAD 文件、物料清单(BOM)、装配手册、ROS 驱动、遥操作脚本、数据录制管线,以及与 ACT/Diffusion Policy 的接入示例。
为什么改:要让"任何实验室都能复刻一台一模一样的"成真,光放代码没用,必须提供"从下单零件到跑通 demo"的完整路径。
带来什么:显著降低复刻门槛,让平台可以真正扩散到很多实验室,形成事实上的标准采集平台。
BOM(Bill of Materials,物料清单):搭一台机器需要的每个零件型号、数量、参考链接。开源硬件里 BOM 完整度直接决定别人能不能复刻。
所以这一节是想说:完整的开源交付(CAD + BOM + 教程 + 软件栈)把"复刻一台 ALOHA 2"从踩坑半个月变成照着手册来,是让平台标准化扩散的最后一块拼图。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【ALOHA 2 · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

6. 关键数字(What works)
作为技术报告,ALOHA 2 没有算法论文那种"我在 benchmark 上比谁高 X%"的主表。它的"关键数字"更多是平台参数和交付物清单。下面把已知的整理出来,未报告的诚实标注。
6.1 平台定位与交付物
| 项目 | 内容 | 说明 |
|---|---|---|
| 定位 | ALOHA 一代的增强版 | 更好的性能 / 人体工学 / 鲁棒性 |
| 成本量级 | 沿袭 ALOHA 低成本路线(一代约 $20k) | ALOHA 2 具体总成本原文未单列 |
| 遥操作方式 | 同构主从(isomorphic leader-follower) | 主臂动作≈1:1 映射到从臂 |
| 手臂数 | 双臂(bimanual) | 面向双手协调任务 |
| 仿真 | MuJoCo 模型 + 系统辨识 | 缩小 sim-to-real 差距 |
| 开源内容 | 全部硬件 CAD + BOM + 教程 + 软件栈 | "从下单到 demo"的完整路径 |
6.2 三个改进维度(相对一代 ALOHA)
| 维度 | 改动 | 定量效果 |
|---|---|---|
| 性能 Performance | 夹爪机构、传动优化 | 原文未报告具体数字 |
| 人体工学 Ergonomics | 握把重设计、配重、视觉反馈 | 连续操作时长从分钟级→小时级(定性) |
| 鲁棒性 Robustness | 耐久部件、电机座、线缆走向 | 原文未报告平均无故障时长 |
6.3 配套算法(用于验证平台,非本文贡献)
| 算法 | 关系 |
|---|---|
| ACT(Action Chunking with Transformers) | ALOHA 一代配套算法,预测动作块缓解复合误差 |
| Diffusion Policy | 常与 ALOHA 平台搭配的策略学习方法 |
生活语言解读:ALOHA 2 该怎么判断"好不好"?不是看某个成功率数字,而是看两件事:(1) 它是否真的让采数据更舒服、更耐用、可复刻——这些原文主要以定性和交付物形式呈现;(2) 更硬核的验证是后续社区的采用率——在它发布后的一段时间里,有多少论文用 ALOHA 2 平台采的数据、用它的仿真做实验。对一篇平台论文来说,"被广泛使用"就是最好的成绩单。原文中许多耐久度、成本、视觉配置的精确数字需查原文/开源文档确认。
所以这一节是想说:平台论文的"关键数字"是交付物和参数,而不是 benchmark 分数;它的真正成绩单是社区采用率,很多定量指标原文以定性或开源文档形式给出。
7. 实验结果说明了什么
作为技术报告,ALOHA 2 的"实验"重心和算法论文不同,它想证明的是"这个平台好用、耐用、可仿真、可复刻":
证明一:能做精细双臂任务。 原文用 ALOHA 2 演示了一组需要双手精细协调的任务(如系带、扣扣、操作复杂物体等定性 demo),说明升级后的硬件精度和稳定性撑得起这些场景。这回答了"改了硬件会不会反而变难用"的疑虑——不会,反而更能干精细活。
证明二:人体工学和耐久的工程化改善。 通过握把重设计、配重、耐久部件替换等,让长时间连续采集成为可能。虽然原文没给"连续采集 X 小时无故障"这类硬数字(原文未报告),但改进方向明确对准了"分钟级→小时级"的采集时长和"日常高强度使用"的耐久需求。
证明三:仿真与真机对齐。 通过发布带系统辨识的 MuJoCo 模型,说明可以在仿真里做贴近真机的实验,缩小 sim-to-real 差距。这为"先仿真验证再真机部署"的研究流程提供了工具。
证明四:可复刻。 通过完整开源 CAD + 教程,证明这不是一台只有原作者能用的实验室特供机,而是任何实验室都能照着搭出来的标准平台。这是它区别于闭源商用臂的核心价值。
需要清醒认识的是:它没有、也不需要"我的算法在 benchmark 上 SOTA"这种表格。它是平台论文,判断标准是"后续有多少工作建立在它之上"。这也提醒读者——评价一份工作的价值,要看它在生态里扮演的角色,而不是机械地找成功率数字。
所以这一节是想说:ALOHA 2 的实验证明了"平台能干精细活、更耐用好用、可仿真、可复刻"四件事,它的价值要用生态采用率而非 benchmark 分数来衡量。
8. 你应该懂的几个新词
遥操作(teleoperation):人通过主控设备实时驱动机器人,机器人记录关节角度等作为训练数据。ALOHA 用的是同构主从结构。类比:捏着提线木偶的手柄,木偶就跟着动,同时把动作录下来。
同构主从(isomorphic leader-follower):主臂(leader,人握的)和从臂(follower,干活的)自由度、关节顺序一致。优点是不需要复杂的运动学映射,操作员动作几乎 1:1 传到机器,上手快;代价是主臂也要做出近似形态,硬件成本上升。
模仿学习(imitation learning):让机器人从人的示范里学策略。最朴素的版本是行为克隆(behavior cloning)——输入观测、输出动作,监督学习。ACT 和 Diffusion Policy 都是这条路上的方法。
ACT(Action Chunking with Transformers):ALOHA 一代的配套算法,每次预测一段连续动作(chunk)而非单步,缓解了行为克隆在精细任务上的复合误差问题。类比:先想好接下来几步怎么走,而不是走一步看一步。
BOM(Bill of Materials,物料清单):搭一台机器需要的每个零件型号、数量、参考链接。开源硬件里 BOM 完整度直接决定别人能不能复刻。
系统辨识(system identification):通过实验测量物理系统的参数,建立能准确预测其行为的数学模型。这里指测量真机参数写进 MuJoCo 仿真。
MuJoCo:一个广泛使用的机器人物理仿真引擎,擅长模拟接触和关节动力学。ALOHA 2 发布了它的 MuJoCo 模型。
sim-to-real gap(仿真到现实的差距):仿真里训好的策略搬到真机后性能下降。系统辨识是缩小它的手段之一。
数据采集基础设施(data collection infrastructure):相对于传统的"算法 + 数据集"二分,强调把"硬件平台 + 操作流程 + 数据格式"当作一类独立的研究对象。ALOHA 2、UMI、DROID 都属于这一脉。
所以这一节是想说:理解本文的关键是把"遥操作/同构主从/模仿学习/ACT"这套采集与学习术语,和"BOM/系统辨识/MuJoCo/sim-to-real"这套硬件与仿真术语都摸一遍。
9. 它有什么搞不定的
没有新算法或新数据集:ALOHA 2 本身不解决"怎么学得更好"或"提供多少数据"的问题,它只提供更好的采集工具。如果你期待的是算法突破,这篇不是。
成本仍非人人可负担:虽然走低成本路线(一代约 $20k),但对个人爱好者或经费紧张的小组仍是一笔不小的开销,且需要一定的机械/电子动手能力来组装。
同构主从的固有局限:主臂要做出近似从臂的形态,增加了硬件成本和复杂度;相比 UMI 那种"手持夹爪直接录视频"的方案,便携性和部署灵活性差一些。
耐久与人体工学缺硬数据:原文以定性和工程描述为主,"连续采集多少小时无故障""疲劳降低多少"等量化指标原文未报告,读者难以精确评估改进幅度。
仿真仍有 sim-to-real 差距:系统辨识缩小了差距但没消除。接触丰富的精细操作(软物体、变形物、复杂摩擦)在仿真里依然难以完美还原,仿真训练的策略上真机仍需适配。
标准化依赖大家自觉遵守:工作台/视觉的标准化只有在各实验室都照做时才让数据可合并。一旦有人偷懒改了配置,跨实验室数据合并的价值就打折。
判断某任务失败的归因变复杂:因为它是平台,当基于它的某个策略做不好某个动作时,可能是算法问题,也可能是夹爪结构的物理限制——读下游论文时要能分辨这两者。
所以这一节是想说:ALOHA 2 的强项是采集工具的打磨,但它不碰算法、成本仍有门槛、耐久缺硬数据、仿真仍有差距、标准化靠自觉——这些是使用和评价它时要清醒认识的边界。
10. 它和别的几篇是什么关系
承接 ALOHA / Mobile ALOHA:直接的硬件迭代,思想没变(低成本 + 同构主从 + 模仿学习),打磨的是工程细节和可复刻性。见本仓库 act-aloha.md(一代 ALOHA + ACT 算法)、mobile-aloha.md(加移动底盘版)。
对比 UMI(Universal Manipulation Interface):UMI 走另一条路——用手持夹爪直接录视频,省掉机械臂主端,更便携;但对动作精度和力控感的还原不如 ALOHA 这种主从结构。两者是互补而非替代。见 umi.md。
和 DROID 相互呼应:DROID 是用 Franka 单臂收集的大规模数据集(约 76k 轨迹);ALOHA 2 是双臂版本的硬件标准。研究范式上都在赌"先把数据采集这件事做大做规范"。见 droid.md。
为通用机器人大模型提供数据基座:当训练 OpenVLA、RT-2、π0 这类通用策略需要海量双臂数据时,ALOHA 2 是社区最常被引用的"标准化采集平台"之一——可以理解为机器人学习领域的"ImageNet 拍摄棚"。
与算法工作的分工:ACT、Diffusion Policy、3D Diffusion Policy 等负责"从数据里学策略",ALOHA 2 负责"把数据采出来"。两者是"数据基础设施"和"学习算法"的上下游关系。
所以这一节是想说:ALOHA 2 处在"数据采集基础设施"这条脉络上,承接 ALOHA 系列、与 UMI/DROID 并列,是喂养下游通用机器人大模型的标准双臂数据源。
11. 和本导读的关系
本篇对应导读 Ch14: 模仿学习。Ch14 的核心论点之一是:模仿学习的成败越来越取决于数据的质量、规模和一致性,而不只是算法本身。ALOHA 2 正是这个论点的硬件注脚——它把"怎么采到又多又好又能合并的双臂数据"作为一等问题来解决。
Ch14 会讲行为克隆(BC)、ACT、Diffusion Policy 这条算法主线。ALOHA 2 是这条主线的"数据供给端":ACT 就是 ALOHA 平台的配套算法,理解 ALOHA 2 的硬件设计(尤其是同构主从和动作录制方式),能帮你看懂 ACT 为什么那样设计动作块、为什么在这类数据上有效。
Ch14 还强调一个观念:在机器人学习里,"硬件 + 流程 + 开源交付"本身就是一类一流贡献,不必非得有炫酷算法才能写论文。ALOHA 2 是这个观念的最佳范例——它没有新算法,却因为把采集平台做到可复刻、可仿真、可规模化而具有很高价值。这对实习期判断"什么工作值得做"很有启发:有时候把一个别人都嫌麻烦的基础设施做扎实,比再刷一个点更有影响力。
从阅读路线看,建议按 act-aloha.md(一代 + 算法)→ mobile-aloha.md(移动版)→ 本篇(增强版硬件)→ umi.md / droid.md(其他采集范式)的顺序读,能把"机器人数据采集"这条脉络串成一条线。
所以这一节是想说:本篇是 Ch14 模仿学习章节里"数据采集基础设施"的代表,印证了"数据决定成败"和"硬件/流程/开源也是一流贡献"两个核心观念。
12. 思考题
Q1:为什么说模仿学习的瓶颈从"算法"转移到了"数据采集基础设施"?这个判断成立的前提是什么?
提示
前提是:算法(ACT、Diffusion Policy)在少量示范(50–200 条)上已能学会单任务。想想如果单任务已经解决,要走向通用机器人还缺什么——是更聪明的算法,还是覆盖 10⁴–10⁶ 量级任务/场景的海量数据?数据从哪来?谁来采?这就把问题推向了"采集的成本、稳定性、易用性"。
Q2:ALOHA 2 用"同构主从"结构(主臂和从臂形态一致)。这相比 VR 遥操作有什么优缺点?为什么精细双手任务更适合同构主从?
提示
同构主从:操作员动作几乎 1:1 映射到机器,不需要复杂运动学转换,还能有力反馈感。VR 遥操作省了主端硬件但缺力反馈和精确同构。想想拧螺丝、拉拉链这种需要"感受到阻力和精确力控"的任务,哪种方式录出的数据更能反映真实操作?代价是什么(提示:主臂也要做出近似形态,成本上升)?
Q3:为什么"工作台和视觉标准化"对跨实验室数据合并如此关键?如果不标准化会发生什么?
提示
想象 A 实验室桌子比 B 矮 5cm、相机视角偏 10°。在 A 采的数据里"杯子在图像中央偏下",到 B 就"偏左上"。策略学到的是"图像里某个位置对应某个动作"。数据合并后这种不一致会怎样?模型会不会学混?标准化本质是在消除什么变量?
Q4:ALOHA 2 发布了带系统辨识的 MuJoCo 模型。系统辨识具体做什么?没有它的仿真模型会有什么问题?
提示
系统辨识是测量真机的物理参数(惯量、摩擦、电机响应)写进仿真。没有它,仿真的机械臂"看着像但动起来不像真机"——同样的控制指令在仿真和真机里produces不同的运动。想想这会如何影响"在仿真里训好的策略搬到真机"的效果(sim-to-real gap)?
Q5:这是一篇没有新算法、没有新数据集的技术报告,却被认为很有价值。你怎么评价这类"基础设施型"工作?该用什么标准判断它成功与否?
提示
传统论文看 benchmark 分数,但平台论文的价值在于"降低了别人做研究的门槛"。想想该看什么指标——发布后多少论文用了它的平台/仿真/数据格式?社区采用率算不算成绩单?为什么"把一个别人都嫌麻烦的基础设施做扎实"有时比刷一个点更有影响力?
Q6:当一个基于 ALOHA 2 的策略在某个精细任务上失败时,可能有哪几种原因?作为读者怎么区分"算法问题"和"硬件物理限制"?
提示
可能是算法学得不好,也可能是夹爪机构本身够不到那个精度/力度(物理限制)。想想怎么区分:如果换个更强的算法还是失败,是不是更可能是硬件限制?如果人自己遥操作都做不好这个任务,那策略学不会是不是也正常?理解平台的物理边界能帮你正确归因下游论文的实验结果。
Q7:ALOHA 2(主从机械臂)和 UMI(手持夹爪录视频)是两种采集范式。如果你要为"叠衣服"这类可变形物体任务采数据,你会选哪个?为什么?
提示
考虑几个维度:力反馈(叠衣服需要感知布料阻力吗)、便携性(要不要在很多不同地点采)、精度(同构主从更精确 vs 手持更灵活)、成本。没有标准答案,关键是能说清每种范式的取舍,以及它们为什么互补而非替代。
13. 一些好奇心问答(FAQ)
Q1:ALOHA 2 到底贵不贵?普通学生能买得起吗?
它走的是低成本路线(一代约 $20k,两三万人民币量级的核心硬件),比几十万的商用双臂便宜一个数量级,但对个人仍不算便宜,且需要动手组装。它面向的是研究实验室,不是消费者。ALOHA 2 的具体总成本原文未单列,以开源 BOM 为准。
Q2:"2"版本到底改了啥,值得单独发一篇吗?
改的是性能、人体工学、鲁棒性三方面,外加发布了对齐真机的 MuJoCo 仿真模型和完整开源教程。对一个要被很多实验室、很多小时使用的平台来说,"更耐用 + 更好用 + 可仿真 + 可复刻"这些工程改进的累积价值很大——它决定了能不能真正跑起规模化采集。所以作为技术报告单独发是合理的。
Q3:为什么这么强调"开源"?放个代码不就行了?
搭机器人光有代码不够。你还得知道每颗螺丝哪买、怎么拧、固件怎么烧、软件怎么配。所以这里的开源是"IKEA 说明书 + 物料清单 + 视频教程 + 软件栈"的完整包,目标是让别人能走通"从下单零件到跑通 demo"的全程,而不只是读代码。
Q4:有了仿真模型,是不是就不用真机了?
不是。仿真适合做算法原型、数据增强、快速迭代,但系统辨识只是缩小 sim-to-real 差距、没消除它。接触丰富的精细操作(软物体、复杂摩擦)在仿真里仍难完美还原,最终还得在真机上验证和适配。仿真是加速器,不是替代品。
Q5:ALOHA 2 和 Mobile ALOHA 什么关系?
Mobile ALOHA 是在(一代)ALOHA 上加移动底盘,让它能做移动 + 操作的长任务。ALOHA 2 是对固定式双臂平台本身的硬件增强。二者关注点不同——一个加"腿"扩展能力范围,一个把"手"打磨得更好用耐用。
Q6:为什么不直接用 VR(Quest/Vision Pro)遥操作,省掉主臂硬件?
VR 遥操作省硬件,但缺了力反馈和"主从关节一一对应"的同构感。对拧、拉、扣这种需要精确力控和双手协调的任务,主从结构录出的数据质量更高。这是个取舍——省成本 vs 数据质量,ALOHA 2 选了后者。
Q7:判断 ALOHA 2 成功的标准是什么?
看社区采用率。发布后一段时间里,有多少论文用它的平台采数据、用它的仿真做实验、照它的图纸复刻。对平台论文来说,"被广泛使用、成为事实标准"就是最高评价,而不是某个成功率数字。
所以这一节是想说:ALOHA 2 的很多设计选择(低成本、同构主从、完整开源、配套仿真)都是围绕"让规模化采集真正跑起来"这个目标做的务实权衡,理解这些能帮你判断它在你的研究里适不适用。
14. 如果你想再深入
Zhao et al., RSS 2023, "Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware"(ALOHA + ACT) — 一代 ALOHA 和 ACT 算法的原始论文。理解了它,ALOHA 2 的硬件改进就有了参照系。本仓库 act-aloha.md 有精读。
Fu et al., 2024, "Mobile ALOHA" — 加移动底盘的版本,展示了低成本双臂 + 模仿学习能做做饭、擦地等长任务。本仓库 mobile-aloha.md。
Chi et al., 2024, "Universal Manipulation Interface (UMI)" — 另一条采集范式(手持夹爪录视频)。和 ALOHA 对照读,能看清两种范式的取舍。本仓库 umi.md。
Khazatsky et al., 2024, "DROID" — 用 Franka 单臂采的大规模数据集(约 76k 轨迹),和 ALOHA 2 的双臂标准呼应。本仓库 droid.md。
ALOHA 2 项目网站 — https://aloha-2.github.io ,有演示视频、CAD、BOM、装配教程。想复刻或理解硬件细节,先看这里,比读 paper 直观得多。
MuJoCo 文档 — https://mujoco.org ,本文仿真模型的引擎。想在仿真里跑 ALOHA 2,先熟悉 MuJoCo 的模型格式和接触仿真。
所以这一节是想说:要理解硬件源头读一代 ALOHA + ACT;要看采集范式对照读 UMI、DROID;要动手先上项目官网拿 CAD 和教程、并熟悉 MuJoCo。
15. 原文信息
本文(笔记所评论文)
@techreport{aloha2team2024,
title={ALOHA 2: An Enhanced Low-Cost Hardware for Bimanual Teleoperation},
author={{ALOHA 2 Team}},
year={2024},
institution={Google DeepMind},
note={arXiv:2405.02292},
url={https://aloha-2.github.io}
}
关键前驱(一代 ALOHA + ACT)
@inproceedings{zhao2023aloha,
title={Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware},
author={Zhao, Tony Z. and Kumar, Vikash and Levine, Sergey and Finn, Chelsea},
booktitle={Robotics: Science and Systems (RSS)},
year={2023}
}
相关链接
- 论文:arXiv:2405.02292
- 项目网站(CAD / BOM / 教程 / 视频):https://aloha-2.github.io
- 一代 ALOHA 精读:act-aloha.md
- 导读章节:Ch14: 模仿学习
笔记结束。如果你只记住一件事:在机器人学习里,把"数据采集平台"打磨到好用、耐用、可仿真、可复刻,本身就是一流的研究贡献——ALOHA 2 没发明新算法,却因为解决了"大规模采双臂数据"这个真瓶颈而被整个社区当作标准工具。
◼
引用本笔记 / Cite this note
@online{eai_aloha_2_2026,
title = {(readable note) ALOHA 2},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/aloha-2/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?