Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 58

HumanPlus

22 min read · 7703 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式和术语全部翻译成人话。

一句话讲什么(TL;DR)

给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看着自己头上的摄像头自主复现技能——只用不超过 40 次示范,就能穿鞋起身走路、从货架卸货、叠卫衣、打字、和另一台机器人打招呼,成功率 60–100%。

所以这一节是想说:HumanPlus 的贡献是"底层用强化学习训一个管平衡的通用小脑(能零样本上真机)+ 上层用一个改良版模仿学习算法(HIT)从几十条数据学技能",两层合起来第一次把"全身人形 + 实时人体接口 + 模仿学习"工程化地串成一条完整链路。


这是个什么场景

想象你在健身房跟一个新教练学动作。

最笨的办法是教练递给你一本说明书:"先抬左腿 30 度,再前倾 15 度……"——这就是传统人形机器人的写脚本控制,几十个关节挨个写死,又长又脆,换个动作就得重写。

稍好一点是教练上手扳你(这叫动觉示教 / kinesthetic teaching,手把手掰关节)——可人形机器人浑身几十个关节,一个人根本扳不过来,还容易把它扳倒。

HumanPlus 走的是第三条路——镜面跟练:你站在机器人面前做一遍深蹲,它当场跟着蹲;做几十遍后,把它的"眼睛"(头上的摄像头)打开,它自己看着画面也能蹲了。这里的关键前提是:

人形机器人和人长得像——胳膊、腿、躯干的位置基本一一对应。所以人的动作几乎可以"一对一抄"过去,不需要复杂的运动规划。换成一条机械臂就抄不动了,因为形态对不上,你没法把"人抬腿"翻译成"机械臂该怎么动"。

而做这件事有两个真正的拦路虎。第一是"稳":人形是"两条腿顶着一堆关节"的倒立摆,手一伸出去重心就偏,稍不留神就摔——所以必须先有个东西专管平衡。第二是"接口贵又笨":过去要遥控人形全身,得穿动捕服、戴 VR 头盔、套外骨骼,既贵又只能在固定房间里用。

HumanPlus 要一次解决这两件事:用强化学习训一个"打死也不摔"的底层控制器,再用一个普通摄像头 + 姿态估计做"影子接口",让一个人在机器人旁边站着就能把全身动作实时传过去。

所以这一节是想说:人形机器人的两大痛点是"站不稳"和"没有便宜顺手的全身遥控接口";HumanPlus 就是来同时补这两根神经的。


HumanPlus — 场景示意:这论文要解决的现实问题
Plate Nº IHumanPlus — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:写脚本 / 模型预测控制(MPC)。 把感知、规划、跟踪拆开,手臂和腿分别建模控制。类比:给机器人一本写死的动作手册。设计耗时、范围窄,稍微换个任务或场景就得重做,很难扩展到多样任务。
  • 方案 B:强化学习只训"走路"这一招。 腿足机器人靠仿真里跑海量强化学习学会稳健行走。类比:一个只会走路的运动员,换成叠衣服就傻眼。问题是这类底层策略通常是任务专用的(奖励函数调起来很费劲),一次只会一招。
  • 方案 C:动捕服 / VR 头盔 / 外骨骼做遥操。 能全身遥控,但设备贵、要标定、只能在固定场地用,而且往往需要两个以上操作员(一个管身体、一个管手)。类比:想拍个视频得先搭一整间动捕棚。
  • 方案 D:从人类视频里学(模仿人视频)。 用互联网人类视频做预训练或表征学习。类比:看别人做菜的录像。但"看到的人"和"要控制的机器人"之间缺一座实时的桥,数据效率低,很难直接落到全身控制上。
  • 核心缺口:没有一个系统能做到"一个人、一个普通摄像头、站在旁边,就能实时全身遥控人形并高效采数据,再从几十条数据里学出自主技能"。各家公司(Figure、Optimus 等)demo 过类似流程,但细节不公开、自主任务也就一两个。

所以这一节是想说:以前要么控制方案太窄(只会一招)、要么遥控接口太贵太笨(要动捕棚 + 多人)、要么从人视频学缺了实时的桥;HumanPlus 要把这几块一次补齐并全部开源。


这篇论文的新想法

一句话:"两层分工 + 一个共享形态的巧合"。

  1. 底层(管平衡的"小脑"):一个任务无关的通用控制器,先在仿真里用强化学习练好,再零样本搬上真机。 关键创新是"任务无关"——它不是学"走路"这一个动作,而是学"给我任何一个目标姿势,我都想办法在不摔的前提下摆出来"。这样上层想让它做什么都行,它只负责"别摔 + 尽量摆到位"。这个底层叫 Humanoid Shadowing Transformer(人形影子 Transformer),喂给它的训练素材是 40 小时的真人动作数据(AMASS 数据集)。

  2. 接口(把人的动作实时抄过来):一个普通 RGB 摄像头 + 现成的姿态估计。 摄像头拍人 → 算法解出人体和手的 3D 姿态 → 按机器人的骨长关节限位重新算一遍(重定向 / retargeting)→ 把目标姿势喂给底层控制器。人在旁边站着做动作,机器人实时跟做——这就是影子模仿(shadowing)。一个人、一个摄像头,不用动捕棚。

  3. 上层(从数据里学自主技能):一个改良版模仿学习算法 HIT。 用影子模仿采到的"我看到什么 + 我做了什么"配对数据,训一个 Humanoid Imitation Transformer(HIT),让机器人看着自己双目摄像头的画面就能自主复现技能。HIT 的巧妙之处是同时预测"动作"和"未来画面会变成什么样"(前向动力学),逼着模型真的去看画面、而不是偷懒只靠本体感觉硬背动作。

而所有这一切之所以成立,靠的是一个"形态巧合":人形和人长得像,所以人的动作能几乎一对一抄过去,省掉了最难的运动规划那一步。

用一张图看两个阶段怎么接力:

  阶段1 影子模仿(采数据)              阶段2 自主技能(学 & 用)
  ┌──────────────┐                   ┌──────────────┐
  │ 人在摄像头前   │                   │ 采到的配对数据 │
  │ 做动作        │                   │ [第一视角画面  │
  └──────┬───────┘                   │  + 机器人动作] │
         ▼ WHAM/HaMeR 估姿态          └──────┬───────┘
  ┌──────────────┐                          ▼ 行为克隆
  │ 重定向到机器人 │                   ┌──────────────┐
  └──────┬───────┘                   │  训练 HIT 策略 │
         ▼ 底层控制器执行              └──────┬───────┘
  ┌──────────────┐                          ▼
  │ 机器人实时跟做 │  ── 录第一视角 ──▶ │ 机器人看自己画面│
  │ (人当遥控器)   │                   │ 自主复现技能   │
  └──────────────┘                   └──────────────┘

所以这一节是想说:新想法不是某个单点模型,而是"RL 当腿(管平衡)、人体当遥控器(影子接口)、IL 当脑(学技能)"这套分工,恰好被"人形≈人"的形态巧合黏合成一条能跑通的完整流水线。


它分几步做的(方法)

这一节最长。HumanPlus 的功夫全在"硬件怎么配、底层怎么训、人体怎么实时抄过来、上层怎么学"这四步的工程细节里。我们逐一拆开,每步标清"输入 → 处理 → 输出"。

第 1 步:硬件——一台 33 自由度的成人人形(输入:设计需求;输出:一台能动的机器人)

整机基于 Unitree H1,共 33 个自由度(DoF)

  • 19-DoF 身体:两条 4-DoF 手臂 + 两条 5-DoF 腿 + 1-DoF 腰。
  • 两只 6-DoF 灵巧手(Inspire-Robots RH56DFX),通过定制手腕连接,每个手腕含 1-DoF 舵机。

补一句术语——自由度(DoF) 就是"能独立弯曲/转动的关节数",数越多动作越灵活也越难控制。

感知靠头上两个 RGB 摄像头(Razer Kiyo Pro,向下倾斜 50 度,双目间距 160mm)——注意是双目,两只眼睛才能感知深度。执行能力上:手指最大出力 10N,手臂能抓 7.5kg,腿部电机瞬时扭矩可达 360Nm(这是它能站起来、跳、扛重物的力气来源)。

第 2 步:底层控制器——用 40 小时真人动作在仿真里练"永不摔"(输入:目标姿势;输出:19 维关节指令)

素材:公开动捕数据集 AMASS,含 40 小时真人动作、超过 11,000 段独立动作序列,用 SMPL-X 人体模型参数化(22 个身体 + 30 个手部的 3-DoF 球关节,加全局平移/旋转各 3 维)。先做质量过滤。

重定向(retargeting):机器人身体只有 SMPL-X 的一个子集(19 个转动关节),做法是把 SMPL-X 对应关节(髋、膝、踝、躯干、肩、肘)的欧拉角直接抄过来;手部按每根手指中间关节的转角映射;1-DoF 手腕角用前臂和手的相对朝向算。

网络与训练:底层策略 Humanoid Shadowing Transformer 是一个 decoder-only Transformer。每一步的输入是机器人的本体感觉(根部的横滚/俯仰/角速度、关节角、关节速度、上一步动作)+ 一个目标姿势(目标前进/横向速度、目标横滚俯仰、目标偏航角速度、目标关节角,从 AMASS 采样重定向而来)。输出是 19 维身体关节位置设定值,再由一个 1000Hz 的 PD 控制器换算成力矩执行;手部目标角直接给 PD 控制器。策略本身跑在 50Hz,上下文长度 8(能根据最近 8 步的历史适应不同环境)。

补术语——PD 控制器是最基础的"纠偏器":目标和实际差多少,就按比例(P)和变化率(D)施加纠正力矩,类似"离目标越远、纠得越狠"。

训练用 PPO(一种主流强化学习算法),奖励项包括:贴合目标速度/姿态、省能量、别打滑、活着就加分等(见下方关键数字里的奖励表思路)。同时对仿真物理参数做域随机化(domain randomization)——随机改负重、电机强度、摩擦、控制延迟等,逼策略学得鲁棒。这样训完的底层策略能零样本(没在真机上训过就直接用)搬到真机,本体感觉只靠机身自带的 IMU 和关节编码器。一个细节:机器人坐着时直接把目标姿势发给 PD 控制器,不走策略——因为坐姿不用补重力,且带丰富接触的坐姿在仿真里很难建。

第 3 步:实时姿态估计 + 重定向——把人的动作当场"翻译"过去(输入:一路 RGB 视频;输出:机器人目标姿势)

这一步像同声传译:人做动作,系统当场把"人体姿态"翻成"机器人能听懂的关节角"。

  • 身体:用 WHAM(一个能同时估计人体姿态和全局位移的实时算法,基于 SMPL-X),在 RTX4090 上跑 25 fps
  • :用 HaMeR(基于 Transformer 的单摄像头手部姿态估计,基于 MANO 手模型),在 RTX4090 上跑 10 fps

估出来的人体/手姿态,按第 2 步的重定向方法转成机器人目标姿势,喂给底层控制器。操作员就站在机器人旁边,用肉眼直视(line of sight)观察机器人和环境,实现响应及时的遥控——不用戴头盔看直播画面。被遥控的同时,机器人用双目摄像头录下自己的第一视角画面,作为上层学习的素材。这条链路一旦慢了,机器人就跟不上人,所以延迟是"影子"能否成立的命门

第 4 步:上层技能学习——HIT,逼着模型"看画面"而不是"背动作"(输入:画面+本体感觉;输出:未来 50 步姿势)

上层策略 Humanoid Imitation Transformer(HIT) 是把经典的 ACT(Action Chunking Transformer)改成 decoder-only 得来的。它的输入是两路第一视角画面的特征(用预训练 ResNet 编码)+ 本体感觉 + 固定的位置编码;输出是一次预测未来 50 步的目标姿势(动作分块 / action chunking)。

HIT 最关键的一招是同时预测未来画面特征:它在输入的图像位置上预测"执行完这段动作后画面特征会变成什么样",并加一个 L2 特征损失去约束这个预测。这等于让模型顺带学一个"前向动力学模型"(预测世界下一刻的样子)。

为什么要多此一举? 因为纯模仿学习有个臭毛病——模型会偷懒只靠本体感觉硬背动作、无视画面(overfitting to proprioception)。一旦无视画面,遇到物体位置变了它就抓瞎。加上"预测未来画面"这个约束后,模型被迫认真看画面、把视觉特征学好,泛化能力就上来了。部署时 HIT 在机身上以 25Hz 运行,异步把预测的目标姿势发给底层控制器,同时把预测的未来画面特征丢弃(那只是训练时的辅助任务)。

两层怎么配合:HIT(脑,25Hz,决定"想做什么姿势")→ Humanoid Shadowing Transformer(小脑,50Hz,决定"怎么摆到这个姿势又不摔")→ PD 控制器(1000Hz,出力矩)。频率一层比一层高,正好对应"决策慢、平衡快、执行更快"的分工。

一张图看懂这个"三层不同频率"的控制栈:

   ┌──────────────────────────────────────┐
   │  HIT 脑 (25Hz)  看双目画面+本体感觉      │  决策:想做什么姿势
   │  一次预测未来 50 步目标姿势 (+预测未来画面)│
   └──────────────────┬───────────────────┘
                      ▼ 目标姿势
   ┌──────────────────────────────────────┐
   │ Humanoid Shadowing Transformer 小脑    │  平衡:怎么摆到又不摔
   │ (50Hz) 输出 19 维关节位置设定值          │
   └──────────────────┬───────────────────┘
                      ▼ 关节设定值
   ┌──────────────────────────────────────┐
   │  PD 控制器 (1000Hz) → 关节力矩          │  执行:出多大劲
   └──────────────────┬───────────────────┘
                      ▼
                33-DoF 人形机器人

所以这一节是想说:HumanPlus 的方法核心是"用真人动作在仿真里练一个任务无关、能零样本上真机的平衡小脑 + 用普通摄像头做实时影子接口 + 用会'预测未来画面'的 HIT 逼模型真看画面",三者环环相扣才让'几十条数据学全身技能'成为可能。


HumanPlus — 方法示意:核心 pipeline
Plate Nº IIHumanPlus — 方法示意:核心 pipeline

关键数字(What works)

先看硬件规格:

项目 参数
平台 / 高度 Unitree H1 改装 / 180 cm
总自由度 33(19 身体 + 2×6 手 + 2×1 手腕)
身体分解 2×4-DoF 臂 + 2×5-DoF 腿 + 1-DoF 腰
摄像头 2× RGB(Razer Kiyo Pro),下倾 50°,目距 160mm
出力 手指 10N / 手臂 7.5kg / 腿瞬时扭矩 360Nm
底层控制频率 策略 50Hz → PD 1000Hz
姿态估计 WHAM 身体 25 fps / HaMeR 手 10 fps(RTX4090)
训练数据 AMASS 40 小时、11,000+ 段动作

自主任务成功率(每任务 10 次试验,示范条数见括号,HIT = 本文方法):

任务 示范数 HIT 单目 ACT 开环回放
叠卫衣 Fold Clothes 40 100 40 100 0
整理物品 Rearrange 30 90 70 50 0
打字 "AI" 30 80 40 0 60
双机器人打招呼 30 90 80 90 0
仓库卸货 Warehouse 25 90 80 90 0
穿鞋起身走路 40 60 0 0 0

底层控制器 vs 厂商默认控制器(抗干扰与全身技能):

指标 HumanPlus H1 默认
最大可抗力·前/后 32N / 44N 24N / 36N
最大可抗力·左/右 70N / 100N 40N / 40N
摔倒恢复时间 1.2s 15s
下蹲高度 0.44m 0.85m(越低越好)
起跳高度 0.35m 0m
从坐到站

遥操系统对比(6 名参与者,Rearrange 任务平均完成时间):

方法 成本 操作员数 全身控制 整任务耗时 稳定站立率
动觉示教 $50 3 6.60s 90.5%
ALOHA $7050 2–3 7.15s 100%
Meta Quest $250 2 8.87s 95.3%
HumanPlus(影子) $50 1 5.20s 100%

一句总括:只用 25–40 条示范,6 个任务成功率 60–100%;底层控制器抗干扰、恢复速度、全身技能全面碾压厂商默认;影子接口是唯一"一个人 + 支持全身控制"且最快最稳的遥操方案。

所以这一节是想说:HumanPlus 的数字讲了两件事——底层"打不倒"的平衡是一切的地基(30N 级横向抗力、1.2s 恢复),上层"会看画面"的 HIT 才是唯一能啃下"穿鞋起身走路"这种全身长任务的算法(60% vs 别人全 0)。


实验结果说明了什么

第一,"预测未来画面"这招是 HIT 能赢的关键。 对比最能说明问题的是"穿鞋起身走路":HIT 拿到 60%,而 ACT、单目、开环回放全是 0。作者的诊断很具体——ACT 会过拟合本体感觉、无视画面,导致它成功抓起鞋后就卡在"穿鞋"这一步反复重试(因为它不看画面、不知道鞋在哪);打字任务里 ACT 同样卡在打完"A"之后。HIT 靠双目 + 预测未来画面强制"看图",才没掉进这个坑。

第二,双目(深度)在接触密集任务上不可或缺。 单目版本在需要精确判断距离的任务上明显吃亏:叠卫衣时和桌面的交互很糙(100→40),穿鞋起身彻底失败(0)。这印证了"深度感知对精细全身操作是刚需"。有意思的例外是打字任务,单目因为视野更窄反而某些子步骤更准——说明没有放之四海皆准的最优感知配置。

第三,开环回放几乎全线归零,证明任务真需要闭环反应。 除了完全没有随机化的打字(60%),开环回放在所有任务上都是 0。这说明这些任务不是"背一段轨迹"就能过的,必须实时看反馈纠偏——也反证了学到的策略确实在"反应"。

第四,底层的稳,是上层能学任何东西的前提。 抗干扰对比里,HumanPlus 横向能扛 70–100N、1.2s 内恢复,而厂商默认要走好几步、最长 15s 才稳住——15 秒的抖动足以毁掉任何操作。而且它解锁了下蹲、起跳、从坐到站等厂商默认根本做不到的全身技能。没有这个"打不倒"的地基,上层的模仿学习无从谈起。

第五,影子接口在效率和门槛上全面占优。 6 人用户研究里,影子法整任务耗时最短(5.20s)、稳定站立率最高(100%)、且是唯一"一个人就能操作 + 支持全身控制"的方案;ALOHA 硬件固定难适配不同身高,Meta Quest 因手臂只有 5+1 自由度常出现奇异位形(卡死/抖动)。这解释了为什么影子法能高效采数据。

所以这一节是想说:实验讲了一个自洽的故事——底层"打不倒"提供地基,影子接口高效采数据,HIT 靠"看画面 + 双目"避开模仿学习的偷懒陷阱,三者缺一,"几十条数据学会穿鞋起身走路"就不可能发生。


你应该懂的几个新词

  • 影子模仿(shadowing):机器人实时跟踪人的全身动作,人怎么动它怎么动,延迟在百毫秒级。是本文采数据的核心接口。
  • 重定向(retargeting):把一个形态(人)的动作映射到另一个形态(机器人)。即便都是人形,骨长、关节数、限位也不同,需要按关节对应关系换算。
  • 本体感觉(proprioception):机器人对自身关节角度/速度、身体姿态的感知,靠 IMU 和关节编码器获得,相当于人闭眼也知道胳膊弯没弯。
  • sim-to-real(仿真到真机)与零样本迁移:在仿真里训好的策略直接搬到真机用而不再训练。难点是仿真和现实有差距(摩擦、延迟、噪声),本文用域随机化缩小它。
  • 域随机化(domain randomization):训练时随机改仿真里的物理参数(负重、摩擦、电机强度、延迟),逼策略学得鲁棒,从而能适应真实世界。
  • 动作分块(action chunking):策略一次预测未来 K 步动作(这里 K=50)而非单步,缓解复合误差、抗延迟。源自 ACT。
  • 前向动力学预测(forward dynamics prediction):预测"执行动作后世界/画面下一刻会变成什么样"。HIT 用它当辅助任务,逼模型认真看画面。
  • PPO / PD 控制器:PPO 是训底层策略用的强化学习算法;PD 控制器是最底层按"偏差 + 偏差变化率"出力矩的纠偏器。

所以这一节是想说:读懂 HumanPlus 抓四个词就够——影子模仿(怎么采数据)、重定向(怎么把人翻译成机器人)、域随机化(怎么零样本上真机)、前向动力学预测(HIT 怎么强迫自己看画面)。


它有什么搞不定的

  1. 自由度比人少,敏捷动作受限。 脚踝只有 1-DoF,做不了"单腿抬起晃动、另一腿站稳"这类动作;每条手臂只有 5-DoF(含手腕),限制了 6-DoF 操作空间控制,影子时可能出现"够不到"的死角。
  2. 头上摄像头是固定的、不会动。 手和被操作物体有持续掉出视野的风险——它不能像人一样"低头看一眼手里的活"。
  3. 重定向映射是固定的,丢掉了很多人类关节。 人身上有而机器人没有的关节被直接省略,导致机器人只能从"人类多样动作里的一个小子集"学,学不到需要那些关节的动作。
  4. 姿态估计怕遮挡。 大面积遮挡时 WHAM/HaMeR 效果差,限制了操作员能站的位置和角度。
  5. 主要是操作 + 少量移动,长距离导航没解决。 目前只做了下蹲、起身、往前走这类简单移动;长距离导航需要多得多的人类示范和真机上精确的速度跟踪,本文没做。
  6. 底层依赖 40 小时人类动作数据 + 大量仿真算力。 底层策略要在仿真里用 PPO + 域随机化训练,AMASS 数据虽公开但整套训练管线对算力和调参仍有门槛,不是拿来即用。

所以这一节是想说:HumanPlus 打通了"人形从人身上学技能"的完整链路,但它仍受限于硬件自由度、固定视角/映射、怕遮挡,且长程导航和更敏捷的全身动作还没解决,离真正通用的人形还有距离。


它和别的几篇是什么关系

  • Mobile ALOHA(同组前作,Fu et al. 2024):双臂 + 轮式底盘的"腰推遥操 + 模仿学习"。HumanPlus 把"双臂"升级为"全身人形",把"腰推遥操"换成"影子模仿",接口自然度大幅提升。轮式(Mobile ALOHA)更稳更便宜,双足(HumanPlus)更通用——是路线之争。
  • ACT(Zhao et al. 2023):HIT 直接由 ACT 改造而来(去掉 encoder-decoder 变 decoder-only,加前向动力学预测)。动作分块的思想也来自 ACT。
  • 腿足强化学习(RMA、Radosavovic 等人形/双足 RL):底层控制器的思路来源。HumanPlus 的独到之处是把底层做成任务无关的(给任意目标姿势都能跟),而非只训一个"走路"。
  • SMPL-X / WHAM / HaMeR(人体与手重建):影子接口的姿态估计模块直接依赖这一系工作。
  • 对照 RT-2 / OpenVLA(大模型 + 互联网数据路线):HumanPlus 走"小数据 + 人体接口"路线,两者互补。
  • 影响后续人形操作工作:OmniH2O、ExBody2、H2O 等一批"人到人形"的工作沿这条"RL 当腿、IL 当脑、人当遥控器"的分工深入。

所以这一节是想说:HumanPlus 接过 Mobile ALOHA 的接力棒把双臂扩到全身,借了 ACT 的算法骨架和腿足 RL 的控制思路、SMPL-X 系的姿态估计,又亲手为后来一大批"人到人形"工作定了范式。


和本导读的关系

它属于导读里模仿学习这条主线,建议配合 第 14 章 · 模仿学习 阅读。那一章把行为克隆、动作分块、遥操接口、co-training 讲清楚了;HumanPlus 是这些概念在"全身人形"这个最难形态上的一次集大成落地。读完本篇再回看同章的 mobile-aloha(双臂前作)、act-aloha(HIT 的算法起点)、diffusion-policy(另一条策略学习路线),能串出"桌面双臂 → 移动双臂 → 全身人形"的完整演进线。


思考题

Q1:HIT 明明是训"做动作"的策略,为什么还要顺带预测"未来画面会变成什么样"?去掉这个预测会怎样?

提示

为了防止模型偷懒——纯模仿学习容易"过拟合本体感觉、无视画面",靠背关节角硬走。加"预测未来画面"这个辅助任务,逼模型认真编码视觉特征。去掉它,模型就会像 ACT 那样在"穿鞋起身走路"上卡在某个子步骤反复重试(不看画面不知道该干嘛),成功率掉到 0。

Q2:底层控制器为什么要做成"任务无关"(给任意目标姿势都能跟),而不是像传统那样直接训一个"走路"策略?

提示

任务专用策略一次只会一招,换任务要重新做费劲的奖励工程。任务无关的底层只负责"给我任何姿势,我都不摔地摆出来",把"想做什么"完全交给上层。这样同一个底层能支撑影子模仿的任意动作、也能支撑上层学任意技能,是整套流水线能通用的前提。

Q3:为什么"人形≈人"这个形态巧合如此关键?换成一条机械臂,这套影子模仿还能用吗?

提示

因为形态相似,人的关节能几乎一对一重定向到机器人,省掉最难的运动规划。换成机械臂,人的"抬腿、弯腰"根本没有对应的机器人关节,重定向无从下手,影子模仿就失效了。这也是为什么这条路专属于人形。

Q4:控制链路是三层不同频率(HIT 25Hz → 底层 50Hz → PD 1000Hz)。为什么要分成越底层频率越高的结构?

提示

对应"决策慢、平衡快、执行更快"的物理需求。做什么姿势的高层决策不用太频繁(25Hz 够);维持平衡要更快响应扰动(50Hz);出力矩纠偏必须最快(1000Hz),否则倒立摆一样的人形会瞬间失稳。高频底层把"别摔"扛下来,低频上层才能安心决策。

Q5:影子接口用"肉眼直视(操作员站旁边看)"而不是给操作员戴头盔看机器人第一视角。这个选择有什么利弊?

提示

利:省掉头盔和视频回传、延迟更低、更直观、成本更低($50)。弊:操作员必须和机器人在同一物理空间、看得见它,无法真正"远程"遥操;且操作员看到的视角和机器人第一视角不完全一致。对"就近采数据"够用,对"远程操作"不适用。

Q6:底层控制器是在仿真里训的,却能零样本搬上真机。是什么让这种迁移成为可能?

提示

主要靠域随机化——训练时随机改负重、摩擦、电机强度、控制延迟等物理参数,逼策略不依赖某一组精确参数,学到对参数变化鲁棒的策略。加上上下文长度 8 的历史输入让策略能在线适应环境。真机的参数只要落在训练随机化的范围内,策略就能应付。

Q7:如果让你把 HumanPlus 从"主要做操作"扩展到"能在屋子里长距离导航送东西",你预计最大的拦路虎是什么?

提示

论文自己点了名:长程导航需要多得多的人类示范,以及真机上精确的速度跟踪(走远了误差会累积)。此外固定头部摄像头视野有限、姿态估计怕遮挡,都会在长距离移动中被放大。可能需要引入显式定位/建图或专门的移动策略,而不只是影子模仿。

Q8:Mobile ALOHA(轮式)和 HumanPlus(双足)你会先给哪种投研发资源?从"数据效率"和"落地难度"两个角度权衡。

提示

轮式天生稳、接口简单、采数据快、成本低,在平地家务场景把算力都花在操作上,短期落地更容易。双足更通用(能上下楼、跨障碍、进人类空间的所有角落),但要额外解决平衡(RL 底层)、sim-to-real、怕摔等一大堆问题,数据和工程成本高。答案取决于目标场景——受限平地选轮式,追求人类空间全覆盖的长期愿景选双足。


一些好奇心问答(FAQ)

Q:机器人是"看着人"跟做,还是有别的传感?

影子阶段:一个普通 RGB 摄像头拍操作员,WHAM 估身体、HaMeR 估手,重定向后喂给底层控制器;机器人自身的平衡则靠机身 IMU + 关节编码器。自主阶段:机器人只看自己头上的双目摄像头 + 本体感觉。

Q:为什么遥操成本能压到 $50,而 ALOHA 要 $7050?

因为影子法只需要一个普通摄像头 + 现成的姿态估计软件,不需要造一套物理主从臂(ALOHA 要两台 WidowX 250)。软件成本不算进硬件,硬件就是一个摄像头。

Q:机器人真的能"穿鞋然后站起来走路"吗?

能,但这是最难的任务,成功率 60%(40 条示范)。它包含翻鞋、拿起、穿上、按实、理鞋带、分别抓左右鞋带、系带、起身、前走共 10 个连续子步骤,每步 50 秒一条示范。也只有 HIT 能做到,其它方法全是 0。

Q:底层那 40 小时人类动作数据是他们自己采的吗?

不是,用的是公开数据集 AMASS(聚合了多个动捕数据集,40 小时、11,000+ 段动作)。他们只做了质量过滤和到机器人的重定向。


如果你想再深入

  1. 先看视频:项目主页 humanoid-ai.github.io,影子模仿这种事看 30 秒视频比读 10 页论文都直观(人蹲它蹲、人打拳它打拳)。
  2. 读 §5(Shadowing)+ §6(HIT):这两节是全文最核心的新东西——底层策略的输入输出、HIT 的"预测未来画面"设计。
  3. 对照 Table 5 精读失败模式:重点看"穿鞋起身走路"为什么只有 HIT 非零,理解"过拟合本体感觉"这个模仿学习通病。
  4. 底层控制感兴趣:看奖励表(Table 1)和域随机化范围(Table 2),理解怎么把"永不摔"训出来并零样本上真机。
  5. 前置阅读:先读 Mobile ALOHA 建立"遥操 + 模仿学习"的基线,再看 HumanPlus 如何把"腰推"换成"影子"、把"双臂"扩成"全身"。

原文信息(BibTeX + 链接)

@inproceedings{fu2024humanplus,
  title     = {HumanPlus: Humanoid Shadowing and Imitation from Humans},
  author    = {Fu, Zipeng and Zhao, Qingqing and Wu, Qi and Wetzstein, Gordon and Finn, Chelsea},
  booktitle = {Conference on Robot Learning (CoRL)},
  year      = {2024}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_humanplus_2026,
  title       = {(readable note) HumanPlus},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/humanplus/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?