HumanPlus
这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,公式和术语全部翻译成人话。
一句话讲什么(TL;DR)
给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看着自己头上的摄像头自主复现技能——只用不超过 40 次示范,就能穿鞋起身走路、从货架卸货、叠卫衣、打字、和另一台机器人打招呼,成功率 60–100%。
所以这一节是想说:HumanPlus 的贡献是"底层用强化学习训一个管平衡的通用小脑(能零样本上真机)+ 上层用一个改良版模仿学习算法(HIT)从几十条数据学技能",两层合起来第一次把"全身人形 + 实时人体接口 + 模仿学习"工程化地串成一条完整链路。
这是个什么场景
想象你在健身房跟一个新教练学动作。
最笨的办法是教练递给你一本说明书:"先抬左腿 30 度,再前倾 15 度……"——这就是传统人形机器人的写脚本控制,几十个关节挨个写死,又长又脆,换个动作就得重写。
稍好一点是教练上手扳你(这叫动觉示教 / kinesthetic teaching,手把手掰关节)——可人形机器人浑身几十个关节,一个人根本扳不过来,还容易把它扳倒。
HumanPlus 走的是第三条路——镜面跟练:你站在机器人面前做一遍深蹲,它当场跟着蹲;做几十遍后,把它的"眼睛"(头上的摄像头)打开,它自己看着画面也能蹲了。这里的关键前提是:
人形机器人和人长得像——胳膊、腿、躯干的位置基本一一对应。所以人的动作几乎可以"一对一抄"过去,不需要复杂的运动规划。换成一条机械臂就抄不动了,因为形态对不上,你没法把"人抬腿"翻译成"机械臂该怎么动"。
而做这件事有两个真正的拦路虎。第一是"稳":人形是"两条腿顶着一堆关节"的倒立摆,手一伸出去重心就偏,稍不留神就摔——所以必须先有个东西专管平衡。第二是"接口贵又笨":过去要遥控人形全身,得穿动捕服、戴 VR 头盔、套外骨骼,既贵又只能在固定房间里用。
HumanPlus 要一次解决这两件事:用强化学习训一个"打死也不摔"的底层控制器,再用一个普通摄像头 + 姿态估计做"影子接口",让一个人在机器人旁边站着就能把全身动作实时传过去。
所以这一节是想说:人形机器人的两大痛点是"站不稳"和"没有便宜顺手的全身遥控接口";HumanPlus 就是来同时补这两根神经的。

之前的人怎么做的,为什么不够好
- 方案 A:写脚本 / 模型预测控制(MPC)。 把感知、规划、跟踪拆开,手臂和腿分别建模控制。类比:给机器人一本写死的动作手册。设计耗时、范围窄,稍微换个任务或场景就得重做,很难扩展到多样任务。
- 方案 B:强化学习只训"走路"这一招。 腿足机器人靠仿真里跑海量强化学习学会稳健行走。类比:一个只会走路的运动员,换成叠衣服就傻眼。问题是这类底层策略通常是任务专用的(奖励函数调起来很费劲),一次只会一招。
- 方案 C:动捕服 / VR 头盔 / 外骨骼做遥操。 能全身遥控,但设备贵、要标定、只能在固定场地用,而且往往需要两个以上操作员(一个管身体、一个管手)。类比:想拍个视频得先搭一整间动捕棚。
- 方案 D:从人类视频里学(模仿人视频)。 用互联网人类视频做预训练或表征学习。类比:看别人做菜的录像。但"看到的人"和"要控制的机器人"之间缺一座实时的桥,数据效率低,很难直接落到全身控制上。
- 核心缺口:没有一个系统能做到"一个人、一个普通摄像头、站在旁边,就能实时全身遥控人形并高效采数据,再从几十条数据里学出自主技能"。各家公司(Figure、Optimus 等)demo 过类似流程,但细节不公开、自主任务也就一两个。
所以这一节是想说:以前要么控制方案太窄(只会一招)、要么遥控接口太贵太笨(要动捕棚 + 多人)、要么从人视频学缺了实时的桥;HumanPlus 要把这几块一次补齐并全部开源。
这篇论文的新想法
一句话:"两层分工 + 一个共享形态的巧合"。
底层(管平衡的"小脑"):一个任务无关的通用控制器,先在仿真里用强化学习练好,再零样本搬上真机。 关键创新是"任务无关"——它不是学"走路"这一个动作,而是学"给我任何一个目标姿势,我都想办法在不摔的前提下摆出来"。这样上层想让它做什么都行,它只负责"别摔 + 尽量摆到位"。这个底层叫 Humanoid Shadowing Transformer(人形影子 Transformer),喂给它的训练素材是 40 小时的真人动作数据(AMASS 数据集)。
接口(把人的动作实时抄过来):一个普通 RGB 摄像头 + 现成的姿态估计。 摄像头拍人 → 算法解出人体和手的 3D 姿态 → 按机器人的骨长关节限位重新算一遍(重定向 / retargeting)→ 把目标姿势喂给底层控制器。人在旁边站着做动作,机器人实时跟做——这就是影子模仿(shadowing)。一个人、一个摄像头,不用动捕棚。
上层(从数据里学自主技能):一个改良版模仿学习算法 HIT。 用影子模仿采到的"我看到什么 + 我做了什么"配对数据,训一个 Humanoid Imitation Transformer(HIT),让机器人看着自己双目摄像头的画面就能自主复现技能。HIT 的巧妙之处是同时预测"动作"和"未来画面会变成什么样"(前向动力学),逼着模型真的去看画面、而不是偷懒只靠本体感觉硬背动作。
而所有这一切之所以成立,靠的是一个"形态巧合":人形和人长得像,所以人的动作能几乎一对一抄过去,省掉了最难的运动规划那一步。
用一张图看两个阶段怎么接力:
阶段1 影子模仿(采数据) 阶段2 自主技能(学 & 用)
┌──────────────┐ ┌──────────────┐
│ 人在摄像头前 │ │ 采到的配对数据 │
│ 做动作 │ │ [第一视角画面 │
└──────┬───────┘ │ + 机器人动作] │
▼ WHAM/HaMeR 估姿态 └──────┬───────┘
┌──────────────┐ ▼ 行为克隆
│ 重定向到机器人 │ ┌──────────────┐
└──────┬───────┘ │ 训练 HIT 策略 │
▼ 底层控制器执行 └──────┬───────┘
┌──────────────┐ ▼
│ 机器人实时跟做 │ ── 录第一视角 ──▶ │ 机器人看自己画面│
│ (人当遥控器) │ │ 自主复现技能 │
└──────────────┘ └──────────────┘
所以这一节是想说:新想法不是某个单点模型,而是"RL 当腿(管平衡)、人体当遥控器(影子接口)、IL 当脑(学技能)"这套分工,恰好被"人形≈人"的形态巧合黏合成一条能跑通的完整流水线。
它分几步做的(方法)
这一节最长。HumanPlus 的功夫全在"硬件怎么配、底层怎么训、人体怎么实时抄过来、上层怎么学"这四步的工程细节里。我们逐一拆开,每步标清"输入 → 处理 → 输出"。
第 1 步:硬件——一台 33 自由度的成人人形(输入:设计需求;输出:一台能动的机器人)
整机基于 Unitree H1,共 33 个自由度(DoF):
- 19-DoF 身体:两条 4-DoF 手臂 + 两条 5-DoF 腿 + 1-DoF 腰。
- 两只 6-DoF 灵巧手(Inspire-Robots RH56DFX),通过定制手腕连接,每个手腕含 1-DoF 舵机。
补一句术语——自由度(DoF) 就是"能独立弯曲/转动的关节数",数越多动作越灵活也越难控制。
感知靠头上两个 RGB 摄像头(Razer Kiyo Pro,向下倾斜 50 度,双目间距 160mm)——注意是双目,两只眼睛才能感知深度。执行能力上:手指最大出力 10N,手臂能抓 7.5kg,腿部电机瞬时扭矩可达 360Nm(这是它能站起来、跳、扛重物的力气来源)。
第 2 步:底层控制器——用 40 小时真人动作在仿真里练"永不摔"(输入:目标姿势;输出:19 维关节指令)
素材:公开动捕数据集 AMASS,含 40 小时真人动作、超过 11,000 段独立动作序列,用 SMPL-X 人体模型参数化(22 个身体 + 30 个手部的 3-DoF 球关节,加全局平移/旋转各 3 维)。先做质量过滤。
重定向(retargeting):机器人身体只有 SMPL-X 的一个子集(19 个转动关节),做法是把 SMPL-X 对应关节(髋、膝、踝、躯干、肩、肘)的欧拉角直接抄过来;手部按每根手指中间关节的转角映射;1-DoF 手腕角用前臂和手的相对朝向算。
网络与训练:底层策略 Humanoid Shadowing Transformer 是一个 decoder-only Transformer。每一步的输入是机器人的本体感觉(根部的横滚/俯仰/角速度、关节角、关节速度、上一步动作)+ 一个目标姿势(目标前进/横向速度、目标横滚俯仰、目标偏航角速度、目标关节角,从 AMASS 采样重定向而来)。输出是 19 维身体关节位置设定值,再由一个 1000Hz 的 PD 控制器换算成力矩执行;手部目标角直接给 PD 控制器。策略本身跑在 50Hz,上下文长度 8(能根据最近 8 步的历史适应不同环境)。
补术语——PD 控制器是最基础的"纠偏器":目标和实际差多少,就按比例(P)和变化率(D)施加纠正力矩,类似"离目标越远、纠得越狠"。
训练用 PPO(一种主流强化学习算法),奖励项包括:贴合目标速度/姿态、省能量、别打滑、活着就加分等(见下方关键数字里的奖励表思路)。同时对仿真物理参数做域随机化(domain randomization)——随机改负重、电机强度、摩擦、控制延迟等,逼策略学得鲁棒。这样训完的底层策略能零样本(没在真机上训过就直接用)搬到真机,本体感觉只靠机身自带的 IMU 和关节编码器。一个细节:机器人坐着时直接把目标姿势发给 PD 控制器,不走策略——因为坐姿不用补重力,且带丰富接触的坐姿在仿真里很难建。
第 3 步:实时姿态估计 + 重定向——把人的动作当场"翻译"过去(输入:一路 RGB 视频;输出:机器人目标姿势)
这一步像同声传译:人做动作,系统当场把"人体姿态"翻成"机器人能听懂的关节角"。
- 身体:用 WHAM(一个能同时估计人体姿态和全局位移的实时算法,基于 SMPL-X),在 RTX4090 上跑 25 fps。
- 手:用 HaMeR(基于 Transformer 的单摄像头手部姿态估计,基于 MANO 手模型),在 RTX4090 上跑 10 fps。
估出来的人体/手姿态,按第 2 步的重定向方法转成机器人目标姿势,喂给底层控制器。操作员就站在机器人旁边,用肉眼直视(line of sight)观察机器人和环境,实现响应及时的遥控——不用戴头盔看直播画面。被遥控的同时,机器人用双目摄像头录下自己的第一视角画面,作为上层学习的素材。这条链路一旦慢了,机器人就跟不上人,所以延迟是"影子"能否成立的命门。
第 4 步:上层技能学习——HIT,逼着模型"看画面"而不是"背动作"(输入:画面+本体感觉;输出:未来 50 步姿势)
上层策略 Humanoid Imitation Transformer(HIT) 是把经典的 ACT(Action Chunking Transformer)改成 decoder-only 得来的。它的输入是两路第一视角画面的特征(用预训练 ResNet 编码)+ 本体感觉 + 固定的位置编码;输出是一次预测未来 50 步的目标姿势(动作分块 / action chunking)。
HIT 最关键的一招是同时预测未来画面特征:它在输入的图像位置上预测"执行完这段动作后画面特征会变成什么样",并加一个 L2 特征损失去约束这个预测。这等于让模型顺带学一个"前向动力学模型"(预测世界下一刻的样子)。
为什么要多此一举? 因为纯模仿学习有个臭毛病——模型会偷懒只靠本体感觉硬背动作、无视画面(overfitting to proprioception)。一旦无视画面,遇到物体位置变了它就抓瞎。加上"预测未来画面"这个约束后,模型被迫认真看画面、把视觉特征学好,泛化能力就上来了。部署时 HIT 在机身上以 25Hz 运行,异步把预测的目标姿势发给底层控制器,同时把预测的未来画面特征丢弃(那只是训练时的辅助任务)。
两层怎么配合:HIT(脑,25Hz,决定"想做什么姿势")→ Humanoid Shadowing Transformer(小脑,50Hz,决定"怎么摆到这个姿势又不摔")→ PD 控制器(1000Hz,出力矩)。频率一层比一层高,正好对应"决策慢、平衡快、执行更快"的分工。
一张图看懂这个"三层不同频率"的控制栈:
┌──────────────────────────────────────┐
│ HIT 脑 (25Hz) 看双目画面+本体感觉 │ 决策:想做什么姿势
│ 一次预测未来 50 步目标姿势 (+预测未来画面)│
└──────────────────┬───────────────────┘
▼ 目标姿势
┌──────────────────────────────────────┐
│ Humanoid Shadowing Transformer 小脑 │ 平衡:怎么摆到又不摔
│ (50Hz) 输出 19 维关节位置设定值 │
└──────────────────┬───────────────────┘
▼ 关节设定值
┌──────────────────────────────────────┐
│ PD 控制器 (1000Hz) → 关节力矩 │ 执行:出多大劲
└──────────────────┬───────────────────┘
▼
33-DoF 人形机器人
所以这一节是想说:HumanPlus 的方法核心是"用真人动作在仿真里练一个任务无关、能零样本上真机的平衡小脑 + 用普通摄像头做实时影子接口 + 用会'预测未来画面'的 HIT 逼模型真看画面",三者环环相扣才让'几十条数据学全身技能'成为可能。

关键数字(What works)
先看硬件规格:
| 项目 | 参数 |
|---|---|
| 平台 / 高度 | Unitree H1 改装 / 180 cm |
| 总自由度 | 33(19 身体 + 2×6 手 + 2×1 手腕) |
| 身体分解 | 2×4-DoF 臂 + 2×5-DoF 腿 + 1-DoF 腰 |
| 摄像头 | 2× RGB(Razer Kiyo Pro),下倾 50°,目距 160mm |
| 出力 | 手指 10N / 手臂 7.5kg / 腿瞬时扭矩 360Nm |
| 底层控制频率 | 策略 50Hz → PD 1000Hz |
| 姿态估计 | WHAM 身体 25 fps / HaMeR 手 10 fps(RTX4090) |
| 训练数据 | AMASS 40 小时、11,000+ 段动作 |
自主任务成功率(每任务 10 次试验,示范条数见括号,HIT = 本文方法):
| 任务 | 示范数 | HIT | 单目 | ACT | 开环回放 |
|---|---|---|---|---|---|
| 叠卫衣 Fold Clothes | 40 | 100 | 40 | 100 | 0 |
| 整理物品 Rearrange | 30 | 90 | 70 | 50 | 0 |
| 打字 "AI" | 30 | 80 | 40 | 0 | 60 |
| 双机器人打招呼 | 30 | 90 | 80 | 90 | 0 |
| 仓库卸货 Warehouse | 25 | 90 | 80 | 90 | 0 |
| 穿鞋起身走路 | 40 | 60 | 0 | 0 | 0 |
底层控制器 vs 厂商默认控制器(抗干扰与全身技能):
| 指标 | HumanPlus | H1 默认 |
|---|---|---|
| 最大可抗力·前/后 | 32N / 44N | 24N / 36N |
| 最大可抗力·左/右 | 70N / 100N | 40N / 40N |
| 摔倒恢复时间 | 1.2s | 15s |
| 下蹲高度 | 0.44m | 0.85m(越低越好) |
| 起跳高度 | 0.35m | 0m |
| 从坐到站 | ✓ | ✗ |
遥操系统对比(6 名参与者,Rearrange 任务平均完成时间):
| 方法 | 成本 | 操作员数 | 全身控制 | 整任务耗时 | 稳定站立率 |
|---|---|---|---|---|---|
| 动觉示教 | $50 | 3 | ✗ | 6.60s | 90.5% |
| ALOHA | $7050 | 2–3 | ✗ | 7.15s | 100% |
| Meta Quest | $250 | 2 | ✗ | 8.87s | 95.3% |
| HumanPlus(影子) | $50 | 1 | ✓ | 5.20s | 100% |
一句总括:只用 25–40 条示范,6 个任务成功率 60–100%;底层控制器抗干扰、恢复速度、全身技能全面碾压厂商默认;影子接口是唯一"一个人 + 支持全身控制"且最快最稳的遥操方案。
所以这一节是想说:HumanPlus 的数字讲了两件事——底层"打不倒"的平衡是一切的地基(30N 级横向抗力、1.2s 恢复),上层"会看画面"的 HIT 才是唯一能啃下"穿鞋起身走路"这种全身长任务的算法(60% vs 别人全 0)。
实验结果说明了什么
第一,"预测未来画面"这招是 HIT 能赢的关键。 对比最能说明问题的是"穿鞋起身走路":HIT 拿到 60%,而 ACT、单目、开环回放全是 0。作者的诊断很具体——ACT 会过拟合本体感觉、无视画面,导致它成功抓起鞋后就卡在"穿鞋"这一步反复重试(因为它不看画面、不知道鞋在哪);打字任务里 ACT 同样卡在打完"A"之后。HIT 靠双目 + 预测未来画面强制"看图",才没掉进这个坑。
第二,双目(深度)在接触密集任务上不可或缺。 单目版本在需要精确判断距离的任务上明显吃亏:叠卫衣时和桌面的交互很糙(100→40),穿鞋起身彻底失败(0)。这印证了"深度感知对精细全身操作是刚需"。有意思的例外是打字任务,单目因为视野更窄反而某些子步骤更准——说明没有放之四海皆准的最优感知配置。
第三,开环回放几乎全线归零,证明任务真需要闭环反应。 除了完全没有随机化的打字(60%),开环回放在所有任务上都是 0。这说明这些任务不是"背一段轨迹"就能过的,必须实时看反馈纠偏——也反证了学到的策略确实在"反应"。
第四,底层的稳,是上层能学任何东西的前提。 抗干扰对比里,HumanPlus 横向能扛 70–100N、1.2s 内恢复,而厂商默认要走好几步、最长 15s 才稳住——15 秒的抖动足以毁掉任何操作。而且它解锁了下蹲、起跳、从坐到站等厂商默认根本做不到的全身技能。没有这个"打不倒"的地基,上层的模仿学习无从谈起。
第五,影子接口在效率和门槛上全面占优。 6 人用户研究里,影子法整任务耗时最短(5.20s)、稳定站立率最高(100%)、且是唯一"一个人就能操作 + 支持全身控制"的方案;ALOHA 硬件固定难适配不同身高,Meta Quest 因手臂只有 5+1 自由度常出现奇异位形(卡死/抖动)。这解释了为什么影子法能高效采数据。
所以这一节是想说:实验讲了一个自洽的故事——底层"打不倒"提供地基,影子接口高效采数据,HIT 靠"看画面 + 双目"避开模仿学习的偷懒陷阱,三者缺一,"几十条数据学会穿鞋起身走路"就不可能发生。
你应该懂的几个新词
- 影子模仿(shadowing):机器人实时跟踪人的全身动作,人怎么动它怎么动,延迟在百毫秒级。是本文采数据的核心接口。
- 重定向(retargeting):把一个形态(人)的动作映射到另一个形态(机器人)。即便都是人形,骨长、关节数、限位也不同,需要按关节对应关系换算。
- 本体感觉(proprioception):机器人对自身关节角度/速度、身体姿态的感知,靠 IMU 和关节编码器获得,相当于人闭眼也知道胳膊弯没弯。
- sim-to-real(仿真到真机)与零样本迁移:在仿真里训好的策略直接搬到真机用而不再训练。难点是仿真和现实有差距(摩擦、延迟、噪声),本文用域随机化缩小它。
- 域随机化(domain randomization):训练时随机改仿真里的物理参数(负重、摩擦、电机强度、延迟),逼策略学得鲁棒,从而能适应真实世界。
- 动作分块(action chunking):策略一次预测未来 K 步动作(这里 K=50)而非单步,缓解复合误差、抗延迟。源自 ACT。
- 前向动力学预测(forward dynamics prediction):预测"执行动作后世界/画面下一刻会变成什么样"。HIT 用它当辅助任务,逼模型认真看画面。
- PPO / PD 控制器:PPO 是训底层策略用的强化学习算法;PD 控制器是最底层按"偏差 + 偏差变化率"出力矩的纠偏器。
所以这一节是想说:读懂 HumanPlus 抓四个词就够——影子模仿(怎么采数据)、重定向(怎么把人翻译成机器人)、域随机化(怎么零样本上真机)、前向动力学预测(HIT 怎么强迫自己看画面)。
它有什么搞不定的
- 自由度比人少,敏捷动作受限。 脚踝只有 1-DoF,做不了"单腿抬起晃动、另一腿站稳"这类动作;每条手臂只有 5-DoF(含手腕),限制了 6-DoF 操作空间控制,影子时可能出现"够不到"的死角。
- 头上摄像头是固定的、不会动。 手和被操作物体有持续掉出视野的风险——它不能像人一样"低头看一眼手里的活"。
- 重定向映射是固定的,丢掉了很多人类关节。 人身上有而机器人没有的关节被直接省略,导致机器人只能从"人类多样动作里的一个小子集"学,学不到需要那些关节的动作。
- 姿态估计怕遮挡。 大面积遮挡时 WHAM/HaMeR 效果差,限制了操作员能站的位置和角度。
- 主要是操作 + 少量移动,长距离导航没解决。 目前只做了下蹲、起身、往前走这类简单移动;长距离导航需要多得多的人类示范和真机上精确的速度跟踪,本文没做。
- 底层依赖 40 小时人类动作数据 + 大量仿真算力。 底层策略要在仿真里用 PPO + 域随机化训练,AMASS 数据虽公开但整套训练管线对算力和调参仍有门槛,不是拿来即用。
所以这一节是想说:HumanPlus 打通了"人形从人身上学技能"的完整链路,但它仍受限于硬件自由度、固定视角/映射、怕遮挡,且长程导航和更敏捷的全身动作还没解决,离真正通用的人形还有距离。
它和别的几篇是什么关系
- Mobile ALOHA(同组前作,Fu et al. 2024):双臂 + 轮式底盘的"腰推遥操 + 模仿学习"。HumanPlus 把"双臂"升级为"全身人形",把"腰推遥操"换成"影子模仿",接口自然度大幅提升。轮式(Mobile ALOHA)更稳更便宜,双足(HumanPlus)更通用——是路线之争。
- ACT(Zhao et al. 2023):HIT 直接由 ACT 改造而来(去掉 encoder-decoder 变 decoder-only,加前向动力学预测)。动作分块的思想也来自 ACT。
- 腿足强化学习(RMA、Radosavovic 等人形/双足 RL):底层控制器的思路来源。HumanPlus 的独到之处是把底层做成任务无关的(给任意目标姿势都能跟),而非只训一个"走路"。
- SMPL-X / WHAM / HaMeR(人体与手重建):影子接口的姿态估计模块直接依赖这一系工作。
- 对照 RT-2 / OpenVLA(大模型 + 互联网数据路线):HumanPlus 走"小数据 + 人体接口"路线,两者互补。
- 影响后续人形操作工作:OmniH2O、ExBody2、H2O 等一批"人到人形"的工作沿这条"RL 当腿、IL 当脑、人当遥控器"的分工深入。
所以这一节是想说:HumanPlus 接过 Mobile ALOHA 的接力棒把双臂扩到全身,借了 ACT 的算法骨架和腿足 RL 的控制思路、SMPL-X 系的姿态估计,又亲手为后来一大批"人到人形"工作定了范式。
和本导读的关系
它属于导读里模仿学习这条主线,建议配合 第 14 章 · 模仿学习 阅读。那一章把行为克隆、动作分块、遥操接口、co-training 讲清楚了;HumanPlus 是这些概念在"全身人形"这个最难形态上的一次集大成落地。读完本篇再回看同章的 mobile-aloha(双臂前作)、act-aloha(HIT 的算法起点)、diffusion-policy(另一条策略学习路线),能串出"桌面双臂 → 移动双臂 → 全身人形"的完整演进线。
思考题
Q1:HIT 明明是训"做动作"的策略,为什么还要顺带预测"未来画面会变成什么样"?去掉这个预测会怎样?
提示
为了防止模型偷懒——纯模仿学习容易"过拟合本体感觉、无视画面",靠背关节角硬走。加"预测未来画面"这个辅助任务,逼模型认真编码视觉特征。去掉它,模型就会像 ACT 那样在"穿鞋起身走路"上卡在某个子步骤反复重试(不看画面不知道该干嘛),成功率掉到 0。
Q2:底层控制器为什么要做成"任务无关"(给任意目标姿势都能跟),而不是像传统那样直接训一个"走路"策略?
提示
任务专用策略一次只会一招,换任务要重新做费劲的奖励工程。任务无关的底层只负责"给我任何姿势,我都不摔地摆出来",把"想做什么"完全交给上层。这样同一个底层能支撑影子模仿的任意动作、也能支撑上层学任意技能,是整套流水线能通用的前提。
Q3:为什么"人形≈人"这个形态巧合如此关键?换成一条机械臂,这套影子模仿还能用吗?
提示
因为形态相似,人的关节能几乎一对一重定向到机器人,省掉最难的运动规划。换成机械臂,人的"抬腿、弯腰"根本没有对应的机器人关节,重定向无从下手,影子模仿就失效了。这也是为什么这条路专属于人形。
Q4:控制链路是三层不同频率(HIT 25Hz → 底层 50Hz → PD 1000Hz)。为什么要分成越底层频率越高的结构?
提示
对应"决策慢、平衡快、执行更快"的物理需求。做什么姿势的高层决策不用太频繁(25Hz 够);维持平衡要更快响应扰动(50Hz);出力矩纠偏必须最快(1000Hz),否则倒立摆一样的人形会瞬间失稳。高频底层把"别摔"扛下来,低频上层才能安心决策。
Q5:影子接口用"肉眼直视(操作员站旁边看)"而不是给操作员戴头盔看机器人第一视角。这个选择有什么利弊?
提示
利:省掉头盔和视频回传、延迟更低、更直观、成本更低($50)。弊:操作员必须和机器人在同一物理空间、看得见它,无法真正"远程"遥操;且操作员看到的视角和机器人第一视角不完全一致。对"就近采数据"够用,对"远程操作"不适用。
Q6:底层控制器是在仿真里训的,却能零样本搬上真机。是什么让这种迁移成为可能?
提示
主要靠域随机化——训练时随机改负重、摩擦、电机强度、控制延迟等物理参数,逼策略不依赖某一组精确参数,学到对参数变化鲁棒的策略。加上上下文长度 8 的历史输入让策略能在线适应环境。真机的参数只要落在训练随机化的范围内,策略就能应付。
Q7:如果让你把 HumanPlus 从"主要做操作"扩展到"能在屋子里长距离导航送东西",你预计最大的拦路虎是什么?
提示
论文自己点了名:长程导航需要多得多的人类示范,以及真机上精确的速度跟踪(走远了误差会累积)。此外固定头部摄像头视野有限、姿态估计怕遮挡,都会在长距离移动中被放大。可能需要引入显式定位/建图或专门的移动策略,而不只是影子模仿。
Q8:Mobile ALOHA(轮式)和 HumanPlus(双足)你会先给哪种投研发资源?从"数据效率"和"落地难度"两个角度权衡。
提示
轮式天生稳、接口简单、采数据快、成本低,在平地家务场景把算力都花在操作上,短期落地更容易。双足更通用(能上下楼、跨障碍、进人类空间的所有角落),但要额外解决平衡(RL 底层)、sim-to-real、怕摔等一大堆问题,数据和工程成本高。答案取决于目标场景——受限平地选轮式,追求人类空间全覆盖的长期愿景选双足。
一些好奇心问答(FAQ)
Q:机器人是"看着人"跟做,还是有别的传感?
影子阶段:一个普通 RGB 摄像头拍操作员,WHAM 估身体、HaMeR 估手,重定向后喂给底层控制器;机器人自身的平衡则靠机身 IMU + 关节编码器。自主阶段:机器人只看自己头上的双目摄像头 + 本体感觉。
Q:为什么遥操成本能压到 $50,而 ALOHA 要 $7050?
因为影子法只需要一个普通摄像头 + 现成的姿态估计软件,不需要造一套物理主从臂(ALOHA 要两台 WidowX 250)。软件成本不算进硬件,硬件就是一个摄像头。
Q:机器人真的能"穿鞋然后站起来走路"吗?
能,但这是最难的任务,成功率 60%(40 条示范)。它包含翻鞋、拿起、穿上、按实、理鞋带、分别抓左右鞋带、系带、起身、前走共 10 个连续子步骤,每步 50 秒一条示范。也只有 HIT 能做到,其它方法全是 0。
Q:底层那 40 小时人类动作数据是他们自己采的吗?
不是,用的是公开数据集 AMASS(聚合了多个动捕数据集,40 小时、11,000+ 段动作)。他们只做了质量过滤和到机器人的重定向。
如果你想再深入
- 先看视频:项目主页 humanoid-ai.github.io,影子模仿这种事看 30 秒视频比读 10 页论文都直观(人蹲它蹲、人打拳它打拳)。
- 读 §5(Shadowing)+ §6(HIT):这两节是全文最核心的新东西——底层策略的输入输出、HIT 的"预测未来画面"设计。
- 对照 Table 5 精读失败模式:重点看"穿鞋起身走路"为什么只有 HIT 非零,理解"过拟合本体感觉"这个模仿学习通病。
- 底层控制感兴趣:看奖励表(Table 1)和域随机化范围(Table 2),理解怎么把"永不摔"训出来并零样本上真机。
- 前置阅读:先读 Mobile ALOHA 建立"遥操 + 模仿学习"的基线,再看 HumanPlus 如何把"腰推"换成"影子"、把"双臂"扩成"全身"。
原文信息(BibTeX + 链接)
- 论文:Zipeng Fu, Qingqing Zhao, Qi Wu, Gordon Wetzstein, Chelsea Finn. HumanPlus: Humanoid Shadowing and Imitation from Humans. CoRL 2024.
- arXiv:https://arxiv.org/abs/2406.10454
- 项目主页:https://humanoid-ai.github.io
@inproceedings{fu2024humanplus,
title = {HumanPlus: Humanoid Shadowing and Imitation from Humans},
author = {Fu, Zipeng and Zhao, Qingqing and Wu, Qi and Wetzstein, Gordon and Finn, Chelsea},
booktitle = {Conference on Robot Learning (CoRL)},
year = {2024}
}
◼
引用本笔记 / Cite this note
@online{eai_humanplus_2026,
title = {(readable note) HumanPlus},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/humanplus/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?