Generative Adversarial Imitation Learning
这是一份给"完全没接触过强化学习"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话。
一句话讲什么(TL;DR)
让 AI 看大厨做菜的录像,再找个"挑刺老师"分辨它做得像不像,靠这种较劲学会做事,不用猜大厨心里的打分标准。
所以这一节是想说:这篇论文造了一个"看着专家学,少绕一道弯"的模仿学习算法。
这是个什么场景
想象你刚搬到一个陌生城市,想学本地老饕怎么挑早餐摊。你跟拍了他一周的视频:他先看牌子、再看人多不多、最后才点东西。现在轮到你自己出门了——你怎么照着学?
两个朴素思路:
- 抄作业:把录像每一帧切下来——"老饕看到这个招牌时,下一步是绕过去"——做成一张张"看到 X 就做 Y"的对照表。出门照搬。
- 猜老师心思:先反推"老饕心里的打分标准是什么"(他大概觉得"排队 5 人=好"、"招牌掉漆=差"),再用这个标准慢慢练自己挑摊。
机器人学走路也是一模一样的问题。给一段人类专家走路的录像,机器人要么"抄作业"——把每一帧的 (姿势, 动作) 拿去做监督学习;要么"猜心思"——先反推专家的评分函数。
抄作业看起来简单,但有个老毛病:录像里没拍过的姿势一旦出现,机器人立刻懵——它从没学过怎么"从摔倒的姿势爬起来",于是越走越偏,最后摔。术语叫复合误差(compounding error)。就像你照着视频学挑摊,结果某天看到一家视频里没出现过的招牌,你完全不知道该绕还是该上。
猜老师心思(这就是逆强化学习 IRL)能解决"录像没拍过"的问题,因为它学的是评分标准,不是具体动作。但代价是:每次更新这个评分标准,都要把机器人放进环境里反复练强化学习——算一次猜,要做完一整套强化学习,烧钱烧时间。
GAIL 想做的事:既要 IRL 那种"学评分标准"的鲁棒性,又不想真的跑两层循环。
所以这一节是想说:GAIL 想把"从专家学走路"这件事做得既稳又快。

之前的人怎么做的,为什么不够好
- 行为克隆(Behavioral Cloning):把专家轨迹拆成 (状态, 动作) 对,做监督学习。简单粗暴,但只在录像里见过的状态附近能用——一旦走偏,错误像滚雪球一样累计。要它学好,得喂海量数据。Ch14 详细讲了这个问题:误差随时间步 T 呈 O(T^2 * epsilon) 增长。
- 逆强化学习(IRL):先反推一个"代价函数"(专家觉得啥行为好),然后基于这个代价用 RL 训出策略。问题是内层套着 RL,每次更新代价函数都得跑一遍完整 RL。在高维任务上慢到不可接受。
- 学徒学习(Apprenticeship Learning):IRL 的简化版,假设代价函数是"几个手工特征的线性组合"。能跑大任务,但特征要人工设计,复杂行为根本套不进去——比如人类走路涉及几百个肌肉关节,你给我用 5 个特征写代价函数?
- DAgger:解决了行为克隆的复合误差问题,但需要专家在线提供反馈——学徒走到一个新状态就问专家"你会怎么动"。很多场景下做不到(专家不在、远程操控贵)。
- 共同毛病:"先恢复代价、再求策略"这个两步走是绕路。学习者最终要的是怎么动,不是"专家心里怎么想"。绕了一圈才回到动作上,又慢又容易丢信息。
所以这一节是想说:之前要么数据量小就垮,要么算得太慢,要么必须人工设计特征或在线访问专家——没有哪条路又快又通用。
这篇论文的新想法
别费劲反推代价函数了。直接让 AI 和一个鉴别器对抗:鉴别器努力分辨"这是专家做的还是 AI 做的",AI 努力骗过鉴别器——学到最后,AI 的行为分布和专家几乎一样。
这个套路从 GAN(生成对抗网络)借来的:GAN 让生成器骗过鉴别器去合成以假乱真的图片;GAIL 让策略骗过鉴别器去合成以假乱真的"行为轨迹"。
论文的核心贡献有三层:
- 理论贡献:证明了 IRL 本质上等价于占用度量匹配(Proposition 3.2),把"学奖励函数"翻译成"匹配分布"。
- 算法贡献:设计了一个特殊正则项 psi_GA,使得目标函数恰好是 Jensen-Shannon 散度——和 GAN 打通,直接用对抗训练。
- 实践贡献:第一次在 376 维的 Humanoid 任务上证明模仿学习可以接近甚至超越专家水平。
所以这一节是想说:核心创新是把"模仿学习"翻译成"GAN",用对抗训练直接学策略,跳过 IRL 那一步。
它分几步做的(方法)

上图说明:Figure:GAIL 生成器—判别器对抗训练与 MuJoCo 任务成功率(论文原图)。
像学做一道菜:先想清楚"什么叫做得像大厨",再挑一把"尺子"量你和大厨差多少,然后请一位挑刺老师天天打分,最后把整套办法搬到 9 个真实任务上验证。整篇论文做了这 4 件事:定义"什么叫像专家"、证明 IRL 其实是分布匹配、设计 GAN 式的目标函数、给出落地算法。下面逐步展开。
第一步:把"模仿专家"翻译成"匹配分布"——占用度量与 IRL 的对偶性
类比
你想模仿一位大厨。怎么算"模仿成功"?不是只学他切菜动作——是要学他整个做菜过程的全套路:他多久翻一次锅、什么时候加盐、油温多高时下肉。一句话,**他在厨房里"出现的全套场景统计"**和你出现的统计要长得一模一样。
GAIL 把这个"全套场景统计"叫占用度量(occupancy measure)。
占用度量(occupancy measure)rho_pi(s, a):跟着策略 pi 在世界里走一遍,"状态 s + 动作 a"这种组合出现的(折扣后的)频率分布。数学定义:rho_pi(s, a) = pi(a|s) * sum_{t=0}^{inf} gamma^t * P(s_t = s | pi)。可以理解成"这个策略一辈子里在每种 (情境, 反应) 上花了多少时间"。
状态(state)s:当前世界的样子。比如机器人此刻的关节角度、速度。
动作(action)a:策略对当前状态的反应。比如"左膝伸 5 度"。
策略(policy)pi(a|s):一张"看到 s 我会怎么动 a"的概率表。
折扣因子(discount factor)gamma:0 到 1 之间的数字,控制"未来的权重"。gamma=0.99 意味着 100 步后的事还值关注;gamma=0.9 则只管当前 10 步。
论文做了什么
论文首先引入一个关键的数学工具——Proposition 3.1(来自 Syed et al. 2008):占用度量 rho 和策略 pi 之间存在一一对应关系。给定任何合法的占用度量 rho,都能唯一恢复出策略 pi_rho(a|s) = rho(s,a) / sum_{a'} rho(s, a');反过来,每个策略也唯一对应一个占用度量。
这一步的意义是什么?它意味着优化"策略空间"和优化"占用度量空间"是等价的。策略空间不是凸的(很难做全局优化),但占用度量空间是凸的(因为定义它的约束都是线性不等式)。凸=好算,这为后面的推导铺平了路。
然后论文给出了核心理论结果——Proposition 3.2:
RL(IRL_psi(pi_E)) = argmin_{pi} -H(pi) + psi^*(rho_pi - rho_{pi_E})
人话翻译:先做 IRL 恢复代价函数、再做 RL 提取策略——这一整套两步走的输出——等价于直接找一个策略,让它的占用度量 rho_pi 和专家的 rho_{pi_E} 之间的距离(由正则项 psi 的共轭 psi^ 来度量)最小,同时保持策略的熵 H(pi) 不要太低。*
共轭函数(convex conjugate)psi^: 给定凸函数 psi(c),它的共轭 psi^(x) = sup_c [x^T c - psi(c)]。直觉上,共轭函数把"正则项"翻译成"距离度量"。正则 psi 约束代价函数不能太极端,对应的 psi^* 就是用来量两个分布差距的"尺子"。
熵 H(pi):策略的"随机性程度"。H 高意味着动作选择多样(探索空间大);H 低意味着动作几乎确定(集中在某个选择上)。目标函数里保留 -H(pi) 是为了防止策略过早塌缩成一个确定性选择。
为什么这步有用
这一步是整篇论文的理论地基。它告诉我们一个深刻的事实:IRL 看似在找代价函数,实际等价于在找一个策略,让它的占用度量贴近专家的占用度量。换句话说,IRL 兜了一大圈,本质就在做一件事——让两个分布对齐。既然如此,为什么不直接做分布对齐,跳过中间那个代价函数呢?
论文还证了一个特殊情形(Corollary 3.2.1):如果正则项 psi 是常数(即完全不约束代价函数),则 IRL + RL 得到的策略精确匹配专家的占用度量。这说明"分布匹配"不是近似,是精确等价。
关键公式拆解
原文 Proposition 3.2:RL o IRL_psi(pi_E) = argmin_pi -H(pi) + psi^*(rho_pi - rho_{pi_E})
逐项翻译:
RL o IRL_psi(pi_E):先在专家 pi_E 上做 psi-正则化的 IRL 恢复代价函数 c,再基于 c 做 RL 提取策略——整个管道的输出。argmin_pi:在所有策略中找一个最好的。-H(pi):"减去策略的熵"——等价于"让策略不要太死板"的软约束。psi^*(rho_pi - rho_{pi_E}):"我和专家的占用度量之间的距离"——距离尺子由 psi^* 决定。
证明思路(Appendix A.1):利用 saddle point 定理。IRL 找的代价函数是一个 max-min 问题的 max 坐标;RL 在 IRL 输出上训练得到的策略是 min 坐标。minimax = maximin(因为目标关于 rho 凸、关于 c 凹),所以两步走等价于直接找 min_pi 的那个优化问题。
所以这一节是想说:作者先证明"模仿专家"=="匹配占用度量",把绕弯路变成了直奔主题。后面所有算法设计都站在这个等价性上。
第二步:选择"距离尺子"——从学徒学习到 Jensen-Shannon 散度
类比
两瓶饮料怎么比"像不像"?可以闻味道(粗糙但快)、可以化验成分比例(精确但贵)、可以测密度(便宜但信息少)。换不同的"测法"会得到不同的"距离值"。
GAIL 也要在第一步建立的框架里选一种具体的"测法"——即选择正则项 psi 的具体形式——来量"我的占用度量和专家的占用度量"差多少。不同的 psi 对应不同的模仿学习算法。
论文做了什么
论文先展示了旧方法是怎么选 psi 的:
**学徒学习(Apprenticeship Learning)**对应 psi = delta_C(indicator function),即强制代价函数必须落在一个预设的线性子空间 C 内。具体来说:
- Abbeel & Ng (2004) 的 FEM(Feature Expectation Matching)用 C_linear = {sum_i w_i f_i : ||w||_2 <= 1},对应的距离是"特征期望的 L2 范数"。
- Syed & Schapire (2007) 的 GTAL 用 C_convex = {sum_i w_i f_i : sum_i w_i = 1, w_i >= 0},对应的距离是"最差特征上的差距"。
这些方法的优点:能配合策略梯度(TRPO)在高维环境中跑起来——Ho et al. (2016b) 已经证明了这一点。
这些方法的致命缺点:代价函数被限制在 d 个手工特征张成的线性子空间内。如果真实的专家代价函数不在这个子空间里,就永远没法精确模仿。就像你硬要用"酸、甜、苦"三个维度去描述一杯精品咖啡的风味——少了"花香"、"坚果"、"焦糖"这些维度,你的描述永远不准确。
论文然后提出新的选择——psi_GA(公式 13):
psi_GA(c) = E_{pi_E}[g(c(s,a))] 如果 c < 0 处处成立
= +inf 否则
其中 g(x) = -x - log(1 - e^x) 如果 x < 0
= +inf 否则
正则项 psi_GA 的直觉:它要求代价函数 c(s,a) 处处为负("每个状态-动作组合都有某种程度的'坏'"),并且对那些给专家状态-动作对赋予"接近零的代价"(即几乎不罚专家)的代价函数施加重罚。效果是:允许任意形状的代价函数,同时保证专家被赋予低代价。
关键数学结果
论文证明(Corollary A.1.1)psi_GA 的共轭恰好是:
psi_GA^*(rho_pi - rho_{pi_E}) = max_{D in (0,1)^{S x A}} E_pi[log D(s,a)] + E_{pi_E}[log(1 - D(s,a))]
人话:psi_GA 对应的"距离尺子"恰好是"一个最优二分类器能多好地区分 pi 和 pi_E 的状态-动作对"——这就是 GAN 论文里鉴别器的最优目标函数!
Jensen-Shannon 散度(JS divergence):D_JS(P||Q) = (1/2) D_KL(P||(P+Q)/2) + (1/2) D_KL(Q||(P+Q)/2)。它是对称的、有界的(0 到 log 2),且上述鉴别器最优目标函数恰好等于 2D_JS - 2log2。
为什么不用 KL 散度:KL 散度不对称且无界——当 P 的支撑和 Q 不重合时 KL 为无穷大,对抗训练容易爆炸。JS 散度对称、有界,而且恰好对应 GAN 鉴别器的训练目标,所以是天然的选择。
将 psi_GA^* 代入 Proposition 3.2 的框架,最终得到 GAIL 的优化目标(公式 15):
min_pi D_JS(rho_pi, rho_{pi_E}) - lambda * H(pi)
人话:"找一个策略 pi,让它的占用度量和专家的占用度量之间的 JS 散度最小,同时保持一定的策略熵(防止策略塌缩)。"
为什么这步有用
- 选 JS 散度不是巧合:GAN 论文(Goodfellow 2014)已经证明 GAN 鉴别器训到极致时,等价于在测 JS 散度。所以一旦选了 JS,和 GAN 的连接就立起来了——可以照搬 GAN 的训练流程。
- 旧的学徒学习用"线性特征"刻出来的代价函数表达力有限;新正则项 psi_GA 允许任意复杂的鉴别器(神经网络),表达力一下子拉满。
- psi_GA 有一个关键优势:它是数据自适应的——因为 psi_GA 本身定义中包含对专家数据的期望 E_{pi_E},所以它能根据不同的专家数据集自动调节约束强度。旧的 indicator regularizer delta_C 是固定的,完全不看数据。
所以这一节是想说:作者挑了 JS 散度作为"距离尺子",因为它正好打通了 GAN 的训练机器,同时表达力远超旧方法的线性约束。
第三步:GAN 化的对抗训练——Algorithm 1 详解
类比
教练让两个学生对抗:
- A(鉴别器 D):努力分辨"这段录像是大厨拍的,还是学徒拍的"。看完后给 0-1 之间一个分数:1 代表"我笃定是学徒",0 代表"我笃定是大厨"。
- B(学徒 pi,也就是策略):努力让自己的录像被 A 误认成"大厨拍的"。
两人轮流升级:A 越敏锐,B 就要更像大厨;B 越像大厨,A 又要练出更刁钻的眼力。最后达到平衡时,A 已经分不清了——这意味着 B 的行为分布和大厨几乎一样。
算法的完整流程(Algorithm 1)
论文要找一个鞍点 (pi, D),使得下面这个表达式关于 D 最大、关于 pi 最小:
E_pi[log D(s,a)] + E_{pi_E}[log(1 - D(s,a))] - lambda * H(pi) (公式 16)
具体做法是交替更新:
输入:专家轨迹 tau_E(从 pi_E 采样)、初始策略参数 theta_0、初始鉴别器参数 w_0。
循环(i = 0, 1, 2, ...):
采样:让当前策略 pi_{theta_i} 在环境里跑一批轨迹 tau_i。
更新鉴别器(梯度上升):用 Adam 优化器对 w 做一步梯度上升,梯度为:
E_hat_{tau_i}[nabla_w log D_w(s,a)] + E_hat_{tau_E}[nabla_w log(1 - D_w(s,a))] (公式 17)直觉:让 D 在学徒数据上输出接近 1("这是学徒的"),在专家数据上输出接近 0("这是专家的")。就是标准的二分类交叉熵损失的梯度。
更新策略(TRPO 步):把 log D_{w_{i+1}}(s,a) 当成"代价函数",用 TRPO 做一步策略更新。具体的策略梯度为:
E_hat_{tau_i}[nabla_theta log pi_theta(a|s) * Q(s,a)] - lambda * nabla_theta H(pi_theta) (公式 18) 其中 Q(s_bar, a_bar) = E_hat_{tau_i}[log D_{w_{i+1}}(s,a) | s_0 = s_bar, a_0 = a_bar]直觉:Q(s,a) 是"从 (s,a) 出发,后续轨迹里鉴别器平均给了多高的'学徒分数'"。策略朝着"降低这个分数"的方向走——就是朝着"让鉴别器觉得我像专家"的方向走。
回到第 1 步。
TRPO(Trust Region Policy Optimization):一种"小步慢走"式的 RL 优化器。每次更新策略时,约束新旧策略之间的 KL 散度不超过某个阈值 delta。防止梯度估计噪声太大时策略突然跑偏。在 GAIL 中,TRPO 保证了策略不会因为鉴别器一次大的更新而"过度反应"。
Q 函数 Q(s,a):从状态 s 执行动作 a 后,按照当前策略继续走下去的"累积代价"。在 GAIL 中,代价是 log D(s,a),所以 Q 衡量的是"从这里开始,我有多'容易被识破是学徒'"。
策略梯度(policy gradient):用蒙特卡洛采样来估计"如果我在某个状态稍微改变动作选择概率,总代价会怎么变"。形式为 E[nabla log pi(a|s) * Q(s,a)]。这是 REINFORCE 算法的基础形式。
鉴别器 = 动态代价函数
一个重要的视角:鉴别器 D_w 可以被解读为一个实时更新的代价函数。具体来说,c(s,a) = log D_w(s,a) 就是 GAIL 的"等效代价"。这个代价的特别之处在于:
- 它不是预先指定的(不同于传统 RL 的手写奖励)。
- 它不是从 IRL 一次性恢复的(不同于 MaxEnt IRL)。
- 它是和策略一起共同演化的——策略变了,鉴别器也跟着调整对"什么才算学徒行为"的判断,进而给出新的代价信号。
这种动态代价的好处是课程自适应(curriculum-adaptive):训练初期,策略很差,鉴别器轻松就能分辨,给出的代价信号很明确("你哪哪都不像专家");训练后期,策略已经很好了,鉴别器必须关注细微差异才能分辨,给出的代价信号也变得精细("你在某些罕见状态下的动作还不够像")。这类似 Ch16 提到的 reward shaping 的效果,但是完全自动的。
熵正则的梯度
论文附录 A.2(Lemma A.1)推导了策略熵 H(pi_theta) 的梯度:
nabla_theta H(pi_theta) = E_{pi_theta}[nabla_theta log pi_theta(a|s) * Q_log(s,a)]
其中 Q_log(s,a) = E_{pi_theta}[-log pi_theta(a|s) | s_0 = s, a_0 = a]
人话:熵正则的梯度也可以写成策略梯度的形式——把"代价"替换成 -log pi_theta(a|s)(即"动作本身有多意外")。这意味着实现时不需要特殊处理熵项——只要在 Q 值里加上这个额外的"意外度"代价即可。
和 GAN 的精确对应关系
| GAN (Goodfellow 2014) | GAIL (Ho & Ermon 2016) |
|---|---|
| 生成器 G 造图片 | 策略 pi 造轨迹 |
| 鉴别器 D 辨真假图 | 鉴别器 D 辨专家/学徒 |
| 真实数据分布 p_data | 专家占用度量 rho_{pi_E} |
| 生成分布 p_G | 策略占用度量 rho_pi |
| D 对 G 反向传播 | 不能直接反向传播——策略到轨迹要经过环境动力学 |
| G 的更新用梯度下降 | pi 的更新用 TRPO(策略梯度 + 信任区域) |
| 最优解 = p_G = p_data | 最优解 = rho_pi = rho_{pi_E} |
唯一关键差异:GAN 里生成器可以直接对鉴别器反向传播梯度;GAIL 里策略产生的动作要在环境里"实际跑"才能拿到反馈,中间隔着环境动力学 P(s'|s,a),没法直接反向传播。所以必须用策略梯度(即蒙特卡洛采样 + REINFORCE)来桥接——这就是为什么 GAIL 需要 TRPO 而不是简单的 SGD。
收敛性分析
论文没有给出严格的收敛证明(这在 GAN 文献中也是公认难题),但依赖了以下保障:
- TRPO 的信任区域约束限制了策略每步变化幅度,避免了 GAN 训练中常见的"模式崩塌"。
- Adam 优化器对鉴别器做小步更新,避免了"鉴别器过强导致梯度消失"。
- 实验中观察到训练过程稳定收敛。
计算复杂度
每次迭代的主要成本:
- 在环境中采样 N 个 state-action pairs(论文用 N=5000 到 50000)。
- 对鉴别器做一步 Adam 更新:O(N * |w|),其中 |w| 是鉴别器参数量。
- 对策略做一步 TRPO 更新:需要计算 Fisher 信息矩阵和共轭梯度,大约 O(N * |theta|^2) 或更快的近似。
- 总迭代数:300-1500 次。
所以这一节是想说:把策略和鉴别器架成 GAN 那种对抗结构,让"模仿专家"变成"骗过鉴别器"。鉴别器充当实时更新的代价函数,策略用 TRPO 追着这个动态代价跑。
第四步:从学徒学习到 GAIL 的渐变——为什么旧方法是 GAIL 的特殊情况
论文做了什么
论文 Section 4 展示了一个优美的统一视角:学徒学习(FEM / GTAL)和 GAIL 都是 Proposition 3.2 的特殊实例,只是 psi 的选择不同。
| 方法 | 正则项 psi | 对应距离 psi^* | 代价函数表达力 |
|---|---|---|---|
| FEM | delta_{C_linear} | 特征期望的 L2 距离 | d 个线性特征 |
| GTAL | delta_{C_convex} | 最差特征差距 | d 个线性特征 |
| GAIL | psi_GA | JS 散度 | 任意神经网络 |
学徒学习的策略梯度公式(公式 12):
nabla_theta max_{c in C} E_{pi_theta}[c(s,a)] - E_{pi_E}[c(s,a)]
= nabla_theta E_{pi_theta}[c*(s,a)]
= E_{pi_theta}[nabla_theta log pi_theta(a|s) * Q_{c*}(s,a)]
其中 c* 是使"策略和专家之间代价差"最大的代价函数。
重要洞察:这个公式和 GAIL 的策略梯度(公式 18)结构完全一样!唯一的区别是:
- 学徒学习中 c* 是"在线性函数族 C 中选最优"的结果——有闭式解。
- GAIL 中 c* = log D_w 是"训练一个神经网络鉴别器"的结果——没有闭式解但表达力无限。
这意味着 GAIL 可以复用学徒学习的整套工程基础设施(策略梯度 + TRPO),只需要把"解析计算 c*"替换成"训练一个鉴别器网络"。
为什么旧方法会失败
论文指出(Section 4 末尾):学徒学习中,如果真实的专家代价函数不在 C 里,即使策略在 C 中所有代价上都"不输专家",也不能保证策略等于专家。就像考试只考 5 道题(5 个线性特征),即使你 5 道都答对了,也不代表你真的学会了——也许你只是在这 5 道题上碰巧蒙对了。GAIL 相当于"考无穷多道题"(鉴别器可以检查任意复杂的模式),所以如果你"答对"了,那是真学会了。
所以这一节是想说:GAIL 不是凭空冒出来的新方法——它是把旧的学徒学习框架中"有限表达力的线性代价"升级为"无限表达力的神经网络代价",统一在同一个理论框架下。
第五步:工程细节——让算法真正跑起来
网络架构
- 策略网络 pi_theta:2 层全连接网络,每层 100 个隐藏单元,激活函数 tanh。输入是状态 s(维度 2 到 376),输出是动作分布的参数(高斯分布的均值和对角协方差)。
- 鉴别器网络 D_w:同样的架构(2 层 100 单元 tanh),输入 (s, a) 拼接,输出 sigmoid 到 (0,1)。
训练超参数
- 策略优化器:TRPO,KL 约束 delta 未明确给出(沿用 Schulman et al. 2015 的默认值)。
- 鉴别器优化器:Adam(Kingma & Ba 2014)。
- 方差缩减:训练了价值函数(同样 2 层 100 单元 tanh)+ Generalized Advantage Estimation(GAE,gamma=0.995, lambda=0.97)。
- 每轮采样量:5000-50000 个 state-action pairs(随任务复杂度变化)。
- 总迭代数:300-1500 轮。
实现备注
论文没有明确提到的但后续复现工作发现的关键细节:
- 鉴别器不能训练太多步(否则"太强"导致梯度消失)——通常每轮只做 1 步 Adam 更新。
- 策略和专家的轨迹在送入鉴别器时需要打乱顺序(否则鉴别器可能利用时间位置信息"作弊")。
- 熵正则 lambda 通常设为 0(论文只在 Reacher 任务上观察到非零 lambda 有帮助)。
所以这一节是想说:工程上 GAIL 的实现出人意料地简单——两个小网络交替训练,关键是控制好鉴别器不要太强、策略更新不要太大。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【GAIL vs 行为克隆 · 样本效率对比】
专家示范 D ──► 行为克隆 BC ──► 分布偏移 → 成功率崩溃
│
└──► GAIL: pi + D 对抗 ──► 学分布匹配 → 少样本接近专家
│
▼
MuJoCo 连续控制:GAIL 显著优于 BC(同示范量)

关键数字(What works)
数字本身不重要,重要的是它们告诉你"哪条设计选择真的有效"。
主结果表
| 任务 | 维度 (obs/act) | 专家数据量 | GAIL | BC | FEM | GTAL |
|---|---|---|---|---|---|---|
| Humanoid | 376/17 | 80 traj | 10200 | 1397 | 5093 | 5096 |
| Humanoid | 376/17 | 160 traj | 10119 | 3655 | 5120 | 5412 |
| HalfCheetah | 17/6 | 25 traj | 4840 | 3718 | 502 | 869 |
| Hopper | 11/3 | 4 traj | 3614 | 50 | 3571 | 3065 |
| Walker | 17/6 | 11 traj | 6850 | 5946 | 4723 | 6139 |
| Ant | 111/8 | 25 traj | 4132 | 3235 | -5122 | -3271 |
(负分表示比随机策略还差。专家分数:Humanoid 9575, HalfCheetah 4463, Hopper 3571, Walker 6717, Ant 4228)
关键发现
| 发现 | 数字 | 意义 |
|---|---|---|
| 极少专家数据即可 | Hopper 4 条 = 200 个 (s,a) 即达专家水平 | GAIL 对专家数据效率极高 |
| 高维任务首次跑通 | Humanoid 376D 达到 106% 专家分 | 证明对抗式 IL 可以处理超高维 |
| 线性方法在复杂任务崩盘 | FEM 在 Ant 上 -5148(比随机还差) | 线性代价函数表达力不足 |
| 环境交互不省 | 交互量 ≈ 训 TRPO 专家本身 | GAIL 省的是专家数据,不是仿真 |
| 简单架构即可 | 2 层 100 单元 tanh | 性能源于方法论不是模型大小 |
| 熵正则有时有帮助 | Reacher 上 lambda=10^{-3} 显著改善 | 低维任务探索不够时需要 |
环境交互预算
| 任务 | 迭代数 | 每轮采样 | 总交互 |
|---|---|---|---|
| Cartpole | 300 | 5000 | 1.5M |
| HalfCheetah | 500 | 50000 | 25M |
| Humanoid | 1500 | 50000 | 75M |
所以这一节是想说:数据告诉我们 GAIL 在高维任务上把所有对手按在地上摩擦,但代价是仿真交互很贵——它省的是"看专家做几次",不是"自己练几次"。
实验结果说明了什么
论文的实验回答了三个核心问题:
问题 1:对抗式学习信号在高维连续控制中可行吗?
可行。Humanoid(376 维状态、17 维动作)上 GAIL 达到甚至超越专家水平,而之前从没有模仿学习方法在这个量级的任务上跑通过。这一结果的意义超越了算法本身——它为整个"对抗式模仿学习"方向打开了大门。
问题 2:对比行为克隆,GAIL 的专家数据效率如何?
差距巨大。在 Hopper 上,4 条轨迹(约 200 个样本点)就让 GAIL 达到专家水平;行为克隆只拿到 50 分(专家 3571 分)——几乎什么都没学到。原因很直观:行为克隆需要专家数据覆盖整个状态空间;GAIL 只需要专家数据提供"什么叫像专家"的信号,然后自己通过探索补充其余状态的行为。
问题 3:线性代价函数为什么在复杂任务上崩盘?
FEM 和 GTAL 在 Ant 上得到负分——比完全随机的策略还差。这说明当真实的"什么叫好行为"无法用几个手工特征的线性组合来描述时,线性学徒学习会学到完全错误的策略。GAIL 的神经网络鉴别器没有这个限制,因此能正确捕捉高维行为的复杂模式。
附加发现:熵正则在 Reacher 上的作用
Reacher 是一个低维但需要精确控制的任务。论文发现 lambda=10^{-3} 时性能显著好于 lambda=0(通过 Wilcoxon 检验 p=0.05 确认)。解释:Reacher 的动作空间小、探索需求高——如果不加熵正则,策略容易过早收敛到一个局部最优。
所以这一节是想说:实验证明了 GAIL 的三个核心卖点——高维可行、数据高效、不需要手工特征——同时暴露了环境交互成本高的短板。
你应该懂的几个新词
模仿学习(Imitation Learning, IL):让 AI 看着专家示范学会做事的整套范式。GAIL 是其中一种。
行为克隆(Behavioral Cloning, BC):最朴素的 IL。把 (状态, 动作) 当监督学习样本。简单但脆。Ch14 详细讲了它的分布偏移问题。
逆强化学习(Inverse Reinforcement Learning, IRL):先反推专家心里的奖励函数,再用 RL 学策略。两步走,慢。
占用度量(occupancy measure):策略在状态-动作空间上的折扣频率分布。模仿专家=匹配占用度量。是 GAIL 理论的核心概念。
奖励 / 代价函数(reward / cost function):评价"在这个状态做这个动作有多好/多差"的数字函数。RL 的核心。GAIL 里用的是"代价"(cost)——值越大越坏(和 reward 方向相反)。
GAN(Generative Adversarial Network):Goodfellow 2014 提出的对抗式生成模型。一个生成器、一个鉴别器,互相博弈。GAIL 是它在 RL/IL 领域的化身。
鉴别器(discriminator):二分类网络,分辨"专家 vs 学徒"的 (s,a) 对。在 GAIL 中给策略提供学习信号,相当于"实时打分老师"。等效于动态代价函数 c(s,a) = log D(s,a)。
JS 散度(Jensen-Shannon divergence):测两个分布有多不一样的对称指标。最小化 JS 散度 = 让两个分布几乎重合。有界(0 到 log 2),比 KL 散度更适合对抗训练。
TRPO(Trust Region Policy Optimization):一种"小步慢走"式的 RL 优化器。每次只让策略变一点点(约束 KL 散度),防止训练飞掉。GAIL 用它来更新策略。Ch16 有更详细的介绍。
熵 / 熵正则(entropy / entropy regularization):策略的"随机性程度"。在目标里加上 lambda*H(pi) 鼓励策略不要过早收敛到死板单选。
复合误差(compounding error):行为克隆的老毛病——预测有偏差 -> 进入没见过的状态 -> 再次偏差 -> 雪球越滚越大。误差随时间步 T 呈二次增长。
学徒学习(Apprenticeship Learning):IRL 简化版,把代价限制成几个手工特征的线性组合。能跑大任务但表达力差,在复杂任务上崩盘。
共轭函数(convex conjugate / Fenchel conjugate):凸分析中把"约束"翻译成"距离"的工具。psi^(x) = sup_c [x^T c - psi(c)]。正则项 psi 的共轭 psi^ 决定了 GAIL 用什么"尺子"量分布差距。
鞍点(saddle point):minimax 问题的解。在 GAIL 中,(pi*, D*) 是鞍点——D* 关于 D 最大,pi* 关于 pi 最小。
所以这一节是想说:上面这些词以后看 RL/IL 论文会反复见,先把它们和"教徒弟做菜"这套类比挂钩。
它有什么搞不定的
GAIL 不是万能的,论文自己也老实交代了几个翻车场景,加上后续社区发现的问题:
环境交互巨贵:算法本身省的是专家数据,但训练时机器人要在仿真器里跑很多次(Humanoid 需要 7500 万次仿真步,和"从零训 TRPO 专家"差不多)。所以真机器人上跑是危险且烧钱的——后续工作(AIRL、SQIL、Off-policy GAIL)都在想办法降低这个成本。
训练时不能问专家:和 IRL 一样,GAIL 训练时不能问专家"我现在该怎么动"——只能靠自己探索。如果允许专家在线指点(比如 DAgger),效率会高很多。但在很多实际场景下(远程操控贵、专家不可用),这个限制反而是优势。
对抗训练本身不稳:GAN 圈的老问题——鉴别器太强导致梯度消失、太弱导致学习信号无意义。GAIL 继承了这个毛病。虽然 TRPO + Adam 的组合在实验中够用,但调超参(学习率、每轮更新步数比例)仍然需要经验。
没有显式的奖励函数输出:训完模型后,你没法把"学到的奖励"导出来给别的任务用。鉴别器和策略是绑定的——换一个新环境或新任务,鉴别器就失效了。这是和经典 IRL 的本质差异。后续 AIRL(Fu et al. 2018)专门解决了这个问题。
专家数据质量敏感:如果专家轨迹本身包含次优行为或噪声,鉴别器会把这些噪声也当作"专家特征"去模仿。没有机制过滤"专家也犯错"的情况。
多模态行为难以捕捉:如果专家面对同一状态可能采取多种不同的好策略(例如走路时左绕或右绕都行),GAIL 的高斯策略可能只学到其中一种或折中的平均行为。后续 InfoGAIL 尝试解决这个问题。
缺乏理论收敛保证:论文没有证明 Algorithm 1 一定收敛到全局最优。这在 GAN 文献中也是普遍缺失的——只有在某些简化假设下才有局部收敛的保证。
所以这一节是想说:GAIL 在仿真交互成本、训练稳定性、可迁移性、多模态处理上都有硬伤,需要后续工作来补。但这些硬伤没有阻止它成为 2016-2020 年 IL 领域最有影响力的方法。
它和别的几篇是什么关系
时间线:GAN (2014) -> MaxEnt IRL (Ziebart 2008, 理论基石) -> GAIL (2016) -> AIRL / GAIfO / SQIL (2018-2019) -> Diffusion Policy (2023, 非对抗 IL) -> OpenVLA (2024, 基础模型时代) -> Cosmos-Policy (2025)。
集合关系:把"模仿学习"想成一个大集合 IL。这个集合分两支:BC 派(直接监督学动作,Ch14 详解)和 IRL 派(先学奖励再 RL,Ch16 涉及)。GAIL 开创了第三条路:对抗式直接学策略。这条路后来又分裂出 AIRL(加了可迁移的奖励输出)、GAIfO(只需要状态观测不需要动作标注)、SQIL(用固定奖励替代对抗训练)等亲戚。
因果关系:
- GAN 出现 导致 GAIL 这种思路成为可能——没有 GAN 就没人想到用鉴别器替代代价函数。
- MaxEnt IRL 提供理论地基——没有"IRL = 占用度量匹配"这个等价性证明,GAIL 的推导无从开始。
- GAIL 出现 导致 后续机器人界对模仿学习信心大增,连 OpenVLA、Cosmos-Policy 这类基础模型时代的具身 AI 也大量用 IL 数据。
对比关系:
- 和 DAgger (Ch14) 比:DAgger 需要专家在线,GAIL 不需要。DAgger 不需要环境交互(只做监督学习),GAIL 需要大量环境交互。两者互补。
- 和 Diffusion Policy (Ch13) 比:Diffusion Policy 也是模仿学习路线,但是用扩散模型直接生成动作分布,不需要对抗鉴别器也不需要环境交互——是 GAIL 的"非对抗、纯离线"后继。
- 和 OpenVLA 比:OpenVLA 用 token 化 + 大模型微调来做 IL,规模上和 GAIL 完全两个时代。但底层都是"看着专家轨迹学策略"。
- 和 PPO/SAC (Ch16) 比:PPO/SAC 需要手写奖励函数,GAIL 不需要——GAIL 用鉴别器自动生成奖励。但 GAIL 的策略更新步本身就可以用 PPO 替代 TRPO(后续很多实现这么做)。
所以这一节是想说:GAIL 是模仿学习里"对抗派"的祖宗,上承 GAN + MaxEnt IRL 的理论,下启 AIRL/SQIL/现代具身 AI 的实践。
和本导读的关系
在本导读系列中,GAIL 处于一个承上启下的关键位置:
**Ch14(模仿学习)**详细讲了 BC 的复合误差和 DAgger 的在线纠正方案。GAIL 提供了第三条路——既不需要海量专家数据(BC 的要求),也不需要专家在线(DAgger 的要求),代价是需要环境交互。Ch14 中提到"IRL 的具体算法推导"被标注为"不要求"的内容——GAIL 正是把 IRL 的理论简化为一个可执行的算法,让你不需要理解完整的 IRL 推导就能用起来。
**Ch16(RL 基础)**讲了 PPO、SAC 等策略优化器。GAIL 的策略更新步直接使用 TRPO(PPO 的前身),鉴别器提供的 log D(s,a) 充当 Ch16 中"代价函数 / 奖励函数"的角色。理解了 Ch16 的策略梯度和 Actor-Critic 之后,GAIL 的 Algorithm 1 就变得非常自然——它本质上就是一个 Actor-Critic,只不过 Critic 被替换成了鉴别器。
对后续章节的影响:GAIL 引入的"对抗式模仿"范式,影响了后来的 sim-to-real(Ch17,用鉴别器对齐仿真和真实的分布差异)、世界模型训练(Ch15,一些工作用对抗损失来保证世界模型的轨迹分布和真实分布一致)等方向。
所以这一节是想说:GAIL 连接了 Ch14 的模仿学习问题定义和 Ch16 的 RL 优化工具箱,为后续 Ch17 sim-to-real 中的分布对齐思路提供了范式。
思考题
- GAN-模仿连接:如果把 GAIL 的鉴别器完全去掉,只用占用度量匹配作为目标(Corollary 3.2.1 的设定),为什么在大环境中不可行?
提示
想一想:专家只提供了有限条轨迹。如果状态空间有百万个点,大部分点上专家的占用度量是 0。精确匹配 = 你也必须永远不去那些点。这和"用有限数据泛化到新状态"的目标矛盾了。Corollary 3.2.1 假设可以精确计算所有点的占用度量,实际中做不到。- 鉴别器即奖励:在 GAIL 中,为什么说 c(s,a) = log D(s,a) 是一个好的"等效代价函数"?如果换成 c(s,a) = D(s,a)(不取 log)会怎样?
提示
log D(s,a) 的梯度在 D 接近 0 或 1 时不会消失得太快——它是 GAN 论文里被证明最优的形式,对应 JS 散度。如果用 D(s,a) 不取 log,当策略已经很好(D 接近 0.5)时梯度非常小,学习会停滞;当策略很差(D 接近 1)时梯度也饱和。Log 形式提供了更均匀的梯度信号。- 为什么 GAIL 比 IRL 快:传统 MaxEnt IRL 在内层需要跑完整的 RL 来找最优策略;GAIL 每轮只做一步策略更新。为什么"一步"就够了?
提示
因为 GAIL 把 IRL 的 max-min 双层优化"展平"成了交替单步更新。鉴别器做一步、策略做一步——类似 GAN 的训练。虽然每一步都不是最优的,但多轮交替后会收敛到鞍点。关键是 TRPO 的信任区域约束保证了每步不会跑偏太远,所以不需要内层收敛。- 策略梯度的桥接作用:GAN 里生成器可以直接对鉴别器反向传播;GAIL 为什么不能?策略梯度(REINFORCE)在这里扮演什么角色?
提示
因为策略输出动作 a 后,要经过环境动力学 P(s'|s,a) 才产生下一个状态。环境动力学通常是黑盒(不可微的物理仿真),没法对它求导。策略梯度用蒙特卡洛采样绕过了这个问题:不需要知道环境的导数,只需要知道"走完一条轨迹后总代价是多少"。REINFORCE 用 nabla log pi(a|s) * Q(s,a) 来估计梯度方向。- FEM/GTAL 在 Ant 上为什么比随机还差:线性代价函数在 Ant 上产生了负分(比完全不学还差)。这种"学了反而更差"的现象背后是什么机制?
提示
当代价函数类 C 太小、不包含真正描述专家行为的代价函数时,策略会去优化一个"错误的目标"。这个错误目标可能和真实目标方向相反——就像你根据"谁走得远就好"的线性标准去训练,但实际上专家是在"维持平衡同时前进"。一味追求走远可能导致策略学会猛冲然后摔倒,得分反而比站着不动还低。- 占用度量的一一对应:Proposition 3.1 说策略和占用度量一一对应。如果两个不同的策略恰好产生相同的状态访问分布,它们的占用度量一定不同吗?
提示
是的。占用度量 rho(s,a) 包含了动作维度——即使两个策略访问相同的状态分布,只要在某个状态上它们选择不同的动作分布,rho(s,a) 就不同。一一对应的证明依赖于 pi(a|s) = rho(s,a) / sum_{a'} rho(s,a') 这个恢复公式——不同的 rho 恢复出不同的 pi。- 熵正则的双重作用:目标函数里的 lambda*H(pi) 除了"防止策略塌缩"之外,还有什么数学上的好处?
提示
熵正则使得目标函数关于 rho 严格凸(Lemma 3.1 证明了 -H_bar 是严格凸的)。严格凸意味着最优解唯一——这是 Proposition 3.2 证明中"从对偶最优唯一恢复原问题最优"的关键条件。如果没有熵正则,可能存在多个同样好的策略,理论保证就弱了。所以这一节是想说:能回答这 7 个问题,说明你真的理解了 GAIL 从理论到实践的完整链条。
一些好奇心问答(FAQ)
Q1:GAIL 和 GAN 的对应关系到底有多紧?
非常紧。GAN 里:生成器造图、鉴别器辨真假;GAIL 里:策略造轨迹、鉴别器辨"专家 vs 学徒"。唯一的结构性差异是:GAN 里生成器可以直接对鉴别器反向传播(因为生成过程可微);GAIL 里策略产生的动作要在环境里"实际跑"才能拿到反馈(环境动力学不可微)。所以中间得用策略梯度(TRPO/PPO)来桥接。数学上,两者的目标函数形式完全一样——都是 min_G max_D 的鞍点问题。
Q2:为什么不直接用 KL 散度?非要 JS?
三个原因。第一,KL 散度不对称(D_KL(P||Q) 不等于 D_KL(Q||P)),选哪个方向都有偏;JS 对称。第二,KL 无界——当 P 和 Q 的支撑不完全重合时 KL 为无穷大,对抗训练容易爆炸;JS 有界(0 到 log 2)。第三,也是最关键的:GAN 论文已经证明了"鉴别器训到最优时,生成器的目标恰好是 JS 散度"——选 JS 就能直接复用 GAN 的训练框架,不需要额外推导。
Q3:GAIL 要不要真实奖励?
不要。这是它的核心卖点——只要专家轨迹,不要任何标量奖励信号。但训练时要能在环境里跑(仿真器或真机)。这和 Ch16 讲的 PPO/SAC 形成互补:PPO/SAC 需要奖励但不需要专家数据;GAIL 需要专家数据但不需要奖励。
Q4:要多少专家数据?
少得惊人。论文显示 Hopper 任务上 4 条轨迹(每条约 50 步 = 200 个 (s, a) 对)就能学到超越专家的水平。Humanoid 用 80 条。对比行为克隆在 Humanoid 上需要 240 条才达到 5660 分(GAIL 80 条就达到 10200 分)。
Q5:训练能跑多久?
每个任务 300-1500 次迭代,每次约 5000-50000 个环境交互。Humanoid 最贵:1500 次 x 50000 步 = 7500 万次仿真。在 2016 年的硬件上要好几天——都是 CPU 上跑的物理仿真。2026 年用 Isaac Sim 这类 GPU 加速仿真器会快几个数量级。
Q6:能不能用 GAIL 训真机器人?
理论上可以,但实践中仿真交互成本是大问题——真机器人不能像仿真那样疯跑几千万步。后续工作的解决路线:用 BC 预训练初始化策略(减少 GAIL 从零探索的需求)、改成 off-policy(复用旧数据)、或者在仿真中训完再 sim-to-real 迁移(Ch17 的主题)。
Q7:鉴别器太强了会怎样?
策略学不到东西,因为 log D(s,a) 接近 0(D 几乎确信这是学徒的行为),梯度饱和。这是 GAN 通病——"鉴别器赢太多轮后生成器放弃挣扎"。论文里靠 TRPO 的小步约束 + 每轮只更新鉴别器一步来缓解。后续 Wasserstein GAIL 等工作用梯度惩罚进一步稳定训练。
Q8:和 DAgger 比有啥区别?
DAgger(Ch14 详解)也是解决 BC 的复合误差问题,但要求专家在线提供反馈——学徒走到一个新状态,就问专家"你会怎么动",把答案补进训练集。GAIL 不需要这种在线访问,只要一份预先录好的专家轨迹。代价是 GAIL 需要环境交互(DAgger 不需要仿真器)。
Q9:GAIL 能否用于离散动作空间?
论文的理论适用于有限离散空间(Section 3 的推导就在有限 S、A 上进行),实验则主要在连续控制上。原则上 GAIL 可以用于离散动作(比如游戏 AI),只需要把策略分布从高斯换成 categorical,TRPO 换成适合离散动作的版本。
Q10:为什么 GAIL 在 Humanoid 上甚至超过了专家?
可能的解释:专家策略本身是用 TRPO+真实奖励训练的,不一定达到了全局最优。GAIL 在 JS 散度意义下匹配专家分布时,加上了熵正则,可能在某些方面"平滑"了专家的次优选择,加上统计波动,导致评估时得分略高。这也说明"匹配分布"不完全等于"复制行为"——它可能在边缘上有创造性的超越。
所以这一节是想说:GAIL 的关键定位——只要离线专家数据 + 仿真器,不要在线访问专家,不要真实奖励。它和 BC、DAgger、RL 各自互补,不是替代关系。
如果你想再深入
按"前传 -> 同期 -> 续作 -> 衍生"四类排序:
- 前传:GAN(Goodfellow et al. 2014) — 必读。理解了 GAN 的对抗训练,再看 GAIL 就豁然开朗。论文:arxiv 1406.2661。
- 前传:Maximum Entropy IRL(Ziebart et al. 2008) — GAIL 的理论起点。讲清楚"为什么 IRL 等价于分布匹配"的最早工作。
- 同期:Ho et al. (2016b) Model-free Imitation Learning with Policy Optimization — 同一作者的前序工作。用 TRPO + 线性代价做学徒学习,是 GAIL 的"弱化版"。GAIL 在此基础上把线性代价升级为神经网络。
- 续作:AIRL(Adversarial Inverse RL, Fu et al. 2018) — GAIL 的"可迁移版"。显式恢复一个可以跨任务复用的奖励函数,弥补了 GAIL 不输出奖励的硬伤。
- 续作:SQIL(Soft Q Imitation Learning, Reddy et al. 2019) — GAIL 的"简化版"。把对抗训练换成"专家=奖励 1、自己=奖励 0"的固定二值奖励,效果接近但更稳定。
- 续作:Diffusion Policy(Chi et al. 2023) — 现代具身 AI 的模仿学习。完全不用对抗,改用扩散模型直接生成动作分布。代表"非对抗 IL"在大模型时代的崛起。Ch13 详解。
- 衍生:OpenVLA(Kim et al. 2024) — 把 IL 拉到基础模型尺度。底层逻辑还是"看着专家轨迹学策略",但模型大了 1000 倍、数据多了 10000 倍。
- 工具:TRPO(Schulman et al. 2015) — GAIL 用的策略优化器。Ch16 有深入讲解。
所以这一节是想说:把 GAN + MaxEnt IRL + GAIL + AIRL 这四篇连起来读,就能看到对抗式 IL 的完整脉络;想看现代版直接跳 Diffusion Policy 和 OpenVLA。
原文信息
@inproceedings{ho2016generative,
title={Generative Adversarial Imitation Learning},
author={Ho, Jonathan and Ermon, Stefano},
booktitle={Advances in Neural Information Processing Systems (NeurIPS)},
volume={29},
year={2016}
}
- 论文链接:arxiv 1606.03476
- 代码(非官方复现):openai/imitation
- 作者主页:Jonathan Ho (Stanford -> Google Brain,后来做了 DDPM/Diffusion 系列), Stefano Ermon (Stanford)
所以这一节是想说:这篇 2016 年的 NeurIPS 论文出自斯坦福,第一作者 Jonathan Ho 后来创造了 Diffusion Models——他的研究一直围绕"用生成模型的思路做不是图片的东西"。
◼
引用本笔记 / Cite this note
@online{eai_gail_2026,
title = {(readable note) Generative Adversarial Imitation Learning},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2016 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/gail/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?