Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 50

Generative Adversarial Imitation Learning

34 min read · 11912 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过强化学习"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

让 AI 看大厨做菜的录像,再找个"挑刺老师"分辨它做得像不像,靠这种较劲学会做事,不用猜大厨心里的打分标准。

所以这一节是想说:这篇论文造了一个"看着专家学,少绕一道弯"的模仿学习算法。


这是个什么场景

想象你刚搬到一个陌生城市,想学本地老饕怎么挑早餐摊。你跟拍了他一周的视频:他先看牌子、再看人多不多、最后才点东西。现在轮到你自己出门了——你怎么照着学?

两个朴素思路:

  1. 抄作业:把录像每一帧切下来——"老饕看到这个招牌时,下一步是绕过去"——做成一张张"看到 X 就做 Y"的对照表。出门照搬。
  2. 猜老师心思:先反推"老饕心里的打分标准是什么"(他大概觉得"排队 5 人=好"、"招牌掉漆=差"),再用这个标准慢慢练自己挑摊。

机器人学走路也是一模一样的问题。给一段人类专家走路的录像,机器人要么"抄作业"——把每一帧的 (姿势, 动作) 拿去做监督学习;要么"猜心思"——先反推专家的评分函数。

抄作业看起来简单,但有个老毛病:录像里没拍过的姿势一旦出现,机器人立刻懵——它从没学过怎么"从摔倒的姿势爬起来",于是越走越偏,最后摔。术语叫复合误差(compounding error)。就像你照着视频学挑摊,结果某天看到一家视频里没出现过的招牌,你完全不知道该绕还是该上。

猜老师心思(这就是逆强化学习 IRL)能解决"录像没拍过"的问题,因为它学的是评分标准,不是具体动作。但代价是:每次更新这个评分标准,都要把机器人放进环境里反复练强化学习——算一次猜,要做完一整套强化学习,烧钱烧时间。

GAIL 想做的事:既要 IRL 那种"学评分标准"的鲁棒性,又不想真的跑两层循环

所以这一节是想说:GAIL 想把"从专家学走路"这件事做得既稳又快。


Generative Adversarial Imitation Learning — 场景示意:这论文要解决的现实问题
Plate Nº IGenerative Adversarial Imitation Learning — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 行为克隆(Behavioral Cloning):把专家轨迹拆成 (状态, 动作) 对,做监督学习。简单粗暴,但只在录像里见过的状态附近能用——一旦走偏,错误像滚雪球一样累计。要它学好,得喂海量数据。Ch14 详细讲了这个问题:误差随时间步 T 呈 O(T^2 * epsilon) 增长。
  • 逆强化学习(IRL):先反推一个"代价函数"(专家觉得啥行为好),然后基于这个代价用 RL 训出策略。问题是内层套着 RL,每次更新代价函数都得跑一遍完整 RL。在高维任务上慢到不可接受。
  • 学徒学习(Apprenticeship Learning):IRL 的简化版,假设代价函数是"几个手工特征的线性组合"。能跑大任务,但特征要人工设计,复杂行为根本套不进去——比如人类走路涉及几百个肌肉关节,你给我用 5 个特征写代价函数?
  • DAgger:解决了行为克隆的复合误差问题,但需要专家在线提供反馈——学徒走到一个新状态就问专家"你会怎么动"。很多场景下做不到(专家不在、远程操控贵)。
  • 共同毛病:"先恢复代价、再求策略"这个两步走是绕路。学习者最终要的是怎么动,不是"专家心里怎么想"。绕了一圈才回到动作上,又慢又容易丢信息。

所以这一节是想说:之前要么数据量小就垮,要么算得太慢,要么必须人工设计特征或在线访问专家——没有哪条路又快又通用。


这篇论文的新想法

别费劲反推代价函数了。直接让 AI 和一个鉴别器对抗:鉴别器努力分辨"这是专家做的还是 AI 做的",AI 努力骗过鉴别器——学到最后,AI 的行为分布和专家几乎一样。

这个套路从 GAN(生成对抗网络)借来的:GAN 让生成器骗过鉴别器去合成以假乱真的图片;GAIL 让策略骗过鉴别器去合成以假乱真的"行为轨迹"。

论文的核心贡献有三层:

  1. 理论贡献:证明了 IRL 本质上等价于占用度量匹配(Proposition 3.2),把"学奖励函数"翻译成"匹配分布"。
  2. 算法贡献:设计了一个特殊正则项 psi_GA,使得目标函数恰好是 Jensen-Shannon 散度——和 GAN 打通,直接用对抗训练。
  3. 实践贡献:第一次在 376 维的 Humanoid 任务上证明模仿学习可以接近甚至超越专家水平。

所以这一节是想说:核心创新是把"模仿学习"翻译成"GAN",用对抗训练直接学策略,跳过 IRL 那一步。


它分几步做的(方法)

Figure:GAIL 生成器—判别器对抗训练与 MuJoCo 任务成功率
Plate Nº IIFigure:GAIL 生成器—判别器对抗训练与 MuJoCo 任务成功率

上图说明:Figure:GAIL 生成器—判别器对抗训练与 MuJoCo 任务成功率(论文原图)。

像学做一道菜:先想清楚"什么叫做得像大厨",再挑一把"尺子"量你和大厨差多少,然后请一位挑刺老师天天打分,最后把整套办法搬到 9 个真实任务上验证。整篇论文做了这 4 件事:定义"什么叫像专家"、证明 IRL 其实是分布匹配、设计 GAN 式的目标函数、给出落地算法。下面逐步展开。

第一步:把"模仿专家"翻译成"匹配分布"——占用度量与 IRL 的对偶性

类比

你想模仿一位大厨。怎么算"模仿成功"?不是只学他切菜动作——是要学他整个做菜过程的全套路:他多久翻一次锅、什么时候加盐、油温多高时下肉。一句话,**他在厨房里"出现的全套场景统计"**和你出现的统计要长得一模一样。

GAIL 把这个"全套场景统计"叫占用度量(occupancy measure)。

占用度量(occupancy measure)rho_pi(s, a):跟着策略 pi 在世界里走一遍,"状态 s + 动作 a"这种组合出现的(折扣后的)频率分布。数学定义:rho_pi(s, a) = pi(a|s) * sum_{t=0}^{inf} gamma^t * P(s_t = s | pi)。可以理解成"这个策略一辈子里在每种 (情境, 反应) 上花了多少时间"。

状态(state)s:当前世界的样子。比如机器人此刻的关节角度、速度。

动作(action)a:策略对当前状态的反应。比如"左膝伸 5 度"。

策略(policy)pi(a|s):一张"看到 s 我会怎么动 a"的概率表。

折扣因子(discount factor)gamma:0 到 1 之间的数字,控制"未来的权重"。gamma=0.99 意味着 100 步后的事还值关注;gamma=0.9 则只管当前 10 步。

论文做了什么

论文首先引入一个关键的数学工具——Proposition 3.1(来自 Syed et al. 2008):占用度量 rho 和策略 pi 之间存在一一对应关系。给定任何合法的占用度量 rho,都能唯一恢复出策略 pi_rho(a|s) = rho(s,a) / sum_{a'} rho(s, a');反过来,每个策略也唯一对应一个占用度量。

这一步的意义是什么?它意味着优化"策略空间"和优化"占用度量空间"是等价的。策略空间不是凸的(很难做全局优化),但占用度量空间是凸的(因为定义它的约束都是线性不等式)。凸=好算,这为后面的推导铺平了路。

然后论文给出了核心理论结果——Proposition 3.2:

RL(IRL_psi(pi_E)) = argmin_{pi} -H(pi) + psi^*(rho_pi - rho_{pi_E})

人话翻译:先做 IRL 恢复代价函数、再做 RL 提取策略——这一整套两步走的输出——等价于直接找一个策略,让它的占用度量 rho_pi 和专家的 rho_{pi_E} 之间的距离(由正则项 psi 的共轭 psi^ 来度量)最小,同时保持策略的熵 H(pi) 不要太低。*

共轭函数(convex conjugate)psi^: 给定凸函数 psi(c),它的共轭 psi^(x) = sup_c [x^T c - psi(c)]。直觉上,共轭函数把"正则项"翻译成"距离度量"。正则 psi 约束代价函数不能太极端,对应的 psi^* 就是用来量两个分布差距的"尺子"。

熵 H(pi):策略的"随机性程度"。H 高意味着动作选择多样(探索空间大);H 低意味着动作几乎确定(集中在某个选择上)。目标函数里保留 -H(pi) 是为了防止策略过早塌缩成一个确定性选择。

为什么这步有用

这一步是整篇论文的理论地基。它告诉我们一个深刻的事实:IRL 看似在找代价函数,实际等价于在找一个策略,让它的占用度量贴近专家的占用度量。换句话说,IRL 兜了一大圈,本质就在做一件事——让两个分布对齐。既然如此,为什么不直接做分布对齐,跳过中间那个代价函数呢?

论文还证了一个特殊情形(Corollary 3.2.1):如果正则项 psi 是常数(即完全不约束代价函数),则 IRL + RL 得到的策略精确匹配专家的占用度量。这说明"分布匹配"不是近似,是精确等价。

关键公式拆解

原文 Proposition 3.2:RL o IRL_psi(pi_E) = argmin_pi -H(pi) + psi^*(rho_pi - rho_{pi_E})

逐项翻译:

  • RL o IRL_psi(pi_E):先在专家 pi_E 上做 psi-正则化的 IRL 恢复代价函数 c,再基于 c 做 RL 提取策略——整个管道的输出。
  • argmin_pi:在所有策略中找一个最好的。
  • -H(pi):"减去策略的熵"——等价于"让策略不要太死板"的软约束。
  • psi^*(rho_pi - rho_{pi_E}):"我和专家的占用度量之间的距离"——距离尺子由 psi^* 决定。

证明思路(Appendix A.1):利用 saddle point 定理。IRL 找的代价函数是一个 max-min 问题的 max 坐标;RL 在 IRL 输出上训练得到的策略是 min 坐标。minimax = maximin(因为目标关于 rho 凸、关于 c 凹),所以两步走等价于直接找 min_pi 的那个优化问题。

所以这一节是想说:作者先证明"模仿专家"=="匹配占用度量",把绕弯路变成了直奔主题。后面所有算法设计都站在这个等价性上。


第二步:选择"距离尺子"——从学徒学习到 Jensen-Shannon 散度

类比

两瓶饮料怎么比"像不像"?可以闻味道(粗糙但快)、可以化验成分比例(精确但贵)、可以测密度(便宜但信息少)。换不同的"测法"会得到不同的"距离值"。

GAIL 也要在第一步建立的框架里选一种具体的"测法"——即选择正则项 psi 的具体形式——来量"我的占用度量和专家的占用度量"差多少。不同的 psi 对应不同的模仿学习算法。

论文做了什么

论文先展示了旧方法是怎么选 psi 的:

**学徒学习(Apprenticeship Learning)**对应 psi = delta_C(indicator function),即强制代价函数必须落在一个预设的线性子空间 C 内。具体来说:

  • Abbeel & Ng (2004) 的 FEM(Feature Expectation Matching)用 C_linear = {sum_i w_i f_i : ||w||_2 <= 1},对应的距离是"特征期望的 L2 范数"。
  • Syed & Schapire (2007) 的 GTAL 用 C_convex = {sum_i w_i f_i : sum_i w_i = 1, w_i >= 0},对应的距离是"最差特征上的差距"。

这些方法的优点:能配合策略梯度(TRPO)在高维环境中跑起来——Ho et al. (2016b) 已经证明了这一点。

这些方法的致命缺点:代价函数被限制在 d 个手工特征张成的线性子空间内。如果真实的专家代价函数不在这个子空间里,就永远没法精确模仿。就像你硬要用"酸、甜、苦"三个维度去描述一杯精品咖啡的风味——少了"花香"、"坚果"、"焦糖"这些维度,你的描述永远不准确。

论文然后提出新的选择——psi_GA(公式 13):

psi_GA(c) = E_{pi_E}[g(c(s,a))]  如果 c < 0 处处成立
           = +inf               否则

其中 g(x) = -x - log(1 - e^x)   如果 x < 0
           = +inf               否则

正则项 psi_GA 的直觉:它要求代价函数 c(s,a) 处处为负("每个状态-动作组合都有某种程度的'坏'"),并且对那些给专家状态-动作对赋予"接近零的代价"(即几乎不罚专家)的代价函数施加重罚。效果是:允许任意形状的代价函数,同时保证专家被赋予低代价。

关键数学结果

论文证明(Corollary A.1.1)psi_GA 的共轭恰好是:

psi_GA^*(rho_pi - rho_{pi_E}) = max_{D in (0,1)^{S x A}} E_pi[log D(s,a)] + E_{pi_E}[log(1 - D(s,a))]

人话:psi_GA 对应的"距离尺子"恰好是"一个最优二分类器能多好地区分 pi 和 pi_E 的状态-动作对"——这就是 GAN 论文里鉴别器的最优目标函数!

Jensen-Shannon 散度(JS divergence):D_JS(P||Q) = (1/2) D_KL(P||(P+Q)/2) + (1/2) D_KL(Q||(P+Q)/2)。它是对称的、有界的(0 到 log 2),且上述鉴别器最优目标函数恰好等于 2D_JS - 2log2。

为什么不用 KL 散度:KL 散度不对称且无界——当 P 的支撑和 Q 不重合时 KL 为无穷大,对抗训练容易爆炸。JS 散度对称、有界,而且恰好对应 GAN 鉴别器的训练目标,所以是天然的选择。

将 psi_GA^* 代入 Proposition 3.2 的框架,最终得到 GAIL 的优化目标(公式 15):

min_pi  D_JS(rho_pi, rho_{pi_E}) - lambda * H(pi)

人话:"找一个策略 pi,让它的占用度量和专家的占用度量之间的 JS 散度最小,同时保持一定的策略熵(防止策略塌缩)。"

为什么这步有用

  • 选 JS 散度不是巧合:GAN 论文(Goodfellow 2014)已经证明 GAN 鉴别器训到极致时,等价于在测 JS 散度。所以一旦选了 JS,和 GAN 的连接就立起来了——可以照搬 GAN 的训练流程。
  • 旧的学徒学习用"线性特征"刻出来的代价函数表达力有限;新正则项 psi_GA 允许任意复杂的鉴别器(神经网络),表达力一下子拉满。
  • psi_GA 有一个关键优势:它是数据自适应的——因为 psi_GA 本身定义中包含对专家数据的期望 E_{pi_E},所以它能根据不同的专家数据集自动调节约束强度。旧的 indicator regularizer delta_C 是固定的,完全不看数据。

所以这一节是想说:作者挑了 JS 散度作为"距离尺子",因为它正好打通了 GAN 的训练机器,同时表达力远超旧方法的线性约束。


第三步:GAN 化的对抗训练——Algorithm 1 详解

类比

教练让两个学生对抗:

  • A(鉴别器 D):努力分辨"这段录像是大厨拍的,还是学徒拍的"。看完后给 0-1 之间一个分数:1 代表"我笃定是学徒",0 代表"我笃定是大厨"。
  • B(学徒 pi,也就是策略):努力让自己的录像被 A 误认成"大厨拍的"。

两人轮流升级:A 越敏锐,B 就要更像大厨;B 越像大厨,A 又要练出更刁钻的眼力。最后达到平衡时,A 已经分不清了——这意味着 B 的行为分布和大厨几乎一样

算法的完整流程(Algorithm 1)

论文要找一个鞍点 (pi, D),使得下面这个表达式关于 D 最大、关于 pi 最小:

E_pi[log D(s,a)] + E_{pi_E}[log(1 - D(s,a))] - lambda * H(pi)    (公式 16)

具体做法是交替更新:

输入:专家轨迹 tau_E(从 pi_E 采样)、初始策略参数 theta_0、初始鉴别器参数 w_0。

循环(i = 0, 1, 2, ...)

  1. 采样:让当前策略 pi_{theta_i} 在环境里跑一批轨迹 tau_i。

  2. 更新鉴别器(梯度上升):用 Adam 优化器对 w 做一步梯度上升,梯度为:

    E_hat_{tau_i}[nabla_w log D_w(s,a)] + E_hat_{tau_E}[nabla_w log(1 - D_w(s,a))]   (公式 17)
    

    直觉:让 D 在学徒数据上输出接近 1("这是学徒的"),在专家数据上输出接近 0("这是专家的")。就是标准的二分类交叉熵损失的梯度。

  3. 更新策略(TRPO 步):把 log D_{w_{i+1}}(s,a) 当成"代价函数",用 TRPO 做一步策略更新。具体的策略梯度为:

    E_hat_{tau_i}[nabla_theta log pi_theta(a|s) * Q(s,a)] - lambda * nabla_theta H(pi_theta)   (公式 18)
    其中 Q(s_bar, a_bar) = E_hat_{tau_i}[log D_{w_{i+1}}(s,a) | s_0 = s_bar, a_0 = a_bar]
    

    直觉:Q(s,a) 是"从 (s,a) 出发,后续轨迹里鉴别器平均给了多高的'学徒分数'"。策略朝着"降低这个分数"的方向走——就是朝着"让鉴别器觉得我像专家"的方向走。

  4. 回到第 1 步。

TRPO(Trust Region Policy Optimization):一种"小步慢走"式的 RL 优化器。每次更新策略时,约束新旧策略之间的 KL 散度不超过某个阈值 delta。防止梯度估计噪声太大时策略突然跑偏。在 GAIL 中,TRPO 保证了策略不会因为鉴别器一次大的更新而"过度反应"。

Q 函数 Q(s,a):从状态 s 执行动作 a 后,按照当前策略继续走下去的"累积代价"。在 GAIL 中,代价是 log D(s,a),所以 Q 衡量的是"从这里开始,我有多'容易被识破是学徒'"。

策略梯度(policy gradient):用蒙特卡洛采样来估计"如果我在某个状态稍微改变动作选择概率,总代价会怎么变"。形式为 E[nabla log pi(a|s) * Q(s,a)]。这是 REINFORCE 算法的基础形式。

鉴别器 = 动态代价函数

一个重要的视角:鉴别器 D_w 可以被解读为一个实时更新的代价函数。具体来说,c(s,a) = log D_w(s,a) 就是 GAIL 的"等效代价"。这个代价的特别之处在于:

  • 它不是预先指定的(不同于传统 RL 的手写奖励)。
  • 它不是从 IRL 一次性恢复的(不同于 MaxEnt IRL)。
  • 它是和策略一起共同演化的——策略变了,鉴别器也跟着调整对"什么才算学徒行为"的判断,进而给出新的代价信号。

这种动态代价的好处是课程自适应(curriculum-adaptive):训练初期,策略很差,鉴别器轻松就能分辨,给出的代价信号很明确("你哪哪都不像专家");训练后期,策略已经很好了,鉴别器必须关注细微差异才能分辨,给出的代价信号也变得精细("你在某些罕见状态下的动作还不够像")。这类似 Ch16 提到的 reward shaping 的效果,但是完全自动的。

熵正则的梯度

论文附录 A.2(Lemma A.1)推导了策略熵 H(pi_theta) 的梯度:

nabla_theta H(pi_theta) = E_{pi_theta}[nabla_theta log pi_theta(a|s) * Q_log(s,a)]
其中 Q_log(s,a) = E_{pi_theta}[-log pi_theta(a|s) | s_0 = s, a_0 = a]

人话:熵正则的梯度也可以写成策略梯度的形式——把"代价"替换成 -log pi_theta(a|s)(即"动作本身有多意外")。这意味着实现时不需要特殊处理熵项——只要在 Q 值里加上这个额外的"意外度"代价即可。

和 GAN 的精确对应关系

GAN (Goodfellow 2014) GAIL (Ho & Ermon 2016)
生成器 G 造图片 策略 pi 造轨迹
鉴别器 D 辨真假图 鉴别器 D 辨专家/学徒
真实数据分布 p_data 专家占用度量 rho_{pi_E}
生成分布 p_G 策略占用度量 rho_pi
D 对 G 反向传播 不能直接反向传播——策略到轨迹要经过环境动力学
G 的更新用梯度下降 pi 的更新用 TRPO(策略梯度 + 信任区域)
最优解 = p_G = p_data 最优解 = rho_pi = rho_{pi_E}

唯一关键差异:GAN 里生成器可以直接对鉴别器反向传播梯度;GAIL 里策略产生的动作要在环境里"实际跑"才能拿到反馈,中间隔着环境动力学 P(s'|s,a),没法直接反向传播。所以必须用策略梯度(即蒙特卡洛采样 + REINFORCE)来桥接——这就是为什么 GAIL 需要 TRPO 而不是简单的 SGD。

收敛性分析

论文没有给出严格的收敛证明(这在 GAN 文献中也是公认难题),但依赖了以下保障:

  • TRPO 的信任区域约束限制了策略每步变化幅度,避免了 GAN 训练中常见的"模式崩塌"。
  • Adam 优化器对鉴别器做小步更新,避免了"鉴别器过强导致梯度消失"。
  • 实验中观察到训练过程稳定收敛。

计算复杂度

每次迭代的主要成本:

  • 在环境中采样 N 个 state-action pairs(论文用 N=5000 到 50000)。
  • 对鉴别器做一步 Adam 更新:O(N * |w|),其中 |w| 是鉴别器参数量。
  • 对策略做一步 TRPO 更新:需要计算 Fisher 信息矩阵和共轭梯度,大约 O(N * |theta|^2) 或更快的近似。
  • 总迭代数:300-1500 次。

所以这一节是想说:把策略和鉴别器架成 GAN 那种对抗结构,让"模仿专家"变成"骗过鉴别器"。鉴别器充当实时更新的代价函数,策略用 TRPO 追着这个动态代价跑。


第四步:从学徒学习到 GAIL 的渐变——为什么旧方法是 GAIL 的特殊情况

论文做了什么

论文 Section 4 展示了一个优美的统一视角:学徒学习(FEM / GTAL)和 GAIL 都是 Proposition 3.2 的特殊实例,只是 psi 的选择不同。

方法 正则项 psi 对应距离 psi^* 代价函数表达力
FEM delta_{C_linear} 特征期望的 L2 距离 d 个线性特征
GTAL delta_{C_convex} 最差特征差距 d 个线性特征
GAIL psi_GA JS 散度 任意神经网络

学徒学习的策略梯度公式(公式 12):

nabla_theta max_{c in C} E_{pi_theta}[c(s,a)] - E_{pi_E}[c(s,a)]
= nabla_theta E_{pi_theta}[c*(s,a)]
= E_{pi_theta}[nabla_theta log pi_theta(a|s) * Q_{c*}(s,a)]

其中 c* 是使"策略和专家之间代价差"最大的代价函数。

重要洞察:这个公式和 GAIL 的策略梯度(公式 18)结构完全一样!唯一的区别是:

  • 学徒学习中 c* 是"在线性函数族 C 中选最优"的结果——有闭式解。
  • GAIL 中 c* = log D_w 是"训练一个神经网络鉴别器"的结果——没有闭式解但表达力无限。

这意味着 GAIL 可以复用学徒学习的整套工程基础设施(策略梯度 + TRPO),只需要把"解析计算 c*"替换成"训练一个鉴别器网络"。

为什么旧方法会失败

论文指出(Section 4 末尾):学徒学习中,如果真实的专家代价函数不在 C 里,即使策略在 C 中所有代价上都"不输专家",也不能保证策略等于专家。就像考试只考 5 道题(5 个线性特征),即使你 5 道都答对了,也不代表你真的学会了——也许你只是在这 5 道题上碰巧蒙对了。GAIL 相当于"考无穷多道题"(鉴别器可以检查任意复杂的模式),所以如果你"答对"了,那是真学会了。

所以这一节是想说:GAIL 不是凭空冒出来的新方法——它是把旧的学徒学习框架中"有限表达力的线性代价"升级为"无限表达力的神经网络代价",统一在同一个理论框架下。


第五步:工程细节——让算法真正跑起来

网络架构

  • 策略网络 pi_theta:2 层全连接网络,每层 100 个隐藏单元,激活函数 tanh。输入是状态 s(维度 2 到 376),输出是动作分布的参数(高斯分布的均值和对角协方差)。
  • 鉴别器网络 D_w:同样的架构(2 层 100 单元 tanh),输入 (s, a) 拼接,输出 sigmoid 到 (0,1)。

训练超参数

  • 策略优化器:TRPO,KL 约束 delta 未明确给出(沿用 Schulman et al. 2015 的默认值)。
  • 鉴别器优化器:Adam(Kingma & Ba 2014)。
  • 方差缩减:训练了价值函数(同样 2 层 100 单元 tanh)+ Generalized Advantage Estimation(GAE,gamma=0.995, lambda=0.97)。
  • 每轮采样量:5000-50000 个 state-action pairs(随任务复杂度变化)。
  • 总迭代数:300-1500 轮。

实现备注

论文没有明确提到的但后续复现工作发现的关键细节:

  • 鉴别器不能训练太多步(否则"太强"导致梯度消失)——通常每轮只做 1 步 Adam 更新。
  • 策略和专家的轨迹在送入鉴别器时需要打乱顺序(否则鉴别器可能利用时间位置信息"作弊")。
  • 熵正则 lambda 通常设为 0(论文只在 Reacher 任务上观察到非零 lambda 有帮助)。

所以这一节是想说:工程上 GAIL 的实现出人意料地简单——两个小网络交替训练,关键是控制好鉴别器不要太强、策略更新不要太大。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【GAIL vs 行为克隆 · 样本效率对比】

   专家示范 D ──► 行为克隆 BC ──► 分布偏移 → 成功率崩溃
        │
        └──► GAIL: pi + D 对抗 ──► 学分布匹配 → 少样本接近专家
                    │
                    ▼
            MuJoCo 连续控制:GAIL 显著优于 BC(同示范量)

Generative Adversarial Imitation Learning — 方法示意:核心 pipeline
Plate Nº IIIGenerative Adversarial Imitation Learning — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"哪条设计选择真的有效"。

主结果表

任务 维度 (obs/act) 专家数据量 GAIL BC FEM GTAL
Humanoid 376/17 80 traj 10200 1397 5093 5096
Humanoid 376/17 160 traj 10119 3655 5120 5412
HalfCheetah 17/6 25 traj 4840 3718 502 869
Hopper 11/3 4 traj 3614 50 3571 3065
Walker 17/6 11 traj 6850 5946 4723 6139
Ant 111/8 25 traj 4132 3235 -5122 -3271

(负分表示比随机策略还差。专家分数:Humanoid 9575, HalfCheetah 4463, Hopper 3571, Walker 6717, Ant 4228)

关键发现

发现 数字 意义
极少专家数据即可 Hopper 4 条 = 200 个 (s,a) 即达专家水平 GAIL 对专家数据效率极高
高维任务首次跑通 Humanoid 376D 达到 106% 专家分 证明对抗式 IL 可以处理超高维
线性方法在复杂任务崩盘 FEM 在 Ant 上 -5148(比随机还差) 线性代价函数表达力不足
环境交互不省 交互量 ≈ 训 TRPO 专家本身 GAIL 省的是专家数据,不是仿真
简单架构即可 2 层 100 单元 tanh 性能源于方法论不是模型大小
熵正则有时有帮助 Reacher 上 lambda=10^{-3} 显著改善 低维任务探索不够时需要

环境交互预算

任务 迭代数 每轮采样 总交互
Cartpole 300 5000 1.5M
HalfCheetah 500 50000 25M
Humanoid 1500 50000 75M

所以这一节是想说:数据告诉我们 GAIL 在高维任务上把所有对手按在地上摩擦,但代价是仿真交互很贵——它省的是"看专家做几次",不是"自己练几次"。


实验结果说明了什么

论文的实验回答了三个核心问题:

问题 1:对抗式学习信号在高维连续控制中可行吗?

可行。Humanoid(376 维状态、17 维动作)上 GAIL 达到甚至超越专家水平,而之前从没有模仿学习方法在这个量级的任务上跑通过。这一结果的意义超越了算法本身——它为整个"对抗式模仿学习"方向打开了大门。

问题 2:对比行为克隆,GAIL 的专家数据效率如何?

差距巨大。在 Hopper 上,4 条轨迹(约 200 个样本点)就让 GAIL 达到专家水平;行为克隆只拿到 50 分(专家 3571 分)——几乎什么都没学到。原因很直观:行为克隆需要专家数据覆盖整个状态空间;GAIL 只需要专家数据提供"什么叫像专家"的信号,然后自己通过探索补充其余状态的行为。

问题 3:线性代价函数为什么在复杂任务上崩盘?

FEM 和 GTAL 在 Ant 上得到负分——比完全随机的策略还差。这说明当真实的"什么叫好行为"无法用几个手工特征的线性组合来描述时,线性学徒学习会学到完全错误的策略。GAIL 的神经网络鉴别器没有这个限制,因此能正确捕捉高维行为的复杂模式。

附加发现:熵正则在 Reacher 上的作用

Reacher 是一个低维但需要精确控制的任务。论文发现 lambda=10^{-3} 时性能显著好于 lambda=0(通过 Wilcoxon 检验 p=0.05 确认)。解释:Reacher 的动作空间小、探索需求高——如果不加熵正则,策略容易过早收敛到一个局部最优。

所以这一节是想说:实验证明了 GAIL 的三个核心卖点——高维可行、数据高效、不需要手工特征——同时暴露了环境交互成本高的短板。


你应该懂的几个新词

模仿学习(Imitation Learning, IL):让 AI 看着专家示范学会做事的整套范式。GAIL 是其中一种。

行为克隆(Behavioral Cloning, BC):最朴素的 IL。把 (状态, 动作) 当监督学习样本。简单但脆。Ch14 详细讲了它的分布偏移问题。

逆强化学习(Inverse Reinforcement Learning, IRL):先反推专家心里的奖励函数,再用 RL 学策略。两步走,慢。

占用度量(occupancy measure):策略在状态-动作空间上的折扣频率分布。模仿专家=匹配占用度量。是 GAIL 理论的核心概念。

奖励 / 代价函数(reward / cost function):评价"在这个状态做这个动作有多好/多差"的数字函数。RL 的核心。GAIL 里用的是"代价"(cost)——值越大越坏(和 reward 方向相反)。

GAN(Generative Adversarial Network):Goodfellow 2014 提出的对抗式生成模型。一个生成器、一个鉴别器,互相博弈。GAIL 是它在 RL/IL 领域的化身。

鉴别器(discriminator):二分类网络,分辨"专家 vs 学徒"的 (s,a) 对。在 GAIL 中给策略提供学习信号,相当于"实时打分老师"。等效于动态代价函数 c(s,a) = log D(s,a)。

JS 散度(Jensen-Shannon divergence):测两个分布有多不一样的对称指标。最小化 JS 散度 = 让两个分布几乎重合。有界(0 到 log 2),比 KL 散度更适合对抗训练。

TRPO(Trust Region Policy Optimization):一种"小步慢走"式的 RL 优化器。每次只让策略变一点点(约束 KL 散度),防止训练飞掉。GAIL 用它来更新策略。Ch16 有更详细的介绍。

熵 / 熵正则(entropy / entropy regularization):策略的"随机性程度"。在目标里加上 lambda*H(pi) 鼓励策略不要过早收敛到死板单选。

复合误差(compounding error):行为克隆的老毛病——预测有偏差 -> 进入没见过的状态 -> 再次偏差 -> 雪球越滚越大。误差随时间步 T 呈二次增长。

学徒学习(Apprenticeship Learning):IRL 简化版,把代价限制成几个手工特征的线性组合。能跑大任务但表达力差,在复杂任务上崩盘。

共轭函数(convex conjugate / Fenchel conjugate):凸分析中把"约束"翻译成"距离"的工具。psi^(x) = sup_c [x^T c - psi(c)]。正则项 psi 的共轭 psi^ 决定了 GAIL 用什么"尺子"量分布差距。

鞍点(saddle point):minimax 问题的解。在 GAIL 中,(pi*, D*) 是鞍点——D* 关于 D 最大,pi* 关于 pi 最小。

所以这一节是想说:上面这些词以后看 RL/IL 论文会反复见,先把它们和"教徒弟做菜"这套类比挂钩。


它有什么搞不定的

GAIL 不是万能的,论文自己也老实交代了几个翻车场景,加上后续社区发现的问题:

  1. 环境交互巨贵:算法本身省的是专家数据,但训练时机器人要在仿真器里跑很多次(Humanoid 需要 7500 万次仿真步,和"从零训 TRPO 专家"差不多)。所以真机器人上跑是危险且烧钱的——后续工作(AIRL、SQIL、Off-policy GAIL)都在想办法降低这个成本。

  2. 训练时不能问专家:和 IRL 一样,GAIL 训练时不能问专家"我现在该怎么动"——只能靠自己探索。如果允许专家在线指点(比如 DAgger),效率会高很多。但在很多实际场景下(远程操控贵、专家不可用),这个限制反而是优势。

  3. 对抗训练本身不稳:GAN 圈的老问题——鉴别器太强导致梯度消失、太弱导致学习信号无意义。GAIL 继承了这个毛病。虽然 TRPO + Adam 的组合在实验中够用,但调超参(学习率、每轮更新步数比例)仍然需要经验。

  4. 没有显式的奖励函数输出:训完模型后,你没法把"学到的奖励"导出来给别的任务用。鉴别器和策略是绑定的——换一个新环境或新任务,鉴别器就失效了。这是和经典 IRL 的本质差异。后续 AIRL(Fu et al. 2018)专门解决了这个问题。

  5. 专家数据质量敏感:如果专家轨迹本身包含次优行为或噪声,鉴别器会把这些噪声也当作"专家特征"去模仿。没有机制过滤"专家也犯错"的情况。

  6. 多模态行为难以捕捉:如果专家面对同一状态可能采取多种不同的好策略(例如走路时左绕或右绕都行),GAIL 的高斯策略可能只学到其中一种或折中的平均行为。后续 InfoGAIL 尝试解决这个问题。

  7. 缺乏理论收敛保证:论文没有证明 Algorithm 1 一定收敛到全局最优。这在 GAN 文献中也是普遍缺失的——只有在某些简化假设下才有局部收敛的保证。

所以这一节是想说:GAIL 在仿真交互成本、训练稳定性、可迁移性、多模态处理上都有硬伤,需要后续工作来补。但这些硬伤没有阻止它成为 2016-2020 年 IL 领域最有影响力的方法。


它和别的几篇是什么关系

  • 时间线:GAN (2014) -> MaxEnt IRL (Ziebart 2008, 理论基石) -> GAIL (2016) -> AIRL / GAIfO / SQIL (2018-2019) -> Diffusion Policy (2023, 非对抗 IL) -> OpenVLA (2024, 基础模型时代) -> Cosmos-Policy (2025)。

  • 集合关系:把"模仿学习"想成一个大集合 IL。这个集合分两支:BC 派(直接监督学动作,Ch14 详解)和 IRL 派(先学奖励再 RL,Ch16 涉及)。GAIL 开创了第三条路:对抗式直接学策略。这条路后来又分裂出 AIRL(加了可迁移的奖励输出)、GAIfO(只需要状态观测不需要动作标注)、SQIL(用固定奖励替代对抗训练)等亲戚。

  • 因果关系

    • GAN 出现 导致 GAIL 这种思路成为可能——没有 GAN 就没人想到用鉴别器替代代价函数。
    • MaxEnt IRL 提供理论地基——没有"IRL = 占用度量匹配"这个等价性证明,GAIL 的推导无从开始。
    • GAIL 出现 导致 后续机器人界对模仿学习信心大增,连 OpenVLA、Cosmos-Policy 这类基础模型时代的具身 AI 也大量用 IL 数据。
  • 对比关系

    • 和 DAgger (Ch14) 比:DAgger 需要专家在线,GAIL 不需要。DAgger 不需要环境交互(只做监督学习),GAIL 需要大量环境交互。两者互补。
    • 和 Diffusion Policy (Ch13) 比:Diffusion Policy 也是模仿学习路线,但是用扩散模型直接生成动作分布,不需要对抗鉴别器也不需要环境交互——是 GAIL 的"非对抗、纯离线"后继。
    • 和 OpenVLA 比:OpenVLA 用 token 化 + 大模型微调来做 IL,规模上和 GAIL 完全两个时代。但底层都是"看着专家轨迹学策略"。
    • 和 PPO/SAC (Ch16) 比:PPO/SAC 需要手写奖励函数,GAIL 不需要——GAIL 用鉴别器自动生成奖励。但 GAIL 的策略更新步本身就可以用 PPO 替代 TRPO(后续很多实现这么做)。

所以这一节是想说:GAIL 是模仿学习里"对抗派"的祖宗,上承 GAN + MaxEnt IRL 的理论,下启 AIRL/SQIL/现代具身 AI 的实践。


和本导读的关系

在本导读系列中,GAIL 处于一个承上启下的关键位置:

  • **Ch14(模仿学习)**详细讲了 BC 的复合误差和 DAgger 的在线纠正方案。GAIL 提供了第三条路——既不需要海量专家数据(BC 的要求),也不需要专家在线(DAgger 的要求),代价是需要环境交互。Ch14 中提到"IRL 的具体算法推导"被标注为"不要求"的内容——GAIL 正是把 IRL 的理论简化为一个可执行的算法,让你不需要理解完整的 IRL 推导就能用起来。

  • **Ch16(RL 基础)**讲了 PPO、SAC 等策略优化器。GAIL 的策略更新步直接使用 TRPO(PPO 的前身),鉴别器提供的 log D(s,a) 充当 Ch16 中"代价函数 / 奖励函数"的角色。理解了 Ch16 的策略梯度和 Actor-Critic 之后,GAIL 的 Algorithm 1 就变得非常自然——它本质上就是一个 Actor-Critic,只不过 Critic 被替换成了鉴别器。

  • 对后续章节的影响:GAIL 引入的"对抗式模仿"范式,影响了后来的 sim-to-real(Ch17,用鉴别器对齐仿真和真实的分布差异)、世界模型训练(Ch15,一些工作用对抗损失来保证世界模型的轨迹分布和真实分布一致)等方向。

所以这一节是想说:GAIL 连接了 Ch14 的模仿学习问题定义和 Ch16 的 RL 优化工具箱,为后续 Ch17 sim-to-real 中的分布对齐思路提供了范式。


思考题

  1. GAN-模仿连接:如果把 GAIL 的鉴别器完全去掉,只用占用度量匹配作为目标(Corollary 3.2.1 的设定),为什么在大环境中不可行?
提示 想一想:专家只提供了有限条轨迹。如果状态空间有百万个点,大部分点上专家的占用度量是 0。精确匹配 = 你也必须永远不去那些点。这和"用有限数据泛化到新状态"的目标矛盾了。Corollary 3.2.1 假设可以精确计算所有点的占用度量,实际中做不到。
  1. 鉴别器即奖励:在 GAIL 中,为什么说 c(s,a) = log D(s,a) 是一个好的"等效代价函数"?如果换成 c(s,a) = D(s,a)(不取 log)会怎样?
提示 log D(s,a) 的梯度在 D 接近 0 或 1 时不会消失得太快——它是 GAN 论文里被证明最优的形式,对应 JS 散度。如果用 D(s,a) 不取 log,当策略已经很好(D 接近 0.5)时梯度非常小,学习会停滞;当策略很差(D 接近 1)时梯度也饱和。Log 形式提供了更均匀的梯度信号。
  1. 为什么 GAIL 比 IRL 快:传统 MaxEnt IRL 在内层需要跑完整的 RL 来找最优策略;GAIL 每轮只做一步策略更新。为什么"一步"就够了?
提示 因为 GAIL 把 IRL 的 max-min 双层优化"展平"成了交替单步更新。鉴别器做一步、策略做一步——类似 GAN 的训练。虽然每一步都不是最优的,但多轮交替后会收敛到鞍点。关键是 TRPO 的信任区域约束保证了每步不会跑偏太远,所以不需要内层收敛。
  1. 策略梯度的桥接作用:GAN 里生成器可以直接对鉴别器反向传播;GAIL 为什么不能?策略梯度(REINFORCE)在这里扮演什么角色?
提示 因为策略输出动作 a 后,要经过环境动力学 P(s'|s,a) 才产生下一个状态。环境动力学通常是黑盒(不可微的物理仿真),没法对它求导。策略梯度用蒙特卡洛采样绕过了这个问题:不需要知道环境的导数,只需要知道"走完一条轨迹后总代价是多少"。REINFORCE 用 nabla log pi(a|s) * Q(s,a) 来估计梯度方向。
  1. FEM/GTAL 在 Ant 上为什么比随机还差:线性代价函数在 Ant 上产生了负分(比完全不学还差)。这种"学了反而更差"的现象背后是什么机制?
提示 当代价函数类 C 太小、不包含真正描述专家行为的代价函数时,策略会去优化一个"错误的目标"。这个错误目标可能和真实目标方向相反——就像你根据"谁走得远就好"的线性标准去训练,但实际上专家是在"维持平衡同时前进"。一味追求走远可能导致策略学会猛冲然后摔倒,得分反而比站着不动还低。
  1. 占用度量的一一对应:Proposition 3.1 说策略和占用度量一一对应。如果两个不同的策略恰好产生相同的状态访问分布,它们的占用度量一定不同吗?
提示 是的。占用度量 rho(s,a) 包含了动作维度——即使两个策略访问相同的状态分布,只要在某个状态上它们选择不同的动作分布,rho(s,a) 就不同。一一对应的证明依赖于 pi(a|s) = rho(s,a) / sum_{a'} rho(s,a') 这个恢复公式——不同的 rho 恢复出不同的 pi。
  1. 熵正则的双重作用:目标函数里的 lambda*H(pi) 除了"防止策略塌缩"之外,还有什么数学上的好处?
提示 熵正则使得目标函数关于 rho 严格凸(Lemma 3.1 证明了 -H_bar 是严格凸的)。严格凸意味着最优解唯一——这是 Proposition 3.2 证明中"从对偶最优唯一恢复原问题最优"的关键条件。如果没有熵正则,可能存在多个同样好的策略,理论保证就弱了。

所以这一节是想说:能回答这 7 个问题,说明你真的理解了 GAIL 从理论到实践的完整链条。


一些好奇心问答(FAQ)

Q1:GAIL 和 GAN 的对应关系到底有多紧?

非常紧。GAN 里:生成器造图、鉴别器辨真假;GAIL 里:策略造轨迹、鉴别器辨"专家 vs 学徒"。唯一的结构性差异是:GAN 里生成器可以直接对鉴别器反向传播(因为生成过程可微);GAIL 里策略产生的动作要在环境里"实际跑"才能拿到反馈(环境动力学不可微)。所以中间得用策略梯度(TRPO/PPO)来桥接。数学上,两者的目标函数形式完全一样——都是 min_G max_D 的鞍点问题。

Q2:为什么不直接用 KL 散度?非要 JS?

三个原因。第一,KL 散度不对称(D_KL(P||Q) 不等于 D_KL(Q||P)),选哪个方向都有偏;JS 对称。第二,KL 无界——当 P 和 Q 的支撑不完全重合时 KL 为无穷大,对抗训练容易爆炸;JS 有界(0 到 log 2)。第三,也是最关键的:GAN 论文已经证明了"鉴别器训到最优时,生成器的目标恰好是 JS 散度"——选 JS 就能直接复用 GAN 的训练框架,不需要额外推导。

Q3:GAIL 要不要真实奖励?

不要。这是它的核心卖点——只要专家轨迹,不要任何标量奖励信号。但训练时要能在环境里跑(仿真器或真机)。这和 Ch16 讲的 PPO/SAC 形成互补:PPO/SAC 需要奖励但不需要专家数据;GAIL 需要专家数据但不需要奖励。

Q4:要多少专家数据?

少得惊人。论文显示 Hopper 任务上 4 条轨迹(每条约 50 步 = 200 个 (s, a) 对)就能学到超越专家的水平。Humanoid 用 80 条。对比行为克隆在 Humanoid 上需要 240 条才达到 5660 分(GAIL 80 条就达到 10200 分)。

Q5:训练能跑多久?

每个任务 300-1500 次迭代,每次约 5000-50000 个环境交互。Humanoid 最贵:1500 次 x 50000 步 = 7500 万次仿真。在 2016 年的硬件上要好几天——都是 CPU 上跑的物理仿真。2026 年用 Isaac Sim 这类 GPU 加速仿真器会快几个数量级。

Q6:能不能用 GAIL 训真机器人?

理论上可以,但实践中仿真交互成本是大问题——真机器人不能像仿真那样疯跑几千万步。后续工作的解决路线:用 BC 预训练初始化策略(减少 GAIL 从零探索的需求)、改成 off-policy(复用旧数据)、或者在仿真中训完再 sim-to-real 迁移(Ch17 的主题)。

Q7:鉴别器太强了会怎样?

策略学不到东西,因为 log D(s,a) 接近 0(D 几乎确信这是学徒的行为),梯度饱和。这是 GAN 通病——"鉴别器赢太多轮后生成器放弃挣扎"。论文里靠 TRPO 的小步约束 + 每轮只更新鉴别器一步来缓解。后续 Wasserstein GAIL 等工作用梯度惩罚进一步稳定训练。

Q8:和 DAgger 比有啥区别?

DAgger(Ch14 详解)也是解决 BC 的复合误差问题,但要求专家在线提供反馈——学徒走到一个新状态,就问专家"你会怎么动",把答案补进训练集。GAIL 不需要这种在线访问,只要一份预先录好的专家轨迹。代价是 GAIL 需要环境交互(DAgger 不需要仿真器)。

Q9:GAIL 能否用于离散动作空间?

论文的理论适用于有限离散空间(Section 3 的推导就在有限 S、A 上进行),实验则主要在连续控制上。原则上 GAIL 可以用于离散动作(比如游戏 AI),只需要把策略分布从高斯换成 categorical,TRPO 换成适合离散动作的版本。

Q10:为什么 GAIL 在 Humanoid 上甚至超过了专家?

可能的解释:专家策略本身是用 TRPO+真实奖励训练的,不一定达到了全局最优。GAIL 在 JS 散度意义下匹配专家分布时,加上了熵正则,可能在某些方面"平滑"了专家的次优选择,加上统计波动,导致评估时得分略高。这也说明"匹配分布"不完全等于"复制行为"——它可能在边缘上有创造性的超越。

所以这一节是想说:GAIL 的关键定位——只要离线专家数据 + 仿真器,不要在线访问专家,不要真实奖励。它和 BC、DAgger、RL 各自互补,不是替代关系。


如果你想再深入

按"前传 -> 同期 -> 续作 -> 衍生"四类排序:

  1. 前传:GAN(Goodfellow et al. 2014) — 必读。理解了 GAN 的对抗训练,再看 GAIL 就豁然开朗。论文:arxiv 1406.2661
  2. 前传:Maximum Entropy IRL(Ziebart et al. 2008) — GAIL 的理论起点。讲清楚"为什么 IRL 等价于分布匹配"的最早工作。
  3. 同期:Ho et al. (2016b) Model-free Imitation Learning with Policy Optimization — 同一作者的前序工作。用 TRPO + 线性代价做学徒学习,是 GAIL 的"弱化版"。GAIL 在此基础上把线性代价升级为神经网络。
  4. 续作:AIRL(Adversarial Inverse RL, Fu et al. 2018) — GAIL 的"可迁移版"。显式恢复一个可以跨任务复用的奖励函数,弥补了 GAIL 不输出奖励的硬伤。
  5. 续作:SQIL(Soft Q Imitation Learning, Reddy et al. 2019) — GAIL 的"简化版"。把对抗训练换成"专家=奖励 1、自己=奖励 0"的固定二值奖励,效果接近但更稳定。
  6. 续作:Diffusion Policy(Chi et al. 2023) — 现代具身 AI 的模仿学习。完全不用对抗,改用扩散模型直接生成动作分布。代表"非对抗 IL"在大模型时代的崛起。Ch13 详解。
  7. 衍生:OpenVLA(Kim et al. 2024) — 把 IL 拉到基础模型尺度。底层逻辑还是"看着专家轨迹学策略",但模型大了 1000 倍、数据多了 10000 倍。
  8. 工具:TRPO(Schulman et al. 2015) — GAIL 用的策略优化器。Ch16 有深入讲解。

所以这一节是想说:把 GAN + MaxEnt IRL + GAIL + AIRL 这四篇连起来读,就能看到对抗式 IL 的完整脉络;想看现代版直接跳 Diffusion Policy 和 OpenVLA。


原文信息

@inproceedings{ho2016generative,
  title={Generative Adversarial Imitation Learning},
  author={Ho, Jonathan and Ermon, Stefano},
  booktitle={Advances in Neural Information Processing Systems (NeurIPS)},
  volume={29},
  year={2016}
}
  • 论文链接:arxiv 1606.03476
  • 代码(非官方复现):openai/imitation
  • 作者主页:Jonathan Ho (Stanford -> Google Brain,后来做了 DDPM/Diffusion 系列), Stefano Ermon (Stanford)

所以这一节是想说:这篇 2016 年的 NeurIPS 论文出自斯坦福,第一作者 Jonathan Ho 后来创造了 Diffusion Models——他的研究一直围绕"用生成模型的思路做不是图片的东西"。

引用本笔记 / Cite this note
BibTeX
@online{eai_gail_2026,
  title       = {(readable note) Generative Adversarial Imitation Learning},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2016 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/gail/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?