Dream to Control: Learning Behaviors by Latent Imagination
这是一份给"完全没接触过 AI"的读者看的精读笔记。不假设你懂强化学习,公式全部翻成人话。
一句话讲什么(TL;DR)
教 AI 在脑子里反复"做白日梦"演练动作,不用真去摔跤,就能学会跑步、翻跟头这种复杂动作。具体而言:先从少量真实经验中学一个压缩版的"脑内世界模型",然后在这个模型里想象几千条未来轨迹,用精确的数学导数告诉策略网络"刚才哪步该往哪个方向调",最终以 1/20 的真实交互量超越了所有前辈。
所以这一节是想说:这篇论文教 AI"闭着眼想一遍"就把动作练好,是 model-based RL 第一次在效率和性能上同时碾压 model-free。
这是个什么场景
想象你刚买了驾照要上路。方法 A:直接开着真车上街练,蹭一次保险杠 5000 块,撞到人就更麻烦——这是"试错"型,贵、慢、危险。方法 B:你坐在沙发上闭眼"过电影"——"这里红灯踩刹车、那个路口右转要看后视镜",脑子里走一百遍,再上车你会发现稳多了。
这种"脑内过电影"心理学里叫心象演练(mental rehearsal),钢琴家、外科医生、F1 车手都在偷偷用。问题来了:AI 能不能也学会这套"闭眼练习"?
AI 面临的版本是这样的:
- 真实训练机器人,跟新手开真车一样贵——机械臂磨损、零件砸坏、bug 闯出实验室。
- 一只机器狗要摔一千次才学会走路,电池都换坏了三块。
- 如果它能在脑子里"想象摔一千次"再上场试一次,是不是就能省下 99% 的真实代价?
Dreamer 要做的就是这件事:让 AI 自学一个"世界的脑内模型",然后躲在这个模型里做梦练习,不用天天去真环境里碰运气。实验平台是 DeepMind Control Suite——20 个从摆锤到四足机器人的连续控制任务,输入只有 64x64 像素图像。
所以这一节是想说:Dreamer 想给 AI 安装"做白日梦"的能力,靠想象代替真实试错来学复杂动作。

之前的人怎么做的,为什么不够好
方案 A:纯试错型 RL(D4PG / A3C 等"无模型"方法) 类比:让你在真球场上拍 1 亿次球才学会发球。能学会,但贵、慢,电费比球拍贵。论文里 D4PG 要 1 亿步真实交互才能勉强追上 Dreamer。
方案 B:先学会做梦,但梦完不会自己出招(World Models 2018 / PlaNet 2018) 类比:脑子里能脑补世界长什么样,但每次该出哪招还得"实时搜索"——临到上场才一招招试,慢得要命。PlaNet 每一步决策都要用 CEM 搜 1000 条轨迹选最优,训练时间是 Dreamer 的 4 倍。
方案 C:在像素空间做梦(直接想象画面) 类比:每次脑内演练都要把整张球场重新画一遍。脑子根本装不下——每帧 64x64x3 = 12288 个数字,想 50 步未来要堆 60 万数字,还要 N 个分支。
方案 D:用导数自由的优化(PETS、CEM 这些) 类比:闭着眼瞎试一千个挥拍角度,挑得分最高的那个。能避开模型误差,但不用神经网络梯度等于浪费了一座金矿——梯度本来就长在那儿,告诉你"往哪个方向调更好",他们偏不用。
方案 E:多步 Q 学习(MVE、STEVE) 类比:拿模型预测的奖励去帮真实试错型 AI 算账。只是辅助,不是真的全靠想象学。而且只用单步 Q 值梯度,看不远。
所以这一节是想说:之前要么贵要么慢要么短视,没人把"压缩到潜空间想象 + 解析梯度回传 + 价值函数补长程"三件事缝起来。
这篇论文的新想法
不在像素世界做梦,而是在一个压缩过的"潜空间"里做梦;做完梦还要把"梦里赚的分"沿着可微的神经网络梯度,一路反向流回去告诉策略"刚才哪步该多做"。
等等,先慢一拍——"潜空间"和"可微"是什么?
潜空间(latent space):把一张 64x64 的图(约一万两千个数字)压成几十个数字的"剧情摘要"。脑子里想"摘要"比想"原画"快几百倍。
可微(differentiable):整条链路是数学函数搭起来的,可以一路求导——意思是"分数高了 0.1 分,反推回去刚好能算出哪个动作要稍微往左偏一点点"。
三个创新缝在一起:(1) 在压缩的潜空间里想象未来,而非在像素空间;(2) 用价值函数估计想象地平线之外的长期回报,避免短视;(3) 用解析梯度而非策略梯度来训练演员网络,方差低、效率高。这三件事单独都不新——但把它们缝成一根可微的管子、做到端到端训练并跑通复杂视觉控制,是 Dreamer 的独创组合。
所以这一节是想说:Dreamer 把"想象 -> 评分 -> 改进"三件事用一根可微的管子串了起来。
它分几步做的(方法)
整个 Dreamer 由三个互相喂养的循环组成,如同一个人的学习过程:白天上课(真环境交互收集数据)、晚上做作业(学世界模型)、睡觉做梦练习(在模型里训练行为)。三者不断循环、互相促进。下面逐一拆解。
下图是三个循环互相喂养的"飞轮"结构:
┌──────────────────────────────────────────────┐
│ 经验池 D (真实轨迹) │
└──▲───────────────────────────────────┬───────┘
│ 存入新数据 │ 抽取批次
│ ▼
┌───────┴────────┐ ┌──────────────────────────┐
│ 循环3: 环境交互 │ │ 循环1: 动力学学习 │
│ 演员+探索噪声 │ │ 图像→潜状态 s=(h,z) │
│ 真环境跑1000步 │ │ 学 表示/转移/奖励 模型 │
└───────▲────────┘ │ (重建+奖励-β·KL) │
│ 用更好的策略 └──────────────┬───────────┘
│ │ 世界模型冻结后
┌───────┴──────────────────────────────────────▼───────────┐
│ 循环2: 行为学习 (纯想象) │
│ s_t ─演员→ a ─转移模型→ s_{t+1} ─...→ 想象 H=15 步 │
│ 评论家估 V_λ → 解析梯度回传更新 演员φ / 评论家ψ │
└────────────────────────────────────────────────────────────┘
每 C=100 梯度步 ↺ 跑一次真环境 (脑内:真实 ≈ 10:1)
上图说明:真实交互产生数据、世界模型消费数据、行为在想象轨迹里学习,三者靠经验池串成一个自我改进的飞轮。
总架构:三个循环
论文 Figure 3 和 Algorithm 1 画出了 Dreamer 的完整生命周期:
循环 1:动力学学习(Dynamics Learning)——从经验池抽一批真实轨迹片段,训练世界模型把观测压成潜向量、预测未来状态和奖励。
循环 2:行为学习(Behavior Learning)——从已学的潜状态出发,让演员和评论家在想象中练习 H 步,用梯度回传更新两个网络。
循环 3:环境交互(Environment Interaction)——用当前演员在真环境里执行动作、收集新数据加入经验池。
三个循环交替进行:每收集 C 步真实数据后,做一轮动力学+行为学习。下面依次深入每个循环的技术细节。
第一步:学一个会"压缩世界"的脑内模型(潜动力学)
类比
你看一段足球比赛录像。你不会把每一帧 1080p 画面存进脑子,而是抽象成一个剧情梗概:A 队 3 号球员控球到中线、传给 7 号、7 号射门、进了。下次回忆这场比赛,你脑子里其实只剩这串"剧情向量"。Dreamer 的世界模型干的就是这事。
模型结构:RSSM
RSSM(Recurrent State Space Model,循环状态空间模型):Dreamer 的世界模型骨架。名字拆开看——"Recurrent"说明有时间链(RNN),"State Space"说明用隐状态描述世界,"Model"说明它是个学出来的模型。
RSSM 的核心设计是把每个时刻的潜状态 s_t 拆成两部分:
- 确定性状态
h_t(一条 GRU/RNN 的隐状态)——记住历史信息,类比"你记得前面发生了什么"。 - 随机状态
z_t(从一个高斯分布里采样)——表达不确定性,类比"下一秒可能有好几种走向"。
两条线并行运作:确定性链负责"记忆累积",随机部分负责"表达世界的随机性"。完整的潜状态 s_t = (h_t, z_t) 就是 Dreamer 对"此刻世界全貌"的压缩表示。
三个子模型
RSSM 由三个子模型组成,对应论文的公式 (1):
| 子模型 | 数学符号 | 输入 | 输出 | 人话 |
|---|---|---|---|---|
| 表示模型 | p(s_t | s_{t-1}, a_{t-1}, o_t) | 上一步状态 + 动作 + 当前图像 | 当前潜状态 | "看了真图,把世界压成摘要" |
| 转移模型 | q(s_t | s_{t-1}, a_{t-1}) | 上一步状态 + 动作 | 预测的下一步潜状态 | "不看图,纯靠想象往前推一步" |
| 奖励模型 | q(r_t | s_t) | 当前潜状态 | 预测奖励 | "在这个状态能拿多少分" |
关键区别:表示模型需要看真实图像(用于训练时"校准"),转移模型不看图像(用于"做梦"时独立预测)。这就是"做梦"的核心机制——转移模型能脱离真实观测自行推演未来。
训练目标:让梦和现实对得上
世界模型的训练用的是变分下界(ELBO),翻译成人话就是三个要求同时满足:
ELBO(Evidence Lower Bound,证据下界):一种训练"编码-解码"类模型的标准损失函数。核心思想是:编码后的摘要应该能还原出原始数据,同时编码过程不能太"记死"——要保持一定的压缩性。
- 观测重建(J_O):把潜向量解码回图像,和真图越像越好。人话——"你的摘要得能还原出原画"。
- 奖励预测(J_R):用潜向量预测奖励,和真奖励越近越好。人话——"你的摘要得能判断分数"。
- KL 正则(J_D):表示模型的输出(看了真图的)和转移模型的输出(没看真图的)不能差太远。人话——"你'看了答案后的理解'和'没看答案的猜测'要一致",否则做梦时猜得太离谱。
写成公式(论文 Eq. 10,用人话翻译):
总损失 = 重建图像的准确度 + 预测奖励的准确度 - β × (看图版 vs 不看图版的差异)
其中 β 是一个平衡系数,控制"压缩程度"。β 太小,模型记太多无关细节;β 太大,模型丢掉有用信息。
具体网络结构
论文 Appendix A 给出了所有细节:
- 编码器(图像 -> 潜向量):4 层卷积神经网络(CNN),kernel 4x4,stride 2,通道数 32/64/128/256,激活函数 ReLU。把 64x64x3 的图像压成 1024 维的平坦向量,再通过全连接层得到 GRU 输入。
- GRU(确定性链):隐状态维度 200。每一步接收上一步隐状态 + 上一步动作 + 上一步随机状态,输出新隐状态。
- 随机状态:从 GRU 隐状态通过两个全连接层分别输出均值和标准差(各 30 维),形成 30 维高斯分布,采样得到随机状态 z_t。
- 解码器(潜向量 -> 图像):反卷积网络,是编码器的镜像。用于训练时提供重建损失。
- 奖励预测器:3 层全连接网络(隐藏层 300 维),输入潜状态,输出标量奖励。
为什么这步有用
- 一旦剧情向量足够好,"想象一千个未来"只是 1000 次低维向量计算——比想象 1000 个 12288 维图像便宜几百倍,可以在 GPU 上大规模并行。
- 论文 Figure 5 给了一个震撼实验:只看前 5 帧,让模型自己预测后 45 帧——RSSM 在视觉上几乎 1:1 还原了物理运动。说明剧情向量真的抓住了世界规律。
- KL 正则确保"不看图的猜测"和"看了图的理解"对齐——这是后续做梦时预测质量的基石。
所以这一节是想说:先教 AI 把世界压成一串剧情向量,再教它在这个空间里"快进时间"看未来。RSSM 的确定性+随机性双线设计是 Dreamer 梦境质量的关键。
第二步:在梦里同时学"出招"和"打分员"(演员-评论家)
类比
你脑内打网球时其实在干两件事:
- 出招的你(Actor / 行动者):模拟出"这一拍我侧身回斜线"。
- 打分的你(Critic / 评论者):边模拟边打分——"嗯,这一拍打过去对面接不到,预计本回合赢"。
两个"你"互相喂养:打分员告诉行动者哪种出招更值钱,行动者再去试新招让打分员重新校准。这就是**演员-评论家(actor-critic)**框架。Dreamer 的特别之处在于——这场网球完全在脑子里打,不上真球场。
想象过程的具体流程
每次训练循环中,行为学习按以下步骤进行:
选起点:从经验池里随机抽一批真实轨迹片段,用表示模型把它们编码成潜状态序列。这些潜状态就是"梦的起点"。
展开想象轨迹:从每个起点 s_t 出发,完全脱离真实数据,在想象中往前走 H=15 步。每一步:
- 演员网络看当前潜状态 s_τ,输出动作 a_τ
- 转移模型用 (s_τ, a_τ) 预测下一步潜状态 s_{τ+1}
- 奖励模型预测这一步拿多少分 r_τ
- 评论家网络预测从这步往后总共能拿多少分 v(s_τ)
计算回报估计:用 V_λ 公式综合各步的奖励和价值预测(下面详细解释)。
更新演员:让演员参数朝"整条想象轨迹总分更高"的方向挪动。
更新评论家:让评论家的预测更接近 V_λ 的估计值。
整个过程中世界模型参数冻结——只训练演员和评论家。
演员网络的细节
演员网络是一个 4 层全连接网络(隐藏层 300 维,ELU 激活),输入是潜状态 s_τ(230 维 = 200 维确定性 + 30 维随机性),输出动作的均值 μ 和标准差 σ。
动作的生成过程(论文 Eq. 3):
a_τ = tanh(μ_φ(s_τ) + σ_φ(s_τ) * ε), ε ~ Normal(0, I)
人话:给定剧情向量,神经网络吐出"动作的均值和不确定度",然后骰一个标准正态噪声 ε,按这个不确定度抖一抖、再用 tanh 压到 [-1, 1] 区间,就是这次的动作。
重参数化(reparameterization):把"从分布里随机抽样"改写成"确定性变换 + 外部噪声"的形式。这样做的好处是——梯度可以穿过这个采样操作,一路传回网络参数。如果不用重参数化,采样操作是个"黑箱",梯度到这里就断了。
评论家网络的细节
评论家网络结构和演员类似(4 层全连接,300 维隐藏层),输入潜状态,输出一个标量——对当前状态"从这里往后能拿多少总分"的预测。
V_λ:多视野估计的精妙设计
这是 Dreamer 行为学习中最核心的数学工具。论文用了三层递进来解释:
第一层:只看想象轨迹里的奖励(V_R,Eq. 4)
V_R(s_τ) = r_τ + γ*r_{τ+1} + γ²*r_{τ+2} + ... + γ^(H-τ)*r_{t+H}
人话:"把从 τ 到地平线 H 的所有想象奖励加起来(远的打折扣)"。问题:看不到 H 步之后的回报——短视。
第二层:用价值函数兜底(V_N^k,Eq. 5)
V_N^k(s_τ) = r_τ + γ*r_{τ+1} + ... + γ^(k-1)*r_{τ+k-1} + γ^k * v(s_{τ+k})
人话:"看 k 步真实想象奖励,然后用评论家的预测补上后面所有的"。k 小则偏差大但方差小(评论家可能不准,但稳定);k 大则偏差小但方差大(想象可能累积误差)。
第三层:用指数加权平均(V_λ,Eq. 6)
λ-return(V_λ):把"只看 1 步再用评论家补"、"只看 2 步再补"、"只看 3 步再补"......所有不同视野的估计,按 λ 的指数权重求平均。λ=0 相当于纯用评论家(TD(0));λ=1 相当于纯用想象奖励(Monte Carlo)。Dreamer 用 λ=0.95。
V_λ(s_τ) = (1-λ) * [V_N^1(s_τ) + λ*V_N^2(s_τ) + λ²*V_N^3(s_τ) + ...] + λ^(H-1)*V_N^H(s_τ)
人话:"兼顾所有不同远近的视野,近处看得清的占多一点(因为 λ<1 所以远处权重指数衰减),但远处也不完全丢掉。"
这个设计的妙处在于:当世界模型在近处预测很准时,短视野估计可靠、权重大;当需要看到远处大回报时,长视野估计也在里面。两者自动平衡。
训练目标(论文 Eq. 7 & 8)
演员目标:让整条想象轨迹的 V_λ 总和最大:
max_φ Σ_{τ=t}^{t+H} V_λ(s_τ)
评论家目标:让评论家的输出尽量接近 V_λ 估计值:
min_ψ Σ_{τ=t}^{t+H} (1/2) * (v_ψ(s_τ) - sg[V_λ(s_τ)])²
其中 sg[·] 表示 stop-gradient——训练评论家时,V_λ 被当作固定目标,梯度不通过它流动。否则演员和评论家会互相搅乱。
为什么这步有用
- 用价值函数填补"看不见的未来":H=15 步以外的奖励,让评论者的预测顶上去。这就避开了"短视"——只看 15 步会错过那些 30 步之后才到来的回报。
- Figure 4 的实验:Dreamer 在 H=10 和 H=40 时表现差不多;而没有价值函数的版本("No value")随着 H 增大才慢慢爬上来,性能对 H 很敏感。
- 没有价值函数,等于打网球时只看眼前两秒——你永远学不会布局长回合。
所以这一节是想说:梦里同时训"出招 + 打分员",V_λ 的多视野混合让 AI 既能看远又算得稳。
第三步:用解析梯度直接告诉演员"哪步该多做"
类比
你是个篮球教练,看完一场比赛复盘。
- 传统方法(REINFORCE / PPO):你只能告诉队员"上半场总分高 -> 整体多做这种打法"。粗放,因为你不知道具体是哪一回合贡献了高分。
- Dreamer 方法:因为整场比赛是你在脑子里模拟的(而且每个环节都是"可微"的神经网络),你可以精确算出:"那次第 7 分钟的传球,对终场比分的贡献是 +3.2 分;如果当时角度多偏 5 度,预计能 +4.1 分"。
这种"具体到每个动作的导数"叫解析梯度(analytic gradient)。
梯度流动的完整链路
理解 Dreamer 的精髓,关键是看清梯度从"最终得分"到"演员参数"经过了哪些环节:
演员参数 φ
↓ (演员网络)
动作 a_τ
↓ (转移模型,可微)
下一状态 s_{τ+1}
↓ (转移模型,继续推...)
更远状态 s_{τ+2}, s_{τ+3}, ...
↓ (奖励模型 + 评论家)
V_λ 估计值
↓ (求导 ∂V_λ/∂φ)
梯度流回演员参数
每一步都是神经网络的前向计算——反向传播可以一路穿回去。关键技术点:
- 随机状态的采样用重参数化处理,梯度能穿过。
- 动作的采样同样用重参数化(tanh-Gaussian),梯度能穿过。
- 世界模型参数 θ 冻结(stop-gradient),只更新演员参数 φ。
解析梯度 vs 策略梯度的核心区别:策略梯度(REINFORCE)靠"采样回报 x log 概率"估计梯度——本质是"这条轨迹总分高 -> 整体概率提高",不知道具体哪步贡献大,方差极高。解析梯度直接用链式法则精确算出每一步对总分的微分,方差低几个数量级。代价是需要整条链可微——而 Dreamer 恰好满足这个条件。
与 DDPG/SAC 的关键区别
DDPG 和 SAC 也用解析梯度训练演员,但它们只用"单步 Q 值"的梯度:
DDPG: ∂Q(s, a)/∂φ ← 只看一步
Dreamer: ∂[Σ V_λ(s_τ)]/∂φ ← 看多步想象轨迹
DDPG 的梯度只告诉你"此刻做什么动作 Q 值最高";Dreamer 的梯度告诉你"此刻做什么动作,让接下来 15 步的总 V_λ 最高"。多步梯度意味着长程信用分配——你能学到"先蹲下(短期扣分)是为了后面跳得更高(长期加分)"这种策略。
实际训练的数值细节
- 批次大小 B=50 条序列,每条 L=50 步
- 想象时域 H=15
- 学习率 α=6e-4(Adam 优化器)
- 折扣因子 γ=0.99
- λ=0.95
- 梯度裁剪:全局梯度范数不超过 100
为什么这步有用
- 解析梯度的方差比策略梯度低几个数量级——同样的样本量能学得更准。
- DDPG、SAC 也用解析梯度,但它们只用"单步 Q 值"的梯度, 看不远;Dreamer 用"多步价值"的梯度,看得远。这是它和 SAC 这一系最关键的差别。
- 实验结果:Dreamer 用 5×10⁶ 步交互达到 823 平均分;D4PG 要 10⁸ 步(多 20 倍)才达到 786。梯度信息利用得越好,样本越省。
所以这一节是想说:因为整场梦是可微的,可以精确算出"哪步动作往哪个方向调",比传统 RL 的粗放反馈高效得多。
3.4 表征学习:怎么让"梦"长得像真世界
类比
学画画时老师让你做三种练习:(A) 看一眼苹果转身画出来——逼你记住完整结构;(B) 在一堆水果照片里挑出哪两张是同一个苹果——只要分得清就行;(C) 只记住这苹果"甜度 7 分"——根本没看形状。三种练习练出来的画工天差地别。Dreamer 的世界模型也面临这个选择:让它学着"重建图片"、"分清哪张配哪张"、还是"只记奖励分"?
它在干什么
Dreamer 算法本身和"怎么压缩世界"是解耦的——你换不同的世界模型训练目标都行。论文比了三种:
- 图像重建 (reconstruction):让模型把潜向量解码回原图。最有效,绝大多数任务上最强。具体损失包含三项:观测重建 ln q(o_t|s_t) + 奖励预测 ln q(r_t|s_t) - KL 散度正则项。
- 对比学习 (contrastive / NCE):不重建图像,只让"潜向量配对图像"分得清。用 NCE 损失——让正配对的互信息高于负配对。能解决一半任务。
- 只预测奖励 (reward only):完全不管像素,只让奖励预测对。不够——Figure 8 显示几乎完全学不会走路。
NCE (Noise Contrastive Estimation):对比学习损失之一,靠"区分真配对 vs 假配对"间接学表征。
信息瓶颈 (Information Bottleneck):理论框架,让模型只保留对预测有用的信息,丢掉无关细节。KL 正则项就是瓶颈的具体实现——β 越大,压缩越狠。
具体损失函数翻译成人话
重建目标 J_REC = 观测重建 + 奖励预测 - β × KL 散度
人话:"画回去越像越好" + "猜对奖励" - "不要让每一步的压缩太精细(防止过拟合)"。β 是个旋钮:调大了模型会更泛化但丢细节,调小了记得清楚但可能过拟合训练数据。Dreamer 用 β=1。
为什么图像重建最强
- 重建是最"无损"的监督信号——模型被逼着记住画面中所有可能与未来奖励相关的东西,不管你现在知不知道哪些相关。
- 对比学习只需要"分得清",不需要"记得全",所以会丢掉一些细节——这些细节可能恰好在某些任务里很关键。
- 只预测奖励更极端:奖励稀疏时几乎没有学习信号,模型学到的表征空空如也。
所以这一节是想说:图像重建是当前最有效的"造梦原料";只看奖励的偷懒法不够。
3.5 环境交互:从梦中醒来验证一下
类比
国际象棋大师在脑子里复盘完一百盘棋,还是得去下几盘真棋来校准自己的判断——"我以为这步能赢,实际上对手有我没想到的反击"。真实对弈的数据用来更新脑内模型,然后回家继续在脑子里练。
它在干什么
算法的第三个循环:
- 用当前策略(演员)在真实环境里走 T=1000 步,收集 (观测, 动作, 奖励) 三元组。
- 把这些数据存进经验池 D(一个大数据库)。
- 下次训练世界模型和行为模型时,从 D 里随机抽批次来用。
具体流程:每隔 C=100 个梯度步(即做了 100 轮"学模型 + 学行为"的更新后),去真环境跑一个完整 episode(1000 步)。初始化时先用 5 个随机策略的 episode 填充经验池。
探索噪声
在真环境交互时,会给演员的输出加一个小扰动(additive Gaussian noise σ=0.3),鼓励它偶尔偏离已学策略去尝试新动作——这是标准的"探索"技巧。
为什么这步有用
- 纯靠想象永远学不会——因为世界模型有误差,如果不用真实数据校准,误差会越积越大。
- 真实数据也不能太多——否则就退化成传统 model-free RL 了。Dreamer 的设计是"100 步脑内训练 : 1000 步真实交互"的比例,大约 10:1,兼顾效率和准确性。
- 经验池可以无限增长,越早期的数据也能反复利用——这是"离线学习"的优势。
所以这一节是想说:做梦再多也得定期睁眼看看真世界,用真实数据校准脑内模型。
3.6 三个循环如何协作(整体训练流程)
把上面五步缝起来,Dreamer 的完整训练循环是:
while 没收敛:
for c = 1 到 C: # C=100 个梯度步
从经验池 D 随机抽 B=50 条长度 L=50 的序列
用表示模型编码成潜状态序列 s_1, ..., s_50
用重建/对比/奖励损失更新世界模型 θ
从每个 s_t 出发想象 H=15 步轨迹
计算 V_λ 估计
更新演员 φ(最大化 V_λ)
更新评论者 ψ(回归 V_λ 目标)
# 环境交互
用演员 + 探索噪声跑一个 episode(1000 步)
把数据加进 D
关键设计原则:
- 世界模型训练和行为学习交替进行但互不干扰——更新行为时冻结世界模型参数。
- 行为完全在想象中学——演员和评论者从未直接接触真实环境的梯度信号。
- 经验池是三者的纽带——真实交互产生数据,世界模型消费数据,行为在世界模型产生的想象轨迹中学习。
所以这一节是想说:三个循环(学世界、学行为、收集数据)互相喂养、交替运行,形成一个自我改进的飞轮。
下图放大 RSSM 的双线结构与"想象轨迹上解析梯度回流"的关键机制:
【RSSM 潜状态:确定性链 h + 随机快照 z】
o_t(真图)──CNN编码──┐
▼
h_{t-1} ─────► GRU ───► h_t (确定性记忆链)
a_{t-1},z_{t-1}─┘ │
├─表示模型 q(z|h,o) ◄─看真图(训练校准)
├─转移模型 p(z|h) ◄─不看图(做梦独立推演)
▼
z_t (随机快照) ── s_t=(h_t,z_t)
【想象展开 + 解析梯度回流(整条链可微)】
演员φ 演员φ 演员φ
│ │ │
▼ ▼ ▼
s_t ──转移──► s_{t+1} ──转移──► s_{t+2} ── ... ── s_{t+H}
│ │ │ │
奖励/评论家 奖励/评论家 奖励/评论家 评论家兜底
└────────────┴─── V_λ 多视野加权 ───┴──────────────┘
│ ∂V_λ/∂φ 沿可微链反传
▼
更新演员φ (方差比策略梯度低几个数量级)
上图说明:RSSM 用"确定性记忆 h + 随机快照 z"压缩世界;行为学习在想象轨迹上用 V_λ 综合远近视野,再靠解析梯度精确告诉演员每步该往哪调。

关键数字(What works)
| 指标 | Dreamer | 对比方 | 含义 |
|---|---|---|---|
| 20 任务平均分 | 823(5×10⁶ 步) | D4PG 786(10⁸ 步) | 样本效率高 20 倍,分数还更高 |
| 单任务训练时间 | 3 小时/百万步 | PlaNet 11h, D4PG 24h | 计算效率高 3-8 倍 |
| Hopper Hop | 369 | PlaNet 0.4, A3C 0.5 | 长程信用分配任务碾压 |
| 想象时域敏感性 | H∈[10,40] 稳定~800 | No-value H=10 只有 200 | 价值函数兜底让超参不敏感 |
| 表征消融 | 重建 |
— | 图像重建是最强监督信号 |
| 超参通用性 | 20 任务同一组超参 | PlaNet 需逐任务调 | 工程友好,鲁棒性强 |
所以这一节是想说:在样本效率、计算效率、长程任务表现、稳健性四个维度同时碾压,是 model-based RL 第一次做到全面碾压 model-free。
实验结果说明了什么
论文的实验回答了四个核心问题:
问题 1:Dreamer 能否同时兼顾样本效率和最终性能? Figure 6 的柱状图给出了肯定答案——用 1/20 的数据量超过了 D4PG,同时继承了 PlaNet 的数据效率。这打破了此前"model-based 效率高但天花板低"的刻板印象。
问题 2:价值函数对长程任务到底有多重要? Figure 4 和 Figure 7 联合说明:Hopper Hop 这种"先蓄力再起跳"的任务,没有价值函数的版本("No value")分数趋近于零。因为蓄力阶段在 H=15 步内看不到奖励,只有价值函数能"代表"远处的回报告诉演员"现在蹲下是值得的"。
问题 3:不同表征学习方法对 Dreamer 性能影响多大? Figure 8 清楚展示了层次关系。这说明 Dreamer 算法本身是通用的——未来更好的表征学习方法(比如后来 DreamerV3 的 symlog 预测)可以直接插进来获益。
问题 4:Dreamer 是否需要逐任务调参? 所有 20 个连续控制任务用完全相同的超参数,这在当时 model-based RL 领域非常罕见。PlaNet 需要调动作重复次数,D4PG 需要调网络结构——Dreamer 不需要。这是工业界采用的重要前提。
所以这一节是想说:实验系统性地证明了 Dreamer 在效率、长程规划、表征灵活性和工程鲁棒性四个维度的优势。
你应该懂的几个新词
强化学习 (Reinforcement Learning, RL):通过试错 + 奖励信号学行为的范式。AlphaGo、ChatGPT 的 RLHF 都属于此。
世界模型 (World Model):AI 心里那个"环境怎么演化"的模型,可以用来"在脑子里模拟"。Dreamer 是把世界模型用到登峰造极的代表作。
潜空间 (latent space) / 潜动力学 (latent dynamics):把高维输入压缩成低维向量后所在的空间。Dreamer 用 30 维确定性 + 30 维随机性组合。
想象 (imagination):在世界模型里"快进时间"看可能的未来轨迹,不需要真去环境里走。
演员-评论家 (actor-critic):两个网络,一个出招 (actor / policy / action model),一个打分 (critic / value model)。Dreamer 的核心结构。
价值函数 (value function, V):状态打分函数。"从这状态往后总共能拿多少分"。
解析梯度 (analytic gradient):通过反向传播精确算出的导数。相对于"采样估计的策略梯度"方差低很多。
重参数化 (reparameterization):把随机采样改写成"确定性变换 + 标准噪声",让梯度能穿过采样这一步。
POMDP (Partially Observable Markov Decision Process):标准 RL 形式化,承认"你只看到部分观测,得自己脑补"。视觉控制天然是 POMDP。
RSSM (Recurrent State Space Model):Dreamer 用的具体世界模型结构,确定性 RNN 隐状态 h_t + 随机潜变量 z_t 两条线并行。h_t 负责记忆,z_t 负责表达不确定性。
DM Control Suite:DeepMind 发布的连续控制基准,包括走路、跳跃、平衡杆等 20 多个任务。Dreamer 把它当主战场。
样本效率 (sample efficiency):拿到好性能需要多少真实交互步数。model-based 方法的核心卖点就是样本效率。
λ-return (V_λ):把不同展望长度的价值估计按指数衰减加权平均,兼顾偏差和方差。TD(λ) 的推广。
所以这一节是想说:上面这些词是 model-based RL 这条路的基本词汇表,Dreamer 把它们的标准用法定型了。
它有什么搞不定的
离散动作(Atari)打不过 model-free:原文 Appendix C 老实承认,在 Atari 这种动作离散、画面复杂的环境上,Dreamer 还赢不过 Rainbow / IMPALA。重参数化技巧对离散动作不如连续动作自然——需要用 straight-through 估计器,精度打折。要等 DreamerV2(2021)把随机变量改成 categorical 才追上。
奖励稀疏到极端时仍然会卡:纯奖励驱动学世界模型时几乎瘫痪(Figure 8)。说明世界模型本身得有"额外信号"(图像重建)才稳定。如果任务连图像重建都帮不上(比如奖励和视觉线索完全无关),Dreamer 也会挣扎。
想象的世界不等于真实世界——误差累积:模型再准也有误差,长想象时域里误差会累积——所以 Dreamer 才不得不靠价值函数兜底。纯靠想象推到底是不现实的。论文选择 H=15 而非 H=100 正是因为更长的想象可信度下降。
不能处理高分辨率或 3D 大规模场景:64×64 像素的卡通仿真环境是它的舒适区。真实机器人摄像头分辨率高、光照变、纹理复杂,CNN 编码器和转置 CNN 解码器扛不住。得等 DreamerV3 引入更大模型和 symlog 归一化。
没有内在探索机制:Dreamer 只靠"动作加噪声"做探索,没有好奇心驱动或信息增益驱动的主动探索。在稀疏奖励环境中可能长时间收集不到有意义的数据。后续 Plan2Explore (2020) 补了这块。
单任务学习,不能迁移:每个任务从零训一个世界模型。学会了"走路"的模型不能直接拿去"跑步"——得重新训。通用世界模型要等 Genie / Cosmos 这一代。
所以这一节是想说:Dreamer 是连续控制 + 简单视觉的霸主,但离散动作、真实复杂场景、稀疏探索和跨任务迁移还得等续作。
它和别的几篇是什么关系
放到我们这批已经读过的笔记里:
- vs LLaVA / 多模态 VLM:LLaVA 教 AI"看图说话",Dreamer 教 AI"想象未来动作"。一个偏感知,一个偏决策。但都体现了"用大模型把世界压缩成有用表示"的共同套路。
- vs SayCan / OpenVLA:SayCan 让大语言模型当机器人的"高层规划师",OpenVLA 端到端从图直接吐动作。Dreamer 是另一条腿——自己学一个世界模型,再在里头做梦。这条腿后来发展成 DreamerV3、DayDreamer,可以跑真机器人。
- vs Cosmos World Foundation Model:NVIDIA Cosmos 是把"世界模型"思路放大到大规模视频预训练的版本。可以理解成 Dreamer 的精神后裔——压缩→想象→学策略。Cosmos 用 Transformer 替了 RSSM,规模拉到几亿参数。
- vs 模仿学习类论文:模仿学习(如行为克隆)需要专家数据;Dreamer 完全自己探索 + 想象,不需要演示。
- 历史脉络:World Models (2018) → PlaNet (2018) → Dreamer (2020, 本篇) → DreamerV2 (2021, 攻克 Atari) → DreamerV3 (2023, 一组超参跑 150 个任务) → DayDreamer (真机器人) → 各种衍生(IRIS、TWM、Genie、Cosmos)。
所以这一节是想说:Dreamer 是 model-based RL 这条主线的"成年礼"——之后所有"AI 自己造梦学动作"的工作都从它出发。
和本导读的关系
本导读 Ch15(世界模型)的核心命题是:让机器人在脑中建立环境的心理模型,在想象中练习和规划,而不是每次都付出真实互动的代价。Dreamer 正是这个命题的"成年礼"论文——它第一次把"想象轨迹在潜空间中展开,然后用解析梯度优化策略"这条技术路线做到在 20 个视觉控制任务上全面超越 model-free 方法。
具体来说,Ch15 描述的 World Models 演化路径是 Ha (2018) → PlaNet (2018) → Dreamer (2020) → DreamerV2/V3 → Genie → Cosmos。Dreamer 在这条线上的角色是:
- 承上:继承了 PlaNet 的 RSSM 世界模型,但去掉了在线规划(CEM),换成了训练好的演员网络——把"实时搜索"变成"提前练好直接出招"。
- 启下:确立了"潜空间想象 + 演员-评论家 + 解析梯度"的范式,后续 DreamerV2/V3 只是在这个框架上改细节(categorical 潜变量、symlog 预测、KL balancing)。
- 方法论贡献:证明了 model-based RL 可以同时做到样本高效和性能高——这打破了此前"model-based 天花板低"的误解。
所以这一节是想说:Dreamer 是 Ch15 "世界模型"章节的技术锚点——读懂它就理解了这条路线从"能跑"到"能用"的关键跨越。
思考题
Q1:RSSM 为什么要同时有"确定性路径"(RNN 隐状态 h_t)和"随机路径"(潜变量 z_t)?只用一条行不行?
提示
想想确定性路径擅长记忆什么、随机路径擅长表达什么。如果世界是完全确定的(比如简单钟摆),只有 h_t 够吗?如果世界有很多随机性(比如掷骰子),只有 z_t 够吗?Q2:为什么 Dreamer 用 V_λ 而不是直接用"纯想象回报" V_R(就是直接加 H 步的奖励)?V_R 有什么问题?
提示
想想 H=15 步以后的奖励怎么办。V_R 相当于假设"15 步之后世界结束了",这对哪些任务影响最大?Figure 4 的"No value"曲线就是用 V_R 的效果。Q3:假设世界模型完全准确(误差为零),Dreamer 还需要价值函数吗?能不能直接把 H 设成无穷大?
提示
即使模型完全准确,H=无穷大意味着什么?计算量、内存、梯度消失/爆炸——哪个先成为瓶颈?实际上 DreamerV3 仍然用 H=15 即使模型更强了,为什么?Q4:Dreamer 的演员用重参数化采样(tanh Gaussian),如果动作空间是离散的(比如 Atari 的上下左右),这个技巧还能用吗?论文怎么处理的?
提示
离散变量不能直接求导("往左偏一点点"没有意义)。论文 Section 3 提到了 straight-through gradients——这是什么?为什么精度会打折?DreamerV2 用什么替代方案解决了这个问题?Q5:图像重建为什么比"只预测奖励"效果好那么多?从信息论角度想——重建目标逼模型保留了哪些信息,而纯奖励目标允许模型丢掉什么?
提示
想想信息瓶颈:纯奖励目标只要求模型保留"和奖励相关"的信息,但训练初期奖励信号稀疏时模型根本不知道什么和奖励相关,于是什么都不学。重建目标强制保留"能画回图片"的全部信息——这是一种"宁可多记也不漏"的策略。Q6:Dreamer 在 Hopper Hop 上拿 369 分,而 PlaNet(同样有世界模型但没有演员/价值函数)拿 0.4 分。为什么差距这么大?这个任务有什么特殊?
提示
Hopper Hop 要求先蹲下蓄力(短期奖励为 0 甚至为负),然后才能跳起来拿分。PlaNet 用在线规划(CEM)只看 H 步内的奖励,如果蹲下的成本在 H 步内都看不到回报,CEM 就永远不会选择"蹲下"。Q7:如果你要把 Dreamer 部署到一个真实机械臂上(比如抓杯子),你预期会遇到哪些原论文没解决的困难?至少列三个。
提示
想想:(1) 真实摄像头的分辨率和光照变化 vs 64×64 卡通画面;(2) 真实世界没有"重置"按钮——episode 之间怎么办;(3) 安全约束——想象中可以摔一千次但真实中不行;(4) 动作延迟——真实电机有响应时间。DayDreamer (2022) 正是解决这些问题的工作。所以这一节是想说:这些问题覆盖了 RSSM 结构设计、价值估计、表征学习、离散动作和真实部署五个维度,能验证你是否真正理解了 Dreamer 的设计动机。
一些好奇心问答(FAQ)
Q1:为什么不用真实图像做梦,而要在潜空间?
潜空间小(30+30=60 维 vs 12288 维),可以并行想象几千条轨迹;图像空间想象一条都嫌慢。而且在潜空间做梦可以让梯度直接流过——如果在像素空间想象,你得对一个 64×64 的图做反向传播,既慢又容易梯度爆炸。
Q2:Dreamer 是不是 supervised learning 的强化版?
不完全是。它确实有监督部分(奖励预测、图像重建属于监督学习),但"怎么出招"那部分是 RL(自己探索、自己造数据、自己评分)。可以说是"监督学世界 + 强化学行为"的混合体。
Q3:H=15 是怎么定的?
经验值。Figure 4 显示 H 在 [10, 40] 区间分数差不多,说明价值函数把它调宽容了。原文用 H=15 在所有连续任务上都跑——足够让梯度传递有效信号,又不会让模型误差累积太多。
Q4:为什么"做梦"梦得准是可能的?
DM Control Suite 是仿真环境——物理规则简单(牛顿力学)+ 画面卡通。Figure 5 的实验显示模型只看 5 帧能预测后 45 帧。真实复杂环境(猫从沙发跳下打翻水杯)梦不准,所以 DreamerV3 才需要更大模型。
Q5:训练 Dreamer 要多少卡?我能跑吗?
单张 V100 + 10 CPU 跑一个任务大约 12-15 小时(500 万步)。GitHub 上原作者放了完整代码(TF1 版本)。社区也有 PyTorch 复现(dreamerv2 仓库向下兼容 V1 配置)。研究生硬件够用。
Q6:演员是确定性还是随机性策略?
随机性。输出"动作均值 + 标准差"的高斯分布(再用 tanh 压到 [-1, 1])。重参数化让梯度可以穿过采样。训练时随机性鼓励探索;部署时可以取均值变成确定性策略。
Q7:奖励稀疏的时候 Dreamer 还行吗?
部分行。Cartpole Swingup Sparse 这种"扔出杆子才有 1 分"的任务上 Dreamer 拿 812(D4PG 482,PlaNet 0.6)。但完全没奖励信号的环境(纯探索)不行——它没有内在好奇心机制。后续 Plan2Explore 补了这块。
Q8:和 SAC 这种 model-free 的最强代表比,Dreamer 强在哪?
主要是样本效率。SAC 也用解析梯度(重参数化),但它只能用"环境真实数据 + 单步 Q"。Dreamer 在脑内造了无穷数据 + 多步价值,每步真交互价值是 SAC 的 10-20 倍。但是 SAC 在大规模真实任务(比如真机器人 360 度全转)目前还更稳——因为它不依赖世界模型的准确性。
所以这一节是想说:Dreamer 是仿真环境的样本效率冠军,但稀疏奖励、复杂感知、真机部署这些工程问题还有空间。
如果你想再深入
按"前传 → 续作 → 衍生 → 实战"四类排序:
- 前传:World Models (Ha & Schmidhuber, 2018) — 第一次提出"AI 在脑子里学世界模型 + 在梦里训练策略"的端到端范式。Dreamer 是它的"端到端训练 + 解析梯度"升级版。
- 前传:PlaNet (Hafner et al., 2018) — 同一作者的前作。引入 RSSM,但出招靠在线规划而非演员。读完 Dreamer 再读 PlaNet,会发现"加一个演员"的改进多么关键。
- 续作:DreamerV2 (Hafner et al., 2021) — 攻克离散动作(Atari),把 RSSM 的随机变量改成 categorical。第一次让纯 model-based 在 Atari 击败 Rainbow。
- 续作:DreamerV3 (Hafner et al., 2023) — 一组超参跑 150 多个任务,包括 Minecraft "钻石挑战"。引入 symlog 预测、KL balancing、free bits 等稳定性 trick。
- 衍生:DayDreamer (Wu et al., 2022) — 把 Dreamer 直接搬到真机器狗、机械臂上。证明"想象学习"在真实硬件上也能省样本。
- 衍生:Plan2Explore (Sekar et al., 2020) — 补 Dreamer 不会主动探索的弱点,加内在好奇心。
- 教材:Sutton & Barto, Ch8 (Dyna 架构) — Dreamer 的精神祖先。Dyna-Q 在 1991 年就提出了"用学到的模型生成模拟经验来加速学习",Dreamer 可以看成 Dyna 的深度学习时代升级版。
如果你想把这条主线串起来,World Models → PlaNet → Dreamer → DreamerV3 是必读四件套。
所以这一节是想说:把 Dreamer 放进 Hafner 的研究序列里读,能清楚看到 model-based RL 这条路怎么从玩具发展到能解 Minecraft 钻石挑战。
原文信息
@inproceedings{hafner2020dream,
title = {Dream to Control: Learning Behaviors by Latent Imagination},
author = {Hafner, Danijar and Lillicrap, Timothy and Ba, Jimmy and Norouzi, Mohammad},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2020},
url = {https://arxiv.org/abs/1912.01603}
}
- arXiv: https://arxiv.org/abs/1912.01603
- 项目主页: https://danijar.com/dreamer
- 代码(TF1 原版): https://github.com/danijar/dreamer
- 代码(PyTorch 社区复现): https://github.com/juliusfrost/dreamer-pytorch
所以这一节是想说:提供完整引用和资源链接,方便后续查阅和复现。
◼
引用本笔记 / Cite this note
@online{eai_dreamer_v1_2026,
title = {(readable note) Dream to Control: Learning Behaviors by Latent Imagination},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2020 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dreamer-v1/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?