Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 144

Dream to Control: Learning Behaviors by Latent Imagination

30 min read · 10564 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者看的精读笔记。不假设你懂强化学习,公式全部翻成人话。

一句话讲什么(TL;DR)

教 AI 在脑子里反复"做白日梦"演练动作,不用真去摔跤,就能学会跑步、翻跟头这种复杂动作。具体而言:先从少量真实经验中学一个压缩版的"脑内世界模型",然后在这个模型里想象几千条未来轨迹,用精确的数学导数告诉策略网络"刚才哪步该往哪个方向调",最终以 1/20 的真实交互量超越了所有前辈。

所以这一节是想说:这篇论文教 AI"闭着眼想一遍"就把动作练好,是 model-based RL 第一次在效率和性能上同时碾压 model-free。


这是个什么场景

想象你刚买了驾照要上路。方法 A:直接开着真车上街练,蹭一次保险杠 5000 块,撞到人就更麻烦——这是"试错"型,贵、慢、危险。方法 B:你坐在沙发上闭眼"过电影"——"这里红灯踩刹车、那个路口右转要看后视镜",脑子里走一百遍,再上车你会发现稳多了。

这种"脑内过电影"心理学里叫心象演练(mental rehearsal),钢琴家、外科医生、F1 车手都在偷偷用。问题来了:AI 能不能也学会这套"闭眼练习"?

AI 面临的版本是这样的:

  • 真实训练机器人,跟新手开真车一样贵——机械臂磨损、零件砸坏、bug 闯出实验室。
  • 一只机器狗要摔一千次才学会走路,电池都换坏了三块。
  • 如果它能在脑子里"想象摔一千次"再上场试一次,是不是就能省下 99% 的真实代价?

Dreamer 要做的就是这件事:让 AI 自学一个"世界的脑内模型",然后躲在这个模型里做梦练习,不用天天去真环境里碰运气。实验平台是 DeepMind Control Suite——20 个从摆锤到四足机器人的连续控制任务,输入只有 64x64 像素图像。

所以这一节是想说:Dreamer 想给 AI 安装"做白日梦"的能力,靠想象代替真实试错来学复杂动作。


Dream to Control — 场景示意:这论文要解决的现实问题
Plate Nº IDream to Control — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:纯试错型 RL(D4PG / A3C 等"无模型"方法) 类比:让你在真球场上拍 1 亿次球才学会发球。能学会,但贵、慢,电费比球拍贵。论文里 D4PG 要 1 亿步真实交互才能勉强追上 Dreamer。

  • 方案 B:先学会做梦,但梦完不会自己出招(World Models 2018 / PlaNet 2018) 类比:脑子里能脑补世界长什么样,但每次该出哪招还得"实时搜索"——临到上场才一招招试,慢得要命。PlaNet 每一步决策都要用 CEM 搜 1000 条轨迹选最优,训练时间是 Dreamer 的 4 倍。

  • 方案 C:在像素空间做梦(直接想象画面) 类比:每次脑内演练都要把整张球场重新画一遍。脑子根本装不下——每帧 64x64x3 = 12288 个数字,想 50 步未来要堆 60 万数字,还要 N 个分支。

  • 方案 D:用导数自由的优化(PETS、CEM 这些) 类比:闭着眼瞎试一千个挥拍角度,挑得分最高的那个。能避开模型误差,但不用神经网络梯度等于浪费了一座金矿——梯度本来就长在那儿,告诉你"往哪个方向调更好",他们偏不用。

  • 方案 E:多步 Q 学习(MVE、STEVE) 类比:拿模型预测的奖励去帮真实试错型 AI 算账。只是辅助,不是真的全靠想象学。而且只用单步 Q 值梯度,看不远。

所以这一节是想说:之前要么贵要么慢要么短视,没人把"压缩到潜空间想象 + 解析梯度回传 + 价值函数补长程"三件事缝起来。


这篇论文的新想法

不在像素世界做梦,而是在一个压缩过的"潜空间"里做梦;做完梦还要把"梦里赚的分"沿着可微的神经网络梯度,一路反向流回去告诉策略"刚才哪步该多做"。

等等,先慢一拍——"潜空间"和"可微"是什么?

潜空间(latent space):把一张 64x64 的图(约一万两千个数字)压成几十个数字的"剧情摘要"。脑子里想"摘要"比想"原画"快几百倍。

可微(differentiable):整条链路是数学函数搭起来的,可以一路求导——意思是"分数高了 0.1 分,反推回去刚好能算出哪个动作要稍微往左偏一点点"。

三个创新缝在一起:(1) 在压缩的潜空间里想象未来,而非在像素空间;(2) 用价值函数估计想象地平线之外的长期回报,避免短视;(3) 用解析梯度而非策略梯度来训练演员网络,方差低、效率高。这三件事单独都不新——但把它们缝成一根可微的管子、做到端到端训练并跑通复杂视觉控制,是 Dreamer 的独创组合。

所以这一节是想说:Dreamer 把"想象 -> 评分 -> 改进"三件事用一根可微的管子串了起来。


它分几步做的(方法)

整个 Dreamer 由三个互相喂养的循环组成,如同一个人的学习过程:白天上课(真环境交互收集数据)、晚上做作业(学世界模型)、睡觉做梦练习(在模型里训练行为)。三者不断循环、互相促进。下面逐一拆解。

下图是三个循环互相喂养的"飞轮"结构:

        ┌──────────────────────────────────────────────┐
        │              经验池 D (真实轨迹)               │
        └──▲───────────────────────────────────┬───────┘
           │ 存入新数据                          │ 抽取批次
           │                                     ▼
   ┌───────┴────────┐              ┌──────────────────────────┐
   │ 循环3: 环境交互 │              │ 循环1: 动力学学习         │
   │ 演员+探索噪声   │              │ 图像→潜状态 s=(h,z)       │
   │ 真环境跑1000步  │              │ 学 表示/转移/奖励 模型    │
   └───────▲────────┘              │ (重建+奖励-β·KL)          │
           │ 用更好的策略           └──────────────┬───────────┘
           │                                        │ 世界模型冻结后
   ┌───────┴──────────────────────────────────────▼───────────┐
   │ 循环2: 行为学习 (纯想象)                                    │
   │  s_t ─演员→ a ─转移模型→ s_{t+1} ─...→ 想象 H=15 步         │
   │  评论家估 V_λ  →  解析梯度回传更新 演员φ / 评论家ψ         │
   └────────────────────────────────────────────────────────────┘
      每 C=100 梯度步 ↺ 跑一次真环境 (脑内:真实 ≈ 10:1)

上图说明:真实交互产生数据、世界模型消费数据、行为在想象轨迹里学习,三者靠经验池串成一个自我改进的飞轮。

总架构:三个循环

论文 Figure 3 和 Algorithm 1 画出了 Dreamer 的完整生命周期:

循环 1:动力学学习(Dynamics Learning)——从经验池抽一批真实轨迹片段,训练世界模型把观测压成潜向量、预测未来状态和奖励。

循环 2:行为学习(Behavior Learning)——从已学的潜状态出发,让演员和评论家在想象中练习 H 步,用梯度回传更新两个网络。

循环 3:环境交互(Environment Interaction)——用当前演员在真环境里执行动作、收集新数据加入经验池。

三个循环交替进行:每收集 C 步真实数据后,做一轮动力学+行为学习。下面依次深入每个循环的技术细节。


第一步:学一个会"压缩世界"的脑内模型(潜动力学)

类比

你看一段足球比赛录像。你不会把每一帧 1080p 画面存进脑子,而是抽象成一个剧情梗概:A 队 3 号球员控球到中线、传给 7 号、7 号射门、进了。下次回忆这场比赛,你脑子里其实只剩这串"剧情向量"。Dreamer 的世界模型干的就是这事。

模型结构:RSSM

RSSM(Recurrent State Space Model,循环状态空间模型):Dreamer 的世界模型骨架。名字拆开看——"Recurrent"说明有时间链(RNN),"State Space"说明用隐状态描述世界,"Model"说明它是个学出来的模型。

RSSM 的核心设计是把每个时刻的潜状态 s_t 拆成两部分:

  1. 确定性状态 h_t(一条 GRU/RNN 的隐状态)——记住历史信息,类比"你记得前面发生了什么"。
  2. 随机状态 z_t(从一个高斯分布里采样)——表达不确定性,类比"下一秒可能有好几种走向"。

两条线并行运作:确定性链负责"记忆累积",随机部分负责"表达世界的随机性"。完整的潜状态 s_t = (h_t, z_t) 就是 Dreamer 对"此刻世界全貌"的压缩表示。

三个子模型

RSSM 由三个子模型组成,对应论文的公式 (1):

子模型 数学符号 输入 输出 人话
表示模型 p(s_t | s_{t-1}, a_{t-1}, o_t) 上一步状态 + 动作 + 当前图像 当前潜状态 "看了真图,把世界压成摘要"
转移模型 q(s_t | s_{t-1}, a_{t-1}) 上一步状态 + 动作 预测的下一步潜状态 "不看图,纯靠想象往前推一步"
奖励模型 q(r_t | s_t) 当前潜状态 预测奖励 "在这个状态能拿多少分"

关键区别:表示模型需要看真实图像(用于训练时"校准"),转移模型不看图像(用于"做梦"时独立预测)。这就是"做梦"的核心机制——转移模型能脱离真实观测自行推演未来。

训练目标:让梦和现实对得上

世界模型的训练用的是变分下界(ELBO),翻译成人话就是三个要求同时满足:

ELBO(Evidence Lower Bound,证据下界):一种训练"编码-解码"类模型的标准损失函数。核心思想是:编码后的摘要应该能还原出原始数据,同时编码过程不能太"记死"——要保持一定的压缩性。

  1. 观测重建(J_O):把潜向量解码回图像,和真图越像越好。人话——"你的摘要得能还原出原画"。
  2. 奖励预测(J_R):用潜向量预测奖励,和真奖励越近越好。人话——"你的摘要得能判断分数"。
  3. KL 正则(J_D):表示模型的输出(看了真图的)和转移模型的输出(没看真图的)不能差太远。人话——"你'看了答案后的理解'和'没看答案的猜测'要一致",否则做梦时猜得太离谱。

写成公式(论文 Eq. 10,用人话翻译):

总损失 = 重建图像的准确度 + 预测奖励的准确度 - β × (看图版 vs 不看图版的差异)

其中 β 是一个平衡系数,控制"压缩程度"。β 太小,模型记太多无关细节;β 太大,模型丢掉有用信息。

具体网络结构

论文 Appendix A 给出了所有细节:

  • 编码器(图像 -> 潜向量):4 层卷积神经网络(CNN),kernel 4x4,stride 2,通道数 32/64/128/256,激活函数 ReLU。把 64x64x3 的图像压成 1024 维的平坦向量,再通过全连接层得到 GRU 输入。
  • GRU(确定性链):隐状态维度 200。每一步接收上一步隐状态 + 上一步动作 + 上一步随机状态,输出新隐状态。
  • 随机状态:从 GRU 隐状态通过两个全连接层分别输出均值和标准差(各 30 维),形成 30 维高斯分布,采样得到随机状态 z_t。
  • 解码器(潜向量 -> 图像):反卷积网络,是编码器的镜像。用于训练时提供重建损失。
  • 奖励预测器:3 层全连接网络(隐藏层 300 维),输入潜状态,输出标量奖励。

为什么这步有用

  • 一旦剧情向量足够好,"想象一千个未来"只是 1000 次低维向量计算——比想象 1000 个 12288 维图像便宜几百倍,可以在 GPU 上大规模并行。
  • 论文 Figure 5 给了一个震撼实验:只看前 5 帧,让模型自己预测后 45 帧——RSSM 在视觉上几乎 1:1 还原了物理运动。说明剧情向量真的抓住了世界规律。
  • KL 正则确保"不看图的猜测"和"看了图的理解"对齐——这是后续做梦时预测质量的基石。

所以这一节是想说:先教 AI 把世界压成一串剧情向量,再教它在这个空间里"快进时间"看未来。RSSM 的确定性+随机性双线设计是 Dreamer 梦境质量的关键。


第二步:在梦里同时学"出招"和"打分员"(演员-评论家)

类比

你脑内打网球时其实在干两件事:

  • 出招的你(Actor / 行动者):模拟出"这一拍我侧身回斜线"。
  • 打分的你(Critic / 评论者):边模拟边打分——"嗯,这一拍打过去对面接不到,预计本回合赢"。

两个"你"互相喂养:打分员告诉行动者哪种出招更值钱,行动者再去试新招让打分员重新校准。这就是**演员-评论家(actor-critic)**框架。Dreamer 的特别之处在于——这场网球完全在脑子里打,不上真球场

想象过程的具体流程

每次训练循环中,行为学习按以下步骤进行:

  1. 选起点:从经验池里随机抽一批真实轨迹片段,用表示模型把它们编码成潜状态序列。这些潜状态就是"梦的起点"。

  2. 展开想象轨迹:从每个起点 s_t 出发,完全脱离真实数据,在想象中往前走 H=15 步。每一步:

    • 演员网络看当前潜状态 s_τ,输出动作 a_τ
    • 转移模型用 (s_τ, a_τ) 预测下一步潜状态 s_{τ+1}
    • 奖励模型预测这一步拿多少分 r_τ
    • 评论家网络预测从这步往后总共能拿多少分 v(s_τ)
  3. 计算回报估计:用 V_λ 公式综合各步的奖励和价值预测(下面详细解释)。

  4. 更新演员:让演员参数朝"整条想象轨迹总分更高"的方向挪动。

  5. 更新评论家:让评论家的预测更接近 V_λ 的估计值。

整个过程中世界模型参数冻结——只训练演员和评论家。

演员网络的细节

演员网络是一个 4 层全连接网络(隐藏层 300 维,ELU 激活),输入是潜状态 s_τ(230 维 = 200 维确定性 + 30 维随机性),输出动作的均值 μ 和标准差 σ。

动作的生成过程(论文 Eq. 3):

a_τ = tanh(μ_φ(s_τ) + σ_φ(s_τ) * ε),  ε ~ Normal(0, I)

人话:给定剧情向量,神经网络吐出"动作的均值和不确定度",然后骰一个标准正态噪声 ε,按这个不确定度抖一抖、再用 tanh 压到 [-1, 1] 区间,就是这次的动作

重参数化(reparameterization):把"从分布里随机抽样"改写成"确定性变换 + 外部噪声"的形式。这样做的好处是——梯度可以穿过这个采样操作,一路传回网络参数。如果不用重参数化,采样操作是个"黑箱",梯度到这里就断了。

评论家网络的细节

评论家网络结构和演员类似(4 层全连接,300 维隐藏层),输入潜状态,输出一个标量——对当前状态"从这里往后能拿多少总分"的预测。

V_λ:多视野估计的精妙设计

这是 Dreamer 行为学习中最核心的数学工具。论文用了三层递进来解释:

第一层:只看想象轨迹里的奖励(V_R,Eq. 4)

V_R(s_τ) = r_τ + γ*r_{τ+1} + γ²*r_{τ+2} + ... + γ^(H-τ)*r_{t+H}

人话:"把从 τ 到地平线 H 的所有想象奖励加起来(远的打折扣)"。问题:看不到 H 步之后的回报——短视。

第二层:用价值函数兜底(V_N^k,Eq. 5)

V_N^k(s_τ) = r_τ + γ*r_{τ+1} + ... + γ^(k-1)*r_{τ+k-1} + γ^k * v(s_{τ+k})

人话:"看 k 步真实想象奖励,然后用评论家的预测补上后面所有的"。k 小则偏差大但方差小(评论家可能不准,但稳定);k 大则偏差小但方差大(想象可能累积误差)。

第三层:用指数加权平均(V_λ,Eq. 6)

λ-return(V_λ):把"只看 1 步再用评论家补"、"只看 2 步再补"、"只看 3 步再补"......所有不同视野的估计,按 λ 的指数权重求平均。λ=0 相当于纯用评论家(TD(0));λ=1 相当于纯用想象奖励(Monte Carlo)。Dreamer 用 λ=0.95。

V_λ(s_τ) = (1-λ) * [V_N^1(s_τ) + λ*V_N^2(s_τ) + λ²*V_N^3(s_τ) + ...] + λ^(H-1)*V_N^H(s_τ)

人话:"兼顾所有不同远近的视野,近处看得清的占多一点(因为 λ<1 所以远处权重指数衰减),但远处也不完全丢掉。"

这个设计的妙处在于:当世界模型在近处预测很准时,短视野估计可靠、权重大;当需要看到远处大回报时,长视野估计也在里面。两者自动平衡。

训练目标(论文 Eq. 7 & 8)

演员目标:让整条想象轨迹的 V_λ 总和最大:

max_φ  Σ_{τ=t}^{t+H} V_λ(s_τ)

评论家目标:让评论家的输出尽量接近 V_λ 估计值:

min_ψ  Σ_{τ=t}^{t+H} (1/2) * (v_ψ(s_τ) - sg[V_λ(s_τ)])²

其中 sg[·] 表示 stop-gradient——训练评论家时,V_λ 被当作固定目标,梯度不通过它流动。否则演员和评论家会互相搅乱。

为什么这步有用

  • 用价值函数填补"看不见的未来":H=15 步以外的奖励,让评论者的预测顶上去。这就避开了"短视"——只看 15 步会错过那些 30 步之后才到来的回报。
  • Figure 4 的实验:Dreamer 在 H=10 和 H=40 时表现差不多;而没有价值函数的版本("No value")随着 H 增大才慢慢爬上来,性能对 H 很敏感。
  • 没有价值函数,等于打网球时只看眼前两秒——你永远学不会布局长回合。

所以这一节是想说:梦里同时训"出招 + 打分员",V_λ 的多视野混合让 AI 既能看远又算得稳。


第三步:用解析梯度直接告诉演员"哪步该多做"

类比

你是个篮球教练,看完一场比赛复盘。

  • 传统方法(REINFORCE / PPO):你只能告诉队员"上半场总分高 -> 整体多做这种打法"。粗放,因为你不知道具体是哪一回合贡献了高分
  • Dreamer 方法:因为整场比赛是你在脑子里模拟的(而且每个环节都是"可微"的神经网络),你可以精确算出:"那次第 7 分钟的传球,对终场比分的贡献是 +3.2 分;如果当时角度多偏 5 度,预计能 +4.1 分"。

这种"具体到每个动作的导数"叫解析梯度(analytic gradient)

梯度流动的完整链路

理解 Dreamer 的精髓,关键是看清梯度从"最终得分"到"演员参数"经过了哪些环节:

演员参数 φ
  ↓ (演员网络)
动作 a_τ
  ↓ (转移模型,可微)
下一状态 s_{τ+1}
  ↓ (转移模型,继续推...)
更远状态 s_{τ+2}, s_{τ+3}, ...
  ↓ (奖励模型 + 评论家)
V_λ 估计值
  ↓ (求导 ∂V_λ/∂φ)
梯度流回演员参数

每一步都是神经网络的前向计算——反向传播可以一路穿回去。关键技术点:

  1. 随机状态的采样用重参数化处理,梯度能穿过。
  2. 动作的采样同样用重参数化(tanh-Gaussian),梯度能穿过。
  3. 世界模型参数 θ 冻结(stop-gradient),只更新演员参数 φ。

解析梯度 vs 策略梯度的核心区别:策略梯度(REINFORCE)靠"采样回报 x log 概率"估计梯度——本质是"这条轨迹总分高 -> 整体概率提高",不知道具体哪步贡献大,方差极高。解析梯度直接用链式法则精确算出每一步对总分的微分,方差低几个数量级。代价是需要整条链可微——而 Dreamer 恰好满足这个条件。

与 DDPG/SAC 的关键区别

DDPG 和 SAC 也用解析梯度训练演员,但它们只用"单步 Q 值"的梯度:

DDPG: ∂Q(s, a)/∂φ  ← 只看一步
Dreamer: ∂[Σ V_λ(s_τ)]/∂φ  ← 看多步想象轨迹

DDPG 的梯度只告诉你"此刻做什么动作 Q 值最高";Dreamer 的梯度告诉你"此刻做什么动作,让接下来 15 步的总 V_λ 最高"。多步梯度意味着长程信用分配——你能学到"先蹲下(短期扣分)是为了后面跳得更高(长期加分)"这种策略。

实际训练的数值细节

  • 批次大小 B=50 条序列,每条 L=50 步
  • 想象时域 H=15
  • 学习率 α=6e-4(Adam 优化器)
  • 折扣因子 γ=0.99
  • λ=0.95
  • 梯度裁剪:全局梯度范数不超过 100

为什么这步有用

  • 解析梯度的方差比策略梯度低几个数量级——同样的样本量能学得更准。
  • DDPG、SAC 也用解析梯度,但它们只用"单步 Q 值"的梯度, 看不远;Dreamer 用"多步价值"的梯度,看得远。这是它和 SAC 这一系最关键的差别。
  • 实验结果:Dreamer 用 5×10⁶ 步交互达到 823 平均分;D4PG 要 10⁸ 步(多 20 倍)才达到 786。梯度信息利用得越好,样本越省。

所以这一节是想说:因为整场梦是可微的,可以精确算出"哪步动作往哪个方向调",比传统 RL 的粗放反馈高效得多。


3.4 表征学习:怎么让"梦"长得像真世界

类比

学画画时老师让你做三种练习:(A) 看一眼苹果转身画出来——逼你记住完整结构;(B) 在一堆水果照片里挑出哪两张是同一个苹果——只要分得清就行;(C) 只记住这苹果"甜度 7 分"——根本没看形状。三种练习练出来的画工天差地别。Dreamer 的世界模型也面临这个选择:让它学着"重建图片"、"分清哪张配哪张"、还是"只记奖励分"?

它在干什么

Dreamer 算法本身和"怎么压缩世界"是解耦的——你换不同的世界模型训练目标都行。论文比了三种:

  • 图像重建 (reconstruction):让模型把潜向量解码回原图。最有效,绝大多数任务上最强。具体损失包含三项:观测重建 ln q(o_t|s_t) + 奖励预测 ln q(r_t|s_t) - KL 散度正则项。
  • 对比学习 (contrastive / NCE):不重建图像,只让"潜向量配对图像"分得清。用 NCE 损失——让正配对的互信息高于负配对。能解决一半任务。
  • 只预测奖励 (reward only):完全不管像素,只让奖励预测对。不够——Figure 8 显示几乎完全学不会走路。

NCE (Noise Contrastive Estimation):对比学习损失之一,靠"区分真配对 vs 假配对"间接学表征。

信息瓶颈 (Information Bottleneck):理论框架,让模型只保留对预测有用的信息,丢掉无关细节。KL 正则项就是瓶颈的具体实现——β 越大,压缩越狠。

具体损失函数翻译成人话

重建目标 J_REC = 观测重建 + 奖励预测 - β × KL 散度

人话:"画回去越像越好" + "猜对奖励" - "不要让每一步的压缩太精细(防止过拟合)"。β 是个旋钮:调大了模型会更泛化但丢细节,调小了记得清楚但可能过拟合训练数据。Dreamer 用 β=1。

为什么图像重建最强

  • 重建是最"无损"的监督信号——模型被逼着记住画面中所有可能与未来奖励相关的东西,不管你现在知不知道哪些相关。
  • 对比学习只需要"分得清",不需要"记得全",所以会丢掉一些细节——这些细节可能恰好在某些任务里很关键。
  • 只预测奖励更极端:奖励稀疏时几乎没有学习信号,模型学到的表征空空如也。

所以这一节是想说:图像重建是当前最有效的"造梦原料";只看奖励的偷懒法不够。


3.5 环境交互:从梦中醒来验证一下

类比

国际象棋大师在脑子里复盘完一百盘棋,还是得去下几盘真棋来校准自己的判断——"我以为这步能赢,实际上对手有我没想到的反击"。真实对弈的数据用来更新脑内模型,然后回家继续在脑子里练。

它在干什么

算法的第三个循环:

  1. 用当前策略(演员)在真实环境里走 T=1000 步,收集 (观测, 动作, 奖励) 三元组。
  2. 把这些数据存进经验池 D(一个大数据库)。
  3. 下次训练世界模型和行为模型时,从 D 里随机抽批次来用。

具体流程:每隔 C=100 个梯度步(即做了 100 轮"学模型 + 学行为"的更新后),去真环境跑一个完整 episode(1000 步)。初始化时先用 5 个随机策略的 episode 填充经验池。

探索噪声

在真环境交互时,会给演员的输出加一个小扰动(additive Gaussian noise σ=0.3),鼓励它偶尔偏离已学策略去尝试新动作——这是标准的"探索"技巧。

为什么这步有用

  • 纯靠想象永远学不会——因为世界模型有误差,如果不用真实数据校准,误差会越积越大。
  • 真实数据也不能太多——否则就退化成传统 model-free RL 了。Dreamer 的设计是"100 步脑内训练 : 1000 步真实交互"的比例,大约 10:1,兼顾效率和准确性。
  • 经验池可以无限增长,越早期的数据也能反复利用——这是"离线学习"的优势。

所以这一节是想说:做梦再多也得定期睁眼看看真世界,用真实数据校准脑内模型。


3.6 三个循环如何协作(整体训练流程)

把上面五步缝起来,Dreamer 的完整训练循环是:

while 没收敛:
    for c = 1 到 C:   # C=100 个梯度步
        从经验池 D 随机抽 B=50 条长度 L=50 的序列
        用表示模型编码成潜状态序列 s_1, ..., s_50
        用重建/对比/奖励损失更新世界模型 θ
        从每个 s_t 出发想象 H=15 步轨迹
        计算 V_λ 估计
        更新演员 φ(最大化 V_λ)
        更新评论者 ψ(回归 V_λ 目标)
    # 环境交互
    用演员 + 探索噪声跑一个 episode(1000 步)
    把数据加进 D

关键设计原则:

  • 世界模型训练和行为学习交替进行但互不干扰——更新行为时冻结世界模型参数。
  • 行为完全在想象中学——演员和评论者从未直接接触真实环境的梯度信号。
  • 经验池是三者的纽带——真实交互产生数据,世界模型消费数据,行为在世界模型产生的想象轨迹中学习。

所以这一节是想说:三个循环(学世界、学行为、收集数据)互相喂养、交替运行,形成一个自我改进的飞轮。


下图放大 RSSM 的双线结构与"想象轨迹上解析梯度回流"的关键机制:

【RSSM 潜状态:确定性链 h + 随机快照 z】
   o_t(真图)──CNN编码──┐
                       ▼
   h_{t-1} ─────► GRU ───► h_t  (确定性记忆链)
   a_{t-1},z_{t-1}─┘       │
                          ├─表示模型 q(z|h,o) ◄─看真图(训练校准)
                          ├─转移模型 p(z|h)   ◄─不看图(做梦独立推演)
                          ▼
                    z_t (随机快照) ── s_t=(h_t,z_t)

【想象展开 + 解析梯度回流(整条链可微)】
   演员φ         演员φ         演员φ
     │            │            │
     ▼            ▼            ▼
   s_t ──转移──► s_{t+1} ──转移──► s_{t+2} ── ... ── s_{t+H}
     │            │            │                      │
   奖励/评论家   奖励/评论家   奖励/评论家          评论家兜底
     └────────────┴─── V_λ 多视野加权 ───┴──────────────┘
                        │ ∂V_λ/∂φ 沿可微链反传
                        ▼
              更新演员φ (方差比策略梯度低几个数量级)

上图说明:RSSM 用"确定性记忆 h + 随机快照 z"压缩世界;行为学习在想象轨迹上用 V_λ 综合远近视野,再靠解析梯度精确告诉演员每步该往哪调。


Dream to Control — 方法示意:核心 pipeline
Plate Nº IIDream to Control — 方法示意:核心 pipeline

关键数字(What works)

指标 Dreamer 对比方 含义
20 任务平均分 823(5×10⁶ 步) D4PG 786(10⁸ 步) 样本效率高 20 倍,分数还更高
单任务训练时间 3 小时/百万步 PlaNet 11h, D4PG 24h 计算效率高 3-8 倍
Hopper Hop 369 PlaNet 0.4, A3C 0.5 长程信用分配任务碾压
想象时域敏感性 H∈[10,40] 稳定~800 No-value H=10 只有 200 价值函数兜底让超参不敏感
表征消融 重建800 > 对比半数 > 奖励~0 图像重建是最强监督信号
超参通用性 20 任务同一组超参 PlaNet 需逐任务调 工程友好,鲁棒性强

所以这一节是想说:在样本效率、计算效率、长程任务表现、稳健性四个维度同时碾压,是 model-based RL 第一次做到全面碾压 model-free。


实验结果说明了什么

论文的实验回答了四个核心问题:

问题 1:Dreamer 能否同时兼顾样本效率和最终性能? Figure 6 的柱状图给出了肯定答案——用 1/20 的数据量超过了 D4PG,同时继承了 PlaNet 的数据效率。这打破了此前"model-based 效率高但天花板低"的刻板印象。

问题 2:价值函数对长程任务到底有多重要? Figure 4 和 Figure 7 联合说明:Hopper Hop 这种"先蓄力再起跳"的任务,没有价值函数的版本("No value")分数趋近于零。因为蓄力阶段在 H=15 步内看不到奖励,只有价值函数能"代表"远处的回报告诉演员"现在蹲下是值得的"。

问题 3:不同表征学习方法对 Dreamer 性能影响多大? Figure 8 清楚展示了层次关系。这说明 Dreamer 算法本身是通用的——未来更好的表征学习方法(比如后来 DreamerV3 的 symlog 预测)可以直接插进来获益。

问题 4:Dreamer 是否需要逐任务调参? 所有 20 个连续控制任务用完全相同的超参数,这在当时 model-based RL 领域非常罕见。PlaNet 需要调动作重复次数,D4PG 需要调网络结构——Dreamer 不需要。这是工业界采用的重要前提。

所以这一节是想说:实验系统性地证明了 Dreamer 在效率、长程规划、表征灵活性和工程鲁棒性四个维度的优势。


你应该懂的几个新词

强化学习 (Reinforcement Learning, RL):通过试错 + 奖励信号学行为的范式。AlphaGo、ChatGPT 的 RLHF 都属于此。

世界模型 (World Model):AI 心里那个"环境怎么演化"的模型,可以用来"在脑子里模拟"。Dreamer 是把世界模型用到登峰造极的代表作。

潜空间 (latent space) / 潜动力学 (latent dynamics):把高维输入压缩成低维向量后所在的空间。Dreamer 用 30 维确定性 + 30 维随机性组合。

想象 (imagination):在世界模型里"快进时间"看可能的未来轨迹,不需要真去环境里走。

演员-评论家 (actor-critic):两个网络,一个出招 (actor / policy / action model),一个打分 (critic / value model)。Dreamer 的核心结构。

价值函数 (value function, V):状态打分函数。"从这状态往后总共能拿多少分"。

解析梯度 (analytic gradient):通过反向传播精确算出的导数。相对于"采样估计的策略梯度"方差低很多。

重参数化 (reparameterization):把随机采样改写成"确定性变换 + 标准噪声",让梯度能穿过采样这一步。

POMDP (Partially Observable Markov Decision Process):标准 RL 形式化,承认"你只看到部分观测,得自己脑补"。视觉控制天然是 POMDP。

RSSM (Recurrent State Space Model):Dreamer 用的具体世界模型结构,确定性 RNN 隐状态 h_t + 随机潜变量 z_t 两条线并行。h_t 负责记忆,z_t 负责表达不确定性。

DM Control Suite:DeepMind 发布的连续控制基准,包括走路、跳跃、平衡杆等 20 多个任务。Dreamer 把它当主战场。

样本效率 (sample efficiency):拿到好性能需要多少真实交互步数。model-based 方法的核心卖点就是样本效率。

λ-return (V_λ):把不同展望长度的价值估计按指数衰减加权平均,兼顾偏差和方差。TD(λ) 的推广。

所以这一节是想说:上面这些词是 model-based RL 这条路的基本词汇表,Dreamer 把它们的标准用法定型了。


它有什么搞不定的

  1. 离散动作(Atari)打不过 model-free:原文 Appendix C 老实承认,在 Atari 这种动作离散、画面复杂的环境上,Dreamer 还赢不过 Rainbow / IMPALA。重参数化技巧对离散动作不如连续动作自然——需要用 straight-through 估计器,精度打折。要等 DreamerV2(2021)把随机变量改成 categorical 才追上。

  2. 奖励稀疏到极端时仍然会卡:纯奖励驱动学世界模型时几乎瘫痪(Figure 8)。说明世界模型本身得有"额外信号"(图像重建)才稳定。如果任务连图像重建都帮不上(比如奖励和视觉线索完全无关),Dreamer 也会挣扎。

  3. 想象的世界不等于真实世界——误差累积:模型再准也有误差,长想象时域里误差会累积——所以 Dreamer 才不得不靠价值函数兜底。纯靠想象推到底是不现实的。论文选择 H=15 而非 H=100 正是因为更长的想象可信度下降。

  4. 不能处理高分辨率或 3D 大规模场景:64×64 像素的卡通仿真环境是它的舒适区。真实机器人摄像头分辨率高、光照变、纹理复杂,CNN 编码器和转置 CNN 解码器扛不住。得等 DreamerV3 引入更大模型和 symlog 归一化。

  5. 没有内在探索机制:Dreamer 只靠"动作加噪声"做探索,没有好奇心驱动或信息增益驱动的主动探索。在稀疏奖励环境中可能长时间收集不到有意义的数据。后续 Plan2Explore (2020) 补了这块。

  6. 单任务学习,不能迁移:每个任务从零训一个世界模型。学会了"走路"的模型不能直接拿去"跑步"——得重新训。通用世界模型要等 Genie / Cosmos 这一代。

所以这一节是想说:Dreamer 是连续控制 + 简单视觉的霸主,但离散动作、真实复杂场景、稀疏探索和跨任务迁移还得等续作。


它和别的几篇是什么关系

放到我们这批已经读过的笔记里:

  • vs LLaVA / 多模态 VLM:LLaVA 教 AI"看图说话",Dreamer 教 AI"想象未来动作"。一个偏感知,一个偏决策。但都体现了"用大模型把世界压缩成有用表示"的共同套路。
  • vs SayCan / OpenVLA:SayCan 让大语言模型当机器人的"高层规划师",OpenVLA 端到端从图直接吐动作。Dreamer 是另一条腿——自己学一个世界模型,再在里头做梦。这条腿后来发展成 DreamerV3、DayDreamer,可以跑真机器人。
  • vs Cosmos World Foundation Model:NVIDIA Cosmos 是把"世界模型"思路放大到大规模视频预训练的版本。可以理解成 Dreamer 的精神后裔——压缩→想象→学策略。Cosmos 用 Transformer 替了 RSSM,规模拉到几亿参数。
  • vs 模仿学习类论文:模仿学习(如行为克隆)需要专家数据;Dreamer 完全自己探索 + 想象,不需要演示。
  • 历史脉络:World Models (2018) → PlaNet (2018) → Dreamer (2020, 本篇) → DreamerV2 (2021, 攻克 Atari) → DreamerV3 (2023, 一组超参跑 150 个任务) → DayDreamer (真机器人) → 各种衍生(IRIS、TWM、Genie、Cosmos)。

所以这一节是想说:Dreamer 是 model-based RL 这条主线的"成年礼"——之后所有"AI 自己造梦学动作"的工作都从它出发。


和本导读的关系

本导读 Ch15(世界模型)的核心命题是:让机器人在脑中建立环境的心理模型,在想象中练习和规划,而不是每次都付出真实互动的代价。Dreamer 正是这个命题的"成年礼"论文——它第一次把"想象轨迹在潜空间中展开,然后用解析梯度优化策略"这条技术路线做到在 20 个视觉控制任务上全面超越 model-free 方法。

具体来说,Ch15 描述的 World Models 演化路径是 Ha (2018) → PlaNet (2018) → Dreamer (2020) → DreamerV2/V3 → Genie → Cosmos。Dreamer 在这条线上的角色是:

  • 承上:继承了 PlaNet 的 RSSM 世界模型,但去掉了在线规划(CEM),换成了训练好的演员网络——把"实时搜索"变成"提前练好直接出招"。
  • 启下:确立了"潜空间想象 + 演员-评论家 + 解析梯度"的范式,后续 DreamerV2/V3 只是在这个框架上改细节(categorical 潜变量、symlog 预测、KL balancing)。
  • 方法论贡献:证明了 model-based RL 可以同时做到样本高效和性能高——这打破了此前"model-based 天花板低"的误解。

所以这一节是想说:Dreamer 是 Ch15 "世界模型"章节的技术锚点——读懂它就理解了这条路线从"能跑"到"能用"的关键跨越。


思考题

Q1:RSSM 为什么要同时有"确定性路径"(RNN 隐状态 h_t)和"随机路径"(潜变量 z_t)?只用一条行不行?

提示想想确定性路径擅长记忆什么、随机路径擅长表达什么。如果世界是完全确定的(比如简单钟摆),只有 h_t 够吗?如果世界有很多随机性(比如掷骰子),只有 z_t 够吗?

Q2:为什么 Dreamer 用 V_λ 而不是直接用"纯想象回报" V_R(就是直接加 H 步的奖励)?V_R 有什么问题?

提示想想 H=15 步以后的奖励怎么办。V_R 相当于假设"15 步之后世界结束了",这对哪些任务影响最大?Figure 4 的"No value"曲线就是用 V_R 的效果。

Q3:假设世界模型完全准确(误差为零),Dreamer 还需要价值函数吗?能不能直接把 H 设成无穷大?

提示即使模型完全准确,H=无穷大意味着什么?计算量、内存、梯度消失/爆炸——哪个先成为瓶颈?实际上 DreamerV3 仍然用 H=15 即使模型更强了,为什么?

Q4:Dreamer 的演员用重参数化采样(tanh Gaussian),如果动作空间是离散的(比如 Atari 的上下左右),这个技巧还能用吗?论文怎么处理的?

提示离散变量不能直接求导("往左偏一点点"没有意义)。论文 Section 3 提到了 straight-through gradients——这是什么?为什么精度会打折?DreamerV2 用什么替代方案解决了这个问题?

Q5:图像重建为什么比"只预测奖励"效果好那么多?从信息论角度想——重建目标逼模型保留了哪些信息,而纯奖励目标允许模型丢掉什么?

提示想想信息瓶颈:纯奖励目标只要求模型保留"和奖励相关"的信息,但训练初期奖励信号稀疏时模型根本不知道什么和奖励相关,于是什么都不学。重建目标强制保留"能画回图片"的全部信息——这是一种"宁可多记也不漏"的策略。

Q6:Dreamer 在 Hopper Hop 上拿 369 分,而 PlaNet(同样有世界模型但没有演员/价值函数)拿 0.4 分。为什么差距这么大?这个任务有什么特殊?

提示Hopper Hop 要求先蹲下蓄力(短期奖励为 0 甚至为负),然后才能跳起来拿分。PlaNet 用在线规划(CEM)只看 H 步内的奖励,如果蹲下的成本在 H 步内都看不到回报,CEM 就永远不会选择"蹲下"。

Q7:如果你要把 Dreamer 部署到一个真实机械臂上(比如抓杯子),你预期会遇到哪些原论文没解决的困难?至少列三个。

提示想想:(1) 真实摄像头的分辨率和光照变化 vs 64×64 卡通画面;(2) 真实世界没有"重置"按钮——episode 之间怎么办;(3) 安全约束——想象中可以摔一千次但真实中不行;(4) 动作延迟——真实电机有响应时间。DayDreamer (2022) 正是解决这些问题的工作。

所以这一节是想说:这些问题覆盖了 RSSM 结构设计、价值估计、表征学习、离散动作和真实部署五个维度,能验证你是否真正理解了 Dreamer 的设计动机。


一些好奇心问答(FAQ)

Q1:为什么不用真实图像做梦,而要在潜空间?

潜空间小(30+30=60 维 vs 12288 维),可以并行想象几千条轨迹;图像空间想象一条都嫌慢。而且在潜空间做梦可以让梯度直接流过——如果在像素空间想象,你得对一个 64×64 的图做反向传播,既慢又容易梯度爆炸。

Q2:Dreamer 是不是 supervised learning 的强化版?

不完全是。它确实有监督部分(奖励预测、图像重建属于监督学习),但"怎么出招"那部分是 RL(自己探索、自己造数据、自己评分)。可以说是"监督学世界 + 强化学行为"的混合体。

Q3:H=15 是怎么定的?

经验值。Figure 4 显示 H 在 [10, 40] 区间分数差不多,说明价值函数把它调宽容了。原文用 H=15 在所有连续任务上都跑——足够让梯度传递有效信号,又不会让模型误差累积太多。

Q4:为什么"做梦"梦得准是可能的?

DM Control Suite 是仿真环境——物理规则简单(牛顿力学)+ 画面卡通。Figure 5 的实验显示模型只看 5 帧能预测后 45 帧。真实复杂环境(猫从沙发跳下打翻水杯)梦不准,所以 DreamerV3 才需要更大模型。

Q5:训练 Dreamer 要多少卡?我能跑吗?

单张 V100 + 10 CPU 跑一个任务大约 12-15 小时(500 万步)。GitHub 上原作者放了完整代码(TF1 版本)。社区也有 PyTorch 复现(dreamerv2 仓库向下兼容 V1 配置)。研究生硬件够用。

Q6:演员是确定性还是随机性策略?

随机性。输出"动作均值 + 标准差"的高斯分布(再用 tanh 压到 [-1, 1])。重参数化让梯度可以穿过采样。训练时随机性鼓励探索;部署时可以取均值变成确定性策略。

Q7:奖励稀疏的时候 Dreamer 还行吗?

部分行。Cartpole Swingup Sparse 这种"扔出杆子才有 1 分"的任务上 Dreamer 拿 812(D4PG 482,PlaNet 0.6)。但完全没奖励信号的环境(纯探索)不行——它没有内在好奇心机制。后续 Plan2Explore 补了这块。

Q8:和 SAC 这种 model-free 的最强代表比,Dreamer 强在哪?

主要是样本效率。SAC 也用解析梯度(重参数化),但它只能用"环境真实数据 + 单步 Q"。Dreamer 在脑内造了无穷数据 + 多步价值,每步真交互价值是 SAC 的 10-20 倍。但是 SAC 在大规模真实任务(比如真机器人 360 度全转)目前还更稳——因为它不依赖世界模型的准确性。

所以这一节是想说:Dreamer 是仿真环境的样本效率冠军,但稀疏奖励、复杂感知、真机部署这些工程问题还有空间。


如果你想再深入

按"前传 → 续作 → 衍生 → 实战"四类排序:

  1. 前传:World Models (Ha & Schmidhuber, 2018) — 第一次提出"AI 在脑子里学世界模型 + 在梦里训练策略"的端到端范式。Dreamer 是它的"端到端训练 + 解析梯度"升级版。
  2. 前传:PlaNet (Hafner et al., 2018) — 同一作者的前作。引入 RSSM,但出招靠在线规划而非演员。读完 Dreamer 再读 PlaNet,会发现"加一个演员"的改进多么关键。
  3. 续作:DreamerV2 (Hafner et al., 2021) — 攻克离散动作(Atari),把 RSSM 的随机变量改成 categorical。第一次让纯 model-based 在 Atari 击败 Rainbow。
  4. 续作:DreamerV3 (Hafner et al., 2023) — 一组超参跑 150 多个任务,包括 Minecraft "钻石挑战"。引入 symlog 预测、KL balancing、free bits 等稳定性 trick。
  5. 衍生:DayDreamer (Wu et al., 2022) — 把 Dreamer 直接搬到真机器狗、机械臂上。证明"想象学习"在真实硬件上也能省样本。
  6. 衍生:Plan2Explore (Sekar et al., 2020) — 补 Dreamer 不会主动探索的弱点,加内在好奇心。
  7. 教材:Sutton & Barto, Ch8 (Dyna 架构) — Dreamer 的精神祖先。Dyna-Q 在 1991 年就提出了"用学到的模型生成模拟经验来加速学习",Dreamer 可以看成 Dyna 的深度学习时代升级版。

如果你想把这条主线串起来,World Models → PlaNet → Dreamer → DreamerV3 是必读四件套。

所以这一节是想说:把 Dreamer 放进 Hafner 的研究序列里读,能清楚看到 model-based RL 这条路怎么从玩具发展到能解 Minecraft 钻石挑战。


原文信息

@inproceedings{hafner2020dream,
  title     = {Dream to Control: Learning Behaviors by Latent Imagination},
  author    = {Hafner, Danijar and Lillicrap, Timothy and Ba, Jimmy and Norouzi, Mohammad},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year      = {2020},
  url       = {https://arxiv.org/abs/1912.01603}
}

所以这一节是想说:提供完整引用和资源链接,方便后续查阅和复现。

引用本笔记 / Cite this note
BibTeX
@online{eai_dreamer_v1_2026,
  title       = {(readable note) Dream to Control: Learning Behaviors by Latent Imagination},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2020 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/dreamer-v1/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?