Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 149

Transformers are Sample-Efficient World Models

15 min read · 5347 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

把游戏画面切成一格格"积木",让 AI 像写句子一样接龙下一帧,然后让它在脑子里"自己跟自己玩"练强化学习——只玩两小时就接近人类水平。

所以这一节是想说:IRIS 用"图像 token + Transformer 世界模型 + 想象中训练"把强化学习的样本效率大幅拉高。


这是个什么场景

你小时候肯定干过:玩一个新游戏卡住了,晚上躺床上闭着眼"在脑子里复盘"——按左会怎样、按右会怎样、这个鬼会从哪边来。第二天再开机,手感明显变好了。

人类学游戏其实只玩了几小时,但 AI 玩雅达利往往要"刷"上亿局才能玩明白。差距就在这——人能在脑子里"过电影"自己练,AI 通常只会硬刷。

IRIS 想让 AI 也学会这套"脑内模拟":

  • 常见做法(Model-free RL,无模型强化学习):AI 必须真在游戏里反复死,靠死出来的经验更新策略——慢且贵。
  • 基于模型的做法(Model-based RL,有模型强化学习):AI 先学一个"小型游戏模拟器"装在脑子里,大部分练习都在脑内模拟器里完成,省掉真打。
  • IRIS 的小聪明:它脑内的模拟器不直接"画"下一帧(画图容易糊),而是把画面切成小"乐高积木",像写句子一样一块一块接龙预测——这正好是 Transformer(写文章那种 AI)的强项。

换句话说,IRIS 把"预测下一帧画面"变成了"写下一句话"。

世界模型(World Model):一个能预测"环境对动作的反应"的神经网络。给定当前状态 s 和动作 a,输出下一个状态 s' 和奖励 r。它是"脑内模拟器"。

所以这一节是想说:场景是"AI 学游戏太费样本",IRIS 用脑内世界模型让 AI 像人一样"闭眼复盘"来省样本。


Transformers are Sample-Efficient World Models — 场景示意:这论文要解决的现实问题
Plate Nº ITransformers are Sample-Efficient World Models — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Dreamer 系列(v1/v2):在隐空间里建 RSSM(循环状态空间模型),用 RNN 滚动预测潜变量。世界模型连续、平滑,但 RNN 长程依赖弱、容量受限。
  • MuZero:不显式建图像,而是学一个"价值/策略一致性"的隐模型,配合 MCTS 搜索。强但工程复杂。
  • SimPLe(Atari 100k 基准的开山之作):用像素级视频预测模型,在想象里训 PPO。证明 model-based 在低数据 Atari 上可行,但模型不够准。
  • World Models(Ha & Schmidhuber 2018):VAE + MDN-RNN 想象 CarRacing。开创"在梦里训练"思路,但规模小。
  • 共同问题:要么用连续隐空间 + RNN(容量与可扩展性受限),要么用像素级预测(噪声大、累积误差大)。Transformer 在语言上的成功还没真正"搬"进世界模型。

样本效率(Sample Efficiency):用更少真实交互达到同样性能。Atari 100k 基准专门衡量这个——只允许 10 万步真实交互(约人类玩 2 小时)。

所以这一节是想说:以前世界模型要么 RNN 容量小、要么像素预测噪声大,Transformer 的威力还没被引进来。


这篇论文的新想法

一句话:把"预测画面"硬掰成"写文章",然后用 GPT 那一套去做。

像翻译一样三步走:

  1. 把画面翻译成"字":用 VQ-VAE 把每帧图切成一格格小方块,每个方块从一本"字典"(codebook)里挑一个最像的"字"代替。这一步图像就变成了一串"文本"。
  2. 请 GPT 当游戏模拟器:训练一个 Transformer,输入"过去几帧的字 + 玩家按了什么键",输出"下一帧应该写哪些字 + 这一步得几分 + 游戏是不是结束了"。结构跟 GPT 一模一样,只是它学的"语言"是游戏画面。
  3. 让智能体在小说里练级:用 actor-critic(演员-评论员)强化学习算法,完全在 Transformer 编出来的"游戏小说"里训练。真游戏只负责给世界模型喂新素材。

等等,先慢一拍——这里的 token 是什么?可以理解成"视觉拼音":原本一张图有几万个像素值,太碎了 Transformer 学不动;VQ-VAE 替它压缩成几百个"拼音字母",再交给 Transformer 去拼。这样模型只能从有限的"字"里选词,自带防止"画歪"的护栏。

所以这一节是想说:新想法 = VQ-VAE 把画面变 token + Transformer 当世界模型 + 在想象里训 actor-critic。


它分几步做的(方法)

这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。

1. 训练 tokenizer(VQ-VAE):给画面学拼音

输入:replay buffer(回放池)里攒下的游戏帧图像。

处理:想象你教孩子认字:先准备一本 512 字左右的字典,再让他看图找最像的字。这就是 VQ-VAE 做的事——encoder 把图像下采样到 16×16 网格,每个网格位置去 codebook(字典)里找最近的码字,用索引代替;decoder 再把这串索引"读"回成图像。损失由三部分组成:重建损失(还原得像不像)+ commitment loss(防止字典字四处乱跑)+ 感知损失(视觉上像不像)。这一步是离线无监督的。

输出:一个能把任意帧压成约 256 个离散 token、也能把 token 还原成图像的编解码器。

VQ-VAE(向量量化变分自编码器):把连续向量"吸附"到一个有限码本上的自编码器,让图像变成离散 token 序列,便于 Transformer 处理。

2. 训练世界模型(Transformer):翻译官学接龙

输入:序列 [obs_tokens_t, action_t, obs_tokens_{t+1}, action_{t+1}, ...],每帧约 256 个 token。

处理:把一个翻译官关在屋里,只给他看"过去几帧的字 + 玩家按的键",让他猜下一帧的字、这步得多少分、游戏是不是结束了。这就是 Transformer 在做的事。它自回归预测三件事:(a) 下一帧的 token 串;(b) 这步奖励(标量回归头);(c) 是否结束(二分类头)。三个头共享同一个主干。真实游戏数据持续往里灌。

输出:一个能在 token 空间里"续写游戏"的世界模型。

3. 在想象中训练策略:脑内跑马拉松

输入:从真实游戏截一个起点状态。

处理:类比抄作业但只抄过程不抄答案——智能体从真实游戏的某一刻"截图",然后让世界模型在脑内 rollout 十几步假轨迹,在这串假轨迹上更新自己的策略。actor(出招的演员)按 critic(打分的评论员)反馈调整动作选择,critic 用 λ-return 平衡"看远还是看近"。

输出:一个更强的策略。整个循环是:真玩一小段 → 训 tokenizer + 世界模型 → 在想象里训 actor-critic → 用新策略再去真玩。

想象中 rollout(Imagination Rollout):不在真实环境,而在世界模型里模拟若干步轨迹。便宜、可并行,但有累积误差。

Actor-Critic:策略网络(actor)+ 价值网络(critic)的双塔训练框架。critic 估值,actor 用它的信号更新。

4. 关键细节

输入 / 处理 / 输出:token 化让注意力(attention)能在一帧内自己问"豆子和鬼在哪、互相离多近",跨帧时再去算"按了左之后这堆字会怎么变"。比起 Dreamer 那种 RSSM(用 RNN 压成一个小瓶颈),Transformer 容量大得多、适合更复杂的画面。代价是 token 多,脑内 rollout 比 Dreamer 慢。

ASCII 总览:

真实游戏帧 ──►[VQ-VAE tokenizer]──► 每帧~256个token
                                          │
[obs,act,obs,act,...] ──►[Transformer 世界模型]──► 预测(下一帧token + 奖励 + 是否结束)
                                          │
        从真实截图起点 ──► 世界模型脑内rollout十几步(想象轨迹)
                                          │
                          [Actor-Critic 在想象里训练]──► 更强策略
                                          │ 再去真玩,采新数据
                                          └──────────────► 循环

5. 为什么"把画面变成离散 token"能换来样本效率

论文标题就是"Transformers are Sample-Efficient World Models",这一节讲清楚 token 化和样本效率之间的因果。

输入:一个只允许玩约 10 万步真实游戏(Atari 100k,相当于人类玩 2 小时)的苛刻预算。

处理:样本效率的意思是"用很少的真实交互就学到很多"。IRIS 的路子是:既然真实数据这么金贵,就用它训一个能"续写游戏"的世界模型,然后让策略主要在这个世界模型里免费练。而要让世界模型好训、好学,关键一招是把每帧画面用 VQ-VAE 压成约 256 个离散 token——一旦画面变成了离散 token 序列,"预测下一帧会怎样"就和"预测句子的下一个词"变成了同一类问题,可以直接套用 Transformer 那套已经被验证极其擅长建模序列的机器。离散化还有个好处:它把高维连续像素这个难啃的建模对象,压成了一个有限词表上的分类问题,用少量数据也能学得比较稳、比较准。

输出:一个用极少真实数据就能训出来、且能被 Transformer 高效建模的世界模型——这正是样本效率的来源。

打个比方:与其让模型逐像素背下整个游戏画面(数据不够根本背不完),不如先给画面发明一套 512 个字的"拼音",让模型用这套拼音来预测剧情,学起来省数据得多。

6. 为什么"在想象里训练"能大幅省真实交互

输入:一个已经会续写游戏的世界模型,和一个真实游戏的起点截图。

处理:真实交互又慢又有限,但世界模型里的"想象"是几乎免费、可大量并行的。IRIS 让策略从真实游戏的某个状态出发,在世界模型脑内 rollout 十几步假轨迹,然后就在这些假轨迹上用 actor-critic 更新自己——actor 负责出招、critic 用 λ-return(一种在"看远"和"看近"之间做平衡的价值估计)打分。这样,一小段真实交互被"放大"成大量想象经验供策略练级。整个系统是个循环:真玩一小段采集新素材 → 更新 tokenizer 和世界模型 → 在想象里猛训 actor-critic → 用变强的策略再去真玩。真实交互只用在"采集新素材"和"校准世界模型"上,绝大部分策略学习发生在想象里。

输出:一个把宝贵真实步数的价值榨到最大的训练循环,这是它继承自 Dreamer 系列的核心思想。

所以这一节是想说:真实交互只负责采素材和校准,策略的苦练搬进了几乎免费的想象空间。

7. 想象的软肋:累积误差,以及怎么压住它

输入:世界模型生成的想象轨迹。

处理:想象不是白吃的午餐——世界模型毕竟是近似的,它预测一步会有小误差,一步步 rollout 下去误差会累积,走得越远越可能"越想越离谱",策略若在离谱的想象上练就会学歪。IRIS 用几件事压制它:一是想象 rollout 只做较短的十几步,不让误差滚太大;二是不断用新的真实数据回来校准世界模型,把它拉回现实;三是 tokenizer 要先训得足够稳(离散码本不能乱漂),否则世界模型建立在抖动的表示上,误差会更快失控。这套"短想象 + 勤校准 + 稳表示"的组合,是让"在想象里训练"真正靠谱的前提。

输出:一个把累积误差控制在可用范围内的想象训练机制。

8. 为什么用 Transformer 而不是 Dreamer 的 RNN

输入:同一个"建模世界动力学"的任务。

处理:Dreamer 系列用 RSSM(一种基于 RNN 的循环状态空间模型),它把每一帧压进一个很小的循环状态瓶颈里。IRIS 换成 Transformer,直接在 token 序列上做注意力,好处是容量大得多、能对更复杂的画面建模——注意力可以在一帧内部灵活地问"豆子和鬼分别在哪、离多近",跨帧时再算"按了某个键后这堆 token 会怎么变"。代价是每帧 token 多,想象 rollout 比 Dreamer 慢。论文的贡献恰恰是证明了:即便有这个速度代价,Transformer 世界模型在样本效率上依然能打赢前代,说明"大容量序列建模"这条路对世界模型是值得的。

输出:一个用 Transformer 换来更强建模能力、并证明其样本效率优势的世界模型架构。

所以这一节是想说:VQ-VAE 把帧变离散 token(换来省数据的可建模性),Transformer 学会 token 接龙当高容量世界模型,actor-critic 在短想象轨迹里练级(并靠勤校准压住累积误差),真玩只用来采新素材和校准——离散化 + 想象训练 + 大容量序列模型,共同成就了"样本高效"。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Transformers are Sample-Efficient W… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Transformers are Sample-Efficient World Models — 方法示意:核心 pipeline
Plate Nº IITransformers are Sample-Efficient World Models — 方法示意:核心 pipeline

关键数字(What works)

IRIS 是 ICLR 2023 论文。可确认的框架是**在 Atari 100k 基准上(约 10 万步真实交互 ≈ 人类 2 小时)**评测;具体分数(human-normalized 均值/中位数、超人类游戏数)需以原文为准,本笔记只给方向。

关注点 说明 具体数值
真实交互预算 Atari 100k 约 10 万步(基准定义)
对比对象 SimPLe / Dreamer-V2 / SPR / MuZero-Reanalyze 见原文
人类标准化中位数 26 款游戏 显著超之前 model-based,量级跨过人类水平
超人类游戏数 —— 若干款超人类
消融 去离散 token / 换 RNN 都掉点

提醒:除"Atari 100k ≈ 10 万步"这一基准定义外,任何分数请以 arXiv 原文(2209.00588)为准。

所以这一节是想说:能确认的是"在 10 万步预算下评测且显著超越前代 model-based",精确分数回原文。


实验结果说明了什么

  • Transformer + 离散 token 是关键组合:消融显示去掉离散 token 或换回 RNN 都掉点,说明"把画面 token 化再用 Transformer"这个组合本身是性能来源,而非可有可无。
  • 世界模型能大幅提升样本效率:在只允许 2 小时真实游戏的极端低数据设定下跑赢前代,证明"在梦里训练"是给样本效率续命的有效手段。
  • 想象质量足够支撑训练:能从一个起点 rollout 几十步还保持画面连贯,说明世界模型学到的动力学足够可靠。
  • 探索仍是软肋:在需要长程探索的游戏(如 Montezuma's Revenge)上仍弱——这是探索问题,不是世界模型问题。

所以这一节是想说:实验证明"Transformer 世界模型 + 想象训练"能在极低数据下逼近人类,但探索难题另说。


你应该懂的几个新词

World Model(世界模型):给 (s, a) 预测 (s', r) 的神经网络"模拟器"。

VQ-VAE:把连续向量吸附到有限码本的自编码器,让图像变离散 token。

Tokenization(token 化):把原始信号切成离散单位。NLP 里是 BPE,视觉里是 VQ-VAE/dVAE。

Imagination Rollout(想象 rollout):在世界模型里模拟若干步轨迹,便宜但有累积误差。

Sample Efficiency(样本效率):用更少真实交互达到同样性能。

Actor-Critic:策略网络 + 价值网络的双塔 RL 框架。

所以这一节是想说:抓住"世界模型、VQ-VAE、token 化、想象 rollout、样本效率、actor-critic"这几个词,就抓住了 IRIS。


它有什么搞不定的

  • 探索难题解决不了:需要长程探索/稀疏奖励的游戏(Montezuma's Revenge)仍弱,因为这是探索问题,世界模型帮不上。
  • 想象会累积误差:脑内 rollout 越长,误差越大,太长的想象轨迹会失真,限制了训练视野。
  • token 多导致慢:每帧约 256 个 token,Transformer 的脑内 rollout 比 Dreamer 的 RSSM 慢,计算开销大。
  • 离散化有信息损失:把画面压成有限码本会丢细节,对需要精细视觉的任务可能不利。
  • 只在 Atari 验证:论文主战场是 Atari,迁到真实机器人这种高维连续、采样更贵的场景还需改造。

所以这一节是想说:IRIS 强在样本效率,但探索、想象误差、速度、离散化损失、领域局限都是边界。


它和别的几篇是什么关系

  • 直接前辈Dreamer-V2——同样 model-based + 想象训练,但用 RSSM 而非 Transformer。IRIS 可看作"Dreamer 把骨架换成 Transformer"。
  • 方法论先祖World Models (Ha & Schmidhuber)——"在梦里训练"的最早系统化提法。
  • token 化来源:VQ-VAE-2 / DALL·E——把图像变 token 让 Transformer 处理的视觉生成传统。
  • 同期/后续:STORM、Dreamer-V3GAIA-1Genie——都沿"Transformer 当世界模型"走,任务从 Atari 推到机器人、驾驶、开放世界。
  • 互补对比:Diffusion World Model(如 DIAMOND)——走"连续 + 扩散"路线,证明离散 token 不是唯一答案。

所以这一节是想说:IRIS 是"Transformer 世界模型"的早期标杆,上承 Dreamer/World Models,下启 GAIA-1/Genie。


和本导读的关系

  • 主线章节:Ch15 世界模型。IRIS 是"Transformer 世界模型"这条线的关键一站,紧接 Dreamer。
  • 强化学习:Ch16 强化学习基础。actor-critic、想象训练、样本效率都是 RL 核心概念。
  • 对具身的意义:机器人采样昂贵,IRIS 证明世界模型能续命样本效率,思路可迁移到机器人数据增广。

所以这一节是想说:IRIS 落在 Ch15(世界模型)与 Ch16(强化学习)的交叉处。


思考题

Q1:为什么把"预测下一帧"变成"预测下一个 token",就能用上 Transformer 的优势?

提示

Transformer 天生擅长离散序列的自回归预测(就像语言)。把画面 token 化后,预测下一帧变成"接龙下一个字",正好落在它的强项上。

Q2:离散 token 相比像素级预测有什么"自带护栏"的好处?

提示

模型只能从有限码本里选"字",不能画出任意乱像素,天然限制了输出空间,减少"画歪"的噪声。

Q3:IRIS 的"想象训练"和真玩游戏,各自扮演什么角色?

提示

真玩只负责采集新素材喂给世界模型;策略的大量练习都在世界模型的想象轨迹里完成,从而省真实交互。

Q4:为什么 IRIS 在 Montezuma's Revenge 这类游戏上仍然弱?

提示

那是探索问题(奖励稀疏、需要长程规划),世界模型只解决"预测世界",不解决"如何探索到奖励"。

Q5:想象 rollout 越长越好吗?有什么隐患?

提示

不是。rollout 越长累积误差越大,想象会逐渐失真,太长反而误导策略,要控制在可靠范围。

Q6:IRIS 和 Dreamer 的最大架构区别是什么?各自代价?

提示

IRIS 用 Transformer + 离散 token(容量大但慢、token 多);Dreamer 用 RSSM/RNN(快、紧凑但长程依赖和容量弱)。

Q7:IRIS 的思路能给"机器人采样昂贵"带来什么启发?

提示

机器人真实交互贵,可以学一个世界模型当数据增广器/脑内模拟器,在想象里训策略,减少真机采样——GAIA-1、GR-2 等正是这个方向。

所以这一节是想说:想清楚这些题,你就理解了"为何 token 化""想象 vs 真玩""探索 vs 世界模型"这几件核心事。


一些好奇心问答(FAQ)

Q:IRIS 是开源的吗?

是,官方提供了代码,相比 DreamerV3 代码量小、可读性高,适合上手。

Q:Atari 100k 为什么是 10 万步?

10 万步约等于人类玩 2 小时,用来考验"低数据下能学多好",是样本效率的标准考场。

Q:VQ-VAE 的码本要多大?

一般几百到一千(如 512–1024)。太小丢细节,太大难学,是个超参,具体需读原文。

Q:世界模型会不会"胡编"游戏画面?

会有累积误差,长 rollout 可能失真。IRIS 靠离散 token 和适度 rollout 长度控制这个问题。

Q:IRIS 之后世界模型往哪走?

往更大、更真实的方向:GAIA-1(驾驶)、Genie(可玩世界)、Dreamer-V3(通用)等都在这条线上。

所以这一节是想说:IRIS 是理解"Transformer 世界模型"最干净的入门样本,代码小、概念清。


如果你想再深入

  1. 前置:Dreamer-V2 —— 懂"想象里训 actor-critic"和 RSSM。
  2. 前置:VQ-VAE 原文 —— 看图 1-2,懂"码本 + 最近邻替换"。
  3. 正式读 IRIS —— 重点看整体架构图和训练循环,方法很短。
  4. 配合代码跑 Pong —— 体感"10 万步 = 多少训练时间 = 玩成什么样"。
  5. 续读:GAIA-1 / Genie —— 看 Transformer 世界模型如何扩到真实世界。

所以这一节是想说:先补 Dreamer 和 VQ-VAE,再读 IRIS 主体,最后顺到 GAIA-1/Genie 看它的后续。


原文信息

@inproceedings{micheli2023iris,
  title  = {Transformers are Sample-Efficient World Models},
  author = {Micheli, Vincent and Alonso, Eloi and Fleuret, Fran{\c{c}}ois},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year   = {2023},
  note   = {arXiv:2209.00588}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_iris_world_model_2026,
  title       = {(readable note) Transformers are Sample-Efficient World Models},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/iris-world-model/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?