Transformers are Sample-Efficient World Models
这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。
一句话讲什么(TL;DR)
把游戏画面切成一格格"积木",让 AI 像写句子一样接龙下一帧,然后让它在脑子里"自己跟自己玩"练强化学习——只玩两小时就接近人类水平。
所以这一节是想说:IRIS 用"图像 token + Transformer 世界模型 + 想象中训练"把强化学习的样本效率大幅拉高。
这是个什么场景
你小时候肯定干过:玩一个新游戏卡住了,晚上躺床上闭着眼"在脑子里复盘"——按左会怎样、按右会怎样、这个鬼会从哪边来。第二天再开机,手感明显变好了。
人类学游戏其实只玩了几小时,但 AI 玩雅达利往往要"刷"上亿局才能玩明白。差距就在这——人能在脑子里"过电影"自己练,AI 通常只会硬刷。
IRIS 想让 AI 也学会这套"脑内模拟":
- 常见做法(Model-free RL,无模型强化学习):AI 必须真在游戏里反复死,靠死出来的经验更新策略——慢且贵。
- 基于模型的做法(Model-based RL,有模型强化学习):AI 先学一个"小型游戏模拟器"装在脑子里,大部分练习都在脑内模拟器里完成,省掉真打。
- IRIS 的小聪明:它脑内的模拟器不直接"画"下一帧(画图容易糊),而是把画面切成小"乐高积木",像写句子一样一块一块接龙预测——这正好是 Transformer(写文章那种 AI)的强项。
换句话说,IRIS 把"预测下一帧画面"变成了"写下一句话"。
世界模型(World Model):一个能预测"环境对动作的反应"的神经网络。给定当前状态 s 和动作 a,输出下一个状态 s' 和奖励 r。它是"脑内模拟器"。
所以这一节是想说:场景是"AI 学游戏太费样本",IRIS 用脑内世界模型让 AI 像人一样"闭眼复盘"来省样本。

之前的人怎么做的,为什么不够好
- Dreamer 系列(v1/v2):在隐空间里建 RSSM(循环状态空间模型),用 RNN 滚动预测潜变量。世界模型连续、平滑,但 RNN 长程依赖弱、容量受限。
- MuZero:不显式建图像,而是学一个"价值/策略一致性"的隐模型,配合 MCTS 搜索。强但工程复杂。
- SimPLe(Atari 100k 基准的开山之作):用像素级视频预测模型,在想象里训 PPO。证明 model-based 在低数据 Atari 上可行,但模型不够准。
- World Models(Ha & Schmidhuber 2018):VAE + MDN-RNN 想象 CarRacing。开创"在梦里训练"思路,但规模小。
- 共同问题:要么用连续隐空间 + RNN(容量与可扩展性受限),要么用像素级预测(噪声大、累积误差大)。Transformer 在语言上的成功还没真正"搬"进世界模型。
样本效率(Sample Efficiency):用更少真实交互达到同样性能。Atari 100k 基准专门衡量这个——只允许 10 万步真实交互(约人类玩 2 小时)。
所以这一节是想说:以前世界模型要么 RNN 容量小、要么像素预测噪声大,Transformer 的威力还没被引进来。
这篇论文的新想法
一句话:把"预测画面"硬掰成"写文章",然后用 GPT 那一套去做。
像翻译一样三步走:
- 把画面翻译成"字":用 VQ-VAE 把每帧图切成一格格小方块,每个方块从一本"字典"(codebook)里挑一个最像的"字"代替。这一步图像就变成了一串"文本"。
- 请 GPT 当游戏模拟器:训练一个 Transformer,输入"过去几帧的字 + 玩家按了什么键",输出"下一帧应该写哪些字 + 这一步得几分 + 游戏是不是结束了"。结构跟 GPT 一模一样,只是它学的"语言"是游戏画面。
- 让智能体在小说里练级:用 actor-critic(演员-评论员)强化学习算法,完全在 Transformer 编出来的"游戏小说"里训练。真游戏只负责给世界模型喂新素材。
等等,先慢一拍——这里的 token 是什么?可以理解成"视觉拼音":原本一张图有几万个像素值,太碎了 Transformer 学不动;VQ-VAE 替它压缩成几百个"拼音字母",再交给 Transformer 去拼。这样模型只能从有限的"字"里选词,自带防止"画歪"的护栏。
所以这一节是想说:新想法 = VQ-VAE 把画面变 token + Transformer 当世界模型 + 在想象里训 actor-critic。
它分几步做的(方法)
这是全篇最核心部分,分四段讲清楚"进什么、做什么、出什么"。
1. 训练 tokenizer(VQ-VAE):给画面学拼音
输入:replay buffer(回放池)里攒下的游戏帧图像。
处理:想象你教孩子认字:先准备一本 512 字左右的字典,再让他看图找最像的字。这就是 VQ-VAE 做的事——encoder 把图像下采样到 16×16 网格,每个网格位置去 codebook(字典)里找最近的码字,用索引代替;decoder 再把这串索引"读"回成图像。损失由三部分组成:重建损失(还原得像不像)+ commitment loss(防止字典字四处乱跑)+ 感知损失(视觉上像不像)。这一步是离线无监督的。
输出:一个能把任意帧压成约 256 个离散 token、也能把 token 还原成图像的编解码器。
VQ-VAE(向量量化变分自编码器):把连续向量"吸附"到一个有限码本上的自编码器,让图像变成离散 token 序列,便于 Transformer 处理。
2. 训练世界模型(Transformer):翻译官学接龙
输入:序列 [obs_tokens_t, action_t, obs_tokens_{t+1}, action_{t+1}, ...],每帧约 256 个 token。
处理:把一个翻译官关在屋里,只给他看"过去几帧的字 + 玩家按的键",让他猜下一帧的字、这步得多少分、游戏是不是结束了。这就是 Transformer 在做的事。它自回归预测三件事:(a) 下一帧的 token 串;(b) 这步奖励(标量回归头);(c) 是否结束(二分类头)。三个头共享同一个主干。真实游戏数据持续往里灌。
输出:一个能在 token 空间里"续写游戏"的世界模型。
3. 在想象中训练策略:脑内跑马拉松
输入:从真实游戏截一个起点状态。
处理:类比抄作业但只抄过程不抄答案——智能体从真实游戏的某一刻"截图",然后让世界模型在脑内 rollout 十几步假轨迹,在这串假轨迹上更新自己的策略。actor(出招的演员)按 critic(打分的评论员)反馈调整动作选择,critic 用 λ-return 平衡"看远还是看近"。
输出:一个更强的策略。整个循环是:真玩一小段 → 训 tokenizer + 世界模型 → 在想象里训 actor-critic → 用新策略再去真玩。
想象中 rollout(Imagination Rollout):不在真实环境,而在世界模型里模拟若干步轨迹。便宜、可并行,但有累积误差。
Actor-Critic:策略网络(actor)+ 价值网络(critic)的双塔训练框架。critic 估值,actor 用它的信号更新。
4. 关键细节
输入 / 处理 / 输出:token 化让注意力(attention)能在一帧内自己问"豆子和鬼在哪、互相离多近",跨帧时再去算"按了左之后这堆字会怎么变"。比起 Dreamer 那种 RSSM(用 RNN 压成一个小瓶颈),Transformer 容量大得多、适合更复杂的画面。代价是 token 多,脑内 rollout 比 Dreamer 慢。
ASCII 总览:
真实游戏帧 ──►[VQ-VAE tokenizer]──► 每帧~256个token
│
[obs,act,obs,act,...] ──►[Transformer 世界模型]──► 预测(下一帧token + 奖励 + 是否结束)
│
从真实截图起点 ──► 世界模型脑内rollout十几步(想象轨迹)
│
[Actor-Critic 在想象里训练]──► 更强策略
│ 再去真玩,采新数据
└──────────────► 循环
5. 为什么"把画面变成离散 token"能换来样本效率
论文标题就是"Transformers are Sample-Efficient World Models",这一节讲清楚 token 化和样本效率之间的因果。
输入:一个只允许玩约 10 万步真实游戏(Atari 100k,相当于人类玩 2 小时)的苛刻预算。
处理:样本效率的意思是"用很少的真实交互就学到很多"。IRIS 的路子是:既然真实数据这么金贵,就用它训一个能"续写游戏"的世界模型,然后让策略主要在这个世界模型里免费练。而要让世界模型好训、好学,关键一招是把每帧画面用 VQ-VAE 压成约 256 个离散 token——一旦画面变成了离散 token 序列,"预测下一帧会怎样"就和"预测句子的下一个词"变成了同一类问题,可以直接套用 Transformer 那套已经被验证极其擅长建模序列的机器。离散化还有个好处:它把高维连续像素这个难啃的建模对象,压成了一个有限词表上的分类问题,用少量数据也能学得比较稳、比较准。
输出:一个用极少真实数据就能训出来、且能被 Transformer 高效建模的世界模型——这正是样本效率的来源。
打个比方:与其让模型逐像素背下整个游戏画面(数据不够根本背不完),不如先给画面发明一套 512 个字的"拼音",让模型用这套拼音来预测剧情,学起来省数据得多。
6. 为什么"在想象里训练"能大幅省真实交互
输入:一个已经会续写游戏的世界模型,和一个真实游戏的起点截图。
处理:真实交互又慢又有限,但世界模型里的"想象"是几乎免费、可大量并行的。IRIS 让策略从真实游戏的某个状态出发,在世界模型脑内 rollout 十几步假轨迹,然后就在这些假轨迹上用 actor-critic 更新自己——actor 负责出招、critic 用 λ-return(一种在"看远"和"看近"之间做平衡的价值估计)打分。这样,一小段真实交互被"放大"成大量想象经验供策略练级。整个系统是个循环:真玩一小段采集新素材 → 更新 tokenizer 和世界模型 → 在想象里猛训 actor-critic → 用变强的策略再去真玩。真实交互只用在"采集新素材"和"校准世界模型"上,绝大部分策略学习发生在想象里。
输出:一个把宝贵真实步数的价值榨到最大的训练循环,这是它继承自 Dreamer 系列的核心思想。
所以这一节是想说:真实交互只负责采素材和校准,策略的苦练搬进了几乎免费的想象空间。
7. 想象的软肋:累积误差,以及怎么压住它
输入:世界模型生成的想象轨迹。
处理:想象不是白吃的午餐——世界模型毕竟是近似的,它预测一步会有小误差,一步步 rollout 下去误差会累积,走得越远越可能"越想越离谱",策略若在离谱的想象上练就会学歪。IRIS 用几件事压制它:一是想象 rollout 只做较短的十几步,不让误差滚太大;二是不断用新的真实数据回来校准世界模型,把它拉回现实;三是 tokenizer 要先训得足够稳(离散码本不能乱漂),否则世界模型建立在抖动的表示上,误差会更快失控。这套"短想象 + 勤校准 + 稳表示"的组合,是让"在想象里训练"真正靠谱的前提。
输出:一个把累积误差控制在可用范围内的想象训练机制。
8. 为什么用 Transformer 而不是 Dreamer 的 RNN
输入:同一个"建模世界动力学"的任务。
处理:Dreamer 系列用 RSSM(一种基于 RNN 的循环状态空间模型),它把每一帧压进一个很小的循环状态瓶颈里。IRIS 换成 Transformer,直接在 token 序列上做注意力,好处是容量大得多、能对更复杂的画面建模——注意力可以在一帧内部灵活地问"豆子和鬼分别在哪、离多近",跨帧时再算"按了某个键后这堆 token 会怎么变"。代价是每帧 token 多,想象 rollout 比 Dreamer 慢。论文的贡献恰恰是证明了:即便有这个速度代价,Transformer 世界模型在样本效率上依然能打赢前代,说明"大容量序列建模"这条路对世界模型是值得的。
输出:一个用 Transformer 换来更强建模能力、并证明其样本效率优势的世界模型架构。
所以这一节是想说:VQ-VAE 把帧变离散 token(换来省数据的可建模性),Transformer 学会 token 接龙当高容量世界模型,actor-critic 在短想象轨迹里练级(并靠勤校准压住累积误差),真玩只用来采新素材和校准——离散化 + 想象训练 + 大容量序列模型,共同成就了"样本高效"。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【Transformers are Sample-Efficient W… · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
IRIS 是 ICLR 2023 论文。可确认的框架是**在 Atari 100k 基准上(约 10 万步真实交互 ≈ 人类 2 小时)**评测;具体分数(human-normalized 均值/中位数、超人类游戏数)需以原文为准,本笔记只给方向。
| 关注点 | 说明 | 具体数值 |
|---|---|---|
| 真实交互预算 | Atari 100k | 约 10 万步(基准定义) |
| 对比对象 | SimPLe / Dreamer-V2 / SPR / MuZero-Reanalyze | 见原文 |
| 人类标准化中位数 | 26 款游戏 | 显著超之前 model-based,量级跨过人类水平 |
| 超人类游戏数 | —— | 若干款超人类 |
| 消融 | 去离散 token / 换 RNN | 都掉点 |
提醒:除"Atari 100k ≈ 10 万步"这一基准定义外,任何分数请以 arXiv 原文(2209.00588)为准。
所以这一节是想说:能确认的是"在 10 万步预算下评测且显著超越前代 model-based",精确分数回原文。
实验结果说明了什么
- Transformer + 离散 token 是关键组合:消融显示去掉离散 token 或换回 RNN 都掉点,说明"把画面 token 化再用 Transformer"这个组合本身是性能来源,而非可有可无。
- 世界模型能大幅提升样本效率:在只允许 2 小时真实游戏的极端低数据设定下跑赢前代,证明"在梦里训练"是给样本效率续命的有效手段。
- 想象质量足够支撑训练:能从一个起点 rollout 几十步还保持画面连贯,说明世界模型学到的动力学足够可靠。
- 探索仍是软肋:在需要长程探索的游戏(如 Montezuma's Revenge)上仍弱——这是探索问题,不是世界模型问题。
所以这一节是想说:实验证明"Transformer 世界模型 + 想象训练"能在极低数据下逼近人类,但探索难题另说。
你应该懂的几个新词
World Model(世界模型):给 (s, a) 预测 (s', r) 的神经网络"模拟器"。
VQ-VAE:把连续向量吸附到有限码本的自编码器,让图像变离散 token。
Tokenization(token 化):把原始信号切成离散单位。NLP 里是 BPE,视觉里是 VQ-VAE/dVAE。
Imagination Rollout(想象 rollout):在世界模型里模拟若干步轨迹,便宜但有累积误差。
Sample Efficiency(样本效率):用更少真实交互达到同样性能。
Actor-Critic:策略网络 + 价值网络的双塔 RL 框架。
所以这一节是想说:抓住"世界模型、VQ-VAE、token 化、想象 rollout、样本效率、actor-critic"这几个词,就抓住了 IRIS。
它有什么搞不定的
- 探索难题解决不了:需要长程探索/稀疏奖励的游戏(Montezuma's Revenge)仍弱,因为这是探索问题,世界模型帮不上。
- 想象会累积误差:脑内 rollout 越长,误差越大,太长的想象轨迹会失真,限制了训练视野。
- token 多导致慢:每帧约 256 个 token,Transformer 的脑内 rollout 比 Dreamer 的 RSSM 慢,计算开销大。
- 离散化有信息损失:把画面压成有限码本会丢细节,对需要精细视觉的任务可能不利。
- 只在 Atari 验证:论文主战场是 Atari,迁到真实机器人这种高维连续、采样更贵的场景还需改造。
所以这一节是想说:IRIS 强在样本效率,但探索、想象误差、速度、离散化损失、领域局限都是边界。
它和别的几篇是什么关系
- 直接前辈:Dreamer-V2——同样 model-based + 想象训练,但用 RSSM 而非 Transformer。IRIS 可看作"Dreamer 把骨架换成 Transformer"。
- 方法论先祖:World Models (Ha & Schmidhuber)——"在梦里训练"的最早系统化提法。
- token 化来源:VQ-VAE-2 / DALL·E——把图像变 token 让 Transformer 处理的视觉生成传统。
- 同期/后续:STORM、Dreamer-V3、GAIA-1、Genie——都沿"Transformer 当世界模型"走,任务从 Atari 推到机器人、驾驶、开放世界。
- 互补对比:Diffusion World Model(如 DIAMOND)——走"连续 + 扩散"路线,证明离散 token 不是唯一答案。
所以这一节是想说:IRIS 是"Transformer 世界模型"的早期标杆,上承 Dreamer/World Models,下启 GAIA-1/Genie。
和本导读的关系
- 主线章节:Ch15 世界模型。IRIS 是"Transformer 世界模型"这条线的关键一站,紧接 Dreamer。
- 强化学习:Ch16 强化学习基础。actor-critic、想象训练、样本效率都是 RL 核心概念。
- 对具身的意义:机器人采样昂贵,IRIS 证明世界模型能续命样本效率,思路可迁移到机器人数据增广。
所以这一节是想说:IRIS 落在 Ch15(世界模型)与 Ch16(强化学习)的交叉处。
思考题
Q1:为什么把"预测下一帧"变成"预测下一个 token",就能用上 Transformer 的优势?
提示
Transformer 天生擅长离散序列的自回归预测(就像语言)。把画面 token 化后,预测下一帧变成"接龙下一个字",正好落在它的强项上。
Q2:离散 token 相比像素级预测有什么"自带护栏"的好处?
提示
模型只能从有限码本里选"字",不能画出任意乱像素,天然限制了输出空间,减少"画歪"的噪声。
Q3:IRIS 的"想象训练"和真玩游戏,各自扮演什么角色?
提示
真玩只负责采集新素材喂给世界模型;策略的大量练习都在世界模型的想象轨迹里完成,从而省真实交互。
Q4:为什么 IRIS 在 Montezuma's Revenge 这类游戏上仍然弱?
提示
那是探索问题(奖励稀疏、需要长程规划),世界模型只解决"预测世界",不解决"如何探索到奖励"。
Q5:想象 rollout 越长越好吗?有什么隐患?
提示
不是。rollout 越长累积误差越大,想象会逐渐失真,太长反而误导策略,要控制在可靠范围。
Q6:IRIS 和 Dreamer 的最大架构区别是什么?各自代价?
提示
IRIS 用 Transformer + 离散 token(容量大但慢、token 多);Dreamer 用 RSSM/RNN(快、紧凑但长程依赖和容量弱)。
Q7:IRIS 的思路能给"机器人采样昂贵"带来什么启发?
提示
机器人真实交互贵,可以学一个世界模型当数据增广器/脑内模拟器,在想象里训策略,减少真机采样——GAIA-1、GR-2 等正是这个方向。
所以这一节是想说:想清楚这些题,你就理解了"为何 token 化""想象 vs 真玩""探索 vs 世界模型"这几件核心事。
一些好奇心问答(FAQ)
Q:IRIS 是开源的吗?
是,官方提供了代码,相比 DreamerV3 代码量小、可读性高,适合上手。
Q:Atari 100k 为什么是 10 万步?
10 万步约等于人类玩 2 小时,用来考验"低数据下能学多好",是样本效率的标准考场。
Q:VQ-VAE 的码本要多大?
一般几百到一千(如 512–1024)。太小丢细节,太大难学,是个超参,具体需读原文。
Q:世界模型会不会"胡编"游戏画面?
会有累积误差,长 rollout 可能失真。IRIS 靠离散 token 和适度 rollout 长度控制这个问题。
Q:IRIS 之后世界模型往哪走?
往更大、更真实的方向:GAIA-1(驾驶)、Genie(可玩世界)、Dreamer-V3(通用)等都在这条线上。
所以这一节是想说:IRIS 是理解"Transformer 世界模型"最干净的入门样本,代码小、概念清。
如果你想再深入
- 前置:Dreamer-V2 —— 懂"想象里训 actor-critic"和 RSSM。
- 前置:VQ-VAE 原文 —— 看图 1-2,懂"码本 + 最近邻替换"。
- 正式读 IRIS —— 重点看整体架构图和训练循环,方法很短。
- 配合代码跑 Pong —— 体感"10 万步 = 多少训练时间 = 玩成什么样"。
- 续读:GAIA-1 / Genie —— 看 Transformer 世界模型如何扩到真实世界。
所以这一节是想说:先补 Dreamer 和 VQ-VAE,再读 IRIS 主体,最后顺到 GAIA-1/Genie 看它的后续。
原文信息
- 标题:Transformers are Sample-Efficient World Models(IRIS)
- arXiv:https://arxiv.org/abs/2209.00588
- 会议:ICLR 2023
- 年份:2023
@inproceedings{micheli2023iris,
title = {Transformers are Sample-Efficient World Models},
author = {Micheli, Vincent and Alonso, Eloi and Fleuret, Fran{\c{c}}ois},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2023},
note = {arXiv:2209.00588}
}
BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。
◼
引用本笔记 / Cite this note
@online{eai_iris_world_model_2026,
title = {(readable note) Transformers are Sample-Efficient World Models},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/iris-world-model/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?