Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 153

GAIA-1

16 min read · 5664 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

GAIA-1 是个会做梦的开车模拟器:给它一段街景视频的开头,加一句"我现在打方向盘",它能接着画出后面几秒街上看到的画面。

所以这一节是想说:GAIA-1 是一个能"续写驾驶视频"的世界模型,用文字和动作就能控制它往下画。


这是个什么场景

想象你小时候玩"我画你猜",但反过来:你说一句"左转,雨天,前面有个红绿灯",旁边坐着一个看过几百万小时行车记录仪的高人,他立刻接着你的话头一帧一帧画下去——左转后路边的咖啡店滑到右边,雨点落在挡风玻璃上,红灯由远变近。你随时可以打断说"换个动作,我现在踩刹车",他立刻顺着新动作把后面的画面改掉。

GAIA-1 就是这个高人。它脑子里不是真的"画",而是像写小说一样一格一格地猜"下一帧视频的拼图块(token)该是什么"——和大语言模型(LLM)猜下一个字的套路一模一样,只不过它猜的是图像碎片,不是中文字。

世界模型(World Model):一个神经网络版的"模拟器"。给它当前状态和一个动作,它预测下一状态会长什么样。区别于"策略(policy)"——策略只决定"该做什么动作",世界模型负责"做了动作之后世界会怎样"。

所以这一节是想说:场景是"驾驶场景的可控续写",GAIA-1 把它做成了一个能被文字和动作驱动的生成式模拟器。


GAIA-1 — 场景示意:这论文要解决的现实问题
Plate Nº IGAIA-1 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • Dreamer 系列(v1/v2/v3):在游戏环境(Atari、DMC)里学一个紧凑的隐空间世界模型,画面分辨率低、场景简单,撑不起真实街景。
  • GameGAN / GAN 类世界模型:用对抗训练模仿游戏引擎,但生成质量不稳定,长时序容易崩。
  • MILE(Wayve 自家前作):在驾驶场景学世界模型,但规模和保真度还不足以支撑"长视频续写 + 多模态条件"。
  • CARLA / Drive Sim 等仿真器:手工搭建的物理 + 渲染管线,可控性强但"长得不像真的",sim-to-real gap 是老问题。
  • 视频生成模型(Make-A-Video、Imagen Video 等):能生成视频但不接受动作输入,没法当"驾驶模拟器"用。

sim-to-real gap(仿真到真实的差距):仿真里训得好,搬到真实世界就翻车,因为仿真画面/物理和真实不完全一样。

所以这一节是想说:以前的世界模型要么太小、要么不真、要么不能被动作控制,GAIA-1 想要"又真、又长、又可控"。


这篇论文的新想法

把"驾驶世界模型"重新定义成一个自回归序列建模问题,和 GPT 训文本一模一样:

  1. 把视频、文本、动作都编码成同一条 token 序列。
  2. 训一个约 90 亿参数(9B)的 Transformer 去做"预测下一个 token"。
  3. 解码 token 时用一个独立的视频扩散解码器把 token 还原成高保真视频。

自回归(autoregressive):一次预测一个 token,把刚预测出的塞回前缀,再预测下一个。GPT 写文章就是这样一个字一个字接龙。

这一套的好处是:LLM 那套"越大越强"的经验(scaling law)直接搬过来用——参数变大、数据变多,就越能预测远期未来。GAIA-1 也确实展现出"涌现"行为:能理解车辆、行人、道路结构、交通规则,并能根据 prompt 生成训练集里没出现过的场景(比如"车开上人行道")。

涌现能力(emergent capability):模型变大后突然出现的、小模型完全没有的能力。源自 LLM 文献,GAIA-1 在驾驶领域复现了这个现象。

所以这一节是想说:新想法 = 把驾驶视频预测当成"GPT 式接龙",从而继承大模型的规模红利和涌现能力。


它分几步做的(方法)

这是全篇最核心部分,按四步走,每步交代"进什么、做什么、出什么"。

1. 把视频压成 token

输入:一段驾驶视频(每帧是几十万像素的图像)+ 文本 prompt + 动作(方向盘、油门、刹车的数值)。

处理:一帧图像直接喂给模型太贵,于是用一个图像 tokenizer(类似 VQ-VAE 或 DALL·E 用的离散自动编码器)把每一帧切成几百块"视觉积木"(离散 token)。文本用类似 CLIP 的文字编码器编成向量;动作也量化成 action token。三种模态最后拼成一条长队伍。

输出:一条"视频 token + 文本 token + 动作 token"混合的长序列。

等等,先慢一拍——token 是什么?你可以把它想成"乐高的颜色编号":原图是一堆复杂像素,tokenizer 给每个小区域贴一个标签(比如"3721 号块"),模型就只需操心这些编号怎么排,不用直接画像素。

tokenizer(分词器/编码器):把连续信号(图像、音频)切成离散 token 的模型。GAIA-1 用图像 tokenizer 把帧编成 token。

2. 自回归世界模型

输入:过去的视频 token + 文本 + 动作组成的前缀序列。

处理:一个约 9B 参数的 decoder-only Transformer(只能看过去、不能偷看未来,和 GPT 同款)接过序列,猜下一个视频 token 是哪块积木。训练目标就是经典的"预测下一个 token",和训 GPT 完全一样。

输出:预测的下一批视频 token——注意这一步还是一串数字编号,根本没画面

用生活语言说:这一步像编剧写分镜脚本,只写"第几格该出现什么内容",还没真正作画。

3. 视频扩散解码器

输入:上一步预测出的视频 token 序列。

处理:一个独立的扩散模型(diffusion model)把这些"积木编号"重新画回高分辨率、帧与帧连得上的真实画面。这样就把"剧情对不对"和"画工好不好"分开了:世界模型管剧情,扩散解码器管画工。

输出:一段高保真、时序连贯的驾驶视频。

扩散解码器(diffusion decoder):用扩散过程从 token 还原成像素的网络。它只管"画得好看",不管"应该画什么"。

4. 条件控制

输入:在序列开头塞不同的文本和动作。

处理:换天气、换光照、换驾驶风格、甚至强行让车做平时不会做的动作,模型就会生成对应的"如果当时这样会怎样"(counterfactual,反事实)的场景。

输出:各种被 prompt 控制出来的定制场景视频。

反事实(counterfactual):训练集里没真发生过、但符合物理/语义合理性的"如果……会怎样"场景。这是世界模型比策略多出来的独特能力——你能让它演没真发生过的事。

ASCII 总览:

视频帧 ─►[图像tokenizer]─┐
文本   ─►[文字编码器]─────┤──► token长序列
动作   ─►[动作量化]───────┘        │
                                   ▼
                    [9B 自回归 Transformer]  预测下一批视频token
                                   │
                                   ▼
                    [视频扩散解码器]  token → 高清视频

5. 为什么绕这么大弯:不直接生成像素,非要先出 token

初看会觉得别扭——想要视频,为什么不直接让网络画视频,非要中间隔一层"离散 token"?这一节讲清楚这个设计的深意。

输入:一段要被"理解并续写"的驾驶视频。

处理:GAIA-1 的核心信念是"世界模型本质上是一个序列预测模型"。它想复用 GPT 那套已经被验证到极致的配方:把一切变成离散 token,然后训练"预测下一个 token"。为什么这招在视频上也灵?因为一旦把视频压成 token 序列,"预测下一帧该出现什么"就等价于"预测句子的下一个词"——模型为了把下一个视觉 token 猜准,被迫学会车怎么动、行人怎么走、红灯亮了车该停,也就是世界的动力学。直接在像素上做这件事有两个坏处:像素维度太高、连续值难以像语言那样稳定地做概率建模,scaling 也没有 token 序列那么干净。离散化等于把"理解世界"这个难题翻译成"大语言模型已经很擅长的接龙题"。

输出:一个可以像训 GPT 一样、靠堆规模就变强的世界模型。

打个比方:与其教模型直接画出连贯的电影(太难),不如先教它写好剧本(token 序列),再另找一个画师照剧本作画。

6. 世界模型和扩散解码器为什么必须分家

输入:预测出来的一串视觉 token(剧本)。

处理:GAIA-1 刻意把生成拆成两个各管一摊的模块:

  • 世界模型(9B 自回归 Transformer) 只负责"接下来该发生什么"——它在低分辨率的 token 空间里做长时序推演,管的是剧情、物理、因果是否说得通。
  • 视频扩散解码器 只负责"把这些 token 画得好看又连贯"——它不操心剧情对不对,只把编号还原成高清、帧间平滑的像素。

为什么要分?因为让一个网络同时兼顾"长时序逻辑"和"高保真渲染"极难,两个目标会互相拖累。分家后,世界模型可以在压缩后的 token 空间里省算力地推演很长的时间跨度,解码器则专注把画质做足。这也是很多现代生成系统的通用套路:语义/动力学一层,渲染一层。

输出:既能推演长剧情、又能产出高清画面的两段式生成管线。

所以这一节是想说:把"想什么"和"画什么"拆开,各自都变成一个更好解决的问题。

7. 三种模态怎么塞进同一条序列

输入:视频、文本、动作三种完全不同的信号。

处理:它们各自被转成 token 后,被拼接成一条统一的长序列喂给同一个 Transformer。Transformer 用因果掩码(causal mask,只能看过去不能偷看未来)做自回归,所以放在序列开头的文本和动作 token 自然就成了"条件"——后面预测视觉 token 时,注意力会不断回看这些条件,于是"文字描述的天气""给定的方向盘动作"就能持续影响生成内容。想做反事实推演("如果此刻猛打方向会怎样")只要把对应的动作 token 塞进去,模型就顺着这个前提往下演。这种"一切皆 token、条件即前缀"的统一,正是它能被自由 prompt 的根源。

输出:一个用同一套注意力机制、把多模态条件和视频生成揉在一起的序列模型。

8. 训练目标简单到出奇,能力却是"堆"出来的

输入:海量真实驾驶视频(配上文本、动作)。

处理:训练目标就一个——预测下一个 token 的交叉熵,和训 GPT 一模一样,完全自监督,不需要人工标注。神奇之处在于:当数据和参数量堆上去(论文观察参数从几亿涨到 9B,生成的一致性、物理合理性明显变好),模型会涌现出没被显式教过的能力,比如对三维结构、车流交互、交通规则的隐含理解,以及生成训练集里没真出现过但合理的场景。这正是"世界模型走大模型路线"的赌注:不去手工设计物理引擎,而是相信"预测下一帧"这个简单目标 + 规模,能自己长出对世界的理解。

输出:一个靠规模涌现出世界理解、可作为自动驾驶"想象力仿真器"的生成式世界模型。

再补一句它在自动驾驶研发里的定位:真实路测既贵又危险,尤其是罕见危险场景(有人突然横穿、前车急刹)几乎无法主动采集。GAIA-1 的价值在于可以被 prompt 出海量这类反事实场景,给下游的感知和决策模型当"合成训练与压力测试场"。也就是说,它不是直接开车的策略,而是给策略提供"练兵场"和"想象力"的基础设施——这正是世界模型区别于普通策略网络的意义所在。

所以这一节是想说:先把三种模态压成 token,用 9B Transformer 做 GPT 式接龙预测(这一步逼它学会世界动力学),再用扩散解码器把 token 画成高清视频,最后靠开头的文字/动作当前缀条件控制内容——简单目标 + 规模,换来涌现的世界理解。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【GAIA-1 · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

GAIA-1 — 方法示意:核心 pipeline
Plate Nº IIGAIA-1 — 方法示意:核心 pipeline

关键数字(What works)

GAIA-1 是 Wayve 的技术报告。可确认的规模是世界模型约 9B 参数;其它精确指标(FVD、训练数据小时数、token 数)需以原文为准,本笔记不编造。

关注点 说明 具体数值
世界模型规模 自回归 Transformer 参数量 约 9B(原文报告)
训练数据 大量真实驾驶视频(英国道路等) 具体小时数需读原文
长时序生成 从真实开头续写数十秒 具体秒数/FVD 需读原文
scaling 趋势 参数从几亿到 9B,质量与一致性变好 曲线见原文
涌现能力 未显式训练的场景可被 prompt 出来 定性证据

提醒:除"约 9B 参数"外,其它数值请以 arXiv 原文(2309.17080)为准。

所以这一节是想说:能确认的是"9B 规模 + 随规模变好 + 有涌现",精确的生成质量指标要回原文。


实验结果说明了什么

  • scaling law 在视觉-动作世界里也成立:参数越大、数据越多,生成质量、prompt 跟随、长时一致性都在变好。这是把 LLM 经验搬到驾驶域的核心证据。
  • 动作真能控制未来:给不同方向盘/油门动作,世界模型续写出不同后果,说明它学到了"动作 → 视觉后果"的因果,而不是只会复读。
  • 能演没发生过的事:反事实场景(开上人行道、逆行)可被 prompt 出来,说明它学到的是可组合的世界规律,不是死记训练片段。
  • 三段式解耦有效:把"剧情(世界模型)"和"画工(扩散解码器)"分开,让每段都能独立扩大,是干净且可扩展的工程选择。

所以这一节是想说:实验证明"把驾驶当 GPT 来训"能得到可控、有因果、能反事实、可扩展的世界模型。


你应该懂的几个新词

World Model(世界模型):给当前状态 + 动作,预测下一状态的神经网络"模拟器"。

Autoregressive(自回归):一次预测一个 token,接龙式生成。

Tokenizer(编码器):把图像/音频等连续信号切成离散 token 的模型。

Diffusion Decoder(扩散解码器):用扩散过程把 token 还原成像素,只管画得好看。

Counterfactual(反事实):训练集没出现、但合理的"如果……会怎样"场景。

Emergent Capability(涌现能力):模型变大后突然出现的新能力。

所以这一节是想说:抓住"世界模型、自回归、tokenizer、扩散解码器、反事实、涌现"六个词,就抓住了 GAIA-1。


它有什么搞不定的

  • 长时序仍会漂移:自回归生成越往后,累积误差越大,几十秒后画面可能失真或"梦游"。
  • 计算昂贵:9B 世界模型 + 扩散解码器,训练和推理都很重,实时性差,短期难直接当在线模拟器用。
  • 没有显式物理保证:它学的是数据里的统计规律,不是真物理引擎,罕见但物理上合法的情况可能画错。
  • 数据领域偏置:训练视频来自特定地区/相机,换到差异很大的道路环境可能不准(具体过滤策略需读原文)。
  • 评估困难:视频生成质量本身难量化,FVD 等指标只能部分反映"像不像 + 合不合理"。

所以这一节是想说:GAIA-1 强但重、会漂移、无硬物理、有数据偏置,离"即插即用的驾驶模拟器"还有距离。


它和别的几篇是什么关系

  • 上游World Models (Ha & Schmidhuber) 提出隐空间世界模型概念;Dreamer v1/v2 把它做进游戏环境能学策略。
  • 同范式IRIS 也用"图像 token + Transformer"当世界模型,但在 Atari 上;GAIA-1 推到真实驾驶 + 9B 规模。
  • 同代视频生成:Make-A-Video、Imagen Video、Sora(更晚)都是文生视频,但不接受动作输入,不能当模拟器;GAIA-1 把"动作可控"补上。
  • 驾驶同行:DriveDreamer、MagicDrive、GenAD 都做驾驶视频生成,定位略不同。
  • 下游 / embodied 启示:可给 RL agent 当训练环境、做安全性测试、做反事实评估;机械臂、人形也能照搬(见 GR-2Cosmos World Foundation)。

所以这一节是想说:GAIA-1 是"Transformer 世界模型"从游戏(IRIS)走向真实驾驶的标志,也是 Sora/Genie/GAIA-2 这条线的前驱。


和本导读的关系

  • 主线章节:Ch15 世界模型。GAIA-1 是"大规模生成式世界模型"的代表作,紧接 Dreamer 与 IRIS 之后。
  • Sim-to-Real:Ch17 Sim-to-Real。世界模型是"用生成数据代替真实采集"的一条路径。
  • 多模态:Ch18 多模态生态。GAIA-1 把视频、文本、动作统一成 token,是多模态融合的范例。

所以这一节是想说:GAIA-1 落在 Ch15(世界模型)的核心位置,与 Ch17、Ch18 相连。


思考题

Q1:GAIA-1 是"策略"还是"世界模型"?两者最本质的区别是什么?

提示

它是世界模型。策略回答"我该做什么动作",世界模型回答"做了动作之后世界会怎样"。GAIA-1 生成的是未来画面,不是控制指令。

Q2:为什么要把世界模型和扩散解码器分成两段,而不是一步到位直接生成像素?

提示

解耦"剧情"和"画工":Transformer 在 token 层做长程一致的预测,扩散解码器专注画质。各自能独立扩大,也更稳定。

Q3:GAIA-1 能生成训练集里没出现过的场景(如开上人行道),这说明它学到了什么?

提示

说明它学到的是可组合的世界规律,而非死记片段,能把"车""人行道""驶上去"这些概念重组成新场景。

Q4:把驾驶视频预测当成"GPT 式 next-token 预测",最大的好处和最大的代价各是什么?

提示

好处是直接继承 scaling law 和成熟训练范式;代价是自回归的累积误差导致长时漂移,且计算昂贵。

Q5:动作 token 和视频 token 混在同一序列里训练,为什么这样能学到"动作 → 后果"的因果?

提示

因为动作 token 出现在对应视频 token 之前,模型要准确预测后续画面就必须把动作纳入条件,久而久之学到"这个动作会带来这种视觉变化"。

Q6:为什么长时序生成会"漂移"?可以怎么缓解?

提示

自回归把自己的预测当输入继续生成,误差会一步步累积。缓解可用更大模型、更强 tokenizer、周期性用真实帧校正等。

Q7:GAIA-1 没有真物理引擎,只靠数据统计,这在安全关键的驾驶场景意味着什么风险?

提示

它可能在罕见但物理合法的情况下生成不真实的后果,用它做安全评估时要小心"看起来对但物理错"的样本。

Q8:如果要把 GAIA-1 的思路搬到机械臂,需要什么额外数据?

提示

需要大量"视频 + 对应动作"的配对数据。机械臂领域这种配对远比驾驶稀缺,这正是 GR-2 等工作要解决的瓶颈。

所以这一节是想说:想清楚这些题,你就理解了"世界模型 vs 策略""解耦剧情与画工""动作因果""长时漂移"这几件核心事。


一些好奇心问答(FAQ)

Q:GAIA-1 是开源的吗?

它是 Wayve 的技术报告,模型权重未开源。可通过官方博客和视频看大量生成结果。

Q:它能实时跑吗?

不能。9B 世界模型 + 扩散解码器很重,目前更适合离线生成和评估,而非在线实时模拟。

Q:它和 Sora 有什么区别?

Sora 是通用文生视频,不接受动作输入;GAIA-1 专注驾驶且能被动作控制,定位是"可控世界模型"。

Q:为什么用离散 token 而不是直接在连续隐空间生成?

离散 token 让世界模型能像 GPT 一样自回归,天然继承成熟的语言模型训练范式;连续路线(如扩散世界模型)是另一条并行方案。

Q:GAIA-1 之后有续作吗?

有 GAIA-2(2025),更大、更可控。GAIA 这条线是 Wayve 世界模型驱动自动驾驶的主线。

所以这一节是想说:GAIA-1 目前是"研究性可控模拟器",离实时部署尚远,但代表了驾驶世界模型的方向。


如果你想再深入

  1. 先看官方 demo —— Wayve 博客和视频里有大量生成结果,比读文字快建立直觉。
  2. 前置:World Models / Dreamer —— 理解"在梦里训练"的传统。
  3. 同范式:IRIS —— 看"图像 token + Transformer 世界模型"在 Atari 上的干净版本。
  4. 对照:Genie / Cosmos —— 看世界模型往开放世界和机器人扩展的后续。
  5. 想迁移到机器人 —— 读 GR-2,理解"视频 + 动作"配对数据这个瓶颈。

所以这一节是想说:先看 demo 建立直觉,再补 World Models/IRIS 的范式,最后顺着 Genie/Cosmos/GR-2 看它怎么扩展。


原文信息

  • 标题:GAIA-1: A Generative World Model for Autonomous Driving
  • arXiv:https://arxiv.org/abs/2309.17080
  • 发表:Wayve 技术报告(arXiv)
  • 年份:2023
@article{hu2023gaia1,
  title  = {GAIA-1: A Generative World Model for Autonomous Driving},
  author = {Hu, Anthony and others},
  journal = {arXiv preprint arXiv:2309.17080},
  year   = {2023}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_gaia_1_2026,
  title       = {(readable note) GAIA-1},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/gaia-1/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?