Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 116

GR-2: Generative Video-Language-Action Model

16 min read · 5631 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

让机器人先刷大量网络视频攒常识,再练动手;它干活时脑子里会先"预演"下一秒的画面,再从这个预演里读出动作。

所以这一节是想说:GR-2 用"先看海量视频学常识,再学动作"的两段式,把互联网视频的物理直觉灌进机器人。


这是个什么场景

你新请了一个保姆。

情况 A:她从没看过别人做家务,直接进你家厨房上手。第一次端汤泼了,第一次洗碗碎了。每错一次你都得在旁边喊"不是这样"。家里能让她练的次数有限,就算练熟了倒水,换个新杯子她又不会了——因为她脑子里没"杯子倒过来水会洒"这种常识。

情况 B:她进门之前,已经看了几年的生活 vlog——别人怎么切菜、怎么开抽油烟机、怎么塞洗衣机。她没亲手做过,但闭上眼能"放电影":手伸过去,杯子会被举起来;门把手一拧,门会开。等她真上手,前几下还有点笨,但能很快迁移到新东西上,因为脑子里那部"世界怎么动"的电影已经预装好了。

GR-2 走的是情况 B。大量互联网视频是它的"童年放电影时间",机器人轨迹数据才是"正式上岗培训"。

VLA(Vision-Language-Action)模型:输入图像 + 文本指令,输出机器人动作的端到端模型。RT-2 是开山之作,GR-2 属于这一谱系。

所以这一节是想说:场景是"机器人缺常识级视觉先验",GR-2 用互联网视频补上这块童子功。


GR-2 — 场景示意:这论文要解决的现实问题
Plate Nº IGR-2 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • RT-1 / RT-2:直接在机器人数据 + 视觉语言数据上端到端训练,没有显式的"未来预测"。机器人数据贵且少,泛化靠 VLM 主干。
  • GR-1(GR-2 的前作):已经引入"预测未来视频帧 + 输出动作"的双任务,但预训练规模较小。
  • 世界模型路线(Dreamer 系列、GAIA-1):学环境动力学但不直接产出动作,需要再接 RL/规划。
  • 扩散策略类(Diffusion Policy、π0):用扩散模型生成动作序列,但视觉表征通常没用上大规模视频预训练。
  • 共同短板:机器人数据本身规模小,难以获得"看一眼就知道接下来会发生什么"的常识级先验。

端到端(end-to-end):从原始输入(图像/文字)一路直接到输出(动作),中间不拆成人工设计的模块,全靠一个网络学。

所以这一节是想说:以前机器人数据太少、常识不足,GR-2 想用"海量视频预训练"这个更便宜的常识来源来补。


这篇论文的新想法

类比:学打乒乓球的人,看一万场比赛回放再上场挥拍,比直接闷头练要快——因为脑子里已经有"球会怎么飞、人会怎么跑"的画面。GR-2 想把这套思路搬给机器人。

把"互联网视频"当成机器人的预训练语料库,理由有三:

  1. 视频天然蕴含动作和因果——一个人推门,门会开;一只手抓杯子,杯子会被举起来。这种"先有动作再有结果"的时序结构,正是机器人需要的。
  2. 视频规模远大于机器人数据——互联网视频数以千万计,机器人轨迹只有百万量级,差好几个数量级。
  3. 统一的生成式框架——预训练阶段模型学"给定过去帧 + 文本,预测未来帧";微调阶段多加一个分支预测动作。同一套 Transformer 架构、同一套 token,前后任务高度对齐。

关键洞察:动作不是从零学的,动作是从"对未来画面的想象"里读出来的。模型先想"接下来手应该到这个位置",再把这个想象解码成机械臂指令。

所以这一节是想说:新想法 = 把互联网视频当预训练语料,让模型先学会想象未来,再从想象里读出动作。


它分几步做的(方法)

这是全篇最核心部分,按四段讲清楚"进什么、做什么、出什么"。

1. 视频生成预训练

输入:大量互联网视频(论文报告约 3800 万条量级;具体来源和过滤策略需读原文)+ 文本描述。

处理:像让小孩看动画片预测下一帧。模型训练一个视频-文本模型(video-language model),输入是过去若干帧 + 文本描述,输出是未来若干帧。这一阶段没有任何机器人数据,纯粹学"世界长什么样、会怎么变"。

输出:一个学会了"世界物理直觉"的视频生成主干。

等等,先慢一拍——这里的 "tokenize(token 化)" 是什么?打个比方,文本送进 GPT 之前要先切成一个个"词块",每个词块是个编号;视频也一样,要先把每一帧画面压成一串"画面编号",模型才能像处理文字那样处理它。GR-2 用类似 VQ-VAE 的离散化方案,外加一个 causal transformer(只能看过去、不能偷看未来,跟 GPT 同款)做自回归生成。

视频 token 化:把连续视频帧用 VQ-VAE 之类的码本压成离散 token 序列,让视频能像文本一样喂给 Transformer 自回归生成。

2. 机器人数据微调

输入:多任务机器人轨迹(任务种类、本体规模需读原文),即"观测 + 动作"配对。

处理:像保姆从看 vlog 切到上岗实操,但电视没关,一边干活一边继续看。模型联合训练两个目标:

  • (a) 继续预测未来视频帧(保持对画面变化的敏感度)。
  • (b) 加一个 action head(动作输出头),预测对应时刻的机械臂动作(末端位姿/关节角等具体形式需读原文)。

两个损失联合优化,视频预测在这里相当于"辅助作业"。

输出:一个既能想象未来、又能输出动作的 VLA 模型。

辅助任务(auxiliary task):训练时除主任务(这里是动作预测)外,再加一个相关任务(这里是视频预测)一起优化,目的是让学到的表征更好。

3. 推理时部署

输入:当前观测 + 任务指令。

处理:像厨师上菜前先在脑子里把成品摆盘"演"一遍。模型先在内部"想象"未来视频,再同步输出动作。具体是先生成视频 token 再 condition 出动作(先脑补画面再读出动作),还是两者交织生成,需读原文确认架构细节。

输出:机器人在真实/仿真环境里执行的动作序列。

4. 工程要点

输入:整套训练/部署流程。

处理:模型规模、训练硬件、推理频率(机器人控制要求 10 Hz 以上,否则手抖跟不上)都是能不能真正部署的关键。

输出:一个可在真机上运行的系统。具体数字需读原文。

ASCII 总览:

阶段1(无机器人数据):
  互联网视频 + 文本 ──►[视频token化]──►[causal Transformer]──► 预测未来帧
                                                │(学到物理直觉)
阶段2(机器人数据):
  观测 + 指令 ──► 同一主干 ──┬──► 继续预测未来帧(辅助)
                            └──► [action head] ──► 动作
推理:
  观测+指令 ──► 想象未来画面 ──► 从想象读出动作

5. 为什么"先看几千万条视频"能让机器人更会干活

这是 GR-2 整套思路的地基,值得讲透。

输入:一个残酷的现实——高质量机器人示范数据极其稀缺(采一条要真人真机操作),而互联网视频几乎无限。

处理:GR-2 的赌注是:干活的本事,一大半是"懂世界怎么运转"。杯子被推会倒、水会往低处流、手挡住物体后面就看不见——这些物理常识,人类小孩是看着世界长大悟出来的,不是靠亲手操作几百万次。GR-2 让模型先看几千万条互联网视频、反复做"预测下一帧",逼它在没有任何机器人数据的情况下,先把这套"世界物理直觉"学到手。等到真正上机器人数据微调时,模型已经不是白纸,它只需要学"我这只手怎么和已经理解的世界互动",这比从零学省太多示范。

输出:一个把稀缺的机器人数据用在刀刃上、其余靠海量视频兜底的训练范式。

打个比方:与其让一个对世界一无所知的人硬练开车(要练很久),不如先让他看几千小时的路况视频建立直觉,再上车练几十次就上手。

6. 为什么微调时还要继续"预测视频"当辅助作业

输入:机器人轨迹数据 + 一个已经会想象视频的主干。

处理:微调阶段一个自然的想法是"既然要输出动作,那就只训动作头呗"。GR-2 偏不,它让模型一边学动作、一边继续预测未来视频帧,两个损失联合优化。这么做有三层用意:一是防止模型在少量机器人数据上过拟合、把预训练学到的世界知识"忘掉"(灾难性遗忘);二是"预测未来帧"这个辅助任务会持续逼模型维护一个关于"接下来会发生什么"的丰富表征,而好的动作恰恰依赖这种对后果的预判;三是把动作和它导致的视觉后果绑在一起学,动作就不再是凭空输出,而是"为了让世界变成想象中那样"而产生的。

输出:一个表征更扎实、更不易遗忘、动作与后果强关联的 VLA 模型。

所以这一节是想说:视频预测不是训练完就扔的脚手架,而是全程陪跑的辅助任务,专门用来保住世界知识、逼出对后果的预判。

7. "先脑补画面再读出动作"是一种什么范式

输入:当前观测 + 任务指令。

处理:GR-2 推理时的独特之处在于它不是"看一眼就直接吐动作",而是先在内部想象出未来该发生的画面,再从这个想象里读出该做的动作。这在思想上接近"基于模型的规划"——先在脑子里预演结果,再据此决定怎么动。它的好处是动作有了明确的"目标图景"作锚:模型不是盲目模仿示范里的手部轨迹,而是奔着"让世界变成想象中的样子"去动手,这让它对新物体、新摆放更有章法。具体是先生成完整视频 token 再解码动作,还是视频与动作交织生成,属于架构细节,需以原文为准。

输出:一串有"想象目标"支撑、而非纯反射式的动作序列。

8. 数据规模、多样性与泛化的关系

输入:几千万条视频 + 多任务机器人数据。

处理:GR-2 属于"用规模换泛化"的路线。互联网视频的题材极广,覆盖了海量物体、场景、交互方式,这种多样性是任何机器人数据集都给不了的,它直接决定了模型见识的广度;机器人微调数据则负责把这份广博的世界知识"接地"到具体本体的动作上。论文关心的核心问题正是:这样训出来的策略,能不能泛化到训练时没见过的新物体、新场景、新任务。这也是它和只在有限机器人数据上训练的策略最本质的区别——后者见识被数据集框死,前者的见识来自整个互联网。

输出:一个因"预训练见得广、微调接得准"而具备更强开放世界泛化潜力的机器人大模型。

顺带说一个部署上的现实约束:机器人控制要求足够高的频率(通常 10 Hz 以上),否则"先想象整段视频再读动作"会让手反应迟钝、跟不上环境变化。所以这类"生成式 VLA"在工程上必须解决"想象要快"的问题——要么压缩想象的分辨率/长度,要么让动作解码不必等完整视频生成完,这些取舍直接决定它能不能从演示视频里的漂亮结果走到真机上的实用系统。

所以这一节是想说:先用海量视频学会想象未来、建立世界物理直觉,再在机器人数据上加动作头联合微调(视频预测全程当辅助防遗忘),推理时"先脑补画面再从中读出动作"——稀缺的机器人数据只用来接地,广博的世界知识全靠视频兜底。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【GR-2: Generative Video-Language-Act… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

GR-2 — 方法示意:核心 pipeline
Plate Nº IIGR-2 — 方法示意:核心 pipeline

关键数字(What works)

GR-2 是字节跳动的技术报告。可确认的规模是预训练用了约 3800 万条互联网视频;其它精确指标(成功率、任务数、模型参数、scaling 曲线数值)需以原文为准,本笔记不编造。

关注点 说明 具体数值
预训练视频规模 互联网视频条数 约 3800 万(原文报告)
机器人微调数据 多任务轨迹 任务数/本体规模需读原文
多任务成功率 对比 RT-2/OpenVLA/π0 等 原文未在本笔记转录
新物体/新指令泛化 未见场景 原文未在本笔记转录
消融:去掉视频预训练 保留 掉分反映预训练价值

提醒:除"约 3800 万视频"外,其它数值请以 arXiv 原文(2410.06158)为准。

所以这一节是想说:能确认的是"3800 万视频预训练",成功率和泛化数字要回原文。最该盯的是 scaling 曲线和新物体/新指令泛化。


实验结果说明了什么

  • 互联网视频预训练确实有用:消融里"去掉视频预训练"掉分越多,越证明常识级视觉先验是机器人泛化的关键来源,而不只是锦上添花。
  • 视频预测作为辅助任务提升表征:保留"未来帧预测 loss"能让动作预测更强,说明"逼模型持续关注画面变化"对动作有帮助。
  • scaling 决定路线天花板:如果预训练数据/参数越大性能越好,说明这条路值得继续投入——这是判断路线价值的关键证据。
  • 想象可视化提供可解释性:模型生成的"想象未来"视频本身能拿来看,是难得的可解释证据,让你看见它"以为接下来会发生什么"。

所以这一节是想说:实验的灵魂是证明"视频预训练 + 视频预测辅助任务"各自有用,且规模越大越强。


你应该懂的几个新词

VLA(Vision-Language-Action)模型:输入图像 + 文本指令,输出机器人动作的端到端模型。

视频 token 化:把视频帧用码本压成离散 token 序列,便于 Transformer 自回归处理。

世界模型(World Model):学环境动力学、能预测下一状态的模型。GR-2 的视频生成器本质是"视觉空间的世界模型"。

辅助任务(Auxiliary Task):训练时附加的相关任务,用来让主任务的表征更好。

causal transformer:只能看过去不能看未来的自回归 Transformer,GPT 同款,适合生成。

机器人本体(Embodiment):具体的机械臂型号/自由度配置。跨本体迁移是 VLA 的硬骨头。

所以这一节是想说:抓住"VLA、视频 token 化、世界模型、辅助任务、causal transformer"这几个词,就抓住了 GR-2。


它有什么搞不定的

  • 依赖动作-视频对齐数据:微调阶段仍需机器人"观测 + 动作"配对,这类数据依然稀缺,是真正的瓶颈(视频本身不缺)。
  • 想象未来会出错:如果内部预演的画面不准,从中读出的动作也会错;生成质量直接影响控制质量。
  • 推理成本高:先生成视频再出动作,计算量大,达到 10 Hz+ 控制频率有工程压力。
  • 预训练数据偏置:3800 万视频若集中在某些领域(如烹饪),学到的先验会偏,迁移到差异大的任务打折。
  • 跨本体迁移仍难:不同机械臂自由度不同,视频先验通用但动作头仍要适配具体本体。

所以这一节是想说:GR-2 缺的不是视频而是"视频 + 动作"配对,想象会出错、推理重、有数据偏置,跨本体仍是难题。


它和别的几篇是什么关系

  • 直接前作GR-1——同思路的小规模版本,GR-2 主要把预训练数据扩到 3800 万。
  • 同期对比RT-2OpenVLAπ0——都是 VLA 路线,但 GR-2 强调"用互联网视频做预训练"这一独特卖点。
  • 思想源头GAIA-1IRISGenie——视频/世界模型路线,证明"视频生成"能学到物理直觉,GR-2 把这个直觉接到了下游控制。
  • 数据基建Open X-EmbodimentDROID 提供机器人微调数据;互联网视频部分更接近视频预训练语料(参考 Cosmos World Foundation)。
  • 平行路线Diffusion Policy / π0 走"动作扩散生成",不依赖视频预训练;GR-2 走"视频先验 + 动作头"。

所以这一节是想说:GR-2 把 GAIA-1/IRIS 的"视频生成学物理"接到 RT-2/OpenVLA 的"VLA 出动作"上,是两条线的缝合点。


和本导读的关系

  • 主线章节:Ch11 端到端 VLACh12 OpenVLA/VLAS/MLA。GR-2 是 VLA 家族里"用视频预训练"的代表。
  • 世界模型:Ch15 世界模型。GR-2 的视频生成器本质是视觉世界模型,是"世界模型 + 动作"结合的范例。
  • 若对"连续信号离散化 + 语言模型"陌生,可对照 Ch20 听觉智能 里 AudioLM 等同范式工作。

所以这一节是想说:GR-2 落在 Ch11/Ch12(VLA)与 Ch15(世界模型)的交叉处。


思考题

Q1:为什么互联网视频对机器人有用,尽管里面根本没有"机器人动作标签"?

提示

视频里天然含"动作 → 结果"的时序因果(推门门开、抓杯举起),模型能从中学到物理直觉,这种常识不需要动作标签就能学。

Q2:GR-2 说"动作从想象里读出来",这和 RT-2 直接出动作有什么本质不同?

提示

RT-2 直接映射到动作;GR-2 先预测未来画面(世界模型),再从这个预测里解出动作,多了一层"预演",泛化更靠物理直觉。

Q3:视频预测作为辅助任务,为什么能帮到动作预测?

提示

它逼模型持续关注画面如何变化,学到更好的时序视觉表征,动作头建立在更好的表征上自然更准。

Q4:GR-2 真正的数据瓶颈是什么?为什么不是视频本身?

提示

视频海量易得,瓶颈是"视频 + 对应机器人动作"的配对数据,这类数据稀缺,正是 Open X-Embodiment 等要解决的。

Q5:如果预训练视频全是烹饪场景,模型在洗衣任务上会怎样?

提示

数据偏置会让先验偏向烹饪相关的物理,迁移到差异大的洗衣任务时收益打折,需更均衡的预训练数据。

Q6:推理时"先生成视频再出动作"带来什么工程难题?

提示

计算量大、延迟高,难以满足机器人 10 Hz+ 的实时控制要求,需要加速或简化想象步骤。

Q7:GR-2 和 GAIA-1 都用"视频 token + Transformer",最大的目标差异是什么?

提示

GAIA-1 是纯世界模型(只生成未来画面);GR-2 在此之上加了动作头,目标是产出可执行动作,是"世界模型 + 策略"。

所以这一节是想说:想清楚这些题,你就理解了"视频为何有用""从想象读动作""辅助任务的作用""真正的数据瓶颈"这几件核心事。


一些好奇心问答(FAQ)

Q:GR-2 是开源的吗?

它是字节跳动的技术报告,可通过项目主页看 demo。权重开放程度需查官方。

Q:3800 万视频是怎么筛的?

具体过滤/清洗策略需读原文。数据规模是它相对 GR-1 的主要升级点。

Q:它比 π0 强吗?

定位不同。π0 走流匹配动作头、不强调视频预训练;GR-2 主打视频先验。直接高下需看同设定对比,本笔记不编造数字。

Q:为什么机器人控制要 10 Hz 以上?

太慢机器人反应跟不上环境变化,手会"卡顿"甚至失稳。实时性是部署硬约束。

Q:零基础怎么入门这套机制?

先理解"视频 token 化 + 自回归生成",可配合 AudioLM/MusicLM 这类"离散化再做语言模型"的工作一起看,能快速搭起整体框架。

所以这一节是想说:GR-2 的难点在"视频 token 化 + 自回归 + 世界模型",建议配同范式工作一起打基础。


如果你想再深入

  1. 先看官方 demo —— 对照"想象未来"和"实际动作",比读方法快建立直觉。
  2. 前置:RT-2 / OpenVLA —— 懂 VLA 基础范式。
  3. 前置:GAIA-1 / IRIS —— 懂"视频生成学物理"的世界模型思路。
  4. 同范式:AudioLM —— 理解"连续信号离散化 + 语言模型"的通用套路。
  5. 想复现 —— 关注消融(去视频预训练、去视频预测 loss 各掉多少)和预训练数据细节。

所以这一节是想说:先看 demo,再补 VLA(RT-2)和世界模型(GAIA-1/IRIS),把 GR-2 当两者的缝合成品来读。


原文信息

  • 标题:GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation
  • arXiv:https://arxiv.org/abs/2410.06158
  • 发表:字节跳动技术报告(arXiv)
  • 年份:2024
@article{cheang2024gr2,
  title  = {GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation},
  author = {Cheang, Chi-Lam and others},
  journal = {arXiv preprint arXiv:2410.06158},
  year   = {2024}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_gr_2_2026,
  title       = {(readable note) GR-2: Generative Video-Language-Action Model},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/gr-2/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?