Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 156

UniSim

13 min read · 4589 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

看过海量视频后,你给它一个动作(说一句话 / 推一下机械臂 / 挪一下镜头),它就生成"接下来世界长什么样"的视频——像一台会脑补现实的"游戏机",还能拿它当机器人的训练场。

所以这一节是想说:UniSim 把"仿真器"重新做成一个吃各种动作格式的条件视频生成模型,用海量真实视频学出一个通用"现实引擎"。


这是个什么场景

你伸手去拿桌上的杯子前,脑子里其实已经"预演"过一遍:手伸过去 → 指头碰到杯壁 → 杯子被拿起来。如果中途感觉"不对,会撞到旁边水壶",你会临时改路线。这个在脑子里放小电影、不用真做就能预见后果的能力,就是 UniSim 想给机器人装上的本事。

更具体:给它一张当前画面 + 一个动作("机械臂往左移 10cm""打开抽屉",或一句话"把苹果放进碗里"),它播一段视频告诉你"做完之后世界长什么样"。

麻烦在于教材太杂——人类做饭的第一视角视频、机械臂抓东西的演示、汽车开在路上的录像,每种数据写"动作"的格式都不一样。UniSim 要把这一锅杂烩塞进同一个模型,让它学出一个通用的"现实世界引擎"。

仿真器(simulator):让 agent 在里面练习而不用碰真实世界的模拟环境。传统仿真器(MuJoCo、CARLA)靠人工建物理规则;UniSim 靠从视频里学。

所以这一节是想说:UniSim 面对的是"传统仿真器靠手工建模、场景有限、与真实世界有差距"这个老问题,它想用海量真实视频学一个通用可交互仿真器。


UniSim — 场景示意:这论文要解决的现实问题
Plate Nº IUniSim — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 专用仿真器:MuJoCo、Isaac Sim、CARLA,靠人工建模 3D 资产 + 物理参数。逼真但场景有限,搬到真实世界有 sim-to-real gap。
  • 早期基于像素的世界模型:World Models(Ha & Schmidhuber 2018)、Dreamer 系列在低维任务(Atari、DM Control)上学"环境压缩 + 预测",但分辨率低、场景单一。
  • 视频预测模型:FitVid、MCVD 等能条件视频生成,但条件通常只能是"过去几帧",接不了语言/动作这种异构控制信号。
  • 大规模视频生成模型:Phenaki、Imagen Video 能从文本生成长视频,但是"放电影"模式——没法在中途插一个动作改变剧情。
  • 特定领域世界模型:GAIA-1(自动驾驶)、UniPi(决策即视频生成)已在试"动作条件视频生成",UniSim 把这条路推到通用尺度。

所以这一节是想说:以前的仿真器要么手工建、要么场景窄、要么不能被动作实时干预,没人做出"吃各种动作、覆盖各种场景"的通用交互仿真器。


这篇论文的新想法

过去的仿真器像"乐高积木"——你得手工搭好每块物理规则,搭得辛苦又不像真世界。UniSim 换思路:不搭,直接让模型从海量真实视频里自己看会"世界怎么动"。

技术上,把"仿真器"重新定义成一个条件视频扩散模型(conditional video diffusion model):输入 = 当前观测(一张图或一小段视频)+ 一个动作(文字、机械臂控制信号、相机位姿等不同格式),输出 = 接下来的视频帧。

关键工程哲学是数据统一:不管样本来自机器人演示、人类第一视角视频、还是网络视频,都把"动作"翻译成同一种条件嵌入灌进同一个接口。这样不同来源的数据能互补——网络视频教模型"水会流"这种常识,机械臂数据教模型"夹爪闭合就能抓起东西"这种因果。

仿真器训好后,下游直接接上来:让策略在里面 rollout(反复试跑)、给视觉语言模型造反事实训练数据、把它当强化学习里"真实世界的廉价副本"。

所以这一节是想说:UniSim 的新意是"把仿真器做成能吃异构动作格式的条件视频扩散模型",用数据统一让多源真实视频互相补。


它分几步做的(方法)

这一节是全篇核心,拆成"统一接口、多源混训、长程一致性、下游接入"四块。

整体数据流 ASCII 示意:

   当前观测(图/短视频) ┐
   文本动作 ─► T5/CLIP ┤
   机械臂动作 ─► MLP ──┼─► 统一条件 token ─► 视频扩散模型(cross-attn) ─► 未来视频帧
   相机位姿 ─► 投影 ───┘                              │ 自回归接力生成长视频

第 1 步:统一接口的扩散模型——只配一个总接待

输入:当前观测 + 一个动作(格式五花八门)。

处理:像翻译公司只配一个总接待,谁来都先翻成英语再进会议室。UniSim 的"总接待"是骨架的视频扩散模型(架构类似 Imagen Video / Stable Video Diffusion)。文本指令用 T5/CLIP 编码、机械臂关节角和末端位姿走 MLP 投影、相机外参(自动驾驶/导航的位姿变化)也照样接进来——最后所有条件都统一成一串 token,丢进 cross-attention(交叉注意力,让生成过程"看见"这些条件)。

输出:一个能被任意动作格式驱动的视频生成器。

等等,先慢一拍——"扩散模型"是什么?

简单说:先教模型怎么把一张清晰图慢慢加噪点变成雪花屏,再反过来训它从雪花屏一步步去噪还原图像。生成时从随机雪花出发,模型逐步擦干净就拿到新图。视频扩散就是把这套用到"一叠帧"上。

第 2 步:多源数据混训——一个学生同时啃三本教材

输入:机器人操作数据(Bridge、RT-1 系列)、人类第一视角视频(Ego4D 之类)、模拟器数据,可能还有网络视频。

处理:每条样本带一个"我来自哪本教材"的标签,让模型知道这次的动作信号是哪种格式。不同教材互补——网络视频教常识,机器人数据教操作因果。

输出:一个见多识广、能泛化到多种场景的世界模型。具体配比和数据集列表需查原文。

第 3 步:长程一致性——接力跑生成长视频

输入:需要模拟"机械臂连续做几个动作"的多步交互。

处理:单步预测的视频模型滚两步就画面崩坏。UniSim 用 autoregressive(自回归,把上一轮输出当下一轮输入)的接力法,分块滚动生成长视频。

输出:一段连贯的多步交互视频。

autoregressive rollout(自回归展开):把上一轮输出作为下一轮输入,循环生成长序列。长视频/长交互靠它接起来。

第 4 步:下游应用接入——仿真器要能干活

输入:训好的 UniSim。

处理:论文给了几条路:

  • (a) 当离线强化学习的仿真器,让策略在仿真轨迹上学。
  • (b) 用它生成的反事实视频去训 VLM(视觉语言模型)做长任务规划。
  • (c) sim-to-real 闭环——在 UniSim 里训完的策略直接放真实机器人上跑。

输出:真实可用的下游能力,而不只是好看的视频。

所以这一节是想说:UniSim 的方法 = 统一条件接口 + 多源真实视频混训 + 自回归长程一致 + 下游策略/VLM 接入,四步把"视频生成"变成"可交互仿真器"。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【UniSim · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

UniSim — 方法示意:核心 pipeline
Plate Nº IIUniSim — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体 FVD/成功率请查原文,此处不编造。

维度 说明
仿真器形态 条件视频扩散模型
动作格式 文本 / 机械臂控制 / 相机位姿等异构
数据来源 机器人演示 + 人类第一视角 + 模拟器 + 网络视频
条件注入 cross-attention
长视频 自回归分块接力
视频质量指标 FVD(Fréchet Video Distance,越低越像真实)
下游验证 策略 sim-to-real、VLM 反事实训练

关键结论:UniSim 证明了"用同一个模型吃下异构动作格式、多源真实数据"是可行的,而且训出的仿真器真能教出可迁移到真机的策略,也能给 VLM 造有用的训练数据。

所以这一节是想说:数字告诉我们,UniSim 不只是生成好看的视频,它作为仿真器真能训出下游可用的策略和模型。


实验结果说明了什么

主要从三类问题验证:"仿真够不够真""仿真器能不能教出真策略""仿真器能不能让 VLM 学到东西"。

  • 视频生成质量:用 FVD 等指标对比传统视频预测模型和不做多源融合的消融版本。
  • 机器人策略:展示在 UniSim 里训出的策略迁移到真实机器人的成功率,验证 sim-to-real gap 是否缩小。
  • VLM 训练:用 UniSim 生成的"看不见的反事实"微调 VLM,看长任务规划准确率有没有涨。

所以这一节是想说:实验共同证明"用生成模型当仿真器"不是花架子——它能同时改善视频质量、策略迁移和 VLM 训练三件事。


你应该懂的几个新词

  • 世界模型:根据"当前状态 + 动作"预测"下一状态"的内部模型。下棋时脑内推演就是一个世界模型。
  • 扩散模型:先把数据加噪到纯噪声,再训网络逆向去噪,生成时从随机噪声逐步还原。
  • 动作条件视频生成(action-conditioned video generation):不仅给过去的视频,还给一个"动作"信号告诉模型接下来发生什么。
  • sim-to-real gap:仿真里训得好、真实世界翻车的现象,源于仿真的物理/视觉/动力学偏差。
  • cross-attention conditioning:把外部条件(文本、动作向量)作为 key/value 接到生成模型的注意力层,让生成"看见"条件。
  • autoregressive rollout:把上一轮输出当下一轮输入,循环生成长序列。
  • FVD:视频生成版的 FID,衡量生成视频和真实分布的距离。

所以这一节是想说:这几个词是理解"生成式世界模型/仿真器"这条线的通用基础。


它有什么搞不定的

  • 误差累积:自回归长视频滚久了仍会漂移、崩坏,长交互的一致性有上限。
  • 物理不严格:从视频学的"物理"是统计相关,不是真物理,可能生成看似合理但违反物理的画面。
  • 计算昂贵:视频扩散训练和推理都很重,远慢于传统物理引擎,实时交互困难。
  • 动作可控性有限:能大致响应动作,但精确的、连续闭环控制的响应精度不如真物理仿真。
  • 数据偏见:生成质量受训练视频分布限制,罕见/长尾场景表现差。

所以这一节是想说:UniSim 的短板集中在"误差累积、物理不严格、算力昂贵"上——它逼真但不精确、通用但不便宜。


它和别的几篇是什么关系

  • 上游:继承 Imagen Video / Stable Video Diffusion 的视频扩散架构、Ha & Schmidhuber 的世界模型思想、UniPi(视频生成即决策)的"用生成模型当仿真器"范式。
  • 同代:和 GAIA-1(自动驾驶世界模型)、Genie(DeepMind 2024,可玩的潜在动作世界模型)、1X World Model 共同探索"用生成模型做交互式仿真器"。GAIA-1 限自动驾驶,Genie 学潜在动作不依赖标注,UniSim 主打多源真实数据 + 多种显式动作格式。
  • 前身桥梁TWM 先证明了"Transformer 世界模型"可行,UniSim 是把生成器换成视频扩散、放大到通用尺度的版本。
  • 下游:RT-2-X、Open X-Embodiment 在大规模真实机器人数据上做类似统一化,UniSim 在"用视频做仿真器"这条线上是关键节点。
  • 对照:和 RT-1 这种"直接学 policy"不同,UniSim 是"先学环境再用环境训 policy"的两步走。

所以这一节是想说:UniSim 是"用大模型把现实压成可交互仿真器"这条路线的代表作,是 TWM 之后生成式世界模型的放大版。


和本导读的关系

本篇对应导读 Ch15: 世界模型。Ch15 讲 agent 怎么学一个"脑内环境",UniSim 是这条线走到"生成式、通用、多源"阶段的代表——它把世界模型从 Atari 级的低维预测,推到了"高清视频级、吃各种动作格式"的通用仿真器。读完本篇,配合同章的 TWM(Transformer 世界模型的早期证明)、1X World Model(机器人专用世界模型),能串出世界模型从低维到视频级的完整演化。

所以这一节是想说:把 UniSim 放进 Ch15 的世界模型主线里读,它是"生成式通用仿真器"这一格的代表。


思考题

Q1:为什么 UniSim 要把仿真器做成"视频生成模型"而不是继续用物理引擎?

提示

物理引擎要人工建每个场景和规则,覆盖窄、与真实有差距。视频生成模型能从海量真实视频里自己学"世界怎么动",场景覆盖广、视觉逼真。代价是物理不严格、算力贵。

Q2:数据统一(把各种动作格式翻成同一种条件)为什么是 UniSim 能 scale 的关键?

提示

统一接口后,机器人数据、人类视频、网络视频能塞进同一个模型互补——网络视频教常识,机器人数据教操作因果。不统一就只能各训各的,学不到跨源的互补知识。

Q3:自回归生成长视频为什么会"滚着滚着崩坏"?怎么缓解?

提示

每一轮的输出都带一点误差,作为下一轮输入后误差被喂回去、逐步累积放大。缓解手段包括分块生成、限制 rollout 长度、更强的一致性约束。彻底解决很难。

Q4:UniSim 学到的"物理"和真实物理有什么本质区别?这会带来什么风险?

提示

它学的是"视频里像素怎么变"的统计相关,不是真正的物理方程。风险是生成看似合理但违反物理的画面(比如物体穿模、水凭空消失),用来训策略可能学到错误因果。

Q5:把 UniSim 当强化学习的仿真器,相比真实环境采数据有什么利弊?

提示

利:便宜、安全、可大量并行、能造反事实。弊:sim-to-real gap(仿真不准,策略可能过拟合到仿真的瑕疵),且视频扩散仿真本身很慢。

Q6:UniSim 和 Genie 都是"生成式世界模型",一个用显式动作格式、一个学潜在动作,各有什么取舍?

提示

UniSim 用显式动作(文本/控制信号)——可控、可指令,但需要有标注的动作数据。Genie 学潜在动作——不依赖动作标注、能从纯视频学,但动作语义不明确、可控性弱。标注依赖 vs 可控性的取舍。

所以这一节是想说:这几个问题带你把"为什么生成式、数据统一、误差累积、伪物理、sim-to-real、显式 vs 潜在动作"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:UniSim 能实时交互吗?像玩游戏那样?

初代不能实时——视频扩散推理很慢。它更像"离线仿真器",用来批量生成训练轨迹,而不是即时可玩。实时可玩的方向后来由 Genie 等推进。

Q2:它生成的视频真到什么程度?

看 demo 才有直觉——建议去项目主页看几段 rollout。定性上足够真到能当训练场,但细看仍有生成模型的瑕疵。

Q3:它需要多少数据?

海量、多源(机器人 + 人类视频 + 模拟器 + 网络视频)。这也是它算力和数据门槛高、普通团队难复现的原因。

Q4:为什么说它是"通用"仿真器?

因为它不限定单一领域(不像 GAIA-1 只做自动驾驶),能吃多种动作格式、覆盖操作/导航/日常等多种场景。

Q5:UniSim 和 TWM 是什么关系?

TWM 先证明了"Transformer 世界模型"在小任务上可行;UniSim 是把生成器换成视频扩散、数据换成多源真实视频、规模放大到通用的现代版。一脉相承。

Q6:读完 UniSim 接下来看什么?

想看前身证明看 TWM;想看机器人专用世界模型看 1X World Model;想看潜在动作路线看 Genie。

所以这一节是想说:能不能实时、要多少数据、和 TWM 什么关系——这些实操问题都有明确答案。


如果你想再深入

按"前身 → 架构来源 → 同代"排序:

  1. 前身:TWM —— Transformer 世界模型的早期证明。
  2. 架构来源:Stable Video Diffusion / Imagen Video —— UniSim 的视频扩散骨架。
  3. 范式来源:UniPi —— "用生成模型当仿真器/决策器"的思想源头。
  4. 同代:Genie / GAIA-1 / 1X World Model —— 交互式生成世界模型的不同侧重。

所以这一节是想说:把 TWM + Stable Video Diffusion + UniSim + Genie 连起来读,就能看懂世界模型走向"生成式通用仿真器"的这一步。


原文信息

  • 标题:Learning Interactive Real-World Simulators(UniSim)
  • arXiv:https://arxiv.org/abs/2310.06114
  • 会议:ICLR 2024(Outstanding Paper)
  • 年份:2024

BibTeX:

@inproceedings{yang2024unisim,
  title     = {Learning Interactive Real-World Simulators},
  author    = {Yang, Mengjiao and Du, Yilun and Ghasemipour, Kamyar and others},
  booktitle = {International Conference on Learning Representations (ICLR)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2310.06114}
}

所以整篇是想说:UniSim 把"仿真器"从手工搭的乐高,变成了从海量真实视频学出来的条件视频生成模型——它让"用同一个模型吃下各种动作、模拟整个现实世界"第一次成为可用的训练场。

引用本笔记 / Cite this note
BibTeX
@online{eai_unisim_2026,
  title       = {(readable note) UniSim},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/unisim/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?