UniSim
这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。
一句话讲什么(TL;DR)
看过海量视频后,你给它一个动作(说一句话 / 推一下机械臂 / 挪一下镜头),它就生成"接下来世界长什么样"的视频——像一台会脑补现实的"游戏机",还能拿它当机器人的训练场。
所以这一节是想说:UniSim 把"仿真器"重新做成一个吃各种动作格式的条件视频生成模型,用海量真实视频学出一个通用"现实引擎"。
这是个什么场景
你伸手去拿桌上的杯子前,脑子里其实已经"预演"过一遍:手伸过去 → 指头碰到杯壁 → 杯子被拿起来。如果中途感觉"不对,会撞到旁边水壶",你会临时改路线。这个在脑子里放小电影、不用真做就能预见后果的能力,就是 UniSim 想给机器人装上的本事。
更具体:给它一张当前画面 + 一个动作("机械臂往左移 10cm""打开抽屉",或一句话"把苹果放进碗里"),它播一段视频告诉你"做完之后世界长什么样"。
麻烦在于教材太杂——人类做饭的第一视角视频、机械臂抓东西的演示、汽车开在路上的录像,每种数据写"动作"的格式都不一样。UniSim 要把这一锅杂烩塞进同一个模型,让它学出一个通用的"现实世界引擎"。
仿真器(simulator):让 agent 在里面练习而不用碰真实世界的模拟环境。传统仿真器(MuJoCo、CARLA)靠人工建物理规则;UniSim 靠从视频里学。
所以这一节是想说:UniSim 面对的是"传统仿真器靠手工建模、场景有限、与真实世界有差距"这个老问题,它想用海量真实视频学一个通用可交互仿真器。

之前的人怎么做的,为什么不够好
- 专用仿真器:MuJoCo、Isaac Sim、CARLA,靠人工建模 3D 资产 + 物理参数。逼真但场景有限,搬到真实世界有 sim-to-real gap。
- 早期基于像素的世界模型:World Models(Ha & Schmidhuber 2018)、Dreamer 系列在低维任务(Atari、DM Control)上学"环境压缩 + 预测",但分辨率低、场景单一。
- 视频预测模型:FitVid、MCVD 等能条件视频生成,但条件通常只能是"过去几帧",接不了语言/动作这种异构控制信号。
- 大规模视频生成模型:Phenaki、Imagen Video 能从文本生成长视频,但是"放电影"模式——没法在中途插一个动作改变剧情。
- 特定领域世界模型:GAIA-1(自动驾驶)、UniPi(决策即视频生成)已在试"动作条件视频生成",UniSim 把这条路推到通用尺度。
所以这一节是想说:以前的仿真器要么手工建、要么场景窄、要么不能被动作实时干预,没人做出"吃各种动作、覆盖各种场景"的通用交互仿真器。
这篇论文的新想法
过去的仿真器像"乐高积木"——你得手工搭好每块物理规则,搭得辛苦又不像真世界。UniSim 换思路:不搭,直接让模型从海量真实视频里自己看会"世界怎么动"。
技术上,把"仿真器"重新定义成一个条件视频扩散模型(conditional video diffusion model):输入 = 当前观测(一张图或一小段视频)+ 一个动作(文字、机械臂控制信号、相机位姿等不同格式),输出 = 接下来的视频帧。
关键工程哲学是数据统一:不管样本来自机器人演示、人类第一视角视频、还是网络视频,都把"动作"翻译成同一种条件嵌入灌进同一个接口。这样不同来源的数据能互补——网络视频教模型"水会流"这种常识,机械臂数据教模型"夹爪闭合就能抓起东西"这种因果。
仿真器训好后,下游直接接上来:让策略在里面 rollout(反复试跑)、给视觉语言模型造反事实训练数据、把它当强化学习里"真实世界的廉价副本"。
所以这一节是想说:UniSim 的新意是"把仿真器做成能吃异构动作格式的条件视频扩散模型",用数据统一让多源真实视频互相补。
它分几步做的(方法)
这一节是全篇核心,拆成"统一接口、多源混训、长程一致性、下游接入"四块。
整体数据流 ASCII 示意:
当前观测(图/短视频) ┐
文本动作 ─► T5/CLIP ┤
机械臂动作 ─► MLP ──┼─► 统一条件 token ─► 视频扩散模型(cross-attn) ─► 未来视频帧
相机位姿 ─► 投影 ───┘ │ 自回归接力生成长视频
第 1 步:统一接口的扩散模型——只配一个总接待
输入:当前观测 + 一个动作(格式五花八门)。
处理:像翻译公司只配一个总接待,谁来都先翻成英语再进会议室。UniSim 的"总接待"是骨架的视频扩散模型(架构类似 Imagen Video / Stable Video Diffusion)。文本指令用 T5/CLIP 编码、机械臂关节角和末端位姿走 MLP 投影、相机外参(自动驾驶/导航的位姿变化)也照样接进来——最后所有条件都统一成一串 token,丢进 cross-attention(交叉注意力,让生成过程"看见"这些条件)。
输出:一个能被任意动作格式驱动的视频生成器。
等等,先慢一拍——"扩散模型"是什么?
简单说:先教模型怎么把一张清晰图慢慢加噪点变成雪花屏,再反过来训它从雪花屏一步步去噪还原图像。生成时从随机雪花出发,模型逐步擦干净就拿到新图。视频扩散就是把这套用到"一叠帧"上。
第 2 步:多源数据混训——一个学生同时啃三本教材
输入:机器人操作数据(Bridge、RT-1 系列)、人类第一视角视频(Ego4D 之类)、模拟器数据,可能还有网络视频。
处理:每条样本带一个"我来自哪本教材"的标签,让模型知道这次的动作信号是哪种格式。不同教材互补——网络视频教常识,机器人数据教操作因果。
输出:一个见多识广、能泛化到多种场景的世界模型。具体配比和数据集列表需查原文。
第 3 步:长程一致性——接力跑生成长视频
输入:需要模拟"机械臂连续做几个动作"的多步交互。
处理:单步预测的视频模型滚两步就画面崩坏。UniSim 用 autoregressive(自回归,把上一轮输出当下一轮输入)的接力法,分块滚动生成长视频。
输出:一段连贯的多步交互视频。
autoregressive rollout(自回归展开):把上一轮输出作为下一轮输入,循环生成长序列。长视频/长交互靠它接起来。
第 4 步:下游应用接入——仿真器要能干活
输入:训好的 UniSim。
处理:论文给了几条路:
- (a) 当离线强化学习的仿真器,让策略在仿真轨迹上学。
- (b) 用它生成的反事实视频去训 VLM(视觉语言模型)做长任务规划。
- (c) sim-to-real 闭环——在 UniSim 里训完的策略直接放真实机器人上跑。
输出:真实可用的下游能力,而不只是好看的视频。
所以这一节是想说:UniSim 的方法 = 统一条件接口 + 多源真实视频混训 + 自回归长程一致 + 下游策略/VLM 接入,四步把"视频生成"变成"可交互仿真器"。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【UniSim · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
下表整理关键设定与定性结论;具体 FVD/成功率请查原文,此处不编造。
| 维度 | 说明 |
|---|---|
| 仿真器形态 | 条件视频扩散模型 |
| 动作格式 | 文本 / 机械臂控制 / 相机位姿等异构 |
| 数据来源 | 机器人演示 + 人类第一视角 + 模拟器 + 网络视频 |
| 条件注入 | cross-attention |
| 长视频 | 自回归分块接力 |
| 视频质量指标 | FVD(Fréchet Video Distance,越低越像真实) |
| 下游验证 | 策略 sim-to-real、VLM 反事实训练 |
关键结论:UniSim 证明了"用同一个模型吃下异构动作格式、多源真实数据"是可行的,而且训出的仿真器真能教出可迁移到真机的策略,也能给 VLM 造有用的训练数据。
所以这一节是想说:数字告诉我们,UniSim 不只是生成好看的视频,它作为仿真器真能训出下游可用的策略和模型。
实验结果说明了什么
主要从三类问题验证:"仿真够不够真""仿真器能不能教出真策略""仿真器能不能让 VLM 学到东西"。
- 视频生成质量:用 FVD 等指标对比传统视频预测模型和不做多源融合的消融版本。
- 机器人策略:展示在 UniSim 里训出的策略迁移到真实机器人的成功率,验证 sim-to-real gap 是否缩小。
- VLM 训练:用 UniSim 生成的"看不见的反事实"微调 VLM,看长任务规划准确率有没有涨。
所以这一节是想说:实验共同证明"用生成模型当仿真器"不是花架子——它能同时改善视频质量、策略迁移和 VLM 训练三件事。
你应该懂的几个新词
- 世界模型:根据"当前状态 + 动作"预测"下一状态"的内部模型。下棋时脑内推演就是一个世界模型。
- 扩散模型:先把数据加噪到纯噪声,再训网络逆向去噪,生成时从随机噪声逐步还原。
- 动作条件视频生成(action-conditioned video generation):不仅给过去的视频,还给一个"动作"信号告诉模型接下来发生什么。
- sim-to-real gap:仿真里训得好、真实世界翻车的现象,源于仿真的物理/视觉/动力学偏差。
- cross-attention conditioning:把外部条件(文本、动作向量)作为 key/value 接到生成模型的注意力层,让生成"看见"条件。
- autoregressive rollout:把上一轮输出当下一轮输入,循环生成长序列。
- FVD:视频生成版的 FID,衡量生成视频和真实分布的距离。
所以这一节是想说:这几个词是理解"生成式世界模型/仿真器"这条线的通用基础。
它有什么搞不定的
- 误差累积:自回归长视频滚久了仍会漂移、崩坏,长交互的一致性有上限。
- 物理不严格:从视频学的"物理"是统计相关,不是真物理,可能生成看似合理但违反物理的画面。
- 计算昂贵:视频扩散训练和推理都很重,远慢于传统物理引擎,实时交互困难。
- 动作可控性有限:能大致响应动作,但精确的、连续闭环控制的响应精度不如真物理仿真。
- 数据偏见:生成质量受训练视频分布限制,罕见/长尾场景表现差。
所以这一节是想说:UniSim 的短板集中在"误差累积、物理不严格、算力昂贵"上——它逼真但不精确、通用但不便宜。
它和别的几篇是什么关系
- 上游:继承 Imagen Video / Stable Video Diffusion 的视频扩散架构、Ha & Schmidhuber 的世界模型思想、UniPi(视频生成即决策)的"用生成模型当仿真器"范式。
- 同代:和 GAIA-1(自动驾驶世界模型)、Genie(DeepMind 2024,可玩的潜在动作世界模型)、1X World Model 共同探索"用生成模型做交互式仿真器"。GAIA-1 限自动驾驶,Genie 学潜在动作不依赖标注,UniSim 主打多源真实数据 + 多种显式动作格式。
- 前身桥梁:TWM 先证明了"Transformer 世界模型"可行,UniSim 是把生成器换成视频扩散、放大到通用尺度的版本。
- 下游:RT-2-X、Open X-Embodiment 在大规模真实机器人数据上做类似统一化,UniSim 在"用视频做仿真器"这条线上是关键节点。
- 对照:和 RT-1 这种"直接学 policy"不同,UniSim 是"先学环境再用环境训 policy"的两步走。
所以这一节是想说:UniSim 是"用大模型把现实压成可交互仿真器"这条路线的代表作,是 TWM 之后生成式世界模型的放大版。
和本导读的关系
本篇对应导读 Ch15: 世界模型。Ch15 讲 agent 怎么学一个"脑内环境",UniSim 是这条线走到"生成式、通用、多源"阶段的代表——它把世界模型从 Atari 级的低维预测,推到了"高清视频级、吃各种动作格式"的通用仿真器。读完本篇,配合同章的 TWM(Transformer 世界模型的早期证明)、1X World Model(机器人专用世界模型),能串出世界模型从低维到视频级的完整演化。
所以这一节是想说:把 UniSim 放进 Ch15 的世界模型主线里读,它是"生成式通用仿真器"这一格的代表。
思考题
Q1:为什么 UniSim 要把仿真器做成"视频生成模型"而不是继续用物理引擎?
提示
物理引擎要人工建每个场景和规则,覆盖窄、与真实有差距。视频生成模型能从海量真实视频里自己学"世界怎么动",场景覆盖广、视觉逼真。代价是物理不严格、算力贵。
Q2:数据统一(把各种动作格式翻成同一种条件)为什么是 UniSim 能 scale 的关键?
提示
统一接口后,机器人数据、人类视频、网络视频能塞进同一个模型互补——网络视频教常识,机器人数据教操作因果。不统一就只能各训各的,学不到跨源的互补知识。
Q3:自回归生成长视频为什么会"滚着滚着崩坏"?怎么缓解?
提示
每一轮的输出都带一点误差,作为下一轮输入后误差被喂回去、逐步累积放大。缓解手段包括分块生成、限制 rollout 长度、更强的一致性约束。彻底解决很难。
Q4:UniSim 学到的"物理"和真实物理有什么本质区别?这会带来什么风险?
提示
它学的是"视频里像素怎么变"的统计相关,不是真正的物理方程。风险是生成看似合理但违反物理的画面(比如物体穿模、水凭空消失),用来训策略可能学到错误因果。
Q5:把 UniSim 当强化学习的仿真器,相比真实环境采数据有什么利弊?
提示
利:便宜、安全、可大量并行、能造反事实。弊:sim-to-real gap(仿真不准,策略可能过拟合到仿真的瑕疵),且视频扩散仿真本身很慢。
Q6:UniSim 和 Genie 都是"生成式世界模型",一个用显式动作格式、一个学潜在动作,各有什么取舍?
提示
UniSim 用显式动作(文本/控制信号)——可控、可指令,但需要有标注的动作数据。Genie 学潜在动作——不依赖动作标注、能从纯视频学,但动作语义不明确、可控性弱。标注依赖 vs 可控性的取舍。
所以这一节是想说:这几个问题带你把"为什么生成式、数据统一、误差累积、伪物理、sim-to-real、显式 vs 潜在动作"这些核心点自己推一遍。
一些好奇心问答(FAQ)
Q1:UniSim 能实时交互吗?像玩游戏那样?
初代不能实时——视频扩散推理很慢。它更像"离线仿真器",用来批量生成训练轨迹,而不是即时可玩。实时可玩的方向后来由 Genie 等推进。
Q2:它生成的视频真到什么程度?
看 demo 才有直觉——建议去项目主页看几段 rollout。定性上足够真到能当训练场,但细看仍有生成模型的瑕疵。
Q3:它需要多少数据?
海量、多源(机器人 + 人类视频 + 模拟器 + 网络视频)。这也是它算力和数据门槛高、普通团队难复现的原因。
Q4:为什么说它是"通用"仿真器?
因为它不限定单一领域(不像 GAIA-1 只做自动驾驶),能吃多种动作格式、覆盖操作/导航/日常等多种场景。
Q5:UniSim 和 TWM 是什么关系?
TWM 先证明了"Transformer 世界模型"在小任务上可行;UniSim 是把生成器换成视频扩散、数据换成多源真实视频、规模放大到通用的现代版。一脉相承。
Q6:读完 UniSim 接下来看什么?
想看前身证明看 TWM;想看机器人专用世界模型看 1X World Model;想看潜在动作路线看 Genie。
所以这一节是想说:能不能实时、要多少数据、和 TWM 什么关系——这些实操问题都有明确答案。
如果你想再深入
按"前身 → 架构来源 → 同代"排序:
- 前身:TWM —— Transformer 世界模型的早期证明。
- 架构来源:Stable Video Diffusion / Imagen Video —— UniSim 的视频扩散骨架。
- 范式来源:UniPi —— "用生成模型当仿真器/决策器"的思想源头。
- 同代:Genie / GAIA-1 / 1X World Model —— 交互式生成世界模型的不同侧重。
所以这一节是想说:把 TWM + Stable Video Diffusion + UniSim + Genie 连起来读,就能看懂世界模型走向"生成式通用仿真器"的这一步。
原文信息
- 标题:Learning Interactive Real-World Simulators(UniSim)
- arXiv:https://arxiv.org/abs/2310.06114
- 会议:ICLR 2024(Outstanding Paper)
- 年份:2024
BibTeX:
@inproceedings{yang2024unisim,
title = {Learning Interactive Real-World Simulators},
author = {Yang, Mengjiao and Du, Yilun and Ghasemipour, Kamyar and others},
booktitle = {International Conference on Learning Representations (ICLR)},
year = {2024},
url = {https://arxiv.org/abs/2310.06114}
}
所以整篇是想说:UniSim 把"仿真器"从手工搭的乐高,变成了从海量真实视频学出来的条件视频生成模型——它让"用同一个模型吃下各种动作、模拟整个现实世界"第一次成为可用的训练场。
◼
引用本笔记 / Cite this note
@online{eai_unisim_2026,
title = {(readable note) UniSim},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/unisim/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?