Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 155

Navigation World Models

14 min read · 4908 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过世界模型/导航"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么一个会预测'我这样走画面会变成啥样'的模型,能帮机器人规划路线,甚至在没去过的地方靠一张照片脑补路线"。

一句话讲什么(TL;DR)

训练一个"导航世界模型"(NWM):给它当前看到的画面和一串打算走的动作,它就能像放电影一样预测出"这样走下去画面会变成什么样"。有了这个"脑内模拟器",智能体可以先在脑子里把好几条路线各走一遍、看哪条能到目的地,再挑最好的去执行——甚至在从没去过的环境里,只凭一张照片就想象出一条路。

所以这一节是想说:这篇论文做的是一个"能预测未来画面"的导航世界模型,用来在脑内模拟并规划路线。


这是个什么场景

你要从客厅走到厨房拿杯水。你不会瞎走——在迈步之前,你脑子里已经"预演"了一遍:往左转、绕过沙发、穿过门口,画面大概会怎么变,最后厨房出现在眼前。你是在脑内模拟,然后选了一条能到的路。

机器人导航传统上不这么干。它们要么用一个"策略"(policy)直接根据当前画面输出下一步动作(走就完了,不预演),要么靠预先建好的地图。前者行为是固定死的——训练成什么样就走什么样,遇到临时约束("别走那块湿地板")没法灵活应对;后者要先建图,换个新地方就抓瞎。

Navigation World Models 想给机器人装上人类那种"先在脑内模拟走一遍再决定"的能力:有一个能预测"我这么走,看到的画面会怎么变"的模型,就能把导航变成"在想象里搜索最好的路线"。

所以这一节是想说:目标是让智能体像人一样先"脑内预演"再选路,而不是死板地按固定策略走或依赖预建地图。


Navigation World Models — 场景示意:这论文要解决的现实问题
Plate Nº INavigation World Models — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 监督式导航策略(supervised navigation policy):直接学"看到这个画面就走这个动作"。问题是行为固定——不能在规划时临时加约束(比如"避开某区域"),也难解释它为什么这么走。
  • 基于地图的规划(SLAM + planning):先建几何地图再在地图上规划。精确,但要先建图、依赖传感器,换到陌生环境或没建图时就不灵。
  • 强化学习导航:能学到目标导向行为,但需要大量交互、泛化到新环境难。
  • 已有的世界模型(如 Dreamer 系):在游戏/仿真里"脑内模拟"很成功,但多在低维或特定环境,缺乏"在真实、多样的第一人称视频上学到通用视觉动态、还能用来规划导航"的模型。
  • 共同短板:要么行为死板,要么依赖地图,要么不够通用、不能灵活规划。

所以这一节是想说:以前的导航要么固定、要么依赖地图、要么不够通用,缺一个"能预测未来画面、还能灵活规划"的世界模型。


这篇论文的关键想法

三个关键决定:

第一,把导航世界模型做成"可控的视频生成模型"。 输入是过去的画面 + 打算执行的导航动作(前进多少、转多少),输出是未来的画面。它本质上是"给定我怎么动,预测我会看到什么"——一个以动作为控制信号的视频预测器。

第二,用条件扩散 Transformer(CDiT)+ 海量第一人称视频训练。 模型骨架叫 Conditional Diffusion Transformer(CDiT),在大量人类和机器人的第一人称(egocentric)导航视频上训练,规模做到 10 亿参数。数据多样 + 模型大,让它学到通用的视觉动态先验("世界一般怎么随我的动作变化")。

第三,把规划变成"在世界模型里模拟并打分"。 有了这个脑内模拟器,规划就有两种玩法:(a) 从零规划——自己在想象里试各种动作序列,模拟出结果画面,看哪条最接近目标画面,选它;(b) 给外部策略的候选路线打分排序——让一个现成策略生成几条候选,用世界模型模拟每条的结果、挑最好的。而且规划时能动态加入约束(这是固定策略做不到的)。更妙的是,在陌生环境里,它能靠学到的视觉先验,从单张图片就想象出未来轨迹。

所以这一节是想说:核心是"用 CDiT 在海量第一人称视频上学一个动作可控的视频预测器,再把导航规划变成在它里面模拟打分"。


Navigation World Models — 方法示意:核心 pipeline
Plate Nº IINavigation World Models — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:问题设定、CDiT 骨架、训练、以及三种用法(从零规划 / 排序 / 单图想象)。逐块按"输入 → 处理 → 输出"讲。

1. 问题设定:世界模型要预测什么

输入。 过去若干帧观测画面(第一人称视角)+ 一串导航动作(每步的平移、转向)。

处理。 模型要学一个"条件预测":在已知过去画面和动作的前提下,自回归地(一帧接一帧)合成未来的观测画面。所谓自回归(auto-regressive),就是"先预测下一帧,再把它当已知去预测再下一帧",像滚雪球一样往前推。

世界模型(world model):一个学出来的"环境模拟器",能预测"我采取某动作后,世界(我看到的)会变成什么样"。有了它,智能体可以在脑内试错,不用真的去撞。

输出。 一个能"给动作、出未来画面"的预测函数——这就是导航世界模型。

所以这一节是想说:NWM 的本质是"给定过去画面 + 未来动作,预测未来画面"的条件视频生成器。

2. CDiT:条件扩散 Transformer 骨架

输入。 过去画面的编码 + 动作条件 + 一个带噪声的"未来帧草稿"。

处理。 用扩散模型(diffusion model)的方式生成未来帧:扩散模型的思路是"从一团随机噪声出发,一步步去噪,最后还原出清晰画面",而这里的去噪过程被过去画面和动作条件所引导。骨架用 Transformer(擅长处理序列和长程依赖),所以叫 Conditional Diffusion Transformer(CDiT)。动作(前进/转向)作为条件注入,控制生成出的未来画面朝哪个方向变化。模型规模扩到 10 亿参数以吃下多样数据。

扩散模型(diffusion model):一类强大的生成模型。训练时学"如何把加了噪声的图还原干净",生成时就从纯噪声一步步去噪造出新图。这里用它来"造出未来的画面"。

输出。 以动作为控制、时间上连贯的未来画面序列。

所以这一节是想说:CDiT 用"条件扩散 + Transformer"实现"按动作可控地生成未来画面"。

3. 训练:吃海量人类 + 机器人第一人称视频

输入。 大规模、多样的第一人称导航视频(既有人走路拍的,也有机器人跑的),配上对应的导航动作。

处理。 在这些数据上训练 CDiT 去预测未来帧。数据的多样性(不同人、不同机器人、不同场景)让模型学到通用的"世界随动作演化"的规律,而不是只记住某个环境。规模化(1B 参数 + 海量视频)是它能泛化的关键。

输出。 一个通用的导航世界模型,见过足够多"这么走画面会怎么变"的例子。

所以这一节是想说:用多样的人+机器人第一人称视频规模化训练,让世界模型学到通用的视觉动态先验。

4. 三种用法:从零规划、排序、单图想象

输入。 一个目标(通常是"目标画面",即到达终点时该看到的样子)+ 当前观测。

处理。

  • 从零规划(planning from scratch):在世界模型里搜索动作序列——试一串动作、模拟出结果画面、看它和目标画面像不像,反复优化,选出最能到达目标的那串动作。规划时可动态加约束(如避开某类区域)。
  • 给外部策略排序(ranking):让一个现成导航策略吐出几条候选轨迹,用世界模型分别模拟每条、评分最终画面与目标的相似度,挑最高分的执行。这提升了现成策略的表现。
  • 单图想象(imagination in unfamiliar env):在没去过的环境里,只给一张当前照片,模型靠学到的视觉先验也能想象出走下去的画面序列,用于规划。

输出。 一条被"脑内模拟 + 打分"选出来的、更可能成功的导航路线。

下面用 ASCII 图把整体思路画出来:

   当前画面 + 候选动作序列A ──► NWM(CDiT) ──► 想象的未来画面A ──┐
   当前画面 + 候选动作序列B ──► NWM(CDiT) ──► 想象的未来画面B ──┤ 与目标画面比相似度
   当前画面 + 候选动作序列C ──► NWM(CDiT) ──► 想象的未来画面C ──┘
                                                        │
                                                        ▼
                                        选最接近目标的那条 → 执行
   (规划时可动态加入约束: 例如"避开湿地板区域")

再用一张 ASCII 图看"扩散去噪生成未来帧"的直觉:

   纯噪声帧  ─去噪步1─►  ─去噪步2─►  ...  ─►  清晰未来帧
      ▲                                         ▲
   过去画面 + 动作 作为条件, 一路引导去噪方向

所以这一整节是想说:NWM = 条件设定 + CDiT 扩散骨架 + 海量第一人称视频训练 + (从零规划/排序/单图想象) 三种用法,合起来把导航变成"脑内模拟选路"。


关键数字(What works)

数字来自论文(arXiv:2412.03572);具体各基准的成功率提升属正文表格,标注"需读原文"。

项目 数值/结论 说明
模型规模 约 10 亿参数(1B) 规模化以吃多样数据
骨架 CDiT(条件扩散 Transformer) 动作可控的视频生成
训练数据 多样的人类 + 机器人第一人称视频 通用视觉动态
规划方式 从零规划 + 给外部策略排序 两种都提升导航
约束 规划时可动态加入 固定策略做不到
陌生环境 单张图片即可想象轨迹 靠视觉先验
各基准成功率 需读原文 摘要未逐条给出

三个要点:第一,10 亿参数 + 多样视频是它能通用的基础,把世界模型从"仿真玩具"推向"真实多样场景";第二,规划时能动态加约束是相对固定策略的杀手锏——同一个模型可以应对训练时没规定的新要求;第三,单图想象展示了世界模型的迷人潜力:靠先验在陌生地方"脑补"未来。

所以这一节是想说:规模化通用 + 可加约束的规划 + 单图想象,是它区别于传统导航的三个亮点。


实验结果说明了什么

论文实验主要证明:

  • 世界模型能提升导航:无论是"从零规划"还是"给外部策略的候选排序",用 NWM 都能改善下游导航表现,说明"脑内模拟 + 打分"确实有用。
  • 灵活性优于固定策略:因为能在规划时动态加约束,NWM 面对新要求时比行为固定的监督策略更灵活。
  • 陌生环境有泛化:靠学到的视觉先验,从单张图片就能想象合理的未来轨迹,说明模型学到的不是死记场景,而是通用动态。
  • 视频质量足以支撑规划:生成的未来画面质量够高、够可控,才能用"最终画面与目标的相似度"来打分选路。

所以这一节是想说:实验证明"能预测未来画面的世界模型"确实能让导航更强、更灵活、更通用。


你应该懂的几个新词

  • 世界模型(world model):学出来的环境模拟器,预测"采取动作后世界会变成什么样",用于脑内试错。
  • 导航(navigation)/ egomotion:智能体在环境里移动、抵达目标的能力;第一人称视角即从智能体眼睛看出去。
  • 扩散模型(diffusion model):从噪声一步步去噪生成图像/视频的强大生成模型。
  • CDiT(Conditional Diffusion Transformer):本文骨架,用 Transformer 做条件扩散,按动作生成未来画面。
  • 自回归(auto-regressive):一帧接一帧地预测,把已预测的当已知继续往前推。
  • 规划(planning):在世界模型里模拟多条路线并选最优,而非直接输出动作。
  • 目标条件(goal-conditioned):用"目标画面/位置"作为规划的目标,评分靠"结果与目标的相似度"。
  • 视觉先验(visual prior):模型从海量视频中学到的"世界一般长什么样、怎么变"的通用知识。

所以这一节是想说:世界模型、扩散、CDiT、规划是理解本篇的四个关键词,也是"世界模型"这条线的通用概念。


它有什么搞不定的

  • 误差会累积:自回归预测多步后,误差滚雪球,想象的画面会逐渐失真,长时规划的可靠性下降。
  • 计算昂贵:扩散模型生成画面本就慢,规划时还要模拟很多条路线,实时性是挑战。
  • 依赖目标可用画面:用"目标画面相似度"打分,前提是你有一张目标画面;纯语义目标("去有绿色沙发的房间")需要额外处理。
  • 陌生环境的想象可能是幻觉:单图想象靠先验"脑补",脑补的画面未必符合真实环境布局,可能把不存在的门想象出来。
  • 动态障碍/人:世界里有移动的人和物时,预测会更难,脑内模拟可能和现实脱节。

所以这一节是想说:它强在灵活和通用,但受累积误差、计算成本、目标表示、以及"想象可能是幻觉"这几点限制。


它和别的几篇是什么关系

  • 世界模型谱系:World Models(Ha & Schmidhuber)、Dreamer 系列是"脑内模拟做决策"的经典,NWM 把这套思想搬到"真实第一人称视频 + 导航"上。
  • 视频世界模型/生成:Genie、GAIA-1、Cosmos、UniSim 等"可控视频/世界模拟"是近亲,NWM 专注导航并用于规划。
  • 扩散生成骨架:DiT(Diffusion Transformer)是它 CDiT 的直接技术来源。
  • 导航策略对照:传统监督导航策略、SLAM+规划是它要超越/补位的对象;NWM 也能给这些策略的候选打分。

所以这一节是想说:它是"世界模型 + 可控视频生成"两股潮流在导航上的交汇点。


和本导读的关系

本笔记对应导读 Ch15: 世界模型。Ch15 讲的正是"让智能体学一个环境模拟器、在脑内试错再行动"这条主线,从 World Models、Dreamer 到 Genie、Cosmos。Navigation World Models 是这条线在"真实导航"上的前沿落地——它把世界模型从游戏/仿真推向多样真实视频,并明确用于"规划 + 加约束 + 陌生环境想象"。读完本篇再看同章的 dreamer-v3(脑内模拟做 RL)、genie/cosmos-world-foundation(可控世界生成),能看清"世界模型从仿真走向真实、从做梦走向规划"的演进。

所以这一节是想说:把 NWM 放进 Ch15,它代表世界模型走向真实导航与实用规划的最新一步。


思考题

Q1:为什么"能预测未来画面"就能帮助规划?它和直接输出动作的策略差在哪?

提示

能预测就能"脑内试很多条路再选",而策略只能直接给一个动作。想想"先想象再决定"相比"条件反射"的优势和代价。

Q2:把导航世界模型做成"可控视频生成",动作是怎么起控制作用的?

提示

动作作为条件注入扩散生成过程,引导去噪朝"如果我这么走会看到的画面"方向。想想同一张当前图,不同动作会生成不同未来。

Q3:自回归多步预测的误差累积问题,怎么会影响长时规划?

提示

每步的小误差被下一步当真,越滚越大,几十步后想象画面可能已失真。规划越长越不可靠。想想如何缓解(如缩短规划视野)。

Q4:"给外部策略的候选排序"这个用法为什么实用?它绕开了什么难题?

提示

从零规划要在巨大动作空间里搜索,很贵。让现成策略先给几条候选、世界模型只负责打分,省事很多。

Q5:单图想象在陌生环境里可能产生"幻觉",这会带来什么风险?如何应对?

提示

想象出不存在的通路会导致规划失败甚至危险。可结合实时观测纠偏、或对不确定的想象降低信任。

Q6:为什么要同时用人类和机器人的第一人称视频训练?只用机器人的不行吗?

提示

人类视频量大、场景多样,能提供丰富的视觉动态先验;机器人视频提供贴合部署的动作对应。两者互补有助泛化。

Q7:世界模型规划 vs 端到端策略,你觉得未来机器人会走哪条路?为什么?

提示

没有标准答案。想想灵活性(世界模型可加约束、可解释)和效率(策略快、简单)的权衡,以及两者结合的可能。


一些好奇心问答(FAQ)

Q:世界模型和普通视频生成模型有什么区别?

普通视频生成给个文字/图就生成视频;世界模型强调"动作可控 + 用于决策"——它是为了"我这么动会怎样"服务的模拟器,而不只是好看的视频。

Q:它需要先建地图吗?

不需要。它靠学到的视觉动态在脑内模拟,甚至陌生环境只凭一张图就能想象,这正是相对 SLAM 方案的优势。

Q:规划这么慢,能实时跑吗?

实时是挑战。扩散生成 + 多路线模拟计算量大,实际部署可能需要缩短规划视野、减少候选或加速采样。

Q:为什么作者里有 Yann LeCun?

LeCun 长期主张"世界模型是通往更强 AI 的关键"(他的 JEPA 等工作也是这个方向)。NWM 正契合"让 AI 学会预测世界、在脑内推理"的理念。

所以这一节是想说:它是"面向决策的、动作可控的视频世界模型",与建图方案和纯视频生成都不同。


如果你想再深入

  1. 经典:World Models(Ha & Schmidhuber)/ Dreamer 系 — 理解"脑内模拟做决策"的起点。
  2. 骨架:DiT(Diffusion Transformer) — 理解 CDiT 的技术来源。
  3. 近亲:Genie / GAIA-1 / Cosmos / UniSim — 看可控世界/视频生成的家族。
  4. 理念:LeCun 的世界模型/JEPA 论述 — 理解"预测世界"路线的动机。
  5. 对照:SLAM + 规划、监督导航策略 — 理解它要超越的传统方案。

所以这一节是想说:把 Dreamer → DiT → NWM → Genie/Cosmos 串起来,能看清世界模型走向真实与规划的脉络。


原文信息

  • 标题:Navigation World Models
  • 作者:Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun
  • 会议:CVPR 2025
  • arXiv:https://arxiv.org/abs/2412.03572
@inproceedings{bar2025navigationworldmodels,
  title     = {Navigation World Models},
  author    = {Bar, Amir and Zhou, Gaoyue and Tran, Danny and Darrell, Trevor and LeCun, Yann},
  booktitle = {IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  year      = {2025},
  url       = {https://arxiv.org/abs/2412.03572}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_navigation_world_models_2026,
  title       = {(readable note) Navigation World Models},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/navigation-world-models/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?