Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 118

Cosmos World Foundation Model

28 min read · 9740 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过世界模型和视频生成"的读者的精读笔记。语言尽量像聊天,概念全部翻译成人话。

一句话讲什么(TL;DR)

Cosmos 是英伟达做的一个"世界基础模型(World Foundation Model, WFM)平台":核心是一个会"看过去的视频 + 一个动作/指令 → 生成未来会发生什么视频"的大模型。它像给机器人和自动驾驶造了一个"数字世界的沙盘",让物理 AI 能先在里面安全预演,而不用拿真机去冒险试错。平台包含视频数据处理流水线、两大类预训练模型(扩散式 7B/14B + 自回归式 4B/12B)、高压缩视频 tokenizer、多种下游微调示例(相机控制、机械臂操作、自动驾驶)和安全护栏,全部开源开放权重。

所以这一节是想说:Cosmos 的核心是"预训练一个通用世界模型 + 微调成专用世界模型",给物理 AI 提供一个能安全预演现实的数字底座。


这是个什么场景

想象你要训练一个机器人或自动驾驶系统——统称物理 AI(Physical AI):有传感器能看世界、有执行器能改变世界。它面临一个比 ChatGPT 难得多的问题:数据。

文本 AI 可以从互联网抓海量文本训练,但物理 AI 需要的数据是"一连串交错的观测和动作"——而且这些动作会真实地扰动物理世界,探索性的错误动作可能撞坏机器人、撞坏环境、甚至伤人。尤其在 AI 还很"幼稚"、需要大量试错时,直接在真实世界采数据既危险又昂贵。

那怎么办?造一个世界的数字孪生——一个模型,能模拟"如果机器人做了这个动作,世界接下来会变成什么样"。有了它,物理 AI 就能在这个安全的数字世界里预演、试错、被评估,而不用拿真机冒险。这就是世界模型(world model)

Cosmos 要解的题:能不能造一个通用的、高质量的世界基础模型,让任何做物理 AI 的开发者都能拿去、用少量自己的数据微调成专用的世界模型? 就像 GPT 之于 NLP、Stable Diffusion 之于图像——给"世界模拟"这件事提供一个可复用的基础模型底座。

所以这一节是想说:物理 AI 卡在"数据难采且危险",世界模型是解药,Cosmos 想做一个通用可微调的世界基础模型平台,让开发者都能用。


Cosmos World Foundation Model — 场景示意:这论文要解决的现实问题
Plate Nº ICosmos World Foundation Model — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:真机采数据 + 真机试错 直接让物理 AI 在现实里学。类比:让新手司机直接上高速练。问题:危险(错误动作损坏系统/环境/伤人)、昂贵、慢,探索期尤其致命。

  • 方案 B:传统物理仿真器(如 Isaac Sim、Habitat) 用手工搭建的物理引擎模拟世界。问题:搭建成本高、难以覆盖真实世界的视觉丰富度和长尾物理,sim-to-real 差距大,每个场景都要专门建模。

  • 方案 C:专用的、从头训练的世界模型 为某个具体任务/机型从头训一个世界模型。问题:数据稀缺(前述采集难题),从头训需要海量该场景数据,做不大、泛化差、每个应用都要重来一遍。

  • 方案 D:通用视频生成模型(如 Sora、VideoPoet) 在海量视频上训生成模型。问题:它们面向"生成好看的视频",不是为物理 AI 的"给定观测和动作、预测未来"设计——缺可控性(相机/动作条件)、缺因果性(要能只看过去不看未来)、缺针对物理 AI 的微调路径和安全护栏。

  • 核心难题:怎么造一个**通用(在海量多样视频上预训练)+ 可微调(少量数据就能适配具体物理 AI)+ 可控(能被动作/相机/文本条件)+ 因果(只依赖过去)+ 安全(有护栏)**的世界基础模型平台?之前的方案要么危险、要么难扩展、要么不为物理 AI 设计。

所以这一节是想说:真机试错危险、传统仿真难扩展、专用世界模型数据不够、通用视频模型不为物理 AI 设计——缺一个"通用可微调、可控因果、带安全护栏"的世界基础模型平台,Cosmos 来补这个空。


这篇论文的新想法

类比:如果说 GPT 是"文本世界的基础模型",Cosmos 想做"物理世界的基础模型"——先在海量视频上学成一个"什么都懂一点物理"的通才世界模型,再让开发者用自己场景的少量数据把它微调成专才。

Cosmos 的核心判断:世界模型应该采用"预训练 + 后训练"两段式范式——用大规模多样视频预训练出通用世界模型(world foundation model),再用少量目标场景数据后训练成专用世界模型。 因为预训练打好了地基,后训练所需数据可以少很多。

Cosmos 平台包含五大件:

  1. 视频数据处理流水线(video curator):从 2000 万小时原始视频里,筛出约 1 亿个富含动态、高画质的片段(2-60 秒),用视觉语言模型(VILA 13B)自动配字幕。数据决定模型的天花板。

  2. 视频 tokenizer(Cosmos Tokenizer):把视频压成紧凑 token(像视频编解码器),有连续版(给扩散模型)和离散版(给自回归模型),高压缩比 + 高重建质量(比现有方法 PSNR 高 4dB、快 12 倍),且因果(只用过去帧)。

  3. 两大类预训练世界模型

    • 扩散式 WFM(7B、14B):从高斯噪声逐步去噪生成视频,用连续 token。
    • 自回归式 WFM(4B、12B):像 GPT 一样一块块地按顺序生成视频,用离散 token。
  4. 后训练示例:把预训练模型微调成相机可控、机械臂指令跟随、自动驾驶等专用世界模型。

  5. 安全护栏(guardrail):pre-Guard 拦有害输入、post-Guard 拦有害输出。

全部开源、开放权重(NVIDIA 开放模型许可)。

【"预训练通用 → 后训练专用"两段式平台】

  2000万小时原始视频
    │ ①视频数据流水线(切分/过滤/去重/VILA-13B配字幕)
    ▼
  ~1亿高质量片段 ──②Cosmos Tokenizer(因果; 连续/离散)──▶ 视频token
    │
    ▼ ③预训练两大类通用世界模型(WFM)
      ├─ 扩散式 WFM(7B/14B, 连续token, 从噪声去噪)
      └─ 自回归式 WFM(4B/12B, 离散token, 像GPT一块块生成)
    │
    ▼ ④后训练(少量目标场景数据) → 相机可控 / 机械臂 / 自动驾驶 专用世界模型
    │
  ⑤安全护栏:pre-Guard 拦有害输入 · post-Guard 拦有害输出

所以这一节是想说:Cosmos 的新想法是"预训练通用世界模型 + 后训练专用化"的两段式范式,配一整套数据流水线、tokenizer、扩散/自回归双路模型、后训练示例和安全护栏,做成一个开源平台。


它分几步做的(方法)

Cosmos 平台的整体架构:

【数据】20M小时原始视频
   │ 5步流水线: 切分→过滤→标注(VILA 13B配字幕)→去重→分片
   ▼ ~100M片段(2-60s)预训练 + ~10M片段微调
   │
【Tokenizer】Cosmos Tokenizer (小波空间, 因果, encoder-decoder)
   ├─ 连续(CV): 潜维16 → 给扩散模型
   └─ 离散(DV): FSQ 6级(8,8,8,5,5,5), 词表64000 → 给自回归模型
   │
【预训练WFM】
   ├─ 扩散式: 7B/14B, Text2World(文→视频)→Video2World(过去视频+文→未来视频)
   │          latent diffusion + T5-XXL文本编码 + 3D RoPE
   └─ 自回归式: 4B/12B (Llama3风GPT, 纯视频token预测)
   │          → 加T5交叉注意力 → 5B/13B Video2World
   │
【后训练】用少量目标场景数据微调:
   ├─ 相机控制 (可导航虚拟世界)
   ├─ 机械臂操作 (视频-动作序列, 预测动作后的未来)
   └─ 自动驾驶
   │
【护栏】pre-Guard拦有害输入 + post-Guard拦有害输出

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 世界模型的形式化定义

类比:世界模型就是一个"预言家"——你给它看过去一段视频、再告诉它下一步要干什么(扰动),它预言接下来会发生什么视频。

输入:过去的视觉观测 x₀:t(一段 RGB 视频)+ 当前的扰动 cₜ(可以是物理 AI 的动作、随机扰动、文本描述等)。

处理:世界模型 W 是一个预测未来观测 x̂ₜ₊₁ 的模型——基于过去观测和当前扰动。这个"扰动"的灵活性是关键:它可以是动作命令、轨迹、文本指令,让同一个框架适配不同物理 AI。

输出:预测的未来观测 x̂ₜ₊₁。

论文还指出 WFM 对物理 AI 的多种用途:策略评估(在数字世界里评估策略而非真机部署,省钱省时、还能测未见环境)、策略初始化(用 WFM 初始化策略、缓解数据稀缺)、策略训练(WFM + 奖励模型当强化学习的环境代理)、规划/模型预测控制(用 WFM 推演不同动作的后果来选最优)。

小结:WFM 形式上就是"过去观测 + 扰动 → 未来观测"的预测器,扰动可以是动作/文本,从而服务策略评估、初始化、训练、规划等多种物理 AI 需求。

5.2 数据流水线:从 2000 万小时里淘出精华

类比:数据决定天花板。就像淘金——从海量原始视频里筛出"动态丰富、画质高、能学到物理"的那部分。

输入:约 2000 万小时原始视频(720p 到 4k),加上图像数据。

处理:5 步流水线——(1) 切分(splitting):切成镜头一致的片段;(2) 过滤(filtering):去掉语义冗余、无用信息的;(3) 标注(annotation):用视觉语言模型 **VILA(13B,视频字幕微调版,FP8 量化 TensorRT-LLM 加速 10 倍)**给每 256 帧配一段字幕(平均 97 词);(4) 去重(deduplication);(5) **分片(sharding)**适配训练。用 Ray 做编排、用 GPU 硬件 H.264 编解码加速。最终产出约 1 亿个片段(2-60 秒)用于预训练、约 1000 万个用于微调。

输出:高质量的视频-字幕训练数据集。

小结:5 步数据流水线从 2000 万小时里淘出 1 亿高质量片段并自动配字幕,为世界模型打好"高天花板"的数据地基。

5.3 Cosmos Tokenizer:把视频压成紧凑 token

类比:视频信息量巨大,直接喂给模型算不动。Tokenizer 像个高效的"视频压缩器",把视频压成少量 token,又尽量不丢内容——就像视频编解码器。

输入:高分辨率、长时长的视频(不限类别、宽高比)。

处理:一个基于注意力的 encoder-decoder 架构,特点:

  • 两种 token:连续版(CV,潜维 16,给扩散模型,类似 latent diffusion)和离散版(DV,用 FSQ 有限标量量化,6 个级别 (8,8,8,5,5,5),词表 64000,给自回归 GPT 模型)。
  • 因果设计(causal):当前帧的 token 只依赖过去帧、不看未来——好处是能联合训练图像和视频(单帧时就是图像 tokenizer),也匹配活在因果世界里的物理 AI。
  • 小波空间(wavelet space):先做 2 级小波变换把视频按 x/y/t 下采样 4 倍,再因果编码。
  • 支持多种宽高比(1:1、16:9 等)、时长无关(推理时能处理超过训练时长的视频)。 效果:比现有 tokenizer PSNR 高约 4dB、快 12 倍,单张 A100(80G) 能一次编码 8 秒 1080p 视频。

输出:紧凑的连续/离散 token 序列。

小结:Cosmos Tokenizer 用小波空间 + 因果 + 注意力的 encoder-decoder,产出连续和离散两种高压缩高质量 token,是世界模型能高效训练的关键。

5.4 扩散式世界模型(7B / 14B)

类比:从一团电视雪花噪声出发,一步步"擦"出清晰的未来视频。

输入:文本提示(Text2World)或过去视频 + 文本提示(Video2World)。

处理:基于 Transformer 的 latent diffusion,用连续 token。两阶段预训练:

  • Text2World:先训"文本 → 视频世界",用 T5-XXL 编码文本(补零到 512 长度)、classifier-free guidance 对齐文本。
  • Video2World:再微调成"过去视频 + 文本 → 未来视频"——把条件帧沿时间维拼接、加噪声增强鲁棒性、用二值掩码区分条件帧和生成帧。 架构含 3D RoPE 位置编码、交叉注意力接文本。14B 模型比 7B 能捕捉更精细的视觉细节和更复杂的运动。还配了 prompt upsampler(把用户短提示扩写成训练分布的长提示)。

输出:高画质、3D 一致、物理较准的未来视频。

小结:扩散式 WFM 用 latent diffusion + T5 文本条件,分 Text2World 和 Video2World 两阶段,7B/14B 两档,生成高质量可控的未来世界视频。

5.5 自回归式世界模型(4B / 12B)

类比:像 GPT 写文章一样,一块块 token 按顺序"写"出未来视频,每块都看着前面已生成的。

输入:过去视频(基础版)或过去视频 + 文本(Video2World 版)。

处理Llama3 风格的 GPT 模型,从头为视频预测训练(不懂语言)。用离散 token(DV tokenizer)。两阶段:

  • 先训纯"下一 token 预测"——只看过去视频预测未来(foresight generation),得到 4B、12B 基础模型。
  • 再加交叉注意力层接入 T5 文本嵌入,让它能用文本条件生成,得到 5B、13B 的 Video2World 版。 因为离散 tokenizer 压缩很重、可能有失真,还训了一个扩散解码器来提升重建质量。

输出:按顺序生成的未来视频 token,解码成视频。

小结:自回归式 WFM 是 Llama3 风 GPT,用离散 token 一块块生成视频,加 T5 交叉注意力支持文本条件,4B/12B 两档,是扩散路线之外的另一条可扩展路线。

5.6 后训练与安全护栏

类比:通才世界模型学成后,用你自己场景的少量数据"专科进修",再套上"安检门"保证安全。

输入:目标物理 AI 场景的少量"提示-视频"对(提示可以是动作、轨迹、指令)。

处理

  • 相机控制后训练:微调成相机位姿可控,造出可自由移动视角探索的虚拟世界。
  • 机械臂操作后训练:在"视频-动作序列"上微调,让它能根据机器人的动作更好地预测世界的未来状态。
  • 自动驾驶后训练:微调成驾驶场景专用。
  • 安全护栏:pre-Guard 拦有害输入、post-Guard 拦有害输出,保护开发者安全使用。

输出:专用世界模型 + 安全保障。

小结:后训练用少量目标场景数据把通才模型专科化(相机/机械臂/驾驶),配 pre/post 双护栏保证安全,体现"预训练+后训练"范式的高效。

5.7 为什么"预训练+后训练+tokenizer"是关键

  • 预训练打地基让后训练省数据:通用世界模型见过海量物理,专用化只需少量数据,直接缓解物理 AI 的数据稀缺难题。
  • 高压缩因果 tokenizer 让训练可行:世界模型训练成本随 token 数增长,高压缩 tokenizer 让长视频可训;因果设计匹配物理 AI 的实时因果需求。
  • 扩散/自回归双路 + 开源:两条可扩展路线覆盖不同需求,开源开放权重让整个物理 AI 社区都能用。

所以这一节是想说:Cosmos 的方法(数据流水线 → tokenizer → 扩散/自回归预训练 → 后训练专用化 → 护栏),核心是"预训练+后训练"范式 + 高压缩因果 tokenizer,把世界模型做成人人可用的开源基础设施。


Cosmos World Foundation Model — 方法示意:核心 pipeline
Plate Nº IICosmos World Foundation Model — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"这个世界模型底座有多大、多高效"。

数字 1:数据规模

维度 数据
原始视频 约 2000 万小时(720p–4k)
预训练片段 约 1 亿个(每个 2–60 秒)
微调片段 约 1000 万个
字幕模型 VILA 13B(视频字幕微调),平均字幕 97 词
字幕加速 FP8 TensorRT-LLM,吞吐比 PyTorch 半精度快 10 倍

关键含义:数据决定天花板——从 2000 万小时里精选 1 亿高质量片段并自动配字幕,是模型能力的基础。

数字 2:两大模型家族

家族 类型 基础模型 Video2World 版 Token/文本
扩散式 latent diffusion 7B、14B Text2World 7B、14B 连续 token + T5-XXL
自回归式 Llama3 风 GPT 4B、12B 5B、13B 离散 token + T5 交叉注意力

关键含义:两条可扩展路线(扩散 vs 自回归)覆盖连续/离散 token,各 2 档规模,满足不同计算约束和应用。

数字 3:Cosmos Tokenizer 性能

维度 数据
连续 token 潜维 16
离散 token(FSQ) 6 级 (8,8,8,5,5,5),词表 64000
重建质量 比现有 tokenizer PSNR 高约 +4 dB(DAVIS)
速度 快达 12 倍
单卡能力 A100(80G) 一次编码 8 秒 1080p / 10 秒 720p
设计 小波空间 + 因果 + 注意力 encoder-decoder

关键含义:高压缩 + 高质量 + 高速,是世界模型能高效训练和推理的核心组件。

数字 4:离散视频 tokenizer 重建(DAVIS / TokenBench,17 帧)

Tokenizer 压缩 PSNR(DAVIS) SSIM(DAVIS)
Cosmos-DV 4×8×8 28.81 0.818
Cosmos-DV 8×8×8 27.51 0.789
Cosmos-DV 8×16×16 25.09 0.714

关键含义:压缩率越高、重建质量越低,Cosmos 提供多档压缩比适配不同计算约束,且在同压缩比下质量领先。

数字 5:平台交付物

组件 内容
数据流水线 5 步(切分/过滤/标注/去重/分片),Ray 编排
预训练模型 扩散 7B/14B + 自回归 4B/12B(开放权重)
Tokenizer 连续 + 离散,多压缩比
后训练示例 相机控制、机械臂操作、自动驾驶
安全护栏 pre-Guard + post-Guard
许可 NVIDIA 开放模型许可(开源开放权重)

关键含义:不只给模型,而是给一整套可复用的物理 AI 世界模型基础设施,且开源。

所以这一节是想说:数据证明四件事——数据规模巨大、双路模型多档齐全、tokenizer 高压缩高质量高速、整套平台开源可复用。


实验结果说明了什么

问题一:为什么用"预训练 + 后训练"两段式,而不为每个应用从头训? 因为它高效地解决了物理 AI 的数据稀缺。预训练在海量多样视频上学出一个"通才"世界模型,见过丰富的真实物理;后训练只需目标场景的少量"提示-视频"对就能专科化(相机控制、机械臂、驾驶)。地基打好了,专用化的数据需求就小得多——这正是把物理 AI 系统做起来的高效策略。

问题二:扩散式和自回归式,选哪个? 两条路各有所长。扩散式(7B/14B)从噪声去噪生成,用连续 token,画质和运动质量高;自回归式(4B/12B)像 GPT 一块块生成,用离散 token,天然适合和语言模型统一、便于流式生成。论文两条都做,因为它们把"难的视频生成"分解成不同的易子问题,都利用了 Transformer 的可扩展性。开发者可按需求选。

问题三:为什么 tokenizer 这么重要? 因为世界模型的训练成本随 token 数增长,而视频信息量巨大。好的 tokenizer 要在"高压缩(省算力)"和"高重建质量(不丢细节)"之间取得平衡——这是核心权衡。Cosmos Tokenizer 比现有方法 PSNR 高 4dB、快 12 倍,且因果设计匹配物理 AI 的实时需求。没有它,训练大规模世界模型不可行。

问题四:模型越大越好吗? 基本是。14B 扩散模型比 7B 能捕捉更精细的视觉细节和更复杂的运动、场景更丰富、运动更稳定。这符合基础模型的规模化规律。但代价是巨大的算力——14B 模型需约 280GB 存参数/梯度/优化器状态 + 310GB 激活,得用 FSDP + 上下文并行分摊到多卡。

问题五:世界模型能直接用于物理 AI 吗?安全吗? 能用于多种用途(策略评估、初始化、训练、规划),但论文坦承"世界模型问题远未解决",需更多研究。安全上专门做了 guardrail(pre/post 双护栏)拦有害输入输出,保护开发者。它定位是给物理 AI 开发者的基础设施,而非终点。

所以这一节是想说:实验(平台性)说明四件事——两段式范式高效省数据、扩散/自回归各有所长、tokenizer 是可行性关键、规模化有效但算力昂贵,且世界模型仍是开放问题。


你应该懂的几个新词

物理 AI(Physical AI):有传感器和执行器、能感知并改变物理世界的 AI,如机器人、自动驾驶。

世界模型 / 世界基础模型(World Model / WFM):模拟"给定过去观测和动作、预测未来"的模型,是世界的数字孪生。

预训练 + 后训练(pre-training + post-training):先在大数据上训通才,再用少量目标数据微调成专才的两段式范式。

视频 tokenizer:把视频压成紧凑 token(连续向量或离散整数)的编解码器,是大模型处理视频的前提。

连续 vs 离散 token:连续 token(向量)给扩散模型用,离散 token(整数)给自回归 GPT 用。

FSQ(有限标量量化):一种把连续潜变量量化成离散码的方法,Cosmos 离散 tokenizer 用它(替代 VQ-VAE,无需 commitment loss)。

扩散模型(diffusion model):从高斯噪声逐步去噪生成数据的生成模型,Cosmos 扩散式 WFM 的骨干。

自回归模型(autoregressive model):像 GPT 一样按顺序一块块生成、每块条件于前面的模型。

因果 tokenizer(causal):当前帧编码只依赖过去帧、不看未来,匹配物理 AI 的实时因果世界。

护栏(guardrail):pre-Guard 拦有害输入、post-Guard 拦有害输出的安全系统。

所以这一节是想说:这十个词是读任何"世界模型 / 视频生成 / 物理 AI"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 世界模型问题远未解决:论文自己明确说,尽管有改进,世界模型仍是未解难题,物理准确性、长时一致性等仍需大量后续研究。
  • 算力门槛极高:14B 模型训练需数百 GB 显存、多卡并行(FSDP + CP),普通团队难以从头训练(虽然开放权重降低了使用门槛)。
  • 物理准确性有限:生成视频"物理较准"但不是真物理引擎,可能生成违反物理的内容(穿模、不守恒等),对精确物理推理的物理 AI 是隐患。
  • 依赖数据质量和 VLM 字幕:训练依赖自动 VLM 字幕,字幕分布和人类描述有差(论文还专门做 prompt upsampler 弥合),字幕错误会传导到模型。
  • 离散 token 高压缩有失真:自回归路线的重压缩 tokenizer 会引入失真,需额外的扩散解码器补救。
  • 后训练仍需目标场景数据:虽然比从头训省,但相机控制/机械臂/驾驶各自仍需收集专门的"提示-视频"数据,非零成本。

所以这一节是想说:Cosmos 把"通用可微调的世界模型平台"做出来了,但物理准确性、算力门槛、字幕依赖、离散失真这些问题仍在——它是重要一步而非终点。


它和别的论文是什么关系

  • 上游(被它借用)
    • Stable Diffusion / VideoLDM:latent diffusion 的思想,扩散式 WFM 的基础。
    • VideoPoet / GPT / Llama3:自回归视频/语言生成的架构来源,自回归 WFM 是 Llama3 风 GPT。
    • FSQ(Mentzer et al.):离散 tokenizer 的量化方法。
    • T5 / VILA / Mistral / Pixtral:文本编码、视频字幕、prompt upsampler 用到的模型。
  • 对比关系
    • Sora / 通用视频生成模型:那些面向"生成好看视频",Cosmos 专为物理 AI(可控、因果、可微调、带护栏)设计。
    • 传统物理仿真器(Isaac Sim / Habitat / BEHAVIOR-1K 的 OmniGibson):那些是手工物理引擎,Cosmos 是从视频数据学出的神经世界模型——更真实的视觉,但物理不如引擎精确,两者互补。
    • 1X World Model / 其他机器人世界模型:本仓库有 1X World Model 笔记,同属"用生成模型做世界模拟",Cosmos 更通用、更大规模、平台化。
  • 下游 / 同族:Cosmos 作为开源基础设施,可被各种物理 AI 项目微调使用,是"世界模型作为物理 AI 底座"这条线的重量级工作。

所以这一节是想说:Cosmos 站在 latent diffusion + GPT/Llama + FSQ 的肩膀上,把通用视频生成技术改造成专为物理 AI 的世界模型平台,是"世界模型底座"这条线的标杆。


和本导读的关系

本笔记对应导读中"世界模型"这条线的重量级节点。

物理 AI 的核心瓶颈是数据和安全试错,世界模型是公认的解药——它给机器人/自动驾驶提供一个能安全预演的数字世界。理解了 Cosmos,你就理解了为什么大厂(英伟达)要下重注做"世界基础模型平台",以及"预训练+后训练"这个从 NLP 借来的范式如何被搬到世界模拟上。

读完本笔记,建议:对照看 1X World Model 笔记(另一个机器人世界模型,规模更聚焦,理解世界模型在人形机器人上的具体应用),再看 Diffusion Policy / 3D-VLA 等策略/生成模型笔记(理解世界模型如何和策略学习配合——世界模型评估/训练策略)。三者连起来,就能看清"世界模型 ↔ 策略"这个物理 AI 的核心循环。

对应导读章节:Ch15:世界模型——World Models / Dreamer / Genie / Cosmos Policy

所以这一节是想说:本笔记是"世界模型"这条线的重量级节点,读它能理解物理 AI 的世界模型底座,再结合 1X World Model 和策略模型笔记看清"世界模型+策略"的循环。


思考题

以下问题检验你是否真正理解了 Cosmos 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么物理 AI 比文本 AI 更需要世界模型?世界模型到底解决了什么核心痛点?

提示

核心痛点是"数据采集难且危险"。文本 AI 可以从互联网抓海量现成文本训练,数据便宜、安全、量大。但物理 AI 需要的数据是"观测-动作交错的序列"——这些数据只能通过让 AI 真实地在世界里行动来采集,而行动会扰动物理世界:错误的探索动作可能撞坏机器人、损坏环境、甚至伤人,尤其在 AI 还很幼稚、正需要大量探索时最危险。这使得规模化采集物理 AI 数据既昂贵又危险,成为物理 AI 进展缓慢的根本原因。世界模型(世界的数字孪生)解决这个痛点:它能模拟"如果做了这个动作,世界会怎么变",让物理 AI 在安全的数字世界里预演、试错、被评估、甚至被训练,而不用拿真机冒险。这样就把"危险昂贵的真实试错"替换成"安全廉价的数字预演",绕开了数据瓶颈。这也是为什么世界模型被视为物理 AI 数据难题的"长期解药"。

Q2:Cosmos 采用"预训练 + 后训练"两段式。为什么这个范式能省数据?和从头为每个应用训练相比好在哪?

提示

关键是"通用知识可复用"。从头为每个应用(比如某款机械臂)训练世界模型,意味着该应用要独自承担学习"世界如何运作"的全部数据成本——但物理 AI 数据恰恰稀缺,凑不出足够多的该场景数据,结果模型做不大、泛化差,而且每个新应用都要从零重来。预训练+后训练则不同:预训练阶段用海量、多样的通用视频(2000 万小时里筛出的 1 亿片段)让模型学到通用的物理、外观、动态规律——这部分知识是所有物理 AI 应用共享的。后训练阶段只需用目标场景的少量"提示-视频"数据,把这个通才微调成专才即可,因为它已经"懂物理"了,只需学习该场景的特定分布。这就像一个见多识广的人转行只需短期培训,而不是从婴儿重新学起。所以两段式把昂贵的通用学习摊销到一次预训练里,让每个下游应用的数据需求大幅降低——这正是应对物理 AI 数据稀缺的高效策略,也是 GPT/BERT 等基础模型范式的精髓被搬到世界模型上。

Q3:Cosmos 同时做了扩散式和自回归式两种世界模型。它们分别用连续 token 和离散 token,为什么?各自适合什么?

提示

因为两种生成范式的数学基础不同,对 token 类型的要求也不同。扩散模型从高斯噪声逐步去噪,它在连续空间里操作、从连续分布采样,所以天然配连续 token(向量形式的潜嵌入,如 latent diffusion)。自回归模型像 GPT 一样用交叉熵损失做"下一 token 分类预测",它需要一个有限的词表来分类,所以配离散 token(量化成整数索引,如 Cosmos 用 FSQ 得到词表 64000)。各自的适用:扩散式画质和运动质量往往更高、更擅长高保真生成;自回归式天然能和语言模型统一(都是 token 序列预测)、便于流式/因果生成、能复用成熟的 GPT 基础设施。Cosmos 两条都做,是因为它们把"难的视频生成问题"分解成不同的易子问题(扩散分解成去噪步骤、自回归分解成逐块生成),都利用了 Transformer 的可扩展性,能覆盖不同开发者的需求和计算约束。这也体现了平台"两条腿走路"的稳健策略。

Q4:Cosmos Tokenizer 特意设计成"因果的"(当前帧只依赖过去帧)。这个设计对物理 AI 有什么特别的意义?

提示

因果设计对物理 AI 至关重要,有两方面意义。(1) 匹配物理 AI 的实时因果世界:真实的物理 AI(机器人、自动驾驶)活在因果世界里——它在时刻 t 做决策时,只能依赖到 t 为止的观测,根本不可能"看到未来"。如果 tokenizer 编码当前帧时用到了未来帧的信息(非因果),那基于它构建的世界模型就无法在真实的在线场景中使用(因为部署时未来还没发生)。因果 tokenizer 保证模型的每个 token 只依赖过去,从而能无缝用于实时、在线的物理 AI 应用。(2) 支持联合图像和视频训练:因果 tokenizer 在输入单帧时就退化成图像 tokenizer(因为第一个时间 token 就代表第一帧)。这让模型能同时利用海量、多样的图像数据集训练(图像含丰富的外观信息且更易获取),提升视觉质量、加速训练。所以因果设计既是"能实际部署到物理 AI"的必要条件,又带来"图像视频联合训练"的额外好处,是深思熟虑的设计选择,而非随意为之。

Q5:论文说"数据决定 AI 模型的天花板",并花大力气做数据流水线。既然有 2000 万小时原始视频,为什么还要精筛成 1 亿片段,而不全用?

提示

因为"数据量大"不等于"数据质量高",而质量决定天花板。2000 万小时原始视频里有大量对学习物理无用甚至有害的内容:语义冗余(大量相似的静态镜头、重复画面)、低质量(模糊、抖动、低分辨率)、缺乏动态(长时间静止画面学不到物理运动)、无信息(黑屏、字幕卡、纯色)。如果全部拿来训练,(1) 模型会把大量算力浪费在学习无用/冗余内容上,训练效率低;(2) 低质量数据会拉低模型的生成质量上限;(3) 缺乏动态的数据教不会模型物理规律(而学物理正是世界模型的核心目的)。所以要用流水线精筛:切分出镜头一致的片段、过滤掉冗余低质的、保留"动态丰富、画质高、能学到物理"的部分——这才是对学习世界模型真正有价值的数据。精筛出的 1 亿高质量片段,比 2000 万小时未筛的原始数据更能提升模型天花板。这印证了"数据质量 > 数据数量"的原则,也是为什么数据流水线(切分/过滤/标注/去重/分片)被列为平台的核心组件之一——它决定了喂给模型的到底是金子还是沙子。

Q6:世界模型可以用来"评估策略"(policy evaluation)。这相比在真机上评估策略有什么好处?有什么风险?

提示

好处:(1) 省钱省时——真机评估一个策略要搭真实环境、跑真实机器人、可能损坏硬件,而在世界模型里评估只需数字推演,成本和时间大幅降低;(2) 能测未见环境——世界模型可以生成现实中难以获得或危险的环境(如极端天气、罕见路况),让策略在真机无法覆盖的场景里被测试;(3) 快速筛选——可以先在世界模型里快速淘汰掉大量差策略,把宝贵的真机资源集中在少数有希望的策略上。风险:世界模型不是真实世界,它的预测有误差、物理不完全准确,可能出现"在世界模型里表现好、真机却不行"(或反之)的情况——如果世界模型的偏差和策略的弱点耦合,评估结论可能误导。所以世界模型评估是"筛选和加速"工具,不能完全替代真机验证——最终仍需在真机上确认。这类似仿真评估,好用但要警惕 sim-to-real(或 model-to-real)差距。

Q7:Cosmos 生成的视频"物理较准"但不是真物理引擎。对一个依赖它做规划的机器人,这种"近似物理"会带来什么隐患?你会怎么缓解?

提示

隐患:世界模型是从视频数据学出来的神经网络,它模仿的是"视频里看起来像什么",而非严格遵守物理定律。所以它可能生成违反物理的内容——物体穿模、质量/动量不守恒、接触力不真实、物体凭空出现或消失、长时演化漂移等。如果机器人用它做规划(推演不同动作的后果来选最优),而世界模型对某个动作的后果预测错了(比如预测"推一下杯子它会滑到桌边停住",但真实物理是"它会掉下去"),机器人就会基于错误的预测做出错误决策,在真机上失败甚至造成损坏。越是需要精确物理推理的任务(精细操作、动态平衡、接触丰富任务),这个隐患越严重。缓解方法:(1) 限制预测时域——只信任世界模型的短期预测(误差还没累积),长期规划分段重规划;(2) 世界模型 + 真实反馈闭环——用世界模型做粗规划,真机执行时用真实观测不断校正(模型预测控制的思路);(3) 混合物理引擎——对物理敏感的部分用真物理引擎补充,视觉丰富的部分用神经世界模型;(4) 不确定性估计——让世界模型输出预测的置信度,对低置信预测保守处理;(5) 后训练对齐——用目标场景数据后训练提升该场景的物理准确性。核心是不要盲信神经世界模型的物理,把它当"有偏差的近似"来用,配合真实反馈和保守策略。

所以这一节是想说:能回答这 7 题,你就真正理解了 Cosmos 为什么需要世界模型、为什么两段式、扩散/自回归和连续/离散 token 的对应、因果设计、数据质量优先,以及用世界模型评估/规划的好处和隐患。


一些好奇心问答(FAQ)

Q1:Cosmos 到底是一个模型还是一个平台? 是平台。它包含数据流水线、视频 tokenizer、两大类预训练世界模型(扩散 7B/14B + 自回归 4B/12B)、后训练示例(相机/机械臂/驾驶)和安全护栏,是一整套可复用的物理 AI 世界模型基础设施,全部开源开放权重。

Q2:它是给谁用的? 给物理 AI 开发者(机器人、自动驾驶等)。他们可以拿预训练的通用世界模型,用自己场景的少量数据微调成专用世界模型。

Q3:世界模型能拿来干什么? 论文列了四种用途:策略评估(在数字世界评估策略)、策略初始化(缓解数据稀缺)、策略训练(当强化学习的环境代理)、规划(推演动作后果选最优)。

Q4:扩散版和自回归版有什么区别? 扩散版(7B/14B)从噪声去噪生成、用连续 token、画质高;自回归版(4B/12B)像 GPT 一块块生成、用离散 token、便于和语言统一、流式生成。两条路各有所长。

Q5:为什么要做自己的 tokenizer? 因为世界模型训练成本随 token 数增长,需要高压缩又高质量的视频 tokenizer。Cosmos Tokenizer 比现有方法 PSNR 高 4dB、快 12 倍,且因果设计匹配物理 AI。

Q6:为什么要有 guardrail? 安全。pre-Guard 拦有害输入、post-Guard 拦有害输出,保护开发者安全使用这些强大的生成模型。

所以这一节是想说:Cosmos 的实操问题(平台而非单模型、面向物理 AI 开发者、四种用途、扩散/自回归区别、自研 tokenizer、安全护栏)都有明确答案,核心就是"通用可微调的世界模型底座"这一招。


如果你想再深入

按"必读前置 → 生成骨干 → 对比 → 应用"排序:

  1. 必读前置:世界模型概念 + Diffusion Policy — 本仓库有 Diffusion Policy 深读笔记,理解生成模型如何用于机器人。
  2. 生成骨干:Stable Diffusion / VideoLDM / VideoPoet — 理解 latent diffusion 和自回归视频生成的基础。
  3. 对比:1X World Model — 本仓库有笔记,另一个机器人世界模型,对照理解规模和定位差异。
  4. 对比:BEHAVIOR-1K / OmniGibson — 本仓库有笔记,传统物理仿真器,对照理解"神经世界模型 vs 手工物理引擎"。
  5. 应用:各类 VLA 策略模型(3D-VLA、RT 系列) — 理解世界模型如何和策略配合形成物理 AI 闭环。

所以这一节是想说:把 Diffusion Policy + Stable Diffusion + 1X World Model + Cosmos 连起来读,就能看清"生成模型 → 世界模型 → 物理 AI 底座"的完整技术脉络。


原文信息

BibTeX

@article{nvidia2025cosmos,
  title     = {Cosmos World Foundation Model Platform for Physical AI},
  author    = {{NVIDIA}},
  journal   = {arXiv preprint arXiv:2501.03575},
  year      = {2025}
}

链接

所以这一节是想说:这是 NVIDIA 2025 年发布的工作,用"预训练+后训练范式 + 高压缩因果 tokenizer + 扩散/自回归双路模型 + 安全护栏",把世界模型做成一个开源、通用、可微调的物理 AI 底座。

引用本笔记 / Cite this note
BibTeX
@online{eai_cosmos_world_foundation_2026,
  title       = {(readable note) Cosmos World Foundation Model},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/cosmos-world-foundation/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?