Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 7

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control

33 min read · 11451 字 · ⭐⭐⭐⭐⭐ · 长篇结构化

这是写给零经验读者的精读笔记。所有专业词第一次出现都会用日常类比解释。只看这份笔记就能理解全文机制。

一句话讲什么(TL;DR)

把一个会"脑补下一秒视频"的大模型,再练一遍,就能让它指挥机械臂做家务——不改模型结构、不加新零件,只是把机器人动作、未来画面和评分全伪装成视频帧塞进去,让模型按原来处理视频的方式一起学会三件事。

所以这一节是想说:核心创意只有一句话——别从零做,拿"会脑补视频的大脑"改造成"会动手的大脑"。


这是个什么场景

周末你赶着出门,从厨房顺手抓一把糖塞进密封袋——左手撑住袋口、右手把糖倒进去、捏紧拉链。从看到糖到拉好袋子,前后两秒钟,你几乎没在想。

现在让一台机器人替你做这件事。它得在两秒里完成下面这串"心算":看清楚糖在哪、袋子在哪、袋口现在开了多大;想清楚两只手怎么配合(一只撑袋口、一只塞糖);还得知道"手歪一毫米糖就撒了"。

换句话说,它需要两种本事:物理直觉(手伸下去会发生什么、东西会不会倒、塑料袋会不会瘪)和动作多样性(同一个目标可能有十种合理的伸手路线,模型要能挑一种走,而不是卡死在一条路上)。

机器人策略(policy):一个函数,输入是"眼前看到的画面",输出是"接下来手要怎么动"。可以理解为机器人的"反应公式"。打个考试的比方:你做物理题时,看到题面(输入),写出解题步骤(输出)。policy 干的就是这件事,只不过输入换成了摄像头画面,输出换成了"每个关节转多少度"。

动作多模态性(action multimodality):同一个目标有多种合理走法。就像去学校可以坐公交也可以骑自行车——两条路都行。如果模型只会取平均(半坐车半骑车),反而哪条路都走不通。

所以这一节是想说:让机器人做家务的难点是又要懂物理、又要会变通。


Cosmos Policy — 场景示意:这论文要解决的现实问题
Plate Nº ICosmos Policy — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

之前的主流做法分几条路线,每条都有硬伤。

VLA(Vision-Language-Action,视觉-语言-动作模型):一个大网络,能看图、能读指令、能输出动作。代表作是 OpenVLA、π0、π0.5。

路线一:VLA 派。 VLA 的"地基"是看了几亿张"图配文字"训出来的——它见过"苹果"配"红色水果"、"猫"配"四条腿动物"。但 VLA 没看过视频。类比:你只让一个小孩看绘本(静止画面 + 文字)却不让他看动画片(连续画面)。他能认识"苹果",但说不出"苹果从桌上滚下去会怎样"。这就是缺了对时间的直觉。VLA 还有一个毛病:它输出动作用的是"取平均"的方式(L1 回归),碰到两颗糖时,平均位置正好在两颗糖中间——伸手就抓空了。

L1 回归(L1 regression):让模型预测所有训练样本动作的平均值。就像考试时你不确定选 A 还是 C,干脆选了 B——但 B 是错的。

路线二:从头训视频模型派。 有人想用视频模型当地基,但他们丢掉了别人辛苦在几亿小时视频上训好的成果,从零开始——相当于上考场前撕掉自己背了三年的笔记。

路线三:两阶段拼接派。 先训一个视频网络生成未来画面,再外挂一个"动作输出头"从生成的画面里提取动作。结果两个东西没融合好——像把英语作文和数学计算分给两个互不交流的人做,信息在交接时大量丢失。

路线四:小模型派。 用一个 1.5 亿参数的小网络从干净示教数据训。简单但没"地基知识",复杂任务一塌糊涂——在 LIBERO 长程任务上只有 50.5 分。

总结成一张表:

路线 代表方法 核心问题
VLA 派 OpenVLA, π0, π0.5 只看过静态图,缺物理直觉;L1 回归遇到多模态就取平均
从头训视频 UWM, UniVLA 丢掉预训练知识,白费几亿小时视频训练
两阶段拼接 Video Policy, VIDAR 视频生成和动作提取分开做,信息丢失
小模型 Diffusion Policy 150M 参数,没有大底模知识,复杂任务撑不住

所以这一节是想说:之前的人要么没看过视频、要么没融合好、要么没地基知识。


这篇论文的新想法

打个比方:邻居家有位会画连环画的大叔,看一眼场景就能给你画出"下一格会发生什么"。你想让他帮你指挥机器人手臂——常规做法是另请一位机器人专家,或者给大叔配个助手。这篇论文不一样:不换人、不加助手,就让大叔在画下一格画的时候,顺手在角落写一行字告诉你"主人公接下来该往哪走"。

落到模型上就是一句话:直接拿一个会预测下一秒视频画面的现成大网络(叫 Cosmos-Predict2),不动结构、不加新部件,只是再训练一轮,让它顺便吐出机器人动作。

Cosmos-Predict2:NVIDIA 训好的视频预测大模型,20 亿参数,看了海量视频,已经具备"东西会不会掉、会不会滑"的物理直觉。它的工作方式是:给一张图 + 一句描述,预测接下来的视频帧。

具体来说,Cosmos Policy 让这个视频模型同时学三件事:(1)输出机器人动作(当策略),(2)预测做完动作后的未来画面(当世界模型),(3)评估这条路的最终得分(当价值函数)。三件事都用同一套"伪装成视频帧"的方式塞进同一个网络里,一个训练阶段全部搞定。

更进一步:因为模型学会了预测未来和打分,部署时可以"想 8 种方案、推演每种的结果、选最好的"——就像下棋高手在脑子里推演多步再落子。

所以这一节是想说:不动结构、只改训练数据,让一个模型同时当策略、世界模型和评分员,是这篇最大的胆量。


它分几步做的(方法)

这是全文最核心的部分。Cosmos Policy 的方法可以拆成五个子步骤,从"怎么把动作塞进视频模型"一直到"怎么用规划涨分"。

第 1 步:把动作"伪装"成视频画面(潜帧注入)

类比:你的笔记本本来只能写汉字。现在你要在里面记英文单词——但你不想换笔记本。怎么办?把每个英文单词翻译成对应的汉字塞进去,本子完全不知道你在记新东西,照常翻页。

背景:视频模型怎么处理画面。

Cosmos-Predict2 本来的工作流程是这样的:接收一张起始图和一句文字描述,然后预测接下来的几帧画面,拼成一段短视频。每一帧画面在送进模型之前,都要经过一个叫 VAE 的"压缩软件"处理。

VAE(变分自编码器,Variational Auto-Encoder):一个会把大图压成小卡片、又能把小卡片还原成大图的网络。你可以理解为视频的"压缩软件"。就像你把一张 4K 照片压缩成一张邮票大小的缩略图——虽然小了,但关键信息还在。

潜帧(latent frame):被 VAE 压缩之后的"小卡片"。一张 256x256 的彩色图片被压成一个 32x32x16 的数据块,比原图小了很多但保留了关键信息。模型处理的不是原图,而是这些潜帧。

扩散模型(diffusion model):一种生成图片/视频的方式。先往图里加一堆雪花点(噪声),让网络学怎么把雪花点擦掉还原原图。学会之后给它纯雪花点它就能"擦"出新图。

去噪(denoising):擦掉雪花点的过程。一步一步擦,越擦越清楚。扩散模型的核心训练目标就是:给一张被噪声污染的潜帧,让网络预测"加进去的噪声是什么",然后减去它。

Cosmos-Predict2 的训练过程(EDM 去噪分数匹配公式)可以用一句话翻译:给一个干净的视频潜帧序列,往上面加随机高斯噪声,让网络学着把噪声去掉、还原原始序列。公式里的关键变量:x0 是干净的 VAE 编码后的图像序列,c 是文字描述的 T5 编码,n 是高斯噪声,σ 是噪声强度,Dθ 是去噪网络。网络的目标就是让"Dθ(加噪后的输入) - 原始干净输入"尽量小。

Cosmos Policy 的招数:潜帧注入。

原始的视频模型只能处理图像帧。但机器人策略需要处理很多非图像的东西:关节角度(一串数字)、要执行的动作(一串数字)、这条路能拿多少分(一个数字)。这些都不是图像,怎么塞进去?

做法分四步:

  1. 准备占位符:先在图像序列里插入几张"空白图"(全零的图片),放在需要插入新数据的位置。比如序列变成:[空白] [当前关节] [手腕相机] [第三人称相机1] [第三人称相机2] [动作] [未来关节] [未来手腕相机] [未来相机1] [未来相机2] [分数]。

  2. VAE 编码:把这些图片(包括空白图)一起送进 VAE 压缩成潜帧。空白图被压缩成一串零。

  3. 覆盖注入:把空白图对应的潜帧直接覆盖掉——用归一化后复制铺满的动作数据、关节数据或分数数据来替换。具体做法是:把动作向量(比如 50 个时间步 x 14 个关节 = 700 个数字)先归一化到 [-1, +1] 范围,然后把这 700 个数字复制很多份填满一个 32x32x16 的数据块(因为一个潜帧就是这么大的),就像把一句话抄满整页纸。

  4. 加噪去噪:对需要预测的部分(动作、未来画面、分数)加噪声,保持条件部分(当前画面、当前关节)干净。让网络学去噪。

归一化(normalization):把数据缩放到固定范围(比如 [-1, +1])。就像考试把原始分换算成百分制——不管原始满分是 80 还是 120,统一换成 0-100 方便比较。

条件(conditioning):给模型看的"已知信息"。在去噪时,有些潜帧保持干净(不加噪声)作为条件,网络要基于这些干净帧来去噪其他帧。就像考试时题目是"已知"的(条件),你要写的是"答案"(目标)。

为什么要这样做而不是设计新结构?

最大的好处:不动结构 = 几亿小时视频训练出来的"物理直觉"被原封不动地继承下来。等于白嫖几年的训练成果。模型用同一套去噪机制处理图像和动作,不需要学新规则。虽然复制铺满看起来浪费空间,但好处是模型不需要任何架构修改就能接受新数据类型。

推理时怎么把动作取出来?

模型去噪完成后,会输出干净的潜帧。对于动作潜帧,取出方法很简单:把 32x32x16 数据块里所有复制的值取平均(因为它们都是同一份数据的拷贝),然后反归一化回原始尺度。不需要 VAE 解码——因为这些数据是直接注入潜空间的,从来就不是真正的图像。

一个具体的例子:对于 ALOHA 双臂机器人(3 个相机、14 个关节),潜帧序列有 11 帧。其中 4 帧是新模态(当前关节、动作、未来关节、分数),7 帧是图像(3 个当前视角 + 3 个未来视角 + 1 个空白占位符)。如果只有一个相机,可以删掉多余的相机帧,总潜帧数降到 7。

方法总览图:怎么把动作和分数塞进视频帧序列里
Plate Nº II方法总览图:怎么把动作和分数塞进视频帧序列里
更详细的版本:白色块是真画面,彩色块是伪装的动作和分数
Plate Nº III更详细的版本:白色块是真画面,彩色块是伪装的动作和分数

所以这一节是想说:核心招数就是——把不是图像的东西伪装成图像,让旧模型用同一套去噪机制一起处理。


第 2 步:一个模型同时干三件事(联合训练)

类比:想象一个学生同时学三门课——化学(怎么做反应)、物理(反应后会怎样)、考试评分(这次考多少分)。普通做法是请三个家教,这篇的做法是同一个学生轮流戴三顶帽子。

三件事是什么。

每次训练时,把一批数据分成三份,让同一个网络(同一组参数)轮流学三件事:

  1. 当机器人策略(50% 数据):输入是当前画面和关节状态,目标是输出"我该做什么动作"。数学上是在学 p(a, s', V(s') | s)——不光预测动作 a,还顺手预测未来状态 s' 和价值 V(s')。

  2. 当世界模型(25% 数据):输入是当前画面 + 给定一个动作,目标是预测"做完之后画面变成什么样"。数学上是在学 p(s', V(s') | s, a)——给定状态和动作,预测未来状态和价值。

  3. 当评分员(25% 数据):输入是当前画面 + 动作 + 做完后的画面,目标是估计"这条路最后能拿多少分"。数学上是在学 p(V(s') | s, a, s')——给定全部信息,预测价值。

世界模型(world model):一个会脑补"做了某动作之后世界会变什么样"的模型。相当于脑子里的物理实验室。你心里想"松手苹果会掉",就是你的世界模型在工作。

价值函数(value function):给"当前局面"打分的函数。下棋时教练说"这个局面值 +3",就是价值函数。在本文中,价值 = 这条路最终能拿多少分(成功 = 1,失败 = 0,中间状态按距离终点的远近打折)。

条件掩码怎么决定学哪件事?

关键在于"哪些潜帧保持干净、哪些被加噪"。同一批训练数据,通过不同的条件掩码,就能训练不同的功能:

  • 训练策略时:当前状态潜帧干净,动作 + 未来状态 + 价值潜帧被加噪。网络要从当前状态去噪出动作。
  • 训练世界模型时:当前状态 + 动作潜帧干净,未来状态 + 价值潜帧被加噪。网络要从状态和动作去噪出未来。
  • 训练价值函数时:当前状态 + 动作 + 未来状态潜帧干净,价值潜帧被加噪。网络要从全部信息去噪出价值。

这就是论文说的"条件方案决定训练哪个函数"——同一套数据、同一个网络,只靠改变"哪部分干净、哪部分加噪"就能切换三种学习模式。

梯度(gradient):一个数学量,告诉你"参数往哪调能让分数变高/损失变低"。

梯度下降(gradient descent):根据梯度一步一步调参数。像下山找最低点,每一步都往最陡的下坡方向迈。

损失(loss):考试扣分总和。模型预测错了多少,就扣多少。模型的全部目标就是让 loss 越小越好。

评分是怎么来的?

录一条机器人完成任务的过程。如果最后成功 = 1 分,失败 = 0 分。然后把这个终端分数往前回传——离成功越近的画面分数越高(乘以折扣因子 γ 的递减次方),离失败越近越低。这叫蒙特卡洛回报。每个训练样本都有一个标注的"这条路值多少分"。

折扣因子 γ(discount factor):一个 0 到 1 之间的数,用来让"远期的分数"比"近期的分数"权重低。就像你更在乎今天到手的 100 块而不是明年可能到手的 100 块。本文用 γ^(H-t) 来给时间步 t 的回报打折。

辅助监督:为什么策略不只学动作?

注意上面说的:策略学的是 p(a, s', V(s') | s) 而不是简单的 p(a | s)。也就是说,策略不光要输出动作,还要顺手预测未来画面和分数。这叫辅助监督——看起来是额外负担,但实际上帮策略学得更好。消融实验证明砍掉这些"多余目标"会大幅掉分(后面详细讲)。

50/25/25 的分配不是拍脑袋。 当机器人策略那一份难度最大(输入信息最少,要从当前状态推出一切),所以多分点训练数据。世界模型和价值函数输入更多(有动作信息),相对容易一些,各分 25%。

初始训练数据的来源。 一开始,rollouts 数据集就是 demonstrations 数据集的超集——包含成功示教和失败示教。在仿真环境(LIBERO、RoboCasa)中,大概 10-20% 的示教因为人类操作失误会失败;在真实 ALOHA 环境中数据采得更仔细,没有失败示教,两个数据集相等。

所以这一节是想说:一个网络靠切换"哪部分干净哪部分加噪"来戴三顶帽子,三件事互相提分。


第 3 步:顺手预测未来,反而考得更好(辅助监督的威力)

类比:让一个学生只背公式他考 70 分。让他顺带预测出题人下一题会问什么——他反而考 85 分。因为"预测出题方向"逼他理解了公式背后的逻辑。

它在干什么。

第 2 步里说,模型当策略时,本来只需要输出"动作"。但论文硬要它同时预测"做完后画面什么样"和"这条路值多少分"。听起来是浪费时间——这些预测在直接部署时不需要。但消融实验显示砍掉这些"多余预测"反而会大幅掉分。

论文在 RoboCasa 厨房任务上做了一组层层递进的消融实验,每次砍掉一个部件:

版本 描述 平均成功率
完整版 策略 + 世界模型 + 价值函数 + 辅助监督 67.1%
去掉价值函数训练 不训评分员,只用 50% 策略 + 50% 世界模型 66.6%
去掉世界模型和价值函数训练 100% 数据全训策略 64.0%
再去掉策略的辅助价值目标 策略只学 p(a, s' s),不预测分数
再去掉策略的辅助未来状态目标 策略只学 p(a s),纯动作

最后一刀最狠——拿掉"预测未来画面",分数从 62.5 直接掉到 44.4,暴跌 22.7 分。

为什么预测未来这么有用?

被迫预测"做完之后画面什么样",模型就被逼着真的理解了动作的物理后果,而不是靠死记硬背"看见 X 就做 Y"的浅层关联。类比学车:只背口诀(向左打 90 度)的人开不好车。能在脑子里看到"打了之后车会往哪偏"的人才能开好。

在 LIBERO 上也做了消融:去掉辅助监督掉 1.5 分,去掉预训练(从随机权重开始训)掉 3.9 分。两个都去掉的"裸奔版"只有 94.6 分,而完整版是 98.5 分。

另一个关键消融:噪声分布的修改。

原始 Cosmos-Predict2 的噪声采样用的是对数正态分布——大部分训练样本加的噪声比较小。这对生成视频没问题(视频不需要特别精确),但对生成机器人动作有害——因为动作的微小偏差会导致任务失败。

论文改成了"混合对数正态-均匀分布":70% 概率从原来的对数正态分布采样,30% 概率从均匀分布 [1.0, 85.0] 采样。这样在高噪声区域(生成过程的起点)有了更多训练信号,去噪的初始步骤更准。推理时也把噪声下限从 σ_min = 0.002 提高到 σ_min = 4,因为极低噪声时信噪比太低、预测反而不准。

所以这一节是想说:让模型顺手预测未来画面和分数,是它真正"开窍"的钥匙——去掉这一招直接掉 22 分。


第 4 步:像下棋一样想 8 步再走(基于模型的规划)

类比:下棋高手不会随手就走。会在脑子里想 8 种走法,推演每种走完会怎样,挑最好的那种落子。

前提条件:为什么要收集 rollout 数据?

如果只用示教数据训练世界模型和价值函数,会有一个致命问题:示教数据里全是成功案例。模型见过的画面都是"教科书里的标准答案"。一旦真实运行时去到"奇怪的中间状态"(比如机器人初始位置稍微偏一点、物体滑了一半),评分员根本没见过这种场面——就只能瞎打分。

所以需要收集"真实运行数据"(rollout data):让基础策略去跑各种初始条件,记录成功和失败的完整过程。这样世界模型和价值函数就能见过"真实世界的混乱",包括失败。

Rollout:让策略在环境中实际跑一遍,记录全程的状态-动作序列和最终结果。就像让学生做一套真题,记录他每道题写了什么、最后考了多少分。

具体流程:

  1. 先用示教数据训出基础策略(Cosmos Policy base)。
  2. 部署基础策略跑很多次(本文收集了 648 条 rollout),记录成功和失败。
  3. 用这 648 条数据再训练一份"规划模型"——90% 数据训世界模型和价值函数,只有 10% 训策略。重点精炼预测和评分能力。

双部署策略(dual deployment):

关键设计:出动作用的是原始基础策略模型 A("出题人"),评分用的是精炼后的规划模型 B("改卷人")。为什么不用同一个模型?因为如果同一个模型既出动作又评分,它评分时见过的画面全都是成功示教里的画面。让 B 见过 A 真实运行过的"奇怪状态"(包括失败),评分才靠谱。就像自己改自己的卷子容易高估自己,让另一个老师改才靠谱。

规划的具体步骤(best-of-N 采样):

  1. 让策略模型 A 生成 8 个不同的候选动作(因为扩散采样有随机性,同一起点多采几次得到不同结果)。

  2. 对每个候选动作,用规划模型 B 预测"做了之后画面变什么样"——预测 3 次(因为预测有随机性,多算几次更准)。

  3. 对每个预测出的未来画面,用 B 的价值函数打分——打 5 次。

  4. 这样每个候选动作就有 3 × 5 = 15 个分数。

  5. 用"多数派均值"(majority mean)聚合:先看 15 个分数里多数判成功(> 阈值)还是失败,再在多数那一组里取平均。挑分数最高的那个候选动作真正执行。

采样(sampling):从一个能产生很多可能结果的模型里抽一次结果。掷骰子就是从 {1,2,3,4,5,6} 里采一次样。模型采样有随机性——同样输入,多采几次得到的结果会有微小不同。

为什么用多数派均值而不是简单平均?

模型对"抓住糖"会打 0.9 分,对"抓滑了"会打 0.1 分。如果简单求平均得 0.5——但 0.5 这个分数很误导,事实上结果非黑即白。正确做法是先看 15 个分数里多数判成功还是失败,再在多数那一组里取平均。这就像选举投票——看大多数人意见,而不是把所有人意见数值平均。

并行解码 vs 自回归解码。

直接当策略用时(不需要规划),只用到动作输出,用并行解码——动作、未来画面、分数同时生成,速度快(0.61 秒/动作块,5 步去噪)。带规划时用自回归解码——先生成动作,再基于动作生成未来画面,再基于未来画面生成分数。速度慢但质量更高。

关键数字: 8 个候选 × 3 次未来预测 × 5 次评分 = 120 次打分。全部在 8 张 H100 显卡上并行,大约 5 秒输出一个动作。

代价: 每次出动作要 5 秒。所以这套规划只用在"慢活"上——折衣服、装糖。接抛球肯定不行。

所以这一节是想说:先脑补 8 种方案、用见过真实失败案例的改卷人评分、再选最优,能涨分但很慢。


第 5 步:模型 V(s') vs 模型无关 Q(s,a) 的对比

类比:评估一道菜好不好吃有两种方式。方式一:先想象吃了之后什么感觉(世界模型预测未来),再给这个感觉打分(价值函数)。方式二:看了菜名和做法直接打分,不想象吃了之后的感受。

V(s') 版本(基于模型的规划)。 价值函数只看"未来状态 s'"来打分。但 s' 是未知的,需要先用世界模型预测出来——"想象吃了之后什么感觉",再打分。好处是:世界模型提供了额外的环境动态信息,在 rollout 数据有限时更准确。

Q(s,a) 版本(模型无关的规划)。 价值函数直接看"当前状态 s + 动作 a"来打分,不需要预测未来状态——"看菜名和做法直接打分"。好处是少了一步预测,更快。坏处是输入维度更高(多了未来状态的信息),在数据有限时更容易过拟合。

实验结论: V(s') 版本一致性地优于 Q(s,a) 版本。论文把原因归结为:世界模型学到的环境动态知识在数据有限时提供了额外的归纳偏置,而 Q 函数因为输入维度更高更容易过拟合。

所以这一节是想说:先想象再做决定(V(s'))比不想象直接判断(Q(s,a))更靠谱——至少在数据不多的时候。


Cosmos Policy — 方法示意:核心 pipeline
Plate Nº IVCosmos Policy — 方法示意:核心 pipeline

关键数字(What works)

仿真任务 LIBERO:平均成功率 98.5%

方法 Spatial Object Goal Long 平均
Diffusion Policy 78.3 92.5 68.3 50.5 72.4
Dita 97.4 94.8 93.2 83.6 92.3
π0 96.8 98.8 95.8 85.2 94.2
UniVLA 96.5 96.8 95.6 92.0 95.2
π0.5 98.8 98.2 98.0 92.4 96.9
OpenVLA-OFT 97.6 98.4 97.9 94.5 97.1
CogVLA 98.6 98.8 96.6 95.4 97.4
Cosmos Policy 98.1 100.0 98.2 97.6 98.5

设置:4 套测试 x 10 任务 x 50 次 x 3 个随机种子 = 6000 次试验。其中"长程多步任务"子集 97.6 分,超过第二名 CogVLA 的 95.4 分。在一个已经被卷到天花板的考试上多 1 分都很难,这里把第二名甩开 1.1 分。

仿真任务 RoboCasa:50 条示教拿 67.1%

方法 每任务示教数 平均成功率
GR00T-N1 300 49.6
DP-VLA 3000 57.3
UWM 1000 60.8
π0 300 62.5
GR00T-N1.5 300 64.1
Video Policy 300 66.0
FLARE 300 66.4
Cosmos Policy 50 67.1

设置:24 个厨房任务,每任务只给 50 次人类演示。数据效率高 60 倍——别人用 300-3000 条才到 50-66 分,Cosmos Policy 用 50 条就拿 67.1 分。这意味着普通家庭买一台机器人时不需要演示 3000 次叠衣服才让它学。

真实双臂机器人 ALOHA:平均 93.6%

方法 放盘子 折衣服 放糖入碗 装糖入袋 平均
Diffusion Policy 63.3 23.5 32.8 14.6 33.6
OpenVLA-OFT+ 68.3 99.5 21.6 58.5 62.0
π0 85.0 98.5 71.2 56.9 77.9
π0.5 98.3 99.5 95.2 61.5 88.6
Cosmos Policy 100.0 99.5 89.6 85.4 93.6

设置:4 个家务任务,101 次试验,185 条人类示教。最弱的方法 100 次有 66 次失败,最强的 100 次只失败 7 次。从"绝对不能商用"到"工业流水线可以试试"。

装糖入袋任务:领先对手 23.9 分

Cosmos Policy 85.4 分;最强对手 π0.5 只有 61.5 分。这个任务要毫米级精度(拉链滑块只有几毫米宽)。视频模型见过海量连续画面,对"东西会不会滑"有直觉。VLA 模型只看过静态图,对滑动没感觉。

加规划再涨 12.5 分

在两个最难的任务上,不带规划 78 分,带规划 90.5 分。代价是每次出动作从 1 秒变 5 秒。折衣服可以接受,乒乓球肯定不行。

推理速度

模式 去噪步数 延迟(1 张 H100)
直接策略(LIBERO/RoboCasa) 5 步 0.61 秒
直接策略(ALOHA) 10 步 0.95 秒
极速模式(1 步去噪) 1 步 0.16 秒
带规划(8 GPU 并行) 10+5+5 步 4.9 秒

极速模式(1 步去噪)在 RoboCasa 上还有 66.4 分,只比 5 步版低 0.5 分——但快了近 4 倍。

所以这一节是想说:仿真和真实任务上都拿了第一,数据效率最猛,规划能再涨一截但很慢。


实验结果说明了什么

第一,视频模型是比 VLA 更好的策略底座。 Cosmos Policy 在 ALOHA 上打败了看过大量机器人数据的 π0.5 和 OpenVLA-OFT+,尽管 Cosmos Policy 没有从大规模机器人示教数据中受益。这说明视频模型从几亿小时视频中获得的时空先验(物理直觉、运动模式)是比 VLA 从图文对中获得的知识更有价值的策略初始化。

第二,预测未来画面是关键。 消融实验中最惊人的发现:去掉"预测未来状态"这个辅助目标,RoboCasa 分数从 62.5 暴跌到 44.4。这不是小数点的差异,这是"能不能用"和"完全不能用"的差异。原因在于:被迫预测未来画面让模型理解了动作的物理后果,而不是浅层地记忆"看见 X 就做 Y"。

第三,预训练知识很重要但不是全部。 从随机权重开始训(不用预训练视频模型)只掉 3.9 分(98.5 → 94.6)。这说明模型架构本身(扩散 transformer + 潜帧注入)就有一定能力,但预训练提供的物理直觉在最难的长程任务上(97.6 → 88.6,差 9 分)贡献最大。

第四,规划有效但有代价。 模型 V(s') 规划一致性地优于模型无关 Q(s,a) 规划,说明世界模型提供的环境动态知识在数据有限时有额外价值。但 5 秒的延迟限制了应用场景——只适合"慢活"。

第五,OOD 泛化是短板。 在 ALOHA 的 OOD 测试中,π0.5(92.5 分)略优于 Cosmos Policy(89.3 分)。π0.5 训练时看过几亿条机器人轨迹,泛化能力更强。Cosmos Policy 虽然在分布内碾压,但换到没见过的颜色/物体时优势缩小。

所以这一节是想说:视频底座 + 联合训练 + 规划,每一层都有实验证据支撑,但 OOD 泛化和速度是两个需要继续攻克的短板。


你应该懂的几个新词

VLA(Vision-Language-Action):会看图、会读指令、会输出动作的三合一模型。像一个会听话的服务员。

视频基础模型(video foundation model):在海量视频上训练过的大网络。可以理解为"看遍了短视频平台的物理直觉机"。

VAE(变分自编码器):把大图压成小卡片、又能还原的网络。视频的"压缩软件"。

潜帧(latent frame):被 VAE 压缩之后的画面"小卡片"。模型实际处理的数据单元。

扩散模型(diffusion model):通过"先加雪花点 → 再学着擦掉"来生成图片或视频的方法。

去噪(denoising):擦雪花点的过程。给被噪声污染的潜帧,预测并减去噪声,恢复干净数据。

潜帧注入(latent injection):把非图像数据(动作、关节角度、分数)伪装成潜帧塞进视频模型的扩散序列里。本文最核心的技术贡献。

世界模型(world model):会预测"做完动作之后世界变什么样"的网络。脑内物理模拟器。

价值函数(value function):给"当前局面"打分。下棋时教练给局面 +3,就是这个东西。

策略(policy):输入画面、输出动作的"反应公式"。

辅助监督(auxiliary supervision):让模型在学主任务(输出动作)的同时顺手学副任务(预测未来、打分),副任务反过来帮主任务学得更好。

消融实验(ablation study):故意拿掉模型的某个部件再测一次,看分数掉多少,从而知道这个部件值不值钱。

OOD(Out-of-Distribution,分布外):测试时见到训练里没出现过的物体或场景。

采样(sampling):从一个有随机性的模型里抽一次输出。同样输入采两次结果会略不同。

Rollout:让策略在环境中实际跑一遍,记录全程的状态-动作序列和最终结果。

Best-of-N 采样:生成 N 个候选方案,分别评估,选最好的。本文 N=8。

多数派均值(majority mean):先按阈值把分数分成成功/失败两组,取多数组的平均值。比简单平均更抗极端值干扰。

所以这一节是想说:这些词是后面所有讨论的"通行证",背下来不亏。


它有什么搞不定的

问题 1:规划太慢。 带规划时一次出动作 5 秒。让它陪小孩打乒乓——别想了。用户实际场景:折衣服 OK,接抛球不行。即使用极速模式(1 步去噪,0.16 秒),也只是直接策略模式,不能做规划。

问题 2:换个新厨房就不灵。 测试时换没见过的颜色衬衫、没见过的厨房风格,分数就掉得多。对手 π0.5 在 OOD 场景下反而更稳(92.5 vs 89.3)——因为 π0.5 训练时看过几亿条机器人轨迹。用户实际场景:机器人在你家用得好不等于在邻居家用得好。

问题 3:要先跑很多次才好用。 加规划那一招需要先用基础策略跑 648 次真实运行,记录失败案例,再训改卷员。用户实际场景:小实验室没钱跑这么多次真机,只能用基础版本,拿不到那 12.5 分加成。

问题 4:长程任务还是不行。 规划只往前看 1 步(best-of-N 只搜索一层)。如果任务是"先开冰箱、再拿菜、再切菜"3 大步,单步预测帮不上忙。论文自己承认"扩展世界模型的预测范围和规划深度可能带来更好的搜索效果"是未来方向。

问题 5:从零训不如预训练但差距不算大。 从随机权重开始训只掉 3.9 分。这说明方法本身(潜帧注入 + 联合训练)有一定独立价值,但也意味着预训练的优势主要在最难的长程任务上——不是全面碾压。

所以这一节是想说:精度和数据效率赢了,速度和泛化还输着,规划深度也还不够。


它和别的几篇是什么关系

用集合的语言:

  • {VLA 派} = OpenVLA、π0、π0.5、CogVLA、UniVLA
  • {视频派} = Cosmos Policy、UVA、UWM、Video Policy
  • {世界模型派} = Dreamer、TD-MPC、Ha & Schmidhuber

Cosmos Policy 同时落在 {视频派} ∩ {世界模型派} 里——它是这两条路线在大模型时代的合流。

维度 VLA 派(π0.5) 视频派(Cosmos Policy) 世界模型派(Dreamer)
预训练来源 图文对 视频 无(从零训)
物理直觉
动作生成 回归/流匹配 扩散 策略网络
规划能力 有(best-of-N) 有(rollout in dream)
OOD 泛化

时间线:

2023:Diffusion Policy(用 diffusion 出动作的开山作)
       ↓
2024:OpenVLA(VLA 范式标杆)
       ↓
2025:π0、π0.5(VLA 巅峰)
       ↓
2025:Cosmos Policy(视频派反击)← 我们读的这篇

因果关系链:因为 Diffusion Policy 证明了"diffusion 适合建模动作"——所以 Cosmos Policy 把这套放大到 20 亿参数。因为 VLA 在 OOD 上表现好——所以 Cosmos Policy 在 OOD 仍然输给 π0.5。因为 Dreamer 证明了"世界模型 + 规划"思路有效——所以 Cosmos Policy 把这套放进大模型。因为 Cosmos-Predict2 已经训好了——所以 Cosmos Policy 能白嫖其物理直觉而不需要从零训。

值得一提的是,Cosmos Policy 的一作 Moo Jin Kim 同时是 OpenVLA-OFT 的一作——他自己跨过了两条路线,从 VLA 派跳到了视频派。

所以这一节是想说:这篇是"视频派 + 世界模型派"的合流,和 VLA 派各有胜场。


和本导读的关系

本文属于导读的 Ch15: 世界模型 章节。在导读的世界模型演化路径中,Cosmos Policy 是第四个里程碑:

  • 2018 Ha & Schmidhuber:VAE + RNN + 线性控制器,首次在"梦中"训练
  • 2020-2023 Dreamer 三部曲:RSSM 从概念验证到 Minecraft 挖钻石
  • 2024 Genie:从无标签视频自动发现动作
  • 2025 Cosmos Policy:用预训练视频模型直接当策略 + 世界模型 + 价值函数

Cosmos Policy 和前面三个里程碑的区别在于:前三个是"先学世界模型、再在模型里训策略"的两步走,而 Cosmos Policy 是"一个模型同时当策略和世界模型"的一步走。此外,Cosmos Policy 是第一个用大规模预训练视频模型(20 亿参数)做底座的世界模型方法。

本文也和 Ch13: 扩散策略 紧密相关——Cosmos Policy 把 Diffusion Policy 的"用扩散生成动作"思路从 150M 参数放大到 2B 参数,并且从"只生成动作"升级到"同时生成动作 + 未来画面 + 价值"。

如果你还没读过 Ch13 和 Ch15,建议先读那两章建立背景知识。

所以这一节是想说:这篇论文在导读中属于世界模型章节的最新里程碑,和扩散策略章节也有直接关联。


思考题

Q1:如果要把 Cosmos Policy 用到一个只有 1 个相机的简单机械臂上,潜帧序列需要几帧?怎么排列?

提示

参考论文 4.1 节的例子。三相机时有 11 帧;单相机时去掉多余的相机视角帧。你需要保留:占位符、当前关节、当前相机、动作、未来关节、未来相机、分数 = 7 帧。排列顺序保持 (s, a, s', V) 的结构。

Q2:消融实验显示"去掉预测未来画面"会掉 22.7 分,但"去掉预测价值"只掉 0.5 分。为什么预测未来画面比预测价值重要得多?

提示

想想这两件事的"信息量"差异。预测未来画面迫使模型理解"动作的物理后果"——这是核心的物理直觉。而预测价值只是"给物理后果打个分"——如果模型已经理解了物理后果,打分相对容易。换句话说,理解因果关系比评估好坏更难也更关键。

Q3:论文为什么要用"双部署"策略(A 出动作、B 评分),而不是用同一个模型既出动作又评分?如果用同一个模型会有什么问题?

提示

关键在于"见过的数据分布"。示教数据全是成功案例。如果同一个模型评分,它见过的全是"教科书状态"。真实运行时会遇到训练时没见过的"奇怪中间状态"——模型没见过就不知道怎么打分。让 B 在 rollout 数据(包含失败)上微调,它就见过真实世界的混乱了。

Q4:噪声分布从对数正态改成"混合对数正态-均匀"(70/30),为什么这对机器人动作特别重要,但对视频生成不重要?

提示

视频生成允许"差不多就行"——生成的视频稍微模糊一点没人会在意。但机器人动作差一点就可能导致任务失败(拉链滑块只有几毫米宽)。高噪声区域是生成过程的起点——如果起点去噪不准,后面的误差会级联放大。原始分布在高噪声区域训练信号不足,改了之后起点更准。

Q5:V(s') 规划(先预测未来再打分)比 Q(s,a) 规划(直接打分)效果好。但如果 rollout 数据非常充足(比如 10000 条而不是 648 条),你觉得哪个会更好?为什么?

提示

论文说 Q(s,a) 在数据有限时更容易过拟合(因为输入维度更高)。但如果有充足数据,过拟合不再是问题,Q(s,a) 的优势在于:少了一步世界模型预测,减少了误差传播,速度也更快。所以数据充足时 Q(s,a) 可能反超。

Q6:Cosmos Policy 在 LIBERO 的长程任务上拿 97.6 分,比第二名高 2.2 分。但它的规划只搜索一层(best-of-N,不递归)。如果要支持多步规划(搜索 2-3 层),需要改什么?代价是什么?

提示

需要把世界模型的预测从"1 步未来"扩展到"多步未来"——即预测 s''、s''' 等。代价是:(1) 长程预测误差累积——越远越不准;(2) 搜索树指数爆炸——8 个候选 × 8 个子候选 = 64 个叶子节点,计算量翻 8 倍;(3) 延迟从 5 秒变成几十秒。论文在 Limitations 里提到了这个方向。

Q7:Cosmos Policy 不改模型结构、只改训练数据就能接受新模态。这种"潜帧注入"方法有什么潜在风险?

提示

把动作复制铺满一个 32x32x16 的数据块,本质上是在浪费容量——99% 的数据是冗余的。更大的风险是:模型可能"混淆"真实图像潜帧和注入的伪装潜帧——如果去噪时不小心把动作潜帧当图像处理,输出就会出错。论文通过条件掩码来缓解,但这个问题可能在大规模扩展时显现。

所以这一节是想说:这些题覆盖了方法理解、实验分析、工程权衡和未来方向四个层面。


一些好奇心问答(FAQ)

Q1:模型多大?我家电脑跑得动吗?

模型 20 亿参数。训练用了 8 到 64 张 H100 显卡(每张 80GB 显存)。推理时 1 张 H100 就够:5 步去噪 0.61 秒/动作块,1 步去噪 0.16 秒。普通家用显卡(12GB 显存)训练完全不行,推理可能勉强但慢得多。

Q2:数据从哪来?

三个来源:LIBERO(仿真平台,公开免费)、RoboCasa(仿真厨房,公开免费)、ALOHA(作者自己用真双臂机器人录的 185 条家务示教,论文说会公开)。规划用的 648 条 rollout 数据是基础策略自己跑出来的。

Q3:训练一次要多少算力?

LIBERO:64 张 H100,48 小时,4 万步。RoboCasa:32 张 H100,48 小时,4.5 万步。ALOHA:8 张 H100,48 小时,5 万步。所有对比方法(π0.5、π0、OpenVLA-OFT+)都给了同样的 48 小时 x 8 H100 预算。

Q4:为什么不用更简单的方法?

试过了。论文里有一个对照——用一个 1.5 亿参数的小网络(Diffusion Policy)从干净数据训。结果在长程任务上 50.5 分,Cosmos Policy 是 97.6 分。说明预训练大底模是新地板,小模型撑不到天花板。

Q5:为什么要做"预测未来"这种看起来没用的事?

被迫预测"做完动作之后会怎样",模型就被逼着理解动作的物理后果。如果只让它输出动作,它会偷懒——背"看见 X 就做 Y",而不是真懂物理。消融实验显示去掉这一招会暴跌 22 分。

Q6:为什么不直接用 ChatGPT 那种文字模型?

文字模型没看过视频,不知道"把杯子推过去会不会洒"。机器人需要的是对连续画面的直觉,文字模型给不了这个。VLA 模型(基于图文对训练的)也有类似问题——只是比纯文字模型多了视觉理解,但仍然缺时间维度的物理直觉。

Q7:1 步去噪能行吗?

能!1 步去噪在 RoboCasa 上还有 66.4 分,只比 5 步版低 0.5 分——但快了近 4 倍(0.16 秒 vs 0.61 秒)。这对实时性要求高的场景很有价值。

Q8:这套方法能用在自动驾驶吗?

理论上能。NVIDIA 的 Cosmos 系列就是给"物理 AI"(自动驾驶 + 机器人 + 仿真)当地基设计的。但自动驾驶还要解决延迟(5 秒太慢)、安全验证、长尾事件等问题。

所以这一节是想说:常见疑问基本能从论文找到答案,不需要再搜外网。


如果你想再深入

按重要性排序:

  1. Cosmos World Foundation Model(NVIDIA 2025) — Cosmos-Predict2 的来源。讲清楚"为什么 NVIDIA 想训物理 AI 底模",以及底模的预训练数据和方法。读懂了才能理解 Cosmos Policy 的"地基"有多结实。

  2. π0.5(Physical Intelligence 2025) — 当下最强 VLA 之一,是 Cosmos Policy 在 OOD 上仍输的对手。读完才能形成完整的对照视野——为什么视频派在分布内赢、VLA 派在 OOD 赢。

  3. Diffusion Policy(Chi 等 2023) — 用 diffusion 建模动作的奠基作。Cosmos Policy 把这个思路从 150M 参数放大到 2B 参数。理解"为什么扩散适合建模多模态动作分布"的起点。

  4. Dreamer V3(Hafner 2023) — 经典世界模型派代表。和 Cosmos Policy 思路一脉相承——learn dynamics + plan with it。看完会明白 Cosmos Policy 是"Dreamer 在大模型时代的重做",区别在于 Dreamer 是两步走(先训世界模型再训策略),Cosmos Policy 是一步走(同时训)。

  5. OpenVLA / OpenVLA-OFT(Stanford 2024-2025) — VLA 派开源标杆。Cosmos Policy 的一作 Moo Jin Kim 同时是 OpenVLA-OFT 的一作——他自己跨过两条路线。读 OpenVLA-OFT 才能理解 VLA 的优势在哪、Cosmos Policy 为什么要换路线。

  6. UWM: Unified World Models(Zhu 等 2025) — 同属"视频 + 动作"路线但不用预训练模型。和 Cosmos Policy 形成直接对比——说明预训练视频模型的价值。

所以这一节是想说:想看更多就按这个顺序,能形成完整的领域地图。


原文信息

标题:Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

作者:Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构:NVIDIA, Stanford University

年份:2025

项目主页https://research.nvidia.com/labs/dir/cosmos-policy/

代码与模型:已在项目主页开源(含训练数据、模型权重、训练和评估脚本)

@article{kim2025cosmospolicy,
  title={Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning},
  author={Kim, Moo Jin and Gao, Yihuai and Lin, Tsung-Yi and Lin, Yen-Chen and Ge, Yunhao and Lam, Grace and Liang, Percy and Song, Shuran and Liu, Ming-Yu and Finn, Chelsea and Gu, Jinwei},
  year={2025},
  url={https://research.nvidia.com/labs/dir/cosmos-policy/}
}

所以这一节是想说:论文、代码、模型全开源,想复现可以直接上手。

引用本笔记 / Cite this note
BibTeX
@online{eai_cosmos_policy_2026,
  title       = {(readable note) Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/cosmos-policy/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?