Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
这是写给零经验读者的精读笔记。所有专业词第一次出现都会用日常类比解释。只看这份笔记就能理解全文机制。
一句话讲什么(TL;DR)
把一个会"脑补下一秒视频"的大模型,再练一遍,就能让它指挥机械臂做家务——不改模型结构、不加新零件,只是把机器人动作、未来画面和评分全伪装成视频帧塞进去,让模型按原来处理视频的方式一起学会三件事。
所以这一节是想说:核心创意只有一句话——别从零做,拿"会脑补视频的大脑"改造成"会动手的大脑"。
这是个什么场景
周末你赶着出门,从厨房顺手抓一把糖塞进密封袋——左手撑住袋口、右手把糖倒进去、捏紧拉链。从看到糖到拉好袋子,前后两秒钟,你几乎没在想。
现在让一台机器人替你做这件事。它得在两秒里完成下面这串"心算":看清楚糖在哪、袋子在哪、袋口现在开了多大;想清楚两只手怎么配合(一只撑袋口、一只塞糖);还得知道"手歪一毫米糖就撒了"。
换句话说,它需要两种本事:物理直觉(手伸下去会发生什么、东西会不会倒、塑料袋会不会瘪)和动作多样性(同一个目标可能有十种合理的伸手路线,模型要能挑一种走,而不是卡死在一条路上)。
机器人策略(policy):一个函数,输入是"眼前看到的画面",输出是"接下来手要怎么动"。可以理解为机器人的"反应公式"。打个考试的比方:你做物理题时,看到题面(输入),写出解题步骤(输出)。policy 干的就是这件事,只不过输入换成了摄像头画面,输出换成了"每个关节转多少度"。
动作多模态性(action multimodality):同一个目标有多种合理走法。就像去学校可以坐公交也可以骑自行车——两条路都行。如果模型只会取平均(半坐车半骑车),反而哪条路都走不通。
所以这一节是想说:让机器人做家务的难点是又要懂物理、又要会变通。

之前的人怎么做的,为什么不够好
之前的主流做法分几条路线,每条都有硬伤。
VLA(Vision-Language-Action,视觉-语言-动作模型):一个大网络,能看图、能读指令、能输出动作。代表作是 OpenVLA、π0、π0.5。
路线一:VLA 派。 VLA 的"地基"是看了几亿张"图配文字"训出来的——它见过"苹果"配"红色水果"、"猫"配"四条腿动物"。但 VLA 没看过视频。类比:你只让一个小孩看绘本(静止画面 + 文字)却不让他看动画片(连续画面)。他能认识"苹果",但说不出"苹果从桌上滚下去会怎样"。这就是缺了对时间的直觉。VLA 还有一个毛病:它输出动作用的是"取平均"的方式(L1 回归),碰到两颗糖时,平均位置正好在两颗糖中间——伸手就抓空了。
L1 回归(L1 regression):让模型预测所有训练样本动作的平均值。就像考试时你不确定选 A 还是 C,干脆选了 B——但 B 是错的。
路线二:从头训视频模型派。 有人想用视频模型当地基,但他们丢掉了别人辛苦在几亿小时视频上训好的成果,从零开始——相当于上考场前撕掉自己背了三年的笔记。
路线三:两阶段拼接派。 先训一个视频网络生成未来画面,再外挂一个"动作输出头"从生成的画面里提取动作。结果两个东西没融合好——像把英语作文和数学计算分给两个互不交流的人做,信息在交接时大量丢失。
路线四:小模型派。 用一个 1.5 亿参数的小网络从干净示教数据训。简单但没"地基知识",复杂任务一塌糊涂——在 LIBERO 长程任务上只有 50.5 分。
总结成一张表:
| 路线 | 代表方法 | 核心问题 |
|---|---|---|
| VLA 派 | OpenVLA, π0, π0.5 | 只看过静态图,缺物理直觉;L1 回归遇到多模态就取平均 |
| 从头训视频 | UWM, UniVLA | 丢掉预训练知识,白费几亿小时视频训练 |
| 两阶段拼接 | Video Policy, VIDAR | 视频生成和动作提取分开做,信息丢失 |
| 小模型 | Diffusion Policy | 150M 参数,没有大底模知识,复杂任务撑不住 |
所以这一节是想说:之前的人要么没看过视频、要么没融合好、要么没地基知识。
这篇论文的新想法
打个比方:邻居家有位会画连环画的大叔,看一眼场景就能给你画出"下一格会发生什么"。你想让他帮你指挥机器人手臂——常规做法是另请一位机器人专家,或者给大叔配个助手。这篇论文不一样:不换人、不加助手,就让大叔在画下一格画的时候,顺手在角落写一行字告诉你"主人公接下来该往哪走"。
落到模型上就是一句话:直接拿一个会预测下一秒视频画面的现成大网络(叫 Cosmos-Predict2),不动结构、不加新部件,只是再训练一轮,让它顺便吐出机器人动作。
Cosmos-Predict2:NVIDIA 训好的视频预测大模型,20 亿参数,看了海量视频,已经具备"东西会不会掉、会不会滑"的物理直觉。它的工作方式是:给一张图 + 一句描述,预测接下来的视频帧。
具体来说,Cosmos Policy 让这个视频模型同时学三件事:(1)输出机器人动作(当策略),(2)预测做完动作后的未来画面(当世界模型),(3)评估这条路的最终得分(当价值函数)。三件事都用同一套"伪装成视频帧"的方式塞进同一个网络里,一个训练阶段全部搞定。
更进一步:因为模型学会了预测未来和打分,部署时可以"想 8 种方案、推演每种的结果、选最好的"——就像下棋高手在脑子里推演多步再落子。
所以这一节是想说:不动结构、只改训练数据,让一个模型同时当策略、世界模型和评分员,是这篇最大的胆量。
它分几步做的(方法)
这是全文最核心的部分。Cosmos Policy 的方法可以拆成五个子步骤,从"怎么把动作塞进视频模型"一直到"怎么用规划涨分"。
第 1 步:把动作"伪装"成视频画面(潜帧注入)
类比:你的笔记本本来只能写汉字。现在你要在里面记英文单词——但你不想换笔记本。怎么办?把每个英文单词翻译成对应的汉字塞进去,本子完全不知道你在记新东西,照常翻页。
背景:视频模型怎么处理画面。
Cosmos-Predict2 本来的工作流程是这样的:接收一张起始图和一句文字描述,然后预测接下来的几帧画面,拼成一段短视频。每一帧画面在送进模型之前,都要经过一个叫 VAE 的"压缩软件"处理。
VAE(变分自编码器,Variational Auto-Encoder):一个会把大图压成小卡片、又能把小卡片还原成大图的网络。你可以理解为视频的"压缩软件"。就像你把一张 4K 照片压缩成一张邮票大小的缩略图——虽然小了,但关键信息还在。
潜帧(latent frame):被 VAE 压缩之后的"小卡片"。一张 256x256 的彩色图片被压成一个 32x32x16 的数据块,比原图小了很多但保留了关键信息。模型处理的不是原图,而是这些潜帧。
扩散模型(diffusion model):一种生成图片/视频的方式。先往图里加一堆雪花点(噪声),让网络学怎么把雪花点擦掉还原原图。学会之后给它纯雪花点它就能"擦"出新图。
去噪(denoising):擦掉雪花点的过程。一步一步擦,越擦越清楚。扩散模型的核心训练目标就是:给一张被噪声污染的潜帧,让网络预测"加进去的噪声是什么",然后减去它。
Cosmos-Predict2 的训练过程(EDM 去噪分数匹配公式)可以用一句话翻译:给一个干净的视频潜帧序列,往上面加随机高斯噪声,让网络学着把噪声去掉、还原原始序列。公式里的关键变量:x0 是干净的 VAE 编码后的图像序列,c 是文字描述的 T5 编码,n 是高斯噪声,σ 是噪声强度,Dθ 是去噪网络。网络的目标就是让"Dθ(加噪后的输入) - 原始干净输入"尽量小。
Cosmos Policy 的招数:潜帧注入。
原始的视频模型只能处理图像帧。但机器人策略需要处理很多非图像的东西:关节角度(一串数字)、要执行的动作(一串数字)、这条路能拿多少分(一个数字)。这些都不是图像,怎么塞进去?
做法分四步:
准备占位符:先在图像序列里插入几张"空白图"(全零的图片),放在需要插入新数据的位置。比如序列变成:[空白] [当前关节] [手腕相机] [第三人称相机1] [第三人称相机2] [动作] [未来关节] [未来手腕相机] [未来相机1] [未来相机2] [分数]。
VAE 编码:把这些图片(包括空白图)一起送进 VAE 压缩成潜帧。空白图被压缩成一串零。
覆盖注入:把空白图对应的潜帧直接覆盖掉——用归一化后复制铺满的动作数据、关节数据或分数数据来替换。具体做法是:把动作向量(比如 50 个时间步 x 14 个关节 = 700 个数字)先归一化到 [-1, +1] 范围,然后把这 700 个数字复制很多份填满一个 32x32x16 的数据块(因为一个潜帧就是这么大的),就像把一句话抄满整页纸。
加噪去噪:对需要预测的部分(动作、未来画面、分数)加噪声,保持条件部分(当前画面、当前关节)干净。让网络学去噪。
归一化(normalization):把数据缩放到固定范围(比如 [-1, +1])。就像考试把原始分换算成百分制——不管原始满分是 80 还是 120,统一换成 0-100 方便比较。
条件(conditioning):给模型看的"已知信息"。在去噪时,有些潜帧保持干净(不加噪声)作为条件,网络要基于这些干净帧来去噪其他帧。就像考试时题目是"已知"的(条件),你要写的是"答案"(目标)。
为什么要这样做而不是设计新结构?
最大的好处:不动结构 = 几亿小时视频训练出来的"物理直觉"被原封不动地继承下来。等于白嫖几年的训练成果。模型用同一套去噪机制处理图像和动作,不需要学新规则。虽然复制铺满看起来浪费空间,但好处是模型不需要任何架构修改就能接受新数据类型。
推理时怎么把动作取出来?
模型去噪完成后,会输出干净的潜帧。对于动作潜帧,取出方法很简单:把 32x32x16 数据块里所有复制的值取平均(因为它们都是同一份数据的拷贝),然后反归一化回原始尺度。不需要 VAE 解码——因为这些数据是直接注入潜空间的,从来就不是真正的图像。
一个具体的例子:对于 ALOHA 双臂机器人(3 个相机、14 个关节),潜帧序列有 11 帧。其中 4 帧是新模态(当前关节、动作、未来关节、分数),7 帧是图像(3 个当前视角 + 3 个未来视角 + 1 个空白占位符)。如果只有一个相机,可以删掉多余的相机帧,总潜帧数降到 7。


所以这一节是想说:核心招数就是——把不是图像的东西伪装成图像,让旧模型用同一套去噪机制一起处理。
第 2 步:一个模型同时干三件事(联合训练)
类比:想象一个学生同时学三门课——化学(怎么做反应)、物理(反应后会怎样)、考试评分(这次考多少分)。普通做法是请三个家教,这篇的做法是同一个学生轮流戴三顶帽子。
三件事是什么。
每次训练时,把一批数据分成三份,让同一个网络(同一组参数)轮流学三件事:
当机器人策略(50% 数据):输入是当前画面和关节状态,目标是输出"我该做什么动作"。数学上是在学 p(a, s', V(s') | s)——不光预测动作 a,还顺手预测未来状态 s' 和价值 V(s')。
当世界模型(25% 数据):输入是当前画面 + 给定一个动作,目标是预测"做完之后画面变成什么样"。数学上是在学 p(s', V(s') | s, a)——给定状态和动作,预测未来状态和价值。
当评分员(25% 数据):输入是当前画面 + 动作 + 做完后的画面,目标是估计"这条路最后能拿多少分"。数学上是在学 p(V(s') | s, a, s')——给定全部信息,预测价值。
世界模型(world model):一个会脑补"做了某动作之后世界会变什么样"的模型。相当于脑子里的物理实验室。你心里想"松手苹果会掉",就是你的世界模型在工作。
价值函数(value function):给"当前局面"打分的函数。下棋时教练说"这个局面值 +3",就是价值函数。在本文中,价值 = 这条路最终能拿多少分(成功 = 1,失败 = 0,中间状态按距离终点的远近打折)。
条件掩码怎么决定学哪件事?
关键在于"哪些潜帧保持干净、哪些被加噪"。同一批训练数据,通过不同的条件掩码,就能训练不同的功能:
- 训练策略时:当前状态潜帧干净,动作 + 未来状态 + 价值潜帧被加噪。网络要从当前状态去噪出动作。
- 训练世界模型时:当前状态 + 动作潜帧干净,未来状态 + 价值潜帧被加噪。网络要从状态和动作去噪出未来。
- 训练价值函数时:当前状态 + 动作 + 未来状态潜帧干净,价值潜帧被加噪。网络要从全部信息去噪出价值。
这就是论文说的"条件方案决定训练哪个函数"——同一套数据、同一个网络,只靠改变"哪部分干净、哪部分加噪"就能切换三种学习模式。
梯度(gradient):一个数学量,告诉你"参数往哪调能让分数变高/损失变低"。
梯度下降(gradient descent):根据梯度一步一步调参数。像下山找最低点,每一步都往最陡的下坡方向迈。
损失(loss):考试扣分总和。模型预测错了多少,就扣多少。模型的全部目标就是让 loss 越小越好。
评分是怎么来的?
录一条机器人完成任务的过程。如果最后成功 = 1 分,失败 = 0 分。然后把这个终端分数往前回传——离成功越近的画面分数越高(乘以折扣因子 γ 的递减次方),离失败越近越低。这叫蒙特卡洛回报。每个训练样本都有一个标注的"这条路值多少分"。
折扣因子 γ(discount factor):一个 0 到 1 之间的数,用来让"远期的分数"比"近期的分数"权重低。就像你更在乎今天到手的 100 块而不是明年可能到手的 100 块。本文用 γ^(H-t) 来给时间步 t 的回报打折。
辅助监督:为什么策略不只学动作?
注意上面说的:策略学的是 p(a, s', V(s') | s) 而不是简单的 p(a | s)。也就是说,策略不光要输出动作,还要顺手预测未来画面和分数。这叫辅助监督——看起来是额外负担,但实际上帮策略学得更好。消融实验证明砍掉这些"多余目标"会大幅掉分(后面详细讲)。
50/25/25 的分配不是拍脑袋。 当机器人策略那一份难度最大(输入信息最少,要从当前状态推出一切),所以多分点训练数据。世界模型和价值函数输入更多(有动作信息),相对容易一些,各分 25%。
初始训练数据的来源。 一开始,rollouts 数据集就是 demonstrations 数据集的超集——包含成功示教和失败示教。在仿真环境(LIBERO、RoboCasa)中,大概 10-20% 的示教因为人类操作失误会失败;在真实 ALOHA 环境中数据采得更仔细,没有失败示教,两个数据集相等。
所以这一节是想说:一个网络靠切换"哪部分干净哪部分加噪"来戴三顶帽子,三件事互相提分。
第 3 步:顺手预测未来,反而考得更好(辅助监督的威力)
类比:让一个学生只背公式他考 70 分。让他顺带预测出题人下一题会问什么——他反而考 85 分。因为"预测出题方向"逼他理解了公式背后的逻辑。
它在干什么。
第 2 步里说,模型当策略时,本来只需要输出"动作"。但论文硬要它同时预测"做完后画面什么样"和"这条路值多少分"。听起来是浪费时间——这些预测在直接部署时不需要。但消融实验显示砍掉这些"多余预测"反而会大幅掉分。
论文在 RoboCasa 厨房任务上做了一组层层递进的消融实验,每次砍掉一个部件:
| 版本 | 描述 | 平均成功率 |
|---|---|---|
| 完整版 | 策略 + 世界模型 + 价值函数 + 辅助监督 | 67.1% |
| 去掉价值函数训练 | 不训评分员,只用 50% 策略 + 50% 世界模型 | 66.6% |
| 去掉世界模型和价值函数训练 | 100% 数据全训策略 | 64.0% |
| 再去掉策略的辅助价值目标 | 策略只学 p(a, s' | s),不预测分数 |
| 再去掉策略的辅助未来状态目标 | 策略只学 p(a | s),纯动作 |
最后一刀最狠——拿掉"预测未来画面",分数从 62.5 直接掉到 44.4,暴跌 22.7 分。
为什么预测未来这么有用?
被迫预测"做完之后画面什么样",模型就被逼着真的理解了动作的物理后果,而不是靠死记硬背"看见 X 就做 Y"的浅层关联。类比学车:只背口诀(向左打 90 度)的人开不好车。能在脑子里看到"打了之后车会往哪偏"的人才能开好。
在 LIBERO 上也做了消融:去掉辅助监督掉 1.5 分,去掉预训练(从随机权重开始训)掉 3.9 分。两个都去掉的"裸奔版"只有 94.6 分,而完整版是 98.5 分。
另一个关键消融:噪声分布的修改。
原始 Cosmos-Predict2 的噪声采样用的是对数正态分布——大部分训练样本加的噪声比较小。这对生成视频没问题(视频不需要特别精确),但对生成机器人动作有害——因为动作的微小偏差会导致任务失败。
论文改成了"混合对数正态-均匀分布":70% 概率从原来的对数正态分布采样,30% 概率从均匀分布 [1.0, 85.0] 采样。这样在高噪声区域(生成过程的起点)有了更多训练信号,去噪的初始步骤更准。推理时也把噪声下限从 σ_min = 0.002 提高到 σ_min = 4,因为极低噪声时信噪比太低、预测反而不准。
所以这一节是想说:让模型顺手预测未来画面和分数,是它真正"开窍"的钥匙——去掉这一招直接掉 22 分。
第 4 步:像下棋一样想 8 步再走(基于模型的规划)
类比:下棋高手不会随手就走。会在脑子里想 8 种走法,推演每种走完会怎样,挑最好的那种落子。
前提条件:为什么要收集 rollout 数据?
如果只用示教数据训练世界模型和价值函数,会有一个致命问题:示教数据里全是成功案例。模型见过的画面都是"教科书里的标准答案"。一旦真实运行时去到"奇怪的中间状态"(比如机器人初始位置稍微偏一点、物体滑了一半),评分员根本没见过这种场面——就只能瞎打分。
所以需要收集"真实运行数据"(rollout data):让基础策略去跑各种初始条件,记录成功和失败的完整过程。这样世界模型和价值函数就能见过"真实世界的混乱",包括失败。
Rollout:让策略在环境中实际跑一遍,记录全程的状态-动作序列和最终结果。就像让学生做一套真题,记录他每道题写了什么、最后考了多少分。
具体流程:
- 先用示教数据训出基础策略(Cosmos Policy base)。
- 部署基础策略跑很多次(本文收集了 648 条 rollout),记录成功和失败。
- 用这 648 条数据再训练一份"规划模型"——90% 数据训世界模型和价值函数,只有 10% 训策略。重点精炼预测和评分能力。
双部署策略(dual deployment):
关键设计:出动作用的是原始基础策略模型 A("出题人"),评分用的是精炼后的规划模型 B("改卷人")。为什么不用同一个模型?因为如果同一个模型既出动作又评分,它评分时见过的画面全都是成功示教里的画面。让 B 见过 A 真实运行过的"奇怪状态"(包括失败),评分才靠谱。就像自己改自己的卷子容易高估自己,让另一个老师改才靠谱。
规划的具体步骤(best-of-N 采样):
让策略模型 A 生成 8 个不同的候选动作(因为扩散采样有随机性,同一起点多采几次得到不同结果)。
对每个候选动作,用规划模型 B 预测"做了之后画面变什么样"——预测 3 次(因为预测有随机性,多算几次更准)。
对每个预测出的未来画面,用 B 的价值函数打分——打 5 次。
这样每个候选动作就有 3 × 5 = 15 个分数。
用"多数派均值"(majority mean)聚合:先看 15 个分数里多数判成功(> 阈值)还是失败,再在多数那一组里取平均。挑分数最高的那个候选动作真正执行。
采样(sampling):从一个能产生很多可能结果的模型里抽一次结果。掷骰子就是从 {1,2,3,4,5,6} 里采一次样。模型采样有随机性——同样输入,多采几次得到的结果会有微小不同。
为什么用多数派均值而不是简单平均?
模型对"抓住糖"会打 0.9 分,对"抓滑了"会打 0.1 分。如果简单求平均得 0.5——但 0.5 这个分数很误导,事实上结果非黑即白。正确做法是先看 15 个分数里多数判成功还是失败,再在多数那一组里取平均。这就像选举投票——看大多数人意见,而不是把所有人意见数值平均。
并行解码 vs 自回归解码。
直接当策略用时(不需要规划),只用到动作输出,用并行解码——动作、未来画面、分数同时生成,速度快(0.61 秒/动作块,5 步去噪)。带规划时用自回归解码——先生成动作,再基于动作生成未来画面,再基于未来画面生成分数。速度慢但质量更高。
关键数字: 8 个候选 × 3 次未来预测 × 5 次评分 = 120 次打分。全部在 8 张 H100 显卡上并行,大约 5 秒输出一个动作。
代价: 每次出动作要 5 秒。所以这套规划只用在"慢活"上——折衣服、装糖。接抛球肯定不行。
所以这一节是想说:先脑补 8 种方案、用见过真实失败案例的改卷人评分、再选最优,能涨分但很慢。
第 5 步:模型 V(s') vs 模型无关 Q(s,a) 的对比
类比:评估一道菜好不好吃有两种方式。方式一:先想象吃了之后什么感觉(世界模型预测未来),再给这个感觉打分(价值函数)。方式二:看了菜名和做法直接打分,不想象吃了之后的感受。
V(s') 版本(基于模型的规划)。 价值函数只看"未来状态 s'"来打分。但 s' 是未知的,需要先用世界模型预测出来——"想象吃了之后什么感觉",再打分。好处是:世界模型提供了额外的环境动态信息,在 rollout 数据有限时更准确。
Q(s,a) 版本(模型无关的规划)。 价值函数直接看"当前状态 s + 动作 a"来打分,不需要预测未来状态——"看菜名和做法直接打分"。好处是少了一步预测,更快。坏处是输入维度更高(多了未来状态的信息),在数据有限时更容易过拟合。
实验结论: V(s') 版本一致性地优于 Q(s,a) 版本。论文把原因归结为:世界模型学到的环境动态知识在数据有限时提供了额外的归纳偏置,而 Q 函数因为输入维度更高更容易过拟合。
所以这一节是想说:先想象再做决定(V(s'))比不想象直接判断(Q(s,a))更靠谱——至少在数据不多的时候。

关键数字(What works)
仿真任务 LIBERO:平均成功率 98.5%
| 方法 | Spatial | Object | Goal | Long | 平均 |
|---|---|---|---|---|---|
| Diffusion Policy | 78.3 | 92.5 | 68.3 | 50.5 | 72.4 |
| Dita | 97.4 | 94.8 | 93.2 | 83.6 | 92.3 |
| π0 | 96.8 | 98.8 | 95.8 | 85.2 | 94.2 |
| UniVLA | 96.5 | 96.8 | 95.6 | 92.0 | 95.2 |
| π0.5 | 98.8 | 98.2 | 98.0 | 92.4 | 96.9 |
| OpenVLA-OFT | 97.6 | 98.4 | 97.9 | 94.5 | 97.1 |
| CogVLA | 98.6 | 98.8 | 96.6 | 95.4 | 97.4 |
| Cosmos Policy | 98.1 | 100.0 | 98.2 | 97.6 | 98.5 |
设置:4 套测试 x 10 任务 x 50 次 x 3 个随机种子 = 6000 次试验。其中"长程多步任务"子集 97.6 分,超过第二名 CogVLA 的 95.4 分。在一个已经被卷到天花板的考试上多 1 分都很难,这里把第二名甩开 1.1 分。
仿真任务 RoboCasa:50 条示教拿 67.1%
| 方法 | 每任务示教数 | 平均成功率 |
|---|---|---|
| GR00T-N1 | 300 | 49.6 |
| DP-VLA | 3000 | 57.3 |
| UWM | 1000 | 60.8 |
| π0 | 300 | 62.5 |
| GR00T-N1.5 | 300 | 64.1 |
| Video Policy | 300 | 66.0 |
| FLARE | 300 | 66.4 |
| Cosmos Policy | 50 | 67.1 |
设置:24 个厨房任务,每任务只给 50 次人类演示。数据效率高 60 倍——别人用 300-3000 条才到 50-66 分,Cosmos Policy 用 50 条就拿 67.1 分。这意味着普通家庭买一台机器人时不需要演示 3000 次叠衣服才让它学。
真实双臂机器人 ALOHA:平均 93.6%
| 方法 | 放盘子 | 折衣服 | 放糖入碗 | 装糖入袋 | 平均 |
|---|---|---|---|---|---|
| Diffusion Policy | 63.3 | 23.5 | 32.8 | 14.6 | 33.6 |
| OpenVLA-OFT+ | 68.3 | 99.5 | 21.6 | 58.5 | 62.0 |
| π0 | 85.0 | 98.5 | 71.2 | 56.9 | 77.9 |
| π0.5 | 98.3 | 99.5 | 95.2 | 61.5 | 88.6 |
| Cosmos Policy | 100.0 | 99.5 | 89.6 | 85.4 | 93.6 |
设置:4 个家务任务,101 次试验,185 条人类示教。最弱的方法 100 次有 66 次失败,最强的 100 次只失败 7 次。从"绝对不能商用"到"工业流水线可以试试"。
装糖入袋任务:领先对手 23.9 分
Cosmos Policy 85.4 分;最强对手 π0.5 只有 61.5 分。这个任务要毫米级精度(拉链滑块只有几毫米宽)。视频模型见过海量连续画面,对"东西会不会滑"有直觉。VLA 模型只看过静态图,对滑动没感觉。
加规划再涨 12.5 分
在两个最难的任务上,不带规划 78 分,带规划 90.5 分。代价是每次出动作从 1 秒变 5 秒。折衣服可以接受,乒乓球肯定不行。
推理速度
| 模式 | 去噪步数 | 延迟(1 张 H100) |
|---|---|---|
| 直接策略(LIBERO/RoboCasa) | 5 步 | 0.61 秒 |
| 直接策略(ALOHA) | 10 步 | 0.95 秒 |
| 极速模式(1 步去噪) | 1 步 | 0.16 秒 |
| 带规划(8 GPU 并行) | 10+5+5 步 | 4.9 秒 |
极速模式(1 步去噪)在 RoboCasa 上还有 66.4 分,只比 5 步版低 0.5 分——但快了近 4 倍。
所以这一节是想说:仿真和真实任务上都拿了第一,数据效率最猛,规划能再涨一截但很慢。
实验结果说明了什么
第一,视频模型是比 VLA 更好的策略底座。 Cosmos Policy 在 ALOHA 上打败了看过大量机器人数据的 π0.5 和 OpenVLA-OFT+,尽管 Cosmos Policy 没有从大规模机器人示教数据中受益。这说明视频模型从几亿小时视频中获得的时空先验(物理直觉、运动模式)是比 VLA 从图文对中获得的知识更有价值的策略初始化。
第二,预测未来画面是关键。 消融实验中最惊人的发现:去掉"预测未来状态"这个辅助目标,RoboCasa 分数从 62.5 暴跌到 44.4。这不是小数点的差异,这是"能不能用"和"完全不能用"的差异。原因在于:被迫预测未来画面让模型理解了动作的物理后果,而不是浅层地记忆"看见 X 就做 Y"。
第三,预训练知识很重要但不是全部。 从随机权重开始训(不用预训练视频模型)只掉 3.9 分(98.5 → 94.6)。这说明模型架构本身(扩散 transformer + 潜帧注入)就有一定能力,但预训练提供的物理直觉在最难的长程任务上(97.6 → 88.6,差 9 分)贡献最大。
第四,规划有效但有代价。 模型 V(s') 规划一致性地优于模型无关 Q(s,a) 规划,说明世界模型提供的环境动态知识在数据有限时有额外价值。但 5 秒的延迟限制了应用场景——只适合"慢活"。
第五,OOD 泛化是短板。 在 ALOHA 的 OOD 测试中,π0.5(92.5 分)略优于 Cosmos Policy(89.3 分)。π0.5 训练时看过几亿条机器人轨迹,泛化能力更强。Cosmos Policy 虽然在分布内碾压,但换到没见过的颜色/物体时优势缩小。
所以这一节是想说:视频底座 + 联合训练 + 规划,每一层都有实验证据支撑,但 OOD 泛化和速度是两个需要继续攻克的短板。
你应该懂的几个新词
VLA(Vision-Language-Action):会看图、会读指令、会输出动作的三合一模型。像一个会听话的服务员。
视频基础模型(video foundation model):在海量视频上训练过的大网络。可以理解为"看遍了短视频平台的物理直觉机"。
VAE(变分自编码器):把大图压成小卡片、又能还原的网络。视频的"压缩软件"。
潜帧(latent frame):被 VAE 压缩之后的画面"小卡片"。模型实际处理的数据单元。
扩散模型(diffusion model):通过"先加雪花点 → 再学着擦掉"来生成图片或视频的方法。
去噪(denoising):擦雪花点的过程。给被噪声污染的潜帧,预测并减去噪声,恢复干净数据。
潜帧注入(latent injection):把非图像数据(动作、关节角度、分数)伪装成潜帧塞进视频模型的扩散序列里。本文最核心的技术贡献。
世界模型(world model):会预测"做完动作之后世界变什么样"的网络。脑内物理模拟器。
价值函数(value function):给"当前局面"打分。下棋时教练给局面 +3,就是这个东西。
策略(policy):输入画面、输出动作的"反应公式"。
辅助监督(auxiliary supervision):让模型在学主任务(输出动作)的同时顺手学副任务(预测未来、打分),副任务反过来帮主任务学得更好。
消融实验(ablation study):故意拿掉模型的某个部件再测一次,看分数掉多少,从而知道这个部件值不值钱。
OOD(Out-of-Distribution,分布外):测试时见到训练里没出现过的物体或场景。
采样(sampling):从一个有随机性的模型里抽一次输出。同样输入采两次结果会略不同。
Rollout:让策略在环境中实际跑一遍,记录全程的状态-动作序列和最终结果。
Best-of-N 采样:生成 N 个候选方案,分别评估,选最好的。本文 N=8。
多数派均值(majority mean):先按阈值把分数分成成功/失败两组,取多数组的平均值。比简单平均更抗极端值干扰。
所以这一节是想说:这些词是后面所有讨论的"通行证",背下来不亏。
它有什么搞不定的
问题 1:规划太慢。 带规划时一次出动作 5 秒。让它陪小孩打乒乓——别想了。用户实际场景:折衣服 OK,接抛球不行。即使用极速模式(1 步去噪,0.16 秒),也只是直接策略模式,不能做规划。
问题 2:换个新厨房就不灵。 测试时换没见过的颜色衬衫、没见过的厨房风格,分数就掉得多。对手 π0.5 在 OOD 场景下反而更稳(92.5 vs 89.3)——因为 π0.5 训练时看过几亿条机器人轨迹。用户实际场景:机器人在你家用得好不等于在邻居家用得好。
问题 3:要先跑很多次才好用。 加规划那一招需要先用基础策略跑 648 次真实运行,记录失败案例,再训改卷员。用户实际场景:小实验室没钱跑这么多次真机,只能用基础版本,拿不到那 12.5 分加成。
问题 4:长程任务还是不行。 规划只往前看 1 步(best-of-N 只搜索一层)。如果任务是"先开冰箱、再拿菜、再切菜"3 大步,单步预测帮不上忙。论文自己承认"扩展世界模型的预测范围和规划深度可能带来更好的搜索效果"是未来方向。
问题 5:从零训不如预训练但差距不算大。 从随机权重开始训只掉 3.9 分。这说明方法本身(潜帧注入 + 联合训练)有一定独立价值,但也意味着预训练的优势主要在最难的长程任务上——不是全面碾压。
所以这一节是想说:精度和数据效率赢了,速度和泛化还输着,规划深度也还不够。
它和别的几篇是什么关系
用集合的语言:
- {VLA 派} = OpenVLA、π0、π0.5、CogVLA、UniVLA
- {视频派} = Cosmos Policy、UVA、UWM、Video Policy
- {世界模型派} = Dreamer、TD-MPC、Ha & Schmidhuber
Cosmos Policy 同时落在 {视频派} ∩ {世界模型派} 里——它是这两条路线在大模型时代的合流。
| 维度 | VLA 派(π0.5) | 视频派(Cosmos Policy) | 世界模型派(Dreamer) |
|---|---|---|---|
| 预训练来源 | 图文对 | 视频 | 无(从零训) |
| 物理直觉 | 弱 | 强 | 中 |
| 动作生成 | 回归/流匹配 | 扩散 | 策略网络 |
| 规划能力 | 无 | 有(best-of-N) | 有(rollout in dream) |
| OOD 泛化 | 强 | 中 | 弱 |
时间线:
2023:Diffusion Policy(用 diffusion 出动作的开山作)
↓
2024:OpenVLA(VLA 范式标杆)
↓
2025:π0、π0.5(VLA 巅峰)
↓
2025:Cosmos Policy(视频派反击)← 我们读的这篇
因果关系链:因为 Diffusion Policy 证明了"diffusion 适合建模动作"——所以 Cosmos Policy 把这套放大到 20 亿参数。因为 VLA 在 OOD 上表现好——所以 Cosmos Policy 在 OOD 仍然输给 π0.5。因为 Dreamer 证明了"世界模型 + 规划"思路有效——所以 Cosmos Policy 把这套放进大模型。因为 Cosmos-Predict2 已经训好了——所以 Cosmos Policy 能白嫖其物理直觉而不需要从零训。
值得一提的是,Cosmos Policy 的一作 Moo Jin Kim 同时是 OpenVLA-OFT 的一作——他自己跨过了两条路线,从 VLA 派跳到了视频派。
所以这一节是想说:这篇是"视频派 + 世界模型派"的合流,和 VLA 派各有胜场。
和本导读的关系
本文属于导读的 Ch15: 世界模型 章节。在导读的世界模型演化路径中,Cosmos Policy 是第四个里程碑:
- 2018 Ha & Schmidhuber:VAE + RNN + 线性控制器,首次在"梦中"训练
- 2020-2023 Dreamer 三部曲:RSSM 从概念验证到 Minecraft 挖钻石
- 2024 Genie:从无标签视频自动发现动作
- 2025 Cosmos Policy:用预训练视频模型直接当策略 + 世界模型 + 价值函数
Cosmos Policy 和前面三个里程碑的区别在于:前三个是"先学世界模型、再在模型里训策略"的两步走,而 Cosmos Policy 是"一个模型同时当策略和世界模型"的一步走。此外,Cosmos Policy 是第一个用大规模预训练视频模型(20 亿参数)做底座的世界模型方法。
本文也和 Ch13: 扩散策略 紧密相关——Cosmos Policy 把 Diffusion Policy 的"用扩散生成动作"思路从 150M 参数放大到 2B 参数,并且从"只生成动作"升级到"同时生成动作 + 未来画面 + 价值"。
如果你还没读过 Ch13 和 Ch15,建议先读那两章建立背景知识。
所以这一节是想说:这篇论文在导读中属于世界模型章节的最新里程碑,和扩散策略章节也有直接关联。
思考题
Q1:如果要把 Cosmos Policy 用到一个只有 1 个相机的简单机械臂上,潜帧序列需要几帧?怎么排列?
提示
参考论文 4.1 节的例子。三相机时有 11 帧;单相机时去掉多余的相机视角帧。你需要保留:占位符、当前关节、当前相机、动作、未来关节、未来相机、分数 = 7 帧。排列顺序保持 (s, a, s', V) 的结构。
Q2:消融实验显示"去掉预测未来画面"会掉 22.7 分,但"去掉预测价值"只掉 0.5 分。为什么预测未来画面比预测价值重要得多?
提示
想想这两件事的"信息量"差异。预测未来画面迫使模型理解"动作的物理后果"——这是核心的物理直觉。而预测价值只是"给物理后果打个分"——如果模型已经理解了物理后果,打分相对容易。换句话说,理解因果关系比评估好坏更难也更关键。
Q3:论文为什么要用"双部署"策略(A 出动作、B 评分),而不是用同一个模型既出动作又评分?如果用同一个模型会有什么问题?
提示
关键在于"见过的数据分布"。示教数据全是成功案例。如果同一个模型评分,它见过的全是"教科书状态"。真实运行时会遇到训练时没见过的"奇怪中间状态"——模型没见过就不知道怎么打分。让 B 在 rollout 数据(包含失败)上微调,它就见过真实世界的混乱了。
Q4:噪声分布从对数正态改成"混合对数正态-均匀"(70/30),为什么这对机器人动作特别重要,但对视频生成不重要?
提示
视频生成允许"差不多就行"——生成的视频稍微模糊一点没人会在意。但机器人动作差一点就可能导致任务失败(拉链滑块只有几毫米宽)。高噪声区域是生成过程的起点——如果起点去噪不准,后面的误差会级联放大。原始分布在高噪声区域训练信号不足,改了之后起点更准。
Q5:V(s') 规划(先预测未来再打分)比 Q(s,a) 规划(直接打分)效果好。但如果 rollout 数据非常充足(比如 10000 条而不是 648 条),你觉得哪个会更好?为什么?
提示
论文说 Q(s,a) 在数据有限时更容易过拟合(因为输入维度更高)。但如果有充足数据,过拟合不再是问题,Q(s,a) 的优势在于:少了一步世界模型预测,减少了误差传播,速度也更快。所以数据充足时 Q(s,a) 可能反超。
Q6:Cosmos Policy 在 LIBERO 的长程任务上拿 97.6 分,比第二名高 2.2 分。但它的规划只搜索一层(best-of-N,不递归)。如果要支持多步规划(搜索 2-3 层),需要改什么?代价是什么?
提示
需要把世界模型的预测从"1 步未来"扩展到"多步未来"——即预测 s''、s''' 等。代价是:(1) 长程预测误差累积——越远越不准;(2) 搜索树指数爆炸——8 个候选 × 8 个子候选 = 64 个叶子节点,计算量翻 8 倍;(3) 延迟从 5 秒变成几十秒。论文在 Limitations 里提到了这个方向。
Q7:Cosmos Policy 不改模型结构、只改训练数据就能接受新模态。这种"潜帧注入"方法有什么潜在风险?
提示
把动作复制铺满一个 32x32x16 的数据块,本质上是在浪费容量——99% 的数据是冗余的。更大的风险是:模型可能"混淆"真实图像潜帧和注入的伪装潜帧——如果去噪时不小心把动作潜帧当图像处理,输出就会出错。论文通过条件掩码来缓解,但这个问题可能在大规模扩展时显现。
所以这一节是想说:这些题覆盖了方法理解、实验分析、工程权衡和未来方向四个层面。
一些好奇心问答(FAQ)
Q1:模型多大?我家电脑跑得动吗?
模型 20 亿参数。训练用了 8 到 64 张 H100 显卡(每张 80GB 显存)。推理时 1 张 H100 就够:5 步去噪 0.61 秒/动作块,1 步去噪 0.16 秒。普通家用显卡(12GB 显存)训练完全不行,推理可能勉强但慢得多。
Q2:数据从哪来?
三个来源:LIBERO(仿真平台,公开免费)、RoboCasa(仿真厨房,公开免费)、ALOHA(作者自己用真双臂机器人录的 185 条家务示教,论文说会公开)。规划用的 648 条 rollout 数据是基础策略自己跑出来的。
Q3:训练一次要多少算力?
LIBERO:64 张 H100,48 小时,4 万步。RoboCasa:32 张 H100,48 小时,4.5 万步。ALOHA:8 张 H100,48 小时,5 万步。所有对比方法(π0.5、π0、OpenVLA-OFT+)都给了同样的 48 小时 x 8 H100 预算。
Q4:为什么不用更简单的方法?
试过了。论文里有一个对照——用一个 1.5 亿参数的小网络(Diffusion Policy)从干净数据训。结果在长程任务上 50.5 分,Cosmos Policy 是 97.6 分。说明预训练大底模是新地板,小模型撑不到天花板。
Q5:为什么要做"预测未来"这种看起来没用的事?
被迫预测"做完动作之后会怎样",模型就被逼着理解动作的物理后果。如果只让它输出动作,它会偷懒——背"看见 X 就做 Y",而不是真懂物理。消融实验显示去掉这一招会暴跌 22 分。
Q6:为什么不直接用 ChatGPT 那种文字模型?
文字模型没看过视频,不知道"把杯子推过去会不会洒"。机器人需要的是对连续画面的直觉,文字模型给不了这个。VLA 模型(基于图文对训练的)也有类似问题——只是比纯文字模型多了视觉理解,但仍然缺时间维度的物理直觉。
Q7:1 步去噪能行吗?
能!1 步去噪在 RoboCasa 上还有 66.4 分,只比 5 步版低 0.5 分——但快了近 4 倍(0.16 秒 vs 0.61 秒)。这对实时性要求高的场景很有价值。
Q8:这套方法能用在自动驾驶吗?
理论上能。NVIDIA 的 Cosmos 系列就是给"物理 AI"(自动驾驶 + 机器人 + 仿真)当地基设计的。但自动驾驶还要解决延迟(5 秒太慢)、安全验证、长尾事件等问题。
所以这一节是想说:常见疑问基本能从论文找到答案,不需要再搜外网。
如果你想再深入
按重要性排序:
Cosmos World Foundation Model(NVIDIA 2025) — Cosmos-Predict2 的来源。讲清楚"为什么 NVIDIA 想训物理 AI 底模",以及底模的预训练数据和方法。读懂了才能理解 Cosmos Policy 的"地基"有多结实。
π0.5(Physical Intelligence 2025) — 当下最强 VLA 之一,是 Cosmos Policy 在 OOD 上仍输的对手。读完才能形成完整的对照视野——为什么视频派在分布内赢、VLA 派在 OOD 赢。
Diffusion Policy(Chi 等 2023) — 用 diffusion 建模动作的奠基作。Cosmos Policy 把这个思路从 150M 参数放大到 2B 参数。理解"为什么扩散适合建模多模态动作分布"的起点。
Dreamer V3(Hafner 2023) — 经典世界模型派代表。和 Cosmos Policy 思路一脉相承——learn dynamics + plan with it。看完会明白 Cosmos Policy 是"Dreamer 在大模型时代的重做",区别在于 Dreamer 是两步走(先训世界模型再训策略),Cosmos Policy 是一步走(同时训)。
OpenVLA / OpenVLA-OFT(Stanford 2024-2025) — VLA 派开源标杆。Cosmos Policy 的一作 Moo Jin Kim 同时是 OpenVLA-OFT 的一作——他自己跨过两条路线。读 OpenVLA-OFT 才能理解 VLA 的优势在哪、Cosmos Policy 为什么要换路线。
UWM: Unified World Models(Zhu 等 2025) — 同属"视频 + 动作"路线但不用预训练模型。和 Cosmos Policy 形成直接对比——说明预训练视频模型的价值。
所以这一节是想说:想看更多就按这个顺序,能形成完整的领域地图。
原文信息
标题:Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning
作者:Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu
机构:NVIDIA, Stanford University
年份:2025
项目主页:https://research.nvidia.com/labs/dir/cosmos-policy/
代码与模型:已在项目主页开源(含训练数据、模型权重、训练和评估脚本)
@article{kim2025cosmospolicy,
title={Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning},
author={Kim, Moo Jin and Gao, Yihuai and Lin, Tsung-Yi and Lin, Yen-Chen and Ge, Yunhao and Lam, Grace and Liang, Percy and Song, Shuran and Liu, Ming-Yu and Finn, Chelsea and Gu, Jinwei},
year={2025},
url={https://research.nvidia.com/labs/dir/cosmos-policy/}
}
所以这一节是想说:论文、代码、模型全开源,想复现可以直接上手。
◼
引用本笔记 / Cite this note
@online{eai_cosmos_policy_2026,
title = {(readable note) Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2025 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/cosmos-policy/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?