Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
World Model & Video Policy · Plate Nº 151

1X World Model Challenge

23 min read · 7890 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过世界模型和视频生成"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。

注意:本文精读的 arXiv 2510.07092 是 Revontuli 队(Aalto、爱丁堡等)为 1X World Model Challenge 写的技术报告,他们在两个赛道都拿了第一。它不是 1X 公司自己发布的基础模型,而是"参赛冠军怎么做的"复盘。

一句话讲什么(TL;DR)

给机器人两个不同难度的"脑补未来"考题:一个是直接画出未来的像素画面(采样赛道),一个是预测未来的压缩编码(压缩赛道)。冠军队一个用现成视频大模型 Wan-2.2 微调、一个从零训小 Transformer,双双夺冠——还比亚军快一个数量级。

所以这一节是想说:这篇是"世界模型公开擂台赛"的冠军解题报告,核心经验是"能借基础模型就借,借不到就训个小而巧的"。


这是个什么场景

你打台球,出杆前脑子里会闪过一段"小电影":母球撞过去 → 目标球往袋口滚 → 母球反弹回来。手还没动,画面已经在脑中放完。这种"动手前先脑补未来画面"的能力,学名叫 世界模型(world model)——一个装在脑子里的"环境模拟器",让你不用真动手就能预演后果、提前规划。

给人形机器人装上世界模型,好处是巨大的:机器人可以在"想象"里试错,不用真把杯子摔碎才知道抓法不对。但难点在于——机器人没有人类那种物理常识,得从数据里学。

1X(一家造人形机器人 Neo 的公司)办了一个公开擂台赛 1X World Model Challenge,把真实人形机器人交互的数据放出来,设两个互补的赛道让全世界来卷:

  • 采样赛道(Sampling):预测未来的图像帧——给你机器人看到的前 17 帧画面 + 完整的机器人状态序列,让你画出 2 秒后(第 77 帧)那张 512×512 的画面。评分用 PSNR(预测帧和真实帧的像素相似度)。
  • 压缩赛道(Compression):预测未来的离散编码——先用 Cosmos 分词器把画面压成一格格离散 token,给你 3 格(过去)+ 机器人状态,让你预测接下来 3 格 token。评分用 Top-500 交叉熵(只看每个 token 概率最高的 500 个候选)。

同一个"脑补未来"的能力,用两种方式考:一种在像素空间直接画(直观、可人工验证),一种在压缩的编码空间预测(高效、适合下游用序列模型)。

所以这一节是想说:1X 把"世界模型好不好"拆成"能不能画出未来帧"和"能不能预测未来编码"两道考题,本文是同时拿下这两道题的冠军报告。


1X World Model Challenge — 场景示意:这论文要解决的现实问题
Plate Nº I1X World Model Challenge — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 循环网络 / MLP 路线(Dreamer、PlaNet、TD-MPC 等):在低维隐空间预测未来状态,配强化学习学控制。优点是闭环训练快;缺点是隐空间不是像素,人无法直观验证"它想得对不对",且表达力受限。
  • 离散隐空间上的自回归 Transformer(IRIS、Genie、STORM 等):把画面压成离散 token,用 Transformer 像写句子一样预测下一批 token。压缩赛道正是这条路线。优点是高效、能建模长序列;缺点是要先训一个好的分词器,且自回归推理会累积误差。
  • 扩散 / 流匹配的视频世界模型(Diffusion for World Modeling、Oasis 等):在像素空间直接生成高质量未来视频。优点是画质高、细节足;缺点是训练极贵,从零训一个视频生成模型要海量算力和数据。
  • 核心难题:想要像素级高质量(可验证、细节足),就得付出巨大的训练成本;想省成本用隐空间,又牺牲了直观性和画质。

冠军队的破题思路:采样赛道别从零训——直接借一个已经在互联网视频上"长大"的视频基础模型(Wan-2.2)来微调;压缩赛道数据量适中,从零训一个小而高效的时空 Transformer 反而更划算。

所以这一节是想说:世界模型的两难是"画质 vs 成本",冠军队用"能借就借、该训就训"分赛道各个击破。


这篇论文的新想法

三个判断叠在一起:

  1. 基础模型时代,像素级世界模型不必从零训。Wan-2.2 这种几十亿参数的视频生成大模型,权重里已经塞满"物体不穿墙、光照连续、手有五指"的常识。与其重训,不如把它微调到"给定机器人状态,预测机器人第一视角的未来帧"。
  2. 机器人世界模型的稀缺资源是"状态-视频"配对,不是视频本身。所以关键工程是怎么把机器人状态这个新条件接进原本只吃文本/图像的视频模型——冠军队用 AdaLN-Zero 干这件事。
  3. 两个赛道要用不同武器。像素预测(数据分布广、要画质)适合借大模型微调;离散编码预测(数据量适中、要高效自回归)适合从零训一个轻量时空 Transformer。

合起来:采样赛道 = Wan-2.2 + 状态条件(AdaLN-Zero)+ LoRA 微调 + 集成推理;压缩赛道 = 从零训的时空 Transformer + 贪心自回归解码。

【一个能力,两种武器:分赛道各个击破】

              ┌── 采样赛道(画像素) ── 数据分布广、要画质
  "脑补未来"  │      → 借 Wan-2.2 视频大模型(已含物理常识)
   的能力 ────┤        + 状态条件(AdaLN-Zero) + LoRA微调 + 集成推理
              │        评分:PSNR(预测帧 vs 真实帧像素相似度)
              │
              └── 压缩赛道(预测token) ── 数据量适中、要高效自回归
                     → 从零训轻量时空 Transformer(ST-Transformer)
                       + 贪心自回归解码
                       评分:Top-500 交叉熵

  原则:能借基础模型就借,借不到就训个"小而巧"的

所以这一节是想说:核心创新不在"发明新架构",而在"如何把机器人状态条件优雅地接进现成视频模型 + 分赛道选对武器"这套务实的工程判断。


它分几步做的(方法)

整个方案分两条独立的流水线,对应两个赛道:

采样赛道 (Sampling):
 前17帧 + 机器人状态s(77×25) ──▶ [Wan-2.2 TI2V-5B, 30层DiT]
                                    ▲ 状态用AdaLN-Zero注入
                                    ▲ LoRA rank32微调
                                └──▶ 未来16帧(512×512) ──▶ 集成平均 ──▶ 第77帧, PSNR

压缩赛道 (Compression):
 3格过去token(3×32×32) + 状态s(64×25) ──▶ [ST-Transformer, 24层]
                                          ▲ 状态用加性embedding注入
                                     └──▶ 预测3格未来token ──▶ 贪心自回归, Top-500 CE

下面逐块拆开。

5.1 采样赛道的底座:Wan-2.2 TI2V-5B

类比:要造赛车,自己从矿石冶炼钢铁太贵;不如买一台靠谱的发动机改一改。

输入 → 处理 → 输出:底座是 Wan-2.2 TI2V-5B——一个基于**流匹配(flow-matching)**的视频生成模型,骨干是 30 层 DiT(Diffusion Transformer,用 Transformer 当扩散骨干)。它原本是"文本+图像→视频(TI2V)"。模型在 Wan2.2-VAE 压缩出的隐空间上工作:VAE 对首帧做空间压缩,对其余帧做 4 倍时间压缩,长度 L 的片段压成长度 1+(L-1)/4 的隐序列。

数据预处理:原始 77 帧片段按 4 倍下采样成 21 帧的短片段——于是有 5 帧当条件(第 0,4,8,12,16 帧),剩下 16 帧当预测目标。

小结:选一个开源、参数适中、画质过关的视频基模当地基,在它的压缩隐空间上干活。

5.2 采样赛道的关键改造:视频 + 状态条件

类比:原版遥控器只有"文字"和"首帧图"两个按钮,机器人需要一个新按钮——"我现在关节这么动,画面会怎样"。

视频条件(image-to-video → video-to-video):标准图生视频模型只把第一帧固定住当条件。冠军队改了输入 latent 的掩码机制,固定多帧,把模型从"图→视频"升级成"视频→视频"。原本吃文本的交叉注意力层保留,用空字符串当文本 prompt(数据没有文字描述),给未来留接口。

状态条件(AdaLN-Zero):这是最核心的一招。机器人状态 s ∈ R^{77×25}(77 个时刻,每时刻 25 维:关节角度、速度等)。

  • 先把状态下采样到和下采样后的视频对齐;连续的角度、速度用正弦特征增强;所有状态过 MLP 投影到隐维度 r_dim=256
  • 再用 2 层 1D 卷积沿时间维压缩,匹配 Wan-VAE 对视频的时间压缩,得到形状 ((1+L//4), r_dim)
  • 最后过一个 MLP 得到 AdaLN-Zero 用的调制量(scale/shift)。这个"机器人调制量"加到流匹配时间步的调制量上,注入 Wan 的每个 DiT 块。

AdaLN-Zero:一种把条件信息"调旋钮"注入 Transformer 的方式(DiT 里的经典做法)——把条件变成一组缩放/平移系数,作用在每层归一化上。"Zero"指初始化时让这些调制为零,训练开始时等于不改变原模型,稳定微调。

妙处:时间步调制对整个 latent 是同一个值,而状态调制会分片作用在对应帧的 latent 上——即"第 t 帧的画面被第 t 时刻的机器人状态控制",做到了逐帧的动作可控性。

小结:把机器人状态用正弦编码+MLP+1D卷积对齐到视频时间轴,再用 AdaLN-Zero 逐帧注入 DiT,让"未来画面随动作变"。

5.3 采样赛道的训练与推理技巧

训练:用 LoRA(低秩适配)rank=32 微调 Wan-2.2 的 DiT 骨干——只训插入的低秩矩阵,省显存。AdamW,恒定学习率 4e-4,训 23k 步,有效 batch size 1024。硬件是 DataCrunch 的 B200 集群(4 节点 × 8 张 B200,每张 184GB 显存)。作者试了训练时加/不加无分类器引导(CFG),发现对 PSNR 提升不大。

推理技巧(PSNR 优化):PSNR 会重罚"锐利但有偏差"的图——一张略糊但整体接近的图,PSNR 反而更高。所以:

  • 前人做法是对预测帧做高斯模糊 + 直方图匹配后处理,能 +1.2dB。
  • 冠军队更进一步:用多次预测的集成平均(ensemble)来选择性地模糊高不确定区域(比如运动剧烈的手臂)。增加集成样本数持续提升 PSNR。这是"利用预测不确定性"的巧劲——确定的地方保持锐利,不确定的地方自动变糊,正好迎合 PSNR 的偏好。

小结:LoRA 省钱微调 + 用集成平均迎合 PSNR 指标,是拿分的两把钥匙。

5.4 压缩赛道:从零训时空 Transformer(ST-Transformer)

类比:这道题数据量适中、要在离散编码空间高效自回归,与其扛来一台大发动机,不如手工打造一台小而顺手的。

输入 → 处理 → 输出:先用 Cosmos 8×8×8 分词器把 17 帧 RGB 画面编码成 3 格 32×32 的离散 token。任务:给 H=3 格过去 token + 机器人状态 s ∈ R^{64×25},预测 M=3 格未来 token。

架构(借鉴 Genie):为了避免标准 Transformer 的二次方内存开销,用 时空 Transformer(ST-Transformer)——交替做空间注意力(每帧内 1×32×32 个 token 互相看)和带因果掩码的时间注意力(同一空间坐标跨时间看,只看过去)。这样主瓶颈的空间注意力随帧数线性增长而非二次。用 pre-LayerNorm + QKNorm 稳定训练,位置用可学习绝对编码。规模:24 层、8 头、维度 512、序列长 T=5、dropout 0.1

状态条件(加性 embedding,借鉴 Genie):状态向量过 MLP → 1D 卷积(核 3、padding 1)→ 加绝对位置编码,然后和视频 token 相加。

训练:AdamW(β=0.9/0.95),80 epoch,权重衰减 0.05 只作用于权重矩阵。输入输出 embedding 绑定(省内存、常提性能)。用 teacher forcing 并行训练,学习率从峰值 8e-4 线性降到 0(2000 步预热)。混合精度 bf16 训练,但推理用 fp32(bf16 推理会掉点)。有效 batch size 160,同样在 B200 集群。

推理:自回归逐 token 生成。作者对比了随机采样 vs 贪心解码(greedy,每步选概率最高的 token),发现贪心更有效更高效——它产生确定的高概率序列,损失更低。

小结:压缩赛道用一个 24 层的时空 Transformer 从零训,空间/时间注意力交替省内存,贪心自回归解码拿低损失。

5.5 为什么"分赛道选武器"是关键

  • 采样赛道数据分布广、要像素画质——借大模型微调能白嫖互联网尺度的物理常识,36 小时就登顶。
  • 压缩赛道在离散编码空间、数据量适中(约 30.6 万样本)——从零训小模型反而更快更省,17 小时训完还赢。
  • 两个赛道都靠把机器人状态接进模型(一个用 AdaLN-Zero,一个用加性 embedding),这是机器人世界模型区别于纯视频生成的命门。

小结:同一个"脑补未来"能力,用不同数据形态考,就该用不同武器——这套务实判断是冠军队的核心方法论。


1X World Model Challenge — 方法示意:核心 pipeline
Plate Nº II1X World Model Challenge — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"借大模型 + 巧推理"到底值多少。

数字 1:两赛道公开榜单双第一

赛道 队伍 PSNR (Test) Top-500 CE (Test) 名次
采样 Revontuli(本文) 23.00 dB 1st
采样 Duke 21.56 dB 2nd
采样 Michael 18.51 dB 3rd
压缩 Revontuli(本文) 6.64 1st
压缩 Duke 7.50 2nd
压缩 a27sridh 7.99 3rd

关键含义:采样 23.00 dB 领先亚军 1.44 dB,压缩 6.64 领先亚军 0.86——两赛道都是明确的第一。

数字 2:采样赛道推理消融(验证集)

推理设置 Val PSNR↑ SSIM↑ LPIPS↓ FID↓
1 样本,无 CFG 22.63 0.707 0.137 40.23
5 样本平均 24.52 0.750 0.165 71.46
20 样本平均 24.88 0.762 0.201 90.71
首次提交(含验证集训练)20 样本 26.62 0.836 0.082 31.70

关键含义:增加集成样本数持续拉高 PSNR/SSIM,但 LPIPS/FID(感知质量)反而变差——集成平均是在牺牲视觉真实感换 PSNR 分数,印证 PSNR 偏爱"糊而准"。

数字 3:训练效率——比亚军快一个数量级

维度 采样赛道 压缩赛道
到达第一名耗时 约 36 小时 17 小时内训完
亚军耗时(采样) 约 1 个月
硬件 DataCrunch B200 集群(4×8 张 B200) 同上
微调方式 LoRA rank 32 从零训

关键含义:借基础模型 + 多节点 B200,36 小时登顶,比亚军的约一个月快约 20 倍——这是"借大模型"路线最有说服力的证据。

数字 4:数据与任务规模

维度 数据
采样目标 预测 2 秒后(第 77 帧)512×512 画面
采样条件 前 17 帧 + 状态 s ∈ R^{77×25}
压缩数据集 约 306,000 样本,约 1.88B token
压缩单样本 6 格 token(3 过去 3 未来),每格 32×32 = 6144 token
状态维度 每时刻 25 维

所以这一节是想说:数据证明三件事——两赛道都赢、集成平均是"刷 PSNR"的取巧、借大模型带来数量级的效率优势。


实验结果说明了什么

问题一:借大模型 vs 从零训,到底哪个好? 答案是"看赛道"。采样赛道(要像素画质、数据分布广)借 Wan-2.2 微调压倒性胜出,36 小时登顶。压缩赛道(离散空间、数据量适中)从零训小模型反而更划算,17 小时训完还第一。所以不是"借"或"训"哪个绝对好,而是匹配数据形态和资源

问题二:PSNR 是不是一个好指标? 本文暴露了 PSNR 的一个大坑:它偏爱"糊而准"。集成平均样本越多,PSNR 越高,但 LPIPS/FID(感知质量)越差——生成的画面其实越糊。作者自己也点明:"最适合下游决策的推理策略仍是开放问题"。这提醒我们:世界模型评测不能只看 PSNR,否则会奖励"把不确定区域一律模糊掉"的偷懒策略。

问题三:机器人状态条件真的起作用吗? 起作用。采样赛道用 AdaLN-Zero 让状态分片调制对应帧的 latent,实现逐帧动作可控;压缩赛道用加性 embedding 注入状态。这正是"世界模型"区别于"无条件视频生成"的关键——生成的未来必须随机器人的动作而变,而不是产生一个默认行为。

问题四:自回归推理怎么选? 压缩赛道对比了随机采样 vs 贪心解码,贪心更好——它选高概率序列,损失更低更稳。作者还试了 scheduled sampling 想缩小 teacher forcing 和自回归的差距,但没明显改善。这说明在这个任务上"确定性、高概率"比"多样性"更重要。

所以这一节是想说:实验回答了四个问题——借/训看赛道、PSNR 有坑、状态条件是命门、贪心解码更优。


你应该懂的几个新词

世界模型(world model):根据当前观测 + 动作预测未来观测/状态的模型,相当于装在脑子里的环境模拟器。

视频基础模型(video foundation model):在海量互联网视频上预训练的大模型(Sora、Wan-2.2、Cosmos),学到"视频长什么样"的通用先验。

流匹配(flow-matching):一种生成模型训练方式,用直线路径把噪声映射到数据,比标准扩散的曲线路径采样更快。Wan-2.2 用它。

DiT(Diffusion Transformer):用 Transformer 替换 U-Net 当扩散/生成骨干的架构。Sora、Wan、Cosmos 都属于这家。

AdaLN-Zero:把条件信息变成 scale/shift 系数注入每层归一化的方式,初始化为零以稳定微调。DiT 注入条件的标配。

LoRA(低秩适配):大模型微调技术,只训插入的低秩矩阵,省显存。本文用 rank 32 微调 Wan-2.2。

分词器(tokenizer):把连续画面压成离散 token 的模块。压缩赛道用 Cosmos 8×8×8 分词器。

时空 Transformer(ST-Transformer):交替做空间注意力和时间注意力的 Transformer,让空间注意力随帧数线性增长而非二次,省内存。

PSNR / SSIM / LPIPS / FID:图像/视频质量指标。PSNR 看逐像素误差(偏爱糊而准),LPIPS/FID 看感知真实感。

teacher forcing:序列模型训练时用真值当输入并行训练,推理时改用自己的预测(会有分布差异)。

所以这一节是想说:这十个词是理解现代视频世界模型的通用词汇,尤其 AdaLN-Zero 和流匹配会在几乎所有 DiT 类工作里反复出现。


它有什么搞不定的

  • PSNR 导向的取巧不利于下游:为刷 PSNR 用集成平均把高运动区域模糊掉,感知质量(LPIPS/FID)反而变差。作者明说"最适合下游决策的推理策略仍是开放问题"——一个把手臂糊成一团的世界模型,拿去做规划未必好用。
  • 只是挑战赛技术报告,非完整方法论:这是为特定赛题、特定数据、特定指标优化的方案,很多选择(如集成平均)是"为了赢比赛"而非"为了真实机器人控制"。
  • 采样赛道推理慢且贵:集成 20 个样本、每个都要跑完整视频扩散,推理成本高。挑战赛不限推理时间,但真实机器人闭环控制吃不消。
  • 自回归误差累积:压缩赛道 teacher forcing 和真实自回归推理有差距(图 3b 的橙绿曲线分离),scheduled sampling 也没能补上——长时预测会漂。
  • 没做真正的下游控制验证:全文只评"预测得像不像",没验证"拿这个世界模型去规划/控制机器人效果如何"。世界模型的终极价值是辅助决策,这一步缺席。
  • 状态条件仅限本体状态:只用了机器人关节/速度状态,没有语言指令、任务目标等更高层条件,能"脑补"但还不能"按指令脑补"。

所以这一节是想说:本文赢了比赛,但赢的是"预测像不像",而世界模型真正的考验——"能不能帮机器人做更好的决策"——还没被回答。


它和别的论文是什么关系

  • 上游(被它借用)
    • Wan-2.2(阿里通义万相):采样赛道的底座视频生成模型。
    • Cosmos(NVIDIA):提供了压缩赛道用的 8×8×8 分词器。本仓库有 cosmos-world-foundation 笔记可对照。
    • Genie(DeepMind):压缩赛道的 ST-Transformer 架构和状态加性 embedding 都借鉴自它。
    • DiT / AdaLN-Zero(Peebles & Xie):条件注入机制来源。
  • 同族(世界模型大家族)
    • Dreamer 系列(V1/V2/V3):隐空间世界模型 + RL,本仓库有笔记。和本文的区别:Dreamer 在低维隐空间预测且直接闭环学控制,本文在像素/token 空间预测但只评预测质量。
    • World Models(Ha & Schmidhuber):世界模型的开山之作,本仓库有 world-models-ha 笔记。
  • 对比路线
    • VLA(π0、OpenVLA、RT-2):跳过显式世界模型,端到端学"看图+指令→动作"。本文代表另一条押注——先建"想象力",未来再在其上做规划。
    • cosmos-policy:把世界模型微调成策略,是"世界模型 → 控制"的下一步,正好补上本文缺席的下游验证。

所以这一节是想说:本文站在 Wan-2.2 + Cosmos + Genie + DiT 的肩膀上,是"视频/token 世界模型"路线的一个务实工程样本,但离"世界模型辅助控制"还差一步。


和本导读的关系

本笔记对应导读 Ch15:世界模型——从 Dreamer 到视频基座

导读 Ch15 讲的是"让智能体在脑子里建一个环境模拟器"这条线:从 Ha & Schmidhuber 的 World Models 开山,到 Dreamer 系列在隐空间做 model-based RL,再到近年"视频基础模型当世界模型"的新浪潮(Cosmos、Genie、本文)。本笔记深入的是最新这一格——如何把现成视频大模型微调成动作可控的世界模型,以及一个公开擂台赛暴露出的评测陷阱(PSNR 偏爱糊而准)。

读完本笔记,建议对照看 cosmos-world-foundation 笔记(本文压缩赛道分词器的来源,也是"视频世界模型平台"的系统工作)和 dreamer 系列笔记(理解隐空间世界模型 + RL 的另一条路),你会看到"世界模型"这条线从隐空间到像素、从自研架构到借基础模型的完整演进。

所以这一节是想说:本笔记是导读 Ch15 "视频基座世界模型"这一格的深度展开,和 Cosmos、Dreamer 笔记连起来看能看清整条演进线。


思考题

以下问题检验你是否真正理解了本文的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么采样赛道选择"借 Wan-2.2 微调",而压缩赛道选择"从零训小模型"?决定这个选择的关键因素是什么?

提示

关键是数据形态 + 数据量 + 目标指标的匹配。采样赛道要在像素空间生成高画质视频,数据分布广,从零训视频模型极贵——而 Wan-2.2 已在互联网视频学到丰富物理常识,微调就能白嫖,36 小时登顶。压缩赛道在离散 token 空间、数据量适中(约 30.6 万样本约 1.88B token),一个 24 层的时空 Transformer 足够表达,从零训反而更快更省(17 小时)还能针对性优化自回归。没有一刀切的答案,武器要匹配战场。

Q2:AdaLN-Zero 注入状态时,为什么状态调制要"分片作用在对应帧的 latent",而流匹配时间步的调制是"整个 latent 统一"?这个区别为什么重要?

提示

流匹配时间步描述的是"当前去噪到第几步",这对整段视频是同一个状态,所以统一调制。而机器人状态是逐时刻变化的——第 t 帧的画面应该由第 t 时刻的动作决定。如果状态也统一调制整段 latent,就丢失了"哪一帧对应哪个动作"的对齐,模型无法做到逐帧动作可控。分片调制保证了"第 t 帧随第 t 时刻状态变",这正是世界模型"动作可控"的核心。

Q3:集成平均样本数从 1 增到 20,PSNR 从 22.63 升到 24.88,但 LPIPS 从 0.137 恶化到 0.201。请解释这个矛盾,以及它揭示了 PSNR 作为评测指标的什么问题。

提示

集成平均对多个预测求平均,在模型确定的区域(背景)几乎不变,在不确定的区域(运动的手臂)会把多个可能位置平均成一团糊。PSNR 是逐像素均方误差,重罚"锐利但位置偏一点"的预测——一张糊图整体接近就得高分。所以集成平均是在"用画质换 PSNR"。LPIPS 衡量感知相似度,糊图感知质量差,所以恶化。这揭示 PSNR 会奖励"把不确定区域一律模糊"的偷懒策略,不能单独作为世界模型的评测标准。

Q4:压缩赛道的 ST-Transformer 交替做空间注意力和时间注意力,而不是让所有 token 一起做全局注意力。这样做的动机是什么?牺牲了什么?

提示

动机是省内存。标准全局注意力的复杂度是序列长度的二次方,视频 token 数量巨大(每帧 32×32=1024,多帧更多),全局注意力内存爆炸。ST 把注意力拆成"每帧内空间注意力"(随帧数线性增长)+"同坐标跨时间注意力",让主瓶颈线性化。牺牲的是:token 不能一步到位地直接关注任意时空位置,跨时空的信息要经过多层空间+时间注意力交替才能传递,表达力理论上弱于全局注意力,但换来了可训练的内存开销。

Q5:本文只评估了"预测未来像不像"(PSNR/CE),没有验证"拿世界模型去做规划/控制的效果"。为什么这是一个重要的缺失?一个 PSNR 很高的世界模型可能在控制上失败吗?

提示

世界模型的终极价值是辅助决策(规划、想象中试错、生成训练数据),而不是画好看的视频。一个 PSNR 高的模型完全可能控制失败:比如它靠把运动区域(恰恰是机器人手和被操作物体,控制最关心的部分)模糊掉来刷 PSNR,那么用它规划时恰恰在最关键的地方信息缺失。预测质量指标和下游控制效用之间没有必然的正相关——这正是作者说"最适合下游的推理策略仍是开放问题"的原因。

Q6:假设你要把这个世界模型真正用于机器人闭环控制(10Hz),采样赛道的方案会遇到什么瓶颈?你会怎么改?

提示

瓶颈是推理慢且贵:采样赛道为刷 PSNR 用了 20 个样本集成,每个样本都要跑完整的多步视频扩散——远达不到 10Hz。改进方向:去掉集成(它本是为刷指标而非控制);用更少的流匹配/扩散步数或蒸馏成一步生成;只预测控制需要的短时域而非 2 秒;或干脆转向压缩赛道那种在低维 token 空间的高效自回归预测,牺牲像素画质换速度。核心是"控制需要的是快和动作相关的准,不是像素级美观"。

Q7:压缩赛道用贪心解码(每步选概率最高 token)而非随机采样,得到更低的损失。但"损失更低"一定意味着"世界模型更好"吗?在什么场景下你会反而想要随机采样?

提示

不一定。贪心解码产生确定的、高概率的单一未来,损失(交叉熵)低是因为它总押最稳的答案。但真实世界是多模态的——未来有多种可能(物体可能往左也可能往右滚)。贪心会塌缩到单一"平均/最可能"未来,丢失多样性。如果你要用世界模型做基于采样的规划(想象多种未来再挑最好的)、或需要探索、或要建模不确定性,你就想要随机采样来覆盖多个可能的未来分支。低损失只说明"单点预测准",不等于"能表达未来的分布"。

所以这一节是想说:能回答这 7 题,你就理解了本文的武器选择逻辑、状态条件的对齐细节、PSNR 的陷阱,以及"预测质量 ≠ 控制效用"这个世界模型的根本议题。


一些好奇心问答(FAQ)

Q1:这篇是 1X 公司自己发的模型吗? 不是。它是参加 1X World Model Challenge 的 Revontuli 队(Aalto 大学、爱丁堡大学等)写的冠军技术报告。1X 提供了数据、评测协议和榜单,方案是参赛队做的。

Q2:为什么要设"采样"和"压缩"两个赛道? 两种都是"预测未来",但视角不同。采样在像素空间直接画未来帧——直观、人能验证、细节足。压缩在离散编码空间预测未来 token——高效、适合下游用序列模型处理。设两个赛道能同时推动"高画质"和"高效率"两条技术路线。

Q3:Wan-2.2 是什么? 阿里通义万相系列的开源视频生成模型,基于流匹配 + DiT 架构。本文用的是 TI2V-5B 版本(约 50 亿参数,文本图像到视频)。选它因为开源、参数适中、对人手和室内场景画质过关。

Q4:36 小时登顶靠的是模型好还是算力猛? 两者都有,但关键是"借大模型"这个战略。他们用了 B200 集群(4×8 张,每张 184GB),但真正让他们比亚军快约 20 倍(36 小时 vs 约 1 个月)的,是没有从零训视频模型,而是 LoRA 微调 Wan-2.2——白嫖了互联网尺度的预训练。

Q5:为什么推理用 fp32 而训练用 bf16? 压缩赛道作者发现 bf16 推理会掉点(精度不够导致自回归误差放大),所以推理切回 fp32 保精度。训练用 bf16 是为了省显存加速。这是个常见的工程权衡。

Q6:这个世界模型现在能用来控制机器人了吗? 还不能直接用。本文只验证了"预测像不像",没做下游控制。而且采样赛道为刷 PSNR 的集成推理又慢又会糊化关键区域,不适合实时闭环。要落地控制还需要专门为"控制效用"优化。

所以这一节是想说:这是一份"怎么赢比赛"的实战复盘,读它能学到借基础模型的工程手艺,但别误以为它已经是能开机就用的机器人大脑。


如果你想再深入

按"底座 → 架构来源 → 同族 → 下游方向"排序:

  1. 底座:Wan 技术报告(Wang et al. 2025) — 采样赛道的地基视频模型,读懂流匹配 + DiT 的条件注入才懂本文改了什么。
  2. 架构来源:Genie(Bruce et al. 2024) — 压缩赛道的 ST-Transformer 和状态注入方式来源。
  3. 分词器 / 平台:Cosmos World Foundation(NVIDIA 2025) — 压缩赛道分词器来源,本仓库有笔记,是"视频世界模型平台"的系统工作。
  4. 同族:Dreamer V3(Hafner et al. 2025, Nature) — 隐空间世界模型 + RL 的巅峰,理解另一条世界模型路线。
  5. 下游:cosmos-policy — 把世界模型微调成策略,补上本文缺席的"世界模型→控制"环节。

所以这一节是想说:把 Wan + Genie + Cosmos + Dreamer 连起来读,就能看清"视频/token 世界模型"从架构到应用的全貌。


原文信息

BibTeX

@techreport{mereu2025worldmodel,
  title       = {Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report},
  author      = {Mereu, Riccardo and Scannell, Aidan and Hou, Yuxin and Zhao, Yi and Jitta, Aditya and Dominguez, Antonio and Acerbi, Luigi and Storkey, Amos and Chang, Paul},
  institution = {Aalto University and University of Edinburgh and Deep Render and DataCrunch and University of Helsinki},
  year        = {2025},
  note        = {1X World Model Challenge, arXiv:2510.07092}
}

链接

  • arXiv:arxiv.org/abs/2510.07092
  • 挑战赛:1X World Model Challenge(含公开数据、评测协议、榜单)
  • 底座模型:Wan-2.2 TI2V-5B;分词器:Cosmos 8×8×8

所以这一节是想说:这是 Revontuli 队 2025 年的冠军技术报告,核心贡献是"如何把机器人状态条件优雅地接进现成视频基础模型"以及一套务实的分赛道解题策略。

引用本笔记 / Cite this note
BibTeX
@online{eai_1x_world_model_2025_2026,
  title       = {(readable note) 1X World Model Challenge},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/1x-world-model-2025/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?