World Model & Video Policy
教 AI 在脑子里预演:给它当前画面和一个动作,它能脑补出'下一秒会发生什么'。这个能力一旦建立,规划就能在想象里跑,不必撞坏真机器人。
先读这三篇。
World Models 开宗 → Dreamer-v3 跨域训练范式 → Genie 从无标签视频学潜在动作空间。
-
1
World Models
让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。
-
2
Dreamer V3: Mastering Diverse Domains through World Models
DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。
-
3
Genie: Generative Interactive Environments
Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。
2018 到 2025,16 篇怎么排开。
祖师爷
经典
前沿
World Model & Video Policy 全部 16 篇。
| era | year | title | venue |
|---|---|---|---|
| 前沿 | 2025 | Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control | arXiv |
| 祖师爷 | 2018 | World Models | NeurIPS |
| 祖师爷 | 2020 | Dream to Control: Learning Behaviors by Latent Imagination | ICLR |
| 经典 | 2021 | Mastering Atari with Discrete World Models | ICLR |
| 经典 | 2022 | DayDreamer | CoRL |
| 经典 | 2023 | Transformers are Sample-Efficient World Models | ICLR |
| 经典 | 2023 | TWM: Transformer-based World Models | ICLR |
| 经典 | 2025 | Dreamer V3: Mastering Diverse Domains through World Models | Nature |
| 前沿 | 2023 | GAIA-1 | arXiv |
| 前沿 | 2023 | Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis | arXiv |
| 前沿 | 2024 | Genie: Generative Interactive Environments | ICML |
| 前沿 | 2024 | UniSim | ICLR |
| 前沿 | 2024 | The Essential Role of Causality in Foundation World Models for Embodied AI | ICML |
| 前沿 | 2025 | Cosmos World Foundation Model | arXiv |
| 前沿 | 2025 | 1X World Model Challenge | arXiv |
| 前沿 | 2025 | Navigation World Models | CVPR |