Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Topic VI · 世界模型与视频策略

World Model & Video Policy

World Model & Video Policy — 世界模型与视频策略
16papers
2founder
5classic
9frontier

教 AI 在脑子里预演:给它当前画面和一个动作,它能脑补出'下一秒会发生什么'。这个能力一旦建立,规划就能在想象里跑,不必撞坏真机器人。


Primer · 入门 3 篇

先读这三篇

World Models 开宗 → Dreamer-v3 跨域训练范式 → Genie 从无标签视频学潜在动作空间。

  1. 1
    World Models 2018 · NeurIPS · ⭐⭐⭐

    让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。

  2. 2
    Dreamer V3: Mastering Diverse Domains through World Models 2025 · Nature · ⭐⭐⭐⭐

    DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。

  3. 3
    Genie: Generative Interactive Environments 2024 · ICML · ⭐⭐⭐⭐

    Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。


Distribution · 年份分布

2018 到 2025,16 篇怎么排开。

祖师爷 经典 前沿
All papers · 按 era 排

World Model & Video Policy 全部 16 篇。

erayeartitlevenue
前沿 2025 Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control arXiv
祖师爷 2018 World Models NeurIPS
祖师爷 2020 Dream to Control: Learning Behaviors by Latent Imagination ICLR
经典 2021 Mastering Atari with Discrete World Models ICLR
经典 2022 DayDreamer CoRL
经典 2023 Transformers are Sample-Efficient World Models ICLR
经典 2023 TWM: Transformer-based World Models ICLR
经典 2025 Dreamer V3: Mastering Diverse Domains through World Models Nature
前沿 2023 GAIA-1 arXiv
前沿 2023 Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis arXiv
前沿 2024 Genie: Generative Interactive Environments ICML
前沿 2024 UniSim ICLR
前沿 2024 The Essential Role of Causality in Foundation World Models for Embodied AI ICML
前沿 2025 Cosmos World Foundation Model arXiv
前沿 2025 1X World Model Challenge arXiv
前沿 2025 Navigation World Models CVPR