跳转到内容

V-JEPA 2:先从无动作视频学习世界,再用少量动作数据控制

高级

来源:Meta AI · 发布于 2025-06-11最近复核于 2026-08-30

V-JEPA 2 的路线是先从大量没有动作标签的视频学习“画面接下来怎样变化”,再用约 62 小时带机器人动作的数据把表征接到控制上。执行时,模型预测候选动作的未来状态,MPC 选择短期最优动作;机器人观察新状态后重新规划。它展示的是视觉世界模型迁移到物理推理与控制的可能性,不是只看视频就自动学会任意机器人技能。

真实机器人动作数据昂贵,覆盖的物体、视角和场景有限;公开视频丰富,却通常没有“采取了什么动作”的标签。纯视觉模型能识别画面,不一定知道推、抓、移动会带来什么后果。控制系统还必须应对预测误差:一次规划到底在现实里执行,偏差会不断累积。

V-JEPA 2 先在 actionless 视频上做自监督预训练,通过预测抽象表征而非逐像素重建来学习物体运动和场景变化。随后用约 62 小时机器人视频与动作数据训练动作条件模型,使它能预测“执行候选动作后状态如何变化”。MPC 每轮枚举或优化短动作序列,按目标评估预测结果,只执行前一小步,再用新观测重规划。这种闭环能纠正部分模型误差,但规划质量仍受表征、动作覆盖和目标函数限制。

Meta 报告了物理推理基准和机器人任务结果;这些数字是厂商在特定数据、硬件与设置下的自报,本站没有独立复现。

先用二维网格理解模型与控制器的职责:世界模型预测状态转移,目标函数评价离目标多远,MPC 负责滚动选择动作。三者应分别记录。真实机器人之前先在模拟环境测试越界、遮挡和目标变化;开放权重、代码或 benchmark 只说明工件可获得,不等于下载后已复现论文结果。

画一个 6×6 网格,障碍物在每两步后随机移动一格。建立一个有 20% 概率预测错障碍位置的简化世界模型。比较“一次规划完整路径”与“每走一步重新观察并规划三步”的策略,运行 30 个固定随机种子,统计到达率、碰撞数和平均步数。

成功证据: 随机种子、转移规则和每步计划可复查;至少保存一次重规划避开新障碍的轨迹,同时报告重规划仍失败的案例。

停止线: 两种策略使用不同观测、随机种子未固定,或从网格结果推导真实机器人安全性时,停止比较并补齐实验契约。

  • 视频规模大不等于具备动作因果知识,控制仍依赖带动作数据的适配。
  • MPC 重规划能减小累计误差,但不能修复完全错误的世界模型或目标函数。
  • benchmark 高分和开放工件都不等于真实环境已复现,更不等于可安全部署。

Meta 官方页面提供架构、数据量和案例描述,结果属于团队自报。验证 bundle 的 verification.valid=true 仅证明抓取内容完整,不证明模型主张。上面的网格实验只验证闭环重规划直觉,不验证 V-JEPA 2 的视觉表征或机器人性能。

本文是原创中文实践解读,不是逐句翻译。英文原文见 Meta AI。