Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 48

pi_0.5: VLA with Open-World Generalization

20 min read · 6865 字 · ⭐⭐⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。

一句话讲什么(TL;DR)

Physical Intelligence 的 π0.5:在前作 π0 的"VLM 大脑 + flow matching 动作专家"基础上,靠异构联训(co-training)——约 400 小时移动机器人数据(100 个真实家庭)+ 大量其他机器人数据 + 网页图文/VQA + 高层子任务标注 + 人类口头指令——让机器人第一次能走进训练中从未见过的真实房子,听懂"把碗放进水池"这类长程指令,先在脑子里念出下一个子任务、再用动作专家做出对应动作,一步步干完。核心创新是分层推理(先出高层子任务、再出低层动作)+ 离散/连续动作混合训练,实现开放世界泛化(open-world generalization)。

所以这一节是想说:π0.5 把"网页世界常识 + 多机器人动作手感 + 把大任务拆小的本事"压进同一个脑子,第一次做到"换个新家也能开干",是 VLA 走向开放世界的里程碑。


这是个什么场景

你第一次去朋友家做客,朋友说"帮我把饭后桌子收一下"。你从没进过这个厨房,但照样能干:

  • 厨房大概长啥样(你脑子里有"厨房常识");
  • "收桌子"该干哪几件事(把碗端去水池 / 擦桌面 / 把垃圾扔掉);
  • 一个没见过的怪形杯子,伸手怎么抓也大概有数。

人类觉得这事再普通不过,但对机器人是道大坎:以前的机器人策略基本只在"训练时去过的那间厨房"里好用,搬去新房子立刻抓瞎——找不到柜子、不知道脏盘子在哪、连杯子都拿不稳。这就是缺乏开放世界泛化(open-world generalization):能力被锁死在训练分布里,一出分布就崩。

π0.5 干的就是这件事:让机器人也能像人一样"换个新家也能开干"。论文里,研究员真的把机器人搬进训练时从未出现过的真实家庭(三个厨房、三个卧室),让它做"把东西放进抽屉""把脏衣服放进洗衣篮""把碗放进水池""铺床"这类2~5 分钟的长程多步任务——这比传统 benchmark(LIBERO、SimplerEnv、单一实验室桌面)严苛得多。

所以这一节是想说:π0.5 面对的是"在陌生真实家庭做长程家务"这个开放世界难题,衡量标准是"没见过的房子里能不能干完活"。


pi_0.5 — 场景示意:这论文要解决的现实问题
Plate Nº Ipi_0.5 — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • RT-1 / RT-2(Google):把"看到啥 + 听到啥 → 输出动作"训成大 Transformer,但数据仍限定场景,跨房间泛化弱
  • OpenVLA:开源 7B VLA,离散 action token,在 Open-X-Embodiment 上做指令微调,受控场景泛化不错,但没把"语义子任务分解"这层显式建模。见 openvla.md
  • π0(本作前身):用 flow matching 动作专家预测连续动作块,跨多种机器人形态联训,已是 frontier,但主要在演示分布内表现好,开放世界泛化仍有限。见 pi0.md
  • SayCan / Inner Monologue:靠 LLM 做高层规划,但底层执行器和高层规划是两段拼接,不是端到端。见 saycan.mdinner-monologue.md
  • 传统行为克隆(Behavior Cloning):单任务、单环境、堆遥操数据,换个家就崩

开放世界泛化(open-world generalization):在训练分布外的场景(新房子、新物体、新指令组合)也能干活,区别于"测试集和训练集同分布"的封闭评测。

异构联训(co-training):把不同模态、不同任务、不同标签结构的数据混在同一个训练批里一起训。

共同空白:**没人把"网页级世界常识 + 多机器人动作 + 任务分解"端到端地压进一个模型,做到陌生家庭里的长程泛化。**π0.5 来填这个空。

所以这一节是想说:前人要么泛化弱、要么高低层拼接、要么没显式建模任务分解,π0.5 把这几件事端到端缝进一个模型。


这篇论文的新想法

核心赌注:一个模型 + 杂七杂八的数据一起练 + 把"想"和"做"塞进同一个网络 = 换房子也能干活。

三个关键想法:

  1. 异构联训吃进"世界常识":把网页图文/VQA、多机器人遥操轨迹、高层子任务标注、人类口头指令等全混在一起训。网页数据让模型继承 VLM 的"世界知识"(杯子长啥样、脏衣服一般在洗衣篮),多机器人数据让它学到抽象的"怎么操作物体"而非"我家灶台前的肌肉记忆"。论文提到第一训练阶段 97.6% 的样本并非来自移动机器人——真正的家务动作只占很小一部分,其余全是"补常识"。
  2. 分层推理端到端化:把 SayCan 式"上面一个 LLM 派活、下面一个策略干活"的两段拼接,整个塞进同一个网络——模型先在文本侧念出下一个子任务("先拿起盘子"),再以这句子任务为条件让动作专家输出动作。
  3. 离散 + 连续动作混合训练:预训练时用**离散 token(FAST 压缩编码)**表示动作,训练快、可扩展;后训练时加一个 flow matching 动作专家输出连续动作,推理快、精度高。取两者之长。

所以这一节是想说:π0.5 的新想法是"异构联训补常识 + 分层推理把想和做合一 + 离散/连续动作混合",共同支撑开放世界泛化。


它分几步做的(方法)

方法可拆成:架构、离散/连续混合、两阶段训练与数据配方、分层推理。这是全文精华。

1. 架构:一个能同时输出"文字"和"动作"的 Transformer

类比:一个"嘴巴 + 手"组合——嘴巴是预训练 VLM(看图听话、还能说出下一步要干啥),手是动作专家(把"看到的 + 想到的"翻译成连续关节动作)。

输入:观察 o_t = [多路相机图像, 本体状态 q_t](关节角、夹爪位姿、躯干升降、底座速度)+ 总任务指令 ℓ(如"把碗收进水池")。

处理:一个 Transformer 同时能产出两种输出——文本 token(回答问题 / 输出高层子任务)和动作块(连续关节动作)。模型建模的分布可写成:

π(动作, 子任务 ˆℓ | 观察 o, 总指令 ℓ) = π(子任务 ˆℓ | o, ℓ) × π(动作 | o, ˆℓ)

注意一个关键设计:动作只依赖子任务 ˆℓ,不直接依赖总指令 ℓ。也就是"高层推理"负责 π(ˆℓ | o, ℓ)(从总指令想出下一个子任务),"低层推理"负责 π(动作 | o, ˆℓ)(照着子任务动手),两者由同一个模型表示。图像块、文本、连续动作 token 用双向注意力(bidirectional attention),本体状态被离散化后当文本 token 输入。动作 token 用**独立的专家权重(action expert)**处理,类似 mixture-of-experts。

输出:一个既能"说出下一步该干啥"、又能"做出对应动作"的统一策略。

动作专家(action expert):与主干 VLM 共享注意力、但用独立权重的机器人专用子网络,专门做(flow matching)动作生成,可比主干小很多。

所以这一节是想说:π0.5 用一个 Transformer 同时承载"想"(出子任务文本)和"做"(出动作),且动作只条件于子任务,实现分层却不拆成两个模型。


2. 离散 + 连续动作混合训练(Hybrid Action Representation)

类比:先用"打字"的方式快速学会大意(离散、训练快),再用"手写连笔"的方式练出流畅(连续、推理快)。

输入:示范动作块 a_{t:t+H}。

处理

  • 离散侧:用 FAST tokenizer(一种对动作块高效压缩的编码)把动作变成离散 token,模型像标准 VLM 一样做下一 token 预测。好处:训练快、可扩展、稳定。坏处:推理要昂贵的自回归解码,不适合实时。
  • 连续侧:用 flow matching——给真动作插值噪声 a^τ = τ·a + (1−τ)·ω,训练动作专家预测流向量场 ω − a。好处:推理只需 10 步积分,快且精度高。

模型被训练成同时能用离散 token(自回归)和连续 flow 两种方式产动作,并用注意力矩阵确保两种动作表示互不attend(不互相干扰)。训练损失是"文本/离散动作的交叉熵 + α × flow matching 回归误差"。当 α=0 时就退化成标准 VLM 预训练(动作当文本 token);后训练阶段再加上动作专家权重和 flow 损失。

输出:一个"预训练像 VLM 一样快、推理像 π0 一样连续实时"的动作生成机制。

FAST:一种把连续动作块压缩成少量离散 token 的编码方案,让 VLA 能用 next-token 预测高效训练动作。

flow matching(流匹配):学"从噪声到目标的速度方向"的生成方法,比扩散推理步数少。π0 系用它做连续动作。

所以这一节是想说:混合表示让 π0.5 兼得"离散训练快"和"连续推理实时"——预训练走离散 FAST token,部署走 10 步 flow matching。


3. 两阶段训练与数据配方(Pre-train + Post-train, Co-training)

类比:一个学生先上通识大课(预训练,什么都学一点、主要补常识),再上专业实训课(后训练,专攻移动操作 + 学会高效实时推理)。

输入(多种数据源混合)

  • MM(移动机器人数据):约 400 小时,来自约 100 个真实家庭,是最贴近评测任务的一档;
  • ME(多环境非移动机器人数据):固定在台面/平台上的单臂或双臂,家居环境采集;
  • CE(跨形态实验室数据):多种机器人在实验室采的相关任务;
  • HL(高层数据):输入观察,预测应执行的高层语义子任务;
  • WD(网页数据):图说、VQA、物体定位等多模态例子,补世界常识;
  • VI(人类口头指令):人类监督者给机器人的语言指令。

处理

  • 预训练阶段所有任务(含带动作的任务)都用离散 token 表示(动作走 FAST),当成标准自回归 Transformer 做 next-token 预测。简单、可扩展、高效。此阶段第一训练阶段中 97.6% 样本不是移动机器人做家务——绝大多数是补常识/补泛化的异构数据。
  • 后训练阶段:加上 flow matching 动作专家,让动作有更细粒度、推理更省,专攻移动操作并装上高效实时推理机制。

输出:一个既有广博世界常识、又能在真实家庭高效实时控制的策略。控制系统很简单——模型直接以 50 Hz 输出双臂、夹爪、躯干升降的目标位姿和底座速度(配合动作分块),由简单 PD 控制器跟踪,无额外轨迹规划或碰撞检测,全端到端。

两阶段 + 多数据源(ASCII)

  预训练(全离散 token, next-token)        后训练(加 flow 动作专家)
  ┌───────────────────────────┐         ┌──────────────────────┐
  │ WD 网页图文/VQA (补常识)     │         │ MM 移动机器人家务       │
  │ CE 跨形态实验室             │  ─────► │ + flow matching 动作专家 │
  │ ME 多环境非移动             │         │ 细粒度动作 + 实时推理     │
  │ HL 高层子任务 / VI 口头指令  │         └──────────┬───────────┘
  │ MM(仅少量, 首阶段占2.4%)    │                    ▼
  └───────────────────────────┘        50Hz 端到端控制真实家庭

所以这一节是想说:π0.5 的护城河一半在异构数据配方(97.6% 补常识 + 少量家务),一半在"预训练全离散、后训练加 flow"的两阶段 recipe。


4. 分层推理:先念子任务,再做动作(Hierarchical Inference)

类比:厨师做菜先念菜谱("先切葱"),再动手切;切完再念下一步。

输入:观察 o_t + 总任务指令 ℓ(如"把碗收进水池")。

处理:推理分两步走,都由同一个模型完成:

  1. 高层推理:用标准自回归解码,先产出一个高层子任务文本 ˆℓ(如"拿起盘子"),即 π(ˆℓ | o, ℓ);
  2. 低层推理:以这个子任务 ˆℓ 为条件,用 10 步 flow matching 去噪产出连续动作块 a_{t:t+H},即 π(动作 | o, ˆℓ)。

这一段动作干完,再回头念下一个子任务,如此滚动。因为动作只条件于子任务 ˆℓ 而非总指令 ℓ,模型把"理解长任务→拆成子任务"和"执行子任务→出动作"清晰解耦,但共享同一套权重。

输出:一连串"念一句子任务 → 做一段动作"的循环,直到长程任务完成。

所以这一节是想说:分层推理把 SayCan 式"规划+执行"合进一个模型——先自回归念子任务、再 flow 出动作,端到端地做完长程家务。


pi_0.5 — 方法示意:核心 pipeline
Plate Nº IIpi_0.5 — 方法示意:核心 pipeline

关键数字(What works)

以下数字来自论文正文与摘要,均为真实报告;未明确的标"原文未报告"。

数据与训练

项目 数值
移动机器人数据(MM) 400 小时
覆盖真实家庭数 100 个
首个训练阶段中"非移动机器人"样本占比 97.6%
动作预训练表示 离散 FAST token(自回归)
动作后训练/推理表示 flow matching,10 步去噪
控制频率 50 Hz(动作分块 + PD 跟踪)
泛化扩展实验位置数 最多 104 个训练环境(另有 40k 步控制变量)

评测设置与结论

项目 内容
主评测 3 个真实厨房 + 3 个真实卧室(训练未见
可控评测 mock(模拟)家庭,10 次试验取平均
任务 items in drawer / laundry basket / dishes in sink / make bed 等,2~5 分钟长程
泛化 vs 位置数 随训练环境增多,语言跟随率和成功率稳步提升
泛化上限对照 104 环境模型 ≈ "直接在测试家训练"的对照,说明联训配方逼近了同环境训练的水平

消融/对比(定性,见论文 Fig. 12–13)

对比对象 结论
π0(仅机器人动作数据) π0.5 显著超过
π0-FAST+Flow(混合训练但无 HL/WD) π0.5 超过
用 GPT-4 当高层策略 不如训练过的 π0.5 高层
人类专家当高层"oracle" π0.5 完整版甚至超过该上限
implicit HL(训练含高层数据但推理不显式分层) 第二好,说明高层数据本身有价值

所以这一节是想说:可确认硬数字是"400 小时/100 家庭数据、首阶段 97.6% 非移动、50Hz、10 步 flow、最多 104 环境",且完整 π0.5 在陌生真实家庭超过 π0、GPT-4 高层甚至人类 oracle 高层。


实验结果说明了什么

**结论 1:开放世界泛化主要来自数据的"广度"而非"贴近度"。**首阶段 97.6% 的训练样本不是移动机器人做家务,却正是这些网页/跨形态/多环境数据撑起了"陌生家里也能干"的泛化。这印证"补世界常识 + 多样动作"比"多采一点目标场景数据"更能泛化。

**结论 2:环境多样性可以替代"在目标环境训练"。**训练环境数增到 104 时,性能逼近"直接在测试家里训练"的对照。说明只要见过足够多样的家庭,就能泛化到全新家庭,不必为每个新家单独采数据。

**结论 3:分层推理端到端化优于外接大模型。**训练过的 π0.5 高层策略超过用 GPT-4 当高层——因为 GPT-4 没在机器人数据上对齐,不了解机器人能做什么、当前场景细节。把"想"和"做"用同一套权重训练,比拼接一个通用大模型更好。

**结论 4:完整版甚至超过人类 oracle 高层。**这个反直觉结果说明,π0.5 的低层执行 + 自己训练的高层配合得比"人给完美子任务 + π0.5 执行"还好——可能因为它的高层子任务与自身低层能力更匹配(人给的指令未必是模型最擅长执行的粒度)。

**结论 5:离散/连续混合两全其美。**离散 FAST token 让预训练快且稳,flow matching 让推理连续实时(10 步)。这解决了"离散训练快但推理慢、连续推理快但训练慢"的两难。

所以这一节是想说:核心 takeaway 是"广度数据驱动开放世界泛化 + 环境多样性替代目标场景数据 + 端到端分层胜过外接 LLM + 混合动作表示两全"。


你应该懂的几个新词

VLA(Vision-Language-Action):看+听→动的统一模型。π0.5 是 flow-based、带分层推理的 VLA。

开放世界泛化(open-world generalization):在训练分布外(新房子、新物体、新指令)也能干活。

异构联训(co-training):不同模态/任务/标签结构的数据混在一个 batch 里训。难点是任务间互相干扰,配比是脏活。

flow matching(流匹配):学"从噪声到目标的速度场"的生成方法,推理步少(π0.5 用 10 步)。

FAST tokenizer:把连续动作块压成少量离散 token 的高效编码,让动作能用 next-token 预测训练。

动作专家(action expert):与主干共享注意力、独立权重的机器人子网络,专做动作生成。

分层推理(hierarchical inference):先出高层语义子任务、再出低层动作,两者同一模型。

本体状态 / 本体感受(proprioception):机器人自身关节角、夹爪位姿等内部状态。

embodiment(本体):机器人本体。不同 embodiment = 不同关节/夹爪/自由度。

所以这一节是想说:抓住"开放世界泛化""异构联训""分层推理""离散/连续混合"这四点,就抓住了 π0.5 的全部要害。


它有什么搞不定的

  1. 数据 recipe 难完整复现:400 小时移动数据 + 100 家庭 + 大量私有异构数据,多为 Physical Intelligence 自采,社区难复刻。
  2. 并非所有任务都可靠:长程家务成功率不到满分,长尾任务、极端物体仍会失败;需要多少数据才能保证某任务缺乏预测理论。
  3. 算力与工程门槛高:VLM + 动作专家 + 混合训练 + 多相机 + 50Hz 实时,训练 infra 和部署工程都不轻。
  4. 闭源商业团队主导:权重/API 开放程度随时间变化,以官方发布为准。
  5. 分层推理仍可能出错:高层念错子任务会带偏低层执行;虽超过 GPT-4,但高层错误依然是失败来源之一。
  6. 安全与鲁棒性:直接输出目标位姿 + 简单 PD 跟踪、无碰撞检测,在真实家庭里对安全边界的处理仍是开放问题。
  7. 模仿学习范式的固有限制:π0.5 是模仿/行为克隆式,失败恢复靠数据多样性而非在线探索,遇到训练中完全没有的错误模式可能不会自救。

所以这一节是想说:π0.5 是开放世界 VLA 的强原型而非即插即用的家庭 AGI,落地前要评估数据、算力、安全与长尾可靠性。


它和别的几篇是什么关系

家族树(ASCII)

   VLM(PaliGemma 等, 网页常识)   SayCan/Inner Monologue(高层规划)
            │                            │
            ▼                            │(把规划端到端化)
         π0(flow matching 动作专家)       │
            │  + 异构联训 + 分层推理 ◄────┘
            ▼
        π0.5(开放世界泛化)
      ┌──────┼──────────────┐
   竞品对照   数据地基         动作头谱系
   OpenVLA   OXE/DROID/     Diffusion Policy /
   /RT-2     Bridge V2      Consistency Policy
                            (flow/diffusion 家族)
  • π0:直系前作。π0 解决"多机器人 + flow matching 动作专家",π0.5 在其上加异构联训(网页/子任务/口头指令)+ 分层推理 + 离散/连续混合。见 pi0.md
  • RT-2 / OpenVLA:同代 VLA 竞品。RT-2 闭源、OpenVLA 开源;π 系是 Physical Intelligence 的旗舰,主打工业级真实家居。见 rt-2.mdopenvla.md
  • SayCan / Inner Monologue:高层规划路线代表。π0.5 把它们的"LLM 分解任务"端到端化,不再是两个模型拼接。见 saycan.mdinner-monologue.md
  • Open-X-Embodiment / DROID / Bridge V2:多机器人数据集地基,π 系训练数据来源之一。见 open-x-embodiment.mddroid.md
  • Diffusion Policy / Consistency Policy:动作头谱系。π 系用的 flow matching 是这条线的延伸。见 diffusion-policy.md

所以这一节是想说:π0.5 = π0 的架构 + 异构联训补常识 + SayCan 式分层的端到端化 + 离散/连续混合,是 VLA 走向开放世界的产业级标杆。


和本导读的关系

本篇对应 Ch13: 扩散策略

Ch13 讲连续动作生成(扩散/流)的谱系:Diffusion Policy(验证)→ 3D-DP(感知)→ π0(基础模型规模)→ π0.5(开放世界)。π0.5 是这条线的当前终点——它继承 π0 的 flow matching 动作专家,把连续动作生成放进一个"能补世界常识、能分层推理、能在陌生真实家庭工作"的框架里。读完 Ch13 的 Diffusion Policy 与 π0,再读 π0.5,就能看到"连续动作策略如何从单任务长成开放世界基础模型";也能对照 Ch12 的 OpenVLA,理解离散 VLA 与连续/分层 VLA 的差异。

所以这一节是想说:π0.5 是 Ch13 扩散/流策略线的当前终点,代表连续动作 VLA 走向开放世界泛化的方向。


思考题

Q1:π0.5 首个训练阶段 97.6% 的样本不是移动机器人做家务,反而是这些"不相关"数据撑起了开放世界泛化。为什么"补常识"比"多采目标场景数据"更有效?

提示

目标场景数据教的是"在这个家、这个桌面怎么做",泛化范围窄;网页/跨形态/多环境数据教的是可迁移的抽象——"杯子长什么样、脏衣服一般在哪、怎么抓一个圆形物体"。换新家时,具体家务动作可以从少量目标数据 + 大量常识重新组合出来,但常识本身无法从少量目标数据里学到。这类似 LLM:预训练海量通用文本("不相关")才是泛化的根,SFT 只是对齐格式。π0.5 把这个 recipe 搬到机器人。

Q2:π0.5 的动作只条件于子任务 ˆℓ,不直接依赖总指令 ℓ(π(动作|o,ˆℓ))。这个解耦有什么好处和风险?

提示

好处:低层执行只需专注"照着这个明确子任务动手",不用每次都重新理解冗长模糊的总指令,动作策略更简单、更可复用(同一个"拿起盘子"子任务在不同总任务里都能用)。风险:如果高层念出的子任务 ˆℓ 错了或粒度不对,低层完全照做也会错——低层无法从总指令 ℓ 纠正高层的错误。这把系统的正确性押在高层推理质量上,所以论文才重点验证"训练过的高层 > GPT-4 高层"。

Q3:为什么预训练用离散 FAST token、推理用连续 flow matching?直接全程用 flow 或全程用离散不行吗?

提示

全程离散:训练快且稳(next-token 预测成熟高效),但推理要昂贵的自回归解码,不适合 50Hz 实时。全程 flow:推理快(10 步)、动作连续精细,但作者指出离散 token 训练更快更可扩展,纯 flow 预训练效率低。混合取两者之长——用离散把海量异构数据快速稳训进模型,再用 flow 动作专家在后训练阶段获得实时连续控制。这是"训练效率 vs 推理效率"两个目标在不同阶段用不同表示各自最优化。

Q4:π0.5 完整版竟然超过了"人类专家当高层 oracle"。这个反直觉结果可能怎么解释?

提示

人类给的子任务未必是模型最擅长执行的粒度/措辞——人可能说"整理一下这堆",而模型自己训练出的高层会念出它低层最擅长的具体子任务(如"拿起蓝碗放进水池")。因为高层和低层是同一套权重共训的,高层"知道"低层能做什么、以什么措辞最好执行,这种自洽让高低层配合优于"外部人给指令 + 模型执行"。这也再次说明端到端共训 > 外接一个更聪明但不了解本体的规划者。

Q5:π0.5 直接输出目标位姿 + 简单 PD 跟踪、无碰撞检测。在真实家庭部署,这种极简控制栈有什么隐患?为什么作者仍这么做?

提示

隐患:没有碰撞检测/轨迹规划,模型若输出危险动作(撞到人、打翻物体),没有安全兜底;对突发扰动的反应也全靠模型本身。作者这么做是为了证明"端到端学习足够强,不需要传统规划模块"——把复杂度从工程管线转移到学习到的策略里,简化系统、让能力随数据 scaling。代价是安全性和可解释性下降。落地产品通常还需加安全层,但研究上这样能最纯粹地检验"端到端 VLA 能走多远"。

Q6:π0.5 靠 104 个训练环境就逼近"在测试家里训练"的水平。如果继续加到 1000 个环境,你预期会怎样?这对"要不要为新家采数据"意味着什么?

提示

预期边际收益递减但仍上升——更多环境覆盖更多家居布局/物体/光照,泛化更稳,但增速会放缓(常见的 log-scaling)。意味着与其为每个新家单独采数据,不如投资"采集足够多样的环境"一次性获得广泛泛化能力。这把机器人部署从"每个客户现场采数据微调"转向"预训练一个够泛化的基础模型直接部署",正是基础模型范式的商业价值所在。但长尾(罕见布局/物体)可能始终需要少量补充数据。


一些好奇心问答(FAQ)

Q:π0.5 怎么读?

读"pi zero five"(π-零-五)。π 表示策略(policy),是 π0 的下一代但非大版本跃迁,故用 0.5。

Q:和 π0 最大的区别是什么?

π0 主要在演示分布内做连续动作;π0.5 加了异构联训(网页/子任务/口头指令)、分层推理、离散/连续混合,目标是陌生真实家庭的开放世界长程任务

Q:它在陌生家里真能干活吗?

论文在 3 个真实厨房 + 3 个真实卧室(训练未见)里评测了"东西放进抽屉/脏衣入篮/碗进水池/铺床"等 2~5 分钟长程任务,报告能持续成功,泛化远超以往 VLA。

Q:50Hz 是每秒跑 50 次大模型吗?

不是。50Hz 是控制环频率,配合动作分块——模型一次出一段动作、由 PD 控制器以 50Hz 跟踪,不是每 20ms 跑一次完整模型。

Q:开源吗?

论文与 blog 公开(pi.website/blog/pi05);权重与数据以 Physical Intelligence 官方发布为准。

所以这一节是想说:对多数人,π0.5 的价值是理解"异构数据 + 分层推理 + 混合动作"如何带来开放世界泛化,而非复现其训练。


如果你想再深入

  1. 前作(必读):π0 (Physical Intelligence, 2024) — 先懂 flow matching 动作专家 + 多形态联训,再看 π0.5 加了什么。见 pi0.md
  2. 离散动作编码:π0-FAST / FAST tokenizer — 理解预训练为何用离散 token。见 pi0-fast.md
  3. 分层规划源头:SayCan / Inner Monologue — π0.5 把它们的两段拼接端到端化。见 saycan.mdinner-monologue.md
  4. 对照:OpenVLA (Kim et al. 2024) — 离散 VLA,对比连续 + 分层。见 openvla.md
  5. 动作头谱系:Diffusion Policy — flow matching 的近亲,理解连续动作生成的起源。见 diffusion-policy.md
  6. 官方资源:pi.website/blog/pi05(真实家庭长视频必看)。重点看真实家居主表 + 消融(消融掉子任务/网页数据后掉多少)。

读顺序建议:

Diffusion Policy → π0 → π0.5(你在这)
                         ├─► SayCan / Inner Monologue(分层源头)
                         └─► OpenVLA(离散 VLA 对照)

所以这一节是想说:把 π0.5 放在"π0 → 开放世界"的脉络里读,对照 SayCan 看分层的端到端化,对照 OpenVLA 看离散与连续/分层的差异。


原文信息

@article{pi052025,
  title   = {$\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization},
  author  = {{Physical Intelligence} and Black, Kevin and Brown, Noah and Driess, Danny and Finn, Chelsea and Hausman, Karol and Ichter, Brian and Levine, Sergey and Pertsch, Karl and others},
  journal = {arXiv preprint arXiv:2504.16054},
  year    = {2025},
  url     = {https://arxiv.org/abs/2504.16054}
}
  • arXiv:2504.16054
  • Blog:https://pi.website/blog/pi05
  • 机构:Physical Intelligence, San Francisco
  • 一句话定位:π0 + 异构联训 + 分层推理 + 离散/连续混合动作,让机器人在陌生真实家庭做长程家务,实现开放世界泛化。

引用本笔记 / Cite this note
BibTeX
@online{eai_pi05_2026,
  title       = {(readable note) pi_0.5: VLA with Open-World Generalization},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/pi05/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?