PaLM-E: An Embodied Multimodal Language Model
这是一份给"完全没接触过 AI 和机器人"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话。
一句话讲什么(TL;DR)
教 ChatGPT 长出眼睛和手脚:你说一句话 + 让它瞄一眼现场,它直接列出机器人该做的几步。
所以这一节是想说:这篇论文让一个本来只会聊天的超大 AI,长出眼睛 + 长出手脚,能给真机器人下达多步指令。
这是个什么场景
周末早上你赖在沙发上,咖啡杯一倾,洒了一桌。你懒得动,扭头对着家里的机器人喊:
"我把饮料洒了,能帮我擦一下吗?"
你心里其实不是想听它说"好的主人",而是希望它真的能:
- 抬眼瞥一下桌面,知道现在乱成啥样
- 反应过来"擦水要先找海绵"
- 找海绵 → 拿起来 → 走过来 → 擦干净 → 放回去
这就跟你叫一个刚来的实习生帮你订外卖一样——他得听懂你说的话、看得见菜单上有什么、还得自己拆出"打开 app → 选店 → 下单"几步。三件事缺一样都不行。
放到机器人身上,需要两种能力同时在线:
- 会看 + 会想:看懂厨房,知道海绵在哪、桌上还有什么。
- 会拆任务:把"擦水"拆成 5-6 个具体动作,一步一步走,中间出岔子还能纠错。
2023 年初市面上的方案就两条路,都不太顺:
- 路线 A:聊天 AI 出主意 + 另一个机器人模型动手。 像甲方和外包——甲方写英文需求,外包只看中文,中间得有个翻译来回传话。
- 路线 B:让机器人模型自己学会动手 + 看世界。 但这种模型脑容量小,长程规划基本不行。
PaLM-E 想做的事,就是把"超大聊天 AI 的脑子"+"能看图的眼睛"+"机器人的手脚"焊成一个端到端的整体——你说一句话 + 给它看一眼现场,它直接吐一串机器人能照做的步骤。
所以这一节是想说:PaLM-E 要造的是"一个大脑同时管说话、看图、做计划"的机器人控制器。

之前的人怎么做的,为什么不够好
方案 A:SayCan(2022)—— 聊天 AI 出主意,但看不见图 类比:把任务交给一个被关在小黑屋里的聪明顾问,他只能听描述。SayCan 用 LLM 列出可能的动作清单,再用一个外部"评分模型"挑选哪一步最靠谱。但 LLM 自己根本看不到现场,所以遇到"几何位置很重要"的任务(比如三块积木叠哪一块在前)就抓瞎。
方案 B:通用 VLM(PaLI、Flamingo 等)—— 会看图,但不懂机器人 类比:博物馆讲解员,看到图能滔滔不绝,但你叫他"先收餐桌再倒垃圾"他就没思路了。论文实验里 PaLI 对机器人任务零分。
方案 C:Gato(2022)—— 多模态万能 agent,但没有正向迁移 Gato 试过把多种任务塞一个模型,但**没观察到"做 A 任务能帮 B 任务变好"**这种现象。说明它只是"会很多事",不是"互相借力"。
方案 D:VIMA(2022)—— 多模态 prompt,但不会规划长程任务 VIMA 用图文混排的指令,但语言只是"任务说明书",不是规划工具。
核心难题:机器人数据特别少——拍一段真机器人擦桌子的视频,比拍一张猫狗图贵 1000 倍。所以单纯堆机器人数据训练不动大模型。
所以这一节是想说:以前要么"会看不会规划"、要么"会规划看不见",没人能把这两件事在一个端到端的大模型里搞定。
这篇论文的新想法
别再让聊天 AI 和机器人模型互相翻译了——直接把图片、机器人状态都翻译成"假装是单词"的向量,和真单词一起塞给一个超大 LLM,让它一句话里既能看图又能输出动作步骤。
听起来朴素,但工程上的关键是:LLM 的输入序列不再分"文字位"和"图位",每个位置都可以是文字、是图、是关节角度、是 3D 物体表征——位置完全自由。
所以这一节是想说:核心创新是"多模态句子"——把视觉、状态都伪装成单词向量,塞进 LLM 的输入序列任意位置。
它分几步做的(方法)
把它想成做一道家常菜——整本菜谱拆开就 4 步:先把食材备好(多模态句子)、挑顺手的刀(眼睛)、决定要不要重新换灶台(冻不冻 LLM)、最后用一大锅杂烩一起炖(共训)。下面一步步来。
下图是"多模态句子"如何把不同模态都伪装成词向量塞进同一条 LLM 序列:
文字 "I see" 图片 文字 "Human: 擦一下" 机器人状态
│ │ │ │
▼ ▼ ▼ ▼
┌───────┐ ┌────────┐ ┌───────┐ ┌────────┐
│词查表 │ │ ViT │ │词查表 │ │小 MLP │
│ γ(w) │ │(图→256 │ │ γ(w) │ │(状态→ │
│ │ │ 向量) │ │ │ │ 向量) │
└───┬───┘ └───┬────┘ └───┬───┘ └───┬────┘
│ │ │ │
▼ ▼ ▼ ▼
[w][w] [img₁..img₂₅₆] [w][w][w][w] [state₁..stateₙ] ← 全是同维度向量
└─────────────────────┬──────────────────────────┘
每个位置随便插:文字/图/状态/3D物体, 位置完全自由
▼
┌────────────────────────┐
│ Decoder-only LLM (PaLM)│ self-attention + causal mask
│ 像续写小说一样生成 │
└───────────┬────────────┘
▼
"1. Find a sponge. 2. Pick up... " (子目标步骤)
上图说明:图经 ViT、状态经 MLP、3D 经 OSRT,全部压成与词向量同维度的向量,插进 LLM 序列的任意位置——序列不再分"文字位/图位",因果顺序完全由位置决定。
1. 多模态句子:把图、状态都翻译成"假装是单词"的向量
类比
想象你在微信群发消息。你打字打到一半,想插一张照片——传统做法是先打完字、再单独发一张图,两条消息分开。
PaLM-E 的做法更猛:
把照片压缩成几个特殊符号(比如
<img1>、<img2>),直接塞在文字中间——就像 emoji 那样。读消息的人扫过去,眼睛一边读字一边"看到"那张图,根本分不出哪是字哪是图。
LLM 内部其实就是一连串向量。每个单词被查表查成一个固定维度的向量(比如 PaLM 用的是 18432 维)。PaLM-E 做的事就是:
- 图片:通过 ViT(一个图片识别模型)压成一串相同维度的向量。
- 机器人状态(关节角度、物体位置等):通过一个小 MLP 也压成相同维度的向量。
- 3D 场景:通过 OSRT(一个 3D 物体表征模型)压成一组向量,每个向量代表一个物体。
向量:一串数字,比如 (0.3, -0.5, 0.8, ...)。AI 内部到处用向量表示词、图、状态。维度越高表达能力越强。
MLP(多层感知机):一种简单的神经网络,几张数字表格串起来,输入一组数字、输出一组数字。这里负责把状态向量"翻译"成 LLM 认识的格式。
多模态句子(Multi-modal sentence):在传统纯文字句子的任意位置插入图片/状态的向量。比如
Q: 抓蓝色方块前要先做什么? <状态向量> <图> A:这样的输入。
它在干什么
- 用户说:"Human: 把饮料洒了,帮我擦一下"。
- 机器人摄像头拍一张图。
- PaLM-E 把这条消息编码成
Human: 把饮料洒了... I see <img>. Robot:。 <img>这个位置不再是文字,而是 ViT 输出的一组向量。- LLM 看着这一长串混合向量,像续写小说一样吐出
1. Find a sponge. 2. Pick up the sponge. 3. ...。
关键公式翻译成人话
原文写:x_i = γ(w_i) if w_i 是文字 else φ_j(O_j)_i if 是观测
人话:"第 i 个位置的向量,要么是从单词查表得来,要么是从图/状态编码器算出来。"——一句话:每个位置随便插。
为什么这步有用
- 位置自由:不像 Flamingo 那种"图必须在固定位置",PaLM-E 能在一句话里插好几张图、好几个状态。
- 复用 LLM 已有的位置编码:LLM 本来就会处理"第 1 个词、第 2 个词..."的相对位置,多模态向量直接搭便车,不需要重新学。
- 天然支持多图 / 多状态 / 多机器人:训练时只要混进去就行。
和 Flamingo 的差异——为什么"位置自由"是关键突破
Flamingo(2022)的做法是:图像特征通过 cross-attention 层注入文本序列,图像处于"固定旁路"——它不能出现在文本中间的任意位置。这意味着 Flamingo 在单一位置"看完"整张图,再继续处理文字。
PaLM-E 完全不同:图/状态向量直接替换序列中占位符的位置,与文字 token 完全平等地走同一条 self-attention 路径。这带来一个看似微小但后果深远的好处——LLM 的 causal mask 让模型"读到 <img> 时已经看过前面的文字,读到 <img> 后面的文字时已经融合了图片信息",因果顺序完全由位置决定。
结果:
- 你可以写
I see <img1>. Then I walk to the left and see <img2>.——两张图各自只在它出现的位置注入上下文。 - Flamingo 做不到这种"时间顺序"的多图推理,因为所有图都在同一个旁路被处理。
多模态句子的信息流细节
一个完整的输入示例(真机厨房任务):
Robot: I am in a kitchen. I see <img>. Human: Bring me the rice chips
from the drawer. Robot: 1. Go to the drawers. 2. Open top drawer.
I see <img>. 3. Pick the green rice chip bag...
注意两个 <img> 分别对应不同时刻拍的照片。第一张是进厨房时的全景,第二张是打开抽屉后看到的特写。PaLM-E 能自然地处理这种"边走边看"的多步视觉流,因为每张图只在序列对应位置参与注意力计算。
Token 数量与计算开销
ViT-4B 把一张 224×224 的图编码成 256 个向量(16×16 patch)。也就是说,每插一张图,就相当于在序列里多了 256 个"单词"。如果一个任务需要看 3 张图,光图就占 768 个位置——这就是为什么 PaLM-E 只有 Google 那种 TPU 集群才跑得动。
所以这一节是想说:把图和状态伪装成"假装是单词的向量",让 LLM 的输入序列变成可以自由穿插多种模态的"鸡尾酒"。
2. 三种"眼睛":从扁平 ViT 到 3D 物体感知
类比
不同任务对"看世界的方式"要求不同:
- 拍鸟需要长焦镜头。
- 拍全家福用广角。
- 拍微距用微距镜头。
PaLM-E 也准备了好几种"镜头",不同机器人任务挑不同的来用。
它在干什么
论文比较了三类编码器:
状态向量(State):最简单。直接把机器人测得的关节角、物体姿态当输入。一个小 MLP 就能搞定。仅在仿真里好用——真机器人哪有完美状态信息。
ViT(Vision Transformer):标准做法。把图切成 16×16 个小方块,每块输出一个向量。论文用了两个版本:4B 参数的 ViT-4B(来自 PaLI)和 22B 参数的 ViT-22B(当时最大)。
OSRT(Object Scene Representation Transformer):3D 物体感知。这是 PaLM-E 引以为傲的创新——它从多视角图片里自己学会把场景拆成"一个一个物体",每个物体用几个向量表示,自带 3D 几何感。不需要外部物体框标注。
ViT:一种把图当"视觉文字"处理的模型。把 224×224 的图切成 14×14=196 个 patch,每个 patch 当成一个"视觉单词"。
OSRT:从多视角图自学物体分割的模型。给它几张同一场景不同角度的照片,它能把场景分成 N 个"物体槽(slot)",每个槽自动对应一个物体。
Object slot(物体槽):OSRT 的核心概念。可以理解为一个"装一个物体的容器",里面存着这个物体的颜色、形状、3D 位置等综合信息。
Entity referrals(实体引用):当场景里有多个相同颜色的物体时,光说"红色那个"指代不清,PaLM-E 会在 prompt 里写
Object 1 is <obj1>. Object 2 is <obj2>. ...,让 LLM 学会用<obj1>这种特殊标记唯一指代某个物体。
OSRT 的工作机制详解
OSRT 的流程分三步:
第一步,多视角输入:给模型同一场景的 N 张不同角度照片(论文中通常是 5 张)。这些照片必须是已知相机位姿的——也就是知道"每张照片是从哪个角度拍的"。
第二步,Slot Attention 分割:OSRT 用一种叫 Slot Attention 的机制,把场景自动分成 K 个"物体槽"。每个槽竞争性地"吸附"属于自己那个物体的视觉特征。这个过程不需要人工标注哪个像素属于哪个物体——模型自己学。
第三步,渲染验证:模型用分出来的物体槽尝试从新视角"渲染"场景。如果渲染得像真的,说明分得对。这是一种自监督方式——不需要标签,能不能重建就是标准。
最终每个物体槽输出一个固定长度的向量,被送入 LLM 作为那个物体的"名字"。
OSRT vs ViT 的本质差异
| 维度 | ViT | OSRT |
|---|---|---|
| 输入 | 单张图 | 多视角图(5张) |
| 输出单位 | patch(图像小方块) | object slot(物体) |
| 语义粒度 | 像素级 | 物体级 |
| 3D 感知 | 无(纯 2D) | 有(自带深度和位姿) |
| 数据要求 | 任意单张图 | 需要已知位姿的多视角合成数据 |
| 适用场景 | 通用(真机、网络图) | 仿真为主(真机数据难采) |
为什么 OSRT 对规划特别重要?
因为多步规划的核心是"操作物体"——"先抓 A,放到 B 上面,再拿 C"。如果模型只有像素,它必须从像素中"猜"出哪些像素组成了 A、哪些是 B。OSRT 直接把场景分成物体,每个物体有唯一 ID——这就像给 LLM 递了一份清单,上面写着"1 号物体:红方块,坐标 (0.3, 0.5, 0.1);2 号物体:蓝圆柱..."。LLM 只需要说"先动 1 号再动 2 号"就行。
为什么这步有用
- 实验数据(Tab. 1):在 TAMP 任务(积木堆叠规划)里,用 1% 训练数据,OSRT 拿到 82.5% 的成功率,普通 ViT-4B 只有 30.6%。3D 物体感知比扁平像素强 2.5 倍。
- ViT 把图当一张"马赛克",没有"物体"概念——这对涉及"先抓 A 再放到 B 上"的多步规划是硬伤。OSRT 直接把物体当成 LLM 的"名词"。
- 但 OSRT 训练数据要求高(要多视角合成数据),所以真实机器人任务更多还是 ViT-4B + 全量数据混训。
所以这一节是想说:不同任务用不同的眼睛——OSRT 在精细规划上吊打 ViT,但 ViT 加海量数据更通用。
3. 冻还是不冻 LLM:两条路都能走通
类比
教一个清华博士做菜,有两种做法:
- 冻结派:博士的脑子不动,只让他读菜谱。你想办法把菜谱写得他一看就懂——博士保留所有原本的学识,但要做菜的话你得反复修菜谱。
- 解冻派:让博士边做菜边调整自己的脑子。结果他做菜越来越好,但可能慢慢忘了量子物理。
冻结(freeze):训练时不更新这部分参数。LLM 保持原样。
解冻 / 微调(finetune):训练时更新这部分参数。LLM 跟着学,但有遗忘风险。
灾难性遗忘(catastrophic forgetting):模型学新东西时把旧能力忘了。比如学完做菜,连原本会的英语单词都忘了一半。
软提示(soft prompt):把"提示词"做成可学习的向量,而不是固定文字。冻 LLM 时,编码器输出的向量其实就是"动态生成的软提示"。
它在干什么
PaLM-E 把这两条路都试了:
路线 1:冻 LLM,只训练编码器(ViT、OSRT、MLP)
- 好处:LLM 完整保留语言能力,0% 遗忘。
- 坏处:编码器要"翻译得很好"才能让冻住的 LLM 听懂,机器人任务上有时拉胯。
路线 2:全模型解冻,全部一起训
- 好处:机器人任务表现最好。
- 坏处:会遗忘语言能力——但论文发现一个反直觉的现象:
模型越大,遗忘越少。
具体数字(Fig. 6):
- PaLM-E-12B 训完后,自然语言生成(NLG)能力下降 87.3%。几乎全废。
- PaLM-E-84B 下降 61.6%。
- PaLM-E-562B 下降仅 3.9%。基本没遗忘。
为什么大模型能抗遗忘?——容量假说
这个现象论文没有给出严格证明,但学界主流解释是"容量假说"(capacity hypothesis):
想象一个书架。如果书架只有一层(12B),你要放进去一本新书(机器人技能),就得把旧书扔掉腾位置。如果书架有一百层(562B),新书随便找个空位放就行,旧书纹丝不动。
更技术地说:大模型参数空间巨大,"机器人规划"和"自然语言生成"各自需要的参数子空间几乎不重叠——就像一幢大楼里两个租户各住不同楼层,互不干扰。小模型则像一间合租房,两个人争一张桌子。
这个发现的实践意义:如果你用小模型做具身 AI(比如 7B),必须冻结 LLM 或用 LoRA 这类轻量微调,否则语言能力会崩。用超大模型(100B+)可以放心全解冻。
为什么这步有用
- 给后续工作指了两条路:要嘛冻 LLM 当软提示用、要嘛把模型做大让它"装得下"机器人 + 语言两套技能。
- 562B 是当时最大的 VLM。这个尺度下"机器人技能"和"语言能力"可以共存——这是 PaLM-E 给整个领域的最大启示之一。
所以这一节是想说:冻 LLM 是稳妥路线(保语言)、解冻 + 大模型是激进路线(保机器人);模型够大时两者可兼得。
4. 一锅杂烩共训:让"做 VQA"帮"做机器人"变好
类比
教小孩学钢琴,光练钢琴谱很死板。如果同时学乐理 + 视唱 + 听音 + 节奏游戏,每样虽然没单练那么深,但互相借力整体反而更强。这叫"正向迁移"。
正向迁移(positive transfer):训 A 任务能让 B 任务也变好。反义词:负向迁移(学 A 反而搞坏 B)。
co-training / 联合训练:把多种任务的数据混在一起一起训练。
full mixture(全量混合):PaLM-E 用的训练配方——大量通用 VLM 数据 + 一点点机器人数据混在一起。
它在干什么
PaLM-E 的训练数据配比(Tab. 6):
- 通用 VLM 数据:91% 左右
- WebLI(Google 的图文对数据集)52.4%
- VQ²A、VQG、CC3M、COCO 等总共 ~38%
- 机器人数据:8.9%
- Mobile Manipulator 真机 3.1%
- Language-Table 仿真 + 真机 4.2%
- TAMP 仿真 1.6%
关键观察:机器人数据量这么小,按理说应该被淹没在 VLM 数据里。但实验显示——正是因为 VLM 数据多,机器人任务才学得好。
实验对照(Tab. 1,1% TAMP 数据):
- 只用 TAMP 数据训:ViT-4B 单机器人成功率 30.6%
- 用全量混合训:ViT-4B 成功率 74.1%——翻了 1.5 倍
类似的趋势在 Language-Table(Tab. 2)和移动操作(Tab. 4)都成立。
正向迁移的机制——为什么看图回答问题能帮规划?
VLM 数据里有海量的视觉问答,比如"图里有几个苹果?""红色的东西在绿色的左边还是右边?""这只鸟在什么上面?"。模型在回答这些问题时学到了:
- 物体识别:知道什么是杯子、海绵、方块。
- 空间关系:理解"左边""上面""里面"等概念。
- 属性绑定:把"红色"和特定物体关联起来。
- 计数:知道"有三个方块"意味着什么。
这些恰好是机器人规划的基础能力!当模型做机器人任务时,它不需要从零学"什么是方块"——VLM 数据已经教过了。它只需要学"在机器人语境下,看到方块后该输出什么动作"。
这就解释了为什么 Gato(2022)没有观察到正向迁移——Gato 混合的任务之间共享的"基础能力"太少(比如 Atari 游戏和对话几乎没有共同的视觉基础)。PaLM-E 选择的 VLM 任务和机器人任务之间有天然的"视觉-空间理解"交集。
数据配比的艺术
论文的消融实验揭示了一个微妙的平衡:
- 机器人数据占比太低(< 5%)→ 机器人任务学不动
- 机器人数据占比太高(> 20%)→ VLM 能力下降,且正向迁移效果减弱
- 最优配比:~9% 机器人数据 + ~91% VLM 数据
这个比例不是随便调的——它背后的逻辑是:让 VLM 数据建立"共享语义地基",机器人数据只负责"最后一公里的对接"。就像学英语,你 90% 的时间读文章建立语感,10% 的时间做翻译练习——翻译练习不用多,语感到位了自然就会了。
为什么这步有用
- 机器人数据稀缺,没法靠堆数据解决。
- 通用 VLM 数据里有大量"理解物体+位置+关系"的隐性知识,刚好是机器人规划需要的基本功。
- 这个"杂烩共训"思路被 RT-2 等后续工作继承——少量机器人数据 + 大量网络数据变成了标准配方。
所以这一节是想说:与其只用稀缺的机器人数据死磕,不如用海量 VLM 数据当背景,机器人任务自然受益。
5. 输出层与闭环执行:从文字到机器人动作
类比
PaLM-E 像一个口述菜谱的大厨——它说"第一步切洋葱",然后你(底层策略)去切。切完了你回来说"切完了"或者"刀不够锋利没切好",大厨再决定下一步。
输出格式
PaLM-E 的输出是纯文本——一串自然语言的子目标(sub-goal)。例如:
1. Find a sponge.
2. Pick up the sponge.
3. Navigate to the table.
4. Wipe the table.
5. Place the sponge back.
每个子目标被传给底层策略(如 RT-1),底层策略负责把"Pick up the sponge"翻译成具体的关节角度序列。
闭环 vs 开环
- 开环(open-loop):一次性输出全部步骤,不管中间发生什么。像写好剧本然后照演。
- 闭环(closed-loop):执行一步后重新观察,再决定下一步。像即兴表演,根据现场反应调整。
PaLM-E 支持闭环:每执行完一个子目标后,机器人重新拍照、把新图和历史对话一起送回 PaLM-E,让它决定下一步。论文演示了一个精彩场景——实验员故意把机器人刚抓起的方块抢走,PaLM-E 看到新图后重新规划"再去抓一次"。
底层策略的对接
PaLM-E 不直接控制电机。它和底层策略的对接方式是:
- PaLM-E 输出一个 sub-goal 字符串
- 字符串被传给 RT-1(或其他底层策略)作为"语言条件"
- RT-1 根据当前图像 + 语言条件,输出具体的 7-DoF 动作(xyz 位移 + 旋转 + 夹爪开合)
- 动作执行完毕后,成功/失败信号返回
- 如果成功,PaLM-E 输出下一个 sub-goal;如果失败,重新规划
这种分层设计的好处是:PaLM-E 只需要学"说人话",不需要学"怎么精确移动机械臂 0.03 米"。高层规划和底层控制解耦。
Affordance 预测——判断"能不能做"
除了规划,PaLM-E 还能回答一类特殊问题:"当前状态下,这个动作做得了吗?"这叫 affordance prediction。
实现方式:把问题格式化为 Given <img>, is it possible to [action]? Answer: Yes/No。PaLM-E 根据当前图像判断可行性。
这比 SayCan 的做法更优雅——SayCan 需要一个额外的 affordance 模型(通常是一个小的分类器),PaLM-E 把 affordance 判断也统一进了同一个大模型。
Affordance 的训练方式
PaLM-E 的 affordance 训练数据来自真机采集:研究员在厨房里让机器人尝试各种动作,记录每次"能不能做到"。比如"面前有一个关着的抽屉,能不能打开?→ Yes""手里没有东西,能不能放下?→ No"。这些数据被格式化为问答对,混入训练集。
和 SayCan 对比——SayCan 需要一个独立的 affordance 分类器(通常是一个 ResNet),它和 LLM 完全分离,只在推理时配合。PaLM-E 把 affordance 判断变成了"回答一个 Yes/No 问题"——和回答"图里有几只猫?"用的是同一套推理机制。统一带来的好处是:模型做 affordance 判断时能参考当前对话的全部上下文(前几步做了什么、用户说了什么),而不是只看一张孤立的图。
从 PaLM-E 到 RT-2:输出层的演化
理解 PaLM-E 的输出设计,对理解后续工作至关重要:
- PaLM-E(本文):输出自然语言子目标 → 底层策略(RT-1)翻译成动作
- RT-2(2023.7):输出动作 token(把关节角度离散化成 256 个 bin,当成"特殊词汇"生成)
- OpenVLA(2024):和 RT-2 思路类似,但用开源 LLM + 开源数据
PaLM-E 的"输出文字"设计看似保守,实际上是有意为之——它把"高层规划"和"底层控制"解耦,让两部分可以独立改进。但代价是多了一个翻译环节,信息有损。RT-2 做的事就是"把翻译环节砍掉"。
三种机器人平台的对接差异
论文在三种不同机器人上验证了 PaLM-E:
Mobile Manipulator(移动操作机器人):有轮子 + 有手臂,能在厨房里走来走去。PaLM-E 输出导航 + 操作混合的子目标,如 "Go to the counter" → "Pick up the sponge"。底层策略是 RT-1。
Language-Table(桌面推操作机器人):只有一个简单的推杆,能把桌上的物体推到指定位置。PaLM-E 输出如 "Push the green star to the bottom left corner"。底层策略是一个简单的 learned pushing policy。
TAMP(仿真积木堆叠):纯仿真环境,有精确状态信息。PaLM-E 输出如 "First grasp yellow block and place it on the table, then grasp the blue block"。底层执行用 motion planner(运动规划器)。
每种平台对接方式不同,但 PaLM-E 的高层输出格式统一——都是自然语言。这证明了"语言作为统一接口"的可行性:不管底层是什么机器人,只要能听懂自然语言指令就行。
所以这一节是想说:PaLM-E 输出人话、底层策略翻译成动作,闭环执行 + affordance 判断让整个系统在真实环境中能纠错、能避坑。
下图是"高层规划 + 底层控制"的分层闭环执行架构:
用户指令 "我把饮料洒了,帮我擦一下"
│ ┌──────────── 闭环反馈 ────────────┐
▼ │ │
┌──────────────────────────────────┐ │
│ PaLM-E (大脑, 高层规划) │ │
│ 多模态句子: 指令 + <当前图> │◄── 重新拍照 ────┤
│ 输出 sub-goal (自然语言) │ │
│ 同时可答 affordance: 能做吗?Y/N │ │
└───────────────┬──────────────────┘ │
│ "Pick up the sponge" (语言条件) │
▼ │
┌──────────────────────────────────┐ │
│ 底层策略 RT-1 (手脚, 底层控制) │ │
│ 当前图像 + 语言条件 │ │
│ → 7-DoF 动作 (xyz+旋转+夹爪) │ │
└───────────────┬──────────────────┘ │
▼ │
机器人执行一步 ── 成功? ──────────────────┘
成功→下一 sub-goal / 失败→重新规划
(被抢走方块也能重新"去抓一次")
上图说明:PaLM-E 只负责输出自然语言子目标(高层规划 + affordance 判断),RT-1 把子目标翻译成 7-DoF 动作,每步执行后重新拍照回灌,形成能纠错的闭环。

关键数字(What works)
数字本身不重要,重要的是它们告诉你什么"设计选择"才是关键。
| 关键数字 | 含义 | 对比基准 | 启示 |
|---|---|---|---|
| PaLM-E-562B = 540B PaLM + 22B ViT | 当时最大 VLM | PaLI 17B(它的 33 倍) | 规模本身带来涌现能力 |
| TAMP 1% 数据 OSRT 82.5% | 极少数据下的表现 | ViT-4B 仅 30.6% | 架构选对了,数据少也能赢 |
| 移动操作 affordance F1 = 0.91 | 判断动作可行性 | PaLI 0.62 / CLIP 0.65 | 一体化模型优于拼凑式 |
| OK-VQA SOTA 66.1(通才) | 通用视觉问答 | PaLI/Flamingo 82+(专才微调) | 单一模型能同时做机器人和 VQA |
| 562B 语言遗忘率仅 3.9% | 学机器人不忘语言 | 12B 遗忘 87.3% | 模型够大可双修 |
| 单图训练 → 零样本多图 | 泛化能力 | 之前 VLM 需多图训练 | 架构自带泛化 |
数字 1:PaLM-E-562B = 540B PaLM + 22B ViT
- 怎么算的:把 PaLM-540B(当时 Google 最大的语言模型)和 ViT-22B(当时最大视觉模型)拼一起。
- 对比:当时最大 VLM PaLI 只有 17B(13B 语言 + 4B 视觉)。PaLM-E 是它的 33 倍。
- 生活语言:相当于把"全世界最大的脑子"和"全世界最大的眼睛"焊在一起。代价是训练它要 Google 内部好几百块 TPU——普通研究机构基本不可能复现。
数字 2:TAMP 1% 数据下 OSRT 拿 82.5% 成功率
- 怎么算的:只用 320 条积木堆叠数据,比较不同编码器。
- 对比:ViT-4B 只用 TAMP 数据 30.6%;ViT-4B 加全量混合 74.1%;OSRT 82.5%。
- 生活语言:3D 物体感知 + 实体引用让模型在"超少数据"下也能搞定多步规划。证明架构选对了,数据少也能赢。
数字 3:移动操作(kitchen)affordance F1 = 0.91
- 怎么算的:在真厨房环境里问"现在能不能执行 X 动作",PaLM-E 判断对错的 F1 分数。
- 对比:PaLI 零样本 0.62;CLIP 微调版 0.65;PaLM-E 0.91。
- 生活语言:判断"这个动作现在做得了吗"是闭环规划的命脉——错判会导致机器人撞墙。PaLM-E 比专门为这个任务设计的方法还强。
数字 4:OK-VQA 上 SOTA(无任务专属微调)
- 怎么算的:OK-VQA 是个考"图 + 外部知识"的题库,比如"图里这种鸟主要分布在哪个洲?"。
- 对比:PaLI(专门微调)82.0;Flamingo(专门微调)82.1;PaLM-E-562B 通用模型 66.1——但它是单一通才模型,不像别人针对每个任务专门微调。
- 生活语言:意思是 PaLM-E 这一个模型既能开机器人又能在通用 VQA 任务上打到第一。"通才打过专才"在 2023 年是大新闻。
数字 5:562B 模型语言遗忘率仅 3.9%
- 怎么算的:在 21 个标准语言基准上,对比 PaLM-540B 和 PaLM-E-562B。
- 对比:12B 模型遗忘 87.3%;84B 遗忘 61.6%;562B 仅 3.9%。
- 生活语言:模型够大就能"双修"——既学会做机器人,又不丢掉原本的语言能力。这是后续 RT-2、Gemini-Robotics 的关键依据。
数字 6:单图训练 → 零样本能处理多图
- 怎么算的:训练数据里只有单张图,但测试时 PaLM-E 能处理
Photo 1: <img1>. Photo 2: <img2>. Q: 哪张里有墨镜?这种多图问题。 - 对比:之前的 VLM 只能处理训练时见过的输入格式。
- 生活语言:多模态句子的"位置自由"带来的副产物——你只训了"插一张图",但模型能泛化到"插两张图"。架构本身就有泛化能力,不靠堆数据。
所以这一节是想说:大尺度 + 多模态句子 + 杂烩共训这三件事凑齐,迁移效应、数据效率、零样本能力都跟着出现。
实验结果说明了什么
上面的"关键数字"告诉你每个具体实验的成绩,但更重要的是——这些成绩放在一起能推出什么结论。论文实验跑了三大类任务(机器人规划、视觉问答、纯语言),七组消融对比。把结论按重要程度排列:
结论一:多模态共训不仅不是负担,反而是"免费的助推剂"
直觉上你可能觉得——把 91% 无关数据塞进来不是浪费训练时间吗?答案是否。VLM 数据提供的视觉理解能力直接转化为机器人规划的性能增益。Tab. 1 中 ViT-4B 单任务训 30.6% → 混合训 74.1%,涨幅比"加更多机器人数据"还大。这意味着:如果你只有 1000 条机器人数据,最好的投资不是去采第 1001 条,而是混入 10 万条网络 VLM 数据。
结论二:3D 物体感知(OSRT)在少数据下碾压扁平视觉(ViT),但不具备通用性
OSRT 在 TAMP 任务上用 1% 数据就打到 82.5%,而 ViT 即使有全量混合也只有 74.1%。但 OSRT 的限制也很明显:它需要多视角合成数据,真机环境基本用不了。论文的隐含建议是——如果你的任务涉及"操作特定物体的空间位置"且能生成仿真数据,OSRT 是首选;否则老老实实用 ViT + 海量数据。
结论三:灾难性遗忘是可以靠"把模型做大"来解决的
这是论文最有话题性的发现。12B 模型训完机器人后语言能力基本报废(-87.3%),但 562B 几乎纹丝不动(-3.9%)。这不是"模型大了什么都好"的空话——它指向一个具体策略:如果你的计算预算够大,就全解冻;不够,就冻住 LLM 只练编码器。不存在中间态——84B 的遗忘(-61.6%)已经不可接受。
结论四:闭环执行比开环显著更鲁棒
论文展示了"实验员故意干扰"的对比:开环模式(一次性输出所有步骤不看结果)失败率极高,因为任何一步出错后面全部跟着错。闭环模式(每步重新看图)能从大多数单步失败中恢复。但闭环的代价是——每步都要跑一次 562B 模型的推理,延迟高。
结论五:PaLM-E 验证了"一个通才模型同时做多件事"的可行性
在 2023 年之前,学界的主流共识还是"专才模型各司其职"。PaLM-E 证明了:一个通才模型在它参与的所有任务上都不差于(甚至优于)专才基线,且额外获得了跨任务迁移的好处。这为后续的 GPT-4V、Gemini 等通才模型奠定了理论依据。
一个反面结论:在有充足数据 + ViT 的情况下,OSRT 的优势消失
Tab. 1 中用 100% TAMP 数据时,ViT-4B + 全量混合拿到 97.5%,OSRT 也差不多。OSRT 的优势只在"数据极度稀缺"时才显著。这提醒我们:精巧的架构设计和粗暴的堆数据,最终往往殊途同归——当数据足够时,简单方法胜出。
所以这一节是想说:这些实验加在一起告诉你四个关键设计原则——混合训练 > 单任务训练、大模型 > 小模型(在遗忘问题上)、闭环 > 开环、物体感知 > 像素感知(在少数据下)。
你应该懂的几个新词
Embodied AI(具身 AI):把 AI 装进机器人或 agent 里,让它真的能"动"。区别于只在屏幕里聊天的 AI。
Grounding(定锚):让 AI 的语言能跟现实世界的视觉、物体、动作对应起来。一个会聊"苹果"但分不清桌上苹果在哪的 AI 就是 ungrounded。
Multi-modal sentence(多模态句子):PaLM-E 的核心数据格式——文字、图、状态向量混在同一个序列里输入 LLM。
Decoder-only LLM(解码器-only 语言模型):像 GPT 那样从左往右"接龙"生成文字的模型。PaLM 就是这种。
ViT(Vision Transformer):把图切成网格小方块当"视觉单词"处理的模型。PaLM-E 用了 4B 和 22B 两种规模。
OSRT(Object Scene Representation Transformer):从多视角图片里自学物体分割的 3D 感知模型。能把场景分成 N 个"物体槽"。
TAMP(Task and Motion Planning):任务与运动规划——机器人领域里"先抓 A 放到 B 上,再抓 C..."这类多步组合规划任务。
Affordance(可供性):某个动作在当前环境能不能执行。比如"抓住门把手"的 affordance = 1(可以),"飞过去"的 affordance = 0(不能)。
Catastrophic forgetting(灾难性遗忘):模型学新任务时把旧任务能力一并忘掉。是大模型微调的老大难问题。
Positive transfer(正向迁移):训练 A 任务时让 B 任务也变好。PaLM-E 在多种机器人 + VQA 任务上都观察到这个现象。
SayCan:2022 年 Google 的前作。让 LLM 列出动作选项,再用一个外部"价值函数"评分。PaLM-E 最直接的对手。
Closed-loop control(闭环控制):机器人执行一步后看看结果,再决定下一步。能纠错。和"开环"(一次性输出全部计划)相对。
所以这一节是想说:上面这十几个词以后看任何具身 AI 论文都会反复出现,先把它们和生活类比挂钩。
它有什么搞不定的
PaLM-E 也有几个明显短板:
- 巨型模型搞不动:562B 模型加载就要几百 GB 显存,只能在 Google 内部 TPU 集群跑。开源世界基本无法复现完整版,只能玩小一点的 84B 或 12B。
- 真机器人数据仍然贵:虽然训练数据 91% 是网络 VLM,但那 9% 机器人数据采集成本极高(真机操作 + 人工标签)。换个新机器人还得重采。
- 低阶动作还是依赖外部 policy:PaLM-E 输出的是"语言子目标"(比如 "pick up the sponge"),真正怎么把手伸过去还是要 RT-1 这类底层策略。它是"高级管理",不是"全栈工程师"。
- OSRT 假设过强:3D 物体感知好用,但需要多视角合成数据,真机环境很难拿到。论文里 OSRT 主要用在仿真 TAMP 上。
- 超长推理链条仍会断:极长的多步任务(比如 20 步以上)失败率明显上升,闭环纠错能救一部分,但不是无敌。
- 没有动态场景适应:PaLM-E 假设场景在规划过程中基本静止(除了机器人自己的动作)。如果环境中有其他人或移动物体在不断变化,它的规划可能跟不上。
- 泛化到新环境有限:虽然通用 VLM 数据给了模型广泛的视觉知识,但真正部署到一个训练没见过的厨房/办公室时,性能下降明显——尤其是 affordance 判断容易失准。
所以这一节是想说:PaLM-E 是"用大模型暴力刷分"的代表作,门槛极高,且它只解决"高层规划",底层动作另开篇章。
它和别的论文是什么关系
- 直接前传:LLaVA(2023.4) —— 但其实 PaLM-E(2023.3)比 LLaVA 还早一个月。两者都是"用 LLM + 视觉编码器做 VLM"的早期代表,但 LLaVA 走开源 + 极简路线(练习题为王),PaLM-E 走闭源 + 极大模型路线(参数量为王)。LLaVA 证明几百万练习题 + 13B 模型也能打,PaLM-E 证明562B 大模型自带涌现能力。
- 同期对手:SayCan(2022) —— PaLM-E 替代了 SayCan 的"LLM + affordance"两段式设计。在所有机器人实验里 PaLM-E 都吊打 SayCan,因为后者 LLM 看不到图。
- 架构灵感:Frozen(2021)、PaLI(2022) —— 给 PaLM-E 的"冻结 LLM + 训编码器"路线提供了原型。PaLM-E 把它扩展到了多模态 + 多机器人。
- 直接续作:RT-2(2023.7) —— 同一组人。RT-2 把 PaLM-E 的"输出文字步骤"换成"直接输出动作 token"——LLM 不再只规划,连机械臂角度都自己生成。这条线后续通向 OpenVLA、π₀ 等真正的 VLA(Vision-Language-Action)模型。
- 集合关系:可以把"具身 AI 大模型"想成一棵树——PaLM-E 是树根之一(多模态规划),RT-2 是分支(端到端动作),LLaVA 是另一根(开源 VLM 基础设施)。
所以这一节是想说:PaLM-E 是 2023 年具身 AI 的一个分水岭——之前大家在拼凑各种小模型,之后大家都开始用大 LLM 当大脑。
和本导读的关系
PaLM-E 在本导读中处于 Part 3(核心主线精读) 的关键位置——它是 Ch10: 高层规划 章节所讲的三种模块化规划方案(SayCan / Code-as-Policies / Inner Monologue)的终结者和超越者。
Ch10 详细讲了 2022 年"让 LLM 指挥机器人"的三种尝试:SayCan 靠菜单打勾、Code-as-Policies 靠写代码、Inner Monologue 靠每步反思。它们有一个共同的致命弱点——LLM 看不见图。LLM 只接收文字描述的环境信息,不管你怎么描述,总有信息丢失。
PaLM-E 把这个问题从根上解决了:不再"描述给 LLM 听",而是直接把图塞给它看。多模态句子消灭了 Ch10 三种方案中"感知模块 → 文字描述 → LLM"这个信息瓶颈。
从学习路径上说:
- Ch08(CLIP) 教会 AI "认图"
- Ch09(BLIP-2 / LLaVA) 教会 AI "看图说话"
- Ch10(SayCan 等) 第一次尝试让 AI "看图做事"——但靠拼凑
- PaLM-E(本文) 第一次用一个端到端大模型实现"看图做事"——不再拼凑
- Ch11(RT-1 / RT-2) 把 PaLM-E 的"输出文字"进一步升级为"输出动作 token"
所以 PaLM-E 是这条学习路径的"枢纽点"——它既是 Ch10 模块化思路的批判性回应("你们拼凑得太累了,我一个模型全搞定"),也是 Ch11 端到端路线的直接铺垫("输出文字 → 输出动作"的过渡就差一步)。
读完本文再回看 Ch10,你会更清楚地看到:SayCan 等方案的"LLM 看不见图"这个限制,不是一个小 bug——它是整个模块化范式的结构性瓶颈,PaLM-E 把这个瓶颈一刀砍掉。
所以这一节是想说:PaLM-E 是本导读 Ch10(模块化规划)到 Ch11(端到端 VLA)之间的转折点——它第一次证明"一个大模型直接看图做规划"比"多个小模型接力传话"更强。
思考题
用这些问题检验自己是否真的理解了 PaLM-E 的核心思想。先自己想,想不出再点开提示。
Q1:如果把多模态句子中的图像向量全部移到序列最前面(而不是插在文字中间),会损失什么能力?
提示
想想论文中"边走边看"的例子——机器人先看全景图、走到抽屉前再看特写图。如果两张图都放在最前面,LLM 就无法区分"哪张图对应哪个时刻的观察"。位置自由的本质是让图像和文字之间建立因果顺序——"我看到 X,所以我决定做 Y"这种推理依赖于图出现在决策文字之前。把所有图堆在前面,就丢失了"观察-行动"的时间对应关系。Q2:为什么 PaLM-E 选择 OSRT 做 TAMP 任务的编码器,而不是直接用更简单的 ViT?从数据效率的角度解释。
提示
TAMP 任务的核心是"操作特定物体的空间位置"——比如"先抓红方块放到蓝方块上"。ViT 输出的是 256 个 patch 向量,LLM 需要从这些 patch 中"猜"出哪些 patch 组成了红方块、它在哪。这个"从像素到物体"的映射需要大量数据才能学会。OSRT 直接输出物体级别的向量,每个向量就是一个物体——LLM 不需要学"从像素中识别物体"这一步,只需要学"知道物体后该怎么规划"。省掉的这一步恰好是数据效率 2.5 倍差异的来源。Q3:论文发现 562B 模型遗忘率只有 3.9%,而 12B 遗忘 87.3%。如果你只有 7B 模型但想做具身 AI,你该怎么办?
提示
两条路:(1) 冻结 LLM,只训练视觉编码器和投影层——这样 LLM 的语言能力完全不受影响,代价是机器人任务可能表现稍差;(2) 用 LoRA 等参数高效微调方法——只更新模型的一小部分参数(比如 1-5%),在保留大部分语言能力的同时学习机器人技能。PaLM-E 论文暗示了这两条路,而后续的 OpenVLA 正是用 LoRA + 7B 模型实现的。Q4:PaLM-E 的训练数据中 91% 是 VLM 数据、9% 是机器人数据。如果把比例反过来(91% 机器人数据),性能会怎样?为什么?
提示
性能几乎一定会下降,原因有三:(1) 机器人数据总量太少(论文中总共也就几万条),91% 只是翻几倍,不够支撑一个大模型;(2) 失去 VLM 数据的"语义地基"——模型不再理解"红色是什么""左边是什么方向"这些基础概念;(3) 过拟合到机器人数据的狭窄分布上,泛化能力下降。正向迁移的前提是"共享基础能力的数据量大于特化数据"——就像学英语,语感(大量阅读)比做翻译题(少量专练)更重要。Q5:SayCan 和 PaLM-E 都能做 affordance 判断(判断动作能不能执行)。它们的做法有什么本质区别?哪个更好,为什么?
提示
SayCan 用一个独立的 affordance 模型(通常是一个小型分类器,接收图像和动作文字,输出概率)。PaLM-E 把 affordance 判断作为一个问答任务统一进大模型——`GivenQ6:论文声称"单图训练 → 零样本多图"是多模态句子架构的副产物。请解释这种泛化能力的来源。
提示
关键在于 PaLM-E 的架构对"图出现在序列中的位置"没有硬编码。训练时虽然只有一张图,但模型学到的是"在任何位置遇到视觉向量时如何处理"这种通用能力——就像 LLM 学会了处理任意长度的文本,不需要专门为"三段话"做训练。多模态句子的"位置自由"意味着:模型见过"位置 5 有图"和"位置 20 有图"的情况,它自然能处理"位置 5 有图且位置 20 也有图"的情况——因为每个位置的处理逻辑是独立的。这是 self-attention 的天然属性。Q7:假设你要用 PaLM-E 的思路给一个仓库机器人做拣货规划。仓库有 500 种商品、机器人需要一次拣 20 件。PaLM-E 的哪个设计决定最可能成为瓶颈?
提示
最大瓶颈是"超长推理链条"。拣 20 件货意味着至少 20 步规划(可能更多——找到商品 → 拿起 → 放进推车 → 移动到下一个货架...每件货 3-5 步,总共可能 60-100 步)。论文指出超长链条失败率显著上升。闭环执行虽然能纠错,但每步都要跑 562B 推理,在仓库实时场景下延迟不可接受。可能的缓解方案:(1) 分层规划——先用 PaLM-E 规划"先去 A 区拣 5 件,再去 B 区拣 3 件"的高层路线,每个区域内再细化;(2) 用更小更快的模型做底层导航。所以这一节是想说:这些问题覆盖了 PaLM-E 的五大核心设计——多模态句子、编码器选择、冻结策略、数据配比、输出与执行。能回答这些,说明你不只是"读完了",而是"理解了"。
一些好奇心问答(FAQ)
Q1:562B 我自己能跑吗?
跑不动。562B 模型推理就要 8 张以上 80GB 的 H100,训练更得几百块 TPU。论文里的小版本 PaLM-E-12B 倒是消费级显卡能勉强加载,但官方没开源权重。真要玩,去 Hugging Face 找开源 VLA 模型(OpenVLA、SpatialVLA),思路一脉相承但能跑。
Q2:PaLM-E 能直接控制机器人吗?还是还要别的模型?
不能直接控。PaLM-E 输出的是语言子目标(比如 "Pick up the sponge"),真正怎么把机械臂动起来还是要靠 RT-1 这类底层 policy。可以理解成 PaLM-E 是"项目经理",RT-1 是"工程师"。
Q3:为什么不直接让 PaLM-E 输出关节角度?
那是 RT-2 干的事。PaLM-E 的设计哲学是"高层规划 + 复用现有底层",把动作生成留给已经训练好的 RT-1。RT-2 把 PaLM-E 的思路再往前推了一步——直接输出动作 token。
Q4:OSRT 这么强为什么后来不流行?
主要是数据要求高。OSRT 需要"同场景多视角合成数据"才能学好物体分割,真机环境很难拿。后来的 VLA 模型大多回归 ViT,靠堆数据弥补 3D 感知的不足。但 OSRT 的"物体槽"思路被很多 3D 视觉模型继承。
Q5:Multi-modal sentence 和 Flamingo 的"图+文"格式有啥区别?
Flamingo 把图固定插在文本前面(用 cross-attention),位置不灵活。PaLM-E 把图当成"普通 token"直接嵌入序列任意位置,完全复用 LLM 的位置编码——这是它能零样本支持多图、能在一句话里多次插图的根本原因。
Q6:训练这么大的模型会不会过拟合机器人数据?
会,但作者用"杂烩共训"绕开了——91% 是网络 VLM 数据,9% 才是机器人数据。机器人数据被海量通用数据"稀释",反而避免了对窄分布的过拟合。
Q7:如果机器人摔了一跤,PaLM-E 能纠错吗?
能,这就是闭环控制。PaLM-E 每执行一步后会重新看图、重新规划。论文里有个演示:实验员故意把机器人刚抓起的方块再抢走,PaLM-E 重新看图发现"咦方块没了",重新规划"再去抓一次"。
Q8:PaLM-E 之后该看什么?
最直接的下一步是 RT-2(2023.7)——同一组人的"动作版"。再下一步看 OpenVLA(2024)——开源、可复现、跑得动。如果对 3D 感知感兴趣,看 3D-LLM 系列。
所以这一节是想说:实操问题(多大、多贵、能不能跑、和别的模型怎么接)作者大多想到了,但门槛比 LLaVA 高很多——它就不是给小团队复现用的。
如果你想再深入
按"前传 → 同期对手 → 续作 → 衍生方向"四类排序:
- 前传:SayCan(2022) —— LLM + affordance 的双段式做法。读完 PaLM-E 再读 SayCan,能清楚看到"两个模型互相翻译"vs"一个模型端到端"的取舍。
- 前传:Frozen(2021) —— "冻结 LLM + 训视觉编码器"思路的鼻祖。PaLM-E 在它的基础上扩到了多模态 + 多机器人。
- 续作:RT-2(2023.7) —— 真要看具身 AI 必读。把 PaLM-E 的"输出文字步骤"升级成"输出动作 token",从规划器变成了动作生成器。
- 续作:OpenVLA(2024) —— 开源版的 VLA 模型。如果你想动手训一个,从这个开始。
- 衍生:Gemini Robotics(2024) —— Google 把 PaLM-E 思路融进 Gemini 的工业版本。代表"具身大模型"工业化的最新进展。
所以这一节是想说:把 PaLM-E + RT-2 + OpenVLA 这三篇连起来读,就能看到 2023-2024 年具身大模型从"高层规划"到"端到端动作"的完整演化。
原文信息
BibTeX
@inproceedings{driess2023palme,
title = {{PaLM-E}: An Embodied Multimodal Language Model},
author = {Driess, Danny and Xia, Fei and Sajjadi, Mehdi S. M. and Lynch, Corey and Chowdhery, Aakanksha and Ichter, Brian and Wahid, Ayzaan and Tompson, Jonathan and Vuong, Quan and Yu, Tianhe and Huang, Wenlong and Chebotar, Yevgen and Sermanet, Pierre and Duckworth, Daniel and Levine, Sergey and Vanhoucke, Vincent and Hausman, Karol and Toussaint, Marc and Greff, Klaus and Zeng, Andy and Mordatch, Igor and Florence, Pete},
booktitle = {Proceedings of the 40th International Conference on Machine Learning (ICML)},
year = {2023},
url = {https://arxiv.org/abs/2303.03378}
}
链接
- arXiv: https://arxiv.org/abs/2303.03378
- 项目主页: https://palm-e.github.io
- Google AI Blog: https://ai.googleblog.com/2023/03/palm-e-embodied-multimodal-language.html
所以这一节是想说:需要引用或找原文时来这里查——arXiv 链接是免费全文,项目主页有交互式演示视频。
我建议这样读这篇
零基础读者不要从头读到尾。建议这样走:
- 看 Figure 1 和 Figure 2(5 分钟):Figure 1 是架构总览,Figure 2 是 562B 模型的"杂技表演"集锦——多图问答、视觉笑话、零样本数学题、机器人规划。先建立"它能干什么"的直观感受。
- 读 Section 3(架构)(15 分钟):核心是"多模态句子"——理解 LLM 的输入序列任意位置都能塞图/状态向量。公式 (3) 是全文最重要的式子,记住人话翻译就够。
- 跳到 Section 4(编码器)(10 分钟):扫一眼三类编码器(State / ViT / OSRT),理解 OSRT 为什么对机器人任务这么强。
- 重点读 Section 5(训练配方)(10 分钟):搞清楚"冻 vs 解冻 LLM"的两条路,以及"杂烩共训"为什么能让机器人任务受益。
- 扫消融表 Tab. 1、Tab. 2、Tab. 4(10 分钟):看哪些设计决定贡献最大——你会发现是"全量混合数据"和"OSRT",不是模型参数。
- 跳过附录(除非你想自己实现):附录主要是任务细节和具体数字,原理读完前面 5 步就够了。
读完这 6 步大约 50-70 分钟,已经能在和别人讨论具身 AI 时报出 PaLM-E 的核心思路。
所以这一节是想说:这篇精华全在"多模态句子 + 杂烩共训",模型参数和工程细节可以略读,节省时间。
最后一个画面
想象你站在厨房里说:"我把饮料洒了。"
机器人听见这句话,扫了一眼桌面,然后自言自语般地报出:
"好的。1. 找海绵。2. 走到水槽。3. 拿起海绵。4. 走回桌子。5. 擦水。6. 放回海绵。7. 完成。"
每报一步,它真的就去做。中途你恶作剧把它刚拿起的海绵抢走,它愣了一下,看了看周围,重新说:"1. 找海绵..."继续来。
这一刻,"会聊天的 AI"和"会动的机器人"第一次合体成同一个东西。PaLM-E 没解决所有问题,但它第一次让人觉得"具身 AI"不是科幻——而是一组超大模型 + 一些工程胶水 + 大量数据共训就能做出来的东西。
所以最后一节是想说:PaLM-E 不只是技术上跑通了,更是从概念上把"机器人 + 大模型"这条路凿了出来——之后所有 VLA 模型都是踩着它的脚印往前走。
◼
引用本笔记 / Cite this note
@online{eai_palm_e_2026,
title = {(readable note) PaLM-E: An Embodied Multimodal Language Model},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/palm-e/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?