Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 53

Behavior Transformers: Cloning k Modes with One Stone

22 min read · 7563 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过模仿学习和 Transformer"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

同一件事人类有好几种做法(左绕、右绕都行)。传统 AI 会把这些做法"取平均"成一个四不像。BeT 先用 k-means 把动作分成 k 个"流派",让 Transformer 先选流派、再微调细节——一个模型克隆出人类示范里的所有主流做法。

所以这一节是想说:BeT 用"先分类选流派、再回归调细节"的双头设计,第一次让 Transformer 干净利落地表达"多模态"人类行为。


这是个什么场景

你打开视频网站学做番茄炒蛋,搜出 100 个视频跟着学。问题是每个博主做法都不一样:有的先炒蛋、有的先炒番茄;有的放糖、有的放盐;有的大火快炒、有的中火慢煨。

如果一个零经验的人想"把这 100 个视频的动作取平均"——蛋下锅 1.5 次、火候介于大小之间、糖盐各放一半——做出来是什么?一锅四不像。

机器人模仿学习(imitation learning)里最朴素的一支叫行为克隆(Behavior Cloning, BC):给一堆"观测 + 动作"的示范数据 {(o, a)},训一个网络学映射 o → a。它碰到的正是这个"取平均"的坑:

  • 传统 BC 用 MSE 损失(均方误差),本质假设"同一个观测只对应一个正确动作"(单模态)。
  • 但真实的人类示范是**多模态(multi-modal)**的——同一个画面下藏着好几种合理做法。MSE 会把它们平均成一个动作,落在所有正确答案的"正中间",往往正是最差的那个。论文图 2 举例:一个 MSE-BC 模型为了最小化 MSE,干脆输出"0 动作"(不动)。

更麻烦的是,真实数据往往没有奖励标签(不像强化学习有分数),也不是干净的单一专家——它是次优的、带噪声的、多种做法混在一起的。这正是人类示范最典型的样子。

BeT 要解的题:怎么从这种无标签、多模态的开放数据里,训一个模型原生地"克隆"出所有主流做法,而不是塌缩到单一模式或糊成平均?

所以这一节是想说:人类示范天生多模态又没奖励标签,传统 MSE 行为克隆会取平均糊成四不像,BeT 来解这道"如何原生表达多模态行为"的题。


Behavior Transformers — 场景示意:这论文要解决的现实问题
Plate Nº IBehavior Transformers — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:MLP + MSE 回归 直接拟合 o → a。类比:把 100 个视频动作取平均。问题:MSE 假设单模态,多模态数据被无脑平均,输出一个差答案(甚至"0 动作")。

  • 方案 B:混合密度网络(MDN / GMM) 显式预测几个高斯分量的中心。类比:明说"我有 3 派做法,中心分别在这"。问题:要显式预测每个模式中心,表达力受限、训练不稳,分量数难调。

  • 方案 C:VAE(变分自编码器,如 SPiRL) 用隐变量 z 来"分支"表达多模态。类比:先掷个骰子决定风格。问题:训练复杂,容易模式坍缩(塌到单一模式)。

  • 方案 D:Normalizing Flow(如 PARROT) 用可逆变换建模动作分布。问题:训练/表达在复杂交互数据上仍受限。

  • 方案 E:能量模型 / Implicit BC(IBC) 不建条件分布,而是建联合分布 P(a,o) 的能量,采样时找能量最低点。类比:给每个候选动作打分,选最好的。问题:推理慢(要采样优化)、数值上难驯——BeT 实测 IBC 单次 rollout 要 17.70 秒,BeT 只要 1.65 秒。

  • 核心难题:怎么在高维连续动作空间里表达多模态分布,又不需要复杂生成模型、不需要指数级的动作格子、不需要慢速测试时优化,还能吃 Transformer 的"长历史上下文"红利?

所以这一节是想说:前人要么取平均(MSE)、要么显式建模式受限(MDN)、要么训练不稳/坍缩(VAE/Flow)、要么推理慢(IBC),缺一个又快又稳又能表达多模态的方案。


这篇论文的新想法

关键洞察:连续动作空间太大、模态太多,直接学很难;但如果先把动作离散化成 k 个"桶"(bin),就把"多模态生成"这个难题拆成两件容易的事:

  1. 分类问题:当前该走哪个桶(哪个流派)?→ Transformer 输出 k 维概率分布(天生擅长离散分类)。
  2. 回归问题:在那个桶内部,相对桶中心要偏移多少?→ Transformer 输出一个残差偏移向量。

最终动作 = 选中桶的中心 + 偏移量。这种"离散选择 + 连续残差"的设计,灵感来自目标检测里的"偏移预测"(先粗定位框、再回归精修)。BeT 的三个核心 insight:

  1. 用 Transformer(minGPT)的上下文多 token 预测能力表达多模态动作。
  2. k-means 把连续动作聚成离散桶,从而把"高维连续多模态分布"变成"离散类别分布"——不用学复杂生成模型。
  3. 加一个残差动作校正器,把离散桶中心修回精确的连续动作,保证在线执行可用。

名字双关:"cloning k modes with one stone" = 一石 k 鸟——一个模型克隆 k 种行为模式。

【MSE 取平均 vs BeT 离散选桶 + 残差】

多模态示范(绕左 / 绕右都对):
  MSE 回归:预测 = 两者平均 ─▶ 直冲障碍物(四不像)

  BeT:先用 k-means 把连续动作聚成 k 个桶(bin)
    观测 ─Transformer(minGPT)─┬─ 分类头:该走哪个桶?(k维概率)
                              └─ 残差头:桶内相对中心偏多少?
    最终动作 = 选中桶中心 + 偏移量 ─▶ 保住"绕左"或"绕右"整支模态
  (快:BeT 1.65s/rollout  vs  IBC 17.70s)

所以这一节是想说:把"生成多模态连续动作"重写成"先分类选桶、再回归调偏移",用 Transformer 的分类天赋 + k-means 离散化,绕开所有复杂生成模型。


它分几步做的(方法)

BeT 的整体流水线:

训练阶段(离线):
  所有动作 a ──▶ [k-means聚类] ──▶ k个桶中心 {A_1..A_k}
  每个动作 a = 最近桶 ⌊a⌋ + 残差 ⟨a⟩ = a - A_⌊a⌋
       │
  历史观测(o_{t-h+1}..o_t) ──▶ [minGPT] ──┬──▶ 分类头: k维桶概率  ── Focal Loss
                                          └──▶ 偏移头: k×dim 残差 ── Masked MT-Loss

推理阶段:
  历史观测 ──▶ minGPT ──▶ 采样一个桶 j ──▶ 取第j列偏移 ──▶ a = A_j + ⟨â^(j)⟩

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 动作离散化:k-means 把动作分流派(离线预处理)

类比:做菜前先把上千种手势归成"翻炒/颠勺/划散"几大类。

输入:训练集里所有的连续动作向量 a

处理:跑 k-means 聚类——自动找出 k 个"代表点"(桶中心){A_1, ..., A_k},每个原始动作就近归到最近的中心。于是每个动作被分解成两部分:

  • 桶索引 ⌊a⌋ = argmin_i ||a - A_i||(离散类别,它属于哪个流派);
  • 残差 ⟨a⟩ = a - A_⌊a⌋(连续偏移,在这个流派内部偏了多少)。 给定桶中心集、桶索引、残差,就能确定性地重建原动作 a = A_⌊a⌋ + ⟨a⟩

k-means 是什么:给一堆点,自动找 k 个"代表点",每个点归到最近代表点。这里就是"给动作分类"。

输出:一套固定的"编码器/解码器"(把动作 ↔ 桶+残差 互转),训练和测试全程不变。

小结:k-means 把连续动作空间切成 k 块,每个动作 = 桶中心 + 残差,为后面"分类+回归"铺路。

5.2 分类头:minGPT 学"该走哪个流派"

类比:翻译员看完整段上文再决定下一个词,而不是逐字蒙。

输入:过去 h 帧连续观测序列 (o_i, ..., o_{i+h-1})。骨干是 minGPT(一个精简版 GPT 风格的 Transformer 解码器,因果注意力,只看过去)。视觉观测(如 CARLA)先用冻结的 ImageNet 预训练 ResNet-18 编码。

处理:Transformer 把每个观测映射到一个 k 维桶概率分布(预测该走哪个桶),和真值桶索引比较。用 Focal loss 训练——它是交叉熵的加权版,加了个 (1-p_t)^γ 因子:对"已经分得很准的样本"降权,逼模型多关注"低概率的难/少数类"。这缓解了动作桶频次不均(常用动作会霸屏)的问题。

为什么松弛了两个假设:一是不再假设行为是马尔可夫的(只看当前帧),而是看 h 帧历史;二是不再假设单模态,而是用离散分布表达多模态。

输出:每个位置一个 k 维桶概率分布。

小结:minGPT 吃 h 帧历史,输出"该走哪个桶"的概率分布,用 Focal loss 对付桶频次不均。

5.3 偏移头:残差校正,把粗动作修精

类比:先粗选流派(翻炒),再微调力度角度(翻得再快一点)。

输入:同一个 minGPT 主干的输出。

处理:加一个偏移头,对每个观测产生一个 k × dim(A) 的矩阵——即为每个桶都备一个候选残差向量。关键 trick 是 masked 多任务损失(借鉴目标检测):训练时只惩罚"真值桶"那一列的残差,其他桶的残差不算 loss(用 Iverson 指示函数 I[⌊a⌋=j] 屏蔽)。

为什么这样设计:如果对每个桶都要求它能拟合真值动作,模型会崩(每个桶都想当"万能桶")。只惩罚真值桶那列,让每个桶专注学"我这个流派内部该怎么微调"。离散化必然损失精度,残差校正把精度补回来——尤其在高维动作空间(如 9-DOF 厨房机器人)损失更大,校正更关键。

输出:每个桶对应的残差向量。

小结:偏移头给每个桶备一个残差,但只训真值桶那列,把离散化损失的精度补回来。

5.4 推理:先采样桶、再取残差

类比:点菜时不是只能点最热门那道,可以按热度随机翻翻别的派。

输入:最近 h 帧观测。

处理:minGPT 输出桶概率和偏移矩阵。先按桶概率采样(不是 argmax)一个桶 j,再取第 j 列残差 ⟨â^(j)⟩,最终动作 â = A_j + ⟨â^(j)⟩

为什么采样而非 argmax:采样保证了"每次执行可能走不同流派"——这正是处理多模态该有的行为。如果每次都 argmax,就塌回单模态了。

输出:一个连续动作 â

小结:按概率采样桶再加残差,让同一起点每次可能走出不同的合理做法。

5.5 为什么"离散 + 残差"是关键

  • 离散桶是多模态的来源:同一起点,桶概率分布可以是多峰的(左桶 50%、右桶 50%),采样时自然分流,永不取平均。消融证明去掉离散化,多模态能力大幅下降(Block push 归一化性能从 1 掉到 0.25)。
  • 残差校正是精度的保证:尤其高维动作空间,离散化误差大,残差把动作修回精确值。消融证明去掉残差,Kitchen(动作维度最高)掉得最多(0.78)。
  • Transformer 骨干是历史上下文的载体:换成 MLP/LSTM/Temporal Conv 都明显更差且难训(LSTM 三个环境全崩到 0.03/0.03/0.04)。
  • 又快又轻:BeT 只有 10^4–10^6 参数,单卡桌面 GPU 一小时内训完最大数据集;IBC 同任务要约 14 小时。

小结:离散桶管多模态、残差管精度、Transformer 管历史——三者缺一不可,且比能量模型快一个数量级。

5.6 怎么在环境里"滚动"起来:三类测试场景

类比:训练学的是"看一段历史 → 下一步怎么走",真跑起来就是把这个动作反复接龙——每走一步就把新观测续进历史窗口,再问模型下一步。

输入:一个初始状态,以及不断更新的最近 h 帧观测窗口。

处理:BeT 是闭环滚动执行的——每个时刻拿最近 h 帧观测喂给 minGPT,采样出一个动作执行,环境给出新观测,再把它接到历史窗口尾部,如此循环直到任务结束。论文在三类差异很大的环境里验证这套机制:

  • Block Push(推方块):经典的多模态测试——两个方块、两个目标,人类示范里"先推哪个、推到哪个目标"有多种合理组合,专门考模型会不会取平均糊掉。
  • Franka Kitchen(厨房)9 自由度机械臂、要在一个厨房里连续完成多个子任务(开微波炉、挪水壶、开灯……),动作维度最高,最考验残差校正的精度。
  • CARLA(自动驾驶)图像观测环境,观测先用冻结的 ResNet-18 编码,考模型在高维视觉输入 + 多种驾驶风格下的多模态克隆。

输出:在三类环境里都能"接龙"出成套的、保留多种做法的合理行为轨迹。

小结:BeT 靠"最近 h 帧观测 → 采样动作 → 更新窗口"的闭环滚动执行,在推方块(多模态)、厨房(高维长程)、CARLA(视觉驾驶)三类环境里都验证了它保留多模态又执行精确。


Behavior Transformers — 方法示意:核心 pipeline
Plate Nº IIBehavior Transformers — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们说明"离散+残差"到底解决了什么。

数字 1:三大环境任务成功率(部分)

方法 CARLA 成功率 Block 推2块(P2) Kitchen 完成4任务
RBC (MLP+MSE) 0.98 0 0
VAE 0 0 0
Flow 0.03 0 0
IBC 0.25 0 0.24
BeT 0.98 0.71 0.44

关键含义:长程 + 多模态任务上 BeT 一骑绝尘。Block push 要"先推一块、再推另一块到指定格"(需长期承诺单一模式),所有基线的 P2 都是 0,只有 BeT 到 0.71。CARLA 上 BeT 略输给 LWR(非参方法),但那是单模态友好的任务。

数字 2:Block push 完整分解

方法 够到1块(R1) 够到2块(R2) 推1块(P1) 推2块(P2)
IBC 0.98 0.04 0.01 0
BeT 1.00 0.99 0.96 0.71

关键含义:基线能"够到一块"(短程),但一到"够到两块、推两块"(长程多模态)就崩。BeT 能长期承诺一个模式走完全程,这是"一次预测一串 + 离散桶"的功劳。

数字 3:多模态覆盖(是否学到所有做法)

指标 RBC IBC BeT 示范真值
Block 先够红/绿 0/0.98 0.12/0.13 0.34/0.64 0.50/0.50
Kitchen 任务序列熵 0 2.41 2.47 2.96

关键含义:RBC 完全塌到单一模式(几乎总是右/绿);BeT 覆盖了所有模式(虽不完美匹配 50/50),Kitchen 序列熵 2.47 最接近示范的 2.96——说明它保留了行为多样性而没坍缩。

数字 4:消融——每个部件的价值(归一化性能)

变体 CARLA Block Kitchen
完整 BeT 1.0 1.0 1.0
去残差 0.94 0.95 0.78
去离散桶 0.94 0.25 0.68
去历史 0.65 0.95 0.88
换 MLP 0.90 0 0.05
换 LSTM 0.03 0.03 0.04

关键含义:离散桶对 Block push 最关键(去掉掉到 0.25),残差对高维 Kitchen 最关键(掉到 0.78),Transformer 骨干不可替代(换 LSTM 全崩)。

数字 5:效率

维度 BeT IBC
训练最大数据集 单卡桌面 GPU < 1 小时 约 14 小时
单次评估 rollout 1.65 秒 17.70 秒
参数量 10^4–10^6

所以这一节是想说:数字证明四件事——长程多模态任务碾压、模式覆盖全、每个部件都有用、比能量模型快一个数量级。


实验结果说明了什么

问题一:BeT 真能克隆多模态示范吗? 能。表 1 显示在 CARLA、Block push、Kitchen 三个环境上 BeT 全面领先(除 CARLA 略输单模态友好的 LWR)。尤其 Block push 的"推两块",所有基线都是 0,只有 BeT 到 0.71——因为这需要"长期承诺一个模式"(先决定推红还是推绿,然后坚持走完),而不是每步乱切换。

问题二:BeT 会不会塌到单一模式? 不会。表 2 显示 BeT 覆盖了示范里的所有模式(Block 先够红/绿是 0.34/0.64,虽不完美但两种都有),Kitchen 任务序列熵 2.47 最接近真值 2.96。对比 RBC(MSE)几乎总走同一条路(0/0.98),VAE/Flow 直接坍缩。这证明离散桶 + 采样确实保住了多样性。

问题三:每个部件到底多重要? 消融给出清晰答案:离散桶是多模态的根(去掉后 Block push 从 1 掉到 0.25,且 Kitchen 只会完成固定的任务子序列);残差在高维动作空间最关键(Kitchen 掉到 0.78);历史上下文对需要记忆的任务重要(CARLA 掉到 0.65);Transformer 骨干不可替代(MLP/LSTM/TempConv 都明显更差且难训)。

问题四:为什么不用能量模型(IBC)? IBC 理论上也能多模态,但工程上崩且慢:Block push 的 P2 是 0,单次 rollout 要 17.70 秒(BeT 1.65 秒),训练要 14 小时(BeT < 1 小时)。BeT 用"离散+残差"绕开了能量模型的采样优化,又快又稳。

所以这一节是想说:实验系统回答了四个问题——能克隆多模态、不坍缩、每个部件都有据可查、比能量模型又快又稳。


你应该懂的几个新词

模仿学习(imitation learning):从专家示范里学行为,不需要奖励信号。行为克隆是其中最朴素的一支。

行为克隆(Behavior Cloning, BC):监督学习"观测 → 动作"的映射。BeT 是 BC 的多模态增强版。

多模态行为分布(multi-modal behavior distribution):同一观测对应多个合理动作,是个多峰分布。MSE 会把它压成单点。

k-means 离散化:把连续动作向量聚成 k 个中心,每个动作表示为"最近中心 + 偏移"。

分类头 + 偏移头(categorical + offset head):分类头选桶、偏移头给桶内残差,共享 Transformer 主干。灵感来自目标检测的"框分类 + 框回归"。

Focal loss:交叉熵的加权版,给已分对的样本降权,逼模型关注难/少数类。原本用于目标检测的类别不均。

Masked 多任务损失:偏移头虽为 k 个桶各出一个残差,但训练只惩罚真值桶那一列,其他桶不学。

minGPT:精简版 GPT 风格 Transformer 解码器,因果注意力。BeT 的骨干。

模式坍缩(mode collapse):生成模型只学到一种模式、丢掉其他模式的常见失败。VAE/Flow 在此易发。

能量模型 / IBC(Implicit BC):给动作打能量分、采样找最优。能多模态但慢且难训,是 BeT 的主要对手。

所以这一节是想说:这十个词是读任何"多模态模仿学习"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 离散化必然损失精度:k-means 桶是有限的,残差校正能补一部分,但桶数 k 若太小仍会丢细节。这是"离散+残差"路线的固有代价(后续 Diffusion Policy 用连续扩散绕开了它)。
  • 主要失败模式:不知道"还没完成":论文指出 BeT 在 Block push 的主要失败是"没意识到块还没完全进格"——它会过早切换到下一步。这源于纯模仿没有对"任务完成"的显式判断。
  • 无法在线抽取单一策略:BeT 表达了所有模式,但如果你想在线只要某一种确定行为(比如总是左绕),需要额外蒸馏或"提示",论文把这列为未来工作。
  • OOD(分布外)脆弱:和所有 BC 方法一样,一旦观测漂出训练分布就会失败。BeT 只是比基线更耐受一点,没根治。
  • 桶数 k 是超参:k 太小表达不足、太大每桶样本稀疏。论文用 k-means 但 k 仍需选(后续 VQ-BeT 用 VQ-VAE codebook 改进)。
  • 没有语言/目标条件:BeT 是无条件克隆所有模式,不能"按指令选模式"(比如"这次请左绕")。

所以这一节是想说:BeT 解了"如何表达多模态",但没解"离散化精度损失""如何在线选单一模式""OOD 鲁棒性"这些根问题——每个都催生了后续工作。


它和别的论文是什么关系

  • 上游 / 思想血缘
    • Decision Transformer(2021):最先把 Transformer 用进 offline RL,但 DT 需要 reward-to-go 当条件,BeT 不需要任何奖励。BeT 架构上最接近 DT 的模仿学习变体,但 BeT 学条件分布 P(a|o)(DT 学联合分布),能处理更复杂的状态空间。
    • 目标检测的偏移预测:分类头+偏移头的双头设计直接借鉴目标检测(先粗定位框、再回归精修)。
    • VQ-VAE / wav2vec 的离散 codebook:把连续信号离散化后交给序列模型,思想同源。
  • 同期对手
    • Implicit BC(IBC):BeT 的主要基线,走能量模型路线。BeT 用"离散+残差"绕开能量模型,又快又稳(详见数字)。
  • 下游 / 续作
    • Diffusion Policy(2023):用扩散过程表达多模态动作分布,效果更强但训练/推理更重。BeT 可看作它的"轻量前辈"——本仓库有 diffusion-policy 深读笔记,把 BeT 列为对比基线之一。
    • VQ-BeT:把 k-means 升级成 VQ-VAE codebook,进一步提升表达力。

所以这一节是想说:BeT 站在 Decision Transformer + 目标检测 + VQ-VAE 的肩膀上,是"多模态模仿学习"从能量模型(IBC)走向序列模型(后来的扩散策略)的关键中间站。


和本导读的关系

本笔记对应导读 Ch14:模仿学习基础——从 DAgger 到多模态克隆

导读 Ch14 讲的是"从专家示范里学行为"这条线:从最基础的行为克隆和 DAgger(解决分布漂移),到多模态行为的表达(BeT、ACT),再到用扩散/VLA 做大规模模仿。BeT 是这条线上**"如何表达多模态行为"**这个核心议题的奠基性一步——它给出了"离散桶 + 残差"这个既简单又有效的答案。

读完本笔记,建议对照看 diffusion-policy 深读笔记——两者解的是同一道题(多模态动作分布),但路线不同:BeT 用"离散分类 + 残差回归",Diffusion Policy 用"连续扩散去噪"。把两篇连起来读,你会对"如何在高维空间表达多模态"有立体认识:离散化路线简单快但有精度损失,扩散路线连续无损但更重。这正是导读 Ch14 想让你理解的"表达多模态的两条技术路线"。

所以这一节是想说:本笔记是导读 Ch14 "多模态行为表达"这一格的深度展开,和 Diffusion Policy 笔记互为路线对照。


思考题

以下问题检验你是否真正理解了 BeT 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么 MSE 损失训练的 BC 模型面对多模态数据会输出"取平均"的动作,甚至是"0 动作"?请从损失函数的数学本质解释。

提示

MSE 损失 Σ||a - π(o)||² 的最优解是"所有目标动作的均值"(均值最小化平方误差)。当同一个观测 o 对应多个合理动作(比如 +5 和 -5,代表左绕右绕),最小化 MSE 的输出是它们的均值 0——而 0 恰恰可能是最差的动作(直接撞上中间的障碍)。数学上,MSE 假设条件分布 P(a|o) 是单峰各向同性高斯,均值是它的最优点估计;但真实分布是多峰的,均值落在两峰之间的低概率谷底。

Q2:BeT 把动作拆成"桶 + 残差",为什么这个分解能表达多模态,而直接回归不能?

提示

关键在"桶概率分布可以是多峰的"。直接回归输出一个点估计,被所有模式拉扯到均值。BeT 的分类头输出 k 维概率分布——它可以是"左桶 50%、右桶 50%"这样的多峰分布,采样时按概率随机落到某个桶,自然分流到某一种做法,永不取平均。残差只是在选定桶内部做小幅精修,不改变"选哪个模式"的多峰性。所以多模态来自离散分类的多峰概率,精度来自连续残差。

Q3:偏移头为每个桶都输出一个残差(k×dim 矩阵),但训练时只惩罚"真值桶"那一列。如果改成"惩罚所有桶都去拟合真值动作",会发生什么?

提示

会崩。如果要求每个桶的残差都能把桶中心修到真值动作,那么每个桶都被逼着当"万能桶"——不管你选哪个桶,加上残差都得到同一个真值动作。这就摧毁了多模态:所有桶最终指向同一个动作,等价于取平均。masked loss 只惩罚真值桶那列,让每个桶专注学"我这个流派内部的微调",保持了桶之间的差异性和多模态性。

Q4:消融显示"去掉离散桶"在 Block push 上从 1 掉到 0.25,但在 CARLA 上只掉到 0.94。为什么离散桶对不同任务的重要性差这么多?

提示

取决于任务的多模态程度和长程性。Block push 有强多模态(先推红还是绿 50/50、推到哪个格 50/50)且需要长期承诺单一模式——没有离散桶就无法在同一起点分流到不同做法并坚持,直接崩。CARLA 的多模态弱(主要是路口左右转),且更接近单模态回归任务,即使没有离散桶,连续回归也能勉强完成,所以只小幅下降。结论:任务越多模态、越长程,离散桶越关键。

Q5:消融显示"去掉残差"在 Kitchen(9-DOF)上掉得最多(0.78)。为什么高维动作空间对残差校正的依赖更强?

提示

离散化误差随动作维度增长。k-means 用有限的 k 个桶去覆盖动作空间,维度越高,空间体积越大,每个桶要"代表"的区域越大,桶中心离真实动作的平均距离越远——离散化损失的精度越多。低维空间(如 2D 的 CARLA)少数几个桶就能贴合得不错,残差可有可无;高维空间(9-DOF Kitchen)桶中心很粗糙,必须靠残差把动作修回精确值,否则执行时会偏出分布导致失败。

Q6:BeT 用采样(而非 argmax)选桶。如果你在部署时希望机器人每次都用同一种确定的做法(比如生产线上要求可复现),你会怎么改?会失去什么?

提示

可以改成 argmax 选桶(总选概率最高的桶),或对某个桶做"提示/条件"固定选择,或从训练好的 BeT 蒸馏出一个单模态策略(论文把这列为未来工作)。失去的是多模态多样性——机器人不再能在遇到扰动时灵活切换到另一种合理做法,鲁棒性可能下降。这是"可复现性 vs 灵活性"的权衡:生产线要前者,开放环境要后者。

Q7:论文指出 BeT 在 Block push 的主要失败是"没意识到块还没完全进格就切换下一步"。这个失败模式暴露了纯行为克隆的什么根本局限?

提示

暴露了纯 BC 缺乏对"任务/子目标完成状态"的显式判断。BeT 只学"看到这个观测该做什么动作",没有一个"当前子任务是否完成"的判据。当观测和"块快进格了"很像但其实还差一点时,模型可能按"完成后该做的动作"提前切换。根本局限:BC 是反应式的模式匹配,不含目标推理或状态机。缓解方向包括:加子目标/进度条件、结合规划、或用能感知任务完成的奖励/价值信号(走向 offline RL)。

所以这一节是想说:能回答这 7 题,你就真正理解了 BeT 为什么用离散+残差、每个部件的分工、以及纯行为克隆的根本局限。


一些好奇心问答(FAQ)

Q1:k 一般取多少? 论文用 k-means 聚类,k 是超参(不同任务不同)。核心思想是"够表达主流模式即可"——太小丢模式、太大每桶样本稀疏。后续 VQ-BeT 用 VQ-VAE codebook 让离散化更灵活。

Q2:BeT 需要奖励标签吗? 不需要。这是它相对 offline RL 和 Decision Transformer 的关键优势——只吃无标签、无奖励的多模态示范。这让它能用更便宜、更大规模的人类示范数据。

Q3:为什么用 Focal loss 而不是普通交叉熵? 因为动作桶频次严重不均——常用动作(如"直行")的桶样本极多,罕见动作的桶样本少。普通交叉熵会被高频桶主导。Focal loss 给已分对的高频样本降权,逼模型多学低频难桶,保住罕见但重要的模式。

Q4:BeT 比 IBC 快多少? 快一个数量级。单次评估 rollout:BeT 1.65 秒 vs IBC 17.70 秒;训练最大数据集:BeT < 1 小时 vs IBC 约 14 小时。因为 BeT 是一次前向(分类+回归),IBC 要做采样优化。

Q5:视觉输入怎么处理? CARLA 用 224×224×3 的 RGB 图,先过一个冻结的 ImageNet 预训练 ResNet-18 编码成特征向量,再喂给 minGPT。注意是冻结的(不端到端训),这和后来 Diffusion Policy 端到端训编码器不同。

Q6:BeT 和 Diffusion Policy 哪个好? 解同一道题(多模态动作),路线不同。Diffusion Policy 通常效果更强(连续扩散无离散化损失),但训练/推理更重。BeT 更轻更快,是很好的基线和理解多模态表达的入门。看任务对精度和速度的需求。

所以这一节是想说:BeT 的实操问题(k 的选择、无奖励、Focal loss、速度、视觉、与扩散对比)都有明确答案,理解权衡比记结论重要。


如果你想再深入

按"前置 → 对手 → 续作 → 路线对照"排序:

  1. 前置:Decision Transformer(Chen et al. 2021) — 最先把 Transformer 用进决策,理解"序列模型做控制"的起点。
  2. 对手:Implicit BC / IBC(Florence et al. 2021) — BeT 的主要基线,能量模型路线代表作。
  3. 续作:VQ-BeT — 把 k-means 升级成 VQ-VAE codebook,提升离散化表达力。
  4. 路线对照:Diffusion Policy(Chi et al. 2023) — 用连续扩散表达多模态,本仓库有深读笔记,和 BeT 是两条技术路线。
  5. 数据集来源:Relay Policy Learning(Gupta et al. 2019) — Franka Kitchen 数据集来源,理解长程多模态任务。

所以这一节是想说:把 Decision Transformer + IBC + BeT + Diffusion Policy 连起来读,就能看清 2021–2023 年多模态模仿学习的范式演进。


原文信息

BibTeX

@inproceedings{shafiullah2022behavior,
  title     = {Behavior Transformers: Cloning $k$ modes with one stone},
  author    = {Shafiullah, Nur Muhammad Mahi and Cui, Zichen Jeff and Altanzaya, Ariuntuya and Pinto, Lerrel},
  booktitle = {Advances in Neural Information Processing Systems (NeurIPS)},
  year      = {2022}
}

链接

所以这一节是想说:这是 Shafiullah et al. 2022 年发表在 NeurIPS 的工作,用"离散桶 + 残差校正 + Transformer"第一次让模仿学习干净地表达多模态人类行为,是多模态行为克隆的奠基论文之一。

引用本笔记 / Cite this note
BibTeX
@online{eai_bet_2026,
  title       = {(readable note) Behavior Transformers: Cloning k Modes with One Stone},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/bet/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?