Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Datasets & Benchmarks · Plate Nº 30

CALVIN

24 min read · 8488 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过机器人基准、语言条件策略、模仿学习"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。

一句话讲什么(TL;DR)

要让机器人听懂人话干活,得有个统一的"考卷"来比较不同方法的好坏。CALVIN 就是这样一份考卷(基准 benchmark):它在仿真里搭了 4 个桌面环境,让一个机器人根据自然语言指令连续完成一长串任务(比如"打开抽屉→拿起蓝色积木→把积木推进抽屉→打开滑门")。它提供约 24 小时的"随便玩"遥操作数据、34 个任务、几百条自然语言指令,还设计了从易到难的评测(同环境、多环境、零样本新环境)。论文用当时的 SOTA 方法(MCIL)一测——连续做 5 个任务的成功率只有 0.08%,说明这道题非常难、大有研究空间。

所以这一节是想说:CALVIN 的核心就一句话——它是第一个把"自然语言 + 多模态感知 + 7 自由度连续控制 + 长程操作 + 泛化"全都塞进一份考卷的机器人基准。


这是个什么场景

想象未来家里有个机器人,你对它说:"打开抽屉,把蓝色积木放进去,然后关上抽屉,再把灯打开。" 这一句话里有好几个连续的子任务,而且用的是没有约束的自然语言(你不会按固定格式说话)。

要研究"怎么让机器人做到这件事",学术界需要一个统一的基准(benchmark)——一套标准的环境、数据、任务、评测指标,让所有人用同一把尺子量自己的方法,才能公平比较、可复现地推进研究。

但当时的基准都有欠缺:

  • 有的只做单个任务、一次学一个。
  • 有的用目标图像独热技能选择器指定任务——普通用户没法用这些方式指挥机器人(你不会给机器人看一张"抽屉打开的照片")。
  • 有的(如 ALFRED)用预定义的离散动作原语(7 个固定动作),不是真正的连续控制。
  • 缺乏对长程(一连串任务)和零样本泛化(换个没见过的环境)的评测。

CALVIN 要填的坑:做一个既要听懂无约束自然语言、又要用高维多模态感知、又要做 7 自由度连续控制、又要连续完成长程任务、还要能泛化的综合基准。

所以这一节是想说:研究"机器人听人话干长活"需要统一考卷,但已有基准要么单任务、要么任务指定方式不实用、要么不是连续控制、要么不考长程和泛化——CALVIN 来补这个综合考卷。


CALVIN — 场景示意:这论文要解决的现实问题
Plate Nº ICALVIN — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:单任务学习 一次学一个任务。类比:只会做一道题的学生。问题:没有泛化和组合能力,无法应对"一句话里一串任务"。

  • 方案 B:用目标图像 / 独热技能选择器指定任务 给机器人一张目标状态图,或一个"技能编号"。类比:不用说话,直接给答案图或按编号。问题:普通用户根本没法这么指挥——你不会随身带"抽屉打开的照片",也记不住技能编号。不实用。

  • 方案 C:离散动作原语的语言基准(ALFRED) 最接近 CALVIN 的基准,含导航+操作的语言指令,但用 7 个预定义动作原语。类比:只能从固定几个动作里挑。问题:不是连续控制,agent 只需"分类"选动作,不用学会真正的连续运动技能。

  • 方案 D:受限环境 / 简化执行器的语言到动作研究 在受限环境或简化机械上研究语言映射到动作。问题:离真实的、需要精细连续控制的桌面操作还远。

  • 共性问题:缺乏标准化——没有统一的基准和公开实现,不同方法难以公平比较、难以复现。而且大多不同时具备"无约束语言 + 多模态高维输入 + 连续控制 + 长程 + 泛化"这几项。

所以这一节是想说:单任务不泛化、目标图像/编号不实用、离散原语不是连续控制、受限环境不真实、且缺标准化——缺一个把这些都补齐的综合基准。


这篇论文的新想法

类比:以前的基准像"只考一道题"或"选择题",CALVIN 是一份"综合大题连续答卷"——要求学生(机器人)听懂大白话,连着解一串主观题。

CALVIN 不是提出一个新方法,而是提出一个新基准 + 数据集 + 评测协议。它的核心贡献是把五件难事第一次组合进同一个公开基准:

  1. 无约束自然语言条件:任务用人话指定(且测试用的指令是训练没见过的新说法),不是目标图像或编号。

  2. 多模态高维输入:提供静态相机和夹爪相机的 RGB-D、触觉、本体感受(关节角等)——研究者可自由组合传感器。

  3. 7 自由度连续闭环控制:真正的连续动作(30Hz),支持绝对笛卡尔、相对笛卡尔、关节空间三种动作空间。

  4. 长程任务:要求连续完成 5 个子任务,且任意组合任意顺序——考"子目标间的转换"。

  5. 系统的泛化评测:三档难度——单环境、多环境、零样本新环境(在 3 个环境训、在第 4 个没见过的环境测)。

再配上约 24 小时"随便玩"的遥操作数据(任务无关、多样、便宜),以及只标注 1% 的语言指令的设定(模拟真实中标注昂贵)。

【CALVIN 把五座大山合成一份考卷】

  ┌ 无约束自然语言(测试用训练没见过的新说法)
  ├ 多模态高维输入(静态相机 & 夹爪相机 RGB-D + 触觉 + 本体感受)
  ├ 7-DoF 连续闭环控制(30Hz; 绝对笛卡尔/相对笛卡尔/关节空间)
  ├ 长程任务(连续完成 5 个子任务, 任意组合任意顺序)
  └ 系统泛化(单环境 → 多环境 → 零样本新环境 D)

  数据设定:~24h 任务无关"随便玩"遥操作数据 + 仅 1% 语言标注(模拟标注昂贵)

所以这一节是想说:CALVIN 的新意不是新算法,而是第一次把"无约束语言 + 多模态 + 连续控制 + 长程 + 泛化"这五座大山合成一份标准考卷,配上便宜的玩耍数据和实用的标注设定。


它分几步做的(方法)

CALVIN 由三大部分组成:环境、数据集、挑战(评测)。整体结构:

[环境] 4个桌面环境 A/B/C/D (纹理/布局各异)
   7-DOF Franka + 夹爪 | 滑门/抽屉/按钮(绿LED)/开关(灯泡)/3个彩色积木 | PyBullet
   传感器: 静态RGB-D + 夹爪RGB-D + 触觉 + 本体感受
   动作: 绝对笛卡尔 / 相对笛卡尔 / 关节空间, 30Hz
        │
[数据集] ~24h 遥操作"随便玩" (每环境6h) = ~2.4M步 = ~40M短窗口
   只1%配语言标注 → 389条自然语言指令(34任务, 每任务~11种说法) + MiniLM嵌入
        │
[挑战] 三档: 单环境(D→D) / 多环境(ABCD→D) / 零样本(ABC→D)
   指标: MTLC(34任务) + LH-MTLC(1000条5任务链)
        │
[基线] MCIL (多上下文模仿学习, seq2seq CVAE)

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 环境:4 个结构相似但外观各异的桌面

类比:4 间布置略有不同的厨房,家具都在但位置和贴纸不一样——好考"换个房间还认不认得"。

输入:无(这是仿真环境设计)。

处理:4 个环境(A/B/C/D),每个都有 7 自由度 Franka Emika Panda 机械臂 + 平行夹爪,桌上有可开关的滑门、抽屉、切换绿灯的按钮、控制灯泡的开关、3 个不同颜色形状的积木。关键设计:所有环境纹理不同、所有静态元件(滑门、抽屉、按钮、开关)位置不同——这样才能考泛化(换环境后还能不能"打开滑门",哪怕它位置和外观都变了)。桌子、机器人、静态相机的位置在各环境相同。物理用 PyBullet 引擎(支持 GPU 快速渲染、大规模并行采数据)。

输出:4 个可玩、可评测的桌面操作环境。

小结:4 个结构相似但纹理/布局各异的桌面环境,为泛化评测(尤其零样本换环境)打下基础。

5.2 观测与动作空间:多模态、多选择

类比:给机器人配一整套感官(多个摄像头 + 触觉 + 身体感觉),还让研究者自选用哪几种、用哪种动作方式。

输入:环境状态。

处理

  • 观测:静态相机 RGB-D(200×200)、夹爪相机 RGB-D(84×84)、触觉图(120×160×2)、本体感受(末端位置/朝向、夹爪宽度、7 个关节角)。研究者可自由组合。
  • 动作:三选一——绝对笛卡尔位姿(末端位置+朝向+夹爪,相对世界系)、相对笛卡尔位移(相对夹爪系)、关节空间(7 关节+夹爪)。30Hz 闭环连续控制。论文鼓励研究不同观测/动作组合:静态相机+绝对动作适合大范围移动,夹爪相机+相对动作适合抓取堆叠这种精细控制,触觉适合"抓住把手滑门"这种要保持稳定抓握的任务。

输出:灵活的多模态观测 + 三种动作空间。

小结:提供静态/夹爪 RGB-D、触觉、本体感受多模态观测和三种动作空间,让研究者按任务需求自由权衡"精细控制 vs 大范围移动"。

5.3 数据集:24 小时"随便玩" + 1% 语言标注

类比:不是请专家一板一眼地演示每个任务,而是让普通人在环境里"随便玩",事后只给一小部分片段配上文字说明。

输入:3 个未受训、不知道下游任务的人,用 HTC Vive VR 头盔遥操作。

处理

  • 玩耍数据(play data):每个环境玩约 6 小时、共 24 小时,唯一要求是"探索环境但别把物体弄掉桌"。这产生约 2.4M 交互步、约 40M 个 1-2 秒的短窗口(用于重标注的目标条件模仿学习)。玩耍数据的好处:任务无关、多样、便宜,含探索和次优行为(如"重试"),比只有专家轨迹的数据更丰富、覆盖多种解法。
  • 语言标注:用记录的环境状态程序化地给片段贴标签——只有展示出有意义技能的片段才标。收集了 400 多条众包自然语言指令,对应 34 个任务(每任务约 11 种同义说法,共 389 条唯一指令)。关键设定:只标注 1% 的数据(模拟真实中不可能给所有数据配语言标注)。还提供预计算的 MiniLM 语言嵌入(384 维)。

输出:约 24h 玩耍数据 + 34 任务的语言指令(仅 1% 标注)+ MiniLM 嵌入。

小结:用便宜的"随便玩"数据覆盖状态空间、只标注 1% 配语言、程序化贴标签——务实地模拟真实世界数据采集的约束。

5.4 挑战:三档难度 + 两个评测指标

类比:考卷分"本班测""跨班测""转学测"三档,每档考"单题"和"连续大题"两种。

输入:训练好的语言条件策略。

处理

  • 三档环境组合:单环境(D→D,训练测试同环境,即 Lynch 等的设定);多环境(ABCD→D,要泛化到多种纹理/布局,但数据也更多);零样本多环境(ABC→D,最难,测试环境训练时完全没见过,但所有元素以不同位置出现在训练环境里)。
  • 两个指标:MTLC(多任务语言控制,考 34 个任务各自的成功率,每任务 10 次 rollout,用训练没见过的新指令);LH-MTLC(长程多任务,把 34 任务当子目标,构造 1000 条由 5 个连续任务组成的合法指令链,只有完成当前子任务才转到下一个;每序列后把机器人重置到中性位,打破初始状态和任务的相关性,逼 agent 完全靠语言判断任务)。

输出:一套从易到难、可复现的评测协议。

小结:三档环境(同/多/零样本)× 两指标(单任务 MTLC / 长程 LH-MTLC)构成系统的难度阶梯,尤其长程链和零样本环境最能区分方法优劣。

5.5 基线方法 MCIL:多上下文模仿学习

类比:把"随便玩"的数据回头贴上"这段其实是在达成某个目标"的标签,再学一个"给目标就照做"的策略。

输入:未分段的玩耍数据。

处理MCIL(Multi-context Imitation Learning)——先把玩耍数据重标注(relabeling):把每个到访过的状态当成"达成的目标",之前的状态和动作就是"达成该目标的最优行为"。这样从无标注玩耍数据里生成大量"目标条件"演示,用最大似然目标条件模仿学习目标训练。用 seq2seq 条件变分自编码器(CVAE) 通过一个潜在"计划"空间来处理自由数据里的多模态性。对语言条件:因为无法把任意状态重标注成语言目标(语言目标空间≠观测空间),所以只给少量窗口配语言(<1%),训一个既能吃目标图像又能吃语言的单一策略。实现用 Adam、学习率 1e-4、KL 权重 β=0.001,窗口长 16-32。

输出:一个语言条件的连续控制策略(作为基准的性能参照)。

小结:MCIL 用重标注把玩耍数据变成目标条件演示、用 seq2seq CVAE 的潜在计划处理多模态,只需 1% 语言标注就能学语言条件策略——但它在 CALVIN 长程任务上表现很差,正说明基准之难。


CALVIN — 方法示意:核心 pipeline
Plate Nº IICALVIN — 方法示意:核心 pipeline

关键数字(What works)

CALVIN 是基准论文,数字重点看"这道题有多难、基线差到什么程度"。

数字 1:数据集规模

维度 数据
玩耍数据时长 ~24 小时(每环境 6h)
交互步数 ~2.4M
短窗口数(1-2 秒) ~40M
环境数 4(A/B/C/D)
任务数 34
语言指令 389 条唯一(每任务 ~11 种说法)
语言标注比例 仅 1%
机器人 7-DOF Franka Panda + 平行夹爪

关键含义:用便宜的"随便玩"数据覆盖状态空间,只标注 1% 配语言——务实且规模可观。

数字 2:单任务成功率 MTLC(不同传感器,D→D,34 任务)

传感器 MTLC 成功率
静态 RGB 53.9%
静态 RGB + 夹爪 RGB 51.8%
静态 RGB + 触觉 54.2%
静态 RGB-D + 夹爪 RGB-D 46.1%

关键含义:单任务上最高 53.9%,加夹爪相机/深度/触觉没带来明显提升(论文推测夹爪相机需配相对动作才有用,且没做数据增强)。

数字 3:长程成功率 LH-MTLC(连续完成 N 个任务,1000 条链)

训练→测试 1 个 2 个 3 个 4 个 5 个
D→D(静态 RGB) 48.9% 12.9% 2.6% 0.5% 0.08%
A,B,C,D→D 28.2% 2.5% 0.3% 0% 0%
A,B,C→D(零样本) 20.2% 0.2% 0% 0% 0%

关键含义:这是全文最重要的数字。连续做 5 个任务,即便同环境也只有 0.08%;多环境掉到 0%;零样本更是从第 2 个就几乎归零。长程 + 泛化极难,误差随任务链急剧累积。

数字 4:任务与评测设计

维度 数据
控制频率 30 Hz
长程评测链 1000 条(每条 5 个连续子任务)
语言嵌入 MiniLM,384 维,词表 30522
动作空间 绝对笛卡尔 / 相对笛卡尔 / 关节空间
任务完成判定 首尾帧环境状态变化(可自动检测,任意长度片段)

关键含义:任务完成靠"首尾状态变化"自动判定,既能当强化学习的稀疏奖励,又能自动给离线数据打标签。

所以这一节是想说:数字证明 CALVIN 是一道极难的题——单任务勉强过半,长程连续 5 任务几乎归零,零样本泛化更是崩溃,给后续研究留了巨大空间。


实验结果说明了什么

问题一:为什么单任务能到 53.9%,长程却崩到 0.08%? 因为误差会沿任务链急剧累积。做对 1 个任务成功率 48.9%,但要连续做对 5 个,就约等于 0.5⁵ 量级——每一步的小失败都会让后续子任务的初始状态偏离,越往后越难。而且每个序列后机器人被重置到中性位,打破了"初始状态暗示任务"的捷径,逼 agent 完全靠语言判断——这暴露了当前方法在"子目标间转换"和"纯靠语言 grounding"上的根本弱点。

问题二:加更多传感器为什么没帮上忙? 反直觉但有原因。加夹爪相机、深度、触觉都没明显提升单任务成功率。论文推测:(1) 夹爪相机可能需要配相对动作(相对夹爪系)才能发挥,而基线用的是绝对动作;(2) 没做图像数据增强;(3) 简单的特征拼接式多模态融合可能不够,需要更精细的融合(如专家混合、视角不变对比学习)。这说明"有更多传感器"不等于"用好了传感器"——怎么融合是关键。

问题三:零样本换环境为什么崩得这么惨? 因为它违背了模仿学习"训练和测试同分布"的基本假设。零样本设定下测试环境的纹理和元件位置都变了,策略没见过。论文指出:朴素地在多域间共享数据可能很脆弱,会加剧策略分布偏移;需要域适应、更好的数据增强、更依赖对纹理不变的深度输入等技术。这说明泛化到新环境是尚未解决的硬骨头。

问题四:模型在语言 grounding 上有什么典型错误? 会混淆颜色。策略有时能正确执行积木操作,但把指令里的"红色"和"蓝色"搞混——因为语言模型把含"red"和"blue"的句子嵌入得很相似。论文建议:反向传播穿过整个语言模型、用对齐视觉和语言表示的辅助损失(如 CLIP 式)可能有助于解决这个感知 grounding 难题。

所以这一节是想说:实验揭示了四个硬骨头——长程误差累积、多传感器融合不到位、零样本泛化崩溃、语言颜色 grounding 混淆,这些正是 CALVIN 想推动解决的问题。


你应该懂的几个新词

基准(benchmark):统一的环境+数据+任务+指标,让不同方法用同一把尺子公平比较、可复现。CALVIN 就是一个基准。

语言条件策略(language-conditioned policy):以自然语言指令为条件、输出动作的策略。CALVIN 考的核心。

长程任务(long-horizon):需要连续完成多个子任务的任务(如连做 5 件事)。CALVIN 的最大难点。

7 自由度(7-DOF)连续控制:机械臂有 7 个关节可连续调节,动作是连续值而非离散选项。

玩耍数据(play data):人在环境里无目的"随便玩"产生的数据,任务无关、多样、便宜。CALVIN 的主数据来源。

重标注(relabeling / hindsight):把到访过的任意状态当成"目标",反过来把之前的行为当成"达成该目标的演示"。MCIL 的核心技巧。

多上下文模仿学习(MCIL):能同时从目标图像和语言等多种"目标描述"学习的单一策略。CALVIN 的基线。

CVAE(条件变分自编码器):用潜在变量建模数据多模态性的生成模型。MCIL 用它的潜在"计划"空间。

零样本泛化(zero-shot):在训练没见过的环境/指令上直接测试。CALVIN 最难的一档。

MiniLM:一个蒸馏的小语言模型,把句子映射成 384 维向量。CALVIN 提供其预计算嵌入。

闭环控制(closed-loop):每步根据最新观测调整动作(vs 开环:一次规划到底)。CALVIN 要求 30Hz 闭环。

所以这一节是想说:这些词是读任何"语言条件机器人 + 基准 + 模仿学习"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 本身是基准,不提供解法:CALVIN 定义了难题并给了差强人意的基线(MCIL),但把"怎么解"留给社区——它是考卷不是答案。
  • 仿真,非真机:在 PyBullet 仿真里,虽力求贴近真实(不用仿真器特权状态),但仍有 sim-to-real 差距,真机部署另说。
  • 物体简化为单色基本形状:为降低语言条件多任务闭环控制的难度,物体是单色简单形状——论文自己说未来会扩展到更真实多样的物体。
  • 基线长程几乎失败:MCIL 连续 5 任务成功率 0.08%,多环境和零样本更差——基线远不够用,说明题目超前于当时方法。
  • 语言 grounding 弱:基线会混淆颜色(red/blue 嵌入相似),感知 grounding 是未解难题。
  • 多传感器未被有效利用:加夹爪相机/触觉没提升,说明基准提供的丰富传感器还需更好的方法去用。

所以这一节是想说:CALVIN 作为基准很成功地暴露了难点,但它不提供解法、是仿真、物体简化、基线孱弱——这些"局限"恰恰是它留给后续研究的空间。


它和别的论文是什么关系

  • 上游(被它借用/对标)
    • Learning Latent Plans from Play(Lynch et al. 2019)/ MCIL(Lynch & Sermanet 2021):玩耍数据 + 重标注 + 多上下文模仿的思想源头,CALVIN 的桌面环境和基线都基于它,并加以扩展(更多子任务 34 vs 18、更长评测 5 vs 4、多环境、零样本、视觉 grounding)。
    • ALFRED(Shridhar et al. 2020):最接近的语言基准,但用离散动作原语;CALVIN 是连续控制、无约束语言。
    • MiniLM / PyBullet / TACTO:语言嵌入 / 物理引擎 / 触觉仿真的工具。
  • 对比关系
    • Meta-World / RLBench:那些是多任务操作基准,但 CALVIN 专注"无约束语言 + 长程 + 泛化"。
    • 目标图像/独热技能基准:CALVIN 用更实用的自然语言指定任务。
  • 下游 / 同族:CALVIN 成了语言条件机器人操作的标准试金石,后续大量方法(如 HULC、GR-1、3D-VLA、各种 VLA)都在 CALVIN 上刷分。它和本仓库的 3d-vla(在 CALVIN 上评测长程规划)、以及 bridgedata-v2 等数据集/基准工作同族——都在为"语言驱动的通用机器人"提供数据和评测基础设施。

所以这一节是想说:CALVIN 站在 Lynch 的玩耍数据 + MCIL 的肩膀上,扩展成一个更难更全的语言条件长程操作基准,成为后续 VLA/语言条件策略的标准考场。


和本导读的关系

本笔记对应导读 Ch21:数据集与评测

导读 Ch21 讲了机器人学习的"数据与评测基础设施"——没有好的数据集和基准,方法就无法公平比较、可复现地进步。CALVIN 是"语言条件长程操作"这一方向的标杆基准。读完本笔记,建议:对照 bridgedata-v2 深读笔记(真机大规模数据集,和 CALVIN 的仿真基准互补),以及 behavior-1k(更大规模、更真实的家务任务仿真基准),能看清"仿真基准 vs 真机数据集""窄任务 vs 广任务"的不同取舍。再结合 3d-vla 笔记(它就在 CALVIN 上评测长程规划),能理解"基准如何驱动方法演进"——CALVIN 定义的难题(长程、零样本)正是后续 VLA 想攻克的目标。

所以这一节是想说:本笔记是导读 Ch21 数据集与评测在"语言条件长程操作基准"方向的深度展开,和 bridgedata-v2、behavior-1k 对照能看清评测基础设施的全景。


思考题

以下问题检验你是否真正理解了 CALVIN 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:CALVIN 为什么坚持用"无约束自然语言"来指定任务,而不用更容易处理的目标图像或技能编号?

提示

因为终极目标是"普通人能指挥机器人"。目标图像不实用——你不会随身带一张"抽屉打开、蓝积木在里面"的照片;技能编号也不实用——普通用户记不住也不愿记编号。自然语言是人类最自然、最有表达力的指令方式:它能抽象("把最远的杯子"可推广到无穷物体)、能组合(把复杂任务描述成一串指令)。虽然处理自然语言难得多(要解决 grounding、歧义、同义表达),但这才是真实场景的需求。CALVIN 特意用训练没见过的新说法来测试,就是要逼方法真正理解语言而非记住固定句子。选难而实用的路,正是基准的价值。

Q2:CALVIN 用"随便玩"的数据而不是"专家逐任务演示"。这个选择有什么优势和代价?

提示

优势:(1) 便宜——不用为每个任务专门设计和采集演示,让人随便玩就行;(2) 任务无关、可复用——同一批玩耍数据能通过重标注支持很多任务的学习;(3) 更丰富——含探索和次优行为(如重试、纠错),覆盖"多种解法"的多模态空间,而专家演示往往只展示一种最优解,学出来的策略遇到偏离就不会恢复。代价:(1) 数据里各任务出现频率不均,尤其"需要先完成前置任务才能做的任务"很稀少;(2) 数据自由无标签,需要重标注和事后语言标注才能用;(3) 含次优行为,若不加处理可能学到不好的动作。CALVIN 用"只标注 1% + 重标注"来务实地利用玩耍数据,模拟真实中标注昂贵的约束。

Q3:为什么长程评测里,连续 5 个任务的成功率会从单任务的 48.9% 暴跌到 0.08%?这个数字说明了什么?

提示

因为成功率沿任务链呈乘法式衰减。如果每个任务独立成功率约 p,连续做 n 个全对的概率约 pⁿ。单任务约 0.49,连做 5 个理论上约 0.49⁵≈0.028(实际更低到 0.08%,因为误差还会累积——前一个任务结束时的状态偏差会让下一个任务更难)。这个暴跌说明:长程任务的根本挑战不是"会不会做单个任务",而是"能否稳定地在子目标间转换、并从前一步的误差中恢复"。它揭示了当时方法缺乏可靠的长程规划和纠错能力。这也是为什么 CALVIN 把长程作为核心难点——它比单任务更能区分方法的真实水平。

Q4:CALVIN 在长程评测里,每完成一个序列就把机器人重置到"中性位置"。为什么要这么做?

提示

为了打破"初始状态和任务的相关性",逼 agent 真正靠语言判断任务。如果不重置,机器人每次任务的起始姿态可能和特定任务强相关(比如"手总是从抽屉附近开始 → 那就是开抽屉任务"),agent 就能靠"记住初始姿态"这个捷径蒙对,而不是真的听懂了语言。论文的定性分析也发现基线性能严重依赖初始位置,怀疑存在"本体感受信息和目标动作之间的因果混淆"。重置到中性位后,agent 无法从初始姿态推断任务,必须完全依赖语言指令来判断该做什么——这才真正考验了"语言 grounding"能力。这是一个防止"作弊捷径"的重要评测设计。

Q5:加了夹爪相机、深度、触觉这些额外传感器,单任务成功率却没提升。这是否说明这些传感器没用?

提示

不能这么下结论——"没提升"不等于"没用",很可能是"没用好"。论文给了几个可能原因:(1) 夹爪相机可能需要配合相对动作空间(相对夹爪系)才能发挥,而基线用的是绝对动作,导致夹爪相机的近距离细节信息没被有效利用;(2) 基线为贴近原实现没做图像数据增强,可能限制了额外视觉信息的价值;(3) 简单的特征拼接式融合可能不够,需要更精细的多模态融合方法(专家混合、视角不变对比学习)。所以这更可能是"基线方法没能把丰富传感器用起来",而非传感器本身无用。这恰恰是 CALVIN 想推动的研究——如何设计能有效利用多模态感知的方法。这提醒我们:评测结果要结合方法局限来解读,别把"当前方法的失败"误读成"信息源的无用"。

Q6:基线会混淆"红色"和"蓝色"积木。这个具体错误揭示了语言条件机器人的什么深层难题?

提示

揭示了"语言 grounding(语言落地)"的难题——把抽象的语言符号对应到具体的视觉感知上。基线用 MiniLM 把整句话编码成一个向量,而含"red"和"blue"的句子在通用语料上训练的语言模型里嵌入得很相似(都是颜色词、句法位置相同),所以模型难以区分。这说明:仅靠一个冻结的、在通用文本上训练的语言模型,不足以支撑需要精细视觉区分的机器人任务——语言表示没有和视觉表示对齐。论文建议反向传播穿过整个语言模型、加视觉-语言对齐的辅助损失(如 CLIP 式对比学习)。这个小错误折射出的是多模态 grounding 的核心挑战:语言、视觉、动作三者的表示如何对齐。这也是后续 VLA 模型(用视觉-语言预训练)想解决的问题。

Q7:如果让你设计一个方法来攻克 CALVIN 的零样本多环境(ABC→D)设定,你会从哪些方向入手?

提示

思路可从论文的提示和领域常识出发:(1) 依赖对纹理不变的输入——深度图对纹理变化不敏感,多用深度可能更鲁棒(零样本主要是纹理和位置变了);(2) 强数据增强——训练时随机化纹理、光照、位置(域随机化),让策略见过各种变化而不依赖特定外观;(3) 域适应技术——显式对齐不同环境的特征分布;(4) 更好的视觉-语言 grounding——用视觉-语言预训练模型(CLIP 式)让"滑门"这个词对应到"滑门的功能/几何"而非"特定环境里滑门的像素样子",从而位置/外观变了也认得;(5) 更好的多模态融合和表示学习。核心矛盾是:模仿学习假设训练测试同分布,而零样本天生违背它——所以要么让训练分布足够广(增强/随机化)覆盖测试,要么学到对变化不变的表示。后续在 CALVIN 上表现好的方法(如用预训练视觉-语言模型的 VLA)大多走了"更强表示 + 更多数据"这条路。

所以这一节是想说:能回答这 7 题,你就真正理解了 CALVIN 为什么用自然语言、用玩耍数据、考长程、重置中性位,以及零样本泛化和语言 grounding 的深层难题。


一些好奇心问答(FAQ)

Q1:CALVIN 是数据集还是基准? 两者都是。它包含环境(可交互仿真)、数据集(24h 玩耍数据+语言标注)、挑战(评测协议)三部分——是一个完整的基准框架。

Q2:为什么只标注 1% 的数据? 模拟真实约束——现实中不可能给所有机器人交互数据都配上众包语言标注(太贵)。CALVIN 证明只需 <1% 语言标注,配合大量无标注玩耍数据就能学语言条件策略。

Q3:MTLC 和 LH-MTLC 有什么区别? MTLC 考单个任务的成功率(34 个任务各自测);LH-MTLC 考连续完成一串任务(1000 条 5 任务链),是长程能力的核心考验,也是最能拉开方法差距的指标。

Q4:三档难度哪个最重要? 零样本多环境(ABC→D)最能反映真实部署——服务机器人到你家(没见过的环境)也得能干活。它也最难,基线几乎全崩。

Q5:为什么物体是单色简单积木,不用真实物体? 为降低"语言条件多任务闭环控制"这个本已很难的问题的复杂度。论文说未来会扩展到更真实多样的物体。

Q6:基线 MCIL 为什么表现这么差?这是坏事吗? 不是坏事。基线差恰恰说明这道题难、有研究价值——一个所有方法都能满分的基准是没用的。CALVIN 的价值就在于定义了一个足够难、能推动进步的挑战。

所以这一节是想说:CALVIN 的实操问题(数据集/基准定位、1% 标注、两指标区别、三档难度、简化物体、基线为何差)都有明确答案。


如果你想再深入

按"思想源头 → 对标基准 → 后续方法 → 同族"排序:

  1. 思想源头:Learning Latent Plans from Play / MCIL(Lynch et al.) — 玩耍数据 + 重标注 + 多上下文模仿,CALVIN 的基础,理解 play data 范式。
  2. 对标基准:ALFRED(Shridhar et al. 2020) — 最接近的语言基准(离散动作),对照理解 CALVIN 的连续控制优势。
  3. 后续方法:3D-VLA / HULC / GR-1 — 在 CALVIN 上刷分的方法,本仓库有 3d-vla 深读笔记,看基准如何驱动方法。
  4. 多模态融合:TACTO(触觉仿真)/ CLIP — 理解如何更好地利用触觉和做视觉-语言对齐。
  5. 同族基准/数据集:bridgedata-v2 / behavior-1k — 本仓库有笔记,对照真机数据集和更大规模仿真基准。

所以这一节是想说:把 MCIL + ALFRED + 3D-VLA 连起来读,就能看清"语言条件机器人基准如何定义难题、又如何被后续方法逐步攻克"的脉络。


原文信息

BibTeX

@article{mees2022calvin,
  title   = {CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks},
  author  = {Mees, Oier and Hermann, Lukas and Rosete-Beas, Erick and Burgard, Wolfram},
  journal = {IEEE Robotics and Automation Letters (RA-L)},
  volume  = {7},
  number  = {3},
  pages   = {7327--7334},
  year    = {2022}
}

链接

所以这一节是想说:这是 Mees et al. 2022 年发表在 RA-L 的工作,第一次把"无约束语言 + 多模态 + 连续控制 + 长程 + 泛化"合成一份公开考卷,成为语言条件机器人操作的标准基准。

引用本笔记 / Cite this note
BibTeX
@online{eai_calvin_2026,
  title       = {(readable note) CALVIN},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/calvin/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?