CALVIN
这是一份写给"没接触过机器人基准、语言条件策略、模仿学习"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。
一句话讲什么(TL;DR)
要让机器人听懂人话干活,得有个统一的"考卷"来比较不同方法的好坏。CALVIN 就是这样一份考卷(基准 benchmark):它在仿真里搭了 4 个桌面环境,让一个机器人根据自然语言指令连续完成一长串任务(比如"打开抽屉→拿起蓝色积木→把积木推进抽屉→打开滑门")。它提供约 24 小时的"随便玩"遥操作数据、34 个任务、几百条自然语言指令,还设计了从易到难的评测(同环境、多环境、零样本新环境)。论文用当时的 SOTA 方法(MCIL)一测——连续做 5 个任务的成功率只有 0.08%,说明这道题非常难、大有研究空间。
所以这一节是想说:CALVIN 的核心就一句话——它是第一个把"自然语言 + 多模态感知 + 7 自由度连续控制 + 长程操作 + 泛化"全都塞进一份考卷的机器人基准。
这是个什么场景
想象未来家里有个机器人,你对它说:"打开抽屉,把蓝色积木放进去,然后关上抽屉,再把灯打开。" 这一句话里有好几个连续的子任务,而且用的是没有约束的自然语言(你不会按固定格式说话)。
要研究"怎么让机器人做到这件事",学术界需要一个统一的基准(benchmark)——一套标准的环境、数据、任务、评测指标,让所有人用同一把尺子量自己的方法,才能公平比较、可复现地推进研究。
但当时的基准都有欠缺:
- 有的只做单个任务、一次学一个。
- 有的用目标图像或独热技能选择器指定任务——普通用户没法用这些方式指挥机器人(你不会给机器人看一张"抽屉打开的照片")。
- 有的(如 ALFRED)用预定义的离散动作原语(7 个固定动作),不是真正的连续控制。
- 缺乏对长程(一连串任务)和零样本泛化(换个没见过的环境)的评测。
CALVIN 要填的坑:做一个既要听懂无约束自然语言、又要用高维多模态感知、又要做 7 自由度连续控制、又要连续完成长程任务、还要能泛化的综合基准。
所以这一节是想说:研究"机器人听人话干长活"需要统一考卷,但已有基准要么单任务、要么任务指定方式不实用、要么不是连续控制、要么不考长程和泛化——CALVIN 来补这个综合考卷。

之前的人怎么做的,为什么不够好
方案 A:单任务学习 一次学一个任务。类比:只会做一道题的学生。问题:没有泛化和组合能力,无法应对"一句话里一串任务"。
方案 B:用目标图像 / 独热技能选择器指定任务 给机器人一张目标状态图,或一个"技能编号"。类比:不用说话,直接给答案图或按编号。问题:普通用户根本没法这么指挥——你不会随身带"抽屉打开的照片",也记不住技能编号。不实用。
方案 C:离散动作原语的语言基准(ALFRED) 最接近 CALVIN 的基准,含导航+操作的语言指令,但用 7 个预定义动作原语。类比:只能从固定几个动作里挑。问题:不是连续控制,agent 只需"分类"选动作,不用学会真正的连续运动技能。
方案 D:受限环境 / 简化执行器的语言到动作研究 在受限环境或简化机械上研究语言映射到动作。问题:离真实的、需要精细连续控制的桌面操作还远。
共性问题:缺乏标准化——没有统一的基准和公开实现,不同方法难以公平比较、难以复现。而且大多不同时具备"无约束语言 + 多模态高维输入 + 连续控制 + 长程 + 泛化"这几项。
所以这一节是想说:单任务不泛化、目标图像/编号不实用、离散原语不是连续控制、受限环境不真实、且缺标准化——缺一个把这些都补齐的综合基准。
这篇论文的新想法
类比:以前的基准像"只考一道题"或"选择题",CALVIN 是一份"综合大题连续答卷"——要求学生(机器人)听懂大白话,连着解一串主观题。
CALVIN 不是提出一个新方法,而是提出一个新基准 + 数据集 + 评测协议。它的核心贡献是把五件难事第一次组合进同一个公开基准:
无约束自然语言条件:任务用人话指定(且测试用的指令是训练没见过的新说法),不是目标图像或编号。
多模态高维输入:提供静态相机和夹爪相机的 RGB-D、触觉、本体感受(关节角等)——研究者可自由组合传感器。
7 自由度连续闭环控制:真正的连续动作(30Hz),支持绝对笛卡尔、相对笛卡尔、关节空间三种动作空间。
长程任务:要求连续完成 5 个子任务,且任意组合任意顺序——考"子目标间的转换"。
系统的泛化评测:三档难度——单环境、多环境、零样本新环境(在 3 个环境训、在第 4 个没见过的环境测)。
再配上约 24 小时"随便玩"的遥操作数据(任务无关、多样、便宜),以及只标注 1% 的语言指令的设定(模拟真实中标注昂贵)。
【CALVIN 把五座大山合成一份考卷】
┌ 无约束自然语言(测试用训练没见过的新说法)
├ 多模态高维输入(静态相机 & 夹爪相机 RGB-D + 触觉 + 本体感受)
├ 7-DoF 连续闭环控制(30Hz; 绝对笛卡尔/相对笛卡尔/关节空间)
├ 长程任务(连续完成 5 个子任务, 任意组合任意顺序)
└ 系统泛化(单环境 → 多环境 → 零样本新环境 D)
数据设定:~24h 任务无关"随便玩"遥操作数据 + 仅 1% 语言标注(模拟标注昂贵)
所以这一节是想说:CALVIN 的新意不是新算法,而是第一次把"无约束语言 + 多模态 + 连续控制 + 长程 + 泛化"这五座大山合成一份标准考卷,配上便宜的玩耍数据和实用的标注设定。
它分几步做的(方法)
CALVIN 由三大部分组成:环境、数据集、挑战(评测)。整体结构:
[环境] 4个桌面环境 A/B/C/D (纹理/布局各异)
7-DOF Franka + 夹爪 | 滑门/抽屉/按钮(绿LED)/开关(灯泡)/3个彩色积木 | PyBullet
传感器: 静态RGB-D + 夹爪RGB-D + 触觉 + 本体感受
动作: 绝对笛卡尔 / 相对笛卡尔 / 关节空间, 30Hz
│
[数据集] ~24h 遥操作"随便玩" (每环境6h) = ~2.4M步 = ~40M短窗口
只1%配语言标注 → 389条自然语言指令(34任务, 每任务~11种说法) + MiniLM嵌入
│
[挑战] 三档: 单环境(D→D) / 多环境(ABCD→D) / 零样本(ABC→D)
指标: MTLC(34任务) + LH-MTLC(1000条5任务链)
│
[基线] MCIL (多上下文模仿学习, seq2seq CVAE)
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 环境:4 个结构相似但外观各异的桌面
类比:4 间布置略有不同的厨房,家具都在但位置和贴纸不一样——好考"换个房间还认不认得"。
输入:无(这是仿真环境设计)。
处理:4 个环境(A/B/C/D),每个都有 7 自由度 Franka Emika Panda 机械臂 + 平行夹爪,桌上有可开关的滑门、抽屉、切换绿灯的按钮、控制灯泡的开关、3 个不同颜色形状的积木。关键设计:所有环境纹理不同、所有静态元件(滑门、抽屉、按钮、开关)位置不同——这样才能考泛化(换环境后还能不能"打开滑门",哪怕它位置和外观都变了)。桌子、机器人、静态相机的位置在各环境相同。物理用 PyBullet 引擎(支持 GPU 快速渲染、大规模并行采数据)。
输出:4 个可玩、可评测的桌面操作环境。
小结:4 个结构相似但纹理/布局各异的桌面环境,为泛化评测(尤其零样本换环境)打下基础。
5.2 观测与动作空间:多模态、多选择
类比:给机器人配一整套感官(多个摄像头 + 触觉 + 身体感觉),还让研究者自选用哪几种、用哪种动作方式。
输入:环境状态。
处理:
- 观测:静态相机 RGB-D(200×200)、夹爪相机 RGB-D(84×84)、触觉图(120×160×2)、本体感受(末端位置/朝向、夹爪宽度、7 个关节角)。研究者可自由组合。
- 动作:三选一——绝对笛卡尔位姿(末端位置+朝向+夹爪,相对世界系)、相对笛卡尔位移(相对夹爪系)、关节空间(7 关节+夹爪)。30Hz 闭环连续控制。论文鼓励研究不同观测/动作组合:静态相机+绝对动作适合大范围移动,夹爪相机+相对动作适合抓取堆叠这种精细控制,触觉适合"抓住把手滑门"这种要保持稳定抓握的任务。
输出:灵活的多模态观测 + 三种动作空间。
小结:提供静态/夹爪 RGB-D、触觉、本体感受多模态观测和三种动作空间,让研究者按任务需求自由权衡"精细控制 vs 大范围移动"。
5.3 数据集:24 小时"随便玩" + 1% 语言标注
类比:不是请专家一板一眼地演示每个任务,而是让普通人在环境里"随便玩",事后只给一小部分片段配上文字说明。
输入:3 个未受训、不知道下游任务的人,用 HTC Vive VR 头盔遥操作。
处理:
- 玩耍数据(play data):每个环境玩约 6 小时、共 24 小时,唯一要求是"探索环境但别把物体弄掉桌"。这产生约 2.4M 交互步、约 40M 个 1-2 秒的短窗口(用于重标注的目标条件模仿学习)。玩耍数据的好处:任务无关、多样、便宜,含探索和次优行为(如"重试"),比只有专家轨迹的数据更丰富、覆盖多种解法。
- 语言标注:用记录的环境状态程序化地给片段贴标签——只有展示出有意义技能的片段才标。收集了 400 多条众包自然语言指令,对应 34 个任务(每任务约 11 种同义说法,共 389 条唯一指令)。关键设定:只标注 1% 的数据(模拟真实中不可能给所有数据配语言标注)。还提供预计算的 MiniLM 语言嵌入(384 维)。
输出:约 24h 玩耍数据 + 34 任务的语言指令(仅 1% 标注)+ MiniLM 嵌入。
小结:用便宜的"随便玩"数据覆盖状态空间、只标注 1% 配语言、程序化贴标签——务实地模拟真实世界数据采集的约束。
5.4 挑战:三档难度 + 两个评测指标
类比:考卷分"本班测""跨班测""转学测"三档,每档考"单题"和"连续大题"两种。
输入:训练好的语言条件策略。
处理:
- 三档环境组合:单环境(D→D,训练测试同环境,即 Lynch 等的设定);多环境(ABCD→D,要泛化到多种纹理/布局,但数据也更多);零样本多环境(ABC→D,最难,测试环境训练时完全没见过,但所有元素以不同位置出现在训练环境里)。
- 两个指标:MTLC(多任务语言控制,考 34 个任务各自的成功率,每任务 10 次 rollout,用训练没见过的新指令);LH-MTLC(长程多任务,把 34 任务当子目标,构造 1000 条由 5 个连续任务组成的合法指令链,只有完成当前子任务才转到下一个;每序列后把机器人重置到中性位,打破初始状态和任务的相关性,逼 agent 完全靠语言判断任务)。
输出:一套从易到难、可复现的评测协议。
小结:三档环境(同/多/零样本)× 两指标(单任务 MTLC / 长程 LH-MTLC)构成系统的难度阶梯,尤其长程链和零样本环境最能区分方法优劣。
5.5 基线方法 MCIL:多上下文模仿学习
类比:把"随便玩"的数据回头贴上"这段其实是在达成某个目标"的标签,再学一个"给目标就照做"的策略。
输入:未分段的玩耍数据。
处理:MCIL(Multi-context Imitation Learning)——先把玩耍数据重标注(relabeling):把每个到访过的状态当成"达成的目标",之前的状态和动作就是"达成该目标的最优行为"。这样从无标注玩耍数据里生成大量"目标条件"演示,用最大似然目标条件模仿学习目标训练。用 seq2seq 条件变分自编码器(CVAE) 通过一个潜在"计划"空间来处理自由数据里的多模态性。对语言条件:因为无法把任意状态重标注成语言目标(语言目标空间≠观测空间),所以只给少量窗口配语言(<1%),训一个既能吃目标图像又能吃语言的单一策略。实现用 Adam、学习率 1e-4、KL 权重 β=0.001,窗口长 16-32。
输出:一个语言条件的连续控制策略(作为基准的性能参照)。
小结:MCIL 用重标注把玩耍数据变成目标条件演示、用 seq2seq CVAE 的潜在计划处理多模态,只需 1% 语言标注就能学语言条件策略——但它在 CALVIN 长程任务上表现很差,正说明基准之难。

关键数字(What works)
CALVIN 是基准论文,数字重点看"这道题有多难、基线差到什么程度"。
数字 1:数据集规模
| 维度 | 数据 |
|---|---|
| 玩耍数据时长 | ~24 小时(每环境 6h) |
| 交互步数 | ~2.4M |
| 短窗口数(1-2 秒) | ~40M |
| 环境数 | 4(A/B/C/D) |
| 任务数 | 34 |
| 语言指令 | 389 条唯一(每任务 ~11 种说法) |
| 语言标注比例 | 仅 1% |
| 机器人 | 7-DOF Franka Panda + 平行夹爪 |
关键含义:用便宜的"随便玩"数据覆盖状态空间,只标注 1% 配语言——务实且规模可观。
数字 2:单任务成功率 MTLC(不同传感器,D→D,34 任务)
| 传感器 | MTLC 成功率 |
|---|---|
| 静态 RGB | 53.9% |
| 静态 RGB + 夹爪 RGB | 51.8% |
| 静态 RGB + 触觉 | 54.2% |
| 静态 RGB-D + 夹爪 RGB-D | 46.1% |
关键含义:单任务上最高 53.9%,加夹爪相机/深度/触觉没带来明显提升(论文推测夹爪相机需配相对动作才有用,且没做数据增强)。
数字 3:长程成功率 LH-MTLC(连续完成 N 个任务,1000 条链)
| 训练→测试 | 1 个 | 2 个 | 3 个 | 4 个 | 5 个 |
|---|---|---|---|---|---|
| D→D(静态 RGB) | 48.9% | 12.9% | 2.6% | 0.5% | 0.08% |
| A,B,C,D→D | 28.2% | 2.5% | 0.3% | 0% | 0% |
| A,B,C→D(零样本) | 20.2% | 0.2% | 0% | 0% | 0% |
关键含义:这是全文最重要的数字。连续做 5 个任务,即便同环境也只有 0.08%;多环境掉到 0%;零样本更是从第 2 个就几乎归零。长程 + 泛化极难,误差随任务链急剧累积。
数字 4:任务与评测设计
| 维度 | 数据 |
|---|---|
| 控制频率 | 30 Hz |
| 长程评测链 | 1000 条(每条 5 个连续子任务) |
| 语言嵌入 | MiniLM,384 维,词表 30522 |
| 动作空间 | 绝对笛卡尔 / 相对笛卡尔 / 关节空间 |
| 任务完成判定 | 首尾帧环境状态变化(可自动检测,任意长度片段) |
关键含义:任务完成靠"首尾状态变化"自动判定,既能当强化学习的稀疏奖励,又能自动给离线数据打标签。
所以这一节是想说:数字证明 CALVIN 是一道极难的题——单任务勉强过半,长程连续 5 任务几乎归零,零样本泛化更是崩溃,给后续研究留了巨大空间。
实验结果说明了什么
问题一:为什么单任务能到 53.9%,长程却崩到 0.08%? 因为误差会沿任务链急剧累积。做对 1 个任务成功率 48.9%,但要连续做对 5 个,就约等于 0.5⁵ 量级——每一步的小失败都会让后续子任务的初始状态偏离,越往后越难。而且每个序列后机器人被重置到中性位,打破了"初始状态暗示任务"的捷径,逼 agent 完全靠语言判断——这暴露了当前方法在"子目标间转换"和"纯靠语言 grounding"上的根本弱点。
问题二:加更多传感器为什么没帮上忙? 反直觉但有原因。加夹爪相机、深度、触觉都没明显提升单任务成功率。论文推测:(1) 夹爪相机可能需要配相对动作(相对夹爪系)才能发挥,而基线用的是绝对动作;(2) 没做图像数据增强;(3) 简单的特征拼接式多模态融合可能不够,需要更精细的融合(如专家混合、视角不变对比学习)。这说明"有更多传感器"不等于"用好了传感器"——怎么融合是关键。
问题三:零样本换环境为什么崩得这么惨? 因为它违背了模仿学习"训练和测试同分布"的基本假设。零样本设定下测试环境的纹理和元件位置都变了,策略没见过。论文指出:朴素地在多域间共享数据可能很脆弱,会加剧策略分布偏移;需要域适应、更好的数据增强、更依赖对纹理不变的深度输入等技术。这说明泛化到新环境是尚未解决的硬骨头。
问题四:模型在语言 grounding 上有什么典型错误? 会混淆颜色。策略有时能正确执行积木操作,但把指令里的"红色"和"蓝色"搞混——因为语言模型把含"red"和"blue"的句子嵌入得很相似。论文建议:反向传播穿过整个语言模型、用对齐视觉和语言表示的辅助损失(如 CLIP 式)可能有助于解决这个感知 grounding 难题。
所以这一节是想说:实验揭示了四个硬骨头——长程误差累积、多传感器融合不到位、零样本泛化崩溃、语言颜色 grounding 混淆,这些正是 CALVIN 想推动解决的问题。
你应该懂的几个新词
基准(benchmark):统一的环境+数据+任务+指标,让不同方法用同一把尺子公平比较、可复现。CALVIN 就是一个基准。
语言条件策略(language-conditioned policy):以自然语言指令为条件、输出动作的策略。CALVIN 考的核心。
长程任务(long-horizon):需要连续完成多个子任务的任务(如连做 5 件事)。CALVIN 的最大难点。
7 自由度(7-DOF)连续控制:机械臂有 7 个关节可连续调节,动作是连续值而非离散选项。
玩耍数据(play data):人在环境里无目的"随便玩"产生的数据,任务无关、多样、便宜。CALVIN 的主数据来源。
重标注(relabeling / hindsight):把到访过的任意状态当成"目标",反过来把之前的行为当成"达成该目标的演示"。MCIL 的核心技巧。
多上下文模仿学习(MCIL):能同时从目标图像和语言等多种"目标描述"学习的单一策略。CALVIN 的基线。
CVAE(条件变分自编码器):用潜在变量建模数据多模态性的生成模型。MCIL 用它的潜在"计划"空间。
零样本泛化(zero-shot):在训练没见过的环境/指令上直接测试。CALVIN 最难的一档。
MiniLM:一个蒸馏的小语言模型,把句子映射成 384 维向量。CALVIN 提供其预计算嵌入。
闭环控制(closed-loop):每步根据最新观测调整动作(vs 开环:一次规划到底)。CALVIN 要求 30Hz 闭环。
所以这一节是想说:这些词是读任何"语言条件机器人 + 基准 + 模仿学习"论文都会反复出现的基础词汇。
它有什么搞不定的
- 本身是基准,不提供解法:CALVIN 定义了难题并给了差强人意的基线(MCIL),但把"怎么解"留给社区——它是考卷不是答案。
- 仿真,非真机:在 PyBullet 仿真里,虽力求贴近真实(不用仿真器特权状态),但仍有 sim-to-real 差距,真机部署另说。
- 物体简化为单色基本形状:为降低语言条件多任务闭环控制的难度,物体是单色简单形状——论文自己说未来会扩展到更真实多样的物体。
- 基线长程几乎失败:MCIL 连续 5 任务成功率 0.08%,多环境和零样本更差——基线远不够用,说明题目超前于当时方法。
- 语言 grounding 弱:基线会混淆颜色(red/blue 嵌入相似),感知 grounding 是未解难题。
- 多传感器未被有效利用:加夹爪相机/触觉没提升,说明基准提供的丰富传感器还需更好的方法去用。
所以这一节是想说:CALVIN 作为基准很成功地暴露了难点,但它不提供解法、是仿真、物体简化、基线孱弱——这些"局限"恰恰是它留给后续研究的空间。
它和别的论文是什么关系
- 上游(被它借用/对标):
- Learning Latent Plans from Play(Lynch et al. 2019)/ MCIL(Lynch & Sermanet 2021):玩耍数据 + 重标注 + 多上下文模仿的思想源头,CALVIN 的桌面环境和基线都基于它,并加以扩展(更多子任务 34 vs 18、更长评测 5 vs 4、多环境、零样本、视觉 grounding)。
- ALFRED(Shridhar et al. 2020):最接近的语言基准,但用离散动作原语;CALVIN 是连续控制、无约束语言。
- MiniLM / PyBullet / TACTO:语言嵌入 / 物理引擎 / 触觉仿真的工具。
- 对比关系:
- 和 Meta-World / RLBench:那些是多任务操作基准,但 CALVIN 专注"无约束语言 + 长程 + 泛化"。
- 和 目标图像/独热技能基准:CALVIN 用更实用的自然语言指定任务。
- 下游 / 同族:CALVIN 成了语言条件机器人操作的标准试金石,后续大量方法(如 HULC、GR-1、3D-VLA、各种 VLA)都在 CALVIN 上刷分。它和本仓库的 3d-vla(在 CALVIN 上评测长程规划)、以及 bridgedata-v2 等数据集/基准工作同族——都在为"语言驱动的通用机器人"提供数据和评测基础设施。
所以这一节是想说:CALVIN 站在 Lynch 的玩耍数据 + MCIL 的肩膀上,扩展成一个更难更全的语言条件长程操作基准,成为后续 VLA/语言条件策略的标准考场。
和本导读的关系
本笔记对应导读 Ch21:数据集与评测。
导读 Ch21 讲了机器人学习的"数据与评测基础设施"——没有好的数据集和基准,方法就无法公平比较、可复现地进步。CALVIN 是"语言条件长程操作"这一方向的标杆基准。读完本笔记,建议:对照 bridgedata-v2 深读笔记(真机大规模数据集,和 CALVIN 的仿真基准互补),以及 behavior-1k(更大规模、更真实的家务任务仿真基准),能看清"仿真基准 vs 真机数据集""窄任务 vs 广任务"的不同取舍。再结合 3d-vla 笔记(它就在 CALVIN 上评测长程规划),能理解"基准如何驱动方法演进"——CALVIN 定义的难题(长程、零样本)正是后续 VLA 想攻克的目标。
所以这一节是想说:本笔记是导读 Ch21 数据集与评测在"语言条件长程操作基准"方向的深度展开,和 bridgedata-v2、behavior-1k 对照能看清评测基础设施的全景。
思考题
以下问题检验你是否真正理解了 CALVIN 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:CALVIN 为什么坚持用"无约束自然语言"来指定任务,而不用更容易处理的目标图像或技能编号?
提示
因为终极目标是"普通人能指挥机器人"。目标图像不实用——你不会随身带一张"抽屉打开、蓝积木在里面"的照片;技能编号也不实用——普通用户记不住也不愿记编号。自然语言是人类最自然、最有表达力的指令方式:它能抽象("把最远的杯子"可推广到无穷物体)、能组合(把复杂任务描述成一串指令)。虽然处理自然语言难得多(要解决 grounding、歧义、同义表达),但这才是真实场景的需求。CALVIN 特意用训练没见过的新说法来测试,就是要逼方法真正理解语言而非记住固定句子。选难而实用的路,正是基准的价值。
Q2:CALVIN 用"随便玩"的数据而不是"专家逐任务演示"。这个选择有什么优势和代价?
提示
优势:(1) 便宜——不用为每个任务专门设计和采集演示,让人随便玩就行;(2) 任务无关、可复用——同一批玩耍数据能通过重标注支持很多任务的学习;(3) 更丰富——含探索和次优行为(如重试、纠错),覆盖"多种解法"的多模态空间,而专家演示往往只展示一种最优解,学出来的策略遇到偏离就不会恢复。代价:(1) 数据里各任务出现频率不均,尤其"需要先完成前置任务才能做的任务"很稀少;(2) 数据自由无标签,需要重标注和事后语言标注才能用;(3) 含次优行为,若不加处理可能学到不好的动作。CALVIN 用"只标注 1% + 重标注"来务实地利用玩耍数据,模拟真实中标注昂贵的约束。
Q3:为什么长程评测里,连续 5 个任务的成功率会从单任务的 48.9% 暴跌到 0.08%?这个数字说明了什么?
提示
因为成功率沿任务链呈乘法式衰减。如果每个任务独立成功率约 p,连续做 n 个全对的概率约 pⁿ。单任务约 0.49,连做 5 个理论上约 0.49⁵≈0.028(实际更低到 0.08%,因为误差还会累积——前一个任务结束时的状态偏差会让下一个任务更难)。这个暴跌说明:长程任务的根本挑战不是"会不会做单个任务",而是"能否稳定地在子目标间转换、并从前一步的误差中恢复"。它揭示了当时方法缺乏可靠的长程规划和纠错能力。这也是为什么 CALVIN 把长程作为核心难点——它比单任务更能区分方法的真实水平。
Q4:CALVIN 在长程评测里,每完成一个序列就把机器人重置到"中性位置"。为什么要这么做?
提示
为了打破"初始状态和任务的相关性",逼 agent 真正靠语言判断任务。如果不重置,机器人每次任务的起始姿态可能和特定任务强相关(比如"手总是从抽屉附近开始 → 那就是开抽屉任务"),agent 就能靠"记住初始姿态"这个捷径蒙对,而不是真的听懂了语言。论文的定性分析也发现基线性能严重依赖初始位置,怀疑存在"本体感受信息和目标动作之间的因果混淆"。重置到中性位后,agent 无法从初始姿态推断任务,必须完全依赖语言指令来判断该做什么——这才真正考验了"语言 grounding"能力。这是一个防止"作弊捷径"的重要评测设计。
Q5:加了夹爪相机、深度、触觉这些额外传感器,单任务成功率却没提升。这是否说明这些传感器没用?
提示
不能这么下结论——"没提升"不等于"没用",很可能是"没用好"。论文给了几个可能原因:(1) 夹爪相机可能需要配合相对动作空间(相对夹爪系)才能发挥,而基线用的是绝对动作,导致夹爪相机的近距离细节信息没被有效利用;(2) 基线为贴近原实现没做图像数据增强,可能限制了额外视觉信息的价值;(3) 简单的特征拼接式融合可能不够,需要更精细的多模态融合方法(专家混合、视角不变对比学习)。所以这更可能是"基线方法没能把丰富传感器用起来",而非传感器本身无用。这恰恰是 CALVIN 想推动的研究——如何设计能有效利用多模态感知的方法。这提醒我们:评测结果要结合方法局限来解读,别把"当前方法的失败"误读成"信息源的无用"。
Q6:基线会混淆"红色"和"蓝色"积木。这个具体错误揭示了语言条件机器人的什么深层难题?
提示
揭示了"语言 grounding(语言落地)"的难题——把抽象的语言符号对应到具体的视觉感知上。基线用 MiniLM 把整句话编码成一个向量,而含"red"和"blue"的句子在通用语料上训练的语言模型里嵌入得很相似(都是颜色词、句法位置相同),所以模型难以区分。这说明:仅靠一个冻结的、在通用文本上训练的语言模型,不足以支撑需要精细视觉区分的机器人任务——语言表示没有和视觉表示对齐。论文建议反向传播穿过整个语言模型、加视觉-语言对齐的辅助损失(如 CLIP 式对比学习)。这个小错误折射出的是多模态 grounding 的核心挑战:语言、视觉、动作三者的表示如何对齐。这也是后续 VLA 模型(用视觉-语言预训练)想解决的问题。
Q7:如果让你设计一个方法来攻克 CALVIN 的零样本多环境(ABC→D)设定,你会从哪些方向入手?
提示
思路可从论文的提示和领域常识出发:(1) 依赖对纹理不变的输入——深度图对纹理变化不敏感,多用深度可能更鲁棒(零样本主要是纹理和位置变了);(2) 强数据增强——训练时随机化纹理、光照、位置(域随机化),让策略见过各种变化而不依赖特定外观;(3) 域适应技术——显式对齐不同环境的特征分布;(4) 更好的视觉-语言 grounding——用视觉-语言预训练模型(CLIP 式)让"滑门"这个词对应到"滑门的功能/几何"而非"特定环境里滑门的像素样子",从而位置/外观变了也认得;(5) 更好的多模态融合和表示学习。核心矛盾是:模仿学习假设训练测试同分布,而零样本天生违背它——所以要么让训练分布足够广(增强/随机化)覆盖测试,要么学到对变化不变的表示。后续在 CALVIN 上表现好的方法(如用预训练视觉-语言模型的 VLA)大多走了"更强表示 + 更多数据"这条路。
所以这一节是想说:能回答这 7 题,你就真正理解了 CALVIN 为什么用自然语言、用玩耍数据、考长程、重置中性位,以及零样本泛化和语言 grounding 的深层难题。
一些好奇心问答(FAQ)
Q1:CALVIN 是数据集还是基准? 两者都是。它包含环境(可交互仿真)、数据集(24h 玩耍数据+语言标注)、挑战(评测协议)三部分——是一个完整的基准框架。
Q2:为什么只标注 1% 的数据? 模拟真实约束——现实中不可能给所有机器人交互数据都配上众包语言标注(太贵)。CALVIN 证明只需 <1% 语言标注,配合大量无标注玩耍数据就能学语言条件策略。
Q3:MTLC 和 LH-MTLC 有什么区别? MTLC 考单个任务的成功率(34 个任务各自测);LH-MTLC 考连续完成一串任务(1000 条 5 任务链),是长程能力的核心考验,也是最能拉开方法差距的指标。
Q4:三档难度哪个最重要? 零样本多环境(ABC→D)最能反映真实部署——服务机器人到你家(没见过的环境)也得能干活。它也最难,基线几乎全崩。
Q5:为什么物体是单色简单积木,不用真实物体? 为降低"语言条件多任务闭环控制"这个本已很难的问题的复杂度。论文说未来会扩展到更真实多样的物体。
Q6:基线 MCIL 为什么表现这么差?这是坏事吗? 不是坏事。基线差恰恰说明这道题难、有研究价值——一个所有方法都能满分的基准是没用的。CALVIN 的价值就在于定义了一个足够难、能推动进步的挑战。
所以这一节是想说:CALVIN 的实操问题(数据集/基准定位、1% 标注、两指标区别、三档难度、简化物体、基线为何差)都有明确答案。
如果你想再深入
按"思想源头 → 对标基准 → 后续方法 → 同族"排序:
- 思想源头:Learning Latent Plans from Play / MCIL(Lynch et al.) — 玩耍数据 + 重标注 + 多上下文模仿,CALVIN 的基础,理解 play data 范式。
- 对标基准:ALFRED(Shridhar et al. 2020) — 最接近的语言基准(离散动作),对照理解 CALVIN 的连续控制优势。
- 后续方法:3D-VLA / HULC / GR-1 — 在 CALVIN 上刷分的方法,本仓库有 3d-vla 深读笔记,看基准如何驱动方法。
- 多模态融合:TACTO(触觉仿真)/ CLIP — 理解如何更好地利用触觉和做视觉-语言对齐。
- 同族基准/数据集:bridgedata-v2 / behavior-1k — 本仓库有笔记,对照真机数据集和更大规模仿真基准。
所以这一节是想说:把 MCIL + ALFRED + 3D-VLA 连起来读,就能看清"语言条件机器人基准如何定义难题、又如何被后续方法逐步攻克"的脉络。
原文信息
BibTeX
@article{mees2022calvin,
title = {CALVIN: A Benchmark for Language-Conditioned Policy Learning for Long-Horizon Robot Manipulation Tasks},
author = {Mees, Oier and Hermann, Lukas and Rosete-Beas, Erick and Burgard, Wolfram},
journal = {IEEE Robotics and Automation Letters (RA-L)},
volume = {7},
number = {3},
pages = {7327--7334},
year = {2022}
}
链接
所以这一节是想说:这是 Mees et al. 2022 年发表在 RA-L 的工作,第一次把"无约束语言 + 多模态 + 连续控制 + 长程 + 泛化"合成一份公开考卷,成为语言条件机器人操作的标准基准。
◼
引用本笔记 / Cite this note
@online{eai_calvin_2026,
title = {(readable note) CALVIN},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2022 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/calvin/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?