Ch06: 具身 AI 的时间线——2021-2025 关键里程碑
Ch06: 具身 AI 的时间线——2021-2025 关键里程碑
Part 2: 全景概念 前置章节:Ch05: 两条技术路线——模块化 vs 端到端 后续章节:Ch07: 从论文到机器人——理解学术论文的结构与读法
1. 为什么需要一条时间线
论文不是孤立的——每一篇都站在前人的肩膀上,回应上一篇的局限,提出新的方案,然后被下一篇改进。如果你不知道论文之间的时间先后和因果关系,读每一篇都会觉得"这也行,那也行",分不清主流和支流。
这一章用时间线把 2021-2025 年具身 AI 的关键里程碑串起来。读完后你会看到一条清晰的叙事脉络:基础模型能力就位 → 感知和语言对齐 → LLM 驱动规划 → 端到端 VLA 崛起 → 数据和仿真生态成熟 → 混合路线和产业化。
2. 前史:2016-2020(快速回顾)
具身智能不是 2021 年凭空出现的。在 2016-2020 年间,有几件事为后来的爆发埋下了种子。
2017:Transformer 诞生。 Vaswani 等人提出了 Attention Is All You Need,奠定了后来所有大模型的基础架构。当时没人想到它会用在机器人上——大家还在用 CNN + RNN 做视觉和语言处理。但 Transformer 的"一切都是序列"思想,后来被 RT-1 直接借用来把机器人观测和动作也编码为序列。
2018:RF-Pose 穿墙看人。 MIT 的 Dina Katabi 团队用 WiFi 信号穿墙估计人体姿态。这不是机器人论文,但它证明了"不用摄像头也能感知"——这个思想后来发展成你的 13 篇中的三篇射频感知论文。
2019:Dreamer V1 开始在想象中训练。 Hafner 等人的 Dreamer 系列第一版,第一次大规模证明"世界模型 + 在想象中做强化学习"能在 Atari 游戏上达到接近真实训练的效果。这个思路后来从游戏扩展到机器人控制。
2019:Habitat 发布。 Meta AI 发布了 Habitat 仿真平台,让研究者能在逼真的虚拟室内环境中训练和测试导航机器人。仿真平台的出现大幅降低了具身智能研究的门槛——不需要买真机器人也能做研究。
2020:Isaac Gym 发布。 NVIDIA 推出 GPU 加速的机器人仿真器,能在一张 GPU 上同时跑几千个仿真环境。训练速度比传统 CPU 仿真快 2-3 个数量级,彻底改变了 RL-for-robotics 的可行性。
这些种子在 2021-2022 年同时开花。
3. 2021:视觉-语言对齐的元年
CLIP(2021.01,OpenAI)
这是什么:用 4 亿对图文数据训练一个双编码器模型,让图片向量和文字向量在同一个空间里对齐。
为什么重要:CLIP 是后来所有"看图说话"模型的地基。在 CLIP 之前,视觉模型和语言模型是分离的——你需要先训练一个图像分类器,再用一个独立的语言模型理解分类结果。CLIP 打通了这堵墙:只需要一次点积运算就能判断"这张图和这段文字有多相关"。
对具身 AI 的影响:CLIP 的嵌入空间后来被大量复用——mmCLIP 把毫米波雷达信号对齐到 CLIP 空间,ImageBind 把 6 种模态都对齐到 CLIP 空间,SigLIP(OpenVLA 使用的视觉编码器之一)是 CLIP 的改进版。可以说 CLIP 是整个视觉-语言-动作研究的"坐标系原点"。
BLIP(2022.01, Salesforce)& BLIP-2(2023.01)
这是什么:BLIP 提出了"先生成后过滤"的数据清洗策略,在脏数据上也能训练出好的 VLM。BLIP-2 更进一步,提出了 Q-Former(一个轻量级"翻译器"),把冻结的视觉编码器和冻结的语言模型连接起来。
为什么重要:BLIP-2 证明了一个关键思路——你不需要从零训练一个多模态大模型。只需要训练一个小的"桥梁模块",就能把现有的视觉模型(比如 ViT-G)和语言模型(比如 Flan-T5)接在一起。这大幅降低了 VLM 的训练成本。
Flamingo(2022.04, DeepMind)
这是什么:DeepMind 的多模态大模型,用 Perceiver Resampler + Gated Cross-Attention 把视觉信息注入冻结的 LLM。支持多图多轮对话,few-shot 学习能力极强。
为什么重要:Flamingo 证明了"冻住 LLM,只训练视觉接入模块"的路线是可行的——后来 LLaVA 和 RoboFlamingo 都沿用了这个思路。
4. 2022:LLM 驱动机器人的元年
SayCan(2022.04,Google Robotics)
这是什么:第一个大规模证明"LLM 能指挥真实机器人完成厨房任务"的工作。见 Ch05 的详细分析。
为什么重要:SayCan 的核心贡献不是具体的技术方案——而是"证明了这条路走得通"。在 SayCan 之前,大多数人认为 LLM 和机器人是两个世界。SayCan 之后,"用 LLM 做机器人规划"变成了一个爆炸性的研究方向。
RT-1(2022.12,Google Robotics)
这是什么:Google 用 13 万条真机数据(13 台 Everyday Robot × 17 个月)训练的第一个大规模端到端机器人策略。基于 EfficientNet + TokenLearner + Transformer 架构。
为什么重要:RT-1 证明了三件事——(1) Transformer 架构可以直接用于机器人控制,(2) 大规模真机数据训练确实能带来泛化,(3) 多任务训练让模型能执行 700 多种不同指令。RT-1 是 RT-2 和 OpenVLA 的直系前辈。
Inner Monologue(2022.07,Google)
这是什么:在 SayCan 基础上加入闭环反馈——每步执行后用视觉模型检查成功/失败,如果失败就让 LLM 重新规划。
为什么重要:解决了 SayCan 的弱闭环问题。"执行 → 检查 → 反馈 → 重规划"的循环后来成为模块化系统的标准范式。
Whisper(2022.09,OpenAI)
这是什么:用 68 万小时多语言音频数据训练的通用语音识别模型。零样本在多种语言上达到接近或超过监督方法的水平。
为什么重要:Whisper 不是机器人论文,但它给具身 AI 提供了关键的听觉基础——机器人需要听懂人的语音指令。Whisper 之前,语音识别需要大量标注数据和语言特定的模型。Whisper 之后,"直接用预训练模型做语音接口"变成了可行的工程方案。
Diffusion Policy(2023.03,Chi et al.)
这是什么:第一次把扩散模型用于机器人策略学习。核心思想:把"选择动作"重新定义为"去噪"——从随机噪声开始,逐步去噪得到一段平滑的动作轨迹。
为什么重要:解决了行为克隆的老大难问题——多模态动作分布。传统 BC 对多种可行动作求平均,结果哪种都不是。Diffusion Policy 能"完整地选择某一种模式",输出稳定且多样。
5. 2023:VLA 的诞生和 VLM 的爆发
LLaVA(2023.04,Wisconsin-Madison & Microsoft)
这是什么:用一个简单的线性投影层把 CLIP 视觉编码器的输出映射到 LLaMA 语言模型的输入空间。用 GPT-4 生成的指令遵循数据做微调。
为什么重要:LLaVA 的架构极其简单——一个投影层就完事了。但它证明了"简单的视觉-语言连接 + 好的数据"就能产生惊人的多模态理解能力。这个简洁的设计后来被 OpenVLA 直接继承:OpenVLA 的视觉接入方式本质上就是 LLaVA 的方法。
Code as Policies(2023.02,Google Brain)
这是什么:让 LLM 直接写 Python 代码控制机器人。零训练、零微调。见 Ch05 的详细分析。
为什么重要:把"规划"变成了"编程",模块化路线的灵活性翻倍。同时证明了一个重要论点:不训练任何东西,只靠 LLM 的预训练知识 + 好的 prompt,就能做出有用的机器人系统。
ImageBind(2023.05,Meta AI)
这是什么:用图像作为"锚点",把 6 种模态(图、文、音、深度、热红外、IMU)全部对齐到同一个嵌入空间。只需要图文对 + 图音对等成对数据,就能实现任意两种模态之间的"零样本跨模态检索"。
为什么重要:为多模态融合提供了一个统一框架。具身 AI 的机器人有各种传感器——摄像头、麦克风、力传感器、IMU——ImageBind 的思路让这些不同传感器的信息能在同一个空间中被理解和推理。
RT-2(2023.07,Google DeepMind)
这是什么:第一个提出 VLA(Vision-Language-Action)概念的工作。把机器人动作编码为 VLM 词表中的 token,让模型像做视觉问答一样输出动作。见 Ch05 的详细分析。
为什么重要:RT-2 是具身 AI 的分水岭。它证明了三个革命性观点——(1) 视觉-语言预训练的知识能直接迁移到机器人控制,(2) 模型越大泛化越好,(3) 端到端 VLA 能产生涌现能力(推理、识人)。这三个发现定义了后续所有 VLA 工作的方向。
Open X-Embodiment(2023.10,RT-X 联盟)
这是什么:22 家机构联合,把各自的机器人数据汇聚在一起,形成了覆盖 22 种机器人形态的统一数据集。同时训练了 RT-1-X 和 RT-2-X 两个基线模型。
为什么重要:这是具身 AI 的"ImageNet 时刻"。在此之前,每个实验室只有自己的数据,模型只能在自己的机器人上工作。Open X-Embodiment 证明了跨机器人的数据汇聚能显著提升泛化——在大多数评估中,用联合数据训练的模型比用单家数据训练的好。
Acoustic Swarms(2023.06,Washington)
这是什么:一群小型机器人(miniature robots)在房间里自行分布,组成移动麦克风阵列,用声学信号自行定位后协同做声源分离和定位。
为什么重要:解决了一个基础问题——固定麦克风阵列只能覆盖有限区域。让"一群小机器人自动部署自己"变成了一种新的感知方式。
6. 2024:开源 VLA 和产业化加速
OpenVLA(2024.06,Stanford / TRI / Berkeley)
这是什么:第一个重要的开源 VLA 模型。7B 参数,基于 Prismatic VLM,在 OXE 数据集上训练。见 Ch05 的详细分析。
为什么重要:RT-2 是闭源的,没人能复现。OpenVLA 把整个 VLA 范式开源——模型权重、训练代码、数据集都可获取。这对整个领域的研究加速效应是巨大的。它还证明了 7B 模型能打赢 55B 的 RT-2-X,说明"聪明的设计 + 好的数据"比"蛮力堆参数"更有效。
DROID(2024.03,多机构联合)
这是什么:13 个国家、52 个实验室、76,000 条真实操作演示。覆盖 564 个不同场景、86 种任务类型。
为什么重要:DROID 是目前最大规模的真实机器人操作数据集之一。它和 Open X-Embodiment 一起构成了训练通用 VLA 模型的数据基础。
π0(2024.10,Physical Intelligence)
这是什么:Physical Intelligence 公司的旗舰 VLA 模型。用 Flow Matching(扩散的简化版)替代动作 token 化,支持连续动作空间。在折衣服、清理桌面等复杂灵巧任务上展示了强大能力。
为什么重要:π0 代表了端到端路线的下一个进化——从离散 token 化到连续 Flow Matching。它还展示了 VLA 模型首次在真正复杂的灵巧操作任务上取得成功。Physical Intelligence 公司估值 24 亿美元,是具身 AI 商业化最成功的例子之一。
RF-SLAM(2024,多机构)
这是什么:用射频信号(毫米波雷达)做同时定位与建图(SLAM),不需要摄像头或 LiDAR 就能在黑暗、烟雾、遮挡环境中构建 3D 地图。
为什么重要:SLAM 是机器人导航的基础能力——"我在哪里"和"周围是什么样"。RF-SLAM 把这个能力从"需要好的光照和视野"扩展到"完全黑暗也能用"。
Proactive Hearing(2024,UW / Meta)
这是什么:教 AI "选择性听"——用户指定一个目标说话者(通过录音或文字描述),模型从嘈杂混合音频中只分离出目标说话者的声音。
为什么重要:人类有"鸡尾酒会效应"——在嘈杂环境中能专注听某个人说话。Proactive Hearing 首次让 AI 具备了类似能力。对服务机器人来说,这个能力是刚需——用户在嘈杂厨房里对机器人说话,机器人得能分辨出用户的声音。
7. 2025:融合与产业化(进行中)
Cosmos Policy(2025,NVIDIA)
这是什么:把大规模视频预训练的世界模型用于机器人策略学习。先用互联网视频训练一个"理解物理世界怎么运动"的世界模型,然后在这个世界模型的基础上做策略微调。
为什么重要:这代表了一条新的研究方向——"先理解世界,再学习行动"。传统的 VLA 是"直接从观测到动作",Cosmos Policy 是"先学会预测世界变化,再在预测中学习策略"。如果世界模型足够好,它甚至可以替代仿真器——在"想象"中训练策略。
π0.5(2025,Physical Intelligence)
这是什么:π0 的升级版,增强了泛化到开放世界的能力。
SmolVLA(2025,Hugging Face)
这是什么:轻量级 VLA 模型,探索在更小的参数量下做 VLA 的可行性。
产业化趋势
2025 年的具身 AI 领域出现了明显的产业化加速信号:
- Physical Intelligence 估值 24 亿美元,Figure AI 融资超过 7 亿美元
- Google DeepMind、Tesla Optimus、华为等大公司持续投入
- 人形机器人赛道成为 VC 热点——Unitree、宇树、智元等中国公司也在快速追赶
- 你的导师给的 Task 2(代码复现 + 模型微调)正是这个产业化浪潮的缩影——从"读论文"到"动手做"
8. 时间线可视化
timeline
title 具身 AI 关键里程碑 2021-2025
section 2021: 视觉-语言对齐
CLIP (OpenAI) : 图文对齐的坐标系原点
BLIP (Salesforce) : 数据清洗 + 统一 VLU+VLG
section 2022: LLM 驱动机器人
SayCan (Google) : 第一个 LLM 驱动真实机器人
RT-1 (Google) : 第一个大规模端到端机器人策略
Inner Monologue : 模块化闭环反馈
Whisper (OpenAI) : 通用语音识别
Dreamer V3 : 世界模型+RL 统一
Diffusion Policy : 扩散模型用于机器人策略
section 2023: VLA 诞生
LLaVA : 简单高效的 VLM
Code as Policies : LLM 写代码控制机器人
ImageBind (Meta) : 6 模态统一嵌入
RT-2 (DeepMind) : VLA 概念提出+涌现能力
Open X-Embodiment : 22 家联合数据集
Acoustic Swarms : 移动麦克风阵列
section 2024: 开源与产业化
DROID : 13 国 76k 真实演示
OpenVLA : 第一个重要开源 VLA
π0 : Flow Matching VLA
RF-SLAM : 射频 SLAM
Proactive Hearing : 选择性听觉 AI
section 2025: 融合
Cosmos Policy (NVIDIA) : 世界模型驱动策略
π0.5 : 开放世界泛化
SmolVLA : 轻量级 VLA
9. 四条技术演进线索
如果你不想记住每一个里程碑,至少记住这四条线索——它们是理解整个领域的"骨架"。
线索 1:VLM → VLA 主线(最重要)。
CLIP (2021) → BLIP-2 (2023) → LLaVA (2023)
↓
RT-1 (2022) → RT-2 (2023) → OpenVLA (2024) → π0 (2024)
CLIP 提供视觉-语言对齐 → LLaVA 让 LLM 能看图 → RT-2 让 VLM 能输出动作 → OpenVLA 开源 → π0 用 Flow Matching 做连续动作。这是具身 AI 的"主叙事"。
线索 2:规划路线。
SayCan (2022) → Inner Monologue (2022) → Code as Policies (2023) → PaLM-E (2023)
LLM 当大脑,从"固定技能菜单"→"闭环反馈"→"直接写代码"→"多模态理解后规划"。模块化路线在不断增强灵活性和闭环能力。
线索 3:策略学习路线。
Behavior Cloning → DAgger → Diffusion Policy (2023) → π0/Flow Matching (2024)
从简单的监督学习 → 解决分布偏移 → 用扩散模型处理多模态 → 用 Flow Matching 简化和加速。策略表达能力在不断增强。
线索 4:数据和基建路线。
Habitat (2019) + Isaac Gym (2020) → RLBench → Meta-World
→ Open X-Embodiment (2023) → DROID (2024)
仿真器提供训练场 → 小规模 benchmark 提供评测 → 大规模联合数据集提供弹药。数据规模从几千条到几十万条。
10. 你的 13 篇论文在时间线上的位置
| 年份 | 论文 | 在时间线上的角色 |
|---|---|---|
| 2022 | SayCan | LLM 驱动机器人的开山之作 |
| 2023 | LLaVA | VLM 简洁架构的标杆 |
| 2023 | RT-2* | VLA 概念提出(非你的 13 篇但极重要) |
| 2024 | OpenVLA | 开源 VLA 基线 |
| 2024 | VLAS | VLA + 语音指令扩展 |
| 2024 | MLA | VLA + 多感官(触觉等)扩展 |
| 2024 | 3DShape2VecSet | 3D 物体表征 → 服务于抓取理解 |
| 2024 | RF-SLAM | 射频 SLAM,无视觉条件下建图 |
| 2024 | mmCLIP | 毫米波 → CLIP 空间对齐 |
| 2024 | NLOS mmWave | 非视线 3D 重建 |
| 2024 | Proactive Hearing | 选择性听觉 |
| 2024 | NeuralAids | 神经网络助听 |
| 2023 | Acoustic Swarms | 移动声学阵列 |
| 2025 | Cosmos Policy | 世界模型驱动策略(最新) |
你的 13 篇横跨 2022-2025 四个年度,覆盖了从"LLM 首次驱动机器人"到"世界模型驱动策略"的完整发展弧线。
11. 本章自测
问题 1:CLIP(2021)和 RT-2(2023)之间,技术上的连接路径是什么?中间经历了哪些关键步骤?
问题 2:为什么 Open X-Embodiment(2023)被称为具身 AI 的"ImageNet 时刻"?ImageNet 在计算机视觉历史上做了什么,OXE 类比地做了什么?
问题 3:从时间线看,模块化路线(SayCan → CaP)和端到端路线(RT-1 → RT-2 → OpenVLA)几乎是同步发展的。为什么到 2024 年端到端路线开始占上风?
参考思路(先自己想再展开)
题 1 参考:CLIP 提供了图文对齐 → BLIP-2 / LLaVA 把这种对齐能力接入 LLM → RT-1 证明 Transformer 可以处理机器人数据 → RT-2 把 VLM 的输出从"文字回答"扩展为"动作 token"。关键连接是"动作 token 化"——把连续的机器人动作离散化为 VLM 词表中的 token,让模型以"续写文字"的方式输出动作。
题 2 参考:ImageNet(2012)把分散在各研究组的图像分类数据统一成一个大基准,催生了 AlexNet 等突破性工作——数据规模化 + 统一评测 = 技术爆发。OXE 对具身 AI 做了同样的事:把 22 家机构各自的机器人数据合在一起,让研究者第一次可以在"跨机器人形态"的大数据上训练和评测模型。
题 3 参考:2024 年端到端占上风有三个推动力——(1) OpenVLA 证明 7B 开源模型就能打赢 55B 闭源模型,降低了研究门槛;(2) OXE + DROID 提供了足够的训练数据,解决了端到端模型的数据饥渴;(3) π0 展示了端到端模型在复杂灵巧任务上的成功,而模块化系统在精细操作上进展有限。
12. 本章小结
回顾本章的核心要点:
- 2021 年:CLIP 建立视觉-语言对齐的坐标系
- 2022 年:SayCan 和 RT-1 同时证明"LLM 能指挥机器人"和"Transformer 能控制机器人"
- 2023 年:LLaVA / RT-2 / OXE 三重突破——简洁 VLM、VLA 概念诞生、大规模联合数据
- 2024 年:OpenVLA 开源、π0 展示端到端路线的上限、感知方向(RF/听觉)取得重要进展
- 2025 年:Cosmos Policy 代表"世界模型驱动策略"的新方向,产业化加速
- 四条核心演进线索:VLM→VLA 主线、规划路线、策略学习路线、数据基建路线
下一章我们讲如何读论文——理解学术论文的结构和阅读策略,为 Part 3 的精读做准备。
导读目录:README.md 上一章:Ch05: 两条技术路线——模块化 vs 端到端 下一章:Ch07: 从论文到机器人——理解学术论文的结构与读法
本章涉及论文 36 篇
点击查看论文笔记全文,标有 ● 的为已读。