Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Guide · Part 2: 全景概念

Ch06: 具身 AI 的时间线——2021-2025 关键里程碑


Ch06: 具身 AI 的时间线——2021-2025 关键里程碑

Part 2: 全景概念 前置章节:Ch05: 两条技术路线——模块化 vs 端到端 后续章节:Ch07: 从论文到机器人——理解学术论文的结构与读法


1. 为什么需要一条时间线

论文不是孤立的——每一篇都站在前人的肩膀上,回应上一篇的局限,提出新的方案,然后被下一篇改进。如果你不知道论文之间的时间先后和因果关系,读每一篇都会觉得"这也行,那也行",分不清主流和支流。

这一章用时间线把 2021-2025 年具身 AI 的关键里程碑串起来。读完后你会看到一条清晰的叙事脉络:基础模型能力就位 → 感知和语言对齐 → LLM 驱动规划 → 端到端 VLA 崛起 → 数据和仿真生态成熟 → 混合路线和产业化。


2. 前史:2016-2020(快速回顾)

具身智能不是 2021 年凭空出现的。在 2016-2020 年间,有几件事为后来的爆发埋下了种子。

2017:Transformer 诞生。 Vaswani 等人提出了 Attention Is All You Need,奠定了后来所有大模型的基础架构。当时没人想到它会用在机器人上——大家还在用 CNN + RNN 做视觉和语言处理。但 Transformer 的"一切都是序列"思想,后来被 RT-1 直接借用来把机器人观测和动作也编码为序列。

2018:RF-Pose 穿墙看人。 MIT 的 Dina Katabi 团队用 WiFi 信号穿墙估计人体姿态。这不是机器人论文,但它证明了"不用摄像头也能感知"——这个思想后来发展成你的 13 篇中的三篇射频感知论文。

2019:Dreamer V1 开始在想象中训练。 Hafner 等人的 Dreamer 系列第一版,第一次大规模证明"世界模型 + 在想象中做强化学习"能在 Atari 游戏上达到接近真实训练的效果。这个思路后来从游戏扩展到机器人控制。

2019:Habitat 发布。 Meta AI 发布了 Habitat 仿真平台,让研究者能在逼真的虚拟室内环境中训练和测试导航机器人。仿真平台的出现大幅降低了具身智能研究的门槛——不需要买真机器人也能做研究。

2020:Isaac Gym 发布。 NVIDIA 推出 GPU 加速的机器人仿真器,能在一张 GPU 上同时跑几千个仿真环境。训练速度比传统 CPU 仿真快 2-3 个数量级,彻底改变了 RL-for-robotics 的可行性。

这些种子在 2021-2022 年同时开花。


3. 2021:视觉-语言对齐的元年

CLIP(2021.01,OpenAI)

这是什么:用 4 亿对图文数据训练一个双编码器模型,让图片向量和文字向量在同一个空间里对齐。

为什么重要:CLIP 是后来所有"看图说话"模型的地基。在 CLIP 之前,视觉模型和语言模型是分离的——你需要先训练一个图像分类器,再用一个独立的语言模型理解分类结果。CLIP 打通了这堵墙:只需要一次点积运算就能判断"这张图和这段文字有多相关"。

对具身 AI 的影响:CLIP 的嵌入空间后来被大量复用——mmCLIP 把毫米波雷达信号对齐到 CLIP 空间,ImageBind 把 6 种模态都对齐到 CLIP 空间,SigLIP(OpenVLA 使用的视觉编码器之一)是 CLIP 的改进版。可以说 CLIP 是整个视觉-语言-动作研究的"坐标系原点"。

BLIP(2022.01, Salesforce)& BLIP-2(2023.01)

这是什么:BLIP 提出了"先生成后过滤"的数据清洗策略,在脏数据上也能训练出好的 VLM。BLIP-2 更进一步,提出了 Q-Former(一个轻量级"翻译器"),把冻结的视觉编码器和冻结的语言模型连接起来。

为什么重要:BLIP-2 证明了一个关键思路——你不需要从零训练一个多模态大模型。只需要训练一个小的"桥梁模块",就能把现有的视觉模型(比如 ViT-G)和语言模型(比如 Flan-T5)接在一起。这大幅降低了 VLM 的训练成本。

Flamingo(2022.04, DeepMind)

这是什么:DeepMind 的多模态大模型,用 Perceiver Resampler + Gated Cross-Attention 把视觉信息注入冻结的 LLM。支持多图多轮对话,few-shot 学习能力极强。

为什么重要:Flamingo 证明了"冻住 LLM,只训练视觉接入模块"的路线是可行的——后来 LLaVA 和 RoboFlamingo 都沿用了这个思路。


4. 2022:LLM 驱动机器人的元年

SayCan(2022.04,Google Robotics)

这是什么:第一个大规模证明"LLM 能指挥真实机器人完成厨房任务"的工作。见 Ch05 的详细分析。

为什么重要:SayCan 的核心贡献不是具体的技术方案——而是"证明了这条路走得通"。在 SayCan 之前,大多数人认为 LLM 和机器人是两个世界。SayCan 之后,"用 LLM 做机器人规划"变成了一个爆炸性的研究方向。

RT-1(2022.12,Google Robotics)

这是什么:Google 用 13 万条真机数据(13 台 Everyday Robot × 17 个月)训练的第一个大规模端到端机器人策略。基于 EfficientNet + TokenLearner + Transformer 架构。

为什么重要:RT-1 证明了三件事——(1) Transformer 架构可以直接用于机器人控制,(2) 大规模真机数据训练确实能带来泛化,(3) 多任务训练让模型能执行 700 多种不同指令。RT-1 是 RT-2 和 OpenVLA 的直系前辈。

Inner Monologue(2022.07,Google)

这是什么:在 SayCan 基础上加入闭环反馈——每步执行后用视觉模型检查成功/失败,如果失败就让 LLM 重新规划。

为什么重要:解决了 SayCan 的弱闭环问题。"执行 → 检查 → 反馈 → 重规划"的循环后来成为模块化系统的标准范式。

Whisper(2022.09,OpenAI)

这是什么:用 68 万小时多语言音频数据训练的通用语音识别模型。零样本在多种语言上达到接近或超过监督方法的水平。

为什么重要:Whisper 不是机器人论文,但它给具身 AI 提供了关键的听觉基础——机器人需要听懂人的语音指令。Whisper 之前,语音识别需要大量标注数据和语言特定的模型。Whisper 之后,"直接用预训练模型做语音接口"变成了可行的工程方案。

Diffusion Policy(2023.03,Chi et al.)

这是什么:第一次把扩散模型用于机器人策略学习。核心思想:把"选择动作"重新定义为"去噪"——从随机噪声开始,逐步去噪得到一段平滑的动作轨迹。

为什么重要:解决了行为克隆的老大难问题——多模态动作分布。传统 BC 对多种可行动作求平均,结果哪种都不是。Diffusion Policy 能"完整地选择某一种模式",输出稳定且多样。


5. 2023:VLA 的诞生和 VLM 的爆发

LLaVA(2023.04,Wisconsin-Madison & Microsoft)

这是什么:用一个简单的线性投影层把 CLIP 视觉编码器的输出映射到 LLaMA 语言模型的输入空间。用 GPT-4 生成的指令遵循数据做微调。

为什么重要:LLaVA 的架构极其简单——一个投影层就完事了。但它证明了"简单的视觉-语言连接 + 好的数据"就能产生惊人的多模态理解能力。这个简洁的设计后来被 OpenVLA 直接继承:OpenVLA 的视觉接入方式本质上就是 LLaVA 的方法。

Code as Policies(2023.02,Google Brain)

这是什么:让 LLM 直接写 Python 代码控制机器人。零训练、零微调。见 Ch05 的详细分析。

为什么重要:把"规划"变成了"编程",模块化路线的灵活性翻倍。同时证明了一个重要论点:不训练任何东西,只靠 LLM 的预训练知识 + 好的 prompt,就能做出有用的机器人系统。

ImageBind(2023.05,Meta AI)

这是什么:用图像作为"锚点",把 6 种模态(图、文、音、深度、热红外、IMU)全部对齐到同一个嵌入空间。只需要图文对 + 图音对等成对数据,就能实现任意两种模态之间的"零样本跨模态检索"。

为什么重要:为多模态融合提供了一个统一框架。具身 AI 的机器人有各种传感器——摄像头、麦克风、力传感器、IMU——ImageBind 的思路让这些不同传感器的信息能在同一个空间中被理解和推理。

RT-2(2023.07,Google DeepMind)

这是什么:第一个提出 VLA(Vision-Language-Action)概念的工作。把机器人动作编码为 VLM 词表中的 token,让模型像做视觉问答一样输出动作。见 Ch05 的详细分析。

为什么重要:RT-2 是具身 AI 的分水岭。它证明了三个革命性观点——(1) 视觉-语言预训练的知识能直接迁移到机器人控制,(2) 模型越大泛化越好,(3) 端到端 VLA 能产生涌现能力(推理、识人)。这三个发现定义了后续所有 VLA 工作的方向。

Open X-Embodiment(2023.10,RT-X 联盟)

这是什么:22 家机构联合,把各自的机器人数据汇聚在一起,形成了覆盖 22 种机器人形态的统一数据集。同时训练了 RT-1-X 和 RT-2-X 两个基线模型。

为什么重要:这是具身 AI 的"ImageNet 时刻"。在此之前,每个实验室只有自己的数据,模型只能在自己的机器人上工作。Open X-Embodiment 证明了跨机器人的数据汇聚能显著提升泛化——在大多数评估中,用联合数据训练的模型比用单家数据训练的好。

Acoustic Swarms(2023.06,Washington)

这是什么:一群小型机器人(miniature robots)在房间里自行分布,组成移动麦克风阵列,用声学信号自行定位后协同做声源分离和定位。

为什么重要:解决了一个基础问题——固定麦克风阵列只能覆盖有限区域。让"一群小机器人自动部署自己"变成了一种新的感知方式。


6. 2024:开源 VLA 和产业化加速

OpenVLA(2024.06,Stanford / TRI / Berkeley)

这是什么:第一个重要的开源 VLA 模型。7B 参数,基于 Prismatic VLM,在 OXE 数据集上训练。见 Ch05 的详细分析。

为什么重要:RT-2 是闭源的,没人能复现。OpenVLA 把整个 VLA 范式开源——模型权重、训练代码、数据集都可获取。这对整个领域的研究加速效应是巨大的。它还证明了 7B 模型能打赢 55B 的 RT-2-X,说明"聪明的设计 + 好的数据"比"蛮力堆参数"更有效。

DROID(2024.03,多机构联合)

这是什么:13 个国家、52 个实验室、76,000 条真实操作演示。覆盖 564 个不同场景、86 种任务类型。

为什么重要:DROID 是目前最大规模的真实机器人操作数据集之一。它和 Open X-Embodiment 一起构成了训练通用 VLA 模型的数据基础。

π0(2024.10,Physical Intelligence)

这是什么:Physical Intelligence 公司的旗舰 VLA 模型。用 Flow Matching(扩散的简化版)替代动作 token 化,支持连续动作空间。在折衣服、清理桌面等复杂灵巧任务上展示了强大能力。

为什么重要:π0 代表了端到端路线的下一个进化——从离散 token 化到连续 Flow Matching。它还展示了 VLA 模型首次在真正复杂的灵巧操作任务上取得成功。Physical Intelligence 公司估值 24 亿美元,是具身 AI 商业化最成功的例子之一。

RF-SLAM(2024,多机构)

这是什么:用射频信号(毫米波雷达)做同时定位与建图(SLAM),不需要摄像头或 LiDAR 就能在黑暗、烟雾、遮挡环境中构建 3D 地图。

为什么重要:SLAM 是机器人导航的基础能力——"我在哪里"和"周围是什么样"。RF-SLAM 把这个能力从"需要好的光照和视野"扩展到"完全黑暗也能用"。

Proactive Hearing(2024,UW / Meta)

这是什么:教 AI "选择性听"——用户指定一个目标说话者(通过录音或文字描述),模型从嘈杂混合音频中只分离出目标说话者的声音。

为什么重要:人类有"鸡尾酒会效应"——在嘈杂环境中能专注听某个人说话。Proactive Hearing 首次让 AI 具备了类似能力。对服务机器人来说,这个能力是刚需——用户在嘈杂厨房里对机器人说话,机器人得能分辨出用户的声音。


7. 2025:融合与产业化(进行中)

Cosmos Policy(2025,NVIDIA)

这是什么:把大规模视频预训练的世界模型用于机器人策略学习。先用互联网视频训练一个"理解物理世界怎么运动"的世界模型,然后在这个世界模型的基础上做策略微调。

为什么重要:这代表了一条新的研究方向——"先理解世界,再学习行动"。传统的 VLA 是"直接从观测到动作",Cosmos Policy 是"先学会预测世界变化,再在预测中学习策略"。如果世界模型足够好,它甚至可以替代仿真器——在"想象"中训练策略。

π0.5(2025,Physical Intelligence)

这是什么:π0 的升级版,增强了泛化到开放世界的能力。

SmolVLA(2025,Hugging Face)

这是什么:轻量级 VLA 模型,探索在更小的参数量下做 VLA 的可行性。

产业化趋势

2025 年的具身 AI 领域出现了明显的产业化加速信号:

  • Physical Intelligence 估值 24 亿美元,Figure AI 融资超过 7 亿美元
  • Google DeepMind、Tesla Optimus、华为等大公司持续投入
  • 人形机器人赛道成为 VC 热点——Unitree、宇树、智元等中国公司也在快速追赶
  • 你的导师给的 Task 2(代码复现 + 模型微调)正是这个产业化浪潮的缩影——从"读论文"到"动手做"

8. 时间线可视化

timeline
    title 具身 AI 关键里程碑 2021-2025
    
    section 2021: 视觉-语言对齐
        CLIP (OpenAI) : 图文对齐的坐标系原点
        BLIP (Salesforce) : 数据清洗 + 统一 VLU+VLG
    
    section 2022: LLM 驱动机器人
        SayCan (Google) : 第一个 LLM 驱动真实机器人
        RT-1 (Google) : 第一个大规模端到端机器人策略
        Inner Monologue : 模块化闭环反馈
        Whisper (OpenAI) : 通用语音识别
        Dreamer V3 : 世界模型+RL 统一
        Diffusion Policy : 扩散模型用于机器人策略
    
    section 2023: VLA 诞生
        LLaVA : 简单高效的 VLM
        Code as Policies : LLM 写代码控制机器人
        ImageBind (Meta) : 6 模态统一嵌入
        RT-2 (DeepMind) : VLA 概念提出+涌现能力
        Open X-Embodiment : 22 家联合数据集
        Acoustic Swarms : 移动麦克风阵列
    
    section 2024: 开源与产业化
        DROID : 13 国 76k 真实演示
        OpenVLA : 第一个重要开源 VLA
        π0 : Flow Matching VLA
        RF-SLAM : 射频 SLAM
        Proactive Hearing : 选择性听觉 AI
    
    section 2025: 融合
        Cosmos Policy (NVIDIA) : 世界模型驱动策略
        π0.5 : 开放世界泛化
        SmolVLA : 轻量级 VLA

9. 四条技术演进线索

如果你不想记住每一个里程碑,至少记住这四条线索——它们是理解整个领域的"骨架"。

线索 1:VLM → VLA 主线(最重要)。

CLIP (2021) → BLIP-2 (2023) → LLaVA (2023)
                                      ↓
RT-1 (2022) → RT-2 (2023) → OpenVLA (2024) → π0 (2024)

CLIP 提供视觉-语言对齐 → LLaVA 让 LLM 能看图 → RT-2 让 VLM 能输出动作 → OpenVLA 开源 → π0 用 Flow Matching 做连续动作。这是具身 AI 的"主叙事"。

线索 2:规划路线。

SayCan (2022) → Inner Monologue (2022) → Code as Policies (2023) → PaLM-E (2023)

LLM 当大脑,从"固定技能菜单"→"闭环反馈"→"直接写代码"→"多模态理解后规划"。模块化路线在不断增强灵活性和闭环能力。

线索 3:策略学习路线。

Behavior Cloning → DAgger → Diffusion Policy (2023) → π0/Flow Matching (2024)

从简单的监督学习 → 解决分布偏移 → 用扩散模型处理多模态 → 用 Flow Matching 简化和加速。策略表达能力在不断增强。

线索 4:数据和基建路线。

Habitat (2019) + Isaac Gym (2020) → RLBench → Meta-World
    → Open X-Embodiment (2023) → DROID (2024)

仿真器提供训练场 → 小规模 benchmark 提供评测 → 大规模联合数据集提供弹药。数据规模从几千条到几十万条。


10. 你的 13 篇论文在时间线上的位置

年份 论文 在时间线上的角色
2022 SayCan LLM 驱动机器人的开山之作
2023 LLaVA VLM 简洁架构的标杆
2023 RT-2* VLA 概念提出(非你的 13 篇但极重要)
2024 OpenVLA 开源 VLA 基线
2024 VLAS VLA + 语音指令扩展
2024 MLA VLA + 多感官(触觉等)扩展
2024 3DShape2VecSet 3D 物体表征 → 服务于抓取理解
2024 RF-SLAM 射频 SLAM,无视觉条件下建图
2024 mmCLIP 毫米波 → CLIP 空间对齐
2024 NLOS mmWave 非视线 3D 重建
2024 Proactive Hearing 选择性听觉
2024 NeuralAids 神经网络助听
2023 Acoustic Swarms 移动声学阵列
2025 Cosmos Policy 世界模型驱动策略(最新)

你的 13 篇横跨 2022-2025 四个年度,覆盖了从"LLM 首次驱动机器人"到"世界模型驱动策略"的完整发展弧线。


11. 本章自测

问题 1:CLIP(2021)和 RT-2(2023)之间,技术上的连接路径是什么?中间经历了哪些关键步骤?

问题 2:为什么 Open X-Embodiment(2023)被称为具身 AI 的"ImageNet 时刻"?ImageNet 在计算机视觉历史上做了什么,OXE 类比地做了什么?

问题 3:从时间线看,模块化路线(SayCan → CaP)和端到端路线(RT-1 → RT-2 → OpenVLA)几乎是同步发展的。为什么到 2024 年端到端路线开始占上风?

参考思路(先自己想再展开)

题 1 参考:CLIP 提供了图文对齐 → BLIP-2 / LLaVA 把这种对齐能力接入 LLM → RT-1 证明 Transformer 可以处理机器人数据 → RT-2 把 VLM 的输出从"文字回答"扩展为"动作 token"。关键连接是"动作 token 化"——把连续的机器人动作离散化为 VLM 词表中的 token,让模型以"续写文字"的方式输出动作。

题 2 参考:ImageNet(2012)把分散在各研究组的图像分类数据统一成一个大基准,催生了 AlexNet 等突破性工作——数据规模化 + 统一评测 = 技术爆发。OXE 对具身 AI 做了同样的事:把 22 家机构各自的机器人数据合在一起,让研究者第一次可以在"跨机器人形态"的大数据上训练和评测模型。

题 3 参考:2024 年端到端占上风有三个推动力——(1) OpenVLA 证明 7B 开源模型就能打赢 55B 闭源模型,降低了研究门槛;(2) OXE + DROID 提供了足够的训练数据,解决了端到端模型的数据饥渴;(3) π0 展示了端到端模型在复杂灵巧任务上的成功,而模块化系统在精细操作上进展有限。


12. 本章小结

回顾本章的核心要点:

  • 2021 年:CLIP 建立视觉-语言对齐的坐标系
  • 2022 年:SayCan 和 RT-1 同时证明"LLM 能指挥机器人"和"Transformer 能控制机器人"
  • 2023 年:LLaVA / RT-2 / OXE 三重突破——简洁 VLM、VLA 概念诞生、大规模联合数据
  • 2024 年:OpenVLA 开源、π0 展示端到端路线的上限、感知方向(RF/听觉)取得重要进展
  • 2025 年:Cosmos Policy 代表"世界模型驱动策略"的新方向,产业化加速
  • 四条核心演进线索:VLM→VLA 主线、规划路线、策略学习路线、数据基建路线

下一章我们讲如何读论文——理解学术论文的结构和阅读策略,为 Part 3 的精读做准备。


导读目录:README.md 上一章:Ch05: 两条技术路线——模块化 vs 端到端 下一章:Ch07: 从论文到机器人——理解学术论文的结构与读法

本章涉及论文 36 篇

点击查看论文笔记全文,标有 的为已读。

№ 127 VLM Foundation · 经典

BLIP

№ 126 VLM Foundation · 经典

BLIP-2

№ 125 VLM Foundation · 祖师爷

Flamingo

№ 03 High-Level Planning · 祖师爷

SayCan

№ 109 End-to-End VLA · 祖师爷

RT-1

№ 01 VLM Foundation · 祖师爷

LLaVA

№ 64 Multimodal Ecology · 祖师爷

ImageBind

№ 112 End-to-End VLA · 经典

RT-2

№ 04 End-to-End VLA · 经典

OpenVLA

№ 34 Datasets & Benchmarks · 前沿

DROID

№ 47 Diffusion Policy · 前沿

π₀

№ 08 RF Perception & Mapping · 经典

CartoRadar

№ 48 Diffusion Policy · 前沿

pi_0.5

№ 61 Imitation Learning · 前沿

SmolVLA

№ 148 World Model & Video Policy · 经典

Dreamer V3

№ 98 Simulation & Sim2Real · 祖师爷

Habitat

№ 99 Simulation & Sim2Real · 祖师爷

Isaac Gym

№ 78 High-Level Planning · 祖师爷

PaLM-E

№ 09 RF Perception & Mapping · 经典

mmCLIP

№ 10 RF Perception & Mapping · 前沿

mmNorm

№ 05 Multimodal Ecology · 前沿

VLAS

№ 06 Multimodal Ecology · 前沿

MLA