Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Guide · Part 2: 全景概念

Ch05: 两条技术路线——模块化流水线 vs 端到端一体化


Ch05: 两条技术路线——模块化流水线 vs 端到端一体化

Part 2: 全景概念 前置章节:Ch04: 11 个主题全景图——一个机器人的 11 个器官 后续章节:Ch06: 具身 AI 的时间线——2021-2025 关键里程碑


1. 一个你熟悉的选择题

你要搬家,需要把东西从旧房子搬到新房子。你有两种方案:

方案 A:流水线作业。 雇一个规划师、一个打包师、一个搬运工、一个司机。规划师看你家的东西列一张清单,打包师按清单装箱,搬运工把箱子搬上货车,司机开到新家。四个人各管一段,清清楚楚。问题是——规划师列清单的时候不知道某些柜子是钉在墙上的(他不做搬运,不知道这些物理限制),于是搬运工到了现场才发现计划走不通,只能打电话回去改计划。信息在四个人之间传递,每传一次丢一点。

方案 B:一个人全包。 你雇了一个超级搬家员。他同时能看、能想、能动——走进房间环顾一周,脑子里自动规划先搬什么后搬什么,然后撸起袖子自己搬。速度可能没方案 A 快(一个人干四个人的活),但不会出现"信息丢失"的问题,因为所有信息都在一个人脑子里。问题是——他搬错了东西你问他为什么,他说不清楚,因为他的决策过程是"直觉式"的。

这就是具身 AI 领域最核心的架构争论:模块化流水线(Modular Pipeline)vs 端到端一体化(End-to-End)


2. 两条路线的正式定义

2.1 模块化流水线

把"从感知到动作"的过程拆成多个独立模块,每个模块有明确的输入输出接口,像工厂流水线一样首尾相接。

一个典型的模块化系统长这样:

用户指令: "把桌上的红苹果放进碗里"
     │
     ▼
┌──────────────────┐
│   感知模块        │  输入: 摄像头画面
│  (目标检测/分割)   │  输出: "红苹果在坐标 (0.3, 0.2, 0.1),碗在 (0.5, 0.4, 0.05)"
└────────┬─────────┘
         │
         ▼
┌──────────────────┐
│   规划模块        │  输入: 指令 + 物体位置
│  (LLM / 规划器)   │  输出: ["移动到苹果上方", "下降", "闭合夹爪", "抬起",
└────────┬─────────┘         "移动到碗上方", "下降", "打开夹爪"]
         │
         ▼
┌──────────────────┐
│   底层控制模块     │  输入: 子任务指令
│  (RL 策略/MPC)    │  输出: 关节角速度 [θ₁, θ₂, ..., θ₇]
└──────────────────┘

代表工作

  • SayCan(2022):LLM 当规划大脑,affordance function 当可行性评估器,预训练的 RL 策略当手脚。三个模块各自独立训练。
  • Code as Policies(2023):LLM 直接写 Python 代码来调用感知和控制 API。模块化的极致表达——每个 API 是一个模块,LLM 是"调度中心"。
  • Inner Monologue(2022):在 SayCan 基础上加了"内心独白"——每步执行后检查成功/失败,反馈给 LLM 决定下一步。模块化体系下的闭环尝试。

2.2 端到端一体化

用一个巨大的神经网络,从摄像头画面和语言指令直接输出关节动作,中间没有任何显式的模块拆分。

一个典型的端到端系统长这样:

用户指令: "把桌上的红苹果放进碗里"
     │
     ▼
┌─────────────────────────────────────────────────┐
│              VLA 端到端模型                       │
│                                                  │
│  视觉编码器 ──→ 投影层 ──→ 语言模型 ──→ 动作头    │
│  (DINOv2+SigLIP)         (Llama 2 7B)           │
│                                                  │
│  输入: 图像 pixels + 文本 tokens                  │
│  输出: [Δx, Δy, Δz, Δroll, Δpitch, Δyaw, grip] │
└─────────────────────────────────────────────────┘

代表工作

  • RT-2(2023):第一个正式提出 VLA 概念的工作。把机器人动作编码为 VLM 词表中的 token,让 VLM 像回答视觉问答一样"回答"动作。55B 参数,闭源。
  • OpenVLA(2024):开源的 7B VLA。把 Prismatic VLM 接上动作 token 化,用 Open X-Embodiment 数据集训练。目前最重要的开源 VLA 基线。
  • π0(2024):Physical Intelligence 的旗舰模型。用 Flow Matching(扩散的简化版)替代动作 token 化,输出连续动作。

3. 深入对比:六个关键维度

下面从六个维度逐一对比两条路线。每个维度先给直觉,再给具体数据。

3.1 信息传递——是否有瓶颈

模块化的问题:信息在模块间传递时会丢失。

SayCan 的例子:LLM 在打分时看不到摄像头画面——它只知道"我有 551 个技能可以选",但不知道桌上到底有什么。affordance function 能看到画面,但它只能输出一个 0-1 的数字("这个动作有多大概率能做到"),不能告诉 LLM "红苹果被杯子挡住了,你可能需要先把杯子移开"。两个模块之间的信息传递被压缩成了一个标量——这就是"信息瓶颈"。

Code as Policies 稍好一些:LLM 可以调用 detect_objects() 获取场景信息,相当于把感知模块的输出"拉"到规划模块里。但它仍然受限于 API 提供的信息粒度——如果 API 只返回物体的中心坐标,LLM 就不知道物体的形状和材质。

端到端的优势:所有信息在同一个网络中流动,没有显式瓶颈。

RT-2 的例子:视觉编码器处理完图像后,生成的视觉 token 和语言 token 在同一个 Transformer 里做 self-attention——模型可以自由地把"图片中红色区域"和"苹果"这个词关联起来,然后直接影响动作输出。没有任何一个中间步骤把信息压缩成标量。

RT-2 论文中展示了一个令人惊讶的涌现能力:你给它看一张桌子上有各种物体的图片,说"pick up the object that Taylor Swift would like"——模型能识别出一个吉他形状的物体并抓起来。这种"常识推理 → 视觉识别 → 动作执行"的链条只有在信息端到端流动时才可能实现。SayCan 的 LLM 也知道 Taylor Swift 可能喜欢吉他,但它看不到画面,不知道桌上有没有吉他形状的东西。

3.2 泛化能力——面对没见过的场景

端到端的关键优势:预训练知识的直接迁移。

RT-2 的数据特别有说服力:

测试类型 RT-2 (55B) RT-1 SayCan
见过的物体/背景 ~90% ~90% ~90%
未见物体 62% 32% 不适用(需重新训练技能)
涌现推理能力 60% 17% 不适用

未见物体泛化提升近一倍。涌现推理能力——用文字描述物体("pick the object most likely to be found in a bathroom")——从 17% 跳到 60%。RT-2 论文还证明了一个规律:模型越大泛化越好(55B 比 5B 高 20 个百分点)。这在模块化范式中很难实现,因为 SayCan 的泛化依赖于每个独立模块的泛化,而底层的 RL 技能策略往往严重过拟合训练场景。

模块化的优势:可以单独升级任何一个模块。

Code as Policies 有一个独特优势:LLM 不需要任何微调。当 GPT-4 出来替换 GPT-3 时,Code as Policies 的规划能力自动升级——你只需要换一个 API key。而 RT-2 如果想利用更强的语言模型,需要重新预训练整个 VLM,成本以万美元计。SayCan 同理——换一个更强的 LLM 不需要重新训练底层技能。

3.3 可调试性——出错了怎么办

模块化的核心优势:每一步都可以检查。

SayCan 的机器人在执行"拿苹果放进碗里"时失败了。你可以逐步排查:LLM 给出的规划是什么?("移到苹果 → 抓 → 移到碗 → 放"——看起来对。)affordance function 给的分数是什么?(苹果 0.9、碗 0.8——看起来对。)底层策略在"抓"这一步的执行轨迹是什么?(手爪到了苹果旁边但没夹紧——找到了!是底层抓取策略的问题。)

Code as Policies 更好——它直接给你 Python 代码。如果代码有 bug,你能像调试普通程序一样定位问题行。论文里的一个真实例子:LLM 生成了 pick_place(apple, bowl) 但苹果太大放不进碗里。你只需要在代码里加一行 if apple.size > bowl.opening: use_bigger_bowl()

端到端的调试困境:黑箱。

OpenVLA 在执行"拿苹果放进碗里"时失败了。输出的 7 维动作向量是 [0.12, -0.05, 0.08, 0.0, 0.0, 0.03, 1]。为什么是这组数字?你完全不知道。是因为它没认出苹果?还是认出了但计算的轨迹有偏差?还是轨迹对了但夹爪力度不够?端到端模型不会告诉你。

论文中记录的一个真实案例:OpenVLA 在微调后出现了"灾难性遗忘"——它在学会新任务后忘了怎么识别明星脸。这个 bug 被发现是因为研究者恰好测试了视觉常识,但如果没测呢?端到端模型的失败模式是不可预测的。

3.4 新技能习得——能不能做没见过的动作

模块化的灵活性差异很大。

SayCan 的技能集是封闭的——551 个预定义技能。如果你想让机器人做一个新动作(比如"用筷子夹花生"),你需要:(1) 定义新技能,(2) 用 RL 训练新的策略,(3) 用人类演示训练新的 affordance function。整个过程可能需要几周。

Code as Policies 的灵活性好得多——只要你能用已有的 API 组合出新动作,LLM 就能写出代码。"先用左手拿碗、再用右手拿勺子、最后左右手配合"——这种组合逻辑不需要任何额外训练。但如果 API 中没有"用筷子"这个操作,代码也写不出来。

端到端的局限:受训练数据中的动作类型限制。

RT-2 论文明确说:"RT-2 can generalize its understanding to new objects/scenes, but cannot generate novel motor skills not seen during training." 翻译过来:它能用已有的抓取技能去抓新物体(泛化识别),但不能自己发明一个新的抓取姿势(泛化动作)。OpenVLA 同理——它只会 Open X-Embodiment 数据集中出现过的动作类型。

这是一个根本性限制。端到端模型的"行为空间"完全由训练数据定义。你给它看一百万次"平移 + 抓取"的演示,它就只会"平移 + 抓取"。想让它学会"旋转 + 插入"?你得找数据集里有没有这种演示。

3.5 训练成本

方面 SayCan Code as Policies RT-2 (55B) OpenVLA (7B)
训练是否需要 是(RL + BC) 否(零训练) 是(VLM 微调) 是(VLM 微调)
数据需求 68,000 段演示(11 个月) 0 段 RT-1 数据 + 网页数据 970k 段(OXE)
算力成本 中等(RL 仿真训练) $0 极高(闭源未公布) $40,000(64×A100×14 天)
微调适配成本 需重新训练每个技能 改 prompt 即可 不可复现(闭源) LoRA 60GB 显存

Code as Policies 的训练成本几乎为零——这是一个巨大的实际优势。你今天就可以拿 GPT-4 + 几个机器人 API 搭出一个工作系统。相比之下,OpenVLA 需要 $40,000 的算力从头训练,即使用 LoRA 微调也需要 60GB 显存的 GPU。

但成本的另一面是能力天花板。Code as Policies 的天花板被 API 设计锁死——API 之外的事它一概不会。OpenVLA 花了 $40,000 训练出来的模型,理论上能做训练数据中出现的任何任务组合。

3.6 闭环控制——能不能边做边调整

模块化的闭环能力取决于设计。

SayCan 的闭环非常弱。每一步的 affordance scoring 只在步骤开始时做一次——如果机器人在抓取过程中苹果滚了,它不会中途调整,而是把"抓"这步做完(失败),然后在下一步重新评估。Inner Monologue 在 SayCan 基础上做了改进——每步执行后让视觉模型检查"成功了吗?",如果失败就让 LLM 重新规划。但这仍然是"步间闭环",不是"步内闭环"。

Code as Policies 完全没有闭环——代码写好后一次性执行,不在运行中检查和调整。

端到端天然支持闭环。

OpenVLA 每个时间步都重新推理一次:摄像头拍一帧画面 → 输入模型 → 输出一步动作 → 执行 → 下一帧画面 → 再推理。这意味着如果苹果在抓取过程中滚了,下一帧画面会反映苹果的新位置,模型自动调整动作。这是端到端架构的天然优势——"感知 → 动作"的循环每一步都在跑。

但 OpenVLA 的推理速度限制了闭环的质量。6 Hz(每秒推理 6 次)对于大幅度运动足够,但对于精细装配(需要 20-50 Hz 的控制频率)不够。这就是 π0 用 Flow Matching 替代 token 化的原因之一——连续动作空间不需要离散化和 token 解码,推理可以更快。


4. 一张完整的对比总表

维度 模块化流水线 端到端一体化
信息流 模块间有瓶颈,信息被压缩 同一网络内自由流动
泛化来源 LLM 预训练 + 各模块各自泛化 VLM 预训练直接迁移到动作
涌现能力 无明确证据 RT-2 明确证明(符号/推理/识人)
可调试性 高(每步可检查,代码可读) 低(黑箱)
新技能 CaP 可代码组合;SayCan 封闭 受限于训练数据中的动作类型
训练成本 CaP $0;SayCan 中等 高($40k+ 起步)
闭环控制 弱(步间闭环或无闭环) 强(每步重推理)
推理速度 取决于最慢模块 受限于大模型推理(1-10 Hz)
可组合性 模块可独立升级替换 一体化,升级需重训
安全性 可加显式约束(代码层/规划层) 需隐式学习安全行为

5. 不是非此即彼——混合路线正在兴起

2024 年以后,越来越多的工作不再纠结"模块化还是端到端",而是取两者之长:

混合模式 1:端到端感知 + 模块化控制。

PaLM-E(2023)是 Google 的另一个重要工作。它的 VLM 部分是端到端的——把真实的机器人传感器数据(视觉、关节位置)和语言一起输入一个 562B 参数的多模态大模型。但输出不是直接的关节角度,而是高层规划文本,然后交给底层的预训练控制策略执行。这相当于"端到端大脑 + 模块化手脚"。

混合模式 2:端到端主体 + 模块化安全层。

在真实部署中,很多团队会在 VLA 模型外面套一层"安全壳"——一个规则引擎检查 VLA 输出的动作是否安全(力度是否超限、是否会碰到人、是否超出工作空间)。如果不安全就截断或替换。这实际上是"端到端模型 + 模块化安全监控"。

混合模式 3:分层端到端。

π0(2024)的做法特别有趣。它用一个大模型理解视觉和语言,输出一个"动作草图"(粗粒度的意图),然后用 Flow Matching 精细化为可执行的动作序列。整个过程是端到端训练的,但内部有明确的层次结构——类似于人类"先想做什么,再规划怎么做"的认知过程。

趋势判断:目前学术界的主流趋势是向端到端倾斜——RT-2、OpenVLA、π0 的连续成功让大多数研究者相信"大力出奇迹"。但工业界(实际部署场景)仍然大量使用模块化,因为可调试性和安全性在真实场景中是硬性要求。你的学习策略应该是两条路线都理解,然后根据具体场景选择。


6. 具体案例分析——同一个任务两种做法

让我们用一个具体任务来比较两种路线的完整执行过程。

任务:机器人站在厨房里,用户说"我想喝咖啡,帮我弄一杯"。

6.1 SayCan 的做法(模块化)

SayCan 的 LLM 收到指令后,开始逐步规划。它看不到摄像头画面,但它"知道"厨房里通常有什么。

第 1 步:LLM 生成候选动作列表——"找到咖啡杯""找到咖啡机""按下咖啡机按钮""拿起咖啡杯""走到用户面前""递出咖啡杯"等等。同时给每个候选打一个"语言概率分数"(这一步对完成任务有多大帮助)。

第 2 步:affordance function 看到当前摄像头画面——台面上有一个空咖啡杯、咖啡机在右边、水龙头在左边。它给每个候选动作打一个"物理可行性分数"——"找到咖啡杯" 0.95(就在视野里)、"找到咖啡机" 0.90(也在视野里)、"拿起热锅" 0.10(不相关且危险)。

第 3 步:两个分数相乘,argmax 选出下一步——"找到咖啡杯"(0.9 × 0.95 = 0.855)胜出。

第 4 步:底层 RL 策略执行"走到咖啡杯"这个预训练技能。

第 5-12 步:重复 1-4,逐步完成"拿起杯子→走到咖啡机→放杯子→按按钮→等待→拿起杯子→走到用户→递出"。

整个过程花费 8 个子步骤,LLM 被查询 8 次,affordance function 被评估 8 × 551 = 4,408 次(每步对 551 个技能都打分),底层策略被调用 8 次。

6.2 OpenVLA 的做法(端到端)

OpenVLA 收到摄像头画面 + "I want a cup of coffee, please make one for me" 这句话。

时刻 t=0:模型看到台面和咖啡杯,输出动作 [0.05, 0.02, -0.01, 0.0, 0.0, 0.01, 0](夹爪张开,手臂开始向咖啡杯移动)。

时刻 t=0.17s(6Hz):下一帧画面,手臂更靠近杯子了,输出 `[0.03, 0.01, -0.02, 0.0, 0.0, 0.0, 0]``(继续移动)。

时刻 t=1.5s:手臂到达杯子位置,输出 [0.0, 0.0, -0.005, 0.0, 0.0, 0.0, 1](闭合夹爪抓住杯子)。

时刻 t=2.0s-8.0s:连续输出动作,手臂带着杯子移向咖啡机……

整个过程是连续的控制循环——每 1/6 秒一个动作,没有"步骤"的概念。模型被调用约 50-60 次(总时间 8-10 秒 × 6 Hz)。

6.3 两种做法的对比

维度 SayCan OpenVLA
决策粒度 8 个离散子步骤 ~60 个连续控制步
感知利用 每步开始看一次 每 1/6 秒看一次
意外处理 杯子被移走 → 当步失败 → 下步重规划 杯子被移走 → 下一帧自动追踪新位置
理解深度 LLM 不知道咖啡机长什么样 模型知道咖啡机长什么样(视觉预训练)
失败排查 可以看规划 + affordance 分数 只能看 7 维动作向量
组合任务 LLM 天然擅长组合 需训练数据中有类似复合任务

7. 四篇核心论文的技术细节速查

这一节给出你的 13 篇论文中涉及两条路线的四篇核心论文的关键技术参数,方便后续精读时快速参考。

7.1 SayCan 技术卡片

参数
发表 CoRL 2022,Google Robotics
架构 LLM(闭源 540B)+ Affordance(RL Value Function)+ 底层策略(BC)
技能集大小 551 个预定义技能(7 大类:拾取/放置/走到/开/关/倒/丢弃)
训练数据 68,000 段遥操作演示(10 台 Everyday Robot × 11 个月)
评测场景 模拟厨房 + 真实办公室厨房
核心公式 `π(a) = argmax[ P(say
规划准确率 真实环境 81%、执行端到端成功率 60%
关键限制 技能集封闭;弱闭环;否定指令容易出错;长程任务 65% 失败因过早输出 done

7.2 Code as Policies 技术卡片

参数
发表 ICRA 2023,Google Brain
架构 LLM(Codex / GPT-3)→ 生成 Python 代码 → exec() 调用 API
训练 零训练、零微调(完全依赖 prompt)
API 类型 感知 API(detect_objects, get_pos)+ 控制 API(pick_place, set_velocity)
代码生成 分层:遇到未定义函数时递归调用 LLM 补写
评测 桌面操作 CaP 97.2% vs CLIPort 78.8%(见过的任务)
未见任务 CaP 62% vs CLIPort 0.01%
关键限制 天花板被 API 设计锁死;无闭环;代码可能有 bug

7.3 RT-2 技术卡片

参数
发表 CoRL 2023,Google DeepMind
架构 PaLI-X (5B/55B) 或 PaLM-E (12B),动作 → 256 bin 离散化 → token
训练 Co-fine-tuning:机器人数据 50-66% + 网页 VQA 数据
动作编码 8 维(6-DoF 末端位姿变化 + 夹爪 + 终止),每维 256 档
核心发现 模型越大泛化越好(55B vs 5B: +20 点)
涌现能力 符号理解 / 推理 / 人物识别:60% vs RT-1 的 17%
推理速度 1-3 Hz(TPU 云端)
关键限制 闭源不可复现;推理太慢做不了精细任务;不能学新动作类型

7.4 OpenVLA 技术卡片

参数
发表 CoRL 2024,Stanford / TRI / Berkeley
架构 Prismatic-7B(DINOv2 + SigLIP → MLP → Llama 2 7B),动作 → 256 bin → 最低频 token
训练 OXE 970k 段 × 27 epoch,64×A100×14 天 ≈ $40k
动作编码 7 维(6-DoF + 夹爪),每维 256 档,映射到 LLM 最低频 256 个 token
BridgeData V2 70.6% vs RT-2-X 50.6%(+20 点),参数小 7 倍
推理速度 RTX 4090: ~6 Hz
微调 LoRA 1.4% 参数 + 60 GB 显存 ≈ 追平全量
关键限制 单帧无时序;6 Hz 不够精细;微调后灾难性遗忘

8. 你的 13 篇论文在两条路线中的位置

回到你的 13 篇论文,标注每篇属于哪条路线。

论文 路线 角色
LLaVA 端到端(基础设施) VLM 基座,VLA 的视觉地基
SayCan 模块化 规划模块的经典代表
OpenVLA 端到端 开源 VLA 基线
VLAS 端到端 VLA 的语音扩展
MLA 端到端 VLA 的多感官扩展
3DShape2VecSet 中立(基础设施) 3D 表征,两条路线都能用
Cosmos Policy 端到端 + 世界模型 世界模型驱动的策略学习
RF-SLAM 中立(感知层) 射频感知,两条路线都能用
mmCLIP 中立(感知层) 毫米波语义对齐
NLOS mmWave 中立(感知层) 非视线感知
Proactive Hearing 中立(感知层) 选择性听觉
NeuralAids 中立(感知层) 助听增强
Acoustic Swarms 中立(感知层) 声学分离定位

有趣的发现:你的 13 篇中感知层论文(射频 + 听觉共 6 篇)是路线中立的——它们提供感知能力,不关心下游是模块化还是端到端。VLM 方向(LLaVA)也是路线中立的基础设施。真正站队的是 SayCan(模块化)和 OpenVLA/VLAS/MLA(端到端)。


9. 三个设计决策思考题

思考题 1:成本约束下的选择。

你是一家初创公司的机器人工程师,预算只有 $5,000,需要在两周内做出一个"端茶送水"的机器人原型给投资人看。你选模块化还是端到端?为什么?

思考题 2:安全优先的选择。

你要做一个在养老院照顾老人的机器人。它可能需要扶老人站起来、递药、递水。出错可能导致老人受伤。你选模块化还是端到端?为什么?如果选端到端,你会加什么模块化的"安全壳"?

思考题 3:未来判断。

假设 2027 年出现了一个 1000B 参数的端到端 VLA 模型,在 100 万种任务上都达到了 95%+ 的成功率,推理速度达到 50 Hz。这时候模块化流水线还有存在的价值吗?

参考思路(先自己想再展开)

题 1 参考:预算 $5,000、两周时间——几乎肯定选模块化,具体选 Code as Policies 路线。零训练成本,只需要一个 GPT-4 API 和几个已有的机器人控制 API。$5,000 用来买/租一个简单的机械臂 + 摄像头。端到端方案(OpenVLA)光微调就需要 60 GB 显存的 GPU,$5,000 预算连一张 A100 的一周租金都不够。

题 2 参考:安全优先场景,模块化更合适——每步规划可以被安全规则检查器审核。但纯模块化的闭环能力弱,可能在"扶老人"这种需要实时力反馈的任务上不够好。一个混合方案可能是:端到端 VLA 做主体,外面包一层力矩限制器(任何一个关节力矩超过阈值立即停止)+ 工作空间限制(手臂不能运动到老人头部以上)+ 速度限制(靠近人体时自动减速)。这些都是简单的规则,可以在 VLA 外面实现。

题 3 参考:即使有超大规模端到端模型,模块化仍然有价值——(1) 法律责任:出事了需要解释"为什么做了这个动作",黑箱模型无法解释;(2) 紧急覆写:安全关键场景需要人类能在任何时刻接管,这需要模块化的安全层;(3) 可审计性:合规要求每个决策可追溯;(4) 长尾问题:95% 在工业场景中不够——那 5% 的失败可能是致命的,需要可调试来逐一修复。


10. 本章小结

回顾本章的核心要点:

  • 模块化流水线把"感知 → 规划 → 执行"拆成独立模块,优势是可调试、可组合、可独立升级,劣势是信息瓶颈和弱闭环
  • 端到端一体化用一个大模型从感知直接到动作,优势是无信息瓶颈、强闭环、预训练知识直接迁移,劣势是黑箱、训练昂贵、不能学新动作类型
  • RT-2 首次证明了端到端 VLA 的涌现能力——模型越大泛化越好
  • OpenVLA 把这条路线开源——7B 参数打赢了 55B 的 RT-2-X
  • Code as Policies 是模块化的极致——零训练成本,LLM 直接写代码控制机器人
  • 2024 年后混合路线兴起:端到端主体 + 模块化安全层 / 分层端到端
  • 你的 13 篇中 SayCan 代表模块化,OpenVLA/VLAS/MLA 代表端到端,6 篇感知论文是路线中立的

下一章我们画出具身 AI 2021-2025 年的时间线,把这些论文放到历史脉络中。


导读目录:README.md 上一章:Ch04: 11 个主题全景图——一个机器人的 11 个器官 下一章:Ch06: 具身 AI 的时间线——2021-2025 关键里程碑

本章涉及论文 10 篇

点击查看论文笔记全文,标有 的为已读。

№ 03 High-Level Planning · 祖师爷

SayCan

№ 109 End-to-End VLA · 祖师爷

RT-1

№ 112 End-to-End VLA · 经典

RT-2

№ 04 End-to-End VLA · 经典

OpenVLA

№ 47 Diffusion Policy · 前沿

π₀