Ch05: 两条技术路线——模块化流水线 vs 端到端一体化
Ch05: 两条技术路线——模块化流水线 vs 端到端一体化
Part 2: 全景概念 前置章节:Ch04: 11 个主题全景图——一个机器人的 11 个器官 后续章节:Ch06: 具身 AI 的时间线——2021-2025 关键里程碑
1. 一个你熟悉的选择题
你要搬家,需要把东西从旧房子搬到新房子。你有两种方案:
方案 A:流水线作业。 雇一个规划师、一个打包师、一个搬运工、一个司机。规划师看你家的东西列一张清单,打包师按清单装箱,搬运工把箱子搬上货车,司机开到新家。四个人各管一段,清清楚楚。问题是——规划师列清单的时候不知道某些柜子是钉在墙上的(他不做搬运,不知道这些物理限制),于是搬运工到了现场才发现计划走不通,只能打电话回去改计划。信息在四个人之间传递,每传一次丢一点。
方案 B:一个人全包。 你雇了一个超级搬家员。他同时能看、能想、能动——走进房间环顾一周,脑子里自动规划先搬什么后搬什么,然后撸起袖子自己搬。速度可能没方案 A 快(一个人干四个人的活),但不会出现"信息丢失"的问题,因为所有信息都在一个人脑子里。问题是——他搬错了东西你问他为什么,他说不清楚,因为他的决策过程是"直觉式"的。
这就是具身 AI 领域最核心的架构争论:模块化流水线(Modular Pipeline)vs 端到端一体化(End-to-End)。
2. 两条路线的正式定义
2.1 模块化流水线
把"从感知到动作"的过程拆成多个独立模块,每个模块有明确的输入输出接口,像工厂流水线一样首尾相接。
一个典型的模块化系统长这样:
用户指令: "把桌上的红苹果放进碗里"
│
▼
┌──────────────────┐
│ 感知模块 │ 输入: 摄像头画面
│ (目标检测/分割) │ 输出: "红苹果在坐标 (0.3, 0.2, 0.1),碗在 (0.5, 0.4, 0.05)"
└────────┬─────────┘
│
▼
┌──────────────────┐
│ 规划模块 │ 输入: 指令 + 物体位置
│ (LLM / 规划器) │ 输出: ["移动到苹果上方", "下降", "闭合夹爪", "抬起",
└────────┬─────────┘ "移动到碗上方", "下降", "打开夹爪"]
│
▼
┌──────────────────┐
│ 底层控制模块 │ 输入: 子任务指令
│ (RL 策略/MPC) │ 输出: 关节角速度 [θ₁, θ₂, ..., θ₇]
└──────────────────┘
代表工作:
- SayCan(2022):LLM 当规划大脑,affordance function 当可行性评估器,预训练的 RL 策略当手脚。三个模块各自独立训练。
- Code as Policies(2023):LLM 直接写 Python 代码来调用感知和控制 API。模块化的极致表达——每个 API 是一个模块,LLM 是"调度中心"。
- Inner Monologue(2022):在 SayCan 基础上加了"内心独白"——每步执行后检查成功/失败,反馈给 LLM 决定下一步。模块化体系下的闭环尝试。
2.2 端到端一体化
用一个巨大的神经网络,从摄像头画面和语言指令直接输出关节动作,中间没有任何显式的模块拆分。
一个典型的端到端系统长这样:
用户指令: "把桌上的红苹果放进碗里"
│
▼
┌─────────────────────────────────────────────────┐
│ VLA 端到端模型 │
│ │
│ 视觉编码器 ──→ 投影层 ──→ 语言模型 ──→ 动作头 │
│ (DINOv2+SigLIP) (Llama 2 7B) │
│ │
│ 输入: 图像 pixels + 文本 tokens │
│ 输出: [Δx, Δy, Δz, Δroll, Δpitch, Δyaw, grip] │
└─────────────────────────────────────────────────┘
代表工作:
- RT-2(2023):第一个正式提出 VLA 概念的工作。把机器人动作编码为 VLM 词表中的 token,让 VLM 像回答视觉问答一样"回答"动作。55B 参数,闭源。
- OpenVLA(2024):开源的 7B VLA。把 Prismatic VLM 接上动作 token 化,用 Open X-Embodiment 数据集训练。目前最重要的开源 VLA 基线。
- π0(2024):Physical Intelligence 的旗舰模型。用 Flow Matching(扩散的简化版)替代动作 token 化,输出连续动作。
3. 深入对比:六个关键维度
下面从六个维度逐一对比两条路线。每个维度先给直觉,再给具体数据。
3.1 信息传递——是否有瓶颈
模块化的问题:信息在模块间传递时会丢失。
SayCan 的例子:LLM 在打分时看不到摄像头画面——它只知道"我有 551 个技能可以选",但不知道桌上到底有什么。affordance function 能看到画面,但它只能输出一个 0-1 的数字("这个动作有多大概率能做到"),不能告诉 LLM "红苹果被杯子挡住了,你可能需要先把杯子移开"。两个模块之间的信息传递被压缩成了一个标量——这就是"信息瓶颈"。
Code as Policies 稍好一些:LLM 可以调用 detect_objects() 获取场景信息,相当于把感知模块的输出"拉"到规划模块里。但它仍然受限于 API 提供的信息粒度——如果 API 只返回物体的中心坐标,LLM 就不知道物体的形状和材质。
端到端的优势:所有信息在同一个网络中流动,没有显式瓶颈。
RT-2 的例子:视觉编码器处理完图像后,生成的视觉 token 和语言 token 在同一个 Transformer 里做 self-attention——模型可以自由地把"图片中红色区域"和"苹果"这个词关联起来,然后直接影响动作输出。没有任何一个中间步骤把信息压缩成标量。
RT-2 论文中展示了一个令人惊讶的涌现能力:你给它看一张桌子上有各种物体的图片,说"pick up the object that Taylor Swift would like"——模型能识别出一个吉他形状的物体并抓起来。这种"常识推理 → 视觉识别 → 动作执行"的链条只有在信息端到端流动时才可能实现。SayCan 的 LLM 也知道 Taylor Swift 可能喜欢吉他,但它看不到画面,不知道桌上有没有吉他形状的东西。
3.2 泛化能力——面对没见过的场景
端到端的关键优势:预训练知识的直接迁移。
RT-2 的数据特别有说服力:
| 测试类型 | RT-2 (55B) | RT-1 | SayCan |
|---|---|---|---|
| 见过的物体/背景 | ~90% | ~90% | ~90% |
| 未见物体 | 62% | 32% | 不适用(需重新训练技能) |
| 涌现推理能力 | 60% | 17% | 不适用 |
未见物体泛化提升近一倍。涌现推理能力——用文字描述物体("pick the object most likely to be found in a bathroom")——从 17% 跳到 60%。RT-2 论文还证明了一个规律:模型越大泛化越好(55B 比 5B 高 20 个百分点)。这在模块化范式中很难实现,因为 SayCan 的泛化依赖于每个独立模块的泛化,而底层的 RL 技能策略往往严重过拟合训练场景。
模块化的优势:可以单独升级任何一个模块。
Code as Policies 有一个独特优势:LLM 不需要任何微调。当 GPT-4 出来替换 GPT-3 时,Code as Policies 的规划能力自动升级——你只需要换一个 API key。而 RT-2 如果想利用更强的语言模型,需要重新预训练整个 VLM,成本以万美元计。SayCan 同理——换一个更强的 LLM 不需要重新训练底层技能。
3.3 可调试性——出错了怎么办
模块化的核心优势:每一步都可以检查。
SayCan 的机器人在执行"拿苹果放进碗里"时失败了。你可以逐步排查:LLM 给出的规划是什么?("移到苹果 → 抓 → 移到碗 → 放"——看起来对。)affordance function 给的分数是什么?(苹果 0.9、碗 0.8——看起来对。)底层策略在"抓"这一步的执行轨迹是什么?(手爪到了苹果旁边但没夹紧——找到了!是底层抓取策略的问题。)
Code as Policies 更好——它直接给你 Python 代码。如果代码有 bug,你能像调试普通程序一样定位问题行。论文里的一个真实例子:LLM 生成了 pick_place(apple, bowl) 但苹果太大放不进碗里。你只需要在代码里加一行 if apple.size > bowl.opening: use_bigger_bowl()。
端到端的调试困境:黑箱。
OpenVLA 在执行"拿苹果放进碗里"时失败了。输出的 7 维动作向量是 [0.12, -0.05, 0.08, 0.0, 0.0, 0.03, 1]。为什么是这组数字?你完全不知道。是因为它没认出苹果?还是认出了但计算的轨迹有偏差?还是轨迹对了但夹爪力度不够?端到端模型不会告诉你。
论文中记录的一个真实案例:OpenVLA 在微调后出现了"灾难性遗忘"——它在学会新任务后忘了怎么识别明星脸。这个 bug 被发现是因为研究者恰好测试了视觉常识,但如果没测呢?端到端模型的失败模式是不可预测的。
3.4 新技能习得——能不能做没见过的动作
模块化的灵活性差异很大。
SayCan 的技能集是封闭的——551 个预定义技能。如果你想让机器人做一个新动作(比如"用筷子夹花生"),你需要:(1) 定义新技能,(2) 用 RL 训练新的策略,(3) 用人类演示训练新的 affordance function。整个过程可能需要几周。
Code as Policies 的灵活性好得多——只要你能用已有的 API 组合出新动作,LLM 就能写出代码。"先用左手拿碗、再用右手拿勺子、最后左右手配合"——这种组合逻辑不需要任何额外训练。但如果 API 中没有"用筷子"这个操作,代码也写不出来。
端到端的局限:受训练数据中的动作类型限制。
RT-2 论文明确说:"RT-2 can generalize its understanding to new objects/scenes, but cannot generate novel motor skills not seen during training." 翻译过来:它能用已有的抓取技能去抓新物体(泛化识别),但不能自己发明一个新的抓取姿势(泛化动作)。OpenVLA 同理——它只会 Open X-Embodiment 数据集中出现过的动作类型。
这是一个根本性限制。端到端模型的"行为空间"完全由训练数据定义。你给它看一百万次"平移 + 抓取"的演示,它就只会"平移 + 抓取"。想让它学会"旋转 + 插入"?你得找数据集里有没有这种演示。
3.5 训练成本
| 方面 | SayCan | Code as Policies | RT-2 (55B) | OpenVLA (7B) |
|---|---|---|---|---|
| 训练是否需要 | 是(RL + BC) | 否(零训练) | 是(VLM 微调) | 是(VLM 微调) |
| 数据需求 | 68,000 段演示(11 个月) | 0 段 | RT-1 数据 + 网页数据 | 970k 段(OXE) |
| 算力成本 | 中等(RL 仿真训练) | $0 | 极高(闭源未公布) | $40,000(64×A100×14 天) |
| 微调适配成本 | 需重新训练每个技能 | 改 prompt 即可 | 不可复现(闭源) | LoRA 60GB 显存 |
Code as Policies 的训练成本几乎为零——这是一个巨大的实际优势。你今天就可以拿 GPT-4 + 几个机器人 API 搭出一个工作系统。相比之下,OpenVLA 需要 $40,000 的算力从头训练,即使用 LoRA 微调也需要 60GB 显存的 GPU。
但成本的另一面是能力天花板。Code as Policies 的天花板被 API 设计锁死——API 之外的事它一概不会。OpenVLA 花了 $40,000 训练出来的模型,理论上能做训练数据中出现的任何任务组合。
3.6 闭环控制——能不能边做边调整
模块化的闭环能力取决于设计。
SayCan 的闭环非常弱。每一步的 affordance scoring 只在步骤开始时做一次——如果机器人在抓取过程中苹果滚了,它不会中途调整,而是把"抓"这步做完(失败),然后在下一步重新评估。Inner Monologue 在 SayCan 基础上做了改进——每步执行后让视觉模型检查"成功了吗?",如果失败就让 LLM 重新规划。但这仍然是"步间闭环",不是"步内闭环"。
Code as Policies 完全没有闭环——代码写好后一次性执行,不在运行中检查和调整。
端到端天然支持闭环。
OpenVLA 每个时间步都重新推理一次:摄像头拍一帧画面 → 输入模型 → 输出一步动作 → 执行 → 下一帧画面 → 再推理。这意味着如果苹果在抓取过程中滚了,下一帧画面会反映苹果的新位置,模型自动调整动作。这是端到端架构的天然优势——"感知 → 动作"的循环每一步都在跑。
但 OpenVLA 的推理速度限制了闭环的质量。6 Hz(每秒推理 6 次)对于大幅度运动足够,但对于精细装配(需要 20-50 Hz 的控制频率)不够。这就是 π0 用 Flow Matching 替代 token 化的原因之一——连续动作空间不需要离散化和 token 解码,推理可以更快。
4. 一张完整的对比总表
| 维度 | 模块化流水线 | 端到端一体化 |
|---|---|---|
| 信息流 | 模块间有瓶颈,信息被压缩 | 同一网络内自由流动 |
| 泛化来源 | LLM 预训练 + 各模块各自泛化 | VLM 预训练直接迁移到动作 |
| 涌现能力 | 无明确证据 | RT-2 明确证明(符号/推理/识人) |
| 可调试性 | 高(每步可检查,代码可读) | 低(黑箱) |
| 新技能 | CaP 可代码组合;SayCan 封闭 | 受限于训练数据中的动作类型 |
| 训练成本 | CaP $0;SayCan 中等 | 高($40k+ 起步) |
| 闭环控制 | 弱(步间闭环或无闭环) | 强(每步重推理) |
| 推理速度 | 取决于最慢模块 | 受限于大模型推理(1-10 Hz) |
| 可组合性 | 模块可独立升级替换 | 一体化,升级需重训 |
| 安全性 | 可加显式约束(代码层/规划层) | 需隐式学习安全行为 |
5. 不是非此即彼——混合路线正在兴起
2024 年以后,越来越多的工作不再纠结"模块化还是端到端",而是取两者之长:
混合模式 1:端到端感知 + 模块化控制。
PaLM-E(2023)是 Google 的另一个重要工作。它的 VLM 部分是端到端的——把真实的机器人传感器数据(视觉、关节位置)和语言一起输入一个 562B 参数的多模态大模型。但输出不是直接的关节角度,而是高层规划文本,然后交给底层的预训练控制策略执行。这相当于"端到端大脑 + 模块化手脚"。
混合模式 2:端到端主体 + 模块化安全层。
在真实部署中,很多团队会在 VLA 模型外面套一层"安全壳"——一个规则引擎检查 VLA 输出的动作是否安全(力度是否超限、是否会碰到人、是否超出工作空间)。如果不安全就截断或替换。这实际上是"端到端模型 + 模块化安全监控"。
混合模式 3:分层端到端。
π0(2024)的做法特别有趣。它用一个大模型理解视觉和语言,输出一个"动作草图"(粗粒度的意图),然后用 Flow Matching 精细化为可执行的动作序列。整个过程是端到端训练的,但内部有明确的层次结构——类似于人类"先想做什么,再规划怎么做"的认知过程。
趋势判断:目前学术界的主流趋势是向端到端倾斜——RT-2、OpenVLA、π0 的连续成功让大多数研究者相信"大力出奇迹"。但工业界(实际部署场景)仍然大量使用模块化,因为可调试性和安全性在真实场景中是硬性要求。你的学习策略应该是两条路线都理解,然后根据具体场景选择。
6. 具体案例分析——同一个任务两种做法
让我们用一个具体任务来比较两种路线的完整执行过程。
任务:机器人站在厨房里,用户说"我想喝咖啡,帮我弄一杯"。
6.1 SayCan 的做法(模块化)
SayCan 的 LLM 收到指令后,开始逐步规划。它看不到摄像头画面,但它"知道"厨房里通常有什么。
第 1 步:LLM 生成候选动作列表——"找到咖啡杯""找到咖啡机""按下咖啡机按钮""拿起咖啡杯""走到用户面前""递出咖啡杯"等等。同时给每个候选打一个"语言概率分数"(这一步对完成任务有多大帮助)。
第 2 步:affordance function 看到当前摄像头画面——台面上有一个空咖啡杯、咖啡机在右边、水龙头在左边。它给每个候选动作打一个"物理可行性分数"——"找到咖啡杯" 0.95(就在视野里)、"找到咖啡机" 0.90(也在视野里)、"拿起热锅" 0.10(不相关且危险)。
第 3 步:两个分数相乘,argmax 选出下一步——"找到咖啡杯"(0.9 × 0.95 = 0.855)胜出。
第 4 步:底层 RL 策略执行"走到咖啡杯"这个预训练技能。
第 5-12 步:重复 1-4,逐步完成"拿起杯子→走到咖啡机→放杯子→按按钮→等待→拿起杯子→走到用户→递出"。
整个过程花费 8 个子步骤,LLM 被查询 8 次,affordance function 被评估 8 × 551 = 4,408 次(每步对 551 个技能都打分),底层策略被调用 8 次。
6.2 OpenVLA 的做法(端到端)
OpenVLA 收到摄像头画面 + "I want a cup of coffee, please make one for me" 这句话。
时刻 t=0:模型看到台面和咖啡杯,输出动作 [0.05, 0.02, -0.01, 0.0, 0.0, 0.01, 0](夹爪张开,手臂开始向咖啡杯移动)。
时刻 t=0.17s(6Hz):下一帧画面,手臂更靠近杯子了,输出 `[0.03, 0.01, -0.02, 0.0, 0.0, 0.0, 0]``(继续移动)。
时刻 t=1.5s:手臂到达杯子位置,输出 [0.0, 0.0, -0.005, 0.0, 0.0, 0.0, 1](闭合夹爪抓住杯子)。
时刻 t=2.0s-8.0s:连续输出动作,手臂带着杯子移向咖啡机……
整个过程是连续的控制循环——每 1/6 秒一个动作,没有"步骤"的概念。模型被调用约 50-60 次(总时间 8-10 秒 × 6 Hz)。
6.3 两种做法的对比
| 维度 | SayCan | OpenVLA |
|---|---|---|
| 决策粒度 | 8 个离散子步骤 | ~60 个连续控制步 |
| 感知利用 | 每步开始看一次 | 每 1/6 秒看一次 |
| 意外处理 | 杯子被移走 → 当步失败 → 下步重规划 | 杯子被移走 → 下一帧自动追踪新位置 |
| 理解深度 | LLM 不知道咖啡机长什么样 | 模型知道咖啡机长什么样(视觉预训练) |
| 失败排查 | 可以看规划 + affordance 分数 | 只能看 7 维动作向量 |
| 组合任务 | LLM 天然擅长组合 | 需训练数据中有类似复合任务 |
7. 四篇核心论文的技术细节速查
这一节给出你的 13 篇论文中涉及两条路线的四篇核心论文的关键技术参数,方便后续精读时快速参考。
7.1 SayCan 技术卡片
| 参数 | 值 |
|---|---|
| 发表 | CoRL 2022,Google Robotics |
| 架构 | LLM(闭源 540B)+ Affordance(RL Value Function)+ 底层策略(BC) |
| 技能集大小 | 551 个预定义技能(7 大类:拾取/放置/走到/开/关/倒/丢弃) |
| 训练数据 | 68,000 段遥操作演示(10 台 Everyday Robot × 11 个月) |
| 评测场景 | 模拟厨房 + 真实办公室厨房 |
| 核心公式 | `π(a) = argmax[ P(say |
| 规划准确率 | 真实环境 81%、执行端到端成功率 60% |
| 关键限制 | 技能集封闭;弱闭环;否定指令容易出错;长程任务 65% 失败因过早输出 done |
7.2 Code as Policies 技术卡片
| 参数 | 值 |
|---|---|
| 发表 | ICRA 2023,Google Brain |
| 架构 | LLM(Codex / GPT-3)→ 生成 Python 代码 → exec() 调用 API |
| 训练 | 零训练、零微调(完全依赖 prompt) |
| API 类型 | 感知 API(detect_objects, get_pos)+ 控制 API(pick_place, set_velocity) |
| 代码生成 | 分层:遇到未定义函数时递归调用 LLM 补写 |
| 评测 | 桌面操作 CaP 97.2% vs CLIPort 78.8%(见过的任务) |
| 未见任务 | CaP 62% vs CLIPort 0.01% |
| 关键限制 | 天花板被 API 设计锁死;无闭环;代码可能有 bug |
7.3 RT-2 技术卡片
| 参数 | 值 |
|---|---|
| 发表 | CoRL 2023,Google DeepMind |
| 架构 | PaLI-X (5B/55B) 或 PaLM-E (12B),动作 → 256 bin 离散化 → token |
| 训练 | Co-fine-tuning:机器人数据 50-66% + 网页 VQA 数据 |
| 动作编码 | 8 维(6-DoF 末端位姿变化 + 夹爪 + 终止),每维 256 档 |
| 核心发现 | 模型越大泛化越好(55B vs 5B: +20 点) |
| 涌现能力 | 符号理解 / 推理 / 人物识别:60% vs RT-1 的 17% |
| 推理速度 | 1-3 Hz(TPU 云端) |
| 关键限制 | 闭源不可复现;推理太慢做不了精细任务;不能学新动作类型 |
7.4 OpenVLA 技术卡片
| 参数 | 值 |
|---|---|
| 发表 | CoRL 2024,Stanford / TRI / Berkeley |
| 架构 | Prismatic-7B(DINOv2 + SigLIP → MLP → Llama 2 7B),动作 → 256 bin → 最低频 token |
| 训练 | OXE 970k 段 × 27 epoch,64×A100×14 天 ≈ $40k |
| 动作编码 | 7 维(6-DoF + 夹爪),每维 256 档,映射到 LLM 最低频 256 个 token |
| BridgeData V2 | 70.6% vs RT-2-X 50.6%(+20 点),参数小 7 倍 |
| 推理速度 | RTX 4090: ~6 Hz |
| 微调 | LoRA 1.4% 参数 + 60 GB 显存 ≈ 追平全量 |
| 关键限制 | 单帧无时序;6 Hz 不够精细;微调后灾难性遗忘 |
8. 你的 13 篇论文在两条路线中的位置
回到你的 13 篇论文,标注每篇属于哪条路线。
| 论文 | 路线 | 角色 |
|---|---|---|
| LLaVA | 端到端(基础设施) | VLM 基座,VLA 的视觉地基 |
| SayCan | 模块化 | 规划模块的经典代表 |
| OpenVLA | 端到端 | 开源 VLA 基线 |
| VLAS | 端到端 | VLA 的语音扩展 |
| MLA | 端到端 | VLA 的多感官扩展 |
| 3DShape2VecSet | 中立(基础设施) | 3D 表征,两条路线都能用 |
| Cosmos Policy | 端到端 + 世界模型 | 世界模型驱动的策略学习 |
| RF-SLAM | 中立(感知层) | 射频感知,两条路线都能用 |
| mmCLIP | 中立(感知层) | 毫米波语义对齐 |
| NLOS mmWave | 中立(感知层) | 非视线感知 |
| Proactive Hearing | 中立(感知层) | 选择性听觉 |
| NeuralAids | 中立(感知层) | 助听增强 |
| Acoustic Swarms | 中立(感知层) | 声学分离定位 |
有趣的发现:你的 13 篇中感知层论文(射频 + 听觉共 6 篇)是路线中立的——它们提供感知能力,不关心下游是模块化还是端到端。VLM 方向(LLaVA)也是路线中立的基础设施。真正站队的是 SayCan(模块化)和 OpenVLA/VLAS/MLA(端到端)。
9. 三个设计决策思考题
思考题 1:成本约束下的选择。
你是一家初创公司的机器人工程师,预算只有 $5,000,需要在两周内做出一个"端茶送水"的机器人原型给投资人看。你选模块化还是端到端?为什么?
思考题 2:安全优先的选择。
你要做一个在养老院照顾老人的机器人。它可能需要扶老人站起来、递药、递水。出错可能导致老人受伤。你选模块化还是端到端?为什么?如果选端到端,你会加什么模块化的"安全壳"?
思考题 3:未来判断。
假设 2027 年出现了一个 1000B 参数的端到端 VLA 模型,在 100 万种任务上都达到了 95%+ 的成功率,推理速度达到 50 Hz。这时候模块化流水线还有存在的价值吗?
参考思路(先自己想再展开)
题 1 参考:预算 $5,000、两周时间——几乎肯定选模块化,具体选 Code as Policies 路线。零训练成本,只需要一个 GPT-4 API 和几个已有的机器人控制 API。$5,000 用来买/租一个简单的机械臂 + 摄像头。端到端方案(OpenVLA)光微调就需要 60 GB 显存的 GPU,$5,000 预算连一张 A100 的一周租金都不够。
题 2 参考:安全优先场景,模块化更合适——每步规划可以被安全规则检查器审核。但纯模块化的闭环能力弱,可能在"扶老人"这种需要实时力反馈的任务上不够好。一个混合方案可能是:端到端 VLA 做主体,外面包一层力矩限制器(任何一个关节力矩超过阈值立即停止)+ 工作空间限制(手臂不能运动到老人头部以上)+ 速度限制(靠近人体时自动减速)。这些都是简单的规则,可以在 VLA 外面实现。
题 3 参考:即使有超大规模端到端模型,模块化仍然有价值——(1) 法律责任:出事了需要解释"为什么做了这个动作",黑箱模型无法解释;(2) 紧急覆写:安全关键场景需要人类能在任何时刻接管,这需要模块化的安全层;(3) 可审计性:合规要求每个决策可追溯;(4) 长尾问题:95% 在工业场景中不够——那 5% 的失败可能是致命的,需要可调试来逐一修复。
10. 本章小结
回顾本章的核心要点:
- 模块化流水线把"感知 → 规划 → 执行"拆成独立模块,优势是可调试、可组合、可独立升级,劣势是信息瓶颈和弱闭环
- 端到端一体化用一个大模型从感知直接到动作,优势是无信息瓶颈、强闭环、预训练知识直接迁移,劣势是黑箱、训练昂贵、不能学新动作类型
- RT-2 首次证明了端到端 VLA 的涌现能力——模型越大泛化越好
- OpenVLA 把这条路线开源——7B 参数打赢了 55B 的 RT-2-X
- Code as Policies 是模块化的极致——零训练成本,LLM 直接写代码控制机器人
- 2024 年后混合路线兴起:端到端主体 + 模块化安全层 / 分层端到端
- 你的 13 篇中 SayCan 代表模块化,OpenVLA/VLAS/MLA 代表端到端,6 篇感知论文是路线中立的
下一章我们画出具身 AI 2021-2025 年的时间线,把这些论文放到历史脉络中。
导读目录:README.md 上一章:Ch04: 11 个主题全景图——一个机器人的 11 个器官 下一章:Ch06: 具身 AI 的时间线——2021-2025 关键里程碑
本章涉及论文 10 篇
点击查看论文笔记全文,标有 ● 的为已读。