Ch03: 前置知识检查清单——学具身智能之前你需要什么
Ch03: 前置知识检查清单——学具身智能之前你需要什么
Part 1: 导读总纲 前置章节:Ch02: 阅读路线图——三条路径任你选 后续章节:Ch04: 11 个主题全景图——一个机器人的 11 个器官
1. 这章在做什么
具身智能是一个交叉学科——你会同时遇到深度学习、计算机视觉、自然语言处理、机器人学、控制论、甚至物理信号处理的概念。如果每遇到一个不懂的术语都要停下来查,阅读体验会非常糟糕。
这一章的目标是:帮你检查自己的知识底盘,找出需要补的缺口,并给出最小化的补课路线——不是让你去学一整门课,而是告诉你"理解后续章节至少需要知道什么"。
补课资源速查:Learn: 学习路径地图 汇总了 30+ 条中文入门资源(视频 / 教材 / 公开课),按阶段分好了,缺什么补什么。
我把前置知识分成三层:地基层(必须有,否则后面寸步难行)、脚手架层(最好有,缺了会影响理解深度但不完全卡住)、锦上添花层(有则更好,没有也不影响阅读主线)。先做个自检,然后按需补课。
2. 地基层——没有这些读不下去
地基层有四块,每块我会给出"你需要知道什么"和"怎么验证自己知道了"。
2.1 线性代数基本功
你需要知道什么:向量是什么(一列数字)、矩阵是什么(一张数字表格)、矩阵乘法怎么算(行乘列求和)、转置是什么(行列互换)。不需要知道特征值分解、SVD 之类的高级概念。
为什么是地基:具身智能的几乎每一步都是矩阵运算。摄像头画面是一个三维矩阵(高 × 宽 × 颜色通道),Transformer 的注意力计算是矩阵乘法,机器人的关节角度是一个向量,CLIP 的图文匹配是两个向量的点积。不理解矩阵运算,后面的所有公式都会变成天书。
自检问题:给你两个矩阵 A(2×3)和 B(3×2),你能算出 AB 的结果吗?AB 的形状是什么?BA 的形状呢?AB 和 BA 相等吗?
你的现有基础:目前 learnings/ 中没有线性代数的专门笔记。RL 数学基础笔记(rl-math-fundamentals.md)涉及了向量概念但没有展开矩阵运算。
最小补课建议:3Blue1Brown 的《线性代数的本质》前 4 集(中文字幕),总共约 1 小时。看完后你会直觉地理解"矩阵就是空间变换"。不需要做题,看懂视频就够用了。
2.2 概率基本概念
你需要知道什么:概率是 0 到 1 之间的数、概率分布是什么(一组可能结果各自的概率)、条件概率("已知 A 发生了,B 发生的概率是多少")、期望值("平均会怎样")。不需要知道贝叶斯定理的推导或假设检验。
为什么是地基:机器人的动作选择本质上就是在一个概率分布上采样。SayCan 的核心公式是"语言概率 × 可行性概率";强化学习的策略就是"在状态 s 下选动作 a 的概率分布";扩散策略从"噪声分布"出发逐步恢复到"动作分布"。不理解概率分布,这些核心思想都会变成黑箱。
自检问题:你扔一个骰子,P(偶数) 是多少?P(大于 4 | 偶数) 是多少?如果你扔 100 次,期望值是多少?
你的现有基础:rl-math-fundamentals.md 把策略定义为"概率分布",并用了"每一步都在掷骰子选动作"的类比。这说明你对概率有直觉,但可能缺少形式化理解。
最小补课建议:Khan Academy 概率入门("Intro to Probability"),前 3 个单元,约 2 小时。重点理解"概率分布"和"条件概率"两个概念就够用了。
2.3 神经网络基本原理
你需要知道什么:神经网络是"一堆矩阵乘法 + 非线性激活函数叠在一起";训练就是"看正确答案,算差距(loss),然后调参数让差距变小";反向传播就是"从输出层往回算每个参数对 loss 的贡献"。不需要能手推梯度公式,但需要理解训练循环(前向 → 算 loss → 反向传播 → 更新参数)的整体流程。
为什么是地基:导读中的每一个模型——CLIP、LLaVA、RT-1、OpenVLA、Diffusion Policy、π0——都是神经网络。如果不理解"训练"是怎么回事,你就只能把每个模型当黑箱看,无法理解"为什么这个设计比那个好"。
自检问题:给你一个两层神经网络 y = W₂ · ReLU(W₁ · x + b₁) + b₂,输入 x 是图片像素,输出 y 是分类概率。训练时 loss 怎么算(分类问题用什么 loss)?参数 W₁、W₂、b₁、b₂ 怎么更新?
你的现有基础:目前没有神经网络基础的专门笔记。论文笔记中大量使用了"编码器""解码器""特征提取"等概念,说明你在阅读中已经建立了一些直觉,但可能缺少从零搭建的系统理解。
最小补课建议:3Blue1Brown 的《深度学习》系列前 4 集(What is a neural network → Gradient descent → Backpropagation → Backpropagation calculus),总共约 1 小时。这四集给你完整的直觉框架。如果想动手跑代码,PyTorch 官方的 60-minute blitz 教程可以紧跟着做。
2.4 PyTorch 基本操作
你需要知道什么:tensor 是什么(多维数组)、怎么创建 tensor、怎么做 tensor 运算(加减乘、reshape、索引)、怎么写一个训练循环(forward → loss → backward → step)、怎么用 GPU 加速。不需要精通 DataLoader、自定义 Module 继承等高级用法。
为什么是地基:你的 Task 2 是复现和微调模型——这意味着你必须能读懂和修改 PyTorch 代码。即使 Task 1 只是读论文做 PPT,论文里的伪代码和实验代码几乎都是 PyTorch 风格。看不懂 loss.backward() 和 optimizer.step() 意味着你跳过了论文的核心实验细节。
自检问题:你能在 PyTorch 里创建一个 3×3 的随机矩阵,乘以一个 3×1 的向量,得到结果吗?你能写出一个最简单的训练循环(线性回归拟合 y = 2x + 1)吗?
你的现有基础:learnings/ 中没有 PyTorch 笔记。但你有丰富的编程经验(TypeScript/Python 项目、MCP 协议开发等),说明代码能力本身不是瓶颈,只是需要学 PyTorch 的 API。
最小补课建议:PyTorch 官方 60-Minute Blitz,动手跑每个代码块。重点理解 torch.Tensor、autograd、nn.Module 三个核心概念。约 2 小时。
3. 脚手架层——最好有,缺了会影响理解深度
3.1 Transformer 架构
你需要知道什么:Self-attention 的直觉("每个词看看其他词跟自己有多相关")、Q/K/V 矩阵怎么来的、Multi-head attention 为什么要多头、位置编码为什么需要、Layer Normalization 在哪。不需要能手推完整的 attention 公式,但需要理解 attention 的输入输出形状。
和导读的关系:Transformer 是本导读涉及的几乎所有模型的骨架。CLIP 的文本编码器是 Transformer,LLaVA 的语言模型是 Transformer,RT-2 和 OpenVLA 都是在 Transformer 骨架上输出动作。Ch08-Ch12 每一章都会提到 Transformer,如果你不知道 attention 是什么,这些章节的核心设计决策你就无法理解。
你的现有基础:glossary 中有一行 Transformer 定义;vlm-image-video-tokenization.md 提到"塞给同一套 Transformer";long-video-perception-qwen3vl.md 提到时空注意力。这些说明你知道 Transformer 存在,但没有深入理解其内部机制。
补课建议:Jay Alammar 的 The Illustrated Transformer,约 30 分钟精读。这篇博客用可视化把 Transformer 的每个组件讲得非常直觉。读完后再看李沐的论文精读《Attention Is All You Need》视频(约 1 小时)作为加深。
3.2 CNN 基本概念
你需要知道什么:卷积操作的直觉("用一个小滤波器在图片上滑动,提取局部特征")、特征图是什么、池化做什么(缩小分辨率)、ResNet 的残差连接为什么有效("给梯度开一条高速公路")。不需要会设计 CNN 架构。
和导读的关系:CLIP 的视觉编码器可以是 ResNet 或 ViT;很多 paper notes 里提到"CNN 提取特征"作为 baseline。你不需要精通 CNN,但需要知道"卷积提取局部特征"这个基本思想,否则在 Ch08 里讲 CLIP 的两种视觉编码器时会困惑。
你的现有基础:完全缺失。不过好消息是,导读中 CNN 出现的频率远低于 Transformer——具身智能领域的主流已经从 CNN 转向 ViT/Transformer。
补课建议:Stanford CS231n 的卷积网络讲义(第 5 讲),约 20 分钟阅读。只需要理解"卷积""特征图""池化"三个概念即可。
3.3 对比学习(Contrastive Learning)
你需要知道什么:把相似的东西拉近、不相似的东西推远——这个直觉足够了。具体来说:给一对"正样本"(匹配的图文对),让它们的向量表示靠近;给一对"负样本"(不匹配的),让它们远离。
和导读的关系:CLIP 的核心训练方式就是对比学习。如果你不理解对比学习,Ch08 里 CLIP 的工作原理就会变成"反正就是能对齐图和文"而无法理解 why。
你的现有基础:clip.md 笔记(357 行精读)已经详细讲了对比学习在 CLIP 中的应用。这是一个优势——你已经在具体场景中见过了。
补课建议:如果你读完 clip.md 的对比学习部分觉得理解了,这一项可以跳过。如果还有些模糊,推荐 Lilian Weng 的博客 Contrastive Representation Learning,约 30 分钟。
3.4 扩散模型直觉
你需要知道什么:前向过程("往干净数据上一步步加噪声直到变成纯噪声")和逆向过程("从纯噪声开始一步步去噪还原成干净数据")。训练目标是"学会每一步怎么去噪"。不需要推导 ELBO 或噪声调度公式。
和导读的关系:Ch13 整章讲扩散策略(Diffusion Policy),Ch15 的世界模型用到扩散生成视频,π0 用 Flow Matching(扩散的变体)。如果你不理解"从噪声中恢复信号"这个核心思想,这三章都会非常吃力。
你的现有基础:diffusion-policy.md(388 行精读)已经从机器人策略的角度讲解了扩散模型的直觉。glossary 中有"Diffusion Policy"和"Flow Matching"条目。
补课建议:如果 diffusion-policy.md 的去噪直觉你已经理解,这一项可以跳过。如果想更扎实,推荐 Lilian Weng 的博客 What are Diffusion Models? 的前三节,约 30 分钟。
4. 锦上添花层——有则更好
4.1 强化学习核心概念
状态、动作、奖励、策略、值函数、Bellman 方程、PPO。你的 rl-math-fundamentals.md 已经覆盖了核心概念(Reward Shaping、Policy Gradients、PPO),基础比较扎实。在导读的 Ch10(规划)和 Ch15(世界模型)中会用到 RL 概念,但不是核心依赖——即使 RL 概念不太牢固,也能靠类比理解。
4.2 控制系统基础
PID 控制器、状态空间表示、可观性 / 可控性。你的 control-system-fundamentals.md 已经覆盖了基础。在导读中主要在 Ch19(仿真)和讨论机器人底层控制时会遇到,但大多数论文笔记是在"策略输出关节力矩"这个抽象层级上讨论的,不太深入底层控制回路。
4.3 ROS(机器人操作系统)
如果你要做 Task 2(代码复现),可能会遇到 ROS 相关的环境配置。但这不是阅读导读的前置要求,等实际用到时再查即可。
4.4 3D 数学(齐次坐标、旋转矩阵、四元数)
在机器人学中非常重要,但本导读涉及 3D 数学的章节(Ch16 的 3DShape2VecSet)会给出必要的直觉解释,不需要预先掌握。
5. 自检评分表
用下面的表格给自己打分。每项 0-2 分:0 = 完全不知道、1 = 听说过但不确定细节、2 = 能向别人解释清楚。
| 编号 | 知识点 | 所属层 | 自评分 | 现有笔记参考 |
|---|---|---|---|---|
| G1 | 向量和矩阵乘法 | 地基 | __ | 无 |
| G2 | 概率分布和条件概率 | 地基 | __ | rl-math-fundamentals.md(部分) |
| G3 | 神经网络训练循环 | 地基 | __ | 无 |
| G4 | PyTorch tensor 操作 | 地基 | __ | 无 |
| S1 | Transformer / Self-attention | 脚手架 | __ | glossary(一行定义) |
| S2 | CNN 卷积和特征图 | 脚手架 | __ | 无 |
| S3 | 对比学习 | 脚手架 | __ | clip.md(精读) |
| S4 | 扩散模型前向/逆向 | 脚手架 | __ | diffusion-policy.md(精读) |
| B1 | RL 策略和值函数 | 锦上添花 | __ | rl-math-fundamentals.md(扎实) |
| B2 | PID 和状态空间 | 锦上添花 | __ | control-system-fundamentals.md |
| B3 | ROS 基础 | 锦上添花 | __ | 无 |
| B4 | 3D 旋转 / 四元数 | 锦上添花 | __ | 无 |
打分解读:
- 地基层全部 ≥ 1:可以开始阅读导读,遇到不懂的地方回来补
- 地基层全部 = 2:你的基础很好,可以专注在内容本身
- 脚手架层全部 = 0:建议在进入 Part 3 之前补 S1(Transformer),其他可以边读边补
- 锦上添花层全部 = 0:完全不影响导读阅读
6. 推荐补课资源汇总
按优先级排序。每项给出"最小投入"和"如果想更扎实"两个级别。
P0 级——地基层缺了必须补:
| 知识点 | 最小投入(1-2 小时) | 更扎实(4-8 小时) |
|---|---|---|
| 线性代数 | 3B1B《线性代数的本质》前 4 集 | 同系列看完全部 16 集 |
| 概率基础 | Khan Academy "Intro to Probability" 前 3 单元 | 同课程全部完成 |
| 神经网络 | 3B1B《深度学习》前 4 集 | Andrej Karpathy 的 micrograd 视频(2 小时从零实现反向传播) |
| PyTorch | 官方 60-Minute Blitz | 官方 Learning PyTorch with Examples 教程 |
P1 级——脚手架层建议补:
| 知识点 | 推荐资源 | 时间 |
|---|---|---|
| Transformer | Jay Alammar: The Illustrated Transformer + 李沐精读 | 1.5 小时 |
| CNN 基础 | CS231n 第 5 讲讲义 | 20 分钟 |
| 对比学习 | 你的 clip.md 笔记已够用;如需加深看 Lilian Weng 博客 | 30 分钟 |
| 扩散模型 | 你的 diffusion-policy.md 已够用;如需加深看 Lilian Weng 博客 | 30 分钟 |
P2 级——锦上添花层用到时再查:
你的 rl-math-fundamentals.md 和 control-system-fundamentals.md 已经是很好的参考。ROS 和 3D 数学等到做 Task 2 时再补不迟。
7. 补课策略建议
如果你只有 1 天时间补基础:优先看 3B1B《深度学习》前 4 集 + 跑 PyTorch 60-Minute Blitz。这两项做完,你至少能理解"模型是怎么训练的"和"代码长什么样"。
如果你有 3 天时间补基础:第 1 天做上述。第 2 天看 3B1B《线性代数》前 4 集 + Jay Alammar 的 Illustrated Transformer。第 3 天看 Khan Academy 概率前 3 单元 + CS231n CNN 讲义。三天下来地基层和脚手架层就基本补完了。
如果你不确定自己的水平:直接开始读 Ch04(全景图),遇到看不懂的概念回来查这一章对应的补课资源。很多时候"在具体场景中学"比"先抽象学完再开始"效率更高。
特别提醒:补课不是目的,读懂导读和论文才是目的。不要陷入"我要把所有基础都补完了再开始"的陷阱——那样永远开始不了。最好的策略是"够用就走,缺了再补"。
8. 本章小结
回顾本章的核心要点:
- 前置知识分三层:地基(线性代数、概率、神经网络、PyTorch)、脚手架(Transformer、CNN、对比学习、扩散模型)、锦上添花(RL、控制、ROS、3D 数学)
- 你的现有笔记已覆盖:RL 基础(扎实)、对比学习(通过 CLIP 精读)、扩散模型直觉(通过 Diffusion Policy 精读)、控制系统基础
- 需要补的重点:Transformer 深入理解、PyTorch 实操、线性代数直觉、概率分布概念
- 补课策略:够用就走、缺了再补,不要追求"全部学完再开始"
- 自检评分表帮你量化自己的知识状态
下一章我们进入正式内容——用"机器人的 11 个器官"类比,画出具身智能 11 个主题的全景地图。
导读目录:README.md 上一章:Ch02: 阅读路线图——三条路径任你选 下一章:Ch04: 11 个主题全景图——一个机器人的 11 个器官
本章涉及论文 7 篇
点击查看论文笔记全文,标有 ● 的为已读。