22 章系统教程,从零基础到实战。
面向零基础读者,用日常类比和代码示例系统讲解具身智能——从 CLIP 到 π0,每章含自测题。基于 202 篇论文笔记和 13 篇精读论文。
Part 1: 导读总纲
这本导读是什么?怎么读?需要什么前置知识?
Part 2: 全景概念
具身 AI 到底在解决什么问题?11 个主题怎么串起来?
11 个主题全景图——一个机器人的 11 个器官
Task ×5两条技术路线——模块化流水线 vs 端到端一体化
Task ×2具身 AI 的时间线——2021-2025 关键里程碑
Task ×13从论文到机器人——理解学术论文的结构与读法
Task ×8Part 3: 核心主线精读
VLM → VLA → 扩散策略 → 模仿学习,一步步造出机器人的大脑和手
VLM 地基 (I)——CLIP,教 AI 同时认图和认字
Task ×1VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力
Task ×2高层规划——SayCan / Code-as-Policies / Inner Monologue
Task ×1端到端 VLA (I)——RT-1 / RT-2,把动作变成 token
Task ×2端到端 VLA (II)——OpenVLA / VLAS / MLA,开源与扩展
Task ×4扩散策略——Diffusion Policy / 3D-DP / π0,像擦噪声一样擦出动作
模仿学习——DAgger / ACT-ALOHA / UMI,你做给它看
Part 4: 训练与部署基建
世界模型、强化学习、仿真与 Sim-to-Real——从训练到落地
世界模型——World Models / Dreamer / Genie / Cosmos Policy
Task ×1强化学习基础——PPO / SAC / Reward Shaping
Sim-to-Real——仿真训练与真机部署
Task ×1Part 5: 感知模态扩展
多模态生态、射频感知、听觉智能——给机器人装上更多感官
多模态生态——ImageBind / AnyMAL / 3DShape2VecSet
Task ×2射频感知——RF-Pose / milliMap / PanoRadar / RF-SLAM / mmCLIP
Task ×3听觉智能——Whisper / AudioLM / Proactive Hearing / NeuralAids / Acoustic Swarms
Task ×3Part 6: 横切主题与实战
数据集全景、Task 1/2 实战指南
数据集全景——Open X-Embodiment / DROID / BridgeData V2 / LIBERO
Task 1 & Task 2 实战指南——从理论到交付
Task ×13推荐阅读路径
Task 1 路径(2 周)
Ch01→Ch03→Ch04→Ch08→Ch09→Ch10→Ch12→Ch22
全景学习路径(4 周)
顺序通读 Part 1-6
按主题跳读路径
Ch01→Ch04→跳到感兴趣的主题章节