Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Learn · Beginner Track

30-day core path + optional extension — 零基础上手具身 AI

如果你刚来,157 篇太多。这页先给你 30 天核心路径(25 篇论文 + 5 个复习/输出日),任务驱动读者再选做 5 天扩展。


三条入口怎么选? 本页是30 天核心 + 5 天可选任务扩展(适合每天固定投入);22 章导读系统教材(适合想搞懂原理再读论文);主题入门三连按兴趣跳读(适合已有方向)。三者内容互通,选一条主线即可,不必都走。Day 31–35 不计入 30 天核心进度。

想边走边勾选? 打开 可勾选的 30 天核心 Syllabus,Day 1–30 的完成度会保存在当前浏览器;可选扩展仍按本页继续。

这页为谁设计

你是大一/大二/转方向的本科生,知道 Python 但没接触过具身 AI;你愿意每天花 30-60 分钟系统读一段时间。

如果你符合这两条,按这页走就行。每天的阅读、复习和输出任务已经按前置关系排好了。

如果你已经懂 transformer,可以跳过 Week 1,从 Week 2 开始。

Week 1 · 把视觉和语言连起来

具身 AI 的所有模型都建在"视觉 + 语言"的基座上。先把这部分搞清楚。

Day 论文 学到
1 CLIP 怎么把图和文塞进同一个坐标系
2 BLIP 自举:弱标注 + 自我清洗
3 BLIP-2 Q-Former 桥接冻结的视觉 + 冻结的 LLM
4 LLaVA 一层 MLP 把视觉特征注入 LLM
5 Flamingo 交错图文 + Perceiver Resampler
6 SigLIP sigmoid 损失替换 softmax
7 复习 + 看 Glossary 整理自己的术语笔记

Week 1 收获:你能解释"为什么所有 VLA 都先有一个 VLM"。

Week 2 · 看懂 VLA 的进化

VLA = 视觉-语言-动作。这周读完你能讲清"机器人怎么从看图直接出关节速度"。

Day 论文 学到
8 RT-1 把动作 token 化,让 transformer 当策略
9 SayCan LLM 给候选 + 可行性打分相乘
10 Code-as-Policies 让 LLM 直接写 Python 调机器人 API
11 RT-2 把网络知识从 VLM 转到 robot policy
12 OpenVLA 完全开源的 VLA 民主化
13 π0 VLM + flow matching head 通用基础模型
14 复习 + 看 VLA topic page 整理 VLA 路线

Week 2 收获:你能比较 RT-1/RT-2/OpenVLA/π0 四条不同技术路径。

Week 3 · 数据、模仿、扩散

VLA 的瓶颈不是模型而是数据。这周读模仿学习 + 扩散策略。

Day 论文 学到
15 DAgger 模仿学习的误差累积 + 解决方案
16 ACT/ALOHA 双臂遥操作 + action chunking
17 UMI 手持夹爪 + GoPro 采野外数据
18 Open X-Embodiment 22 家机构数据合一
19 Diffusion Policy 把'选动作'变'去噪'
20 3D Diffusion Policy 加 3D 点云做眼睛
21 复习 + 看 Imitation topic 整理数据采集思路

Week 3 收获:你能跟人说清"为什么 Diffusion Policy 在 manipulation 上赢了 transformer"。

Week 4 · 周边生态

VLA 不是孤岛。这周读世界模型、仿真器、感知扩展。

Day 论文 学到
22 World Models 在脑子里预演
23 Dreamer V3 跨域固定超参的世界模型
24 Genie 从无标签视频学潜在动作
25 Habitat 室内仿真器照片级
26 Isaac Gym GPU 并行物理仿真
27 ImageBind 六模态通过图像作锚点联通
28 Whisper 弱标注 + 大规模 = 零样本 ASR
29-30 复习 + 看 Compare + 写一篇自己的 review 输出验证收获

Week 4 收获:你已经具备"读 2026 年新论文 abstract 不发蒙"的能力。

30 天核心完成后你能做什么

  • 读 NeurIPS/CoRL 任意一篇具身 AI 论文,看懂大体在干啥
  • 知道自己接下来该深挖哪个分支(按兴趣选 topic)
  • 能跟实验室同学讨论 RT-2 vs π0 这种话题
  • 能自己挑论文读,不再依赖别人推荐

核心路径到这里已经完成。下面 5 天只服务于“补齐导师指定 13 篇论文”这个额外目标,不计入 30 天进度。

可选任务扩展 · Day 31–35

这是任务驱动读者的补全段——每天 2 篇,完成后 13 篇任务论文就全部走完(对照 research-task.md)。如果你只想系统入门,可以先停在 Day 30。

Day 论文 为什么读
31 3DShape2VecSet 把 3D 物体压成"特征卡片集"喂给扩散模型——3D 生成表示法的代表作
31 Cosmos Policy 把会"脑补下一秒视频"的大模型微调成机械臂策略——世界模型直通控制
32 VLAS 给 VLA 装上耳朵:Whisper 当听觉编码器 + 声纹 RAG 解决"我的杯子是哪只"式个性化指令
32 MLA 视觉之外再加"手感"和"空间感"——多感官直通语言-动作模型
33 CartoRadar (RF-SLAM) 几百块的毫米波雷达做厘米级 3D SLAM,靠"知道自己不确定"打败相机方案
33 mmCLIP 把雷达信号对齐进 CLIP 文本语义空间,零样本认出没采过数据的新动作
34 mmNorm (NLOS mmWave) 先猜"表面法向"再重建——隔着纸箱用毫米波还原物体的 3D 形状
34 Proactive Hearing 耳机自动听出"你在跟谁聊天"——靠对话节奏而非声纹放大同伴的声音
35 NeuralAids 把跑在显卡上的降噪模型瘦身 100 倍塞进助听器,实时又省电
35 Acoustic Swarms 七个自走小麦克风机器人自己散开、互相定位,把同桌说话人一一分离

扩展收获:13 篇任务论文全部走完,RF 感知与听觉智能两个“具身感官”方向也补上了。

验证:每周末做一次

挑当周读过的 1 篇,关掉笔记尝试给同学/室友讲清楚(< 5 分钟)。讲不通的部分回去重读那部分。

卡住怎么办

  • 数学公式看不懂 → 去 Math Primer 查符号
  • 术语不认识 → 去 Glossary
  • 想看可视化关系 → 去 Graph
  • 不确定哪篇先读 → 这页就是答案

不要做什么

  • 不要囤积笔记 app:你的笔记就是这站,你的标记就是 ✓ 已读
  • 不要追新:30 天内别看微信推送的 2026-08 论文。先读完路径
  • 不要跳读:第 1 周看着简单,但是后面所有内容的根基

◼ End of 30-day core path. 可选扩展按你的任务需要决定,不必为了“打满”而硬读。


想看更详细的路径规划?Guide Ch02: 阅读路线图 ——提供 Task 1 / 全景 / 主题跳读三条路径,含时间管理建议和检查点自测。


Other beginner pages