Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Reading lists · 主题精选

5 套策划好的读书包

不知道 202 篇该从哪开始?挑一个你最感兴趣的方向,按 era 顺序读完一个包。每包 50-90 分钟,读完能在那个细分领域跟人聊起。


vla-starter

VLA 入门 6 篇

从动作 token 到产业基础模型

6 篇 · ~90 分钟

想理解'机器人怎么直接看图听话出动作'?这 6 篇按 era 升序排,读完你能自己讲清 VLA 路线。

  1. 1
    Learning Transferable Visual Models From Natural Language Supervision 2021 · ICML · ⭐⭐⭐ · VLM Foundation

    教 AI 同时认图和认字,把 4 亿对网上图文塞进同一张坐标。之后你说"一只猫",它就能从新图里挑出猫——不用为新任务再训一遍。

  2. 2
    RT-1: Robotics Transformer for Real-World Control at Scale 2022 · RSS · ⭐⭐⭐ · End-to-End VLA

    Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式…

  3. 3
    RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control 2023 · CoRL · ⭐⭐⭐⭐ · End-to-End VLA

    把机器人动作翻译成一句话,让会看图聊天的 AI 用写句子的方式开口指挥机器人——它会写字,就能动手。

  4. 4
    OpenVLA: An Open-Source Vision-Language-Action Model 2024 · CoRL · ⭐⭐⭐ · End-to-End VLA

    把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。

  5. 5
    OpenVLA-OFT 2025 · RSS · ⭐⭐⭐ · End-to-End VLA

    原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配…

  6. 6
    π₀: A Vision-Language-Action Flow Model for General Robot Control 2024 · arXiv · ⭐⭐⭐⭐ · Diffusion Policy

    Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 …

diffusion-policy

扩散策略 5 篇

从'选动作'变成'去噪'

5 篇 · ~70 分钟

Diffusion Policy 把控制问题重新定义。读完知道为什么扩散赢过 transformer 在 manipulation 上。

  1. 1
    Diffusion Policy: Visuomotor Policy Learning via Action Diffusion 2023 · RSS · ⭐⭐⭐ · Diffusion Policy

    让机器人像调电视雪花一样产生动作:从满屏乱码开始,擦几下,下一步该怎么动就擦出来了。

  2. 2
    3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations 2024 · RSS · ⭐⭐⭐ · Diffusion Policy

    让机器人改看 3D 立体形状(点云)而不是 2D 照片来学动作,10 条示范就够,72 个任务平均比原版强 24.2%,真机成功率从 35% 涨到 85%,安全违规率 0%。

  3. 3
    Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation 2024 · RSS · ⭐⭐⭐ · Diffusion Policy

    机器人选下一步动作本来要慢慢搅 100 下才出一步,这篇教它一下就跳到答案——快约十倍,连笔记本都跑得动。

  4. 4
    DiT-Policy 2025 · ICRA · ⭐⭐⭐⭐ · Diffusion Policy

    扩散策略强在"多模态",Transformer 强在"可扩展",但把两者硬凑到一起训练极不稳定(原版 Diffusion Policy 的 Transformer 实现几乎训不动)。这篇论文找到了正确配方——用 adaLN-Zero 注意力…

  5. 5
    π₀: A Vision-Language-Action Flow Model for General Robot Control 2024 · arXiv · ⭐⭐⭐⭐ · Diffusion Policy

    Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 …

world-models

世界模型 4 篇

在脑子里预演

4 篇 · ~55 分钟

教 AI 在想象里走一遍。这 4 篇覆盖从 World Models 鼻祖到 Genie/Cosmos 工业级。

  1. 1
    World Models 2018 · NeurIPS · ⭐⭐⭐ · World Model & Video Policy

    让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。

  2. 2
    Dreamer V3: Mastering Diverse Domains through World Models 2025 · Nature · ⭐⭐⭐⭐ · World Model & Video Policy

    DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。

  3. 3
    Genie: Generative Interactive Environments 2024 · ICML · ⭐⭐⭐⭐ · World Model & Video Policy

    Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。

  4. 4
    Cosmos World Foundation Model 2025 · arXiv · ⭐⭐⭐⭐ · World Model & Video Policy

    Cosmos 是英伟达做的一个"世界基础模型(World Foundation Model, WFM)平台":核心是一个会"看过去的视频 + 一个动作/指令 → 生成未来会发生什么视频"的大模型。它像给机器人和自动驾驶造了一个"数字世界的沙…

rf-perception

射频感知 5 篇

WiFi 和毫米波看世界

5 篇 · ~60 分钟

电磁波怎么穿墙、抗烟雾、画出 LiDAR 级 3D。这 5 篇讲清射频感知的核心套路。

  1. 1
    Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm 2019 · arXiv · ⭐⭐⭐⭐ · RF Perception & Mapping

    ![系统总览:RF 雷达穿过障碍物捕获人体反射,深度学习模型解码出骨架](../papers/rf-pose-through-wall/images/img_000.jpg)

  2. 2
    Can WiFi Estimate Person Pose? 2019 · ICCV · ⭐⭐⭐ · RF Perception & Mapping

    想象你家路由器除了上网,还能告诉你"屋里那个人正在做啥姿势"——胳膊抬到哪、腿怎么弯,全画给你看。这篇论文用一对普通商用 WiFi 网卡(3 天线发射 + 3 天线接收),配一个摄像头当"老师",让神经网络学会从 WiFi 信道状态信息(C…

  3. 3
    See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar 2020 · MobiSys · ⭐⭐⭐ · RF Perception & Mapping

    机器人在浓烟里也能画出清晰的房间地图——靠一颗几十块的小雷达加一个会"脑补"的神经网络。 具体两招: 训练时让贵的激光雷达(lidar)和便宜的雷达坐同一辆车,把 lidar 的清晰图当作业答案喂给神经网络(cGAN),教雷达学会脑补。学完…

  4. 4
    Enabling Visual Recognition at Radio Frequency (PanoRadar) 2024 · MobiCom · ⭐⭐⭐⭐ · RF Perception & Mapping

    *PanoRadar 把 TI AWR1843 单芯片 mmWave 雷达装到 8 cm 半径、2 Hz 转台上,合成 8×1200 圆柱虚拟阵列;再用 RF 自运动估计 + 2D CNN 提仰角分辨率,从纯射频信号生成 360° rang…

  5. 5
    Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on 2024 · SenSys · ⭐⭐⭐⭐ · RF Perception & Mapping

    想实时知道一个人全身姿态(比如健身教练看你深蹲标不标准),传统办法要么靠摄像头(怕黑、有隐私、会被遮挡),要么靠昂贵的动捕棚。Argus 换个思路:在耳机/VR 头显左右两侧各磁吸一个指甲盖大小、7.5 克、0.35 瓦的毫米波雷达,从"第…

imitation-hardware

模仿学习硬件 4 篇

怎么采到好数据

4 篇 · ~50 分钟

VLA 的瓶颈是数据。这 4 篇讲明白:ALOHA、UMI、DexCap、HumanPlus 各解决了什么采集问题。

  1. 1
    Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA) 2023 · RSS · ⭐⭐⭐ · Imitation Learning

    用约 2 万美元搭一套"主从臂遥操 + 四摄像头"的双臂系统(ALOHA),让人示范 50 次约 10 分钟,再用 ACT 算法让机器人一次预测未来 100 步动作而不是一步一步猜——开调料杯、插电池这类毫米级精细活,成功率能到 80–96…

  2. 2
    Universal Manipulation Interface 2024 · RSS · ⭐⭐⭐ · Imitation Learning

    做一个和机器人末端一模一样的手持夹爪 + GoPro(约 371 美元),人去厨房、咖啡馆随便示范;视频经视觉-惯性 SLAM 还原 6D 轨迹,再训 Diffusion Policy——机器人不在场也能采数据,洗碗、抛球、叠毛衣、摆咖啡杯…

  3. 3
    DexCap 2024 · RSS · ⭐⭐⭐⭐ · Imitation Learning

    DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数…

  4. 4
    HumanPlus 2024 · CoRL · ⭐⭐⭐⭐ · Imitation Learning

    给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看…