5 套策划好的读书包。
不知道 202 篇该从哪开始?挑一个你最感兴趣的方向,按 era 顺序读完一个包。每包 50-90 分钟,读完能在那个细分领域跟人聊起。
VLA 入门 6 篇
从动作 token 到产业基础模型
想理解'机器人怎么直接看图听话出动作'?这 6 篇按 era 升序排,读完你能自己讲清 VLA 路线。
-
1
Learning Transferable Visual Models From Natural Language Supervision
教 AI 同时认图和认字,把 4 亿对网上图文塞进同一张坐标。之后你说"一只猫",它就能从新图里挑出猫——不用为新任务再训一遍。
-
2
RT-1: Robotics Transformer for Real-World Control at Scale
Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式…
-
3
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
把机器人动作翻译成一句话,让会看图聊天的 AI 用写句子的方式开口指挥机器人——它会写字,就能动手。
-
4
OpenVLA: An Open-Source Vision-Language-Action Model
把一个会"看图说话"的 AI 改一改,让它学会"看一眼桌面就动手摆东西"——把机械臂动作伪装成"单词",用 7B 参数全面打败闭源 55B 的 RT-2-X,并把全部训练配方开源送出去。
-
5
OpenVLA-OFT
原版机器人大模型 OpenVLA 输出动作时像"一个字一个字念口令"——慢、抖、长任务掉链子。OpenVLA-OFT 把微调这件事拆成三个可以各自打开的开关——并行解码(一口气说完)、动作分块(一段段说)、连续动作表征(说准确的小数),再配…
-
6
π₀: A Vision-Language-Action Flow Model for General Robot Control
Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 …
扩散策略 5 篇
从'选动作'变成'去噪'
Diffusion Policy 把控制问题重新定义。读完知道为什么扩散赢过 transformer 在 manipulation 上。
-
1
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
让机器人像调电视雪花一样产生动作:从满屏乱码开始,擦几下,下一步该怎么动就擦出来了。
-
2
3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
让机器人改看 3D 立体形状(点云)而不是 2D 照片来学动作,10 条示范就够,72 个任务平均比原版强 24.2%,真机成功率从 35% 涨到 85%,安全违规率 0%。
-
3
Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
机器人选下一步动作本来要慢慢搅 100 下才出一步,这篇教它一下就跳到答案——快约十倍,连笔记本都跑得动。
-
4
DiT-Policy
扩散策略强在"多模态",Transformer 强在"可扩展",但把两者硬凑到一起训练极不稳定(原版 Diffusion Policy 的 Transformer 实现几乎训不动)。这篇论文找到了正确配方——用 adaLN-Zero 注意力…
-
5
π₀: A Vision-Language-Action Flow Model for General Robot Control
Physical Intelligence 的 π₀:在 PaliGemma 3B 视觉-语言模型上挂 300M 参数的 action expert,用 流匹配(flow matching) 一次生成 50 步连续动作 chunk,在 7 …
世界模型 4 篇
在脑子里预演
教 AI 在想象里走一遍。这 4 篇覆盖从 World Models 鼻祖到 Genie/Cosmos 工业级。
-
1
World Models
让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。
-
2
Dreamer V3: Mastering Diverse Domains through World Models
DreamerV3 用同一套固定超参数,在 150 多种完全不同的任务上同时训练一个「脑内世界模型 + 演员 + 教练」三件套,不靠人类示范数据,第一次让 AI 从零开始在《我的世界》里挖到钻石。
-
3
Genie: Generative Interactive Environments
Genie 从海量无标注游戏录屏里,自己"猜"出每两帧之间按了什么键,再用这个猜出来的虚拟按键续画下一帧——把死视频变成单张图片就能开玩的互动世界。
-
4
Cosmos World Foundation Model
Cosmos 是英伟达做的一个"世界基础模型(World Foundation Model, WFM)平台":核心是一个会"看过去的视频 + 一个动作/指令 → 生成未来会发生什么视频"的大模型。它像给机器人和自动驾驶造了一个"数字世界的沙…
射频感知 5 篇
WiFi 和毫米波看世界
电磁波怎么穿墙、抗烟雾、画出 LiDAR 级 3D。这 5 篇讲清射频感知的核心套路。
-
1
Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm

-
2
Can WiFi Estimate Person Pose?
想象你家路由器除了上网,还能告诉你"屋里那个人正在做啥姿势"——胳膊抬到哪、腿怎么弯,全画给你看。这篇论文用一对普通商用 WiFi 网卡(3 天线发射 + 3 天线接收),配一个摄像头当"老师",让神经网络学会从 WiFi 信道状态信息(C…
-
3
See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
机器人在浓烟里也能画出清晰的房间地图——靠一颗几十块的小雷达加一个会"脑补"的神经网络。 具体两招: 训练时让贵的激光雷达(lidar)和便宜的雷达坐同一辆车,把 lidar 的清晰图当作业答案喂给神经网络(cGAN),教雷达学会脑补。学完…
-
4
Enabling Visual Recognition at Radio Frequency (PanoRadar)
*PanoRadar 把 TI AWR1843 单芯片 mmWave 雷达装到 8 cm 半径、2 Hz 转台上,合成 8×1200 圆柱虚拟阵列;再用 RF 自运动估计 + 2D CNN 提仰角分辨率,从纯射频信号生成 360° rang…
-
5
Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
想实时知道一个人全身姿态(比如健身教练看你深蹲标不标准),传统办法要么靠摄像头(怕黑、有隐私、会被遮挡),要么靠昂贵的动捕棚。Argus 换个思路:在耳机/VR 头显左右两侧各磁吸一个指甲盖大小、7.5 克、0.35 瓦的毫米波雷达,从"第…
模仿学习硬件 4 篇
怎么采到好数据
VLA 的瓶颈是数据。这 4 篇讲明白:ALOHA、UMI、DexCap、HumanPlus 各解决了什么采集问题。
-
1
Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
用约 2 万美元搭一套"主从臂遥操 + 四摄像头"的双臂系统(ALOHA),让人示范 50 次约 10 分钟,再用 ACT 算法让机器人一次预测未来 100 步动作而不是一步一步猜——开调料杯、插电池这类毫米级精细活,成功率能到 80–96…
-
2
Universal Manipulation Interface
做一个和机器人末端一模一样的手持夹爪 + GoPro(约 371 美元),人去厨房、咖啡馆随便示范;视频经视觉-惯性 SLAM 还原 6D 轨迹,再训 Diffusion Policy——机器人不在场也能采数据,洗碗、抛球、叠毛衣、摆咖啡杯…
-
3
DexCap
DexCap 是斯坦福做的一套便携动捕系统:一件背心 + 手套 + 几个小相机,人穿上它在任何地方(厨房、客厅)徒手干活,就能实时(60Hz)录下"手腕 6 自由度位姿 + 手指动作 + 3D 环境点云"。配套算法 DexIL 把这些人手数…
-
4
HumanPlus
给一台成人尺寸的人形机器人搭一整套"从人身上学"的流水线:先用一个普通摄像头把人的全身动作实时抄到机器人身上(叫"影子模仿 / shadowing",人怎么动它怎么动),用这种方式一个人就能遥控它采数据;再拿采到的数据训一个策略,让机器人看…