Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Era

祖师爷 · Founder

每个领域的第一篇——把这个研究方向第一次讲清楚的论文。RT-1 之于 VLA、CLIP 之于 VLM、Diffusion Policy 之于扩散策略。读懂这些,你就掌握了每个分支的'第一性'。

27总篇数
11覆盖主题
2011–2023年份跨度
308,036

经典 · Classic →前沿 · Frontier →

I VLM Foundation 3 篇

II High-Level Planning 6 篇

  • 2022
    SayCan: Do As I Can, Not As I Say CoRL · ⭐⭐

    让"见多识广但出不了门的 AI"出主意,让机器人自己摸口袋说"这事我现在能做",两边都点头才动手——AI 出嘴,机器人出手,两个分数相乘选下一步。

  • 2022
    Inner Monologue: Embodied Reasoning through Planning with Language Models CoRL · ⭐⭐⭐

    让机器人边干活边在心里念叨:看到啥、做成没、人改主意没,全翻成文字塞回 AI,它就能边做边改计划。

  • 2023
    Code as Policies: Language Model Programs for Embodied Control ICRA · ⭐⭐⭐

    让 LLM 直接写 Python 代码作为机器人的策略(policy),而不是从预训练技能库中选动作。代码可以包含循环、条件判断、NumPy 运算、递归函数定义,因此能在不做任何额外训练的情况下,通过 few-shot prompting 让机器人执行任意复杂度的新指令——只要感

  • 2023
    LLM+P: Empowering LLMs with Optimal Planning arXiv · ⭐⭐⭐

    让 LLM 只当翻译——把你说的话翻译成机器格式,真正的规划交给老牌算法去算。LLM 管说话,算法管动脑子。

  • 2023
    PaLM-E: An Embodied Multimodal Language Model ICML · ⭐⭐⭐⭐

    教 ChatGPT 长出眼睛和手脚:你说一句话 + 让它瞄一眼现场,它直接列出机器人该做的几步。

  • 2023
    ProgPrompt ICRA · ⭐⭐

    让大语言模型(LLM)不要用大白话写机器人的行动计划,而是写成一段 Python 程序——把机器人能做的动作写成函数、把现场有的物体写成一个列表、再给几个示范程序,LLM 就能照葫芦画瓢生成一段可执行、还自带检查的计划代码。这招在 VirtualHome 家务任务上做到当时最强,

III End-to-End VLA 1 篇

  • 2022
    RT-1: Robotics Transformer for Real-World Control at Scale RSS · ⭐⭐⭐

    Google 用 13 台机器人花 17 个月录下 13 万段人类示范,训出一个 35M 参数的小 Transformer,让机器人听一句指令就能在真办公室厨房里完成 700 多种操作,并首次证明"大数据 + Transformer"的范式在物理世界同样有效。

IV Diffusion Policy 1 篇

V Imitation Learning 2 篇

VI World Model & Video Policy 2 篇

  • 2018
    World Models NeurIPS · ⭐⭐⭐

    让 AI 先在自己脑子里反复"做白日梦"练打游戏,练熟了再去真游戏里上场——居然真能赢。

  • 2020
    Dream to Control: Learning Behaviors by Latent Imagination ICLR · ⭐⭐⭐⭐

    教 AI 在脑子里反复"做白日梦"演练动作,不用真去摔跤,就能学会跑步、翻跟头这种复杂动作。具体而言:先从少量真实经验中学一个压缩版的"脑内世界模型",然后在这个模型里想象几千条未来轨迹,用精确的数学导数告诉策略网络"刚才哪步该往哪个方向调",最终以 1/20 的真实交互量超越了

VII Multimodal Ecology 2 篇

VIII RF Perception & Mapping 2 篇

  • 2019
    Can WiFi Estimate Person Pose? ICCV · ⭐⭐⭐

    想象你家路由器除了上网,还能告诉你"屋里那个人正在做啥姿势"——胳膊抬到哪、腿怎么弯,全画给你看。这篇论文用一对普通商用 WiFi 网卡(3 天线发射 + 3 天线接收),配一个摄像头当"老师",让神经网络学会从 WiFi 信道状态信息(CSI)直接画出 18 个人体关节点。核心

  • 2020
    See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar MobiSys · ⭐⭐⭐

    机器人在浓烟里也能画出清晰的房间地图——靠一颗几十块的小雷达加一个会"脑补"的神经网络。 具体两招: 训练时让贵的激光雷达(lidar)和便宜的雷达坐同一辆车,把 lidar 的清晰图当作业答案喂给神经网络(cGAN),教雷达学会脑补。学完老师下车,雷达单飞。 认门/墙/玻璃/电

IX Auditory & Acoustic 3 篇

X Datasets & Benchmarks 3 篇

XI Simulation & Sim2Real 2 篇

  • 2019
    Habitat: A Platform for Embodied AI Research ICCV · ⭐⭐

    给家用机器人造一个跑得飞快的"VR 房子",让它在里面绕路撞墙练几千万步,再上岗去你家。

  • 2021
    Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning NeurIPS Datasets · ⭐⭐⭐

    一句话:把"算物理"和"训神经网络"塞进同一张显卡,机器人学走路从"几千台 CPU 跑一晚"压成"一张卡跑几分钟"。 类比:以前训机器人像切菜、炒菜、装盘分三个房间,端来端去比真做菜还累;Isaac Gym 把厨房合并,菜不动、工具换着上。 效果对照:OpenAI 训魔方机械手用