High-Level Planning
把'去厨房热一杯牛奶'拆成一长串可执行步骤——LLM 当大脑,机器人当手脚。这一族研究关心:怎么让大模型只输出可执行命令,并对失败做出反应。
先读这三篇。
SayCan 教 LLM 看清自己能做什么 → Code-as-Policies 让它直接写代码 → Inner Monologue 让它反思失败。
-
1
SayCan: Do As I Can, Not As I Say
让"见多识广但出不了门的 AI"出主意,让机器人自己摸口袋说"这事我现在能做",两边都点头才动手——AI 出嘴,机器人出手,两个分数相乘选下一步。
-
2
Code as Policies: Language Model Programs for Embodied Control
让 LLM 直接写 Python 代码作为机器人的策略(policy),而不是从预训练技能库中选动作。代码可以包含循环、条件判断、NumPy 运算、递归函数定义,因此能在不做任何额外训练的情况下,通过 few-shot prompting 让机器人执行任意复杂度的新指令——只要感
-
3
Inner Monologue: Embodied Reasoning through Planning with Language Models
让机器人边干活边在心里念叨:看到啥、做成没、人改主意没,全翻成文字塞回 AI,它就能边做边改计划。
2022 到 2026,14 篇怎么排开。
祖师爷
经典
前沿
High-Level Planning 全部 14 篇。
| era | year | title | venue |
|---|---|---|---|
| 祖师爷 | 2022 | SayCan: Do As I Can, Not As I Say | CoRL |
| 祖师爷 | 2022 | Inner Monologue: Embodied Reasoning through Planning with Language Models | CoRL |
| 祖师爷 | 2023 | Code as Policies: Language Model Programs for Embodied Control | ICRA |
| 祖师爷 | 2023 | LLM+P: Empowering LLMs with Optimal Planning | arXiv |
| 祖师爷 | 2023 | PaLM-E: An Embodied Multimodal Language Model | ICML |
| 祖师爷 | 2023 | ProgPrompt | ICRA |
| 经典 | 2023 | ChatGPT for Robotics | IEEE Access |
| 经典 | 2023 | VoxPoser | CoRL |
| 经典 | 2024 | GenSim | ICLR |
| 经典 | 2024 | RoboFlamingo | ICLR |
| 经典 | 2024 | Tree-Planner | ICLR |
| 前沿 | 2024 | SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems | arXiv |
| 前沿 | 2025 | LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks | arXiv |
| 前沿 | 2026 | What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else? | arXiv |