ChatGPT for Robotics
这是一份写给"没接触过大模型 + 机器人结合"的读者的精读笔记。语言尽量像聊天,概念全部翻译成人话。
一句话讲什么(TL;DR)
这是微软的一篇"设计原则 + 能力研究"论文:它教你怎么用一套方法(提示工程 + 高层函数库 + 人在环把关),让 ChatGPT 把人的大白话指令翻译成机器人能执行的代码。核心招数是——不让 ChatGPT 直接写底层电机代码,而是给它一套"起好名字的高层函数"(如 detect_object()、move_to()),它负责把这些积木搭成解决任务的逻辑。论文在无人机、机械臂、具身导航等多种平台上做了仿真和真机演示,还开源了提示协作平台 PromptCraft 和 AirSim-ChatGPT 仿真工具。
所以这一节是想说:这篇论文的核心是"提示工程 + 高层函数库 + 人在环"这套方法论,让 ChatGPT 成为连接自然语言和机器人控制的通用桥梁。
这是个什么场景
想象你家有个机器人,你想让它"去厨房给我做个煎蛋"。传统上,要实现这个功能,得有专门的工程师坐在中间——他要懂机器人 API、懂运动规划、懂视觉,把你的意图一行行翻译成代码。每换一个任务、换一个机器人平台,工程师就得重写一遍。这个"专家在环"是机器人普及的巨大门槛。
ChatGPT 这类大语言模型(LLM)擅长两件事:理解自然语言和写代码。而且 ChatGPT 特别的地方在于——它能对话(多轮交互、记住上下文、根据反馈改),而不是像早期 GPT-3/Codex 那样只能一次性给一个提示。
那能不能用 ChatGPT 把中间那个"工程师"替换掉,让普通人(甚至不懂技术的人)用大白话就能指挥机器人?这就是本文要探索的问题。
但机器人不是纯文本应用——它要理解真实世界的物理、环境上下文,还要执行物理动作,错了可能撞坏东西甚至伤人。所以直接让 ChatGPT 生成机器人代码有很多坑:怎么完整准确地描述问题?给它哪些可用的函数?怎么让它的输出结构化到能被程序解析和安全执行?
本文要解的题:能不能总结出一套设计原则和流程,让 ChatGPT 可靠地把自然语言指令变成机器人能安全执行的代码,且能适配不同任务、不同平台?
所以这一节是想说:机器人编程需要专家在环,门槛高;ChatGPT 会理解语言又会写代码还能对话,本文想用它替代中间的工程师,让普通人用大白话指挥机器人。

之前的人怎么做的,为什么不够好
方案 A:经典符号 AI / 规则系统 预先定义物体和函数之间的刚性关系。类比:写死一本"如果 A 则 B"的规则手册。问题:结构脆弱,物体/函数关系必须提前定死,遇到新情况就不灵活,无法定义新概念。
方案 B:为特定场景定制的语言-机器人系统 用语言 token 嵌入、LLM 特征、多模态特征做某个具体机型/场景(视觉语言导航、语言人机交互、视觉语言操作)。问题:范围僵硬、功能有限,换个场景/平台就得重做。
方案 C:GPT-3 / Codex 做零样本规划或代码生成 用早期大模型做高层规划或生成代码。问题:开环(open-loop)——只能一次性给提示、一次性出结果,不能流畅交互、不能根据反馈修正。要改就得从头重写提示、重新生成。
方案 D:端到端训练机器人策略(如 RT 系列) 直接从数据学"观测→动作"。问题(相对本文而言):需要大量机器人数据和训练,不能像对话那样灵活地用自然语言即时指挥、即时纠正,也不便于非技术用户使用。
核心难题:怎么利用 LLM 的"语言理解 + 代码生成 + 对话"能力,做出一个灵活、可交互、可纠错、能跨平台的自然语言机器人接口,而不是僵硬的、开环的、场景专用的系统?
所以这一节是想说:符号 AI 脆、定制系统窄、GPT-3/Codex 开环不可交互、端到端策略需大量训练——缺一套能用对话灵活指挥、跨平台、可纠错的 LLM+机器人方法,这正是本文用 ChatGPT 来补的。
这篇论文的新想法
类比:ChatGPT 就像一个又懂人话、又会编程的"翻译官 + 程序员"。你不需要教它怎么控制每个电机(那太底层、太危险),你只要给它一套写好名字的"乐高积木"(高层函数),告诉它任务,它就能把积木搭成解决方案。你在旁边看着、给反馈,它就能改。
本文的核心判断:用 LLM 做机器人的关键,不是让它直接输出底层控制代码,而是给它一套命名清晰的高层函数库,让它在这个抽象层上做逻辑推理和组合。
它的方法论有几个支柱:
高层函数库(high-level function library):把机器人已有的能力(检测、建图、运动规划、抓取等)包装成命名描述性强的高层函数(如
detect_object(name)、move_to(x,y,z)),后端再链接到真实 API。ChatGPT 只需在这一层组合,不碰底层。提示工程(prompt engineering):精心写提示,包含可用函数、约束、环境描述、当前状态、目标、示例等。还可以用特殊技巧约束输出结构(要求写某语言的代码、用 XML 标签包裹输出便于解析)。
对话式闭环推理(closed-loop reasoning):利用 ChatGPT 的对话能力——它不对时可以用自然语言反馈让它自己改(不像 GPT-3 要重写提示);还能做课程学习(先教小技能再组合成大任务)、能主动提澄清问题。
人在环(human on the loop):人监督 ChatGPT 输出的代码(直接看或在仿真里验证),把关安全,出问题就干预。强调这不是全自动,而是"增强人的能力"的工具。
开源工具:PromptCraft(社区协作分享好的/坏的提示策略)+ AirSim-ChatGPT(无人机导航仿真起点)。
【开环 GPT-3/Codex vs ChatGPT 函数库 + 对话闭环】
旧(GPT-3/Codex):一次给提示 ─▶ 一次出代码(开环, 要改就从头重写)
ChatGPT for Robotics:
用户大白话任务
│ 提示工程(可用函数 / 约束 / 环境 / 状态 / 示例; XML标签包输出便于解析)
▼
ChatGPT 在"高层函数库"抽象层组合:
detect_object() / move_to() / grasp() ...(不碰底层控制)
│ ↑ 人在环把关:读代码或仿真验证, 出问题就干预
└── 自然语言反馈 ─▶ ChatGPT 自己改(对话闭环)
▼
后端链接真实 API ─▶ 机器人执行
所以这一节是想说:本文的新想法是"给 ChatGPT 一套高层函数库当积木 + 用提示工程和对话闭环引导 + 人在环把关",让它在抽象层做推理组合,而非直接写底层代码。
它分几步做的(方法)
ChatGPT for Robotics 的流水线:
【第1步 定义高层函数库】
把机器人能力包装成描述性命名的函数
detect_object(name) → 内部链接视觉模型
move_to(x,y,z) → 内部链接运动规划+避障+电机
│
【第2步 构建提示】
任务目标 + 可用函数列表 + 约束 + 环境 + 当前状态 + 目标 + 示例
(可选: 要求XML标签/特定语言代码 约束输出结构)
│
▼ ChatGPT 生成代码 (高层函数的逻辑组合)
│
【第3步 人在环评估】
人直接看代码 / 在仿真(AirSim等)里验证
│ 用自然语言反馈问题 → ChatGPT 对话式自我修正
▼ (迭代直到满意)
│
【第4步 部署】最终代码上真机
下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。
5.1 第一步:构建高层函数库
类比:不给 ChatGPT 一堆散乱的螺丝钉(底层电机指令),而是给它一盒起好名字的乐高积木(高层函数)。
输入:目标机器人平台已有的库和能力(黑盒或开源,涵盖检测分割、建图、运动规划、控制、抓取等)。
处理:把这些底层能力包装成高层函数,关键要求是函数名要描述性强——因为 ChatGPT 要靠名字推理函数之间的功能关系。例如 detect_object(object_name) 内部可链接 OpenCV 或视觉模型,move_to(x,y,z) 内部可调用运动规划 + 避障 + 底层电机指令。必要时把函数拆成清晰输入输出的子组件,像写代码文档一样解释。一个重要观察:不像脆弱的符号 AI,LLM 在需要时能自己定义新函数、新概念,甚至融合已有 API——用户可以利用这点,和 ChatGPT 一起迭代定义新 API。
输出:一套命名清晰、可映射到真实实现的高层函数库。
小结:高层函数库是整套方法的地基——给 ChatGPT 命名清晰的积木,让它在抽象层组合,而非碰危险的底层。
5.2 第二步:写清任务提示
类比:给一个能干的实习生派活,你得说清楚:能用哪些工具、有什么限制、环境什么样、现在是什么状态、目标是什么,最好给个例子。
输入:要完成的机器人任务。
处理:构建提示,一个好的上下文描述应包含:
- 机器人 API:可用的高层函数列表。
- 约束和要求:如要移动物体的重量、大小、形状。
- 环境:如迷宫的大小形状、障碍。
- 当前状态:如机器人和物体的当前位置朝向。
- 目标:如要拼多少块拼图、期望完成时间。
- 示例(solution examples):示范类似任务怎么解,引导它的策略(但注意示例会引入偏见,要给多样例子、避免过度规定)。 反面教材:不给 API 指导 → 无边界的纯文本回答;API 描述不足 → 对函数参数产生幻觉。
输出:一个信息完整、能引导 ChatGPT 生成正确代码的提示。
小结:提示要交代清楚函数、约束、环境、状态、目标、示例——信息越完整,ChatGPT 越少幻觉、越准。
5.3 第三步:约束输出结构
类比:不仅要它给答案,还要它按你能自动读取的格式给(比如"只用代码块""用 XML 标签分段")。
输入:需要被下游程序自动解析、实时执行的场景。
处理:用特殊技巧约束输出格式:
- 直接要求生成特定语言(Python、C++)的代码——通常会跟一段自由文本 + 代码块。
- 要求用 XML 标签包裹输出(如
<command>放代码、<reason>放解释、<question>放澄清问题),便于后处理自动解析。 - 也可要求按列表格式而非代码/自由文本输出(在提示最后一行指定)。
XML 标签这招还带来一个好处:能让 ChatGPT 在不确定时主动用
<question>标签提澄清问题,实现更自然的交互。
输出:结构化、可自动解析的模型输出。
小结:用"指定语言 + XML 标签"约束输出结构,让 ChatGPT 的回答能被程序可靠解析、还能规范化交互(提问/解释/命令分离)。
5.4 第四步:对话式闭环推理与纠错
类比:实习生第一版没做对没关系,你用大白话告诉他哪不对,他自己改——不用你重写整个任务书。
输入:ChatGPT 的初版代码 + 人的反馈。
处理:利用 ChatGPT 的对话能力做闭环:
- 行为纠正:如果零样本没做对,用户在对话里用自然语言描述问题,ChatGPT 自我修正。这比 GPT-3/Codex(要重新工程化提示、从头生成)高效得多。
- 课程学习(curriculum learning):先教小技能(如"学会 pick""学会 place"),再让它把技能组合成复杂任务(如"用积木搭出微软 logo"——它要记得 logo 的颜色布局,再抽象成机器人能搭的物理部件)。
- 主动提问:不确定时问澄清问题(如"房间里有两个沙发,你要去哪个?")。
- 感知-动作闭环:把观测转成文本喂给 ChatGPT,它能解析这些观测流并输出相应动作。
输出:经过迭代、满足任务的代码。
小结:对话闭环让 ChatGPT 能被自然语言反馈纠正、能课程式学技能、能提问、能处理文本化的感知流——这是它超越开环 GPT-3/Codex 的关键。
5.5 第五步:人在环把关与部署
类比:实习生再能干,涉及真实机器(会撞坏东西)也得有师傅盯着、先在沙盘上演练再上手。
输入:迭代好的代码。
处理:强调人在环(human on the loop)——人监督 ChatGPT 的输出,直接分析或在仿真器(如 AirSim)里验证后再部署到真机。论文明确:用 ChatGPT 做机器人不是全自动流程,而是增强人的能力的工具;物理部署的安全考量不能忽视,必须有人监控并在异常时干预。
输出:安全部署到真机的最终方案。
小结:人在环 + 仿真验证是安全底线——ChatGPT 是增强人、而非取代人的工具,真机部署必须有人把关。
5.6 为什么"高层抽象 + 对话闭环 + 人在环"是关键
- 高层抽象让 LLM 发挥所长、规避所短:它擅长逻辑组合、不擅长精确底层控制,给它高层积木正好扬长避短,也更安全。
- 对话闭环让系统灵活可纠错:这是 ChatGPT 相对早期 LLM 的核心优势,让非技术用户也能用自然语言迭代。
- 人在环保证安全:物理世界容错低,人监督 + 仿真验证是负责任的做法。
所以这一节是想说:本文方法五步(建函数库 → 写提示 → 约束输出 → 对话闭环纠错 → 人在环部署),核心是"让 ChatGPT 在高层抽象上做推理组合 + 用对话灵活迭代 + 用人在环兜底安全"。

关键数字(What works)
这是一篇定性研究论文,主要贡献是方法论和多平台演示,而非量化基准。下面用表格梳理它验证的能力范围和工具(数据均来自原文的定性描述,非虚构成功率)。
概览 1:验证的任务类别(从简单到复杂)
| 类别 | 代表任务 | 关键观察 |
|---|---|---|
| 逻辑/几何/数学推理 | 基础时空推理 | 零样本可解 |
| 时空推理 + 视觉伺服 | 用视觉伺服接篮球 | 会调 OpenCV、用比例控制器,甚至用 SVG 画出球的样子 |
| 空中机器人(真机) | 真实无人机飞行取饮料 | 直观自然语言接口、会提澄清问题、写复杂巡检轨迹 |
| 空中机器人(仿真) | AirSim 工业巡检 | 准确解析几何意图控制无人机 |
| 操作(机械臂) | 积木排列、搭微软 logo | 课程学习:学 pick/place 再组合;跨文本-物理域泛化 |
| 空中避障 | 带距离传感器的目标到达 | 搭出主体算法,人给高层反馈补漏 |
| 具身导航 | 闭环物体导航 | 用 API 库构造感知-动作循环 |
关键含义:覆盖从纯推理到真机操作/飞行的广谱任务,展示了 ChatGPT 作为通用机器人接口的潜力。
概览 2:核心提示工程技巧
| 技巧 | 作用 |
|---|---|
| 高层函数库 | 让 ChatGPT 在抽象层组合,不碰底层、更安全 |
| 描述性函数命名 | ChatGPT 靠名字推理函数间关系 |
| 完整上下文(约束/环境/状态/目标) | 减少幻觉、提升准确性 |
| 示例(solution examples) | 引导解题策略(但注意引入偏见) |
| 指定输出语言(Python/C++) | 便于直接执行 |
| XML 标签(command/reason/question) | 便于自动解析 + 规范交互 |
| 对话式反馈 | 自然语言纠错,无需重写提示 |
关键含义:这些技巧构成了论文最可复用的部分——一套实操的提示工程方法论。
概览 3:验证平台与形态
| 形态/平台 | 是否真机 | 场景 |
|---|---|---|
| 平面机器人 + 上视相机 | 仿真 | 视觉伺服接球 |
| Tello 无人机 | 真机 | 取饮料、巡检兰花 |
| AirSim 无人机 | 仿真 | 工业巡检、避障 |
| 机械臂 | 真机 | 积木排列、搭 logo |
| 移动地面机器人 | 交互演示 | 房间物体导航 |
关键含义:跨多种形态(无人机、机械臂、地面机器人)和多种现实(仿真/真机)验证,证明方法的通用性。
概览 4:开源交付物
| 交付物 | 用途 |
|---|---|
| PromptCraft | 社区协作上传/投票好的(和坏的)机器人提示策略 |
| AirSim-ChatGPT | 集成 ChatGPT 的无人机导航仿真环境,供研究者上手 |
关键含义:不只给方法,还给社区工具,推动"提示工程 for 机器人"这门经验科学的积累。
所以这一节是想说:作为定性研究,它证明了三件事——ChatGPT 能跨广谱任务/多平台/真机与仿真工作、一套提示工程技巧可复用、并用开源工具推动社区。
实验结果说明了什么
问题一:ChatGPT 真能零样本解机器人任务吗? 能,部分任务。只给提示和函数库描述、不给代码示例,ChatGPT 就能零样本解一些任务:如用视觉伺服接篮球(会正确调用 OpenCV、用比例控制器)、控制真实无人机飞行取饮料、AirSim 工业巡检。但复杂任务或它零样本做不对时,需要对话纠正。
问题二:对话能力到底带来什么关键优势? 灵活的行为纠正和交互。相比 GPT-3/Codex 要重写提示、从头生成,ChatGPT 能在对话里接收自然语言反馈、局部修改代码。这让它能做课程学习(先学小技能再组合)、能主动提澄清问题、能处理文本化的感知流形成闭环。这是它作为机器人接口比早期 LLM 强的根本原因。
问题三:为什么强调高层函数库而不让它直接写底层代码? 因为不给 API 指导时,ChatGPT 会给出无边界的纯文本回答;API 描述不足时会对函数参数产生幻觉。给它命名清晰的高层函数,它才能靠函数名推理功能关系、组合成正确逻辑,且能泛化到不同场景和平台。高层抽象既扬长(逻辑组合)避短(精确底层控制),也更安全。
问题四:这套方法能全自动吗?安全吗? 不能全自动,必须人在环。论文反复强调:物理机器人部署有安全风险,需要人监控、在异常时干预,并建议先在仿真里验证再上真机。ChatGPT 是增强人能力的工具,不是取代人的自主系统。一个有趣的观察是:ChatGPT 能用 SVG 画出球和天空的样子,暗示它可能维持着某种超越文本概率的隐式世界模型——但这仍需人来把关。
所以这一节是想说:实验(定性)系统回答了四个问题——能零样本解部分任务、对话带来灵活纠错是核心优势、高层函数库避免幻觉、但必须人在环保证安全。
你应该懂的几个新词
大语言模型(LLM):在海量文本上训练的模型(如 GPT-3、ChatGPT),会理解和生成语言、写代码。
提示工程(prompt engineering):精心设计给 LLM 的输入提示,以引导它产生想要的输出,是一门经验科学。
高层函数库(high-level function library):把机器人底层能力包装成命名清晰的高层函数,供 LLM 组合调用。
零样本(zero-shot):不给任何示例,只靠任务描述就完成任务。
闭环推理 / 感知-动作循环(closed-loop / perception-action loop):把观测反馈给系统、系统据此调整动作,不断循环,区别于一次性的开环。
开环(open-loop):一次性给指令、一次性执行,不根据反馈调整(早期 GPT-3/Codex 的模式)。
课程学习(curriculum learning):先教简单技能,再把它们组合成复杂任务。
人在环(human on the loop):人监督并在必要时干预自动系统的输出,保证安全。
视觉伺服(visual servoing):用视觉反馈实时控制机器人运动(如根据球在图像中的位置调整速度)。
幻觉(hallucination):LLM 编造不存在的信息(如虚构函数参数),API 描述不足时容易发生。
所以这一节是想说:这十个词是读任何"LLM + 机器人 / 智能体"论文都会反复出现的基础词汇。
它有什么搞不定的
- 不能全自动、必须人在环:ChatGPT 会出错、会幻觉,物理部署有安全风险,必须人监督 + 仿真验证,无法无人值守自主运行。
- 依赖高层函数库的质量:如果没有好的、命名清晰的高层函数库,ChatGPT 要么给无边界文本、要么幻觉参数。方法的成败很大程度取决于人预先包装的 API。
- 提示工程是经验科学、不稳定:好提示靠试错,缺乏理论保证;换个措辞、换个示例,结果可能大变(示例还会引入偏见)。
- 没有量化的可靠性保证:论文是定性演示,没给成功率/失败率的系统统计,实际部署的可靠性难以预估。
- 感知仍靠外部模块:ChatGPT 本身不直接感知世界,感知信息要转成文本喂给它,视觉/空间理解受限于外部检测模块和文本化的损失。
- 安全和幻觉在物理世界后果严重:文本应用里幻觉无伤大雅,但机器人幻觉一个错误动作可能撞坏设备或伤人——这是把 LLM 用于机器人的根本风险。
所以这一节是想说:这套方法打开了"大白话指挥机器人"的大门,但依赖人在环、依赖函数库质量、提示不稳定、缺可靠性保证、幻觉在物理世界后果严重——它是工具而非自主系统。
它和别的论文是什么关系
- 上游(被它借用):
- ChatGPT / GPT 系列(OpenAI):底座模型,提供语言理解 + 代码生成 + 对话能力。
- Codex / GPT-3 的机器人应用:前人用早期 LLM 做规划/代码生成的尝试,本文指出它们开环、不可交互的局限。
- 经典机器人库:OpenCV、运动规划、抓取等,被包装成高层函数供 ChatGPT 调用。
- Microsoft AirSim:仿真底座,用于 AirSim-ChatGPT 工具。
- 对比关系:
- 和 SayCan / Code as Policies 等:都是 LLM 做机器人高层规划/代码生成,本文更强调对话闭环、提示工程方法论和人在环。
- 和 端到端 VLA(RT-1/RT-2、OpenVLA):那些从数据端到端学动作,本文不训练模型、只用提示 + 现成 API,更轻量灵活但依赖人和函数库。
- 下游 / 同族:本文推动了"LLM 作为机器人高层大脑/接口"这条线,其 PromptCraft 平台和提示工程原则影响了后续大量"LLM + 机器人"工作;也和后来的 VLM/VLA 世界模型形成互补(一个做高层推理接口,一个做端到端策略)。
所以这一节是想说:本文站在 ChatGPT + 经典机器人库 + AirSim 的肩膀上,用"提示工程 + 高层函数库 + 对话闭环 + 人在环"把 LLM 变成灵活的机器人接口,是"LLM 作为机器人大脑"这条线的奠基性研究之一。
和本导读的关系
本笔记对应导读中"LLM 作为机器人高层规划/接口"这条线的早期节点。
机器人智能大致分两层:高层"想做什么、怎么分解"和底层"具体怎么动"。本文探索的是用 LLM(ChatGPT)来担当高层——把人的自然语言意图翻译成机器人能执行的代码逻辑。理解了它,你就理解了后来一大批"LLM 做规划、底层用现成技能"工作的思路源头,也理解了"提示工程 + 函数库"这套至今仍常用的实操范式。
读完本笔记,建议:对照看端到端的 VLA 模型笔记(如 RT 系列、OpenVLA、3D-VLA),理解"用提示 + 现成 API(本文)"和"从数据端到端学动作(VLA)"这两条路线的根本差异和互补;也可以结合 世界模型相关笔记,理解本文提到的"ChatGPT 可能有隐式世界模型"这个引人遐想的观察。
对应导读章节:Ch10:高层规划——SayCan / Code-as-Policies / Inner Monologue。
所以这一节是想说:本笔记是"LLM 作为机器人高层大脑"这条线的起点,读它能理解提示工程范式,再对照 VLA 端到端路线看清两条技术路线。
思考题
以下问题检验你是否真正理解了 ChatGPT for Robotics 的设计逻辑。建议先自己想 30 秒再展开提示。
Q1:为什么本文坚持给 ChatGPT 一套"高层函数库",而不让它直接生成控制电机的底层代码?
提示
三个原因。(1) 扬长避短:LLM 擅长逻辑推理和组合,但不擅长精确的底层控制细节(电机时序、坐标变换、控制律参数)。让它在高层组合命名清晰的函数,正好用它的强项、避开弱项。(2) 避免幻觉和无边界输出:论文观察到,不给 API 指导时 ChatGPT 会给无边界的纯文本回答;API 描述不足时会对函数参数产生幻觉。给它明确的高层函数库,它才能靠函数名推理功能关系、生成有界且正确的逻辑。(3) 安全和可移植:底层代码直接控制物理硬件,出错后果严重且平台相关;高层函数是"包装层",后端可链接到不同平台的真实 API,既安全(人能审查高层逻辑)又能跨平台泛化(换机器人只需换后端实现,高层逻辑不变)。所以高层抽象是这套方法安全、可靠、通用的核心设计。
Q2:ChatGPT 的"对话能力"相比早期 GPT-3/Codex 到底带来了什么本质区别?
提示
本质区别是从"开环"变成"闭环可交互"。GPT-3/Codex 是一次性的:你给一个提示,它给一个输出,如果不对,你得重新工程化提示、从头生成——这既费力又不连贯,无法基于之前的上下文做增量改进。ChatGPT 能对话、能记住长上下文,这带来几个关键能力:(1) 自然语言纠错——你只需用大白话说"你忘了转向目标",它就能定位到代码里对应的地方局部修改,无需重写整个提示;(2) 课程学习——可以先教它小技能,它记住后,再让它组合成大任务;(3) 主动提问——不确定时它能问澄清问题("有两个沙发,去哪个?");(4) 感知闭环——可以持续把观测转成文本喂给它,形成感知-动作循环。这些都建立在"对话 + 记忆上下文"之上,是 ChatGPT 作为机器人接口远超早期 LLM 的根本原因,也让非技术用户能用自然语言迭代。
Q3:论文强调"人在环",说这不是全自动系统。为什么在物理机器人上,人在环比在纯文本应用里重要得多?
提示
因为物理世界的容错性极低、后果不可逆。在纯文本应用里,LLM 幻觉一个错误答案,用户看一眼就能忽略,代价几乎为零。但机器人执行动作会直接作用于真实世界:ChatGPT 如果幻觉一个错误的坐标或动作,机械臂可能撞坏物体、撞到自己、甚至伤人,无人机可能坠机——这些后果是物理的、往往不可逆、可能危险。而且 LLM 本质上会犯错、会幻觉,不可能保证 100% 正确。所以在把它用于物理机器人时,必须有人监督它的输出(直接审查代码或在仿真里验证),在异常时干预,绝不能让它无人值守地自主控制真机。这也是为什么论文把它定位为"增强人的能力的工具"而非"自主系统",并建议先在仿真(如 AirSim)里充分验证再上真机。安全是把 LLM 用于机器人的第一原则。
Q4:论文提到用 XML 标签(如 <command>、<reason>、<question>)约束 ChatGPT 的输出。这个技巧解决了什么实际问题?
提示
解决两个实际问题。(1) 自动解析:ChatGPT 默认输出通常是"一段自由文本 + 一个代码块"混在一起,如果要让下游程序自动提取出可执行的代码来实时控制机器人,混杂的文本会干扰解析。用 XML 标签把代码包在 <command> 里,程序就能可靠地只提取标签内的内容执行,不用靠脆弱的文本规则去猜哪部分是代码。(2) 规范交互结构:定义 <question>(澄清问题)、<reason>(解释)、<command>(命令)等标签,等于给 ChatGPT 的回答定了一个结构化协议——它不确定时把问题放 <question>、执行时把代码放 <command>、把解释放 <reason>。这让人机交互变得清晰可控:系统能自动区分"它在问我 vs 它在执行 vs 它在解释",从而分别处理(比如遇到 <question> 就暂停等用户回答)。所以 XML 标签既是"让机器能读"的工程手段,也是"规范交互流程"的协议设计,是提示工程里很实用的一招。
Q5:论文观察到 ChatGPT 能用 SVG 代码画出球的样子、能记住并搭出微软 logo,作者说这"暗示 LLM 维持着某种隐式世界模型"。你怎么理解这个说法?它靠谱吗?
提示
这个观察确实引人遐想,但要谨慎理解。"隐式世界模型"的意思是:ChatGPT 似乎不只是在做"下一个 token 的文本概率预测",而是内部维持着对物理世界某种结构化的理解——它知道球是圆的橙色的、知道微软 logo 是四个不同颜色的方块组成的网格,并能把这些"知识"转化为 SVG 几何代码或机器人搭建动作。这跨越了"文本域"和"物理/视觉域"。乐观地看,这暗示大规模语言训练可能副产品式地学到了世界的一些结构,使 LLM 在机器人任务上有超预期的表现。但要谨慎:(1) 这些能力可能来自训练数据里见过大量相关描述(SVG 教程、logo 描述),是记忆+组合而非真正的物理理解;(2) 它没有真正的感知和物理接地,容易在训练分布外犯低级错误(如空间推理出错、幻觉);(3) "世界模型"是个强主张,单靠几个定性例子不足以证明。所以合理的态度是:这是个有趣的、值得进一步研究的现象,提示 LLM 有超越纯文本的潜力,但不能过度解读为它真正"理解"了物理世界——这也正是为什么仍然需要人在环把关。
Q6:这套方法不训练任何模型、只用提示 + 现成 API,而 RT-2/OpenVLA 这类是从数据端到端学动作。两条路线各有什么优劣?什么场景该用哪个?
提示
两条路线是互补的。本文(提示 + 现成 API)路线:优点是轻量(不需训练、不需机器人数据)、灵活(换任务/平台改提示或函数库即可)、可交互可纠错、非技术用户友好、能利用 LLM 的常识和推理。缺点是依赖预先包装的高层函数库、必须人在环、提示不稳定、只做高层逻辑而不直接产生精细连续控制、缺可靠性保证。端到端 VLA 路线:优点是能直接输出低层连续动作(精细控制)、从数据学到的技能更贴合物理、可以规模化、部署时更自主。缺点是需要大量机器人数据和训练、泛化到全新任务需要新数据、不如对话灵活、可解释性差。场景选择:如果你有现成的机器人技能库、想让用户用自然语言灵活组合它们做高层任务(如"去厨房做煎蛋"分解成一串已有技能)、且能接受人在环,用本文这条路;如果你需要精细的、数据里学出来的连续控制技能(如灵巧操作、动态任务),且愿意投入数据和训练,用 VLA。实际上最强的系统往往结合两者:用 LLM 做高层规划和任务分解(本文思路),用学习式策略执行底层技能(VLA 思路)——这正是很多分层机器人系统的架构。
Q7:如果你要把这套方法部署到一个真实的家庭服务机器人上,你觉得最大的工程和安全挑战是什么?
提示
几个层面的挑战:(1) 安全兜底:ChatGPT 会幻觉、会出错,家庭环境里有人、宠物、易碎物、火/电/水,一个错误动作可能造成伤害。需要在高层函数库和执行层加硬性安全约束(如速度/力/工作空间限制、碰撞检测、危险动作拦截),不能只靠 ChatGPT 自觉。(2) 感知的可靠性:本文把感知外包给检测模块,家庭场景物体繁多、光照多变、遮挡常见,检测一旦出错,ChatGPT 基于错误信息生成的动作就危险。需要鲁棒的感知 + 不确定性处理。(3) 人在环 vs 实用性的矛盾:论文要求人监督每次输出,但家庭用户不可能审查每段代码——如何在减少人负担的同时保持安全,是个难题(可能需要经过验证的技能库 + 分级授权 + 只在低风险任务上放手)。(4) 提示的鲁棒性:家庭指令千变万化、含糊不清,提示工程的不稳定性会放大,需要大量测试和 fallback(如不确定就提问或拒绝)。(5) 实时性和延迟:调用云端 ChatGPT 有延迟,对需要实时响应的安全动作(如避开突然出现的孩子)不够快,安全关键的控制不能依赖 LLM 的慢推理。(6) 可靠性验证:论文没给量化可靠性,商用部署需要大规模测试建立可信度。核心矛盾是"LLM 的灵活性和不可预测性"与"物理安全要求的确定性"之间的张力——解决它需要把 LLM 限制在高层、用经过验证的安全底层技能兜底、并对不同风险等级的任务采取不同的自主度。
所以这一节是想说:能回答这 7 题,你就真正理解了 ChatGPT for Robotics 为什么用高层函数库、为什么强调对话和人在环、XML 标签的作用,以及它和端到端 VLA 的路线差异与部署挑战。
一些好奇心问答(FAQ)
Q1:这篇论文提出了新模型吗? 没有。它不训练任何模型,直接用现成的 ChatGPT,贡献是一套"怎么用好它做机器人"的设计原则、流程和多平台演示,外加开源工具。
Q2:核心的一招是什么?
高层函数库。不让 ChatGPT 写底层电机代码,而是给它一套命名清晰的高层函数(detect_object、move_to 等)当积木,让它在抽象层组合逻辑。
Q3:它在真机上跑过吗? 跑过。用 ChatGPT 控制过真实的 Tello 无人机(取饮料、巡检兰花)和机械臂(积木排列、搭微软 logo),也在 AirSim 仿真里做了无人机巡检和避障。
Q4:ChatGPT 能全自动控制机器人吗? 不能。论文明确强调必须人在环——人监督输出、在仿真里验证、异常时干预。它是增强人能力的工具,不是自主系统。
Q5:PromptCraft 是什么? 一个开源的社区协作平台,研究者可以上传、投票分享针对机器人的好的(和坏的)提示策略,因为提示工程是门经验科学,需要社区积累知识。
Q6:为什么用 XML 标签?
两个用途:让程序能自动解析 ChatGPT 的输出(提取代码执行),以及规范交互结构(<question> 提问、<reason> 解释、<command> 命令分离)。
所以这一节是想说:ChatGPT for Robotics 的实操问题(没新模型、核心招数、真机验证、非全自动、PromptCraft、XML 标签)都有明确答案,核心就是"提示工程 + 高层函数库 + 人在环"这套方法。
如果你想再深入
按"必读前置 → 同类方法 → 对比 → 工具"排序:
- 必读前置:GPT-3 / Codex 及其机器人应用 — 理解早期 LLM 做规划/代码生成的开环局限,才懂 ChatGPT 对话闭环的价值。
- 同类方法:SayCan / Code as Policies — 另一批"LLM 做机器人规划/代码"工作,对照理解不同侧重。
- 对比路线:RT-2 / OpenVLA / 3D-VLA — 本仓库有相关笔记,端到端 VLA 路线,对照理解两条技术路线。
- 工具上手:PromptCraft-Robotics(GitHub)+ AirSim-ChatGPT — 论文开源的提示库和仿真工具,动手实践。
- 延伸思考:世界模型相关论文 — 理解"LLM 是否有隐式世界模型"这个观察背后的更大问题。
所以这一节是想说:把 GPT-3/Codex + SayCan + 本文 + VLA 连起来读,就能看清"LLM 从开环规划到对话式机器人接口再到端到端策略"的技术脉络。
原文信息
BibTeX
@article{vemprala2024chatgpt,
title = {ChatGPT for Robotics: Design Principles and Model Abilities},
author = {Vemprala, Sai and Bonatti, Rogerio and Bucker, Arthur and Kapoor, Ashish},
journal = {IEEE Access},
year = {2024},
publisher = {IEEE}
}
链接
所以这一节是想说:这是 Vemprala et al.(微软)2023 年的工作,用"提示工程 + 高层函数库 + 对话闭环 + 人在环"证明了 ChatGPT 可以当连接自然语言和机器人控制的通用桥梁,是"LLM 作为机器人大脑"的奠基研究之一。
◼
引用本笔记 / Cite this note
@online{eai_chatgpt_for_robotics_2026,
title = {(readable note) ChatGPT for Robotics},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2023 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/chatgpt-for-robotics/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?