Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
High-Level Planning · Plate Nº 80

ChatGPT for Robotics

27 min read · 9491 字 · ⭐⭐ · 长篇结构化

这是一份写给"没接触过大模型 + 机器人结合"的读者的精读笔记。语言尽量像聊天,概念全部翻译成人话。

一句话讲什么(TL;DR)

这是微软的一篇"设计原则 + 能力研究"论文:它教你怎么用一套方法(提示工程 + 高层函数库 + 人在环把关),让 ChatGPT 把人的大白话指令翻译成机器人能执行的代码。核心招数是——不让 ChatGPT 直接写底层电机代码,而是给它一套"起好名字的高层函数"(如 detect_object()move_to()),它负责把这些积木搭成解决任务的逻辑。论文在无人机、机械臂、具身导航等多种平台上做了仿真和真机演示,还开源了提示协作平台 PromptCraft 和 AirSim-ChatGPT 仿真工具。

所以这一节是想说:这篇论文的核心是"提示工程 + 高层函数库 + 人在环"这套方法论,让 ChatGPT 成为连接自然语言和机器人控制的通用桥梁。


这是个什么场景

想象你家有个机器人,你想让它"去厨房给我做个煎蛋"。传统上,要实现这个功能,得有专门的工程师坐在中间——他要懂机器人 API、懂运动规划、懂视觉,把你的意图一行行翻译成代码。每换一个任务、换一个机器人平台,工程师就得重写一遍。这个"专家在环"是机器人普及的巨大门槛。

ChatGPT 这类大语言模型(LLM)擅长两件事:理解自然语言写代码。而且 ChatGPT 特别的地方在于——它能对话(多轮交互、记住上下文、根据反馈改),而不是像早期 GPT-3/Codex 那样只能一次性给一个提示。

那能不能用 ChatGPT 把中间那个"工程师"替换掉,让普通人(甚至不懂技术的人)用大白话就能指挥机器人?这就是本文要探索的问题。

但机器人不是纯文本应用——它要理解真实世界的物理、环境上下文,还要执行物理动作,错了可能撞坏东西甚至伤人。所以直接让 ChatGPT 生成机器人代码有很多坑:怎么完整准确地描述问题?给它哪些可用的函数?怎么让它的输出结构化到能被程序解析和安全执行?

本文要解的题:能不能总结出一套设计原则和流程,让 ChatGPT 可靠地把自然语言指令变成机器人能安全执行的代码,且能适配不同任务、不同平台?

所以这一节是想说:机器人编程需要专家在环,门槛高;ChatGPT 会理解语言又会写代码还能对话,本文想用它替代中间的工程师,让普通人用大白话指挥机器人。


ChatGPT for Robotics — 场景示意:这论文要解决的现实问题
Plate Nº IChatGPT for Robotics — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:经典符号 AI / 规则系统 预先定义物体和函数之间的刚性关系。类比:写死一本"如果 A 则 B"的规则手册。问题:结构脆弱,物体/函数关系必须提前定死,遇到新情况就不灵活,无法定义新概念。

  • 方案 B:为特定场景定制的语言-机器人系统 用语言 token 嵌入、LLM 特征、多模态特征做某个具体机型/场景(视觉语言导航、语言人机交互、视觉语言操作)。问题:范围僵硬、功能有限,换个场景/平台就得重做。

  • 方案 C:GPT-3 / Codex 做零样本规划或代码生成 用早期大模型做高层规划或生成代码。问题:开环(open-loop)——只能一次性给提示、一次性出结果,不能流畅交互、不能根据反馈修正。要改就得从头重写提示、重新生成。

  • 方案 D:端到端训练机器人策略(如 RT 系列) 直接从数据学"观测→动作"。问题(相对本文而言):需要大量机器人数据和训练,不能像对话那样灵活地用自然语言即时指挥、即时纠正,也不便于非技术用户使用。

  • 核心难题:怎么利用 LLM 的"语言理解 + 代码生成 + 对话"能力,做出一个灵活、可交互、可纠错、能跨平台的自然语言机器人接口,而不是僵硬的、开环的、场景专用的系统?

所以这一节是想说:符号 AI 脆、定制系统窄、GPT-3/Codex 开环不可交互、端到端策略需大量训练——缺一套能用对话灵活指挥、跨平台、可纠错的 LLM+机器人方法,这正是本文用 ChatGPT 来补的。


这篇论文的新想法

类比:ChatGPT 就像一个又懂人话、又会编程的"翻译官 + 程序员"。你不需要教它怎么控制每个电机(那太底层、太危险),你只要给它一套写好名字的"乐高积木"(高层函数),告诉它任务,它就能把积木搭成解决方案。你在旁边看着、给反馈,它就能改。

本文的核心判断:用 LLM 做机器人的关键,不是让它直接输出底层控制代码,而是给它一套命名清晰的高层函数库,让它在这个抽象层上做逻辑推理和组合。

它的方法论有几个支柱:

  1. 高层函数库(high-level function library):把机器人已有的能力(检测、建图、运动规划、抓取等)包装成命名描述性强的高层函数(如 detect_object(name)move_to(x,y,z)),后端再链接到真实 API。ChatGPT 只需在这一层组合,不碰底层。

  2. 提示工程(prompt engineering):精心写提示,包含可用函数、约束、环境描述、当前状态、目标、示例等。还可以用特殊技巧约束输出结构(要求写某语言的代码、用 XML 标签包裹输出便于解析)。

  3. 对话式闭环推理(closed-loop reasoning):利用 ChatGPT 的对话能力——它不对时可以用自然语言反馈让它自己改(不像 GPT-3 要重写提示);还能做课程学习(先教小技能再组合成大任务)、能主动提澄清问题。

  4. 人在环(human on the loop):人监督 ChatGPT 输出的代码(直接看或在仿真里验证),把关安全,出问题就干预。强调这不是全自动,而是"增强人的能力"的工具。

  5. 开源工具:PromptCraft(社区协作分享好的/坏的提示策略)+ AirSim-ChatGPT(无人机导航仿真起点)。

【开环 GPT-3/Codex vs ChatGPT 函数库 + 对话闭环】

旧(GPT-3/Codex):一次给提示 ─▶ 一次出代码(开环, 要改就从头重写)

ChatGPT for Robotics:
  用户大白话任务
    │ 提示工程(可用函数 / 约束 / 环境 / 状态 / 示例; XML标签包输出便于解析)
    ▼
  ChatGPT 在"高层函数库"抽象层组合:
      detect_object() / move_to() / grasp() ...(不碰底层控制)
    │           ↑ 人在环把关:读代码或仿真验证, 出问题就干预
    └── 自然语言反馈 ─▶ ChatGPT 自己改(对话闭环)
    ▼
  后端链接真实 API ─▶ 机器人执行

所以这一节是想说:本文的新想法是"给 ChatGPT 一套高层函数库当积木 + 用提示工程和对话闭环引导 + 人在环把关",让它在抽象层做推理组合,而非直接写底层代码。


它分几步做的(方法)

ChatGPT for Robotics 的流水线:

【第1步 定义高层函数库】
   把机器人能力包装成描述性命名的函数
   detect_object(name) → 内部链接视觉模型
   move_to(x,y,z)      → 内部链接运动规划+避障+电机
   │
【第2步 构建提示】
   任务目标 + 可用函数列表 + 约束 + 环境 + 当前状态 + 目标 + 示例
   (可选: 要求XML标签/特定语言代码 约束输出结构)
   │
   ▼ ChatGPT 生成代码 (高层函数的逻辑组合)
   │
【第3步 人在环评估】
   人直接看代码 / 在仿真(AirSim等)里验证
   │ 用自然语言反馈问题 → ChatGPT 对话式自我修正
   ▼ (迭代直到满意)
   │
【第4步 部署】最终代码上真机

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 第一步:构建高层函数库

类比:不给 ChatGPT 一堆散乱的螺丝钉(底层电机指令),而是给它一盒起好名字的乐高积木(高层函数)。

输入:目标机器人平台已有的库和能力(黑盒或开源,涵盖检测分割、建图、运动规划、控制、抓取等)。

处理:把这些底层能力包装成高层函数,关键要求是函数名要描述性强——因为 ChatGPT 要靠名字推理函数之间的功能关系。例如 detect_object(object_name) 内部可链接 OpenCV 或视觉模型,move_to(x,y,z) 内部可调用运动规划 + 避障 + 底层电机指令。必要时把函数拆成清晰输入输出的子组件,像写代码文档一样解释。一个重要观察:不像脆弱的符号 AI,LLM 在需要时能自己定义新函数、新概念,甚至融合已有 API——用户可以利用这点,和 ChatGPT 一起迭代定义新 API。

输出:一套命名清晰、可映射到真实实现的高层函数库。

小结:高层函数库是整套方法的地基——给 ChatGPT 命名清晰的积木,让它在抽象层组合,而非碰危险的底层。

5.2 第二步:写清任务提示

类比:给一个能干的实习生派活,你得说清楚:能用哪些工具、有什么限制、环境什么样、现在是什么状态、目标是什么,最好给个例子。

输入:要完成的机器人任务。

处理:构建提示,一个好的上下文描述应包含:

  • 机器人 API:可用的高层函数列表。
  • 约束和要求:如要移动物体的重量、大小、形状。
  • 环境:如迷宫的大小形状、障碍。
  • 当前状态:如机器人和物体的当前位置朝向。
  • 目标:如要拼多少块拼图、期望完成时间。
  • 示例(solution examples):示范类似任务怎么解,引导它的策略(但注意示例会引入偏见,要给多样例子、避免过度规定)。 反面教材:不给 API 指导 → 无边界的纯文本回答;API 描述不足 → 对函数参数产生幻觉。

输出:一个信息完整、能引导 ChatGPT 生成正确代码的提示。

小结:提示要交代清楚函数、约束、环境、状态、目标、示例——信息越完整,ChatGPT 越少幻觉、越准。

5.3 第三步:约束输出结构

类比:不仅要它给答案,还要它按你能自动读取的格式给(比如"只用代码块""用 XML 标签分段")。

输入:需要被下游程序自动解析、实时执行的场景。

处理:用特殊技巧约束输出格式:

  • 直接要求生成特定语言(Python、C++)的代码——通常会跟一段自由文本 + 代码块。
  • 要求用 XML 标签包裹输出(如 <command> 放代码、<reason> 放解释、<question> 放澄清问题),便于后处理自动解析。
  • 也可要求按列表格式而非代码/自由文本输出(在提示最后一行指定)。 XML 标签这招还带来一个好处:能让 ChatGPT 在不确定时主动用 <question> 标签提澄清问题,实现更自然的交互。

输出:结构化、可自动解析的模型输出。

小结:用"指定语言 + XML 标签"约束输出结构,让 ChatGPT 的回答能被程序可靠解析、还能规范化交互(提问/解释/命令分离)。

5.4 第四步:对话式闭环推理与纠错

类比:实习生第一版没做对没关系,你用大白话告诉他哪不对,他自己改——不用你重写整个任务书。

输入:ChatGPT 的初版代码 + 人的反馈。

处理:利用 ChatGPT 的对话能力做闭环:

  • 行为纠正:如果零样本没做对,用户在对话里用自然语言描述问题,ChatGPT 自我修正。这比 GPT-3/Codex(要重新工程化提示、从头生成)高效得多。
  • 课程学习(curriculum learning):先教小技能(如"学会 pick""学会 place"),再让它把技能组合成复杂任务(如"用积木搭出微软 logo"——它要记得 logo 的颜色布局,再抽象成机器人能搭的物理部件)。
  • 主动提问:不确定时问澄清问题(如"房间里有两个沙发,你要去哪个?")。
  • 感知-动作闭环:把观测转成文本喂给 ChatGPT,它能解析这些观测流并输出相应动作。

输出:经过迭代、满足任务的代码。

小结:对话闭环让 ChatGPT 能被自然语言反馈纠正、能课程式学技能、能提问、能处理文本化的感知流——这是它超越开环 GPT-3/Codex 的关键。

5.5 第五步:人在环把关与部署

类比:实习生再能干,涉及真实机器(会撞坏东西)也得有师傅盯着、先在沙盘上演练再上手。

输入:迭代好的代码。

处理:强调人在环(human on the loop)——人监督 ChatGPT 的输出,直接分析或在仿真器(如 AirSim)里验证后再部署到真机。论文明确:用 ChatGPT 做机器人不是全自动流程,而是增强人的能力的工具;物理部署的安全考量不能忽视,必须有人监控并在异常时干预。

输出:安全部署到真机的最终方案。

小结:人在环 + 仿真验证是安全底线——ChatGPT 是增强人、而非取代人的工具,真机部署必须有人把关。

5.6 为什么"高层抽象 + 对话闭环 + 人在环"是关键

  • 高层抽象让 LLM 发挥所长、规避所短:它擅长逻辑组合、不擅长精确底层控制,给它高层积木正好扬长避短,也更安全。
  • 对话闭环让系统灵活可纠错:这是 ChatGPT 相对早期 LLM 的核心优势,让非技术用户也能用自然语言迭代。
  • 人在环保证安全:物理世界容错低,人监督 + 仿真验证是负责任的做法。

所以这一节是想说:本文方法五步(建函数库 → 写提示 → 约束输出 → 对话闭环纠错 → 人在环部署),核心是"让 ChatGPT 在高层抽象上做推理组合 + 用对话灵活迭代 + 用人在环兜底安全"。


ChatGPT for Robotics — 方法示意:核心 pipeline
Plate Nº IIChatGPT for Robotics — 方法示意:核心 pipeline

关键数字(What works)

这是一篇定性研究论文,主要贡献是方法论和多平台演示,而非量化基准。下面用表格梳理它验证的能力范围和工具(数据均来自原文的定性描述,非虚构成功率)。

概览 1:验证的任务类别(从简单到复杂)

类别 代表任务 关键观察
逻辑/几何/数学推理 基础时空推理 零样本可解
时空推理 + 视觉伺服 用视觉伺服接篮球 会调 OpenCV、用比例控制器,甚至用 SVG 画出球的样子
空中机器人(真机) 真实无人机飞行取饮料 直观自然语言接口、会提澄清问题、写复杂巡检轨迹
空中机器人(仿真) AirSim 工业巡检 准确解析几何意图控制无人机
操作(机械臂) 积木排列、搭微软 logo 课程学习:学 pick/place 再组合;跨文本-物理域泛化
空中避障 带距离传感器的目标到达 搭出主体算法,人给高层反馈补漏
具身导航 闭环物体导航 用 API 库构造感知-动作循环

关键含义:覆盖从纯推理到真机操作/飞行的广谱任务,展示了 ChatGPT 作为通用机器人接口的潜力。

概览 2:核心提示工程技巧

技巧 作用
高层函数库 让 ChatGPT 在抽象层组合,不碰底层、更安全
描述性函数命名 ChatGPT 靠名字推理函数间关系
完整上下文(约束/环境/状态/目标) 减少幻觉、提升准确性
示例(solution examples) 引导解题策略(但注意引入偏见)
指定输出语言(Python/C++) 便于直接执行
XML 标签(command/reason/question) 便于自动解析 + 规范交互
对话式反馈 自然语言纠错,无需重写提示

关键含义:这些技巧构成了论文最可复用的部分——一套实操的提示工程方法论。

概览 3:验证平台与形态

形态/平台 是否真机 场景
平面机器人 + 上视相机 仿真 视觉伺服接球
Tello 无人机 真机 取饮料、巡检兰花
AirSim 无人机 仿真 工业巡检、避障
机械臂 真机 积木排列、搭 logo
移动地面机器人 交互演示 房间物体导航

关键含义:跨多种形态(无人机、机械臂、地面机器人)和多种现实(仿真/真机)验证,证明方法的通用性。

概览 4:开源交付物

交付物 用途
PromptCraft 社区协作上传/投票好的(和坏的)机器人提示策略
AirSim-ChatGPT 集成 ChatGPT 的无人机导航仿真环境,供研究者上手

关键含义:不只给方法,还给社区工具,推动"提示工程 for 机器人"这门经验科学的积累。

所以这一节是想说:作为定性研究,它证明了三件事——ChatGPT 能跨广谱任务/多平台/真机与仿真工作、一套提示工程技巧可复用、并用开源工具推动社区。


实验结果说明了什么

问题一:ChatGPT 真能零样本解机器人任务吗? 能,部分任务。只给提示和函数库描述、不给代码示例,ChatGPT 就能零样本解一些任务:如用视觉伺服接篮球(会正确调用 OpenCV、用比例控制器)、控制真实无人机飞行取饮料、AirSim 工业巡检。但复杂任务或它零样本做不对时,需要对话纠正。

问题二:对话能力到底带来什么关键优势? 灵活的行为纠正和交互。相比 GPT-3/Codex 要重写提示、从头生成,ChatGPT 能在对话里接收自然语言反馈、局部修改代码。这让它能做课程学习(先学小技能再组合)、能主动提澄清问题、能处理文本化的感知流形成闭环。这是它作为机器人接口比早期 LLM 强的根本原因。

问题三:为什么强调高层函数库而不让它直接写底层代码? 因为不给 API 指导时,ChatGPT 会给出无边界的纯文本回答;API 描述不足时会对函数参数产生幻觉。给它命名清晰的高层函数,它才能靠函数名推理功能关系、组合成正确逻辑,且能泛化到不同场景和平台。高层抽象既扬长(逻辑组合)避短(精确底层控制),也更安全。

问题四:这套方法能全自动吗?安全吗? 不能全自动,必须人在环。论文反复强调:物理机器人部署有安全风险,需要人监控、在异常时干预,并建议先在仿真里验证再上真机。ChatGPT 是增强人能力的工具,不是取代人的自主系统。一个有趣的观察是:ChatGPT 能用 SVG 画出球和天空的样子,暗示它可能维持着某种超越文本概率的隐式世界模型——但这仍需人来把关。

所以这一节是想说:实验(定性)系统回答了四个问题——能零样本解部分任务、对话带来灵活纠错是核心优势、高层函数库避免幻觉、但必须人在环保证安全。


你应该懂的几个新词

大语言模型(LLM):在海量文本上训练的模型(如 GPT-3、ChatGPT),会理解和生成语言、写代码。

提示工程(prompt engineering):精心设计给 LLM 的输入提示,以引导它产生想要的输出,是一门经验科学。

高层函数库(high-level function library):把机器人底层能力包装成命名清晰的高层函数,供 LLM 组合调用。

零样本(zero-shot):不给任何示例,只靠任务描述就完成任务。

闭环推理 / 感知-动作循环(closed-loop / perception-action loop):把观测反馈给系统、系统据此调整动作,不断循环,区别于一次性的开环。

开环(open-loop):一次性给指令、一次性执行,不根据反馈调整(早期 GPT-3/Codex 的模式)。

课程学习(curriculum learning):先教简单技能,再把它们组合成复杂任务。

人在环(human on the loop):人监督并在必要时干预自动系统的输出,保证安全。

视觉伺服(visual servoing):用视觉反馈实时控制机器人运动(如根据球在图像中的位置调整速度)。

幻觉(hallucination):LLM 编造不存在的信息(如虚构函数参数),API 描述不足时容易发生。

所以这一节是想说:这十个词是读任何"LLM + 机器人 / 智能体"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 不能全自动、必须人在环:ChatGPT 会出错、会幻觉,物理部署有安全风险,必须人监督 + 仿真验证,无法无人值守自主运行。
  • 依赖高层函数库的质量:如果没有好的、命名清晰的高层函数库,ChatGPT 要么给无边界文本、要么幻觉参数。方法的成败很大程度取决于人预先包装的 API。
  • 提示工程是经验科学、不稳定:好提示靠试错,缺乏理论保证;换个措辞、换个示例,结果可能大变(示例还会引入偏见)。
  • 没有量化的可靠性保证:论文是定性演示,没给成功率/失败率的系统统计,实际部署的可靠性难以预估。
  • 感知仍靠外部模块:ChatGPT 本身不直接感知世界,感知信息要转成文本喂给它,视觉/空间理解受限于外部检测模块和文本化的损失。
  • 安全和幻觉在物理世界后果严重:文本应用里幻觉无伤大雅,但机器人幻觉一个错误动作可能撞坏设备或伤人——这是把 LLM 用于机器人的根本风险。

所以这一节是想说:这套方法打开了"大白话指挥机器人"的大门,但依赖人在环、依赖函数库质量、提示不稳定、缺可靠性保证、幻觉在物理世界后果严重——它是工具而非自主系统。


它和别的论文是什么关系

  • 上游(被它借用)
    • ChatGPT / GPT 系列(OpenAI):底座模型,提供语言理解 + 代码生成 + 对话能力。
    • Codex / GPT-3 的机器人应用:前人用早期 LLM 做规划/代码生成的尝试,本文指出它们开环、不可交互的局限。
    • 经典机器人库:OpenCV、运动规划、抓取等,被包装成高层函数供 ChatGPT 调用。
    • Microsoft AirSim:仿真底座,用于 AirSim-ChatGPT 工具。
  • 对比关系
    • SayCan / Code as Policies 等:都是 LLM 做机器人高层规划/代码生成,本文更强调对话闭环、提示工程方法论和人在环。
    • 端到端 VLA(RT-1/RT-2、OpenVLA):那些从数据端到端学动作,本文不训练模型、只用提示 + 现成 API,更轻量灵活但依赖人和函数库。
  • 下游 / 同族:本文推动了"LLM 作为机器人高层大脑/接口"这条线,其 PromptCraft 平台和提示工程原则影响了后续大量"LLM + 机器人"工作;也和后来的 VLM/VLA 世界模型形成互补(一个做高层推理接口,一个做端到端策略)。

所以这一节是想说:本文站在 ChatGPT + 经典机器人库 + AirSim 的肩膀上,用"提示工程 + 高层函数库 + 对话闭环 + 人在环"把 LLM 变成灵活的机器人接口,是"LLM 作为机器人大脑"这条线的奠基性研究之一。


和本导读的关系

本笔记对应导读中"LLM 作为机器人高层规划/接口"这条线的早期节点。

机器人智能大致分两层:高层"想做什么、怎么分解"底层"具体怎么动"。本文探索的是用 LLM(ChatGPT)来担当高层——把人的自然语言意图翻译成机器人能执行的代码逻辑。理解了它,你就理解了后来一大批"LLM 做规划、底层用现成技能"工作的思路源头,也理解了"提示工程 + 函数库"这套至今仍常用的实操范式。

读完本笔记,建议:对照看端到端的 VLA 模型笔记(如 RT 系列、OpenVLA、3D-VLA),理解"用提示 + 现成 API(本文)"和"从数据端到端学动作(VLA)"这两条路线的根本差异和互补;也可以结合 世界模型相关笔记,理解本文提到的"ChatGPT 可能有隐式世界模型"这个引人遐想的观察。

对应导读章节:Ch10:高层规划——SayCan / Code-as-Policies / Inner Monologue

所以这一节是想说:本笔记是"LLM 作为机器人高层大脑"这条线的起点,读它能理解提示工程范式,再对照 VLA 端到端路线看清两条技术路线。


思考题

以下问题检验你是否真正理解了 ChatGPT for Robotics 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:为什么本文坚持给 ChatGPT 一套"高层函数库",而不让它直接生成控制电机的底层代码?

提示

三个原因。(1) 扬长避短:LLM 擅长逻辑推理和组合,但不擅长精确的底层控制细节(电机时序、坐标变换、控制律参数)。让它在高层组合命名清晰的函数,正好用它的强项、避开弱项。(2) 避免幻觉和无边界输出:论文观察到,不给 API 指导时 ChatGPT 会给无边界的纯文本回答;API 描述不足时会对函数参数产生幻觉。给它明确的高层函数库,它才能靠函数名推理功能关系、生成有界且正确的逻辑。(3) 安全和可移植:底层代码直接控制物理硬件,出错后果严重且平台相关;高层函数是"包装层",后端可链接到不同平台的真实 API,既安全(人能审查高层逻辑)又能跨平台泛化(换机器人只需换后端实现,高层逻辑不变)。所以高层抽象是这套方法安全、可靠、通用的核心设计。

Q2:ChatGPT 的"对话能力"相比早期 GPT-3/Codex 到底带来了什么本质区别?

提示

本质区别是从"开环"变成"闭环可交互"。GPT-3/Codex 是一次性的:你给一个提示,它给一个输出,如果不对,你得重新工程化提示、从头生成——这既费力又不连贯,无法基于之前的上下文做增量改进。ChatGPT 能对话、能记住长上下文,这带来几个关键能力:(1) 自然语言纠错——你只需用大白话说"你忘了转向目标",它就能定位到代码里对应的地方局部修改,无需重写整个提示;(2) 课程学习——可以先教它小技能,它记住后,再让它组合成大任务;(3) 主动提问——不确定时它能问澄清问题("有两个沙发,去哪个?");(4) 感知闭环——可以持续把观测转成文本喂给它,形成感知-动作循环。这些都建立在"对话 + 记忆上下文"之上,是 ChatGPT 作为机器人接口远超早期 LLM 的根本原因,也让非技术用户能用自然语言迭代。

Q3:论文强调"人在环",说这不是全自动系统。为什么在物理机器人上,人在环比在纯文本应用里重要得多?

提示

因为物理世界的容错性极低、后果不可逆。在纯文本应用里,LLM 幻觉一个错误答案,用户看一眼就能忽略,代价几乎为零。但机器人执行动作会直接作用于真实世界:ChatGPT 如果幻觉一个错误的坐标或动作,机械臂可能撞坏物体、撞到自己、甚至伤人,无人机可能坠机——这些后果是物理的、往往不可逆、可能危险。而且 LLM 本质上会犯错、会幻觉,不可能保证 100% 正确。所以在把它用于物理机器人时,必须有人监督它的输出(直接审查代码或在仿真里验证),在异常时干预,绝不能让它无人值守地自主控制真机。这也是为什么论文把它定位为"增强人的能力的工具"而非"自主系统",并建议先在仿真(如 AirSim)里充分验证再上真机。安全是把 LLM 用于机器人的第一原则。

Q4:论文提到用 XML 标签(如 <command><reason><question>)约束 ChatGPT 的输出。这个技巧解决了什么实际问题?

提示

解决两个实际问题。(1) 自动解析:ChatGPT 默认输出通常是"一段自由文本 + 一个代码块"混在一起,如果要让下游程序自动提取出可执行的代码来实时控制机器人,混杂的文本会干扰解析。用 XML 标签把代码包在 <command> 里,程序就能可靠地只提取标签内的内容执行,不用靠脆弱的文本规则去猜哪部分是代码。(2) 规范交互结构:定义 <question>(澄清问题)、<reason>(解释)、<command>(命令)等标签,等于给 ChatGPT 的回答定了一个结构化协议——它不确定时把问题放 <question>、执行时把代码放 <command>、把解释放 <reason>。这让人机交互变得清晰可控:系统能自动区分"它在问我 vs 它在执行 vs 它在解释",从而分别处理(比如遇到 <question> 就暂停等用户回答)。所以 XML 标签既是"让机器能读"的工程手段,也是"规范交互流程"的协议设计,是提示工程里很实用的一招。

Q5:论文观察到 ChatGPT 能用 SVG 代码画出球的样子、能记住并搭出微软 logo,作者说这"暗示 LLM 维持着某种隐式世界模型"。你怎么理解这个说法?它靠谱吗?

提示

这个观察确实引人遐想,但要谨慎理解。"隐式世界模型"的意思是:ChatGPT 似乎不只是在做"下一个 token 的文本概率预测",而是内部维持着对物理世界某种结构化的理解——它知道球是圆的橙色的、知道微软 logo 是四个不同颜色的方块组成的网格,并能把这些"知识"转化为 SVG 几何代码或机器人搭建动作。这跨越了"文本域"和"物理/视觉域"。乐观地看,这暗示大规模语言训练可能副产品式地学到了世界的一些结构,使 LLM 在机器人任务上有超预期的表现。但要谨慎:(1) 这些能力可能来自训练数据里见过大量相关描述(SVG 教程、logo 描述),是记忆+组合而非真正的物理理解;(2) 它没有真正的感知和物理接地,容易在训练分布外犯低级错误(如空间推理出错、幻觉);(3) "世界模型"是个强主张,单靠几个定性例子不足以证明。所以合理的态度是:这是个有趣的、值得进一步研究的现象,提示 LLM 有超越纯文本的潜力,但不能过度解读为它真正"理解"了物理世界——这也正是为什么仍然需要人在环把关。

Q6:这套方法不训练任何模型、只用提示 + 现成 API,而 RT-2/OpenVLA 这类是从数据端到端学动作。两条路线各有什么优劣?什么场景该用哪个?

提示

两条路线是互补的。本文(提示 + 现成 API)路线:优点是轻量(不需训练、不需机器人数据)、灵活(换任务/平台改提示或函数库即可)、可交互可纠错、非技术用户友好、能利用 LLM 的常识和推理。缺点是依赖预先包装的高层函数库、必须人在环、提示不稳定、只做高层逻辑而不直接产生精细连续控制、缺可靠性保证。端到端 VLA 路线:优点是能直接输出低层连续动作(精细控制)、从数据学到的技能更贴合物理、可以规模化、部署时更自主。缺点是需要大量机器人数据和训练、泛化到全新任务需要新数据、不如对话灵活、可解释性差。场景选择:如果你有现成的机器人技能库、想让用户用自然语言灵活组合它们做高层任务(如"去厨房做煎蛋"分解成一串已有技能)、且能接受人在环,用本文这条路;如果你需要精细的、数据里学出来的连续控制技能(如灵巧操作、动态任务),且愿意投入数据和训练,用 VLA。实际上最强的系统往往结合两者:用 LLM 做高层规划和任务分解(本文思路),用学习式策略执行底层技能(VLA 思路)——这正是很多分层机器人系统的架构。

Q7:如果你要把这套方法部署到一个真实的家庭服务机器人上,你觉得最大的工程和安全挑战是什么?

提示

几个层面的挑战:(1) 安全兜底:ChatGPT 会幻觉、会出错,家庭环境里有人、宠物、易碎物、火/电/水,一个错误动作可能造成伤害。需要在高层函数库和执行层加硬性安全约束(如速度/力/工作空间限制、碰撞检测、危险动作拦截),不能只靠 ChatGPT 自觉。(2) 感知的可靠性:本文把感知外包给检测模块,家庭场景物体繁多、光照多变、遮挡常见,检测一旦出错,ChatGPT 基于错误信息生成的动作就危险。需要鲁棒的感知 + 不确定性处理。(3) 人在环 vs 实用性的矛盾:论文要求人监督每次输出,但家庭用户不可能审查每段代码——如何在减少人负担的同时保持安全,是个难题(可能需要经过验证的技能库 + 分级授权 + 只在低风险任务上放手)。(4) 提示的鲁棒性:家庭指令千变万化、含糊不清,提示工程的不稳定性会放大,需要大量测试和 fallback(如不确定就提问或拒绝)。(5) 实时性和延迟:调用云端 ChatGPT 有延迟,对需要实时响应的安全动作(如避开突然出现的孩子)不够快,安全关键的控制不能依赖 LLM 的慢推理。(6) 可靠性验证:论文没给量化可靠性,商用部署需要大规模测试建立可信度。核心矛盾是"LLM 的灵活性和不可预测性"与"物理安全要求的确定性"之间的张力——解决它需要把 LLM 限制在高层、用经过验证的安全底层技能兜底、并对不同风险等级的任务采取不同的自主度。

所以这一节是想说:能回答这 7 题,你就真正理解了 ChatGPT for Robotics 为什么用高层函数库、为什么强调对话和人在环、XML 标签的作用,以及它和端到端 VLA 的路线差异与部署挑战。


一些好奇心问答(FAQ)

Q1:这篇论文提出了新模型吗? 没有。它不训练任何模型,直接用现成的 ChatGPT,贡献是一套"怎么用好它做机器人"的设计原则、流程和多平台演示,外加开源工具。

Q2:核心的一招是什么? 高层函数库。不让 ChatGPT 写底层电机代码,而是给它一套命名清晰的高层函数(detect_objectmove_to 等)当积木,让它在抽象层组合逻辑。

Q3:它在真机上跑过吗? 跑过。用 ChatGPT 控制过真实的 Tello 无人机(取饮料、巡检兰花)和机械臂(积木排列、搭微软 logo),也在 AirSim 仿真里做了无人机巡检和避障。

Q4:ChatGPT 能全自动控制机器人吗? 不能。论文明确强调必须人在环——人监督输出、在仿真里验证、异常时干预。它是增强人能力的工具,不是自主系统。

Q5:PromptCraft 是什么? 一个开源的社区协作平台,研究者可以上传、投票分享针对机器人的好的(和坏的)提示策略,因为提示工程是门经验科学,需要社区积累知识。

Q6:为什么用 XML 标签? 两个用途:让程序能自动解析 ChatGPT 的输出(提取代码执行),以及规范交互结构(<question> 提问、<reason> 解释、<command> 命令分离)。

所以这一节是想说:ChatGPT for Robotics 的实操问题(没新模型、核心招数、真机验证、非全自动、PromptCraft、XML 标签)都有明确答案,核心就是"提示工程 + 高层函数库 + 人在环"这套方法。


如果你想再深入

按"必读前置 → 同类方法 → 对比 → 工具"排序:

  1. 必读前置:GPT-3 / Codex 及其机器人应用 — 理解早期 LLM 做规划/代码生成的开环局限,才懂 ChatGPT 对话闭环的价值。
  2. 同类方法:SayCan / Code as Policies — 另一批"LLM 做机器人规划/代码"工作,对照理解不同侧重。
  3. 对比路线:RT-2 / OpenVLA / 3D-VLA — 本仓库有相关笔记,端到端 VLA 路线,对照理解两条技术路线。
  4. 工具上手:PromptCraft-Robotics(GitHub)+ AirSim-ChatGPT — 论文开源的提示库和仿真工具,动手实践。
  5. 延伸思考:世界模型相关论文 — 理解"LLM 是否有隐式世界模型"这个观察背后的更大问题。

所以这一节是想说:把 GPT-3/Codex + SayCan + 本文 + VLA 连起来读,就能看清"LLM 从开环规划到对话式机器人接口再到端到端策略"的技术脉络。


原文信息

BibTeX

@article{vemprala2024chatgpt,
  title     = {ChatGPT for Robotics: Design Principles and Model Abilities},
  author    = {Vemprala, Sai and Bonatti, Rogerio and Bucker, Arthur and Kapoor, Ashish},
  journal   = {IEEE Access},
  year      = {2024},
  publisher = {IEEE}
}

链接

所以这一节是想说:这是 Vemprala et al.(微软)2023 年的工作,用"提示工程 + 高层函数库 + 对话闭环 + 人在环"证明了 ChatGPT 可以当连接自然语言和机器人控制的通用桥梁,是"LLM 作为机器人大脑"的奠基研究之一。

引用本笔记 / Cite this note
BibTeX
@online{eai_chatgpt_for_robotics_2026,
  title       = {(readable note) ChatGPT for Robotics},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/chatgpt-for-robotics/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?