Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 94

Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on

24 min read · 8446 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"没接触过毫米波雷达、点云、人体网格重建"的读者的精读笔记。语言尽量像聊天,公式全部翻译成人话。建议先读 3drimr 笔记理解毫米波成像基础。

一句话讲什么(TL;DR)

想实时知道一个人全身姿态(比如健身教练看你深蹲标不标准),传统办法要么靠摄像头(怕黑、有隐私、会被遮挡),要么靠昂贵的动捕棚。Argus 换个思路:在耳机/VR 头显左右两侧各磁吸一个指甲盖大小、7.5 克、0.35 瓦的毫米波雷达,从"第一视角(戴在头上往下看身体)"双视角感知,重建全身 3D 人体网格。它是第一个用这种"阉割版"小雷达做多视角第一视角人体网格重建的系统,平均顶点误差只有 6.5 cm,接近用大而贵的高性能雷达的方案。

所以这一节是想说:Argus 的核心就一句话——把两个耳夹式小毫米波雷达当"可穿戴动捕",双视角互补解决自遮挡,重建出媲美大雷达的全身 3D 姿态。


这是个什么场景

想象你在家跟着 App 练瑜伽,希望有个"虚拟教练"实时看你姿势对不对;或者你戴着 VR 头显,希望在元宇宙里有个跟你动作同步的 avatar。这些都需要人体姿态估计(HPE),更进一步是人体网格重建(HMR,Human Mesh Reconstruction)——不只是几个关节点,而是一整张贴合身体的 3D 网格。

怎么感知?几条路各有毛病:

  • 摄像头(RGB/深度):怕黑、怕烟雾、有隐私顾虑、容易被遮挡。
  • 可穿戴(IMU、肌电):得在全身贴一堆传感器,笨重、不友好。
  • 无线信号(Wi-Fi、超声、毫米波):非接触、不打扰。其中**毫米波(mmWave)**精度高、穿透性比 Wi-Fi 好、抗干扰比超声好,是热门方向。

但过去的毫米波人体重建几乎都是**"正面视角"**——雷达放在你前方拍你。这有先天问题:感知范围受限、别人走过会干扰(多径效应)、容易被遮挡。

有人想到换成**"第一视角(egocentric)"**——把雷达戴在身上,感知场随人移动、可控范围能避开他人干扰。第一个这么做的是 mmEgo。但 mmEgo 用的是又大又重又费电的专业雷达(IWR6843),根本没法真的戴着用;而且它单视角,解决不了"上半身挡住下半身"的自遮挡问题。

Argus 要解的题:能不能用真正小到能戴(阉割版小雷达)、又多视角(解自遮挡)的方式,做实用的第一视角全身人体网格重建?

所以这一节是想说:全身姿态感知的现有方案各有短板,毫米波第一视角有潜力但卡在"专业雷达太大"和"单视角自遮挡"上——Argus 要用可穿戴小雷达 + 双视角把它做实用。


Argus — 场景示意:这论文要解决的现实问题
Plate Nº IArgus — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:摄像头(RGB/深度)人体重建(HMR 2.0 等) 用视觉估计人体网格。类比:拍照看姿势。问题:怕黑、怕烟、隐私顾虑、被遮挡就瞎。(但 Argus 巧妙地把它当"训练时的免费标注器",见后文。)

  • 方案 B:可穿戴 IMU/肌电 全身贴传感器算姿态。问题:笨重、侵入、不友好。

  • 方案 C:正面视角毫米波 HMR(mmMesh、M4esh、SynMotion、m3Track、HUPR 等) 雷达放前方拍人。类比:一个固定的哨兵盯着你。问题:感知范围受限、他人走动的多径干扰、遮挡;而且你得待在雷达前方那块区域。

  • 方案 D:第一视角毫米波 HMR(mmEgo) 开创性地把雷达戴在头上。问题:(1) 用的是专业大雷达(IWR6843,4×4 等效天线阵,137g、1.75W),太大太重太费电,戴不了;(2) 单视角,解决不了上半身遮挡下半身的自遮挡和肩部镜面反射,它靠"把雷达伸到头前方很远"来缓解,结果更笨重、装不进耳机这种小设备。

  • 核心难题(三个)

    1. 硬件:阉割版小雷达(1 发 3 收)能力弱、还没有成熟开发套件出高质量点云,怎么设计?
    2. 标注:训练需要真值,但动捕棚(VICON、OptiTrack)又贵又占地,怎么用便宜设备拿到高质量标签?
    3. 自遮挡 + 镜面反射:第一视角下上半身挡下半身、肩膀产生镜面反射,怎么破?

所以这一节是想说:正面视角毫米波受范围/遮挡/多径所限,mmEgo 开了第一视角先河但雷达太大且单视角——Argus 要同时解掉"小雷达能力弱""标注贵""自遮挡镜面反射"这三道题。


这篇论文的新想法

类比:mmEgo 是"在头前伸一根长杆挂个大雷达",Argus 是"左右耳各夹一个纽扣大小的小雷达,像戴耳机一样自然",靠两只眼睛互补看清全身。

Argus 对三道难题各出一招:

  1. 硬件——双视角小雷达当 add-on:用一对紧凑毫米波雷达(Infineon BGT60TR13C,60GHz,仅 1 发 3 收),做成可磁吸的 add-on,贴在头显/耳机两侧(左耳、右耳)。这是第一个多视角、第一视角、可穿戴的毫米波 HMR 系统——小(3.9×2.4cm)、轻(7.5g×2)、省电(0.35W×2)。

  2. 标注——用单目 RGB 当"免费动捕":不用昂贵动捕棚,而是训练时用一个普通 RGB 摄像头 + 最新的单目人体网格估计网络 HMR 2.0,从图像估出 SMPL 参数当**伪标签(pseudo-label)**去监督毫米波模型。部署后就撤掉摄像头,只靠雷达。

  3. 自遮挡——双视角互补 + 定制信号处理 + KAN:左右耳两个视角互补,一个视角挡住的另一个可能看到。再配一套定制信号处理(能量补偿、距离门控、杂波去除、数字波束成形)和 KAN(Kolmogorov-Arnold 网络) 来高效学习高维非线性关系。

【mmEgo(单视角大雷达) vs Argus(双耳小雷达)】

mmEgo:头前伸长杆挂大雷达(IWR6843, 137g/1.75W) 单视角
        └ 自遮挡 + 肩部镜面反射难破,笨重装不进耳机

Argus:
  左耳小雷达 ┐ (BGT60TR13C, 1发3收, 7.5g/0.35W)
  右耳小雷达 ┘   双视角互补 ─▶ 解自遮挡
      │  定制信号处理(能量补偿/距离门控/杂波去除/数字波束成形)
      │  训练用 单目RGB + HMR2.0 当"免费动捕"伪标签(部署撤掉相机)
      ▼  KAN 学高维非线性关系
  第一视角全身人体网格(SMPL)

所以这一节是想说:Argus 用"双耳小雷达做多视角 + 单目 RGB 当免费标注 + 定制信号处理 + KAN"三招,把第一视角毫米波 HMR 从实验室搬进了能真戴的耳机。


它分几步做的(方法)

Argus 分训练测试两阶段。训练时用 RGB 当老师教会毫米波模型;测试时甩掉 RGB,只靠双雷达。

[训练阶段]
RGB摄像头 ──▶ HMR 2.0(ViT+解码器) ──▶ SMPL伪标签 ┐
                                                  ├─▶ 一起算损失
双雷达(左耳/右耳) ─▶ 信号处理 ─▶ 多视角点云 ─▶ DNN ─▶ 预测SMPL ┘
        (NTP时间戳对齐, 阈值20ms)

[测试阶段]
双雷达 ─▶ 信号处理 ─▶ 多视角点云 ─▶ DNN ─▶ SMPL ─▶ 连续3D网格/骨架
   (不再需要摄像头, 用户自由活动)

下面逐步拆开,每步按"输入 → 处理 → 输出"讲清楚。

5.1 硬件设计:两个耳夹式小雷达

类比:给耳机左右各别一个纽扣大小的"雷达眼"。

输入:无(这是物理设计)。

处理:每侧一块雷达板 = 一个 Microchip ATSAMS70Q21(Arm Cortex-M7 MCU)基板 + 一个 BGT60TR13C(60GHz)雷达子板,PCB 仅 17×12.7mm²。雷达是 1 发 3 收,三个收天线排成 L 形分两对(对内间距半波长),可测方位角和俯仰角。两块雷达板通过 USB 接一个 树莓派 4 做同步和传输中枢(左右两帧时间偏差控制在 10ms 内),再经 Wi-Fi/TCP 把数据实时传到手机计算。外壳 3D 打印、磁吸设计(四对磁铁的极性排布保证每次贴到同一位置、左右不会装反——装反会排斥)。传感器约在耳朵水平外 8cm,单个视场角最大 90°、最大感知距离 3.2m。

输出:一套可磁吸、轻量、低功耗的双视角毫米波采集硬件。

小结:BGT60TR13C 小雷达 + 树莓派同步 + 磁吸外壳,做出第一个真正能戴的双视角毫米波 add-on。

5.2 用单目 RGB 当"免费动捕"拿伪标签

类比:请一个"看照片就能画出 3D 人体"的 AI 当免费老师,代替昂贵的动捕棚。

输入:训练时同步录的 RGB 图像。

处理:把 RGB 图喂给 HMR 2.0——一个基于 ViT(把图像切块做自注意力)+ Transformer 解码器(交叉注意力聚焦关键区域)的单目人体网格估计网络,输出 SMPL 参数(人体姿态、朝向、体型 betas)。SMPL 是参数化人体模型,给一组参数就能生成一张 3D 人体网格。实现分辨率用 640×480(低成本相机也够)。因为 Argus 戴在头上、和用户共坐标系,不需要预测全局位置和朝向,训练时把全局朝向矩阵固定成单位阵(orientation-fixing)。

输出:每帧的 SMPL 伪标签。

小结:用 HMR 2.0 从单目 RGB 估 SMPL 当伪标签,彻底摆脱昂贵动捕棚,让系统能低成本大规模采数据。

5.3 跨模态时间对齐

类比:雷达和摄像头两个"钟"走得不一样快,得先对表再配对。

输入:毫米波帧(10Hz)、RGB 帧(30Hz),采样率不同。

处理:两招(Algorithm 1)——(1) 采集前树莓派向 NTP(网络时间协议) 服务器查时间、记本地时间,算出本地和 NTP 的偏移,把两个模态的本地时间戳都换算成 NTP 时间戳来对齐;(2) 训练时若某帧两模态 NTP 时间戳差超过阈值就丢弃;时序输入(连续 N 帧)则看平均时间差是否超阈值。本文阈值设 20ms

输出:时间精确对齐的毫米波-RGB 数据对。

小结:用 NTP 时间戳对齐 + 超阈值丢帧,把不同采样率的雷达和相机数据精确配对到 20ms 内。

5.4 信号处理:从原始回波到多视角点云

类比:把杂乱的雷达回波"洗"成一小把能反映身体运动的干净 3D 点。

输入:FMCW(调频连续波)原始回波。雷达配置:帧周期 100ms、每帧 128 个 chirp、带宽 3GHz(60–63GHz)、每 chirp 128 采样、时长 700µs。

处理:先做两次 FFT——沿采样轴的 Range FFT 得距离、沿 chirp 轴的 Doppler FFT 得速度,合成"距离-多普勒图"。然后六步四组件:

  • 能量补偿 + 距离门控(空间注意力):毫米波衰减导致下半身回波比上半身弱,点云会挤在上半身。用能量补偿(Algorithm 2,给不同距离 bin 乘不同缩放系数让能量拉平)提升下半身感知;再把距离门控成两段(0.3–0.9m、0.9–1.5m)分别估点云——这样能滤掉肩膀/肩峰(通常在 0.3m 内)的镜面反射,并单独聚焦下半身。
  • 能量+速度选点(提取有用点):在聚合的距离-多普勒图里检测超过 −3.5dB 的高能点投影到 3D;再按速度过滤,只留速度最高和最低的各若干点(本文每区域取 32),于是每个视角上/下半身各 64 点,最终 64×2 身体部位×2 视角 = 256 点/帧
  • 动目标指示 MTI + 杂波去除(动态注意力):MTI 在 Range FFT 前抑制静止杂波(如墙),去掉肩部镜面反射造成的静态密集点;杂波去除在 Range FFT 后减去各距离 bin 跨 chirp 的均值,突出人体运动。
  • 数字波束成形 DBF:用权重矩阵对每对天线的距离-多普勒图加权相移合成不同方向的波束,把点对齐到规整的角度-距离网格,减少点的随机弥散。beam 数设 31,达到 3° 角分辨率。相比 Angle FFT,DBF 在灵活性和结构规整间取平衡、且可自定义分辨率。

输出:结构规整、反映运动的多视角稀疏点云(256 点/帧)。

小结:两次 FFT 出距离-多普勒图,再用能量补偿/距离门控/选点/MTI/杂波去除/DBF 六步,把弱小雷达的回波洗成能用的多视角点云——这是补偿"阉割版雷达"的关键工程。

5.5 深度网络:多视角点云 → SMPL 参数

类比:先分别看懂左右两只"眼睛"看到的点云,再用"上半身指导下半身"的方式拼出全身。

输入:上/下半身分开的多视角点云。

处理:三大组件(42.4K 参数,能在手机上跑)——

  • PointNet++(多尺度特征提取):三层 Set Abstraction 层逐级下采样并提取局部到全局的几何特征(第一层采 128 点、半径 0.1/0.2/0.4m,第二层采 64 点、半径 0.2/0.4/0.8m,第三层聚合全局),再用 Feature Propagation 层传回原分辨率。
  • LSTM + KAN:LSTM 学相邻帧关系、平滑输出、建模时序依赖;KAN(Kolmogorov-Arnold 网络) 把深特征映射成 SMPL 所需维度。KAN 基于 Kolmogorov-Arnold 表示定理(任意多元连续函数可分解为一元连续函数的复合与求和),用更少参数更精细地逼近复杂多元函数,还能更好地解耦不同输入维度(视角、身体部位),降低复杂度、防过拟合——特别适合关节旋转这种高维非线性任务。
  • 多头注意力(融合上下半身):用上半身姿态预测当 K、V,下半身特征当 Q,让全局的上半身信息去引导下半身估计,保证上下一致。这是解自遮挡的关键——用能看清的上半身去"脑补"被遮挡的下半身。

输出:SMPL 参数(关节旋转矩阵),渲染成连续 3D 网格/骨架。

小结:PointNet++ 提几何特征、LSTM+KAN 建时序与高维映射、多头注意力用上半身引导下半身——42.4K 参数的小网络就能重建全身,还能跑在手机上。


Argus — 方法示意:核心 pipeline
Plate Nº IIArgus — 方法示意:核心 pipeline

关键数字(What works)

数字来自原文,重点看"阉割版小雷达"到底能做到什么水平。

数字 1:与 SOTA 基线对比(越低越好)

方法 V 顶点误差(cm) S 关节定位(cm) Q 关节旋转(°)
mmMesh(正面,大雷达) 9.4 8.7 9.9
mmEgo(第一视角,大雷达) 7.9 6.8 7.5
Argus (MLP) 6.9 5.3 6.6
Argus (KAN) 6.5 5.0 6.4

关键含义:Argus 用小雷达(等效 2×2 天线阵)就打败了用大雷达(等效 4×4 天线阵)的 mmMesh 和 mmEgo——V 误差降 17.7–30.9%、Q 误差降 14.7–35.4%。KAN 版比 MLP 版更好,证明 KAN 处理高维数据的优势。

数字 2:硬件对比(小到能戴)

指标 mmEgo(IWR6843) Argus(BGT60TR13C)
收发天线 3 发 4 收 1 发 3 收
板尺寸 6.8×5.5 cm 3.9×2.4 cm
重量 ~137 g ~7.5 g ×2
功耗 ~1.75 W ~0.35 W ×2
视角 单(第一视角) 多(双第一视角)

关键含义:Argus 单个雷达重量只有 mmEgo 的约 1/18、功耗约 1/5,且是双视角——这才是"能真戴"和"能解自遮挡"的物理前提。

数字 3:整体与泛化

维度 数据
数据集 16 人、10 种日常动作、每动作 2 分钟、>200,000 帧
整体平均 V=6.8cm, S=5.3cm, Q=6.6°
最难动作 侧向平衡触碰 V=7.7cm
误差相关 顶点绝对误差与身高正相关(1.90m 的参与者误差最高)
新用户微调 用 30% 新数据(约 4.2 分钟)即可达良好性能,甚至超过用户专属模型

关键含义:动作越复杂误差越大;因距离门控上限 1.5m,高个子下半身覆盖不足;新用户只需约 4.2 分钟数据微调就能用。

数字 4:计算延迟与鲁棒性

维度 数据
信号处理(Python, i7) 0.880 s
模型推理 11.6 ms
SMPL 渲染 1.5 ms
总延迟 0.89 s(估计换 C + 硬件加速可降到 <80ms,约 10× 加速)
图像分辨率 640×480→320×240 仅小幅下降(对分辨率鲁棒)
换宿主设备(耳机→VR) V/S 仅升约 3%/5.7%
衣物 羽绒服等大反射面会加剧自遮挡与镜面反射,误差明显上升

关键含义:当前瓶颈是 Python 信号处理慢(0.88s),但模型本身很快(11.6ms);对分辨率、背景、宿主设备鲁棒,但怕大反射面衣物。

所以这一节是想说:数字证明——小雷达做到了媲美甚至超过大雷达的精度、硬件真的能戴、泛化到新用户只需几分钟、模型本身够快,唯一现实瓶颈是 Python 信号处理速度。


实验结果说明了什么

问题一:阉割版小雷达真的能媲美大雷达吗? 能。Argus 用等效 2×2 天线阵的小雷达,V 误差 6.5cm,打败了用等效 4×4 天线阵大雷达的 mmMesh(9.4)和 mmEgo(7.9)。这说明巧妙的信号处理 + 网络设计能补偿硬件能力的不足——能量补偿救回下半身、距离门控除镜面反射、DBF 提角分辨率、双视角解自遮挡,合起来把小雷达的短板补上了。虽然仍不及 mmEgo 原论文用超高性能雷达的成绩,但那是完全不同量级的硬件。

问题二:双视角到底解决了什么? 自遮挡和肩部镜面反射。单视角(mmEgo)下上半身挡住下半身,它只能靠"把雷达伸到头前方很远"硬解,结果笨重。Argus 用左右耳双视角互补——一侧挡住的另一侧可能看到,再加多头注意力用上半身引导下半身,从原理上解决了自遮挡。消融也证明 KAN 比 MLP 好,说明高维多视角融合确实需要更强的函数逼近能力。

问题三:不用动捕棚,用 RGB 伪标签会不会不准? 够用。用 HMR 2.0 从单目 RGB 估 SMPL 当伪标签,对图像分辨率鲁棒(640×480 降到 320×240 只小幅下降),对背景也鲁棒。这大幅降低了部署门槛——普通网络摄像头就能采训练数据,摆脱了昂贵、占地的动捕系统。这是"实用性"的关键一步。

问题四:换个人能直接用吗? 需要少量微调。直接测未见用户有差距,但用该用户 30%(约 4.2 分钟)的数据微调,性能就很好,甚至因多用户训练带来的泛化而超过用户专属模型。这提示实际部署时新用户只需几分钟"注册"。

所以这一节是想说:实验回答了四个问题——信号处理+网络能补硬件短板、双视角解自遮挡、RGB 伪标签够用且省钱、新用户几分钟微调即可用。


你应该懂的几个新词

人体网格重建(HMR):不只估几个关节点,而是重建一整张贴合身体的 3D 网格(比 HPE 更细)。Argus 的目标。

SMPL:参数化人体模型,给一组参数(姿态、朝向、体型 betas)就能生成一张 3D 人体网格。HMR 的标准输出。

第一视角 / 正面视角(egocentric / frontal):传感器戴在身上往下看 vs 放在前方拍你。第一视角感知场随人移动、避他人干扰。

毫米波雷达(mmWave radar):用 60GHz 附近的电磁波感知,非接触、精度高、不受光照影响。

FMCW(调频连续波):毫米波雷达常用波形,通过发射频率线性变化的连续波、混频回波来测距离和速度。

距离-多普勒图(range-Doppler map):两次 FFT 后得到的图,每个格子表示某距离、某速度上的反射能量。

自遮挡 + 镜面反射:第一视角下上半身挡下半身(自遮挡)、肩膀像镜子反射毫米波(镜面反射)——本文两大难题。

距离门控(range-gating):只保留特定距离段的回波(如 0.3–0.9m、0.9–1.5m),用来除近处肩部镜面反射、分段聚焦。

数字波束成形(DBF):用权重给各天线信号加权相移,合成指向不同方向的波束,提升角分辨率、规整点云。

PointNet++:经典点云网络,用多尺度分组提取局部到全局的几何特征。Argus 的点云特征提取器。

KAN(Kolmogorov-Arnold 网络):基于 KA 表示定理的新型网络,用更少参数逼近复杂多元函数、更好解耦维度。Argus 用它做高维映射。

伪标签(pseudo-label):不用人工/动捕真值,而用另一个模型(这里是 HMR 2.0 看 RGB)估出的标签来监督训练。

所以这一节是想说:这些词是读任何"毫米波 + 人体感知 + 点云"论文都会反复出现的基础词汇。


它有什么搞不定的

  • 感知不到耳朵水平以上的动作:硬件戴在头两侧、朝下看,举手过头这类动作检测不到(论文明确列出的局限)。加朝向不同的额外传感器可补盲区。
  • 高个子下半身覆盖不足:距离门控上限 1.5m,身高 1.90m 的参与者下半身超出范围,误差最高。误差与身高正相关。
  • 怕大反射面衣物:羽绒服等大反射表面会加剧自遮挡和镜面反射,导致关节旋转和位置估计误差大增。
  • 信号处理慢(当前):Python 信号处理 0.88s/帧,达不到实时。需改写成 C + 硬件加速才能到 <80ms(论文只是"估计"能做到,未实现)。
  • 仍是原型硬件:靠树莓派当中转,不够紧凑。未来需专用 PCB。
  • 需要少量个性化微调:新用户直接用有差距,需约 4.2 分钟数据微调——不是完全即戴即用。

所以这一节是想说:Argus 证明了可穿戴小雷达做全身 HMR 的可行性,但头上盲区、高个子覆盖、反射衣物、Python 信号处理速度、原型硬件、需微调这些问题仍待解。


它和别的论文是什么关系

  • 上游(被它借用)
    • mmMesh(Xue et al. 2021):第一个商用毫米波 HMR,正面视角,是 Argus 的对比基线和思想源头。
    • mmEgo(Li et al. 2023):第一个第一视角毫米波 HMR,Argus 的直接前身与主要对比对象(Argus 把它做小、做多视角)。
    • HMR 2.0(Goel et al. 2023):单目 RGB 人体网格估计,Argus 拿它当"免费动捕"出伪标签。
    • PointNet++(Qi et al. 2017):点云特征提取骨干。
    • KAN(Liu et al. 2024):新型网络,Argus 用它做高维映射。
    • SMPL / MTI / DBF:人体模型、动目标指示、数字波束成形的经典方法。
  • 对比关系
    • mmMesh / M4esh / SynMotion / HUPR / SUPER:那些是正面视角,受范围/遮挡/多径限制;Argus 是可穿戴第一视角。
    • mmEgo:都是第一视角,但 mmEgo 单视角+大雷达,Argus 双视角+小雷达。
  • 下游 / 同族:Argus 属于"毫米波无线感知"这条线,和本仓库的 3drimr(毫米波 3D 重建)同族——都在用毫米波+深度学习从稀疏点云重建 3D,但 Argus 专攻可穿戴人体网格。它也和耳戴感知(earable sensing)研究交叉。

所以这一节是想说:Argus 站在 mmMesh/mmEgo + HMR 2.0 + PointNet++ + KAN 的肩膀上,把第一视角毫米波 HMR 从"大雷达单视角"推进到"小雷达可穿戴多视角",是毫米波人体感知走向实用的一步。


和本导读的关系

本笔记对应导读 Ch19:射频感知

导读 Ch19 讲了用射频信号(Wi-Fi、毫米波等)做人体感知的思路:射频非接触、不怕黑、保护隐私,但信号稀疏、噪声大,需要巧妙的信号处理 + 深度学习。Argus 是这条线上"可穿戴 + 多视角 + 人体网格"的一个前沿代表。读完本笔记,建议:对照 3drimr 深读笔记(同样是毫米波 + 深度学习,但目标是重建物体/场景而非人体),能看清"毫米波成像/重建"这一大类的共同套路——都要经过 FMCW→FFT→点云→深度网络,都要跟稀疏、噪声、遮挡搏斗。两篇连起来,就能理解毫米波感知从"看物体"到"看人"的技术脉络。

所以这一节是想说:本笔记是导读 Ch19 射频感知在"可穿戴人体网格"方向的深度展开,和 3drimr 对照能看清毫米波重建的共同套路。


思考题

以下问题检验你是否真正理解了 Argus 的设计逻辑。建议先自己想 30 秒再展开提示。

Q1:Argus 用能力弱得多的"阉割版"小雷达(1 发 3 收),却打败了用大雷达(3 发 4 收)的基线。这怎么可能?靠什么补上了硬件短板?

提示

靠"多视角 + 定制信号处理 + 网络设计"的合力补硬件。具体:(1) 双视角互补解决了单视角解不了的自遮挡——这是大雷达单视角也没有的优势;(2) 能量补偿救回被衰减淹没的下半身回波;(3) 距离门控滤掉肩部镜面反射;(4) DBF 提升角分辨率到 3°、规整点云;(5) KAN 用更少参数更好地逼近高维非线性映射。这说明"系统级设计"能补偿"器件级能力"的不足——硬件差的地方用算法和多视角补回来。这是嵌入式感知领域很典型的思路。

Q2:为什么 Argus 要用两个视角(左耳+右耳),而不是像 mmEgo 那样用一个更好的单视角?

提示

因为第一视角有个单视角无解的物理难题:自遮挡。雷达戴在头上往下看,上半身(胸、手臂)会挡住下半身(腿),单个视角看不到被挡的部分。mmEgo 的"解法"是把雷达伸到头前方很远,绕开遮挡,但这让设备变得笨重、装不进耳机。Argus 用左右耳双视角——左边挡住的部分右边可能看得到,两个互补视角合起来覆盖更全。再配合多头注意力用能看清的上半身去引导下半身估计,就从原理上解决了自遮挡。而且双视角还能缓解肩部镜面反射。所以双视角不是为了"看得更清",而是为了"看得更全"。

Q3:训练时 Argus 用单目 RGB + HMR 2.0 当"免费动捕"出伪标签,而不用昂贵的动捕棚。这个选择的意义和风险各是什么?

提示

意义(大):动捕棚(VICON、OptiTrack)又贵又占地,普通人根本没有,这是毫米波 HMR 难以推广的一大障碍。用普通 RGB 摄像头 + HMR 2.0 就能出训练标签,把部署门槛降到"一个网络摄像头",这对系统的实用性和可推广性是决定性的。风险:伪标签本身有误差(HMR 2.0 也会估错),相当于用"老师的近似答案"教学生,学生精度上限受老师限制;RGB 怕黑、被遮挡、隐私——但注意这些只在训练阶段有影响,部署后就只用雷达了。论文实验证明对图像分辨率和背景都鲁棒,说明伪标签方案实际够用。这是"用便利性换一点精度上限"的务实权衡。

Q4:信号处理里为什么要做"能量补偿"?不做会怎样?

提示

因为毫米波信号在传播中会衰减,距离越远能量越弱。雷达戴在头上,下半身(腿脚)离雷达比上半身(胸)远,回波能量显著更弱。如果不补偿,直接从距离-多普勒图里按能量高低选点,选出的点就会全挤在上半身,下半身几乎没点——网络就"看不到"腿,没法重建下半身。能量补偿(给不同距离 bin 乘不同缩放系数)把远近的能量拉平,让下半身也能被检测到,相当于提升了对下半身的"空间注意力"。这是第一视角特有的问题(正面视角上下半身离雷达差不多远,就没这么严重)。

Q5:Argus 用多头注意力时,特意把"上半身预测当 K/V、下半身特征当 Q"。为什么是这个方向,反过来行不行?

提示

这个方向体现了"信息层级"——用可靠的去引导不可靠的。上半身离雷达近、遮挡少,检测更可靠、信息更全;下半身远、被上半身遮挡,检测更不可靠。注意力机制里,Q(Query)是"提问方",K/V(Key/Value)是"知识库"。让下半身当 Q 去查询上半身这个"知识库",意思是"下半身拿着自己不确定的特征,去可靠的上半身信息里找线索来修正自己"。反过来(上半身当 Q 查下半身)就是让可靠的去问不可靠的,等于用噪声大的信息污染可靠的预测,会更差。所以方向的选择反映了对"哪部分信息更可信"的判断——这是解自遮挡的巧妙设计。

Q6:论文报告 Python 信号处理要 0.88s/帧,但声称"改成 C 能到 <80ms"。这个声称可信吗?作为读者你该怎么看待这类"未实现的估计"?

提示

要审慎看待。可信的部分:论文的估计有依据——它引用 mmMesh 用 C 处理 AWR1843 原始信号到点云只要 28ms,并据此推断约 10× 加速(Python→C 的典型加速幅度)。所以"数量级上能大幅加速"是合理的。但需保留:(1) 这是估计不是实测,实际实现可能遇到工程障碍(BGT60TR13C 缺成熟 C 开发套件正是他们用 Python 的原因);(2) 80ms 是"算法延迟",端到端还要算数据传输等;(3) 具体能否达到实时(<100ms/帧)取决于硬件加速的可得性。作为读者,应把它当"有依据的乐观预期"而非"已验证的事实"——这也提醒我们读论文时要区分"做到了"和"估计能做到"。

Q7:Argus 感知不到耳朵水平以上的动作(如举手过头),且怕大反射面衣物。如果让你改进硬件/算法来缓解这些问题,你会怎么做?

提示

针对头上盲区:论文自己提到可加朝向不同的额外传感器覆盖盲区——比如在头顶或肩部再加一个朝上的小雷达,或用更大视场角的雷达。代价是增加设备复杂度、功耗、和多传感器同步/融合的难度。针对反射衣物:可以在信号处理里加更强的镜面反射抑制(如基于反射面几何的建模);或在训练数据里加入多种衣物增强鲁棒性(数据增强);或用多视角进一步互补(一个视角被反射干扰,另一个可能没有);也可考虑融合其他模态(如 IMU)在雷达失效时兜底。针对硬件:论文提到新出的 BGT60ATR24C(2 发 4 收)能力更强,换更好的雷达能直接提升。核心权衡都是"性能/覆盖 vs 尺寸/功耗/复杂度"——这正是可穿戴系统的永恒矛盾。

所以这一节是想说:能回答这 7 题,你就真正理解了 Argus 为什么用双视角、用 RGB 伪标签、做能量补偿、用上半身引导下半身,以及可穿戴毫米波系统的核心权衡。


一些好奇心问答(FAQ)

Q1:Argus 到底戴在哪、多大? 磁吸在耳机/VR 头显左右两侧(约耳朵外 8cm)。每个雷达板 3.9×2.4cm、约 7.5g、0.35W——纽扣大小,几乎无感。

Q2:它能实时用吗? 模型本身很快(推理 11.6ms + 渲染 1.5ms)。但当前 Python 信号处理慢(0.88s/帧),总延迟 0.89s,还达不到实时。论文估计改 C + 硬件加速能到 <80ms。

Q3:为什么不直接用摄像头做,非要用雷达? 摄像头怕黑、怕烟、有隐私顾虑、被遮挡就瞎。毫米波不受光照影响、保护隐私、可穿戴随身。Argus 只在训练时用摄像头当"免费老师",部署后就撤掉。

Q4:换个人用要重新训练吗? 不用从头训。用新用户约 4.2 分钟(30% 数据)微调基础模型就能达良好性能,甚至超过纯用户专属模型(因为基础模型有多用户泛化)。

Q5:256 个点够重建全身网格吗? 够。每帧 64×2 身体部位×2 视角 = 256 点,虽稀疏但经能量补偿、选点、DBF 后信息集中在运动部位,配合 PointNet++ + 时序 LSTM,足以重建 V 误差 6.5cm 的网格。

Q6:KAN 是什么、为什么用它? KAN 是基于 Kolmogorov-Arnold 定理的新型网络,能用更少参数逼近复杂多元函数、更好解耦不同维度(视角、身体部位)。关节旋转是高维非线性任务,KAN 比 MLP 更合适——实验也显示 KAN 版全面优于 MLP 版。

所以这一节是想说:Argus 的实操问题(戴哪、多大、能否实时、为何用雷达、换人、点数、KAN)都有明确答案。


如果你想再深入

按"前身 → 标注器 → 组件 → 同族"排序:

  1. 直接前身:mmEgo(Li et al. 2023, SenSys) — 第一个第一视角毫米波 HMR,理解 Argus 改进了什么(小型化 + 多视角)。
  2. 正面视角基线:mmMesh(Xue et al. 2021) — 第一个商用毫米波 HMR,理解正面视角的套路和局限。
  3. 标注器:HMR 2.0(Goel et al. 2023) — 单目 RGB 人体网格估计,理解伪标签怎么来。
  4. 点云骨干:PointNet++(Qi et al. 2017) — 点云特征提取的经典。
  5. 新组件:KAN(Liu et al. 2024) — 理解为什么它适合高维非线性任务。
  6. 同族对照:3drimr — 毫米波 3D 重建,本仓库有深读笔记,对照理解毫米波成像的共同套路。

所以这一节是想说:把 mmEgo + mmMesh + HMR 2.0 + 3drimr 连起来读,就能看清毫米波人体/物体重建的完整技术脉络。


原文信息

BibTeX

@inproceedings{duan2024argus,
  title     = {Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on},
  author    = {Duan, Di and Lyu, Shengzhe and Yuan, Mu and Xue, Hongfei and Li, Tianxing and Xu, Weitao and Wu, Kaishun and Xing, Guoliang},
  booktitle = {Proceedings of the ACM Conference on Embedded Networked Sensor Systems (SenSys)},
  year      = {2024}
}

链接

所以这一节是想说:这是 Duan et al. 2024 年发表在 SenSys 的工作,用"双耳阉割版小雷达 + 单目 RGB 伪标签 + 定制信号处理 + KAN",第一次把第一视角毫米波全身网格重建做成能真戴的可穿戴系统。

引用本笔记 / Cite this note
BibTeX
@online{eai_argus_mmego_2026,
  title       = {(readable note) Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/argus-mmego/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?