Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 95

Diffusion Model is a Good Pose Estimator from 3D RF-Vision

25 min read · 8603 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话,术语第一次出现必定义 + 类比。

一句话讲什么(TL;DR)

毫米波雷达拍出的人像像隔了层毛玻璃、还在闪。mmDiff 让 AI 从一团噪点出发、以雷达信号为参照,一步步"擦"出稳定又符合人体常识的 3D 骨架,比"一口气猜"准得多、稳得多。CVPR 2024 收录,是第一个用扩散模型做毫米波雷达人体姿态估计的工作。

所以这一节是想说:这篇论文把人体姿态估计从"一步回归"重写成"多步去噪的条件生成",并针对雷达点云的稀疏、噪声、缺检问题设计了四路条件,专门为难缠的雷达数据量身定做。


这是个什么场景

想象凌晨三点,独居老人在卫生间摔倒了。你想做一个"自动报警的看护系统"——但摄像头放卫生间太尴尬、老人也不愿意贴一身手环、断电或黑灯时摄像头也瞎。

毫米波雷达就是为这种"不方便用摄像头"的场景准备的:黑灯瞎火、浓烟弥漫、要保护隐私(雷达只看得到形状轮廓,看不到脸)的地方都能用。它工作在 30–300 GHz 频段,发射并接收射频信号,通过信号变化提取出目标的点云(point cloud,一组带 3D 坐标的散点)。但代价是——雷达拍出来的人像像戴了副毛玻璃眼镜

  • 看得到一团晃动的影子(点云稀疏、低分辨率,整个人只有几十到几百个 3D 点)
  • 影子还在闪、在漂(多径效应产生"鬼点",信号镜面反射与干扰导致人体某些部位偶尔"整块消失")
  • 而你脑子里其实清楚"人长什么样"(胳膊分两节、膝盖不会反弯、身高相对固定、动作是连续的)

过去的做法是从这团模糊影子一口气猜出骨架坐标——一锤子买卖,猜错了就错了,而且相邻帧之间的预测会跳变、抖动,人体尺寸还会忽大忽小。

mmDiff 换了个思路,更像画家临摹:先在画布上铺一层随机噪声,再对着"模糊影子"一笔一笔擦出人形,每一笔都参考雷达信号,还随时用"人体常识"校正。最后画出来的骨架既贴合观测,又符合解剖学与运动学。

为什么用扩散模型特别合适?因为雷达观测本身就是"加了噪声的真相"——扩散模型天生干的就是"去噪"这件事,物理结构天然对味。

所以这一节是想说:mmDiff 面对的场景是"用隐私友好但极其模糊的毫米波雷达估计人体骨架",它选择扩散模型的根本原因,是雷达数据的"含噪"本质与扩散的"去噪"本领天然匹配。


Diffusion Model is a Good Pose Estimator from 3D RF-Vision — 场景示意:这论文要解决的现实问题
Plate Nº IDiffusion Model is a Good Pose Estimator from 3D RF-Vision — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:直接回归(mmMesh、P4Transformer、mmPose 等) 类比:瞄一眼模糊影子就报出所有关节坐标。用 CNN / PointNet / Transformer 吃点云,直接输出关节 3D 坐标。问题:点云一稀疏就抖,帧与帧之间预测不连续,遇到部位缺检直接崩。

  • 方案 B:时序滤波类 类比:给抖动的视频做防抖。在回归之上加 LSTM / Transformer 平滑帧间预测。问题:能压住抖动,但压不掉结构错误(比如手臂长度突然变化、身高忽高忽低)。

  • 方案 C:多模态融合类 类比:雷达看不清就叫上摄像头和惯性计一起看。雷达 + IMU + 摄像头联合训练。问题:部署时这些额外传感器不一定都有,雷达单模态本身仍然弱。

  • 方案 D:基于图模型的优化 类比:把骨架当成一张固定拓扑的网,硬套上去。用图神经网络强制人体拓扑约束。问题:图先验是硬编码的,对没见过的姿态泛化差。

  • 方案 E:早期生成式方法(VAE / GAN) 类比:让模型"编"一个合理骨架。试过 VAE / GAN,但模式坍塌或训练不稳,没成主流。

  • 一个关键对照:RGB 上的扩散姿态估计(DiffPose 等) DiffPose 把扩散用在 RGB 图像或已经相对可靠的 2D 关键点上做"精修"。但它面对的是信息相对充分的模态;毫米波雷达面对的是根本性的观测残缺(稀疏 + 缺检)。把 DiffPose 直接搬到雷达上不够用。

  • 共同痛点:雷达点云的低分辨率 + 高噪声 + 偶发缺检,让"一步预测"很难同时满足"贴合观测"和"解剖学/运动学合理"两个目标。

所以这一节是想说:之前的方法要么一步回归(抖、缺检就崩)、要么后处理平滑(压不掉结构错误)、要么依赖额外传感器;即便是 RGB 上的扩散精修也不适配雷达的根本性残缺——留了一个"专为雷达设计的扩散姿态估计"的空位。


这篇论文的新想法

核心洞察:从雷达估计姿态,本质是一个条件生成问题,不是一个回归问题。

  • 雷达点云不是骨架的精确测量,而是一组强先验提示(noisy guidance)。
  • 真值骨架可以看作"从雷达点云所对应的条件分布里采样出来的一个合理样本"。
  • 那么扩散模型——一个天生擅长条件生成、且擅长渐进去噪的工具——就该是首选。

mmDiff 的设计哲学分三层:

  1. 正向过程:把真值骨架逐步加噪,直到变成纯高斯噪声。
  2. 反向过程:从随机噪声出发,每一步都以雷达提取的特征为条件去噪,最终得到骨架。
  3. 多重条件分而治之:不止用一路条件,而是针对雷达的两大顽疾——"部位缺检"和"信号不一致"——设计了四路互补条件。这四路正是本文相对通用扩散姿态估计(如 DiffPose)的最大区别。

这个设计的"巧"在于:扩散模型每一步只解决一个问题(去掉一点点噪声),而不是一锤子干完整个估计。它天然地把困难任务摊成多步,每一步都有雷达信号和人体先验当锚点,把"稀疏残缺观测"这个难题一点点消化掉。

所以这一节是想说:mmDiff 的新想法是"把姿态估计当条件生成来做",并用四路专门对付雷达顽疾的条件去引导扩散——这是它区别于一般扩散姿态估计、专为雷达定制的核心。


它分几步做的(方法)

mmDiff 的方法可拆成五块:扩散主框架、四路条件里的两路"雷达上下文"(GRC 全局 + LRC 局部)、两路"人体先验一致性"(SLC 肢长 + TMC 运动)、点云骨干网络当翻译官、以及训练与推理配置。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。

先看整体架构图:

 真值骨架 x0 ──(前向加噪 K 步)──► 纯噪声 xK
                                     │
        雷达点云 R                    │  反向去噪(每步都看四路条件 c)
        │                            ▼
   ┌────┴───────────────┐    ┌──────────────────────────────┐
   │ 点云骨干(翻译官)     │    │  去噪网络 εθ(x_k, k, c)        │
   │ Point4D / PointTrans│    │  预测这一步该减掉多少噪声       │
   └────┬───────────────┘    └──────────────┬───────────────┘
        │  提取四路条件 c                     │  x_{k-1}
        ▼                                    ▼
  ┌───────────────────────────────┐   迭代到 x0 = 干净骨架 (J×3)
  │ GRC 全局雷达上下文(治缺检)      │
  │ LRC 局部雷达上下文(治细节定位)  │
  │ SLC 肢长一致性(治尺寸忽大忽小)  │
  │ TMC 时序运动一致性(治帧间抖动)  │
  └───────────────────────────────┘

5.1 扩散主框架:像橡皮擦一样反向擦

类比:老师故意往一张写着 J 个关节坐标的便签上一层层泼噪声,直到全是雪花点;再教学生怎么一层层擦干净。部署时反过来:给一张全是雪花的便签,让学生一步步擦回干净骨架。

等等,先慢一拍——扩散模型(diffusion model) 说白了就是这套"先加噪、再学着去噪"的把戏。它的标准数学版本叫 DDPM(Denoising Diffusion Probabilistic Model,去噪扩散概率模型)

机制(输入→处理→输出)

  • 输入:训练时是真值骨架 $x_0$,被参数化为 $J \times 3$ 的张量(J 个关节、每个 3D 坐标)。
  • 处理:前向加噪按标准 DDPM 公式 $x_t = \sqrt{\bar\alpha_t},x_0 + \sqrt{1-\bar\alpha_t},\epsilon$。人话:"含噪骨架 = 缩小一点的真骨架 + 一份随机噪声",$\bar\alpha_t$ 控制缩多少。反向时,去噪网络 $\epsilon_\theta(x_t, t, c)$ 学着预测"这一步加进去的噪声长什么样",其中 $c$ 是从雷达提取的条件。
  • 输出:从纯噪声出发,反复"猜噪声 → 减噪声",最终得到干净骨架。

加噪与去噪的链条可以画成一条对称的流水线:

 前向(训练时故意加噪):
   x0(真骨架) ──►x1──►x2──► ... ──► xK(纯高斯噪声)
   干净                                全是雪花

 反向(推理时逐步擦净,每步看四路条件 c):
   xK ──►x_{K-1}──► ... ──►x1──► x0(估计骨架)
        │每步:εθ(x_k,k,c) 预测噪声→减掉
        └── c = {GRC, LRC, SLC, TMC}(雷达+人体先验)

为什么有用:把一次性的困难预测摊成多步小修正,每步都可控、可被条件引导。这正是扩散相对一步回归在"稀疏残缺观测"下更稳的根源。

5.2 GRC 全局雷达上下文:治"部位缺检"

类比:导演先定基调"这场是跳舞还是打架",哪怕某个演员暂时被挡住,整体调度也不会乱。

机制(输入→处理→输出)

  • 输入:整段/整帧雷达点云。
  • 处理:GRC(Global Radar Context,全局雷达上下文)用一个 Transformer 提取全局特征,但关键设计是——为每个人体关节隔离出各自的全局特征(joint-wise features)。这样即便某个部位偶尔缺检(雷达没打到手臂),其他检测到的关节的特征提取不受牵连。论文对比过"直接用整体点云特征当条件",发现那样容易被缺检带偏,而按关节隔离的特征更鲁棒。
  • 输出:一组按关节组织、抗缺检的全局条件特征。

为什么有用:直接针对雷达第一大顽疾——人体某部位整块消失。隔离让"一个关节丢了"不会污染"其他关节"的判断。

5.3 LRC 局部雷达上下文:治"细节定位"

类比:化妆师凑近看每一只手,只盯这只手周围的点。

机制(输入→处理→输出)

  • 输入:每个关节附近的局部点云。
  • 处理:LRC(Local Radar Context,局部雷达上下文)用一个局部 Transformer 在关节邻域做点级注意力。它用动态锚点(dynamic anchors)选取每个关节周围的点——比论文对比的"用粗估计姿态当静态锚点"的方案更适合扩散式的逐步细化。局部特征分辨率更高,告诉去噪器"这只手周围的点具体长这样"。
  • 输出:每个关节的高分辨率局部条件特征。
  • 注意:在 mm-Fi 数据集上,因为点太少(每帧点数 N < 100),LRC 被略去——点不够时局部邻域没意义。

为什么有用:全局定基调、局部抠细节,两者互补,把稀疏点云里能榨出的空间信息榨干。

5.4 SLC 肢长一致性 + TMC 运动一致性:注入"人体常识"

类比:SLC 像量体裁衣的裁缝——"这个人的前臂就这么长,不会一帧变长一帧变短";TMC 像剪辑师——"人的动作是连贯的,不会瞬间从站变躺"。

机制(输入→处理→输出)

  • SLC(Structural Limb-length Consistency,结构肢长一致性):额外估计人体各肢段长度并施加约束。因为人体有硬约束——肢长应保持恒定。这直接压住"人体尺寸忽大忽小"的结构错误。权重 $\lambda = 5$。
  • TMC(Temporal Motion Consistency,时序运动一致性):把相邻若干历史帧的估计姿态当条件,逼当前生成平滑连续。灵感来自"人的运动是连续的、不会突变"。时间窗 $\Delta t = 8$。
  • 输出:两路"人体先验"条件,一路管空间结构合理、一路管时间运动连贯。

为什么有用:直接针对雷达第二大顽疾——信号不一致导致的结构变形与帧间抖动。消融显示,去掉肢长模块(SLC)和时序运动模块(TMC)时性能掉得最狠,因为姿态不稳会直接拉低精度。

5.5 点云骨干与训练/推理配置

类比:那四路"条件"不是凭空来的,得先有个翻译官把一堆 3D 点翻译成特征。

机制

  • 骨干(翻译官):mmBody 上用 Point4D(P4Transformer 的点云编码器)当 GRC 的点云编码器;mm-Fi 上用 PointTransformer(专为更稀疏点云设计)。骨干把点云翻译成"每点特征 + 整体特征",再分发给各条件分支。
  • 训练配置:100 个 epoch,batch size 1024,Adam 优化器,学习率 $2\times10^{-5}$,梯度裁剪 1.0。前向/反向扩散步数 $K = 25$,采用常数 $\beta = 0.001$。为与非扩散方法公平比较,推理时平均 5 个采样假设(hypotheses)。LRC 的 KNN 邻居数 $\bar K = 50$。
  • 推理:从高斯噪声出发跑 K=25 步反向去噪得到骨架。

为什么有用:K=25 步是个务实选择——比图像扩散动辄几百上千步少得多,因为骨架维度极低(J×3,才几十个数),去噪收敛快,适配对延迟敏感的实时感知场景。论文的效率分析显示,四个条件模块每个延迟都 < 2ms,去噪主干仅 1.03M 参数、0.03 GFLOPs,远轻于 P4Transformer 的 128M 参数、43.5 GFLOPs。

所以这一节是想说:mmDiff 的方法 = DDPM 主框架 + 四路专治雷达顽疾的条件(GRC 治缺检、LRC 抠细节、SLC 稳尺寸、TMC 稳运动)+ 点云骨干翻译官,且用极低维骨架让 25 步去噪就能实时,四路条件"全局-局部-结构-时序"分而治之是全文精髓。


Diffusion Model is a Good Pose Estimator from 3D RF-Vision — 方法示意:核心 pipeline
Plate Nº IIDiffusion Model is a Good Pose Estimator from 3D RF-Vision — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"每一路条件到底贡献了多少、扩散相比回归赢在哪"。以下数字来自原文表格;未报告的标"原文未报告"。评价指标是 MPJPE(平均每关节位置误差,mm,越低越好)和 PA-MPJPE(去掉全局旋转平移缩放后的误差)。

数字 1:mmBody 上全面超过 SOTA 回归基线

对比对象 mmDiff 的提升(MPJPE / PA-MPJPE)
P4Transformer(mmWave SOTA) +12.8% / +11.3%
P4Transformer(仅恶劣环境) +14.7% / +12.0%
DiffPose / PoseFormer(3D 精修 SOTA) +6.6% / +4.2%
关键含义 全面超越;恶劣环境(雨、烟、暗、遮挡)提升更大,正是雷达优势场景

数字 2:mmBody 平均 MPJPE 逐模块下降

配置 平均 MPJPE 平均 PA-MPJPE
P4Transformer(回归基线) 78.10 60.56
纯扩散(无雷达条件) 73.31 58.23
+ GRC(G) 70.99 55.80
+ LRC(G,L) 69.79 55.04
+ TMC(G,L,T) 69.16 ~53.96
完整 mmDiff(G,L,T,S) 68.08 53.71
关键含义 每加一路条件都在降误差,四路叠加最优

数字 3:mm-Fi 上的泛化

维度 数据
vs PointTransformer 基线 MPJPE 降低 6.29%–13.61%,PA-MPJPE 降低 7.15%–14.42%
vs 原版 DiffPose 精修 再改善 4.19%–11.14%(MPJPE)
数据划分 random / cross-subject / cross-environment 三种
关键含义 跨被试、跨环境都稳,说明学到的是可迁移的人体结构/运动规律

数字 4:消融——两组条件各自的贡献

模块组 MPJPE 增益 PA-MPJPE 增益
全局-局部雷达上下文(GRC+LRC) +4.8% +5.5%
结构-运动一致性(SLC+TMC) +5.3% +6.1%
关键含义 两组贡献相当;去掉肢长(SLC)/时序(TMC)掉得最狠

数字 5:效率——模块极轻,适合边缘

组件 延迟 参数量 GFLOPs
P4Transformer(对照) 40.48 ms 128.00M 43.50
去噪主干(D) 7.59 ms 1.03M 0.03
全局上下文(G) 0.36 ms 0.02M 0.01
局部上下文(L) 2.00 ms 0.19M 0.40
关键含义 每个新增模块 < 2ms,去噪主干极轻,指向机器人/IoT/边缘计算

数字 6:关键超参

超参 取值
扩散步数 K 25
常数 β 0.001
采样假设数 5(取平均)
时序窗 Δt(TMC) 8
肢长权重 λ(SLC) 5
KNN 邻居 K̄(LRC) 50

所以这一节是想说:最硬的结论是"每加一路条件都降误差、恶劣环境提升最大、模块极轻可上边缘"——数字证明四路条件不是堆砌,而是各有专攻、缺一不可。


实验结果说明了什么

上一节列数字,这一节回答实验背后的科学问题。

问题一:扩散相比一步回归,在雷达上到底赢在哪? 赢在把"稀疏残缺观测下的一次性猜测"变成"多步、可被条件引导的渐进细化"。纯扩散(还没加任何雷达条件)就已经把 P4Transformer 的 78.10 MPJPE 降到 73.31——仅靠"建模姿态分布 + 逐步精修变形的粗姿态"就有增益。这说明扩散的多步去噪框架本身对含噪观测就有天然优势。

问题二:四路条件是真有用,还是华丽的堆砌? 真有用,且各有专攻。消融显示每加一路误差都下降:GRC 治缺检、LRC 抠细节、SLC 稳尺寸、TMC 稳抖动。两组(雷达上下文 vs 人体一致性)贡献相当(约 5% 量级)。去掉肢长和时序模块掉得最惨——印证了"雷达顽疾的核心是不稳定",而这两路正是专治不稳定的。

问题三:恶劣环境下的表现,是不是雷达真正的价值所在? 是。在雨、烟、暗、遮挡等恶劣场景,mmDiff 对 P4Transformer 的提升(14.7%)比常规场景(12.8%)更大。原因是恶劣环境让信号更噪,而 mmDiff 的去噪 + 条件引导正是为对付噪声设计的。这恰恰击中雷达"抗恶劣环境"的核心卖点——摄像头在这些场景直接失效,雷达 + mmDiff 才有意义。

问题四:它学到的是"死记这批人"还是"通用的人体规律"? 偏后者。mm-Fi 的 cross-subject(换人)划分下成绩与 random 划分接近,说明模型显式学到的人体结构约束(肢长恒定)和运动连续性能泛化到没见过的被试。这是 SLC/TMC 注入人体先验带来的额外好处——不是记住训练集,而是学到人之所以为人的物理规律。

问题五:这么多模块,会不会重到没法实时? 不会。四路条件模块每个延迟 < 2ms,去噪主干仅 1.03M 参数、0.03 GFLOPs,比 P4Transformer 轻两个数量级。K=25 步的低维骨架去噪很快。作者据此点明潜在应用:机器人、物联网、边缘计算——这些恰是"隐私 + 恶劣环境 + 算力受限"三重约束的场景。

所以这一节是想说:实验系统回答了五个问题——扩散框架本身就有增益、四路条件各有专攻且缺一不可、恶劣环境提升最大、学到可泛化的人体规律、且轻到能上边缘——共同证明"专为雷达定制的条件扩散"是正确路线。


你应该懂的几个新词

毫米波雷达(mmWave radar):工作在 30–300 GHz(波长毫米级)的雷达。能穿透衣物/烟雾、保护隐私(看不到脸),但角分辨率低,点云稀疏(每帧几十到几百点)。

点云(Point Cloud):一组 3D 点的集合,每点带坐标,可能还带多普勒速度、信号强度。雷达点云比 LiDAR 点云更稀更噪,但能测速度。

人体姿态估计(HPE, Human Pose Estimation):预测人体关键点(关节)坐标、还原骨架。这里是 3D 版本,输出 J 个关节的 3D 坐标。

DDPM(去噪扩散概率模型):扩散模型的经典形式。前向加噪、反向去噪,训练目标是预测每步加进去的噪声 $\epsilon$。

条件扩散(Conditional Diffusion):去噪过程接受额外输入作为条件。Stable Diffusion 用文本当条件,mmDiff 用雷达特征 + 人体先验当条件。

MPJPE / PA-MPJPE:姿态估计的标准误差指标(单位 mm)。MPJPE 是骨盆对齐后的平均每关节误差;PA-MPJPE 再去掉全局旋转、平移、缩放,只看纯姿态质量。越低越好。

多径效应与镜面反射(multi-path / specular reflection):射频信号在环境里多次反射产生"鬼点",或在人体表面镜面反射导致某部位"整块消失"(缺检)。这是雷达点云噪声与不一致的物理根源。

采样假设(hypotheses):扩散是生成式的,同一输入多次采样会得到略不同的骨架。取多个假设的平均能提升稳定性,也便于和确定性回归方法公平对比。

所以这一节是想说:掌握这八个词,你就能读懂"射频感知 + 扩散生成 + 姿态估计"交叉方向的论文。


它有什么搞不定的

mmDiff 不是万能的,几个局限值得注意:

  • 依赖点云骨干的选择:GRC/LRC 的输入来自 Point4D 或 PointTransformer 这类骨干。骨干选得不好,四路条件都会"信息不足"。论文换数据集就换了骨干(mmBody 用 Point4D、mm-Fi 用 PointTransformer),说明这不是即插即用、一套通吃。

  • 点太少时局部条件失效:mm-Fi 上因为每帧点数不足 100,LRC 直接被略去。也就是说在更稀疏的雷达上,mmDiff 的"局部抠细节"这一路能力打折。传感器越差,方法优势越受限。

  • SLC 在远距离会退化:论文指出肢长一致性在感知距离较远时(如 Lab2 场景)效果变差,因为远处点更稀、肢长本身就更难估。人体先验不是无条件有效。

  • 扩散仍需多步采样:K=25 步虽比图像扩散少很多,但相比一步回归仍是多次前向。对超高频(远超普通感知帧率)的场景,25 步 + 5 假设平均可能仍是负担;进一步压步数会不会掉精度,论文未探索。

  • 需要成对训练数据:训练要真值骨架,来自 MoCap(mmBody)或预训练 HRNet 从 RGB 生成(mm-Fi)。后者的真值本身不完美("标注相对不稳"),意味着模型上限受制于真值质量。全新场景仍需采集配对数据。

所以这一节是想说:mmDiff 漂亮地解决了雷达姿态估计的稳定性问题,但它对骨干选择、点云密度、感知距离、采样步数和配对真值都有依赖——传感器越差、场景越极端,这些依赖越会露出短板。


它和别的几篇是什么关系

  • 上游(被借鉴)

    • DDPM(Ho et al. 2020)——扩散模型的数学基础。
    • DiffPose / Diff3DHPE——把扩散用于 RGB / 2D-to-3D 姿态估计的先驱。mmDiff 把场景从"信息充分的 RGB"换到"根本残缺的雷达",并加了四路专用条件。
    • P4Transformer / mmMesh / PointTransformer——雷达/点云姿态估计的回归基线,也是 mmDiff 的对比靶子与骨干来源。
  • 同方向(射频感知):本仓库 topic=rf 下的其他工作共享"穿墙 / 隐私 / 抗恶劣环境"的动机。参见 rf-pose-through-wall.md(用 WiFi 看人骨架)、millimap.md(毫米波建室内地图)、panoradar.md(毫米波做到 LiDAR 级 3D)。mmDiff 与它们的区别在于:它专注"从稀疏雷达点云生成结构化骨架",且用扩散生成而非判别式回归。

  • 方法气质相近:Diffusion Policy,参见 diffusion-policy.md。两者都把"一步预测"重写成"多步去噪"——Diffusion Policy 去噪出机器人动作序列,mmDiff 去噪出人体骨架。都吃到了扩散"稳、能表达多种合理解"的红利,是"扩散思想跨领域迁移"的两个平行样本。

  • 下游(可能启发):任何"观测稀疏残缺 + 需要结构化输出"的任务——超声、热成像、低光相机的姿态估计;把雷达 + 摄像头 + IMU 同时当条件的多模态扩散;把步数压到 < 5 步的实时化。

所以这一节是想说:mmDiff 站在"DDPM/DiffPose 的扩散谱系"与"射频感知谱系"的交叉点,它的贡献是把扩散生成的稳定性带进射频感知,是"扩散跨领域迁移"的又一个成功样本。


和本导读的关系

本笔记对应导读 Ch19: 射频感知——RF-Pose / milliMap / PanoRadar / RF-SLAM / mmCLIP

导读 Ch19 关心的是"怎么把 WiFi、毫米波、雷达这些看不见的电磁波,变成像摄像头一样可读的画面"。这条线里,RF-Pose 用 WiFi 看人骨架、milliMap 用毫米波建地图、PanoRadar 把毫米波做到 LiDAR 级 3D——它们大多是"判别式"地从射频信号回归出结构。mmDiff 在这条线里补的是一种新的方法论:用生成式扩散替代判别式回归来做射频姿态估计,专门对付射频信号"稀疏 + 残缺 + 不稳"的先天缺陷。

建议阅读顺序:先读导读 Ch19 建立"射频感知为什么重要、难在哪"的整体图景;再读 rf-pose-through-wall.md 看这条线的开山思路(用 WiFi 看骨架);然后读本笔记,理解"当信号更稀更噪时,为什么要从回归转向扩散生成";如果对扩散本身好奇,跳去 diffusion-policy.md 看同一套"去噪"思想在机器人动作上的用法。

从知识图谱角度,本笔记是 Ch19(射频感知)与扩散生成方法(Ch13 附近)的一座桥——它证明了扩散不只属于图像和机器人动作,也能服务于射频这类"物理上就带噪"的模态。

所以这一节是想说:本笔记是导读 Ch19 里"用生成式扩散做射频感知"的代表案例,读完能理解射频姿态估计从判别式回归向生成式去噪演进的动因。


思考题

以下问题检验你是否真正理解论文逻辑,而非记住"提升 12.8%"。每题附折叠提示,先自己想 30 秒再展开。

Q1:为什么说"从雷达估计姿态"更适合当条件生成问题,而不是回归问题?

提示

回归假设"输入能相对确定地映射到唯一输出"。但雷达点云稀疏残缺,同一团模糊点云其实对应多个都算合理的骨架——这是一个"一对多"的分布,不是"一对一"的函数。回归被迫在多个合理解之间取平均,得到一个谁都不像的解。生成式扩散显式建模这个条件分布,能采样出某一个合理解,而不是取平均。含噪观测的本质决定了它更像采样问题而非拟合问题。

Q2:GRC 为什么要"按关节隔离"地提取全局特征,而不是直接把整体点云特征喂给去噪器?

提示

因为雷达会偶发缺检——某个部位(如手臂)整块消失。如果用整体点云特征当统一条件,一处缺检会污染所有关节的判断。按关节隔离后,"手臂丢了"只影响手臂那一路特征,其他检测到的关节特征仍然干净。论文对比过"整体特征 vs 关节隔离特征",后者显著更抗缺检。隔离 = 把故障局部化。

Q3:在 mm-Fi 上 LRC 被直接略去,为什么?这暴露了 mmDiff 的什么依赖?

提示

因为 mm-Fi 每帧点数不足 100,LRC 的"关节局部邻域"里根本没几个点,局部注意力无从谈起。这暴露了 mmDiff 对点云密度的依赖——传感器越稀疏,"局部抠细节"这一路越失效。方法的优势和输入质量正相关,不是无条件成立。

Q4:消融显示去掉 SLC(肢长)和 TMC(时序)时性能掉得最狠。为什么这两路人体先验对雷达尤其重要?

提示

雷达的核心顽疾是"不稳定"——信号不一致导致骨架尺寸忽大忽小、帧间抖动。SLC 用"肢长恒定"这个硬约束压住尺寸变形,TMC 用"运动连续"压住帧间抖动,两者正好对准雷达最痛的点。而缺检类问题(GRC/LRC 处理的)虽也重要,但"不稳定"对最终 MPJPE 的伤害更直接,所以去掉这两路掉得最狠。

Q5:mmDiff 在恶劣环境(雨、烟、暗)的提升比常规环境更大。这说明了什么,对"该不该用雷达"有何启示?

提示

恶劣环境让信号更噪,而 mmDiff 的去噪 + 条件引导正是治噪的,所以噪声越大它相对回归基线的优势越明显。启示是:雷达的真正价值不在常规光照好的场景(那时摄像头更强),而在摄像头失效的恶劣/隐私场景——而 mmDiff 恰好在这些场景把雷达的潜力发挥得最好。方法与传感器的优势场景对齐了。

Q6:mmDiff 用 K=25 步去噪,而图像扩散常要几百上千步。为什么骨架能这么少步?

提示

因为数据维度天差地别。图像是几十万维(如 512×512×3),骨架只有 J×3(几十维)。去噪的难度和数据维度强相关——低维分布的去噪收敛快得多,25 步就够。这也是 mmDiff 能做到每模块 <2ms、指向边缘计算的原因。维度低是结构化输出(骨架)相对图像的天然便宜。

Q7:如果把 mmDiff 迁移到超声或热成像的姿态估计,你会保留什么、可能要改什么?

提示

可保留的骨架:DDPM 主框架 + "人体先验一致性"两路(SLC 肢长、TMC 运动)——这两路只依赖人体结构,与传感器无关。要改的:GRC/LRC 依赖点云骨干,超声/热成像的原始数据形态不同(可能是图像而非点云),需要换对应的编码器提取"全局-局部"条件;缺检/噪声的物理机制不同,条件设计可能要重新针对该模态的顽疾定制。核心方法论(多路条件、分而治之)可迁移,具体条件与骨干要按模态重做。

所以这一节是想说:能回答这 7 个问题,你就真正理解了 mmDiff 为雷达定制四路条件的动机与边界,而非只记住"CVPR 2024、提升 12.8%"。


一些好奇心问答(FAQ)

Q1:雷达点云真有那么差吗?

很差。整个人往往只有几十到几百个点,还夹着多径产生的"鬼点",某些部位(尤其被遮或镜面反射时)会整块消失。相比之下 LiDAR 点云稠密得多。正因为差,才需要 mmDiff 这种"去噪 + 先验"的重手段。

Q2:扩散模型不是用来画图的吗?怎么画骨架?

数学上没区别。扩散本质是"学一个数据分布,从噪声里采样出合格样本"。图像的"合格样本"是清晰图,骨架的"合格样本"是合理的人体姿态。把数据从像素网格换成 J×3 的关节坐标,框架照跑。

Q3:四个模块的缩写老记混,怎么记?

按"从哪来、治什么"记:GRC/LRC 都来自雷达(Radar Context),一个全局一个局部;SLC/TMC 都来自人体先验,一个管结构(肢长恒定)一个管时间(运动连续)。前两路"看数据",后两路"用常识"。

Q4:为什么要平均 5 个假设?

扩散是生成式的,同一输入多跑几次会得到略不同的骨架。取多个采样假设的平均能提升稳定性,也让它能和"输出唯一确定值"的回归方法做公平对比。

Q5:能实时跑吗?

模块很轻(每个 <2ms,去噪主干 0.03 GFLOPs),K=25 步的低维去噪也快。论文明确指向机器人、物联网、边缘计算这些实时且算力受限的场景。

Q6:和 RGB 上的 DiffPose 到底差在哪?

DiffPose 面对的是信息相对充分的 RGB 或可靠 2D 关键点,扩散主要做精修;mmDiff 面对的是根本残缺的稀疏雷达点云,必须靠四路专用条件(尤其治缺检和不稳定)才能补上信息缺口。同是扩散,难度和设计重心完全不同。

Q7:读完接下来看什么?

想看射频感知全貌看导读 Ch19rf-pose-through-wall.mdpanoradar.md;想理解扩散本身看 diffusion-policy.md(同样把预测重写成去噪);想深入点云骨干看 P4Transformer / PointTransformer 原文。

所以这一节是想说:关于点云质量、扩散画骨架、模块记忆法、实时性这些实操疑问,论文都给了清楚答案,mmDiff 的定位和用法已经相当明确。


如果你想再深入

按"扩散基础 → 姿态扩散先驱 → 射频同行 → 跨域对照"排序:

  1. 扩散基础:DDPM(Ho et al. 2020) — 加噪/去噪框架的奠基论文。读完才懂 mmDiff 的前向/反向过程具体在算什么。
  2. 姿态扩散先驱:DiffPose — 把扩散用于 3D 人体姿态的先行者。对照它能看清"信息充分的 RGB"与"残缺的雷达"在扩散设计上的差别。
  3. 射频同行:RF-Pose / milliMap / PanoRadar — 射频感知这条线的代表。见 rf-pose-through-wall.mdmillimap.mdpanoradar.md。理解 mmDiff 在射频谱系里的位置。
  4. 跨域对照:Diffusion Policy — 同样"把预测重写成去噪",去噪出机器人动作。见 diffusion-policy.md。两篇并读能体会扩散思想的跨领域通用性。
  5. 点云骨干:P4Transformer / PointTransformer — mmDiff 的特征翻译官,决定条件质量的上限。

所以这一节是想说:把 DDPM + DiffPose + mmDiff + 射频感知同行连起来读,就能看清"扩散生成如何一步步渗入射频感知"这条技术脉络。


原文信息

BibTeX

@article{fan2024mmdiff,
  title   = {Diffusion Model is a Good Pose Estimator from 3D RF-Vision},
  author  = {Fan, Junqiao and Yang, Jianfei and Xu, Yuecong and Xie, Lihua},
  journal = {arXiv preprint arXiv:2403.16198},
  year    = {2024}
}

说明:本站 frontmatter 记录 venue 为 CVPR(依站内收录记录)。为避免会议信息出错,这里用 arXiv 预印本条目引用;若正式引用,请以官方发表版本页面标注的会议信息为准。

链接

所以这一节是想说:这是 Fan 等人 2024 年的工作(来自 NTU),第一个把扩散模型用于毫米波雷达人体姿态估计,并在 mmBody / mm-Fi 上取得 SOTA,是射频感知与扩散生成交叉方向的代表论文。

引用本笔记 / Cite this note
BibTeX
@online{eai_mmdiff_2026,
  title       = {(readable note) Diffusion Model is a Good Pose Estimator from 3D RF-Vision},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mmdiff/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?