Diffusion Model is a Good Pose Estimator from 3D RF-Vision
这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,公式全部翻译成人话,术语第一次出现必定义 + 类比。
一句话讲什么(TL;DR)
毫米波雷达拍出的人像像隔了层毛玻璃、还在闪。mmDiff 让 AI 从一团噪点出发、以雷达信号为参照,一步步"擦"出稳定又符合人体常识的 3D 骨架,比"一口气猜"准得多、稳得多。CVPR 2024 收录,是第一个用扩散模型做毫米波雷达人体姿态估计的工作。
所以这一节是想说:这篇论文把人体姿态估计从"一步回归"重写成"多步去噪的条件生成",并针对雷达点云的稀疏、噪声、缺检问题设计了四路条件,专门为难缠的雷达数据量身定做。
这是个什么场景
想象凌晨三点,独居老人在卫生间摔倒了。你想做一个"自动报警的看护系统"——但摄像头放卫生间太尴尬、老人也不愿意贴一身手环、断电或黑灯时摄像头也瞎。
毫米波雷达就是为这种"不方便用摄像头"的场景准备的:黑灯瞎火、浓烟弥漫、要保护隐私(雷达只看得到形状轮廓,看不到脸)的地方都能用。它工作在 30–300 GHz 频段,发射并接收射频信号,通过信号变化提取出目标的点云(point cloud,一组带 3D 坐标的散点)。但代价是——雷达拍出来的人像像戴了副毛玻璃眼镜:
- 看得到一团晃动的影子(点云稀疏、低分辨率,整个人只有几十到几百个 3D 点)
- 影子还在闪、在漂(多径效应产生"鬼点",信号镜面反射与干扰导致人体某些部位偶尔"整块消失")
- 而你脑子里其实清楚"人长什么样"(胳膊分两节、膝盖不会反弯、身高相对固定、动作是连续的)
过去的做法是从这团模糊影子一口气猜出骨架坐标——一锤子买卖,猜错了就错了,而且相邻帧之间的预测会跳变、抖动,人体尺寸还会忽大忽小。
mmDiff 换了个思路,更像画家临摹:先在画布上铺一层随机噪声,再对着"模糊影子"一笔一笔擦出人形,每一笔都参考雷达信号,还随时用"人体常识"校正。最后画出来的骨架既贴合观测,又符合解剖学与运动学。
为什么用扩散模型特别合适?因为雷达观测本身就是"加了噪声的真相"——扩散模型天生干的就是"去噪"这件事,物理结构天然对味。
所以这一节是想说:mmDiff 面对的场景是"用隐私友好但极其模糊的毫米波雷达估计人体骨架",它选择扩散模型的根本原因,是雷达数据的"含噪"本质与扩散的"去噪"本领天然匹配。

之前的人怎么做的,为什么不够好
方案 A:直接回归(mmMesh、P4Transformer、mmPose 等) 类比:瞄一眼模糊影子就报出所有关节坐标。用 CNN / PointNet / Transformer 吃点云,直接输出关节 3D 坐标。问题:点云一稀疏就抖,帧与帧之间预测不连续,遇到部位缺检直接崩。
方案 B:时序滤波类 类比:给抖动的视频做防抖。在回归之上加 LSTM / Transformer 平滑帧间预测。问题:能压住抖动,但压不掉结构错误(比如手臂长度突然变化、身高忽高忽低)。
方案 C:多模态融合类 类比:雷达看不清就叫上摄像头和惯性计一起看。雷达 + IMU + 摄像头联合训练。问题:部署时这些额外传感器不一定都有,雷达单模态本身仍然弱。
方案 D:基于图模型的优化 类比:把骨架当成一张固定拓扑的网,硬套上去。用图神经网络强制人体拓扑约束。问题:图先验是硬编码的,对没见过的姿态泛化差。
方案 E:早期生成式方法(VAE / GAN) 类比:让模型"编"一个合理骨架。试过 VAE / GAN,但模式坍塌或训练不稳,没成主流。
一个关键对照:RGB 上的扩散姿态估计(DiffPose 等) DiffPose 把扩散用在 RGB 图像或已经相对可靠的 2D 关键点上做"精修"。但它面对的是信息相对充分的模态;毫米波雷达面对的是根本性的观测残缺(稀疏 + 缺检)。把 DiffPose 直接搬到雷达上不够用。
共同痛点:雷达点云的低分辨率 + 高噪声 + 偶发缺检,让"一步预测"很难同时满足"贴合观测"和"解剖学/运动学合理"两个目标。
所以这一节是想说:之前的方法要么一步回归(抖、缺检就崩)、要么后处理平滑(压不掉结构错误)、要么依赖额外传感器;即便是 RGB 上的扩散精修也不适配雷达的根本性残缺——留了一个"专为雷达设计的扩散姿态估计"的空位。
这篇论文的新想法
核心洞察:从雷达估计姿态,本质是一个条件生成问题,不是一个回归问题。
- 雷达点云不是骨架的精确测量,而是一组强先验提示(noisy guidance)。
- 真值骨架可以看作"从雷达点云所对应的条件分布里采样出来的一个合理样本"。
- 那么扩散模型——一个天生擅长条件生成、且擅长渐进去噪的工具——就该是首选。
mmDiff 的设计哲学分三层:
- 正向过程:把真值骨架逐步加噪,直到变成纯高斯噪声。
- 反向过程:从随机噪声出发,每一步都以雷达提取的特征为条件去噪,最终得到骨架。
- 多重条件分而治之:不止用一路条件,而是针对雷达的两大顽疾——"部位缺检"和"信号不一致"——设计了四路互补条件。这四路正是本文相对通用扩散姿态估计(如 DiffPose)的最大区别。
这个设计的"巧"在于:扩散模型每一步只解决一个小问题(去掉一点点噪声),而不是一锤子干完整个估计。它天然地把困难任务摊成多步,每一步都有雷达信号和人体先验当锚点,把"稀疏残缺观测"这个难题一点点消化掉。
所以这一节是想说:mmDiff 的新想法是"把姿态估计当条件生成来做",并用四路专门对付雷达顽疾的条件去引导扩散——这是它区别于一般扩散姿态估计、专为雷达定制的核心。
它分几步做的(方法)
mmDiff 的方法可拆成五块:扩散主框架、四路条件里的两路"雷达上下文"(GRC 全局 + LRC 局部)、两路"人体先验一致性"(SLC 肢长 + TMC 运动)、点云骨干网络当翻译官、以及训练与推理配置。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。
先看整体架构图:
真值骨架 x0 ──(前向加噪 K 步)──► 纯噪声 xK
│
雷达点云 R │ 反向去噪(每步都看四路条件 c)
│ ▼
┌────┴───────────────┐ ┌──────────────────────────────┐
│ 点云骨干(翻译官) │ │ 去噪网络 εθ(x_k, k, c) │
│ Point4D / PointTrans│ │ 预测这一步该减掉多少噪声 │
└────┬───────────────┘ └──────────────┬───────────────┘
│ 提取四路条件 c │ x_{k-1}
▼ ▼
┌───────────────────────────────┐ 迭代到 x0 = 干净骨架 (J×3)
│ GRC 全局雷达上下文(治缺检) │
│ LRC 局部雷达上下文(治细节定位) │
│ SLC 肢长一致性(治尺寸忽大忽小) │
│ TMC 时序运动一致性(治帧间抖动) │
└───────────────────────────────┘
5.1 扩散主框架:像橡皮擦一样反向擦
类比:老师故意往一张写着 J 个关节坐标的便签上一层层泼噪声,直到全是雪花点;再教学生怎么一层层擦干净。部署时反过来:给一张全是雪花的便签,让学生一步步擦回干净骨架。
等等,先慢一拍——扩散模型(diffusion model) 说白了就是这套"先加噪、再学着去噪"的把戏。它的标准数学版本叫 DDPM(Denoising Diffusion Probabilistic Model,去噪扩散概率模型)。
机制(输入→处理→输出):
- 输入:训练时是真值骨架 $x_0$,被参数化为 $J \times 3$ 的张量(J 个关节、每个 3D 坐标)。
- 处理:前向加噪按标准 DDPM 公式 $x_t = \sqrt{\bar\alpha_t},x_0 + \sqrt{1-\bar\alpha_t},\epsilon$。人话:"含噪骨架 = 缩小一点的真骨架 + 一份随机噪声",$\bar\alpha_t$ 控制缩多少。反向时,去噪网络 $\epsilon_\theta(x_t, t, c)$ 学着预测"这一步加进去的噪声长什么样",其中 $c$ 是从雷达提取的条件。
- 输出:从纯噪声出发,反复"猜噪声 → 减噪声",最终得到干净骨架。
加噪与去噪的链条可以画成一条对称的流水线:
前向(训练时故意加噪):
x0(真骨架) ──►x1──►x2──► ... ──► xK(纯高斯噪声)
干净 全是雪花
反向(推理时逐步擦净,每步看四路条件 c):
xK ──►x_{K-1}──► ... ──►x1──► x0(估计骨架)
│每步:εθ(x_k,k,c) 预测噪声→减掉
└── c = {GRC, LRC, SLC, TMC}(雷达+人体先验)
为什么有用:把一次性的困难预测摊成多步小修正,每步都可控、可被条件引导。这正是扩散相对一步回归在"稀疏残缺观测"下更稳的根源。
5.2 GRC 全局雷达上下文:治"部位缺检"
类比:导演先定基调"这场是跳舞还是打架",哪怕某个演员暂时被挡住,整体调度也不会乱。
机制(输入→处理→输出):
- 输入:整段/整帧雷达点云。
- 处理:GRC(Global Radar Context,全局雷达上下文)用一个 Transformer 提取全局特征,但关键设计是——为每个人体关节隔离出各自的全局特征(joint-wise features)。这样即便某个部位偶尔缺检(雷达没打到手臂),其他检测到的关节的特征提取不受牵连。论文对比过"直接用整体点云特征当条件",发现那样容易被缺检带偏,而按关节隔离的特征更鲁棒。
- 输出:一组按关节组织、抗缺检的全局条件特征。
为什么有用:直接针对雷达第一大顽疾——人体某部位整块消失。隔离让"一个关节丢了"不会污染"其他关节"的判断。
5.3 LRC 局部雷达上下文:治"细节定位"
类比:化妆师凑近看每一只手,只盯这只手周围的点。
机制(输入→处理→输出):
- 输入:每个关节附近的局部点云。
- 处理:LRC(Local Radar Context,局部雷达上下文)用一个局部 Transformer 在关节邻域做点级注意力。它用动态锚点(dynamic anchors)选取每个关节周围的点——比论文对比的"用粗估计姿态当静态锚点"的方案更适合扩散式的逐步细化。局部特征分辨率更高,告诉去噪器"这只手周围的点具体长这样"。
- 输出:每个关节的高分辨率局部条件特征。
- 注意:在 mm-Fi 数据集上,因为点太少(每帧点数 N < 100),LRC 被略去——点不够时局部邻域没意义。
为什么有用:全局定基调、局部抠细节,两者互补,把稀疏点云里能榨出的空间信息榨干。
5.4 SLC 肢长一致性 + TMC 运动一致性:注入"人体常识"
类比:SLC 像量体裁衣的裁缝——"这个人的前臂就这么长,不会一帧变长一帧变短";TMC 像剪辑师——"人的动作是连贯的,不会瞬间从站变躺"。
机制(输入→处理→输出):
- SLC(Structural Limb-length Consistency,结构肢长一致性):额外估计人体各肢段长度并施加约束。因为人体有硬约束——肢长应保持恒定。这直接压住"人体尺寸忽大忽小"的结构错误。权重 $\lambda = 5$。
- TMC(Temporal Motion Consistency,时序运动一致性):把相邻若干历史帧的估计姿态当条件,逼当前生成平滑连续。灵感来自"人的运动是连续的、不会突变"。时间窗 $\Delta t = 8$。
- 输出:两路"人体先验"条件,一路管空间结构合理、一路管时间运动连贯。
为什么有用:直接针对雷达第二大顽疾——信号不一致导致的结构变形与帧间抖动。消融显示,去掉肢长模块(SLC)和时序运动模块(TMC)时性能掉得最狠,因为姿态不稳会直接拉低精度。
5.5 点云骨干与训练/推理配置
类比:那四路"条件"不是凭空来的,得先有个翻译官把一堆 3D 点翻译成特征。
机制:
- 骨干(翻译官):mmBody 上用 Point4D(P4Transformer 的点云编码器)当 GRC 的点云编码器;mm-Fi 上用 PointTransformer(专为更稀疏点云设计)。骨干把点云翻译成"每点特征 + 整体特征",再分发给各条件分支。
- 训练配置:100 个 epoch,batch size 1024,Adam 优化器,学习率 $2\times10^{-5}$,梯度裁剪 1.0。前向/反向扩散步数 $K = 25$,采用常数 $\beta = 0.001$。为与非扩散方法公平比较,推理时平均 5 个采样假设(hypotheses)。LRC 的 KNN 邻居数 $\bar K = 50$。
- 推理:从高斯噪声出发跑 K=25 步反向去噪得到骨架。
为什么有用:K=25 步是个务实选择——比图像扩散动辄几百上千步少得多,因为骨架维度极低(J×3,才几十个数),去噪收敛快,适配对延迟敏感的实时感知场景。论文的效率分析显示,四个条件模块每个延迟都 < 2ms,去噪主干仅 1.03M 参数、0.03 GFLOPs,远轻于 P4Transformer 的 128M 参数、43.5 GFLOPs。
所以这一节是想说:mmDiff 的方法 = DDPM 主框架 + 四路专治雷达顽疾的条件(GRC 治缺检、LRC 抠细节、SLC 稳尺寸、TMC 稳运动)+ 点云骨干翻译官,且用极低维骨架让 25 步去噪就能实时,四路条件"全局-局部-结构-时序"分而治之是全文精髓。

关键数字(What works)
数字本身不重要,重要的是它们告诉你"每一路条件到底贡献了多少、扩散相比回归赢在哪"。以下数字来自原文表格;未报告的标"原文未报告"。评价指标是 MPJPE(平均每关节位置误差,mm,越低越好)和 PA-MPJPE(去掉全局旋转平移缩放后的误差)。
数字 1:mmBody 上全面超过 SOTA 回归基线
| 对比对象 | mmDiff 的提升(MPJPE / PA-MPJPE) |
|---|---|
| P4Transformer(mmWave SOTA) | +12.8% / +11.3% |
| P4Transformer(仅恶劣环境) | +14.7% / +12.0% |
| DiffPose / PoseFormer(3D 精修 SOTA) | +6.6% / +4.2% |
| 关键含义 | 全面超越;恶劣环境(雨、烟、暗、遮挡)提升更大,正是雷达优势场景 |
数字 2:mmBody 平均 MPJPE 逐模块下降
| 配置 | 平均 MPJPE | 平均 PA-MPJPE |
|---|---|---|
| P4Transformer(回归基线) | 78.10 | 60.56 |
| 纯扩散(无雷达条件) | 73.31 | 58.23 |
| + GRC(G) | 70.99 | 55.80 |
| + LRC(G,L) | 69.79 | 55.04 |
| + TMC(G,L,T) | 69.16 | ~53.96 |
| 完整 mmDiff(G,L,T,S) | 68.08 | 53.71 |
| 关键含义 | 每加一路条件都在降误差,四路叠加最优 |
数字 3:mm-Fi 上的泛化
| 维度 | 数据 |
|---|---|
| vs PointTransformer 基线 | MPJPE 降低 6.29%–13.61%,PA-MPJPE 降低 7.15%–14.42% |
| vs 原版 DiffPose 精修 | 再改善 4.19%–11.14%(MPJPE) |
| 数据划分 | random / cross-subject / cross-environment 三种 |
| 关键含义 | 跨被试、跨环境都稳,说明学到的是可迁移的人体结构/运动规律 |
数字 4:消融——两组条件各自的贡献
| 模块组 | MPJPE 增益 | PA-MPJPE 增益 |
|---|---|---|
| 全局-局部雷达上下文(GRC+LRC) | +4.8% | +5.5% |
| 结构-运动一致性(SLC+TMC) | +5.3% | +6.1% |
| 关键含义 | 两组贡献相当;去掉肢长(SLC)/时序(TMC)掉得最狠 |
数字 5:效率——模块极轻,适合边缘
| 组件 | 延迟 | 参数量 | GFLOPs |
|---|---|---|---|
| P4Transformer(对照) | 40.48 ms | 128.00M | 43.50 |
| 去噪主干(D) | 7.59 ms | 1.03M | 0.03 |
| 全局上下文(G) | 0.36 ms | 0.02M | 0.01 |
| 局部上下文(L) | 2.00 ms | 0.19M | 0.40 |
| 关键含义 | 每个新增模块 < 2ms,去噪主干极轻,指向机器人/IoT/边缘计算 |
数字 6:关键超参
| 超参 | 取值 |
|---|---|
| 扩散步数 K | 25 |
| 常数 β | 0.001 |
| 采样假设数 | 5(取平均) |
| 时序窗 Δt(TMC) | 8 |
| 肢长权重 λ(SLC) | 5 |
| KNN 邻居 K̄(LRC) | 50 |
所以这一节是想说:最硬的结论是"每加一路条件都降误差、恶劣环境提升最大、模块极轻可上边缘"——数字证明四路条件不是堆砌,而是各有专攻、缺一不可。
实验结果说明了什么
上一节列数字,这一节回答实验背后的科学问题。
问题一:扩散相比一步回归,在雷达上到底赢在哪? 赢在把"稀疏残缺观测下的一次性猜测"变成"多步、可被条件引导的渐进细化"。纯扩散(还没加任何雷达条件)就已经把 P4Transformer 的 78.10 MPJPE 降到 73.31——仅靠"建模姿态分布 + 逐步精修变形的粗姿态"就有增益。这说明扩散的多步去噪框架本身对含噪观测就有天然优势。
问题二:四路条件是真有用,还是华丽的堆砌? 真有用,且各有专攻。消融显示每加一路误差都下降:GRC 治缺检、LRC 抠细节、SLC 稳尺寸、TMC 稳抖动。两组(雷达上下文 vs 人体一致性)贡献相当(约 5% 量级)。去掉肢长和时序模块掉得最惨——印证了"雷达顽疾的核心是不稳定",而这两路正是专治不稳定的。
问题三:恶劣环境下的表现,是不是雷达真正的价值所在? 是。在雨、烟、暗、遮挡等恶劣场景,mmDiff 对 P4Transformer 的提升(14.7%)比常规场景(12.8%)更大。原因是恶劣环境让信号更噪,而 mmDiff 的去噪 + 条件引导正是为对付噪声设计的。这恰恰击中雷达"抗恶劣环境"的核心卖点——摄像头在这些场景直接失效,雷达 + mmDiff 才有意义。
问题四:它学到的是"死记这批人"还是"通用的人体规律"? 偏后者。mm-Fi 的 cross-subject(换人)划分下成绩与 random 划分接近,说明模型显式学到的人体结构约束(肢长恒定)和运动连续性能泛化到没见过的被试。这是 SLC/TMC 注入人体先验带来的额外好处——不是记住训练集,而是学到人之所以为人的物理规律。
问题五:这么多模块,会不会重到没法实时? 不会。四路条件模块每个延迟 < 2ms,去噪主干仅 1.03M 参数、0.03 GFLOPs,比 P4Transformer 轻两个数量级。K=25 步的低维骨架去噪很快。作者据此点明潜在应用:机器人、物联网、边缘计算——这些恰是"隐私 + 恶劣环境 + 算力受限"三重约束的场景。
所以这一节是想说:实验系统回答了五个问题——扩散框架本身就有增益、四路条件各有专攻且缺一不可、恶劣环境提升最大、学到可泛化的人体规律、且轻到能上边缘——共同证明"专为雷达定制的条件扩散"是正确路线。
你应该懂的几个新词
毫米波雷达(mmWave radar):工作在 30–300 GHz(波长毫米级)的雷达。能穿透衣物/烟雾、保护隐私(看不到脸),但角分辨率低,点云稀疏(每帧几十到几百点)。
点云(Point Cloud):一组 3D 点的集合,每点带坐标,可能还带多普勒速度、信号强度。雷达点云比 LiDAR 点云更稀更噪,但能测速度。
人体姿态估计(HPE, Human Pose Estimation):预测人体关键点(关节)坐标、还原骨架。这里是 3D 版本,输出 J 个关节的 3D 坐标。
DDPM(去噪扩散概率模型):扩散模型的经典形式。前向加噪、反向去噪,训练目标是预测每步加进去的噪声 $\epsilon$。
条件扩散(Conditional Diffusion):去噪过程接受额外输入作为条件。Stable Diffusion 用文本当条件,mmDiff 用雷达特征 + 人体先验当条件。
MPJPE / PA-MPJPE:姿态估计的标准误差指标(单位 mm)。MPJPE 是骨盆对齐后的平均每关节误差;PA-MPJPE 再去掉全局旋转、平移、缩放,只看纯姿态质量。越低越好。
多径效应与镜面反射(multi-path / specular reflection):射频信号在环境里多次反射产生"鬼点",或在人体表面镜面反射导致某部位"整块消失"(缺检)。这是雷达点云噪声与不一致的物理根源。
采样假设(hypotheses):扩散是生成式的,同一输入多次采样会得到略不同的骨架。取多个假设的平均能提升稳定性,也便于和确定性回归方法公平对比。
所以这一节是想说:掌握这八个词,你就能读懂"射频感知 + 扩散生成 + 姿态估计"交叉方向的论文。
它有什么搞不定的
mmDiff 不是万能的,几个局限值得注意:
依赖点云骨干的选择:GRC/LRC 的输入来自 Point4D 或 PointTransformer 这类骨干。骨干选得不好,四路条件都会"信息不足"。论文换数据集就换了骨干(mmBody 用 Point4D、mm-Fi 用 PointTransformer),说明这不是即插即用、一套通吃。
点太少时局部条件失效:mm-Fi 上因为每帧点数不足 100,LRC 直接被略去。也就是说在更稀疏的雷达上,mmDiff 的"局部抠细节"这一路能力打折。传感器越差,方法优势越受限。
SLC 在远距离会退化:论文指出肢长一致性在感知距离较远时(如 Lab2 场景)效果变差,因为远处点更稀、肢长本身就更难估。人体先验不是无条件有效。
扩散仍需多步采样:K=25 步虽比图像扩散少很多,但相比一步回归仍是多次前向。对超高频(远超普通感知帧率)的场景,25 步 + 5 假设平均可能仍是负担;进一步压步数会不会掉精度,论文未探索。
需要成对训练数据:训练要真值骨架,来自 MoCap(mmBody)或预训练 HRNet 从 RGB 生成(mm-Fi)。后者的真值本身不完美("标注相对不稳"),意味着模型上限受制于真值质量。全新场景仍需采集配对数据。
所以这一节是想说:mmDiff 漂亮地解决了雷达姿态估计的稳定性问题,但它对骨干选择、点云密度、感知距离、采样步数和配对真值都有依赖——传感器越差、场景越极端,这些依赖越会露出短板。
它和别的几篇是什么关系
上游(被借鉴):
- DDPM(Ho et al. 2020)——扩散模型的数学基础。
- DiffPose / Diff3DHPE——把扩散用于 RGB / 2D-to-3D 姿态估计的先驱。mmDiff 把场景从"信息充分的 RGB"换到"根本残缺的雷达",并加了四路专用条件。
- P4Transformer / mmMesh / PointTransformer——雷达/点云姿态估计的回归基线,也是 mmDiff 的对比靶子与骨干来源。
同方向(射频感知):本仓库 topic=rf 下的其他工作共享"穿墙 / 隐私 / 抗恶劣环境"的动机。参见
rf-pose-through-wall.md(用 WiFi 看人骨架)、millimap.md(毫米波建室内地图)、panoradar.md(毫米波做到 LiDAR 级 3D)。mmDiff 与它们的区别在于:它专注"从稀疏雷达点云生成结构化骨架",且用扩散生成而非判别式回归。方法气质相近:Diffusion Policy,参见
diffusion-policy.md。两者都把"一步预测"重写成"多步去噪"——Diffusion Policy 去噪出机器人动作序列,mmDiff 去噪出人体骨架。都吃到了扩散"稳、能表达多种合理解"的红利,是"扩散思想跨领域迁移"的两个平行样本。下游(可能启发):任何"观测稀疏残缺 + 需要结构化输出"的任务——超声、热成像、低光相机的姿态估计;把雷达 + 摄像头 + IMU 同时当条件的多模态扩散;把步数压到 < 5 步的实时化。
所以这一节是想说:mmDiff 站在"DDPM/DiffPose 的扩散谱系"与"射频感知谱系"的交叉点,它的贡献是把扩散生成的稳定性带进射频感知,是"扩散跨领域迁移"的又一个成功样本。
和本导读的关系
本笔记对应导读 Ch19: 射频感知——RF-Pose / milliMap / PanoRadar / RF-SLAM / mmCLIP。
导读 Ch19 关心的是"怎么把 WiFi、毫米波、雷达这些看不见的电磁波,变成像摄像头一样可读的画面"。这条线里,RF-Pose 用 WiFi 看人骨架、milliMap 用毫米波建地图、PanoRadar 把毫米波做到 LiDAR 级 3D——它们大多是"判别式"地从射频信号回归出结构。mmDiff 在这条线里补的是一种新的方法论:用生成式扩散替代判别式回归来做射频姿态估计,专门对付射频信号"稀疏 + 残缺 + 不稳"的先天缺陷。
建议阅读顺序:先读导读 Ch19 建立"射频感知为什么重要、难在哪"的整体图景;再读 rf-pose-through-wall.md 看这条线的开山思路(用 WiFi 看骨架);然后读本笔记,理解"当信号更稀更噪时,为什么要从回归转向扩散生成";如果对扩散本身好奇,跳去 diffusion-policy.md 看同一套"去噪"思想在机器人动作上的用法。
从知识图谱角度,本笔记是 Ch19(射频感知)与扩散生成方法(Ch13 附近)的一座桥——它证明了扩散不只属于图像和机器人动作,也能服务于射频这类"物理上就带噪"的模态。
所以这一节是想说:本笔记是导读 Ch19 里"用生成式扩散做射频感知"的代表案例,读完能理解射频姿态估计从判别式回归向生成式去噪演进的动因。
思考题
以下问题检验你是否真正理解论文逻辑,而非记住"提升 12.8%"。每题附折叠提示,先自己想 30 秒再展开。
Q1:为什么说"从雷达估计姿态"更适合当条件生成问题,而不是回归问题?
提示
回归假设"输入能相对确定地映射到唯一输出"。但雷达点云稀疏残缺,同一团模糊点云其实对应多个都算合理的骨架——这是一个"一对多"的分布,不是"一对一"的函数。回归被迫在多个合理解之间取平均,得到一个谁都不像的解。生成式扩散显式建模这个条件分布,能采样出某一个合理解,而不是取平均。含噪观测的本质决定了它更像采样问题而非拟合问题。
Q2:GRC 为什么要"按关节隔离"地提取全局特征,而不是直接把整体点云特征喂给去噪器?
提示
因为雷达会偶发缺检——某个部位(如手臂)整块消失。如果用整体点云特征当统一条件,一处缺检会污染所有关节的判断。按关节隔离后,"手臂丢了"只影响手臂那一路特征,其他检测到的关节特征仍然干净。论文对比过"整体特征 vs 关节隔离特征",后者显著更抗缺检。隔离 = 把故障局部化。
Q3:在 mm-Fi 上 LRC 被直接略去,为什么?这暴露了 mmDiff 的什么依赖?
提示
因为 mm-Fi 每帧点数不足 100,LRC 的"关节局部邻域"里根本没几个点,局部注意力无从谈起。这暴露了 mmDiff 对点云密度的依赖——传感器越稀疏,"局部抠细节"这一路越失效。方法的优势和输入质量正相关,不是无条件成立。
Q4:消融显示去掉 SLC(肢长)和 TMC(时序)时性能掉得最狠。为什么这两路人体先验对雷达尤其重要?
提示
雷达的核心顽疾是"不稳定"——信号不一致导致骨架尺寸忽大忽小、帧间抖动。SLC 用"肢长恒定"这个硬约束压住尺寸变形,TMC 用"运动连续"压住帧间抖动,两者正好对准雷达最痛的点。而缺检类问题(GRC/LRC 处理的)虽也重要,但"不稳定"对最终 MPJPE 的伤害更直接,所以去掉这两路掉得最狠。
Q5:mmDiff 在恶劣环境(雨、烟、暗)的提升比常规环境更大。这说明了什么,对"该不该用雷达"有何启示?
提示
恶劣环境让信号更噪,而 mmDiff 的去噪 + 条件引导正是治噪的,所以噪声越大它相对回归基线的优势越明显。启示是:雷达的真正价值不在常规光照好的场景(那时摄像头更强),而在摄像头失效的恶劣/隐私场景——而 mmDiff 恰好在这些场景把雷达的潜力发挥得最好。方法与传感器的优势场景对齐了。
Q6:mmDiff 用 K=25 步去噪,而图像扩散常要几百上千步。为什么骨架能这么少步?
提示
因为数据维度天差地别。图像是几十万维(如 512×512×3),骨架只有 J×3(几十维)。去噪的难度和数据维度强相关——低维分布的去噪收敛快得多,25 步就够。这也是 mmDiff 能做到每模块 <2ms、指向边缘计算的原因。维度低是结构化输出(骨架)相对图像的天然便宜。
Q7:如果把 mmDiff 迁移到超声或热成像的姿态估计,你会保留什么、可能要改什么?
提示
可保留的骨架:DDPM 主框架 + "人体先验一致性"两路(SLC 肢长、TMC 运动)——这两路只依赖人体结构,与传感器无关。要改的:GRC/LRC 依赖点云骨干,超声/热成像的原始数据形态不同(可能是图像而非点云),需要换对应的编码器提取"全局-局部"条件;缺检/噪声的物理机制不同,条件设计可能要重新针对该模态的顽疾定制。核心方法论(多路条件、分而治之)可迁移,具体条件与骨干要按模态重做。
所以这一节是想说:能回答这 7 个问题,你就真正理解了 mmDiff 为雷达定制四路条件的动机与边界,而非只记住"CVPR 2024、提升 12.8%"。
一些好奇心问答(FAQ)
Q1:雷达点云真有那么差吗?
很差。整个人往往只有几十到几百个点,还夹着多径产生的"鬼点",某些部位(尤其被遮或镜面反射时)会整块消失。相比之下 LiDAR 点云稠密得多。正因为差,才需要 mmDiff 这种"去噪 + 先验"的重手段。
Q2:扩散模型不是用来画图的吗?怎么画骨架?
数学上没区别。扩散本质是"学一个数据分布,从噪声里采样出合格样本"。图像的"合格样本"是清晰图,骨架的"合格样本"是合理的人体姿态。把数据从像素网格换成 J×3 的关节坐标,框架照跑。
Q3:四个模块的缩写老记混,怎么记?
按"从哪来、治什么"记:GRC/LRC 都来自雷达(Radar Context),一个全局一个局部;SLC/TMC 都来自人体先验,一个管结构(肢长恒定)一个管时间(运动连续)。前两路"看数据",后两路"用常识"。
Q4:为什么要平均 5 个假设?
扩散是生成式的,同一输入多跑几次会得到略不同的骨架。取多个采样假设的平均能提升稳定性,也让它能和"输出唯一确定值"的回归方法做公平对比。
Q5:能实时跑吗?
模块很轻(每个 <2ms,去噪主干 0.03 GFLOPs),K=25 步的低维去噪也快。论文明确指向机器人、物联网、边缘计算这些实时且算力受限的场景。
Q6:和 RGB 上的 DiffPose 到底差在哪?
DiffPose 面对的是信息相对充分的 RGB 或可靠 2D 关键点,扩散主要做精修;mmDiff 面对的是根本残缺的稀疏雷达点云,必须靠四路专用条件(尤其治缺检和不稳定)才能补上信息缺口。同是扩散,难度和设计重心完全不同。
Q7:读完接下来看什么?
想看射频感知全貌看导读 Ch19 与 rf-pose-through-wall.md、panoradar.md;想理解扩散本身看 diffusion-policy.md(同样把预测重写成去噪);想深入点云骨干看 P4Transformer / PointTransformer 原文。
所以这一节是想说:关于点云质量、扩散画骨架、模块记忆法、实时性这些实操疑问,论文都给了清楚答案,mmDiff 的定位和用法已经相当明确。
如果你想再深入
按"扩散基础 → 姿态扩散先驱 → 射频同行 → 跨域对照"排序:
- 扩散基础:DDPM(Ho et al. 2020) — 加噪/去噪框架的奠基论文。读完才懂 mmDiff 的前向/反向过程具体在算什么。
- 姿态扩散先驱:DiffPose — 把扩散用于 3D 人体姿态的先行者。对照它能看清"信息充分的 RGB"与"残缺的雷达"在扩散设计上的差别。
- 射频同行:RF-Pose / milliMap / PanoRadar — 射频感知这条线的代表。见
rf-pose-through-wall.md、millimap.md、panoradar.md。理解 mmDiff 在射频谱系里的位置。 - 跨域对照:Diffusion Policy — 同样"把预测重写成去噪",去噪出机器人动作。见
diffusion-policy.md。两篇并读能体会扩散思想的跨领域通用性。 - 点云骨干:P4Transformer / PointTransformer — mmDiff 的特征翻译官,决定条件质量的上限。
所以这一节是想说:把 DDPM + DiffPose + mmDiff + 射频感知同行连起来读,就能看清"扩散生成如何一步步渗入射频感知"这条技术脉络。
原文信息
BibTeX
@article{fan2024mmdiff,
title = {Diffusion Model is a Good Pose Estimator from 3D RF-Vision},
author = {Fan, Junqiao and Yang, Jianfei and Xu, Yuecong and Xie, Lihua},
journal = {arXiv preprint arXiv:2403.16198},
year = {2024}
}
说明:本站 frontmatter 记录 venue 为 CVPR(依站内收录记录)。为避免会议信息出错,这里用 arXiv 预印本条目引用;若正式引用,请以官方发表版本页面标注的会议信息为准。
链接
- arXiv:arxiv.org/abs/2403.16198
- 项目主页:fanjunqiao.github.io/mmDiff-site
- 团队:南洋理工大学(NTU Singapore),Jianfei Yang 为项目负责人
- 数据集:mmBody、mm-Fi(毫米波雷达 + 同步骨架真值的公开数据集)
所以这一节是想说:这是 Fan 等人 2024 年的工作(来自 NTU),第一个把扩散模型用于毫米波雷达人体姿态估计,并在 mmBody / mm-Fi 上取得 SOTA,是射频感知与扩散生成交叉方向的代表论文。
◼
引用本笔记 / Cite this note
@online{eai_mmdiff_2026,
title = {(readable note) Diffusion Model is a Good Pose Estimator from 3D RF-Vision},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mmdiff/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?