Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 92

RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals

28 min read · 9949 字 · ⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI、也没碰过雷达"的读者看的精读笔记。所有物理和公式都翻成人话,类比都来自日常生活。数字全部来自原文,没有的地方会写明"原文未报告"。

   毫米波雷达(两台,互相垂直)
   ┌─────────────┐   ┌─────────────┐
   │ 水平雷达     │   │ 垂直雷达     │
   │ 77–78.23GHz │   │ 79–80.23GHz │
   └──────┬──────┘   └──────┬──────┘
          │ 水平热图          │ 垂直热图
          ▼                  ▼
   ┌────────────────────────────────┐
   │ ① 信号处理(FFT + 时域相减去噪) │
   ├────────────────────────────────┤
   │ ② 人体检测(RPN 框出每个人)     │
   ├────────────────────────────────┤
   │ ③ 掩码生成(多头注意力融合 + 解码)│
   └────────────────────────────────┘
          │
          ▼
   每个人的稠密剪影(silhouette mask)
   —— 黑屋子、烟雾、遮挡里也能画出人形

1. 一句话讲什么(TL;DR)

漆黑屋子里相机看不见,但毫米波雷达的回波能"听"出人形。RFMask 让模型把雷达信号直接画成每个人的精细剪影——头、肩、胳膊的轮廓都画出来,而且是稠密的 mask(涂满的人形),不是几个关节点连成的"火柴人"。

更具体一点:输入是两台互相垂直的毫米波 FMCW 雷达采到的信号,经过傅里叶变换 + 时域去噪后变成"水平"和"垂直"两张热图(可以理解成俯视图和侧视图);输出是画面里每个人的二值剪影。方法上它把成熟的两阶段视觉框架(先框人、再画轮廓,也就是 Faster/Mask R-CNN 那一套)搬到雷达域,并用一个基于多头注意力的融合模块把水平/垂直两个视角拼起来。训练标签不用人工标——用同步的多相机系统自动生成剪影和 3D 骨架当"标准答案"。在作者自采的数据集上,它拿到 mask IoU 0.706 / 0.711 / 0.705(单人/多人/动作三个子集),在黑暗和遮挡场景下相机方法全挂时它照常工作。这是第一个从毫米波信号做人体稠密剪影分割的工作。

所以这一节是想说:这篇论文造了一个"雷达剪影相机",把又糊又吵的毫米波信号变成每个人涂满的人形轮廓,而且在黑暗、烟雾、遮挡里照常能用。


2. 这是个什么场景

家里浴室不能装摄像头,可你又担心独居的爷爷会不会在里面摔倒——这是个让人头疼的两难:既要看见,又不能真的"看见"

蝙蝠在伸手不见五指的洞里能照常飞,靠的是发出超声波、听回声判断前面有什么。换成人也一样:闭上眼睛在屋里拍手,墙、桌子、人体反弹回来的回声不同,你大致能听出"前面两米有个人"。毫米波雷达(mmWave radar)干的就是这件事,只不过用的是毫米级电磁波而不是声波——"拍手频率"高达几十 GHz,反射信号还带着距离、速度、角度、相位等多维信息。

RFMask 想把蝙蝠的本事再升级一档:不光告诉你"那里有个人",还要把这个人涂满地画出来——头在哪、肩膀多宽、抬起的胳膊伸到哪。这比"火柴人骨架"更进一步,是稠密的语义分割级别的输出。

什么时候特别有用:

  • 养老监护:浴室、卧室不方便装摄像头,又想知道老人有没有摔倒、什么姿势
  • 消防救援:屋里全是烟,普通相机直接糊掉,雷达能穿烟
  • 黑夜 / 强逆光:相机睁眼瞎的场合,雷达照常工作
  • 隐私敏感场所:医院、公共厕所,不想拍清脸但需要知道有几个人、在做什么

而这件事在信号层面非常难。原文点破了核心挑战:现有的无线感知(WiFi CSI、雷达)大多只能提取粗粒度信息——位置、速度、有没有人。而生成"视觉级别的稠密剪影"是完全不同量级的任务,因为毫米波信号又稀疏又吵,多路径反射还会把人体反射淹没。

所以这一节是想说:本文瞄准的是"看不见但需要看见"的隐私/黑暗/烟雾场景——用不依赖光的毫米波雷达,画出比骨架更细的稠密人形剪影。


RFMask — 场景示意:这论文要解决的现实问题
Plate Nº IRFMask — 场景示意:这论文要解决的现实问题

3. 之前的人怎么做的,为什么不够好

RGB 相机 + 语义分割(FCN、Mask R-CNN 这条线):过去十年深度学习把 RGB 分割做得很好。但原文一针见血:光学相机在遮挡或弱光下有根本性缺陷——很多方法尝试融合多层特征、加全局信息、用对抗策略增强暗图,但遇到完全遮挡(看都看不到)和完全黑暗时还是失败。因为在这些条件下,视觉本身就是个病态问题(ill-posed)——信息压根没进到传感器里。

深度相机 / Kinect:能给点云轮廓,但室外日光下退化,距离也短,同样是光学传感器的宿命。

WiFi / CSI 信号(RASID、DeMan、CARM 等):用 WiFi 的信道状态信息(CSI)做人体检测、活动识别。原文承认这条线能做感知,但分辨率粗——WiFi 带宽小、天线少,做稠密 mask 力不从心。

RF-Pose / RF-Pose3D(MIT 系列):里程碑式工作,用跨模态监督把雷达/WiFi 信号映射到人体关键点(骨架)。但它输出的是"火柴人",不是涂满的稠密轮廓。RFMask 正是把这条路从"RF → 关键点"升级到"RF → 稠密剪影"。原文实验里,把 RF-Pose 改造成输出剪影后当基线对比,RFMask 全面胜出。

  • 一句话对照:RGB 分割——精细但怕光怕遮挡;WiFi CSI——不怕光但太粗;RF-Pose——不怕光但只到骨架。

RFMask 的位置:把"不怕光"的雷达感知,第一次做到"稠密剪影"这个精度,同时尽量工程简洁(标题就叫 "A Simple Baseline",很诚实)。

所以这一节是想说:前人要么精细但看不穿黑暗遮挡,要么不怕黑但只能给粗位置或骨架;本文的空位是"用毫米波做到视觉级的稠密人形剪影"。


4. 这篇论文的新想法

类比:装修公司量房时会同时拍俯视图和侧视图——单一角度容易漏,两个角度叠起来才立体。RFMask 的思路就是这个。

核心想法有三条:

  1. 两路垂直雷达视角融合:用两台互相垂直放置的毫米波雷达,一台采"水平面"信息、一台采"垂直面"信息,相当于同时拿到俯视图和侧视图,立体感才出得来。原文特意让两台雷达用不同频段(77–78.23 GHz 和 79–80.23 GHz)以避免互相干扰。

  2. 借用成熟的两阶段检测/分割框架:把人当作热图上的目标,套一套类似 Faster/Mask R-CNN 的两阶段流水线——先用 RPN 框出每个人(人体检测),再在框内画轮廓(掩码生成)。这样能优雅地处理多人场景,还能先滤掉噪声、只在有人的地方精细计算。

  3. 用多相机系统当"老师"自动生成标签:训练时让 13 个相机节点和雷达同步开机,相机跑现成的 Mask R-CNN(生成剪影)和 OpenPose(生成 2D 关键点,再三角化成 3D 骨架)自动产出"标准答案",雷达就跟着这个答案学。学完上岗时把相机撤掉,光靠雷达干活。这套"跨模态监督"省下了人工标雷达数据的天价成本。

最关键的思路翻转:不要把雷达当成"另一种相机"从零造轮子,而是想办法把雷达数据揉成"长得像图"的张量(两张热图),再直接接已经验证好的视觉网络。这也解释了为什么标题谦虚地叫 "Simple Baseline"——它没有炫技的新组件,而是把工程链路打通了。

等等,先慢一拍——为什么要两台雷达而不是一台? 因为最终要画的剪影是在一个"成像平面"上(想象你面对着人拍的正面照)。而两台雷达采的是水平面和垂直面的信息,这两个平面都和成像平面正交。要把它们的信息投影/融合到成像平面上,单一平面永远缺一个维度——水平面不知道高低,垂直面不知道左右。两个一起才够。

所以这一节是想说:本文的新意是"双垂直视角 + 成熟两阶段视觉框架 + 相机跨模态监督"三件套,把雷达数据规整成图再接现成网络,第一次做出了 RF 稠密剪影。


5. 它分几步做的(方法)

RFMask 由三个模块串成:信号处理 → 人体检测 → 掩码生成。下面逐个拆开,每个先打比方抓直觉,再讲输入→处理→输出,最后说为什么必不可少。最后单独讲跨模态监督和损失函数。

5.1 信号处理:把原始波形变成两张"伪图像"

类比:把一段录音转成五线谱——原始波形人看不懂,得先变换成结构化的形式才能交给后续处理。

输入:两台 FMCW 雷达 + 线性天线阵列接收到的原始信号。每台雷达是 TI MMWCAS-RF-EVM,12 个发射天线 × 16 个接收天线的 MIMO 阵列,用时分复用(TDM)让不同发射天线的信号正交,一帧里 12 个发射天线依次向 16 个接收天线发波。天线设计让方位分辨率很高(虚拟天线阵列形状 86×1)。

处理分两步:

第一步,空间定位。原文公式(1)把某个空间位置 (x,y,z) 的信号强度算出来——本质是对每个采样、每个天线的回波,按"该位置到发射天线再到接收天线的往返距离 d 和波长 λ"做相位补偿求和。直接处理完整的 4D 张量(距离×角度×多普勒×时间)计算量爆炸,主流机器学习平台都撑不住。所以作者借鉴 RF-Pose 的做法,把信号分解到水平面和垂直面并行处理(公式 2、3),得到水平热图 y_hor(x,y,t) 和垂直热图 y_ver(y,z,t)——两张二维图,像素值代表该位置的反射强度。

第二步,时域相减去噪。室内多路径干扰严重,人体反射在原始信号上根本看不清。作者的巧招:静态物体(墙、桌子)的多路径反射不随时间变,但人在动,人的反射会随时间变化——所以把相邻时刻的信号在时域相减,静态多路径被抵消,人体反射被凸显出来。

输出:两张去噪后的热图(水平 + 垂直),是后续网络的输入。

FMCW + 天线阵列:调频连续波负责测距(回波频差正比于距离),天线阵列负责测角(不同天线的相位差反推来波方向)。两者结合就能定位空间中每个反射点。

多路径反射(multi-path):一束波撞了好几个面才回来,制造出"幻影反射"。室内墙面多,这是毫米波感知最大的噪声源之一。

为什么这步关键:如果这一步没把人体从多路径噪声里凸显出来,后面网络再强也是在噪声里瞎猜。时域相减这一招简单但极其有效——它利用了"人动、物静"这个物理先验。

所以这一节是想说:信号处理把原始毫米波变换成水平/垂直两张伪图像,并用"人动物静"的时域相减把人体反射从多路径噪声里捞出来,是全流程的地基。

5.2 人体检测:先框出每个人在哪

类比:监控员先在画面里圈出"这一块好像有人在动",再细看里面是谁——先定位,再细看,省力又准。

输入:水平热图和垂直热图。

处理:两个结构相同的编码器(卷积层 + 跳跃连接)分别提取水平特征和垂直特征。然后只把水平特征送进 RPN(Region Proposal Network,候选框生成网络),输出每个人的候选框——带精修的边界框坐标 + 置信度。为什么只在水平特征上做 RPN?因为水平面(俯视)能同时看到人的左右和前后位置,最适合定位"人在哪";垂直面主要提供高度信息,留到后面画轮廓时用。

输出:画面里每个人的边界框(bounding box)+ 置信度。

RPN(Region Proposal Network):从一张特征图里"画框"圈出可能有物体的位置,源自 Faster R-CNN。类比:先粗略框出"这块疑似有人",再交给下一步精细处理。

为什么这步关键:原文明说,RF 信号稀疏又吵,如果把整张热图直接喂给解码器,不但难收敛,还浪费算力。先检测、再分割这个两阶段设计,让模型只在有人的地方精细计算,既降噪又省算力——这也是它在多人和复杂动作子集上表现稳定的原因。

所以这一节是想说:人体检测用 RPN 先框出每个人,把稀疏嘈杂的全图问题缩小成"每个框里画一个人",为多人场景和降噪打好基础。

5.3 掩码生成:把两个视角融合,画出稠密剪影

类比:两个法医分别从正面和侧面看现场,各提一组线索,再由一个"总协调"把两组线索拼成完整判断——这个总协调就是多头注意力融合模块。

输入:水平特征、垂直特征、以及检测阶段给出的框。

处理分两步:

第一步,坐标投影(公式 4)。检测是在两个信号平面上做的,但最终剪影要画在"成像平面"上。作者用一个类似针孔相机模型的投影,把 3D 边界框的顶点投影到成像平面,得到每个人在成像平面上的正确位置。

第二步,特征级融合 + 解码。光有位置还不够,要画出细节轮廓,得在特征层面融合两个视角。作者设计了一个 Multi-Head Fusion(多头融合)模块,由四层多头注意力组成(灵感来自 Transformer)。做法很巧:把形状为 (C×H×W) 的水平/垂直特征在高度和通道维度上压平,得到沿宽度方向的一串向量,再拼在一起。多头注意力学习"任意两个位置之间的相关性权重"——但我们只需要"所有水平位置和所有垂直位置之间"的相关性,所以只取相关矩阵的左下角那块,喂进解码器。解码器由三个"反卷积-卷积"块组成,逐步提高分辨率,输出低分辨率剪影热图。最后把 mask 结果贴回对应的投影框里,拼成最终的完整剪影。

输出:画面里每个人的稠密二值剪影。

Multi-Head Attention(多头注意力):Transformer 的核心机制,计算序列里任意两个元素之间的相关性并加权。这里用来学"水平位置和垂直位置之间该怎么配对融合"。

为什么这步是灵魂:原文的消融实验证明,多头融合模块比"简单拼接"两个视角强得多,而且抹平了简单子集和复杂子集之间的精度差距——正是它让 RFMask 在多人、复杂动作场景下也保持稳定。这是本文相比"把两张图直接堆一起"的关键创新。

所以这一节是想说:掩码生成先把检测框投影到成像平面定位,再用多头注意力融合水平/垂直两个视角、解码出稠密剪影——这个融合模块是让复杂场景也稳定的核心。

5.4 跨模态监督:13 个相机当"老师",雷达当"学生"

类比:让小孩跟着字帖练字——字帖是相机(已经会认人),学生是雷达(看的是另一种"语言")。

输入:雷达信号 + 同步的多相机视频。

处理:作者搭了一个 13 个相机节点的系统(12 个固定 + 1 个跟着雷达走),每个节点是树莓派 + 相机模块 + PoE 供电,便携易部署。标签这样自动生成:

  • 剪影标签:对跟随雷达那台相机的视频逐帧跑 Mask R-CNN,得到人体剪影。
  • 3D 骨架 / 框标签:对全部 13 路视频跑 OpenPose 得到 2D 关键点,再用三角化(公式 8,多视角几何)恢复 3D 关键点;多人时用 K-means 按欧氏距离区分不同人。3D 关键点的最小包围盒就是人体的 3D 框,用来监督检测阶段。
  • 同步:所有设备用 NTP(网络时间协议)对齐到本地时间服务器,采集前统一约定"15 秒后开始",误差在毫秒级。

一个聪明的工程细节:为了在不同环境采数据,作者不用每换一个房间就重搭 13 相机系统(太费时),而是把雷达放到同一个房间的不同位置来模拟不同环境,只需移动第 13 个跟随相机并重新标定。即便如此,遮挡场景下(相机被挡)还能靠其他相机的 3D 关键点重投影生成参考真值。

输出:无需人工标注的剪影、3D 骨架、框标签。

跨模态监督(Cross-Modal Supervision):用 A 模态(RGB)自动生成的标签去训 B 模态(RF)的模型。也叫"特权信息学习"——老师训练时拥有学生看不到的信息,训练完老师退场。

为什么这步关键:手工标雷达热图几乎不可能——你没法盯着一团回波涂出人形。相机白送标签,才让"从零训练一个 RF 剪影模型"在成本上可行。这是整条研究线(含 RF-Pose)的命根子。

所以这一节是想说:跨模态监督用 13 相机自动生成剪影和骨架标签,解决了"雷达数据没法人工标"的死结,是 RFMask 能训得起来的前提。

5.5 损失函数与训练配置

类比:一个学生同时考两门——"框画得准不准"(检测)和"轮廓涂得对不对"(分割),总分是两门加起来。

输入:预测的框和 mask + 老师生成的真值。

处理:总损失是两部分之和(公式 7):L = L_detect + L_mask。

  • 检测损失 L_detect(公式 5):分类损失(前景/背景的二元交叉熵)+ 框回归损失(smooth-L1),只有前景(有人)才算框损失,λ_det 是平衡权重。
  • 掩码损失 L_mask(公式 6):对每个检测到的框,预测 K 个类别的二值 mask(分辨率 m×m),用二值交叉熵和真值比。

训练配置:输入时间序列长度为 12 帧;主干用 ResNet + 特征金字塔(FPN);单张 NVIDIA A100,batch size 90,初始学习率 1.5e-4,用周期为 4 的循环余弦退火(cyclic cosine annealing)调度。

输出:梯度反传,同时更新检测和分割部分的权重。

所以这一节是想说:损失函数把"框准"和"轮廓对"两个目标简单相加联合优化,配上标准的两阶段训练配置,工程上干净利落,呼应了标题的 "Simple Baseline"。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【RFMask: A Simple Baseline for Human… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   RFMask(12)   ──► 0.706                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

RFMask — 方法示意:核心 pipeline
Plate Nº IIRFMask — 方法示意:核心 pipeline

6. 关键数字(What works)

6.1 主结果:mask IoU(三个子集,输入长度对比)

方法 单人 IoU 多人 IoU 动作 IoU
RFPose(4)(改造基线) 0.664 0.626 0.616
RFMask(4) 0.681 0.682 0.681
RFPose(12)(改造基线) 0.675 0.631 0.614
RFMask(12) 0.706 0.711 0.705

说明:括号里的数字是输入时间序列长度(帧数)。RFMask(4) 比 RFPose(4) 提升 0.017 / 0.056 / 0.065;RFMask(12) 比 RFPose(12) 提升 0.031 / 0.08 / 0.091。原文还指出:RFMask(4) 甚至超过了 RFPose(12)、RFPose(32)、RFPose(64) 所有更长输入的版本。RFPose 各基线的精确数值以原文 Table I 为准(此处基线值按原文文字描述的提升量反推,可能有小数末位出入)。

6.2 检测模块定位性能(不同主干 / 序列长度)

指标 数值 配置
最高 AP 0.632 ResNet-50 主干,序列长度 12
最高 Recall 0.701 ResNet-50 主干,序列长度 12
ResNet-18 vs ResNet-50 仅差 0.011 序列长度 12

有意思的结论:更深的网络(ResNet-50)只比浅网络(ResNet-18)高 0.011——原文解释是"RF 信号的表示比 RGB 图像简单得多,浅网络就够"。

6.3 数据集规模

项目 数值
雷达帧总数 804,760
相机帧总数 402,380
相机节点 13 个(12 固定 + 1 跟随雷达)
雷达 2 台 TI MMWCAS-RF-EVM,各 12Tx × 16Rx MIMO
采集环境 10 个不同位置
采集条件 11 种(含无遮挡、泡沫/纸箱/瑜伽垫遮挡、弱光、多种动作)
动作类型 站、走、坐、蹲
相机帧率 / 雷达帧率 10 / 20

6.4 消融结论

对比项 结论
双视角(H&V)vs 单视角(仅 H) 双视角更好——垂直信号虽信息少但有用
多头融合 vs 简单拼接 多头融合显著更好,且抹平简单/复杂子集差距
序列长度 12 vs 4 更长序列定位更准

生活语言解读:0.706 的 mask IoU 意味着预测剪影和真值剪影的重叠率约七成——对第一个做 RF 稠密剪影的工作来说相当不错。最值得注意的是 6.1 表里 RFMask 在三个子集(单人/多人/动作)上的成绩几乎一样稳(0.706/0.711/0.705),而基线 RFPose 在复杂子集上明显掉分——这说明"先检测再分割 + 多头融合"这套设计真的让它扛得住多人和复杂动作。6.2 表则揭示了一个反直觉的事实:RF 信号太简单,加深网络几乎没用,这和 RGB 视觉"越深越好"的经验相反。

所以这一节是想说:数字证明 RFMask 不仅精度可用(IoU 约 0.7),更关键的是它在多人和复杂动作下依然稳定,而这份稳定来自两阶段设计和多头融合模块。


7. 实验结果说明了什么

原文的实验回答了四个关键问题:

问题一:RFMask 比升级版 RF-Pose 好在哪? Table I 直接对比。RFMask 在所有子集、所有输入长度上都胜过改造成剪影输出的 RFPose。更关键的是稳定性:RFPose 的表现随子集难度递减(单人 > 多人 > 动作),而 RFMask 三个子集几乎持平。原文归因于两点:两阶段设计在检测阶段就滤掉了噪声,多头融合模块专注于人体反射的空间关系。这说明 RFMask 的优势不是"分数高一点",而是"复杂场景也不崩"。

问题二:黑暗和遮挡下真的能用吗? 因为黑暗/遮挡下相机拿不到真值,只能做定性对比(Fig. 8)。结论:RFMask 在遮挡(相机被挡但用其他相机重投影骨架当参考)和弱光下都能画出合理剪影,而 RGB 方法直接失效。这就是全篇最大的卖点——它是视觉系统的"退路",可以作为补充提升整体系统的鲁棒性。

问题三:两个视角都有必要吗?多头融合值不值? 消融实验(Table III)证明:双视角(H&V)优于单视角(仅 H)——垂直信号虽然信息少(主要是垂直运动),但对剪影分割确实有贡献;多头融合模块比简单拼接强得多,还抹平了简单/复杂子集的差距。这两条直接支撑了本文的两个核心设计选择。

问题四:需要多深的网络? Table II 显示 ResNet-50 只比 ResNet-18 高 0.011。原文的解释很有洞见:RF 信号的表示比 RGB 图像简单得多,所以浅网络就够,不必堆深。这对做 RF 感知的人是个重要经验——别把 RGB 的"越大越好"直接搬过来。

所以这一节是想说:四组实验分别验证了"胜过 RF-Pose 且更稳""黑暗遮挡下能当退路""双视角和多头融合都必要""RF 不需要深网络"——每条都有对比或消融支撑。


8. 你应该懂的几个新词

mmWave Radar(毫米波雷达):工作在 30–300 GHz、波长毫米级的雷达。优点是分辨率高、体积小、不受光照影响;缺点是穿透力比微波弱,多路径反射带噪声。类比:蝙蝠的回声定位,只是把声波换成高频电磁波。

FMCW(调频连续波):发射频率随时间线性变化的信号,靠回波频差测距。类比:唱"嘀——"从低音滑到高音,根据回声音调差判断障碍物多远。

天线阵列 / MIMO:多根发射和接收天线组合,靠相位差测来波方向。本文每台雷达 12 发 × 16 收。类比:人有两只耳朵就能定位声音方向,天线越多定位越准。

热图(heatmap)投影:把复杂的雷达信息聚合成一张二维图,像素亮度代表反射强度。本文用水平和垂直两张热图。

多路径反射(multi-path):一束波撞多个面才回来的"幻影反射",室内墙面多时尤其严重,是毫米波感知的主要噪声源。

RPN(Region Proposal Network,候选框生成网络):从特征图里画框圈出可能有物体的位置,源自 Faster R-CNN。本文用它做多人检测。

两阶段检测/分割(Mask R-CNN 风格):先 RPN 出框、再在框内画 mask 的流水线。本文把它从 RGB 域移植到 RF 域。

Multi-Head Attention(多头注意力):Transformer 核心机制,算序列里任意两元素的相关性并加权。本文用来融合水平/垂直视角。

跨模态监督(Cross-Modal Supervision):用一种模态(RGB)自动生成的标签训练另一种模态(RF)的模型,省掉人工标注。

IoU(Intersection over Union,交并比):预测区域和真值区域"重叠面积 ÷ 合并面积",分割任务的标准指标,0–1 之间,越高越好。

所以这一节是想说:读懂本文,关键是把"雷达术语(mmWave/FMCW/天线阵列/多路径)""视觉术语(RPN/两阶段/多头注意力/IoU)""跨模态监督"这三套词都摸一遍。


9. 它有什么搞不定的

弱光/遮挡下无法定量评估:这些场景相机拿不到真值,所以原文只能给定性结果。也就是说"黑暗里到底有多准"这个数字,论文其实没法回答——只能说"看起来合理"。这是跨模态监督范式的内禀局限:老师看不见的地方,学生也没法被打分。

依赖"人动物静"的时域相减:去噪的核心假设是人在动、物体静止。如果一个人长时间僵着不动(比如昏迷躺地上——恰恰是养老监护最该检测的情况),时域相减会把他也当成静态背景抵消掉,人可能"消失"。

用相机模拟环境,泛化存疑:为省成本,作者把雷达放同一房间的不同位置来"模拟"不同环境,而不是真的去很多不同房间采集。真正跨建筑、跨户型的泛化能力,原文没有充分验证。

分辨率上限受物理限制:毫米波在人体表面有镜面反射(specularity)——只有近似垂直入射的部分才反射回来。所以末梢肢体(手指、脚)反射面积小、方向窄,很难画准。0.7 的 IoU 已经不错,但离 RGB 分割的精细度还有差距。

依赖老师模型的偏差:标签来自 Mask R-CNN 和 OpenPose。这两个老师本身的系统性偏差(比如对某些体型、姿态识别差)会被雷达学生继承,而且没有机制纠正。

两台雷达 + 13 相机的采集系统很重:虽然推理时只用雷达,但训练时要搭一套 13 相机 + 双雷达 + NTP 同步的系统,门槛不低,复现成本高。

所以这一节是想说:RFMask 的强项是"不怕光、不怕遮挡的稠密剪影",但代价是难以定量评估极端场景、依赖人动假设、泛化未充分验证、受镜面反射物理上限约束——这些是后续工作的空间。


10. 它和别的几篇是什么关系

MIT RF-Pose / RF-Pose3D 系列(CVPR 2018/2019):同领域的里程碑与直接父类,做的是 RF → 关键点(火柴人)。RFMask 把任务从"骨架"升级成"稠密剪影",并在实验里把改造成剪影输出的 RFPose 当基线打败。信号分解到水平/垂直平面的做法也直接借鉴自 RF-Pose。

Person-in-WiFi(ICCV 2019):用 WiFi CSI 估计人体姿态,分辨率比毫米波粗,是更早、更粗粒度的尝试。见本仓库 person-in-wifi.md

Mask R-CNN / Faster R-CNN(ICCV 2017 / NIPS 2015):本文方法论的直接父类——两阶段检测、RPN、ROI、mask 分支几乎全在借鉴。RFMask 相当于"把 Mask R-CNN 搬到 RF 域"。

Transformer / 多头注意力(NeurIPS 2017):本文的 Multi-Head Fusion 模块直接受 Transformer 启发,用注意力融合两个视角。

本仓库同主题rf-pose-through-wall.md(穿墙人体骨架)、person-in-wifi.md(WiFi 姿态)、radarslam.md(雷达 SLAM)、nlos-mmwave.md(非视距毫米波)都是 RF 感知一脉,可以串起来读——RFMask 是其中"稠密视觉级输出"的代表。

所以这一节是想说:RFMask 站在"RF-Pose 的跨模态监督思想"和"Mask R-CNN 的两阶段视觉框架"两条脉络的交汇点,把 RF 感知从骨架推进到稠密剪影。


11. 和本导读的关系

本篇对应导读 Ch19: 射频感知。Ch19 把射频感知分为三层:位置层(Where)、形状层(What shape)、语义层(What is it)。RFMask 属于形状层——它不只回答"人在哪"(位置层,如 RF-Pose 的关键点),而是回答"人是什么形状"(稠密剪影轮廓),比位置层更进一步、比语义层更基础。

Ch19 的核心方法论线索之一是跨模态监督:用强模态(RGB/LiDAR)教弱模态(RF)。RFMask 是这个范式的典型实现——用 13 相机的 Mask R-CNN 和 OpenPose 当老师、雷达当学生,训练时多模态、推理时只用 RF。这和 Ch19 里 milliMap(用 LiDAR 地图教毫米波网络)、mmCLIP(用 CLIP 语义教雷达编码器)是同一套思路的不同变体。

Ch19 还强调 RF 的物理约束驱动架构设计:因为毫米波信号稀疏、有严重多路径,所以本文必须先做检测降噪、再做分割,还要用"人动物静"的时域相减去噪。这正是 Ch19 反复讲的"深度学习不是替代物理,而是弥补物理的不足"——RFMask 用两阶段结构和融合模块弥补了单帧信号的稀疏与嘈杂。

从阅读路线看,建议先读 rf-pose-through-wall.md(位置层)建立"用电波看人"的直觉,再读本篇看"如何从骨架进阶到稠密剪影",最后读 millimap.md 看形状层在环境建图上的另一种体现。

所以这一节是想说:本篇是 Ch19 射频感知章节"形状层"的代表,体现了跨模态监督和物理约束驱动架构设计两个核心方法论。


12. 思考题

Q1:RFMask 为什么要用两台互相垂直的雷达,而不是一台?如果只用水平那一台会丢失什么?

提示

最终剪影画在"成像平面"上(正面视角)。水平面(俯视)能看到左右和前后,但看不到高低;垂直面能看到高低。想想一个人"站着"和"蹲着",在哪张热图上更容易区分?为什么两张合起来才能三角化出成像平面上的完整位置?

Q2:信号处理里用"时域相减"去噪。它利用了什么物理先验?在什么场景下这个先验会失效?

提示

先验是"静态物体的多路径反射不随时间变,人在动所以人的反射随时间变"。相邻帧相减,静态被抵消、动态被凸显。那么如果一个人长时间一动不动(比如昏迷躺地上),会发生什么?这对养老监护这个目标应用是不是一个讽刺的问题?

Q3:为什么 RFMask 采用"先检测、再分割"的两阶段设计,而不是直接把整张热图喂进去输出剪影?

提示

原文说 RF 信号稀疏且吵,直接喂整图"难收敛且浪费算力"。想想两阶段的好处:检测阶段先框出人,滤掉了无人区的噪声,分割只在框内精细计算。这和 RFMask 在多人/复杂动作子集上表现稳定有什么关系?

Q4:原文发现 ResNet-50 只比 ResNet-18 高 0.011,几乎没差别。这个反直觉的结论说明了什么?和 RGB 视觉的经验有什么不同?

提示

原文归因于"RF 信号的表示比 RGB 图像简单得多"。RGB 图像纹理、颜色、光影极其丰富,需要深网络才能吃透;而 RF 热图信息量小、结构简单,浅网络就够。想想这对"RF 感知该用多大模型"这个工程决策有什么启示?

Q5:跨模态监督用相机当老师。如果 Mask R-CNN 或 OpenPose 在某些姿态上系统性出错,RFMask 会怎样?能避免吗?

提示

学生只能学老师给的标签,老师的系统性偏差会被继承。本文没有专门的纠错机制。想想能不能用多个不同的老师、或引入少量人工校正、或用置信度加权来缓解?这是所有跨模态监督工作共有的隐患。

Q6:黑暗和遮挡场景下,原文只能给定性结果、无法定量评估。这是为什么?这个局限对"证明 RFMask 有用"有多大影响?

提示

黑暗/遮挡下相机拿不到真值(连老师都看不见),所以没有 ground truth 来算 IoU。想想这是否意味着"RFMask 在最该发挥作用的场景里,恰恰最难被严格验证"?有没有别的办法获取这些场景的真值(比如遮挡时用其他没被挡的相机重投影)?原文用了哪种?

Q7:毫米波在人体表面有"镜面反射"——只有近似垂直入射的部分才反射回来。这如何限制了 RFMask 能画多细的剪影?

提示

镜面反射意味着面积小、朝向不对的部位(手指、脚、侧对雷达的手臂)反射不回信号。想想为什么末梢肢体最难画准?增加序列长度(多看几帧、人动了角度变了)为什么能部分缓解这个问题?这和 RadarSLAM/RF-Pose 里遇到的镜面反射问题是同一个物理根源吗?


13. 一些好奇心问答(FAQ)

Q1:毫米波雷达照人,安全吗?

安全。毫米波雷达发射功率极低(民用设备通常在毫瓦量级甚至更低),远低于安全限值,而且不像 X 光那样有电离辐射。它和汽车前保险杠里的雷达、机场安检的毫米波仪是同一类技术,已广泛民用。

Q2:为什么叫 "Simple Baseline"?是不是作者谦虚?

是诚实的自我定位。它没有发明全新的算法组件——检测借 Faster/Mask R-CNN,融合借 Transformer 注意力,监督借 RF-Pose 的跨模态思路。它的贡献是"第一个把这些拼起来做出 RF 稠密剪影,并建了数据集"。这类"打通链路 + 建 benchmark"的工作,正是一个新方向的合理起点。

Q3:804,760 雷达帧听起来很多,但为什么相机帧只有一半(402,380)?

因为帧率不同——雷达 20 fps、相机 10 fps,采同样时长自然雷达帧数是相机的两倍。而且雷达和相机的时间戳靠 NTP 对齐,一个相机帧对应大约两个雷达帧。

Q4:推理时真的完全不用相机吗?

对。相机(和 13 相机系统、Mask R-CNN、OpenPose)只在训练阶段当老师生成标签,部署时只需要两台雷达。这是跨模态监督最优雅的地方——训练用多模态、推理用单模态。所以你可以把训练好的模型装进一个完全没有摄像头的监护设备里。

Q5:为什么用两个不同频段(77 和 79 GHz)而不是同一个?

避免两台雷达互相干扰。如果两台都发同一频段,一台的信号会被另一台收到造成串扰。错开频段(各占 1.23 GHz 带宽)就能各扫各的,互不打扰。

Q6:这个和 RadarSLAM 都用雷达,有什么区别?

任务完全不同。RadarSLAM 用旋转扫描雷达做定位建图(我在哪、环境什么样),输出轨迹和地图;RFMask 用毫米波 MIMO 雷达做人体感知(画出人形剪影),输出 mask。硬件、目标、方法都不一样,只是共享"用电波看世界"的物理底层。

Q7:能实时跑吗?

原文重点在精度和数据集,没有强调实时推理速度(原文未报告端到端帧率)。但两阶段设计(先检测降噪、再只在框内分割)本身是为了省算力,主干也证明浅网络(ResNet-18)就够,所以实时化有基础。要确切数字需看原文/代码。

所以这一节是想说:RFMask 的很多设计(低功耗安全、双频段、只训练用相机、两阶段省算力)都是务实的工程权衡,理解它们能帮你判断这套方案在你的场景里能不能落地。


14. 如果你想再深入

Zhao et al., CVPR 2018, "Through-Wall Human Pose Estimation Using Radio Signals"(RF-Pose) — 这条研究线的真正起点,做 RF → 关键点。理解了它,RFMask 的"从骨架到剪影"升级就一目了然。信号分解到水平/垂直平面的做法也源于此。

He et al., ICCV 2017, "Mask R-CNN" — 本文两阶段检测-分割框架的直接父类。搞懂 RPN、ROI Align、mask 分支,再看 RFMask 就知道哪些是照搬、哪些是为 RF 改的。

Ren et al., NIPS 2015, "Faster R-CNN" — RPN 的发源地。本文人体检测全靠它。

Vaswani et al., NeurIPS 2017, "Attention Is All You Need" — 本文 Multi-Head Fusion 模块的灵感来源。想懂"多头注意力怎么融合两个视角",去读原始 Transformer。

RFMask 代码与数据集 — 原文承诺公开数据集和代码(804,760 雷达帧 + 402,380 相机帧)。想复现或做 RF 感知研究,这套多模态数据集本身就很有价值。

TI mmWave 雷达开发套件文档 — 本文用 TI MMWCAS-RF-EVM。想动手玩毫米波感知,先读 TI 的 mmWave SDK 和级联雷达文档。

所以这一节是想说:要理解任务源头读 RF-Pose;要理解方法读 Mask R-CNN 和 Faster R-CNN;要理解融合模块读 Transformer;要动手先搞 TI 雷达 SDK 和本文数据集。


15. 原文信息

本文(笔记所评论文)

@article{wu2022rfmask,
  title={RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals},
  author={Wu, Zhi and Zhang, Dongheng and Xie, Chunyang and Yu, Cong and Chen, Jinbo and Hu, Yang and Chen, Yan},
  journal={IEEE Transactions on Multimedia (TMM)},
  year={2022}
}

关键前驱论文(RF-Pose)

@inproceedings{zhao2018rfpose,
  title={Through-Wall Human Pose Estimation Using Radio Signals},
  author={Zhao, Mingmin and Li, Tianhong and Abu Alsheikh, Mohammad and Tian, Yonglong and Zhao, Hang and Torralba, Antonio and Katabi, Dina},
  booktitle={Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)},
  year={2018}
}

相关链接


笔记结束。如果你只记住一件事:把非视觉模态(雷达)规整成"长得像图"的张量、再接成熟的视觉网络、用现成模态当老师做跨模态监督——这套"务实三件套"是把新传感器接入深度学习最快的路径,RFMask 是它在 RF 稠密剪影上的干净样本。

引用本笔记 / Cite this note
BibTeX
@online{eai_rfmask_2026,
  title       = {(readable note) RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rfmask/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?