Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 90

RadarSLAM: Radar based Large-Scale SLAM in All Weathers

31 min read · 10756 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没碰过 SLAM、也不懂雷达"的读者看的精读笔记。所有物理和公式都翻成人话,类比都来自日常生活。数字全部来自原文,没有的地方会写明"原文未报告"。

              大雪 / 大雾 / 黑夜
   相机 ──────► ✗(被雪糊住、逆光、看不见)
   激光雷达 ──► ✗(激光被雪花雨滴打散)
   毫米波雷达 ► ✓(长波能穿雨雾雪,几乎不挑天气)
                    │
                    ▼
              RadarSLAM(纯雷达)
        ┌────────────┬────────────┬──────────────┬────────────┐
        │ 位姿跟踪    │ 局部建图    │ 回环检测      │ 位姿图优化  │
        │ (odometry) │ (local BA) │ (loop close) │ (g2o)      │
        └────────────┴────────────┴──────────────┴────────────┘
                    │
                    ▼
        全局一致的轨迹(9.04 km)+ 一整张地图

1. 一句话讲什么(TL;DR)

让一台"会转圈的雷达"在大雾、大雪、黑夜里也能一边知道自己走到哪、一边把周围的地图画出来——不靠 GPS、不靠深度学习、不靠激光,只靠雷达回波 + 一套经典 SLAM 流水线。

更具体一点:输入是一台 360° 旋转 FMCW 扫描雷达(Navtech CTS350-X)每 0.25 秒转一圈拍下来的"雷达图像";输出是一条全局一致的行车轨迹 + 一张由所有关键帧拼起来的地图。它把成熟的视觉 SLAM 套路(前端跟踪 → 局部优化 → 回环 → 全图优化)原样搬到雷达上,只在两个地方换了针对雷达的新工具:一个是带离群点剔除的雷达特征匹配(用最大团算法),一个是概率化的点云生成 + M2DP 描述子做回环检测。在公开的 Oxford Radar RobotCar 数据集上,它跑出了 2.19% 的平移误差、0.0071 deg/m 的旋转误差;在作者自己在雾/雪/夜里采的序列上,相机和激光雷达都挂了,只有它还能稳稳定位。

所以这一节是想说:这篇论文造了一套"全天候 SLAM 系统",用一台不挑天气的旋转雷达,在恶劣环境里同时完成定位和建图。


2. 这是个什么场景

你有没有大雪天开车回家的经历?雪片糊在挡风玻璃上,车灯一开全是白茫茫的反光,钻进高架桥底下手机导航"嘀"一声没信号了——这时你其实是靠"记忆里的路口、模糊的路牌印象"一点点往前蹭。

自动驾驶车会遇到一模一样的窘境,而且它连"记忆"都没有。要让车自己开,它必须实时回答两个问题:我现在在哪?(定位)和周围长什么样?(建图)。这两件事同时做,学术上就叫 SLAM(Simultaneous Localization and Mapping,同步定位与建图)。问题是,车用来"看"的几种传感器,各有各的软肋:

  • 相机(车的"眼睛"):跟人眼一样,黑灯瞎火、逆光、起雾下雪就抓瞎。相机图像还有个致命缺点——它是二维投影,丢了深度,不知道前面那栋楼离你多远。
  • 激光雷达(用激光尺到处测距):精度极高,能直接给出三维点云。但激光是光,雨滴、雪花、浓雾会把激光束打散、吸收,就像在烟雾里打手电,越远越糊。
  • 毫米波/厘米波雷达(类似蝙蝠的回声定位,只是把声波换成电磁波):波长比光长得多,能"绕过"或"穿过"雨雾雪,几乎不挑天气。原文明确说 FMCW 雷达"能在各种天气下工作",正是这个特性让它成了恶劣环境里的最后一根救命稻草。

那为什么不早点用雷达做 SLAM?因为雷达图像又糊又脏。原文列了雷达的一堆毛病:距离误差、角度误差、漏检、误检,还有杂波(clutter)、旁瓣(sidelobes)、多路径反射(multi-path)、接收机饱和(saturation)。尤其是"多路径反射"——同一束波可能撞了好几个面才回来,害得前后两帧看到的东西对不上,凭空冒出一堆离群点。所以原文一句话总结:雷达数据比相机和激光都更"吵",更难用来做运动估计和 SLAM。

RadarSLAM 要做的事,就是在这么脏的数据上,把一套完整的 SLAM 系统跑起来,而且要在大尺度(几公里到几十公里)、恶劣天气下也稳。

所以这一节是想说:本文瞄准的是自动驾驶最头疼的"恶劣天气定位建图"难题——用不挑天气但很吵的雷达,把 SLAM 这件事做扎实。


RadarSLAM — 场景示意:这论文要解决的现实问题
Plate Nº IRadarSLAM — 场景示意:这论文要解决的现实问题

3. 之前的人怎么做的,为什么不够好

视觉 SLAM(ORB-SLAM2 这一脉):靠相机提取特征点、跨帧匹配来估计运动。轻便便宜、方法极成熟,但怕黑、怕逆光、怕雨雾——本质上和人眼一个限制。原文实验里,ORB-SLAM2 stereo 在恶劣序列上直接跟丢,跑不完全程。

激光雷达 SLAM(LOAM、SuMa 这一脉):靠三维点云配准(ICP/NDT)。精度是几种传感器里最高的,但激光在雾、雪里衰减严重。原文实验里 LOAM 和 SuMa 在雾和雪的序列上也漂得很快或直接失败。

早期雷达 odometry(只做里程计,不做全局):把雷达图当图像抽特征、估相邻两帧走了多远。有几条技术路线:有人用 ICP 把雷达图当点云配准 [原文 ref 4];有人专门设计雷达地标提取算法、估计雷达功率信号 [ref 5];有人做图匹配做数据关联 [ref 6];还有人用傅里叶-梅林变换(Fourier-Mellin Transform)做直接法 odometry [ref 8]。这些的共同问题是:只做前后帧的相对运动,不做回环、不做全局地图,所以误差会像滚雪球一样越积越大(这个现象叫漂移,drift)。

基于深度学习的雷达特征/里程计 [ref 10-12]:有人学"多次测量的一致性"来决定保留哪些信息、生成掩码滤噪 [ref 10-11];有人做自监督的雷达关键点检测,同时用于运动估计和回环 [ref 12]。这条路精度可以很高(原文承认深度学习方法 [ref 10] 的里程计精度比 RadarSLAM 还好),但需要大量数据训练,泛化到新城市、新雷达型号要重训。

  • 一句话对照:视觉/激光——精度够但怕天气;纯雷达 odometry——不挑天气但会漂;深度学习雷达——精度高但吃数据、难泛化。

RadarSLAM 选的是第四条路:纯雷达 + 经典几何 + 全图优化。不学习、不融合 GPS/IMU,而是把视觉 SLAM 那套"前端 + 局部优化 + 回环 + 全图优化"的完整架构,配上专门为雷达设计的两个关键组件,把漂移用回环压回去。

所以这一节是想说:前人要么精度高但怕天气,要么不挑天气但会漂或吃数据;本文的空位是"用经典 SLAM 框架 + 雷达专用组件,做一个不挑天气、不吃数据、还能压住漂移的完整系统"。


4. 这篇论文的新想法

类比:视觉 SLAM 好比"明厨亮灶里的老师傅",整套菜谱(前端跟踪 + 局部优化 + 回环 + 全图优化)已经炉火纯青。RadarSLAM 干的事,就是把这套菜谱原样搬进"地下室厨房"——食材(数据)变糊了、灯(光线)暗了,流程基本不动,只针对几样关键工序换趁手的工具。

核心想法有三条:

  1. 把成熟的图优化 SLAM 框架整体搬到雷达上:不重新发明 SLAM,而是复用视觉 SLAM 经过千锤百炼的四段式架构(pose tracking / local mapping / loop closure / pose graph optimization),保证系统层面的可靠性。

  2. 为雷达重新设计"特征匹配 + 位姿跟踪":雷达图不像相机图那样有丰富纹理,直接套视觉的匹配会一堆错配。作者用了两招剔除离群点:运动先验(车速有上限,所以匹配的搜索半径能限死)+ 成对一致性约束(真正的正确匹配之间,相对运动应该彼此一致)。后者被巧妙地转化成图论里的"最大团(maximum clique)"问题——找到互相都一致的最大一组匹配。

  3. 为雷达重新设计"回环检测":视觉 SLAM 常用的词袋模型(Bag-of-Words)在雷达上不好使(原文给了三条理由,见下文)。作者提出一个概率化的点云生成算法——用正态分布把真实反射点从斑点噪声里挑出来,再用一个对旋转不敏感的全局描述子 M2DP 给每一帧点云做"指纹",靠指纹相似度认出"我来过这"。

等等,先慢一拍——为什么不直接用 GPS 或 IMU 融合掉漂移? 因为 GPS 在隧道、高楼峡谷、桥下会失灵,IMU 单独用久了也会漂。作者想证明的恰恰是:纯雷达 + 图优化,不靠任何外部定位源,就能在恶劣天气下把 SLAM 做稳。这也是它和"雷达 + GPS/IMU 融合"路线的根本区别。

所以这一节是想说:本文的新意不在"发明新理论",而在"把成熟的图优化 SLAM 框架搬到雷达上,并为雷达量身定制了特征匹配和回环检测这两个最难的环节"。


5. 它分几步做的(方法)

在讲四大子系统之前,先搞懂雷达给我们的原始数据长什么样,因为后面所有操作都建立在它上面。

5.1 雷达数据长什么样:极坐标图与笛卡儿图

类比:想象你站在原地转一圈,每转到一个角度就朝前喊一嗓子,听回声判断那个方向多远有东西。转完一整圈,你把"每个角度、每个距离有没有东西、反射多强"记成一张表——这就是雷达图。

输入:360° FMCW 扫描雷达连续旋转,一圈被切成 Ns 个方位角(azimuth)。每个方位角发一束波,把回波按距离折叠成一行强度值(不考虑俯仰,也就是只在一个平面上扫)。

处理:原始输出是一张极坐标图(polar image)——横轴是距离、纵轴是方位角、像素亮度是回波强度。为了后续好处理,用原文的公式(1)把它转成笛卡儿图(Cartesian image),也就是我们熟悉的俯视灰度图:

公式(1)人话版:极坐标里一个点 (方位角 a, 距离 r),先算出真实角度 θ = 2π·a/Ns,再投到笛卡儿坐标 P = (γ·r·cosθ, γ·r·sinθ)。这里 γ 是"图像像素到真实米数"的缩放系数。转完之后为了更清楚,还会做双线性插值补一补。

输出:一张俯视灰度图,图上亮的地方代表"这里有东西反射"。和相机图最大的不同——雷达图自带绝对的距离信息(相机图丢了深度)。

FMCW 雷达:Frequency-Modulated Continuous Wave,调频连续波。发射的不是固定频率的"嘀",而是频率随时间线性滑动的"嘀——"。靠收到的回波频率比发出去时差了多少,反推目标多远、多快。既能测距,又能测速。

speckle noise(斑点噪声):雷达图上到处乱冒的小亮点,很多根本不是真实物体,是波相干叠加产生的噪点。后面回环检测最大的敌人就是它。

为什么这步重要:所有 SLAM 操作(提特征、匹配、建图)都在这张笛卡儿图上做。如果不理解"雷达图是俯视的、带距离的、但很吵",后面的每一步都会觉得莫名其妙。

所以这一节是想说:雷达每转一圈给你一张"带真实距离但很吵"的俯视图,这是整个系统的原材料,也是后面所有麻烦的来源。

5.2 位姿跟踪(odometry):估计"我刚才走了多远"

类比:两张拼图边对齐,看看整体挪了多少——你不用认出每一块拼图,只要知道"这堆点整体往前挪了 3 米、右转了 5 度"就行。

输入:当前帧 t 的笛卡儿雷达图 + 上一个关键帧 k 的雷达图。

处理分三步:

第一步,抽特征点。在当前帧和关键帧上分别用 SURF(一种经典的图像特征提取算法,能找出稳定的角点/斑点)提取两组关键点。

第二步,匹配 + 剔除离群点。先按特征描述子把两组点初步配对,然后用两个雷达专属的招数把错配剔掉:

  • 运动先验:车速有物理上限,所以一个点在下一帧不可能跑太远。据此把搜索半径限死,既减少错配又省计算。
  • 成对一致性约束(公式 3):任取两对匹配 (i, j),如果它们都是对的,那么"i 在两帧间的位移"和"j 在两帧间的位移"应该差不多。把所有满足这个条件的匹配对关系记进一个一致性矩阵 G——两对匹配一致就把对应格子置 1。找出互相都一致的最大一组匹配,等价于在 G 这张图里找"最大团(maximum clique)"(团 = 所有成员两两相连的子图)。

第三步,算相对位姿 + 局部优化。用剩下的可靠匹配,通过 SVD(奇异值分解)算出当前帧相对关键帧的变换 T(SE(2) 上的平移 + 旋转)。再按公式(2)C_t = C_k · T⁻¹ 得到当前位姿的初值,最后按公式(4)最小化重投影误差把 C_t 磨准。

输出:当前帧的位姿估计 C_t(在世界坐标系里我在哪、朝哪)。够条件时,当前帧会被提升为新的关键帧。

SE(2):二维刚体运动群,说人话就是"平面上的平移 + 旋转",一个位姿用 (x, y, θ) 三个数表示。因为雷达只在一个平面扫,所以是 2D 而不是 3D。

最大团(maximum clique):图论概念。一群匹配互相都"看得顺眼"(两两一致),就构成一个团;最大团就是最大的这么一群。用它来筛匹配,能一次性把不自洽的错配全踢掉。

为什么这步关键:雷达图纹理差、噪声大,直接匹配会一堆错配。运动先验 + 最大团这套"双保险"是本文让雷达 odometry 变可靠的核心工程贡献之一。

所以这一节是想说:位姿跟踪先在两帧雷达图上抽点、配对,再用"车速上限 + 最大团一致性"把错配踢干净,最后用 SVD 算出这一段走了多远——这是和视觉 SLAM 最不一样的一步。

5.3 局部建图(local mapping):一边跟踪一边把局部地图磨准

类比:你边走边画草图,走几步就回头把刚画的这一小块和周围对一对、修一修,别让小错误攒着。

输入:新生成的关键帧 + 它附近的若干关键帧和地图点。

处理:这一步和位姿跟踪并行跑在另一个线程上。每当有新关键帧产生,它的关键点就被"注册"成世界坐标系里的地图点。然后把附近的关键帧和它们能看到的地图点一起拿出来做局部集束调整(local Bundle Adjustment, BA)——按公式(5)联合优化这些关键帧的位姿和地图点的位置,最小化加权残差平方和,用 Levenberg-Marquardt 方法求解。为了省算力,上一个关键帧新建的地图点如果没被两个以上关键帧观测到,就直接删掉(culling)。

输出:更准的局部位姿和局部地图。

Bundle Adjustment(集束调整/光束平差):SLAM/三维重建里的核心优化步骤,同时微调"相机/传感器位姿"和"地图点位置",让所有观测的误差最小。局部 BA 就是只优化最近这一小片,省算力。

为什么这步有用:光靠帧间跟踪,误差会一点点渗进来。局部 BA 相当于随手把最近这一小段"擦干净",为后面的全图优化打好底子。

所以这一节是想说:局部建图在后台默默把最近一小片地图和位姿反复磨准,是压制短期误差的第二道防线。

5.4 回环检测(loop closure):认出"这地方我来过"

类比:你绕城一圈又回到出发的那个路口,一眼就认出"诶这不是早上出发的地方吗"——认出来之后,你就知道自己其实绕了一圈回到原点,可以把这一路上攒的方向感误差一次性修正回来。

输入:当前帧的雷达图。

处理分两步:

第一步,概率化点云生成。为什么不直接找每个方位角上的局部最大值当特征点?因为斑点噪声会让"假峰"到处乱冒,连没有物体的地方都是。作者提出用概率模型(公式 6):假设每个方位角扫描里各个峰值的功率 s 服从正态分布 N(μ, σ),只保留那些既超过均值 μ、又超出一个标准差 σ 的峰,把真实反射从斑点噪声里筛出来(算法 1)。这样生成的点云保留了环境结构、压掉了多路径和斑点噪声。

第二步,描述子匹配。为什么不用视觉 SLAM 常用的词袋模型(Bag-of-Words)?原文给了三条理由:(1) 雷达图像素辨识度低,相似的描述子会在整张图里到处重复;(2) 多路径反射让描述子有歧义;(3) 雷达稍微一转,场景变化巨大,描述子直方图分布会被严重扭曲。所以作者改用 M2DP——一个专为三维点云设计的、对旋转不敏感的全局描述子。M2DP 把点云投影到多个平面算密度签名,再取这些签名的左右奇异向量当描述子。当前帧的 M2DP 指纹和历史帧库比对,够像就触发一次回环。

输出:一条候选的回环约束("当前帧 ≈ 某个历史关键帧")。

描述子(descriptor):把一帧观测压成一串数字"指纹"。两帧指纹像,就大概率是同一个地方。

M2DP:一种旋转不变的三维点云全局描述子,本文借来给雷达点云做地点识别。

为什么这步关键:回环是压制长期漂移的唯一办法。没有回环,跑几公里下来轨迹一定飘走。而回环检测在雷达上最难——本文的"概率点云 + M2DP"正是它区别于纯 odometry 工作的核心,也是标题里 "large-scale" 能成立的关键。

所以这一节是想说:回环检测先用概率模型把真实反射点从噪声里挑出来,再用旋转不变的 M2DP 指纹认出"故地重游",这是把漂移压回去、支撑大尺度地图的命门。

5.5 位姿图优化(pose graph optimization):把走偏的轨迹一次性拉直

类比:老师批完卷子发现你从第 3 页开始就有个系统性小错,一直错到第 20 页;他不会让你每页单独改,而是找到"这里其实应该接回第 3 页"的那个约束,把这一整段的误差平摊回去改对。

输入:所有关键帧位姿(图的节点)+ 所有帧间约束和回环约束(图的边)。

处理:随着雷达移动,一张**位姿图(pose graph)**逐渐建起来——每个节点是一帧位姿,每条边是一段相对位移约束。一旦检测到回环,就用 ICP(迭代最近点)配准当前帧和历史帧算出精确的相对变换,并用 RANSAC 做几何检验(防止假回环)。如果 ICP 收敛,就把这条回环约束加进图里,然后用 g2o 库对所有关键帧位姿做全局优化。优化完再更新所有地图点,得到一张全局一致的地图。

输出:一条全局一致的轨迹 + 一张全局地图。

pose graph(位姿图):一张"我去过哪、相对怎么走"的关系网。优化它就是在所有约束(尤其是回环这条"跨越很多帧的强约束")之间找一个让总误差最小的位姿组合。

g2o:一个广泛使用的图优化 C++ 库,专门解这种非线性最小二乘问题。

RANSAC:一种"随机采样 + 投票"的鲁棒估计方法,专门排除离谱的离群点。这里用来检验回环配准靠不靠谱。

为什么这步是收尾:前面攒下的所有漂移,都在这里被回环约束"拉回去"分摊掉。这一步做完,几公里的轨迹才能闭合成一条干净的环。

所以这一节是想说:位姿图优化是系统的收尾——把所有帧间约束和回环约束一起扔进 g2o,让长期累积的漂移在闭环处被一次性拉直,输出全局一致的轨迹和地图。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【RadarSLAM: Radar based Large-Scale … · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

RadarSLAM — 方法示意:核心 pipeline
Plate Nº IIRadarSLAM — 方法示意:核心 pipeline

6. 关键数字(What works)

6.1 Oxford Radar RobotCar 定量结果(KITTI 里程计评测标准)

指标 数值 说明
平移误差(translation) 2.1854% RadarSLAM 完整系统,按 100–800m 分段平均
旋转误差(rotation) 0.0071 deg/m 完整系统
对比:纯 odometry(无回环) 明显更差 原文强调 SLAM 版比纯里程计准得多
对比:几何法雷达里程计 [ref 5] RadarSLAM 更优 本文优于这一基线
对比:深度学习雷达里程计 [ref 10] RadarSLAM 略逊 本文承认在纯里程计精度上不如学习方法

说明:原文因篇幅只给了 5 条序列的详细结果;[ref 5][ref 10] 无开源实现,原文只引用了它们论文里报告的平均误差,因此没有逐序列对比。

6.2 数据集与传感器参数

项目 数值
公开数据集 Oxford Radar RobotCar(32 条同路线序列,带真值)
雷达型号 Navtech CTS350-X(360° FMCW 扫描雷达)
每圈读数 3768 个功率读数
距离分辨率 4.32 cm
方位角数 400 个
扫描频率 4 Hz(每 0.25 秒一圈)
最大量程 163 m
示例地图长度 9.04 km(序列 10-12-32-52)

6.3 自采恶劣天气序列(对比传感器鲁棒性)

序列 长度 (km) 是否有回环 相机 激光雷达 雷达
Fog/Rain 1 4.7 失败 受影响 成功
Fog/Rain 2 4.8 失败 受影响 成功
Snow 8.7 完全遮挡 受影响 成功
Countryside 3.4 成功
Night 5.6 运动模糊 成功

6.4 运行速度

指标 数值
运行帧率 ~6 Hz(Intel i7 2.60GHz CPU,16GB RAM,无 GPU)
测试序列时长 37 分钟(约 9000 张雷达图)

生活语言解读:2.19% 的平移误差意味着走 100 米大概偏 2 米出头——对纯雷达、不靠 GPS 来说相当扎实。最有说服力的是 6.3 表:在雾、雪、夜里,相机被水滴糊死、被雪完全遮挡、夜里运动模糊;激光雷达被雾雪影响;只有雷达在所有天气下都能稳定定位。这就是标题 "in All Weathers" 的底气。而且它在一台普通笔记本 CPU 上就能跑到 6 Hz,是真能实时用的。

所以这一节是想说:数字证明了两件事——纯雷达 SLAM 精度够用(100 米偏 2 米),而且在相机/激光全挂的恶劣天气里它是唯一还能活的传感器。


7. 实验结果说明了什么

原文的实验回答了四个关键问题:

问题一:纯雷达 SLAM 到底准不准? 在 Oxford 数据集上,完整 RadarSLAM 拿到 2.19% 平移 / 0.0071 deg/m 旋转,且明显优于自家的纯 odometry 版本。这说明回环 + 全图优化确实把漂移压下去了——加了回环的完整系统比只做前端的里程计准得多。相比几何法基线 [ref 5] 它更好;相比深度学习基线 [ref 10] 它稍逊——作者很诚实地承认了这一点,说明它的卖点不是"里程计精度最高",而是"不吃数据、不挑天气的完整系统"。

问题二:恶劣天气下它比相机/激光强多少? 在自采的雾/雪/夜序列上,ORB-SLAM2、LOAM、SuMa 要么跟丢、要么快速漂移,原文只能报告它们"丢失跟踪之前"的结果。尤其雪天序列——雷达前半圈的数据都被积雪盖住了还能跑(Fig. 8),而相机被雪完全遮挡。这是全篇最强的论据:它把"能不能用"这件事从相机/激光的"看天吃饭"变成了雷达的"全天候"

问题三:回环检测的概率点云真的有必要吗? Fig. 5 做了对比:直接找局部最大值会产生大量斑点噪声假峰(Fig. 5b),而概率点云算法(Fig. 5c)保留了环境结构、压掉了多路径和斑点。这直接支撑了回环能在雷达上成立——没有干净的点云,M2DP 指纹就不可靠,回环就会误触发。

问题四:它能实时跑吗? 在纯 CPU 笔记本上 ~6 Hz,处理 37 分钟约 9000 张图的序列(Fig. 10)。这说明它不是"实验室里跑一晚上出结果"的离线方法,而是能装车实时用的。

所以这一节是想说:四组实验分别证明了"回环压住了漂移""恶劣天气只有雷达能活""概率点云是回环的前提""系统能实时"——每一条都有对比或可视化支撑,不是自说自话。


8. 你应该懂的几个新词

SLAM(Simultaneous Localization and Mapping,同步定位与建图):一边估计自己在哪、一边把周围地图画出来。类比:你到一个陌生城市,边走边认路边在脑子里画地图,两件事同时进行。

FMCW 扫描雷达:调频连续波雷达,发射频率随时间线性变化的电磁波,靠回波频差测距,配合机械旋转扫一圈。类比:你唱"嘀——"从低音滑到高音,根据回声音调差多少判断障碍物多远。

polar image / Cartesian image(极坐标图 / 笛卡儿图):雷达原始输出是极坐标图(横轴距离、纵轴角度),处理时常转成我们熟悉的俯视灰度图(笛卡儿图)。类比:极坐标图像"雷达屏幕上的扇形扫描线",笛卡儿图像"从天上俯拍的照片"。

odometry(里程计)与 drift(漂移):里程计估计"前后两帧走了多远"。每帧的小误差不停累加,跑久了轨迹会"飘走",就是漂移。类比:闭着眼睛数步子走路,走十步还行,走一千步就完全不知道在哪了。

loop closure(回环检测/闭环):认出"我现在在的地方之前来过",然后加一条跨越很多帧的强约束,把累积漂移拉回正。类比:绕城一圈回到出发点,一下就能修正一路攒的方向误差。

pose graph optimization(位姿图优化):把所有位姿当节点、所有相对约束当边,全局求解一个让总误差最小的位姿组合。类比:一张用橡皮筋连起来的关系网,回环那条橡皮筋一拉紧,整张网就归位了。

maximum clique(最大团):图论里"两两都相连的最大子图"。本文用它从一堆匹配里挑出互相都一致的最大一组,剔除错配。

M2DP:一种旋转不变的三维点云全局描述子,本文用来给雷达点云做"地点指纹",实现回环检测。

Bundle Adjustment(集束调整):同时优化传感器位姿和地图点位置的经典步骤。局部 BA 只优化最近一小片,省算力。

所以这一节是想说:读懂这篇论文,关键是把"SLAM 术语(odometry/drift/loop closure/pose graph/BA)"和"雷达术语(FMCW/polar image/M2DP/最大团)"这两套词都摸一遍。


9. 它有什么搞不定的

里程计精度不如深度学习方法:原文自己承认,纯里程计精度上它逊于学习式雷达里程计 [ref 10]。它赢在"不吃训练数据、不挑场景",但如果你只看单纯的相对位姿精度,学习方法更强。

只做 2D、不估高度:雷达只在一个平面扫,位姿是 SE(2)(x, y, θ)。上下坡、多层立交这种有明显高度变化的场景,2D 假设会带来误差。对比视觉/激光的 6 自由度位姿,这是信息上的先天缺失。

依赖回环来压漂移:没有回环的序列(比如自采的两条 Fog/Rain 就没回环),漂移只能靠前端和局部 BA 硬扛,长距离下会积累。回环是它压漂移的主力,一旦路线不闭合就少了这道保险。

极端积雪会盖住雷达:雪天序列里雷达前半圈数据被积雪覆盖(Fig. 8)——虽然还能跑,但传感器本身被物理遮挡时性能会打折。雷达不挑天气,但不代表它对"糊在天线上的雪"免疫。

多路径和斑点噪声始终是隐患:概率点云和最大团缓解了噪声,但没根治。在多路径特别严重的环境(金属结构密集的城市峡谷)里,误匹配和假回环的风险仍然存在。

没有融合 IMU(原文列为未来工作):作者在结论里明说未来要融合 IMU 提升精度。也就是说当前纯雷达版本在精度上还有明显上升空间,尤其是短时快速运动时。

所以这一节是想说:它的强项是"全天候、不吃数据、完整系统",但代价是里程计精度不顶尖、只做 2D、强依赖回环,且没融合 IMU——这些正是后续工作的改进空间。


10. 它和别的几篇是什么关系

方法论上游——视觉 SLAM(ORB-SLAM2、Cartographer):本文的四段式架构、关键帧机制、局部 BA、pose graph 全部借鉴自视觉 SLAM。可以说 RadarSLAM 是"视觉 SLAM 的方法论 + 雷达的传感器优势"的结合体。

传感器思路上游——millimap、rf-slam 系列:本仓库里的 millimap.md(毫米波建图)和 rf-slam.md(早期 RF SLAM)都在做"用穿透性强的电磁波代替光"这件事。RadarSLAM 是把这条思路推进到"完整大尺度 SLAM 系统"的代表。

数据集层面——Oxford Radar RobotCar / MulRan:本文和这类公开雷达数据集互相催化——有了标准数据集,雷达 SLAM 才能像视觉 SLAM 一样做公平 benchmark。

同期与后续——雷达里程计/定位一条线:原文对比的几何法 [ref 5] 和深度学习法 [ref 10-12] 是同期的雷达里程计工作。RadarSLAM 之后,社区涌现了 Under the Radar、Kidnapped Radar、RaLL(Radar Localization Learning)等一系列雷达 SLAM/定位工作,以及把雷达和 lidar/camera 融合的多模态 SLAM。

横向参考——本仓库 RF 感知线nlos-mmwave.md 关注非视距毫米波感知,rf-pose-through-wall.md 关注穿墙人体感知——它们和 RadarSLAM 共享"用电波看世界"的物理底层,但任务不同(感知人体 vs 定位建图)。

所以这一节是想说:RadarSLAM 站在"视觉 SLAM 方法论"和"RF 感知硬件"两条脉络的交汇点,是把"用电波做完整 SLAM"这件事做扎实的里程碑。


11. 和本导读的关系

本篇对应导读 Ch19: 射频感知。Ch19 把射频感知分为三层:位置层(Where)、形状层(What shape)、语义层(What is it)。RadarSLAM 横跨位置层 + 形状层——它既回答"我在哪"(位置/轨迹),又回答"周围长什么样"(地图/形状),是 RF 感知里少见的"完整系统级"工作。

Ch19 反复强调的核心方法论是物理约束驱动系统设计:因为雷达图又糊又吵、有多路径和斑点噪声,所以本文不能照搬视觉的词袋回环,而要专门设计概率点云 + M2DP。这正是 Ch19 讲的"深度学习/工程不是替代物理,而是弥补物理的不足"。

Ch19 里还讨论了 RF 的三大超能力(穿墙、穿烟穿雾、无需光照)——RadarSLAM 精准踩在"穿烟穿雾 + 无需光照"这两个超能力上,把它们从"实验室 demo"推进到"能装车跑几公里的全天候 SLAM"。与 Ch19 里 milliMap(用 LiDAR 教毫米波建图)、mmCLIP(用 CLIP 语义教雷达)这类"跨模态学习"路线相比,RadarSLAM 走的是纯几何、不学习的另一条务实路线,正好和它们形成对照。

从阅读路线看,建议先读 rf-pose-through-wall.md(位置层,感知人体)建立"用电波看东西"的直觉,再读本篇看"电波怎么用来定位建图",最后读 millimap.md 看形状层的建图细节,能把 RF 感知从"看人"到"看路"的脉络串起来。

所以这一节是想说:本篇是 Ch19 射频感知章节里"完整 SLAM 系统"的代表,体现了"物理约束驱动设计"和"RF 全天候超能力"两个核心主题。


12. 思考题

Q1:为什么雷达图上直接找每个方位角的局部最大值当特征点,会产生一堆"假峰"?本文的概率模型是怎么把真实反射从噪声里挑出来的?

提示

回忆斑点噪声(speckle noise)的来源——电磁波相干叠加会在没有物体的地方也产生亮点。局部最大值算法只看"比周围亮",无法区分真峰和噪声峰。本文假设每个方位角扫描里峰值功率服从正态分布 N(μ, σ),只保留同时满足"超过均值 μ"和"超出一个标准差 σ"的峰。想想为什么"超出一个标准差"这个统计条件能筛掉大部分随机噪声?

Q2:本文为什么不用视觉 SLAM 里成熟的词袋模型(Bag-of-Words)做雷达回环检测?原文给了三条理由,你能复述并解释吗?

提示

三条理由:(1) 雷达图像素辨识度低——相似描述子会在整张图里重复;(2) 多路径反射让描述子有歧义;(3) 雷达稍微一转,场景变化巨大,描述子直方图分布被严重扭曲。想想 M2DP 的"旋转不变"特性恰好对应解决了第三条中的哪个问题?

Q3:位姿跟踪里用"最大团(maximum clique)"来剔除错配。如果不用一致性约束、只靠特征描述子匹配,会发生什么?为什么雷达比相机更需要这道保险?

提示

相机图纹理丰富,描述子辨识度高,错配相对少。雷达图纹理差、噪声大,同样的描述子会在很多地方重复,光靠描述子匹配会一堆错配。成对一致性约束的思想是"正确的匹配之间相对运动应该彼此一致"。想想如果错配进入了 SVD 求解,估出来的相对位姿会怎样?

Q4:RadarSLAM 只做 SE(2)(平面上的 x, y, θ)位姿。在什么样的真实场景下,这个 2D 假设会带来明显误差?

提示

雷达只在一个平面扫,不估高度。想想上下坡、多层立交桥、地下车库螺旋坡道这类场景——车的真实运动有明显的垂直分量,但 2D 位姿完全忽略了它。这会如何影响轨迹估计和回环时的匹配?

Q5:原文承认 RadarSLAM 的纯里程计精度不如深度学习方法 [ref 10],但它仍然值得发表。它的核心价值到底在哪?

提示

从三个角度想:(1) 它是完整的 SLAM 系统(有回环、有全局地图),不只是里程计;(2) 它不吃训练数据、不需要为新城市/新雷达重训;(3) 它在恶劣天气下是唯一能活的传感器方案。研究的价值不总是"某个指标最高",有时是"提供了一条别人没有的能力"。

Q6:为什么回环检测对"大尺度"SLAM 特别重要?如果一条几公里的路线完全没有回环(比如一直往前开不回头),RadarSLAM 会怎样?

提示

回顾漂移(drift)的累积特性——每帧小误差不停叠加。回环提供了一个"我回到已知位置"的强约束,能一次性把整段漂移拉回。没有回环,漂移只能靠前端和局部 BA 硬扛。原文自采的两条 Fog/Rain 序列就没有回环,想想它们的精度会比有回环的 Snow/Night 序列如何?

Q7:作者在结论里说未来要融合 IMU。IMU 能补雷达的哪些短板?为什么"纯雷达 + IMU"可能比"纯雷达"或"纯 IMU"都好?

提示

IMU(惯性测量单元)测的是加速度和角速度,短时间内很准但长期会漂;雷达能提供绝对的距离结构但帧率低、快速运动时匹配可能失败。想想两者的误差特性是否互补——一个短期准、一个长期有绝对参照。这种"高频 IMU + 低频雷达"的融合在视觉惯性里程计(VIO)里是成熟范式吗?


13. 一些好奇心问答(FAQ)

Q1:为什么雷达能穿雾雪,激光和相机不行?

关键是波长。可见光波长几百纳米、激光也在这个量级,遇到和波长尺寸相近的雨滴雪花会被强烈散射、吸收。雷达用的是毫米/厘米波,波长比雨雪颗粒大得多,能"绕过"它们继续传播。这是纯物理特性,不是算法能弥补的——所以恶劣天气感知从传感器选型上就赢了一半。

Q2:这台雷达贵吗?普通人能玩吗?

原文用的 Navtech CTS350-X 是工业级 360° 扫描雷达,不便宜(几千到上万美元量级),主要面向自动驾驶/机器人研究。它和汽车前保险杠里那种便宜的毫米波雷达不是一个东西——那种是固定视角、低分辨率的;这种是机械旋转、高分辨率、能成"图"的。

Q3:为什么帧率只有 4 Hz?会不会太慢?

因为它靠机械旋转扫一圈,转一圈需要 0.25 秒。相比激光雷达(10-20 Hz)确实慢。但对城市/公路车速来说,4 Hz 配合运动先验够用了。系统本身能跑到 6 Hz 处理速度,瓶颈在雷达硬件的旋转速度而不是算法。

Q4:它和特斯拉/自动驾驶公司用的雷达是一回事吗?

思路相关但不完全一样。量产车多用固定的毫米波雷达阵列(现在很多转向纯视觉或 4D 成像雷达),本文用的是可旋转的扫描雷达,能拍出接近"俯视地图"的图像。RadarSLAM 证明的是"扫描雷达做全天候 SLAM 可行",属于研究性验证。

Q5:概率点云那一步,为什么用"均值 + 一个标准差"而不是别的阈值?

这是个经验选择。正态分布下,超过"均值 + 1 个标准差"大约保留最强的约 16% 的峰。太松(比如只超过均值)会漏进噪声,太紧(比如均值 + 3 个标准差)会把真实弱反射也筛掉。作者选的这个阈值在"保留结构"和"压噪声"之间取了个平衡(Fig. 5c 的效果)。

Q6:如果两个不同的地方雷达图长得很像,会不会误触发回环?

有可能,这是回环检测的通病(叫感知混淆,perceptual aliasing)。本文用两道防线降低风险:M2DP 描述子的相似度筛选是第一道,回环后用 ICP + RANSAC 做几何检验是第二道——只有几何上也自洽的候选才被接受。但在高度重复的环境(一模一样的隧道、停车场)里,误触发的风险仍然存在。

Q7:为什么不直接用激光雷达 + 除雪算法,非要换传感器?

因为激光在浓雾/暴雪里是物理级衰减,不是"加点噪声"那么简单——很多激光束根本回不来,信息直接丢失,再强的算法也没法从"没有的数据"里恢复。换成能穿透的雷达,是从源头解决问题。这也是本文想传达的核心观念:有些问题在传感器层面解决,比在算法层面硬抠更根本

所以这一节是想说:RadarSLAM 的很多设计选择(雷达型号、帧率、阈值、双重回环校验)背后都是"物理特性 + 工程平衡"的权衡,理解这些能帮你判断它在你的场景里适不适用。


14. 如果你想再深入

Mur-Artal & Tardós, "ORB-SLAM2"(IEEE T-RO 2017) — 本文四段式架构的方法论母本。理解了 ORB-SLAM2 的关键帧、局部 BA、pose graph、回环,再看 RadarSLAM 就知道哪些是"照搬"、哪些是"为雷达改的"。建议先读它。

Barnes et al., "Under the Radar: Learning to Detect Keypoints in Odometry"(ICRA 2020) — 同期的学习式雷达里程计代表(可能就是原文对比的 [ref 10-12] 一脉)。和 RadarSLAM 对照读,能看清"几何法 vs 学习法"两条路线的取舍。

Oxford Radar RobotCar Dataset 论文(ICRA 2020) — 本文的主要评测数据集。想复现或做雷达 SLAM 研究,先把这个数据集的采集设置、传感器标定、真值来源搞清楚。

He et al., "M2DP: A Novel 3D Point Cloud Descriptor and Its Application in Loop Closure Detection"(IROS 2016) — 本文回环检测用的描述子原始论文。想懂"雷达点云怎么变成一个旋转不变的指纹",源头在这。

RadarSLAM 项目页http://pro.hw.ac.uk/radarslam ,有作者自采的恶劣天气数据和更多可视化,比论文直观。

g2o 库文档https://github.com/RainerKuemmerle/g2o ,本文位姿图优化的工具。想动手做 SLAM 后端优化,这是绕不开的基础设施。

所以这一节是想说:要理解方法论先读 ORB-SLAM2;要理解雷达专属组件读 M2DP 和 Under the Radar;要复现先搞 Oxford 数据集和 g2o;要建直觉去项目页看恶劣天气可视化。


15. 原文信息

本文(笔记所评论文)

@article{hong2020radarslam,
  title={RadarSLAM: Radar based Large-Scale SLAM in All Weathers},
  author={Hong, Ziyang and P{\'e}tillot, Yvan and Wang, Sen},
  journal={arXiv preprint arXiv:2005.02198},
  year={2020}
}

关键方法论前驱(ORB-SLAM2)

@article{murartal2017orbslam2,
  title={ORB-SLAM2: An Open-Source SLAM System for Monocular, Stereo, and RGB-D Cameras},
  author={Mur-Artal, Ra{\'u}l and Tard{\'o}s, Juan D.},
  journal={IEEE Transactions on Robotics},
  volume={33},
  number={5},
  pages={1255--1262},
  year={2017}
}

相关链接


笔记结束。如果你只记住一件事:在传感器有强物理约束的任务里,"把成熟框架搬过来 + 为新数据的痛点定制关键几步"是一条比"从零发明"更务实、更可靠的研究路径——RadarSLAM 用一台不挑天气的雷达,把这条路走通了。

引用本笔记 / Cite this note
BibTeX
@online{eai_radarslam_2026,
  title       = {(readable note) RadarSLAM: Radar based Large-Scale SLAM in All Weathers},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2020 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/radarslam/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?