Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 89

High Resolution Point Clouds from mmWave Radar

13 min read · 4578 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过雷达/点云"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么便宜的毫米波雷达点云又稀又乱,而 RadarHD 用一个神经网络就能把它变成接近激光雷达那样清晰的点云,还能在浓烟里工作"。

一句话讲什么(TL;DR)

训练一个端到端的神经网络,把一颗便宜的单芯片毫米波雷达"看糊的、又稀又乱的"数据,翻译成接近激光雷达(LiDAR)那样清晰、稠密的点云——而且在浓烟弥漫、雷达没见过的房间里也照样管用,生成的点云还好到能直接喂给现成的激光雷达建图/里程计软件。

所以这一节是想说:这篇论文用深度学习给廉价毫米波雷达"提清晰度",让它输出激光级的点云。


这是个什么场景

机器人和自动驾驶要"看清"周围的三维结构,主流靠激光雷达(LiDAR)——它发激光、测反射,能生成又密又准的点云(一堆代表物体表面的三维点)。但激光雷达有两个硬伤:,而且怕烟雾灰尘(激光会被颗粒散射,火场、沙尘暴里就废了)。

毫米波雷达正好补这两个短板:便宜(一颗单芯片才几十块)、而且发的是无线电波,穿烟穿尘不怕黑。消防、矿井、沙尘环境里它是理想传感器。问题是——便宜雷达的成像质量太差:点云极稀疏(没几个点)、还混着大量假点(镜面反射、旁瓣杂散),根本没法像激光那样勾勒出清晰的墙壁和物体轮廓。

RadarHD 要问的是:能不能用深度学习,把廉价雷达这堆"稀又乱"的数据,提升成接近激光雷达那样清晰稠密的点云?

所以这一节是想说:目标是让又便宜又抗烟尘的毫米波雷达,也能产出接近激光雷达质量的点云。


High Resolution Point Clouds from mmWave Radar — 场景示意:这论文要解决的现实问题
Plate Nº IHigh Resolution Point Clouds from mmWave Radar — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 传统雷达信号处理(CFAR 等):用固定的算法从雷达回波里挑"目标点"。但单芯片雷达分辨率太低、假点太多,挑出来的点云还是又稀又乱。
  • 直接用激光雷达:质量好,但贵、怕烟尘——正是要规避的。
  • 把雷达当普通图像做图像处理:论文特别指出,雷达信号有"sinc 状扩散"(一个真实目标在雷达图里摊成一团旁瓣,不是一个干净的点),不符合传统图像处理的假设,直接套图像方法效果差。
  • 已有的雷达增强方法:多针对特定场景或需要多芯片/扫描式雷达,把"最便宜的单芯片"做到激光级的很少。
  • 共同短板:传统处理挑不出好点云,图像方法水土不服,激光又贵又怕烟。

所以这一节是想说:传统信号处理挑不出清晰点云,套图像方法又水土不服,缺一个专为雷达特性设计的学习方案。


这篇论文的关键想法

三个关键点:

第一,把"提清晰度"变成一个端到端的学习问题。 不再用手工规则从回波里挑点,而是训练一个神经网络:输入是低分辨率雷达数据,输出是"激光雷达那样"的高分辨率点云。让网络自己从数据里学会"哪些回波是真墙、哪些是假点、真实结构长什么样"。

第二,用"雷达 + 激光"配对数据来教。 关键在监督信号:作者同时采集大量原始 I/Q 雷达数据同场景的激光雷达点云,配成对子。激光点云当"标准答案",教网络把雷达数据翻译成激光级点云。数据覆盖多种室内场景,让网络学到通用规律。

第三,为雷达特性定制处理,克服镜面/杂散反射和 sinc 扩散。 因为雷达信号不像普通图像,作者设计的网络和数据表示专门应对"镜面反射、杂散假点、sinc 状能量扩散"这些雷达独有的麻烦(具体架构需读原文,思路上类似图像超分辨/翻译网络,但适配雷达的极坐标/距离-角度表示)。

结果:即使在训练时没见过的房间、甚至浓烟遮挡下,也能生成丰富清晰的点云,且质量高到能直接接现成激光雷达的里程计和建图流程。

所以这一节是想说:核心是"端到端学习 + 雷达-激光配对监督 + 针对雷达特性定制",把糊雷达提成激光级点云。


High Resolution Point Clouds from mmWave Radar — 方法示意:核心 pipeline
Plate Nº IIHigh Resolution Point Clouds from mmWave Radar — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:数据表示、配对数据采集、翻译网络、输出点云与下游对接。逐块按"输入 → 处理 → 输出"讲。

1. 雷达数据表示:把回波整理成网络能学的形式

输入。 单芯片毫米波雷达的原始 I/Q 回波数据。

处理。 把原始回波处理成一种保留距离和角度信息的表示(如距离-方位角的雷达热力图/图像)。要点在于:雷达的能量呈 sinc 状扩散、还有镜面/杂散反射,所以这个表示不能当普通照片看待,网络要在这种"带旁瓣、带假点"的输入上学。

I/Q 信号 / 距离-方位图:雷达回波的标准表示,横轴/纵轴对应距离和角度,亮度是回波强度。sinc 扩散指一个点目标会在图上摊成一条亮纹而非一个亮点。

输出。 适合喂给神经网络的雷达输入表示。

所以这一节是想说:先把带旁瓣、带假点的雷达回波整理成网络友好的距离-角度表示。

2. 配对数据采集:雷达和激光同场景对齐

输入。 一套同时装了单芯片毫米波雷达和激光雷达的采集设备,在多种室内环境里走。

处理。 同一时刻、同一场景,雷达采一份数据、激光采一份点云,两者时空对齐配成对子。激光点云是"标准答案"(ground truth)。作者在多样的室内场景采集大量这样的配对,保证网络学到的是通用规律而非某个房间的特例。

输出。 大规模"低分辨率雷达输入 ↔ 高分辨率激光点云答案"的训练数据。

所以这一节是想说:用激光点云当标准答案、雷达当输入,配对起来就是教网络"提清晰度"的教材。

3. 翻译网络:从糊雷达生成清晰点云

输入。 雷达输入表示(低分辨率、带假点)。

处理。 一个端到端神经网络(思路类似图像超分辨/图到图翻译,但适配雷达特性)学习一个映射:低分辨率雷达 → 高分辨率、激光级的点云表示。训练时用激光答案做监督,网络逐渐学会:抑制镜面/杂散假点、补全稀疏结构、还原真实的墙壁和物体轮廓。因为雷达穿烟,网络学到的结构信息在烟雾下依然成立。

输出。 一个能把任意糊雷达输入翻译成清晰点云的模型。

所以这一节是想说:网络在配对数据上学会"去假点 + 补结构",把稀乱雷达变成激光级点云。

4. 输出点云与下游对接

输入。 网络输出的高分辨率点云。

处理。 关键验证:这些生成的点云不是"好看就行",而要好用——作者把它们直接喂给现成的激光雷达里程计和建图(SLAM)软件,看能不能正常工作。能用,就说明点云质量真的达到了实用级别。

输出。 可直接用于导航/建图的高质量点云,且在未见场景和浓烟下依然有效。

下面用 ASCII 图把整体流程画出来:

   训练:
     雷达 I/Q ─► 距离-角度表示(稀+假点) ─┐
                                          ├─► 翻译网络 ─► 生成点云
     激光雷达点云(标准答案) ─────────────┘        │  与答案比对, 反向优化
                                                    ▼
   推理(含未见房间/浓烟):
     糊雷达 ─► 翻译网络 ─► 激光级清晰点云 ─► 现成 LiDAR SLAM/里程计

再用一张 ASCII 图对比"传统雷达点云 vs RadarHD":

   传统雷达:  . ·   ·      .   ·     (稀疏 + 假点, 认不出墙)
   RadarHD :  ▁▁▁▁▁▁▁▁     ▏        (稠密清晰, 墙壁轮廓分明, 接近激光)

所以这一整节是想说:RadarHD = 雷达表示 + 雷达/激光配对 + 翻译网络 + 下游对接验证,把糊雷达炼成可用的激光级点云。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【High Resolution Point Clouds from m… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

关键数字(What works)

数字来自论文摘要(arXiv:2206.09273);具体的分辨率提升指标、点云精度数值属正文,标注"需读原文"。

项目 数值/结论 说明
传感器 单芯片毫米波雷达 低成本
监督信号 激光雷达点云 高分辨率答案
输入 原始 I/Q 雷达数据 端到端从原始学
训练场景 多样室内 求泛化
未见场景 仍能生成丰富点云 泛化验证
浓烟遮挡 仍有效 雷达穿烟优势
下游 可接现成 LiDAR SLAM/里程计 质量达实用级

三个要点:第一,端到端从原始 I/Q 学,而非在传统处理后的稀疏点上修补,让网络能最大限度榨取雷达信息;第二,未见场景 + 浓烟下仍有效,证明它学到的是通用结构而非记住房间,且发挥了雷达穿烟的物理优势;第三,点云能直接接现成激光 SLAM,是"质量达实用级"的硬证据——这比任何主观指标都有说服力。

所以这一节是想说:从原始学、泛化到未见/浓烟、点云能接现成激光软件,是 RadarHD 的三个关键证据。


实验结果说明了什么

论文实验主要证明:

  • 能提清晰度:从又稀又乱的雷达数据生成接近激光质量的稠密点云,验证了"用学习提分辨率"的可行性。
  • 泛化到未见场景:在训练时没见过的房间也能生成好点云,说明学到的是通用的"雷达→结构"映射。
  • 抗烟雾:在浓烟遮挡下依然有效,发挥了雷达相对激光/视觉的核心物理优势——这是它最有价值的应用场景(消防、矿井)。
  • 点云真的好用:直接喂给现成激光雷达里程计/建图软件能正常工作,说明质量达到了实用门槛,而非仅仅"看起来清楚"。

所以这一节是想说:实验证明生成的点云既清晰、又泛化、又抗烟、还能直接被现成激光软件使用。


你应该懂的几个新词

  • 毫米波雷达(mmWave radar):发毫米波无线电、看回波的传感器,便宜、穿烟穿尘、不怕黑。
  • 激光雷达(LiDAR):发激光测反射,生成又密又准的点云,但贵且怕烟尘。
  • 点云(point cloud):一堆代表物体表面的三维点,用来描述场景几何。
  • I/Q 信号:雷达回波的标准复数表示,保留幅度和相位。
  • 距离-方位图(range-azimuth heatmap):雷达回波按距离和角度摊开的热力图。
  • sinc 扩散 / 旁瓣:一个点目标在雷达图里摊成亮纹而非亮点,是假点和模糊的来源。
  • 镜面/杂散反射(specular/spurious reflection):雷达里的假目标,主要噪声。
  • 端到端学习(end-to-end):从原始输入直接学到最终输出,中间不靠手工步骤。

所以这一节是想说:毫米波雷达 vs 激光、点云、sinc 扩散是理解本篇的关键词,也是射频感知通用词汇。


它有什么搞不定的

  • 仍受雷达物理分辨率限制:网络能"补"和"去噪",但雷达本身角分辨率有限,极精细的结构仍难还原,且补出来的细节有"猜"的成分。
  • 可能产生幻觉结构:既然是学习生成,网络可能补出实际不存在的墙或物体(尤其在训练分布外)。
  • 依赖配对数据:需要激光当答案来训练,采集成本不低;覆盖不到的环境类型可能退化。
  • 动态物体/人:训练多在静态场景,场景里有移动的人时表现如何需谨慎。
  • 室内为主:论文聚焦室内,室外大尺度场景是否同样有效需另行验证。

所以这一节是想说:它提升明显,但受雷达物理极限、幻觉风险、配对数据依赖和场景范围限制。


它和别的几篇是什么关系

  • 同赛道:milliEgo(用雷达做里程计)、RF-SLAM(射频建图定位)是毫米波感知的邻居,RadarHD 专注"把雷达变清晰点云"这一环,可给它们提供更好的输入。
  • 前身:传统雷达信号处理(CFAR)、以及"雷达穿烟"类工作(如 See through smoke)是背景。
  • 技术邻居:图像超分辨、图到图翻译(如 pix2pix、U-Net)提供了"学习提清晰度"的范式,RadarHD 把它适配到雷达。
  • 对照:激光雷达是它的"标准答案"和要逼近的目标;视觉方法是怕烟的对照。

所以这一节是想说:RadarHD 是"用学习给雷达提清晰度"的代表,为毫米波感知生态提供更好的点云输入。


和本导读的关系

本笔记对应导读 Ch19: 射频感知。Ch19 讲的是"用无线电波替代/补充视觉去感知世界",核心动机是电磁波能穿透遮挡、不怕烟尘黑暗。RadarHD 在这条线里代表"雷达成像质量提升"这一支——它把廉价雷达的短板(点云稀乱)用深度学习补上,让"便宜 + 抗烟 + 清晰"三者兼得。读完本篇再看同章的 milliego(雷达里程计)、rf-slam(射频建图)、rfpose-ot(雷达估姿态),能拼出"毫米波感知能做什么"的全景。

所以这一节是想说:把 RadarHD 放进 Ch19,它对应"雷达成像/点云增强"这一格。


思考题

Q1:为什么"把雷达数据当普通照片做图像处理"效果不好?

提示

雷达有 sinc 扩散和镜面/杂散反射,一个点摊成亮纹、还有假点,不符合普通图像的假设。需要为雷达特性定制。

Q2:用激光点云当"标准答案"来训练,隐含了什么前提和风险?

提示

前提是激光点云在训练时可用且准确。风险是网络学的是"逼近激光",激光的盲区/误差也会被继承,且训练分布外可能失效。

Q3:RadarHD 生成的点云可能有"幻觉结构",这在导航中有多危险?如何缓解?

提示

补出不存在的墙可能导致误判、碰撞或绕路。可结合置信度、多帧一致性、或与其它传感器交叉验证。

Q4:为什么"能接现成激光 SLAM"比"点云看起来清晰"更有说服力?

提示

好看是主观的,能被为激光设计的软件正常使用是客观的实用门槛。想想"可用性"作为评价标准的价值。

Q5:浓烟下 RadarHD 仍有效,靠的是什么物理性质?激光/相机为什么不行?

提示

毫米波波长远大于烟雾颗粒,基本不被散射;激光和可见光会被烟雾颗粒散射衰减。

Q6:端到端从原始 I/Q 学,相比"在传统处理后的稀疏点上修补",好处是什么?

提示

传统处理已经丢了很多信息,在其结果上修补上限低。从原始学能让网络榨取更多原始信息。

Q7:RadarHD 提供清晰点云,milliEgo 做里程计,二者能怎么配合?

提示

RadarHD 的清晰点云可作为更好的输入喂给里程计/SLAM,可能提升定位精度。想想"感知增强 + 定位"的流水线。


一些好奇心问答(FAQ)

Q:RadarHD 能完全取代激光雷达吗?

不能完全取代。它让廉价雷达在抗烟尘、低成本场景下逼近激光,但雷达物理分辨率有限、且生成有"猜"的成分。它是"激光失效或太贵时"的强力替代/补充。

Q:它在浓烟里也能生成清晰点云,是不是"看穿"了烟?

雷达发的无线电波本就不太被烟雾散射,所以雷达数据在烟里基本不受影响,网络再把它提成清晰点云。不是"看穿",是"本来就不受烟影响"。

Q:生成的点云可信吗?会不会瞎补?

在训练分布内较可靠;分布外或极端场景可能补出幻觉结构,需谨慎并结合其它验证。

Q:这套方法只能用于室内吗?

论文主要在多样室内场景验证。室外大尺度是否同样有效需另行研究。

所以这一节是想说:它是"廉价抗烟的激光替代/补充",可信度在训练分布内高,室外和幻觉是待验证点。


如果你想再深入

  1. 同赛道:milliEgo / RF-SLAM — 看雷达里程计与建图如何用点云。
  2. 背景:See through smoke — 理解"雷达穿烟"的应用动机。
  3. 技术范式:U-Net / pix2pix — 理解"学习提清晰度/图到图翻译"的骨架。
  4. 对照:激光雷达 SLAM(如 LOAM) — 理解它要对接的下游软件。
  5. 传统:雷达信号处理(CFAR) — 理解它替代的老办法。
  6. 同章:rfpose-ot / millimap — 看毫米波感知的其它任务。

所以这一节是想说:把传统雷达处理 → RadarHD → milliEgo/RF-SLAM 串起来,能看清"雷达感知从原始信号到清晰点云再到定位建图"的链路。


原文信息

  • 标题:High Resolution Point Clouds from mmWave Radar(RadarHD)
  • 作者:Akarsh Prabhakara, Tao Jin, Arnav Das, Gantavya Bhatt, Lilly Kumari, Elahe Soltanaghaei, Jeff Bilmes, Swarun Kumar, Anthony Rowe
  • 会议:ICRA 2023
  • arXiv:https://arxiv.org/abs/2206.09273
@inproceedings{prabhakara2023radarhd,
  title     = {High Resolution Point Clouds from mmWave Radar},
  author    = {Prabhakara, Akarsh and Jin, Tao and Das, Arnav and Bhatt, Gantavya and Kumari, Lilly and Soltanaghaei, Elahe and Bilmes, Jeff and Kumar, Swarun and Rowe, Anthony},
  booktitle = {IEEE International Conference on Robotics and Automation (ICRA)},
  year      = {2023},
  url       = {https://arxiv.org/abs/2206.09273}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_radarhd_2026,
  title       = {(readable note) High Resolution Point Clouds from mmWave Radar},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/radarhd/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?