milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
这是一份写给"完全没接触过定位/雷达"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么在黑暗、烟雾里摄像头会瞎,而一颗便宜的毫米波雷达配上深度学习就能算出自己走了多远"。
一句话讲什么(TL;DR)
用一颗几十块钱、单芯片的毫米波雷达,加上一套专门设计的神经网络,让一个移动设备(人、机器人、无人机)在黑暗、烟雾、无纹理墙面这些摄像头会失灵的环境里,也能准确算出"自己往哪儿走了、走了多远",3D 轨迹误差低到约 1.3%。
所以这一节是想说:这篇论文让一颗便宜的毫米波雷达也能做出可靠的"自我运动估计",专治摄像头失灵的场景。
这是个什么场景
想象消防员冲进浓烟滚滚的火场,或者一个扫地机器人在漆黑的房间里。它们都需要知道一件最基本的事:我现在相对刚才走了多远、转了多少度? 这个能力叫"自我运动估计"(egomotion estimation)或"里程计"(odometry),是所有导航、AR、自主交互的地基。
现在主流靠的是视觉惯性里程计(VIO)——用摄像头看画面里特征点怎么移动,配合惯性传感器(加速度计、陀螺仪)推算轨迹。但它有两个死穴:光线不好就瞎(黑暗、烟雾、强逆光),没有纹理就抓不住(一面纯白墙壁,摄像头找不到可追踪的点)。
毫米波雷达(mmWave radar)不怕这些:它发射无线电波、看回波,烟雾灰尘照穿不误,黑暗更无所谓。而且它有个摄像头没有的天然优势——它是"有尺度的"(metric),能直接测出绝对距离(多少米),而单目摄像头只能算出"相对比例",不知道真实尺寸。问题是:便宜的单芯片毫米波雷达分辨率极低、点云又稀又乱,传统的点云配准方法(靠前后两帧点云对齐来算位移)在这种"稀疏又带噪"的数据上非常脆弱。
milliEgo 要解决的就是:怎么让一颗又便宜又"看不清"的单芯片毫米波雷达,靠深度学习榨出可靠的运动估计。
所以这一节是想说:目标是在摄像头失灵的恶劣环境里,用便宜的单芯片毫米波雷达做出准确的里程计。

之前的人怎么做的,为什么不够好
- 视觉惯性里程计(VIO):主流、精度高,但光照差、无纹理时崩溃——这正是要避开的场景。
- 激光雷达(LiDAR)里程计:精度很高,但传感器贵、功耗大,也怕烟雾灰尘(会散射)。
- 传统雷达点云配准(ICP 及其变体):靠"把前后两帧点云对齐"求位姿变化。但单芯片毫米波雷达的点云又稀疏、又有镜面反射和杂散回波(specular/spurious reflection),配准算法很容易被带偏,鲁棒性差。
- 已有的雷达里程计:多用较贵的扫描式雷达或多芯片方案;把"最便宜的单芯片"做好的很少。
- 简单的传感器融合:直接把雷达和惯性数据拼一起喂网络,没有考虑"什么时候该信雷达、什么时候该信惯性",融合不智能。
所以这一节是想说:视觉怕暗、激光贵且怕烟、传统雷达配准太脆、简单融合又不够聪明——正好留出 milliEgo 的空间。
这篇论文的新想法
作者提出两个关键设计:
第一,为"低分辨率雷达求位姿"量身定做一个神经网络。 不再靠传统的点云配准,而是让网络直接从前后两帧稀疏雷达数据里学出"这段时间设备的位姿变化(平移 + 旋转)"。既然点云太稀太乱不好配准,那就用深度学习端到端地"猜"出运动——把它当成一个从雷达图像到位姿变换的回归问题。
第二,用"混合注意力(mixed attention)"做深度融合。 雷达和惯性传感器各有脾气:惯性传感器短时间很准但会漂移(越积越偏),雷达绝对尺度准但单帧噪。关键是在不同时刻,该更信谁是会变的。混合注意力就是让网络学会一个"动态分配信任"的机制——某一刻雷达回波清晰就多信雷达,某一刻雷达糊了就多靠惯性。这比"固定权重拼一起"聪明得多。
结果:3D 轨迹误差约 1.3%,还能泛化到训练时没见过的环境,且网络可以做得很轻、适合实时嵌入式设备。
所以这一节是想说:一是用定制网络替代脆弱的点云配准,二是用混合注意力智能地融合雷达和惯性,动态决定信谁。
它分几步做的(方法)
方法分四块:雷达数据表示、雷达位姿网络、惯性编码、混合注意力融合。逐块按"输入 → 处理 → 输出"讲。
1. 雷达数据表示:把稀疏回波整理成网络能吃的形式
输入。 单芯片毫米波雷达的原始回波(论文用到 I/Q 原始信号层面的信息,经处理得到雷达图像/点表示)。
处理。 毫米波雷达的回波有个麻烦特性:信号呈现"sinc 状扩散"(一个真实目标会在雷达图里摊成一团旁瓣,不像激光那样一个点就是一个点),还有镜面反射和杂散回波。作者把回波整理成适合卷积网络处理的表示,保留距离、角度信息,同时让网络自己去学"哪些是真目标、哪些是噪"。
I/Q 信号:雷达/通信里对回波的一种标准表示(同相分量 I 和正交分量 Q),保留了幅度和相位信息,比只看强度更完整。
输出。 一对相邻时刻的雷达特征图,交给下一步的位姿网络。
所以这一节是想说:先把"又稀又带旁瓣"的雷达回波整理成网络友好的表示,把去噪辨真的活儿交给网络学。
2. 雷达位姿网络:从两帧雷达直接回归运动
输入。 相邻两帧(t−1 和 t)的雷达特征。
处理。 一个为"低分辨率雷达位姿估计"专门设计的网络,直接输出这两帧之间设备的位姿变换(平移向量 + 旋转)。这一步取代了传统 ICP 配准——因为在稀疏噪声点云上配准太脆,端到端学习反而更稳。这就是标题里 "pose transformation problem" 的核心。
输出。 相邻两帧间的相对运动估计(本步的雷达单独估计)。
所以这一节是想说:网络直接"看两帧雷达猜位移和转角",绕开了脆弱的点云配准。
3. 惯性编码:处理加速度计/陀螺仪序列
输入。 惯性测量单元(IMU)的读数序列(加速度、角速度)。
处理。 用一个网络(论文用循环/序列结构处理 IMU 时间序列)把惯性数据编码成运动特征。惯性的特点是短时精确、长时漂移——它知道你刚刚猛地加速了,但积分久了误差越滚越大。
惯性传感器漂移(drift):加速度积分成速度、再积分成位置,微小误差会随时间累积放大,像滚雪球,这是纯惯性里程计的通病。
输出。 惯性运动特征,等待与雷达特征融合。
所以这一节是想说:惯性分支负责提供"短时很准但会漂"的运动线索。
4. 混合注意力融合:动态决定信雷达还是信惯性
这是本篇的灵魂。
类比。 你走夜路,有时靠眼睛(看得清时),有时靠脚感和方向感(看不清时)。你的大脑会根据当下情况动态切换该信哪个感官。混合注意力就是给网络装了这样一个大脑。
输入。 雷达运动特征 + 惯性运动特征。
处理。 用"混合注意力"机制给两路特征动态加权融合——注意力权重不是固定的,而是随场景实时算出来的:雷达这帧信息足就多信雷达,雷达糊了就多靠惯性。论文强调这是为"稳健融合额外传感器(惯性或视觉)"设计的。融合后再输出最终的、更可靠的位姿变化。
输出。 融合后的相对位姿;把每一步相对位姿一路累加,就得到完整的运动轨迹。
下面用 ASCII 图把整条流水线画出来:
雷达回波(t-1) ─┐
├─► 雷达位姿网络 ─► 雷达运动特征 ─┐
雷达回波(t) ─┘ │
├─► 混合注意力(动态加权)
IMU 序列 ─────► 惯性编码网络 ─► 惯性运动特征 ─────┘ │
▼
融合后相对位姿(Δ平移+Δ旋转)
│ 逐帧累加
▼
完整运动轨迹
再用一张 ASCII 图对比"信谁"的动态切换直觉:
场景光/回波质量: 好 ████████░░ 差(烟雾/纯墙)
注意力偏向: 雷达权重↑ 惯性权重↑
└──── 混合注意力实时调节 ────┘
所以这一整节是想说:milliEgo = 雷达表示 + 定制位姿网络 + 惯性编码 + 混合注意力融合,四步合起来把"便宜雷达 + 惯性"炼成稳健里程计。

关键数字(What works)
数字来自论文摘要(arXiv:2006.02266);具体分场景误差、与各 baseline 的逐项对比属正文,标注"需读原文"。
| 项目 | 数值/结论 | 说明 |
|---|---|---|
| 3D 轨迹误差漂移 | 约 1.3% | 走 100 米约偏 1.3 米量级 |
| 传感器 | 单芯片毫米波雷达 + 惯性 | 低成本 |
| 融合方式 | 混合注意力(mixed attention) | 动态加权 |
| 泛化 | 对未见环境泛化良好 | 摘要明确声称 |
| 部署 | 可做到高效、适合实时嵌入式 | 轻量网络 |
| 雷达优势 | metric(有绝对尺度) | 单目相机没有 |
三个要点:第一,1.3% 的 3D 误差在"单芯片廉价雷达"这个前提下相当亮眼——要知道传统方法在这种稀疏数据上常常直接崩;第二,泛化到未见环境说明学到的是通用运动规律,而非死记训练场景;第三,能跑在嵌入式意味着它不是实验室玩具,而是能真正装进消防头盔或小机器人里。
所以这一节是想说:在最廉价的传感器设定下拿到 1.3% 误差、还能泛化并实时运行,这三点合起来才是它的分量。
实验结果说明了什么
论文实验主要证明三件事:
- 在恶劣环境里也稳:包括烟雾遮挡等视觉会失灵的场景,milliEgo 依然给出可靠轨迹,验证了雷达 + 融合的价值。
- 混合注意力融合优于简单融合:对比"直接拼接特征"或"固定权重融合",混合注意力带来更低误差(消融细节需读原文),证明"动态决定信谁"是关键。
- 能泛化、能实时:在训练时没见过的环境里仍准确,并且网络可压到适合嵌入式实时运行——这让它具备落地价值。
所以这一节是想说:实验证明"定制网络 + 混合注意力"这套组合在恶劣环境下稳、能泛化、还能实时,缺一不可。
你应该懂的几个新词
- egomotion / odometry(自我运动估计 / 里程计):估计自己相对起点走了多远、转了多少,是导航的地基。
- mmWave radar(毫米波雷达):发射毫米波段无线电、看回波的传感器,穿烟穿尘、不怕黑,且能测绝对距离。
- metric(有尺度):能给出真实物理尺寸/距离;单目相机不具备,雷达具备。
- VIO(视觉惯性里程计):摄像头 + 惯性做里程计的主流方案,怕暗怕无纹理。
- IMU / drift(惯性单元 / 漂移):加速度计+陀螺仪;纯积分会随时间累积误差。
- 点云配准(point cloud registration,ICP):把前后两帧点云对齐来求位姿变化;在稀疏噪声点云上脆弱。
- specular / spurious reflection(镜面/杂散反射):雷达回波里的假目标和干扰,稀疏点云的主要噪声源。
- attention(注意力)/ mixed attention:让网络学"该关注哪路信息"的机制;混合注意力用于动态融合多传感器。
所以这一节是想说:这些词是"射频感知 + 传感器融合"这条线的通用词汇,后面 RF-SLAM、radarHD 都会用到。
它有什么搞不定的
- 雷达分辨率天生低:单芯片雷达空间分辨率远不如激光/相机,milliEgo 缓解了这个问题但没消除它,精细场景仍吃亏。
- 依赖惯性质量:融合里惯性是重要一路,若 IMU 很差或标定不好,漂移会拖累整体。
- 动态环境干扰:场景里有大量移动物体(人群、车流)时,回波里"自己动"和"别人动"难分,可能误估自我运动。
- 训练数据依赖:端到端学习需要大量"雷达+惯性+真值轨迹"的配对数据,采集成本不低;覆盖不到的场景可能退化。
- 1.3% 仍会累积:里程计是逐帧累加的,长距离下误差会滚雪球,需要回环检测/建图(SLAM)来纠正——这超出了本文范畴。
所以这一节是想说:它在恶劣环境里很能打,但分辨率、动态干扰、长距离漂移、数据成本这几关仍是硬约束。
它和别的几篇是什么关系
- 同作者线:牛津团队一系列射频/穿透感知工作(如 "See through smoke"、Milli-RIO、DeepTIO 热惯性里程计)都在解决"视觉失灵时怎么办",milliEgo 是雷达里程计这一支。
- 对照:传统 VIO(视觉惯性)、LiDAR 里程计是它要超越/补位的对象;雷达里程计(如 PhaRaO、雷达-惯性速度估计)是同赛道。
- 技术邻居:DeepVO、VINet 等"用深度学习做视觉/视觉惯性里程计"的工作提供了端到端里程计的范式,milliEgo 把它迁移到雷达并加了混合注意力。
- 导读同章:radarHD(用学习给雷达生成高分辨率点云)、RF-SLAM、milliMap 等都是"毫米波感知"这条线上的邻居,关注点不同(建图 / 定位 / 成像)。
所以这一节是想说:它是"深度学习里程计"范式在毫米波雷达上的落地,属于射频感知大家族里"定位"这一支。
和本导读的关系
本笔记对应导读 Ch19: 射频感知。Ch19 讲的是"用无线电波(WiFi、毫米波、雷达)替代或补充摄像头去感知世界"这条路线,核心动机就是"电磁波能穿透遮挡、不怕黑"。milliEgo 是这条线里"自我定位/里程计"的代表——它展示了当视觉失灵时,便宜雷达 + 深度融合如何接管。读完本篇再看同章的 radarhd(雷达成点云)、rfpose-ot(雷达估人体姿态)、rf-slam(射频建图定位),能拼出"毫米波感知能做哪些事"的全景。
所以这一节是想说:把 milliEgo 放进 Ch19 射频感知里,它对应"定位/里程计"这一格。
思考题
Q1:为什么单目摄像头"没有尺度",而毫米波雷达"有尺度"?这对里程计意味着什么?
提示
相机靠三角化推深度,只能得到相对比例,除非有已知尺寸参照。雷达直接测回波往返时间/频差得到绝对距离。想想没有尺度会给轨迹带来什么歧义。
Q2:为什么在稀疏噪声雷达点云上,传统 ICP 配准会失败,而端到端网络反而更稳?
提示
ICP 假设两帧点能一一对应,稀疏+旁瓣+假目标会让对应关系错乱。网络可以从大量数据里学"整体运动模式",容忍局部噪声。
Q3:混合注意力"动态决定信谁",如果去掉它、改用固定权重融合,最可能在什么场景下翻车?
提示
场景质量随时间剧烈变化时(忽而清晰忽而烟雾)。固定权重无法适应,会在最该切换的时候用错传感器。
Q4:里程计误差会逐帧累加,1.3% 听起来很小,走 1 公里会偏多少?这够用吗?
提示
1.3% × 1000m ≈ 13m 量级。对短程 AR/避障够用,对长程导航需要回环/建图来纠偏。想想应用场景对精度的要求。
Q5:如果场景里有很多移动的人和车,milliEgo 可能怎么被骗?如何缓解?
提示
网络可能把"别人在动"误当成"自己在动"。可考虑区分静态/动态回波、结合多帧一致性或惯性交叉验证。
Q6:为什么作者强调"能跑在嵌入式实时"?这对方法设计有什么约束?
提示
消防头盔、小机器人算力有限、要求低延迟。这限制了网络规模和计算量,逼迫设计轻量结构。
Q7:milliEgo 只做里程计(相对运动),要变成完整的 SLAM(建图+全局定位)还缺什么?
提示
缺回环检测(认出"我回到之前来过的地方")和全局地图优化来消除累积漂移。想想里程计和 SLAM 的区别。
一些好奇心问答(FAQ)
Q:毫米波雷达真能"穿"烟雾看东西吗?
它不是"看",是发射无线电波看回波。毫米波波长比烟雾颗粒大得多,基本不被散射,所以烟雾里照常工作;但它分辨率低,看不清细节。
Q:为什么不干脆用激光雷达(LiDAR)?
激光精度高,但贵、耗电,而且激光会被烟雾灰尘散射(火场里就废了)。毫米波便宜、抗烟尘,代价是分辨率差——milliEgo 用学习把这个代价补上一部分。
Q:milliEgo 需要事先建好地图吗?
不需要。它做的是里程计(相对运动累加),不是在已知地图里定位。这也意味着长距离会有累积漂移。
Q:这套方法能装到手机上吗?
思路上可以(网络轻量、雷达便宜),但需要手机带毫米波雷达传感器,目前不普及。更现实的是机器人、无人机、专用可穿戴设备。
所以这一节是想说:它的定位是"廉价、抗恶劣环境的相对运动估计",不是"全能高精度定位"。
如果你想再深入
- 背景:视觉惯性里程计(VINet / VIO 综述) — 理解主流方法及其死穴。
- 端到端里程计:DeepVO — 看"用网络直接回归位姿"的范式起点。
- 雷达里程计:PhaRaO / 雷达-惯性速度估计 — 同赛道对照。
- 同作者:See through smoke / DeepTIO — 看"视觉失灵时怎么办"的姊妹工作。
- 下一步:Ch19 的 radarHD / RF-SLAM — 从"里程计"扩展到"成像/建图"。
所以这一节是想说:把 VIO → DeepVO → milliEgo → RF-SLAM 串起来,能看清"从视觉里程计到射频感知"的迁移路径。
原文信息
- 标题:milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 作者:Chris Xiaoxuan Lu, Muhamad Risqi U. Saputra, Peijun Zhao, Yasin Almalioglu, Pedro P. B. de Gusmao, Changhao Chen, Ke Sun, Niki Trigoni, Andrew Markham
- 会议:ACM SenSys 2020
- arXiv:https://arxiv.org/abs/2006.02266
@inproceedings{lu2020milliego,
title = {milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion},
author = {Lu, Chris Xiaoxuan and Saputra, Muhamad Risqi U. and Zhao, Peijun and Almalioglu, Yasin and de Gusmao, Pedro P. B. and Chen, Changhao and Sun, Ke and Trigoni, Niki and Markham, Andrew},
booktitle = {Proceedings of the 18th ACM Conference on Embedded Networked Sensor Systems (SenSys)},
year = {2020},
url = {https://arxiv.org/abs/2006.02266}
}
◼
引用本笔记 / Cite this note
@online{eai_milliego_2026,
title = {(readable note) milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2020 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/milliego/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?