Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 97

Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion

12 min read · 4352 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

毫米波信号能穿过纸箱、布帘,Wave-Former 把弹回来的模糊回声拼成藏在背后的杯子、瓶子的完整 3D 形状——用"物理先验清洗信号 + Transformer 补全形状"这套混合架构。

所以这一节是想说:Wave-Former 做的是"隔着遮挡物、用毫米波重建出被挡物体的完整 3D 网格"。


这是个什么场景

搬家时你蹲在墙角一堆封好的纸箱前,想找出装马克杯的那一箱,但每个都拆开看一遍太麻烦。你想要一双"能透过纸箱看里面"的眼睛。

类似场景到处都是:

  • 仓库里机器人要从堆叠的箱子里挑出某个零件。
  • 家用机器人翻柜子找遥控器,柜门关着。
  • 搜救场景要看废墟下面有没有人、有什么东西。

可选的"看穿"工具有三种:

  • 眼睛(RGB 摄像头):看不见,纸箱不透明。
  • X 光:能看见但设备贵、有辐射、家里不可能放。
  • 毫米波雷达:信号能穿透纸板、布料、薄木板,弹回来的回波告诉你"里面好像有个圆柱形的东西"。

Wave-Former 干的就是第三件事,再多走一步:把雷达回波(一堆稀疏、噪声大、只照到物体半边脸的点)拼成一个完整的、能直接交给机器人手臂去抓的 3D 网格(mesh,由很多三角面拼成的物体外壳)。

mmWave(毫米波):30-300 GHz 频段的电磁波,波长毫米级。能穿透很多非金属材料(纸、布、薄木、干墙),分辨率比 WiFi 高、比 LiDAR 低。商用雷达芯片(TI IWR 系列)便宜易得。

所以这一节是想说:Wave-Former 面对的是"机器人要在乱糟糟、有遮挡的现实环境里看清被挡物体的完整形状"这个感知盲区。


Wave-Former — 场景示意:这论文要解决的现实问题
Plate Nº IWave-Former — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

毫米波感知不是新事物,但"穿透 + 重建完整 3D 形状"是个新组合:

  • mmWave 人体姿态/活动识别(如 RF-Pose、Person-in-WiFi):穿墙看人,但只输出骨架关键点,不做物体形状。
  • mmWave SLAM / 建图(如 milliMap、RF-SLAM):建房间级稀疏地图,分辨率不够还原杯子级几何。
  • NLOS(非视距)成像(如 nlos-mmwave):能看到拐角后的物体,但通常只输出 2D 轮廓或低分辨率体素。
  • 视觉点云形状补全(如 PCN、3DShape2VecSet):很成熟,但前提是点云来自 LiDAR/深度相机,遮挡场景下根本拿不到点。
  • 直接把毫米波点云丢给视觉补全网络:失败——毫米波点云的稀疏度、噪声分布、遮挡边缘畸变和 LiDAR 完全不是一回事。

所以这一节是想说:以前的毫米波工作要么只看人、要么只建粗地图、要么只出 2D,而视觉形状补全又拿不到遮挡下的点云,两边都补不了这个缺口。


这篇论文的新想法

两个洞察拼在一起:

  1. 毫米波回波不是"乱",是有物理规律的乱:信号穿透遮挡时会折射、衰减、多路径反射,这些都能用电磁传播模型描述。让网络从零学这些畸变需要海量数据;但把物理模型当先验注入,网络只需学"残差"——剩下没被物理模型解释清楚的部分。
  2. Transformer 形状补全在视觉里已经很强:把它的归纳偏置(注意力 + 大感受野)借过来,输入换成"经过物理先验校正的毫米波点云",输出还是完整的 3D 形状。

合起来:物理先验做信号清洗 → Transformer 做几何想象。这种"物理 + 学习"的混合架构是近几年 RF 领域的主流路线,Wave-Former 把它推到了"完整物体 mesh 重建"这个粒度。

所以这一节是想说:Wave-Former 的新意是"用电磁物理先验先把毫米波回波清洗成可用点云,再用 Transformer 补全成完整 3D 形状"。


它分几步做的(方法)

这一节是全篇核心,拆成"物理校正、稀疏编码、Transformer 补全、数据合成"四步。

整体数据流 ASCII 示意:

   mmWave 原始回波 ─► 物理模型校正(去介电畸变) ─► 等效点云
   等效点云(稀疏,只近表面) ─► PointNet/patch 编码 ─► Transformer decoder(cross-attn query)
                                                       ─► 完整 3D 形状(点云/occupancy/SDF)
   训练: 电磁仿真(FDTD/射线追踪)合成大数据 + 少量真实数据 fine-tune

第 1 步:原始信号 → 物理校正点云——隔着毛玻璃反推清晰图

输入:毫米波雷达发射 chirp(调频脉冲)信号后收到的回波,被纸箱/布/木板"污染"过。

处理:像隔着毛玻璃拍照,照片是糊的,但你知道毛玻璃怎么糊的就能反推清晰图。回波经过遮挡材料时会因材料的介电常数差异发生相位偏移和路径延长。Wave-Former 显式建模这些畸变(具体公式需查原文),把"被污染"的回波反算回"如果没有遮挡应该长啥样"的等效点云。

输出:一份去除了系统性遮挡畸变的等效点云。这一步是标题里 "Wireless" 的关键——它不把 RF 当黑盒。

等等,先慢一拍——介电常数是啥?

简单说就是材料对电磁波的"减速程度":空气是 1,纸板大概 2-4,金属是无穷大(完全弹回去)。毫米波穿过纸箱时会被减速,路径被拉长,看起来像物体往后挪了几厘米。Wave-Former 把这种"系统性偏差"提前算掉。

第 2 步:稀疏点云编码——只拍到正脸,背后得猜

输入:校正后的点云,仍然很稀疏(毫米波分辨率比 LiDAR 低一个数量级)。

处理:用 PointNet 类编码器或直接切成 patch 喂进 Transformer。和视觉点云补全的差异是:mmWave 点云只覆盖物体朝向雷达的"近表面",背面、内凹结构完全是黑的。

输出:稀疏点云的特征表示。

第 3 步:Transformer 形状补全——拿半块碎片想象整个罐子

输入:稀疏点云特征。

处理:像考古学家拿半块陶器碎片想象整个罐子。Decoder 参考 PoinTr / 3DShape2VecSet 这类工作,用 cross-attention 让 query token 去"询问"输入点云的不同区域,逐步生成完整形状。

输出:完整的 3D 几何——可能是稠密点云、occupancy field 或 SDF(从标题 "Shape Completion" 推测应是高分辨率几何表示,具体需查原文)。

形状补全(shape completion):给一个不完整的 3D 输入(残缺点云、单视角深度),预测完整的 3D 形状。视觉领域代表作 PCN、PoinTr。

第 4 步:训练数据合成——用模拟器代替真车上路

输入:真实"穿遮挡"的成对数据(RF 扫描 + 真值 mesh)极难大规模采集。

处理:像驾校用模拟器代替真车——大概率用电磁仿真(如 FDTD 或射线追踪)生成大规模合成 RF 数据,再用少量真实数据 fine-tune。这是 RF 学习类工作的标配套路。

输出:足量的训练数据。具体合成/真实配比需查原文。

所以这一节是想说:Wave-Former 的方法 = 电磁物理校正去畸变 + 稀疏点云编码 + Transformer cross-attention 补全 + 仿真合成数据训练,四步把模糊回波变成完整 3D 网格。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【Wave-Former: Through-Occlusion 3D R… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

Wave-Former — 方法示意:核心 pipeline
Plate Nº IIWave-Former — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体 Chamfer/F-Score 请查原文,此处不编造。

维度 说明
传感器 商用 mmWave FMCW 雷达(TI IWR 类)
输入 穿遮挡的稀疏、含畸变毫米波点云
输出 完整 3D 形状(mesh / SDF / occupancy)
核心组件 物理先验校正 + Transformer 补全
训练数据 电磁仿真合成 + 少量真实 fine-tune
遮挡材料 纸箱、布帘等(可能含木板、塑料板)
指标 Chamfer Distance、F-Score、IoU

关键看点是"穿透不同材料的退化曲线"——如果纸箱重建很好但木板就崩了,说明物理先验的覆盖范围有限。物理先验能覆盖的材料越广,方法越实用。

所以这一节是想说:数字里最该盯的是"不同遮挡材料下的重建质量退化",它决定了 Wave-Former 的实用边界。


实验结果说明了什么

从摘要和标题推测主要实验维度(具体数字需查原文):

  • 物体种类:日常物体,可能覆盖杯、瓶、碗、盒等抓取常见类别。
  • 遮挡材料:至少测纸箱、布帘,可能加木板、塑料板,对比不同介电常数下的重建质量。
  • 指标:Chamfer Distance、F-Score、IoU 等标准 3D 重建指标;可能还有下游任务指标(重建 mesh 给抓取规划器用,成功率多少)。
  • 消融:去掉物理先验 vs 保留;纯视觉补全网络在 mmWave 输入下的表现;不同 Transformer 容量。
  • 泛化:训练见过 vs 没见过的物体类别;训练见过 vs 没见过的遮挡材料。

所以这一节是想说:实验的意义是证明"物理先验 + Transformer"这套混合架构真能在穿遮挡场景重建出可用的完整 3D 形状,并标出它在不同材料/物体上的边界。


你应该懂的几个新词

  • mmWave(毫米波):30-300 GHz 电磁波,能穿透非金属材料,分辨率介于 WiFi 和 LiDAR 之间。
  • 形状补全(shape completion):从不完整 3D 输入预测完整形状。
  • 物理先验(physical prior):把已知物理规律(这里是电磁传播)显式写进模型结构或损失,让网络不用从零学。和纯数据驱动对立。
  • 介电常数(dielectric constant):材料对电磁波"减速"程度,空气 ≈ 1、纸板 ≈ 2-4、金属 = ∞。决定 mmWave 能不能穿、穿多少。
  • NLOS(非视距):物体不在传感器直视方向上。Wave-Former 是 NLOS 的一种(被前方遮挡)。
  • chirp(调频脉冲):mmWave FMCW 雷达的发射波形,频率随时间线性变化,回波混频后频差直接对应距离。

所以这一节是想说:这几个词是理解"物理 + 学习混合 RF 感知"这条线的通用基础。


它有什么搞不定的

  • 物理先验覆盖有限:只对建过模的材料(介电常数已知)好用,遇到没建模的材料重建会崩。
  • 分辨率天花板:毫米波分辨率本就比 LiDAR 低,极精细结构(薄边、小孔)难还原。
  • 金属完全反射:金属遮挡物或金属目标会把信号全弹回,穿不透也重建不了。
  • 仿真到真实的差距:训练主要靠电磁仿真合成数据,仿真和真实回波有差距,真机泛化需谨慎。
  • 背面全黑:只照到近表面,背面靠 Transformer 猜,遇到不对称/复杂内凹物体容易猜错。

所以这一节是想说:Wave-Former 的短板集中在"材料受限、分辨率低、金属穿不透、仿真差距"上——它推进了穿遮挡重建,但物理限制仍在。


它和别的几篇是什么关系

向后看:

  • mmWave 感知谱系rf-pose-through-wall(穿墙骨架)→ millimap(毫米波建图)→ nlos-mmwave(非视距)→ Wave-Former(穿遮挡完整物体重建)。粒度从"人体关键点"细化到"物体级 mesh"。
  • 3D 形状补全谱系3dshape2vecset 这类视觉点云补全是直接技术祖先,Wave-Former 把输入模态换成 RF。
  • 物理 + 学习混合架构:和 acoustic-swarms(声学先验 + 学习)、neuralaids(助听器物理 + 神经网络)思路同源。

向前看:

所以这一节是想说:Wave-Former 交汇了"RF 穿透感知"和"3D 形状补全"两条血脉,是把 RF 感知推到物体级 mesh 的关键一步。


和本导读的关系

本篇对应导读 Ch19: 射频感知。Ch19 讲用射频信号"看"世界(穿墙、非视距、成像),核心范式就是"物理 + 学习"混合。Wave-Former 是这条线上粒度最细的一步——从看人、建图、看轮廓,推进到"重建被挡物体的完整 3D 网格"。读完本篇,配合同章的 rf-pose-through-wallmillimapnlos-mmwave,能看清 RF 感知从粗到细的完整谱系。

所以这一节是想说:把 Wave-Former 放进 Ch19 的射频感知谱系里读,它是"穿遮挡做物体级 3D 重建"这一格的代表。


思考题

Q1:为什么直接把毫米波点云丢给现成的视觉补全网络会失败?

提示

毫米波点云的稀疏度、噪声分布、遮挡边缘畸变和 LiDAR 点云完全不同。视觉补全网络是在 LiDAR/深度点云上训的,输入分布不匹配就崩。这也是 Wave-Former 要先做物理校正的原因。

Q2:物理先验"注入"和"让网络从零学"相比,好处是什么?

提示

物理规律(电磁传播)已知且可靠,注入后网络只需学"残差"(物理没解释的部分),大幅降低数据需求、提高泛化。从零学要海量数据,还可能学歪。

Q3:为什么金属遮挡物或金属目标对 Wave-Former 是硬伤?

提示

金属介电常数无穷大,把电磁波完全反射。穿不透金属遮挡(看不到里面),金属目标本身也只反射不透射,物理模型和补全都无从下手。

Q4:Wave-Former 用电磁仿真合成数据训练,这带来什么风险?

提示

仿真回波和真实回波有差距(sim-to-real)。真实材料、多路径、噪声比仿真复杂,模型在真机上可能退化。所以要用少量真实数据 fine-tune。

Q5:毫米波只照到物体"近表面",背面全黑,Transformer 怎么补出背面?靠谱吗?

提示

靠从训练数据学到的"物体形状先验"猜背面(对称、常见形状)。对规则、对称物体靠谱;对不对称、复杂内凹物体容易猜错。这是形状补全的固有局限。

Q6:如果要评估 Wave-Former 的实用性,你会最关注哪张图/表?

提示

"不同遮挡材料下的重建质量退化曲线"。它直接告诉你方法对哪些材料好用、哪些崩,决定能不能真部署到仓储/家用场景。

所以这一节是想说:这几个问题带你把"模态不匹配、物理先验价值、金属硬伤、sim-to-real、背面补全、实用边界"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:Wave-Former 需要特殊硬件吗?

用的是商用 mmWave FMCW 雷达(TI IWR 系列这类),便宜易得,不需要 X 光那种昂贵设备。这是它落地潜力大的原因。

Q2:它能穿多厚的遮挡?

取决于材料和厚度。纸箱、布帘、薄木板这类低介电常数材料可穿;金属穿不透,厚重材料衰减太大也不行。

Q3:输出能直接给机器人抓吗?

目标是输出完整 3D mesh,理论上能交给抓取规划器用。实际抓取成功率取决于重建精度,论文可能有下游抓取实验。

Q4:为什么不用 X 光或 CT?

X 光/CT 贵、有辐射、不适合家用/移动机器人。毫米波便宜、无害、芯片小,更适合日常场景。代价是分辨率和穿透能力有限。

Q5:它和 nlos-mmwave 有什么区别?

nlos-mmwave 多输出 2D 轮廓或低分辨率体素、看拐角后物体;Wave-Former 输出完整高分辨率 3D 形状、看正前方被遮挡物体。粒度更细。

Q6:读完 Wave-Former 接下来看什么?

想看 RF 感知谱系看 nlos-mmwavemillimap;想看形状补全祖先看 3dshape2vecset;想看物理+学习同类看 neuralaids

所以这一节是想说:要不要特殊硬件、能穿多厚、能不能抓、和 nlos 差别——这些实操问题都有明确答案。


如果你想再深入

按"RF 近邻 → 形状补全祖先 → 同架构"排序:

  1. RF 近邻:nlos-mmwave —— 最接近的 RF 侧工作,看 Wave-Former 细化到哪。
  2. 形状补全祖先:3dshape2vecset —— 视觉点云补全的技术祖先。
  3. RF 谱系:millimap / rf-pose-through-wall —— 理解毫米波感知从粗到细。
  4. 同架构:neuralaids / acoustic-swarms —— 物理 + 学习混合的其他模态案例。

所以这一节是想说:把 nlos-mmwave + 3DShape2VecSet + Wave-Former 连起来读,就能看清它两条血脉怎么交汇。


原文信息

  • 标题:Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  • arXiv:https://arxiv.org/abs/2511.14152
  • 发表:arXiv, 2025
  • 年份:2025

BibTeX:

@article{waveformer2025,
  title   = {Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion},
  author  = {others},
  journal = {arXiv preprint arXiv:2511.14152},
  year    = {2025},
  url     = {https://arxiv.org/abs/2511.14152}
}

所以整篇是想说:Wave-Former 用"电磁物理先验清洗回波 + Transformer 补全形状",把毫米波从"看人、建粗图"推进到"隔着纸箱重建出完整杯子形状"——它给机器人补上了"看不见的东西"这块长期盲区的一角。

引用本笔记 / Cite this note
BibTeX
@online{eai_wave_former_2026,
  title       = {(readable note) Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/wave-former/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?