Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
RF Perception & Mapping · Plate Nº 93

RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory

13 min read · 4572 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过射频感知/最优传输"的读者的精读笔记。全程类比、术语先定义、公式翻成人话。读完你能讲清"为什么无线电信号和人体骨架长得完全不像、却能互相翻译,以及'最优传输'这个数学工具在中间起了什么作用"。

一句话讲什么(TL;DR)

用无线电波(RF 信号)估计人体的三维姿态(骨架关节位置)——关键创新是:不像以前那样在"信号层面"硬凑,而是先用最优传输(Optimal Transport)理论,把 RF 信号的特征"搬运"到姿态的特征空间,再从搬运后的特征生成人体骨架。这样即使隔墙、遮挡、在室外,也能比以前的方法更准地看出人在摆什么姿势。

所以这一节是想说:这篇论文用"最优传输"当桥梁,把无线电信号翻译成人体三维姿态。


这是个什么场景

你想在家里装一个能"看出老人有没有摔倒、有没有正常活动"的系统,但又不想装摄像头(侵犯隐私、黑暗和遮挡下也不行)。有没有办法不用摄像头就知道人的姿势?

有——用无线电波感知人体姿态。原理是:人体会反射、扰动无线电波(就像 WiFi、雷达信号打到你身上会变化)。接收端收到这些被人体"改写过"的信号,理论上就能反推出人在哪、摆什么姿势。它的好处是:不拍图像(保护隐私)、不怕黑、还能穿墙穿遮挡

但这件事极难,难在一个根本的结构鸿沟:无线电信号长得和人体骨架完全不像。信号是一堆随时间、频率、天线变化的复数波形;人体姿态是 3D 空间里十几个关节点的坐标。一个是"电磁波的乱码",一个是"骨架图",两者的数据结构天差地别。以前的方法大多在"信号层面"直接硬压一个网络去回归关节坐标,忽略了这个结构差异,效果受限。

RFPose-OT 要解决的就是:怎么优雅地跨越"信号"和"姿态"之间的结构鸿沟。

所以这一节是想说:目标是用无线电波估计人体三维姿态(隐私友好、抗遮挡),难点在信号和骨架的结构完全不同。


RFPose-OT — 场景示意:这论文要解决的现实问题
Plate Nº IRFPose-OT — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 摄像头 + 视觉姿态估计:成熟准确,但侵犯隐私、怕黑、怕遮挡——正是要规避的。
  • RF 信号直接回归姿态(signal-level):拿一个网络直接从 RF 信号硬压出关节坐标。问题是没有正视"信号和姿态结构完全不同"这件事,相当于让网络自己在两个差异巨大的空间之间硬找映射,难学、精度受限。
  • 依赖特定环境:很多 RF 姿态方法在实验室理想环境下才好,换到遮挡、室外就退化。
  • 共同短板:要么隐私/遮挡不行(视觉),要么忽视结构鸿沟、泛化差(信号层直接回归)。

所以这一节是想说:视觉方案隐私和遮挡不行,RF 直接回归又忽视了信号与姿态的结构差异,精度和泛化都受限。


这篇论文的关键想法

RFPose-OT 的核心洞察:既然信号和姿态在"结构"上差异巨大,那就不要在信号层面硬凑,而应该在"特征层面",用一个专门衡量分布差异的数学工具,把信号特征'搬运'到姿态特征空间。 这个工具就是最优传输(Optimal Transport,OT)

先理解最优传输的直觉。 想象你有一堆沙子(分布 A,代表 RF 特征),要把它搬成另一个形状的沙堆(分布 B,代表姿态特征)。搬运有成本(搬得越远越费劲)。最优传输就是总搬运成本最低的那个搬法。它天然衡量"把一个分布变成另一个分布"要花多大代价,正好适合"把信号特征变成姿态特征"这种跨结构的翻译。

RFPose-OT 的三步逻辑:

  1. 把 RF 信号编码成特征;把人体姿态也编码成特征。
  2. 用 OT 理论学一个"搬运方案",把 RF 特征在特征层面对齐/转换到姿态特征空间——显式地跨越结构鸿沟。
  3. 从搬运后的特征生成人体三维姿态。

这样做的好处是:不再逼一个网络在信号和骨架之间盲目硬找映射,而是用 OT 有原则地衔接两个空间,从而在遮挡、室外等更难场景下也更准。

所以这一节是想说:核心是"用最优传输在特征层面把 RF 特征搬到姿态空间,再生成骨架",有原则地跨越结构鸿沟。


RFPose-OT — 方法示意:核心 pipeline
Plate Nº IIRFPose-OT — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:数据采集系统、双域特征编码、OT 特征搬运、姿态生成。逐块按"输入 → 处理 → 输出"讲。

1. 数据采集:自建射频 + 多视角相机系统

输入。 需要"RF 信号 ↔ 真实姿态"的配对数据来训练。

处理。 作者自己搭了两套系统同步采集:一套射频(radio)系统发射并接收无线电信号(人体反射/扰动这些信号);一套多视角相机系统从多个角度拍人,用来重建出真实的三维姿态当作标准答案。两套同步,就得到"这段 RF 信号对应这个 3D 骨架"的配对数据。为了检验鲁棒性,他们在三种环境采集:基础室内、遮挡室内、室外。

输出。 覆盖多种环境的"RF 信号 + 3D 姿态答案"配对数据集。

所以这一节是想说:先用射频系统采信号、多相机系统采真值姿态,配成训练教材,并覆盖遮挡/室外难场景。

2. 双域特征编码:把信号和姿态各自变成特征

输入。 RF 信号 + 对应的 3D 姿态。

处理。 用编码器把 RF 信号编码成 RF 特征;同时把姿态编码成姿态特征。注意这一步是把两种结构完全不同的东西各自压进一个特征空间,为后面的"搬运"做准备。

特征(feature):把原始数据(信号或骨架)经神经网络压成的一串向量,抓住其中的关键信息。在特征层面操作比在原始层面更灵活。

输出。 RF 特征分布和姿态特征分布——两个待对齐的"沙堆"。

所以这一节是想说:把信号和姿态各自编码成特征,把跨结构问题转化成"两个特征分布如何对齐"。

3. OT 特征搬运:跨越结构鸿沟

这是全篇的灵魂。

输入。 RF 特征分布 + 姿态特征分布。

处理。 用最优传输理论学习一个"搬运方案",把 RF 特征在特征层面转换/对齐到姿态特征空间。OT 会找到"总代价最小"的对应关系,使得转换后的 RF 特征在分布上尽量贴合姿态特征。人话:让"从信号来的特征"和"从姿态来的特征"在同一个空间里对上号,这样从信号出发也能落到"姿态该在的地方"。

最优传输(Optimal Transport, OT):衡量"把一个概率分布变成另一个分布"的最小总代价的数学理论。常用来对齐两个不同来源的特征分布(域对齐)。这里用它连接 RF 域和姿态域。

输出。 被"搬运"到姿态空间的 RF 特征。

所以这一节是想说:OT 用"最小代价搬运"把 RF 特征对齐到姿态特征空间,是跨越结构鸿沟的关键机件。

4. 姿态生成:从搬运后的特征输出 3D 骨架

输入。 搬运到姿态空间后的 RF 特征。

处理。 一个解码器/生成器从这些已对齐的特征生成人体三维姿态(十几个关节的 3D 坐标)。因为特征已经在姿态空间里了,生成骨架就变得自然、准确。训练时用真值姿态监督整个流程。

输出。 从 RF 信号推断出的人体 3D 姿态。

下面用 ASCII 图把整体流程画出来:

   RF 信号 ──编码──► RF 特征分布 ─┐
                                   │  最优传输(OT): 最小代价搬运/对齐
   3D 姿态 ──编码──► 姿态特征分布 ─┘
                                   ▼
                        搬运后的 RF 特征(已在姿态空间)
                                   │  解码/生成
                                   ▼
                             人体 3D 姿态(关节坐标)

再用一张 ASCII 图理解 OT 的"搬沙子"直觉:

   RF 特征堆:    ▲▲▲              姿态特征堆:      ▲   ▲   ▲
                 (乱码状分布)                      (骨架状分布)
        └──── OT 找"总搬运成本最低"的对应 ────► 把左边搬成右边的形状

所以这一整节是想说:RFPose-OT = 自建采集系统 + 双域特征编码 + OT 特征搬运 + 姿态生成,用最优传输把无线电信号翻译成人体骨架。


关键数字(What works)

数字来自论文摘要(arXiv:2301.13013);各环境下的具体误差指标(如关节定位误差)属正文表格,标注"需读原文"。

项目 数值/结论 说明
输入 RF(无线电)信号 隐私友好、抗遮挡
输出 人体 3D 姿态(关节坐标) 骨架
核心工具 最优传输(OT)理论 特征层面域对齐
对齐层面 特征层(非信号层) 与以往方法关键区别
测试环境 基础室内 / 遮挡室内 / 室外 三种,验证鲁棒
精度 高于当时 SOTA 方法 三种环境都更准
真值来源 多视角相机系统 提供 3D 姿态答案

三个要点:第一,"在特征层面用 OT 对齐"而非"信号层面直接回归",是本文相对前人的根本区别,也是精度提升的来源;第二,三种环境(含遮挡、室外)都更准,说明这套方法不只在理想实验室有效,抗遮挡是它相对视觉的核心优势;第三,用多视角相机采真值是这类工作的标准做法——RF 出信号、相机出答案。

所以这一节是想说:特征层 OT 对齐 + 三环境更准 + 多相机真值,是 RFPose-OT 的三个关键点。


实验结果说明了什么

论文实验主要证明:

  • OT 对齐有效:相比在信号层面直接回归的方法,RFPose-OT 在三种环境下都更准,验证了"在特征层面用最优传输跨越结构鸿沟"的价值。
  • 抗遮挡、能室外:在遮挡室内和室外场景仍保持较高精度,凸显 RF 感知相对视觉的物理优势(不怕遮挡、不依赖光照)。
  • 结构差异确实重要:正视"信号和姿态结构不同"并用专门工具处理,比忽视它硬压网络效果好——这是本文最想传达的方法论。

所以这一节是想说:实验证明"用 OT 在特征层对齐"确实比信号层硬回归更准、更抗遮挡。


你应该懂的几个新词

  • RF 感知(RF sensing):用无线电波(WiFi/雷达等)感知人和环境,隐私友好、抗遮挡、不怕黑。
  • 人体姿态估计(human pose estimation):估计人体关节点的位置,得到骨架;3D 即三维坐标。
  • 最优传输(Optimal Transport, OT):衡量"把一个分布变成另一个分布"的最小总代价的数学理论,常用于对齐不同来源的特征分布。
  • 域对齐 / 域鸿沟(domain gap):两个来源的数据分布差异很大;对齐就是让它们在同一空间可比。
  • 特征层 vs 信号层:在压缩后的特征上操作 vs 在原始信号上操作;前者更灵活。
  • 多视角相机真值:用多个相机重建 3D 姿态当训练标准答案。
  • 编码器/解码器:把数据压成特征 / 从特征生成输出的网络。

所以这一节是想说:最优传输、域对齐、特征层是理解本篇的三个关键词。


它有什么搞不定的

  • 依赖配对数据采集:需要 RF 系统 + 多相机同步采集真值,成本高、场景受限于采集环境。
  • 泛化到全新环境仍是挑战:RF 信号对环境布局敏感(多径反射随房间变化),换到完全不同的新环境可能退化。
  • 多人场景更难:多个人同时反射信号会互相干扰,分辨每个人的姿态比单人难得多。
  • 精度不及视觉:在光照良好、无遮挡时,视觉方法通常仍更准;RF 的价值在隐私和遮挡场景。
  • OT 计算成本:最优传输的求解本身有计算开销,实时性需要工程优化。

所以这一节是想说:它在隐私/遮挡场景有独特价值,但受数据采集、环境泛化、多人干扰和精度上限限制。


它和别的几篇是什么关系

  • 同赛道:RF-Pose(穿墙估姿态)、Person-in-WiFi、RFMask 等都是"用无线电估人体"的工作,RFPose-OT 的差异是引入最优传输在特征层对齐。
  • 技术来源:最优传输在域自适应、生成模型(Wasserstein GAN)里早有应用,本文把它迁移到 RF→姿态。
  • 邻居:RadarHD(雷达成点云)、milliEgo(雷达里程计)是毫米波感知的其它任务;RFPose-OT 聚焦人体姿态。
  • 对照:视觉姿态估计是要在隐私/遮挡上超越的对象。

所以这一节是想说:RFPose-OT 属于"无线电估人体"这一族,用最优传输这一数学武器改进了跨域翻译。


和本导读的关系

本笔记对应导读 Ch19: 射频感知。Ch19 讲的是"用无线电波感知世界",其中"隔墙/隐私友好地感知人体"是最吸引人的应用之一。RFPose-OT 在这条线里代表"RF 人体姿态估计"这一支,并贡献了一个重要的方法论洞察:当两种模态结构差异巨大时,应在特征层面用有原则的工具(最优传输)对齐,而非在原始层面硬凑。读完本篇再看同章的 rf-pose-through-wall(穿墙估姿态)、person-in-wifi(WiFi 估姿态)、radarhd(雷达点云),能拼出"RF 感知人体"的全景。

所以这一节是想说:把 RFPose-OT 放进 Ch19,它对应"RF 人体姿态估计",并给出"跨模态特征对齐"的方法论。


思考题

Q1:为什么"在信号层面直接回归姿态"效果有限?RFPose-OT 换到哪一层做、为什么更好?

提示

信号和骨架结构差异巨大,直接硬压网络难学。RFPose-OT 在特征层面用 OT 对齐两个分布,衔接更有原则。

Q2:用"搬沙子"的比喻解释一下最优传输在这里干了什么。

提示

把"RF 特征这堆沙"以最小总成本搬成"姿态特征那堆沙"的形状,即把信号特征对齐到姿态空间。

Q3:为什么 RF 感知在隐私和遮挡上比摄像头有优势?代价是什么?

提示

不拍图像、不怕黑、能穿遮挡。代价是精度通常不及视觉、对环境布局敏感、多人更难。

Q4:为什么要在三种环境(室内/遮挡/室外)都测?只测理想室内会有什么问题?

提示

只测理想室内无法证明鲁棒性。遮挡和室外是 RF 的价值场景,也是最容易退化的场景。

Q5:RF 信号对环境布局(多径反射)敏感,这会给"换到全新房间"带来什么麻烦?

提示

不同房间的反射路径不同,训练时学到的信号-姿态映射可能不迁移。想想域鸿沟为什么在 RF 里尤其严重。

Q6:多人同时在场时,为什么姿态估计会难很多?

提示

多人反射的信号叠加、互相干扰,难以分离"哪部分信号属于谁"。想想信号混叠问题。

Q7:最优传输是通用的"分布对齐"工具,你还能想到它在别的跨模态问题里的用途吗?

提示

域自适应(把源域特征对齐到目标域)、图文/音文对齐、风格迁移、Wasserstein GAN。想想任何"两个分布要对上号"的场景。


一些好奇心问答(FAQ)

Q:RFPose-OT 能隔着墙看人吗?

RF 信号本身具备一定穿透能力(这是 RF 感知相对视觉的卖点之一),论文在遮挡场景验证了鲁棒性。具体的穿墙能力取决于频段、功率和墙体材质。

Q:它比摄像头准吗?

在光照好、无遮挡时,视觉通常更准。RFPose-OT 的价值在隐私敏感、黑暗、遮挡场景——那里视觉不行而它能用。

Q:最优传输是必须的吗,换个对齐方法行不行?

OT 是一种有原则、能显式衡量分布差异的对齐工具。也可用对抗对齐等替代,但本文证明 OT 在此任务上带来更高精度。

Q:换个房间还能用吗?

RF 对环境布局敏感,跨全新环境可能需要重新采集/适配。这也是 RF 感知的通病,是重要的研究方向。

所以这一节是想说:它是"隐私/遮挡场景下的人体姿态感知",跨环境泛化是主要待解难题。


如果你想再深入

  1. 同赛道:RF-Pose(穿墙估姿态) — 理解 RF 估人体的开创工作。
  2. 同赛道:Person-in-WiFi / RFMask — 看用 WiFi/雷达估人体的其它方案。
  3. 数学工具:最优传输 / Wasserstein 距离 — 理解 OT 的原理与应用。
  4. 域自适应基础 — 理解"跨域特征对齐"这个大问题。
  5. 同章:radarhd / millimap — 看毫米波感知的其它任务。

所以这一节是想说:把 RF-Pose → RFPose-OT 与最优传输/域自适应一起读,能看清"跨模态感知 + 分布对齐"的思路。


原文信息

  • 标题:RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  • 作者:Cong Yu, Dongheng Zhang, Zhi Wu, Zhi Lu, Chunyang Xie, Hu Yang, Yan Chen
  • 期刊:IEEE Transactions on Circuits and Systems for Video Technology (TCSVT) 2023
  • arXiv:https://arxiv.org/abs/2301.13013
@article{yu2023rfposeot,
  title   = {RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory},
  author  = {Yu, Cong and Zhang, Dongheng and Wu, Zhi and Lu, Zhi and Xie, Chunyang and Yang, Hu and Chen, Yan},
  journal = {IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)},
  year    = {2023},
  url     = {https://arxiv.org/abs/2301.13013}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_rfpose_ot_2026,
  title       = {(readable note) RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/rfpose-ot/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?