Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 121

SpatialVLA

13 min read · 4489 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

教机器人两件事:用普通摄像头也能看出远近(Ego-3D 位置编码);把常用动作存成"肌肉记忆"、不常用的粗着存(自适应动作网格)。两招合起来,让 VLA 跨机器人、跨任务迁移更稳。

所以这一节是想说:SpatialVLA 从"空间感知"和"动作表示"两个短板同时下手,让通用机器人策略更能迁移。


这是个什么场景

闭上一只眼睛去拿桌上的杯子——你会发现手伸过去要么撞到、要么差几厘米,因为少了一只眼睛带来的"立体感"。机器人面对的正是这个困境:摄像头给它一张平面照片,它得猜杯子到底在哪。

再想想你每天的动作:从冰箱拿可乐,90% 的时间手在做"小幅微调"(往前一点、往左一点),只有偶尔需要"大幅挥臂"。但老办法教机器人时,把每一档动作幅度都当同样重要去记——相当于背单词时把"the/a/量子纠缠"用同样大小的卡片记,浪费脑容量。

SpatialVLA 干的就是这两件事:

  • 给机器人装"立体感"(Ego-3D 编码),让它从普通摄像头就能感知"杯子在我前方 30 厘米"。
  • 给机器人建"动作的肌肉记忆"(自适应动作网格),常做的小动作存得细,不常做的大动作存得粗。

VLA(Vision-Language-Action):吃"图 + 指令"、吐"机器人动作"的模型。SpatialVLA 是给 VLA 打补丁的工作。

所以这一节是想说:SpatialVLA 面对的是"VLA 从平面图里悟不出准确空间、又把动作一刀切均匀离散"这两个老毛病。


SpatialVLA — 场景示意:这论文要解决的现实问题
Plate Nº ISpatialVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • RT-2 / OpenVLA 等第一代 VLA:直接把 2D 图 + 文本塞进大模型,输出离散化动作 token,空间感全靠模型自己从像素里"悟",不稳。
  • 3D 输入流派:用点云或体素显式喂 3D,效果好但要深度相机,泛化到只有 RGB 的场景就掉。
  • 动作离散化方案:早期把每个动作维度均匀分桶(如 256 个格子),桶大小固定,导致细动作不够精、粗动作浪费 token。
  • 数据驱动派:靠堆机器人数据(Open X-Embodiment)暴力扩规模,不解决表示问题。
  • 共同问题空间表示弱 + 动作表示僵,跨机器人/跨场景迁移就崩。

所以这一节是想说:以前要么靠模型硬悟空间(不准)、要么靠深度相机(不通用);动作离散又是一刀切,迁移能力受限。


这篇论文的新想法

两条线同时优化:

  1. Ego-3D 位置编码(Ego-3D Position Encoding):不要求传感器给完整 3D,而是从单目 RGB 推理出以机器人自己为原点(ego-centric)的 3D 位置编码,注入视觉 token。让"前后远近"成为一等公民。
  2. 自适应动作网格(Adaptive Action Grids):观察到机器人动作分布不均匀(很多集中在小幅微调,少量是大动作),于是按数据分布自适应地划分动作网格,把 token 预算花在常用动作上。

合起来:模型既"看得有立体感"又"出招有肌肉记忆",跨机器人、跨任务迁移更稳。

所以这一节是想说:SpatialVLA 的新意是"从 2D 推 3D 编码"+"按分布自适应离散动作"这两个可拆卸的模块。


它分几步做的(方法)

这一节是全篇核心,拆成"视觉 3D 化、动作自适应离散、预训练、推理"四段。

整体数据流 ASCII 示意:

   RGB 图 ─► 视觉编码器 ─► patch token + Ego-3D 位置编码(x,y,z) ┐
                                                                 ├─► VLM 主干(PaliGemma 类) ─► action token
   指令 ─► 文本 token ───────────────────────────────────────┘                    │
   推理: action token ─► 反查自适应网格 ─► 连续动作 ─► 机器人

第 1 步:视觉端的 3D 化——给每个像素贴一张"离镜头多远"的纸条

输入:一张普通 RGB 图。

处理:图先过视觉编码器拿到 patch token(图被切成的小块特征)。给每个 token 配一个 Ego-3D 位置编码——把 2D 像素位置 + 推断出的深度/相对相机位姿组合成一个 3D 坐标的嵌入。

输出:下游 Transformer 看到的不再是 "(x,y) 像素",而是 "(x,y,z) 机器人自身视角下的 3D 坐标" token。

位置编码(position encoding):Transformer 本身对"谁在哪"不敏感,需要额外注入位置信息。这里注入的是 3D 位置,而不是普通的 2D/序列位置。

第 2 步:动作空间的自适应离散化——量勺在常用刻度处更密

输入:大规模机器人数据里每个动作维度(dx, dy, dz, droll, ...)的分布。

处理:做菜时"加一点点盐"和"狂倒半瓶酱油"频率天差地别——量勺应该在小剂量段刻度密、大剂量段刻度疏。技术上就是用类似分位数的方法划格子:动作密度高的区段格子细,密度低的区段格子粗。每个动作维度变成一个离散 token id,整条轨迹就成了一串 action token,可以像文本一样丢给语言模型预测。

输出:一套贴合真实动作分布的离散动作词表。

等等,先慢一拍——"把动作变成 token"是什么意思?

就是把"机械臂往前推 0.3 厘米"翻译成一个像单词一样的编号(比如 #237 号格子),让模型像写句子一样依次"写出"动作。均匀分桶是"每个格子代表同样大小的位移";自适应网格是"常用的小位移用很多小格子精细表示,罕见的大位移用几个大格子粗略表示"——把有限的"词汇量"花在刀刃上。

第 3 步:训练——先见百家厨房,再熟悉你家灶台

输入:大规模多机器人混合数据(Open X-Embodiment 量级,跨多种本体)。

处理:骨干用已有的 VLM(如 PaliGemma 类),加上前两个模块,先在混合数据上预训练,再在目标任务/目标机器人上微调。

输出:一个在多本体数据上打好底、能快速适配新机器人的策略。

第 4 步:推理——念稿出动作,翻译官还原数值

输入:一张图 + 一句自然语言指令。

处理:模型像念稿一样滚动输出 action token,再反查自适应网格解码回连续动作。

输出:送给机器人控制器执行的连续动作。滚动长度/chunk 大小需查原文。

等等,先慢一拍——为什么"3D 坐标 + 自适应网格"能帮跨本体迁移?

这两个模块合起来,本质是在给 VLA 建一套"和具体机器人无关"的通用语言。先看 Ego-3D 坐标:不同机器人的相机装的位置、朝向、焦距都不一样,如果模型只学 2D 像素里的规律,换一台相机装法不同的机器人就得重学;而一旦把每个视觉 token 附上"它在以机器人自己为原点的三维空间里大概在哪"的坐标,模型学到的就是"目标在我右前方 30 公分"这种物理关系,这在任何本体上都成立。再看自适应动作网格:不同机器人的动作幅度、关节范围差异很大,用一套固定的均匀分桶会对某些本体太粗、对另一些太细;按每个数据分布自适应地划网格,等于给每台机器人都配了"量身裁剪的刻度尺",预训练时学到的动作规律就更容易在本体间通用。所以这两招不是各自孤立的小优化,而是共同服务于"一次预训练、多种机器人都能快速适配"这个目标。

所以这一节是想说:SpatialVLA 的方法 = 给视觉 token 注入 Ego-3D 坐标 + 按分布自适应离散动作 + 多本体预训练 + 网格反查推理,四步串起来,核心是用"与本体无关的 3D 空间语言 + 自适应刻度尺"撑起跨机器人迁移。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【SpatialVLA · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

SpatialVLA — 方法示意:核心 pipeline
Plate Nº IISpatialVLA — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体成功率请查原文,此处不编造。

维度 说明
空间模块 Ego-3D 位置编码(从单目 RGB 推 3D)
动作模块 自适应动作网格(按分位数划格子)
骨干 现成 VLM(PaliGemma 类)
预训练数据 Open X-Embodiment 量级多本体数据
评测 SimplerEnv / LIBERO + 真机跨本体迁移
传感器要求 仅需 RGB + 相机标定,不要深度相机
核心卖点 跨机器人、跨任务迁移更稳

关键结论:两个模块各自都能拆下来用,且消融显示各自贡献可分离——去掉 Ego-3D 空间任务掉分,去掉自适应网格换均匀网格也掉分。这说明"空间"和"动作"这两个短板确实是独立的、都值得补。

所以这一节是想说:数字告诉我们,Ego-3D 和自适应网格是两个独立有效的组件,共同带来更强的迁移能力。


实验结果说明了什么

  • 仿真基准:在 SimplerEnv / LIBERO 上跑成功率,对照 OpenVLA 等。
  • 真机跨本体:在不同夹爪/不同自由度的机器人上验证迁移,看少样本微调效果。
  • 消融:拆掉 Ego-3D 看掉多少、把自适应网格换均匀网格看掉多少——这是证明两个模块各自有效的关键。
  • 跨机器人迁移:A 机器人训练、B 机器人部署,比 SOTA。

核心想验证两点:"3D 编码真帮到空间任务"+"自适应网格真比均匀好"。

所以这一节是想说:实验的意义是把"空间"和"动作"两个改进的贡献分离量化,证明它们不是锦上添花而是各自解决了真问题。


你应该懂的几个新词

  • VLA:吃"图 + 指令"、吐"动作"的模型。
  • Ego-centric / Ego-3D:以"自己"(机器人/摄像头)为原点的坐标系,和世界坐标(world frame)相对。
  • 位置编码:给 Transformer 注入"谁在哪"的信息,这里注入 3D 位置。
  • 动作 tokenization(动作 token 化):把连续动作切成离散 token,让语言模型能像生成文字一样生成动作。
  • 自适应网格:按数据分布动态决定离散化格子边界,而非均匀划分。
  • Open X-Embodiment:跨本体机器人数据集联盟,VLA 预训练的标准燃料。
  • 分位数(quantile):把数据按大小排序后等比例切分的点,自适应网格用它保证"每个格子里样本数差不多"。

所以这一节是想说:这几个词是理解"空间感知 + 动作表示"这类 VLA 改进的通用语。


它有什么搞不定的

  • 单目 3D 本质是估计:从 RGB 推深度终究是"猜",在无纹理、反光、透明物体上会失准,不如真深度相机可靠。
  • 依赖相机标定:Ego-3D 编码需要相机内外参,标定不准会污染 3D 坐标。
  • 自适应网格依赖训练分布:如果部署时的动作分布和训练数据差异大,"肌肉记忆"就用错地方了。
  • 仍是离散动作:自适应网格再细也有量化误差,极精细操作可能不如连续输出(如 flow matching)。
  • 骨干规模不小:基于 PaliGemma 类 VLM,部署成本仍高于 TinyVLA/SmolVLA 那种轻量路线。

所以这一节是想说:SpatialVLA 的短板集中在"单目 3D 是估计、依赖标定、离散量化误差"上——它改善了表示,但没消除表示的根本局限。


它和别的几篇是什么关系

  • 上游/同代:RT-2、OpenVLAOcto——SpatialVLA 把它们的架构当起点,针对"空间"和"动作"两短板各打一拳。
  • 3D 相关:和 3D-VLA 等显式 3D 输入路线不同,SpatialVLA 走"从 2D 推 3D 编码"的轻量路线,部署门槛更低。
  • 动作离散化相关:和 RT-2 的均匀分桶相比,自适应网格是更细的工程改进;和 VQ-BeT 的可学习离散化是不同思路(一个按分位数固定、一个端到端学)。
  • 轻量对照:和 TinyVLASmolVLARoboMamba 相比,SpatialVLA 不追求"小",而追求"表示更好"。
  • 下游影响:之后的 VLA 会把它的 ego-3D 思路当 baseline 之一。

所以这一节是想说:SpatialVLA 是"给 VLA 补表示"这条支线的代表,和"给 VLA 减规模"的支线并行。


和本导读的关系

本篇对应导读 Ch12: OpenVLA / VLAs / MLA。Ch12 讲 VLA 的演化,其中一条主线就是"输入/输出表示怎么变好"。SpatialVLA 正是这条线的样本——它不换主干、不减规模,而是专攻"视觉怎么带 3D、动作怎么离散"这两个表示问题。读完本篇,配合同章的 openvla(基准)、spatialvla 的轻量对照 tinyvla/smolvla,能理解 VLA 改进的两个正交方向:改表示 vs 改规模。

所以这一节是想说:把 SpatialVLA 放进 Ch12 的 VLA 主线里读,它代表"改表示"这一支。


思考题

Q1:为什么均匀分桶对机器人动作是浪费?自适应网格怎么省?

提示

动作分布高度不均匀(大量小微调、少量大动作)。均匀分桶把同样多的格子分给罕见的大动作,浪费;也让常见的小动作精度不够。自适应网格按分位数分,常用区段格子密、罕见区段格子疏,把"词汇量"花在刀刃上。

Q2:Ego-3D 编码是"估计"出来的深度,这在什么物体上最容易失准?

提示

无纹理表面(白墙)、反光/镜面、透明物体(玻璃杯)——这些单目深度估计的经典难点,会让推出来的 3D 坐标不可靠。

Q3:为什么 SpatialVLA 选"从 2D 推 3D 编码"而不是直接用深度相机?

提示

深度相机要额外硬件,且很多现成数据只有 RGB。从 2D 推 3D 编码让方法能用在只有 RGB 的场景,部署和数据门槛都低——代价是 3D 是估计的、没那么准。

Q4:自适应动作网格依赖训练数据的动作分布。如果换一个动作分布很不同的机器人,会怎样?

提示

网格是按训练分布划的。新机器人若常做的动作落在网格稀疏的区段,精度就会差。这时需要在新机器人数据上重新统计/微调网格。

Q5:SpatialVLA 的自适应网格和 VQ-BeT 的可学习 codebook 都在"更好地离散动作",两者本质区别是什么?

提示

SpatialVLA 按分位数一次性划固定格子(不可学习但简单、可解释);VQ-BeT 用端到端可学的 codebook(更贴分布但需训练、含残差层)。前者工程简单,后者表达力更强。

Q6:如果把 SpatialVLA 的两个模块拆出来装到别的 VLA 上,你预期哪个更容易带来提升?

提示

取决于目标 VLA 的短板。若它空间任务弱,Ego-3D 提升明显;若它动作精度差,自适应网格提升明显。消融数据能告诉你各自的独立贡献。

所以这一节是想说:这几个问题带你把"离散化取舍、单目 3D 局限、模块可迁移性"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:SpatialVLA 需要深度相机吗?

不需要。它的卖点之一就是只用 RGB + 相机标定,从 2D 推出 3D 编码。这让它比显式 3D 输入的方案更好部署。

Q2:两个模块能单独用吗?

能。Ego-3D 编码和自适应动作网格都是可拆卸组件,理论上可以塞进别的 VLA。这是论文强调的可复用性。

Q3:它比 OpenVLA 强在哪?

主要强在空间相关任务的准确率和跨机器人迁移的稳定性。绝对成功率对比请看论文主表。

Q4:自适应网格会不会让动作解码变复杂?

推理时要"反查网格"把 token 翻回连续动作,比均匀分桶稍复杂,但开销很小,不影响实时性。

Q5:它属于"大 VLA"还是"小 VLA"?

偏大——基于 PaliGemma 类 VLM。它的目标是"表示更好",不是"更小更省"。要小就看 TinyVLA/SmolVLA。

Q6:读完 SpatialVLA 接下来看什么?

想看"改表示"的另一面看 3D-VLA;想看动作离散的另一思路看 VQ-BeT;想看"改规模"看 TinyVLA

所以这一节是想说:要不要深度相机、模块能否单用、算大还是小——这些实操问题都有明确答案。


如果你想再深入

按"基准 → 对照 → 组件源头"排序:

  1. 基准:OpenVLA —— SpatialVLA 的起点架构。
  2. 对照:3D-VLA —— 显式 3D 输入路线,对比"推 3D 编码"的取舍。
  3. 组件:VQ-BeT —— 动作离散化的另一条(可学习)路线。
  4. 对照:TinyVLA / SmolVLA —— "改规模"支线,和"改表示"形成正交对比。

所以这一节是想说:把 OpenVLA + SpatialVLA + 3D-VLA + VQ-BeT 连起来读,能看清"VLA 表示改进"的整个设计空间。


原文信息

  • 标题:SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Models
  • arXiv:https://arxiv.org/abs/2501.15830
  • 发表:arXiv, 2025
  • 年份:2025

BibTeX:

@article{qu2025spatialvla,
  title   = {SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Models},
  author  = {Qu, Delin and others},
  journal = {arXiv preprint arXiv:2501.15830},
  year    = {2025},
  url     = {https://arxiv.org/abs/2501.15830}
}

所以整篇是想说:SpatialVLA 不换主干也不减规模,而是给 VLA 补上"从平面图看出立体、把动作按习惯精细编码"这两块短板——证明了改好表示本身,就能显著提升机器人的迁移能力。

引用本笔记 / Cite this note
BibTeX
@online{eai_spatialvla_2026,
  title       = {(readable note) SpatialVLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/spatialvla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?