Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 178

Survey of Vision-Language-Action Models for Embodied Manipulation

12 min read · 4073 字 · ⭐⭐⭐ · 长篇结构化

这是一份面向零基础读者的结构化研究笔记。本文只把公开论文文本和 arXiv 元数据能支持的结论写成事实;本站没有本地训练、仿真或真机复现实验,因此不会把综述判断写成本站 E4 结果。

一句话讲什么(TL;DR)

这篇综述系统整理面向具身操作的 VLA 模型。它从具身智能系统视角出发,把 VLA 发展历程分成 3 个阶段,并从 5 个关键维度分析当前研究:VLA model structures、training datasets、pre-training methods、post-training methods、model evaluation。它还把预训练方法分成 4 类,把后训练方法分成 3 类,并指出评估应覆盖真实环境、仿真器和世界模型。

如果只记一个直觉:这篇不是介绍某一个 VLA,而是给“机器人操作里的 VLA”建目录,告诉你模型由哪些部分组成、数据从哪里来、怎么训练、怎么评估。

所以这一节是想说:它是理解 VLA manipulation 全景的总览页。

这是个什么场景

具身操作指机器人用机械臂、夹爪、传感器和环境交互,例如抓取、放置、整理、插入、开门、折叠、移动物体。VLA 模型希望把语言指令、视觉观察和动作输出连接起来,让机器人从“只能执行固定程序”走向“能理解开放指令并执行操作”。

这类论文很多,新手容易混乱:有的讲 RT-2,有的讲 OpenVLA,有的讲 π0,有的讲数据集,有的讲动作 token,有的讲 diffusion action head,还有的讲评估 benchmark。vla-manipulation-survey 的作用就是把这些内容放进一个结构化框架。

具身操作 VLA

语言指令 + 观测信息
        │
        ▼
  观测编码 -> 特征推理 -> 动作解码
        │          │          │
        ▼          ▼          ▼
    数据来源    训练方法    评估方式
综述的 5 个维度

1. 模型结构
2. 训练数据集
3. 预训练方法
4. 后训练方法
5. 模型评估

它特别强调 VLA 的发展不只是“大模型接机器人”。一个可用系统需要环境、本体和进化算法三个具身系统核心要素,也需要从结构、数据、训练和评估一起看。

所以这一节是想说:VLA manipulation 是系统工程,不是单个 backbone 名字。

Survey of Vision-Language-Action Models for Embodied Manipulation — 场景示意:这论文要解决的现实问题
Plate Nº ISurvey of Vision-Language-Action Models for Embodied Manipulation — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

已有综述有的按 VLA 概念讲,有的按 action representation 讲,有的按 VLM-based VLA 或后训练方法讲。它们各有价值,但本文认为仍有缺口:很多综述没有充分覆盖 2024 年之后快速迭代的 VLA 模型,也没有从具身操作场景下的结构、数据、训练和评估需求做完整梳理。

机器人操作和普通视觉语言任务不同。VLM 可以回答图片问题,但机器人还要把理解变成低层动作;动作是否成功取决于物体几何、接触、实时控制、传感器、机械臂本体和环境变化。因此,仅从 VLM 架构或语言能力看 VLA 是不够的。

本文试图补上这层“面向操作”的视角:不仅问模型怎么想,还问动作怎么解码、数据怎么来、训练怎么接入机器人轨迹、评估怎么覆盖真实环境和仿真。

所以这一节是想说:它弥补的是“以具身操作为中心”的 VLA 全景缺口。

这篇论文的新想法

这篇综述的核心贡献可以按四个层次理解。

第一,它把 VLA 发展历程分成 3 个阶段:萌芽阶段、探索阶段、快速发展阶段。萌芽阶段 VLA 概念尚未形成,但已有相似功能模型;探索阶段架构多样,但逐渐确立 Transformer 作为可扩展骨干;快速发展阶段则从单层走向多层,并随着数据积累出现更多多模态 VLA。

第二,它把 VLA 模型结构拆成观测编码、特征推理、动作解码。观测编码处理语言、RGB、深度、点云、触觉、力等信息;特征推理负责跨模态融合和任务理解;动作解码把特征变成机器人可执行动作。

第三,它把预训练方法分成 4 种:单一领域数据预训练、跨域分阶段训练、跨域数据联合训练、思维链增强。第四,它把后训练分成 3 类:监督微调、强化微调、推理扩展。

所以这一节是想说:本文的新意是把 VLA manipulation 的历史、结构、训练和评估拆成可学习的目录。

它分几步做的(方法)

第 1 步:先定义具身操作和 VLA 的位置

论文先把具身智能和机器人操作放在一起讲。具身智能不是离线处理数据,而是通过本体和环境交互获得能力。VLA 则是当前具身操作中很重要的一类通用控制框架。

这一步对新手很有帮助:VLA 不只是多模态模型,它是控制系统的一部分。模型输出不是解释文本,而是动作。

第 2 步:梳理发展阶段

论文把发展分成 3 个阶段。萌芽阶段已有类似 GATO 一类跨任务模型,但 VLA 概念尚不清晰;探索阶段出现更多架构尝试,Transformer 逐渐成为核心;快速发展阶段,RT-2、OpenVLA、π0、CogACT 等推动 VLA 走向更强泛化、多层结构和多模态训练。

这种历史线索能帮读者理解为什么现在会出现各种动作表示、层级结构、视频预训练和效率优化。它们不是孤立创新,而是 VLA 快速发展后自然出现的问题。

第 3 步:拆解模型结构

论文把主流 VLA 架构大致拆成三个部分:观测编码、特征推理、动作解码。

VLA 模型结构

[观测编码]
  语言 / RGB / 深度 / 点云 / 触觉 / 力
        │
        ▼
[特征推理]
  Transformer / VLM / LLM / 层级推理
        │
        ▼
[动作解码]
  离散 token / 连续动作 / diffusion / latent action

观测编码决定模型看到什么,特征推理决定模型如何理解任务,动作解码决定模型能不能输出稳定可执行的控制信号。任何一个环节薄弱,机器人都可能失败。

第 4 步:整理训练数据和预训练方法

论文强调数据是 VLA 发展的动力。机器人轨迹数据能提供真实动作,但昂贵且受本体限制;互联网图文数据能提供语义泛化,但缺少动作;视频数据有时空信息,但缺少机器人可执行标签。

预训练方法分成 4 类:单一领域数据预训练、跨域分阶段训练、跨域数据联合训练、思维链增强。跨域联合训练和思维链增强被认为有潜力,但也会带来参数竞争、数据分布差异和训练复杂度。

第 5 步:整理后训练和评估

后训练分为监督微调、强化微调和推理扩展。监督微调是当前主流,但在泛化和持续学习方面有挑战;强化微调有主动交互潜力,但还没有形成足够稳定的里程碑;推理扩展不需要额外训练,但用时间换性能,面临速度与性能折中。

评估方面,论文指出要从真实环境评估、仿真器评估和世界模型评估三方面看。只看一个仿真 benchmark 或一个成功率数字,很难判断 VLA 是否真的适合部署。

评估三层

真实环境:最接近部署,但成本高、变量多
仿真器:可控、便宜,但有 sim-to-real gap
世界模型:可扩展分析未来状态,但可信度需验证

所以这一节是想说:综述的主线是“历史 -> 结构 -> 数据 -> 训练 -> 评估”。

Survey of Vision-Language-Action Models for Embodied Manipulation — 方法示意:核心 pipeline
Plate Nº IISurvey of Vision-Language-Action Models for Embodied Manipulation — 方法示意:核心 pipeline

关键数字

本文的关键数字不是某个模型成功率,而是分类数量和结构口径:发展历程 3 个阶段;分析维度 5 个方面;预训练方法 4 类;后训练方法 3 类;评估方向 3 类。

这些数字可以作为读者的记忆锚点:

  • 3 阶段:萌芽、探索、快速发展。
  • 5 维度:结构、数据集、预训练、后训练、评估。
  • 4 类预训练:单一领域、跨域分阶段、跨域联合、思维链增强。
  • 3 类后训练:监督微调、强化微调、推理扩展。
  • 3 类评估:真实环境、仿真器、世界模型。

所以这一节是想说:这篇综述的数字帮助我们建立目录,而不是排名。

实验结果说明了什么

这是综述,不是提出新模型的实验论文。因此读它时重点不是找“本文方法超过 baseline 多少”,而是看它如何组织 VLA 证据。

第一,结构分类能帮助诊断论文贡献。看到一个新 VLA,可以先问它改了观测编码、特征推理还是动作解码。第二,训练分类能帮助判断数据依赖。它是只用机器人轨迹,还是混入图文/视频/跨本体数据?第三,评估分类能帮助判断证据等级。真实环境、仿真器、世界模型分别覆盖不同问题,不能互相替代。

这篇综述也提醒我们:VLA 研究不能只看单点成功率。泛化、持续学习、语义理解、空间感知、动作稳定、实时性、数据效率和评估可信度都要放进同一张表里。

所以这一节是想说:综述的实用价值是给每篇新论文提供审查问题。

术语表

  • 具身操作:机器人通过身体和环境交互完成操作任务。
  • 观测编码:把语言、图像、深度、点云、触觉、力等转成模型 token 或特征。
  • 特征推理:在模型内部融合多模态信息并形成动作决策依据。
  • 动作解码:把模型表示转成机器人可执行动作。
  • 单一领域预训练:主要在一种数据域中训练。
  • 跨域分阶段训练:先在一个域训练,再迁移到另一个域。
  • 跨域联合训练:不同数据域一起训练,共享参数。
  • 思维链增强:让模型在动作之外学习或输出 reasoning 过程。
  • 推理扩展:不额外训练,通过更长推理或搜索提升表现。

所以这一节是想说:VLA manipulation 的核心词汇都围绕“感知到动作”的链条。

局限和边界

第一,survey 的覆盖有时间边界。VLA 发展很快,2025 年之后仍会不断出现新方法,分类需要持续更新。

第二,综述中引用的模型表现来自原论文或已有报告,不是统一复现实验。不同硬件、任务、数据和评估协议下的数字不能简单横比。

第三,本文主要聚焦具身操作。导航、移动服务机器人、自动驾驶或人形全身控制虽然相关,但不一定完全适用同一套分析。

第四,综述提供宏观地图,但具体技术细节仍需要回到原论文。例如 OpenVLA、π0、CogACT、RT-2、SpatialVLA、ForceVLA、ChatVLA 等每个方法都有自己的训练和评估细节。

所以这一节是想说:综述帮我们导航,但不能替代一手论文和本地验证。

和其他论文的关系

和 efficient-vla-survey 相比,本文范围更宽。efficient-vla-survey 专注效率,本文覆盖结构、数据、训练和评估全景。

和 VLA-Forget 相比,本文提供大图,VLA-Forget 是安全治理方向的一个具体方法。综述中的后训练和评估框架可以帮助定位 VLA-Forget 属于训练后治理的一部分。

和 membership-inference-vla 相比,本文对隐私攻击不是重点,但它的评估章节提醒我们:未来 VLA 评估应该纳入更丰富的风险维度,隐私就是其中之一。

和 Green-VLA、Qwen-VLA、RealMirror 等统一模型相比,本文不主张某个架构最好,而是把这些方法放到发展阶段和结构维度里。

所以这一节是想说:这篇综述是 Batch 4 的“总地图”,其他论文是地图上的专题点。

和本导读的关系

本站已有很多单篇 VLA 笔记。读这篇综述后,可以把它当成索引:遇到新论文时,先判断它改的是观测、推理、动作、数据、预训练、后训练还是评估。

它也适合作为阶段复盘材料。读完几批 VLA 论文后,如果感觉概念很多,可以回到这篇的 5 个维度,把笔记重新归类。

所以这一节是想说:vla-manipulation-survey 帮助本站从论文堆变成知识图谱。

思考题

  1. 为什么 VLA 模型结构可以拆成观测编码、特征推理、动作解码?
  2. 单一领域预训练和跨域联合训练分别有什么优势和风险?
  3. 为什么真实环境、仿真器和世界模型评估不能互相替代?
  4. 如果一篇新论文只提升仿真成功率,你会用本文的哪些问题继续追问?

FAQ

Q:这篇综述是中文论文吗?
A:PDF 中有英文标题、摘要和大量中文正文,arXiv 元数据标题为 Survey of Vision-Language-Action Models for Embodied Manipulation。

Q:它和 Pure VLA survey 有什么区别?
A:本文更强调具身操作场景下的模型结构、训练数据、预训练、后训练和评估,Pure VLA survey 则是另一个更广的 VLA 方法综述。

Q:为什么要记录 3/5/4/3/3 这些分类数字?
A:因为这是新手建立目录感最快的方法,后续读论文可以按这些维度归档。

Q:综述有没有自己的机器人实验?
A:它主要是综述和分类,不是提出新模型并做统一实验。本站不把它写成复现实验。

进一步读什么

  • OpenVLA:理解开放 VLA 的基础结构。
  • RT-2:理解 VLM 到机器人动作的早期代表路线。
  • π0 / π0-fast:理解连续动作和 fast action model。
  • CogACT:理解 cognition-action componentization。
  • efficient-vla-survey:专门从效率角度复盘 VLA。

精读补充:为什么这篇综述适合当“总地图”

读了很多 VLA 单篇论文后,最常见的困惑是每篇都在说自己是 generalist、foundation、efficient、scalable,但它们到底改了哪里并不直观。vla-manipulation-survey 的价值,就是提供一张总地图。它把 VLA 拆成观测编码、特征推理、动作解码,再把数据、预训练、后训练、评估放到旁边。这样看新论文时,就不会只被模型名字牵着走。

比如一篇论文说自己加入三维信息,可以先放到观测编码和空间感知里;一篇论文说自己用视频数据,可以放到预训练数据和 latent action 桥接里;一篇论文说自己用 RL 提升真实机器人表现,可以放到后训练和真实环境评估里;一篇论文说自己用世界模型评估未来状态,就放到评估维度里。分类不是为了贴标签,而是为了知道下一步该问什么。

这篇综述还把“具身操作”放在中心。操作任务不是单纯识别物体,而是要产生接触、运动和结果。视觉、语言、动作之间的误差会累积:观测编码少了深度或触觉,特征推理可能不懂接触关系,动作解码可能无法稳定执行。总地图能帮助我们沿着链条定位问题,而不是只说“模型不够大”。

对本站来说,这篇综述也能帮助维护知识库。后续新增论文可以挂到 5 个维度下面:结构论文、数据论文、预训练论文、后训练论文、评估论文。这样 178 篇以后继续扩展时,知识不会只是按时间堆叠,而能形成可复用的路线。

所以这一节是想说:这篇综述的价值不是告诉你唯一答案,而是让你知道每篇 VLA 论文该放在哪个抽屉里。

后续核验清单

如果之后要把本文从 UNVERIFIED 提升到人工核验状态,应逐项核对:3 个发展阶段、5 个分析维度、4 类预训练、3 类后训练、3 类评估是否和原文一致;作者和 Acta Automatica Sinica citation 是否准确;不要把综述分类写成本站原创分类;不要把引用论文的结果写成本站复现实验。

原文信息

@article{li2025vlamanipulationsurvey,
  title = {Survey of Vision-Language-Action Models for Embodied Manipulation},
  author = {Li, Hao-Ran and Chen, Yu-Hui and Cui, Wen-Bo and Liu, Wei-Heng and Liu, Kai and Zhou, Ming-Cai and Zhang, Zheng-Tao and Zhao, Dong-Bin},
  journal = {arXiv preprint arXiv:2508.15201},
  year = {2025}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_vla_manipulation_survey_2026,
  title       = {(readable note) Survey of Vision-Language-Action Models for Embodied Manipulation},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/vla-manipulation-survey/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?