Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 171

Green-VLA: Staged Vision-Language-Action Model for Generalist Robots

12 min read · 4086 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份面向零基础读者的结构化研究笔记。本文只把公开论文文本和 arXiv 元数据能支持的结论写成事实;本站没有本地训练、仿真或真机复现实验,因此不会把论文报告的成功率写成本站 E4 结果。

一句话讲什么(TL;DR)

Green-VLA 的核心不是单纯扩大模型,而是把 VLA 从网页视觉语言基座、机器人预训练、具体身体适配到 RL 对齐,拆成 L0/L1/R0/R1/R2 五个阶段,目标是让同一个策略覆盖单臂、双臂和 Green 人形机器人。

如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人需要低延迟、少量示范适配、长程稳定和全身协调。

所以这一节是想说:Green-VLA 的价值在于把 VLA 从论文分数推近真实部署约束。

这是个什么场景

如果训练机器人像培养实习生,Green-VLA 不让它第一天就上真实厨房,而是先读通用教材,再学物理世界常识,再看大量机器人示范,然后到某台机器人上实习,最后通过真实反馈纠偏。

第 3 批主线:部署效率与快速适配

训练课程 / 自适应计算 / one-shot 技能 / 快慢系统
          │
          ▼
       Green-VLA
          │
          ▼
让 VLA 更接近真实机器人部署:快、稳、可适配
部署视角

[视觉语言理解] -> [动作生成] -> [真实/仿真执行]
      │              │              │
      ├─ 成本:算力/延迟
      ├─ 适配:新任务/新身体
      └─ 稳定:长程/异常/实时控制

这个场景强调工程约束。一个模型在离线 benchmark 上成功,不代表它能以足够频率控制真实机器人;能在一个任务上成功,也不代表换环境后一条示范就能适配。

所以这一节是想说:读 Green-VLA 要把成功率和部署条件一起看。

Green-VLA — 场景示意:这论文要解决的现实问题
Plate Nº IGreen-VLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

行为克隆在长程、接触丰富和高自由度任务上容易饱和;单纯堆数据也无法解决动作空间不统一、数据质量不均和真机部署效率问题。VLA 还需要兼顾成功率、动作链长度和完成时间。

过去很多 VLA 论文默认强 backbone 每步完整运行,或者默认新任务可以靠再次 fine-tune 解决。但真实部署里,等待大模型推理会降低控制频率,收集几十条示范也可能太贵,长程任务一旦早期失败后续步骤就不可达。第 3 批论文分别从训练课程、推理压缩、无梯度适配和异步控制四个方向补这些缺口。

所以这一节是想说:旧方法的问题不是能力完全不够,而是部署成本、适配成本和实时性不够。

这篇论文的新想法

论文提出五阶段 curriculum:L0 base VLM、L1 web pretrain for physical understanding、R0 general robotics pretrain、R1 embodiment-specific adaptation、R2 RL-based policy alignment,并用统一 action space、DataQA 质量过滤和 task planner 支撑真机部署。

这类新意的核心是把约束显式建模。与其希望模型自己学会省算力、自己学会迁移、自己学会快慢分工,不如给它可学习的结构和评测指标。

所以这一节是想说:Green-VLA 的新意是把部署约束变成训练或推理机制的一部分。

它分几步做的(方法)

第 1 步

输入:L1 用网页/多模态数据补物理世界理解;R0 混合 24M+ 非机器人样本和 3,000 小时机器人示范;DataQA 用轨迹平滑、图像清晰度、视觉多样性和状态方差过滤数据。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

第 2 步

输入:统一动作空间把不同机器人控制映射到固定语义布局,并通过频率插值/外推、control-type prompt 和 retargeting 处理人形和非人形数据。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

第 3 步

输入:R1 针对目标 embodiment 微调,R2 用 RL alignment 处理长程目标、失败恢复、偏好反馈和动作效率。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

第 4 步

输入:推理时高层 task planner 把用户目标拆成子任务,Green-VLA 输出动作并用 episode-end、OOD 和目标点引导信号控制执行。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

方法部分要按“哪个部署瓶颈 -> 哪个机制 -> 哪个实验数字”来读。否则容易把这些论文误解成普通模型堆料。

所以这一节是想说:方法的关键是看 Green-VLA 把哪类部署瓶颈交给了哪个机制处理。

Green-VLA — 方法示意:核心 pipeline
Plate Nº IIGreen-VLA — 方法示意:核心 pipeline

关键数字(What works)

事实 数字 / 状态 来源与证据边界
训练阶段 L0/L1/R0/R1/R2 五阶段 摘要与方法
机器人数据 约 3,000 小时 demonstrations 摘要/实验
非机器人数据 over 24M multimodal samples 方法
Green humanoid 32 DoF upper body Introduction
模型规模 约 4B;PaliGemma 3B backbone 实验设置
训练算力 R0 使用 48 H100,超过 105 optimization steps 实验设置
Green humanoid 数据 48 小时扩展为 167 小时有效数据 数据章节
ALOHA table cleaning Green-VLA(R0) first item SR 69.5,avg time 1m35s Table 2
π0 对照 π0 first item SR 35.6,avg time 2m59s Table 2
AgiBot GO-1 对照 first item SR 38.4,avg time 3m57s Table 2

这些数字都是论文报告结果,不是本站本地复现。本站当前只完成公开来源研究、站点构建、provenance 与部署验证。

所以这一节是想说:关键数字帮我们判断方法是否支撑主张,但不能替代本地实验。

实验结果说明了什么

最直观的结果是 ALOHA table-cleaning:Green-VLA(R0) 在 Tape/Screwdrivers/Pliers 上分别达到 83.1/52.1/63.7,first item SR 69.5,平均完成时间 1m35s;π0 的 first item SR 为 35.6,平均 2m59s。论文还强调 R2 对长程成功率、恢复和精确任务跟随有增益。

实验要同时看成功率和部署条件:比如同样 90% 成功率,12Hz 和 32Hz 的控制体验完全不同;同样 100% 成功率,一条示范和一百条示范的适配成本也完全不同。

所以这一节是想说:实验说明 Green-VLA 在特定部署瓶颈上有效,但证据边界仍是论文设置。

你应该懂的几个新词

  • Staged training:分阶段训练,每一阶段解决不同瓶颈。
  • Adaptive computation:按输入或动作上下文动态决定计算量。
  • One-shot adaptation:只用一条示范适配新任务。
  • Fast-slow system:慢系统做语义推理,快系统做实时控制。
  • Action tokenizer:把连续动作压成 token 或离散表示,方便模型生成。
  • Flow matching / diffusion policy:把噪声动作逐渐变成可执行动作的连续生成方法。

所以这一节是想说:这些词都围绕部署:更快、更稳、更省数据。

它有什么搞不定的

  • Green-VLA 仍以 Green humanoid 为主要目标平台,跨更多人形机器人还需验证。
  • R2 RL alignment 更接近在线/真机反馈流程,成本和安全门槛高。
  • DataQA 过滤能提升质量,但也可能过滤掉长尾困难样本。
  • 论文报告的是作者系统结果,本站未复现训练或真机部署。

这些局限提醒我们:VLA 走向真实机器人,不是一个模型名字能解决,而是数据、推理、控制、硬件和安全共同构成的系统工程。

所以这一节是想说:Green-VLA 推进了一个部署维度,但没有消除真实机器人的全部风险。

它和别的几篇是什么关系

  • 它和 Qwen-VLA 都追求 generalist VLA,但 Green-VLA 更强调 staged deployment curriculum。
  • 它和 X-VLA / HiMoE-VLA 都处理多 embodiment 数据,只是 Green-VLA 更关注真机部署流程。
  • 它和 LeRobot / RealMirror 都是从读论文走向工程流水线的重要参考。

第 3 批最好和前两批连读:第 1 批看统一与动作解码,第 2 批看跨 embodiment,第 3 批看部署效率和快速适配。

所以这一节是想说:Green-VLA 是 40 篇扩展里“从研究模型走向部署系统”的一环。

和本导读的关系

本篇对应导读中的 Ch04: 技术版图Ch12: VLACh17: Sim-to-Real。读它之前,建议先理解 OpenVLA、π0、Qwen-VLA、X-VLA 的基本路线。

对 40 篇扩展计划来说,Green-VLA 属于第 3 批,负责补“部署效率 / 快速适配 / 真机全身控制”这条线。

所以这一节是想说:这篇笔记把 VLA 学习从模型结构推进到部署约束。

思考题

Q1:这篇论文解决的是速度、适配、长程还是真机部署?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q2:它的核心组件去掉后,成功率或速度掉了多少?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q3:它需要多少额外数据才能适配新任务?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q4:它和第 1/2 批论文的最大差异是什么?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q5:如果你要复现,哪个 benchmark 最小?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q6:哪些数字不能写成本站复现实验?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

一些好奇心问答(FAQ)

Q:为什么第 3 批不只看成功率?

因为部署还看速度、数据成本、控制频率和异常恢复。成功率相同的系统,实时性可能完全不同。

Q:这些方法能替代安全层吗?

不能。它们提升模型部署能力,但真实机器人仍需要速度、力矩、碰撞和人工接管等安全机制。

Q:为什么还保持 UNVERIFIED?

因为本站没有逐节人工核验和本地复现实验。公开论文事实和本站实验结果是两种证据等级。

如果你想再深入

  1. 先复习 OpenVLA、π0、Qwen-VLA。
  2. 比较 AC²-VLA 和 DuoCore-FS:一个省计算,一个拆频率。
  3. 比较 MoS-VLA 和 X-VLA:一个无梯度一示范,一个 soft prompt 适配。
  4. 看 Green-VLA 时重点关注五阶段训练和 RL 对齐。

补充:怎么把这篇读成工程路线图

读 Green-VLA 时,不要把五阶段训练当成一个好看的流程图,而要把它看成五个不同风险的缓冲区。L0 解决“模型有没有基础视觉语言能力”,L1 解决“它懂不懂物理世界里的对象和空间”,R0 解决“它有没有看过足够多机器人动作”,R1 解决“这具身体的动作接口怎么解释”,R2 解决“真实执行时怎样从失败和奖励里继续改”。如果把这些阶段合并成一次大训练,问题会很难定位:失败时不知道是语义没懂、动作没对齐,还是目标奖励没优化。

这也是它和很多单篇模型论文的区别。单篇模型通常问“这个架构比那个架构强吗”,Green-VLA 更像在问“一个机器人基础模型从通用视觉语言能力走到真实人形机器人部署,需要经过哪些闸门”。这个问题对后续实践很重要,因为 Task 2 或任何真机/仿真实验最终都会撞上类似路线:先有数据,再有动作空间,再有具体环境,最后才谈闭环优化。

复现角度也要分层。最小复现不是直接复刻 3,000 小时数据和 48 H100,而是先复现一个阶段里的一个小判断:例如比较有无 action unification 的数据格式,或比较 episode-end prediction 是否减少任务完成后的无意义动作。只有这些小判断能跑通,才值得往完整 pipeline 扩展。

另一个容易误读的点是“人形机器人”。看到 Green humanoid,很容易以为论文主要贡献是人形硬件展示;其实更核心的是统一训练和统一动作接口。如果只换成人形机器人,但每个 embodiment 仍要单独写动作头、单独筛数据、单独调 planner,那么它并没有解决 foundation policy 的复用问题。Green-VLA 真正想证明的是:机器人身体可以不同,但训练阶段、动作语义和质量过滤可以共享。

如果以后要把这篇接到自己的实验计划里,最合适的落点不是立刻做 RL,而是先把“数据质量”作为一个独立课题。比如给一批遥操作轨迹打上平滑度、模糊度、状态方差等标签,再观察过滤前后 imitation policy 是否更稳定。这样能用小成本验证论文思想,而不用复刻完整人形机器人栈。

一个可执行练习是:拿本站已有的 LeRobot / SmolVLA 路线做一个玩具版五阶段表。L0 写成“已有 VLM 或 VLA 权重”,L1 写成“额外视觉语言数据或空间问答”,R0 写成“公开机器人轨迹”,R1 写成“目标仿真环境微调”,R2 写成“奖励或失败纠正”。这个表不需要马上跑实验,但能帮你把 Green-VLA 的大规模路线压缩成自己能理解、能逐步替换的本地路线图。

所以这一节是想说:Green-VLA 最值得借鉴的是分阶段风险管理,而不是照抄它的大规模训练成本。

后续核验清单

如果之后要把本文从 UNVERIFIED 提升到人工核验状态,应逐项检查:五阶段训练定义是否和论文一致,3,000 小时示范和 24M 多模态样本的口径是否来自同一版本,ALOHA table-cleaning 的指标是否只用于 R0 阶段,Green humanoid 的 32 DoF 描述是否包含头、躯干、双臂和灵巧手,R2 的 RL alignment 是否有可复现实验脚本或仅为论文报告。任何一项没有原文依据,都不能写成本站事实。

原文信息

  • arXiv: 2602.00919
  • 本站状态:公开来源研究;未做本地训练、仿真或真机复现;human verification 仍应保持 UNVERIFIED,直到逐节人工核验完成。
@misc{green_vla_2026,
  title = {Green-VLA: Staged Vision-Language-Action Model for Generalist Robots},
  year = {2026},
  eprint = {2602.00919},
  archivePrefix = {arXiv},
  primaryClass = {cs.RO},
  note = {Read through Embodied AI: Zero to One},
  url = {https://arxiv.org/abs/2602.00919}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_green_vla_2026,
  title       = {(readable note) Green-VLA: Staged Vision-Language-Action Model for Generalist Robots},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2026 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/green-vla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?