Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 173

MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation

12 min read · 4069 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份面向零基础读者的结构化研究笔记。本文只把公开论文文本和 arXiv 元数据能支持的结论写成事实;本站没有本地训练、仿真或真机复现实验,因此不会把论文报告的成功率写成本站 E4 结果。

一句话讲什么(TL;DR)

MoS-VLA 把策略看成一组 learned basis functions 的线性组合。新环境来了,不用梯度微调,只要一条专家轨迹,就能求出组合系数,生成适配该环境的新 policy。

如果只记一个直觉:第 3 批从“模型能不能统一”推进到“模型能不能部署”。真实机器人需要低延迟、少量示范适配、长程稳定和全身协调。

所以这一节是想说:MoS-VLA 的价值在于把 VLA 从论文分数推近真实部署约束。

这是个什么场景

这像调鸡尾酒:训练阶段先学会 16 种基酒,部署时根据一杯样品反推出配比。之后不需要重新酿酒,只要按配比混合,就能调出适合新任务的味道。

第 3 批主线:部署效率与快速适配

训练课程 / 自适应计算 / one-shot 技能 / 快慢系统
          │
          ▼
       MoS-VLA
          │
          ▼
让 VLA 更接近真实机器人部署:快、稳、可适配
部署视角

[视觉语言理解] -> [动作生成] -> [真实/仿真执行]
      │              │              │
      ├─ 成本:算力/延迟
      ├─ 适配:新任务/新身体
      └─ 稳定:长程/异常/实时控制

这个场景强调工程约束。一个模型在离线 benchmark 上成功,不代表它能以足够频率控制真实机器人;能在一个任务上成功,也不代表换环境后一条示范就能适配。

所以这一节是想说:读 MoS-VLA 要把成功率和部署条件一起看。

MoS-VLA — 场景示意:这论文要解决的现实问题
Plate Nº IMoS-VLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

现有 VLA 在新实验室、新机器人设置或新任务上常常 out-of-the-box 失败。fine-tuning 需要几十到几百条 demo 和反向传播,成本高;LoRA 也仍要大量 forward/backward。

过去很多 VLA 论文默认强 backbone 每步完整运行,或者默认新任务可以靠再次 fine-tune 解决。但真实部署里,等待大模型推理会降低控制频率,收集几十条示范也可能太贵,长程任务一旦早期失败后续步骤就不可达。第 3 批论文分别从训练课程、推理压缩、无梯度适配和异步控制四个方向补这些缺口。

所以这一节是想说:旧方法的问题不是能力完全不够,而是部署成本、适配成本和实时性不够。

这篇论文的新想法

MoS-VLA 在 OpenVLA 上训练 16 个 basis action heads,形成 policy skill space。测试时用一条 expert trajectory,通过 L1 action error 的 convex optimization 求 skill coefficients,不做梯度更新。

这类新意的核心是把约束显式建模。与其希望模型自己学会省算力、自己学会迁移、自己学会快慢分工,不如给它可学习的结构和评测指标。

所以这一节是想说:MoS-VLA 的新意是把部署约束变成训练或推理机制的一部分。

它分几步做的(方法)

第 1 步

输入:训练阶段:在 RT-X / Open X data mixture 上 fine-tune OpenVLA,同时学习 k 个 basis action heads。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

第 2 步

输入:校准阶段:对新任务的一条 expert trajectory 前向计算 basis outputs,求解 least absolute error linear program 得到系数 α。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

第 3 步

输入:执行阶段:将各 basis action outputs 按 α 线性组合成新 policy。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

第 4 步

输入:评估阶段:比较 OpenVLA 与 MoS-VLA 在未见 simulation 和 real robot tasks 上的成功率。

处理:这一环都在回答部署问题:模型不只是要看懂,还要能在真实频率、有限数据和新任务环境下稳定输出动作。第 3 批论文的共同点,是把“能跑”放到和“能懂”一样重要的位置。

输出:得到更高效、更可适配或更稳定的 VLA 行为。类比成开车:导航负责路线,司机负责实时控制,车辆状态决定什么时候该省油、什么时候该全力响应。

方法部分要按“哪个部署瓶颈 -> 哪个机制 -> 哪个实验数字”来读。否则容易把这些论文误解成普通模型堆料。

所以这一节是想说:方法的关键是看 MoS-VLA 把哪类部署瓶颈交给了哪个机制处理。

MoS-VLA — 方法示意:核心 pipeline
Plate Nº IIMoS-VLA — 方法示意:核心 pipeline

关键数字(What works)

事实 数字 / 状态 来源与证据边界
basis 数量 16 basis functions Implementation Details
训练数据 Open-X Magic Soup Plus / RTX dataset mixture Implementation Details
训练规模 32 GH200 nodes,5000 steps,约 24 小时 Implementation Details
校准数据 one expert trajectory Abstract / Figure 1
校准方式 least absolute error / L1 action error;无 gradient updates Abstract / Method
仿真 Lift Block OpenVLA 0%,MoS-VLA 70% Table 1
仿真 Open Door OpenVLA 0%,MoS-VLA 75% Table 1
真实 Reach OpenVLA 0%,MoS-VLA 100% Table 1
真实 Lift Block OpenVLA 0%,MoS-VLA 100% Table 1
真实 Insert Pen OpenVLA 0%,MoS-VLA 100% Table 1

这些数字都是论文报告结果,不是本站本地复现。本站当前只完成公开来源研究、站点构建、provenance 与部署验证。

所以这一节是想说:关键数字帮我们判断方法是否支撑主张,但不能替代本地实验。

实验结果说明了什么

MoS-VLA 的实验非常清晰:OpenVLA 在五个未见任务上全为 0%,MoS-VLA 用一条示范校准后,仿真任务达到 70% 和 75%,真实机器人三个任务均为 100%。这不是证明它通用解决所有迁移,而是证明 learned skill space + one-shot coefficient fitting 能显著缓解 domain gap。

实验要同时看成功率和部署条件:比如同样 90% 成功率,12Hz 和 32Hz 的控制体验完全不同;同样 100% 成功率,一条示范和一百条示范的适配成本也完全不同。

所以这一节是想说:实验说明 MoS-VLA 在特定部署瓶颈上有效,但证据边界仍是论文设置。

你应该懂的几个新词

  • Staged training:分阶段训练,每一阶段解决不同瓶颈。
  • Adaptive computation:按输入或动作上下文动态决定计算量。
  • One-shot adaptation:只用一条示范适配新任务。
  • Fast-slow system:慢系统做语义推理,快系统做实时控制。
  • Action tokenizer:把连续动作压成 token 或离散表示,方便模型生成。
  • Flow matching / diffusion policy:把噪声动作逐渐变成可执行动作的连续生成方法。

所以这一节是想说:这些词都围绕部署:更快、更稳、更省数据。

它有什么搞不定的

  • 一条示范要落在 basis span 附近,超出技能空间的新任务可能失败。
  • 实验任务相对简化,部分环境还关闭了前后运动以减轻深度估计困难。
  • basis heads 增加训练结构,且训练仍依赖大规模 OXE 数据。
  • 真实任务数量有限,100% 不应外推为开放世界可靠性。

这些局限提醒我们:VLA 走向真实机器人,不是一个模型名字能解决,而是数据、推理、控制、硬件和安全共同构成的系统工程。

所以这一节是想说:MoS-VLA 推进了一个部署维度,但没有消除真实机器人的全部风险。

它和别的几篇是什么关系

  • 它和 X-VLA 都追求低成本适配,MoS-VLA 更极端:一条示范、无梯度更新。
  • 它和 ET-VLA 都处理迁移问题,但 ET-VLA 面向多机器人,MoS-VLA 面向新 skill/context。
  • 它和 LoRA/PEFT 是对照关系:不是调参数,而是调 basis coefficients。

第 3 批最好和前两批连读:第 1 批看统一与动作解码,第 2 批看跨 embodiment,第 3 批看部署效率和快速适配。

所以这一节是想说:MoS-VLA 是 40 篇扩展里“从研究模型走向部署系统”的一环。

和本导读的关系

本篇对应导读中的 Ch04: 技术版图Ch12: VLACh17: Sim-to-Real。读它之前,建议先理解 OpenVLA、π0、Qwen-VLA、X-VLA 的基本路线。

对 40 篇扩展计划来说,MoS-VLA 属于第 3 批,负责补“部署效率 / 快速适配 / 真机全身控制”这条线。

所以这一节是想说:这篇笔记把 VLA 学习从模型结构推进到部署约束。

思考题

Q1:这篇论文解决的是速度、适配、长程还是真机部署?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q2:它的核心组件去掉后,成功率或速度掉了多少?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q3:它需要多少额外数据才能适配新任务?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q4:它和第 1/2 批论文的最大差异是什么?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q5:如果你要复现,哪个 benchmark 最小?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

Q6:哪些数字不能写成本站复现实验?

提示

先找方法和实验表格的直接对应关系,不要只看最高分。

一些好奇心问答(FAQ)

Q:为什么第 3 批不只看成功率?

因为部署还看速度、数据成本、控制频率和异常恢复。成功率相同的系统,实时性可能完全不同。

Q:这些方法能替代安全层吗?

不能。它们提升模型部署能力,但真实机器人仍需要速度、力矩、碰撞和人工接管等安全机制。

Q:为什么还保持 UNVERIFIED?

因为本站没有逐节人工核验和本地复现实验。公开论文事实和本站实验结果是两种证据等级。

如果你想再深入

  1. 先复习 OpenVLA、π0、Qwen-VLA。
  2. 比较 AC²-VLA 和 DuoCore-FS:一个省计算,一个拆频率。
  3. 比较 MoS-VLA 和 X-VLA:一个无梯度一示范,一个 soft prompt 适配。
  4. 看 Green-VLA 时重点关注五阶段训练和 RL 对齐。

补充:one-shot 适配到底省在哪里

MoS-VLA 的 one-shot 不是“看一眼就会所有事”,而是把适配成本从梯度训练换成系数求解。训练阶段已经学好一组 basis functions,部署时只用一条 expert trajectory 找到这些 basis 的组合权重。这个过程更像在已有技能库里调配比例,而不是重新学习技能本身。

这个思路的好处是非常直接:不需要反向传播,不需要几十到几百条 demo,也不需要为每个新任务跑一轮 LoRA。论文里强调 calibration 可以在几秒级完成,这对小实验室和快速换场景很有吸引力。但它也有边界:如果新任务不在 basis span 附近,线性组合再快也无法凭空生成新能力。

因此读 MoS-VLA 时要同时看成功和假设。它在五个未见任务上把 OpenVLA 的 0% 提到 70–100%,说明 domain gap 很大时,skill-space calibration 确实有效。但这些任务也经过简化,例如部分设置减少了深度估计难度。更严格的下一步,是测试接触丰富、长程、多阶段任务是否仍能被一条轨迹充分校准。

一个好的类比是“调参”和“学技能”的区别。fine-tuning 像让模型重新上课,LoRA 像只改一小部分教材,而 MoS-VLA 像已经准备好一套技能坐标系,新任务只是在坐标系里找一个点。这个点能不能找到,取决于训练阶段的 basis 是否覆盖了目标任务。如果 basis 空间太窄,一条示范给出的也只是错误方向上的精确坐标。

所以复现时不要只追 one-shot 成功率,还要观察失败任务和系数分布。若不同任务的系数聚成合理簇,说明技能空间有结构;若所有新任务都挤在一起,或者某些任务需要极端系数,说明 basis 还没有学到可迁移技能。这个分析比单个成功率更能说明方法是否真的具备 in-context adaptation。

一个可执行练习是:不用机器人,先用二维控制任务模拟 basis。预先训练几个“向上、向右、靠近目标、避障”的小策略,然后给一条新轨迹,用最小绝对误差求它们的线性组合。你会直观看到:如果新轨迹能被 basis 组合出来,一条示范就足够;如果目标需要 basis 没见过的行为,再多调系数也无济于事。这正是 MoS-VLA 的核心假设。

读这篇时也要区分“任务适配”和“任务理解”。一条专家轨迹主要告诉模型这个环境中的动作风格和目标实现方式,不一定提供丰富语言推理。若任务需要先规划多个子目标,MoS-VLA 可能还需要和高层 planner 或 graph 方法结合。也就是说,它非常适合快速校准控制风格,但不自动解决复杂长程任务分解。

把它放到 40 篇路线里看,MoS-VLA 提供的是另一种省数据方式。X-VLA 用 soft prompt 学会跨 embodiment,ET-VLA 用合成预训练适应多机器人,MoS-VLA 则把新任务适配压缩成一条示范加一次小优化。三者都在回答同一个问题:机器人数据太贵时,怎样少采一点也能迁移。

一句话复述:它是在给 VLA 预先学一组技能积木,新任务来了只重新拼一次。

真正落地时,仍要记录那条示范的质量,因为错误示范会把系数校准到错误策略上。 这会直接影响安全。

所以这一节是想说:MoS-VLA 省的是新任务适配的梯度成本,但前提是训练出的技能空间足够覆盖目标任务。

后续核验清单

人工核验时应重点确认:16 个 basis functions、32 个 GH200 nodes、5000 steps、约 24 小时训练这些数字是否来自 Implementation Details;Table 1 的 70%、75%、100% 是否都属于 one-shot calibration 后的任务;OpenVLA 的 0% 是否限定在这些未见实验环境;“几秒级校准”是否只指求解系数而不是完整机器人部署。这样才能避免把 one-shot adaptation 误写成无需示范、无需条件的泛化。

原文信息

  • arXiv: 2510.16617
  • 本站状态:公开来源研究;未做本地训练、仿真或真机复现;human verification 仍应保持 UNVERIFIED,直到逐节人工核验完成。
@misc{mos_vla_2025,
  title = {MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation},
  year = {2025},
  eprint = {2510.16617},
  archivePrefix = {arXiv},
  primaryClass = {cs.RO},
  note = {Read through Embodied AI: Zero to One},
  url = {https://arxiv.org/abs/2510.16617}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_mos_vla_2026,
  title       = {(readable note) MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/mos-vla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?