Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
High-Level Planning · Plate Nº 160

LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks

11 min read · 3994 字 · ⭐⭐⭐ · 长篇结构化

本文基于公开 arXiv 论文和 PDF 文本抽取整理。LoHoVLA 的实验在 Ravens / LoHoRavens 仿真环境中完成,本站没有本地复现训练或评测。

一句话讲什么(TL;DR)

LoHoVLA 处理长程具身任务:机器人不只要做一个动作,而要把“把所有积木按规则摆好”拆成一串子任务,并在每一步执行低层动作。它用 PaliGemma 这类 VLM 同时生成 sub-task 文本和 action token,再用分层闭环控制决定什么时候只重试动作、什么时候重新规划子任务。论文还构建 LoHoSet:3 个 pick-and-place primitive + 20 个长程任务,每个任务 1000 条专家演示。

所以这一节是想说:LoHoVLA 的重点是把高层规划和低层控制放进同一个 VLA,而不是让 planner 和 actor 完全分家。

这是个什么场景

短程任务像“把红块放进碗里”,机器人只要看准目标、移动、放下。长程任务像“把同色积木按大小叠起来,再移动到指定区域”,它包含多个步骤:先判断颜色,再比较大小,再决定顺序,再逐个搬运。如果中间一步失败,后面计划也会受影响。

传统机器人系统会把这件事拆成 planner 和 controller。Planner 说“下一步放红色小块”,controller 负责动手。问题是两者经常不同步:planner 以为已经成功,controller 实际放歪了;controller 卡住时,planner 不知道该换策略还是继续尝试。

普通 VLA 又走另一个极端:给图像和总目标,直接输出低层动作。它可能隐式学到一些步骤,但没有显式 sub-task,长任务里很容易在中途忘记当前目标。

LoHoVLA 的直觉是:让同一个模型既能说“下一小步做什么”,也能输出“现在怎么动”。它像一个会边做饭边自言自语的厨师:先说“现在切番茄”,再动刀;发现切歪了就重切,发现菜谱步骤错了才重新想。

所以这一节是想说:LoHoVLA 关注的是长程任务的协调问题:规划不能离动作太远,动作也不能没有规划。

LoHoVLA — 场景示意:这论文要解决的现实问题
Plate Nº ILoHoVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

LoHoVLA 对比的一个重要基线是 LoHoRavens。它是分层架构:Planner 负责生成子任务,Actor 负责低层控制,Reporter 负责反馈。这个设计清晰,但模块之间通过文本或视觉反馈沟通,容易有信息损失和延迟。

另一类是 vanilla VLA:不给显式 sub-task 标签,直接从图像和目标预测动作。这种方法在短程任务里可行,但长程任务需要记住“当前做到哪一步”,纯低层动作输出容易过拟合训练中常见模式。例如看到相似场景就按旧习惯把块放到匹配碗,而忽略指令要求“不匹配”。

LoHoVLA 认为,两类方法各少一半:分层方法有规划但协调差,普通 VLA 统一但规划弱。它想保留统一模型的共享表示,同时让模型显式输出 sub-task。

所以这一节是想说:长程任务不是单纯把 VLA 变大就能解决,它需要任务分解和执行反馈的结构。

这篇论文的新想法

LoHoVLA 的核心新想法是:用同一个语言模型头同时生成子任务文本和动作 token,再用分层闭环规则管理失败。

这听起来有点绕。可以把它想成一个学生做数学题:他不能只写最后答案,也不能只写草稿。他要先写“下一步先移项”,再真正计算。如果算错了,可能只是重算;如果发现移项方向错了,才回到上一步重规划。

LoHoVLA 中,sub-task 是模型显式说出的中间目标,action token 是执行这个中间目标的低层动作。二者共享 PaliGemma backbone,所以视觉、语言和动作可以在同一个表示空间里互相影响。

总目标 + 当前画面
        │
        ▼
┌─────────────────────┐
│ LoHoVLA shared VLM  │
└───────┬─────────────┘
        ├─► sub-task text: “把红块放到红碗”
        └─► action tokens: 低层 pick/place 动作

所以这一节是想说:LoHoVLA 不是外接一个 planner,而是让 VLA 自己显式生成可检查的中间步骤。

它分几步做的(方法)

第 1 步:定义 LoHoSet 数据集

LoHoSet 基于 Ravens / LoHoRavens 桌面操作环境,包含 3 个 pick-and-place primitive 和 20 个 long-horizon tasks。论文说明其中 10 个长程任务来自 LoHoRavens,用于和基线比较;另外 10 个任务是新加的,用来增强泛化能力。每个长程任务有 1000 条专家演示,数据中包含视觉观察、总目标、子任务和机器人动作。

第 2 步:把动作 token 化

LoHoVLA 把机器人动作离散到 1024 个 uniform bins。人话说,就是把连续动作数值切成 1024 档,让语言模型可以像预测词一样预测动作 token。推理时再反 token 化和反归一化,恢复成机器人动作。

第 3 步:联合训练 sub-task 和 action

训练目标包含两部分:L = Ltext + LactionLtext 训练模型生成正确子任务,Laction 训练模型生成动作。论文使用两阶段训练:先强化长程任务规划,再加入 primitive tasks 和动作标签,避免低层动作太早干扰高层规划。

第 4 步:分层闭环控制

长程任务失败可能来自三类:子任务规划错、动作预测错、外部扰动。LoHoVLA 不会每失败一次都重规划。它设置阈值 K:当前子任务失败次数超过阈值才重新规划,否则只重新预测动作。论文实验里 K = 2

第 5 步:用奖励和成功率评估

评测有平均 reward 和 success rate。比如一个任务需要 10 步,完成 8 步就可能得到 80 的分数;真正全部完成才算成功。这样能区分“完全失败”和“做了一半”的模型。

执行循环

预测 sub-task
     │
     ▼
预测 action 并执行
     │
     ├─ 成功:进入下一 sub-task
     │
     └─ 失败:
          ├─ 失败次数 ≤ K:只重试 action
          └─ 失败次数 > K:重新规划 sub-task

所以这一节是想说:LoHoVLA 的方法核心是“显式中间目标 + 动作 token + 不过度重规划的闭环”。

LoHoVLA — 方法示意:核心 pipeline
Plate Nº IILoHoVLA — 方法示意:核心 pipeline

关键数字(What works)

现象 论文报告的数字 怎么理解
LoHoSet primitive tasks 3 个 低层 pick-and-place 基础技能
LoHoSet long-horizon tasks 20 个 长程桌面操作任务集合
每个长程任务演示 1000 条 支撑 sub-task + action 联合训练
Stage 1 训练任务 14 个长程任务 4 个 seen + 10 个新增任务
Stage 2 primitive 数据 每个 primitive 10000 条演示 补低层动作预测能力
Backbone PaliGemma-3B-mix-224 用预训练 VLM 当共享主干
LoRA 设置 rank 16 参数高效微调
闭环阈值 K = 2 失败两次以内先重试动作
挑战任务结果 put-even-blocks-in-same-color-zone 得分 85.1、成功率 81.0 复杂颜色、计数、空间逻辑任务中显著领先

这些数字说明 LoHoVLA 不只是提出架构,还补了专门长程数据集和训练策略。不过它的实验主要在 Ravens 仿真环境中,不能直接外推到真实家庭机器人。

所以这一节是想说:LoHoVLA 的有效性来自数据集、显式子任务监督和闭环策略三者共同作用。

实验结果说明了什么

第一,显式 sub-task 很重要。Vanilla VLA 在若干任务上成功率为 0,说明它很难只靠隐式状态学会长程推理。显式输出子任务让模型有了可监督、可检查的中间计划。

第二,训练集扩展能缓解过拟合。论文显示,如果只在少数 seen tasks 上训练,模型会把相似场景误判成训练中常见模式;加入额外 10 个长程任务后,未见任务的规划成功率更好。

第三,两阶段训练比一锅炖更稳。先学规划,再加动作,有助于高层 sub-task 能力形成;如果一开始就混入动作标签和 primitive tasks,低层动作损失可能压过规划能力。

第四,闭环控制不能太激进。每次失败都重新规划会浪费高层推理,也可能在低层扰动时过度反应;只重试动作又无法纠正错误计划。阈值策略是在两者之间折中。

所以这一节是想说:长程 VLA 的关键不是“直接端到端到底”,而是让端到端模型内部保留可监督的层级结构。

你应该懂的几个新词

  • Long-horizon task:长程任务。需要多个步骤才能完成的任务,失败会跨步骤传播。
  • Sub-task:子任务。总目标拆出来的下一小步,如“把红块放进红碗”。
  • Hierarchical closed-loop control:分层闭环控制。执行中根据反馈决定重试动作还是重规划子任务。
  • Action token:动作 token。把连续动作离散后交给语言模型预测。
  • LoRA:低秩适配微调。冻结大部分模型,只训练小矩阵,降低显存和训练成本。

所以这一节是想说:LoHoVLA 的术语都围绕“长程任务如何拆、如何执行、如何纠错”。

它有什么搞不定的

第一,动作离散化带来精度限制。论文的 limitation 明确提到,离散结构会限制机器人动作精度。对于需要毫米级接触或复杂姿态的任务,这可能成为瓶颈。

第二,论文假设一个 sub-task 可以在单个 timestep 内完成,这在真实应用中不一定成立。真实机器人可能需要多次低层控制才能完成一个中间目标。

第三,实验集中在 Ravens 仿真。仿真里的物体、摩擦、视觉噪声和真实厨房差距较大,真机迁移还需要额外验证。

第四,sub-task 标注成本不低。要训练模型显式输出子任务,就需要数据里有中间步骤标签,规模化采集时会增加标注负担。

所以这一节是想说:LoHoVLA 很适合学习长程任务结构,但距离真实开放环境部署还有数据、动作精度和真机验证缺口。

它和别的几篇是什么关系

  • SayCan:SayCan 用 LLM 选技能,LoHoVLA 让同一个 VLA 生成 sub-task 和 action。
  • Code-as-Policies:Code-as-Policies 用代码做高层控制,LoHoVLA 用 VLM/VLA 内部 token 做规划和动作。
  • OpenVLA:OpenVLA 偏单步或短程控制;LoHoVLA 补长程任务分解。
  • RT-1:RT-1 证明动作 token 化可行;LoHoVLA 把 token 化推进到长程规划+控制。
  • CogACT:CogACT 改动作模块质量,LoHoVLA 改任务层级结构。

所以这一节是想说:LoHoVLA 是规划路线和 VLA 路线的交汇点。

和本导读的关系

本篇主要对接 Ch10: PlanningCh12: OpenVLA / VLAs / MLA。如果你只读 Ch12,可能会以为 VLA 就是“图像+指令 -> 动作”。LoHoVLA 说明,一旦任务变长,中间目标就会重新变重要。

它也能帮你理解为什么真正的家庭机器人不会只有一个低层 policy。长程任务需要“目标、进度、失败原因、下一步”的状态管理。LoHoVLA 把这些东西部分塞回 VLA 内部,是一个值得关注的折中方向。

所以这一节是想说:LoHoVLA 帮本站补上“长程 VLA 不是纯动作模型”的关键拼图。

思考题

Q1:为什么 vanilla VLA 在长程任务中容易失败?

提示

它缺少显式中间目标,容易把相似场景映射到训练中最常见的动作模式。

Q2:LoHoVLA 为什么不每次失败都重新规划?

提示

失败可能只是低层动作误差或外部扰动,频繁重规划会浪费并引入不稳定。

Q3:两阶段训练为什么有帮助?

提示

先学高层规划,避免低层动作损失过早主导共享表示。

Q4:如果把 LoHoVLA 上真机,你最担心哪两个问题?

提示

动作离散精度和 sub-task 完成时间假设,都会在真机上变得更脆弱。

Q5:LoHoVLA 和 SayCan 的最大区别是什么?

提示

SayCan 是模块化选择技能;LoHoVLA 是统一 VLA 同时生成子任务和动作。

一些好奇心问答(FAQ)

LoHoVLA 是不是完全端到端?
不是纯粹黑盒端到端。它使用同一模型,但显式输出 sub-task,因此保留了可解释的中间层。

它的数据集为什么叫 LoHoSet?
因为它专门服务 long-horizon tasks,包含 primitive 和长程任务,便于训练模型同时学低层动作与高层分解。

它能直接处理真实厨房吗?
不能直接这么说。论文评测在 Ravens 仿真,真实厨房需要视觉、物理和安全方面的额外验证。

为什么 topic 放在 planning 而不是 vla?
它当然是 VLA,但本站把它放到 planning,是为了强调它解决的是长程任务分解与闭环控制问题。

读完后下一篇看什么?
AutoRT 理解真实机器人数据采集如何规模化,再看 EO-1 理解 interleaved vision-text-action 数据如何进一步训练统一模型。

补充理解:长程任务的难点在“进度状态”

LoHoVLA 值得关注,是因为它把长程任务里最容易被忽略的东西显式化了:进度状态。短程抓取只需要回答“现在该往哪动”,长程任务还要回答“我现在做到第几步、上一步有没有真的成功、下一步目标是否需要改变”。如果没有进度状态,模型会把当前画面当成孤立图片,看到相似摆放就重复训练集中最常见的动作。LoHoVLA 通过 sub-task 文本让进度状态变成可监督对象,再用闭环策略处理失败。这给实际部署一个启发:复杂任务里,日志不应只记录动作轨迹,还应该记录当前子目标、失败次数、重试原因和重规划触发点。否则线上调试时,我们只能看到机器人“动错了”,却不知道它是计划错、动作错,还是外部扰动导致临时失败。

如果把它迁移到真实家务场景,还需要把“子任务是否完成”的判断做成可靠传感器或判别器。比如“杯子已经放进水槽”不能只靠模型自信地说完成,而要结合视觉状态、夹爪状态、碰撞/力反馈和任务日志。没有这个完成判断,闭环控制就会失去锚点。

因此,LoHoVLA 更像一张设计图:模型负责提出和执行子任务,系统还要负责确认、回滚和记录。

没有这些外部状态,长程闭环很容易退化成“反复试同一个错误动作”。

所以这一节是想说:LoHoVLA 的核心价值是让长程任务的中间状态可见、可监督、可纠错。

如果你想再深入

  1. 对照 LoHoRavens,理解 planner / actor / reporter 三模块怎么协作。
  2. 看论文 Algorithm 1,手动画一遍失败后重试或重规划的分支。
  3. 对比 Ltext + Laction 的训练目标,思考两个 loss 权重会如何影响模型。
  4. 用一个家务任务自己写 sub-task 序列,体会长程监督的标注成本。
  5. 如果要工程实现,先做仿真闭环,不要直接在真机上让模型自由重规划。

原文信息

  • 标题:LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  • arXiv:https://arxiv.org/abs/2506.00411
  • 数据集:论文提出 LoHoSet,包含 3 个 primitive 与 20 个 long-horizon tasks。
  • 公开状态:本站未独立验证代码或数据集可用性。
@misc{yang2025lohovla,
  title = {LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks},
  author = {Yang, Yi and Sun, Jiaxuan and Kou, Siqi and Wang, Yihan and Deng, Zhijie},
  year = {2025},
  eprint = {2506.00411},
  archivePrefix = {arXiv},
  primaryClass = {cs.RO}
}

所以整篇是想说:LoHoVLA 让 VLA 不再只做下一步动作,而是显式说出下一小步计划,并用闭环机制在长程任务中纠错。

引用本笔记 / Cite this note
BibTeX
@online{eai_lohovla_2026,
  title       = {(readable note) LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/lohovla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?