Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 192

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

12 min read · 4042 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份面向零基础读者的结构化研究笔记。本文只记录公开论文文本、arXiv 元数据和作者项目页能支持的结论;本站没有复现 CoppeliaSim 或 Franka 实验,因此不会把论文报告的成功率写成本站 E4 结果。

一句话讲什么(TL;DR)

LACY 的核心问题是:现在很多机器人策略只学习 language-to-action,也就是“听一句话,做一个动作”。论文认为这太单向了。一个真正稳的机器人不只要会执行语言,还应该能反过来解释动作、判断语言和动作是否语义一致。LACY 因此把三件事放进同一个 vision-language model:L2A(language to action)、A2L(action to language)、L2C(language-to-language consistency)。

这三件事组成一个 Language-Action Cycle。模型先根据语言生成动作,再根据动作解释语言,再判断两段语言是否一致。如果一致,就可以把模型自己生成的样本作为额外训练数据;如果不一致,就过滤掉。这样,LACY 不只是在有限 demonstrations 上训练,还能针对低置信度场景做 active augmentation。

如果只记一个直觉:LACY 像让机器人做完题后自己讲解解法,再让另一个判卷模块看“题意”和“讲解”是否一致。一致的讲解可以变成新的练习题,让模型继续提高。

所以这一节是想说:LACY 用双向语言-动作 grounding 构造自我改进循环。

这是个什么场景

机器人 pick-and-place 看起来简单,但语言和动作之间有很多隐含语义。用户说“pick up the cable and place it to the middle right of the workspace”,机器人需要识别 cable、理解 middle right、生成 pick/place 坐标。传统 L2A 模型只关心动作是否能完成任务,不一定能解释自己为什么这样做。

如果模型不会把动作说回语言,就很难判断它是不是“碰巧动对了”。比如它把红块放到右边,可能是因为理解了“right”,也可能只是训练数据里右边出现得多。A2L 能迫使模型学习动作背后的语言语义,L2C 又能判断原始任务描述和动作解释是否一致。

LACY 的场景是数据有限的 robotic manipulation。论文使用 CoppeliaSim tabletop 环境、32 个 YCB objects,以及 Franka Emika Panda + RealSense D415 的真实 setup。它关心的问题不是更大模型,而是如何用有限数据让模型更懂语言和动作的互相含义。

传统 L2A:
  language -> action
  只问:动作有没有做出来?

LACY:
  language -> action
  action   -> language explanation
  language + explanation -> consistency
  再问:动作是不是语义上真的符合原指令?

所以这一节是想说:LACY 面向的是语言-动作 grounding 不够深、数据又有限的操作学习场景。

LACY — 场景示意:这论文要解决的现实问题
Plate Nº ILACY — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

第一,传统 imitation learning 或 VLA fine-tuning 多数是单向 L2A。输入图像和语言,输出动作。它能优化任务成功率,但不一定学习可解释的语义结构。

第二,直接用 GPT-4o 或通用 VLM 做 spatial reasoning,论文显示在没有明确 grounding 信息时表现会掉。通用模型会说话,但不一定能从单张机器人 top-view 图准确定位 pick/place。

第三,用 simulation 或 self-training 生成更多数据也有风险。如果模型自己生成的动作是错的,还把它当训练数据,就会把错误放大。

第四,RL 自改进通常需要大量交互和 reward,真实机器人代价高。LACY 希望用语言一致性做轻量过滤,而不是每个样本都上真实机器人试。

LACY 的判断是:自改进必须有“语义检验”。只生成更多动作不够,还要知道动作是否能用语言解释,并且解释是否和原指令一致。

所以这一节是想说:旧方法缺少动作反向解释和自生成数据过滤机制。

这篇论文的新想法

第一,新想法是统一训练 L2A、A2L、L2C。三个任务共享同一个 VLM 表征,让模型既会执行又会解释,还会判断一致性。

第二,新想法是用 Chain-of-Thought style 的 object grounding 过程。模型不只是直接吐坐标,而是先显式推理目标对象和空间关系,再生成参数化动作。

第三,新想法是 self-improvement loop。模型针对低置信度 case 生成新 triplets (observation, language, action),再用 L2C 判断是否语义一致,合格样本加入训练。

第四,新想法是 active augmentation。不是随机扩数据,而是针对模型低信心、容易错的区域补样本。

LACY self-improvement loop

原始 demonstrations
      │
      ▼
训练 L2A / A2L / L2C
      │
      ▼
模型生成候选 action
      │
      ▼
A2L: action -> language explanation
      │
      ▼
L2C: original language vs explanation
      │
      ├─ consistent -> 加入训练集
      └─ inconsistent -> 丢弃

所以这一节是想说:LACY 的创新是把“执行、解释、验一致”做成闭环。

它分几步做的(方法)

第 1 步:定义三种任务

输入是 observation o、language instruction l 和 action a。LACY 把任务拆成三类。

L2A 的输入是图像和语言,输出是参数化动作,例如 pick 坐标和 place 坐标。它回答“这句话应该怎么做”。

A2L 的输入是图像和动作,输出是语言解释。它回答“这个动作在干什么”。

L2C 的输入是两段语言,输出是它们是否语义一致。它回答“动作解释和原始指令是不是同一个意思”。

第 2 步:用统一 VLM 做多任务训练

处理上,LACY 不是训练三个完全独立模型,而是用一个 VLM-based framework 统一这些任务。共享表征可以让语言、视觉、动作坐标之间的映射互相促进。

输出是一个能在不同 prompt 下切换任务的模型。给 L2A prompt,它生成动作;给 A2L prompt,它生成解释;给 L2C prompt,它做一致性判断。

这一步的关键是避免各模块各学各的。如果 L2A 和 A2L 完全独立,动作生成和动作解释可能使用不同语义空间,很难形成循环。

第 3 步:显式 object grounding 和 CoT

输入是 top-view robot image 和 task description。处理上,模型先做 object grounding,推理目标对象、目标位置和空间关系,再生成动作。

论文的 ablation 显示 CoT / grounding 很重要。没有中间推理时,模型直接输出动作更容易错;有 object grounding 时,模型能先确认“要抓哪个、放到哪里”。

输出是更可靠的 pick/place 参数。直觉上,机器人先在心里说“我要抓 cable,放到 workspace middle right”,再动手,而不是直接猜坐标。

第 4 步:低置信度样本主动增强

输入是当前模型、原始 demonstrations 和低信心 case。处理上,LACY 生成候选动作,再用 A2L 把动作翻译回语言。L2C 判断翻译语言和原始指令是否一致。

如果一致,说明候选动作在语义上可能可用,加入训练数据;如果不一致,过滤掉。这样做的好处是自生成数据不是全盘接收,而是经过语言一致性门禁。

输出是扩展后的训练集。论文中从 100 demonstrations 起步,每轮生成 100 个新 triplets,比较不同 self-improvement iteration 的效果。

第 5 步:仿真和真实机器人评估

仿真输入是 CoppeliaSim tabletop、32 个 YCB objects,训练数据最多 4000 个成功 pick-and-place demonstrations;真实输入是 Franka Emika Panda 和 Intel RealSense D415,包含 12 个真实物体。

评估指标包括 L2A success、A2L success、L2C accuracy,以及真实机器人上的 Pick / Pick & Place success。论文还比较了 LLaVA-NeXT、GPT-4o、不同 joint training / filtering ablation。

输出是模拟和真实环境的成功率表。注意这些数字都来自论文报告,本站没有复现。

第 6 步:分析失败来源

论文指出,很多失败来自 object grounding 错误。L2C 主要判断语言语义一致性,不一定能专门评估 object grounding 质量。如果模型误识别物体,后续动作解释和一致性判断也可能被污染。

输出是方法边界:LACY 的自改进需要更强的 perception / verification module,才能扩展到复杂长程任务。

所以这一节是想说:LACY 的方法是多任务统一训练 + 语言一致性过滤 + 自生成数据再训练。

LACY — 方法示意:核心 pipeline
Plate Nº IILACY — 方法示意:核心 pipeline

关键数字

数字或设置 原文语境 这说明什么
3 tasks L2A、A2L、L2C 语言到动作、动作到语言、一致性判断
32 YCB objects CoppeliaSim tabletop 环境 仿真对象覆盖常见桌面物体
4000 demos 最大训练 demonstrations 用于建立较强 simulation baseline
100 demos 起步 self-improvement 小数据设置 检验数据有限时能否自改进
每轮 100 triplets L2C-sampled augmentation 自生成训练数据的规模
100 unseen scenarios simulation test set 评估未见场景泛化
212 demos / 50 unseen scenarios real-world setting 真实数据规模更小
83 / 80 / 92 LACY-Joint 的 L2A / A2L / L2C ablation joint training 优于独立训练
93 / 85 / 95 LACY-Joint-SI self-improvement 进一步提升
72.5% Pick / 60% Pick & Place LACY-Joint-Real 真实机器人表格 论文报告的真实执行结果

这些数字全部是论文报告,不是本站复现实验。LACY 论文的 PDF 表格抽取有些错位,因此后续人工核验应回到原 PDF 表格逐项确认。

所以这一节是想说:LACY 的主要证据是 joint training 和 self-improvement 在三项指标上的提升。

实验结果说明了什么

实验第一层说明,通用 VLM 不等于机器人 grounding 模型。GPT-4o 在提供明确 grounding 信息时可以推理得很好,但没有 grounding 时会受图像定位影响。LACY 的专门 fine-tuning 让它更适合机器人 top-view 操作。

实验第二层说明,joint training 有价值。LACY-Joint 在 L2A、A2L、L2C 上都比独立模型更强,说明共享语义空间能让“执行”和“解释”互相帮助。

实验第三层说明,self-improvement 不是靠盲目扩数据,而是靠 L2C 过滤。LACY-Joint-SI 在三项指标上继续提升,尤其 L2A 到 93、A2L 到 85、L2C 到 95,支持语言一致性筛选的价值。

实验第四层说明,真实机器人仍有 sim-to-real 和 object naming 问题。论文提到很多失败来自物体命名错误;加入真实数据后,LACY-Joint-Real 表现更好。这提示我们:语言-动作闭环再好,也绕不开感知和真实世界分布。

所以这一节是想说:LACY 的证据支持“能解释动作的模型更适合自改进”。

你应该懂的几个新词

  • L2A:Language to Action,从语言生成动作。
  • A2L:Action to Language,从动作反推语言解释。
  • L2C:Language to Consistency,判断两段语言是否语义一致。
  • Bidirectional grounding:双向 grounding,既能从语言到动作,也能从动作回到语言。
  • Self-improvement:模型用自己生成并过滤的数据继续训练。
  • Active augmentation:主动选择需要增强的样本,而不是随机扩数据。
  • CoT:Chain-of-Thought,中间推理步骤;这里常用于 object grounding。
  • Sim-to-real gap:仿真到真实的分布差异。

所以这一节是想说:LACY 的核心词是 L2A、A2L、L2C 和 self-improvement。

它有什么搞不定的

第一,L2C 判断的是语言语义一致性,不等于真实物理执行成功。两段话一致,动作仍可能因为抓取姿态、碰撞或控制误差失败。

第二,object grounding 错误会污染整个循环。模型如果把 sponge 认成 mustard bottle,A2L 和 L2C 可能都建立在错误感知上。

第三,任务主要集中在 pick-and-place。论文也承认需要扩展到 long-horizon tasks 和更多 manipulation skills。

第四,自生成数据有确认偏差风险。模型可能只生成它已经会的模式,低置信度选择和过滤标准需要进一步研究。

第五,真实机器人结果仍依赖小规模 setup,换平台、换相机、换物体后的稳定性还需要外部验证。

所以这一节是想说:LACY 提供了语义自检循环,但不是完整的物理世界验证器。

它和别的几篇是什么关系

gaze2act 相比,LACY 不引入人的视线,而是让模型自己建立语言和动作之间的循环。Gaze2Act 是外部意图接口,LACY 是内部语义自检机制。

instructvla 相比,LACY 的规模更小、任务更聚焦,强调 bidirectional grounding;InstructVLA 强调 instruction tuning、MoE 和大规模 VLA-IT 数据。

villa-x 相比,LACY 的中间表示是语言解释和一致性;villa-X 的中间表示是 latent action。一个从语义闭环入手,一个从视频运动表示入手。

和 Batch 7 的 primitive skill diffusion policy 相比,LACY 没有显式 skill library,但 A2L 解释可以被看作一种“语义技能说明”。

所以这一节是想说:LACY 是 Batch 8 里最强调自我监督和语义闭环的一篇。

和本导读的关系

本站导读一直强调:VLA 不只是把语言拼到动作模型上,还需要可检查的中间结构。LACY 提供了一个很适合初学者理解的例子:如果一个模型真的理解动作,它应该能把动作解释回语言。

这篇也适合和数据治理主题一起读。自生成数据最大风险是错误累积,LACY 用 L2C 当 gate,虽然不完美,但体现了“生成 -> 验证 -> 再训练”的 AI pipeline 思路。

所以这一节是想说:LACY 把 VLA 学习变成一个可验证的语言-动作循环。

思考题

Q1:为什么只训练 L2A 可能不够?

提示

L2A 只要求从语言到动作,不要求模型能解释动作。它可能学到相关性,但没有显式学习动作语义。

Q2:A2L 对机器人有什么帮助?

提示

它让模型把动作翻译成语言,相当于检查动作是否表达了正确意图。

Q3:L2C 为什么能过滤自生成数据?

提示

如果动作解释和原始指令语义不一致,说明这个自生成样本可能不该加入训练。

Q4:为什么 L2C 不能替代真实执行评估?

提示

语言一致不代表机械臂能抓住,也不代表轨迹无碰撞。L2C 是语义门禁,不是物理门禁。

Q5:LACY 的自改进和强化学习有什么不同?

提示

LACY 主要用语言一致性过滤生成数据,不需要每个样本都在环境中试错拿 reward。

一些好奇心问答(FAQ)

Q:LACY 是一个大模型吗?

它是 VLM-based framework,但论文重点不是参数规模,而是三任务统一和 self-improvement loop。

Q:为什么叫 Language-Action Cycle?

因为语言生成动作,动作再解释成语言,语言再判断一致性,形成闭环。

Q:如果 A2L 也错了怎么办?

这正是风险。A2L 错会让 L2C 判断建立在错误解释上,所以论文提出未来要更强 verification module。

Q:真实机器人结果说明它已经实用了吗?

不能这样说。它在 Franka setup 上有正向结果,但任务类型和规模有限,仍需要更多真实部署验证。

Q:它和“让模型反思”像不像?

有点像,但更具体。LACY 的反思不是空泛文字,而是把动作解释成语言,再做一致性判断。

如果你想再深入

  1. 读 language grounding in action 的经典工作,理解语言和动作共享表征的背景。
  2. 对比 OpenVLA / SpatialVLA,看单向 action learning 的训练范式。
  3. 研究 self-training 里的 confirmation bias,理解为什么过滤器重要。
  4. 关注 L2C 能否扩展成更强的 multimodal verifier,例如同时检查图像、动作、轨迹和语言。

所以这一节是想说:LACY 是理解 VLA 自监督闭环的好入口。

原文信息

@article{hong2025lacy,
  title={LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation},
  author={Hong, Youngjin and Yu, Houjian and Li, Mingen and Choi, Changhyun},
  journal={arXiv preprint arXiv:2511.02239},
  year={2025}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_lacy_2026,
  title       = {(readable note) LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/lacy/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?