Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 163

Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments

15 min read · 5274 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份面向零基础读者的结构化研究笔记。本文只把公开论文文本和 arXiv 元数据能支持的结论写成事实;本站没有本地训练、仿真或真机复现实验,因此不会把论文报告的成功率写成本站 E4 结果。

一句话讲什么(TL;DR)

Qwen-VLA 想证明一件事:操作、导航、人类第一视角轨迹和视觉语言理解,不一定要拆成四套系统,可以统一成看图、读指令、理解当前身体,然后预测未来动作或轨迹的同一个 VLA 问题。

如果只记一个直觉:它不是在问机器人能不能完成某个固定任务,而是在问能不能把看见、听懂、知道自己是什么身体、再输出动作这几件事,整理成更可扩展的一条路。

所以这一节是想说:Qwen-VLA 的价值在于把分散的具身问题压成一个可比较、可继续扩展的建模接口。

这是个什么场景

如果把机器人比作新同事,过去的做法像给每个岗位单独培训:桌面机械臂学夹杯子,移动机器人学走廊导航,第一视角视频学人手轨迹。Qwen-VLA 的做法是先教一套通用工作语言:当前是什么身体、相机看到什么、任务是什么、接下来要输出哪种轨迹。

对初学者来说,这类论文最容易误读成又一个大模型名字。更准确的读法是:它们在给具身 AI 建接口。所谓接口,就是模型和世界之间约好的语言。图像告诉模型世界长什么样,语言告诉模型人想要什么,身体描述告诉模型自己能怎么动,动作空间告诉模型输出该怎么被机器人执行。

读者视角:为什么需要 Qwen-VLA

旧路线:任务 A 模型 ─┐
        任务 B 模型 ─┼──> 每个任务/身体单独维护,迁移成本高
        任务 C 模型 ─┘

Qwen-VLA:视觉 + 语言 + 身体约束 + 动作/轨迹
        │
        ▼
统一表示 / 统一解码 / 统一评测
        │
        ▼
更容易比较、复用和继续扩展
机制视角:从观察到动作

[图像/视频]   [语言指令]   [身体描述/控制约定]
     │            │              │
     └────────────┴──────────────┘
                  ▼
           多模态上下文表示
                  ▼
          动作或轨迹生成模块
                  ▼
       action chunk / waypoint / trajectory
                  ▼
          仿真评测或真实机器人执行

这个场景和纯聊天模型最大区别在于:输出不是一句话,而是会改变世界的动作。聊天模型答错可以重新问,机器人动作错了可能撞到桌子、夹坏物体、走到错误房间。所以论文里的 benchmark、动作表示、控制频率和 Sim2Real 细节,都不是边角料,而是决定结论能不能落地的核心。

所以这一节是想说:理解 Qwen-VLA 要先把它放在模型输出会驱动物理世界的场景里,而不是只按普通 VLM 论文读。

Qwen-VLA — 场景示意:这论文要解决的现实问题
Plate Nº IQwen-VLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

现有具身系统常按任务和身体拆开训练。manipulation 预测末端位姿或关节,navigation 预测 waypoint 或离散移动,人类 egocentric 数据记录手腕和手部轨迹。这些任务的观察格式、控制频率、动作维度和评测协议不同,导致模型很难像 VLM 那样跨数据源扩展。

早期路线通常把系统拆成几块:视觉模块负责看,语言模块负责理解,规划器负责拆任务,控制器负责执行。拆开有好处:每块容易调试。但坏处也明显:模块之间要靠人工设计的中间表示传话,一旦换机器人、换任务、换环境,就会出现大量胶水代码。

端到端 VLA 出现后,大家开始把图像、语言和动作放进同一个模型。但第一代端到端路线也有局限:有的只覆盖桌面操作,有的只支持单个 embodiment,有的依赖 autoregressive action token,生成动作时像写句子一样从左到右排队。机器人动作不是普通句子,多个控制维度和未来多个 timestep 往往要一起协调。强行顺序化,可能让本来并行相关的控制量变成脆弱的前缀依赖。

还有一个更工程化的问题:数据和评测不统一。不同论文用不同机器人、不同相机、不同动作维度、不同成功率定义。这样读者很难判断一个方法是真的更强,还是只是换了更容易的任务。第一批新增论文都在不同角度回应这个问题:要么统一模型接口,要么统一平台和 benchmark,要么统一动作生成机制。

所以这一节是想说:旧方法不够好,不是因为它们没用,而是因为它们太容易被任务、身体和评测方式切碎。

这篇论文的新想法

论文在 Qwen3.5-4B 视觉语言基座上接 DiT-based flow-matching action decoder,用 embodiment-aware prompt 描述机器人平台、手臂配置、控制 convention、频率和预测 horizon,再把 manipulation、navigation、egocentric motion 和 trajectory prediction 都投到共享 action-and-trajectory prediction 框架。

这件事的关键不在名字,而在取舍。统一模型会带来规模化收益:数据可以混用,模型可以迁移,评测可以并排比较。但统一也会带来优化压力:不同任务的损失函数、动作维度和时间尺度会互相拉扯。论文要证明的就是:这些拉扯可以通过结构设计、训练阶段和解码策略被控制住。

对读者来说,可以用三个问题快速抓住新意:第一,它把什么原本分开的东西合到了一起?第二,它为了合并付出了什么代价?第三,实验是否证明这个代价值得?只要能回答这三个问题,就已经抓住论文主线。

所以这一节是想说:Qwen-VLA 的新意是把一个分散工程问题改写成一个统一建模问题,再用实验说明这种统一没有白做。

它分几步做的(方法)

第 1 步:统一输入语义

输入:多视角图像、自然语言任务和 embodiment prompt 共同进入模型。prompt 明确当前机器人是什么身体、控制空间如何解释、动作频率和预测长度,避免模型把同一个向量误读成另一台机器人的控制命令。

处理:这里不要把输入进模型理解成只塞一个张量。具身 AI 的输入通常同时包含画面、语言、身体约束、时间窗口和控制接口。Qwen-VLA 的设计重点,是把这些异构信息整理成模型能稳定消费的形式,并避免每换一台机器人就重写一套架构。

输出:输出不是一句口号,而是更稳定的动作、轨迹、评测数据或系统接口。换成生活类比,这一步像把不同厨房的炉灶、刀具、食材标签统一成一张菜谱。厨师不必每到一个厨房重新学语言,只要知道这口锅多大、火力怎么调、食材在哪里,就能按同一套流程做菜。

第 2 步:T2A 行动先验

输入:先做 text-to-action DiT pretraining。论文把语言指令到高维动作轨迹看成解压缩:几个词压缩了任务意图,轨迹却可能有上百个连续数值。

处理:这里不要把输入进模型理解成只塞一个张量。具身 AI 的输入通常同时包含画面、语言、身体约束、时间窗口和控制接口。Qwen-VLA 的设计重点,是把这些异构信息整理成模型能稳定消费的形式,并避免每换一台机器人就重写一套架构。

输出:输出不是一句口号,而是更稳定的动作、轨迹、评测数据或系统接口。换成生活类比,这一步像把不同厨房的炉灶、刀具、食材标签统一成一张菜谱。厨师不必每到一个厨房重新学语言,只要知道这口锅多大、火力怎么调、食材在哪里,就能按同一套流程做菜。

第 3 步:联合预训练

输入:混合机器人操作轨迹、人类第一视角示范、合成仿真轨迹、VLN 数据、空间 grounding、自动驾驶 VQA、动作 caption 和普通视觉语言数据。

处理:这里不要把输入进模型理解成只塞一个张量。具身 AI 的输入通常同时包含画面、语言、身体约束、时间窗口和控制接口。Qwen-VLA 的设计重点,是把这些异构信息整理成模型能稳定消费的形式,并避免每换一台机器人就重写一套架构。

输出:输出不是一句口号,而是更稳定的动作、轨迹、评测数据或系统接口。换成生活类比,这一步像把不同厨房的炉灶、刀具、食材标签统一成一张菜谱。厨师不必每到一个厨房重新学语言,只要知道这口锅多大、火力怎么调、食材在哪里,就能按同一套流程做菜。

第 4 步:SFT 与 RL 后训练

输入:SFT 把模型拉向下游任务格式;RL 只在 SimplerEnv 收集 sparse binary success reward,不把所有 benchmark 都塞进 RL。

处理:这里不要把输入进模型理解成只塞一个张量。具身 AI 的输入通常同时包含画面、语言、身体约束、时间窗口和控制接口。Qwen-VLA 的设计重点,是把这些异构信息整理成模型能稳定消费的形式,并避免每换一台机器人就重写一套架构。

输出:输出不是一句口号,而是更稳定的动作、轨迹、评测数据或系统接口。换成生活类比,这一步像把不同厨房的炉灶、刀具、食材标签统一成一张菜谱。厨师不必每到一个厨房重新学语言,只要知道这口锅多大、火力怎么调、食材在哪里,就能按同一套流程做菜。

第 5 步:跨 embodiment 投影

输入:论文比较 Multi-MLP、Concatenation、Zero-Padding 等方式处理不同动作维度。核心目标是让 DiT latent space 共享,各机器人只在投影层处理维度差异。

处理:这里不要把输入进模型理解成只塞一个张量。具身 AI 的输入通常同时包含画面、语言、身体约束、时间窗口和控制接口。Qwen-VLA 的设计重点,是把这些异构信息整理成模型能稳定消费的形式,并避免每换一台机器人就重写一套架构。

输出:输出不是一句口号,而是更稳定的动作、轨迹、评测数据或系统接口。换成生活类比,这一步像把不同厨房的炉灶、刀具、食材标签统一成一张菜谱。厨师不必每到一个厨房重新学语言,只要知道这口锅多大、火力怎么调、食材在哪里,就能按同一套流程做菜。

把这些步骤连起来看,方法部分不是一堆模块名,而是一条数据流:先明确身体和任务,再把多模态观察变成上下文,再用动作生成模块输出未来动作,最后通过 benchmark 或真实机器人判断动作是否有用。任何一步模糊,都会让成功率数字失去解释力。

一个常见误区是只盯最后的模型名字。真正影响复现的是输入格式、动作空间、训练阶段、推理频率和评测协议。比如同样叫 VLA,一个模型输出离散 token,另一个输出连续位姿;一个每步重新推理,另一个输出 action chunk;一个能回看修正,另一个只能从左到右生成。这些差异比名字更重要。

所以这一节是想说:方法部分要按输入、处理、输出的流水线读,才能看懂 Qwen-VLA 到底改变了哪一环。

Qwen-VLA — 方法示意:核心 pipeline
Plate Nº IIQwen-VLA — 方法示意:核心 pipeline

关键数字(What works)

事实 数字 / 状态 来源与证据边界
模型基座 Qwen3.5-4B VLM + DiT-based flow-matching action decoder 摘要与 Introduction
统一任务 manipulation、navigation、egocentric action modeling、trajectory prediction 摘要与贡献列表
LIBERO Qwen-VLA-Instruct 97.9% 摘要
Simpler-WidowX Qwen-VLA-Instruct 73.7% 摘要
RoboTwin Easy/Hard = 86.1/87.2% 摘要
VLN R2R OSR 69.0%;RxR SR 59.6% 摘要与 Table 7
真实 ALOHA OOD 平均 OOD success 76.9%,无 pretrain 对照为 36.2% Table 6
DOMINO zero-shot SR 26.6%,MS 39.5 Table 9
T2A 消融 T2A Beta / CPT-SFT Log-Normal 组合达到 71.09% SFT success Figure 6 文本
默认状态输入 默认不加入 proprioceptive state conditioning Table 12 讨论

这些数字要按证据等级理解:它们是论文报告结果,不是本站本地复现结果。本站目前只完成文本研究、站点构建、provenance 和部署验证;没有保存训练日志、模型权重、仿真录像或真机执行 artifact。因此它们只能支持论文声称或公开文本报告,不能支持本站跑通。

所以这一节是想说:关键数字的价值是帮我们定位论文贡献和边界,而不是把作者报告直接当成自己的实验结论。

实验结果说明了什么

实验横跨 LIBERO、Simpler-WidowX、RoboTwin、VLN-CE、真实 ALOHA OOD 和 DOMINO 动态操作。最值得读的是两类结论:第一,预训练对真实 ALOHA OOD 从 36.2% 拉到 76.9%,说明异构数据混合确实带来迁移;第二,DOMINO zero-shot 只有 26.6%,这同时证明它比基线强,也提醒我们动态操作仍很难。

读这类实验时,建议分三层:第一层看 in-domain 成功率,说明模型有没有学会训练分布内的任务;第二层看 OOD 或新环境,说明它是否真有泛化;第三层看真实机器人或 Sim2Real,说明它是否经得起物理世界的噪声。只看第一层,容易高估方法。

还有一个重要问题:成功率不是唯一答案。一个模型可能平均分高,但在动态抓取、双臂协作或精细控制上很弱。对具身 AI 来说,失败类型往往比平均分更有学习价值,因为它告诉我们下一轮系统应该补感知、补规划、补控制,还是补数据。

所以这一节是想说:实验结果支持 Qwen-VLA 的主张,但也提醒我们要按任务类型和证据层级拆开看。

你应该懂的几个新词

  • Vision-Language-Action (VLA):视觉-语言-动作模型。输入图像和指令,输出机器人动作。类比:不是只听懂拿杯子,还要真的伸手去拿。
  • Embodiment(身体/本体):机器人自己的物理形态和控制接口。机械臂、人形机器人、移动底盘都有不同 embodiment。
  • Action chunk:一次输出未来多步动作,而不是每个控制周期只预测一步。类比:导航时先规划接下来几步,而不是每走一厘米想一次。
  • Sim2Real:从仿真迁移到真实世界。难点是仿真的光照、摩擦、传感器和接触不可能完全等于现实。
  • OOD generalization:面对训练时没见过的对象、布局、背景或任务组合仍能工作。
  • Provenance:来源证据链。本站用它记录笔记、原文、生成资产和人工核验状态,防止看起来像事实的内容没有出处。

所以这一节是想说:术语不是为了显得专业,而是为了精确描述模型和真实世界之间的接口。

它有什么搞不定的

  • 真实 embodied action data 仍稀缺,长尾对象、接触丰富任务和更多机器人身体还不够。
  • 联合训练 vision-language、navigation 和 action 会有优化 trade-off,动作训练可能轻微牺牲纯视觉语言能力。
  • DOMINO zero-shot success 仍只有 26.6%,说明动态物体、在线重规划和失败恢复还远未解决。
  • 默认不用 proprioceptive state,减少跨 embodiment 接口负担,但在末端不可见或接触力关键的任务里可能不够。

这些局限并不削弱论文价值,反而说明它站在一个真实问题上。具身 AI 的难点正是:模型能力、数据规模、硬件接口、实时控制、安全约束和评测可信度同时出现。任何论文只解决其中一两项,剩下的问题都要靠后续系统继续补。

所以这一节是想说:Qwen-VLA 是前沿推进,不是终局答案;它解决了一个关键断点,也留下了下一批研究问题。

它和别的几篇是什么关系

  • RT-2 把 web knowledge 接到动作 token,Qwen-VLA 更进一步把导航和轨迹预测也放进同一框架。
  • OpenVLA 提供开源 VLA 范式,Qwen-VLA 借鉴端到端接口,但把 action decoder 换成 flow-matching DiT。
  • π0 / π0.5 代表 flow/action foundation model 路线,Qwen-VLA 与它们共享连续动作生成思路,但更强调多任务、多环境、多 embodiment 统一。

如果你想把这篇放进本站知识图谱,最自然的读法是:先回到主题 primer 建地基,再读同一方法族的前后代,最后读 benchmark / platform 类论文校准实验边界。不要孤立背论文名,要看它接住了前人哪个问题,又把哪个问题留给后人。

所以这一节是想说:Qwen-VLA 最适合和同主题 VLA、扩散策略、数据评测论文连读,而不是单篇孤立记忆。

和本导读的关系

本篇对应导读中的 Ch04: 技术版图Ch12: VLA 和后续 Sim2Real / benchmark 章节。读它之前,建议至少先知道三件事:VLM 为什么能对齐图文,VLA 为什么要把动作 token 化或连续化,机器人评测为什么必须区分仿真、真实和 OOD。

对当前 40 篇扩展计划来说,Qwen-VLA 属于第一批,因为它能补上 2025–2026 前沿 VLA 的新分支。第一批不是为了追热点,而是为了把统一 VLA 和扩散式动作解码这两条线先接到站点现有 162 篇图谱上。

所以这一节是想说:这篇笔记是导读从经典 VLA 走向 2025–2026 前沿路线的桥。

思考题

Q1:这篇论文最想解决的碎片化具体指什么?

提示

看它是不是要统一任务、统一身体、统一动作空间,还是统一评测流程。

Q2:它的动作表示和 OpenVLA / RT-2 有什么差异?

提示

比较连续动作、离散 token、flow matching、masked diffusion 或 action chunk。

Q3:关键数字里哪个最能说明贡献?哪个最容易被误读?

提示

高分说明能力,低分或小规模实验说明边界。

Q4:如果放到真实家务机器人上,第一处可能失败在哪里?

提示

想传感器、延迟、接触力、未知物体、长程状态和安全约束。

Q5:它和本站已有哪三篇最应该连读?

提示

优先找同主题 primer 和方法相近的模型。

Q6:如果要复现,只能先跑一个最小实验,你会选哪个 benchmark?

提示

选择最小可跑环境,而不是最大最酷的真机任务。

一些好奇心问答(FAQ)

Q:这是不是说明端到端 VLA 已经解决机器人了?

不是。端到端 VLA 让系统更统一,但真实世界还有安全、接触、失败恢复、长程记忆和数据成本。论文成功率越具体,越要看任务范围。

Q:为什么很多论文都强调 action chunk?

因为机器人动作有时间连续性。一次只预测一步会频繁调用大模型,慢且容易抖;一次预测一段动作,可以更平滑,也能利用未来几步的相关性。

Q:为什么本站不把这些成功率写成我们验证了?

因为验证需要本地或线上 artifact,比如训练日志、模型 checkpoint、评测脚本、视频或真机记录。本文只做公开论文研究和站点部署,证据等级不同。

Q:读不懂公式怎么办?

先抓输入、输出和控制流。公式通常是在说明怎么把动作加噪、怎么去噪、怎么计算损失。能用人话复述机制,比逐符号背诵更重要。

如果你想再深入

  1. 先读本站已有的 rt-1、rt-2、openvla,理解 VLA 基线。
  2. 再读 diffusion-policy、pi0、cogact,理解连续动作生成和扩散/流匹配路线。
  3. 最后读本篇和同批的扩散式 VLA,比较 autoregressive、continuous diffusion、discrete diffusion 三种动作解码。
  4. 真要复现时,优先找官方代码、最小 benchmark 和固定环境,不要一开始就上真机。

原文信息

  • arXiv: 2605.30280
  • 本站状态:公开来源研究;未做本地训练、仿真或真机复现;human verification 仍应保持 UNVERIFIED,直到逐节人工核验完成。
@misc{qwen_vla_2026,
  title = {Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments},
  year = {2026},
  eprint = {2605.30280},
  archivePrefix = {arXiv},
  primaryClass = {cs.RO},
  note = {Read through Embodied AI: Zero to One},
  url = {https://arxiv.org/abs/2605.30280}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_qwen_vla_2026,
  title       = {(readable note) Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2026 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/qwen-vla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?