Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 123

TraceVLA: Visual Trace Prompting

16 min read · 5710 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI / 机器人"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。

一句话讲什么(TL;DR)

机器人的手刚走过哪里?TraceVLA 把这条路径直接画在它看到的照片上,让它"看见自己的足迹",再决定下一步往哪动。做法极简:在 OpenVLA 上用自采的 15 万条轨迹做视觉轨迹提示(visual trace prompting)微调,不加新模块、不加历史文本。结果在 SimplerEnv 的 137 个配置上比 OpenVLA 高约 10%,真机 WidowX 上高 3.5 倍;连一个基于 4B Phi-3-Vision 的紧凑版都能追平 7B 的 OpenVLA。

所以这一节是想说:TraceVLA 用"把历史轨迹画进图里"这一招,低成本地补上了 VLA 缺失的时空记忆,是视觉提示在机器人上的样板。


这是个什么场景

想象你在玩一个游戏:每隔一秒给你看一张厨房照片,让你说出锅铲下一秒该往哪挥。但有个坑——每张照片都是孤立的,你根本不记得上一秒挥到了哪。结果就是你在锅里来回打转,左边搅三遍,右边一下没碰。

机器人现在做菜(或抓积木、放杯子)就是这个状态:它每一步只看当前一帧画面,下一步动作全靠"猜",因为它不知道自己刚才动过哪。这就是 VLA 缺乏**时空感知(spatial-temporal awareness)**的毛病——决策更像是"对当前输入的反射",而不是"结合空间历史的判断"。

TraceVLA 的解法很像在锅边架一支荧光笔:锅铲走过哪里,画面上就留一道光痕。机器人下次瞥一眼,当前这张照片里就带着自己刚才的足迹——不用回忆、不用读历史文件,看图就知道"我已经搅过左边了,该轮到右边"。

关键是:轨迹不是塞进文字("刚才手到了 (0.3, 0.5, 0.2)"这种坐标),而是直接画进图像里,让模型用它最擅长的"看图"方式消化。

所以这一节是想说:TraceVLA 面对的是"VLA 只看单帧、丢失历史"的痛点,用一张带轨迹的增强图把时空历史"显式画给模型看"。


TraceVLA — 场景示意:这论文要解决的现实问题
Plate Nº ITraceVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • OpenVLA / RT-2 等单帧 VLA:每步只看当前 RGB 帧,丢掉历史。靠 Transformer 内部隐式建模时序,但单帧输入下信息其实不全,模型"记不住"自己刚才在干嘛。
  • 多帧堆叠(frame stacking):把过去 N 帧拼起来一起喂模型。代价:token 数量爆炸、长上下文训练困难、大量像素冗余。TraceVLA 论文的对照实验里,"OpenVLA + 6 帧序列"也被拿来比较。
  • 历史动作文本化:把过去几步的动作 token 拼进 prompt。问题:动作空间和视觉空间分离,模型要跨模态对齐才能利用历史。
  • RT-Trajectory(同类思路):把目标轨迹画在图上作为任务指令。和 TraceVLA 是镜像关系——一个画"未来要走的路"(指令),一个画"过去走过的路"(状态)。
  • 隐式记忆模块(RNN / Mamba / 状态变量):用循环结构压缩历史。但主流 VLA 是 decoder-only Transformer,引入循环架构成本大。

时空感知(spatial-temporal awareness):模型不仅知道"现在场景什么样",还知道"我刚才动过哪、物体怎么移动的",从而结合空间历史做决策。

共同问题:处理历史要么代价大(多帧、循环结构),要么跨模态别扭(动作文本化)。TraceVLA 主张——既然 VLM 本就极会读图,历史别另开通道,直接画成图喂进去就行。

所以这一节是想说:前人处理历史的方案要么贵要么别扭,TraceVLA 选了"把历史画进图里"这条几乎零成本的视觉路线。


这篇论文的新想法

像给一个英语很好但听不懂中文的朋友指路——别费劲翻译成中文,直接画张地图给他看。

核心洞察:VLM(视觉语言模型,预训练过的"看图王")已经非常会读图了。那历史信息也别另开一条通道塞给它,直接画成图喂进去。

具体三步:

  • 取最近若干步机械手(末端执行器)的位置,用点追踪算法在图像里得到它们的 2D 轨迹点;
  • 把这些点连成一条线(trace,轨迹),叠加渲染在当前 RGB 帧上;
  • 把"原始图 + 带轨迹的增强图"两张图,用一个**可学习的分隔符 token(separator token)**隔开,一起喂给 VLA。

三个好处:

  • 几乎零新增模块:现成 VLA 架构和权重直接用,只是输入端多一张图;
  • 零新增历史 token:历史被画进像素,不额外撑长上下文;
  • 时序信息可视化:模型一眼看出"我已接近目标"或"我在原地打转"。

所以这一节是想说:TraceVLA 的新想法是"把状态历史可视化成图像轨迹,交给 VLM 的读图能力去消化",简单到几乎不改模型。


它分几步做的(方法)

方法可拆成四块:轨迹生成、视觉叠加与双图输入、模型与训练、推理。核心在"怎么生成轨迹"和"怎么把两张图喂进去"。

1. 轨迹生成:用点追踪画出"走过的路"(Visual Trace Generation)

类比:在地图上标"我刚才经过了这几个点",连成一条线。

输入:一段机器人操作演示的连续帧。

处理:用点追踪模型 Co-Tracker 在图像里追踪多个点的运动。论文的具体配置:网格大小 K=40(把图铺成网格取候选点),采样 M=5 条活跃点轨迹(active point trajectories,即真正在动的点),时间窗口 N=6。为省算力,不是每一帧都追踪,而是每 N 步对未来 2N 帧跑一次追踪:把演示切成互相重叠的 2N 长片段(如 [0,2N)、[N,3N)…),每段跑一次 Co-Tracker。这样保证每个 t>N 的时刻至少有 N 步历史可用,同时大幅降算力。

输出:一组随时间的 2D 轨迹点——既包含机械手末端的运动,也包含被移动物体的运动。

末端执行器(end-effector):机械臂最末端那个"手",通常是夹爪。它的位置轨迹是最关键的历史信息。

点追踪(point tracking):在视频里持续跟踪同一批点的位置。Co-Tracker 是一种能同时追踪多点的模型。

所以这一节是想说:轨迹生成用 Co-Tracker 高效追出"手和物体走过的 2D 路径",是后续可视化的原料。


2. 视觉叠加与双图输入(Overlay + Dual-Image with Separator)

类比:像 PS 图层一样把线画到照片上,再把"原图"和"画了线的图"并排给模型看,中间夹一张"分隔卡"。

输入:当前 RGB 帧 + 生成的 2D 轨迹点。

处理:把轨迹点连成线、渲染叠加到当前帧,得到一张"带视觉轨迹的增强图"。这一步是纯绘图、不进梯度,类似数据增强。然后把两张图一起喂:一张原始观察图、一张带轨迹的增强图,两者的视觉 token 之间插入一个可学习的分隔符 token,再拼上语言指令的文本 token,一起送进 VLM 骨干输出动作 token。分隔符告诉模型"前面是原图、后面是带历史轨迹的图"。

输出:一段"原图 token + 分隔符 + 增强图 token + 文本 token"的输入序列。

输入构造(ASCII)

   [原始观察图] <SEP> [带轨迹的增强图] + [语言指令]
        │           │         │              │
     图像 token   可学习    图像 token      文本 token
                  分隔符
        └──────────────┬───────────────────┘
                        ▼
                   VLM 骨干 (OpenVLA)
                        ▼
                    动作 token

所以这一节是想说:双图 + 分隔符是 TraceVLA 的接口设计——让模型对照"现在"和"带历史的现在",从中读出时空变化。


3. 模型与训练:在 OpenVLA 上做视觉轨迹提示微调(SFT)

类比:抄 OpenVLA 的作业,但把练习题的插图换成"带脚印的版本"。

输入:带视觉轨迹的 15 万条机器人操作轨迹数据集。

处理:底座是 OpenVLA(7B)。在带 trace 的图上做监督微调(SFT, supervised fine-tuning),训练目标仍是预测下一步动作 token——和原版 OpenVLA 一样,只是输入图变成了"原图 + 增强图"。为验证通用性,作者还基于 4B 的 Phi-3-Vision 训了一个紧凑版 TraceVLA-Phi3(先在 Open-X-Embodiment 的 97 万条轨迹上预训练,再用自采数据 + 视觉轨迹提示微调)。

输出:TraceVLA(7B)和 TraceVLA-Phi3(4B)两个模型。

关键对照:为了证明提升不是"单纯多微调了一批数据"带来的,作者还训了"在完全相同数据上微调、但不加 trace"的 OpenVLA——结果几乎没涨(7B 仅 +1.1%,4B 甚至掉 0.3%),而加了 trace 后成功率显著上升。这是本文最重要的证据:收益来自视觉轨迹本身,而非额外微调。

所以这一节是想说:训练就是"OpenVLA + 带轨迹图的 SFT",且用"同数据无 trace"的对照坐实了提升来自 trace 而非微调。


4. 推理:边走边画(Inference)

类比:机器人每走一步都实时更新脚印图,再看图决定下一步。

输入:当前观察帧 + 最近若干步的历史位置。

处理:每一步实时计算 trace、叠加到当前帧、连同原图一起喂模型,输出动作。推理时只多了一个轻量的"画线"步骤,模型本身前向不变。开头阶段(历史还是空的、trace 为空)等价于无 trace。

输出:机器人下一步动作。

所以这一节是想说:推理端只加一个画线步骤,模型前向零改动,工程代价极低。


TraceVLA — 方法示意:核心 pipeline
Plate Nº IITraceVLA — 方法示意:核心 pipeline

关键数字(What works)

论文摘要与正文可确认的数字如下;未明确报告的标"原文未报告"。

模型与数据

项目 数值
主模型 TraceVLA,基于 OpenVLA 7B
紧凑版 TraceVLA-Phi3,基于 Phi-3-Vision 4B
视觉轨迹微调数据 150K(15 万)条轨迹
Phi3 版预训练数据 Open-X-Embodiment 970K 轨迹
追踪配置 网格 K=40,活跃轨迹 M=5,时间窗 N=6,Co-Tracker

性能(对比 OpenVLA)

评测 结果
SimplerEnv(137 配置) 比 OpenVLA 高约 10%
真机 WidowX(4 任务) 比 OpenVLA 高 3.5 倍
单任务提升范围(SimplerEnv 三任务) +2.4% ~ +12.7%
pick-place corn(训练中未见) TraceVLA 8/10 vs OpenVLA 1/10
TraceVLA-Phi3(4B) 追平 7B OpenVLA,且推理更省

关键对照(提升来源)

设置 结果
OpenVLA 在相同数据微调(无 trace) 仅 +1.1%
OpenVLA-Phi3 相同数据微调(无 trace) −0.3%(反而降)
OpenVLA 加 visual trace prompting 成功率升至 47.7%

所以这一节是想说:硬数字表明"加 trace 才涨(SimplerEnv +10%、真机 3.5×),同数据无 trace 几乎不涨",提升确实来自视觉轨迹。


实验结果说明了什么

**结论 1:VLA 内部"看不太懂"自己几步前在干嘛。**同数据无 trace 微调几乎不涨(+1.1% / −0.3%),加 trace 后大涨——说明 Transformer VLA 从单帧里并没有隐式建好时空历史,需要外部把历史显式画给它看。

**结论 2:视觉是喂历史最省的通道。**把历史画进像素,不增加历史 token、不改架构,就拿到 SimplerEnv +10%、真机 3.5× 的提升。相比多帧堆叠(token 爆炸)和动作文本化(跨模态别扭),视觉轨迹更契合 VLM 的强项。

**结论 3:VLM 的视觉先验能迁移到"线条=路径"这个抽象。**训练时 VLM 没专门见过画了线的机器人图,却能理解 trace 的含义并用它改进决策——这说明视觉提示(visual prompting)借用了 VLM 从互联网学到的"读图常识"。pick-place corn 这种训练未见任务 8/10 vs 1/10 的泛化,正是这种迁移的体现。

**结论 4:方法可迁移到小模型。**4B 的 TraceVLA-Phi3 追平 7B OpenVLA,说明 trace 的收益不绑定特定规模,还能顺带省推理成本。

所以这一节是想说:核心 takeaway 是"VLA 缺时空记忆、视觉轨迹是最省的补法、且这套补法借力于 VLM 的读图先验、并能迁移到小模型"。


你应该懂的几个新词

VLA(Vision-Language-Action):把图像 + 语言指令直接映射成机器人动作 token 的大模型,如 RT-2、OpenVLA。

时空感知(spatial-temporal awareness):结合"空间历史"(我刚走过哪、物体怎么动)做决策的能力,而非只对当前帧反射。

视觉提示(visual prompting):通过修改输入图像来引导模型行为,如画框、画箭头、叠加轨迹。对应文字 prompt。

视觉轨迹(visual trace):把末端执行器和物体过去若干步的位置连成线,画到当前图上。

末端执行器(end-effector):机械臂最末端的"手"(夹爪),其位置轨迹是关键历史。

点追踪 / Co-Tracker:在视频里持续跟踪多个点位置的算法/模型。

分隔符 token(separator token):插在"原图"和"增强图"视觉 token 之间的可学习标记,告诉模型两段图的角色。

frame stacking(多帧堆叠):把多帧拼一起喂模型处理时序的朴素做法,token 开销大。

所以这一节是想说:抓住"视觉提示""视觉轨迹""时空感知"这三点,就理解了 TraceVLA 的全部要害。


它有什么搞不定的

  1. 开头阶段 trace 为空:任务刚开始、还没有历史时,trace 是空的,等价于无 trace,这一阶段拿不到增益。
  2. 依赖点追踪质量:Co-Tracker 追错点、遮挡、快速运动导致丢点,会画出误导性的轨迹,反而干扰决策。
  3. 2D 投影丢失深度:轨迹是画在 2D 图上的,深度信息(离相机远近)被压扁,对需要精细 3D 判断的任务信息不全。
  4. 多一张图的开销:双图输入让视觉 token 翻倍(原图 + 增强图),比单图 VLA 略贵——虽比多帧堆叠省,但非零成本。
  5. 仍是 OpenVLA 底座的局限:视觉盲区、语义泛化弱点等继承自 OpenVLA,TraceVLA 只补时空记忆,不修这些。
  6. OOD 鲁棒性待观察:训练时 VLA 没见过画线的图,靠 VLM 视觉先验迁移;在分布外场景这种迁移是否始终成立,是论文价值的核心变量(摘要报告了强泛化,但边界仍需具体任务验证)。

所以这一节是想说:TraceVLA 的代价是"依赖追踪质量、2D 丢深度、双图略贵、开头无 trace",且它只补时空记忆、不修底座其他短板。


它和别的几篇是什么关系

关系图(ASCII)

                OpenVLA(7B 单帧 VLA, 底座)
                        │ 输入端加"带轨迹的图"
                        ▼
                 TraceVLA(+ visual trace prompting)
     ┌──────────────┬──────────────┬─────────────┐
   镜像思路         同源视觉提示      对照(处理历史)   小模型验证
  RT-Trajectory    Set-of-Mark      多帧堆叠 /      TraceVLA-Phi3
  (画未来目标轨迹)   (GPT-4V 视觉标记)  动作文本化      (4B Phi-3)
  • OpenVLA(基础):TraceVLA 是它的"轻量增强版"——同款模型,输入端改一改就提点。见 openvla.md
  • RT-Trajectory(DeepMind, 2023):把目标轨迹画在图上作为指令;TraceVLA 把历史轨迹画在图上作为状态。一个朝前看、一个朝后看,思路对偶。见 rt-trajectory.md
  • RT-2 / Octo:同样是 VLA,但靠多帧或大规模数据解决时序;TraceVLA 主张"一张增强图 + 视觉先验"就够,更省。
  • Set-of-Mark prompting(GPT-4V 上的视觉提示):思路同源——给 VLM 看的图加视觉标记引导关注点。TraceVLA 是机器人版的 SoM。
  • Inner Monologue / Code as Policies:靠 LLM 文字推理处理历史;TraceVLA 选了纯视觉路线,不依赖 LLM 自言自语。

所以这一节是想说:TraceVLA = OpenVLA 底座 + RT-Trajectory 的镜像(历史而非未来)+ Set-of-Mark 式视觉提示,是"用视觉补时空记忆"的样板。


和本导读的关系

本篇对应 Ch12: 开源 VLA——OpenVLA / VLAs 综述 / MLA

Ch12 讲开源 VLA 的范式与变体,OpenVLA 是其中的标杆基座。TraceVLA 是围绕这个基座做"最小改动、最大收益"的代表——它不碰架构、不加参数,只在输入端把历史轨迹画进图里,就补上了单帧 VLA 缺失的时空记忆。读完 OpenVLA 理解"单帧 VLA 长什么样、为什么记不住历史",再读 TraceVLA 就能看到"视觉提示这一招如何四两拨千斤",也能顺势对照 OpenVLA-OFT(同样在 OpenVLA 上做改进,但改的是输出端而非输入端)。

所以这一节是想说:在 Ch12 里,TraceVLA 代表"改输入端补时空记忆"的一支,与改输出端的 OpenVLA-OFT 形成互补对照。


思考题

Q1:TraceVLA 把历史画进图里,为什么比"把历史动作写成文本 token 拼进 prompt"更有效?

提示

VLM 的强项是读图,而不是把"文本坐标"和"视觉空间"对齐。历史动作文本化(如 <a1><a2>)要求模型在语言空间和视觉空间之间做跨模态对齐,才能利用历史。视觉轨迹直接把历史放进模型最擅长的视觉通道里,"我走过的路"和"当前场景"在同一张图里天然对齐,无需额外的跨模态映射。这也解释了为什么同一份历史信息,画成图比写成字更好用。

Q2:论文最关键的对照是"同数据无 trace 微调几乎不涨(+1.1%)"。为什么这个对照如此重要?

提示

因为它排除了一个致命的替代解释——"提升只是因为多微调了 15 万条数据"。如果不做这个对照,读者无法判断收益到底来自 trace 还是来自额外训练。结果显示同数据无 trace 几乎不涨、加 trace 才大涨,才能把因果锁定在"视觉轨迹"这个变量上。这是消融实验设计的经典范例:控制其他变量,只翻转你声称有效的那一个。

Q3:TraceVLA 的轨迹是画在 2D 图上的,丢失了深度。这在什么任务上会成为硬伤?如何补救?

提示

对需要判断"手离物体前后多远""要不要下压多少"的任务(如精确插入、堆叠对齐),2D 轨迹无法表达深度方向的历史,可能不够。补救思路:(1) 用带深度的相机,把深度也编码进轨迹的颜色/粗细;(2) 多视角相机各画一条 trace,从不同视角间接恢复 3D;(3) 结合本体状态(关节角)提供的 3D 信息。但这些都会增加复杂度,偏离 TraceVLA"极简、纯 2D"的卖点。

Q4:TraceVLA 和 RT-Trajectory 一个画历史、一个画未来目标。能不能把两者合起来,同时画"走过的路"和"要走的路"?会有什么好处和风险?

提示

好处:模型既知道自己从哪来(历史/状态),又知道该往哪去(目标/指令),时空信息更完整,理论上对长时程任务更有利。风险:(1) 两条线叠在一张图上可能互相干扰、视觉混乱;(2) 未来目标轨迹需要一个规划器先给出,增加系统复杂度;(3) 训练数据要同时标注历史和目标。这是个自然的组合方向,权衡在"信息更全 vs 视觉/系统更复杂"。

Q5:训练时 VLM 从没见过"画了线的机器人图",为什么它还能理解 trace 的含义?这依赖什么前提?

提示

依赖 VLM 在互联网预训练中学到的通用视觉常识——它见过大量"线条表示路径/箭头表示方向"的图(地图、示意图、运动轨迹图),所以"线=运动路径"这个抽象对它不陌生。微调只是把这个已有抽象接到机器人动作预测上。前提是底座 VLM 足够强、见过足够多样的图;如果底座视觉能力弱,trace 可能被当成无意义的噪声。这也是为什么视觉提示在强 VLM 上才特别有效。

Q6:如果点追踪(Co-Tracker)在某些帧追错了点、画出错误轨迹,会发生什么?如何让模型对这种噪声鲁棒?

提示

错误轨迹会给模型误导性历史,可能导致错误决策。鲁棒性来源:(1) 训练数据里如果也含一定比例的追踪噪声,模型会学会"不完全信任 trace";(2) 双图设计保留了原始图,模型可以对照原图判断 trace 是否合理;(3) 只追活跃点(M=5)+ 分段追踪能减少明显错误。根本上,trace 是"辅助线索"而非"唯一输入",原图始终在场,这限制了单条错误轨迹的破坏力。


一些好奇心问答(FAQ)

Q:TraceVLA 需要重新训练一个大模型吗?

不需要从零训。它是在 OpenVLA(或 Phi-3-Vision)基础上做微调,加视觉轨迹提示。复现成本相对低。

Q:推理会慢很多吗?

多了一个画线步骤和一张增强图(视觉 token 翻倍),比单图略贵,但远比多帧堆叠省。Phi3 版本还专门优化了推理效率。

Q:trace 里画的只有机械手吗?

不只。追踪的点既包括末端执行器,也包括被移动的物体,所以 trace 能反映"手和物"的运动历史。

Q:为什么用 Co-Tracker 而不是简单投影关节位置?

Co-Tracker 能直接在图像里追踪任意可见点(包括物体),不需要精确的相机标定和运动学正解,更通用、更省事。

Q:这算是"给 VLA 加记忆"吗?

可以这么理解——但它不是内部记忆模块,而是"把外部历史可视化后重新喂进去",是一种外置的、显式的记忆形式。

所以这一节是想说:对多数人,TraceVLA 的价值是一个可迁移的 idea——"用视觉提示给 VLA 补历史",复现只要在 OpenVLA 上加几十行画线代码。


如果你想再深入

  1. 底座(必读):OpenVLA (Kim et al. 2024) — TraceVLA 的基座,先懂单帧 VLA 为什么记不住历史。见 openvla.md
  2. 镜像对照:RT-Trajectory (2023) — 画未来目标轨迹作指令,与 TraceVLA 的历史轨迹对偶。见 rt-trajectory.md
  3. 视觉提示源头:Set-of-Mark prompting — GPT-4V 上给图加视觉标记的技巧,TraceVLA 是其机器人版。
  4. 输出端对照:OpenVLA-OFT — 同样改进 OpenVLA,但改输出端(并行+分块+连续)。见 openvla-oft.md
  5. 点追踪工具:Co-Tracker — 理解 trace 是怎么高效生成的。

读顺序建议:

OpenVLA(单帧底座) → TraceVLA(你在这,输入端加历史轨迹)
                       ├─► RT-Trajectory(画未来的镜像)
                       └─► OpenVLA-OFT(改输出端的对照)

所以这一节是想说:把 TraceVLA 放在"OpenVLA 的最小改动增强"这一类里读,对照 RT-Trajectory 和 OFT,最能看清它"改输入端补时空记忆"的定位。


原文信息

@inproceedings{zheng2025tracevla,
  title={TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies},
  author={Zheng, Ruijie and Liang, Yongyuan and Huang, Shuaiyi and Gao, Jianfeng and Daum{\'e} III, Hal and Kolobov, Andrey and Huang, Furong and Yang, Jianwei},
  booktitle={International Conference on Learning Representations (ICLR)},
  year={2025}
}
  • arXiv:2412.10345
  • 机构:University of Maryland & Microsoft Research
  • 一句话定位:在 OpenVLA 上用 15 万轨迹做视觉轨迹提示微调,SimplerEnv +10%、真机 3.5×,用视觉补时空记忆。

引用本笔记 / Cite this note
BibTeX
@online{eai_tracevla_2026,
  title       = {(readable note) TraceVLA: Visual Trace Prompting},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/tracevla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?