Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Diffusion Policy · Plate Nº 46

FAST: Efficient Action Tokenization for VLA

13 min read · 4700 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过机器人策略/VLA"的读者的精读笔记。全程类比、术语先定义、公式翻成人话。读完你能讲清"为什么把机器人动作切成 token 这件小事,会决定一个自回归 VLA 能不能学会灵巧的高频动作,以及 FAST 用一招'频率压缩'怎么把它救活"。

一句话讲什么(TL;DR)

给机器人的连续动作找一种更聪明的"切词方式":不再逐个维度、逐个时刻粗暴分格,而是先把一段动作用"频率变换 + 压缩"编成紧凑的 token。这一改,让自回归式的视觉-语言-动作模型(VLA)第一次能学会那些高频、灵巧的操作技能;配上 π0,训练速度比扩散式 VLA 快最多 5 倍,性能还打平。

所以这一节是想说:这篇论文改的是"机器人动作怎么变成 token",一个不起眼但决定成败的环节。


这是个什么场景

现在有一类很火的机器人大脑叫 VLA(Vision-Language-Action,视觉-语言-动作模型):它像会说话的多模态大模型一样,看着摄像头画面、听着人话指令,然后输出机器人该做的动作。其中一大派是自回归 VLA——把动作也当成"词",像写句子一样一个 token 接一个 token 地吐出来(这样就能直接复用大语言模型那套成熟机器)。

问题出在一个不起眼的环节:动作怎么变成 token? 机器人的动作是连续的数字(比如 7 个关节每一时刻的角度或速度)。要让语言模型吐它,就得先把这些连续数字离散成一格一格的 token。主流做法很土:每个维度、每个时刻各自分格(binning)——把每个关节在每个时刻的值切成若干档,各自编号。

这个土办法在"慢速、粗糙"的任务上还行,但一遇到高频、灵巧的任务就崩。比如以 50Hz 采集的精细手部操作,相邻时刻的动作值几乎一样,逐格切出来的 token 序列又长又重复、信息密度极低,语言模型根本学不好。论文发现:用这种土 token,标准离散化在灵巧高频任务上几乎完全失败。

FAST 要解决的就是:给机器人动作找一种高质量的 token 化方式,让自回归 VLA 也能学会灵巧高频技能。

所以这一节是想说:目标是修好"动作 token 化"这个卡住自回归 VLA 学灵巧动作的瓶颈。


FAST — 场景示意:这论文要解决的现实问题
Plate Nº IFAST — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 逐维逐时刻分格(per-dimension per-timestep binning):最常见。每个关节每个时刻的值切档编号。问题:高频数据里相邻时刻几乎不变,token 序列又长又冗余,相关性极高,自回归模型学不动,灵巧任务直接失败。
  • 扩散式 VLA(diffusion VLA,如 π0 原版):不把动作离散,而是用扩散模型直接生成连续动作块。效果好、能处理高频灵巧任务,但训练慢、结构复杂,且和"纯自回归 + 复用 LLM 机器"的简洁路线不兼容。
  • 各种手工设计的动作表示:如只预测关键帧、或降采样。要么丢信息,要么需要任务特定调参,不通用。
  • 共同短板:自回归路线的 token 太差(学不了灵巧高频),扩散路线又慢又复杂——缺一个"既能自回归复用 LLM、又能处理灵巧高频"的动作 token 方案。

所以这一节是想说:土 token 让自回归学不了灵巧动作,扩散虽好但慢且复杂,中间缺一块。


这篇论文的关键想法

FAST 的核心洞察来自信号处理:连续动作序列里的冗余,可以用"频率变换 + 压缩"去掉。 三个关键点:

第一,用离散余弦变换(DCT)把动作从"时间域"搬到"频率域"。 一段平滑的动作曲线,在频率域里能被少数几个系数就描述清楚(大部分能量集中在低频)。这跟 JPEG 压图片、MP3 压音乐是同一个道理——把信号变到频率域,就能用很少的数扔掉冗余、保住主要信息。

第二,量化 + 压缩编码,得到紧凑 token。 把 DCT 系数量化(离散化),再用类似 BPE(byte-pair encoding,语言模型常用的合并高频片段的压缩编码)的方式压成一串短而信息密集的 token。这样同一段动作,token 数大幅减少、每个 token 信息量大增,自回归模型就学得动了。这套方案叫 FAST(Frequency-space Action Sequence Tokenization,频率空间动作序列 token 化)

第三,做一个通用 tokenizer:FAST+。 作者把这套 token 化在 100 万条真实机器人动作轨迹上训练成一个通用动作 tokenizer FAST+——它可以当"黑盒"直接给各种机器人(不同动作空间、不同控制频率)的动作序列切 token,开箱即用。配上 π0 这个 VLA,能扩展到 1 万小时机器人数据训练,性能追平扩散式 VLA,而训练时间最多快 5 倍。

所以这一节是想说:核心是"DCT 频率变换 + 量化压缩"造出紧凑高质量的动作 token(FAST),并做成通用 tokenizer FAST+。


FAST — 方法示意:核心 pipeline
Plate Nº IIFAST — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:为什么土 token 会崩、DCT 变换、量化 + 压缩编码、FAST+ 通用 tokenizer 与 π0 结合。逐块按"输入 → 处理 → 输出"讲。

1. 诊断:为什么逐格切会在高频任务上崩

输入。 一段高频采集的动作块(比如 50Hz 下的一秒钟 = 50 帧 × 若干维度)。

处理(分析)。 逐维逐时刻分格时,相邻时刻的值几乎相同 → 切出来的 token 高度重复、序列很长。自回归模型要预测下一个 token,发现"下一个几乎总是和上一个一样",于是学到的是"复读"而非真正的动作规律;有用信息被冗余淹没。频率越高,这个问题越致命。

输出。 结论:土 token 的信息密度太低、序列太长,是自回归 VLA 学不了灵巧高频动作的根因。

所以这一节是想说:先诊断清楚——土 token 的冗余和长度,才是自回归 VLA 在灵巧任务上失败的病根。

2. DCT:把动作搬到频率域去冗余

输入。 一个动作块(时间 × 维度的连续数值矩阵)。

处理。 对每个动作维度沿时间做离散余弦变换(DCT)——把"随时间变化的曲线"分解成一组不同频率的余弦波的叠加,得到一组频率系数。平滑的动作绝大部分能量集中在低频几个系数上,高频系数大多接近 0(可以扔)。这一步把"又长又冗余的时间序列"变成"少数几个有意义的频率系数"。

离散余弦变换(DCT):一种把信号从"时间/空间域"变到"频率域"的数学变换,JPEG、MP3 都靠它压缩。人话:把一条曲线拆成"几个不同快慢的波叠加",然后只保留主要的几个波。

输出。 每个动作块对应的一组稀疏的频率系数(大部分能量在少数低频系数上)。

所以这一节是想说:DCT 把动作搬到频率域,让"平滑冗余的长序列"变成"少数关键频率系数"。

3. 量化 + 压缩编码:造出紧凑 token

输入。 DCT 频率系数。

处理。

  1. 量化(quantize):把连续的频率系数离散成整数档(丢掉可忽略的精度和接近 0 的高频系数,进一步去冗余)。
  2. 压缩编码(BPE 式):把量化后的系数序列用 BPE 这类"合并高频出现片段"的方法压成更短的 token 串。BPE 是语言模型里把常见字符组合并成一个 token 的经典压缩法,这里借来压动作。

结果:同一段动作,token 数量大幅下降,每个 token 承载的信息量大增——正好对自回归模型的胃口。

输出。 一串短而信息密集的动作 token,可直接当"词"喂给自回归 VLA。

所以这一节是想说:量化 + BPE 压缩把频率系数变成"短小精悍"的 token,解决了长度和信息密度问题。

4. FAST+ 通用 tokenizer + 与 π0 结合

输入。 大量不同机器人、不同动作空间、不同控制频率的动作轨迹。

处理。

  • FAST+:把上面这套 token 化在 100 万条真实机器人动作轨迹上训练/拟合成一个通用的动作 tokenizer——可当黑盒直接给各种机器人的动作切 token,不用为每个机器人重调。
  • 与 π0 结合:把 FAST 动作 token 接到 π0(一个强 VLA)上,做成自回归 VLA。这样就能扩展到 1 万小时数据训练,且训练比扩散式快最多 5 倍、性能追平。

输出。 一个既能自回归复用 LLM 机器、又能处理灵巧高频任务、训练还快的 VLA(即 π0-FAST)。

下面用 ASCII 图把 token 化流水线画出来:

   动作块(时间×维度, 高频冗余)
        │  ① DCT: 时间域 → 频率域
        ▼
   频率系数(能量集中在低频, 高频≈0)
        │  ② 量化: 连续→整数档, 扔掉可忽略高频
        ▼
   量化系数序列(已很短)
        │  ③ BPE 压缩: 合并高频片段
        ▼
   紧凑动作 token 串  ──►  自回归 VLA(如 π0) 像吐词一样输出动作

再用一张 ASCII 图对比"土 token vs FAST":

   土 token(逐格):  ████████████████████████  很长, 高度重复, 学不动
   FAST token:      ████████                  短, 信息密, 学得动
                    (同一段灵巧高频动作)

所以这一整节是想说:FAST = 诊断冗余 + DCT 去冗余 + 量化/BPE 压缩 + FAST+ 通用化,把动作 token 从"学不动"变成"又短又好学"。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【FAST: Efficient Action Tokenization… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

关键数字(What works)

数字来自论文(arXiv:2501.09747);各任务的具体成功率属正文表格,标注"需读原文"。

项目 数值/结论 说明
核心变换 离散余弦变换(DCT) 频率域去冗余
通用 tokenizer FAST+ 黑盒可用
FAST+ 训练数据 100 万条真实机器人轨迹 跨动作空间/频率
与 π0 结合规模 1 万小时机器人数据 大规模训练
训练加速 最多快 相比扩散式 VLA
性能 追平扩散式 VLA 自回归也能打
土 token 在灵巧高频任务 几乎完全失败 动机所在

三个要点:第一,**土 token 在灵巧高频任务上"完全失败"**这个发现,本身就点破了很多自回归 VLA 表现不佳的隐藏原因;第二,训练快 5× 且性能追平扩散是关键成果——它让"简洁的自回归路线"重新有了和扩散 VLA 竞争的资格;第三,FAST+ 是通用黑盒 tokenizer,跨机器人、跨频率即插即用,工程价值很高。

所以这一节是想说:一个更好的 token 化,让自回归 VLA 在灵巧任务上"从不能到能",还比扩散快 5 倍、性能持平。


实验结果说明了什么

论文实验主要证明:

  • FAST 让自回归 VLA 能学灵巧高频任务:在标准离散化"完全失败"的高频精细任务上,FAST token 让自回归 VLA 训练成功,直接验证了"token 化是瓶颈"这一判断。
  • 性能追平扩散、训练快得多:π0-FAST 在多任务上匹配扩散式 π0 的表现,而训练时间最多快 5 倍——说明自回归路线在效率上有优势且不牺牲能力。
  • FAST+ 通用性:作为黑盒 tokenizer 用于多种机器人、多种动作空间和控制频率,都能有效切 token,证明其通用性。
  • 可扩展到大数据:能在 1 万小时数据上训练,具备规模化潜力。

所以这一节是想说:实验证明"好 token 化"既解锁了灵巧高频能力,又带来训练效率优势,还通用可扩展。


你应该懂的几个新词

  • VLA(Vision-Language-Action):看图 + 听指令 + 输出动作的机器人大脑。
  • 自回归(autoregressive):一个 token 接一个 token 地生成,复用语言模型机器。
  • 动作 token 化(action tokenization):把连续动作离散成 token 供语言模型吐出来。
  • binning(分格离散化):把连续值切成若干档编号,最土的 token 化,高频任务上会崩。
  • DCT(离散余弦变换):把信号变到频率域的变换,JPEG/MP3 的压缩基石。
  • 量化(quantization):把连续值离散成整数档。
  • BPE(byte-pair encoding):语言模型常用的压缩编码,把常见片段合并成一个 token。
  • π0:Physical Intelligence 的强 VLA,FAST 与它结合成 π0-FAST。

所以这一节是想说:DCT、量化、BPE、自回归是理解本篇的四个关键词,前三个都来自"压缩"这个大思想。


它有什么搞不定的

  • DCT 假设动作平滑:频率压缩对平滑连续动作最有效;若动作里有大量突变/离散切换(如开关夹爪的瞬时跳变),低频压缩可能损失关键信息。
  • 量化损失:量化必然丢精度,对精度要求极高的任务需权衡档位数量与序列长度。
  • 仍是"预测动作块":和多数 VLA 一样,输出的是一段动作块,对需要极快闭环反馈的任务,块内无法中途纠偏。
  • 依赖 π0 等强骨干:FAST 是 token 化方案,最终能力还受制于 VLA 骨干和数据质量。
  • 通用 tokenizer 的边界:FAST+ 在训练分布内通用,遇到差异极大的新机器人/动作空间仍可能需要适配。

所以这一节是想说:它对平滑动作最灵,但突变动作、量化损失、块内不可纠偏、以及对骨干的依赖是它的边界。


它和别的几篇是什么关系

  • 骨干:π0(Physical Intelligence 的 flow-matching/扩散 VLA)是它结合的对象,π0-FAST 是自回归版本。
  • 对照路线:扩散式 VLA(π0 原版、RDT-1B 等)是它要"用更快更简洁的方式追平"的对手。
  • 自回归 VLA 前辈:RT-2、OpenVLA 等把动作离散成 token 的工作是它改进的对象——FAST 正是给这类方法换上更好的 token。
  • 思想来源:JPEG/MP3 的频率压缩、语言模型的 BPE,是它跨界借来的两大武器。
  • 导读同章:Diffusion Policy、DP3 等是"连续动作生成"这条线的代表,FAST 提供了"离散 token 也能行"的另一种答案。

所以这一节是想说:FAST 站在 RT-2/OpenVLA 的自回归传统上,用信号压缩思想把它救活,并与扩散 VLA 正面竞争。


和本导读的关系

本笔记对应导读 Ch13: Diffusion Policy 与动作生成。Ch13 讲的是机器人"怎么把动作生成出来"这条主线——扩散、flow、自回归 token 等多种路线。FAST 是这条线上非常关键的一块:它证明了"自回归 + 好 token 化"可以在灵巧高频任务上匹敌扩散,而且更快。读完本篇再看同章的 diffusion-policypi0consistency-policy,能理解"连续生成 vs 离散 token"两条动作生成路线的取舍。

所以这一节是想说:把 FAST 放进 Ch13,它代表"离散 token 路线"通过更好的 token 化重新追平扩散路线。


思考题

Q1:为什么"逐维逐时刻分格"在高频任务上信息密度低?举例说明。

提示

50Hz 下相邻帧几乎一样,切出的 token 高度重复。想想"复读一串几乎相同的数字"里有多少真信息。

Q2:DCT 为什么能压缩平滑动作?它和 JPEG 压图片是同一个道理吗?

提示

平滑信号能量集中在低频,少数系数就能描述,高频≈0 可扔。JPEG 也是把图像块 DCT 后扔高频。是同一思想。

Q3:如果一段动作里有夹爪"瞬间张开"这种突变,DCT 压缩可能出什么问题?

提示

突变对应高频成分,若被当冗余扔掉,关键的"瞬间动作"就丢了。想想低频假设何时不成立。

Q4:为什么好的 token 化能让训练快 5 倍?速度从哪来?

提示

token 序列变短 → 自回归要预测的步数少 → 计算和训练都省。想想序列长度对 Transformer 成本的影响。

Q5:FAST(自回归)追平了扩散 VLA,你觉得未来两条路线会怎样共存?

提示

自回归简洁、能复用 LLM 生态、快;扩散在某些连续控制上仍有优势。想想任务性质决定选型,或二者融合。

Q6:把 FAST+ 做成"通用黑盒 tokenizer"有什么工程价值?边界在哪?

提示

跨机器人、跨频率即插即用,省去重调。但训练分布外的新机器人/动作空间可能仍需适配。

Q7:动作 token 化好比给机器人动作"造字典",好字典的标准是什么?

提示

短(序列不长)、密(每 token 信息足)、可逆(能还原动作)、通用(跨任务/机器人)。想想 FAST 各满足了哪些。


一些好奇心问答(FAQ)

Q:FAST 是一个模型还是一种 token 化方法?

主要是一种动作 token 化方法(加上一个通用 tokenizer FAST+)。它本身不是策略,而是给自回归 VLA 提供更好的"动作词表"。

Q:为什么不干脆都用扩散 VLA?

扩散慢、结构复杂,且不能直接复用语言模型的自回归生成机制。FAST 让简洁的自回归路线也能打,兼得效率和生态。

Q:π0-FAST 和 π0 是什么关系?

π0 是骨干 VLA(原版用连续动作生成);π0-FAST 是把动作换成 FAST token 的自回归版本,训练更快、性能持平。

Q:我能直接用 FAST+ 给我的机器人切 token 吗?

作者把 FAST+ 作为通用黑盒 tokenizer 发布,思路上可对多种机器人即插即用;具体到你的动作空间是否在其覆盖范围内,需按项目文档验证。

所以这一节是想说:把 FAST 理解成"给机器人动作造的好字典 + 通用切词器",定位就清楚了。


如果你想再深入

  1. 骨干:π0(Physical Intelligence) — 理解它结合的 VLA 本体。
  2. 自回归 VLA 前辈:RT-2 / OpenVLA — 看它改进的动作 token 传统。
  3. 对照:Diffusion Policy / RDT-1B — 理解扩散动作生成路线。
  4. 压缩基础:DCT(JPEG)/ BPE — 理解它跨界借来的两大武器。
  5. 同章:consistency-policy / flow-policy — 看动作生成的其它加速路线。

所以这一节是想说:把 RT-2/OpenVLA → FAST → π0 → 扩散 VLA 串起来,能看清动作生成两条路线的竞合。


原文信息

  • 标题:FAST: Efficient Action Tokenization for Vision-Language-Action Models
  • 作者:Karl Pertsch, Kyle Stachowicz, Brian Ichter, Danny Driess, Suraj Nair, Quan Vuong, Oier Mees, Chelsea Finn, Sergey Levine
  • 会议:RSS 2025(Physical Intelligence / UC Berkeley / Stanford)
  • arXiv:https://arxiv.org/abs/2501.09747
@inproceedings{pertsch2025fast,
  title     = {FAST: Efficient Action Tokenization for Vision-Language-Action Models},
  author    = {Pertsch, Karl and Stachowicz, Kyle and Ichter, Brian and Driess, Danny and Nair, Suraj and Vuong, Quan and Mees, Oier and Finn, Chelsea and Levine, Sergey},
  booktitle = {Robotics: Science and Systems (RSS)},
  year      = {2025},
  url       = {https://arxiv.org/abs/2501.09747}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_pi0_fast_2026,
  title       = {(readable note) FAST: Efficient Action Tokenization for VLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/pi0-fast/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?