Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Imitation Learning · Plate Nº 61

SmolVLA

13 min read · 4482 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

Hugging Face 推出的小型机器人模型:把"看到 + 听到 + 动手"塞进一张游戏显卡就能训的小脑袋,还全部用社区公开数据训练——让没有数据中心的人也能在家玩具身 AI。

所以这一节是想说:SmolVLA 是一个"小、便宜、用公开数据"的开源 VLA,目标是把机器人学习平民化。


这是个什么场景

你跟室友说"帮我把红色那个杯子放抽屉里"。室友要做三件事:眼睛瞄一下杯子在哪、耳朵理解你说的是哪个、手伸过去拿过去放好。看 + 听 + 动手——机器人里就叫 vision、language、action 这三件套,合起来就是 VLA(Vision-Language-Action,视觉-语言-动作模型)

过去能训出这种"听话机器人"的,基本只有顶级玩家:要有后厨(数据中心几百张 H100)、要有独家食材(自家积累的私有数据)、要慢炖几周。普通人想跟着学,连灶台都摸不到。

SmolVLA 想做的事更像给家里塞一台小烤箱:买得起(一张 4090 就够)、放得下(笔记本 GPU 也能跑推理)、菜谱用社区共享的(公开数据集)。烤出来不一定是米其林那个味,但至少"在家就能做"这件事第一次成立了。

消费级 GPU:相对于 H100/A100 这种数据中心卡,指 RTX 4090/3090 这类个人能买到的显卡,显存 24GB 左右。SmolVLA 的核心目标就是"能在这类卡上训和跑"。

所以这一节是想说:SmolVLA 面对的问题是"VLA 太大太贵、数据太封闭,社区玩不起"。


SmolVLA — 场景示意:这论文要解决的现实问题
Plate Nº ISmolVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • RT-2(Google, 2023):把大型 VLM 直接微调成 VLA,规模巨大,需要 Google 内部 TPU 集群,社区无法复现。
  • OpenVLA(2024):开源化尝试,7B 参数,但训练仍需多卡 A100,门槛高。
  • Octo / RT-1 系列:参数较小但架构较复杂,预训练数据也多依赖 Open X-Embodiment 这类聚合数据集,普通人不易直接在自家机械臂上迁移。
  • 共同痛点:模型大 → 推理慢、训练贵、社区难复现;数据封闭 → 没法在自家便宜机械臂上做迁移。

所以这一节是想说:以前的 VLA 要么大到养不起,要么数据封闭,普通开发者被挡在门外。


这篇论文的新想法

核心赌注一句话:别人开五星酒店,我开社区小馆子——食材普通、厨房不大,但街坊都吃得起,味道还过得去。

落到机器人上,就是赌"小而精 + 社区数据,在具身领域也 work"。具体做三件事:

  1. 架构瘦身:像把厚字典抽成口袋本——用小型多模态主干 + 高效动作专家,把 VLA 压到消费级 GPU 能训能跑的规模(约 0.45B 量级)。
  2. 数据民主化:菜谱不锁后厨——训练数据全部来自 LeRobot 社区平台上公开发布的示范片段,不掺私有数据
  3. 保持可用:小馆子也得能上菜——在标准基准和真机上验证,小模型确实能完成抓取、放置、按指令操作。

所以这一节是想说:SmolVLA 的新意不是某个算法突破,而是"把 VLA 的规模和数据门槛一起打下来,还能用"这个系统性选择。


它分几步做的(方法)

这一节是全篇核心,拆成"主干、动作专家、异步推理、社区数据管线"四块。

整体架构 ASCII 示意:

   图像 ──► SmolVLM 视觉主干 ┐
                             ├─► 特征 ─► Action Expert(flow matching) ─► 动作 chunk
   指令 ──► 语言主干 ────────┘                    ▲
   本体状态 ─────────────────────────────────────┘
   推理: 感知/理解(慢) 与 动作生成(快) 异步解耦,控制频率更高

第 1 步:主干——复用 Smol 家族的现成零件

输入:一张(或几张)相机图 + 一句指令 + 机器人当前本体状态(关节角等)。

处理:Hugging Face 已经有 SmolLM 管语言、SmolVLM 管视觉。SmolVLA 直接站在 SmolVLM 这个小型视觉语言模型肩上——它负责消化"画面 + 指令",吐出一组浓缩特征。为了省,SmolVLA 还做了裁剪,比如只保留主干的部分层、减少视觉 token 数量。

输出:一组"现在场景是什么、要干什么"的条件特征,递给动作模块。

第 2 步:动作专家(Action Expert)——把理解翻译成连续动作

输入:主干给的条件特征 + 本体状态。

处理:接一个独立的小型"动作专家"网络,用 flow matching(一种和扩散模型同族的连续生成方法)来生成动作。它一次预测未来一小段动作(action chunk,动作块),而不是只出一步。

输出:一段连续的动作序列,交给机器人执行。

等等,先慢一拍——flow matching 是什么?

想象扩散模型是"从一团雪花噪声一步步擦干净,还原出图像"。flow matching 是它的近亲,但走得更直——它学的是一条"从噪声直奔目标"的平滑路径,通常需要的步数更少,所以生成更快。把"目标"从图像换成"一段机器人动作",原理一样:从随机噪声出发,沿着学好的路径流到一串靠谱动作。

这比 RT-2 那种"把动作切成离散 token 一个个吐"更适合连续动作,也比标准扩散更快——对小模型追求的"能实时跑"很关键。

第 3 步:异步推理——让感知和动作各跑各的

输入:机器人需要高频出动作(否则动作卡顿),但"看懂画面 + 理解指令"是重活、跑得慢。

处理:SmolVLA 把两件事异步解耦——感知/理解模块慢慢更新对世界的理解,动作专家在最新的理解上高频地连续产出动作 chunk,不用每出一步都等主干重新看一遍图。

输出:更高的实际控制频率,让小模型在真机上"跟得上手"。这是 SmolVLA 工程上很重要的一招。

第 4 步:社区数据管线——把散落的社区示范拼成菜谱

输入:LeRobot Hub 上 lerobot 标签下公开共享、许可证兼容的社区数据;官方博客进一步说明,预训练混合数据经人工筛选后聚焦 SO100 机械臂,包含约 487 个高质量数据集、约 1000 万帧。不要把这里泛化成“所有低成本机械臂都进了预训练集”。

处理:清洗这些数据、对齐相机视角、统一动作空间、给缺失的指令补上语言标注。这些是看不见但极费时的"脏活"。

输出:一份可用于预训练的公开社区机器人数据集;它强调可复查和可复现,但能力上限也受公开数据覆盖范围限制。

等等,先慢一拍——flow matching 和扩散到底差在哪?

两者都是"从噪声里生成一段干净动作",但走的路不一样。扩散模型学的是"每一步该去掉多少噪声",推理时要一小步一小步地反复去噪,步数往往几十步起。flow matching(流匹配)学的是一条从噪声直通目标的"流速场"——你可以把它想成:扩散是沿着一条弯弯曲曲的山路慢慢挪下山,而 flow matching 试图学出一条更直的下山路径,因此常常用更少的步数就能到达终点。对 SmolVLA 这种要在便宜硬件上实时出动作的小模型来说,"少几步"直接等于"控制频率更高、更跟得上手"。这也是它没沿用 RT-2 式离散 action token、而选连续流匹配动作专家的深层原因:既要连续动作的精度,又要尽可能快。

所以这一节是想说:SmolVLA 的方法 = 复用 SmolVLM 小主干 + flow matching 动作专家 + 异步推理提速 + 社区数据清洗,四件事一起把"小而能用"变成现实,而选 flow matching 正是为了用更少步数换更高实时性。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【SmolVLA · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

SmolVLA — 方法示意:核心 pipeline
Plate Nº IISmolVLA — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体成功率请查原文,此处不编造。

维度 说明
参数规模 约 0.45B 量级,远小于 OpenVLA 的 7B
训练硬件 目标是单张消费级 GPU(如 RTX 4090)
训练数据 来自许可证兼容、公开共享的 LeRobot 社区数据;官方博客称预训练筛选后聚焦 SO100
动作生成 flow matching + action chunk
推理优化 感知与动作异步解耦,提高控制频率
部署框架 LeRobot,可直接在 SO-100 等低成本臂上跑
定位 accessibility(可及性)优先,而非刷 SOTA

关键结论:SmolVLA 想证明的是"小模型 + 纯公开数据也能达到可用水平",在一些任务上接近甚至打平更大的模型,而训练/部署成本低一个数量级。

所以这一节是想说:数字告诉我们,SmolVLA 用不到 OpenVLA 十分之一的参数,换来了"人人能训能跑"的可及性,代价是能力上限有取舍。


实验结果说明了什么

  • 仿真基准:在 LIBERO / Meta-World 等环境上对比 OpenVLA 等,看任务成功率——验证"小到这个程度还能 work"。
  • 真机迁移:在 SO-100 等社区低成本机械臂上跑 pick-and-place、按指令抓取,看 zero-shot 和 few-shot 表现。
  • 效率:训练成本、推理延迟、控制频率——这是 SmolVLA 的主场。
  • 消融:去掉社区数据 / 换主干 / 改动作专家 / 关掉异步,看每项的贡献。

核心看点是"在什么任务上小模型已经追平大模型,在什么任务上还有差距"——这条边界就是当前"VLA 平民化"能走多远的答案。

所以这一节是想说:实验的意义是标出"小模型可用的边界",让社区知道用 SmolVLA 能做什么、还做不到什么。


你应该懂的几个新词

  • VLA(Vision-Language-Action):吃"图 + 指令"、吐"动作"的端到端机器人模型。
  • 示范数据(demonstration):人通过遥操作控制机械臂完成任务录下的(画面, 指令, 动作)三元组,是模仿学习的食材。
  • action chunk(动作块):一次预测未来 N 步动作,而非一步一动,减少决策频率、提高一致性。
  • flow matching:和扩散同族的连续生成方法,学一条从噪声直奔目标的平滑路径,通常步数更少、更快。
  • 异步推理(asynchronous inference):把慢的感知/理解和快的动作生成解耦,让控制频率更高。
  • LeRobot:Hugging Face 维护的开源机器人学习库 + 数据 hub,是 SmolVLA 的数据来源和部署框架。
  • 消费级 GPU:个人能买的显卡(如 RTX 4090),显存约 24GB。

所以这一节是想说:这几个词是理解"轻量 VLA + 社区生态"的通用语。


它有什么搞不定的

  • 能力上限受限:小模型在复杂长程任务、强泛化上不如大 VLA,这是"小"的固有代价。
  • 依赖社区数据的质量与覆盖:公开数据的任务和物体分布有限,遇到数据没覆盖的场景会掉。
  • 低成本硬件的精度限制:SO-100 这类便宜臂本身重复精度有限,会限制模型表现的天花板。
  • flow matching 仍需多步:虽比扩散快,但比"一步出 token"还是慢,极端实时场景要靠异步和步数裁剪硬撑。
  • 无私有数据是双刃剑:保证了可复现,但也放弃了大厂私有数据带来的能力增益。

所以这一节是想说:SmolVLA 的短板都来自它的定位——为了可及性,主动放弃了规模和私有数据带来的能力上限。


它和别的几篇是什么关系

  • 延续 OpenVLA / RT-2 的 VLA 范式,不是另起炉灶。
  • 同属 Smol 家族:跟 SmolLM、SmolVLM 一脉相承,Hugging Face 把"小模型也能 work"从 NLP 扩到 vision 再扩到 robotics。
  • 和 LeRobot 深度绑定:既是 LeRobot 的旗舰模型,也是其数据集的消费者,互相成就。
  • 对照大型 VLA(π0、RDT-1B):那条线追 SOTA,SmolVLA 追可及性。
  • 降本路线邻居:和 TinyVLA(缩小 + Diffusion 头)、RoboMamba(换线性主干)是三种不同的"把 VLA 做小"思路,值得横向对比。
  • 硬件呼应:和 ALOHA / DexCap 等廉价硬件路线在"模型侧"对应——硬件下沉了,模型也得下沉。

所以这一节是想说:SmolVLA 是"VLA 平民化"这条线的旗手,和 TinyVLA、RoboMamba 共同定义了"小 VLA"的设计空间。


和本导读的关系

本篇对应导读 Ch14: 模仿学习Ch12: OpenVLA / VLAs / MLA。Ch14 强调数据是模仿学习的命脉,SmolVLA 正是"用社区公开数据把 VLA 训起来"的实证;Ch12 讲 VLA 的演化,SmolVLA 是这条线上"可及性"分支的代表。读完本篇,配合同章的 openvla(大基准)、tinyvla(另一条降本路),能理解"VLA 怎么从实验室走进社区"。

所以这一节是想说:把 SmolVLA 放进 Ch12/Ch14 的 VLA + 模仿学习主线里读,它是"平民化"这一格的答案。


思考题

Q1:SmolVLA 为什么选 flow matching 做动作生成,而不是 RT-2 式的离散 action token?

提示

机器人动作是连续的。flow matching 直接建模连续动作分布,能表达多模态且比离散化更精细;相比标准扩散又更快,适合小模型追求的实时性。

Q2:异步推理为什么能显著提高控制频率?它的代价是什么?

提示

因为不用每出一步动作都等慢的感知模块重新跑一遍。代价是动作可能基于"稍旧一点"的场景理解,在场景剧烈变化时可能反应稍慢。

Q3:只用社区公开数据训练,对模型能力和可复现性各有什么影响?

提示

可复现性拉满(谁都能拿到同样数据重跑);但能力受限于公开数据的任务/物体覆盖,遇到数据外的场景会掉。这是一个"可及性 vs 上限"的取舍。

Q4:SmolVLA、TinyVLA、RoboMamba 都在"把 VLA 做小",它们的核心手段有何不同?

提示

SmolVLA:小主干 + flow matching 动作专家 + 异步 + 社区数据;TinyVLA:缩小 VLM + Diffusion 动作头;RoboMamba:直接把主干换成线性的 Mamba。分别从"缩规模""换动作头""换主干"三个角度切。

Q5:如果你在自己的 SO-100 上跑 SmolVLA 效果不好,最先该怀疑哪几件事?

提示

相机视角/标定是否和训练数据一致、动作空间是否对齐、任务是否在训练数据覆盖范围内、硬件重复精度是否够。数据分布不匹配通常是头号原因。

Q6:把 SmolVLA 的动作专家换成更强但更慢的扩散头,会带来什么权衡?

提示

动作质量/多模态可能更好,但推理变慢,可能吃掉异步推理省下的控制频率,在实时任务上得不偿失。小模型的核心矛盾就是"能力 vs 速度"。

所以这一节是想说:这几个问题带你把"动作生成方式、异步、数据来源、降本路线对比"这些核心权衡自己推一遍。


一些好奇心问答(FAQ)

Q1:我真的能用一张 4090 训 SmolVLA 吗?

这是它的设计目标。约 0.45B 的规模 + LeRobot 的训练脚本,让单张消费级 GPU 微调成为可能。从零大规模预训练仍需更多算力,但社区微调门槛很低。

Q2:需要买机器人才能玩吗?

推理和仿真评测不需要真机。想真机体验,SO-100 这类臂一两千块就能搭,配 LeRobot 是官方推荐路径。

Q3:SmolVLA 和 OpenVLA 谁更强?

OpenVLA 规模大、能力上限高;SmolVLA 小、便宜、可及。在数据覆盖的任务上 SmolVLA 可接近,复杂任务上 OpenVLA 占优。选哪个看你更缺算力还是更缺能力。

Q4:数据从哪来?我能贡献吗?

来自 LeRobot Hub。你也能用自己的机械臂录数据、上传,反哺社区——这正是 SmolVLA 生态想推动的循环。

Q5:flow matching 比扩散好在哪?

主要是快——通常需要的采样步数更少。对小模型的实时控制是关键优势。质量上两者接近。

Q6:读完 SmolVLA 接下来看什么?

横向读 TinyVLARoboMamba 对比三条降本路;纵向读 OpenVLA 理解它站在谁肩上。

所以这一节是想说:能不能训、要不要买机器人、和 OpenVLA 怎么选、数据哪来——这些实操问题都有明确答案,门槛真的低。


如果你想再深入

按"前置 → 同赛道 → 生态"排序:

  1. 前置:OpenVLA —— 标准 VLA 长什么样,理解 SmolVLA 在省什么。
  2. 同赛道:TinyVLA / RoboMamba —— 另两条降本路,横向对比最能看清取舍。
  3. 生态:LeRobot 文档 + SmolVLM 模型卡 —— 理解它复用了什么、部署链路长什么样。
  4. 动作生成:flow matching / Diffusion Policy —— 补动作生成方法的背景。

所以这一节是想说:把 OpenVLA + SmolVLA + TinyVLA + RoboMamba 连起来读,就能看懂"VLA 从大到小"的完整光谱。


原文信息

BibTeX:

@article{shukor2025smolvla,
  title   = {SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics},
  author  = {Shukor, Mustafa and others},
  journal = {arXiv preprint arXiv:2506.01844},
  year    = {2025},
  url     = {https://arxiv.org/abs/2506.01844}
}

所以整篇是想说:SmolVLA 用"小主干 + flow matching + 异步 + 纯社区数据"证明了——玩具身 AI 不一定要数据中心,一张游戏显卡 + 一个几千块的机械臂,普通人也能上桌。

引用本笔记 / Cite this note
BibTeX
@online{eai_smolvla_2026,
  title       = {(readable note) SmolVLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2025 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/smolvla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?