SmolVLA
这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。
一句话讲什么(TL;DR)
Hugging Face 推出的小型机器人模型:把"看到 + 听到 + 动手"塞进一张游戏显卡就能训的小脑袋,还全部用社区公开数据训练——让没有数据中心的人也能在家玩具身 AI。
所以这一节是想说:SmolVLA 是一个"小、便宜、用公开数据"的开源 VLA,目标是把机器人学习平民化。
这是个什么场景
你跟室友说"帮我把红色那个杯子放抽屉里"。室友要做三件事:眼睛瞄一下杯子在哪、耳朵理解你说的是哪个、手伸过去拿过去放好。看 + 听 + 动手——机器人里就叫 vision、language、action 这三件套,合起来就是 VLA(Vision-Language-Action,视觉-语言-动作模型)。
过去能训出这种"听话机器人"的,基本只有顶级玩家:要有后厨(数据中心几百张 H100)、要有独家食材(自家积累的私有数据)、要慢炖几周。普通人想跟着学,连灶台都摸不到。
SmolVLA 想做的事更像给家里塞一台小烤箱:买得起(一张 4090 就够)、放得下(笔记本 GPU 也能跑推理)、菜谱用社区共享的(公开数据集)。烤出来不一定是米其林那个味,但至少"在家就能做"这件事第一次成立了。
消费级 GPU:相对于 H100/A100 这种数据中心卡,指 RTX 4090/3090 这类个人能买到的显卡,显存 24GB 左右。SmolVLA 的核心目标就是"能在这类卡上训和跑"。
所以这一节是想说:SmolVLA 面对的问题是"VLA 太大太贵、数据太封闭,社区玩不起"。

之前的人怎么做的,为什么不够好
- RT-2(Google, 2023):把大型 VLM 直接微调成 VLA,规模巨大,需要 Google 内部 TPU 集群,社区无法复现。
- OpenVLA(2024):开源化尝试,7B 参数,但训练仍需多卡 A100,门槛高。
- Octo / RT-1 系列:参数较小但架构较复杂,预训练数据也多依赖 Open X-Embodiment 这类聚合数据集,普通人不易直接在自家机械臂上迁移。
- 共同痛点:模型大 → 推理慢、训练贵、社区难复现;数据封闭 → 没法在自家便宜机械臂上做迁移。
所以这一节是想说:以前的 VLA 要么大到养不起,要么数据封闭,普通开发者被挡在门外。
这篇论文的新想法
核心赌注一句话:别人开五星酒店,我开社区小馆子——食材普通、厨房不大,但街坊都吃得起,味道还过得去。
落到机器人上,就是赌"小而精 + 社区数据,在具身领域也 work"。具体做三件事:
- 架构瘦身:像把厚字典抽成口袋本——用小型多模态主干 + 高效动作专家,把 VLA 压到消费级 GPU 能训能跑的规模(约 0.45B 量级)。
- 数据民主化:菜谱不锁后厨——训练数据全部来自 LeRobot 社区平台上公开发布的示范片段,不掺私有数据。
- 保持可用:小馆子也得能上菜——在标准基准和真机上验证,小模型确实能完成抓取、放置、按指令操作。
所以这一节是想说:SmolVLA 的新意不是某个算法突破,而是"把 VLA 的规模和数据门槛一起打下来,还能用"这个系统性选择。
它分几步做的(方法)
这一节是全篇核心,拆成"主干、动作专家、异步推理、社区数据管线"四块。
整体架构 ASCII 示意:
图像 ──► SmolVLM 视觉主干 ┐
├─► 特征 ─► Action Expert(flow matching) ─► 动作 chunk
指令 ──► 语言主干 ────────┘ ▲
本体状态 ─────────────────────────────────────┘
推理: 感知/理解(慢) 与 动作生成(快) 异步解耦,控制频率更高
第 1 步:主干——复用 Smol 家族的现成零件
输入:一张(或几张)相机图 + 一句指令 + 机器人当前本体状态(关节角等)。
处理:Hugging Face 已经有 SmolLM 管语言、SmolVLM 管视觉。SmolVLA 直接站在 SmolVLM 这个小型视觉语言模型肩上——它负责消化"画面 + 指令",吐出一组浓缩特征。为了省,SmolVLA 还做了裁剪,比如只保留主干的部分层、减少视觉 token 数量。
输出:一组"现在场景是什么、要干什么"的条件特征,递给动作模块。
第 2 步:动作专家(Action Expert)——把理解翻译成连续动作
输入:主干给的条件特征 + 本体状态。
处理:接一个独立的小型"动作专家"网络,用 flow matching(一种和扩散模型同族的连续生成方法)来生成动作。它一次预测未来一小段动作(action chunk,动作块),而不是只出一步。
输出:一段连续的动作序列,交给机器人执行。
等等,先慢一拍——flow matching 是什么?
想象扩散模型是"从一团雪花噪声一步步擦干净,还原出图像"。flow matching 是它的近亲,但走得更直——它学的是一条"从噪声直奔目标"的平滑路径,通常需要的步数更少,所以生成更快。把"目标"从图像换成"一段机器人动作",原理一样:从随机噪声出发,沿着学好的路径流到一串靠谱动作。
这比 RT-2 那种"把动作切成离散 token 一个个吐"更适合连续动作,也比标准扩散更快——对小模型追求的"能实时跑"很关键。
第 3 步:异步推理——让感知和动作各跑各的
输入:机器人需要高频出动作(否则动作卡顿),但"看懂画面 + 理解指令"是重活、跑得慢。
处理:SmolVLA 把两件事异步解耦——感知/理解模块慢慢更新对世界的理解,动作专家在最新的理解上高频地连续产出动作 chunk,不用每出一步都等主干重新看一遍图。
输出:更高的实际控制频率,让小模型在真机上"跟得上手"。这是 SmolVLA 工程上很重要的一招。
第 4 步:社区数据管线——把散落的社区示范拼成菜谱
输入:LeRobot Hub 上 lerobot 标签下公开共享、许可证兼容的社区数据;官方博客进一步说明,预训练混合数据经人工筛选后聚焦 SO100 机械臂,包含约 487 个高质量数据集、约 1000 万帧。不要把这里泛化成“所有低成本机械臂都进了预训练集”。
处理:清洗这些数据、对齐相机视角、统一动作空间、给缺失的指令补上语言标注。这些是看不见但极费时的"脏活"。
输出:一份可用于预训练的公开社区机器人数据集;它强调可复查和可复现,但能力上限也受公开数据覆盖范围限制。
等等,先慢一拍——flow matching 和扩散到底差在哪?
两者都是"从噪声里生成一段干净动作",但走的路不一样。扩散模型学的是"每一步该去掉多少噪声",推理时要一小步一小步地反复去噪,步数往往几十步起。flow matching(流匹配)学的是一条从噪声直通目标的"流速场"——你可以把它想成:扩散是沿着一条弯弯曲曲的山路慢慢挪下山,而 flow matching 试图学出一条更直的下山路径,因此常常用更少的步数就能到达终点。对 SmolVLA 这种要在便宜硬件上实时出动作的小模型来说,"少几步"直接等于"控制频率更高、更跟得上手"。这也是它没沿用 RT-2 式离散 action token、而选连续流匹配动作专家的深层原因:既要连续动作的精度,又要尽可能快。
所以这一节是想说:SmolVLA 的方法 = 复用 SmolVLM 小主干 + flow matching 动作专家 + 异步推理提速 + 社区数据清洗,四件事一起把"小而能用"变成现实,而选 flow matching 正是为了用更少步数换更高实时性。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【SmolVLA · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
下表整理关键设定与定性结论;具体成功率请查原文,此处不编造。
| 维度 | 说明 |
|---|---|
| 参数规模 | 约 0.45B 量级,远小于 OpenVLA 的 7B |
| 训练硬件 | 目标是单张消费级 GPU(如 RTX 4090) |
| 训练数据 | 来自许可证兼容、公开共享的 LeRobot 社区数据;官方博客称预训练筛选后聚焦 SO100 |
| 动作生成 | flow matching + action chunk |
| 推理优化 | 感知与动作异步解耦,提高控制频率 |
| 部署框架 | LeRobot,可直接在 SO-100 等低成本臂上跑 |
| 定位 | accessibility(可及性)优先,而非刷 SOTA |
关键结论:SmolVLA 想证明的是"小模型 + 纯公开数据也能达到可用水平",在一些任务上接近甚至打平更大的模型,而训练/部署成本低一个数量级。
所以这一节是想说:数字告诉我们,SmolVLA 用不到 OpenVLA 十分之一的参数,换来了"人人能训能跑"的可及性,代价是能力上限有取舍。
实验结果说明了什么
- 仿真基准:在 LIBERO / Meta-World 等环境上对比 OpenVLA 等,看任务成功率——验证"小到这个程度还能 work"。
- 真机迁移:在 SO-100 等社区低成本机械臂上跑 pick-and-place、按指令抓取,看 zero-shot 和 few-shot 表现。
- 效率:训练成本、推理延迟、控制频率——这是 SmolVLA 的主场。
- 消融:去掉社区数据 / 换主干 / 改动作专家 / 关掉异步,看每项的贡献。
核心看点是"在什么任务上小模型已经追平大模型,在什么任务上还有差距"——这条边界就是当前"VLA 平民化"能走多远的答案。
所以这一节是想说:实验的意义是标出"小模型可用的边界",让社区知道用 SmolVLA 能做什么、还做不到什么。
你应该懂的几个新词
- VLA(Vision-Language-Action):吃"图 + 指令"、吐"动作"的端到端机器人模型。
- 示范数据(demonstration):人通过遥操作控制机械臂完成任务录下的(画面, 指令, 动作)三元组,是模仿学习的食材。
- action chunk(动作块):一次预测未来 N 步动作,而非一步一动,减少决策频率、提高一致性。
- flow matching:和扩散同族的连续生成方法,学一条从噪声直奔目标的平滑路径,通常步数更少、更快。
- 异步推理(asynchronous inference):把慢的感知/理解和快的动作生成解耦,让控制频率更高。
- LeRobot:Hugging Face 维护的开源机器人学习库 + 数据 hub,是 SmolVLA 的数据来源和部署框架。
- 消费级 GPU:个人能买的显卡(如 RTX 4090),显存约 24GB。
所以这一节是想说:这几个词是理解"轻量 VLA + 社区生态"的通用语。
它有什么搞不定的
- 能力上限受限:小模型在复杂长程任务、强泛化上不如大 VLA,这是"小"的固有代价。
- 依赖社区数据的质量与覆盖:公开数据的任务和物体分布有限,遇到数据没覆盖的场景会掉。
- 低成本硬件的精度限制:SO-100 这类便宜臂本身重复精度有限,会限制模型表现的天花板。
- flow matching 仍需多步:虽比扩散快,但比"一步出 token"还是慢,极端实时场景要靠异步和步数裁剪硬撑。
- 无私有数据是双刃剑:保证了可复现,但也放弃了大厂私有数据带来的能力增益。
所以这一节是想说:SmolVLA 的短板都来自它的定位——为了可及性,主动放弃了规模和私有数据带来的能力上限。
它和别的几篇是什么关系
- 延续 OpenVLA / RT-2 的 VLA 范式,不是另起炉灶。
- 同属 Smol 家族:跟 SmolLM、SmolVLM 一脉相承,Hugging Face 把"小模型也能 work"从 NLP 扩到 vision 再扩到 robotics。
- 和 LeRobot 深度绑定:既是 LeRobot 的旗舰模型,也是其数据集的消费者,互相成就。
- 对照大型 VLA(π0、RDT-1B):那条线追 SOTA,SmolVLA 追可及性。
- 降本路线邻居:和 TinyVLA(缩小 + Diffusion 头)、RoboMamba(换线性主干)是三种不同的"把 VLA 做小"思路,值得横向对比。
- 硬件呼应:和 ALOHA / DexCap 等廉价硬件路线在"模型侧"对应——硬件下沉了,模型也得下沉。
所以这一节是想说:SmolVLA 是"VLA 平民化"这条线的旗手,和 TinyVLA、RoboMamba 共同定义了"小 VLA"的设计空间。
和本导读的关系
本篇对应导读 Ch14: 模仿学习 与 Ch12: OpenVLA / VLAs / MLA。Ch14 强调数据是模仿学习的命脉,SmolVLA 正是"用社区公开数据把 VLA 训起来"的实证;Ch12 讲 VLA 的演化,SmolVLA 是这条线上"可及性"分支的代表。读完本篇,配合同章的 openvla(大基准)、tinyvla(另一条降本路),能理解"VLA 怎么从实验室走进社区"。
所以这一节是想说:把 SmolVLA 放进 Ch12/Ch14 的 VLA + 模仿学习主线里读,它是"平民化"这一格的答案。
思考题
Q1:SmolVLA 为什么选 flow matching 做动作生成,而不是 RT-2 式的离散 action token?
提示
机器人动作是连续的。flow matching 直接建模连续动作分布,能表达多模态且比离散化更精细;相比标准扩散又更快,适合小模型追求的实时性。
Q2:异步推理为什么能显著提高控制频率?它的代价是什么?
提示
因为不用每出一步动作都等慢的感知模块重新跑一遍。代价是动作可能基于"稍旧一点"的场景理解,在场景剧烈变化时可能反应稍慢。
Q3:只用社区公开数据训练,对模型能力和可复现性各有什么影响?
提示
可复现性拉满(谁都能拿到同样数据重跑);但能力受限于公开数据的任务/物体覆盖,遇到数据外的场景会掉。这是一个"可及性 vs 上限"的取舍。
Q4:SmolVLA、TinyVLA、RoboMamba 都在"把 VLA 做小",它们的核心手段有何不同?
提示
SmolVLA:小主干 + flow matching 动作专家 + 异步 + 社区数据;TinyVLA:缩小 VLM + Diffusion 动作头;RoboMamba:直接把主干换成线性的 Mamba。分别从"缩规模""换动作头""换主干"三个角度切。
Q5:如果你在自己的 SO-100 上跑 SmolVLA 效果不好,最先该怀疑哪几件事?
提示
相机视角/标定是否和训练数据一致、动作空间是否对齐、任务是否在训练数据覆盖范围内、硬件重复精度是否够。数据分布不匹配通常是头号原因。
Q6:把 SmolVLA 的动作专家换成更强但更慢的扩散头,会带来什么权衡?
提示
动作质量/多模态可能更好,但推理变慢,可能吃掉异步推理省下的控制频率,在实时任务上得不偿失。小模型的核心矛盾就是"能力 vs 速度"。
所以这一节是想说:这几个问题带你把"动作生成方式、异步、数据来源、降本路线对比"这些核心权衡自己推一遍。
一些好奇心问答(FAQ)
Q1:我真的能用一张 4090 训 SmolVLA 吗?
这是它的设计目标。约 0.45B 的规模 + LeRobot 的训练脚本,让单张消费级 GPU 微调成为可能。从零大规模预训练仍需更多算力,但社区微调门槛很低。
Q2:需要买机器人才能玩吗?
推理和仿真评测不需要真机。想真机体验,SO-100 这类臂一两千块就能搭,配 LeRobot 是官方推荐路径。
Q3:SmolVLA 和 OpenVLA 谁更强?
OpenVLA 规模大、能力上限高;SmolVLA 小、便宜、可及。在数据覆盖的任务上 SmolVLA 可接近,复杂任务上 OpenVLA 占优。选哪个看你更缺算力还是更缺能力。
Q4:数据从哪来?我能贡献吗?
来自 LeRobot Hub。你也能用自己的机械臂录数据、上传,反哺社区——这正是 SmolVLA 生态想推动的循环。
Q5:flow matching 比扩散好在哪?
主要是快——通常需要的采样步数更少。对小模型的实时控制是关键优势。质量上两者接近。
Q6:读完 SmolVLA 接下来看什么?
横向读 TinyVLA 和 RoboMamba 对比三条降本路;纵向读 OpenVLA 理解它站在谁肩上。
所以这一节是想说:能不能训、要不要买机器人、和 OpenVLA 怎么选、数据哪来——这些实操问题都有明确答案,门槛真的低。
如果你想再深入
按"前置 → 同赛道 → 生态"排序:
- 前置:OpenVLA —— 标准 VLA 长什么样,理解 SmolVLA 在省什么。
- 同赛道:TinyVLA / RoboMamba —— 另两条降本路,横向对比最能看清取舍。
- 生态:LeRobot 文档 + SmolVLM 模型卡 —— 理解它复用了什么、部署链路长什么样。
- 动作生成:flow matching / Diffusion Policy —— 补动作生成方法的背景。
所以这一节是想说:把 OpenVLA + SmolVLA + TinyVLA + RoboMamba 连起来读,就能看懂"VLA 从大到小"的完整光谱。
原文信息
- 标题:SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- arXiv:https://arxiv.org/abs/2506.01844
- 官方博客:https://huggingface.co/blog/smolvla
- 发表:Hugging Face(arXiv, 2025)
- 年份:2025
BibTeX:
@article{shukor2025smolvla,
title = {SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics},
author = {Shukor, Mustafa and others},
journal = {arXiv preprint arXiv:2506.01844},
year = {2025},
url = {https://arxiv.org/abs/2506.01844}
}
所以整篇是想说:SmolVLA 用"小主干 + flow matching + 异步 + 纯社区数据"证明了——玩具身 AI 不一定要数据中心,一张游戏显卡 + 一个几千块的机械臂,普通人也能上桌。
◼
引用本笔记 / Cite this note
@online{eai_smolvla_2026,
title = {(readable note) SmolVLA},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2025 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/smolvla/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?