Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
End-to-End VLA · Plate Nº 122

TinyVLA

12 min read · 4356 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

把会听话的机器人大脑瘦身到约 1.4B,动作生成换成"先乱后凿"的扩散头,不靠云端也能在边缘设备上实时干活。

所以这一节是想说:TinyVLA 是一个"小主干 + 扩散动作头"的 VLA,主打能部署、低延迟。


这是个什么场景

想象你家里有个机器人帮你从冰箱拿可乐。你说"帮我拿一罐冰可乐",它得先看清冰箱里哪个是可乐、不是雪碧,然后控制手臂开门、伸手、抓住、递给你——一整套连续动作。

第一代这种帮手(OpenVLA、RT-2 这类)确实聪明,但它的"大脑"往往装在云端服务器里。每次你下一句指令,机器人都要把摄像头画面 + 你说的话打包发到云上,等服务器算完再把命令传回来。两个麻烦:

  • Wi-Fi 一断,机器人就站那儿发呆。
  • 每个动作都要绕一大圈来回,反应慢、还烧带宽和电费。

TinyVLA(Tiny VLA,迷你版视觉-语言-动作模型)想干的,相当于把这颗大脑瘦身后直接塞进机器人身体里——脑子小了,但因为关键的"动作生成"零件换成了更省力的电路(扩散头),整体活儿没掉太多,反应反而更快。

类比:手机本地小模型 vs 云端 GPT-4。同样的取舍——稍微让一点能力上限,换"随时能用、便宜、低延迟"。

所以这一节是想说:TinyVLA 面对的问题是"大 VLA 部署难、依赖云端、延迟高",它要把大脑塞进机器人本体。


TinyVLA — 场景示意:这论文要解决的现实问题
Plate Nº ITinyVLA — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • RT-2(Google, 2023):把超大 VLM 改造成 VLA,动作离散化成 token 输出。强但巨大、慢,部署难。
  • OpenVLA(2024):开源 7B VLA,用 LLaMA-2 7B 底座 + DINOv2/SigLIP 视觉编码器。能力不错但 7B 在边缘 GPU 上仍偏重。
  • RT-1:早期较小的 Transformer 策略,没有大语言底座,泛化和指令理解弱。
  • 传统 BC / Diffusion Policy:动作生成质量好(尤其 Diffusion Policy),但缺强语言条件化,听不太懂自然语言指令。
  • 共同问题要么大而强但部署难,要么小而轻但语义弱,中间地带没人占。

所以这一节是想说:以前的 VLA 在"能部署"和"听得懂话"之间二选一,TinyVLA 想同时要。


这篇论文的新想法

一个核心判断 + 一个工程选择。

核心判断:VLA 的瓶颈不是"语言理解",而是"在保住语言理解的前提下把动作头做得高效"。换句话说,没必要把 7B 全用来做"画面 → 7 自由度末端位姿"这件低维事,前段语言/视觉用一个相对小的多模态底座就够。

工程选择

  • 小一点的 VLM 底座(约 1.4B),保留语言指令理解和视觉抓取能力。
  • 接一个扩散解码头作为动作专家,专门做连续动作生成。Diffusion Policy 已在动作建模上证明很能打,把它当 VLA 的输出端,比离散化 action token 更自然、更准。
  • 配合参数高效微调,让 1.4B 底座在不算多的机器人数据下学会执行指令。

一句话总结:前端瘦身 + 后端换成扩散,让 VLA 能在边缘端实时跑。

所以这一节是想说:TinyVLA 的新意是"把重活从主干挪到高效的扩散动作头",用小底座保住语义、用扩散头保住动作质量。


它分几步做的(方法)

这一节是全篇核心,拆成"底座、扩散动作头、训练策略、部署"四段。

整体数据流 ASCII 示意:

   图像 ──► 小型 VLM 底座(~1.4B) ─► 条件特征 ┐
   指令 ──►                                    ├─► Diffusion action head ─► 动作 chunk ─► 机器人
   本体状态 ─────────────────────────────────┘         ▲ 从噪声逐步去噪

第 1 步:底座 backbone——脑子的基本盘

输入:一句指令 + 当前画面(+ 本体状态)。

处理:盖楼不重新烧砖,直接买现成预制板——TinyVLA 不从零训大 VLM,而是拿一个已经会看图说话的约 1.4B 量级小型多模态模型当底座,在它头上接东西。这部分消化"指令 + 画面",吐出一组浓缩好的条件特征(可以理解成"现在该干什么"的提示包)。

输出:递给动作头的条件特征。具体用了哪个底座、指标如何需查原文。

等等,先慢一拍——这里的"扩散(Diffusion)"是什么?

想象一张清晰照片被慢慢加雪花点,最后变成纯噪声电视雪花画面。扩散模型干的事正好反过来:教网络从一片雪花里一步步"擦干净",还原出原图。把"原图"换成"一段机器人手臂动作序列",原理一样——从乱糟糟的随机数里逐步雕出一串靠谱动作。

第 2 步:扩散动作头(Diffusion action head)——像雕刻家从黏土里刻出姿态

输入:底座给的条件特征。

处理:把"给定条件 → 输出未来一小段动作 chunk(一次预测几步而非一步)"建模成一个条件扩散过程。训练时把真实动作加噪让网络学去噪;推理时从纯噪声出发逐步去噪到一段干净动作序列。

输出:一段连续、平滑的动作 chunk。这条路子和 Diffusion Policy 一致,区别是条件来自带语言理解的 VLA 底座,所以动作头既听得懂话,又保留扩散在动作平滑、多解上的优势

action chunk(动作块):一次预测未来 N 步动作,而非一步一动。能降低决策频率、抑制误差累积,来自 ACT/Diffusion Policy 的实践。

第 3 步:训练策略——在会做菜的厨师身上加新菜单

输入:"任务指令 + 画面 + 演示动作"三元组,来源覆盖公开机器人数据集和自采任务。

处理:为了不浪费底座的预训练能力,VLM 部分多用 LoRA/适配器这类参数高效微调(PEFT)——只动一小撮参数,省显存又不破坏底座本事。

输出:一个学会执行指令、又保留通用理解的策略。具体配置和规模需查原文。

参数高效微调(PEFT,如 LoRA):只在一小部分参数上学习,省显存、不破坏底座已有知识。

第 4 步:部署——把单反塞进手机壳

输入:训练好的 TinyVLA + 边缘算力平台。

处理:1.4B 比 7B 在消费级 GPU 甚至边缘加速器上塞得更轻松。扩散推理本身比"一步出一个 token"慢,但论文用减少去噪步数(DDIM、consistency 等技巧)把控制频率拉到可接受的实时水平。

输出:一个真能在机器人本体上跑起来的策略。具体频率和硬件平台需查原文。

第 5 步:推理闭环——边走边看的滚动预测

输入:机器人每一时刻的实时画面、本体状态和固定的语言指令。

处理:这一步是把前面几个零件串成真正能干活的闭环,采用"滚动时域"(receding horizon)的做法。模型不是一次性把整条轨迹算死,而是每隔一小段时间就重新看一眼当前画面,用扩散头预测未来一小段动作 chunk,执行其中前几步,然后丢掉剩下的、再重新预测。这样做的好处是:画面里出现意外(物体滑了、人手挡了一下)时,下一轮预测能立刻纠偏,而不会照着一条过时的老计划一头撞下去。因为一次预测覆盖了未来 N 步,即便重新规划的频率不算很高,机器人动作看起来仍是连贯平滑的——这正是 action chunk 与滚动时域配合的价值:用"低频决策 + 每次多步"换来"实时 + 抗误差累积"。

输出:一串随环境实时调整的动作,构成完整的取物、放置等操作流程。具体的重规划频率和每次执行步数需查原文。

所以这一节是想说:TinyVLA 的方法 = 小 VLM 底座保语义 + 扩散头出高质量连续动作 + PEFT 高效训练 + 减步数扩散实时部署 + 滚动时域闭环纠偏,五步一起把"小而能部署"做实。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【TinyVLA · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

TinyVLA — 方法示意:核心 pipeline
Plate Nº IITinyVLA — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体成功率/延迟请查原文,此处不编造。

维度 说明
底座规模 约 1.4B(远小于 OpenVLA 的 7B)
动作生成 条件扩散头 + action chunk
微调方式 参数高效微调(LoRA/适配器)
动作输出 连续末端位姿(非离散 token)
部署目标 边缘设备实时控制
评测 LIBERO / Meta-World 仿真 + 真机任务
核心卖点 接近大模型能力,但可部署、低延迟

关键结论:TinyVLA 想证明"1.4B 量级 + 扩散头这条路是走得通的"——在多数操作任务上接近 OpenVLA,同时参数、显存、延迟有量级优势。

所以这一节是想说:数字告诉我们,把重活挪到扩散头后,小底座也能达到接近大 VLA 的操作能力,而部署成本大幅下降。


实验结果说明了什么

主线回答三个问题:

  1. 能力够不够:在抓取、放置、开抽屉、插入等任务上,能不能接近 OpenVLA 等大模型?
  2. 效率真赢吗:参数量、显存、推理延迟、控制频率相对 7B VLA 是否有量级差异?
  3. 设计成不成立:消融底座大小、是否换扩散头、是否做 PEFT,看每项贡献。

实验涵盖仿真(LIBERO、Meta-World 类)和真机任务,具体清单和成功率需查原文。

所以这一节是想说:实验的意义是证明"小 + 扩散头"这个组合在能力和效率上都站得住,而不只是理论上省。


你应该懂的几个新词

  • VLA:吃"画面 + 指令"、吐"动作"的策略模型。
  • action token:把连续动作离散化成符号 token,让语言模型像生成文字一样"生成动作"(RT-2 路线)。
  • Diffusion Policy:把动作生成建模为去噪过程,擅长处理多模态分布和平滑轨迹。
  • action chunk:一次预测未来 N 步动作,减少决策频次、抑制误差累积。
  • 参数高效微调(PEFT,如 LoRA):只训一小撮参数,省显存、不破坏底座知识。
  • action expert / 解码头:在统一底座上分出来专门负责动作输出的小模块。Pi0、TinyVLA 都是这种"backbone + action head"结构。

所以这一节是想说:这几个词是理解"backbone + action head"这类现代 VLA 架构的通用语。


它有什么搞不定的

  • 扩散推理仍慢于单步:靠减步数硬撑实时,极端高频控制场景可能吃力。
  • 能力上限受小底座限制:复杂长程任务、强泛化不如 7B+ 大 VLA。
  • 多模态是双刃剑:扩散能表达多解是优点,但也可能在需要确定性动作时引入不必要的抖动。
  • 数据依赖:小底座要靠机器人数据学会执行,数据覆盖不足时泛化受限。
  • 减步数技巧有代价:DDIM/consistency 减步会牺牲一点动作质量,是速度和质量的权衡。

所以这一节是想说:TinyVLA 的短板集中在"扩散速度、能力上限、减步数取舍"上——它是效率优先的中量级方案。


它和别的几篇是什么关系

  • vs OpenVLA:同为开源 VLA,但 OpenVLA 是 7B + 离散 action token;TinyVLA 走"小 + 连续扩散",是另一个设计点。
  • vs Pi0 / Pi0.5:Pi 系列也是 VLA + flow/扩散风格动作专家,思路是亲戚;Pi 偏大规模研究,TinyVLA 偏"够用 + 能部署"。
  • vs Diffusion Policy / 3D Diffusion Policy:TinyVLA 的动作头继承自这条线,但加了 VLM 条件化,让"听懂自然语言"成为可能。
  • vs SmolVLA / RoboMamba:同属"把 VLA 做小"路线,可横向对比 backbone 选择、动作头、数据配方的不同取舍。
  • 下游影响:之后一系列"VLA on the edge"工作把 TinyVLA 当小模型 baseline。

所以这一节是想说:TinyVLA 是"VLA 从做大做强转向做小做能部署"这个方向转折的代表作之一。


和本导读的关系

本篇对应导读 Ch12: OpenVLA / VLAs / MLA。Ch12 讲 VLA 的演化,TinyVLA 是"可部署化"这一支的关键节点——它明确论证了"语言不是瓶颈,高效动作头才是关键",并给出了"小底座 + 扩散头"的可行样本。读完本篇,配合同章的 openvla(7B 基准)、smolvla(社区民主化)、robomamba(换线性主干),你能画出"VLA 怎么变得能上机器人本体"的完整分支图。

所以这一节是想说:把 TinyVLA 放进 Ch12 的 VLA 可部署化主线里读,它是"小底座 + 高效动作头"这一格的代表。


思考题

Q1:为什么 TinyVLA 敢把底座缩到 1.4B?它赌的是什么?

提示

赌"VLA 的瓶颈不是语言理解,而是动作生成"。把重活挪到扩散头后,语义/视觉用小底座就够,7B 的容量对"画面→低维动作"这件事是浪费。

Q2:为什么动作头选扩散而不是 RT-2 式的离散 action token?

提示

机器人动作是连续的,扩散能直接建模连续、多模态的动作分布,比先离散化再预测更自然、更精细,尤其在"同一画面多种合理动作"时不会被平均。

Q3:扩散推理天生比单步慢,TinyVLA 怎么保证实时?代价是什么?

提示

用 DDIM/consistency 等技巧减少去噪步数。代价是步数少了动作质量会略降——这是速度和质量的权衡。

Q4:为什么 VLM 部分用 LoRA 而不是全参数微调?

提示

省显存,且只动一小撮参数能保住底座的通用理解不被机器人数据"带偏"(避免灾难性遗忘)。全参微调既贵又容易破坏预训练知识。

Q5:TinyVLA 和 SmolVLA 都是"小 VLA",动作生成一个用扩散、一个用 flow matching,这对实时性有何影响?

提示

flow matching 通常需要更少步数,理论上更快;扩散质量成熟但要减步数硬撑。两者都在"连续动作 + 少步数"上找平衡,是同一矛盾的两种解法。

Q6:如果部署时发现 TinyVLA 动作有轻微抖动,可能的原因和对策是什么?

提示

扩散的多模态性 + 减步数带来的不稳定可能导致抖动。对策:增加去噪步数(牺牲速度)、用 action chunk 平滑、或对输出做时间滤波。

所以这一节是想说:这几个问题带你把"底座取舍、动作生成方式、实时性、微调策略"这些核心权衡自己推一遍。


一些好奇心问答(FAQ)

Q1:TinyVLA 能在什么硬件上跑?

目标是消费级 GPU 甚至边缘加速器。1.4B 比 7B 友好很多,具体平台和帧率看论文报告。

Q2:它比 OpenVLA 弱多少?

在多数常见操作任务上接近,复杂任务上有差距。它换来的是量级级别的效率优势。要具体数字看论文主表。

Q3:为什么不干脆用离散 token 让底座直接吐动作?

那样动作精度和多模态表达不如扩散,且要占用底座容量。TinyVLA 的核心思想就是"把动作这件事交给专门的高效扩散头"。

Q4:TinyVLA 和 Pi0 是一回事吗?

思路是亲戚(都是 backbone + 动作专家),但 Pi 系列规模更大、数据更多、偏研究前沿;TinyVLA 偏"够用 + 能部署"。

Q5:我想复现,从哪开始?

先读 Diffusion Policy 理解扩散动作头,再看 TinyVLA 怎么把条件从"纯视觉"换成"VLM 特征"。

Q6:读完 TinyVLA 接下来看什么?

横向读 SmolVLARoboMamba 对比三条降本路;纵向读 OpenVLA 理解它在省什么。

所以这一节是想说:跑什么硬件、比 OpenVLA 弱多少、怎么复现——这些实操问题都有明确答案。


如果你想再深入

按"基准 → 动作头源头 → 同赛道"排序:

  1. 基准:OpenVLA —— 标准 7B VLA,理解 TinyVLA 在省什么。
  2. 动作头源头:Diffusion Policy —— 扩散动作生成的原型。
  3. 同赛道:SmolVLA / RoboMamba —— 另两条降本路,横向对比。
  4. 亲戚:Pi0 —— backbone + 动作专家的大规模版本。

所以这一节是想说:把 OpenVLA + Diffusion Policy + TinyVLA + SmolVLA 连起来读,就能看懂"高效可部署 VLA"这条线。


原文信息

  • 标题:TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
  • arXiv:https://arxiv.org/abs/2409.12514
  • 期刊:IEEE Robotics and Automation Letters (RA-L)
  • 年份:2024

BibTeX:

@article{wen2024tinyvla,
  title   = {TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation},
  author  = {Wen, Junjie and Zhu, Yichen and others},
  journal = {IEEE Robotics and Automation Letters (RA-L)},
  year    = {2024},
  url     = {https://arxiv.org/abs/2409.12514}
}

所以整篇是想说:TinyVLA 把"语言理解"和"动作生成"这两件事分开对待——用小底座管前者、用高效扩散头管后者,证明了 1.4B 量级的 VLA 也能又听话又能动,还能真正塞进机器人本体。

引用本笔记 / Cite this note
BibTeX
@online{eai_tinyvla_2026,
  title       = {(readable note) TinyVLA},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/tinyvla/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?