Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 69

OneLLM

14 min read · 4729 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过多模态 AI"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么以前每接一种新感官(声音、点云、脑信号)都要单独造一个专用编码器,而 OneLLM 用一套统一的'万能翻译器'把八种感官都接到了同一个语言模型上"。

一句话讲什么(TL;DR)

一套统一的框架,把图像、音频、视频、点云、深度图、法线图、惯性传感器(IMU)、甚至大脑 fMRI 信号这八种完全不同的感官输入,全都翻译成语言模型能听懂的形式,接到同一个大语言模型上——不再为每一种感官单独造一个专用编码器和专用对齐模块。

所以这一节是想说:这篇论文做的是"一个框架统一对齐八种模态到语言",追求的是通用而非逐个定制。


这是个什么场景

你希望有一个万能助手:你发它一张图,它能看图聊天;你发一段录音,它能听音回答;你给它一段点云(3D 扫描)、一段视频、甚至一段智能手表的运动传感器数据,它都能理解并用语言跟你交流。这就是"多模态大语言模型"的梦想——让一个会说话的 AI 拥有各种各样的感官。

现在的做法很别扭:每接一种新感官,就要单独设计一套"翻译器"。接图像用图像编码器 + 图像对齐模块,接音频用音频编码器 + 音频对齐模块,接点云再来一套……每种模态都要各自的网络、各自的训练。结果是:模态越多,系统越臃肿、越难扩展;而且像脑信号 fMRI、IMU 这种冷门模态,数据少,单独训练效果差。

OneLLM 要问的是:能不能用一套统一的机件,把所有感官都对齐到语言,而不是一种感官造一套?

所以这一节是想说:目标是造一个"通用多模态"的框架,避免"每加一种感官就重造轮子"的臃肿。


OneLLM — 场景示意:这论文要解决的现实问题
Plate Nº IOneLLM — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 每模态一个专用编码器 + 专用投影:如 LLaVA 接图像、各种音频 LLM 接音频。效果好,但不通用——加新模态要从头设计训练,扩展性差。
  • ImageBind 式对齐:ImageBind 学了一个把六种模态绑到图像空间的联合嵌入,很优雅,但它主要做"表示对齐/检索",没直接接到一个能对话的大语言模型上做指令问答
  • AnyMAL 等多模态 LLM:能接多种模态,但仍倾向为不同模态用不同的模态专属编码器,统一程度有限。
  • 冷门模态吃亏:fMRI、IMU 这种数据稀缺的模态,若各自单独训练,很难学好。
  • 共同短板:要么不通用(每模态重造),要么不接语言对话,要么冷门模态没法沾大模态的光。

所以这一节是想说:以前要么每种感官单独造、要么不接对话大模型,缺一个"统一、可扩展、还能让冷门模态搭便车"的框架。


这篇论文的关键想法

OneLLM 的核心洞察:不同模态虽然原始形式千差万别,但可以先各自轻量地转成一串 token,然后用同一个"万能投影模块"把它们都翻译到语言空间。 三个关键设计:

第一,统一的编码 + 万能投影模块(UPM,Universal Projection Module)。 不给每种模态配一个专属的大编码器,而是共享一个统一编码器(基于冻结的 CLIP 视觉 Transformer),再用一个万能投影模块把各模态特征翻译成语言 token。这个 UPM 内部是"多个投影专家(projection experts)的混合"(类似 mixture-of-experts),配一个**路由器(router)**根据输入决定该用哪些专家——所以同一套模块能服务所有模态,而不是每模态一套。

第二,可学习的模态 token(modality tokens)+ 路由。 每种模态有自己的"身份标签"(可学习 token),告诉路由器"这是音频/点云/脑信号",路由器据此动态组合专家。这样统一模块也能照顾到不同模态的差异。

第三,渐进式多模态对齐(progressive alignment)。 不是一口气把八种模态硬塞进去训,而是先用数据最多的图像把框架训好,再逐步把音频、视频、点云、深度/法线、IMU、fMRI 等一个个加进来对齐。这样冷门模态可以搭上图像已经铺好的对齐路,用很少数据也能接上。

所以这一节是想说:核心是"共享编码 + 万能投影专家混合 + 模态 token 路由 + 从图像出发逐步扩展",用一套机件统一八种模态。


OneLLM — 方法示意:核心 pipeline
Plate Nº IIOneLLM — 方法示意:核心 pipeline

它分几步做的(方法)

方法分四块:轻量模态 tokenizer、统一编码器、万能投影模块 UPM(专家 + 路由 + 模态 token)、渐进式对齐训练。逐块按"输入 → 处理 → 输出"讲。

1. 轻量模态 tokenizer:把各种信号先切成 token

输入。 任意一种模态的原始数据(图像像素、音频波形/频谱、点云、视频帧、深度图、IMU 序列、fMRI 信号等)。

处理。 每种模态用一个轻量的 tokenizer(通常就是一层卷积之类的简单模块)把原始信号切成一串 token(一串向量)。注意这里刻意做得很轻——重活留给后面统一的部分,避免"每模态一个大编码器"的臃肿。

token 化(tokenization):把原始信号切成一小格一小格、每格变成一个向量,凑成一串,方便后续用 Transformer 统一处理。

输出。 各模态统一形式的 token 序列。

所以这一节是想说:先用极轻的 tokenizer 把八种信号都变成"一串 token",抹平原始形式的差异。

2. 统一编码器:一个共享的骨干处理所有模态

输入。 各模态的 token 序列。

处理。 所有模态共享同一个统一编码器(基于冻结的 CLIP 视觉 Transformer——CLIP 已经在海量图文上训练过,有很强的通用表示能力)。关键点:不是每模态一个编码器,而是大家复用同一个。这既省参数,也让不同模态的表示落在相近的空间里,便于后面统一对齐。

输出。 各模态经过同一骨干处理后的特征。

所以这一节是想说:用一个共享的(CLIP)编码器处理所有模态,是"统一"的第一层含义。

3. 万能投影模块 UPM:专家混合 + 路由 + 模态 token

这是 OneLLM 的心脏。

类比。 想象一个"万能翻译公司",里面有一群各有专长的翻译(专家)。来了一份稿子,前台(路由器)根据稿子类型(模态 token 标明是音频还是点云)派几个合适的翻译一起处理,最后合成一份语言模型能读的译文。不需要为每种稿子单开一家翻译公司。

输入。 统一编码器输出的模态特征 + 该模态的可学习模态 token。

处理。

  • 投影专家(projection experts):一组把特征翻译到语言空间的子模块。
  • 路由器(router):根据输入(含模态 token)动态决定各专家的权重,把它们的输出加权组合。
  • 模态 token:每种模态的"身份标签",帮路由器识别并做恰当组合。

这样同一个 UPM 就能服务全部八种模态——加新模态时,主要是加一个轻 tokenizer 和一个模态 token,UPM 主体可复用。

输出。 各模态被统一翻译成的"语言 token",可以直接拼进大语言模型的输入。

所以这一节是想说:UPM 用"专家混合 + 路由 + 模态 token"把所有模态统一翻译到语言空间,是 OneLLM 通用性的关键机件。

4. 渐进式对齐训练:从图像出发,逐步纳入八模态

输入。 各模态的"模态-文本"数据(图像-文本、音频-文本、点云-文本等),数据量差异极大(图像多、fMRI 极少)。

处理。

  1. 先用图像把统一编码器 + UPM + LLM 的对齐训练好(图像数据最多,先把主干路修通)。
  2. 逐步加入音频、视频、点云、深度/法线、IMU、fMRI 等模态,让它们对齐到已经建好的语言空间。冷门模态因此能沾图像的光,用少量数据就接上。
  3. 最后用多模态指令数据做指令微调,让模型学会"按人话回答关于各种模态输入的问题"。

输出。 一个统一的多模态大语言模型,能对八种模态输入做语言问答。

下面用 ASCII 图把整体架构画出来:

   图像 ─►轻tokenizer─┐
   音频 ─►轻tokenizer─┤
   视频 ─►轻tokenizer─┤        ┌──────── 万能投影模块 UPM ────────┐
   点云 ─►轻tokenizer─┼─►[共享统一编码器]─► 路由器 ─► [专家1..N]加权─► 语言token ─► 大语言模型 ─► 文字回答
   深度/法线─►tokenizer┤        │            ▲                      │
   IMU  ─►轻tokenizer─┤        │      模态token(身份标签)          │
   fMRI ─►轻tokenizer─┘        └──────────────────────────────────┘

再用一张 ASCII 图看"渐进式对齐"的顺序:

   阶段1: [图像]————————对齐好主干路
   阶段2: [图像 + 音频 + 视频]
   阶段3: [ + 点云 + 深度 + 法线]
   阶段4: [ + IMU + fMRI]  ← 冷门/少数据模态搭便车接入

所以这一整节是想说:OneLLM = 轻 tokenizer + 共享编码器 + 万能投影模块(专家/路由/模态token) + 渐进式对齐,用一套机件把八模态统一接到语言模型。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【OneLLM · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

关键数字(What works)

数字来自论文(arXiv:2312.03700);各基准的具体分数属正文表格,标注"需读原文"。

项目 数值/结论 说明
支持模态数 8 种 图/音/视频/点云/深度/法线/IMU/fMRI
核心机件 一个统一编码器 + 一个 UPM 而非每模态一套
UPM 结构 投影专家混合 + 路由 + 模态 token 通用可扩展
统一编码器 基于冻结 CLIP 复用通用视觉表示
训练策略 渐进式对齐(从图像起) 冷门模态搭便车
评测 多模态问答/描述等多基准 具体分数需读原文

三个要点:第一,"一套机件对齐八模态"是它最大的卖点——把"每模态重造"变成"统一 + 少量增量";第二,渐进式对齐让 fMRI、IMU 这种数据极少的模态也能接入,这是很实际的工程智慧;第三,用冻结 CLIP 当共享编码器既省资源又借用了强表示,体现了"复用地基"的思路。

所以这一节是想说:统一机件 + 渐进对齐 + 复用 CLIP,是 OneLLM 在"通用多模态"上的三个关键选择。


实验结果说明了什么

论文实验主要证明:

  • 统一框架能达到有竞争力的表现:在多个模态的问答/描述任务上,OneLLM 用一套统一框架取得了与专用模型可比甚至更好的结果,证明"通用"不必以"性能大幅牺牲"为代价。
  • 渐进式对齐有效:先图像后其它的训练顺序,让冷门模态用少量数据也能接入并工作,验证了"搭便车"策略。
  • 专家混合 + 路由的价值:统一的 UPM 能兼顾不同模态的差异(消融细节需读原文),说明"一套模块 + 动态路由"比"每模态一套"更划算。
  • 模态可扩展性:框架设计使得加新模态成本较低(主要加轻 tokenizer 和模态 token)。

所以这一节是想说:实验证明"统一框架 + 渐进对齐"既通用又不掉链子,还容易扩展新模态。


你应该懂的几个新词

  • 模态(modality):一种输入形式,如图像、音频、点云、脑信号。多模态即同时处理多种。
  • 多模态大语言模型(MLLM):能接收多种模态输入、用语言输出的大模型。
  • token 化(tokenization):把原始信号切成一串向量,便于统一处理。
  • 统一编码器(unified encoder):所有模态共享的骨干(这里基于冻结 CLIP)。
  • 万能投影模块(UPM):本文核心,把各模态特征翻译到语言空间的统一模块。
  • 专家混合(mixture of experts)/ 路由(router):一组子模块 + 一个动态挑选/加权它们的机制。
  • 模态 token(modality token):每种模态的可学习身份标签,帮路由器识别模态。
  • 渐进式对齐(progressive alignment):从数据最多的模态起,逐步纳入更多模态的训练策略。

所以这一节是想说:统一编码器、UPM、专家路由、渐进对齐是理解本篇的四个关键词。


它有什么搞不定的

  • 通用可能不如极致专用:在某个单一模态上,精心定制的专用模型仍可能更强;OneLLM 换来的是通用性和扩展性。
  • 依赖 CLIP 的视觉偏置:共享编码器基于视觉 CLIP,对与视觉差异极大的模态(如 fMRI、IMU)是否最优,仍值得推敲。
  • 冷门模态数据仍是瓶颈:渐进对齐缓解了数据少的问题,但 fMRI 等模态的绝对数据量极少,能力上限受限。
  • 模态数量增长的可扩展性:八种已很多,但当模态继续增加,路由和专家容量、训练平衡会更复杂。
  • 对齐质量不均:不同模态因数据和难度差异,对齐/理解质量参差不齐。

所以这一节是想说:它以"通用换极致",且受 CLIP 偏置、冷门模态数据量、多模态平衡等限制。


它和别的几篇是什么关系

  • 对齐前辈:ImageBind(把六模态绑到图像空间)是思想近亲,但 OneLLM 更进一步——直接接到会对话的大语言模型上做指令问答。
  • 多模态 LLM 对照:AnyMAL、PandaGPT 等也接多模态,OneLLM 的差异在"统一编码 + 万能投影 + 渐进对齐"的高统一度。
  • 地基:LLaVA 定义了"编码器 + 投影 + LLM"的 VLM 模板,OneLLM 把这个模板从"图像一种"推广到"八种模态一套"。
  • CLIP:作为共享编码器的底座,体现了"复用强视觉表示"的思路。

所以这一节是想说:OneLLM 是"ImageBind 的对齐思想 + LLaVA 的对话模板"的融合与推广,主打统一与可扩展。


和本导读的关系

本笔记对应导读 Ch18: 多模态生态。Ch18 讲的是"如何让一个模型同时理解多种感官",从 ImageBind、AnyMAL 到各种统一表示。OneLLM 是这条线里"用一套框架统一对齐所有模态到语言"的代表,它把"每模态重造"的老路收敛成"统一机件 + 渐进扩展"。读完本篇再看同章的 imagebind(多模态联合嵌入的对齐思想)、3dshape2vecset(3D 表示),能理解"多模态统一"从表示对齐走向对话大模型的演进。

所以这一节是想说:把 OneLLM 放进 Ch18,它代表多模态从"绑定表示"走向"统一接入对话大模型"的一步。


思考题

Q1:为什么"每种模态单独造一个大编码器"扩展性差?OneLLM 怎么解决?

提示

模态越多系统越臃肿、训练越贵。OneLLM 共享统一编码器 + 万能投影模块,加新模态只需轻 tokenizer + 模态 token。

Q2:渐进式对齐为什么要"先图像"?这对 fMRI 这种冷门模态有什么好处?

提示

图像数据最多,先把对齐主干路修通;后加的模态对齐到已建好的语言空间,冷门模态可用少量数据搭便车。

Q3:万能投影模块用"专家混合 + 路由",比"所有模态用同一个固定投影"好在哪?

提示

固定投影难兼顾差异极大的模态;专家混合 + 路由能按模态动态组合,既统一又灵活。

Q4:用冻结的 CLIP 当所有模态的共享编码器,对 IMU、fMRI 这类非视觉模态可能有什么隐患?

提示

CLIP 是视觉训练出来的,其表示偏置未必最适合脑信号或运动序列。想想"复用强表示"和"模态适配"的权衡。

Q5:OneLLM 追求通用,代价可能是单模态性能不如专用模型。你觉得这个取舍值得吗?

提示

看应用:要一个能处理万物的助手,通用更重要;要极致的单模态产品,专用更好。想想通用系统的长期价值。

Q6:如果要给 OneLLM 加第九种模态(比如触觉),你需要做哪些事?

提示

加一个轻 tokenizer、一个模态 token,收集触觉-文本数据,渐进对齐到已有语言空间。想想框架的可扩展性体现在哪。

Q7:ImageBind 把模态绑到图像空间,OneLLM 把模态对齐到语言空间。两种"锚点"各有什么优劣?

提示

图像空间利于检索/表示对齐;语言空间利于对话/指令问答。想想下游任务决定锚点选择。


一些好奇心问答(FAQ)

Q:OneLLM 真能读懂大脑 fMRI 信号?

它能把 fMRI 当作一种模态接入并用语言描述相关内容,但 fMRI 数据极少、噪声大,理解能力有限,更多是展示框架的通用性。

Q:它和 ImageBind 到底差在哪?

ImageBind 学的是"多模态共享嵌入"(主要用于对齐/检索),不直接对话;OneLLM 把多模态接到一个能按指令回答的大语言模型上,重点是"统一 + 对话"。

Q:加新模态真的很省吗?

相对"每模态重造一整套"确实省很多——主要加轻 tokenizer 和模态 token,UPM 和编码器主体可复用。但仍需该模态的对齐数据。

Q:为什么统一编码器要用"冻结"的 CLIP?

冻结能保住 CLIP 已学到的强表示、省训练资源,也让各模态落在相近空间便于对齐。代价是对非视觉模态可能不是最优。

所以这一节是想说:它是"统一 + 可对话 + 易扩展"的多模态框架,冷门模态更多是通用性展示。


如果你想再深入

  1. 对齐思想:ImageBind — 理解多模态联合嵌入的原型。
  2. 对话模板:LLaVA — 理解"编码器 + 投影 + LLM"的 VLM 基本盘。
  3. 专家混合:Mixture-of-Experts 基础 — 理解 UPM 的路由机制。
  4. 底座:CLIP — 理解共享编码器的来源与偏置。
  5. 对照:AnyMAL / PandaGPT — 看其它多模态 LLM 的做法差异。

所以这一节是想说:把 CLIP → ImageBind → LLaVA → OneLLM 串起来,能看清多模态从表示到对话的统一之路。


原文信息

  • 标题:OneLLM: One Framework to Align All Modalities with Language
  • 作者:Jiaming Han, Kaixiong Gong, Yiyuan Zhang, Jiaqi Wang, Kaipeng Zhang, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue
  • 会议:CVPR 2024
  • arXiv:https://arxiv.org/abs/2312.03700
@inproceedings{han2024onellm,
  title     = {OneLLM: One Framework to Align All Modalities with Language},
  author    = {Han, Jiaming and Gong, Kaixiong and Zhang, Yiyuan and Wang, Jiaqi and Zhang, Kaipeng and Lin, Dahua and Qiao, Yu and Gao, Peng and Yue, Xiangyu},
  booktitle = {IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  year      = {2024},
  url       = {https://arxiv.org/abs/2312.03700}
}

引用本笔记 / Cite this note
BibTeX
@online{eai_onellm_2026,
  title       = {(readable note) OneLLM},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/onellm/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?