OneLLM
这是一份写给"完全没接触过多模态 AI"的读者的精读笔记。全程类比、术语先定义。读完你能讲清"为什么以前每接一种新感官(声音、点云、脑信号)都要单独造一个专用编码器,而 OneLLM 用一套统一的'万能翻译器'把八种感官都接到了同一个语言模型上"。
一句话讲什么(TL;DR)
用一套统一的框架,把图像、音频、视频、点云、深度图、法线图、惯性传感器(IMU)、甚至大脑 fMRI 信号这八种完全不同的感官输入,全都翻译成语言模型能听懂的形式,接到同一个大语言模型上——不再为每一种感官单独造一个专用编码器和专用对齐模块。
所以这一节是想说:这篇论文做的是"一个框架统一对齐八种模态到语言",追求的是通用而非逐个定制。
这是个什么场景
你希望有一个万能助手:你发它一张图,它能看图聊天;你发一段录音,它能听音回答;你给它一段点云(3D 扫描)、一段视频、甚至一段智能手表的运动传感器数据,它都能理解并用语言跟你交流。这就是"多模态大语言模型"的梦想——让一个会说话的 AI 拥有各种各样的感官。
现在的做法很别扭:每接一种新感官,就要单独设计一套"翻译器"。接图像用图像编码器 + 图像对齐模块,接音频用音频编码器 + 音频对齐模块,接点云再来一套……每种模态都要各自的网络、各自的训练。结果是:模态越多,系统越臃肿、越难扩展;而且像脑信号 fMRI、IMU 这种冷门模态,数据少,单独训练效果差。
OneLLM 要问的是:能不能用一套统一的机件,把所有感官都对齐到语言,而不是一种感官造一套?
所以这一节是想说:目标是造一个"通用多模态"的框架,避免"每加一种感官就重造轮子"的臃肿。

之前的人怎么做的,为什么不够好
- 每模态一个专用编码器 + 专用投影:如 LLaVA 接图像、各种音频 LLM 接音频。效果好,但不通用——加新模态要从头设计训练,扩展性差。
- ImageBind 式对齐:ImageBind 学了一个把六种模态绑到图像空间的联合嵌入,很优雅,但它主要做"表示对齐/检索",没直接接到一个能对话的大语言模型上做指令问答。
- AnyMAL 等多模态 LLM:能接多种模态,但仍倾向为不同模态用不同的模态专属编码器,统一程度有限。
- 冷门模态吃亏:fMRI、IMU 这种数据稀缺的模态,若各自单独训练,很难学好。
- 共同短板:要么不通用(每模态重造),要么不接语言对话,要么冷门模态没法沾大模态的光。
所以这一节是想说:以前要么每种感官单独造、要么不接对话大模型,缺一个"统一、可扩展、还能让冷门模态搭便车"的框架。
这篇论文的关键想法
OneLLM 的核心洞察:不同模态虽然原始形式千差万别,但可以先各自轻量地转成一串 token,然后用同一个"万能投影模块"把它们都翻译到语言空间。 三个关键设计:
第一,统一的编码 + 万能投影模块(UPM,Universal Projection Module)。 不给每种模态配一个专属的大编码器,而是共享一个统一编码器(基于冻结的 CLIP 视觉 Transformer),再用一个万能投影模块把各模态特征翻译成语言 token。这个 UPM 内部是"多个投影专家(projection experts)的混合"(类似 mixture-of-experts),配一个**路由器(router)**根据输入决定该用哪些专家——所以同一套模块能服务所有模态,而不是每模态一套。
第二,可学习的模态 token(modality tokens)+ 路由。 每种模态有自己的"身份标签"(可学习 token),告诉路由器"这是音频/点云/脑信号",路由器据此动态组合专家。这样统一模块也能照顾到不同模态的差异。
第三,渐进式多模态对齐(progressive alignment)。 不是一口气把八种模态硬塞进去训,而是先用数据最多的图像把框架训好,再逐步把音频、视频、点云、深度/法线、IMU、fMRI 等一个个加进来对齐。这样冷门模态可以搭上图像已经铺好的对齐路,用很少数据也能接上。
所以这一节是想说:核心是"共享编码 + 万能投影专家混合 + 模态 token 路由 + 从图像出发逐步扩展",用一套机件统一八种模态。

它分几步做的(方法)
方法分四块:轻量模态 tokenizer、统一编码器、万能投影模块 UPM(专家 + 路由 + 模态 token)、渐进式对齐训练。逐块按"输入 → 处理 → 输出"讲。
1. 轻量模态 tokenizer:把各种信号先切成 token
输入。 任意一种模态的原始数据(图像像素、音频波形/频谱、点云、视频帧、深度图、IMU 序列、fMRI 信号等)。
处理。 每种模态用一个轻量的 tokenizer(通常就是一层卷积之类的简单模块)把原始信号切成一串 token(一串向量)。注意这里刻意做得很轻——重活留给后面统一的部分,避免"每模态一个大编码器"的臃肿。
token 化(tokenization):把原始信号切成一小格一小格、每格变成一个向量,凑成一串,方便后续用 Transformer 统一处理。
输出。 各模态统一形式的 token 序列。
所以这一节是想说:先用极轻的 tokenizer 把八种信号都变成"一串 token",抹平原始形式的差异。
2. 统一编码器:一个共享的骨干处理所有模态
输入。 各模态的 token 序列。
处理。 所有模态共享同一个统一编码器(基于冻结的 CLIP 视觉 Transformer——CLIP 已经在海量图文上训练过,有很强的通用表示能力)。关键点:不是每模态一个编码器,而是大家复用同一个。这既省参数,也让不同模态的表示落在相近的空间里,便于后面统一对齐。
输出。 各模态经过同一骨干处理后的特征。
所以这一节是想说:用一个共享的(CLIP)编码器处理所有模态,是"统一"的第一层含义。
3. 万能投影模块 UPM:专家混合 + 路由 + 模态 token
这是 OneLLM 的心脏。
类比。 想象一个"万能翻译公司",里面有一群各有专长的翻译(专家)。来了一份稿子,前台(路由器)根据稿子类型(模态 token 标明是音频还是点云)派几个合适的翻译一起处理,最后合成一份语言模型能读的译文。不需要为每种稿子单开一家翻译公司。
输入。 统一编码器输出的模态特征 + 该模态的可学习模态 token。
处理。
- 投影专家(projection experts):一组把特征翻译到语言空间的子模块。
- 路由器(router):根据输入(含模态 token)动态决定各专家的权重,把它们的输出加权组合。
- 模态 token:每种模态的"身份标签",帮路由器识别并做恰当组合。
这样同一个 UPM 就能服务全部八种模态——加新模态时,主要是加一个轻 tokenizer 和一个模态 token,UPM 主体可复用。
输出。 各模态被统一翻译成的"语言 token",可以直接拼进大语言模型的输入。
所以这一节是想说:UPM 用"专家混合 + 路由 + 模态 token"把所有模态统一翻译到语言空间,是 OneLLM 通用性的关键机件。
4. 渐进式对齐训练:从图像出发,逐步纳入八模态
输入。 各模态的"模态-文本"数据(图像-文本、音频-文本、点云-文本等),数据量差异极大(图像多、fMRI 极少)。
处理。
- 先用图像把统一编码器 + UPM + LLM 的对齐训练好(图像数据最多,先把主干路修通)。
- 逐步加入音频、视频、点云、深度/法线、IMU、fMRI 等模态,让它们对齐到已经建好的语言空间。冷门模态因此能沾图像的光,用少量数据就接上。
- 最后用多模态指令数据做指令微调,让模型学会"按人话回答关于各种模态输入的问题"。
输出。 一个统一的多模态大语言模型,能对八种模态输入做语言问答。
下面用 ASCII 图把整体架构画出来:
图像 ─►轻tokenizer─┐
音频 ─►轻tokenizer─┤
视频 ─►轻tokenizer─┤ ┌──────── 万能投影模块 UPM ────────┐
点云 ─►轻tokenizer─┼─►[共享统一编码器]─► 路由器 ─► [专家1..N]加权─► 语言token ─► 大语言模型 ─► 文字回答
深度/法线─►tokenizer┤ │ ▲ │
IMU ─►轻tokenizer─┤ │ 模态token(身份标签) │
fMRI ─►轻tokenizer─┘ └──────────────────────────────────┘
再用一张 ASCII 图看"渐进式对齐"的顺序:
阶段1: [图像]————————对齐好主干路
阶段2: [图像 + 音频 + 视频]
阶段3: [ + 点云 + 深度 + 法线]
阶段4: [ + IMU + fMRI] ← 冷门/少数据模态搭便车接入
所以这一整节是想说:OneLLM = 轻 tokenizer + 共享编码器 + 万能投影模块(专家/路由/模态token) + 渐进式对齐,用一套机件把八模态统一接到语言模型。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【OneLLM · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)
关键数字(What works)
数字来自论文(arXiv:2312.03700);各基准的具体分数属正文表格,标注"需读原文"。
| 项目 | 数值/结论 | 说明 |
|---|---|---|
| 支持模态数 | 8 种 | 图/音/视频/点云/深度/法线/IMU/fMRI |
| 核心机件 | 一个统一编码器 + 一个 UPM | 而非每模态一套 |
| UPM 结构 | 投影专家混合 + 路由 + 模态 token | 通用可扩展 |
| 统一编码器 | 基于冻结 CLIP | 复用通用视觉表示 |
| 训练策略 | 渐进式对齐(从图像起) | 冷门模态搭便车 |
| 评测 | 多模态问答/描述等多基准 | 具体分数需读原文 |
三个要点:第一,"一套机件对齐八模态"是它最大的卖点——把"每模态重造"变成"统一 + 少量增量";第二,渐进式对齐让 fMRI、IMU 这种数据极少的模态也能接入,这是很实际的工程智慧;第三,用冻结 CLIP 当共享编码器既省资源又借用了强表示,体现了"复用地基"的思路。
所以这一节是想说:统一机件 + 渐进对齐 + 复用 CLIP,是 OneLLM 在"通用多模态"上的三个关键选择。
实验结果说明了什么
论文实验主要证明:
- 统一框架能达到有竞争力的表现:在多个模态的问答/描述任务上,OneLLM 用一套统一框架取得了与专用模型可比甚至更好的结果,证明"通用"不必以"性能大幅牺牲"为代价。
- 渐进式对齐有效:先图像后其它的训练顺序,让冷门模态用少量数据也能接入并工作,验证了"搭便车"策略。
- 专家混合 + 路由的价值:统一的 UPM 能兼顾不同模态的差异(消融细节需读原文),说明"一套模块 + 动态路由"比"每模态一套"更划算。
- 模态可扩展性:框架设计使得加新模态成本较低(主要加轻 tokenizer 和模态 token)。
所以这一节是想说:实验证明"统一框架 + 渐进对齐"既通用又不掉链子,还容易扩展新模态。
你应该懂的几个新词
- 模态(modality):一种输入形式,如图像、音频、点云、脑信号。多模态即同时处理多种。
- 多模态大语言模型(MLLM):能接收多种模态输入、用语言输出的大模型。
- token 化(tokenization):把原始信号切成一串向量,便于统一处理。
- 统一编码器(unified encoder):所有模态共享的骨干(这里基于冻结 CLIP)。
- 万能投影模块(UPM):本文核心,把各模态特征翻译到语言空间的统一模块。
- 专家混合(mixture of experts)/ 路由(router):一组子模块 + 一个动态挑选/加权它们的机制。
- 模态 token(modality token):每种模态的可学习身份标签,帮路由器识别模态。
- 渐进式对齐(progressive alignment):从数据最多的模态起,逐步纳入更多模态的训练策略。
所以这一节是想说:统一编码器、UPM、专家路由、渐进对齐是理解本篇的四个关键词。
它有什么搞不定的
- 通用可能不如极致专用:在某个单一模态上,精心定制的专用模型仍可能更强;OneLLM 换来的是通用性和扩展性。
- 依赖 CLIP 的视觉偏置:共享编码器基于视觉 CLIP,对与视觉差异极大的模态(如 fMRI、IMU)是否最优,仍值得推敲。
- 冷门模态数据仍是瓶颈:渐进对齐缓解了数据少的问题,但 fMRI 等模态的绝对数据量极少,能力上限受限。
- 模态数量增长的可扩展性:八种已很多,但当模态继续增加,路由和专家容量、训练平衡会更复杂。
- 对齐质量不均:不同模态因数据和难度差异,对齐/理解质量参差不齐。
所以这一节是想说:它以"通用换极致",且受 CLIP 偏置、冷门模态数据量、多模态平衡等限制。
它和别的几篇是什么关系
- 对齐前辈:ImageBind(把六模态绑到图像空间)是思想近亲,但 OneLLM 更进一步——直接接到会对话的大语言模型上做指令问答。
- 多模态 LLM 对照:AnyMAL、PandaGPT 等也接多模态,OneLLM 的差异在"统一编码 + 万能投影 + 渐进对齐"的高统一度。
- 地基:LLaVA 定义了"编码器 + 投影 + LLM"的 VLM 模板,OneLLM 把这个模板从"图像一种"推广到"八种模态一套"。
- CLIP:作为共享编码器的底座,体现了"复用强视觉表示"的思路。
所以这一节是想说:OneLLM 是"ImageBind 的对齐思想 + LLaVA 的对话模板"的融合与推广,主打统一与可扩展。
和本导读的关系
本笔记对应导读 Ch18: 多模态生态。Ch18 讲的是"如何让一个模型同时理解多种感官",从 ImageBind、AnyMAL 到各种统一表示。OneLLM 是这条线里"用一套框架统一对齐所有模态到语言"的代表,它把"每模态重造"的老路收敛成"统一机件 + 渐进扩展"。读完本篇再看同章的 imagebind(多模态联合嵌入的对齐思想)、3dshape2vecset(3D 表示),能理解"多模态统一"从表示对齐走向对话大模型的演进。
所以这一节是想说:把 OneLLM 放进 Ch18,它代表多模态从"绑定表示"走向"统一接入对话大模型"的一步。
思考题
Q1:为什么"每种模态单独造一个大编码器"扩展性差?OneLLM 怎么解决?
提示
模态越多系统越臃肿、训练越贵。OneLLM 共享统一编码器 + 万能投影模块,加新模态只需轻 tokenizer + 模态 token。
Q2:渐进式对齐为什么要"先图像"?这对 fMRI 这种冷门模态有什么好处?
提示
图像数据最多,先把对齐主干路修通;后加的模态对齐到已建好的语言空间,冷门模态可用少量数据搭便车。
Q3:万能投影模块用"专家混合 + 路由",比"所有模态用同一个固定投影"好在哪?
提示
固定投影难兼顾差异极大的模态;专家混合 + 路由能按模态动态组合,既统一又灵活。
Q4:用冻结的 CLIP 当所有模态的共享编码器,对 IMU、fMRI 这类非视觉模态可能有什么隐患?
提示
CLIP 是视觉训练出来的,其表示偏置未必最适合脑信号或运动序列。想想"复用强表示"和"模态适配"的权衡。
Q5:OneLLM 追求通用,代价可能是单模态性能不如专用模型。你觉得这个取舍值得吗?
提示
看应用:要一个能处理万物的助手,通用更重要;要极致的单模态产品,专用更好。想想通用系统的长期价值。
Q6:如果要给 OneLLM 加第九种模态(比如触觉),你需要做哪些事?
提示
加一个轻 tokenizer、一个模态 token,收集触觉-文本数据,渐进对齐到已有语言空间。想想框架的可扩展性体现在哪。
Q7:ImageBind 把模态绑到图像空间,OneLLM 把模态对齐到语言空间。两种"锚点"各有什么优劣?
提示
图像空间利于检索/表示对齐;语言空间利于对话/指令问答。想想下游任务决定锚点选择。
一些好奇心问答(FAQ)
Q:OneLLM 真能读懂大脑 fMRI 信号?
它能把 fMRI 当作一种模态接入并用语言描述相关内容,但 fMRI 数据极少、噪声大,理解能力有限,更多是展示框架的通用性。
Q:它和 ImageBind 到底差在哪?
ImageBind 学的是"多模态共享嵌入"(主要用于对齐/检索),不直接对话;OneLLM 把多模态接到一个能按指令回答的大语言模型上,重点是"统一 + 对话"。
Q:加新模态真的很省吗?
相对"每模态重造一整套"确实省很多——主要加轻 tokenizer 和模态 token,UPM 和编码器主体可复用。但仍需该模态的对齐数据。
Q:为什么统一编码器要用"冻结"的 CLIP?
冻结能保住 CLIP 已学到的强表示、省训练资源,也让各模态落在相近空间便于对齐。代价是对非视觉模态可能不是最优。
所以这一节是想说:它是"统一 + 可对话 + 易扩展"的多模态框架,冷门模态更多是通用性展示。
如果你想再深入
- 对齐思想:ImageBind — 理解多模态联合嵌入的原型。
- 对话模板:LLaVA — 理解"编码器 + 投影 + LLM"的 VLM 基本盘。
- 专家混合:Mixture-of-Experts 基础 — 理解 UPM 的路由机制。
- 底座:CLIP — 理解共享编码器的来源与偏置。
- 对照:AnyMAL / PandaGPT — 看其它多模态 LLM 的做法差异。
所以这一节是想说:把 CLIP → ImageBind → LLaVA → OneLLM 串起来,能看清多模态从表示到对话的统一之路。
原文信息
- 标题:OneLLM: One Framework to Align All Modalities with Language
- 作者:Jiaming Han, Kaixiong Gong, Yiyuan Zhang, Jiaqi Wang, Kaipeng Zhang, Dahua Lin, Yu Qiao, Peng Gao, Xiangyu Yue
- 会议:CVPR 2024
- arXiv:https://arxiv.org/abs/2312.03700
@inproceedings{han2024onellm,
title = {OneLLM: One Framework to Align All Modalities with Language},
author = {Han, Jiaming and Gong, Kaixiong and Zhang, Yiyuan and Wang, Jiaqi and Zhang, Kaipeng and Lin, Dahua and Qiao, Yu and Gao, Peng and Yue, Xiangyu},
booktitle = {IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
year = {2024},
url = {https://arxiv.org/abs/2312.03700}
}
◼
引用本笔记 / Cite this note
@online{eai_onellm_2026,
title = {(readable note) OneLLM},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/onellm/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?