X-VLM: Multi-Grained Vision Language Pre-Training
这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。
一句话讲什么(TL;DR)
X-VLM 教 AI 看图,不只学"整张图配整句话",还同时学"图里某个物体配某个词"——而且不靠外部的物体检测器,一个模型端到端把整图、区域、物体三种粒度的图文对齐一起学,于是问图里某个细节时也能答准。
所以这一节是想说:X-VLM 是一个"同时在多个粗细粒度上对齐图和文"的视觉-语言预训练模型。
这是个什么场景
想象你陪一个三岁小孩翻一本带配文的绘本,你有两种教法:
- 粗粒度教法:指着整张图说"一只狗在草地上玩球"。小孩学到的是"这整个画面 ↔ 这整句话"。
- 细粒度教法:手指着狗说"狗",移到球说"球",移到草地说"草地"。小孩学到的是"图里这一小块 ↔ 这一个词"。
只会第一种的小孩,你问他"图里左下角是什么"会答不上来;只会第二种的小孩,又讲不出"整张图在发生什么"。两种都得学,缺一不可。
计算机的视觉-语言模型面对的是同样的问题。这类模型的用途很广:图文检索(用一句话搜图,或给图配文)、视觉问答(VQA,看图回答问题)、视觉定位(给一句描述,框出图里对应的东西)、给机器人"指认桌上那个红杯子"。这些任务里,有的只需要粗粒度理解(整图检索),有的强烈依赖细粒度理解(视觉定位)。
之前的视觉-语言模型大多只擅长一头:要么只做整图-整文对齐(CLIP 风格),要么依赖一个预训练好的物体检测器(比如 Faster R-CNN)先把图里的"狗""球""草地"框成几个 box,再去对齐——相当于先请别人帮你把绘本里的物体一个个圈出来,你只学"圈好了贴标签"。X-VLM 想做的是:不请外援、端到端地同时学整图、区域、物体三种粒度的对齐。
视觉-语言预训练(Vision-Language Pre-training, VLP):先在海量图-文对上做通用训练,学出一套"既懂图又懂字"的表征,然后在具体任务(检索、VQA、定位)上微调。类比:先让学生博览群书打好通识底子,再针对某门考试冲刺。
所以这一节是想说:X-VLM 面对的是"视觉-语言模型要同时具备粗粒度全局理解和细粒度局部定位能力"这个长期缺口。

之前的人怎么做的,为什么不够好
- CLIP / ALIGN(2021):双塔结构,图和文各过一个编码器,只对齐"整图 ↔ 整文"。简单、能吃海量网络数据、可扩展,但缺乏细粒度理解——问"图里左下角是什么"就答不好。见 clip。
- ViLBERT / LXMERT / UNITER(2019-2020):先用预训练好的目标检测器(Faster R-CNN)抽出 region features,再喂给 Transformer 做图文 cross-attention。问题是强依赖检测器质量、慢、且检测类别有限(检测器没见过的物体就抓瞎)。
- ViLT(2021):去掉检测器,直接把 ViT 的图像 patch + 文本 token 一起塞进 Transformer。轻量,但丢失了"哪个 patch 对应哪个物体"的显式监督,细粒度对齐没人管。
- ALBEF(2021,X-VLM 的直接前作):先用对比学习对齐整图整文,再用融合 Transformer 学交互,并引入 momentum distillation 处理网络噪声数据。做得很好,但对齐仍停留在图-文级别,没有显式的区域-短语监督。见 blip 一脉的同期工作。
一句话概括困境:用检测器的方法太重太僵、不用检测器的方法又丢了细粒度。
所以这一节是想说:以前要么靠笨重的外部检测器换细粒度、要么图省事只做粗粒度,没人在一个端到端框架里把多粒度对齐做干净。
这篇论文的新想法
核心论断:视觉-语言对齐不该只在一个粒度上做,而且不必依赖外部检测器。
X-VLM 的关键想法是同时改造"数据、模型、目标"三层:
- 数据层面:训练数据不只有 (整图, caption) 对,还包含 (图, 区域 box, 区域描述) 三元组。区域可以是物体级(一只狗),也可以是更大的视觉概念(一群人在野餐)。
- 模型层面:用一个 Vision Transformer 编码整图,但允许"取出某个 box 内 patch 的特征、聚合成一个区域表征"。区域特征和整图特征来自同一套 patch 特征,只是聚合范围不同。
- 目标层面:同时优化多个粒度的对齐——整图↔整句、区域↔短语、物体↔单词——共享同一个编码器;并额外加一个"给短语预测它在图里的 box 坐标"的定位监督。
这样,模型学到的视觉特征空间里,"整图特征"和"区域特征"是同一种表征的不同聚合,下游任务可以按需灵活提取任意粒度,而且完全不用外部检测器帮忙圈图。
所以这一节是想说:X-VLM 的新意是"用带 box 标注的数据 + 从 patch 聚合区域特征 + 多粒度对齐损失 + bbox 预测",一个端到端框架同时学会粗细多个粒度。
它分几步做的(方法)
这一节是全篇核心,拆成"整体架构、多粒度视觉表征、四类训练目标、数据混合、下游微调"五步讲清楚。
整体数据流 ASCII 示意:
整图 ─► Vision Transformer ─► 一堆 patch 特征
│
┌─────────────────┼──────────────────┐
▼ ▼ ▼
聚合所有 patch 聚合 box 内 patch 聚合 box 内 patch
= 整图特征 = 区域特征 = 物体特征
│ │ │
文本 ─► Text Encoder ─► 整句/短语/单词 特征
│ │ │
▼ ▼ ▼
┌──────────────── 对齐损失(多粒度)────────────────┐
│ ITC 对比 │ ITM 匹配 │ MLM 掩码语言 │ bbox 预测 │
└──────────────────────────────────────────────────┘
第 1 步:整体架构——三个分工明确的同事
输入:一张图 + 一段文本(整句 caption、短语、或单词)。
处理:架构沿用前作 ALBEF 的"双塔 + 融合"三件套:
- 图像编码器(Vision Transformer,ViT):负责看图。把图切成很多小方块(patch,可想象成 16×16 的小贴纸),每个方块算一个特征向量。
- 文本编码器(BERT-like Transformer):负责读文字,把每个词编码成向量。
- 跨模态融合编码器(fusion Transformer):负责把图那边和文那边的信息凑到一起深度交互(用 cross-attention,即让文本 token 去"看"图像 patch)。
关键改动在于:看图那位同事不再只盯着整张图,而是能按需盯住图里任意一块框住的区域。
输出:图像侧的 patch 特征、文本侧的 token 特征,以及融合后的联合表征。
第 2 步:多粒度视觉表征——把大照片拆成小贴纸再灵活拼
这是 X-VLM 相对 ALBEF 最核心的改动。
输入:整图过 ViT 得到的一堆 patch 特征;以及来自标注数据(Visual Genome、COCO 等带"圈出物体"标注的数据集)的若干 box 坐标。
处理:给定一个 box,就把这个 box 框住的那几张"小贴纸"(patch)的特征聚合一下(比如取平均或加上位置信息后汇总),得到一个区域级特征向量;如果把整张图所有 patch 聚合,就得到整图特征;如果 box 框的正好是一个物体,得到的就是物体级特征。
于是同一张图能一次性产出"1 个整图向量 + 多个区域向量",每一个都可以去和对应粒度的文本配对:整图向量配整句 caption、区域向量配短语、物体向量配单词。
输出:多个粒度的视觉特征,全部落在同一个表征空间里。
等等,先慢一拍——为什么不用现成的物体检测器?
以前的方法(如 ViLBERT)要先请 Faster R-CNN 把图圈成几个固定 box 再喂进来。三个毛病:慢(检测器本身就重)、僵硬(box 数量和类别固定)、且只认它训练过的物体类别。X-VLM 直接让 ViT 自己学"哪几张小贴纸合起来代表一只狗"——box 只在训练时当监督信号用(来自数据集标注),推理时不需要任何外部检测器。这就是"端到端"和"多粒度"能同时成立的关键。
第 3 步:四类训练目标——同时给模型四份作业
输入:上一步的多粒度视觉特征 + 对应文本。
处理:同时优化四类损失,从不同角度逼模型对齐图文:
- 图文对比学习(ITC, Image-Text Contrastive):双塔在多粒度上做——整图-整句、区域-短语都做。人话:在一堆候选里挑出"哪句话配这张图/这个区域",配对的拉近、不配对的推远。这是 CLIP 同款思路,负责"粗对齐、拉开距离"。
- 图文匹配(ITM, Image-Text Matching):把图和文一起塞进融合 Transformer 后,做二分类判断"这对图文是否真的匹配"。比 ITC 更细致(有深度交互)但更慢。为了让这个二分类有难度,通常会用 ITC 的相似度挑"难负样本"(长得很像但其实不配的对)。
- 掩码语言建模(MLM, Masked Language Modeling):把文本里的部分词遮住,让模型靠图像信息猜出来。人话:故意把"一只___在玩球"里的"狗"挖掉,逼模型真的去看图才能填对,而不是只靠语言习惯背出来。
- 边界框预测(Bounding Box Prediction):给一句短语,让模型预测它在图里对应的 box 坐标(回归 4 个数:中心 x、y、宽、高,常配合 GIoU 损失)。这是最像"老师手指着图里某块说话"的信号,是细粒度对齐的关键监督。
输出:四个损失加权求和,一起反向传播,共享同一套编码器参数。
对比学习(contrastive learning):给一批"正确配对"和"错误配对",训练模型把正确的拉近、错误的推远。类比:给你一堆照片和名字,反复练习"把对的照片和名字连线"。
难负样本(hard negative):那些"看起来很像正确答案、其实是错的"样本。用它们训练比用一眼假的负样本更能磨练模型。类比:做选择题时,最有区分度的是那些"看着都对"的干扰项。
第 4 步:数据混合——主菜配菜一起上
输入:多种异构数据源。
处理:把两类数据混在一起训练:
- 带 region 标注的数据(细粒度主菜):COCO、Visual Genome(有密集的 region + region description 标注)等。它们提供 (图, box, 区域描述) 三元组,喂给区域对齐和 bbox 预测。
- 只有整图-整文的数据(粗粒度配菜):Conceptual Captions、SBU、CC12M 等网络爬取的图-文对。它们量大但只有整图级监督,喂给整图对齐。
具体每种数据用了多少、一个 batch 里怎么按比例混、图像分辨率多少,需查原文。
输出:一个既见过大量粗粒度网络数据、又见过精细 region 标注的预训练模型。
第 5 步:下游微调——按需取用任意粒度
输入:预训练好的 X-VLM + 某个下游任务的数据。
处理:因为多粒度特征在同一空间,下游任务可以灵活接:图文检索用整图/整文特征算相似度;VQA/NLVR2 在融合特征上接分类头;视觉定位(RefCOCO)直接复用 bbox 预测能力去回归 box。
输出:在各任务上微调后的模型。
所以这一节是想说:X-VLM 的方法 = ViT+BERT+融合三件套 + 从 patch 聚合出多粒度视觉特征 + ITC/ITM/MLM/bbox 四类损失联合训练 + 粗细数据混合,一个端到端框架同时学会多个粒度且推理不依赖检测器。
下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):
【X-VLM: Multi-Grained Vision Languag… · 关键结果概览】
设定 / 数据 方法要点 主结果
│ │ │
▼ ▼ ▼
训练 ──► 方法核心 ──► …
评测 ──► 主指标提升 ──► ↑ 论文主结论
(对照下方表格中的原文数字与消融)

关键数字(What works)
下表整理关键设定与定性结论;具体 R@1、VQA acc 等数字请查原文,此处不编造。
| 维度 | 说明 |
|---|---|
| 架构 | ViT 图像编码器 + BERT-like 文本编码器 + 融合 Transformer(沿用 ALBEF) |
| 新增监督 | 区域-短语对齐 + bounding box 预测 |
| 训练目标 | ITC + ITM + MLM + bbox 预测(多粒度联合) |
| 主要数据 | COCO、Visual Genome(带 region)+ CC、SBU、CC12M(整图-文) |
| 模型规模 | X-VLM base(约 ViT-B 量级),后续有更大版本 |
| 评测任务 | 图文检索、VQA、NLVR2、视觉定位(RefCOCO)、captioning |
| 最大受益任务 | 视觉定位(visual grounding),因训练时显式对齐 region↔phrase |
关键看点:视觉定位任务上相对 ALBEF 的提升幅度——它最直接检验"多粒度对齐是否真有用"。如果定位大涨而整图检索只是持平,就说明收益主要来自细粒度监督,符合方法设计的初衷。
所以这一节是想说:数字里最该盯的是"视觉定位相对纯粗粒度基线(ALBEF)的提升",它是多粒度对齐价值的直接证据。
实验结果说明了什么
X-VLM 在多个标准视觉-语言任务上验证多粒度对齐的好处(具体数字需查原文):
- 图文检索:Flickr30K、COCO 上的 R@1/R@5/R@10(用一句话搜图、用图搜句子的命中率)。
- VQA:VQA v2 准确率(看图回答开放式问题)。
- 视觉推理:NLVR2(判断两张图和一句话描述是否一致)。
- 视觉定位:RefCOCO/RefCOCO+/RefCOCOg,给一句描述找出图里对应 box——多粒度对齐最直接受益的任务。
- Image captioning:COCO Caption(给图生成描述)。
主要对比对象是 ALBEF、VinVL、UNITER 等同期方法。X-VLM 在多任务上达到或接近 SOTA,视觉定位提升尤其明显——这符合直觉:训练时就显式对齐了 region 和 phrase,测试时找 region 自然更准。消融实验(去掉 bbox 预测 / 去掉区域对齐)应能显示细粒度监督的贡献大小。
所以这一节是想说:实验证明"多粒度对齐"不是花架子——它在需要细粒度的任务上带来明显提升,同时不牺牲粗粒度任务的性能。
你应该懂的几个新词
- 多粒度对齐(multi-grained alignment):同时在整图-整句、区域-短语、物体-单词等多个粒度上让视觉和语言特征对应。X-VLM 的核心概念。
- 区域 / 边界框(region / bounding box):图里一个矩形框,框住某个物体或视觉概念,是细粒度对齐的"锚点"。
- Visual Genome:一个带密集 region 标注 + region description 的数据集,是多粒度训练的关键数据来源。
- 图文对比学习(ITC):双塔对比学习,把匹配的图-文拉近、不匹配的推远,CLIP 同款思路,负责粗对齐。
- 图文匹配(ITM):把图和文一起塞进融合 Transformer,做"是否匹配"的二分类,比 ITC 更细但更慢,常配难负样本。
- 视觉定位(visual grounding):给一句描述,定位它在图里指的是哪个 box——多粒度对齐的"亲女儿任务"。
所以这一节是想说:这几个词是理解"从粗粒度 CLIP 走向细粒度 grounding 类 VLM"这条线的通用基础。
它有什么搞不定的
- 依赖 region 标注数据:细粒度学习需要 (图, box, 描述) 三元组,这类标注数据(Visual Genome、COCO)远少于网络爬的图-文对,规模受限、扩展成本高。
- 粒度是预设的:整图/区域/物体三档是人为设定的粒度,遇到更复杂的层级关系(物体的部件、物体间关系)不一定覆盖得好。
- 区域来自标注框,不是模型自己发现的:训练时的 box 仍来自数据集标注,模型没有真正"无监督发现物体"的能力。
- 不是生成式 VLM:X-VLM 是"理解/对齐"型模型,不像 BLIP-2、LLaVA 那样能自由生成长文本回答,接 LLM 做对话需要额外改造。
- 计算成本:多目标联合训练 + 融合 Transformer 的 cross-attention,比纯双塔 CLIP 更重。
所以这一节是想说:X-VLM 的短板是"细粒度靠标注数据、粒度预设固定、且是对齐型而非生成型"——它把对齐做细了,但没解决数据规模和生成能力。
它和别的几篇是什么关系
向后看(它站在谁的肩膀上):
- clip / ALIGN:粗粒度对齐的代表,X-VLM 可视为它们的"细粒度增强版",代价是需要带 region 标注的数据。
- ALBEF(X-VLM 直接前作):X-VLM 沿用其双塔+融合架构和 momentum distillation 思想,主要扩展是引入多粒度对齐 + bbox 预测。
- VinVL / UNITER:依赖更强物体检测器抽 region feature,"先检测再对齐";X-VLM 是"端到端学多粒度",推理不依赖外部检测器。
向前看(它启发了谁):
- blip / blip-2:同期/后续工作,BLIP 主攻用生成式 caption 做数据清洗(CapFilt),和 X-VLM 是互补思路(一个改对齐粒度、一个改数据质量);BLIP-2 把视觉编码器和 LLM 桥接,开启 VLM 大模型时代。
- siglip:从损失函数角度改进图文对比(sigmoid 替 softmax),和 X-VLM 从粒度角度改进是不同维度。
- llava:现代生成式 VLM,X-VLM 的多粒度 grounding 思想在需要"指认物体"的场景里被继承。
- GLIP / Grounding DINO:把"检测 + 对齐"统一的后续代表,X-VLM 的多粒度对齐是这条线的早期思想源头。
所以这一节是想说:X-VLM 处在"CLIP 粗对齐 → 多粒度对齐 → grounding 类 VLM / 生成式 VLM"这条演进线的关键转折点上。
和本导读的关系
本篇主要对应导读 Ch08: VLM 地基(CLIP),并延伸到 Ch18: 多模态生态。Ch08 讲视觉-语言模型如何"同时认图和认字",起点是 CLIP 的整图-整文对齐;X-VLM 是这条线上"把对齐做细"的关键一步——从只会全局对齐,进化到能对齐到区域和物体。读完 CLIP 再读 X-VLM,能看清 VLM 从"粗"到"细"的技术脉络;再往后接 blip-2、llava,就进入了生成式 VLM 的时代。
所以这一节是想说:把 X-VLM 放进 Ch08 的 VLM 演进谱系里读,它是"从粗粒度对齐迈向细粒度 grounding"这一格的代表作。
思考题
Q1:为什么只做整图-整文对齐的模型(如 CLIP)在"视觉定位"任务上表现差?
提示
CLIP 训练时只学"整张图 ↔ 整句话",从没被要求分辨"图里哪一块对应哪个词"。它的特征空间里没有"区域"这个概念,所以让它框出"左边那只狗"时没有对应的监督信号支撑。X-VLM 通过区域-短语对齐和 bbox 预测显式补上了这一课。
Q2:X-VLM 为什么坚持"推理时不依赖外部检测器"?依赖检测器有什么坏处?
提示
外部检测器(Faster R-CNN)慢、僵硬(box 数量/类别固定)、且只认训练过的类别,检测器没见过的物体就抓瞎,还会成为整个流水线的瓶颈和误差来源。X-VLM 让 ViT 自己从 patch 聚合区域特征,box 只在训练时当监督用,推理时完全自足,更快更灵活。
Q3:X-VLM 同时优化 ITC、ITM、MLM、bbox 四个损失,它们各自负责补什么能力?
提示
ITC 负责粗粒度拉开距离(快速筛选式对齐);ITM 在融合后做细致的"是否匹配"二分类,配难负样本磨区分力;MLM 逼模型真看图才能填空(图文深度关联);bbox 预测提供最直接的细粒度定位监督。四者互补,缺一则某种能力弱化。
Q4:区域特征和整图特征都来自"同一套 patch 特征的不同聚合",这样设计有什么好处?
提示
保证粗细粒度落在同一个表征空间里,下游任务可以自由按需提取任意粒度而无需两套模型/两套特征;也让"整图理解"和"区域理解"互相受益(学好区域有助于理解整图,反之亦然),而不是割裂训练。
Q5:X-VLM 依赖带 region 标注的数据(如 Visual Genome),这对它的可扩展性意味着什么?和 CLIP 靠海量网络数据相比谁更容易 scale?
提示
带 box+描述的 region 标注需要人工精细标注,规模远小于网络爬取的图-文对,扩展成本高、天花板低。CLIP 只需整图-整文对,能吃十亿级网络数据,更容易 scale。这是 X-VLM 换取细粒度能力付出的代价——细粒度收益 vs 数据规模的权衡。
Q6:为什么 ITM 里要专门挑"难负样本",而不是随便找不匹配的图文对?
提示
随便找的负样本(比如"一只狗"配"一辆卡车")一眼就能判假,模型学不到什么。难负样本是"看起来很像但其实不配"的对(比如"黑狗玩球"配"棕狗玩球"),逼模型关注细节差异,才能真正磨出区分力。通常用 ITC 的相似度分数来挑这些难负样本。
Q7:X-VLM 是"对齐/理解型"模型,不能像 LLaVA 那样自由生成对话回答。如果想让它具备生成能力,大致要怎么改?
提示
需要在其视觉编码器之后接一个语言生成模型(LLM),并用一个桥接模块(如 BLIP-2 的 Q-Former 或简单投影层)把视觉特征映射到 LLM 的输入空间,再做指令微调。X-VLM 的多粒度视觉表征可以作为很好的视觉底座,但生成能力要靠后接的 LLM 提供。
所以这一节是想说:这几个问题带你把"为什么需要多粒度、检测器的代价、四损失分工、共享表征、数据规模权衡、难负样本、如何走向生成式"这些核心点自己推一遍。
一些好奇心问答(FAQ)
Q1:X-VLM 和 CLIP 到底谁强?
不是同一维度的比较。CLIP 强在简单可扩展、吃海量数据、零样本分类强;X-VLM 强在细粒度理解和视觉定位。要做"用一句话搜图库"CLIP 够用且更省;要做"框出图里那个红杯子"就得用 X-VLM 这类多粒度模型。
Q2:训练时用的 box 从哪来?推理时也要提供 box 吗?
训练时的 box 来自数据集标注(Visual Genome、COCO 等)。推理时不需要外部提供 box,也不需要外部检测器——模型自己从 patch 聚合出需要的区域表征;做视觉定位任务时反而是模型输出 box。
Q3:X-VLM 算大模型吗?
不算。base 版约 ViT-B 量级(几亿参数),比后来的 BLIP-2、LLaVA 这类接了大 LLM 的动辄数十亿参数小得多。它是"预训练理解模型",不是生成式大模型。
Q4:为什么视觉定位是 X-VLM 最受益的任务?
因为训练时它专门学了"region ↔ phrase 对齐"和"给短语预测 box",这和视觉定位任务(给描述找 box)几乎是同一件事。训练目标和下游任务高度对齐,收益自然最大。
Q5:读完 X-VLM 接下来看什么?
想看它的前身粗粒度对齐看 clip;想看互补的数据清洗思路看 blip;想看走向生成式 VLM 看 blip-2、llava;想看损失函数维度的改进看 siglip。
所以这一节是想说:X-VLM 强在细粒度、不是大模型、推理不需外部 box、定位任务收益最大——这些实操问题都有明确答案。
如果你想再深入
按"前身 → 互补思路 → 后续演进"排序:
- 前身:clip —— 粗粒度对齐的起点,理解 X-VLM 在补什么课。
- 互补:blip —— 同期工作,从数据质量而非粒度角度改进 VLP。
- 后续:blip-2 / llava —— VLM 从"对齐理解"走向"生成对话"的关键。
- 另一维度:siglip —— 从损失函数改进图文对比学习。
所以这一节是想说:把 CLIP + X-VLM + BLIP-2 连起来读,就能看清 VLM 从"粗对齐 → 细对齐 → 生成式"的完整演进。
原文信息
- 标题:Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts (X-VLM)
- arXiv:https://arxiv.org/abs/2111.08276
- 发表:ICML, 2022
- 年份:2022
BibTeX:
@inproceedings{zeng2022xvlm,
title = {Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts},
author = {Zeng, Yan and Zhang, Xinsong and Li, Hang},
booktitle = {International Conference on Machine Learning (ICML)},
year = {2022},
url = {https://arxiv.org/abs/2111.08276}
}
所以整篇是想说:X-VLM 用"从 patch 聚合多粒度视觉特征 + 多粒度对齐损失 + bbox 预测",让视觉-语言模型在不依赖外部检测器的前提下,同时学会整图、区域、物体三种粒度的对齐——它是 VLM 从"只会看整张图"迈向"能指认图里每个细节"的关键一步。
◼
引用本笔记 / Cite this note
@online{eai_x_vlm_2026,
title = {(readable note) X-VLM: Multi-Grained Vision Language Pre-Training},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2022 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/x-vlm/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?