Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
Multimodal Ecology · Plate Nº 70

X-VLM: Multi-Grained Vision Language Pre-Training

18 min read · 6290 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者看的精读笔记。术语首次出现配类比,公式翻译成人话。

一句话讲什么(TL;DR)

X-VLM 教 AI 看图,不只学"整张图配整句话",还同时学"图里某个物体配某个词"——而且不靠外部的物体检测器,一个模型端到端把整图、区域、物体三种粒度的图文对齐一起学,于是问图里某个细节时也能答准。

所以这一节是想说:X-VLM 是一个"同时在多个粗细粒度上对齐图和文"的视觉-语言预训练模型。


这是个什么场景

想象你陪一个三岁小孩翻一本带配文的绘本,你有两种教法:

  • 粗粒度教法:指着整张图说"一只狗在草地上玩球"。小孩学到的是"这整个画面 ↔ 这整句话"。
  • 细粒度教法:手指着狗说"狗",移到球说"球",移到草地说"草地"。小孩学到的是"图里这一小块 ↔ 这一个词"。

只会第一种的小孩,你问他"图里左下角是什么"会答不上来;只会第二种的小孩,又讲不出"整张图在发生什么"。两种都得学,缺一不可。

计算机的视觉-语言模型面对的是同样的问题。这类模型的用途很广:图文检索(用一句话搜图,或给图配文)、视觉问答(VQA,看图回答问题)、视觉定位(给一句描述,框出图里对应的东西)、给机器人"指认桌上那个红杯子"。这些任务里,有的只需要粗粒度理解(整图检索),有的强烈依赖细粒度理解(视觉定位)。

之前的视觉-语言模型大多只擅长一头:要么只做整图-整文对齐(CLIP 风格),要么依赖一个预训练好的物体检测器(比如 Faster R-CNN)先把图里的"狗""球""草地"框成几个 box,再去对齐——相当于先请别人帮你把绘本里的物体一个个圈出来,你只学"圈好了贴标签"。X-VLM 想做的是:不请外援、端到端地同时学整图、区域、物体三种粒度的对齐

视觉-语言预训练(Vision-Language Pre-training, VLP):先在海量图-文对上做通用训练,学出一套"既懂图又懂字"的表征,然后在具体任务(检索、VQA、定位)上微调。类比:先让学生博览群书打好通识底子,再针对某门考试冲刺。

所以这一节是想说:X-VLM 面对的是"视觉-语言模型要同时具备粗粒度全局理解和细粒度局部定位能力"这个长期缺口。


X-VLM — 场景示意:这论文要解决的现实问题
Plate Nº IX-VLM — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • CLIP / ALIGN(2021):双塔结构,图和文各过一个编码器,只对齐"整图 ↔ 整文"。简单、能吃海量网络数据、可扩展,但缺乏细粒度理解——问"图里左下角是什么"就答不好。见 clip
  • ViLBERT / LXMERT / UNITER(2019-2020):先用预训练好的目标检测器(Faster R-CNN)抽出 region features,再喂给 Transformer 做图文 cross-attention。问题是强依赖检测器质量、慢、且检测类别有限(检测器没见过的物体就抓瞎)。
  • ViLT(2021):去掉检测器,直接把 ViT 的图像 patch + 文本 token 一起塞进 Transformer。轻量,但丢失了"哪个 patch 对应哪个物体"的显式监督,细粒度对齐没人管。
  • ALBEF(2021,X-VLM 的直接前作):先用对比学习对齐整图整文,再用融合 Transformer 学交互,并引入 momentum distillation 处理网络噪声数据。做得很好,但对齐仍停留在图-文级别,没有显式的区域-短语监督。见 blip 一脉的同期工作。

一句话概括困境:用检测器的方法太重太僵、不用检测器的方法又丢了细粒度

所以这一节是想说:以前要么靠笨重的外部检测器换细粒度、要么图省事只做粗粒度,没人在一个端到端框架里把多粒度对齐做干净。


这篇论文的新想法

核心论断:视觉-语言对齐不该只在一个粒度上做,而且不必依赖外部检测器

X-VLM 的关键想法是同时改造"数据、模型、目标"三层:

  1. 数据层面:训练数据不只有 (整图, caption) 对,还包含 (图, 区域 box, 区域描述) 三元组。区域可以是物体级(一只狗),也可以是更大的视觉概念(一群人在野餐)。
  2. 模型层面:用一个 Vision Transformer 编码整图,但允许"取出某个 box 内 patch 的特征、聚合成一个区域表征"。区域特征和整图特征来自同一套 patch 特征,只是聚合范围不同。
  3. 目标层面:同时优化多个粒度的对齐——整图↔整句、区域↔短语、物体↔单词——共享同一个编码器;并额外加一个"给短语预测它在图里的 box 坐标"的定位监督。

这样,模型学到的视觉特征空间里,"整图特征"和"区域特征"是同一种表征的不同聚合,下游任务可以按需灵活提取任意粒度,而且完全不用外部检测器帮忙圈图。

所以这一节是想说:X-VLM 的新意是"用带 box 标注的数据 + 从 patch 聚合区域特征 + 多粒度对齐损失 + bbox 预测",一个端到端框架同时学会粗细多个粒度。


它分几步做的(方法)

这一节是全篇核心,拆成"整体架构、多粒度视觉表征、四类训练目标、数据混合、下游微调"五步讲清楚。

整体数据流 ASCII 示意:

   整图 ─► Vision Transformer ─► 一堆 patch 特征
                                   │
                 ┌─────────────────┼──────────────────┐
                 ▼                 ▼                  ▼
           聚合所有 patch     聚合 box 内 patch    聚合 box 内 patch
            = 整图特征         = 区域特征          = 物体特征
                 │                 │                  │
   文本 ─► Text Encoder ─► 整句/短语/单词 特征
                 │                 │                  │
                 ▼                 ▼                  ▼
        ┌──────────────── 对齐损失(多粒度)────────────────┐
        │ ITC 对比  │ ITM 匹配  │ MLM 掩码语言 │ bbox 预测  │
        └──────────────────────────────────────────────────┘

第 1 步:整体架构——三个分工明确的同事

输入:一张图 + 一段文本(整句 caption、短语、或单词)。

处理:架构沿用前作 ALBEF 的"双塔 + 融合"三件套:

  • 图像编码器(Vision Transformer,ViT):负责看图。把图切成很多小方块(patch,可想象成 16×16 的小贴纸),每个方块算一个特征向量。
  • 文本编码器(BERT-like Transformer):负责读文字,把每个词编码成向量。
  • 跨模态融合编码器(fusion Transformer):负责把图那边和文那边的信息凑到一起深度交互(用 cross-attention,即让文本 token 去"看"图像 patch)。

关键改动在于:看图那位同事不再只盯着整张图,而是能按需盯住图里任意一块框住的区域

输出:图像侧的 patch 特征、文本侧的 token 特征,以及融合后的联合表征。

第 2 步:多粒度视觉表征——把大照片拆成小贴纸再灵活拼

这是 X-VLM 相对 ALBEF 最核心的改动。

输入:整图过 ViT 得到的一堆 patch 特征;以及来自标注数据(Visual Genome、COCO 等带"圈出物体"标注的数据集)的若干 box 坐标。

处理:给定一个 box,就把这个 box 框住的那几张"小贴纸"(patch)的特征聚合一下(比如取平均或加上位置信息后汇总),得到一个区域级特征向量;如果把整张图所有 patch 聚合,就得到整图特征;如果 box 框的正好是一个物体,得到的就是物体级特征

于是同一张图能一次性产出"1 个整图向量 + 多个区域向量",每一个都可以去和对应粒度的文本配对:整图向量配整句 caption、区域向量配短语、物体向量配单词。

输出:多个粒度的视觉特征,全部落在同一个表征空间里。

等等,先慢一拍——为什么不用现成的物体检测器?

以前的方法(如 ViLBERT)要先请 Faster R-CNN 把图圈成几个固定 box 再喂进来。三个毛病:慢(检测器本身就重)、僵硬(box 数量和类别固定)、且只认它训练过的物体类别。X-VLM 直接让 ViT 自己学"哪几张小贴纸合起来代表一只狗"——box 只在训练时当监督信号用(来自数据集标注),推理时不需要任何外部检测器。这就是"端到端"和"多粒度"能同时成立的关键。

第 3 步:四类训练目标——同时给模型四份作业

输入:上一步的多粒度视觉特征 + 对应文本。

处理:同时优化四类损失,从不同角度逼模型对齐图文:

  • 图文对比学习(ITC, Image-Text Contrastive):双塔在多粒度上做——整图-整句、区域-短语都做。人话:在一堆候选里挑出"哪句话配这张图/这个区域",配对的拉近、不配对的推远。这是 CLIP 同款思路,负责"粗对齐、拉开距离"。
  • 图文匹配(ITM, Image-Text Matching):把图和文一起塞进融合 Transformer 后,做二分类判断"这对图文是否真的匹配"。比 ITC 更细致(有深度交互)但更慢。为了让这个二分类有难度,通常会用 ITC 的相似度挑"难负样本"(长得很像但其实不配的对)。
  • 掩码语言建模(MLM, Masked Language Modeling):把文本里的部分词遮住,让模型靠图像信息猜出来。人话:故意把"一只___在玩球"里的"狗"挖掉,逼模型真的去看图才能填对,而不是只靠语言习惯背出来。
  • 边界框预测(Bounding Box Prediction):给一句短语,让模型预测它在图里对应的 box 坐标(回归 4 个数:中心 x、y、宽、高,常配合 GIoU 损失)。这是最像"老师手指着图里某块说话"的信号,是细粒度对齐的关键监督。

输出:四个损失加权求和,一起反向传播,共享同一套编码器参数。

对比学习(contrastive learning):给一批"正确配对"和"错误配对",训练模型把正确的拉近、错误的推远。类比:给你一堆照片和名字,反复练习"把对的照片和名字连线"。

难负样本(hard negative):那些"看起来很像正确答案、其实是错的"样本。用它们训练比用一眼假的负样本更能磨练模型。类比:做选择题时,最有区分度的是那些"看着都对"的干扰项。

第 4 步:数据混合——主菜配菜一起上

输入:多种异构数据源。

处理:把两类数据混在一起训练:

  • 带 region 标注的数据(细粒度主菜):COCO、Visual Genome(有密集的 region + region description 标注)等。它们提供 (图, box, 区域描述) 三元组,喂给区域对齐和 bbox 预测。
  • 只有整图-整文的数据(粗粒度配菜):Conceptual Captions、SBU、CC12M 等网络爬取的图-文对。它们量大但只有整图级监督,喂给整图对齐。

具体每种数据用了多少、一个 batch 里怎么按比例混、图像分辨率多少,需查原文。

输出:一个既见过大量粗粒度网络数据、又见过精细 region 标注的预训练模型。

第 5 步:下游微调——按需取用任意粒度

输入:预训练好的 X-VLM + 某个下游任务的数据。

处理:因为多粒度特征在同一空间,下游任务可以灵活接:图文检索用整图/整文特征算相似度;VQA/NLVR2 在融合特征上接分类头;视觉定位(RefCOCO)直接复用 bbox 预测能力去回归 box。

输出:在各任务上微调后的模型。

所以这一节是想说:X-VLM 的方法 = ViT+BERT+融合三件套 + 从 patch 聚合出多粒度视觉特征 + ITC/ITM/MLM/bbox 四类损失联合训练 + 粗细数据混合,一个端到端框架同时学会多个粒度且推理不依赖检测器。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【X-VLM: Multi-Grained Vision Languag… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

X-VLM — 方法示意:核心 pipeline
Plate Nº IIX-VLM — 方法示意:核心 pipeline

关键数字(What works)

下表整理关键设定与定性结论;具体 R@1、VQA acc 等数字请查原文,此处不编造。

维度 说明
架构 ViT 图像编码器 + BERT-like 文本编码器 + 融合 Transformer(沿用 ALBEF)
新增监督 区域-短语对齐 + bounding box 预测
训练目标 ITC + ITM + MLM + bbox 预测(多粒度联合)
主要数据 COCO、Visual Genome(带 region)+ CC、SBU、CC12M(整图-文)
模型规模 X-VLM base(约 ViT-B 量级),后续有更大版本
评测任务 图文检索、VQA、NLVR2、视觉定位(RefCOCO)、captioning
最大受益任务 视觉定位(visual grounding),因训练时显式对齐 region↔phrase

关键看点:视觉定位任务上相对 ALBEF 的提升幅度——它最直接检验"多粒度对齐是否真有用"。如果定位大涨而整图检索只是持平,就说明收益主要来自细粒度监督,符合方法设计的初衷。

所以这一节是想说:数字里最该盯的是"视觉定位相对纯粗粒度基线(ALBEF)的提升",它是多粒度对齐价值的直接证据。


实验结果说明了什么

X-VLM 在多个标准视觉-语言任务上验证多粒度对齐的好处(具体数字需查原文):

  • 图文检索:Flickr30K、COCO 上的 R@1/R@5/R@10(用一句话搜图、用图搜句子的命中率)。
  • VQA:VQA v2 准确率(看图回答开放式问题)。
  • 视觉推理:NLVR2(判断两张图和一句话描述是否一致)。
  • 视觉定位:RefCOCO/RefCOCO+/RefCOCOg,给一句描述找出图里对应 box——多粒度对齐最直接受益的任务
  • Image captioning:COCO Caption(给图生成描述)。

主要对比对象是 ALBEF、VinVL、UNITER 等同期方法。X-VLM 在多任务上达到或接近 SOTA,视觉定位提升尤其明显——这符合直觉:训练时就显式对齐了 region 和 phrase,测试时找 region 自然更准。消融实验(去掉 bbox 预测 / 去掉区域对齐)应能显示细粒度监督的贡献大小。

所以这一节是想说:实验证明"多粒度对齐"不是花架子——它在需要细粒度的任务上带来明显提升,同时不牺牲粗粒度任务的性能。


你应该懂的几个新词

  • 多粒度对齐(multi-grained alignment):同时在整图-整句、区域-短语、物体-单词等多个粒度上让视觉和语言特征对应。X-VLM 的核心概念。
  • 区域 / 边界框(region / bounding box):图里一个矩形框,框住某个物体或视觉概念,是细粒度对齐的"锚点"。
  • Visual Genome:一个带密集 region 标注 + region description 的数据集,是多粒度训练的关键数据来源。
  • 图文对比学习(ITC):双塔对比学习,把匹配的图-文拉近、不匹配的推远,CLIP 同款思路,负责粗对齐。
  • 图文匹配(ITM):把图和文一起塞进融合 Transformer,做"是否匹配"的二分类,比 ITC 更细但更慢,常配难负样本。
  • 视觉定位(visual grounding):给一句描述,定位它在图里指的是哪个 box——多粒度对齐的"亲女儿任务"。

所以这一节是想说:这几个词是理解"从粗粒度 CLIP 走向细粒度 grounding 类 VLM"这条线的通用基础。


它有什么搞不定的

  • 依赖 region 标注数据:细粒度学习需要 (图, box, 描述) 三元组,这类标注数据(Visual Genome、COCO)远少于网络爬的图-文对,规模受限、扩展成本高。
  • 粒度是预设的:整图/区域/物体三档是人为设定的粒度,遇到更复杂的层级关系(物体的部件、物体间关系)不一定覆盖得好。
  • 区域来自标注框,不是模型自己发现的:训练时的 box 仍来自数据集标注,模型没有真正"无监督发现物体"的能力。
  • 不是生成式 VLM:X-VLM 是"理解/对齐"型模型,不像 BLIP-2、LLaVA 那样能自由生成长文本回答,接 LLM 做对话需要额外改造。
  • 计算成本:多目标联合训练 + 融合 Transformer 的 cross-attention,比纯双塔 CLIP 更重。

所以这一节是想说:X-VLM 的短板是"细粒度靠标注数据、粒度预设固定、且是对齐型而非生成型"——它把对齐做细了,但没解决数据规模和生成能力。


它和别的几篇是什么关系

向后看(它站在谁的肩膀上):

  • clip / ALIGN:粗粒度对齐的代表,X-VLM 可视为它们的"细粒度增强版",代价是需要带 region 标注的数据。
  • ALBEF(X-VLM 直接前作):X-VLM 沿用其双塔+融合架构和 momentum distillation 思想,主要扩展是引入多粒度对齐 + bbox 预测。
  • VinVL / UNITER:依赖更强物体检测器抽 region feature,"先检测再对齐";X-VLM 是"端到端学多粒度",推理不依赖外部检测器。

向前看(它启发了谁):

  • blip / blip-2:同期/后续工作,BLIP 主攻用生成式 caption 做数据清洗(CapFilt),和 X-VLM 是互补思路(一个改对齐粒度、一个改数据质量);BLIP-2 把视觉编码器和 LLM 桥接,开启 VLM 大模型时代。
  • siglip:从损失函数角度改进图文对比(sigmoid 替 softmax),和 X-VLM 从粒度角度改进是不同维度。
  • llava:现代生成式 VLM,X-VLM 的多粒度 grounding 思想在需要"指认物体"的场景里被继承。
  • GLIP / Grounding DINO:把"检测 + 对齐"统一的后续代表,X-VLM 的多粒度对齐是这条线的早期思想源头。

所以这一节是想说:X-VLM 处在"CLIP 粗对齐 → 多粒度对齐 → grounding 类 VLM / 生成式 VLM"这条演进线的关键转折点上。


和本导读的关系

本篇主要对应导读 Ch08: VLM 地基(CLIP),并延伸到 Ch18: 多模态生态。Ch08 讲视觉-语言模型如何"同时认图和认字",起点是 CLIP 的整图-整文对齐;X-VLM 是这条线上"把对齐做细"的关键一步——从只会全局对齐,进化到能对齐到区域和物体。读完 CLIP 再读 X-VLM,能看清 VLM 从"粗"到"细"的技术脉络;再往后接 blip-2llava,就进入了生成式 VLM 的时代。

所以这一节是想说:把 X-VLM 放进 Ch08 的 VLM 演进谱系里读,它是"从粗粒度对齐迈向细粒度 grounding"这一格的代表作。


思考题

Q1:为什么只做整图-整文对齐的模型(如 CLIP)在"视觉定位"任务上表现差?

提示

CLIP 训练时只学"整张图 ↔ 整句话",从没被要求分辨"图里哪一块对应哪个词"。它的特征空间里没有"区域"这个概念,所以让它框出"左边那只狗"时没有对应的监督信号支撑。X-VLM 通过区域-短语对齐和 bbox 预测显式补上了这一课。

Q2:X-VLM 为什么坚持"推理时不依赖外部检测器"?依赖检测器有什么坏处?

提示

外部检测器(Faster R-CNN)慢、僵硬(box 数量/类别固定)、且只认训练过的类别,检测器没见过的物体就抓瞎,还会成为整个流水线的瓶颈和误差来源。X-VLM 让 ViT 自己从 patch 聚合区域特征,box 只在训练时当监督用,推理时完全自足,更快更灵活。

Q3:X-VLM 同时优化 ITC、ITM、MLM、bbox 四个损失,它们各自负责补什么能力?

提示

ITC 负责粗粒度拉开距离(快速筛选式对齐);ITM 在融合后做细致的"是否匹配"二分类,配难负样本磨区分力;MLM 逼模型真看图才能填空(图文深度关联);bbox 预测提供最直接的细粒度定位监督。四者互补,缺一则某种能力弱化。

Q4:区域特征和整图特征都来自"同一套 patch 特征的不同聚合",这样设计有什么好处?

提示

保证粗细粒度落在同一个表征空间里,下游任务可以自由按需提取任意粒度而无需两套模型/两套特征;也让"整图理解"和"区域理解"互相受益(学好区域有助于理解整图,反之亦然),而不是割裂训练。

Q5:X-VLM 依赖带 region 标注的数据(如 Visual Genome),这对它的可扩展性意味着什么?和 CLIP 靠海量网络数据相比谁更容易 scale?

提示

带 box+描述的 region 标注需要人工精细标注,规模远小于网络爬取的图-文对,扩展成本高、天花板低。CLIP 只需整图-整文对,能吃十亿级网络数据,更容易 scale。这是 X-VLM 换取细粒度能力付出的代价——细粒度收益 vs 数据规模的权衡。

Q6:为什么 ITM 里要专门挑"难负样本",而不是随便找不匹配的图文对?

提示

随便找的负样本(比如"一只狗"配"一辆卡车")一眼就能判假,模型学不到什么。难负样本是"看起来很像但其实不配"的对(比如"黑狗玩球"配"棕狗玩球"),逼模型关注细节差异,才能真正磨出区分力。通常用 ITC 的相似度分数来挑这些难负样本。

Q7:X-VLM 是"对齐/理解型"模型,不能像 LLaVA 那样自由生成对话回答。如果想让它具备生成能力,大致要怎么改?

提示

需要在其视觉编码器之后接一个语言生成模型(LLM),并用一个桥接模块(如 BLIP-2 的 Q-Former 或简单投影层)把视觉特征映射到 LLM 的输入空间,再做指令微调。X-VLM 的多粒度视觉表征可以作为很好的视觉底座,但生成能力要靠后接的 LLM 提供。

所以这一节是想说:这几个问题带你把"为什么需要多粒度、检测器的代价、四损失分工、共享表征、数据规模权衡、难负样本、如何走向生成式"这些核心点自己推一遍。


一些好奇心问答(FAQ)

Q1:X-VLM 和 CLIP 到底谁强?

不是同一维度的比较。CLIP 强在简单可扩展、吃海量数据、零样本分类强;X-VLM 强在细粒度理解和视觉定位。要做"用一句话搜图库"CLIP 够用且更省;要做"框出图里那个红杯子"就得用 X-VLM 这类多粒度模型。

Q2:训练时用的 box 从哪来?推理时也要提供 box 吗?

训练时的 box 来自数据集标注(Visual Genome、COCO 等)。推理时不需要外部提供 box,也不需要外部检测器——模型自己从 patch 聚合出需要的区域表征;做视觉定位任务时反而是模型输出 box。

Q3:X-VLM 算大模型吗?

不算。base 版约 ViT-B 量级(几亿参数),比后来的 BLIP-2、LLaVA 这类接了大 LLM 的动辄数十亿参数小得多。它是"预训练理解模型",不是生成式大模型。

Q4:为什么视觉定位是 X-VLM 最受益的任务?

因为训练时它专门学了"region ↔ phrase 对齐"和"给短语预测 box",这和视觉定位任务(给描述找 box)几乎是同一件事。训练目标和下游任务高度对齐,收益自然最大。

Q5:读完 X-VLM 接下来看什么?

想看它的前身粗粒度对齐看 clip;想看互补的数据清洗思路看 blip;想看走向生成式 VLM 看 blip-2llava;想看损失函数维度的改进看 siglip

所以这一节是想说:X-VLM 强在细粒度、不是大模型、推理不需外部 box、定位任务收益最大——这些实操问题都有明确答案。


如果你想再深入

按"前身 → 互补思路 → 后续演进"排序:

  1. 前身:clip —— 粗粒度对齐的起点,理解 X-VLM 在补什么课。
  2. 互补:blip —— 同期工作,从数据质量而非粒度角度改进 VLP。
  3. 后续:blip-2 / llava —— VLM 从"对齐理解"走向"生成对话"的关键。
  4. 另一维度:siglip —— 从损失函数改进图文对比学习。

所以这一节是想说:把 CLIP + X-VLM + BLIP-2 连起来读,就能看清 VLM 从"粗对齐 → 细对齐 → 生成式"的完整演进。


原文信息

  • 标题:Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts (X-VLM)
  • arXiv:https://arxiv.org/abs/2111.08276
  • 发表:ICML, 2022
  • 年份:2022

BibTeX:

@inproceedings{zeng2022xvlm,
  title     = {Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts},
  author    = {Zeng, Yan and Zhang, Xinsong and Li, Hang},
  booktitle = {International Conference on Machine Learning (ICML)},
  year      = {2022},
  url       = {https://arxiv.org/abs/2111.08276}
}

所以整篇是想说:X-VLM 用"从 patch 聚合多粒度视觉特征 + 多粒度对齐损失 + bbox 预测",让视觉-语言模型在不依赖外部检测器的前提下,同时学会整图、区域、物体三种粒度的对齐——它是 VLM 从"只会看整张图"迈向"能指认图里每个细节"的关键一步。

引用本笔记 / Cite this note
BibTeX
@online{eai_x_vlm_2026,
  title       = {(readable note) X-VLM: Multi-Grained Vision Language Pre-Training},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2022 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/x-vlm/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?