Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 137

What matters when building vision-language models?

25 min read · 8687 字 · ⭐⭐⭐ · 长篇结构化

这是一份写给"完全没接触过 AI"的读者的精读笔记。语言尽量像聊天,实验和术语全部翻译成人话。

一句话讲什么(TL;DR)

做"看图说话大模型"时,大家凭感觉选零件(用哪个语言模型、图和文怎么拼、图切多少块),却很少做对照实验。这篇论文把每个选择单独拎出来做受控实验,整理成一份"避坑清单",再照着清单训了一个 8B 的模型 Idefics2 当样板——它在同尺寸里最强,有些指标甚至追平大它 4 倍的模型。

所以这一节是想说:这不是"又一个更强的模型",而是一份"做 VLM 时每个设计选择到底该怎么选"的实验说明书,附带一个照着做出来的样板模型。


这是个什么场景

现在很火的一类 AI 叫 VLM(Vision-Language Model,视觉-语言模型):你给它一张图 + 一句话,它输出一段文字。它能读扫描版 PDF、解释图表、认出图里的文字、数图里有几个东西、甚至把网页截图变成代码。

这类模型怎么造?通常是"拼装"出来的:

拿一个现成的语言模型(会说话的大脑)+ 一个现成的图像编码器(会看图的眼睛),中间接一个"转接头"把图像信息翻译成语言模型能读的形式,然后用海量"图 + 配文"数据训练。

问题来了:这个"拼装"过程里有一大堆选择——用哪个语言模型?用哪个眼睛?转接头怎么设计?图和文怎么拼在一起?一张图该变成多少个"视觉 token"(视觉小块)?训练时哪些部分该冻住、哪些该放开?

论文作者发现一个尴尬现象:这些关键选择,绝大多数论文都没做过对照实验,就凭感觉定了。 于是大家看到某个模型效果好,根本分不清是哪个选择的功劳——是语言模型强?还是图切得多?还是转接头巧?这让整个领域"进步"得很盲目。

类比:一群厨师都在做番茄炒蛋,但每个人同时换了火候、油量、下锅顺序、番茄品种……最后有人做得好吃,却没人说得清到底是哪个改动起了作用。

Idefics2 这篇论文就是来当那个"严谨的厨师":一次只改一个变量,把每个选择的影响单独测出来,最后整理成一份可复用的经验清单,并照着这份清单训了个样板模型证明清单管用。

所以这一节是想说:VLM 是拼装出来的,但拼装的关键选择一直没人认真做对照实验;这篇论文来把每个选择的影响单独量化清楚。


What matters when building vision-language models? — 场景示意:这论文要解决的现实问题
Plate Nº IWhat matters when building vision-language models? — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 现状 A:架构选择凭感觉。 图像信息怎么进语言模型,主要有两派。一派用交叉注意力(cross-attention)——像 Flamingo,在语言模型的层之间插入模块让它"侧眼看图";另一派用全自回归拼接(fully autoregressive)——像 LLaVA,直接把图像特征当成一串"视觉 token"和文字 token 拼在一起喂进去。这两派谁更好,从没被正经对比过,各自的计算/数据/效果权衡也说不清。

  • 现状 B:视觉 token 数量凭习惯。 很多模型把图像编码器的所有输出都塞给语言模型,导致一张图动辄 576(DeepSeek-VL)到 2890(SPHINX-2k)个视觉 token。序列超长,训练贵、还难做多图上下文。大家默认"token 越多越好",但没验证过。

  • 现状 C:训练策略各说各话。 该冻住预训练的骨干还是放开训练?之前有工作说"放开视觉骨干会掉性能",有工作说要多阶段训练——结论互相矛盾,缺少受控对比。

  • 核心问题:整个领域充斥着"未经证明的设计决定"。这让人无法判断"到底哪个选择真正决定了性能",社区因此难以扎实地进步。

所以这一节是想说:架构、视觉 token 数、训练策略这三大类选择,之前要么没对比、要么结论打架;缺一份基于受控实验的权威清单。


这篇论文的新想法

一句类比:与其继续"凭手感炒菜",不如做一套严格的对照实验——控制其他所有变量,一次只改一个(换语言模型、换眼睛、换转接头、换图切法),看分数怎么变。把这些实验结论写成一份"避坑清单",再照着清单认认真真做一道菜(Idefics2)证明清单靠谱。

论文的核心贡献是六条经过受控实验验证的发现(Findings),可以浓缩成:

  1. 语言模型比眼睛更重要。 固定其他条件,换个更强的语言模型带来的提升,比换个更强的图像编码器大。

  2. 放开训练时,全自回归架构赢过交叉注意力。 有一个反转:如果冻住骨干,交叉注意力更好;但一旦放开骨干训练,全自回归反超——尽管它参数更少。

  3. 放开全自回归会训崩,LoRA 能救。 直接放开全自回归架构的骨干会训练发散,用 LoRA(一种轻量微调)既加了表达力又稳住了训练。

  4. 视觉 token 越少反而越好(在合理范围内)。 用一个"学习式池化"(perceiver resampler)把一张图的视觉 token 从 729 压到 64,不但省算力,性能还涨了 8.5 分。

  5. 保留图片原始长宽比和分辨率不掉分。 不用把图强行压成正方形,既省显存又不损性能。

  6. 切分图片能用算力换性能。 把一张图切成几块 + 原图一起喂,能提升"读图里文字"这类任务,代价是 token 变多——这是个可调的旋钮。

然后作者照着这份清单,用 SigLIP-SO400M(眼睛)+ Mistral-7B(大脑)训出 Idefics2(8B),并把模型、数据集全部开源。

所以这一节是想说:这篇论文的"新想法"不是一个新架构,而是六条用受控实验证明的设计准则,外加一个照着准则做出来、验证准则有效的开源样板模型。


它分几步做的(方法)

这一节最详细。论文的"方法"其实是"一套受控实验 + 一个照方抓药的模型"。我把它拆成两大块:先讲六条实验发现(每条按"问题 → 怎么测 → 结论 → 为什么"讲),再讲照着这些发现搭 Idefics2 的具体步骤。

先看 VLM 的通用拼装结构,帮你建立全局:

   图片 ──► 图像编码器(眼睛)──► 一串视觉特征 ──► [转接头]──► 视觉token(如64个)
                                                              │
   文字 ──────────────────────────────► 文字token ───────────┤
                                                              ▼
                                            ┌──────────────────────────┐
                                            │  语言模型(大脑) 输出文字   │
                                            └──────────────────────────┘

  两种"图像怎么进大脑":
   (A) 全自回归:视觉token 和文字token 直接拼成一串喂进去   ← Idefics2 选这个
   (B) 交叉注意力:在大脑的层之间插模块让它"侧眼看图"

发现 1:眼睛重要,但大脑更重要

问题:固定其他条件,换更好的语言模型 vs 换更好的图像编码器,哪个提升更大?

怎么测:固定骨干规模、训练数据、训练步数,只换一个组件,看 4 个基准的平均分。

结论(数字)

  • 把语言模型从 LLaMA-1-7B(MMLU 35.1%)换成 Mistral-7B(MMLU 60.1%),平均分从 62.5 → 67.6,涨 5.1
  • 把图像编码器从 CLIP-ViT-H(ImageNet 78.0%)换成 SigLIP-SO400M(ImageNet 83.2%),涨 3.3

为什么:VLM 说到底是"用语言组织答案",语言模型的推理和知识决定了上限。眼睛负责"看清",但看清之后的理解、推理、表达都靠大脑。所以大脑的质量对最终 VLM 影响更大。(有个有趣旁注:EVA-CLIP-5B 比 SigLIP-SO400M 大 11 倍,效果却相当,说明它可能训练不足——社区缺一个"又大又训得好"的视觉编码器。)

发现 2:全自回归 vs 交叉注意力,看你冻不冻骨干

问题:图像信息进大脑,用交叉注意力还是全自回归拼接更好?

怎么测:先冻住两个骨干只训新参数,再放开骨干(用 LoRA)训,两种设置都比。

结论(数字,架构+训练消融表)

架构 骨干训练方式 平均分
全自回归(无 Perceiver) 冻住 51.8
全自回归 冻住 60.3
交叉注意力 冻住 66.7
交叉注意力 LoRA 67.3
全自回归 LoRA 69.5

结论(人话):冻住骨干时,交叉注意力更好(66.7 > 60.3)——尽管它多了 1.3B 可训练参数、推理还多花 10% 算力。但一旦放开骨干(LoRA),全自回归反超(69.5 > 67.3),而且它参数更少、推理更省。

为什么:冻住时,全自回归只有约 15% 参数能训(交叉注意力约 25%),表达力受限,所以交叉注意力凭"参数多"占优。放开后,全自回归的简洁结构 + 骨干可调,把这份劣势翻盘。论文由此选全自回归——省参数、省推理、放开训更强。

发现 3:放开全自回归会训崩,LoRA 是安全绳

问题:既然放开骨干更好,为什么大家不都放开?

怎么测:直接全量放开全自回归的骨干训练。

结论:训练发散(loss 崩),即便疯狂降学习率、逐步解冻也救不回来。改用 LoRA(只在骨干上加少量可训练的低秩参数)后,训练稳了,且全自回归性能大涨 12.9 分(交叉注意力只涨 0.6)。

为什么:全量放开会让优化不稳定。LoRA 用很小的代价给骨干加"可调空间",既提表达力又稳训练,而且 LoRA 层事后能合并回原权重,推理零额外开销。这也解释了为什么之前有人说"放开视觉骨干会掉性能"——他们没用参数高效微调,方法不同。

发现 4:视觉 token 越少反而越好——学习式池化

问题:一张图该给语言模型多少个视觉 token?

怎么测:用 perceiver resampler(一种可学习的 Transformer 式池化)把大量视觉特征"重采样"成固定的少量 token(token 数 = 查询/latent 的个数),对比不同 token 数。

结论(数字):学习式池化把每张图的视觉 token 从 729 压到 64,平均分涨 8.5。而且超过 64 个 token 再加也没收益(Perceiver 128 个 71.2 vs 64 个 71.7)。

为什么:直接把编码器所有输出(几百上千个 token)塞给语言模型,序列超长、训练贵,还稀释了信息。可学习的池化会"挑重点"——把最有用的信息浓缩进 64 个 token。少而精 > 多而杂。这是 Idefics2 效率碾压对手(对手 576–2890 token)的关键。

发现 5:保留原始长宽比和分辨率不掉分

问题:图像编码器通常吃固定大小的正方形图,要不要把图强行压成正方形?

怎么测:让编码器直接吃原始长宽比/分辨率的图(插值位置编码 + LoRA 适配),对比强行 resize。

结论:保留原始长宽比和分辨率不损性能,还省显存、训练推理更快。

为什么:强行 resize 会扭曲图(对"读长文本"这类任务尤其糟);固定分辨率则要么丢细节(太低)要么浪费算力(太高)。让模型吃原始尺寸,用户就能按需决定"每张图花多少算力"。

发现 6:切图能用算力换性能

问题:怎么在不动模型结构的前提下用更多算力换更高性能?

怎么测:把一张图切成 4 块 + 原图 = 5 张图一起喂(指令微调阶段)。

结论:这招显著提升"读图里文字"的任务(TextVQA、DocVQA)。代价是 token 从单图 64 涨到 320。有趣的是,只对 50% 样本切图不影响收益;而进一步提高子图分辨率带来的额外提升很小(TextVQA 73.6 vs 73.0)——切图本身比"切完再提分辨率"更关键。

为什么:读图里的小字需要高有效分辨率。切图相当于"放大局部再看"。这是个可调旋钮:不缺算力就切图冲性能,缺算力就用单图(64 token)。同一个模型权重,推理时选 64 或 320 token 即可。

照着清单搭 Idefics2

机制(输入→处理→输出)

  • 组件:眼睛用 SigLIP-SO400M,大脑用 Mistral-7B-v0.1,架构选全自回归 + perceiver 池化(64 token/图),骨干用 LoRA 放开。
  • 预训练(分两阶段省算力):数据用三类——OBELICS(网页级图文交错文档,3.5 亿图、1150 亿文本 token)、图文对(用 LAION COCO 的合成描述提质量)、PDF 文档(OCR-IDL 1900 万 + PDFA 1800 万页,练 OCR 能力)。第一阶段限图像分辨率 384(大批量 2048),第二阶段引入 PDF、分辨率提到 980。
  • 指令微调:作者自建并开源 The Cauldron——50 个视觉-语言数据集的大合集(含 VQA、计数、图表、文档、几何、找不同、截图转代码等),加文本指令数据,用 DoRA(LoRA 变体)微调,配 NEFTune、随机分辨率等抗过拟合技巧。
  • 对话优化:再用对话数据(LLaVA-Conv、ShareGPT4V)训出 Idefics2-chatty,让它爱聊、格式友好。
  • 输出:Idefics2 的 base / instructed / chat 三个版本,全部开源。

所以这一节是想说:方法 = 六条受控实验发现(大脑>眼睛、全自回归+LoRA、少视觉token、保留长宽比、切图换性能)+ 照方抓药搭出的 Idefics2。核心不是某个新模块,而是"把每个选择的影响单独量化"这套方法论。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【What matters when building vision-l… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   Idefics2     ──► 8B                     ──► …
   Idefics2     ──► 8B                     ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

What matters when building vision-language models? — 方法示意:核心 pipeline
Plate Nº IIWhat matters when building vision-language models? — 方法示意:核心 pipeline

关键数字(What works)

数字来自论文表格。评价用 MMMU(大学级多学科题)、MathVista(数学推理)、TextVQA(读图中文字)、MMBench(综合感知推理)等,都是零样本。

数字 1:Idefics2 8B 用 64 token 打赢更大的对手

模型 规模 每图 token 数 MMMU MathVista TextVQA MMBench
LLaVA-NeXT 13B 2880 36.2 35.3 67.1 70.0
DeepSeek-VL 7B 576 36.6 36.1 64.4 73.2
MM1-Chat 7B 720 37.0 35.9 72.8 72.3
Idefics2 8B 64 43.5 51.6 70.4 76.8
Idefics2 8B 320 43.0 51.4 73.0 76.7

含义:Idefics2 在 MMMU(43.5)、MathVista(51.6)、MMBench(76.8)上全面领先同尺寸对手,而且每张图只用 64 个视觉 token(对手 576–2880)。数学推理(MathVista 51.6 vs 对手 ~36)差距尤其大。切到 320 token 时 TextVQA 从 70.4 涨到 73.0——同一个模型,推理时按需选 token 数。

数字 2:换大脑 vs 换眼睛

改动 平均分变化
LLaMA-1-7B → Mistral-7B(换大脑) +5.1
CLIP-ViT-H → SigLIP-SO400M(换眼睛) +3.3

含义:换更强的语言模型收益(+5.1)大于换更强的图像编码器(+3.3)。大脑比眼睛更决定 VLM 上限。

数字 3:学习式池化——token 从 729 到 64,性能还涨

设置 每图视觉 token 平均分
无池化 729 基线
Perceiver 池化 64 +8.5
Perceiver 池化 128 71.2(vs 64 的 71.7,无提升)

含义:少而精的视觉 token 既省算力又提性能,且 64 是甜点,再多无益。

数字 4:LoRA 放开骨干的威力

架构 冻住骨干 LoRA 放开
全自回归 60.3 69.5(+12.9)
交叉注意力 66.7 67.3(+0.6)

含义:放开骨干对全自回归是质变(+12.9),把它从"不如交叉注意力"翻盘成"最强"。LoRA 是让这一步能稳定发生的关键。

数字 5:OCR 数据 + 分辨率的协同

OCR 数据 分辨率 DocVQA
384 22.6
768 42.9
768 49.9

含义:读文档能力需要"OCR 数据 + 足够分辨率"两者配合——光提分辨率不够,加了 PDF 数据才从 42.9 涨到 49.9。

所以这一节是想说:数据讲了几件事——Idefics2 用极少 token 打赢更大模型、大脑比眼睛更重要、少 token 反而更好、LoRA 让全自回归翻盘、OCR 能力靠数据+分辨率协同。


实验结果说明了什么

上一节列数字,这一节回答这些实验解决了哪些科学问题。

问题一:VLM 的进步主要靠什么?

论文的第一条发现给了明确答案:主要靠更好的单模态骨干,尤其是语言模型。换更强的大脑(+5.1)比换更强的眼睛(+3.3)收益大。这有点反直觉——很多人以为"看图"任务眼睛最重要。但 VLM 的本质是"用语言理解和表达关于图的一切",语言模型的推理/知识是天花板。这条结论指导了整个社区:想提升 VLM,优先投资更强的语言基座。

问题二:那个困扰领域已久的"交叉注意力 vs 全自回归"之争,答案是什么?

论文用受控实验给了细致的答案,而且带一个反转:冻住骨干时交叉注意力更好,放开骨干时全自回归更好。这解释了为什么以前的对比结论互相矛盾——大家在不同的训练设置下比,自然得出不同结论。论文进一步指出关键前提:全自回归放开会训崩,必须用 LoRA。这把一个模糊的争论,变成了"在什么条件下选什么"的清晰指南。全自回归 + LoRA 成了后续很多开源 VLM 的默认配方。

问题三:"视觉 token 越多越好"这个common sense对吗?

不对。论文发现学习式池化把 token 从 729 压到 64 反而涨 8.5 分,且超过 64 无益。这挑战了当时"更多视觉 token = 更强"的主流看法(有工作确实这么认为)。原因是:语言模型处理超长视觉序列既贵又容易被无关信息干扰;可学习池化把信息浓缩,反而更好。这条发现直接让 Idefics2 用 1/10 甚至 1/40 的 token 打赢对手——效率上的巨大胜利。

问题四:读文档/图表这类"要看清小字"的能力从哪来?

论文拆出两个协同因素:OCR 训练数据 + 足够的图像分辨率。消融显示光提分辨率不够(DocVQA 42.9),加了 PDF 数据才到 49.9。而推理时的"切图"是第三个旋钮——把图切块放大局部,进一步提升读字任务。这说明"读图中文字"不是单一开关,而是数据、分辨率、切图三者的组合。

问题五:这些发现能复现/开源吗,还是又一个闭源黑箱?

论文把模型(base/instructed/chat)、训练数据(The Cauldron、OBELICS)全部开源。这是它区别于很多"报个高分就完事"工作的地方——它的价值在于可复用的方法论 + 可复现的资源。对社区而言,这份"避坑清单 + 开源配方"比单纯一个高分模型更有长期价值。

所以这一节是想说:实验系统回答了五个关键问题——进步主要靠语言骨干、架构之争取决于是否放开骨干、视觉token越多不一定越好、读字能力靠数据+分辨率+切图协同、以及全套开源可复现。


你应该懂的几个新词

VLM(Vision-Language Model,视觉-语言模型):输入图 + 文、输出文的大模型。能读 PDF、解释图表、认图中文字等。Idefics2 就是一个 8B 的 VLM。

图像编码器 / 视觉骨干(Vision Encoder/Backbone):把图变成一串数字特征的"眼睛"。本文用 SigLIP-SO400M。

语言模型骨干(LM Backbone):负责理解和生成文字的"大脑"。本文用 Mistral-7B。

交叉注意力架构(Cross-attention):在语言模型层之间插模块让它"侧眼看图"(Flamingo 式)。

全自回归架构(Fully Autoregressive):把视觉特征当成 token 直接和文字 token 拼一起喂进语言模型(LLaVA 式)。本文证明放开骨干时它更优。

视觉 token(Visual Token):一张图被转成的若干"小块",喂给语言模型的单位。数量从 64 到几千不等,本文主张 64 就够。

Perceiver Resampler(学习式池化):一个可学习的 Transformer 式模块,把大量视觉特征"重采样"成固定的少量 token。本文用它把 729 压到 64。

LoRA / DoRA(低秩适配):一种参数高效微调——只在原模型上加少量可训练参数,既省算力又能稳定训练,事后可合并回原权重。本文靠它稳住全自回归的骨干训练。

OBELICS:本团队之前发布的网页级"图文交错文档"数据集(3.5 亿图、1150 亿文本 token),是 Idefics2 预训练的主力数据。

The Cauldron:本文开源的 50 个视觉-语言数据集合集,用于指令微调。

零样本(Zero-shot):不为具体基准专门训练,直接评测。本文主结果都是零样本。

所以这一节是想说:这十来个词是理解"如何拼装一个 VLM"的核心词汇,先把它们和"眼睛/大脑/转接头"这套类比挂上钩。


它有什么搞不定的

论文很严谨,但也有边界(部分明说,部分为基于内容的推断,已标注):

  • 评测指标本身有偏差(论文明说):开放式 VQA 的评分严厉惩罚"格式不一样"的答案——回答"large"而标准答案是"big"就算错。论文自己承认在 VQAv2 这类基准上,差 5 分肉眼几乎看不出区别。所以基准分数不能全信。

  • "聊天"和"刷分"难两全(论文明说):评测基准要极短答案,但人类喜欢长回答。Idefics2 在"精确遵守格式"上会犯难,得专门再训一个 chatty 版来平衡——说明"跑分高"和"好用"之间有张力。

  • 结论受限于实验规模(推断):消融大多只训 6000 步、在 4 个基准上测平均分。这些"小规模受控实验"的结论是否在超大规模、超长训练下依然成立,论文自己也留了余地(比如"无限数据下更多 token 或许有用")。

  • 缺"又大又训得好"的视觉编码器(论文明说):论文发现 EVA-CLIP-5B 比 SigLIP 大 11 倍却效果相当,怀疑它训练不足。这意味着"换更强眼睛"这条路目前被"没有好的大视觉编码器"卡住了。

  • 仍有偏见/安全风险(论文明说):作者对抗性测试发现模型可能生成不准确、有偏见或冒犯性的内容,附录专门报告。这是所有大模型的通病,Idefics2 不例外。

所以这一节是想说:Idefics2 给了扎实的设计清单,但受评测指标偏差、聊天vs刷分的张力、实验规模、缺好视觉编码器、以及安全风险等边界约束。


它和别的几篇是什么关系

  • 站在 LLaVA / Flamingo 的两条路之间(本仓库有相关笔记):LLaVA 代表全自回归拼接,Flamingo 代表交叉注意力。Idefics2 的核心贡献之一就是把这两条路正经对比清楚,并给出"放开骨干时选全自回归"的结论。它是这场架构之争的"裁判"。

  • 承接 Idefics1 / OBELICS(同团队):Idefics2 是 HuggingFace 团队 Idefics 系列的第二代,复用了自家的 OBELICS 图文交错数据集。相比一代,二代把"设计选择"做成了系统实验。

  • 用 SigLIP 当眼睛、Mistral 当大脑(本仓库有 SigLIP 笔记):它的组件选择本身就是发现的落地——SigLIP-SO400M 是当时性价比最高的视觉编码器,Mistral-7B 是当时最强的开源小语言模型。

  • 和 DeepSeek-VL / MM1 / LLaVA-NeXT 同代竞争(本仓库有 deepseek-vl 笔记):都是 2024 年前后的开源 VLM。Idefics2 的差异化是"极少视觉 token(64)+ 完整的设计消融 + 全开源"。

  • 方法论上呼应"消融驱动"的研究范式:它和 MM1、Prismatic VLMs 等同期工作一起,把 VLM 研究从"报高分"推向"讲清楚每个选择为什么"。

所以这一节是想说:Idefics2 是 LLaVA 与 Flamingo 两条架构路线之争的裁判、Idefics 系列的第二代、以及"消融驱动"研究范式的代表作之一。


和本导读的关系

本笔记对应导读 Ch09: BLIP-2 与 LLaVA

Ch09 讲的是"生成式视觉-语言模型"——从 BLIP-2 的 Q-Former 到 LLaVA 的"投影 + 拼接",即如何把视觉信息接进大语言模型让它"看图说话"。Idefics2 正是这条线的一次系统性总结与优化:它把 Ch09 里 LLaVA(全自回归)和 Flamingo(交叉注意力)两种接法拿来做受控对比,还把"转接头怎么设计(perceiver 池化)、视觉 token 给多少、骨干怎么训(LoRA)"这些 Ch09 里被一带而过的选择全部量化清楚。

读完本笔记,建议按导读 Ch09 的路线继续:先确保理解 LLaVA(全自回归拼接的原型,Idefics2 采用的架构路线)和 BLIP-2(Q-Former 式转接头,和 perceiver 池化思路相通),再回头看本文的六条发现,就能明白"为什么 Idefics2 这样选"。往上可连 Ch08(CLIP/SigLIP)——那是 Idefics2 "眼睛"的来源;SigLIP 为什么被选中,本文发现 1 给了答案。

从知识图谱角度,本笔记是理解"现代开源 VLM 怎么拼"的枢纽——它把散落在各篇论文里的设计选择收敛成一份清单,是读任何后续 VLM(Qwen-VL、InternVL、DeepSeek-VL)时的对照基准。

所以这一节是想说:本笔记是导读 Ch09"生成式 VLM"的方法论总结篇,读完可沿 LLaVA/BLIP-2 回看架构原型、沿 CLIP/SigLIP 回看视觉骨干,把"VLM 怎么拼"彻底看透。


思考题

以下问题用来检验你是否真正理解了论文核心。每题附折叠提示,建议先自己想 30 秒。

Q1:论文发现"换语言模型比换图像编码器收益大"。为什么"看图"任务里,负责说话的大脑反而比负责看的眼睛更重要?

提示

因为 VLM 的本质是"用语言理解、推理、表达关于图的一切"。眼睛负责把图看清、提取特征,但看清之后的知识调用、逻辑推理、组织答案全靠语言模型。眼睛决定"信息进不进得来",大脑决定"信息用得多好",而后者才是大多数任务的瓶颈(尤其推理类如 MathVista)。所以换更强的大脑收益更大。

Q2:为什么"冻住骨干时交叉注意力更好,放开骨干时全自回归更好"?这个反转的根源是什么?

提示

根源是"可训练参数的比例"。冻住时,全自回归只有约 15% 参数能训,表达力受限;交叉注意力约 25%,还多了 1.3B 专门的可训练参数,所以凭"参数多"占优。一旦放开骨干(用 LoRA),全自回归的骨干也能调了,它简洁高效的结构(更少参数、更省推理)就把优势发挥出来,反超交叉注意力。所以关键前提是"骨干冻不冻"。

Q3:直觉上"给语言模型看更多视觉 token = 看得更清楚 = 更强"。为什么论文发现把 token 从 729 压到 64 反而更好?

提示

两个原因:(1) 超长视觉序列让语言模型处理成本剧增,还挤占了它处理文字的能力。(2) 编码器原始输出里有大量冗余/无关信息,直接全塞进去会稀释关键信号。可学习的 perceiver 池化会"挑重点",把最有用的信息浓缩进 64 个 token——少而精胜过多而杂。而且实验显示超过 64 就没收益了,说明 64 已经装下了这个规模下的有用信息。

Q4:为什么直接放开全自回归骨干会训崩,而 LoRA 能救?LoRA 到底做了什么?

提示

全量放开所有骨干参数会让优化极不稳定(loss 发散),降学习率、逐步解冻都救不回。LoRA 只在骨干的权重上加少量"低秩"可训练参数,相当于给骨干一个"小而受约束的可调空间"——既增加了表达力(比完全冻住强),又因为改动量小而稳定。额外好处:LoRA 层事后能合并回原权重,推理时零额外开销。所以它是"表达力"和"稳定性"的折中点。

Q5:Idefics2 同一个模型可以用 64 或 320 token 推理。这个设计的实际价值是什么?

提示

它把"算力 vs 性能"变成一个推理时可调的旋钮,无需重训。日常/算力紧张时用 64 token(快、省),遇到"读图中小字"这类需要高有效分辨率的任务时切图用 320 token 冲性能。同一套权重适配两种需求,部署非常灵活。这源自发现 6(切图换性能)——切图只在需要时开。

Q6:论文自己承认"评测指标有偏差"(回答 big vs large 会被算错)。这对我们看待 VLM 排行榜有什么启示?

提示

启示是:不能只看基准分数的绝对高低,尤其是开放式 VQA 这类严格匹配格式的指标——差几分可能只是"表达方式不同"而非真实能力差距。论文明说 VQAv2 上差 5 分肉眼几乎看不出。所以评估 VLM 要结合任务类型(读字类如 DocVQA 答案明确、偏差小;开放描述类偏差大)、看多个基准、必要时人工盲评,而不是迷信单一排行榜。

Q7:这篇论文最大的贡献是 Idefics2 这个模型,还是别的?为什么?

提示

最大贡献不是模型本身,而是一套用受控实验验证的设计准则(六条发现)+ 全套开源资源(模型、OBELICS、The Cauldron)。Idefics2 只是"证明清单管用"的样板。因为模型会很快被超越,但"大脑比眼睛重要、放开骨干选全自回归+LoRA、少视觉token更好"这些方法论结论和开源数据,能长期指导整个社区扎实地造 VLM——这比一个高分模型的价值持久得多。

所以这一节是想说:能答这 7 题,说明你抓住了论文的精髓——它是一份方法论清单,核心是"每个设计选择的影响都被单独量化",而非又一个刷分模型。


一些好奇心问答(FAQ)

Q1:Idefics2 到底多大?和 GPT-4V 比呢?

8B 参数,属于"小而精"。论文说它在同尺寸最强,有些指标(如 MathVista、TextVQA)追平大它 4 倍的模型,甚至在部分基准上匹敌闭源的 Gemini 1.5 Pro。但它不是要打 GPT-4V 这种超大闭源模型,而是证明"精心设计的小模型能很能打"。

Q2:"全自回归"和"交叉注意力"哪个是现在主流?

本文之后,全自回归 + LoRA(放开骨干)成了很多开源 VLM 的默认配方,因为它省参数、省推理、放开训更强。交叉注意力(Flamingo 式)在需要处理超多图/超长上下文的场景仍有价值。

Q3:为什么 64 个视觉 token 就够,别人却用几千个?

因为别人多数没做过对照实验,默认"越多越好"。本文用 perceiver 池化证明 64 个精选 token 就能装下这个规模下的有用信息,再多无益。少 token 让语言模型更专注、训练更省——这是 Idefics2 的效率杀手锏。

Q4:The Cauldron 是什么,为什么重要?

是本文开源的 50 个视觉-语言数据集合集,涵盖 VQA、图表、文档、几何、找不同、截图转代码等,统一成问答格式用于指令微调。重要在于它把"指令微调该用什么数据"这件事标准化、开源化了,别人可以直接用。

Q5:读 PDF/文档为什么需要特别处理?

因为读文档里的小字需要高有效分辨率 + OCR 训练数据。本文用了 1900 万 OCR-IDL + 1800 万 PDFA 页训练,第二阶段把分辨率提到 980,推理时还能切图放大。消融证明"光提分辨率不够,得配 OCR 数据"。

Q6:LoRA 会不会让模型变弱?

不会,反而更好(全自回归 +12.9)。LoRA 是"参数高效"而非"能力打折"——它用很小的可训练参数量达到接近全量微调的效果,还更稳定,且事后能合并回原权重,推理零额外成本。

Q7:之后该看什么?

想理解架构原型看 LLaVA(全自回归)和 Flamingo/BLIP-2(交叉注意力/Q-Former);想理解视觉骨干选择看 SigLIP / CLIP;想看同代竞品看 DeepSeek-VL / Qwen-VL / InternVL

所以这一节是想说:实操问题(多大、架构主流、为什么64token、数据集、读文档、LoRA 会不会变弱)作者都给了清晰答案,且资源全开源。


如果你想再深入

按"架构原型 → 组件 → 同代 → 数据"排序:

  1. 架构原型:LLaVA(全自回归)+ Flamingo(交叉注意力) — 本文对比的两条路线的原型。本仓库有 LLaVA、Flamingo 笔记。理解它们才懂本文的架构消融。
  2. 转接头思路:BLIP-2(Q-Former) — 和 perceiver 池化同属"把视觉压成少量 token"的思路,对照能看出不同的池化设计。
  3. 视觉骨干:SigLIP / CLIP — Idefics2 的"眼睛"来源,发现 1 解释了为什么选 SigLIP。本仓库有相关笔记。
  4. 同代竞品:DeepSeek-VL / Qwen-VL / InternVL — 对照能看出各家在"视觉 token 数、架构、数据"上的不同取舍。本仓库有相关笔记。
  5. 数据:OBELICS(本团队) — 理解图文交错文档为什么是 VLM 预训练的关键数据形态。本仓库有 OBELICS 笔记。

所以这一节是想说:把 LLaVA/Flamingo(架构)+ SigLIP(眼睛)+ OBELICS(数据)+ 本文(清单)连起来读,就能看清"现代开源 VLM 从组件到配方"的全貌。


原文信息

BibTeX

@inproceedings{laurencon2024idefics2,
  title     = {What matters when building vision-language models?},
  author    = {Lauren{\c{c}}on, Hugo and Tronchon, L{\'e}o and Cord, Matthieu and Sanh, Victor},
  booktitle = {Advances in Neural Information Processing Systems (NeurIPS)},
  year      = {2024}
}

链接

  • arXiv:arxiv.org/abs/2405.02246
  • 模型:HuggingFace 上的 Idefics2-8B(base / instructed / chatty 三版)
  • 数据集:The Cauldron、OBELICS(均开源)
  • 发表:NeurIPS 2024

所以这一节是想说:这是 HuggingFace 的 Laurençon et al. 2024 年发表于 NeurIPS 的工作,模型和数据全部开源,是"消融驱动、可复现"的开源 VLM 代表作。


最后一个画面

想象一个厨房里挤满了做番茄炒蛋的厨师,每个人都同时换了火候、油量、下锅顺序,最后有人做得好吃,却没人说得清为什么。

Idefics2 的作者走进来,说:"别乱试了。我一次只改一个变量。" 于是我们终于知道了——大脑比眼睛更决定味道,放开火候要用 LoRA 这个小夹子才不会烧糊,配料(视觉 token)不是越多越好、64 份刚刚好,图切成小块能让你看清菜谱上的小字。

然后他照着这份清单,认认真真做了一盘菜(Idefics2),端出来——用一半的料,味道追平了大它 4 倍的大厨。最后他把菜谱和食材全部公开,让所有人都能照着做。

所以最后一节是想说:Idefics2 真正留下的不是一盘菜,而是一份"每个选择为什么这么做"的公开菜谱——它把 VLM 研究从"凭手感"推进到了"讲得清"。

引用本笔记 / Cite this note
BibTeX
@online{eai_idefics_2_2026,
  title       = {(readable note) What matters when building vision-language models?},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/idefics-2/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?