Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 129

EVA-CLIP: Improved Training Techniques for CLIP at Scale

24 min read · 8359 字 · ⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,术语第一次出现必定义 + 类比。

一句话讲什么(TL;DR)

EVA-CLIP 不改 CLIP 的架构,只换了三个训练技巧——用一个已经"懂图"的视觉模型当起点、换个不闪腰的大 batch 优化器、训练时随机只看半张图——就用远少于对手的数据和算力,训出了更强的看图模型。最大的 EVA-02-CLIP-E/14+(50 亿参数、90 亿样本)在 ImageNet 上零样本分类拿到 82.0%。

所以这一节是想说:这篇论文的贡献不是新架构,而是证明"三个已知技巧的组合拳"能在同参数量下大幅降低 CLIP 的训练成本、同时提高精度——一份"用工程换效率"的教科书。


这是个什么场景

你手机相册里现在有几万张照片。哪天你想找"去年在海边吃冰淇淋那张",直接输文字就能搜出来——背后就是 **CLIP(Contrastive Language-Image Pre-training,对比语言-图像预训练)**这类模型在干活:它学会了把"一张图"和"一句描述"挂在同一根数轴上,谁靠得近就代表谁匹配。

但训这种模型贵得吓人。打个比方:

OpenCLIP 的做法像请一个完全没见过世界的小孩,扔进图书馆,让他一本一本翻"图配文绘本",硬翻几十亿本才学会"毛茸茸四条腿叫狗"。电费、显卡时间、清洗数据,样样都贵——训到 ViT-G/14 那种级别,动辄几百上千张 A100 显卡训好多天。

EVA-CLIP 的做法是:先让这个小孩玩一阵"看图猜缺角"游戏——给他半张被遮住的图,让他脑补另一半(这就是 MIM,Masked Image Modeling,掩码图像建模)。等他对"图里大概长啥样"已经有感觉了,再让他来学"图配文字"。起点高了,后面就不用翻那么多书。

再叠两个省钱小技巧:一次搬一大箱书(大 batch)、但换个不闪腰的搬法(LAMB 优化器);看图时眯着眼只看一半像素(随机丢一半 patch),翻书速度直接翻倍。

结果:用更少的书、更短的时间,考试分数反而更高。这就是 EVA-CLIP 想证明的事。

值得先说清楚:这篇论文其实覆盖了两代模型——EVA-01-CLIP 和更强的 EVA-02-CLIP,从 B/16 一直到 5.0B 的 E/14+,形成一整个高效家族。

所以这一节是想说:EVA-CLIP 面对的场景是"训 CLIP 太贵、扩规模又不稳",它的答案是用"好起点 + 稳优化器 + 眯眼看图"三招把成本砍下来、精度提上去。


EVA-CLIP — 场景示意:这论文要解决的现实问题
Plate Nº IEVA-CLIP — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:OpenAI CLIP(2021) 类比:第一个吃螃蟹的人,但食谱不外传。自己攒了 4 亿对私有图文数据,用对比学习从零训 ViT + 文本编码器。开了路,但数据不开源,别人没法复现。

  • 方案 B:OpenCLIP / LAION 类比:把螃蟹做法公开并越做越大。用公开的 LAION-2B / LAION-5B 训出 ViT-G/14 等大模型。问题:训练慢、卡时贵、收益边际递减——要做到 G/14 级别,单次训练要烧掉几百张 A100 好多天。

  • 方案 C:单纯堆数据 / 堆参数 类比:书读得越多越好、脑子越大越好。业界主流路径之一,但成本呈爆炸式上升,且从零随机初始化训大 CLIP 极不稳定,容易训崩。

  • 方案 D:MIM 系(MAE / BEiT / EVA) 类比:只练"看图猜缺角"这一门功。纯图像自监督预训练,在分类、检测上很强,但本身不会"看图理解文字"——它没有语言这一半。

  • 关键空白:没人系统地把 MIM 初始化和 CLIP 训练拼起来。 在 EVA-CLIP 之前,CLIP 通常从 ImageNet 监督预训练或随机初始化开始;MIM 预训练出来的强视觉编码器虽好,却没被当成 CLIP 的"出厂底板"来系统利用。这块拼图一直空着。

所以这一节是想说:之前要么数据不开源(OpenAI)、要么靠堆数据堆卡(OpenCLIP)、要么只有视觉没有语言(MIM 系);把"MIM 强起点"接进"CLIP 训练"这个明显划算的组合,居然一直没人系统做——EVA-CLIP 就来补这个空白。


这篇论文的新想法

三条,每条都是日常常识级的道理:

1. 招一个会做菜的徒弟,比从头教划算。 要培养厨师,与其从"什么是锅"教起,不如招一个已经会切菜颠勺的人再教菜谱。EVA-CLIP 的视觉塔(图像编码器)就是这么招来的——直接拿同团队的 EVA 模型当起点。EVA 已经用"重建 CLIP 视觉特征"作为目标做过大规模 MIM 训练,对图像结构很熟。视觉塔从这里启动,就跳过了"先学世界长啥样"这一大步。

等等,先慢一拍——"视觉塔"是啥? CLIP 由两半组成:一半看图(视觉塔),一半读字(文本塔),训练目标是让两半在同一空间里对得上号。这里说的就是负责"看图"的那一半。

2. 一次扛一大箱重物,要换种不闪腰的姿势。 训 CLIP 一次要塞进几万张图(batch 极大),因为对比学习是"在一大堆候选里找配对",候选越多学得越准。但箱子太大,常用的 AdamW 优化器容易"闪腰"(训练不稳)。换成 LAMB(专为大 batch 设计、按层自适应缩放学习率的优化器),就稳了。

3. 上课时眯着眼只听一半,效率反而更高。 训练时把每张图切成小块(patch),随机扔掉约一半再喂给模型(FLIP 风格的随机掩码)。前向计算量直接砍半、吞吐翻倍。性能略有损失,但和前两条叠加起来是净赚。推理(实际用时)仍看完整图,不偷工。

再配上 flash attention(更快的注意力实现)和 DeepSpeed ZeRO(省显存的分布式训练库),整套下来就是:会的徒弟 + 不闪腰的姿势 + 眯眼听课 + 提速工具。EVA-CLIP 高效的全部秘密就在这里,没有任何新架构发明。

所以这一节是想说:EVA-CLIP 的新想法是把"MIM 强起点 + LAMB 大 batch 优化器 + 随机掩码提速"三个已知技巧组合起来,用"站在巨人肩膀上 + 工程优化"换取更低成本和更高精度。


它分几步做的(方法)

方法可拆成五块:架构(不变,但视觉塔换起点)、训练目标(不变的对比学习)、优化器与超参、随机掩码提速、以及两代模型的家族谱系。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。

先看训练流程对比图:

 OpenCLIP(从零):
   随机初始化 ViT ──喂 LAION 32~39B 图文对──► CLIP
   (几百张 A100,训好多天,收益边际递减)

 EVA-CLIP(站在 EVA 肩上):
   ① EVA 已用 MIM 学过图像结构(重建 CLIP 视觉特征为目标)
        │  加载权重当起点
        ▼
   ② 视觉塔(EVA 初始化) + 文本塔  ──对比学习(InfoNCE)──►
        │  训练时随机丢~50% patch(提速)
        │  LAMB 优化器 + 大 batch + flash attn + ZeRO
        ▼
   ③ EVA-CLIP(更少样本、更少 GPU、更高精度)
   推理时:看完整图,不丢 patch

再看一张"同参数量下省了多少"的对照图:

 ImageNet 零样本 top-1(越高越好),样本数/GPU(越少越省):
 ┌────────────────────┬────────┬──────────┬───────────┐
 │ 模型                │ top-1  │ 训练样本 │ GPU        │
 ├────────────────────┼────────┼──────────┼───────────┤
 │ OpenCLIP-B/16+      │ 70.2   │ 34B      │ 344× A100  │
 │ EVA-02-CLIP-B/16+   │ 74.7 ▲ │ 8B ▼     │ 64× A100 ▼ │
 └────────────────────┴────────┴──────────┴───────────┘
   → 更高的分,却用约 1/4 样本、约 1/5 的 GPU

5.1 架构:骨架不变,视觉塔从 EVA 加载权重

类比:同一副身板,换了个"已经练过基本功"的大脑进去。

机制(输入→处理→输出)

  • 输入:图像 + 文本。
  • 处理:视觉编码器仍是标准 ViT(不同规模有 B/16、L/14、g/14、E/14+ 等),文本编码器仍是 Transformer,架构和 OpenCLIP 一致。唯一关键差异:视觉塔的初始权重既不是随机的、也不是 ImageNet 监督预训练的,而是来自 EVA——一个用"重建 CLIP 视觉特征"作为目标做 MIM 训练的 ViT。换句话说,视觉塔已经隐式地学过一遍 CLIP 视觉特征的分布。
  • 输出:图像特征、文本特征各一份,落在同一空间。

再拆一层:EVA 的起点为什么特别对味? EVA 做 MIM 时用的重建目标不是原始像素,而是"重建 OpenAI CLIP 视觉塔输出的特征"。这一步很关键——它等于让 EVA 在无标签图像上,隐式地把 CLIP 视觉塔的"语义感"提炼进自己的权重里。所以当 EVA-CLIP 拿它当起点再做对比学习时,视觉塔已经天然带着一层和"语言语义"沾边的先验,对齐起来事半功倍。这也是为什么 EVA 初始化比"ImageNet 监督预训练"或"随机初始化"当起点都更好——后两者要么带着分类任务的偏见、要么一片空白。

为什么有用:好起点意味着收敛更快、需要的图文对更少、训练更不容易崩。这是"用更少数据"的根本来源,也是全文最核心的一招。

5.2 训练目标:仍是标准对比学习

类比:考试规则没变——还是"在一堆答案里给每张图找对应的那句话"。

机制(输入→处理→输出)

  • 输入:一个 batch 的(图,文)对。
  • 处理:每个 batch 内,一对(图,文)是正样本,其余所有文本都是这张图的负样本,跑 InfoNCE loss(把正对拉近、负对推远的对比损失)。文本侧沿用 OpenCLIP 配置,做轻微改造。
  • 输出:更新后的视觉塔和文本塔权重。

再拆一层:InfoNCE 到底在算什么? 把一个 batch 里所有图特征和所有文特征两两算相似度,排成一张方阵。对角线上的(图 i,文 i)是正确配对,希望相似度最高;同一行其他位置是"这张图配错的文",同一列其他位置是"这句文配错的图",都希望相似度低。loss 就是逼这张方阵的对角线"发亮"、其余"变暗",还带一个温度系数控制这种对比的锐利程度。batch 越大,方阵越大,每张图要压低的"错误配对"越多,学到的区分越精细——这正是前面反复强调"要大 batch、要 LAMB 稳住大 batch"的原因。

为什么不改 loss:论文的核心论点就是"训练目标不用动,改训练流程就够了"。保持 loss 不变,才能干净地证明——增益来自初始化和优化技巧,而非改了目标函数。这是一种严谨的"控制变量"式研究设计。

5.3 优化器与超参:LAMB 撑起大 batch

类比:搬超大箱子要用专门的护腰绑带,普通姿势会闪。

机制(输入→处理→输出)

  • 输入:极大的 batch(几万到十几万量级的样本)。
  • 处理:用 LAMB 替代 AdamW,配 cosine 学习率衰减和 warmup。LAMB 在每一层做自适应学习率缩放,专为大 batch 稳定训练设计(当年 BERT 大 batch 训练也用它)。再用混合精度(fp16 / bf16)省显存提速。
  • 输出:即便 batch 极大也不训崩、收敛稳。

为什么要大 batch:对比学习中,batch 越大,一张图能对比的负样本越多,学到的对齐越锐利。所以"稳住大 batch"是提精度的关键,LAMB 就是那根护腰带。

5.4 随机掩码提速:训练时只看半张图

类比:备考刷题时故意遮住一半题干练速度,正式考试再看全。

机制(输入→处理→输出)

  • 输入:一张图切成的所有 patch。
  • 处理:训练阶段随机 mask 掉约 50% 的 patch,让 ViT 只对剩下一半 token 做自注意力。前向 FLOPs 直接减半,吞吐翻倍。这个技巧来自 FLIP(Li et al., 2023),EVA-CLIP 把它和 MIM 初始化叠加使用。
  • 输出:训练更快,精度只轻微下降(被前两条的增益盖过)。
  • 注意:推理时不 mask,看完整图跑一遍,保证实际使用不打折。

为什么有用:这是纯粹的"训练加速"手段,和好起点、稳优化器叠加后净收益为正。整体训练数据规模比 OpenCLIP-G/14 用的 LAION-2B 小一截,训练时间也短。

5.5 两代家族:EVA-01-CLIP 与 EVA-02-CLIP

类比:同一套方法出了初代和二代产品,二代把视觉塔升级得更强。

机制:论文放出从 B/16 到 5.0B 的 E/14+ 完整阶梯,分 EVA-01-CLIP(视觉塔用 EVA-01)和 EVA-02-CLIP(视觉塔升级为 EVA-02,做了若干 Transformer 改动)两代。规模越大精度越高,但每一档相对同规模 OpenCLIP 都更省样本、更省卡。

为什么给一整个家族:让下游用户按显存和精度需求挑型号——这也是它能成为众多多模态模型"默认视觉塔"的原因(开源、规模齐全、推理可控)。

所以这一节是想说:EVA-CLIP 的方法 = 不变的 CLIP 架构与对比目标 + 从 EVA 加载的强起点 + LAMB 撑大 batch + 随机掩码提速 + 两代完整家族,五块合起来把 CLIP 训练做成"同参数量下更省更强",其中"MIM 强起点"是省数据的根,"LAMB + 随机掩码"是省卡的翼。


EVA-CLIP — 方法示意:核心 pipeline
Plate Nº IIEVA-CLIP — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"每个技巧到底省了多少、强了多少"。以下数字来自原文;未报告的标"原文未报告"。指标主要是 ImageNet-1K 零样本 top-1 准确率(%)与训练所用样本数、GPU 数。

数字 1:最强档 82.0%,仅 90 亿样本

维度 数据
模型 EVA-02-CLIP-E/14+
参数量 5.0B
训练样本 9B(90 亿)
ImageNet 零样本 top-1 82.0%
关键含义 顶配精度,样本数却远少于同级对手

数字 2:430M 小模型也到 80.4%

维度 数据
模型 EVA-02-CLIP-L/14+
参数量 430M
训练样本 6B
ImageNet 零样本 top-1 80.4%
关键含义 用 430M 就超过很多十亿级 OpenCLIP——参数效率极高

数字 3:同参数量下,省样本又省卡

模型 训练样本 GPU ImageNet top-1
OpenCLIP-B/16+ 34B 344× A100 70.2
EVA-02-CLIP-B/16+ 8B 64× A100 74.7
关键含义 样本约 1/4、GPU 约 1/5,精度反而 +4.5

数字 4:g/14 级——1/7 GPU 追平大模型

维度 数据
EVA-01-CLIP-g/14 11B 样本训练
对照 OpenCLIP-H/14 32B 样本
GPU 用量 约 OpenCLIP-H/14 的 1/7
关键含义 "更少样本 + 更少卡"能追平甚至超越更大的对手

数字 5:分布外鲁棒性极强(gap 极小)

维度 数据
模型 EVA-02-CLIP-L/14+
6 个 ImageNet 变体平均 约 79.6%
分布内-分布外性能差 Δ↓ 约 0.8(越小越鲁棒)
关键含义 不只 ImageNet 高,换分布也几乎不掉——真正通用的视觉表征

数字 6:家族阶梯

维度 数据
覆盖 从 B/16 到 5.0B 的 E/14+
代际 EVA-01-CLIP 与 EVA-02-CLIP 两代
精度谱 EVA-01-CLIP 约 74.7 → EVA-02-CLIP 约 79.8 → 82.0(原文 Figure 1)
关键含义 全规模开源,下游按需选型

所以这一节是想说:最硬的三个数字是"E/14+ 82.0% 仅 9B 样本、B/16 用 1/4 样本 1/5 卡反超 4.5 分、分布外 gap 仅 0.8"——它们共同证明"好起点 + 稳优化器 + 提速掩码"确实能把 CLIP 训练变得又省又强。


实验结果说明了什么

上一节列数字,这一节回答实验背后的科学问题。

问题一:MIM 初始化到底有没有用? 有,而且是省数据的核心来源。从 EVA(MIM 预训练)加载视觉塔,让 CLIP 训练能用远少于 OpenCLIP 的样本达到更高精度。这验证了一个此前空缺的直觉:MIM 学到的"图像结构感"是 CLIP 对齐的极好起点——先懂"图长什么样",再学"图和字怎么对应",比两件事从零一起学高效得多。

问题二:三个技巧是各自独立有贡献,还是糊在一起说不清? 论文用消融拆开验证——去掉 MIM 初始化掉多少、AdamW 换 LAMB 差多少、有无随机掩码差多少。三条各自独立可拆、边际贡献清晰。这是"如何写消融"的教科书示范,也让"增益来自这三招而非别的"这个论点站得住脚。(各消融的具体数值原文表格给出。)

问题三:省了这么多成本,泛化会不会变差? 不会,反而更好。在 ImageNet 的多个分布外变体(IN-A / IN-R / IN-V2 / IN-Sketch / ObjectNet)上,EVA-02-CLIP 不仅平均精度高,分布内-分布外的性能差(Δ↓)还极小(L/14+ 仅约 0.8)。这说明学到的是真正通用的视觉表征,而非只在 ImageNet 上过拟合。对 CLIP 系来说,鲁棒性比单一 ImageNet 分数更能反映"表征通不通用"。

问题四:为什么这套东西成了众多 VLM 的默认视觉塔? 因为它同时满足三个条件:开源、性能强、推理可控(有完整规模阶梯可挑)。LLaVA-1.5、早期 MiniGPT-4、InternLM-XComposer 等多模态大模型的视觉编码器一栏常常就是 EVA-CLIP。它不是"论文里好看",而是"工程上好用"——这才是它影响力的真正来源。

问题五:这种"组合已知技巧"的研究值不值得发? 论文本身就是答案。它没有发明任何新架构或新损失,纯靠组合三个已知技巧 + 工程优化拿下 SOTA。这在工业界其实比"纯新架构"更常见、更实用——contribution 可以是"我把已知的东西组合好、验证清楚、开源出来"。这种研究审美值得学习。

所以这一节是想说:实验回答了五个问题——MIM 初始化是省数据的根、三招各自独立有效、省成本不损泛化反增鲁棒、工程好用故被广泛采用、组合式工作同样有价值——共同确立 EVA-CLIP 作为"高效 CLIP 训练范式"的地位。


你应该懂的几个新词

CLIP(Contrastive Language-Image Pre-training):让图像和文本在同一嵌入空间对齐的预训练范式。正对拉近、负对推远,跑 InfoNCE loss。

零样本分类(Zero-shot classification):不额外微调,直接用文本 prompt("a photo of {类别}")和图像特征算相似度做分类。CLIP 系最经典的评测协议。

MIM(Masked Image Modeling,掩码图像建模):图像版的完形填空。遮住图像一部分 patch,让模型预测被遮内容(像素或特征)。代表:MAE、BEiT、EVA。

EVA(同团队前作):用"重建 CLIP 视觉特征"作为目标做 MIM 预训练的 ViT。EVA-CLIP 的视觉塔就是从它加载权重。

LAMB(Layer-wise Adaptive Moments for Batch training):为大 batch 训练设计的优化器,按层自适应缩放学习率。稳住大 batch 的关键。

随机掩码 / FLIP(Fast Language-Image Pre-training):训练 CLIP 时随机丢约一半图像 patch,砍前向计算的提速技巧(Li et al., 2023)。推理时不丢。

InfoNCE loss:对比学习的标准损失。让正样本对的相似度高于所有负样本对。batch 越大,负样本越多,对齐越锐利。

分布外鲁棒性(OOD robustness):模型在与训练分布不同的数据上(如 ImageNet-A/R/Sketch)还能不能保持精度。CLIP 系最看重的指标,反映表征是否真通用。

视觉塔 / 文本塔:CLIP 的两半——一半编码图像、一半编码文本,训练目标是让两者在同一空间对齐。

所以这一节是想说:掌握这九个词,你就能读懂几乎所有"CLIP 训练技巧 + 视觉塔"方向的论文。


它有什么搞不定的

EVA-CLIP 不是万能的,几个局限值得注意:

  • 不是新范式,是训练优化:它没有改变 CLIP"对比对齐"的本质,只是把训练做得更省更稳。CLIP 范式本身的问题(比如对细粒度语义、组合关系理解弱,"CLIP-blind pairs"——把明显不同的图编码成相似向量)它并没有解决。

  • 依赖一个已有的强 MIM 模型(EVA):它的"好起点"来自同团队的 EVA。别人要复现整套,得先有一个高质量的 MIM 预训练视觉塔——这本身就不便宜。所以"省"是相对的,前置成本被藏在了 EVA 里。

  • 随机掩码有精度代价:训练时丢一半 patch 会轻微损失精度,只是被 MIM 初始化的增益盖过。在某些对精度极敏感的场景,这个取舍未必划算。

  • 仍是"看图",不"对话":EVA-CLIP 只做图文对齐,不能理解自然语言指令、不能多轮对话。它是给 VLM/多模态大模型当视觉前端的零件,本身不是完整的多模态助手。

  • 大规模训练门槛仍高:虽然比 OpenCLIP 省,但训到 E/14+(5.0B、9B 样本、上百张 A100)对普通团队仍遥不可及。"高效"是相对头部玩家而言,不是人人可训。

所以这一节是想说:EVA-CLIP 把 CLIP 训练做得又省又强,但它没解决 CLIP 范式本身的语义弱点、把前置成本藏在 EVA 里、且顶配训练门槛依然高——它是"更好的视觉塔零件",不是多模态问题的终点。


它和别的几篇是什么关系

  • 直接前作

    • CLIP(OpenAI 2021)——定义范式,但闭源。参见 clip.md
    • OpenCLIP / LAION——开源复现 + 数据扩展。EVA-CLIP 直接对标它,主张"不用堆那么多数据也行"。
    • EVA(同团队 2022)——MIM 预训练的视觉编码器,是 EVA-CLIP 视觉塔的初始化来源。
    • FLIP(Li et al. 2023)——提供"训练时丢一半 patch"的提速技巧。
  • 同期对比

    • SigLIP(Google 2023),参见 siglip.md。它从 loss 角度改进 CLIP(把 InfoNCE 换成 sigmoid loss,省掉 batch 内归一化)。和 EVA-CLIP 是两条不同优化路径——一条改 loss,一条改训练流程。
    • DataComp 系:从数据角度卷,主张"清洗数据比加数据更重要",和 EVA-CLIP 互补。
  • 下游影响

    • 多模态大模型的视觉塔常用 EVA-CLIP,如 llava-1-5.md、早期 MiniGPT-4、InternLM-XComposer。原因:开源、性能强、推理可控。
    • blip-2.md / Q-Former 系列在选视觉编码器时的常见候选。
  • 互补关系:与 DINOv2 是两类不同的视觉自监督——DINOv2 纯图像自蒸馏、不需要文本配对;EVA-CLIP 需要图文对但语义对齐更直接。下游选哪个,看是否需要零样本能力。

  • 对照 InternViT:InternVL 走"自训超大视觉塔"路线(参见 internvl-2-5.md),EVA-CLIP 走"MIM 起点 + 高效训练"路线。都是想要一个更强的视觉塔,手段不同。

所以这一节是想说:EVA-CLIP 站在 CLIP/OpenCLIP 的范式与 EVA 的 MIM 技术之上,与 SigLIP(改 loss)、DataComp(改数据)形成三条平行的 CLIP 改进路线,并作为"默认视觉塔"深刻影响了后续一大批多模态大模型。


和本导读的关系

本笔记对应导读 Ch08: VLM 地基 (I)——CLIP,教 AI 同时认图和认字

导读 Ch08 讲的是整个视觉-语言时代的地基——CLIP 如何把"图"和"词"绑进同一个坐标系,后面所有"机器人看着图听人说话"的模型骨子里都靠这套对齐。EVA-CLIP 在这条线里的位置是把 CLIP 从"能训"推进到"训得起、训得强":它不改 CLIP 的灵魂(对比对齐),而是让这个灵魂能用更少的资源附体到更强的躯壳上,从而成为后续无数 VLM 的默认视觉塔。

建议阅读顺序:先读导读 Ch08 与 clip.md,搞懂 CLIP"对比对齐"的核心机制和零样本分类协议;再读本笔记,理解"如何用 MIM 起点 + 稳优化器 + 随机掩码把 CLIP 训得又省又强";然后对照 siglip.md 看另一条改进路线(改 loss)。三者连起来,你会看到 CLIP 之后"如何把这套范式做得更好"的三种典型思路:改起点(EVA-CLIP)、改损失(SigLIP)、改数据(DataComp)。

从知识图谱角度,本笔记向下连接 Ch09(BLIP-2/LLaVA)——那些模型的视觉塔常常就是 EVA-CLIP;再往下连接 Ch12 的 VLA,因为机器人策略的视觉前端也常源自这条视觉塔谱系。

所以这一节是想说:本笔记是导读 Ch08 里"把 CLIP 训练做到又省又强"的关键案例,读完能理解 CLIP 范式如何通过训练技巧的进化,成为整个多模态时代的默认视觉地基。


思考题

以下问题检验你是否真正理解论文逻辑,而非记住"82.0%"。每题附折叠提示,先自己想 30 秒再展开。

Q1:为什么"用 MIM 预训练的视觉塔当起点"能让 CLIP 训练需要的图文数据大幅减少?

提示

CLIP 从零训练时,视觉塔要同时学两件事:图像本身的结构(什么是边缘、纹理、物体)+ 图像和文字的对应关系。MIM 预训练已经把第一件事学好了——视觉塔天生就"懂图长什么样"。所以 CLIP 训练只需专注第二件事(图文对齐),要学的东西少了一半,自然需要更少的图文对。这就是"先打好视觉基本功,再学跨模态对齐"比"两件事从零一起学"高效的原因。

Q2:论文特意保持 CLIP 的 loss 和架构不变,只改训练流程。这个"控制变量"的做法有什么科学价值?

提示

如果同时改架构、改 loss、改训练流程,最后精度提升了,你无法判断到底是哪个改动的功劳。保持架构和 loss 不变,只动训练流程(初始化、优化器、掩码),就能干净地证明——增益确实来自这三个训练技巧,而非架构或目标函数。这是让"我的三招有效"这个论点可信的关键,也是消融实验设计的核心思想。

Q3:为什么对比学习特别需要"大 batch"?LAMB 在其中扮演什么角色?

提示

对比学习是"在一个 batch 内,为每张图从所有文本里找出对应的那句"。batch 越大,一张图要区分的负样本越多,逼模型学到越锐利的对齐边界——负样本太少,模型只需粗略区分就能蒙对。但极大的 batch 会让常规优化器(AdamW)训练不稳、甚至发散。LAMB 按层自适应缩放学习率,专门稳住大 batch 训练,让"大 batch 提精度"这条路真正走得通。

Q4:训练时随机丢一半 patch 会损失精度,为什么整体还是"净赚"?

提示

丢一半 patch 让前向计算量减半、吞吐翻倍,等于同样时间/算力能训更多步或更大模型。它带来的精度损失很小,而"MIM 好起点"和"LAMB 大 batch"带来的精度增益远大于这个损失。三者叠加后净收益为正——用一点点精度换来大幅提速,再把省下的算力投到别处补回来。而且推理时不丢 patch,实际使用不打折。

Q5:EVA-CLIP 在分布外变体上的性能差 Δ↓ 只有约 0.8。为什么这个"差值小"比"ImageNet 分数高"更能说明表征质量?

提示

ImageNet 分数高,可能是过拟合到 ImageNet 分布的结果——换个分布(艺术画、素描、对抗样本)就崩。分布内-分布外的差值小,说明模型在没见过的分布上几乎不掉,学到的是"狗之所以为狗"的通用特征,而非"ImageNet 里狗的特定拍法"。对 CLIP 这种要当通用视觉塔的模型,鲁棒性(差值小)比单一 benchmark 高分更能证明它到处都能用。

Q6:EVA-CLIP 的"省"其实把一部分成本藏在了 EVA 里。这对想复现它的人意味着什么?

提示

它的高效前提是有一个训练好的高质量 MIM 视觉塔(EVA)当起点。别人要完整复现,得先自己训一个 EVA——而训 EVA 本身要大规模数据和算力,并不便宜。所以"用更少数据训 CLIP"是相对的:CLIP 阶段确实省了,但整条链路(EVA 预训练 + EVA-CLIP 训练)的总成本没那么低。评估一个方法的"省",要看它是否把成本转移到了别处,而非凭空消失。

Q7:EVA-CLIP 这种"组合已知技巧拿 SOTA"的工作,和"发明全新架构"的工作,价值该怎么比较?

提示

两者价值不同但都真实。"发明新架构"推的是能力上界、开辟新可能,风险高、偶尔颠覆。"组合已知技巧 + 工程验证 + 开源"推的是落地效率、把已有能力做得又快又便宜又可复现——这在工业界价值极大,因为绝大多数实际部署靠的正是把成熟技巧组合到位,而非天天换架构。EVA-CLIP 属于后者,它的成功说明:把已知的东西组合好、验证清、开源出来,本身就是一等一的 contribution。别用"有没有新架构"单一标准评判研究价值。

所以这一节是想说:能回答这 7 个问题,你就真正理解了 EVA-CLIP 的三招组合拳与工程审美,而非只记住"82.0%"。


一些好奇心问答(FAQ)

Q1:EVA-CLIP 和 CLIP 到底啥关系?

EVA-CLIP 就是 CLIP——同样的架构、同样的对比对齐目标、同样的零样本用法。区别只在训练方法:视觉塔换成 MIM 强起点、优化器换 LAMB、训练时随机丢一半 patch。所以它是"训得更好的 CLIP",不是新模型类别。

Q2:为什么这么多多模态大模型的视觉塔都写着 eva-clip?

因为它开源、性能强、有完整规模阶梯、推理可控。打开 LLaVA-1.5、早期 MiniGPT-4、InternLM-XComposer 的代码,视觉编码器一栏八成是 eva-clip-g 之类。它是工程上最顺手的现成视觉塔之一。

Q3:训 CLIP 想加速,除了堆卡还能怎么办?

EVA-CLIP 给了三条:用 MIM 预训练视觉塔当起点(少训点)、用 LAMB 稳住大 batch(提精度不训崩)、训练时随机丢一半 patch(前向减半)。这三条可单独用也可叠加,是"不加卡也能提效"的实用清单。

Q4:MIM 自监督和 CLIP 对比学习是什么关系?

互补的两个阶段。MIM(如 EVA)先让视觉塔学会"图长什么样"(图像结构),CLIP 再让它学会"图和字怎么对应"(跨模态对齐)。EVA-CLIP 的洞见就是把这两步串起来——先 MIM 打底、再 CLIP 对齐,比从零一起学高效得多。

Q5:EVA-01-CLIP 和 EVA-02-CLIP 选哪个?

一般选 EVA-02-CLIP,它的视觉塔(EVA-02)做了改进、精度更高(如 L/14+ 从约 79.3 提到 80.4,E/14+ 到 82.0)。EVA-01-CLIP 是初代,性能略低。按显存和精度需求在家族阶梯里挑规模即可。

Q6:它解决了 CLIP 看不清细节、理解不了组合关系的问题吗?

没有。EVA-CLIP 只优化训练效率和精度,CLIP 范式固有的弱点(细粒度语义、组合关系、"CLIP-blind pairs")它没碰。这些要靠后续工作(如混合视觉编码器、SigLIP、更强的对齐目标)去补。

Q7:普通团队能训一个 EVA-CLIP 吗?

小档(B/16)相对可行,但顶配 E/14+(5.0B、9B 样本、上百张 A100)对普通团队仍遥不可及。而且完整链路还得先有个 EVA 视觉塔。所以"高效"是相对头部玩家而言——多数人是直接下载它的开源权重来用,而非自己训。

Q8:读完接下来看什么?

想懂 CLIP 本身看 clip.md;想看另一条改进路线看 siglip.md;想看它当视觉塔的下游看 llava-1-5.mdblip-2.md;想看"自训超大视觉塔"的对照路线看 internvl-2-5.md

所以这一节是想说:关于它和 CLIP 的关系、为何被广泛采用、如何加速训练这些实操疑问,论文和社区都有清晰答案,EVA-CLIP 已是最常用的开源视觉塔之一。


如果你想再深入

按"范式源头 → 起点技术 → 同期路线 → 下游"排序:

  1. 范式源头:CLIP(OpenAI 2021) — 对比对齐与零样本分类的定义者。读它才懂 EVA-CLIP 保持不变的那部分是什么。见 clip.md
  2. 起点技术:EVA / MAE(MIM 系) — EVA-CLIP 视觉塔的初始化来源。读它理解"为什么 MIM 起点能省 CLIP 的数据"。
  3. 提速技巧:FLIP(Li et al. 2023) — "训练时丢一半 patch"的来源。
  4. 同期路线:SigLIP — 从 loss 角度改进 CLIP,和 EVA-CLIP 的"改训练流程"是两条平行路。见 siglip.md
  5. 下游应用:LLaVA-1.5 / BLIP-2 — 把 EVA-CLIP 当视觉塔接进多模态大模型。见 llava-1-5.mdblip-2.md

所以这一节是想说:把 CLIP + EVA/MAE + FLIP + EVA-CLIP + SigLIP 连起来读,就能看清"CLIP 之后如何把视觉塔训得又省又强"的完整技术谱系。


原文信息

BibTeX

@article{sun2023evaclip,
  title   = {EVA-CLIP: Improved Training Techniques for CLIP at Scale},
  author  = {Sun, Quan and Fang, Yuxin and Wu, Ledell and Wang, Xinlong and Cao, Yue},
  journal = {arXiv preprint arXiv:2303.15389},
  year    = {2023}
}

链接

所以这一节是想说:这是 Sun 等人(BAAI)2023 年的工作,用"MIM 强起点 + LAMB 大 batch + 随机掩码提速"三招把 CLIP 训得又省又强,并开源整个模型家族,成为后续众多多模态大模型的默认视觉塔。

引用本笔记 / Cite this note
BibTeX
@online{eai_eva_clip_2026,
  title       = {(readable note) EVA-CLIP: Improved Training Techniques for CLIP at Scale},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/eva-clip/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?