Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 138

Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

24 min read · 8265 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,术语第一次出现必定义 + 类比。

一句话讲什么(TL;DR)

InternVL 2.5 把"模型规模、训练数据、推理时算力"三根轴一起往上推,让完全开源、免费可下载的"看图模型"第一次在大学综合考试 MMMU 上突破 70 分(70.1),追平甚至叫板 GPT-4o、Claude-3.5-Sonnet 这些顶级闭源模型——而且把怎么做到的每一步都写成了别人能照抄的工程指南。

所以这一节是想说:这篇论文没有发明新架构,它的贡献是把大语言模型那套"规模法则"完整搬到视觉-语言模型上,并第一次把开源 VLM 推过了公认的强模型门槛。


这是个什么场景

想象你在群里发了一张化学课本里的反应机理图,问"这一步是什么反应?";或者拍一张陌生城市的地铁线路图问"我从 A 站怎么到 B 站?"。能看着图回答你的这种 AI,就叫 VLM(Vision-Language Model,视觉-语言模型),也叫 MLLM(多模态大语言模型)——可以理解成"会看图的 ChatGPT"。

之前的开源 VLM 像班里中等偏上的同学:菜单照片、宠物图、风景照都答得不错;可一到"看化学反应图讲机理""看统计图分析趋势""解一道带插图的大学物理题"这种真正需要动脑的大学考卷,就明显被闭源那位天才同学(GPT-4o)甩在后面。群里遇到这种难题,还是得掏钱调用闭源 API。

具体到分数上:多模态领域的"高考"叫 MMMU(覆盖艺术、商科、医学、理工等大学课程的综合多模态题库),70 分被公认为"强模型"的门槛。此前闭源模型早已越过,开源社区却长期卡在 60 出头(Qwen2-VL-72B 约 64.5)迟迟破不了 70。

InternVL 2.5 做的事,其实就是让这位开源中等生再补一整年课:课本(模型参数)加厚、习题(训练数据)翻倍且挑质量、考试时允许多花几分钟打草稿(推理时多步思考),最后让他在大学综合卷上第一次摸到 70 分这条线(70.1,比自家上一代高 3.7 分)。

它不是发明新教学法,而是把已有的教学法放大到极致,并且把每一步都公开写进可复现的工程配方——这才是它对开源社区的真正价值。

所以这一节是想说:InternVL 2.5 面对的场景是"开源看图模型在真正需要推理的大学级考题上落后闭源",它的答案是把三根规模轴一起拉满,并把配方全部公开。


Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling — 场景示意:这论文要解决的现实问题
Plate Nº IExpanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:闭源压制(GPT-4o / Claude 3.5 / Gemini 1.5) 类比:天才同学在,但答案册锁在他自己抽屉里。这些模型在多模态综合卷上长期把开源压在 70 分以下,且训练配方完全不公开。开源社区只能望其项背。

  • 方案 B:单维度扩展 类比:只练一块肌肉。很多开源工作一次只做一件事——要么堆参数(把 LLM 换更大)、要么堆数据(塞更多图文对)、要么堆推理(加思维链提示),很少三件一起系统地做。结果是单点提升有限,撞不破 70 分天花板。

  • 方案 C:忽视数据质量 类比:习题册里混着大量印错的题。早期开源 VLM 的训练数据充斥重复、噪声、低质 caption,尤其是"重复模式"样本。因为算力瓶颈先被容忍,具体清洗方法也大多不公开。

  • 方案 D:训练配方黑盒 / 碎片化 类比:菜谱要么不给、要么东一句西一句。闭源不公开;开源虽公开但零碎——从 224 分辨率到 448、到动态高分辨率,每一步该怎么排课表、何时解冻视觉塔,社区缺一份"工业级完整配方"。

  • 方案 E:开源没重视测试时计算 类比:从没教学生"难题先打草稿"。OpenAI o1 已经在纯文本侧把"测试时扩展"(推理时多花算力换准确率)做火,但开源 VLM 在多模态上几乎没人系统尝试。

  • 共同瓶颈:开源 VLM 缺的不是某一项,而是"三根轴一起推 + 数据严格清洗 + 配方全公开"这套组合拳。少了任何一环,都破不了 70 分。

所以这一节是想说:之前开源要么被闭源的黑盒配方压制,要么只在单一维度用力、又不认真清洗数据,始终没人把三根规模轴 + 数据质量 + 测试时计算合成一套可复现的完整方案。


这篇论文的新想法

一句话:模型、数据、测试时三件事一起加大,并且把每一件都拆到别人能照着抄的程度。

类比健身:想练出好身材,单练不行,得"练 + 吃 + 睡"三件一起来,还得科学安排。VLM 也一样——

  • 模型轴(练肌肉):从 1B 到 78B 提供完整的规模阶梯,视觉塔(InternViT)和语言塔(基于 InternLM 2.5、Qwen 2.5 等)的配比经过系统消融。一个关键发现是:大视觉编码器能显著降低对训练数据的依赖——用 6B 视觉塔的 InternVL2.5-78B 只用约 1/10 的训练 token,就超过用 600M 视觉塔的 Qwen2-VL-72B。

  • 数据轴(吃饭):训练语料在上一代基础上继续扩张,但更强调质量过滤——去重、剔除低分样本、专门补强 OCR / 数学 / 图表 / 文档 / 视频等长尾领域。尤其针对"重复模式"样本做清洗,因为它们会毒害测试时的长文本/思维链输出。

  • 测试时轴(考前打草稿):在推理阶段让模型先写思考过程(思维链)再答题,还可多答几遍投票取最常见答案。这在推理重的 benchmark 上能再加几分,但对"看一眼就能答"的感知类任务几乎无增益。

关键洞察是:三根轴互相放大——更大的模型更能吃下更多数据,也更能从更长的思考时间里受益。这其实就是把大语言模型的**规模法则(scaling law)**完整搬到了 VLM 上,并第一次给出完整实证。

所以这一节是想说:InternVL 2.5 的新想法是"三轴协同放大 + 每一轴都公开可抄",本质是把 LLM 的规模法则完整移植到多模态,并用一份工业级配方把它坐实。


它分几步做的(方法)

方法可拆成五块:整体架构(ViT-MLP-LLM)、动态高分辨率切片、三阶段训练、渐进式规模对齐、以及数据清洗流水线与测试时扩展。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。

先看整体架构图:

        输入图(任意分辨率)
             │  动态切片:按宽高比切成若干 448×448 小块 + 一张缩略图
             ▼
   ┌───────────────────────────────┐
   │  视觉塔 InternViT              │  6B(5.5B/45层) 或 300M
   │  每块 448×448 → 1024 视觉 token │
   │  pixel unshuffle 压成 256 token │
   └───────────────┬───────────────┘
                   │  视觉 token
                   ▼
   ┌───────────────────────────────┐
   │  Projector(2 层 MLP 翻译层)   │  把视觉特征翻成 LLM 能听懂的词向量
   └───────────────┬───────────────┘
                   │  拼上文字 token
                   ▼
   ┌───────────────────────────────┐
   │  语言塔 LLM                    │  InternLM 2.5 / Qwen 2.5,多种规模
   │  输出:文字回答                 │
   └───────────────────────────────┘

5.1 整体架构:ViT-MLP-LLM 三段式

类比:一个翻译团队——一位专门看图的同事(视觉塔)+ 一位中间把图翻成语言的传话员(projector)+ 一位专门说话的同事(语言塔)。

机制(输入→处理→输出)

  • 输入:图像 + 文字指令。
  • 处理:InternVL 2.5 沿用前代的 "ViT-MLP-LLM" 范式。视觉塔用自家训练的 InternViT(6B 版实际 5.5B、45 层,或轻量的 300M 版),而不是直接拿 CLIP/SigLIP——这是 InternVL 系列一贯的"不雇外包"特点。视觉特征经一个随机初始化的 2 层 MLP projector 翻译成 LLM 的词向量空间,再和文字 token 一起送进语言塔(InternLM 2.5 或 Qwen 2.5,多种规模可选)。
  • 输出:文字回答。

为什么用自家视觉塔:大视觉编码器带来一个关键红利——降低对训练数据的依赖。论文实测:6B 视觉塔的 78B 模型只用约 120B token 训练,就超过用 600M 视觉塔、训了 1.4T token 的 Qwen2-VL-72B。视觉塔越强,语言侧要学的东西越少。

5.2 动态高分辨率切片:看清文档小字又不爆 token

类比:A4 文档塞不进护照大小的扫描仪,就按版面切成几块分别扫,再附一张缩略图保留整体布局。

机制(输入→处理→输出)

  • 输入:一张任意宽高比、可能很大的图(如 4K 文档截图)。
  • 处理:按宽高比把图切成若干 448×448 的小块(tile),每块单独走 ViT。每块 448×448 原本产生 1024 个视觉 token,通过 pixel unshuffle(像素反混洗) 操作把 token 数压到 1/4,即 256 个。这样既能看清文档里的小字,又不会让 token 数爆炸。
  • 输出:所有小块 + 缩略图的视觉 token 拼在一起。

等等,先慢一拍——token 是什么? 语言模型只懂"词",所以视觉塔要把图片压成一串"视觉词"(token)交给它。token 越多看得越细,但算力代价越大。pixel unshuffle 就是"用更少的视觉词表达同样的图"的省钱技巧。

为什么有用:文档理解、OCR、图表这些"看得清小字才答得对"的任务,硬门槛就是分辨率。动态切片让模型能吃高分辨率而不失控。

5.3 三阶段训练:从认字到读文章到按格式答题

类比:教一个外国实习生干活——先教他认字(对齐)、再让他大量读真实材料见世面(预训练)、最后手把手教他"客户问 X 你要回 Y"(指令微调)。

机制(输入→处理→输出)

  • 阶段一(MLP 预热):冻结视觉塔和语言塔,只训 projector,让"传话员"先学会把图翻成语言。
  • 阶段二(视觉-语言预训练):解冻更多参数,喂海量图文/文档/OCR/视频数据,让模型见多识广。
  • 阶段三(指令微调 SFT):用高质量的指令-回答对调教,让它学会按用户期望的格式输出。这一阶段 LLM 也可训——但论文强调:哪怕几千条带"重复模式"的噪声样本,都可能让模型陷入复读或固定错误,所以此阶段数据质量控制极严,且用统一学习率保持简单。
  • 输出:一个既懂图又会按指令答题的完整 VLM。

三阶段"谁在训、谁冻结"可以画成一张图:

 阶段一 MLP 预热   : [InternViT 冻] [Projector ✓] [LLM 冻]
        目标:传话员先学会把图翻成语言
 阶段二 视觉-语言   : [InternViT ✓] [Projector ✓] [LLM ✓]
        预训练         目标:喂海量图文/文档/视频,见多识广
 阶段三 指令微调SFT: [InternViT ✓] [Projector ✓] [LLM ✓]
        目标:高质量指令数据,学会按格式答题(严控噪声样本)
 ────────────────────────────────────────────────
 渐进式规模对齐:先用小 LLM 把 InternViT 调顺,再迁去配大 LLM(省算力)

为什么这样分:把难度拆成台阶,每阶段只解决一个问题(对齐 → 知识 → 格式),比一锅乱炖稳定得多。

5.4 渐进式规模对齐:小模型先探路,大模型再接手

类比:先让一个便宜的助手把视觉塔"调教顺手",再把这个调好的视觉塔交给贵的大模型,省下大模型的探索成本。

机制:论文提出渐进式规模策略——先用较小的 LLM 把 InternViT 视觉塔对齐、调教到位,再把这个已经"懂图"的视觉塔迁移去配更大的 LLM。因为视觉塔和小 LLM 配合时的探索成本远低于和大 LLM 配合,这样能大幅节省算力。这也是"大视觉塔降低数据依赖"这个发现能落地的工程手段。

为什么有用:让 1B 到 78B 的整条阶梯能高效地共享同一套调教好的视觉塔,而不必每个规模都从零对齐一遍。

5.5 数据清洗流水线 + 测试时扩展

类比:备料时先挑靠谱供应商(数据源级),再一颗颗把烂菜挑出来(样本级);考试时会做的直接写,难题先打草稿、不放心就做三遍取最常见答案。

机制(输入→处理→输出)

  • 数据清洗:做 dataset-level + sample-level 双层过滤——数据源级评估每个来源的整体质量来定权重;样本级用模型打分剔除单条噪声。特别地,专门识别并删除"重复模式"样本——论文发现哪怕仅几千条这类样本,也会在长文本输出和思维链推理时让模型陷入死循环,是测试时扩展的头号杀手。
  • 测试时扩展(test-time scaling):推理阶段让模型先生成思考链(CoT)再给答案,并支持 best-of-N 采样 + 多数投票。
  • 输出:更干净的训练数据 + 推理时可选的"多花算力换准确率"开关。

关键结论:测试时扩展在推理重的 benchmark(MMMU、数学题)上能再加几分,但对感知类任务(OCR、grounding 这种"看一眼就答"的)几乎没增益——和 LLM 侧发现一致:思考时间只对真正需要思考的题目有用

所以这一节是想说:InternVL 2.5 的方法 = ViT-MLP-LLM 架构 + 动态高分切片 + 三阶段训练 + 渐进式规模对齐 + 双层数据清洗与测试时扩展,五块合起来是一份"三轴协同放大"的完整工业配方,其中"大视觉塔省数据"和"清洗重复样本救测试时扩展"是两条最有工程价值的经验。


Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling — 方法示意:核心 pipeline
Plate Nº IIExpanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"三轴各自贡献了什么、开源到底追到什么程度"。以下数字来自原文;未报告的标"原文未报告"。

数字 1:MMMU 首次破 70(开源里程碑)

模型 MMMU(验证集)
InternVL2.5-78B 70.1(开源首次 > 70,较上一代 +3.7)
Qwen2-VL-72B 64.5
OpenAI o1 78.2
关键含义 类似 Llama 3 在文本侧"开源追上 GPT-4"的那一刻

数字 2:大视觉塔省数据

模型 视觉塔 训练 token MMMU
InternVL2.5-78B 6B(InternViT) ~120B 70.1
Qwen2-VL-72B 600M ~1.4T 64.5
关键含义 大视觉塔用约 1/10 数据反超——视觉塔越强,数据需求越低

数字 3:完整规模阶梯(OpenCompass 综合分)

型号 参数 视觉塔 OpenCompass
InternVL2.5-1B 0.9B InternViT-300M 54.5
InternVL2.5-2B 2.2B InternViT-300M 59.8
InternVL2.5-4B 3.7B InternViT-300M 65.1
InternVL2.5-8B 8.1B InternViT-300M 68.1
InternVL2.5-26B 25.5B InternViT-6B 71.3
InternVL2.5-38B / 78B 38.4B / — InternViT-6B 更高(原文表格)
关键含义 从边缘设备到数据中心,用户按显存挑型号——开源相对闭源的关键卖点

数字 4:推理类 benchmark(78B)

Benchmark 分数 说明
MMMU 70.1 多学科推理
MMMU-Pro 51.4 更难的多学科推理
MathVista 72.3 数学视觉推理
MATH-Vision 34.9 数学视觉(更难)
关键含义 全面对标 GPT-4o / Claude-3.5,缩小甚至反超

数字 5:架构关键数

项目 数值
图块尺寸 448×448
每块视觉 token(unshuffle 前 → 后) 1024 → 256
InternViT-6B 实际 5.5B 参数、45 层
视觉塔选项 InternViT-6B / InternViT-300M
语言塔选项 InternLM 2.5 / Qwen 2.5 等

数字 6:测试时扩展的适用边界

任务类型 测试时扩展增益
推理重(MMMU、数学) 有,能再加几分
感知类(OCR、grounding) 几乎无
关键含义 思考时间只对真需要思考的题有用

所以这一节是想说:最硬的三个结论是"MMMU 破 70、大视觉塔用 1/10 数据反超、七档规模阶梯全公开"——它们共同证明三轴协同放大是可行且可复现的。


实验结果说明了什么

上一节列数字,这一节回答实验背后的科学问题。

问题一:开源 VLM 到底能不能追上闭源? 能。MMMU 70.1 首次让开源越过公认门槛,并在数学、文档、多图/视频、grounding、多语言等一系列 benchmark 上与 GPT-4o、Claude-3.5-Sonnet 掰手腕。这不是单点超越,而是全面的性能靠拢——对开源社区的意义类似 Llama 3 在文本侧追上 GPT-4 的那一刻。

问题二:三根轴是不是真的各自有效、还能叠加? 是。论文分别消融模型规模、数据规模、测试时策略对 MMMU 的贡献,验证"三轴各自有效且可叠加"。更重要的发现是它们互相放大——大模型更能吃数据、也更能从思考时间受益。这把"规模法则"从 LLM 完整迁移到了 VLM,并给出实证。

问题三:视觉塔越大越好,还是越大越浪费? 越大越省数据。这是全文最反直觉的发现之一:6B 视觉塔的 78B 模型只用约 1/10 的训练 token 就超过 600M 视觉塔的 Qwen2-VL-72B。含义是——与其拼命堆训练数据,不如先把视觉塔做强,视觉塔强了语言侧要学的东西自然变少。这直接影响后续工作的资源分配决策。

问题四:测试时扩展是万灵药吗? 不是。它只在真正需要推理的题目上有用(MMMU、数学),对"看一眼就能答"的感知任务(OCR、grounding)几乎无增益。这和 LLM 侧的结论一致,也提醒使用者别对所有任务无脑开思维链——那只会更慢却不更准。

问题五:数据质量为什么被反复强调? 因为它是测试时扩展能否奏效的隐形前提。论文发现哪怕仅几千条"重复模式"样本,也会让模型在长文本/思维链输出时陷入复读死循环,毁掉测试时扩展的收益。所以他们专门设计了双层过滤流水线。这个发现对任何想训 VLM 的人都是硬核经验——清洗数据不是可选项,而是让高级推理生效的必要条件。

所以这一节是想说:实验系统回答了五个问题——开源能追上闭源、三轴各自有效且互相放大、大视觉塔省数据、测试时扩展只对推理题有用、数据清洗是它的隐形前提——共同把"规模法则移植到 VLM"这件事坐实。


你应该懂的几个新词

VLM / MLLM(视觉-语言模型 / 多模态大语言模型):能同时吃图和文、输出文本的模型。可理解为"会看图的 ChatGPT"。

MMMU(Massive Multi-discipline Multimodal Understanding):覆盖艺术、商科、医学、理工等大学课程的综合多模态题库,被视为 VLM 的"高考",70 分是公认的强模型门槛。

规模法则(Scaling Law):性能随模型规模、数据规模、算力大致按可预测规律提升。最早在 LLM 上总结(Kaplan、Chinchilla),本文把它系统迁移到 VLM。

测试时扩展(Test-Time Scaling):推理阶段多花算力换准确率,如思维链(CoT)、best-of-N 采样、多数投票。OpenAI o1 把它推火,本文迁到多模态。

动态高分辨率切片(Dynamic High-Resolution Tiling):把大图按宽高比切成多个固定尺寸小块分别编码,让 ViT 既看清细节又不爆 token 数。

pixel unshuffle(像素反混洗):一种把视觉 token 数压缩(本文压到 1/4)的操作,用更少的"视觉词"表达同一张图,省算力。

InternViT:上海 AI Lab 自训的视觉编码器,有 6B(实际 5.5B)和 300M 两档,对标 CLIP/SigLIP 但更大,是 InternVL 系列的"自家视觉塔"。

Projector(投影器):连接视觉特征和 LLM 词向量空间的小型模块(本文是 2 层 MLP),参数最少但最关键的"翻译层"。

SFT(Supervised Fine-Tuning,监督微调):用高质量指令-回答对做最后一轮调教,让模型学会按用户期望的格式输出、听得懂人话。

思维链(Chain-of-Thought, CoT):让模型先写出中间推理步骤再给最终答案,对需要多步推理的题目有帮助。

所以这一节是想说:掌握这十个词,你就能读懂几乎所有"开源 VLM + 规模化"方向的论文。


它有什么搞不定的

InternVL 2.5 不是终点,几个局限值得注意:

  • 不是新架构,红利来自规模与工程:它沿用前代的 ViT-MLP-LLM,本质是把规模法则做到位 + 配方公开。这意味着它的领先很可能被下一个"更大、数据更干净"的模型迅速追平——护城河是执行力而非架构创新。

  • 测试时扩展适用面窄:只对推理题有用,对感知任务无益,还更慢。对以 OCR/检测为主的应用场景,这条轴基本白搭。

  • 对数据质量极度敏感:几千条噪声样本就能毒害测试时扩展。这既是发现也是脆弱点——训练它需要一套严格的清洗流水线,复现门槛并不低。

  • 大模型部署成本高:78B 要拿到 70.1,推理成本可观。虽然有 1B–8B 的轻量档,但这些档的分数与 78B 有明显差距,"又小又强"仍是折中。

  • 仍未根本解决幻觉与可靠性:论文评测里含幻觉检测,但 VLM 看错图、编造细节的问题并未被规模彻底解决。高风险场景(医疗、法律)仍需谨慎。

所以这一节是想说:InternVL 2.5 用规模和工程把开源推过了 70 分,但它的领先靠执行力而非架构、测试时扩展适用面窄、对数据质量敏感、大模型贵、且幻觉未根治——这些都是后续工作要接着啃的。


它和别的几篇是什么关系

  • 直接前作:InternVL 1.0 / 1.5 / 2.0 是同系列。2.5 主要是规模、数据、测试时的扩展,架构基本不变。参见 internvl.md

  • 同代竞品:Qwen2-VL、LLaVA-OneVision、Pixtral、Llama 3.2 Vision 在同一时间窗发布,互相对标。InternVL 2.5 在多数 benchmark 上是当时的开源 SOTA。参见 qwen-vl.mdllava-onevision.mdpixtral-12b.md

  • 视觉塔血统:InternViT 对标 CLIP/SigLIP,但走"自训大视觉塔"路线。可对照 clip.mdsiglip.mdeva-clip.md 理解视觉塔的不同流派。

  • 同期思路对照:DeepSeek-VL,参见 deepseek-vl.md。DeepSeek-VL 走"混合视觉编码器 + 真实场景数据"的小而实用路线,InternVL 2.5 走"三轴规模化 + 全家桶"路线。两者是开源 VLM 的两种典型策略。

  • 规模法则谱系:把 Kaplan / Chinchilla 的 LLM scaling 迁移到 VLM。同期 Idefics3、PaliGemma 2 也在做类似事,但 InternVL 2.5 是规模阶梯最完整、数据流水线最透明的之一。

  • 测试时计算谱系:和 OpenAI o1、DeepSeek-R1 共享"测试时算力"哲学,但应用到多模态。后续 InternVL 3、Qwen2.5-VL 会继续推这条线。

  • 对具身 AI 的连接:作为通用 VLM 骨干,InternVL 2.5 常被下游 VLA(视觉-语言-动作)模型拿去做视觉理解前端/初始化。理解它的能力边界,就是理解那些下游机器人模型的感知上限。

所以这一节是想说:InternVL 2.5 是"开源 VLM 规模法则移植"这条线的一个完整实证节点,上接 InternVL 系列与 CLIP 视觉塔谱系,横向对标 Qwen2-VL / DeepSeek-VL,下接一众用它当骨干的 VLA。


和本导读的关系

本笔记对应导读 Ch09: VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力

导读 Ch09 讲的是 VLM 如何从"看懂图"进化到"看着图对话"这条线:CLIP 把图和词对齐 → BLIP-2 用 Q-Former 桥接冻结的 LLM → LLaVA 用简单的投影层 + 指令微调把视觉变成对话的一部分 → 再到 InternVL、Qwen-VL 这类把架构规模化、工程化的现代开源 VLM。InternVL 2.5 在这条线里是规模化与工程化的集大成节点——它证明 LLaVA 定义的 "ViT-投影-LLM" 范式,配上规模法则和严格的数据工程,能把开源 VLM 推到叫板闭源的高度。

建议阅读顺序:先读导读 Ch09 建立"VLM 怎么学会看图对话"的整体脉络;再读 llava-1-5.md 理解 "ViT-投影-LLM" 这个被 InternVL 沿用的基本范式从哪来;然后读本笔记,看这个范式如何靠三轴规模化被推到 70 分;最后对照 deepseek-vl.mdqwen-vl.md,看同一时代开源 VLM 的不同技术取舍。

从知识图谱角度,本笔记向上连接 Ch08(CLIP 视觉塔),向下连接 Ch12(OpenVLA/VLAS/MLA 等 VLA)——因为很多机器人策略正是拿这类通用 VLM 当感知前端。

所以这一节是想说:本笔记是导读 Ch09 里"VLM 从对话能力走向规模化叫板闭源"的关键案例,读完能看清 LLaVA 范式如何靠规模法则被推向巅峰。


思考题

以下问题检验你是否真正理解论文逻辑,而非记住"MMMU 70.1"。每题附折叠提示,先自己想 30 秒再展开。

Q1:为什么"大视觉塔能降低对训练数据的依赖"是个反直觉但重要的发现?它如何改变训练资源的分配策略?

提示

直觉上大家觉得性能靠堆训练数据,但论文显示:6B 视觉塔的 78B 只用约 1/10 token 就超过 600M 视觉塔的 Qwen2-VL-72B。原因是强视觉塔本身已经把图理解得很好,语言侧只需学"怎么把已理解的视觉信息说出来",要补的知识少。策略含义:与其无脑堆图文数据,不如先投资一个强视觉塔——它能省下大量下游训练数据和算力。这是资源分配从"堆数据"转向"先强化感知"的转变。

Q2:三根轴(模型/数据/测试时)"互相放大"具体是什么意思?举例说明。

提示

不是简单相加,而是相乘式增益。例如:更大的模型有更强的知识容量,才能真正吃下并利用更多、更干净的数据(小模型喂再多数据也学不动);同时更大的模型也更能从"思考时间"里受益(有能力做多步推理的模型,多打草稿才有用,弱模型打草稿也推不出)。所以三轴不是独立叠加,而是彼此解锁对方的上限——这正是规模法则里"协同"的含义。

Q3:为什么测试时扩展对 MMMU 有用,却对 OCR 几乎无用?

提示

测试时扩展(思维链、多次采样投票)的收益来自"多步推理能纠正/深化答案"。MMMU 的题需要多步推理(先读图、再调知识、再演算),多打草稿能减少中间错误。OCR 是"看一眼把字读出来"的感知任务,没有可推理的中间步骤——字要么认对要么认错,多想几遍不会让字变清楚。所以思考时间只对"有推理空间"的题有用。

Q4:论文发现几千条"重复模式"样本就能毁掉测试时扩展。为什么这么少的坏样本破坏力这么大?

提示

因为测试时扩展依赖长文本/思维链输出,而"重复模式"样本教会模型陷入复读循环。在短输出里这个坏习惯不易触发,但一旦让模型生成长推理链,它就容易滑进复读死循环,整段输出报废。少量样本破坏力大,是因为它污染的是"长序列生成"这个测试时扩展赖以生效的能力,而非某个具体知识点。所以清洗数据是测试时扩展的必要前提,不是锦上添花。

Q5:InternVL 用自训的 InternViT 而不是直接拿 CLIP/SigLIP。这个选择的代价和收益各是什么?

提示

收益:自训能把视觉塔做到 6B 这么大、并针对多模态任务优化(去掉过于偏向 CLIP 全局对齐的顶层),从而获得"大视觉塔省数据"的红利,端到端可控。代价:自训一个 6B 视觉塔本身要巨大算力和数据,门槛极高,不是所有团队能复制;且需要渐进式规模对齐等额外工程手段来摊平成本。这是"重资产换上限"的取舍。

Q6:为什么要用 pixel unshuffle 把每块的视觉 token 从 1024 压到 256?如果不压会怎样?

提示

因为动态切片会产生很多小块,每块 1024 token,一张高分辨率图切几十块就会产生上万视觉 token,塞进 LLM 会让上下文爆炸、算力和显存吃不消。pixel unshuffle 把每块压到 256 token,在"看清细节"和"token 预算可控"之间取平衡。不压的话,高分辨率输入会让序列长度失控,训练和推理都难以承受。

Q7:InternVL 2.5 的领先"靠执行力而非架构创新"。如果你是竞争对手,最快追平它的路径是什么?这说明护城河在哪?

提示

最快路径:照抄它公开的配方(三阶段训练、动态切片、渐进对齐、双层数据清洗),换上自己更大/更新的 LLM 和更干净的数据,很可能在下一代就追平甚至反超——因为架构没有秘密。这说明它的护城河不在算法,而在执行力:能否搞到强视觉塔、能否把数据清洗做到极致、能否负担大规模训练。开源透明的代价就是护城河浅,优势靠持续迭代维持,而非一次性架构突破。

所以这一节是想说:能回答这 7 个问题,你就真正理解了 InternVL 2.5 的规模化逻辑与工程取舍,而非只记住"开源破 70 分"。


一些好奇心问答(FAQ)

Q1:70 分很高吗?为什么是 70 而不是别的数?

MMMU 是大学级综合多模态考题,随机猜大概二三十分。70 分被社区默认为"强模型"门槛——闭源顶级模型早已越过,开源长期卡在 60 出头。InternVL2.5-78B 的 70.1 是开源第一次跨过这条线,象征意义类似 Llama 3 追上 GPT-4。

Q2:它真能和 GPT-4o 掰手腕吗?

在很多 benchmark 上是的,尤其推理和文档类。但 benchmark 不等于真实体验的全部,闭源在某些长尾能力、稳定性上可能仍有优势。"叫板"是指分数进入同一梯队,不代表处处更强。

Q3:我显存不大,能用吗?

能。它提供 1B / 2B / 4B / 8B / 26B / 38B / 78B 完整阶梯,按显存挑。代价是小档分数明显低于 78B——"又小又强"总是折中。

Q4:InternViT 和 CLIP 是一回事吗?

不是。InternViT 是上海 AI Lab 自训的大视觉塔(6B/300M),比 CLIP/SigLIP 大得多,是 InternVL 系列的自家视觉塔。CLIP 是更早、更通用的对比学习视觉编码器。

Q5:测试时扩展我要不要开?

看任务。做多步推理/数学题可以开思维链或多数投票,能加几分;做 OCR/检测这种感知任务别开,只会更慢不更准。

Q6:训练数据里最值得学的经验是什么?

双层过滤(数据源级定权重 + 样本级剔噪)和"删除重复模式样本"。后者尤其反直觉——几千条坏样本就能毁掉测试时扩展。想训 VLM 的人这章是必读地图。

Q7:它能直接用在机器人上吗?

它是通用视觉理解骨干,常被下游 VLA / 机器人策略拿去做感知前端或初始化,但本身不输出机器人动作。要落地机器人还需接一个动作头/策略网络。

Q8:读完接下来看什么?

想补范式底座看 llava-1-5.md;想看同代对照看 qwen-vl.mddeepseek-vl.md;想理解视觉塔看 clip.mdeva-clip.md;想看它当骨干的下游看 openvla.md

所以这一节是想说:关于分数含义、部署选型、测试时扩展、数据经验这些实操疑问,论文都给了清晰答案,InternVL 2.5 已是一份成熟可抄的开源 VLM 配方。


如果你想再深入

按"范式底座 → 视觉塔 → 同代对照 → 下游"排序:

  1. 范式底座:LLaVA / LLaVA-1.5 — "ViT-投影-LLM" 范式的定义者,InternVL 沿用它。见 llava-1-5.md
  2. 视觉塔谱系:CLIP / SigLIP / EVA-CLIP — 理解视觉塔的不同流派,对照 InternViT 的"自训大视觉塔"选择。见 clip.mdsiglip.mdeva-clip.md
  3. 前作:InternVL 1.x / 2.0 — 同系列,看架构如何一步步演进。见 internvl.md
  4. 同代对照:Qwen-VL / DeepSeek-VL — 同时代开源 VLM 的不同技术取舍。见 qwen-vl.mddeepseek-vl.md
  5. 下游应用:OpenVLA 等 — 把通用 VLM 当感知骨干接上机器人动作。见 openvla.md

所以这一节是想说:把 LLaVA + CLIP 视觉塔 + InternVL 系列 + 同代竞品连起来读,就能看清开源 VLM 从范式定义到规模化叫板闭源的完整脉络。


原文信息

BibTeX

@article{chen2024internvl25,
  title   = {Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling},
  author  = {Chen, Zhe and Wang, Weiyun and Cao, Yue and others (OpenGVLab, Shanghai AI Laboratory)},
  journal = {arXiv preprint arXiv:2412.05271},
  year    = {2024}
}

链接

所以这一节是想说:这是 OpenGVLab(上海 AI Lab)2024 年底的工作,第一个把开源 VLM 推过 MMMU 70 分,模型、代码、配方全部开源,是开源多模态规模化方向被反复引用的里程碑。

引用本笔记 / Cite this note
BibTeX
@online{eai_internvl_2_5_2026,
  title       = {(readable note) Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/internvl-2-5/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?