Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,术语第一次出现必定义 + 类比。
一句话讲什么(TL;DR)
InternVL 2.5 把"模型规模、训练数据、推理时算力"三根轴一起往上推,让完全开源、免费可下载的"看图模型"第一次在大学综合考试 MMMU 上突破 70 分(70.1),追平甚至叫板 GPT-4o、Claude-3.5-Sonnet 这些顶级闭源模型——而且把怎么做到的每一步都写成了别人能照抄的工程指南。
所以这一节是想说:这篇论文没有发明新架构,它的贡献是把大语言模型那套"规模法则"完整搬到视觉-语言模型上,并第一次把开源 VLM 推过了公认的强模型门槛。
这是个什么场景
想象你在群里发了一张化学课本里的反应机理图,问"这一步是什么反应?";或者拍一张陌生城市的地铁线路图问"我从 A 站怎么到 B 站?"。能看着图回答你的这种 AI,就叫 VLM(Vision-Language Model,视觉-语言模型),也叫 MLLM(多模态大语言模型)——可以理解成"会看图的 ChatGPT"。
之前的开源 VLM 像班里中等偏上的同学:菜单照片、宠物图、风景照都答得不错;可一到"看化学反应图讲机理""看统计图分析趋势""解一道带插图的大学物理题"这种真正需要动脑的大学考卷,就明显被闭源那位天才同学(GPT-4o)甩在后面。群里遇到这种难题,还是得掏钱调用闭源 API。
具体到分数上:多模态领域的"高考"叫 MMMU(覆盖艺术、商科、医学、理工等大学课程的综合多模态题库),70 分被公认为"强模型"的门槛。此前闭源模型早已越过,开源社区却长期卡在 60 出头(Qwen2-VL-72B 约 64.5)迟迟破不了 70。
InternVL 2.5 做的事,其实就是让这位开源中等生再补一整年课:课本(模型参数)加厚、习题(训练数据)翻倍且挑质量、考试时允许多花几分钟打草稿(推理时多步思考),最后让他在大学综合卷上第一次摸到 70 分这条线(70.1,比自家上一代高 3.7 分)。
它不是发明新教学法,而是把已有的教学法放大到极致,并且把每一步都公开写进可复现的工程配方——这才是它对开源社区的真正价值。
所以这一节是想说:InternVL 2.5 面对的场景是"开源看图模型在真正需要推理的大学级考题上落后闭源",它的答案是把三根规模轴一起拉满,并把配方全部公开。

之前的人怎么做的,为什么不够好
方案 A:闭源压制(GPT-4o / Claude 3.5 / Gemini 1.5) 类比:天才同学在,但答案册锁在他自己抽屉里。这些模型在多模态综合卷上长期把开源压在 70 分以下,且训练配方完全不公开。开源社区只能望其项背。
方案 B:单维度扩展 类比:只练一块肌肉。很多开源工作一次只做一件事——要么堆参数(把 LLM 换更大)、要么堆数据(塞更多图文对)、要么堆推理(加思维链提示),很少三件一起系统地做。结果是单点提升有限,撞不破 70 分天花板。
方案 C:忽视数据质量 类比:习题册里混着大量印错的题。早期开源 VLM 的训练数据充斥重复、噪声、低质 caption,尤其是"重复模式"样本。因为算力瓶颈先被容忍,具体清洗方法也大多不公开。
方案 D:训练配方黑盒 / 碎片化 类比:菜谱要么不给、要么东一句西一句。闭源不公开;开源虽公开但零碎——从 224 分辨率到 448、到动态高分辨率,每一步该怎么排课表、何时解冻视觉塔,社区缺一份"工业级完整配方"。
方案 E:开源没重视测试时计算 类比:从没教学生"难题先打草稿"。OpenAI o1 已经在纯文本侧把"测试时扩展"(推理时多花算力换准确率)做火,但开源 VLM 在多模态上几乎没人系统尝试。
共同瓶颈:开源 VLM 缺的不是某一项,而是"三根轴一起推 + 数据严格清洗 + 配方全公开"这套组合拳。少了任何一环,都破不了 70 分。
所以这一节是想说:之前开源要么被闭源的黑盒配方压制,要么只在单一维度用力、又不认真清洗数据,始终没人把三根规模轴 + 数据质量 + 测试时计算合成一套可复现的完整方案。
这篇论文的新想法
一句话:模型、数据、测试时三件事一起加大,并且把每一件都拆到别人能照着抄的程度。
类比健身:想练出好身材,单练不行,得"练 + 吃 + 睡"三件一起来,还得科学安排。VLM 也一样——
模型轴(练肌肉):从 1B 到 78B 提供完整的规模阶梯,视觉塔(InternViT)和语言塔(基于 InternLM 2.5、Qwen 2.5 等)的配比经过系统消融。一个关键发现是:大视觉编码器能显著降低对训练数据的依赖——用 6B 视觉塔的 InternVL2.5-78B 只用约 1/10 的训练 token,就超过用 600M 视觉塔的 Qwen2-VL-72B。
数据轴(吃饭):训练语料在上一代基础上继续扩张,但更强调质量过滤——去重、剔除低分样本、专门补强 OCR / 数学 / 图表 / 文档 / 视频等长尾领域。尤其针对"重复模式"样本做清洗,因为它们会毒害测试时的长文本/思维链输出。
测试时轴(考前打草稿):在推理阶段让模型先写思考过程(思维链)再答题,还可多答几遍投票取最常见答案。这在推理重的 benchmark 上能再加几分,但对"看一眼就能答"的感知类任务几乎无增益。
关键洞察是:三根轴互相放大——更大的模型更能吃下更多数据,也更能从更长的思考时间里受益。这其实就是把大语言模型的**规模法则(scaling law)**完整搬到了 VLM 上,并第一次给出完整实证。
所以这一节是想说:InternVL 2.5 的新想法是"三轴协同放大 + 每一轴都公开可抄",本质是把 LLM 的规模法则完整移植到多模态,并用一份工业级配方把它坐实。
它分几步做的(方法)
方法可拆成五块:整体架构(ViT-MLP-LLM)、动态高分辨率切片、三阶段训练、渐进式规模对齐、以及数据清洗流水线与测试时扩展。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。
先看整体架构图:
输入图(任意分辨率)
│ 动态切片:按宽高比切成若干 448×448 小块 + 一张缩略图
▼
┌───────────────────────────────┐
│ 视觉塔 InternViT │ 6B(5.5B/45层) 或 300M
│ 每块 448×448 → 1024 视觉 token │
│ pixel unshuffle 压成 256 token │
└───────────────┬───────────────┘
│ 视觉 token
▼
┌───────────────────────────────┐
│ Projector(2 层 MLP 翻译层) │ 把视觉特征翻成 LLM 能听懂的词向量
└───────────────┬───────────────┘
│ 拼上文字 token
▼
┌───────────────────────────────┐
│ 语言塔 LLM │ InternLM 2.5 / Qwen 2.5,多种规模
│ 输出:文字回答 │
└───────────────────────────────┘
5.1 整体架构:ViT-MLP-LLM 三段式
类比:一个翻译团队——一位专门看图的同事(视觉塔)+ 一位中间把图翻成语言的传话员(projector)+ 一位专门说话的同事(语言塔)。
机制(输入→处理→输出):
- 输入:图像 + 文字指令。
- 处理:InternVL 2.5 沿用前代的 "ViT-MLP-LLM" 范式。视觉塔用自家训练的 InternViT(6B 版实际 5.5B、45 层,或轻量的 300M 版),而不是直接拿 CLIP/SigLIP——这是 InternVL 系列一贯的"不雇外包"特点。视觉特征经一个随机初始化的 2 层 MLP projector 翻译成 LLM 的词向量空间,再和文字 token 一起送进语言塔(InternLM 2.5 或 Qwen 2.5,多种规模可选)。
- 输出:文字回答。
为什么用自家视觉塔:大视觉编码器带来一个关键红利——降低对训练数据的依赖。论文实测:6B 视觉塔的 78B 模型只用约 120B token 训练,就超过用 600M 视觉塔、训了 1.4T token 的 Qwen2-VL-72B。视觉塔越强,语言侧要学的东西越少。
5.2 动态高分辨率切片:看清文档小字又不爆 token
类比:A4 文档塞不进护照大小的扫描仪,就按版面切成几块分别扫,再附一张缩略图保留整体布局。
机制(输入→处理→输出):
- 输入:一张任意宽高比、可能很大的图(如 4K 文档截图)。
- 处理:按宽高比把图切成若干 448×448 的小块(tile),每块单独走 ViT。每块 448×448 原本产生 1024 个视觉 token,通过 pixel unshuffle(像素反混洗) 操作把 token 数压到 1/4,即 256 个。这样既能看清文档里的小字,又不会让 token 数爆炸。
- 输出:所有小块 + 缩略图的视觉 token 拼在一起。
等等,先慢一拍——token 是什么? 语言模型只懂"词",所以视觉塔要把图片压成一串"视觉词"(token)交给它。token 越多看得越细,但算力代价越大。pixel unshuffle 就是"用更少的视觉词表达同样的图"的省钱技巧。
为什么有用:文档理解、OCR、图表这些"看得清小字才答得对"的任务,硬门槛就是分辨率。动态切片让模型能吃高分辨率而不失控。
5.3 三阶段训练:从认字到读文章到按格式答题
类比:教一个外国实习生干活——先教他认字(对齐)、再让他大量读真实材料见世面(预训练)、最后手把手教他"客户问 X 你要回 Y"(指令微调)。
机制(输入→处理→输出):
- 阶段一(MLP 预热):冻结视觉塔和语言塔,只训 projector,让"传话员"先学会把图翻成语言。
- 阶段二(视觉-语言预训练):解冻更多参数,喂海量图文/文档/OCR/视频数据,让模型见多识广。
- 阶段三(指令微调 SFT):用高质量的指令-回答对调教,让它学会按用户期望的格式输出。这一阶段 LLM 也可训——但论文强调:哪怕几千条带"重复模式"的噪声样本,都可能让模型陷入复读或固定错误,所以此阶段数据质量控制极严,且用统一学习率保持简单。
- 输出:一个既懂图又会按指令答题的完整 VLM。
三阶段"谁在训、谁冻结"可以画成一张图:
阶段一 MLP 预热 : [InternViT 冻] [Projector ✓] [LLM 冻]
目标:传话员先学会把图翻成语言
阶段二 视觉-语言 : [InternViT ✓] [Projector ✓] [LLM ✓]
预训练 目标:喂海量图文/文档/视频,见多识广
阶段三 指令微调SFT: [InternViT ✓] [Projector ✓] [LLM ✓]
目标:高质量指令数据,学会按格式答题(严控噪声样本)
────────────────────────────────────────────────
渐进式规模对齐:先用小 LLM 把 InternViT 调顺,再迁去配大 LLM(省算力)
为什么这样分:把难度拆成台阶,每阶段只解决一个问题(对齐 → 知识 → 格式),比一锅乱炖稳定得多。
5.4 渐进式规模对齐:小模型先探路,大模型再接手
类比:先让一个便宜的助手把视觉塔"调教顺手",再把这个调好的视觉塔交给贵的大模型,省下大模型的探索成本。
机制:论文提出渐进式规模策略——先用较小的 LLM 把 InternViT 视觉塔对齐、调教到位,再把这个已经"懂图"的视觉塔迁移去配更大的 LLM。因为视觉塔和小 LLM 配合时的探索成本远低于和大 LLM 配合,这样能大幅节省算力。这也是"大视觉塔降低数据依赖"这个发现能落地的工程手段。
为什么有用:让 1B 到 78B 的整条阶梯能高效地共享同一套调教好的视觉塔,而不必每个规模都从零对齐一遍。
5.5 数据清洗流水线 + 测试时扩展
类比:备料时先挑靠谱供应商(数据源级),再一颗颗把烂菜挑出来(样本级);考试时会做的直接写,难题先打草稿、不放心就做三遍取最常见答案。
机制(输入→处理→输出):
- 数据清洗:做 dataset-level + sample-level 双层过滤——数据源级评估每个来源的整体质量来定权重;样本级用模型打分剔除单条噪声。特别地,专门识别并删除"重复模式"样本——论文发现哪怕仅几千条这类样本,也会在长文本输出和思维链推理时让模型陷入死循环,是测试时扩展的头号杀手。
- 测试时扩展(test-time scaling):推理阶段让模型先生成思考链(CoT)再给答案,并支持 best-of-N 采样 + 多数投票。
- 输出:更干净的训练数据 + 推理时可选的"多花算力换准确率"开关。
关键结论:测试时扩展在推理重的 benchmark(MMMU、数学题)上能再加几分,但对感知类任务(OCR、grounding 这种"看一眼就答"的)几乎没增益——和 LLM 侧发现一致:思考时间只对真正需要思考的题目有用。
所以这一节是想说:InternVL 2.5 的方法 = ViT-MLP-LLM 架构 + 动态高分切片 + 三阶段训练 + 渐进式规模对齐 + 双层数据清洗与测试时扩展,五块合起来是一份"三轴协同放大"的完整工业配方,其中"大视觉塔省数据"和"清洗重复样本救测试时扩展"是两条最有工程价值的经验。

关键数字(What works)
数字本身不重要,重要的是它们告诉你"三轴各自贡献了什么、开源到底追到什么程度"。以下数字来自原文;未报告的标"原文未报告"。
数字 1:MMMU 首次破 70(开源里程碑)
| 模型 | MMMU(验证集) |
|---|---|
| InternVL2.5-78B | 70.1(开源首次 > 70,较上一代 +3.7) |
| Qwen2-VL-72B | 64.5 |
| OpenAI o1 | 78.2 |
| 关键含义 | 类似 Llama 3 在文本侧"开源追上 GPT-4"的那一刻 |
数字 2:大视觉塔省数据
| 模型 | 视觉塔 | 训练 token | MMMU |
|---|---|---|---|
| InternVL2.5-78B | 6B(InternViT) | ~120B | 70.1 |
| Qwen2-VL-72B | 600M | ~1.4T | 64.5 |
| 关键含义 | 大视觉塔用约 1/10 数据反超——视觉塔越强,数据需求越低 |
数字 3:完整规模阶梯(OpenCompass 综合分)
| 型号 | 参数 | 视觉塔 | OpenCompass |
|---|---|---|---|
| InternVL2.5-1B | 0.9B | InternViT-300M | 54.5 |
| InternVL2.5-2B | 2.2B | InternViT-300M | 59.8 |
| InternVL2.5-4B | 3.7B | InternViT-300M | 65.1 |
| InternVL2.5-8B | 8.1B | InternViT-300M | 68.1 |
| InternVL2.5-26B | 25.5B | InternViT-6B | 71.3 |
| InternVL2.5-38B / 78B | 38.4B / — | InternViT-6B | 更高(原文表格) |
| 关键含义 | 从边缘设备到数据中心,用户按显存挑型号——开源相对闭源的关键卖点 |
数字 4:推理类 benchmark(78B)
| Benchmark | 分数 | 说明 |
|---|---|---|
| MMMU | 70.1 | 多学科推理 |
| MMMU-Pro | 51.4 | 更难的多学科推理 |
| MathVista | 72.3 | 数学视觉推理 |
| MATH-Vision | 34.9 | 数学视觉(更难) |
| 关键含义 | 全面对标 GPT-4o / Claude-3.5,缩小甚至反超 |
数字 5:架构关键数
| 项目 | 数值 |
|---|---|
| 图块尺寸 | 448×448 |
| 每块视觉 token(unshuffle 前 → 后) | 1024 → 256 |
| InternViT-6B 实际 | 5.5B 参数、45 层 |
| 视觉塔选项 | InternViT-6B / InternViT-300M |
| 语言塔选项 | InternLM 2.5 / Qwen 2.5 等 |
数字 6:测试时扩展的适用边界
| 任务类型 | 测试时扩展增益 |
|---|---|
| 推理重(MMMU、数学) | 有,能再加几分 |
| 感知类(OCR、grounding) | 几乎无 |
| 关键含义 | 思考时间只对真需要思考的题有用 |
所以这一节是想说:最硬的三个结论是"MMMU 破 70、大视觉塔用 1/10 数据反超、七档规模阶梯全公开"——它们共同证明三轴协同放大是可行且可复现的。
实验结果说明了什么
上一节列数字,这一节回答实验背后的科学问题。
问题一:开源 VLM 到底能不能追上闭源? 能。MMMU 70.1 首次让开源越过公认门槛,并在数学、文档、多图/视频、grounding、多语言等一系列 benchmark 上与 GPT-4o、Claude-3.5-Sonnet 掰手腕。这不是单点超越,而是全面的性能靠拢——对开源社区的意义类似 Llama 3 在文本侧追上 GPT-4 的那一刻。
问题二:三根轴是不是真的各自有效、还能叠加? 是。论文分别消融模型规模、数据规模、测试时策略对 MMMU 的贡献,验证"三轴各自有效且可叠加"。更重要的发现是它们互相放大——大模型更能吃数据、也更能从思考时间受益。这把"规模法则"从 LLM 完整迁移到了 VLM,并给出实证。
问题三:视觉塔越大越好,还是越大越浪费? 越大越省数据。这是全文最反直觉的发现之一:6B 视觉塔的 78B 模型只用约 1/10 的训练 token 就超过 600M 视觉塔的 Qwen2-VL-72B。含义是——与其拼命堆训练数据,不如先把视觉塔做强,视觉塔强了语言侧要学的东西自然变少。这直接影响后续工作的资源分配决策。
问题四:测试时扩展是万灵药吗? 不是。它只在真正需要推理的题目上有用(MMMU、数学),对"看一眼就能答"的感知任务(OCR、grounding)几乎无增益。这和 LLM 侧的结论一致,也提醒使用者别对所有任务无脑开思维链——那只会更慢却不更准。
问题五:数据质量为什么被反复强调? 因为它是测试时扩展能否奏效的隐形前提。论文发现哪怕仅几千条"重复模式"样本,也会让模型在长文本/思维链输出时陷入复读死循环,毁掉测试时扩展的收益。所以他们专门设计了双层过滤流水线。这个发现对任何想训 VLM 的人都是硬核经验——清洗数据不是可选项,而是让高级推理生效的必要条件。
所以这一节是想说:实验系统回答了五个问题——开源能追上闭源、三轴各自有效且互相放大、大视觉塔省数据、测试时扩展只对推理题有用、数据清洗是它的隐形前提——共同把"规模法则移植到 VLM"这件事坐实。
你应该懂的几个新词
VLM / MLLM(视觉-语言模型 / 多模态大语言模型):能同时吃图和文、输出文本的模型。可理解为"会看图的 ChatGPT"。
MMMU(Massive Multi-discipline Multimodal Understanding):覆盖艺术、商科、医学、理工等大学课程的综合多模态题库,被视为 VLM 的"高考",70 分是公认的强模型门槛。
规模法则(Scaling Law):性能随模型规模、数据规模、算力大致按可预测规律提升。最早在 LLM 上总结(Kaplan、Chinchilla),本文把它系统迁移到 VLM。
测试时扩展(Test-Time Scaling):推理阶段多花算力换准确率,如思维链(CoT)、best-of-N 采样、多数投票。OpenAI o1 把它推火,本文迁到多模态。
动态高分辨率切片(Dynamic High-Resolution Tiling):把大图按宽高比切成多个固定尺寸小块分别编码,让 ViT 既看清细节又不爆 token 数。
pixel unshuffle(像素反混洗):一种把视觉 token 数压缩(本文压到 1/4)的操作,用更少的"视觉词"表达同一张图,省算力。
InternViT:上海 AI Lab 自训的视觉编码器,有 6B(实际 5.5B)和 300M 两档,对标 CLIP/SigLIP 但更大,是 InternVL 系列的"自家视觉塔"。
Projector(投影器):连接视觉特征和 LLM 词向量空间的小型模块(本文是 2 层 MLP),参数最少但最关键的"翻译层"。
SFT(Supervised Fine-Tuning,监督微调):用高质量指令-回答对做最后一轮调教,让模型学会按用户期望的格式输出、听得懂人话。
思维链(Chain-of-Thought, CoT):让模型先写出中间推理步骤再给最终答案,对需要多步推理的题目有帮助。
所以这一节是想说:掌握这十个词,你就能读懂几乎所有"开源 VLM + 规模化"方向的论文。
它有什么搞不定的
InternVL 2.5 不是终点,几个局限值得注意:
不是新架构,红利来自规模与工程:它沿用前代的 ViT-MLP-LLM,本质是把规模法则做到位 + 配方公开。这意味着它的领先很可能被下一个"更大、数据更干净"的模型迅速追平——护城河是执行力而非架构创新。
测试时扩展适用面窄:只对推理题有用,对感知任务无益,还更慢。对以 OCR/检测为主的应用场景,这条轴基本白搭。
对数据质量极度敏感:几千条噪声样本就能毒害测试时扩展。这既是发现也是脆弱点——训练它需要一套严格的清洗流水线,复现门槛并不低。
大模型部署成本高:78B 要拿到 70.1,推理成本可观。虽然有 1B–8B 的轻量档,但这些档的分数与 78B 有明显差距,"又小又强"仍是折中。
仍未根本解决幻觉与可靠性:论文评测里含幻觉检测,但 VLM 看错图、编造细节的问题并未被规模彻底解决。高风险场景(医疗、法律)仍需谨慎。
所以这一节是想说:InternVL 2.5 用规模和工程把开源推过了 70 分,但它的领先靠执行力而非架构、测试时扩展适用面窄、对数据质量敏感、大模型贵、且幻觉未根治——这些都是后续工作要接着啃的。
它和别的几篇是什么关系
直接前作:InternVL 1.0 / 1.5 / 2.0 是同系列。2.5 主要是规模、数据、测试时的扩展,架构基本不变。参见
internvl.md。同代竞品:Qwen2-VL、LLaVA-OneVision、Pixtral、Llama 3.2 Vision 在同一时间窗发布,互相对标。InternVL 2.5 在多数 benchmark 上是当时的开源 SOTA。参见
qwen-vl.md、llava-onevision.md、pixtral-12b.md。视觉塔血统:InternViT 对标 CLIP/SigLIP,但走"自训大视觉塔"路线。可对照
clip.md、siglip.md、eva-clip.md理解视觉塔的不同流派。同期思路对照:DeepSeek-VL,参见
deepseek-vl.md。DeepSeek-VL 走"混合视觉编码器 + 真实场景数据"的小而实用路线,InternVL 2.5 走"三轴规模化 + 全家桶"路线。两者是开源 VLM 的两种典型策略。规模法则谱系:把 Kaplan / Chinchilla 的 LLM scaling 迁移到 VLM。同期 Idefics3、PaliGemma 2 也在做类似事,但 InternVL 2.5 是规模阶梯最完整、数据流水线最透明的之一。
测试时计算谱系:和 OpenAI o1、DeepSeek-R1 共享"测试时算力"哲学,但应用到多模态。后续 InternVL 3、Qwen2.5-VL 会继续推这条线。
对具身 AI 的连接:作为通用 VLM 骨干,InternVL 2.5 常被下游 VLA(视觉-语言-动作)模型拿去做视觉理解前端/初始化。理解它的能力边界,就是理解那些下游机器人模型的感知上限。
所以这一节是想说:InternVL 2.5 是"开源 VLM 规模法则移植"这条线的一个完整实证节点,上接 InternVL 系列与 CLIP 视觉塔谱系,横向对标 Qwen2-VL / DeepSeek-VL,下接一众用它当骨干的 VLA。
和本导读的关系
本笔记对应导读 Ch09: VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力。
导读 Ch09 讲的是 VLM 如何从"看懂图"进化到"看着图对话"这条线:CLIP 把图和词对齐 → BLIP-2 用 Q-Former 桥接冻结的 LLM → LLaVA 用简单的投影层 + 指令微调把视觉变成对话的一部分 → 再到 InternVL、Qwen-VL 这类把架构规模化、工程化的现代开源 VLM。InternVL 2.5 在这条线里是规模化与工程化的集大成节点——它证明 LLaVA 定义的 "ViT-投影-LLM" 范式,配上规模法则和严格的数据工程,能把开源 VLM 推到叫板闭源的高度。
建议阅读顺序:先读导读 Ch09 建立"VLM 怎么学会看图对话"的整体脉络;再读 llava-1-5.md 理解 "ViT-投影-LLM" 这个被 InternVL 沿用的基本范式从哪来;然后读本笔记,看这个范式如何靠三轴规模化被推到 70 分;最后对照 deepseek-vl.md 与 qwen-vl.md,看同一时代开源 VLM 的不同技术取舍。
从知识图谱角度,本笔记向上连接 Ch08(CLIP 视觉塔),向下连接 Ch12(OpenVLA/VLAS/MLA 等 VLA)——因为很多机器人策略正是拿这类通用 VLM 当感知前端。
所以这一节是想说:本笔记是导读 Ch09 里"VLM 从对话能力走向规模化叫板闭源"的关键案例,读完能看清 LLaVA 范式如何靠规模法则被推向巅峰。
思考题
以下问题检验你是否真正理解论文逻辑,而非记住"MMMU 70.1"。每题附折叠提示,先自己想 30 秒再展开。
Q1:为什么"大视觉塔能降低对训练数据的依赖"是个反直觉但重要的发现?它如何改变训练资源的分配策略?
提示
直觉上大家觉得性能靠堆训练数据,但论文显示:6B 视觉塔的 78B 只用约 1/10 token 就超过 600M 视觉塔的 Qwen2-VL-72B。原因是强视觉塔本身已经把图理解得很好,语言侧只需学"怎么把已理解的视觉信息说出来",要补的知识少。策略含义:与其无脑堆图文数据,不如先投资一个强视觉塔——它能省下大量下游训练数据和算力。这是资源分配从"堆数据"转向"先强化感知"的转变。
Q2:三根轴(模型/数据/测试时)"互相放大"具体是什么意思?举例说明。
提示
不是简单相加,而是相乘式增益。例如:更大的模型有更强的知识容量,才能真正吃下并利用更多、更干净的数据(小模型喂再多数据也学不动);同时更大的模型也更能从"思考时间"里受益(有能力做多步推理的模型,多打草稿才有用,弱模型打草稿也推不出)。所以三轴不是独立叠加,而是彼此解锁对方的上限——这正是规模法则里"协同"的含义。
Q3:为什么测试时扩展对 MMMU 有用,却对 OCR 几乎无用?
提示
测试时扩展(思维链、多次采样投票)的收益来自"多步推理能纠正/深化答案"。MMMU 的题需要多步推理(先读图、再调知识、再演算),多打草稿能减少中间错误。OCR 是"看一眼把字读出来"的感知任务,没有可推理的中间步骤——字要么认对要么认错,多想几遍不会让字变清楚。所以思考时间只对"有推理空间"的题有用。
Q4:论文发现几千条"重复模式"样本就能毁掉测试时扩展。为什么这么少的坏样本破坏力这么大?
提示
因为测试时扩展依赖长文本/思维链输出,而"重复模式"样本教会模型陷入复读循环。在短输出里这个坏习惯不易触发,但一旦让模型生成长推理链,它就容易滑进复读死循环,整段输出报废。少量样本破坏力大,是因为它污染的是"长序列生成"这个测试时扩展赖以生效的能力,而非某个具体知识点。所以清洗数据是测试时扩展的必要前提,不是锦上添花。
Q5:InternVL 用自训的 InternViT 而不是直接拿 CLIP/SigLIP。这个选择的代价和收益各是什么?
提示
收益:自训能把视觉塔做到 6B 这么大、并针对多模态任务优化(去掉过于偏向 CLIP 全局对齐的顶层),从而获得"大视觉塔省数据"的红利,端到端可控。代价:自训一个 6B 视觉塔本身要巨大算力和数据,门槛极高,不是所有团队能复制;且需要渐进式规模对齐等额外工程手段来摊平成本。这是"重资产换上限"的取舍。
Q6:为什么要用 pixel unshuffle 把每块的视觉 token 从 1024 压到 256?如果不压会怎样?
提示
因为动态切片会产生很多小块,每块 1024 token,一张高分辨率图切几十块就会产生上万视觉 token,塞进 LLM 会让上下文爆炸、算力和显存吃不消。pixel unshuffle 把每块压到 256 token,在"看清细节"和"token 预算可控"之间取平衡。不压的话,高分辨率输入会让序列长度失控,训练和推理都难以承受。
Q7:InternVL 2.5 的领先"靠执行力而非架构创新"。如果你是竞争对手,最快追平它的路径是什么?这说明护城河在哪?
提示
最快路径:照抄它公开的配方(三阶段训练、动态切片、渐进对齐、双层数据清洗),换上自己更大/更新的 LLM 和更干净的数据,很可能在下一代就追平甚至反超——因为架构没有秘密。这说明它的护城河不在算法,而在执行力:能否搞到强视觉塔、能否把数据清洗做到极致、能否负担大规模训练。开源透明的代价就是护城河浅,优势靠持续迭代维持,而非一次性架构突破。
所以这一节是想说:能回答这 7 个问题,你就真正理解了 InternVL 2.5 的规模化逻辑与工程取舍,而非只记住"开源破 70 分"。
一些好奇心问答(FAQ)
Q1:70 分很高吗?为什么是 70 而不是别的数?
MMMU 是大学级综合多模态考题,随机猜大概二三十分。70 分被社区默认为"强模型"门槛——闭源顶级模型早已越过,开源长期卡在 60 出头。InternVL2.5-78B 的 70.1 是开源第一次跨过这条线,象征意义类似 Llama 3 追上 GPT-4。
Q2:它真能和 GPT-4o 掰手腕吗?
在很多 benchmark 上是的,尤其推理和文档类。但 benchmark 不等于真实体验的全部,闭源在某些长尾能力、稳定性上可能仍有优势。"叫板"是指分数进入同一梯队,不代表处处更强。
Q3:我显存不大,能用吗?
能。它提供 1B / 2B / 4B / 8B / 26B / 38B / 78B 完整阶梯,按显存挑。代价是小档分数明显低于 78B——"又小又强"总是折中。
Q4:InternViT 和 CLIP 是一回事吗?
不是。InternViT 是上海 AI Lab 自训的大视觉塔(6B/300M),比 CLIP/SigLIP 大得多,是 InternVL 系列的自家视觉塔。CLIP 是更早、更通用的对比学习视觉编码器。
Q5:测试时扩展我要不要开?
看任务。做多步推理/数学题可以开思维链或多数投票,能加几分;做 OCR/检测这种感知任务别开,只会更慢不更准。
Q6:训练数据里最值得学的经验是什么?
双层过滤(数据源级定权重 + 样本级剔噪)和"删除重复模式样本"。后者尤其反直觉——几千条坏样本就能毁掉测试时扩展。想训 VLM 的人这章是必读地图。
Q7:它能直接用在机器人上吗?
它是通用视觉理解骨干,常被下游 VLA / 机器人策略拿去做感知前端或初始化,但本身不输出机器人动作。要落地机器人还需接一个动作头/策略网络。
Q8:读完接下来看什么?
想补范式底座看 llava-1-5.md;想看同代对照看 qwen-vl.md、deepseek-vl.md;想理解视觉塔看 clip.md、eva-clip.md;想看它当骨干的下游看 openvla.md。
所以这一节是想说:关于分数含义、部署选型、测试时扩展、数据经验这些实操疑问,论文都给了清晰答案,InternVL 2.5 已是一份成熟可抄的开源 VLM 配方。
如果你想再深入
按"范式底座 → 视觉塔 → 同代对照 → 下游"排序:
- 范式底座:LLaVA / LLaVA-1.5 — "ViT-投影-LLM" 范式的定义者,InternVL 沿用它。见
llava-1-5.md。 - 视觉塔谱系:CLIP / SigLIP / EVA-CLIP — 理解视觉塔的不同流派,对照 InternViT 的"自训大视觉塔"选择。见
clip.md、siglip.md、eva-clip.md。 - 前作:InternVL 1.x / 2.0 — 同系列,看架构如何一步步演进。见
internvl.md。 - 同代对照:Qwen-VL / DeepSeek-VL — 同时代开源 VLM 的不同技术取舍。见
qwen-vl.md、deepseek-vl.md。 - 下游应用:OpenVLA 等 — 把通用 VLM 当感知骨干接上机器人动作。见
openvla.md。
所以这一节是想说:把 LLaVA + CLIP 视觉塔 + InternVL 系列 + 同代竞品连起来读,就能看清开源 VLM 从范式定义到规模化叫板闭源的完整脉络。
原文信息
BibTeX
@article{chen2024internvl25,
title = {Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling},
author = {Chen, Zhe and Wang, Weiyun and Cao, Yue and others (OpenGVLab, Shanghai AI Laboratory)},
journal = {arXiv preprint arXiv:2412.05271},
year = {2024}
}
链接
- arXiv:arxiv.org/abs/2412.05271
- 代码:github.com/OpenGVLab/InternVL
- 模型:huggingface.co/OpenGVLab/InternVL2_5-78B
- 团队:OpenGVLab / 上海人工智能实验室及合作单位
所以这一节是想说:这是 OpenGVLab(上海 AI Lab)2024 年底的工作,第一个把开源 VLM 推过 MMMU 70 分,模型、代码、配方全部开源,是开源多模态规模化方向被反复引用的里程碑。
◼
引用本笔记 / Cite this note
@online{eai_internvl_2_5_2026,
title = {(readable note) Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/internvl-2-5/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?