Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 128

DeepSeek-VL: Towards Real-World Vision-Language Understanding

24 min read · 8408 字 · ⭐⭐⭐ · 长篇结构化

这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,术语第一次出现必定义 + 类比。

一句话讲什么(TL;DR)

DeepSeek 在 2024 年开源的"会看图"模型(1.3B 和 7B 两档),核心不是堆参数,而是给模型配了一双"广角镜头 + 微距镜头"的眼睛(SigLIP + SAM 混合视觉编码器)、能吃 1024×1024 高分辨率,还专门用真实世界的发票、PPT、图表、UI 截图当训练餐单——让它不只会答学术考题,更能在真实办公场景里直接干活,同时不把原有的语言能力搞丢。

所以这一节是想说:这篇论文的核心判断是"VLM 的真瓶颈不是语言模型不够大,而是眼睛看不清 + 训练时没见过真实图片",它用混合视觉编码器、高分辨率、真实数据配比和一套保住语言能力的训练法来对症下药。


这是个什么场景

设想你随手拍了一张餐厅小票,发给 AI 助手让它帮你算 AA。它回你:"呃,好像有几个数字?看不清。"——这就是早期"会看图"模型的真实窘境:照片一旦不是教科书插图、不是网红风景照,而是密密麻麻的小字、表格、截图,它就抓瞎。

**VLM(Vision-Language Model,视觉-语言模型,能"看图说话"的 AI)**当时大致分两类:一类只看过摄影作品和教科书插图,遇到密集文字就懵;另一类很会答学术 benchmark(COCO、VQA 这种),但碰到真实的发票、PPT、科研图就愣住。

再想几个生活里很常见的场景:

  • 你截了一张银行流水问"上个月外卖花了多少"——它得能看清密密麻麻的小字。
  • 你拍了一页论文里的折线图问"2023 年这条线在掉还是在涨"——它得能分清子图和图注。
  • 你截了一张 App 设置页问"关掉自动续费的按钮在哪"——它得能在 UI 截图里定位到具体那个按钮。

DeepSeek-VL 想做的是第三类:像一个在办公室干过几年杂活的实习生——不一定最聪明,但 PPT、发票、图表、UI 截图都能看明白,能直接干活。而且它坚持一个原则:一个好的 VLM 首先得是个好的语言模型,不能为了学看图把说话能力搞退化。

所以这一节是想说:DeepSeek-VL 面对的场景是"真实世界的密集文字/图表/截图,早期 VLM 看不清也没见过",它要做的是一个真实场景导向、又保住语言能力的实用型开源 VLM。


DeepSeek-VL — 场景示意:这论文要解决的现实问题
Plate Nº IDeepSeek-VL — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • 方案 A:CLIP 路线(CLIP、BLIP) 类比:用一台固定焦距的傻瓜相机看世界。用对比学习把图和文对齐,但视觉塔分辨率通常固定在 224 或 336,文档级细节看不清。低分辨率是硬伤。

  • 方案 B:冻结 LLM + 适配器(Flamingo、BLIP-2) 类比:把图硬翻译几句塞给一个不许改口的翻译。把视觉特征通过 cross-attention 适配器塞进冻结的语言模型,省训练成本,但视觉端表达能力受限,且这种耦合方式后来被证明不如直接投影灵活。

  • 方案 C:端到端微调(LLaVA 系列) 类比:请个老师同时教看图和说话,效果好但焦距还是固定的。把 CLIP 视觉塔接到 LLM 做指令微调,效果好,但仍受限于固定分辨率和单一视觉编码器——一只眼睛要么看清全局、要么看清细节,二选一。

  • 方案 D:学术 benchmark 导向 类比:只刷高考模拟卷,不练真实工作场景。大多数 VLM 在 VQAv2 / MMBench / MME 上刷分,对真实的"密集文字 + 多子图 + 长上下文"覆盖不足。考得好不等于用得好。

  • 方案 E:靠堆参数兜底 类比:脑子不够大就换个更大的脑子。用 30B+ 大模型硬撑视觉理解,但部署成本高,开源社区难复用。

  • 一个被忽视的坑:多模态训练会伤语言能力。 直接拿一个语言模型硬灌多模态数据,多模态指标是涨了,但语言能力会断崖式下跌——因为多数多模态语料太简单、分布和纯文本差太远。这个"跷跷板"问题此前少有人系统解决。

所以这一节是想说:之前要么分辨率太低看不清细节、要么适配器耦合太死、要么只刷学术分、要么靠堆参数,且普遍忽视"学看图会伤语言"这个跷跷板——DeepSeek-VL 就是来同时解决这几件事的。


这篇论文的新想法

如果上一代 VLM 像个只会做高考题的学生,DeepSeek-VL 想把它变成一个"什么活都见过"的实习生。这个转变拆成三层,外加一条贯穿始终的原则:

  1. 数据层——别只刷题,去看真实世界。 以前的训练餐单像高三模拟卷(COCO、VQA),这篇把网页截图、论文图、PDF 文档、图表、OCR 数据,按"人平时真的会拿什么图问 AI"的比例混进来。他们甚至从网上收集真实的 GPT-4V / Gemini 使用案例,整理成一个"使用场景分类法"(use-case taxonomy),据此挑选训练和评测的题目。

  2. 视觉编码器层——一个看全局,一个看细节。 单个视觉编码器要么看清整体、要么看清细节,二选一。论文用混合视觉编码器(hybrid vision encoder,两个视觉模型并行处理同一张图)——一个看大局(语义),一个看细节(高分辨率),特征拼起来再交给语言模型。

  3. 分辨率层——大图切块再拼回。高分辨率处理,让模型能吃下 1024×1024 的输入。看清文档小字和图表标签的硬条件就是分辨率。

  4. 贯穿原则——保住语言能力。 一个好 VLM 首先得是好 LLM。训练时必须小心管理"视觉 vs 语言"的竞争,从以文字为主开始,再逐步加大多模态比例,绝不让语言能力退化。

一句话:真正的瓶颈不是语言模型不够大,而是"眼睛"看不清 + 训练时没见过真实图片 + 学看图时把说话能力搞丢了。

所以这一节是想说:DeepSeek-VL 的新想法是"眼睛要好(混合编码器 + 高分辨率)、餐单要真(真实场景数据配比)、且不能顾此失彼(保住语言能力)",把重心从"堆参数"转向"补眼睛、补真实数据、护语言"。


它分几步做的(方法)

方法可拆成五块:混合视觉编码器、高分辨率处理、三阶段训练、保住语言能力的数据配比、以及两档模型尺寸。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。

先看整体架构图:

          输入图(高分辨率,如 1024×1024)
        ┌──────────────┴──────────────┐
        ▼                             ▼
 ┌───────────────┐            ┌────────────────┐
 │ SigLIP-L      │            │ SAM-B          │
 │ 广角/语义     │            │ 微距/细节      │
 │ 低分(如384)   │            │ 高分(1024)     │
 └──────┬────────┘            └───────┬────────┘
        │  语义特征                    │  细节特征
        └──────────────┬──────────────┘
                       ▼
              拼接融合的视觉特征
                       │
                       ▼
              ┌────────────────┐
              │ VL 适配器      │  把视觉特征翻成 LLM 词向量
              └───────┬────────┘
                      │  拼上文字 token
                      ▼
              ┌────────────────┐
              │ DeepSeek-LLM   │  1B 或 7B
              │ 输出文字回答    │
              └────────────────┘

再看三阶段训练的"谁在动、谁冻结"图:

 ┌────────────────┬──────────────────┬──────────┬───────┐
 │ 阶段            │ 视觉编码器        │ 适配器   │ LLM   │
 ├────────────────┼──────────────────┼──────────┼───────┤
 │ 1 适配器预热    │ SigLIP冻 SAM冻    │ ✓ 训练   │ 冻结  │
 │ 2 联合预训练★   │ 全冻              │ ✓ 训练   │ ✓训练 │
 │ 3 监督微调 SFT  │ SigLIP✓ SAM冻     │ ✓ 训练   │ ✓训练 │
 └────────────────┴──────────────────┴──────────┴───────┘
   ★关键阶段:护住语言能力(从文字为主逐步加图)

5.1 混合视觉编码器:广角镜头 + 微距镜头

类比:拍照时广角看全景、微距凑近看细节,两张合在一起就什么都不漏。

机制(输入→处理→输出)

  • 输入:同一张图,分别送两路。
  • 处理:一路用 SigLIP-L(一种改进版 CLIP,用 sigmoid loss 训练更稳,2024 年 VLM 常用它做语义理解)处理缩放过的全局图(如 384×384),抓"这张图大致在讲什么";另一路用 SAM-B(Meta 出的分割大模型 Segment Anything,它的视觉编码器擅长抓局部细节)处理高分辨率版本(如 1024×1024),抓"每个角落长什么样"。两路特征拼接融合。
  • 输出:一份既有全局语义、又有局部细节的融合视觉特征,送进适配器。

为什么要两只眼睛:论文指出,单靠 SigLIP 这类 CLIP 家族编码器有两个短板——一是"CLIP-blind pairs"(把明显不同的图编码成相似向量,语义模糊),二是分辨率低(224/336/384)看不清密集 OCR 和精细定位。SAM-B 高分辨率细节分支正好补上这两块。全局定语义、局部抠细节,互补。

5.2 高分辨率处理:A4 文档分块扫再拼

类比:扫描仪只能扫小尺寸,要扫一张 A4 文档,就切成几块分别扫,再附一张拍全貌的缩略图保留版面。

机制(输入→处理→输出)

  • 输入:一张高分辨率图。
  • 处理:SAM-B 分支直接吃 1024×1024 的高分辨率输入以保留细节;SigLIP 分支吃缩略/全局版保留整体布局。两者一起产生视觉 token 交给语言模型。这样既看清小字、又不丢版面。
  • 输出:兼顾细节与全局的视觉 token 序列。

等等,先慢一拍——token 是什么? 语言模型只懂"词",所以视觉编码器要把图片压成一串"视觉词"(token)交给它。token 越多看得越细,但算力代价越大——这就是为什么要在细节和 token 预算之间做取舍。

为什么有用:文档理解、OCR、图表、UI 定位这些"真实场景"任务,成败全看分辨率。高分辨率是硬门槛,DeepSeek-VL 靠 SAM-B 分支跨过它。

5.3 三阶段训练:从对齐到见世面到听懂人话

类比:教一个外国实习生干活——先教他认中文(对齐),再让他在真实工位跟着干(联合预训练),最后手把手教"客户问 X 你要回 Y"(指令微调)。

机制(输入→处理→输出)

  • 阶段一(VL 适配器预热):冻结混合视觉编码器和 LLM,只训 VL 适配器,让视觉特征先对齐到语言空间。
  • 阶段二(联合视觉-语言预训练,最关键):冻结视觉编码器,训练 LLM + 适配器,用大规模图文 + 文档 + OCR 数据联合训练。关键在数据配比要贴近真实使用,且要护住语言能力(见 5.4)。
  • 阶段三(监督微调 SFT):解冻 SigLIP-L + 适配器 + LLM(SAM-B 因显存限制保持冻结),用真实文档问答、图表理解、多轮对话等高质量指令数据,让模型学会听懂人话、按格式输出。训练只在回答和特殊 token 上算损失,屏蔽系统和用户提示。
  • 输出:一个既懂真实图、又会按指令对话的完整 VLM。

为什么这样分:把难度拆成台阶(对齐 → 知识 → 格式),每阶段只解决一件事,比一锅乱炖稳。哪一路何时冻结/解冻,都是为了在"学新能力"和"不破坏已有能力"之间取平衡。

5.4 保住语言能力:从文字为主逐步加图

类比:给一个中文很好的人补英语,如果整天只讲英语、完全不碰中文,他的中文会退化——得中英混着来、循序渐进。

机制(输入→处理→输出)

  • 输入:多模态数据 + 纯文本数据的混合比例。
  • 处理:论文发现,直接用 100% 多模态数据训 LLM(多模态:语言 = 100%:0%),多模态指标虽升,但语言指标断崖式下跌。原因是多数多模态语料太简单、分布偏离纯文本。对策是——从以文字为主开始,逐步调高多模态比例,并始终保留一定比例的纯文本数据(还把 DeepSeek-LLM 的纯文本 SFT 数据也混进来)。对 1.3B 小模型还额外引入少量 SFT 数据帮助稳定。
  • 输出:一个多模态能力上来了、语言能力几乎没掉的模型。

为什么有用:这直接回应了"学看图会伤语言"这个跷跷板。实测语言 benchmark 上 DeepSeek-VL 与纯语言的 DeepSeek-7B 基本持平甚至反超(如 HellaSwag 68.4 vs 68.5,MMLU/AGIEval 还更高)——证明"多模态训练甚至可能反哺语言",前提是配比得当。

5.5 两档尺寸:小而实用

类比:不去和巨无霸硬拼块头,做能塞进普通电脑的实用款。

机制:DeepSeek-VL 发了 1.3B 和 7B 两档,分别基于 DeepSeek-LLM-1B(约 5000 亿文本 token 预训练)和 DeepSeek-LLM-7B(约 2 万亿 token 预训练)继续训练。定位是"能在消费级 GPU 甚至边缘设备跑起来的实用模型",不去和 GPT-4V 这种闭源大块头硬拼参数。训练开销上,7B 版约用 64 节点 × 8 张 A100、耗时 5 天。

为什么这样选:小尺寸 + 真实场景导向,正好适合"想在本地/机器人上挂一个 VLM 做感知前端"的场景——这也是它对具身 AI 的价值所在。

所以这一节是想说:DeepSeek-VL 的方法 = 混合视觉编码器(SigLIP 语义 + SAM 细节)+ 高分辨率处理 + 三阶段训练 + 从文字为主逐步加图的护语言配比 + 1.3B/7B 实用尺寸,五块合起来做出一个真实场景导向、语言能力不退化的开源 VLM,其中"两只眼睛"和"护住语言"是两条最有辨识度的设计。


DeepSeek-VL — 方法示意:核心 pipeline
Plate Nº IIDeepSeek-VL — 方法示意:核心 pipeline

关键数字(What works)

数字本身不重要,重要的是它们告诉你"混合眼睛值不值、语言到底保住没"。以下数字来自原文表格;未报告或读表不确定的一律标注。分数越高越好(POPE、MMBench、SeedBench、MathVista、MMMU 等),OCRBench 为绝对分。

数字 1:7B 版真实场景与综合表现

Benchmark DeepSeek-VL-7B 说明
MMBench 73.2 综合多模态理解
MMBench-CN 72.8 中文综合
SeedBench 70.4 综合
POPE 88.1 幻觉检测(越高越不乱编)
MathVista 36.1 数学视觉推理
MMMU 36.6 大学级多学科
OCRBench 456 文字识别(绝对分)
关键含义 同尺寸开源里全面领先,尤其真实文档/OCR 强

数字 2:1.3B 小模型也能打

Benchmark DeepSeek-VL-1.3B
MMBench 64.6
POPE 87.6
MathVista 34.8
MMMU 32.2
OCRBench 409
关键含义 1.3B 就超过很多 2B 级小模型,边缘部署友好

数字 3:语言能力几乎没掉(护语言成功)

维度 数据
HellaSwag DeepSeek-VL 68.4 vs DeepSeek-7B 68.5(基本持平)
MMLU / AGIEval DeepSeek-VL 反而略高于 DeepSeek-7B
关键含义 证明"多模态训练可能反哺语言",前提是配比得当

数字 4:跷跷板实验(为什么要护语言)

训练配比 结果
多模态:语言 = 100%:0% 多模态升,语言断崖式下跌
从文字为主逐步加图 + 保留纯文本 多模态升,语言保住
关键含义 直接灌多模态会毁语言,配比策略是关键解法

数字 5:模型与训练配置

维度 数据
视觉编码器 SigLIP-L(语义)+ SAM-B(细节),混合
高分辨率 支持 1024×1024(SAM-B 分支)
尺寸 1.3B(基于 DeepSeek-LLM-1B,500B token)/ 7B(基于 DeepSeek-LLM-7B,2T token)
7B 训练开销 约 64 节点 × 8 A100,5 天
训练阶段 3(适配器预热 → 联合预训练 → SFT)

所以这一节是想说:最硬的三个结论是"7B 真实文档/OCR 全面领先同尺寸、1.3B 也能打、语言能力几乎没掉(甚至反哺)"——它们共同证明"补眼睛 + 护语言"这条路走得通。


实验结果说明了什么

上一节列数字,这一节回答实验背后的科学问题。

问题一:混合视觉编码器到底值不值? 值。单靠 SigLIP 这类 CLIP 家族编码器有两个硬伤——语义模糊(CLIP-blind pairs)和分辨率低(看不清密集 OCR、精细定位)。加上 SAM-B 的高分辨率细节分支后,DeepSeek-VL 在 OCRBench、文档/图表类任务上明显更强。这说明"一只眼睛看全局、一只眼睛抠细节"的互补设计,对真实场景任务是实打实的增益,而非炫技。

问题二:真实场景数据配比是不是关键? 是。论文专门从真实 GPT-4V/Gemini 使用案例构建"使用场景分类法",据此配训练和评测数据。结果是模型在真实文档/图表/UI 任务上表现突出。这印证了作者的核心判断——很多 VLM 不是不够聪明,而是训练时压根没见过用户真正会拿来问的那类图。见过什么,才会答什么。

问题三:学看图会不会把语言能力搞坏?怎么破? 会,但能破。跷跷板实验显示:100% 多模态训练会让语言指标断崖下跌。对策是"从文字为主逐步加图 + 始终保留纯文本 + 混入语言 SFT 数据"。最终语言 benchmark 上 DeepSeek-VL 与纯语言 DeepSeek-7B 基本持平(HellaSwag 68.4 vs 68.5),MMLU/AGIEval 甚至更高。这不仅解决了跷跷板,还带来一个意外发现——恰当的多模态训练可能反哺语言能力。

问题四:小尺寸能实用吗? 能。1.3B 版在 MMBench(64.6)、POPE(87.6)等上超过不少 2B 级小模型,能在消费级 GPU 甚至边缘设备跑。这对"想在本地或机器人上挂一个 VLM 做感知前端"的场景特别友好——不必依赖云端大模型。

问题五:走 LLaVA 的投影路线而非 Flamingo/BLIP-2 的 cross-attention,对不对? 论文选择了 LLaVA 式的投影(projector)路线,而非 Flamingo/BLIP-2 的冻结 LLM + cross-attention 适配器。这条路更灵活、视觉端表达不受限,也更容易联合训练和保住语言能力。结果验证了这个方向选择的合理性——这也代表了 2024 年前后开源 VLM 的主流共识。

所以这一节是想说:实验回答了五个问题——混合眼睛对真实场景确有增益、真实数据配比是关键、护语言策略能破跷跷板还反哺语言、小尺寸可实用、投影路线正确——共同确立 DeepSeek-VL 作为"真实场景导向实用型 VLM"的定位。


你应该懂的几个新词

VLM(Vision-Language Model,视觉-语言模型):能同时吃图和文、输出文本的模型。可理解为"会看图说话的 LLM"。

混合视觉编码器(hybrid vision encoder):用两个或多个不同特性的视觉模型并行处理同一张图,再融合特征。类比:一个用广角镜头看全景,一个用微距镜头看细节。

SigLIP:Google 提出的改进版 CLIP,用 sigmoid loss 替代 softmax 对比学习,训练更稳,2024 年 VLM 常用作语义编码器。

SAM(Segment Anything Model):Meta 出的分割大模型,其视觉编码器(SAM-B/L/H)擅长抓局部细节,被 DeepSeek-VL 借来做高分辨率细节分支。

高分辨率处理(high-resolution processing):让视觉编码器能吃 1024×1024 甚至更高的输入(常配合分块/缩略图),是看清文档小字和图表标签的硬条件。

视觉 token:视觉编码器把图压成的一串"视觉词",交给语言模型。token 越多看得越细,算力代价越大。

投影器 / 适配器(projector / adaptor):把视觉特征翻译进 LLM 词向量空间的模块。LLaVA 用简单投影,Flamingo/BLIP-2 用 cross-attention,DeepSeek-VL 走投影路线。

SFT(Supervised Fine-Tuning,监督微调):用高质量指令-回答对做最后一轮调教,让模型听得懂人话、按指令输出。

使用场景分类法(use-case taxonomy):从真实用户案例整理出的"人们到底拿什么图问 AI"的分类,用来指导训练和评测数据的构建。

幻觉(hallucination)与 POPE:VLM 看图时编造不存在的东西叫幻觉;POPE 是衡量幻觉的基准,分越高越少乱编。

所以这一节是想说:掌握这十个词,你就能读懂几乎所有"真实场景 VLM + 混合视觉编码器"方向的论文。


它有什么搞不定的

DeepSeek-VL 不是万能的,几个局限值得注意:

  • 混合编码器带来复杂度与算力开销:两路编码器(SigLIP + SAM)意味着更多前向计算和更长的视觉 token 序列,工程和推理成本比单塔高。SAM-B 分支在 SFT 阶段还因显存限制被迫冻结,说明这条路对资源有实打实的要求。

  • 参数量不与顶级闭源竞争:1.3B/7B 定位实用,不去和 GPT-4V 硬拼。在最难的推理任务(MMMU 36.6、MathVista 36.1)上,它离顶级闭源仍有明显差距——它强在真实文档/OCR,不是强在深度推理。

  • 护语言靠精细配比,复现门槛不低:语言能力不退化的前提是精心设计的数据配比(文字为主逐步加图 + 保留纯文本 + 混语言 SFT)。这套配比不透明或没调好,别人复现时很可能重新踩进跷跷板。

  • 幻觉未根治:POPE 88.1 说明幻觉被压制得不错,但没有消除。真实场景里看错发票数字、编造图表趋势的风险仍在,高风险用途需谨慎。

  • 真实数据依赖人工整理:使用场景分类法来自人工收集的真实 GPT-4V/Gemini 案例,这部分数据构建有人工成本,且分类法本身可能带偏(只覆盖收集到的那些场景)。

所以这一节是想说:DeepSeek-VL 用混合眼睛和真实数据把"真实场景理解"做强了,但代价是编码器更复杂、推理不算最强、护语言靠精细配比、幻觉未根治——它是"真实场景实用型"的优等生,不是全能冠军。


它和别的几篇是什么关系

  • 视觉塔上游:CLIP / SigLIP / SAM。DeepSeek-VL 借 SigLIP 做语义分支、SAM 做细节分支,是直接的上游依赖。参见 clip.mdsiglip.md

  • 同代竞品:LLaVA / LLaVA-NeXT。同走投影路线。LLaVA-NeXT 也做了高分辨率切片,DeepSeek-VL 的差异在"混合编码器 + 真实场景数据配比 + 护语言"。参见 llava-1-5.md

  • 同代竞品:InternVL / Qwen-VL。思路相近(大视觉塔/高分辨率、真实场景)。InternVL 走"自训超大视觉塔 + 三轴规模化"路线,DeepSeek-VL 走"混合双塔 + 小而实用"路线,是两种典型策略。参见 internvl-2-5.mdqwen-vl.md

  • 方法论祖辈:Flamingo / BLIP-2。DeepSeek-VL 明确抛弃了它们的冻结 LLM + cross-attention 适配器路线,改走 LLaVA 的投影路线。参见 blip-2.md

  • 同门血统:DeepSeek-LLM 系列。DeepSeek-VL 基于 DeepSeek-LLM-1B/7B 继续训练,训练流程、数据策略与整条 DeepSeek 系列(LLM/Coder/V2/V3)共通方法论。

  • 下游延伸:DeepSeek-VL2(2024 年底)。在此基础上引入 MoE(混合专家)视觉路由,是直接续作,可作延伸阅读。

  • 对具身 AI 的连接:小尺寸 + 真实场景导向,使它很适合当机器人 policy 的视觉前端——机器人面对的是真实物理场景,不是干净的学术图。

所以这一节是想说:DeepSeek-VL 站在 CLIP/SigLIP/SAM 视觉塔之上、走 LLaVA 投影路线、与 InternVL/Qwen-VL 形成不同策略对照,并以"小而真实"的定位成为具身 AI 视觉前端的有力候选。


和本导读的关系

本笔记对应导读 Ch09: VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力

导读 Ch09 讲的是 VLM 如何从"看懂图"进化到"看着图对话":CLIP 对齐 → BLIP-2 用 Q-Former 桥接冻结 LLM → LLaVA 用简单投影 + 指令微调把视觉变成对话的一部分。DeepSeek-VL 在这条线里的位置是把 LLaVA 范式推向"真实世界可用"——它接受了 LLaVA 的投影路线,但在视觉端(混合编码器 + 高分辨率)、数据端(真实场景配比)、训练端(护住语言能力)三处做了针对真实部署的强化。

建议阅读顺序:先读导读 Ch09 与 llava-1-5.md,理解 "ViT-投影-LLM" 范式和它相对 Flamingo/BLIP-2 的优势;再读本笔记,看这个范式如何被改造得能看清真实世界的发票和截图、且不牺牲语言能力;然后对照 internvl-2-5.md,看同时代开源 VLM 走"规模化"与"混合双塔小而实用"两种不同路线的取舍。

从知识图谱角度,本笔记向上连接 Ch08(CLIP/SigLIP/SAM 视觉塔),向下连接 Ch12 的 VLA——因为真实场景导向、小尺寸的 VLM 正是机器人策略理想的感知前端。

所以这一节是想说:本笔记是导读 Ch09 里"把 LLaVA 范式推向真实世界可用"的关键案例,读完能理解 VLM 从学术刷分走向真实办公场景落地的技术取舍。


思考题

以下问题检验你是否真正理解论文逻辑,而非记住"MMBench 73.2"。每题附折叠提示,先自己想 30 秒再展开。

Q1:为什么要用两个视觉编码器(SigLIP + SAM)而不是把一个做得更好?

提示

因为"看全局语义"和"看局部细节"对编码器有相互冲突的要求。CLIP 家族(含 SigLIP)为语义对齐设计,分辨率低、擅长"这是什么",但看不清密集小字、还会把不同图编码成相似向量(CLIP-blind pairs)。SAM 为精细分割设计,擅长"每个像素/角落长什么样",但语义抽象能力弱。与其逼一个编码器同时精通两件矛盾的事,不如各司其职再融合——广角定语义、微距抠细节,互补性比单塔调优更划算。

Q2:论文发现"100% 多模态训练会让语言能力断崖下跌"。这个跷跷板的根本原因是什么?

提示

两个原因:一是多数多模态语料太简单(图配一句短描述),复杂度和信息密度远低于纯文本语料;二是多模态数据的分布和纯文本差异很大。当模型 100% 只吃这种简单、异分布的数据,它会逐渐"忘掉"原本在海量高质量文本上学到的语言与推理能力——这是灾难性遗忘的一种。所以必须保留足够比例的纯文本数据来"复习",防止语言能力被冲刷掉。

Q3:DeepSeek-VL 的语言能力甚至略高于纯语言的 DeepSeek-7B。这个"反哺"现象怎么理解?

提示

一种解释是:恰当配比的多模态训练引入了新的、结构化的信号(图表、文档、OCR 里的逻辑关系),这些可能补充了纯文本里较少见的某类推理/结构化知识;同时训练里保留的纯文本 + 语言 SFT 数据本身质量高。两者叠加,语言能力不降反略升。前提是配比得当——如果配比失衡,得到的只会是跷跷板下跌而非反哺。反哺是"配比正确"的奖励,不是免费的。

Q4:为什么 SAM-B 分支在 SFT 阶段被冻结,而 SigLIP-L 被解冻?这个不对称说明了什么?

提示

论文说是因为显存限制——SAM-B 高分辨率分支的激活很占显存,SFT 阶段全解冻负担太重。这个不对称暴露了混合编码器的现实代价:两路编码器带来更高的算力和显存开销,工程上不得不做取舍(细节分支冻结、语义分支微调)。它提醒我们"两只眼睛"不是免费的,资源受限时要权衡哪一路更值得继续训练。

Q5:DeepSeek-VL 强在真实文档/OCR,但 MMMU 只有 36.6。这个"偏科"反映了什么设计取向?

提示

反映它把资源押在了"真实场景理解"而非"深度学术推理"。混合编码器、高分辨率、真实数据配比都是为看清发票/图表/截图服务的,这类任务吃分辨率和真实数据;而 MMMU 这种大学级多学科推理更吃语言模型的知识和推理深度,7B 的容量在这方面本就有限。所以它的强项和弱项都是设计取向的直接结果——为真实办公场景优化,而非为难题竞赛优化。选择即取舍。

Q6:DeepSeek-VL 走 LLaVA 投影路线而非 Flamingo/BLIP-2 的 cross-attention。这两条路的核心区别和权衡是什么?

提示

cross-attention 路线(Flamingo/BLIP-2)通常冻结 LLM,用适配器把视觉信息"注入",好处是省训练成本、保护 LLM,但视觉端表达受限、耦合较死。投影路线(LLaVA/DeepSeek-VL)把视觉特征直接投影成 token 拼进输入,和文字 token 平等参与,好处是灵活、视觉表达不受限、容易联合训练和护语言,代价是要训 LLM、成本更高。DeepSeek-VL 选后者,因为它要联合训练、要护语言、要真实场景的强视觉表达——投影路线更契合这些目标。

Q7:如果要把 DeepSeek-VL 用作机器人的视觉前端,它的哪些特性是优势,哪些要注意?

提示

优势:小尺寸(1.3B/7B)能在本地/边缘跑,适合机器人;真实场景导向意味着它见过杂乱真实图像,比只见过干净学术图的模型更抗真实世界的复杂性;高分辨率能看清细节。要注意:它是理解模型,不输出机器人动作,需接一个动作头/策略;混合编码器推理开销偏高,机器人实时性场景要评估延迟;幻觉未根治,安全关键决策不能全信;深度推理不是它强项,复杂长程规划可能力不从心。

所以这一节是想说:能回答这 7 个问题,你就真正理解了 DeepSeek-VL 的混合眼睛、护语言策略与真实场景取向,而非只记住某个 benchmark 分数。


一些好奇心问答(FAQ)

Q1:为什么早期 VLM 看不清发票小票?

因为它们的视觉塔分辨率通常固定在 224/336,一张密集文字的小票缩到这么小,字就糊成一团。DeepSeek-VL 用 SAM-B 分支吃 1024×1024 高分辨率,才看得清那些小字。

Q2:SigLIP 和 SAM 各管什么?

SigLIP 是"广角/语义眼"——看这张图整体在讲什么;SAM 是"微距/细节眼"——看每个角落的精细结构。两者特征拼起来,既懂大意又抠得清细节。

Q3:它和 LLaVA 到底差在哪?

都走投影路线。差别在三点:DeepSeek-VL 用混合双编码器(LLaVA 单塔)、更强调真实场景数据配比、并系统解决了"学看图伤语言"的跷跷板。可以理解为"面向真实部署强化过的 LLaVA"。

Q4:多模态训练真的会伤语言能力?

会,如果配比失衡。论文实测 100% 多模态训练会让语言指标断崖下跌。对策是从文字为主逐步加图、始终保留纯文本。配比对了,语言不但不掉,甚至略有反哺。

Q5:1.3B 够用吗?

看用途。做真实文档/OCR/UI 理解这类任务,1.3B 已经超过不少 2B 级小模型,且能在边缘设备跑。做深度学术推理就力不从心——那不是它的定位。

Q6:为什么不去拼 GPT-4V 的参数量?

作者明确走"小而实用"路线——真实办公场景的多数需求(看清文档、图表、截图)不需要巨无霸,反而需要能本地部署、开源可复用的模型。堆参数不是它的目标。

Q7:DeepSeek-VL2 又改了什么?

DeepSeek-VL2(2024 年底)在此基础上引入 MoE(混合专家)视觉路由,是直接续作,进一步提升效率与能力,可作延伸阅读。

Q8:读完接下来看什么?

想补范式底座看 llava-1-5.md;想看视觉塔看 clip.mdsiglip.md;想看同代对照看 internvl-2-5.mdqwen-vl.md;想看方法论祖辈看 blip-2.md

所以这一节是想说:关于分辨率、双编码器分工、和 LLaVA 的区别、护语言这些实操疑问,论文都给了清晰答案,DeepSeek-VL 已是真实场景 VLM 的成熟样本。


如果你想再深入

按"范式底座 → 视觉塔 → 同代对照 → 续作"排序:

  1. 范式底座:LLaVA / LLaVA-1.5 — 投影路线的定义者,DeepSeek-VL 沿用并强化它。见 llava-1-5.md
  2. 视觉塔:CLIP / SigLIP / SAM — 理解语义分支和细节分支各自的来历与特性。见 clip.mdsiglip.md
  3. 方法论祖辈:Flamingo / BLIP-2 — cross-attention 适配器路线,和 DeepSeek-VL 的投影路线对照。见 blip-2.md
  4. 同代对照:InternVL / Qwen-VL — 同时代开源 VLM 的不同策略(规模化 vs 混合双塔小而实用)。见 internvl-2-5.mdqwen-vl.md
  5. 续作:DeepSeek-VL2 — 引入 MoE 视觉路由的直接续作。

所以这一节是想说:把 LLaVA + CLIP/SigLIP/SAM + BLIP-2 + DeepSeek-VL + 同代竞品连起来读,就能看清开源 VLM 从"学术刷分"走向"真实世界可用"的完整脉络。


原文信息

BibTeX

@article{lu2024deepseekvl,
  title   = {DeepSeek-VL: Towards Real-World Vision-Language Understanding},
  author  = {Lu, Haoyu and Liu, Wen and Zhang, Bo and Wang, Bingxuan and others (DeepSeek-AI)},
  journal = {arXiv preprint arXiv:2403.05525},
  year    = {2024}
}

链接

  • arXiv:arxiv.org/abs/2403.05525
  • 团队:DeepSeek-AI
  • 尺寸:1.3B 与 7B 两档,均开源
  • 续作:DeepSeek-VL2(引入 MoE 视觉路由)

所以这一节是想说:这是 DeepSeek-AI 2024 年的工作,用混合视觉编码器 + 真实场景数据配比 + 护语言训练法,做出一个真实世界导向、小而实用的开源 VLM,是开源多模态"务实路线"的代表。

引用本笔记 / Cite this note
BibTeX
@online{eai_deepseek_vl_2026,
  title       = {(readable note) DeepSeek-VL: Towards Real-World Vision-Language Understanding},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/deepseek-vl/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?