DeepSeek-VL: Towards Real-World Vision-Language Understanding
这是一份给"完全没接触过 AI"的读者看的精读笔记。语言尽量像聊天,术语第一次出现必定义 + 类比。
一句话讲什么(TL;DR)
DeepSeek 在 2024 年开源的"会看图"模型(1.3B 和 7B 两档),核心不是堆参数,而是给模型配了一双"广角镜头 + 微距镜头"的眼睛(SigLIP + SAM 混合视觉编码器)、能吃 1024×1024 高分辨率,还专门用真实世界的发票、PPT、图表、UI 截图当训练餐单——让它不只会答学术考题,更能在真实办公场景里直接干活,同时不把原有的语言能力搞丢。
所以这一节是想说:这篇论文的核心判断是"VLM 的真瓶颈不是语言模型不够大,而是眼睛看不清 + 训练时没见过真实图片",它用混合视觉编码器、高分辨率、真实数据配比和一套保住语言能力的训练法来对症下药。
这是个什么场景
设想你随手拍了一张餐厅小票,发给 AI 助手让它帮你算 AA。它回你:"呃,好像有几个数字?看不清。"——这就是早期"会看图"模型的真实窘境:照片一旦不是教科书插图、不是网红风景照,而是密密麻麻的小字、表格、截图,它就抓瞎。
**VLM(Vision-Language Model,视觉-语言模型,能"看图说话"的 AI)**当时大致分两类:一类只看过摄影作品和教科书插图,遇到密集文字就懵;另一类很会答学术 benchmark(COCO、VQA 这种),但碰到真实的发票、PPT、科研图就愣住。
再想几个生活里很常见的场景:
- 你截了一张银行流水问"上个月外卖花了多少"——它得能看清密密麻麻的小字。
- 你拍了一页论文里的折线图问"2023 年这条线在掉还是在涨"——它得能分清子图和图注。
- 你截了一张 App 设置页问"关掉自动续费的按钮在哪"——它得能在 UI 截图里定位到具体那个按钮。
DeepSeek-VL 想做的是第三类:像一个在办公室干过几年杂活的实习生——不一定最聪明,但 PPT、发票、图表、UI 截图都能看明白,能直接干活。而且它坚持一个原则:一个好的 VLM 首先得是个好的语言模型,不能为了学看图把说话能力搞退化。
所以这一节是想说:DeepSeek-VL 面对的场景是"真实世界的密集文字/图表/截图,早期 VLM 看不清也没见过",它要做的是一个真实场景导向、又保住语言能力的实用型开源 VLM。

之前的人怎么做的,为什么不够好
方案 A:CLIP 路线(CLIP、BLIP) 类比:用一台固定焦距的傻瓜相机看世界。用对比学习把图和文对齐,但视觉塔分辨率通常固定在 224 或 336,文档级细节看不清。低分辨率是硬伤。
方案 B:冻结 LLM + 适配器(Flamingo、BLIP-2) 类比:把图硬翻译几句塞给一个不许改口的翻译。把视觉特征通过 cross-attention 适配器塞进冻结的语言模型,省训练成本,但视觉端表达能力受限,且这种耦合方式后来被证明不如直接投影灵活。
方案 C:端到端微调(LLaVA 系列) 类比:请个老师同时教看图和说话,效果好但焦距还是固定的。把 CLIP 视觉塔接到 LLM 做指令微调,效果好,但仍受限于固定分辨率和单一视觉编码器——一只眼睛要么看清全局、要么看清细节,二选一。
方案 D:学术 benchmark 导向 类比:只刷高考模拟卷,不练真实工作场景。大多数 VLM 在 VQAv2 / MMBench / MME 上刷分,对真实的"密集文字 + 多子图 + 长上下文"覆盖不足。考得好不等于用得好。
方案 E:靠堆参数兜底 类比:脑子不够大就换个更大的脑子。用 30B+ 大模型硬撑视觉理解,但部署成本高,开源社区难复用。
一个被忽视的坑:多模态训练会伤语言能力。 直接拿一个语言模型硬灌多模态数据,多模态指标是涨了,但语言能力会断崖式下跌——因为多数多模态语料太简单、分布和纯文本差太远。这个"跷跷板"问题此前少有人系统解决。
所以这一节是想说:之前要么分辨率太低看不清细节、要么适配器耦合太死、要么只刷学术分、要么靠堆参数,且普遍忽视"学看图会伤语言"这个跷跷板——DeepSeek-VL 就是来同时解决这几件事的。
这篇论文的新想法
如果上一代 VLM 像个只会做高考题的学生,DeepSeek-VL 想把它变成一个"什么活都见过"的实习生。这个转变拆成三层,外加一条贯穿始终的原则:
数据层——别只刷题,去看真实世界。 以前的训练餐单像高三模拟卷(COCO、VQA),这篇把网页截图、论文图、PDF 文档、图表、OCR 数据,按"人平时真的会拿什么图问 AI"的比例混进来。他们甚至从网上收集真实的 GPT-4V / Gemini 使用案例,整理成一个"使用场景分类法"(use-case taxonomy),据此挑选训练和评测的题目。
视觉编码器层——一个看全局,一个看细节。 单个视觉编码器要么看清整体、要么看清细节,二选一。论文用混合视觉编码器(hybrid vision encoder,两个视觉模型并行处理同一张图)——一个看大局(语义),一个看细节(高分辨率),特征拼起来再交给语言模型。
分辨率层——大图切块再拼回。 用高分辨率处理,让模型能吃下 1024×1024 的输入。看清文档小字和图表标签的硬条件就是分辨率。
贯穿原则——保住语言能力。 一个好 VLM 首先得是好 LLM。训练时必须小心管理"视觉 vs 语言"的竞争,从以文字为主开始,再逐步加大多模态比例,绝不让语言能力退化。
一句话:真正的瓶颈不是语言模型不够大,而是"眼睛"看不清 + 训练时没见过真实图片 + 学看图时把说话能力搞丢了。
所以这一节是想说:DeepSeek-VL 的新想法是"眼睛要好(混合编码器 + 高分辨率)、餐单要真(真实场景数据配比)、且不能顾此失彼(保住语言能力)",把重心从"堆参数"转向"补眼睛、补真实数据、护语言"。
它分几步做的(方法)
方法可拆成五块:混合视觉编码器、高分辨率处理、三阶段训练、保住语言能力的数据配比、以及两档模型尺寸。下面逐块展开,按"类比 → 机制(输入→处理→输出)→ 为什么有用"讲。
先看整体架构图:
输入图(高分辨率,如 1024×1024)
┌──────────────┴──────────────┐
▼ ▼
┌───────────────┐ ┌────────────────┐
│ SigLIP-L │ │ SAM-B │
│ 广角/语义 │ │ 微距/细节 │
│ 低分(如384) │ │ 高分(1024) │
└──────┬────────┘ └───────┬────────┘
│ 语义特征 │ 细节特征
└──────────────┬──────────────┘
▼
拼接融合的视觉特征
│
▼
┌────────────────┐
│ VL 适配器 │ 把视觉特征翻成 LLM 词向量
└───────┬────────┘
│ 拼上文字 token
▼
┌────────────────┐
│ DeepSeek-LLM │ 1B 或 7B
│ 输出文字回答 │
└────────────────┘
再看三阶段训练的"谁在动、谁冻结"图:
┌────────────────┬──────────────────┬──────────┬───────┐
│ 阶段 │ 视觉编码器 │ 适配器 │ LLM │
├────────────────┼──────────────────┼──────────┼───────┤
│ 1 适配器预热 │ SigLIP冻 SAM冻 │ ✓ 训练 │ 冻结 │
│ 2 联合预训练★ │ 全冻 │ ✓ 训练 │ ✓训练 │
│ 3 监督微调 SFT │ SigLIP✓ SAM冻 │ ✓ 训练 │ ✓训练 │
└────────────────┴──────────────────┴──────────┴───────┘
★关键阶段:护住语言能力(从文字为主逐步加图)
5.1 混合视觉编码器:广角镜头 + 微距镜头
类比:拍照时广角看全景、微距凑近看细节,两张合在一起就什么都不漏。
机制(输入→处理→输出):
- 输入:同一张图,分别送两路。
- 处理:一路用 SigLIP-L(一种改进版 CLIP,用 sigmoid loss 训练更稳,2024 年 VLM 常用它做语义理解)处理缩放过的全局图(如 384×384),抓"这张图大致在讲什么";另一路用 SAM-B(Meta 出的分割大模型 Segment Anything,它的视觉编码器擅长抓局部细节)处理高分辨率版本(如 1024×1024),抓"每个角落长什么样"。两路特征拼接融合。
- 输出:一份既有全局语义、又有局部细节的融合视觉特征,送进适配器。
为什么要两只眼睛:论文指出,单靠 SigLIP 这类 CLIP 家族编码器有两个短板——一是"CLIP-blind pairs"(把明显不同的图编码成相似向量,语义模糊),二是分辨率低(224/336/384)看不清密集 OCR 和精细定位。SAM-B 高分辨率细节分支正好补上这两块。全局定语义、局部抠细节,互补。
5.2 高分辨率处理:A4 文档分块扫再拼
类比:扫描仪只能扫小尺寸,要扫一张 A4 文档,就切成几块分别扫,再附一张拍全貌的缩略图保留版面。
机制(输入→处理→输出):
- 输入:一张高分辨率图。
- 处理:SAM-B 分支直接吃 1024×1024 的高分辨率输入以保留细节;SigLIP 分支吃缩略/全局版保留整体布局。两者一起产生视觉 token 交给语言模型。这样既看清小字、又不丢版面。
- 输出:兼顾细节与全局的视觉 token 序列。
等等,先慢一拍——token 是什么? 语言模型只懂"词",所以视觉编码器要把图片压成一串"视觉词"(token)交给它。token 越多看得越细,但算力代价越大——这就是为什么要在细节和 token 预算之间做取舍。
为什么有用:文档理解、OCR、图表、UI 定位这些"真实场景"任务,成败全看分辨率。高分辨率是硬门槛,DeepSeek-VL 靠 SAM-B 分支跨过它。
5.3 三阶段训练:从对齐到见世面到听懂人话
类比:教一个外国实习生干活——先教他认中文(对齐),再让他在真实工位跟着干(联合预训练),最后手把手教"客户问 X 你要回 Y"(指令微调)。
机制(输入→处理→输出):
- 阶段一(VL 适配器预热):冻结混合视觉编码器和 LLM,只训 VL 适配器,让视觉特征先对齐到语言空间。
- 阶段二(联合视觉-语言预训练,最关键):冻结视觉编码器,训练 LLM + 适配器,用大规模图文 + 文档 + OCR 数据联合训练。关键在数据配比要贴近真实使用,且要护住语言能力(见 5.4)。
- 阶段三(监督微调 SFT):解冻 SigLIP-L + 适配器 + LLM(SAM-B 因显存限制保持冻结),用真实文档问答、图表理解、多轮对话等高质量指令数据,让模型学会听懂人话、按格式输出。训练只在回答和特殊 token 上算损失,屏蔽系统和用户提示。
- 输出:一个既懂真实图、又会按指令对话的完整 VLM。
为什么这样分:把难度拆成台阶(对齐 → 知识 → 格式),每阶段只解决一件事,比一锅乱炖稳。哪一路何时冻结/解冻,都是为了在"学新能力"和"不破坏已有能力"之间取平衡。
5.4 保住语言能力:从文字为主逐步加图
类比:给一个中文很好的人补英语,如果整天只讲英语、完全不碰中文,他的中文会退化——得中英混着来、循序渐进。
机制(输入→处理→输出):
- 输入:多模态数据 + 纯文本数据的混合比例。
- 处理:论文发现,直接用 100% 多模态数据训 LLM(多模态:语言 = 100%:0%),多模态指标虽升,但语言指标断崖式下跌。原因是多数多模态语料太简单、分布偏离纯文本。对策是——从以文字为主开始,逐步调高多模态比例,并始终保留一定比例的纯文本数据(还把 DeepSeek-LLM 的纯文本 SFT 数据也混进来)。对 1.3B 小模型还额外引入少量 SFT 数据帮助稳定。
- 输出:一个多模态能力上来了、语言能力几乎没掉的模型。
为什么有用:这直接回应了"学看图会伤语言"这个跷跷板。实测语言 benchmark 上 DeepSeek-VL 与纯语言的 DeepSeek-7B 基本持平甚至反超(如 HellaSwag 68.4 vs 68.5,MMLU/AGIEval 还更高)——证明"多模态训练甚至可能反哺语言",前提是配比得当。
5.5 两档尺寸:小而实用
类比:不去和巨无霸硬拼块头,做能塞进普通电脑的实用款。
机制:DeepSeek-VL 发了 1.3B 和 7B 两档,分别基于 DeepSeek-LLM-1B(约 5000 亿文本 token 预训练)和 DeepSeek-LLM-7B(约 2 万亿 token 预训练)继续训练。定位是"能在消费级 GPU 甚至边缘设备跑起来的实用模型",不去和 GPT-4V 这种闭源大块头硬拼参数。训练开销上,7B 版约用 64 节点 × 8 张 A100、耗时 5 天。
为什么这样选:小尺寸 + 真实场景导向,正好适合"想在本地/机器人上挂一个 VLM 做感知前端"的场景——这也是它对具身 AI 的价值所在。
所以这一节是想说:DeepSeek-VL 的方法 = 混合视觉编码器(SigLIP 语义 + SAM 细节)+ 高分辨率处理 + 三阶段训练 + 从文字为主逐步加图的护语言配比 + 1.3B/7B 实用尺寸,五块合起来做出一个真实场景导向、语言能力不退化的开源 VLM,其中"两只眼睛"和"护住语言"是两条最有辨识度的设计。

关键数字(What works)
数字本身不重要,重要的是它们告诉你"混合眼睛值不值、语言到底保住没"。以下数字来自原文表格;未报告或读表不确定的一律标注。分数越高越好(POPE、MMBench、SeedBench、MathVista、MMMU 等),OCRBench 为绝对分。
数字 1:7B 版真实场景与综合表现
| Benchmark | DeepSeek-VL-7B | 说明 |
|---|---|---|
| MMBench | 73.2 | 综合多模态理解 |
| MMBench-CN | 72.8 | 中文综合 |
| SeedBench | 70.4 | 综合 |
| POPE | 88.1 | 幻觉检测(越高越不乱编) |
| MathVista | 36.1 | 数学视觉推理 |
| MMMU | 36.6 | 大学级多学科 |
| OCRBench | 456 | 文字识别(绝对分) |
| 关键含义 | 同尺寸开源里全面领先,尤其真实文档/OCR 强 |
数字 2:1.3B 小模型也能打
| Benchmark | DeepSeek-VL-1.3B |
|---|---|
| MMBench | 64.6 |
| POPE | 87.6 |
| MathVista | 34.8 |
| MMMU | 32.2 |
| OCRBench | 409 |
| 关键含义 | 1.3B 就超过很多 2B 级小模型,边缘部署友好 |
数字 3:语言能力几乎没掉(护语言成功)
| 维度 | 数据 |
|---|---|
| HellaSwag | DeepSeek-VL 68.4 vs DeepSeek-7B 68.5(基本持平) |
| MMLU / AGIEval | DeepSeek-VL 反而略高于 DeepSeek-7B |
| 关键含义 | 证明"多模态训练可能反哺语言",前提是配比得当 |
数字 4:跷跷板实验(为什么要护语言)
| 训练配比 | 结果 |
|---|---|
| 多模态:语言 = 100%:0% | 多模态升,语言断崖式下跌 |
| 从文字为主逐步加图 + 保留纯文本 | 多模态升,语言保住 |
| 关键含义 | 直接灌多模态会毁语言,配比策略是关键解法 |
数字 5:模型与训练配置
| 维度 | 数据 |
|---|---|
| 视觉编码器 | SigLIP-L(语义)+ SAM-B(细节),混合 |
| 高分辨率 | 支持 1024×1024(SAM-B 分支) |
| 尺寸 | 1.3B(基于 DeepSeek-LLM-1B, |
| 7B 训练开销 | 约 64 节点 × 8 A100,5 天 |
| 训练阶段 | 3(适配器预热 → 联合预训练 → SFT) |
所以这一节是想说:最硬的三个结论是"7B 真实文档/OCR 全面领先同尺寸、1.3B 也能打、语言能力几乎没掉(甚至反哺)"——它们共同证明"补眼睛 + 护语言"这条路走得通。
实验结果说明了什么
上一节列数字,这一节回答实验背后的科学问题。
问题一:混合视觉编码器到底值不值? 值。单靠 SigLIP 这类 CLIP 家族编码器有两个硬伤——语义模糊(CLIP-blind pairs)和分辨率低(看不清密集 OCR、精细定位)。加上 SAM-B 的高分辨率细节分支后,DeepSeek-VL 在 OCRBench、文档/图表类任务上明显更强。这说明"一只眼睛看全局、一只眼睛抠细节"的互补设计,对真实场景任务是实打实的增益,而非炫技。
问题二:真实场景数据配比是不是关键? 是。论文专门从真实 GPT-4V/Gemini 使用案例构建"使用场景分类法",据此配训练和评测数据。结果是模型在真实文档/图表/UI 任务上表现突出。这印证了作者的核心判断——很多 VLM 不是不够聪明,而是训练时压根没见过用户真正会拿来问的那类图。见过什么,才会答什么。
问题三:学看图会不会把语言能力搞坏?怎么破? 会,但能破。跷跷板实验显示:100% 多模态训练会让语言指标断崖下跌。对策是"从文字为主逐步加图 + 始终保留纯文本 + 混入语言 SFT 数据"。最终语言 benchmark 上 DeepSeek-VL 与纯语言 DeepSeek-7B 基本持平(HellaSwag 68.4 vs 68.5),MMLU/AGIEval 甚至更高。这不仅解决了跷跷板,还带来一个意外发现——恰当的多模态训练可能反哺语言能力。
问题四:小尺寸能实用吗? 能。1.3B 版在 MMBench(64.6)、POPE(87.6)等上超过不少 2B 级小模型,能在消费级 GPU 甚至边缘设备跑。这对"想在本地或机器人上挂一个 VLM 做感知前端"的场景特别友好——不必依赖云端大模型。
问题五:走 LLaVA 的投影路线而非 Flamingo/BLIP-2 的 cross-attention,对不对? 论文选择了 LLaVA 式的投影(projector)路线,而非 Flamingo/BLIP-2 的冻结 LLM + cross-attention 适配器。这条路更灵活、视觉端表达不受限,也更容易联合训练和保住语言能力。结果验证了这个方向选择的合理性——这也代表了 2024 年前后开源 VLM 的主流共识。
所以这一节是想说:实验回答了五个问题——混合眼睛对真实场景确有增益、真实数据配比是关键、护语言策略能破跷跷板还反哺语言、小尺寸可实用、投影路线正确——共同确立 DeepSeek-VL 作为"真实场景导向实用型 VLM"的定位。
你应该懂的几个新词
VLM(Vision-Language Model,视觉-语言模型):能同时吃图和文、输出文本的模型。可理解为"会看图说话的 LLM"。
混合视觉编码器(hybrid vision encoder):用两个或多个不同特性的视觉模型并行处理同一张图,再融合特征。类比:一个用广角镜头看全景,一个用微距镜头看细节。
SigLIP:Google 提出的改进版 CLIP,用 sigmoid loss 替代 softmax 对比学习,训练更稳,2024 年 VLM 常用作语义编码器。
SAM(Segment Anything Model):Meta 出的分割大模型,其视觉编码器(SAM-B/L/H)擅长抓局部细节,被 DeepSeek-VL 借来做高分辨率细节分支。
高分辨率处理(high-resolution processing):让视觉编码器能吃 1024×1024 甚至更高的输入(常配合分块/缩略图),是看清文档小字和图表标签的硬条件。
视觉 token:视觉编码器把图压成的一串"视觉词",交给语言模型。token 越多看得越细,算力代价越大。
投影器 / 适配器(projector / adaptor):把视觉特征翻译进 LLM 词向量空间的模块。LLaVA 用简单投影,Flamingo/BLIP-2 用 cross-attention,DeepSeek-VL 走投影路线。
SFT(Supervised Fine-Tuning,监督微调):用高质量指令-回答对做最后一轮调教,让模型听得懂人话、按指令输出。
使用场景分类法(use-case taxonomy):从真实用户案例整理出的"人们到底拿什么图问 AI"的分类,用来指导训练和评测数据的构建。
幻觉(hallucination)与 POPE:VLM 看图时编造不存在的东西叫幻觉;POPE 是衡量幻觉的基准,分越高越少乱编。
所以这一节是想说:掌握这十个词,你就能读懂几乎所有"真实场景 VLM + 混合视觉编码器"方向的论文。
它有什么搞不定的
DeepSeek-VL 不是万能的,几个局限值得注意:
混合编码器带来复杂度与算力开销:两路编码器(SigLIP + SAM)意味着更多前向计算和更长的视觉 token 序列,工程和推理成本比单塔高。SAM-B 分支在 SFT 阶段还因显存限制被迫冻结,说明这条路对资源有实打实的要求。
参数量不与顶级闭源竞争:1.3B/7B 定位实用,不去和 GPT-4V 硬拼。在最难的推理任务(MMMU 36.6、MathVista 36.1)上,它离顶级闭源仍有明显差距——它强在真实文档/OCR,不是强在深度推理。
护语言靠精细配比,复现门槛不低:语言能力不退化的前提是精心设计的数据配比(文字为主逐步加图 + 保留纯文本 + 混语言 SFT)。这套配比不透明或没调好,别人复现时很可能重新踩进跷跷板。
幻觉未根治:POPE 88.1 说明幻觉被压制得不错,但没有消除。真实场景里看错发票数字、编造图表趋势的风险仍在,高风险用途需谨慎。
真实数据依赖人工整理:使用场景分类法来自人工收集的真实 GPT-4V/Gemini 案例,这部分数据构建有人工成本,且分类法本身可能带偏(只覆盖收集到的那些场景)。
所以这一节是想说:DeepSeek-VL 用混合眼睛和真实数据把"真实场景理解"做强了,但代价是编码器更复杂、推理不算最强、护语言靠精细配比、幻觉未根治——它是"真实场景实用型"的优等生,不是全能冠军。
它和别的几篇是什么关系
视觉塔上游:CLIP / SigLIP / SAM。DeepSeek-VL 借 SigLIP 做语义分支、SAM 做细节分支,是直接的上游依赖。参见
clip.md、siglip.md。同代竞品:LLaVA / LLaVA-NeXT。同走投影路线。LLaVA-NeXT 也做了高分辨率切片,DeepSeek-VL 的差异在"混合编码器 + 真实场景数据配比 + 护语言"。参见
llava-1-5.md。同代竞品:InternVL / Qwen-VL。思路相近(大视觉塔/高分辨率、真实场景)。InternVL 走"自训超大视觉塔 + 三轴规模化"路线,DeepSeek-VL 走"混合双塔 + 小而实用"路线,是两种典型策略。参见
internvl-2-5.md、qwen-vl.md。方法论祖辈:Flamingo / BLIP-2。DeepSeek-VL 明确抛弃了它们的冻结 LLM + cross-attention 适配器路线,改走 LLaVA 的投影路线。参见
blip-2.md。同门血统:DeepSeek-LLM 系列。DeepSeek-VL 基于 DeepSeek-LLM-1B/7B 继续训练,训练流程、数据策略与整条 DeepSeek 系列(LLM/Coder/V2/V3)共通方法论。
下游延伸:DeepSeek-VL2(2024 年底)。在此基础上引入 MoE(混合专家)视觉路由,是直接续作,可作延伸阅读。
对具身 AI 的连接:小尺寸 + 真实场景导向,使它很适合当机器人 policy 的视觉前端——机器人面对的是真实物理场景,不是干净的学术图。
所以这一节是想说:DeepSeek-VL 站在 CLIP/SigLIP/SAM 视觉塔之上、走 LLaVA 投影路线、与 InternVL/Qwen-VL 形成不同策略对照,并以"小而真实"的定位成为具身 AI 视觉前端的有力候选。
和本导读的关系
本笔记对应导读 Ch09: VLM 地基 (II)——从 BLIP-2 到 LLaVA,给 AI 装上对话能力。
导读 Ch09 讲的是 VLM 如何从"看懂图"进化到"看着图对话":CLIP 对齐 → BLIP-2 用 Q-Former 桥接冻结 LLM → LLaVA 用简单投影 + 指令微调把视觉变成对话的一部分。DeepSeek-VL 在这条线里的位置是把 LLaVA 范式推向"真实世界可用"——它接受了 LLaVA 的投影路线,但在视觉端(混合编码器 + 高分辨率)、数据端(真实场景配比)、训练端(护住语言能力)三处做了针对真实部署的强化。
建议阅读顺序:先读导读 Ch09 与 llava-1-5.md,理解 "ViT-投影-LLM" 范式和它相对 Flamingo/BLIP-2 的优势;再读本笔记,看这个范式如何被改造得能看清真实世界的发票和截图、且不牺牲语言能力;然后对照 internvl-2-5.md,看同时代开源 VLM 走"规模化"与"混合双塔小而实用"两种不同路线的取舍。
从知识图谱角度,本笔记向上连接 Ch08(CLIP/SigLIP/SAM 视觉塔),向下连接 Ch12 的 VLA——因为真实场景导向、小尺寸的 VLM 正是机器人策略理想的感知前端。
所以这一节是想说:本笔记是导读 Ch09 里"把 LLaVA 范式推向真实世界可用"的关键案例,读完能理解 VLM 从学术刷分走向真实办公场景落地的技术取舍。
思考题
以下问题检验你是否真正理解论文逻辑,而非记住"MMBench 73.2"。每题附折叠提示,先自己想 30 秒再展开。
Q1:为什么要用两个视觉编码器(SigLIP + SAM)而不是把一个做得更好?
提示
因为"看全局语义"和"看局部细节"对编码器有相互冲突的要求。CLIP 家族(含 SigLIP)为语义对齐设计,分辨率低、擅长"这是什么",但看不清密集小字、还会把不同图编码成相似向量(CLIP-blind pairs)。SAM 为精细分割设计,擅长"每个像素/角落长什么样",但语义抽象能力弱。与其逼一个编码器同时精通两件矛盾的事,不如各司其职再融合——广角定语义、微距抠细节,互补性比单塔调优更划算。
Q2:论文发现"100% 多模态训练会让语言能力断崖下跌"。这个跷跷板的根本原因是什么?
提示
两个原因:一是多数多模态语料太简单(图配一句短描述),复杂度和信息密度远低于纯文本语料;二是多模态数据的分布和纯文本差异很大。当模型 100% 只吃这种简单、异分布的数据,它会逐渐"忘掉"原本在海量高质量文本上学到的语言与推理能力——这是灾难性遗忘的一种。所以必须保留足够比例的纯文本数据来"复习",防止语言能力被冲刷掉。
Q3:DeepSeek-VL 的语言能力甚至略高于纯语言的 DeepSeek-7B。这个"反哺"现象怎么理解?
提示
一种解释是:恰当配比的多模态训练引入了新的、结构化的信号(图表、文档、OCR 里的逻辑关系),这些可能补充了纯文本里较少见的某类推理/结构化知识;同时训练里保留的纯文本 + 语言 SFT 数据本身质量高。两者叠加,语言能力不降反略升。前提是配比得当——如果配比失衡,得到的只会是跷跷板下跌而非反哺。反哺是"配比正确"的奖励,不是免费的。
Q4:为什么 SAM-B 分支在 SFT 阶段被冻结,而 SigLIP-L 被解冻?这个不对称说明了什么?
提示
论文说是因为显存限制——SAM-B 高分辨率分支的激活很占显存,SFT 阶段全解冻负担太重。这个不对称暴露了混合编码器的现实代价:两路编码器带来更高的算力和显存开销,工程上不得不做取舍(细节分支冻结、语义分支微调)。它提醒我们"两只眼睛"不是免费的,资源受限时要权衡哪一路更值得继续训练。
Q5:DeepSeek-VL 强在真实文档/OCR,但 MMMU 只有 36.6。这个"偏科"反映了什么设计取向?
提示
反映它把资源押在了"真实场景理解"而非"深度学术推理"。混合编码器、高分辨率、真实数据配比都是为看清发票/图表/截图服务的,这类任务吃分辨率和真实数据;而 MMMU 这种大学级多学科推理更吃语言模型的知识和推理深度,7B 的容量在这方面本就有限。所以它的强项和弱项都是设计取向的直接结果——为真实办公场景优化,而非为难题竞赛优化。选择即取舍。
Q6:DeepSeek-VL 走 LLaVA 投影路线而非 Flamingo/BLIP-2 的 cross-attention。这两条路的核心区别和权衡是什么?
提示
cross-attention 路线(Flamingo/BLIP-2)通常冻结 LLM,用适配器把视觉信息"注入",好处是省训练成本、保护 LLM,但视觉端表达受限、耦合较死。投影路线(LLaVA/DeepSeek-VL)把视觉特征直接投影成 token 拼进输入,和文字 token 平等参与,好处是灵活、视觉表达不受限、容易联合训练和护语言,代价是要训 LLM、成本更高。DeepSeek-VL 选后者,因为它要联合训练、要护语言、要真实场景的强视觉表达——投影路线更契合这些目标。
Q7:如果要把 DeepSeek-VL 用作机器人的视觉前端,它的哪些特性是优势,哪些要注意?
提示
优势:小尺寸(1.3B/7B)能在本地/边缘跑,适合机器人;真实场景导向意味着它见过杂乱真实图像,比只见过干净学术图的模型更抗真实世界的复杂性;高分辨率能看清细节。要注意:它是理解模型,不输出机器人动作,需接一个动作头/策略;混合编码器推理开销偏高,机器人实时性场景要评估延迟;幻觉未根治,安全关键决策不能全信;深度推理不是它强项,复杂长程规划可能力不从心。
所以这一节是想说:能回答这 7 个问题,你就真正理解了 DeepSeek-VL 的混合眼睛、护语言策略与真实场景取向,而非只记住某个 benchmark 分数。
一些好奇心问答(FAQ)
Q1:为什么早期 VLM 看不清发票小票?
因为它们的视觉塔分辨率通常固定在 224/336,一张密集文字的小票缩到这么小,字就糊成一团。DeepSeek-VL 用 SAM-B 分支吃 1024×1024 高分辨率,才看得清那些小字。
Q2:SigLIP 和 SAM 各管什么?
SigLIP 是"广角/语义眼"——看这张图整体在讲什么;SAM 是"微距/细节眼"——看每个角落的精细结构。两者特征拼起来,既懂大意又抠得清细节。
Q3:它和 LLaVA 到底差在哪?
都走投影路线。差别在三点:DeepSeek-VL 用混合双编码器(LLaVA 单塔)、更强调真实场景数据配比、并系统解决了"学看图伤语言"的跷跷板。可以理解为"面向真实部署强化过的 LLaVA"。
Q4:多模态训练真的会伤语言能力?
会,如果配比失衡。论文实测 100% 多模态训练会让语言指标断崖下跌。对策是从文字为主逐步加图、始终保留纯文本。配比对了,语言不但不掉,甚至略有反哺。
Q5:1.3B 够用吗?
看用途。做真实文档/OCR/UI 理解这类任务,1.3B 已经超过不少 2B 级小模型,且能在边缘设备跑。做深度学术推理就力不从心——那不是它的定位。
Q6:为什么不去拼 GPT-4V 的参数量?
作者明确走"小而实用"路线——真实办公场景的多数需求(看清文档、图表、截图)不需要巨无霸,反而需要能本地部署、开源可复用的模型。堆参数不是它的目标。
Q7:DeepSeek-VL2 又改了什么?
DeepSeek-VL2(2024 年底)在此基础上引入 MoE(混合专家)视觉路由,是直接续作,进一步提升效率与能力,可作延伸阅读。
Q8:读完接下来看什么?
想补范式底座看 llava-1-5.md;想看视觉塔看 clip.md、siglip.md;想看同代对照看 internvl-2-5.md、qwen-vl.md;想看方法论祖辈看 blip-2.md。
所以这一节是想说:关于分辨率、双编码器分工、和 LLaVA 的区别、护语言这些实操疑问,论文都给了清晰答案,DeepSeek-VL 已是真实场景 VLM 的成熟样本。
如果你想再深入
按"范式底座 → 视觉塔 → 同代对照 → 续作"排序:
- 范式底座:LLaVA / LLaVA-1.5 — 投影路线的定义者,DeepSeek-VL 沿用并强化它。见
llava-1-5.md。 - 视觉塔:CLIP / SigLIP / SAM — 理解语义分支和细节分支各自的来历与特性。见
clip.md、siglip.md。 - 方法论祖辈:Flamingo / BLIP-2 — cross-attention 适配器路线,和 DeepSeek-VL 的投影路线对照。见
blip-2.md。 - 同代对照:InternVL / Qwen-VL — 同时代开源 VLM 的不同策略(规模化 vs 混合双塔小而实用)。见
internvl-2-5.md、qwen-vl.md。 - 续作:DeepSeek-VL2 — 引入 MoE 视觉路由的直接续作。
所以这一节是想说:把 LLaVA + CLIP/SigLIP/SAM + BLIP-2 + DeepSeek-VL + 同代竞品连起来读,就能看清开源 VLM 从"学术刷分"走向"真实世界可用"的完整脉络。
原文信息
BibTeX
@article{lu2024deepseekvl,
title = {DeepSeek-VL: Towards Real-World Vision-Language Understanding},
author = {Lu, Haoyu and Liu, Wen and Zhang, Bo and Wang, Bingxuan and others (DeepSeek-AI)},
journal = {arXiv preprint arXiv:2403.05525},
year = {2024}
}
链接
- arXiv:arxiv.org/abs/2403.05525
- 团队:DeepSeek-AI
- 尺寸:1.3B 与 7B 两档,均开源
- 续作:DeepSeek-VL2(引入 MoE 视觉路由)
所以这一节是想说:这是 DeepSeek-AI 2024 年的工作,用混合视觉编码器 + 真实场景数据配比 + 护语言训练法,做出一个真实世界导向、小而实用的开源 VLM,是开源多模态"务实路线"的代表。
◼
引用本笔记 / Cite this note
@online{eai_deepseek_vl_2026,
title = {(readable note) DeepSeek-VL: Towards Real-World Vision-Language Understanding},
author = {Xun, Jason},
year = {2026},
note = {Note on a 2024 paper},
howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/deepseek-vl/}},
organization = {Embodied AI: Zero to One}
}
All 202 papers (full index)
- 1. LLaVA: Visual Instruction Tuning
- 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
- 3. SayCan: Do As I Can, Not As I Say
- 4. OpenVLA: An Open-Source Vision-Language-Action Model
- 5. VLAS: VLA Model With Speech Instructions
- 6. MLA: Multisensory Language-Action Model
- 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
- 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
- 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
- 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
- 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
- 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
- 13. Creating speech zones with self-distributing acoustic swarms
- 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
- 15. SoundStream: An End-to-End Neural Audio Codec
- 16. AudioLM
- 17. Conformer
- 18. Dual-path RNN
- 19. EnCodec
- 20. Meta-StyleSpeech
- 21. MusicLM
- 22. Robust Speech Recognition via Large-Scale Weak Supervision
- 23. SeamlessM4T
- 24. Stable Audio
- 25. Universal Source Separation with Weakly Labelled Data
- 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
- 27. RLBench: The Robot Learning Benchmark & Learning Environment
- 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
- 30. CALVIN
- 31. LIBERO
- 32. RH20T
- 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
- 34. DROID
- 35. Open X-Embodiment
- 36. RoboCasa
- 37. SimplerEnv
- 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
- 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
- 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
- 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
- 42. DiT-Policy
- 43. Diffusion Policy Policy Optimization (DPPO)
- 44. Affordance-based Robot Manipulation with Flow Matching
- 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
- 46. FAST: Efficient Action Tokenization for VLA
- 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
- 48. pi_0.5: VLA with Open-World Generalization
- 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- 50. Generative Adversarial Imitation Learning
- 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
- 52. AnyTeleop
- 53. Behavior Transformers: Cloning k Modes with One Stone
- 54. Implicit Behavioral Cloning
- 55. RoboCat
- 56. ALOHA 2
- 58. HumanPlus
- 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
- 60. Mobile ALOHA
- 61. SmolVLA
- 62. Universal Manipulation Interface
- 63. Behavior Generation with Latent Actions (VQ-BeT)
- 64. ImageBind: One Embedding Space To Bind Them All
- 65. Connecting Touch and Vision via Cross-Modal Prediction
- 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
- 67. AudioPaLM
- 68. FROMAGe: Grounding LLMs to Images
- 69. OneLLM
- 70. X-VLM: Multi-Grained Vision Language Pre-Training
- 71. Tactile Beyond Pixels (Sparsh-X)
- 72. Sparsh: Self-supervised Touch Representations
- 73. Tactile-VLA
- 74. TLA: Tactile-Language-Action
- 75. Code as Policies: Language Model Programs for Embodied Control
- 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
- 77. LLM+P: Empowering LLMs with Optimal Planning
- 78. PaLM-E: An Embodied Multimodal Language Model
- 79. ProgPrompt
- 80. ChatGPT for Robotics
- 81. GenSim
- 82. RoboFlamingo
- 83. Tree-Planner
- 84. VoxPoser
- 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
- 86. Can WiFi Estimate Person Pose?
- 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
- 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
- 89. High Resolution Point Clouds from mmWave Radar
- 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
- 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
- 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
- 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
- 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
- 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
- 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
- 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
- 98. Habitat: A Platform for Embodied AI Research
- 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
- 101. Habitat 2.0
- 102. ManiSkill
- 103. ProcTHOR
- 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
- 105. BEHAVIOR-1K
- 106. BridgeData V2
- 106. Habitat 3.0
- 107. Isaac Lab
- 108. DexMV
- 108. MuJoCo Playground
- 109. DexCap
- 109. RT-1: Robotics Transformer for Real-World Control at Scale
- 110. 3D Diffusion Policy (DP3)
- 111. Octo: An Open-Source Generalist Robot Policy
- 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
- 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
- 114. 3D-VLA
- 116. GR-2: Generative Video-Language-Action Model
- 117. DexVLA
- 117. OpenHelix
- 118. Cosmos World Foundation Model
- 118. OpenVLA-OFT
- 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
- 120. RoboMamba
- 121. SpatialVLA
- 122. TinyVLA
- 123. TraceVLA: Visual Trace Prompting
- 124. Learning Transferable Visual Models From Natural Language Supervision
- 125. Flamingo: a Visual Language Model for Few-Shot Learning
- 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
- 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
- 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
- 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
- 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
- 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
- 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
- 133. Improved Baselines with Visual Instruction Tuning
- 134. OBELICS
- 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- 136. Sigmoid Loss for Language Image Pre-Training
- 137. What matters when building vision-language models?
- 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- 139. The Llama 3 Herd of Models
- 140. LLaVA-NeXT-Interleave
- 141. LLaVA-OneVision: Easy Visual Task Transfer
- 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
- 143. Pixtral 12B
- 144. Dream to Control: Learning Behaviors by Latent Imagination
- 145. World Models
- 146. DayDreamer
- 147. Mastering Atari with Discrete World Models
- 148. Dreamer V3: Mastering Diverse Domains through World Models
- 149. Transformers are Sample-Efficient World Models
- 150. TWM: Transformer-based World Models
- 151. 1X World Model Challenge
- 153. GAIA-1
- 154. Genie: Generative Interactive Environments
- 155. Navigation World Models
- 156. UniSim
- 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
- 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
- 159. Universal Actions for Enhanced Embodied Foundation Models
- 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
- 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
- 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
- 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
- 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
- 165. LLaDA-VLA: Vision Language Diffusion Action Models
- 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
- 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
- 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- 169. Embodiment Transfer Learning for Vision-Language-Action Models
- 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
- 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
- 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
- 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
- 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
- 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
- 176. Membership Inference Attacks on Vision-Language-Action Models
- 177. A Survey on Efficient Vision-Language-Action Models
- 178. Survey of Vision-Language-Action Models for Embodied Manipulation
- 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
- 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
- 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
- 182. Embodied Navigation Foundation Model
- 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
- 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
- 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
- 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
- 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
- 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
- 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
- 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
- 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
- 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
- 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
- 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
- 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
- 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
- 197. A Survey of Language-Conditioned Robot Manipulation
- 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
- 199. The Essential Role of Causality in Foundation World Models for Embodied AI
- 200. A call for embodied AI
- 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
- 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?