Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 135

Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

16 min read · 5431 字 · ⭐⭐⭐ · 长篇结构化

给"完全没接触过 AI"的读者写的精读笔记。所有专业词第一次出现都会解释清楚,只看这份笔记就能理解全文机制。本笔记基于 arXiv 摘要与公开正文信息精读。

一句话讲什么(TL;DR)

阿里 2023 年开源的 Qwen-VL:在会中英双语聊天的 Qwen-7B 语言模型上,接一个 ViT-bigG(19 亿参数)视觉编码器 + 一个把图压成 256 个 token 的位置感知适配器,用三阶段训练教它一次学会看图、念中英文招牌(OCR)、用框指出物体(grounding)、还能多轮聊天。关键 trick 是把"指物"当成一种文本任务——直接让模型输出 <box>(x1,y1),(x2,y2)</box>,不用额外检测头。在图说、VQA、grounding、OCR 等多类基准上刷新同规模 generalist 记录,是中文社区第一个真正能打的开源通用 VLM。

所以这一节是想说:Qwen-VL 把"中英双语 + 看图 + 认字 + 指物 + 对话"合进一个模型,靠三阶段训练和"任务文本化"做到,是 2023-2024 中文 VLM 的范式起点。


这是个什么场景

想象你出国旅游,请了个中英文都会的导游,但他眼睛被蒙着——你只能用嘴描述眼前的东西,他再回答。这就是纯文本大语言模型(LLM)的状态:会聊天,但看不见。

Qwen-VL 干的事就是给这个导游摘掉眼罩、配一副眼镜(视觉编码器 Vision Encoder)。摘了眼罩后,导游不光能聊天,还能:

  • 你把菜单举到他面前,他能念出上面的中英文菜名(OCR,光学字符识别);
  • 你说"图里那个穿红衣服的小孩在哪?",他能用手指框出来(grounding,视觉定位);
  • 你接着追问"那他旁边那只狗呢?",他还记得刚才聊过什么(多轮对话)。

上一代(LLaVA / BLIP-2)的眼镜有点糊,导游基本只能讲"这里有只猫坐在沙发上"这种大概描述,念不清招牌,也没法精确指物,而且中文支持差。Qwen-VL 想把这副眼镜升级,让一个模型同时把这几件事都办了,尤其补上中文精确指物这两块。

所以这一节是想说:Qwen-VL 面对的是"通用 VLM 不会指物、不会读中文字、还多是英文私有模型"的空白,目标是一个中英双语、能指物能认字的开源通用 VLM。


Qwen-VL — 场景示意:这论文要解决的现实问题
Plate Nº IQwen-VL — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • CLIP(2021):图文对齐,但只能算"匹配度",不能生成长句子,更别说对话。
  • BLIP / BLIP-2(2022-2023):用 Q-Former 把视觉特征压成几十个 token 喂给 LLM,能生成描述,但 grounding 弱、OCR 弱
  • LLaVA(2023):MLP 投影 + 指令微调,生成能力强,但中文支持差、不会输出坐标框
  • Flamingo(2022):cross-attention 插进 LLM 每一层,参数大、闭源、不支持中文

VLM(Vision-Language Model,视觉语言模型):能同时处理图像和语言的模型。既不是纯 CLIP(只对齐、不生成),也不是纯文本 LLM(看不见)。

grounding(视觉定位):模型不仅说出"猫在哪",还给出像素坐标框。

共性短板:要么不会指物(grounding),要么不会读图里的中文字,要么是英文私有模型。Qwen-VL 要把这几块一次补齐——尤其是中英双语 + grounding + OCR 三合一

所以这一节是想说:前人各缺一块(指物/中文/开源),Qwen-VL 把它们合到一个开源模型里,填了中文通用 VLM 的真空。


这篇论文的新想法

把上面几类能力合到一个模型里,而不是为每种任务训一个专门模型。三个押注:

  1. 主干换成 Qwen-7B:天然支持中英双语,解决中文 VLM 真空。
  2. 视觉端用 ViT-bigG(OpenCLIP)+ 一个位置感知的视觉-语言适配器:让视觉 token 既保留空间信息,又压缩到固定的 256 个(可控开销)。
  3. 三阶段训练范式:先大规模预训练打基础 → 再多任务预训练加 OCR/grounding/caption 等结构化任务 → 最后指令微调出对话版 Qwen-VL-Chat。

最关键的设计是把 grounding 当成一种文本任务:模型直接输出 <box>(x1,y1),(x2,y2)</box> 这种特殊 token,不用额外检测头。这是把"会指物"塞进语言模型的简洁路线——和 OCR、caption 一样,全都统一成"输入 → 任务标签 → 文本输出"的格式。

所以这一节是想说:Qwen-VL 的新想法是"双语主干 + 位置感知适配器 + 三阶段训练 + 把指物/认字都文本化",用一套语法学全部本事。


它分几步做的(方法)

方法可拆成两大块:架构(搭班子)与三阶段训练。训练配方是全文精华。

1. 架构:三个零件搭出一个班子(Model Architecture)

类比:开一家图文翻译店,老板凑齐三个人。

输入:图像 + 文字(提问/指令)。

处理

  • 摄影师(视觉编码器 ViT-bigG,约 1.9B 参数,从 OpenCLIP 初始化):把图切成 patch(步长 14)看成一串视觉特征。
  • 翻译(Qwen-7B 语言模型):负责理解和生成文字。
  • 传话员(视觉-语言适配器 VL Adapter,约 0.08B):把摄影师拍的几百个 patch token 整理成固定 256 个再递给翻译。它用一组"可学习的提问卡(learnable query)+ cross-attention(交叉注意力)"压缩,是简化版的 Q-Former 思路;传话时还附上 2D 位置编码("这块特征来自图的第几行第几列"),别让翻译丢了空间关系。

输出:256 个带位置信息的视觉 token,拼上文字 token 一起进 LLM。三部分参数:ViT 1.9B + Adapter 0.08B + LLM 7.7B ≈ 9.6B 总参数

patch token:ViT 把图切成小方格(patch),每格变成一个 token(数字向量)。一张图有几百个,直接全塞给 LLM 太贵,所以用适配器压成 256 个。

位置感知(position-aware)适配器:压缩视觉特征时保留"哪块来自图的哪个位置",这是 grounding(要输出坐标)能成立的前提。

所以这一节是想说:架构是"ViT 看图 → 位置感知适配器压成 256 token → Qwen-7B 说话",位置感知是后面能指物的关键。


2. 第一阶段:预训练(让摄影师学会和翻译对暗号)

类比:新员工入职先磨合。

输入:约 14 亿(1.4B)图文对(网络爬取 + 学术 caption 数据集,从原始 50 亿清洗而来;清洗后 77.3% 英文、22.7% 中文文本)。

处理:把翻译(LLM)锁住不动(冻结),只训摄影师(ViT)和传话员(Adapter)。任务是看图配文——配多了,这两位就学会用翻译听得懂的"语言"递信息。此阶段用低分辨率 224×224(先用小图练,省算力)。

输出:一个视觉端和语言端已"对齐"的基础模型。

所以这一节是想说:第一阶段只练视觉与适配器、冻结 LLM,用 14 亿图文对把"看"和"说"对齐,中英混合数据奠定双语基础。


3. 第二阶段:多任务预训练(同时教七门手艺)

类比:整个店同时接七种活。

输入:七类任务数据同时训——图说(caption)、看图问答(VQA)、带框描述(grounded captioning)、按描述找框(referring expression comprehension)、读图里的字(OCR)、纯文字聊天、带框问答。数据量级示例:caption 19.7M、VQA 3.6M、grounding 3.5M、ref grounding 8.7M、grounded caption 8.7M、OCR 24.8M、纯文本 7.8M。

处理:聪明之处是所有任务改写成同一种格式 <输入><任务标签><输出>,让 LLM 用同一套语法学全部手艺。分辨率升到 448×448(看更清楚)。grounding 的输出就是 <box>(x1,y1),(x2,y2)</box> 文本 token,OCR 输出文字(+ 可选坐标)。此阶段解冻更多参数一起训。

输出:一个多才多艺的 Qwen-VL 基础模型,会 caption、VQA、grounding、OCR。

七任务统一格式(ASCII)

   图 + <任务标签> + 输入  ──►  Qwen-VL  ──►  文本输出
   ─────────────────────           ────────────────────
   <img> <CAPTION>            →  "一只猫坐在沙发上"
   <img> 问题 <VQA>           →  "红色"
   <img> "穿红衣的人" <REF>   →  <box>(120,80),(210,300)</box>
   <img> <OCR>               →  "本日特价 / Today's Special"

所以这一节是想说:第二阶段是 Qwen-VL 全能的关键——七种任务用同一 <输入><标签><输出> 语法学,指物和认字都被文本化。


4. 第三阶段:指令微调(学会礼貌聊天,造出 Qwen-VL-Chat)

类比:前两步学的是技能,第三步学的是"礼貌"和"接话"。

输入:多模态指令 + 多轮对话数据(含交错图文,interleaved)。

处理:用这批数据再训一遍,让模型学会按人类指令回答、能接住第二轮第三轮追问。此阶段冻结 ViT、主要调 LLM 和 Adapter。训练允许任意交错的图文输入,所以 Chat 版能同时看多张图做对比分析。

输出:对话版 Qwen-VL-Chat。基础技能版叫 Qwen-VL,会聊天的版本叫 Qwen-VL-Chat。

三阶段全景(ASCII)

  阶段1 预训练         阶段2 多任务预训练      阶段3 指令微调
  14 亿图文对          7 任务, 统一格式         多模态指令+多轮对话
  224×224             448×448                交错图文
  冻结 LLM            解冻更多                 冻结 ViT
  练"看+说"对齐        练七门手艺              练"礼貌接话"
      │                   │                      │
      ▼                   ▼                      ▼
   对齐基础    ───►   Qwen-VL 全能   ───►   Qwen-VL-Chat 对话版

所以这一节是想说:三阶段(对齐 → 多任务 → 指令)逐级冻结/解冻不同部分、逐级升分辨率,把一个纯文本 LLM 长成能聊天的通用 VLM。


Qwen-VL — 方法示意:核心 pipeline
Plate Nº IIQwen-VL — 方法示意:核心 pipeline

关键数字(What works)

以下数字来自论文正文表格,均为真实报告值。

模型参数

部件 参数量
视觉编码器 ViT-bigG 1.9B
VL Adapter 0.08B
LLM(Qwen-7B) 7.7B
合计 9.6B
视觉 token 数(压缩后) 256

图说与通用 VQA(对比 generalist,节选自论文 Table 4)

模型 Flickr30K CIDEr (0-shot) VQAv2 OKVQA GQA VizWiz (0-shot)
Flamingo-80B 67.2 56.3 50.6 31.6
BLIP-2 (Vicuna-13B) 71.6 65.0 45.9 61.0 19.6
InstructBLIP (Vicuna-13B) 82.8 63.1 33.4
Qwen-VL (Qwen-7B) 85.8 79.5 58.6 67.1 35.2
Qwen-VL-Chat 81.0 78.2 56.6 68.2 38.9

文本相关 VQA / OCR(节选自 Table 5)

模型 TextVQA DocVQA ChartQA AI2D OCR-VQA
mPLUG-DocOwl (LLaMA-7B) 52.6 62.2 57.4
Pix2Struct-Large (1.3B) 76.6 58.6 42.1 71.3
Qwen-VL (Qwen-7B) 63.8 65.1 65.7 62.3 75.7

指代表达理解 grounding(RefCOCO,节选自 Table 7)

模型 RefCOCO val RefCOCO+ val RefCOCOg val
Shikra-13B 87.83 82.89 82.64
Qwen-VL-7B 89.36 83.12 85.58

所以这一节是想说:Qwen-VL 用 7B 语言主干,在图说(Flickr30K 85.8 CIDEr 甚至超 Flamingo-80B)、VQA、OCR、grounding 上全面领先同规模 generalist。


实验结果说明了什么

**结论 1:小主干也能超大模型,靠的是数据与任务设计。**Qwen-VL 的 Flickr30K 零样本 caption(85.8 CIDEr)超过了 80B 参数的 Flamingo。说明"高分辨率输入 + 细粒度多任务数据 + 位置感知适配器"能让 7B 主干打过纯堆参数的大模型。

**结论 2:任务文本化让一个模型全能。**把 grounding、OCR、caption 全写成 <输入><标签><输出>,一套语法学全部本事,避免为每种任务加专属头。这是 Qwen-VL 能在多类基准同时领先的结构性原因。

**结论 3:位置感知适配器是 grounding 能成立的前提。**压缩视觉 token 时保留 2D 位置,模型才能"说出"精确坐标框(RefCOCO 89.36)。若像普通 Q-Former 那样丢掉位置,grounding 会退化。

**结论 4:三阶段训练是把纯文本 LLM 变 VLM 的稳妥路径。**先对齐(冻 LLM)、再多任务、最后指令微调,逐级解冻和升分辨率,避免一步到位破坏 LLM 的语言能力。论文还报告多任务训练后纯文本能力不降反升。

**结论 5:中文是差异化优势。**中英混合语料让 Qwen-VL 成为开源里少有的中文 OCR / 中文对话可用方案,直接填补中文通用 VLM 真空。

所以这一节是想说:核心 takeaway 是"任务文本化 + 位置感知适配器 + 三阶段训练 + 中英语料",让 7B 主干成为全能且双语的开源 VLM。


你应该懂的几个新词

VLM(Vision-Language Model):能同时处理图像和语言的模型,既非纯 CLIP 也非纯 LLM。

grounding(视觉定位):说出物体的同时给出像素坐标框。Qwen-VL 用输出 <box> 文本 token 实现。

指代表达理解(referring expression comprehension):根据一句话在图里框出对应物体,是 grounding 的一种。

视觉-语言适配器(VL Adapter):连接视觉编码器和 LLM 的中间模块。Qwen-VL 用带可学习 query 的 cross-attention,把可变数量 patch token 压成固定 256 个,并保留位置。

OCR(光学字符识别):读出图里的文字。中文 OCR 因字符多字形复杂比英文难。

三阶段训练:预训练 → 多任务预训练 → 指令微调。后被 InternVL、MiniCPM-V 等大量继承。

CIDEr:评价图说质量的指标,值越高越好。

Q-Former:BLIP-2 提出的、用可学习 query 压缩视觉特征的模块。Qwen-VL 的适配器是其简化 + 位置感知版。

所以这一节是想说:抓住"任务文本化""位置感知适配器""三阶段训练"这三点,就理解了 Qwen-VL 的骨架。


它有什么搞不定的

  1. 固定 256 视觉 token 的分辨率上限:把图压成固定 256 个 token,对超高分辨率长文档、密集小字的极端 OCR 场景信息不足(后续 Qwen2-VL 才引入动态分辨率)。
  2. 不支持视频/时序:这一代主要处理静态图(多图对比可以,但不是视频理解)。
  3. grounding 精度受坐标文本化限制:坐标以文本 token 输出,精度受 token 化和分辨率约束,对亚像素级定位不够。
  4. 不接动作空间:它是通用 VLM,能当具身系统的"感知前端 / 高层规划器",但本身不输出机器人动作,要和 RT-2 / OpenVLA 那条 VLA 线区分。
  5. 9.6B 的部署成本:虽比 Flamingo-80B 小,但 9.6B 推理仍需可观显存,边缘设备吃力。
  6. 依赖数据清洗质量:从 50 亿清洗到 14 亿图文对,清洗策略直接影响质量;网络爬取数据的噪声和偏差可能残留。

所以这一节是想说:Qwen-VL 的边界是"固定 256 token 的分辨率上限 + 无视频 + 不出动作",它是强感知/对话前端,但不是控制器也不处理时序。


它和别的几篇是什么关系

家族关系(ASCII)

   CLIP/OpenCLIP(ViT-bigG来源)  BLIP-2(Q-Former)  LLaVA(指令微调)  Flamingo(多模态预训练)
              └──────────────────┴─────┬───────────┴────────────┘
                                       ▼
                                  Qwen-VL(双语 + grounding + OCR 三合一)
                        ┌──────────────┼───────────────┐
                     同期竞品          下游演进           具身用途
                  LLaVA-1.5 /        Qwen-VL-Plus/Max   当高层规划器/
                  InstructBLIP /     Qwen2-VL           感知前端(非VLA)
                  CogVLM             (动态分辨率+视频)
  • 上游:BLIP-2(Q-Former 思路)、CLIP/OpenCLIP(ViT-bigG 来源)、LLaVA(指令微调范式)、Flamingo(多模态预训练目标)。
  • 同期:LLaVA-1.5、InstructBLIP、CogVLM、MiniGPT-4——都在 2023 年探索"LLM + 视觉",Qwen-VL 的差异点是中英双语 + grounding + OCR 三合一。见 llava-1-5.mdinternvl.md
  • 下游:演进到 Qwen-VL-Plus/Max(闭源更强版)和 2024 年的 Qwen2-VL(动态分辨率 + 视频);也启发国内一批中文 VLM。
  • 对具身研究的关系:作为通用 VLM,可当高层规划器感知前端(看图 → 出指令/坐标);但它不接动作空间,要和 RT-2 / OpenVLA 的 VLA 线区分(见 openvla.mdrt-2.md)。

所以这一节是想说:Qwen-VL = OpenCLIP 视觉 + BLIP-2 式适配器(加位置感知)+ LLaVA 式指令微调 + 中英语料,是中文通用 VLM 的开山标杆。


和本导读的关系

本篇对应 Ch09: 从 BLIP-2 到 LLaVA——视觉接语言

Ch09 讲"怎么把视觉接到语言模型上"。BLIP-2 用 Q-Former 压缩视觉、LLaVA 用简单投影 + 指令微调。Qwen-VL 是这条线上"更全能、且中英双语"的一站:它继承了 Q-Former 的压缩思路(并加位置感知)和 LLaVA 的指令微调,还把 grounding、OCR 都文本化进同一接口。读 Ch09 时把 Qwen-VL 当作"视觉接语言"路线走向工业级全能与多语言的代表;它的三阶段训练配方也是后续大量 VLM(InternVL、MiniCPM-V 等)的模板。对具身读者,Qwen-VL 这类 VLM 常被用作 VLA 的骨架或高层规划器。

所以这一节是想说:在 Ch09 里,Qwen-VL 代表"视觉接语言"路线的全能双语升级版,也是很多 VLA 的上游骨架。


思考题

Q1:Qwen-VL 把视觉压成固定 256 个 token。这个"固定"在什么任务上会成为瓶颈?后续 Qwen2-VL 的动态分辨率如何解决?

提示

固定 256 token 意味着无论图多大多复杂,都压成同样多的信息。对密集小字文档、超高分辨率图、需要看清远处小物体的场景,256 个 token 装不下足够细节,OCR/细粒度理解会掉。动态分辨率(Qwen2-VL)让 token 数随图像尺寸/内容变化——大图/复杂图用更多 token、小图用更少,既保细节又控开销。这本质是"固定预算 vs 按需分配"的权衡。

Q2:为什么 grounding 要在适配器里保留 2D 位置编码?如果用普通 Q-Former(丢位置)会怎样?

提示

grounding 要输出精确坐标框,模型必须知道"某个视觉特征来自图的哪个位置"。如果适配器把 patch token 压缩时丢掉了位置信息(普通 Q-Former 倾向于只保留"是什么"、弱化"在哪"),模型就无法把内部特征映射回具体坐标,grounding 会退化甚至失效。位置感知适配器是"能指物"的结构前提。这也解释了为什么 caption 强的 BLIP-2 grounding 弱——它的压缩丢了位置。

Q3:三阶段训练里,第一阶段冻结 LLM、第三阶段冻结 ViT。为什么不同阶段冻不同部分?

提示

第一阶段目标是"让视觉对齐到语言",此时 LLM 已经很强,冻住它可避免被尚未对齐的视觉特征带偏、破坏语言能力,只让视觉和适配器去适应 LLM。第三阶段目标是"学对话礼貌和指令跟随",视觉能力已经在前两阶段练好,冻住 ViT 省算力并防止指令数据(相对小)破坏视觉表征,主要调 LLM。核心逻辑是"每阶段只训需要变的部分,保护已经练好的部分"。

Q4:Qwen-VL 用 7B 主干在 Flickr30K caption 上超过了 80B 的 Flamingo。这说明参数量不是决定性的,那什么才是?

提示

决定性因素更多在:(1) 输入分辨率(Qwen-VL 用到 448,看得更清);(2) 细粒度多任务训练数据(见过 caption/OCR/grounding 各种粒度);(3) 位置感知适配器保留空间信息;(4) 针对性的三阶段配方。Flamingo 走的是"少样本 in-context + 大参数"路线,但在 caption 这类任务上,专门的数据和更高分辨率比单纯堆参数更有效。这提醒我们"更大"不等于"更好",任务对齐的数据和输入质量常常更关键。

Q5:Qwen-VL 常被具身工作当"高层规划器"用。它作为规划器有什么优势,又有什么必须补的短板?

提示

优势:能看图 + 理解指令 + 输出结构化信息(坐标框、子任务文本),中英双语,开源可微调,适合"看一眼场景,给出下一步该做什么/物体在哪"。短板:它不输出连续机器人动作、不懂运动学、不处理时序动态,也没有实时闭环控制能力。所以具身系统通常让 Qwen-VL 出高层语义/坐标,再接一个低层策略(如 VLA / 控制器)把这些转成动作——它负责"想和看",不负责"动手"。

Q6:把 grounding、OCR、caption 全部文本化成 <输入><标签><输出>,这种"任务文本化"有什么代价?

提示

代价包括:(1) 精度损失——坐标写成文本 token 受 token 化和分辨率限制,不如专用检测头精确;(2) 序列长度——密集输出(很多框、长 OCR)会让序列很长,自回归解码慢且易在后段出错;(3) 任务间可能互相干扰——共享同一套语法和参数,某些任务的信号可能被其他任务淹没(需要精心配比数据)。好处是接口极简、一个模型全能,坏处是每个单项未必是最优。这是 generalist 的普遍权衡。


一些好奇心问答(FAQ)

Q:Qwen-VL 和 Qwen-VL-Chat 有什么区别?

Qwen-VL 是完成第二阶段多任务预训练的基础技能版;Qwen-VL-Chat 是再做指令微调后的对话版,会按指令回答、能多轮追问、能多图对比。

Q:总共多大?跑得动吗?

约 9.6B(ViT 1.9B + Adapter 0.08B + LLM 7.7B)。比 Flamingo-80B 小很多,但推理仍需可观显存,消费级高端显卡可跑量化版。

Q:中文能力真的强吗?

是。训练用了大量中英混合语料,中文 OCR 和中文对话是开源里少有的可用方案,这是它的差异化卖点。

Q:它能做视频吗?

这一代主要处理静态图(可多图)。视频要到 Qwen2-VL。论文里通过采样几帧也能迁移到部分视频任务,但不是原生视频模型。

Q:为什么发在 arXiv 而不是会议?

它是工业界(阿里)的技术报告式发布,重点是开源模型和权重,配套推理脚本完整,社区可直接用。

所以这一节是想说:对多数人,Qwen-VL 的正确用法是"当一个开源中英双语的看图/认字/指物/对话工具或 VLA 骨架来用"。


如果你想再深入

  1. 上游(必读):BLIP-2 (Li et al. 2023) — Q-Former 压缩视觉的思路来源,看 Qwen-VL 如何加位置感知。见 blip-2.md
  2. 上游:LLaVA (Liu et al. 2023) — 指令微调范式,Qwen-VL 第三阶段的思想来源。见 llava.md
  3. 对照:Flamingo (Alayrac et al. 2022) — 大参数少样本路线,对比"堆参数 vs 数据+分辨率"。见 flamingo.md
  4. 同期对照:InstructBLIP / CogVLM — 同代 VLM,理解 Qwen-VL 的差异点(双语 + grounding + OCR)。
  5. 下游演进:Qwen2-VL — 动态分辨率 + 视频,看这一代的短板如何被解决。
  6. 具身用途:OpenVLA / RT-2 — 理解通用 VLM 与 VLA 的分工(一个感知/规划、一个出动作)。见 openvla.md

读顺序建议:

CLIP → BLIP-2 / LLaVA → Qwen-VL(你在这)
                          ├─► Flamingo(对照)
                          └─► Qwen2-VL(下一代)

所以这一节是想说:把 Qwen-VL 放在 BLIP-2 / LLaVA 的"视觉接语言"脉络里读,对照 Flamingo 看路线差异,顺读 Qwen2-VL 看演进。


原文信息

@article{bai2023qwenvl,
  title={Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond},
  author={Bai, Jinze and Bai, Shuai and Yang, Shusheng and Wang, Shijie and Tan, Sinan and Wang, Peng and Lin, Junyang and Zhou, Chang and Zhou, Jingren},
  journal={arXiv preprint arXiv:2308.12966},
  year={2023}
}
  • arXiv:2308.12966
  • 机构:Alibaba Group(阿里巴巴)
  • 一句话定位:Qwen-7B + ViT-bigG + 位置感知适配器(256 token)+ 三阶段训练,中英双语通用 VLM,指物/认字全文本化。

引用本笔记 / Cite this note
BibTeX
@online{eai_qwen_vl_2026,
  title       = {(readable note) Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2023 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/qwen-vl/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?