Jason / Works Embodied AIZero to One
Works
没主意?快捷入口
VLM Foundation · Plate Nº 132

InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks

15 min read · 5250 字 · ⭐⭐⭐⭐ · 长篇结构化

这是一份写给零基础读者的精读笔记。术语第一次出现先给类比,公式一律翻成人话。

一句话讲什么(TL;DR)

让"看图的脑子"也长到 60 亿参数,和"会说话的脑子"一样大,AI 看图说话才不偏科,而且开源就能用。

所以这一节是想说:InternVL 把长期偏小的"视觉端"扩大到和语言模型同一量级,并让它学会 LLM 的说话方式。


这是个什么场景

你拍一张照发给朋友,让他帮你描述里面发生了什么。如果朋友只看了一眼草草说"有只动物在跑",你大概会很失望——你想要的是"一只金毛在沙滩上追飞盘,背景有个穿红衣服的小孩在笑"这种细节。

现在的"看图说话 AI"就常出现前一种翻车。原因是它由两个人合作完成:

  • 一个会说话的资深员工(大语言模型 LLM,几十亿到上千亿参数),见识广、词汇丰富。
  • 一个会看的实习生(视觉编码器 vision encoder,常见才 3 亿参数),眼力凑合但脑容量太小。

让一个见识差几个量级的实习生给资深员工做汇报,他看到的细节根本组织不成对方听得懂的话,中间还得另请一个"翻译"(adapter / Q-Former 之类)勉强对接。

InternVL 想做的:把实习生直接送去读博,把视觉编码器也扩到 60 亿参数(InternViT-6B),让它和 LLM 量级对等。这样两人对话才能从"看到一只动物"升级到"金毛、沙滩、飞盘、红衣小孩"这种级别,而且不用每次都现搭翻译桥。

VLM(Visual-Language Model,视觉语言模型):能同时处理图像和文字的模型,输入图、输出字。

所以这一节是想说:场景是"看图说话偏科",InternVL 通过扩大视觉端来平衡视觉与语言的能力差距。


InternVL — 场景示意:这论文要解决的现实问题
Plate Nº IInternVL — 场景示意:这论文要解决的现实问题

之前的人怎么做的,为什么不够好

  • CLIP 路线(OpenAI 2021):图文对比学习,把图像和文本压到同一空间。视觉塔通常约 3 亿到 10 亿参数,OpenAI 后续训了更大的 CLIP-G(约 2B)但不开源
  • EVA-CLIP / OpenCLIP 路线:开源社区扩大 CLIP,能到 1–2B 量级,但和 OpenAI 私有版还有差距。
  • BLIP-2 / Flamingo / LLaVA 路线:视觉骨干不动(用现成 CLIP-ViT),靠中间一个轻量的"桥"(Q-Former、cross-attention、MLP projector)把视觉特征塞给 LLM。视觉端没扩展
  • 结果:开源圈视觉编码器卡在 1B 左右;多模态大模型的"视觉脑容量"远小于"语言脑容量",细粒度感知任务上限被压住。
  • 痛点:私有 CLIP-G 在零样本分类、检索等基础视觉任务上始终领先,开源没有同档对手。

零样本(zero-shot):不针对某任务专门训练,直接拿去用还能work。CLIP 的招牌能力之一。

所以这一节是想说:以前大家都在"接现成的小视觉塔",导致视觉端长期偏弱,开源追不上私有 CLIP-G。


这篇论文的新想法

一句话:"把眼睛练得和嘴巴一样大,再让眼睛学会嘴巴的说话方式"。

  1. 视觉端纵向扩展:像把"实习生送去读博",把视觉编码器从常见的 3 亿直接训到 60 亿参数(InternViT-6B),和小型 LLM 同档。
  2. 对齐语言空间:让眼睛跟着嘴巴学说话——不仅做传统图文对比,还引入一个 LLM 风格的文本模型当"陪练",让视觉特征学到的表达和 LLM 内部用的词汇(token embedding)兼容,下游接 LLM 时不用复杂桥接。
  3. 渐进式训练:像从小学到研究生,先做大规模图文对比学习(看图配字),再做图文生成(看图写句子),最后指令微调(学会按人话回答)。

收益是:同一个 InternViT-6B,在三类任务上都能打——纯视觉感知(分类/检测/分割)、视觉-语言对比(zero-shot 检索)、视觉-语言生成(多模态对话)。一个骨干通吃,不再为每类任务各训一个。

所以这一节是想说:新想法 = 视觉端扩到 6B + 用 LLM 风格文本模型对齐语言空间 + 三阶段渐进训练。


它分几步做的(方法)

这是全篇最核心部分,分三块讲清楚"进什么、做什么、出什么"。

1. 视觉骨干 InternViT-6B

输入:图像。

处理:好比把厨师从"只会颠勺"练到"米其林主厨"——标准 ViT 架构(Vision Transformer,把图像切成小方块当"词"来处理)不变,但深度和宽度大幅扩展到 60 亿参数量,刚好和 7B 级 LLM 配对。具体层数、隐藏维度、patch 大小这些超参需读原文。

输出:一组高容量的视觉特征。

ViT(Vision Transformer):把图像切成一个个 patch(小方块)当 token 用 Transformer 处理的视觉架构,CLIP/SAM/DINO 都用它。

2. QLLaMA:让眼睛学会嘴巴的说话方式

输入:InternViT 输出的视觉特征 + 文本。

处理:等等,先慢一拍——QLLaMA 是什么?想让眼睛学会嘴巴的说话方式,但完整 LLM 太大太贵,于是论文做了一个"陪练版的 LLaMA"(可理解为压缩版语言模型,融合了 Q-Former 思想和 LLaMA 架构)。它在训练阶段提供 LLM 风格的语言侧表征,让视觉塔学到的特征不是冲着传统 CLIP 文本空间去的,而是冲着 LLM 兼容空间去的。

输出:一套与 LLM 词汇兼容的视觉-语言对齐表征。

下游真正接到完整 LLM 时,对接就顺滑得多——这是 InternVL 和"随便接个现成 CLIP"的关键区别。

QLLaMA:本文设计的中间件,可理解为"Q-Former 思想 + LLaMA 架构"的混合,用来在对比阶段提供 LLM 兼容的语言侧表征。

3. 三阶段训练

输入:三类不同的数据,分阶段喂。

处理:像学生从小学到研究生——

  • 阶段 1(对比预训练):好比抄作业对答案。超大规模图文对,InternViT + QLLaMA 做对比学习(contrastive),类似 CLIP 但语言侧更接近 LLM。
  • 阶段 2(生成预训练):好比看图写作文。把 InternViT 接到真正的 LLM(如 Vicuna),训练 captioning、VQA 等生成任务。
  • 阶段 3(指令微调):好比模拟面试。用多模态指令数据让模型学会按人话回答问题。

输出:一个可三种姿态共用同一份权重的骨干——(a) 单独当视觉编码器接分类/检测头;(b) 配 QLLaMA 做 zero-shot 图文检索;(c) 配 LLM 做多模态对话。

对比学习(contrastive learning):让配对的图文向量拉近、不配对的拉远,是 CLIP 的训练核心。

生成式预训练(generative pretraining):让模型生成 caption/回答,目标是"预测下一个 token",比对比学习多了"会说话"的能力。

ASCII 总览:

              图像 ──►[InternViT-6B]──► 视觉特征
                              │
阶段1 对比:  视觉特征 ⇄ [QLLaMA] ⇄ 文本   (学 LLM 兼容的对齐)
阶段2 生成:  视觉特征 ──►[真正的 LLM]──► caption/VQA
阶段3 指令:  多模态指令数据 ──► 学会按人话回答
                              │
        一份权重三种用法: 视觉编码 / 图文检索 / 多模态对话

5. 为什么非要把视觉塔放大到 6B

这是 InternVL 最反常规的一步,值得讲清动机。

输入:一个"视觉编码器 + 大语言模型"的多模态系统。

处理:当时主流做法是"一个小小的 CLIP 视觉编码器(几亿参数)+ 一个很大的 LLM(几十亿甚至更多)"。InternVL 团队指出这里有个严重的容量失衡:语言侧已经是个博士生,视觉侧却还是个小学生,图像信息在进入 LLM 之前就先被这个"小学生"压扁、丢失了细节,后面 LLM 再强也无米下炊。解决办法很直接——把视觉塔也放大到和 LLM 同一量级(InternViT 约 60 亿参数),让"眼睛"和"脑子"势均力敌。这样视觉端能保留足够丰富的信息喂给语言端,多模态理解的上限才被真正打开。这一步在当时是很大胆的资源投入,因为训练一个 6B 的视觉 Transformer 本身就是一项大工程。

输出:一个容量上能与大 LLM 匹配、不再成为信息瓶颈的视觉骨干。

打个比方:以前是让一个近视眼给一位博士当眼睛,博士学问再大也看不清;InternVL 干脆给博士配一双同样厉害的眼睛。

6. QLLaMA:为什么不能"随便接个现成 CLIP"

输入:视觉特征,以及一个未来要对接的大语言模型。

处理:这里藏着一个容易被忽略的错配问题。普通 CLIP 的视觉特征,是为了对齐 "CLIP 自己那个文本编码器的空间"训出来的,而这个空间和大语言模型(LLaMA 这类)内部的 token 语义空间并不是一回事。你把 CLIP 特征硬塞给 LLM,等于给一个说方言的人配了个说另一种方言的翻译,对接处总是别别扭扭。InternVL 的解法是设计 QLLaMA——一个融合了 Q-Former 思想和 LLaMA 架构的中间件,在对比训练阶段就用"LLM 风格"的语言侧表征去对齐视觉塔。也就是说,视觉塔从一开始学的对齐目标,就是"未来那个大 LLM 听得懂的语言空间",而不是传统 CLIP 文本空间。等到真正接上完整 LLM 时,双方语言基本一致,对接顺滑得多。

输出:一套天生就朝着"LLM 兼容"方向对齐的视觉-语言表征。

所以这一节是想说:QLLaMA 的意义在于让视觉塔"从小就按 LLM 的语言习惯学说话",避免了 CLIP 空间和 LLM 空间之间的翻译损耗。

7. 三阶段训练为什么是这个顺序

输入:三类性质不同的数据(海量图文对、图文生成数据、多模态指令数据)。

处理:三个阶段层层递进,顺序不能乱:

  • 阶段 1 对比预训练:用超大规模图文对做对比学习,先把"图和文在语义上对得上"这件最基础的事打牢——这一步给的是"认得出图里有什么"的能力。
  • 阶段 2 生成预训练:把视觉塔接到真正的 LLM 上,训 captioning、VQA 等生成任务——这一步在"认得出"的基础上加上"会用语言把它讲出来"的能力。
  • 阶段 3 指令微调:用多模态指令数据,教模型按人类的提问方式作答——这一步把前两阶段的知识包装成"听得懂指令、答得像人"的可用产品。

先对齐、再生成、最后对齐人类意图,每一阶段都建立在前一阶段的能力之上,跳过任何一步后面的能力都立不住。

输出:一个既有扎实视觉-语言对齐、又会生成、还听得懂指令的模型。

8. "一份权重三种用法"到底强在哪

输入:三阶段训完的同一份骨干权重。

处理:InternVL 刻意让同一套权重能以三种姿态工作:单独当视觉编码器接分类/检测头(判别式任务)、配 QLLaMA 做 zero-shot 图文检索(对比式任务)、配 LLM 做多模态对话(生成式任务)。这在当时很难得——判别式(像 CLIP/ViT)和生成式(像 LLaVA)通常是两套割裂的模型,各训各的。InternVL 用一个统一骨干把两条路打通,意味着一次昂贵的预训练投入能覆盖从"感知"到"对话"的一整条谱系,部署时按需切换,也让它更像一个真正的"视觉基础模型"而非某个单一任务的专用网络。

输出:一个覆盖判别、检索、对话三大能力谱系的统一视觉基础模型。也正因为它把这三条原本割裂的技术路线收进同一份权重,后来者要接入自己的任务时,可以按需选一种姿态直接用,而不必为每类任务各找一个专门模型,这正是"基础模型"应有的通用性。

所以这一节是想说:InternViT-6B 提供与 LLM 匹配的大容量视觉(消除瓶颈),QLLaMA 让视觉从小按 LLM 语言习惯对齐(消除翻译损耗),对比→生成→指令三阶段层层递进,最终得到一份权重通吃感知/检索/对话三类任务的视觉基础模型。


下图概括本篇在「关键数字」节前的核心结果脉络(便于对照后文表格):

【InternVL: Scaling up Vision Foundat… · 关键结果概览】

   设定 / 数据          方法要点              主结果
        │                   │                    │
        ▼                   ▼                    ▼
   训练           ──► 方法核心                   ──► …
   评测           ──► 主指标提升                  ──► ↑ 论文主结论

   (对照下方表格中的原文数字与消融)

InternVL — 方法示意:核心 pipeline
Plate Nº IIInternVL — 方法示意:核心 pipeline

关键数字(What works)

InternVL 是 CVPR 2024 论文。可确认的关键规模是视觉骨干 InternViT-6B(约 60 亿参数);各 benchmark 的精确指标(top-1 acc、检索 R@1、VQA 分数)需以原文为准,本笔记不编造。

关注点 说明 具体数值
视觉骨干规模 InternViT 约 6B 参数(原文报告)
视觉感知 ImageNet 分类、检测分割 对标 EVA/SAM,具体需读原文
图文对比 zero-shot 分类、COCO/Flickr 检索 目标追平 OpenAI CLIP-G,具体需读原文
多模态对话 VQA、MME 等 VLM benchmark 对标 LLaVA/QwenVL/BLIP-2,具体需读原文
消融 规模/阶段/数据影响 见原文

提醒:除"约 6B 参数"外,任何 top-1、R@1、VQA 分数请以 arXiv 原文(2312.14238)为准。

所以这一节是想说:能确认的是"视觉端 6B"这个规模突破,具体刷榜数字回原文。


实验结果说明了什么

  • 开源视觉端第一次能正面叫板私有 CLIP-G:InternViT-6B 在多任务上达到或超过同期最强开源模型,并在部分对比任务上接近 OpenAI CLIP-G,这对开源生态意义重大。
  • 一个骨干通吃三类任务:同一份权重能做纯视觉、图文检索、多模态对话,说明"扩视觉塔 + 对齐语言"的路线让视觉基础模型真正"基础化"。
  • 视觉规模确实提升细粒度感知:视觉端不再偏科后,细粒度感知任务的上限被打开——这是 BLIP-2 那种"冻小视觉塔"路线做不到的。
  • 对齐语言空间是关键:QLLaMA 让视觉特征天生和 LLM 兼容,下游接 LLM 更顺,是 InternVL 区别于"扩个 CLIP 就完事"的核心。

所以这一节是想说:实验证明"扩视觉端 + 对齐语言"能让开源视觉基础模型追上私有旗舰,且一个骨干多用。


你应该懂的几个新词

Vision Foundation Model(视觉基础模型):像 LLM 之于文本那样,用一个大规模预训练视觉骨干通吃下游任务。

CLIP-G:OpenAI 训练的更大版 CLIP(约 2B 视觉端),效果强但未公开权重,是开源社区长期追赶目标。

ViT(Vision Transformer):把图像切成 patch 当 token 处理的视觉架构。

Contrastive learning(对比学习):让配对图文拉近、不配对拉远,CLIP 训练核心。

Generative pretraining(生成式预训练):让模型生成 caption/回答,比对比学习多了"会说话"。

QLLaMA:本文的中间件,提供 LLM 兼容的语言侧表征,帮视觉对齐 LLM 空间。

所以这一节是想说:抓住"视觉基础模型、CLIP-G、ViT、对比/生成预训练、QLLaMA"这几个词,就抓住了 InternVL。


它有什么搞不定的

  • 训练成本极高:把视觉端训到 6B 需要海量算力和数据,普通团队难以复现,这是"大力出奇迹"的代价。
  • 推理更重:6B 视觉塔 + LLM,推理开销比"小视觉塔 + 大 LLM"更大,部署成本上升。
  • 数据质量依赖:三阶段都吃大规模数据,数据配比和清洗直接影响效果,细节复现难。
  • 不是万能视觉塔:某些高度专业的视觉任务(医学影像、遥感等)仍需领域微调,通用骨干未必最优。
  • 与最强私有仍有差距:论文时点上接近 CLIP-G,但闭源前沿在持续进步,追赶是动态的。

所以这一节是想说:InternVL 强在规模,代价是训练/推理都贵、依赖数据,且并非所有专业视觉任务都通吃。


它和别的几篇是什么关系

  • 延续 CLIP(Radford et al. 2021):图文对比核心框架没变,但视觉端扩了一个数量级,语言端换成 LLM 风格。
  • 挑战 BLIP-2(Li et al. 2023):BLIP-2 选"冻视觉塔 + 训轻量桥",InternVL 反过来"扩视觉塔、简化桥",两种路线之争。
  • 承接 EVA-CLIP(Sun et al. 2023):EVA 把开源 CLIP 推到 1–2B,InternVL 推到 6B,规模的下一站。
  • 配合 LLaVA(Liu et al. 2023):LLaVA 视觉端用现成 CLIP-ViT,InternVL 提供更强的视觉端可替换进 LLaVA 风格的栈。
  • 后续影响:InternVL2/2.5/3 是这条线的演进;后续多模态模型很多直接用 InternViT 做视觉端。

所以这一节是想说:InternVL 是"扩视觉塔"路线的代表,站在 CLIP/EVA-CLIP 肩上,与 BLIP-2 的"冻小塔"路线对垒。


和本导读的关系

  • 主线章节:Ch08 CLIPCh09 从 BLIP-2 到 LLaVA。InternVL 是 VLM 地基里"把视觉端做大"的关键一步。
  • 多模态:Ch18 多模态生态。它是通用视觉基础模型的代表。
  • 对具身的关联:具身智能需要强视觉感知 + 语言理解,InternVL 这种"视觉端不弱化"的路线对机器人/驾驶等细粒度感知下游更友好。

所以这一节是想说:InternVL 落在 Ch08(CLIP 地基)与 Ch09(VLM 对齐)的核心位置。


思考题

Q1:为什么"视觉端偏小"会限制看图说话的细粒度能力?

提示

视觉塔容量小,抽出的细节有限,就算 LLM 再强,也"无米下锅",只能说出粗略描述。

Q2:InternVL 和 BLIP-2 的路线分歧是什么?各自赌注在哪?

提示

BLIP-2 冻小视觉塔、训轻量桥(省),赌"桥接够用";InternVL 扩视觉塔、简化桥(贵),赌"视觉规模才是瓶颈"。

Q3:QLLaMA 的作用是什么?为什么不直接用普通 CLIP 文本编码器?

提示

QLLaMA 提供 LLM 兼容的语言侧表征,让视觉特征对齐到 LLM 空间;普通 CLIP 文本空间和 LLM 空间不一致,下游接 LLM 要额外桥接。

Q4:三阶段训练为什么要按"对比 → 生成 → 指令"这个顺序?

提示

先对齐图文(打基础),再学会生成描述(会说话),最后学按指令回答(会办事),是从底层到高层的能力递进。

Q5:一个骨干通吃三类任务,工程上带来什么好处和风险?

提示

好处是省得为每类任务各训一个、便于复用;风险是通用可能不如专用极致,某些专业任务仍需微调。

Q6:为什么开源社区如此在意"追上 CLIP-G"?

提示

私有 CLIP-G 长期在基础视觉任务领先且不放权重,开源无同档对手;InternVL 追平意味着整个开源多模态生态有了强视觉地基。

所以这一节是想说:想清楚这些题,你就理解了"视觉端为何要大""两条路线之争""QLLaMA 的对齐作用"这几件核心事。


一些好奇心问答(FAQ)

Q:InternVL 开源吗?

是,InternViT 权重和 InternVL 系列开源,是国产开源多模态的重要起点。

Q:我能自己训一个 InternViT-6B 吗?

很难。训到 6B 需要海量算力和数据,多数团队只能用其发布的权重做下游。

Q:它和 InternVL2/2.5/3 什么关系?

本文是这条线的起点,后续版本继续扩规模、扩数据、改流程。想跟进国产开源 VLM,从这篇看起。

Q:视觉端做大就一定更好吗?

在细粒度感知上帮助明显,但也更贵;是否值得取决于任务和资源。

Q:为什么发在 CVPR?

CVPR 是计算机视觉顶会,InternVL 的核心贡献是"视觉基础模型",非常契合。

所以这一节是想说:InternVL 是开源视觉基础模型的里程碑,普通人主要受益于用它的权重,而非从头训练。


如果你想再深入

  1. 前置:CLIP —— 懂对比学习和图文对齐。
  2. 对照:BLIP-2 —— 看"冻小塔 + Q-Former"的相反路线。
  3. 承接:EVA-CLIP —— 看开源 CLIP 如何一步步扩大到 InternVL 的规模。
  4. 配合:LLaVA —— 看视觉塔如何接进多模态对话栈。
  5. 续读:InternVL2/2.5 —— 跟进这条线的规模与流程演进。

所以这一节是想说:先补 CLIP,横向对比 BLIP-2/EVA-CLIP,再顺着 InternVL2/2.5 看这条线怎么走。


原文信息

  • 标题:InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  • arXiv:https://arxiv.org/abs/2312.14238
  • 会议:CVPR 2024
  • 年份:2024
@inproceedings{chen2024internvl,
  title  = {InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks},
  author = {Chen, Zhe and others},
  booktitle = {IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)},
  year   = {2024},
  note   = {arXiv:2312.14238}
}

BibTeX 作者字段据公开信息填写,完整作者与页码请以官方版本为准。

引用本笔记 / Cite this note
BibTeX
@online{eai_internvl_2026,
  title       = {(readable note) InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks},
  author      = {Xun, Jason},
  year        = {2026},
  note        = {Note on a 2024 paper},
  howpublished = {\url{https://estelledc.github.io/embodied-ai-reading-station/papers/internvl/}},
  organization = {Embodied AI: Zero to One}
}

All 202 papers (full index)
  1. 1. LLaVA: Visual Instruction Tuning
  2. 2. 3DShape2VecSet: 3D Shape Representation for Diffusion Models
  3. 3. SayCan: Do As I Can, Not As I Say
  4. 4. OpenVLA: An Open-Source Vision-Language-Action Model
  5. 5. VLAS: VLA Model With Speech Instructions
  6. 6. MLA: Multisensory Language-Action Model
  7. 7. Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control
  8. 8. CartoRadar: RF-Based 3D SLAM Rivaling Vision Approaches
  9. 9. mmCLIP: Boosting mmWave-based Zero-shot HAR via Signal-Text Alignment
  10. 10. mmNorm: Non-Line-of-Sight 3D Object Reconstruction via mmWave Surface Normal Estimation
  11. 11. Proactive Hearing Assistants that Isolate Egocentric Conversations
  12. 12. NeuralAids: Wireless Hearables With Programmable Speech AI Accelerators
  13. 13. Creating speech zones with self-distributing acoustic swarms
  14. 14. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation
  15. 15. SoundStream: An End-to-End Neural Audio Codec
  16. 16. AudioLM
  17. 17. Conformer
  18. 18. Dual-path RNN
  19. 19. EnCodec
  20. 20. Meta-StyleSpeech
  21. 21. MusicLM
  22. 22. Robust Speech Recognition via Large-Scale Weak Supervision
  23. 23. SeamlessM4T
  24. 24. Stable Audio
  25. 25. Universal Source Separation with Weakly Labelled Data
  26. 26. Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning
  27. 27. RLBench: The Robot Learning Benchmark & Learning Environment
  28. 28. robosuite: A Modular Simulation Framework and Benchmark for Robot Learning
  29. 30. CALVIN
  30. 31. LIBERO
  31. 32. RH20T
  32. 33. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation
  33. 34. DROID
  34. 35. Open X-Embodiment
  35. 36. RoboCasa
  36. 37. SimplerEnv
  37. 38. Diffusion Policy: Visuomotor Policy Learning via Action Diffusion
  38. 39. 3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations
  39. 40. Consistency Policy: Accelerated Visuomotor Policies via Consistency Distillation
  40. 41. EquiBot: SIM(3)-Equivariant Diffusion Policy
  41. 42. DiT-Policy
  42. 43. Diffusion Policy Policy Optimization (DPPO)
  43. 44. Affordance-based Robot Manipulation with Flow Matching
  44. 45. FlowPolicy: 3D Flow-based Policy via Consistency Flow Matching
  45. 46. FAST: Efficient Action Tokenization for VLA
  46. 47. π₀: A Vision-Language-Action Flow Model for General Robot Control
  47. 48. pi_0.5: VLA with Open-World Generalization
  48. 49. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
  49. 50. Generative Adversarial Imitation Learning
  50. 51. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT/ALOHA)
  51. 52. AnyTeleop
  52. 53. Behavior Transformers: Cloning k Modes with One Stone
  53. 54. Implicit Behavioral Cloning
  54. 55. RoboCat
  55. 56. ALOHA 2
  56. 58. HumanPlus
  57. 59. Generalizable Humanoid Manipulation with 3D Diffusion Policies (iDP3)
  58. 60. Mobile ALOHA
  59. 61. SmolVLA
  60. 62. Universal Manipulation Interface
  61. 63. Behavior Generation with Latent Actions (VQ-BeT)
  62. 64. ImageBind: One Embedding Space To Bind Them All
  63. 65. Connecting Touch and Vision via Cross-Modal Prediction
  64. 66. AnyMAL: An Efficient and Scalable Any-Modality Augmented Language Model
  65. 67. AudioPaLM
  66. 68. FROMAGe: Grounding LLMs to Images
  67. 69. OneLLM
  68. 70. X-VLM: Multi-Grained Vision Language Pre-Training
  69. 71. Tactile Beyond Pixels (Sparsh-X)
  70. 72. Sparsh: Self-supervised Touch Representations
  71. 73. Tactile-VLA
  72. 74. TLA: Tactile-Language-Action
  73. 75. Code as Policies: Language Model Programs for Embodied Control
  74. 76. Inner Monologue: Embodied Reasoning through Planning with Language Models
  75. 77. LLM+P: Empowering LLMs with Optimal Planning
  76. 78. PaLM-E: An Embodied Multimodal Language Model
  77. 79. ProgPrompt
  78. 80. ChatGPT for Robotics
  79. 81. GenSim
  80. 82. RoboFlamingo
  81. 83. Tree-Planner
  82. 84. VoxPoser
  83. 85. See Through Smoke: Robust Indoor Mapping with Low-cost mmWave Radar
  84. 86. Can WiFi Estimate Person Pose?
  85. 87. 3DRIMR: 3D Reconstruction and Imaging via mmWave Radar based on Deep Learning
  86. 88. milliEgo: Single-chip mmWave Radar Aided Egomotion Estimation via Deep Sensor Fusion
  87. 89. High Resolution Point Clouds from mmWave Radar
  88. 90. RadarSLAM: Radar based Large-Scale SLAM in All Weathers
  89. 91. Through-Wall Pose Imaging in Real-Time with a Many-to-Many Encoder/Decoder Paradigm
  90. 92. RFMask: A Simple Baseline for Human Silhouette Segmentation with Radio Signals
  91. 93. RFPose-OT: RF-Based 3D Human Pose Estimation via Optimal Transport Theory
  92. 94. Argus: Multi-View Egocentric Human Mesh Reconstruction Based on Stripped-Down Wearable mmWave Add-on
  93. 95. Diffusion Model is a Good Pose Estimator from 3D RF-Vision
  94. 96. Enabling Visual Recognition at Radio Frequency (PanoRadar)
  95. 97. Wave-Former: Through-Occlusion 3D Reconstruction via Wireless Shape Completion
  96. 98. Habitat: A Platform for Embodied AI Research
  97. 99. Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning
  98. 101. Habitat 2.0
  99. 102. ManiSkill
  100. 103. ProcTHOR
  101. 104. SAPIEN: A SimulAted Part-based Interactive ENvironment
  102. 105. BEHAVIOR-1K
  103. 106. BridgeData V2
  104. 106. Habitat 3.0
  105. 107. Isaac Lab
  106. 108. DexMV
  107. 108. MuJoCo Playground
  108. 109. DexCap
  109. 109. RT-1: Robotics Transformer for Real-World Control at Scale
  110. 110. 3D Diffusion Policy (DP3)
  111. 111. Octo: An Open-Source Generalist Robot Policy
  112. 112. RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control
  113. 113. RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches
  114. 114. 3D-VLA
  115. 116. GR-2: Generative Video-Language-Action Model
  116. 117. DexVLA
  117. 117. OpenHelix
  118. 118. Cosmos World Foundation Model
  119. 118. OpenVLA-OFT
  120. 119. RDT-1B: Diffusion Foundation Model for Bimanual Manipulation
  121. 120. RoboMamba
  122. 121. SpatialVLA
  123. 122. TinyVLA
  124. 123. TraceVLA: Visual Trace Prompting
  125. 124. Learning Transferable Visual Models From Natural Language Supervision
  126. 125. Flamingo: a Visual Language Model for Few-Shot Learning
  127. 126. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models
  128. 127. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation
  129. 128. DeepSeek-VL: Towards Real-World Vision-Language Understanding
  130. 129. EVA-CLIP: Improved Training Techniques for CLIP at Scale
  131. 130. FILIP: Fine-grained Interactive Language-Image Pre-Training
  132. 131. Florence-2: Advancing a Unified Representation for a Variety of Vision Tasks
  133. 132. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks
  134. 133. Improved Baselines with Visual Instruction Tuning
  135. 134. OBELICS
  136. 135. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
  137. 136. Sigmoid Loss for Language Image Pre-Training
  138. 137. What matters when building vision-language models?
  139. 138. Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
  140. 139. The Llama 3 Herd of Models
  141. 140. LLaVA-NeXT-Interleave
  142. 141. LLaVA-OneVision: Easy Visual Task Transfer
  143. 142. Long-CLIP: Unlocking the Long-Text Capability of CLIP
  144. 143. Pixtral 12B
  145. 144. Dream to Control: Learning Behaviors by Latent Imagination
  146. 145. World Models
  147. 146. DayDreamer
  148. 147. Mastering Atari with Discrete World Models
  149. 148. Dreamer V3: Mastering Diverse Domains through World Models
  150. 149. Transformers are Sample-Efficient World Models
  151. 150. TWM: Transformer-based World Models
  152. 151. 1X World Model Challenge
  153. 153. GAIA-1
  154. 154. Genie: Generative Interactive Environments
  155. 155. Navigation World Models
  156. 156. UniSim
  157. 157. LeRobot: An Open-Source Library for End-to-End Robot Learning
  158. 158. CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation
  159. 159. Universal Actions for Enhanced Embodied Foundation Models
  160. 160. LoHoVLA: A Unified Vision-Language-Action Model for Long-Horizon Embodied Tasks
  161. 161. AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents
  162. 162. EO-1: Interleaved Vision-Text-Action Pretraining for General Robot Control
  163. 163. Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments
  164. 164. RealMirror: A Comprehensive, Open-Source Vision-Language-Action Platform for Embodied AI
  165. 165. LLaDA-VLA: Vision Language Diffusion Action Models
  166. 166. Discrete Diffusion VLA: Bringing Discrete Diffusion to Action Decoding in Vision-Language-Action Policies
  167. 167. Vlaser: Vision-Language-Action Model with Synergistic Embodied Reasoning
  168. 168. X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
  169. 169. Embodiment Transfer Learning for Vision-Language-Action Models
  170. 170. HiMoE-VLA: Hierarchical Mixture-of-Experts for Generalist Vision-Language-Action Policies
  171. 171. Green-VLA: Staged Vision-Language-Action Model for Generalist Robots
  172. 172. AC^2-VLA: Action-Context-Aware Adaptive Computation in Vision-Language-Action Models for Efficient Robotic Manipulation
  173. 173. MoS-VLA: A Vision-Language-Action Model with One-Shot Skill Adaptation
  174. 174. Asynchronous Fast-Slow Vision-Language-Action Policies for Whole-Body Robotic Manipulation
  175. 175. VLA-Forget: Vision-Language-Action Unlearning for Embodied Foundation Models
  176. 176. Membership Inference Attacks on Vision-Language-Action Models
  177. 177. A Survey on Efficient Vision-Language-Action Models
  178. 178. Survey of Vision-Language-Action Models for Embodied Manipulation
  179. 179. Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review
  180. 180. Toward Embodied AGI: A Review of Embodied AI and the Road Ahead
  181. 181. RoboNeuron: A Middle-Layer Infrastructure for Agent-Driven Orchestration in Embodied AI
  182. 182. Embodied Navigation Foundation Model
  183. 183. MiMo-Embodied: X-Embodied Foundation Model Technical Report
  184. 184. Open-H-Embodiment: A Large-Scale Dataset for Enabling Foundation Models in Medical Robotics
  185. 185. AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding
  186. 186. 3D Generation for Embodied AI and Robotic Simulation: A Survey
  187. 187. DISCO: Language-Guided Manipulation with Diffusion Policies and Constrained Inpainting
  188. 188. Time-Unified Diffusion Policy with Action Discrimination for Robotic Manipulation
  189. 189. Learning Diffusion Policy from Primitive Skills for Robot Manipulation
  190. 190. Trace-Focused Diffusion Policy for Multi-Modal Action Disambiguation in Long-Horizon Robotic Manipulation
  191. 191. Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation
  192. 192. LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation
  193. 193. villa-X: Enhancing Latent Action Modeling in Vision-Language-Action Models
  194. 194. InstructVLA: Vision-Language-Action Instruction Tuning from Understanding to Manipulation
  195. 195. Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation
  196. 196. Towards Generalizable Vision-Language Robotic Manipulation: A Benchmark and LLM-guided 3D Policy
  197. 197. A Survey of Language-Conditioned Robot Manipulation
  198. 198. SafeEmbodAI: a Safety Framework for Mobile Robots in Embodied AI Systems
  199. 199. The Essential Role of Causality in Foundation World Models for Embodied AI
  200. 200. A call for embodied AI
  201. 201. Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis
  202. 202. What Breaks Embodied AI Security: LLM Vulnerabilities, CPS Flaws, or Something Else?